На этой карточке модели представлено несколько вариантов модели Qwen3-0.6B, готовых к развертыванию на Android и настольных компьютерах. Вы можете установить Google AI Edge Gallery через открытую бета-версию в магазине Play Store или установить APK с Github. Чтобы собрать демонстрационное приложение из исходного кода, следуйте инструкциям из репозитория GitHub. Убедитесь, что в вашем файле Gradle есть необходимая зависимость. Попробуйте запустить эту модель на NPU, используя этот файл .litertlm и настроив серверную часть EngineConfig на NPU. Чтобы проверить, поддерживается ли NPU вашего телефона, см. это руководство. Для создания настольного приложения в настоящее время рекомендуется использовать C++. См. следующий пример кода. Внутренняя схема квантования Длина контекста Предварительное заполнение (токен/сек) Декодирование (токен/сек) Размер модели (МБ) Файл модели ЦП Dynamicint8 4096 165 ТК/с 9 ТК/с 586 МБ 🔗 GPU Dynamicint8 4096 580 ТК/с 21 ТК/с 586 МБ 🔗 Примечания: Размер модели: измеряется по размеру файла на диске. Вывод о процессоре ускоряется с помощью делегата LiteRT XNNPACK с 4 потоками * Тестирование запускается с включенным и инициализированным кэшем. Во время первого запуска задержка и использование памяти могут отличаться.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: litert-community
Теги: litert-lm, Qwen3, Conversational, litert, litertlm
Лайков: 15 | Загрузок: 11,509
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.