litert-community/Qwen3-14B - Каталог нейросетей
Генерация текста

litert-community/Qwen3-14B

Добавлено:
litert-community/Qwen3-14B

Этот репозиторий содержит варианты Qwen/Qwen3-14B LiteRT-LM, оптимизированные для генерации текста на устройстве. Смешанный артефакт INT4 .litertlm был создан с использованием рецепта первого квантования на основе TorchAO из исходной контрольной точки Hugging Face. Это смешанная схема квантования, а не единая модель, состоящая только из INT4: подходящие веса линейных проекций хранятся как блочные INT4 с размером группы 32 и шкалами с плавающей запятой, веса встраивания токенов используют квантование INT8 только для веса, а пути нормализации/сокращения плюс тензоры кэша KV остаются с плавающей запятой. Смешанный пакет INT4 также использует составные операции LiteRT-LM StableHLO для выполнения внимания и кэширования, включая odml.runtimebmm и odml.cacheupdate. Проведено тестирование на AMD Radeon AI PRO R9700 с использованием веб-графического процессора LiteRT-LM с 256 токенами предварительного заполнения и 32 токенами декодирования. Для этого размера не сообщается ни об одном тесте телефона. Раскрытие информации об аппаратном тестировании: результаты были измерены нами на розничных устройствах, приобретенных через обычные каналы. Эти результаты не связаны, не спонсируются, не одобряются и не проверяются Samsung, vivo, Qualcomm, MediaTek, Google, MLCommons или Hugging Face. Результаты зависят от SKU устройства, сборки ОС, температурного состояния, режима работы от батареи, серверной части и т. д.

Модальности:
Генерация текста


Задача: Генерация текста
Автор: litert-community
Теги: litert-lm, litertlm, qwen, Qwen3, en
Лайков: 5  |  Загрузок: 143

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.