Эта модель предоставляет несколько вариантов google/Gemma-3-27B-IT, готовых к развертыванию в Интернете с использованием API вывода MediaPipe LLM. Чтобы добавить модель в свое веб-приложение, следуйте инструкциям в нашей документации. Обратите внимание, что все статистические данные тестов взяты из MacBook Pro 2024 года (чип Apple M4 Max) с размером кэша 1280 КВ, предварительным заполнением 1024 токенов и декодированием 256 токенов, работающим в Chrome. Precision Backend Предварительное заполнение (токен/сек) Декодирование (токен/сек) Время до первого токена (сек) Память графического процессора Память ЦП Размер модели F16 int8 Графический процессор 166 тактов/с 8 тактов/с 15,0 с 26,8 ГБ 1,5 ГБ 27,05 ГБ 🔗 F32 int8 GPU 98 ТК/с 8 ТК/с 15,0 с 27,8 ГБ 1,5 ГБ 27,05 ГБ 🔗 F16 Q40 GPU 168 ТК/с 8 ТК/с 10,5 с 18,2 ГБ 2,8 ГБ 18,98 ГБ 🔗 F32 Q40 GPU 99 ТК/с 8 ТК/с 10,0 с 20,5 ГБ 2,8 ГБ 18,98 ГБ 🔗 Размер модели: измеряется размером плоского буфера .tflite (формат сериализации для моделей LiteRT). int8: квантованная модель с весами int8 и активациями с плавающей запятой. Q40: квантованная модель QAT с блочными весами int4 и активациями с плавающей запятой. Память графического процессора: измеряется памятью «процесса графического процессора» для всего Chrome во время работы. Было измерено, что Chrome использовал 130–530 МБ до загрузки модели. ПРОЦЕССОР…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: litert-community
Теги: chat
Лайков: 9 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.