Эта модель предоставляет несколько вариантов google/Gemma-3-12B-IT, готовых к развертыванию в Интернете с использованием API вывода MediaPipe LLM. Чтобы добавить модель в свое веб-приложение, следуйте инструкциям в нашей документации. Обратите внимание, что все статистические данные тестов взяты из MacBook Pro 2024 года (чип Apple M4 Max) с размером кэша 1280 КВ, предварительным заполнением 1024 токенов и декодированием 256 токенов, работающим в Chrome. Precision Backend Предварительное заполнение (токенов/сек) Декодирование (токенов/сек) Время до первого токена (сек) Память графического процессора Память ЦП Размер модели F16 int8 Графический процессор 382 тактов/с 17 тактов/с 5,51 с 12,3 ГБ 1,1 ГБ 11,79 ГБ 🔗 F32 int8 GPU 226 ТК/с 17 ТК/с 5,47 с 13,0 ГБ 1,1 ГБ 11,79 ГБ 🔗 F16 int4 GPU 384 ТК/с 23 ТК/с 3,63 с 8,4 ГБ 1,1 ГБ 7,55 ГБ 🔗 F32 int4 GPU 229 ТК/с 23 ТК/с 3,58 с 9,0 ГБ 1,1 ГБ 7,55 ГБ 🔗 F16 Q40 GPU 385 ТК/с 22 ТК/с 4,48 с 8,9 ГБ 1,2 ГБ 8,60 ГБ 🔗 F32 Q40 GPU 229 ТК/с 22 ТК/с 4,20 с 10,1 ГБ 1,2 ГБ 8,60 ГБ 🔗 Размер модели: измеряется размером плоского буфера .tflite (формат сериализации для моделей LiteRT). int8: квантованная модель с весами int8 и активациями с плавающей запятой. int4: квантованная модель с весами int4 и активациями с плавающей запятой. Вопрос 40: квантованная модель QAT с…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: litert-community
Теги: chat
Лайков: 7 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.