litert-community/Gemma3-4B-IT - Каталог нейросетей
Генерация текста

litert-community/Gemma3-4B-IT

Добавлено:
litert-community/Gemma3-4B-IT

Эта модель предоставляет несколько вариантов google/Gemma-3-4B-IT, готовых к развертыванию в Интернете с использованием API вывода MediaPipe LLM. Чтобы добавить модель в свое веб-приложение, следуйте инструкциям в нашей документации. Обратите внимание, что все статистические данные тестов взяты из MacBook Pro 2024 года (чип Apple M4 Max) с размером кэша 1280 КВ, предварительным заполнением 1024 токенов и декодированием 256 токенов, работающим в Chrome. Precision Backend Предварительное заполнение (токен/сек) Декодирование (токен/сек) Время до первого токена (сек) Память графического процессора Память ЦП Размер модели F16 int8 Графический процессор 1192 такт/с 39 такт/с 2,01 с 4,5 ГБ 0,84 ГБ 3,9 ГБ 🔗 F32 int8 GPU 713 ТК/с 39 ТК/с 1,98 с 4,8 ГБ 0,80 ГБ 3,9 ГБ 🔗 F16 int4 GPU 1195 ТК/с 55 ТК/с 1,29 с 3,3 ГБ 0,82 ГБ 2,56 ГБ 🔗 F32 int4 GPU 720 ТК/с 55 ТК/с 1,25 с 3,6 ГБ 0,81 ГБ 2,56 ГБ 🔗 F16 Q40 GPU 1205 ТК/с 54 ТК/с 1,51 с 3,5 ГБ 0,80 ГБ 2,89 ГБ 🔗 F32 Q40 GPU 723 ТК/с 52 ТК/с 1,48 с 3,9 ГБ 0,79 ГБ 2,89 ГБ 🔗 Размер модели: измеряется размером плоского буфера .tflite (формат сериализации для моделей LiteRT). int8: квантованная модель с весами int8 и активациями с плавающей запятой. int4: квантованная модель с весами int4 и активациями с плавающей запятой. Вопрос 40: квантованная модель QAT с…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: litert-community
Теги: chat
Лайков: 10  |  Загрузок: 0

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.

Теги: #chat