Эта модель предоставляет несколько вариантов google/medgemma-27b-text-it, готовых к развертыванию в Интернете с использованием API вывода MediaPipe LLM. Чтобы добавить модель в свое веб-приложение, следуйте инструкциям в нашей документации. Обратите внимание, что все статистические данные тестов взяты из MacBook Pro 2024 года (чип Apple M4 Max) с размером кэша 1280 КВ, предварительным заполнением 1024 токенов и декодированием 256 токенов, работающим в Chrome. Precision Backend Предварительное заполнение (токенов/сек) Декодирование (токенов/сек) Время до первого токена (сек) Память графического процессора Память ЦП Размер модели F16 int8 Графический процессор 167 тк/с 8 тк/с 14,9 с 27,0 ГБ 1,5 ГБ 27,05 ГБ 🔗 F32 int8 GPU 97 ТК/с 8 ТК/с 15,0 с 28,0 ГБ 1,5 ГБ 27,05 ГБ 🔗 Размер модели: измеряется размером плоского буфера .tflite (формат сериализации для моделей LiteRT). int8: квантованная модель с весами int8 и активациями с плавающей запятой. Память графического процессора: измеряется памятью «процесса графического процессора» для всего Chrome во время работы. Было измерено, что Chrome использовал 340–350 МБ до загрузки модели. Память ЦП: измеряется для всей вкладки во время работы. Было измерено, что Tab использовал 60-70 МБ до загрузки модели.
Модальности:
Генерация текста
Области применения:
Медицина
Задача: Генерация текста
Автор: litert-community
Теги: medical, clinical-reasoning, thinking
Лайков: 22 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.