1. Введение 2. Архитектура 3. Вывод – SGLang – vLLM 4. Citation Sarvam-30B — это усовершенствованная модель Mixture-of-Experts (MoE) с 2,4B невстраиваемыми активными параметрами, предназначенная в первую очередь для практического развертывания. Он сочетает в себе сильные аргументы, надежные способности к кодированию и лучшее в своем классе качество разговорной речи на индийских языках. Sarvam-30B создан для надежной работы в средах с ограниченными ресурсами и может обрабатывать многоязычные голосовые вызовы при выполнении вызовов инструментов. Этот репозиторий предоставляет квантованные веса FP8 для Sarvam-30B, что обеспечивает эффективное развертывание с меньшим объемом памяти и более быстрым выводом при сохранении качества модели. Веса квантуются с использованием формата FP8 (E4M3) с помощью набора инструментов NVIDIA ModelOpt. Основное внимание во время обучения уделялось индийскому контексту и языкам, что привело к высочайшему уровню производительности на 22 индийских языках для модели такого размера. Sarvam-30B имеет открытый исходный код под лицензией Apache. Более подробную информацию можно найти в нашем блоге. Модель 30B MoE разработана для обеспечения пропускной способности и эффективности памяти. Он использует 19 слоев, плотный промежуточный размер FFN 8192, moeintermediatesize 1024, маршрутизацию топ-6, сгруппированные головки KV (numkeyvalueheads=4) и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: sarvamai
Теги: sarvam_moe, conversational, custom_code, en, hi, bn, ta, te
Лайков: 11 | Загрузок: 1,276
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.