Сарвам-1 — это языковая модель с 2 миллиардами параметров, специально оптимизированная для индийских языков. Он обеспечивает лучшую в своем классе производительность на 10 индийских языках (bn, gu, hi, kn, ml, mr или pa, ta, te) по сравнению с такими популярными моделями, как Gemma-2-2B и Llama-3.2-3B. It is also competitive against the much larger models like Llama-3.1-8B in these languages. Более подробную информацию можно найти в нашем блоге о выпуске. The model was trained with NVIDIA NeMo™ Framework on the Yotta Shakti Cloud using HGX H100 systems. — Оптимизирован для 10 индийских языков: создан с нуля для поддержки основных индийских языков наряду с английским. — Превосходная эффективность токенов: достигает коэффициента рождаемости 1,4–2,1 для всех поддерживаемых языков, что в 2–4 раза эффективнее существующих многоязычных моделей. — Высококачественные данные обучения: обучение проводится на тщательно подобранном корпусе, состоящем примерно из 4 триллионов токенов с 2 триллионами высококачественных индийских токенов. — Эффективный вывод: Вывод в 4–6 раз быстрее по сравнению с более крупными моделями при совпадении или превышении их производительности при выполнении задач на индийском языке. — Скрытый размер: 2048 — Промежуточный размер: 11 008 — Количество головок внимания: 16 — Количество скрытых слоев: 28 — Количество головок «ключ-значение»: 8 — Максимальная позиция…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: sarvamai
Теги: llama, conversational, bn, en, gu, hi, kn, ml
Лайков: 132 | Загрузок: 8,657
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.