sarvamai/sarvam-105b - Каталог нейросетей
Генерация текста

sarvamai/sarvam-105b

Добавлено:
sarvamai/sarvam-105b

1. Введение 2. Архитектура 3. Тесты — Знания и кодирование — Рассуждение и математика — Агент 4. Вывод — Обнимающее лицо — vLLM 5. Сноска 6. Citation Sarvam-105B — это усовершенствованная модель смешанных экспертов (MoE) с активными параметрами 10,3B, разработанная для превосходной производительности при выполнении широкого спектра сложных задач. Он хорошо оптимизирован для сложных рассуждений, особенно силен в агентских задачах, математике и программировании. Sarvam-105B — это производитель высшего уровня, постоянно соответствующий или превосходящий несколько основных моделей с закрытым исходным кодом и остающийся в узком диапазоне передовых моделей по различным логическим и агентным критериям. Он демонстрирует исключительные агентные и логические способности в реальных приложениях, таких как веб-поиск и устранение технических неполадок. Основное внимание во время обучения уделялось индийскому контексту и языкам, что привело к высочайшему уровню производительности на 22 индийских языках для модели такого размера. Sarvam-105B имеет открытый исходный код под лицензией Apache. Более подробную информацию можно найти в нашем блоге. Модель 105B использует стек внимания в стиле MLA с разделенными размерами головы QK (qheaddim=192, разделенный на компоненты RoPE и noPE, vheaddim=128) и большим размером головы…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: sarvamai
Теги: sarvam_mla, conversational, custom_code, en, hi, bn, ta, te
Лайков: 198  |  Загрузок: 2,048

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.