ai-sage/GigaChat3-10B-A1.8B-base - Каталог нейросетей
Генерация текста

ai-sage/GigaChat3-10B-A1.8B-base

Добавлено:
ai-sage/GigaChat3-10B-A1.8B-base

Представляем GigaChat3-10B-A1.8B-base — базовую (предварительную) модель стандартной GigaChat. Модель на основе архитектуры Mixture-of-Experts (MoE) с 10B базами и 1,8B активных параметров. Архитектура включает в себя латентное внимание с несколькими головками (MLA) и прогнозирование с несколькими токенами (MTP), за счет чего модель обеспечивает высокую пропускную способность (пропускную способность) при выводе. Больше подробностей в хабр статье. Данная карточка описывает базовую (предтреновую) модель. Для диалоговых задач и инструкций, пожалуйста, воспользуйтесь нашей инструкцией-версией. База GigaChat3-10B-A1.8B использует кастомную MoE-архитектуру: Вместо стандартного Multi-head Внимание, модель использует MLA. MLA обеспечивает эффективные выводы для сокращения кэша значения ключа (KV) в скрытом векторе, что значительно снижает требования к памяти и усложняет обработку. Модель обучена с использованием задач Multi-Token Prediction (MTP). Эта модель позволяет предсказать несколько токенов за один проход, что увеличивает вероятность генерации до 40% с помощью техники спекулятивной/параллельной генерации. Модель обучена на 20Т токенов. Мы добавили 10 языков — от китайского и арабского до узбекского и казахского, а также расширили набор…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: ai-sage
Теги: deepseek_v3, moe, ru, en
Лайков: 12  |  Загрузок: 817

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.