Trinity-Large-Preview — это разреженная модель Mixture-of-Experts (MoE) с 398 миллиардами параметров и примерно 13 миллиардами активных параметров на токен. Это крупнейшая модель в семействе Trinity от Arcee AI, обученная на более чем 17 триллионах токенов и обеспечивающая высочайшую производительность с сильным пониманием долгого контекста. Trinity-Large-Preview — это модель с легким постобучением, основанная на Trinity-Large-Base. Этот репозиторий содержит квантованные веса FP8 Trinity-Large-Preview. Более подробная информация об обучении Trinity Large доступна в техническом отчете. Семейство Trinity Large состоит из трех контрольных точек из одного и того же прогона обучения: — Trinity-Large-Preview: слегка постобученная, готовая к общению модель, проходящая активный RL — Trinity-Large-TrueBase: контрольная точка предварительного отжига с 10T-токенами — Trinity-Large-Base: полная предварительно обученная базовая модель с 17T-токенами и отжигами в середине обучения Trinity-Large-Preview использует разреженную конфигурацию MoE, предназначенную для максимизации эффективности при сохранении крупномасштабной емкости. — Аппаратное обеспечение: 2048 графических процессоров NVIDIA B300 — Параллелизм: HSDP + экспертный параллелизм — Партнер по вычислениям: Prime Intellect Используйте ветку основных преобразователей или передайте TrustRemotecode=True с выпущенным…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: arcee-ai
Теги: afmoe, conversational, custom_code, en, es, fr, de, it
Лайков: 32 | Загрузок: 3,821
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.