Tri-21B-Think-Preview — это промежуточная контрольная точка Tri-21B-Think, обеспечивающая расширение длины контекста в середине обучения до 32 000 токенов и настройку инструкций для цепочки мыслей и использования инструментов. — Тип: Модель каузального языка (улучшенная рассуждения) — Базовая модель: Tri-21B — Архитектура: Трансформаторный декодер с RoPE, SwiGLU, RMSNorm и GQA — Количество параметров: 20.73B — Количество слоев: 40 — Количество заголовков внимания: 32 (запрос) / 8 (ключ, значение) — Размер заголовка: 160 — Скрытый размер: 5,120 — Промежуточный размер: 27,392 — Длина контекста: 32,768 (до 262,144 с YaRN) — Размер словаря: 124,416 Поддержка vLLM и SGLang для Trillion Model находится в разработке. Следите за обновлениями! > Примечание по тегам: эта модель обучалась без использования специальных жетонов и с их использованием. Они были добавлены после обучения для совместимости с анализаторами рассуждений. Если вы планируете точно настроить эту модель, вам необходимо изменить tokenizerconfig.json`, чтобы избежать ошибок индексации. — Языковая поддержка: оптимизирована для английского, корейского и японского языков. Другие языки могут демонстрировать снижение производительности. — Прекращение знаний: февраль 2025 года. — Промежуточная контрольная точка: окончательную модель см. в Tri-21B-Think.
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат
Задача: Генерация текста
Автор: trillionlabs
Теги: trillion, finetuned, chat, reasoning, conversational, custom_code, en, ko
Лайков: 5 | Загрузок: 132
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.