Мы представляем Tri-7B, модель следующего поколения после предварительной версии Trillion-7B, которая продолжает расширять границы эффективного обучения, обеспечивая при этом исключительную производительность в масштабе параметров 7B. Расширенное мышление: модифицированная смесь наборов обучающих данных, специально оптимизированная для возможностей рассуждения. Расширенное пост-обучение: значительно улучшенный конвейер обучения RL с упором на математические рассуждения и повседневное использование. Расширенный контекст: поддерживает длину контекста до 32 КБ для понимания длинных форм. Многоязычный: специально оптимизирован для корейского, английского и японского языков. Наша модель Tri-7B представляет собой значительный шаг вперед по сравнению с предварительной моделью Trillion-7B, обеспечивая существенное улучшение производительности во всех оцениваемых областях при сохранении того же эффективного количества параметров. — Тип: модель причинного языка — Этап обучения: предварительное обучение и после обучения — Архитектура: декодер Transformer с RoPE, SwiGLU, RMSNorm — Количество параметров: 7,76B — Количество слоев: 32 — Количество заголовков внимания: 32 — Длина контекста: 32 768 — Размер словарного запаса: 128 256 Вот фрагмент кода с шаблоном applychat, который демонстрирует, как загрузить токенизатор и модель и генерация текста. Мы оценили…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: trillionlabs
Теги: llama, finetuned, chat, conversational, en, ko, ja, text-generation-inference
Лайков: 26 | Загрузок: 1,065
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.