Nanbeige4-3B-Thinking — это модель рассуждения с 3B параметрами в семействе Nanbeige LLM четвертого поколения. Он демонстрирует, что даже компактные модели могут достичь расширенных способностей к рассуждению за счет постоянного улучшения качества данных и методологий обучения. Чтобы поддержать исследования и технологический прогресс в сообществе открытого исходного кода, мы открыли исходный код модели Nanbeige4-3B-Thinking вместе с ее технической методологией. Мы создали комплексный обучающий корпус с 23Т-токенами из веб-текстов, книг, кода и документов, тщательно отфильтрованных с помощью гибридной стратегии оценки на основе тегов и запоминания на основе поиска. Затем эта основа была дополнена синтетическими данными, насыщенными знаниями и интенсивными рассуждениями**, включая пары вопросов и ответов, учебники и длинные COT, что значительно улучшило производительность последующих задач. Мы разработали инновационный планировщик тренировок FG-WSD (Fine-Grained Warmup-Stable-Decay), тщательно доработав традиционный подход WSD. В этом планировщике реализована детальная программа обработки данных с прогрессивным качеством**, разделяющая стабильную стадию на несколько этапов с постепенно улучшающимися комбинациями данных. По сравнению с ванильным WSD…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Nanbeige
Теги: llama, llm, nanbeige, conversational, en, zh, text-generation-inference, endpoints_compatible
Лайков: 13 | Загрузок: 1,248
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.