daVinci-LLM-3B — это базовая языковая модель с 3B параметрами, представленная в документе daVinci-LLM: Towards the Science of Pretraining. Этот проект направлен на то, чтобы сделать процесс предварительного обучения прозрачным и воспроизводимым научным занятием. Мы публикуем не только окончательные веса, но также траектории обучения, промежуточные контрольные точки, решения по обработке данных и более 200 исследований абляции, охватывающих качество данных, дизайн смесей, динамику обучения и достоверность оценок. — GitHub: GAIR-NLP/daVinci-LLM — Документ: arXiv:2603.27164 — Набор данных: davinci-llm-data Модель следует двухэтапной учебной программе с использованием токенов ~8T: — Этап 1 (токены 6T): широкое предварительное обучение в различных корпусах веб-масштаба. — Этап 2 (токены 2T): структурированный контроль качества и аналитические данные для улучшения математических вычислений и рассуждений по коду. — Полностью прозрачный конвейер предварительной подготовки: логика обработки данных, смеси, журналы и контрольные точки общедоступны. — Структура дарвинизма данных: систематическая таксономия L0–L9 для глубины обработки данных. — Масштабные абляции: более 200 контролируемых экспериментов с положительными и отрицательными результатами. — Исследования: предтренировочная наука, исследования качества данных, динамика обучения, стабильность оценок. — Общие возможности: широкий язык…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: SII-GAIR-NLP
Теги: qwen2, pretraining-science, conversational, text-generation-inference, endpoints_compatible
Лайков: 28 | Загрузок: 1,316
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.