prithivMLmods/SmolLM2_135M_Grpo_Gsm8k - Каталог нейросетей
Генерация текста

prithivMLmods/SmolLM2_135M_Grpo_Gsm8k

Добавлено:
prithivMLmods/SmolLM2_135M_Grpo_Gsm8k

SmolLM2135MGrpo_Gsm8k доработан на базе SmolLM2-135M-Instruct. SmolLM2 демонстрирует значительные преимущества по сравнению со своим предшественником SmolLM1, особенно в следовании инструкциям, знаниях и рассуждениях. Модель 135M была обучена на 2 триллионах токенов с использованием разнообразных комбинаций наборов данных: FineWeb-Edu, DCLM, The Stack, а также новых отфильтрованных наборов данных, которые мы курировали и скоро выпустим. Мы разработали версию инструкций посредством контролируемой точной настройки (SFT) с использованием комбинации общедоступных наборов данных и наших собственных наборов данных. 1. Размер модели. Модель основана на размере параметра 135M, который, хотя и является мощным, все же ограничивает ее способность обрабатывать чрезвычайно сложные задачи или зависимости с длинным контекстом по сравнению с более крупными моделями. Он может с трудом справляться с задачами, требующими глубокого понимания сложных деталей или дальновидных рассуждений. 2. Предвзятость и неточность. Несмотря на то, что модель настроена на различные наборы данных, она все равно может давать предвзятые, неточные или фактически неверные ответы. Это может произойти, особенно когда модель просят сделать выводы за пределами объема обучающих данных или при ответе на вопросы, которые требуют специальных знаний, выходящих за рамки ее бюджета токена. 3. Длина контекста:…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: prithivMLmods
Теги: llama, text-generation-inference, GRPO, conversational, en, endpoints_compatible
Лайков: 9  |  Загрузок: 20

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.