Это квантованная версия Agentica-org/DeepCoder-14B-Preview, созданная с использованием llama.cpp DeepCoder-14B-Preview 🚀 Демократизация обучения с подкреплением для LLM (RLLM) 🌟 DeepCoder-14B-Preview — это код рассуждения LLM, тонко настроенный на основе DeepSeek-R1-Distilled-Qwen-14B с использованием распределенного обучения с подкреплением (RL) для масштабирования до большой длины контекста. Модель достигает точности Pass@1 60,6% на LiveCodeBench v5 (8/1/24-2/1/25), что представляет собой улучшение на 8% по сравнению с базовой моделью (53%) и обеспечивает аналогичную производительность с OpenAI o3-mini всего лишь с 14B параметрами. Наш набор обучающих данных состоит примерно из 24 тысяч уникальных пар проблем-тестов, составленных из: — Taco-Verified — PrimeIntellect SYNTHETIC-1 — LiveCodeBench v5 (01.05.23-7.31.24). Наш рецепт обучения основан на улучшенной версии GRPO (GRPO+) и итеративном удлинении контекста, представленном в DeepScaleR. Мы улучшаем исходный алгоритм GRPO, используя идеи DAPO, чтобы обеспечить более стабильное обучение: — Фильтрация сложности в автономном режиме: DAPO использует динамическую выборку в режиме онлайн, отбрасывая на лету как полностью правильные, так и полностью неправильные выборки. Хотя это помогает поддерживать более стабильный эффективный размер пакета, это приводит к значительному увеличению времени выполнения…
Модальности:
Генерация текста
Области применения:
Диалог / чат Генерация кода
Задача: Генерация текста
Автор: QuantFactory
Теги: gguf, en, endpoints_compatible, conversational
Лайков: 5 | Загрузок: 35
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.