Chocolatine-2-4B-Instruct-DPO-v2.1 — это версия Qwen/Qwen3-4B-Instruct-2507 после обучения, предназначенная для улучшения выполнения инструкций, рассуждения и общей производительности на французском языке, сохраняя при этом сильные многоязычные возможности. В моей оценочной схеме он обеспечивает стабильные результаты по протестированным французским тестам, что указывает на значительное улучшение французских возможностей. Хотя в процессе обучения основное внимание уделяется данным о предпочтениях французского языка, при выполнении заданий по английскому ухудшения не наблюдается, а иногда наблюдаются небольшие улучшения, что свидетельствует о положительном межъязыковом переносе. Также доступны оптимизированные варианты (MLX, GGUF), что делает модель особенно подходящей для локального вывода. — Базовая модель: Qwen/Qwen3-4B-Instruct-2507 — Параметры: 4.0B — Длина контекста: 262 144 изначально — Методы постобучения: DPO + слияние моделей — Chocolatine-2-4B-Instruct-DPO-v2.1 (этот репозиторий): содержит переобучаемые веса в формате BF16 — Квантованные версии GGUF: Q4KM / Q8_0 и другие из mradermacher здесь — MLX (оптимизирован для кремния Apple): 4Bit / 6Bit Ollama: В дополнение к выпуску Hugging Face, здесь, на Ollama, также доступны квантованные 4-битные и 8-битные варианты для удобного локального…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: jpacifico
Теги: qwen3, dpo, post-training, french, alignment, model-merging, chocolatine, comparia
Лайков: 8 | Загрузок: 86
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.