Доработанная версия Qwen3.6-35B-A3B, оптимизированная для генерации и понимания кода Rust. Базовая модель представляет собой архитектуру Mixture-of-Experts с общим числом параметров 35B и активными 3B на каждый токен (256 экспертов, 8 активных). Квантован до 8-бит. Точная настройка на наборе данных jedisct1/rust, который содержит 356 тысяч коммитов из популярных репозиториев Rust, включая различия и сообщения о коммитах. Обучение было двунаправленным — модель обучалась в двух взаимодополняющих направлениях: — Вперед (инструкция для кода): при наличии описания изменения сгенерируйте соответствующий унифицированный результат — Обратный (код в инструкцию): при наличии различия создайте краткое описание того, что он делает. Этот подход учит как генерации кода, так и пониманию кода одновременно. После обучения модель выдает результаты, напоминающие реальные коммиты из производственных проектов Rust, а не примеры из учебников. — Метод: LoRA (ранг 8, альфа 16), примененный ко всем 40 слоям. — Целевые модули: проекции q/k/v/o + проекции MLP «ворота/вверх/вниз» (включая экспертные слои MoE) — Набор данных: 634 тыс. обучающих выборок, 33 тыс. оценочных выборок — Итерации: 1000 шагов, размер пакета 1, накопление градиента 4 — Скорость обучения: 2e-5 с косинусным графиком -…
Модальности:
Генерация текста
Области применения:
Генерация кода Диалог / чат
Языки программирования:
Rust
Задача: Генерация текста
Автор: jedisct1
Теги: mlx, qwen3_5_moe, rust, code-generation, fine-tuned, moe, lora, conversational
Лайков: 9 | Загрузок: 1,359
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.