tokyotech-llm/Qwen3-Swallow-8B-SFT-v0.2 - Каталог нейросетей
Генерация текста

tokyotech-llm/Qwen3-Swallow-8B-SFT-v0.2

Добавлено:
tokyotech-llm/Qwen3-Swallow-8B-SFT-v0.2

Qwen3-Swallow v0.2 — это семейство больших языковых моделей, доступных с размерами параметров 8B, 30B-A3B и 32B. Построенные как двуязычные японско-английские модели, они были разработаны с помощью непрерывного предварительного обучения (CPT), контролируемой точной настройки (SFT) и обучения с подкреплением с проверяемыми вознаграждениями (RLVR) на основе Qwen3 [Yang, 2025]. Помимо повышения уровня владения японским языком и возможностей перевода с японского на английский, мы значительно улучшили или сохранили производительность при выполнении математических задач и задач по кодированию во время CPT, используя высококачественные наборы математических и кодовых данных со следами рассуждений, а также специально созданные наборы данных во время SFT. Впоследствии мы еще больше улучшили математическую производительность и производительность кодирования моделей, расширив возможности рассуждения с помощью RLVR. > [!NOTE] > Обратите внимание, что Qwen3-Swallow v0.1 — это пропущенный номер версии. Двуязычное владение: высокая оптимизация для японского и английского языков. Сохранение производительности STEM: стратегические конвейеры CPT и SFT успешно предотвратили катастрофическое забывание в математике и программировании. Улучшенное мышление:** производительность рассуждений достигла уровня исходных моделей Qwen3, а в некоторых задачах даже превосходила их. – 20 февраля 2026 г.: выпущено…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: tokyotech-llm
Теги: qwen3, conversational, en, ja, text-generation-inference, endpoints_compatible
Лайков: 5  |  Загрузок: 5,112

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.