Инструктивная версия адаптированной на русский язык модели deepseek-ai/DeepSeek-R1-Distill-Qwen-14B. В модели был заменен токенизатор, затем произведено дообучение (Continued pretraining) на русскоязычном корпусе, после чего была применена техника LEP (Learned Embedding Propagation). Благодаря новому токенизатору (расширенный tiktoken cl100k с помощью униграм токенизатора на 48 т. токенов) скорость генерации* русскоязычных текстов возрасла до 60% по сравнению с исходной моделью deepseek-ai/DeepSeek-R1-Distill-Qwen-14B. *Под скоростью генерации подразумевается количество русскоязычных символов/слов в секунду на одинаковых текстовых последовательностях. Модель можно попробовать в поднятом Space (внизу в параметрах выбор модели): https://huggingface.co/spaces/RefalMachine/RuadaptQwen2.5 Замеры были произведены с использованием оффициального кода лидерборда (https://github.com/VikhrModels/rullmarena), но с repetitionpenalty=1.1**. Для сабмита на MERA был подготовлен кастомный системный промпт, который смягчает недостатки оценки на кодовых задачах. Для сравнения был также сделан сабмит с этим же системным промптом оригинальной модели. Tikhomirov M., Chernyshev D. Facilitating large…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: RefalMachine
Теги: qwen2, conversational, ru
Лайков: 4 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.