Tiiny/SmallThinker-3B-Preview - Каталог нейросетей
Генерация текста

Tiiny/SmallThinker-3B-Preview

Добавлено:
Tiiny/SmallThinker-3B-Preview

Мы представляем предварительную версию SmallThinker-3B, новую модель, доработанную на основе модели Qwen2.5-3b-Instruct. Теперь вы можете напрямую развернуть SmallThinker на своих телефонах с помощью PowerServe. Ограничение: из-за текущих ограничений SmallThinker в следовании инструкциям для math_comp мы применяем более мягкий метод оценки, при котором требуются только правильные ответы, без ограничения ответов указанным форматом AAAAA. 1. Развертывание на периферии: небольшой размер делает его идеальным для развертывания на устройствах с ограниченными ресурсами. 2. Черновая модель для QwQ-32B-Preview: SmallThinker может служить быстрой и эффективной черновой моделью для более крупной модели QwQ-32B-Preview. По моим тестам, в llama.cpp мы можем получить ускорение на 70% (с 40 токенов/с до 70 токенов/с). Модель была обучена с использованием 8 графических процессоров H100 с общим размером пакета 16. Конкретная конфигурация следующая: Процесс SFT (контролируемая точная настройка) проводился в два этапа: 1. Первый этап: — Использовался только набор данных PowerInfer/QWQ-LONGCOT-500K — Обучение в течение 1,5 эпох 2. Второй этап: — Комбинированное обучение с Наборы данных PowerInfer/QWQ-LONGCOT-500K и PowerInfer/LONGCOT-Refine — продолжение обучения в течение двух дополнительных эпох. Языковое ограничение: модель имеет…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: Tiiny
Теги: qwen2, conversational, en, text-generation-inference, endpoints_compatible
Лайков: 416  |  Загрузок: 776

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.