AxionLab-Co/AxionMoE-350k-A250k - Каталог нейросетей
Генерация текста

AxionLab-Co/AxionMoE-350k-A250k

Добавлено:
AxionLab-Co/AxionMoE-350k-A250k

> Архитектура DeepSeek-V3 масштабируется до ~344 тыс. общих параметров (~160 тыс. активных/токенов) — полностью работает на процессоре. Создан с нуля в качестве доказательства концепции того, что настоящие архитектурные инновации DeepSeek-V3 (MLA + DeepSeekMoE + балансировка нагрузки без вспомогательных потерь) работают корректно даже при крайней миниатюризации. — Набор данных: GSM8K — школьная математика, преобразованная в обычный текст с форматом вопросов/рассуждений/ответов. — Токенизатор: BPE, обученный с нуля, размер словаря 1024. — Аппаратное обеспечение: AMD Ryzen 5 5600G. Только ЦП, 12 потоков, 32 ГБ ОЗУ. — Скорость: ~ 1000–1100 токенов/сек на ЦП. — Эпохи: 20 | Итоговая потеря значения: ~3,2 | Общее время: ~115 минут. Имея всего 344 тыс. параметров, модель усвоила математический словарь и шаблоны совпадений из GSM8K, но не может надежно решать проблемы или поддерживать синтаксическую последовательность. Это ожидаемо — цель этого выпуска — продемонстрировать, что архитектурные компоненты DeepSeek-V3 работают правильно в любом масштабе, и послужить основой для приведенной выше дорожной карты масштабирования.

Модальности:
Генерация текста

Области применения:
Математика


Задача: Генерация текста
Автор: AxionLab-Co
Теги: deepseek_nano, math, experiment, moe, deepseek, from-scratch, tiny-model, cpu
Лайков: 5  |  Загрузок: 81

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.