Верная мелкомасштабная (~ 8,1B всего / ~ 2,21B активируется на токен) реплика архитектуры DeepSeek-V4, рассчитанная на обучение на арендованных графических процессорах и четкое отображение на полномасштабные размеры V4-Flash для нарезки веса. Это случайно инициализированный каркас, который генерирует шум. Его назначение: — эталонная архитектура для экспериментов по абляции /гиперпараметрическому поиску — мишень для переноса веса/ нарезки из реального V4-Pro/V4-Flash mHC (Sinkhorn-Knopp) · CSA Lightning Indexer · HCA · чистое скользящее окно · Shared-KV MQA сгруппированная выходная проекция (на группу WOA) · частичный выход RoPE -i ротация · сток внимания · DeepseekMoE с маршрутизацией sqrt(softplus) · хэш-маршрутизированные ранние слои · зажатый SwiGLU · голова MTP · YaRN. Каждый компонент эквивалентен по битам в математике официальному inference/model.py kernel.py:hcsplitsinkhorn (квантование FP4/FP8 и вращение Адамара пропускаются — это оптимизация вывода, а не архитектура).
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: kshitijthakkar
Теги: deepseek_v4, deepseek-v4, mixture-of-experts, moe, mhc, csa, hca, scaffold
Лайков: 4 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.