Небольшая копия архитектуры DeepSeek-V4 с переносом веса. Тензоры были вырезаны (или, если формы уже совпадали, скопированы дословно) из deepseek-ai/DeepSeek-V4-Flash в меньшую архитектуру, соответствующую kshitijthakkar/deepseek-v4-mini-300M-init. Это не случайно инициализируемый каркас — большинство параметров несут реальный обучающий сигнал от источника. Он задуман как «горячий старт» для тонкой настройки такого размера, а не как законченная модель чата/инструктирования. Подробный рецепт смотрите ниже. — Обрезка слоев: в источнике было 43 слоя; мы сохранили 12 равномерным шагом: [0, 3, 7, 10, 14, 17, 21, 25, 28, 32, 35, 39]. Послойный шаблон CSA/HCA/SW сохраняется. — Отсечение экспертов: в источнике было 256 перенаправленных экспертов на слой; мы сохранили топ-16 по норме Gate.weight L2 (дешевый показатель экспертной значимости — замените выбором на основе статистики активации, если у вас есть данные профилирования). — Компрессоры/индексатор: в этом выпуске отмечены INIT (позиционное смещение и вентиль для каждого блока требуют нетривиального перекрестного сопоставления, которое текущий слайсер оставляет случайным образом; их родительские пути KV/Q вырезаются из источника). — Модуль MTP: вырезается из первого шага MTP источника с использованием тех же правил для каждого тензора. -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: kshitijthakkar
Теги: deepseek_v4, deepseek-v4, mixture-of-experts, moe, weight-transferred, sliced, mhc, csa
Лайков: 6 | Загрузок: 76
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.