Этот репозиторий содержит пакет SSD Flash-MoE для DeepSeek V4 Flash. Он предназначен для сред выполнения, которые могут загружать плотный GGUF плюс маршрутизируемую экспертную коляску. — Плотные/общие тензоры: собственный DeepSeek FP8, представленный как F8E4M3B128 в GGUF. — Маршрутизируемые экспертные тензоры MoE: собственный DeepSeek FP4, представленный как MXFP4 в манифесте коляски. — Встраивания, выходные данные, нормы, метаданные маршрутизации и идентификаторы могут оставаться BF16, F32 или I32, где это необходимо. Маршрутизированные экспертные тензоры не хранятся в плотном GGUF. Они хранятся в коляске как двоичные банки уровня основного уровня. — Архитектура: deepseek4 — Блоки: 43 — Эксперты: 256 — Активные эксперты на токен: 6 — Длина контекста: 1048576 — Плотные тензоры GGUF: 1199 — Маршрутизируемые дополнительные экспертные записи: 129 Этот пакет не является автономным плотным GGUF. Используйте сборку llama.cpp с поддержкой Flash-MoE, которая поддерживает DeepSeek V4 Flash, режим банка слотов и собственные типы тензоров FP8/FP4.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: anemll
Теги: llama.cpp, gguf, deepseek-v4, deepseek-v4-flash, flash-moe, slot-bank, ssd, fp8
Лайков: 6 | Загрузок: 420
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.