thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF - Каталог нейросетей
Генерация текста

thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF

Добавлено:
thetom-ai/DeepSeek-V4-Flash-ConfigI-GGUF

MoE с 284 байтами параметров (активный 21 байт) в 95 ГиБ — подходит и работает на блоках с унифицированной памятью 128 ГБ (DGX Spark, Mac). Гибридное квантование Config-I эффективно при скорости передачи данных 2,88 бит/мас. Квантование Config-I deepseek-ai/DeepSeek-V4-Flash-0731 — официальный выпуск 31 июля 2026 г., заменяющий предварительную версию — (43 слоя, 256 маршрутизируемых экспертов топ-6, хэш-маршрутизация, внимание MLA, гиперсоединения mHC, индексатор DSA). Родственный выпуск: Config-I MLX для Apple Silicon. 📖 Как на самом деле хорошо его запустить: руководство по эксплуатации вне этикетки охватывает серверные ловушки, выборку, исправление цикла повторения и сравнение скорости DwarfStar в одном месте. Этот GGUF использует тип веса TurboQuant TQ31S, поэтому ему требуется вилка TurboQuant llama.cpp, а не стандартный llama.cpp: проверено по ветке по умолчанию ветки (feature/turboquant-kv-cache): загружается и генерируется правильно как на Metal, так и на CUDA. — Wikitext PPL: 15,64 ± 0,38 (ctx 512, 60 фрагментов) · 12,86 ± 0,29 (ctx 2048, 15 фрагментов) — измерено на CUDA (GB10). — Когерентная жадная генерация проверена на CUDA, CPU и Metal. Наблюдаемое поведение при скорости 2,88 бит/мин (примечания честности, измерено в условиях сильного конфликта ввода-вывода — ожидаются повторные запуски в спокойном состоянии): — Используйте официальные настройки выборки: температура…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: thetom-ai
Теги: gguf, turboquant, config-i, moe, en, conversational
Лайков: 5  |  Загрузок: 1,083

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.