lovedheart/DeepSeek-V4-Flash-Lite - Каталог нейросетей
Генерация текста

lovedheart/DeepSeek-V4-Flash-Lite

Добавлено:
lovedheart/DeepSeek-V4-Flash-Lite

Количество экспертов уменьшено с 256 до 192. MTP на данный момент не поддерживается. Базовый проверочный тест для версии, сокращенной на 50 %: https://www.bilibili.com/video/BV1KBVN6fEqD/?vd_source=448090107c928cea02cdf07046d02784. Мы представляем предварительную версию серии DeepSeek-V4, включая две сильные языковые модели Mixture-of-Experts (MoE) — DeepSeek-V4-Pro с Параметры 1.6T (активировано 49 байт) и DeepSeek-V4-Flash с параметрами 284 байт (активировано 13 байт) — оба поддерживают длину контекста в один миллион токенов. Серия DeepSeek-V4 включает несколько ключевых обновлений в архитектуре и оптимизации: 1. Архитектура гибридного внимания. Мы разрабатываем гибридный механизм внимания, сочетающий в себе сжатое разреженное внимание (CSA) и сильно сжатое внимание (HCA), чтобы значительно повысить эффективность в долгом контексте. В настройке контекста с 1 млн токенов DeepSeek-V4-Pro требует только 27% FLOP вывода одного токена и 10% кэша KV по сравнению с DeepSeek-V3.2. 2. Гиперсоединения с многообразием (mHC). Мы включаем mHC для усиления традиционных остаточных связей, повышения стабильности распространения сигнала между слоями, сохраняя при этом выразительность модели. 3. Мюонный оптимизатор: мы используем мюонный оптимизатор…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: lovedheart
Теги: deepseek_v4, endpoints_compatible, 8-bit, fp8
Лайков: 5  |  Загрузок: 148

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.