ОБНОВЛЕНИЕ от 4 января 2025 г.: Поддержка DeepSeek-V3 была объединена, теперь вы можете получить ее из основной ветки llama.cpp. Версии, загруженные в этот репозиторий, уже перераспределены для поддержки изменений в именах тензоров. Первоначальный предварительный просмотр квантовой версии deepseek-ai/DeepSeek-V3 для GGUF. Для работы требуется этот PR-коммит: https://github.com/ggerganov/llama.cpp/pull/11049. Мы представляем DeepSeek-V3, сильную языковую модель Mixture-of-Experts (MoE) с 671B общими параметрами с 37B активируется для каждого токена. Для достижения эффективного вывода и экономичного обучения в DeepSeek-V3 используются архитектуры Multi-head Latent Attention (MLA) и DeepSeekMoE, которые были тщательно проверены в DeepSeek-V2. Кроме того, DeepSeek-V3 внедряет стратегию балансировки нагрузки без вспомогательных потерь и устанавливает цель обучения прогнозированию с использованием нескольких токенов для повышения производительности. Мы предварительно обучаем DeepSeek-V3 на 14,8 триллионах разнообразных и высококачественных токенов, после чего следует этапы контролируемой точной настройки и обучения с подкреплением, чтобы полностью использовать его возможности. Всесторонние оценки показывают, что DeepSeek-V3 превосходит другие модели с открытым исходным кодом и достигает производительности, сравнимой с ведущими моделями с закрытым исходным кодом.…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: bullerwins
Теги: llama.cpp, gguf, endpoints_compatible, conversational
Лайков: 102 | Загрузок: 566
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.