Это незавершенные экспериментальные версии DeepSeek-v3-0324-instruct, созданные посредством объединения моделей. Они не готовы к прямому использованию и будут демонстрировать непредсказуемое поведение без существенного постобучения. Эти модели выпущены исключительно для исследовательских целей и требуют специального процесса «восстановления» для восстановления функциональности. Не используйте эти модели, не разобравшись и не применив процедуру заживления. Модель DeepSeek-V3-0324, в которой задействовано 256 экспертов, составляет основу для этих предварительных моделей. Мы предлагаем четыре варианта, каждый с разным уровнем сжатия: 8 Fused Experts, ранг 4 (параметры ~39B): уменьшение размера на 1/20. 4 Fused Experts, ранг 4 (~29B параметров): уменьшение размера на 1/23. Несмотря на значительно уменьшенный размер, эти модели демонстрируют удивительно высокую производительность, превосходя ожидания по количеству параметров. В дальнейшем планируется более комплексное тестирование. Эти модели после процесса слияния находятся в исходном, нестабильном состоянии. Ожидайте значительного снижения производительности и непредсказуемых результатов. Они не отражают окончательные возможности правильно обученной объединенной модели. Это очень ранняя версия слияния…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: AlphaGaO
Теги: deepseek_v3, conversational, custom_code, text-generation-inference, endpoints_compatible
Лайков: 5 | Загрузок: 15
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.