deepseek-coder-33b-instruct-function-calling-v3
Эта модель идеально настроена для вызова функций. — Формат метаданных функции такой же, как и в OpenAI. —...
Эта модель идеально настроена для вызова функций. — Формат метаданных функции такой же, как и в OpenAI. —...
Автономный черновой вариант («поддерживаемая») модели спекулятивного декодирования DSpark, упакованный как один GGUF емкостью 5,6 ГиБ для движка ds4....
DeepSeek V4 Flash с сокращением REAP на уровне K128 (128 маршрутизируемых экспертов на каждый уровень MoE, сокращение 50%)...
Это кванты для механизма вывода DS4, построенного на основе матрицы важности (imatrix) и смещений тензора, выровненных для эффективной...
> Архитектура DeepSeek-V3 масштабируется до ~344 тыс. общих параметров (~160 тыс. активных/токенов) — полностью работает на процессоре. Создан...
Мы возлагаем большие надежды на эффективность моделей рассуждения; поэтому в настоящее время мы решили не сжимать их до...
DeepSeek-V3.1 — это гибридная модель, поддерживающая как режим мышления, так и режим без мышления. По сравнению с предыдущей...
Этот репозиторий содержит исходный код полной точности в формате «безопасных тензоров» для создания GGUF, GPTQ, EXL2, AWQ, HQQ...
DeepSeek-R1-Distill-SRE-Qwen-32B-INT8 — первая в отрасли общедоступная крупная операционная модель. Это специализированная 8-битная квантованная модель большого языка смешанной точности,...
DeepHermes-3-Llama-3.1-8B-Preview-16.5B с Brainstorm 40x, 16.5B. (72 слоя, 643 тензора) Имейте в виду, что эта модель является экспериментальной и...