DeepSeek-R1-Distill-Llama-70B-FP8-dynamic
— Архитектура модели: LlamaForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
— Архитектура модели: LlamaForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
— Архитектура модели: Qwen2ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
Обладая обширной подготовкой с помощью обучения с подкреплением в сотнях тысяч сложных реальных сред, M2.5 является SOTA в...
Чтобы обеспечить развертывание Ring-Linear-2.0 на устройствах с ограниченным объемом памяти, мы выпускаем квантованные веса с использованием формата GPTQ...
> [!NOTE] > Этот репозиторий содержит версию FP8 4.1-8B. > > Дополнительную информацию см. в карточке модели исходной...
Рекалибровка Agentic + Coder MiniMax-M2.7 NVFP4-GB10. Та же архитектура и схема квантования, что и у saricles/MiniMax-M2.7-NVFP4-GB10, но откалиброваны...
> Запустите 35B 256-expert MoE на RTX 3060 (12 ГБ) с экспертной разгрузкой RTX PRO 6000 Blackwell (96...
LLM Cogito v2.1 представляют собой генеративные модели, настроенные на инструкции. Все модели выпускаются по открытой лицензии для коммерческого...
— Архитектура модели: Mistral-Small-24B-Instruct-2501 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
Эта модель была получена с использованием следующей ветки с LLM Compressor: https://github.com/vllm-project/llm-compressor/pull/2647 Эта модель была развернута с использованием...