Zero-Mistral-Small-24B-Instruct-2501
Zero-Mistral-Small — это улучшенная версия mistralai/Mistral-Small-24B-Instruct-2501, адаптированная в первую очередь для русского и английского языков. Обучение включало этап...
Zero-Mistral-Small — это улучшенная версия mistralai/Mistral-Small-24B-Instruct-2501, адаптированная в первую очередь для русского и английского языков. Обучение включало этап...
CTRL-32B — это критический LLM, доработанный из Qwen2.5-Coder-32B-Instruct. — Страница проекта: https://critic-rl.github.io/ — Документ: https://arxiv.org/abs/2502.03492 — Код: https://github.com/HKUNLP/critic-rl...
— Архитектура модели: Qwen2ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
— Архитектура модели: Qwen2ForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
— Архитектура модели: LlamaForCausalLM — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование веса:...
— Архитектура модели: Meta-Llama-3 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Квантование активации:...
— Архитектура модели: Meta-Llama-3 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
— Архитектура модели: Gemma 2 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое...
— Архитектура модели: Phi-3 — Входные данные: текст — Выходные данные: текст — Оптимизация модели: — Весовое квантование:...
Восстановленный из отзыва повторный REAP GLM-5.2-NVFP4 — 172 эксперта на уровень (из 256), самосогласованный, веса BF16 сохранены, эксперты...