fluxion-370m-instruct
Fluxion обеспечивает в 76,7 раз более высокий показатель MATH-500 на триллион обучающих токенов, чем любая другая модель в...
Fluxion обеспечивает в 76,7 раз более высокий показатель MATH-500 на триллион обучающих токенов, чем любая другая модель в...
Supertron1-14B — это тонко настроенная языковая модель QLoRA, созданная на основе Qwen3-14B. Обученный с упором на программирование, математику,...
GRM-1.5b — это универсальная модель 1.5B, ориентированная на рассуждения, настроенная для улучшения многодоменных рассуждений (математика, логика, кодирование и...
> Архитектура DeepSeek-V3 масштабируется до ~344 тыс. общих параметров (~160 тыс. активных/токенов) — полностью работает на процессоре. Создан...
Компактная языковая модель с параметрами 0,35B, настроенная на инструкции, оптимизированная для рассуждений, математических задач и задач генерации кода....
Фи-4-мини-рассуждение — это облегченная открытая модель, построенная на синтетических данных с упором на высококачественные, плотные данные для рассуждений,...
Модель была обучена на объединенном наборе данных задач программирования на Python (из MBPP и opc-sft-stage2) и задач по...
Фи-4-мини-рассуждение — это облегченная открытая модель, построенная на синтетических данных с упором на высококачественные, плотные данные для рассуждений,...
Выбор правильного формата модели зависит от возможностей вашего оборудования и ограничений памяти. — 16-битный формат с плавающей запятой,...
Компания TNG Technology Consulting провела точную настройку модели большого языка OLMo-2 с 32 миллиардами параметров с использованием графических...