DeepSeek-R1-Distill-Qwen-7B-GRPO_Math-8bit-mlx
Эта модель, обученная GRPO, представляет собой точно настроенную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. GRPO применяется после создания...
Эта модель, обученная GRPO, представляет собой точно настроенную версию deepseek-ai/DeepSeek-R1-Distill-Qwen-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. GRPO применяется после создания...
Эта модель представляет собой точно настроенную версию Qwen/Qwen2.5-7B-Instruct-1M на наборе данных HuggingFaceH4/Bespoke-Stratos-17k. Он был обучен с использованием TRL....
Эта модель представляет собой доработанную версию Qwen/Qwen2.5-Math-7B в наборе данных DigitalLearningGmbH/MATH-lighteval. Он был обучен с использованием TRL. Эта...
Эта модель представляет собой модель рассуждения для задачи Text2SQL, представленную в Think2SQL: усиление возможностей рассуждения LLM для Text2SQL....