ThinkPRM-1.5B
ThinkPRM-1.5B is a generative Process Reward Model (PRM) based on the R1-Distill-Qwen-1.5B architecture. It is fine-tuned to perform...
ThinkPRM-1.5B is a generative Process Reward Model (PRM) based on the R1-Distill-Qwen-1.5B architecture. It is fine-tuned to perform...
Квантованные версии GGUF AIDC-AI/Marco-DeepResearch-8B для использования с llama.cpp и совместимыми механизмами вывода. Marco DeepResearch — это эффективный агент...
ThinkPRM-14B — это модель вознаграждения генеративного процесса (PRM), основанная на архитектуре R1-Distill-Qwen-14B. Он настроен для выполнения пошаговой проверки...
xVerify — это инструмент оценки, созданный на основе предварительно обученной модели большого языка и разработанный специально для объективных...