ReasonCritic-7B
> A reasoning critic — evaluates and improves chain-of-thought. Base model: fableforge-ai/ReasonCritic-7B · Part of the FableForge ecosystem....
> A reasoning critic — evaluates and improves chain-of-thought. Base model: fableforge-ai/ReasonCritic-7B · Part of the FableForge ecosystem....
xVerify is an evaluation tool fine-tuned from a pre-trained large language model, designed specifically for objective questions with...
🛝 Детская площадка | 📄 Технический отчет | 💻 GitHub | 👀 Агент Atla оценивает @keyframes Rainbow {...
— Исходная модель: Flow-Judge-v0.1 — Коллекция моделей: модели Flow-Judge-v0.1 — Технический отчет: Flow Judge: открытая модель на малом...
LMUnit — это современная языковая модель, оптимизированная для оценки модульных тестов естественного языка. Он принимает три входных данных:...
Модель вознаграждения Contextual-SQL — это оценочный компонент системы Contextual-SQL, которая заняла первое место в таблице лидеров тестов BIRD...
Исходная модель: https://huggingface.co/AtlaAI/Selene-1-Mini-Llama-3.1-8B. Запускайте их напрямую с помощью llama.cpp или любого другого проекта на основе llama.cpp. Некоторые из...
UNO-Scorer — это легкая, но высокоточная модель оценки на основе LLM, предназначенная для эффективной автоматизации оценки больших мультимодальных...
🌐 Сообщение в блоге | 📄 Технический отчет | 💻 Кулинарные книги | 👀 Агент Atla оценивает @keyframes...
🛝 Детская площадка | 📄 Технический отчет | 💻 GitHub | 👀 Агент Atla оценивает @keyframes Rainbow {...