SAM (Маленькая агентная модель), модель 7B, демонстрирующая впечатляющие способности к рассуждению, несмотря на свой меньший размер. SAM-7B превзошёл существующие модели SoTA по различным тестам рассуждения, включая GSM8k и ARC-C. Полную информацию об этой модели можно найти в нашем блоге. — SAM-7B превосходит GPT 3.5, Orca и несколько других моделей 70B по нескольким тестам рассуждения, включая ARC-C и GSM8k. — Интересно, что, несмотря на обучение на наборе данных на 97% меньшем, SAM-7B превосходит Orca-13B на GSM8k. — Все ответы в нашем наборе данных для точной настройки генерируются моделями с открытым исходным кодом без какой-либо помощи со стороны современных моделей, таких как GPT-3.5 или GPT-4. — Обучение: команда SuperAGI — Аппаратное обеспечение: NVIDIA 6 x H100 SxM (80 ГБ) — Используемая модель: Mistral 7B — Продолжительность тонкой настройки: 4 часа — Количество эпох: 1 — Размер пакета: 16 — Скорость обучения: 2e-5 — Коэффициент прогрева: 0,1 — Оптимизатор: AdamW — Планировщик: Cosine Шаблон, используемый для создания приглашения для модели Instruct, определяется как следует: Обратите внимание, что и являются специальными токенами для начала строки (BOS) и конца строки (EOS), тогда как [INST] и [/INST] являются обычными строками. Эти тесты показывают, что наша модель улучшила рассуждения по сравнению с…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: SuperAGI
Теги: mistral, en, text-generation-inference, endpoints_compatible
Лайков: 35 | Загрузок: 706
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.