Locutusque/TinyMistral-248M - Каталог нейросетей
Генерация текста

Locutusque/TinyMistral-248M

Добавлено:
Locutusque/TinyMistral-248M

Предварительно обученная языковая модель, основанная на модели Mistral 7B, была уменьшена примерно до 248 миллионов параметров. Эта модель была обучена на 7 488 000 примерах. Эта модель предназначена не для прямого использования, а для тонкой настройки последующих задач. Эта модель должна иметь длину контекста около 32 768 токенов. Безопасная сериализация была удалена из-за проблем с сохранением веса модели. Во время оценки на InstructMix эта модель получила средний балл сложности 6,3. Для этой модели запланировано больше эпох на разных наборах данных. Цель этой модели — доказать, что наборы данных масштаба в триллион не нужны для предварительного обучения языковой модели. Из-за необходимости использования небольших наборов данных эта модель была предварительно обучена на одном графическом процессоре (Titan V).

Модальности:
Генерация текста


Задача: Генерация текста
Автор: Locutusque
Теги: mistral, en, text-generation-inference, endpoints_compatible
Лайков: 50  |  Загрузок: 853

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.