Предварительно обученная языковая модель, основанная на модели Mistral 7B, была уменьшена примерно до 248 миллионов параметров. Эта модель была обучена на 7 488 000 примерах. Эта модель предназначена не для прямого использования, а для тонкой настройки последующих задач. Эта модель должна иметь длину контекста около 32 768 токенов. Безопасная сериализация была удалена из-за проблем с сохранением веса модели. Во время оценки на InstructMix эта модель получила средний балл сложности 6,3. Для этой модели запланировано больше эпох на разных наборах данных. Цель этой модели — доказать, что наборы данных масштаба в триллион не нужны для предварительного обучения языковой модели. Из-за необходимости использования небольших наборов данных эта модель была предварительно обучена на одном графическом процессоре (Titan V).
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Locutusque
Теги: mistral, en, text-generation-inference, endpoints_compatible
Лайков: 50 | Загрузок: 853
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.