aws-prototyping/MegaBeam-Mistral-7B-300k - Каталог нейросетей
Генерация текста

aws-prototyping/MegaBeam-Mistral-7B-300k

Добавлено:
aws-prototyping/MegaBeam-Mistral-7B-300k

MegaBeam-Mistral-7B-300k — это доработанная языковая модель Mistral-7B-Instruct-v0.2, которая поддерживает входные контексты до 320 тыс. токенов. MegaBeam-Mistral-7B-300k можно развернуть на одном экземпляре AWS g5.48xlarge с использованием обслуживающих платформ, таких как vLLM, конечная точка Sagemaker DJL и других. Сходства и различия между MegaBeam-Mistral-7B-300k и Mistral-7B-Instruct-v0.2 суммированы ниже: InfiniteBench: расширение оценки длинного контекста за пределы 100 тыс. токенов InfiniteBench — это передовой тест, предназначенный для оценки возможностей языковых моделей обрабатывать, понимать и рассуждать в сверхдлинных контекстах (более 100 тыс. токенов). Поэтому мы оценили MegaBeam-Mistral-7B-300k, Mistral-7B-Instruct-v0.2, Llama-3-8B-Instruct-262k и Llama3-70B-1M на InfiniteBench. Авторы InfiniteBench также оценили на InfiniteBench собственные LLM и LLM с открытым исходным кодом SOTA. Таким образом, мы объединили оба результата в таблице ниже. Ниже приведены 12 оценочных задач (согласно InfiniteBench)) На экземпляре AWS g5.48xlarge обновите vLLM до последней версии согласно документации по vLLM. Важное примечание. Мы установили для параметра maxpositionembeddings в config.json значение 288 800, чтобы оно соответствовало модели…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: aws-prototyping
Теги: mistral, conversational, text-generation-inference
Лайков: 16  |  Загрузок: 8,134

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.