Одна из лучших 3B-моделей! Превзойти dolly-v2-12b в таблице лидеров Open LLM! Одна из лучших моделей 3B в таблице лидеров Open LLM, производительность которой превосходит dolly-v2-12b! Мы использовали систему оценки языковой модели SOTA (State Of The Art) для запуска тестов производительности, описанных выше. Ниже приведена производительность при тестировании с нулевым выстрелом, в основном лучше, чем acrastt/Marx-3B-V2 hf-causal (pretrained=CobraMamba/mamba-gpt-3b-v4), предел: нет, предоставленное описание: False, numfewshot: 0, пакет_размер: нет. Код обучения и данные будут открыты позже. Гитхаб (https://github.com/chi2liu/mamba-gpt-3b). mamba-gpt-3b-v4 обучен на нескольких наборах данных: — Stanford Alpaca (en) — Open Assistant (многоязычный) — LIMA (en) — CodeAlpaca 20k (en) — Сгенерированные данные GPT-4 (en&zh) — UltraChat (en) Мы доработали модель OpenLLaMA и превзошли исходную модель в нескольких подзадачах оценки, что делает ее на данный момент одной из самых эффективных 3B-моделей, с сопоставимые характеристики с Ламой-7б. — Базовая модель: openlm-research/openllama3b_v2. Чтобы использовать модель с библиотекой преобразователей на машине с графическими процессорами, сначала убедитесь, что у вас установлены библиотеки преобразователей, ускорения и факела. Пожалуйста…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: CobraMamba
Теги: llama, gpt, llm, large language model, en, text-generation-inference
Лайков: 8 | Загрузок: 698
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.