totally-not-an-llm/EverythingLM-13b-16k - Каталог нейросетей
Генерация текста

totally-not-an-llm/EverythingLM-13b-16k

Добавлено:
totally-not-an-llm/EverythingLM-13b-16k

Представляем EverythingLM, универсальную модель 13b на базе llama-2 с контекстом 16k благодаря LlongMa. Модель обучена на наборе данных EverythingLM, дополнительную информацию можно найти на странице набора данных. Эта модель является ранней проверкой набора данных EverythingLM и некоторых новых экспериментальных принципов, поэтому не считайте ее SOTA. Обязательно используйте правильные настройки масштабирования веревки: -c 16384 —rope-freq-base 10000 —rope-freq-scale 0,25 — автоматически активируется рассуждение CoT. — Многословные и подробные ответы. — Творческие истории. — Лучшее быстрое понимание. Это модифицированный формат Vicuna, который используется во многих моделях Хартфорда. Обучение с использованием QLoRa на 1xA100 заняло около 1 часа, поэтому эту модель можно воссоздать примерно за 3 доллара. Модель QLoRa можно найти здесь: https://huggingface.co/totally-not-an-llm/EverythingLM-13b-peft. — Из-за характера набора данных он лучше работает с большей детализацией. Я обнаружил, что истории получаются гораздо лучше, когда я предоставляю больше требований. — Ему очень нравится использовать нумерованные списки. У меня не обязательно возникнут проблемы с этим, но это следует учитывать при обучении на наборе данных. — Ему нравится писать сказки поверх всего остального, что странно. Это легко может быть…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: totally-not-an-llm
Теги: llama, text-generation-inference, endpoints_compatible
Лайков: 33  |  Загрузок: 1,682

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.