Это коллекция языковых моделей, обученных с использованием Pile-CC, каждая из которых имеет приблизительно 1B параметров, обученных на разных семенах. Этот проект направлен на проверку возможностей обобщения подхода RegMix (https://huggingface.co/papers/2407.01492) от мелкомасштабных (например, 1M параметров) до крупномасштабных (например, 1B параметров) моделей. — Размер модели: 5 отдельных моделей, обученных с различными семенами, каждая с параметрами ~1B — Данные обучения: Смесь данных только для свай в наборе данных RegMix. Модели были обучены с использованием набора данных RegMix-Data, который разделен на разные домены из набора данных Pile. Вы можете загрузить любую модель, используя соответствующую ветвь, с помощью библиотеки Hugging Face Transformers: Конкретная смесь данных, используемая для обучения этой модели 1B, выглядит следующим образом, что также можно найти в нашем коде: Чтобы получить доступ к различным вариантам модели, просто измените параметр ревизии в методе frompretrained на желаемое начальное значение (например, «seed-2», «seed-3»), а максимальное начальное значение равно 5. Мы оценили каждую модель с помощью lm-оценки-жгута. Показатель производительности для каждой задачи представляет собой среднее значение от 0 выстрелов до 5 выстрелов при нормализации (точность нормализована, если имеется) или в соответствии (точность)…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: sail
Теги: llama, regmix, en, endpoints_compatible
Лайков: 3 | Загрузок: 35
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.