Вдохновлен Phi2 и попытками создания малых языковых моделей с открытым исходным кодом, такими как smolllama-101M-GQA. Предварительное обучение с использованием токена 7B с нуля, с применением фильтра качества к наборам данных, в результате чего получается токен 0,26B. Элемент управления — kenhktsui/nano-phi-115M-control-v0.1, где используется полный набор данных (0,6B). Незначительное снижение производительности, несмотря на использование только 42 % данных благодаря эффективному фильтру качества («qualityscorev1» > 0,5). Фактически, при проверке chkpt на 6000 шагов достигает такой же производительности, что и эта модель, что свидетельствует об эффективной тренировке благодаря высококачественным данным. Обучение в Colab с A100 40 ГБ заняло всего 1 день (Чтобы использовать модель, вам понадобится версия преобразователя >= 4.37.2 — модель — скрытый размер: 768 — numkeyvalueheads: 8 (внимание к групповым запросам) — numattentionheads: 24 — numhiddenlayers: 6 — длина контекста: 1024 — общее количество параметров: 115M — обучение: — глобальные шаги: 14 000 hf-causal-experimental (pretrained=/content/lm-evaluation-harness/artifacts/checkpoint-pegfss6f:v13,useaccelerate=false,trustremotecode=True), предел: нет, предоставленное описание: False, numfewshot: 0, размер пакета: 16 hf-causal-experimental…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: kenhktsui
Теги: phi, en, model-index, text-generation-inference, endpoints_compatible
Лайков: 4 | Загрузок: 81
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.