pszemraj/jamba-900M-v0.13-KIx2 - Каталог нейросетей
Генерация текста

pszemraj/jamba-900M-v0.13-KIx2

Добавлено:
pszemraj/jamba-900M-v0.13-KIx2

> Виджет API отключен, так как он еще не поддерживается hf — попробуйте Colab. Это предтренировочный эксперимент на джамбе-арке в качестве «смоль МО». — предварительно обучено с длиной контекста 16384 — просмотрено около 20b токенов — используется токенизатор Claude3 (как токенизатор hf GPT2) — скрытый размер 1024, 12 слоев, 8 экспертов достигают следующих результатов в наборе оценок (самый последний набор данных): — Потеря: 3,0366 — Точность: 0,4514 — Число просмотренных входных токенов: 1975517184, если я буду предварительно обучать его дальше, другие версии будут в новых репозиториях с увеличенной версией (это v0.13) hf (pretrained=pszemraj/jamba-H1024L12-v0.13-KIx2,trustremotecode=True,dtype=float), genkwargs: (Нет), предел: 0,9999, numfewshot: Нет, размер пакета: 8. Во время обучения использовались следующие гиперпараметры: — скорость обучения: 5e-05 — размер пакета: 4 — размер пакета: 4 — начальное значение: 80085 — градиентаккумуляция шагов: 32 — общий размер пакета поезда: 128 — оптимизатор: Адам с betas=(0,9,0,999) и эпсилон=1e-08 — lrschedulertype: косинус — lrschedulerwarmupratio: 0,05 — numepochs: 2,0 — Трансформеры 4.40.1 — Pytorch 2.2.0+cu121 — Наборы данных 2.19.0 — Токенизаторы 0.19.1

Модальности:
Генерация текста


Задача: Генерация текста
Автор: pszemraj
Теги: jamba, smol MoE, smol, en
Лайков: 4  |  Загрузок: 25

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.