Возможно, это не лучшая языковая модель, но это языковая модель! Это интересно по нескольким причинам, не последней из которых является то, что технически это не трансформер. — Скрытый размер 768, 12 слоев — без МЕГА-фрагментации, длина контекста 4096 — Размер EMA 16, общий размер 192 — Токенизатор: GPT NeoX — обучение с нуля Более детальное и полезное представление (основанное на расширении средства просмотра + некоторое переформатирование) Учитывая небольшой размер и архитектуру модели, вероятно, лучше использовать ее более длинный контекст, добавляя входной контекст, чтобы «увидеть больше», а не «сгенерировать больше». hf-causal-experimental (pretrained=BEE-spoke-data/mega-ar-126m-4k,revision=main,trustremotecode=True,dtype=’float’), предел: нет, предоставленное описание: False, numfewshot: 0, размер пакета: 4`
Модальности:
Генерация текста
Задача: Генерация текста
Автор: BEE-spoke-data
Теги: mega, en, endpoints_compatible
Лайков: 5 | Загрузок: 119
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.