— Название модели: FANformer-1B — Параметры без внедрения: 1,1B — Токены обучения: 1 триллион — Дата выпуска: март 2025 г. — Тип модели: LLM только для декодера с расширенным моделированием периодичности — Лицензия: Лицензия MIT — Репозиторий: GitHub — Бумага: arXiv:2502.21309 FANformer-1B — это параметр с 1,1 миллиарда авторегрессионная языковая модель, предварительно обученная с нуля для улучшения языкового моделирования с помощью эффективных механизмов периодичности. В его обновленной архитектуре (olmo/model.py) представлен уровень FAN — новый компонент, предназначенный для фиксации периодических закономерностей в обучающих данных, что обеспечивает превосходную эффективность и производительность обучения. — Основное использование: создание и понимание текста общего назначения. — Дальнейшее использование: можно настроить для таких задач, как подведение итогов, ответы на вопросы и диалог. — Ограничения: может наследовать систематические отклонения от обучающих данных. Производительность на языках с низким уровнем ресурсов не гарантируется.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: dongyh
Теги: hf_olmo, custom_code, en
Лайков: 5 | Загрузок: 17
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.