FlexOlmo — это новый вид LM, который открывает новую парадигму совместной работы с данными. С помощью FlexOlmo владельцы данных могут внести свой вклад в разработку моделей открытого языка, не отказываясь при этом от контроля над своими данными. Нет необходимости напрямую делиться необработанными данными, и участники данных могут решать, когда их данные активны в модели, деактивировать их в любое время и получать атрибуты всякий раз, когда они используются для вывода. > FlexOlmo-7x7B-1T (без обучения маршрутизатору) представляет собой смесь экспертов с общим числом параметров 33B, объединяющую независимо обученных экспертов по публичному миксу, новостям, математике, программированию, академическим текстам, творческому письму и данным Reddit. Эксперт по публичному миксу обучается на токенах общедоступных данных 1T, в то время как другие эксперты являются ответвлениями эксперта по публичному миксу и обучаются на токенах 50B своих соответствующих данных. Эту и другую информацию также можно найти: — Документ: https://allenai.org/papers/flexolmo — Код: https://github.com/allenai/FlexOlmo — Блог: https://allenai.org/blog/flexolmo — Данные и соответствующие модели: * Оценка отдельной модели относится к плотной модели, а не к модели 2x7B MoE.
Модальности:
Генерация текста
Области применения:
Диалог / чат Генерация кода
Задача: Генерация текста
Автор: allenai
Теги: flex_olmo, moe, olmo, flexolmo, conversational, en, co2_eq_emissions, endpoints_compatible
Лайков: 5 | Загрузок: 144
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.