> OLMoE-1B-7B — это LLM, объединяющий экспертов, с 1B активными и 7B общими параметрами, выпущенный в сентябре 2024 г. (09:24). Он обеспечивает самую современную производительность среди моделей с аналогичной стоимостью (1B) и конкурирует с гораздо более крупными моделями, такими как Llama2-13B. OLMoE имеет 100% открытый исходный код. Эту и другую информацию также можно найти в репозитории OLMoE GitHub. — Документ: https://arxiv.org/abs/2409.02060 — Контрольные точки предварительного обучения, код, данные и журналы. — Контрольные точки SFT (контролируемая точная настройка), код, данные и журналы. — DPO/KTO (оптимизация прямых предпочтений/оптимизация Канемана-Тверски), контрольные точки, данные предпочтений, код DPO, код KTO и журналы. Установите трансформаторы из исходного кода до выпуска после этого PR, подождите и запустите: Вы можете перечислить все версии/ветви, установив Huggingface-Hub и запустив: Важные ветки: — Step1200000-tokens5033B: Контрольная точка предварительного обучения, используемая для отжига. После этого есть еще несколько чекпоинтов, но мы ими не воспользовались. — main: контрольная точка, отожженная из шага 1200000-tokens5033B для дополнительных 100B токенов (23 842 шага). Мы используем эту контрольную точку для нашей адаптации (https://huggingface.co/allenai/OLMoE-1B-7B-0924-SFT &…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: allenai
Теги: olmoe, moe, olmo, en, co2_eq_emissions, endpoints_compatible
Лайков: 141 | Загрузок: 37,366
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.