Мы расширяем нашу модельную серию Olmo, представляя Olmo Hybrid, новую гибридную модель RNN 7B в семействе Olmo. Olmo Hybrid значительно превосходит Olmo 3 по конечной производительности, стабильно демонстрируя примерно двукратную эффективность данных при тестировании ядра в ходе нашего предварительного обучения. Мы также показываем прирост производительности в тестах с длинным контекстом, а также повышение эффективности вывода (пропускная способность и память) на длинных контекстах на 75%. При обучении нашей гибридной модели используется Olmo 3 7B, за исключением того, что мы меняем график скорости обучения на стандартный косинусный график, а не на кусочный график, используемый Olmo 3. Кроме того, мы используем улучшенный набор данных Olmo 3 32B вместо смеси Olmo 3 7B. В таблице ниже показаны различия в архитектуре нашей гибридной модели. Наш общий уровень соответствует архитектуре трансформатора Olmo 3 7B, за исключением того, что 75% слоев используют вентилируемые головки DeltaNet вместо головок внимания. Уровни чередуются так, что 3 содержат подуровни DeltaNet, за которыми следует 1 с подуровнем многоголового внимания. В частности, в каждой головке используются закрытые головки DeltaNet, расширенные отрицательными собственными значениями. Мы сократили количество головок с 32 до 30, в то время как…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: allenai
Теги: olmo_hybrid, en, endpoints_compatible
Лайков: 52 | Загрузок: 32,483
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.