В этом официальном репозитории представлена модель TransNormerLLM3, а также ее веса с открытым исходным кодом для каждых 50 миллиардов токенов, обработанных во время предварительного обучения. TransNormerLLM развивается из TransNormer и является первым LLM в архитектуре линейного трансформатора. Кроме того, он отличается тем, что является первым LLM, не относящимся к Transformer, который превосходит как традиционные Transformer, так и другие эффективные модели Transformer (такие как RetNet и Mamba) с точки зрения скорости и производительности. > Обновление от 7 апреля: Мы планируем увеличить длину последовательности на этапе предварительного обучения до 10 миллионов: https://twitter.com/opennlplab/status/1776894730015789300 — TransNormerLLM3-15B содержит 14,83 миллиарда параметров. Он структурирован из 42 слоев, включает в себя 40 головок внимания и имеет общий размер встраивания 5120. — TransNormerLLM3-15B полностью интегрирован с Lightning Attention-2, который может поддерживать стабильный TGS во время обучения последовательностей неограниченной длины, вплоть до тех пор, пока не возникнут жесткие ограничения, такие как ограничения памяти графического процессора. — Используется токенизатор Titoken с общим размером словаря около 100 000. — Наша система обучения была расширена за счет интеграции с LASP (параллелизм последовательностей линейного внимания),…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: OpenNLPLab
Теги: transnormer, TransNormerLLM, custom_code, en, zh
Лайков: 15 | Загрузок: 59
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.