Суперлинейное многоэтапное внимание — субквадратичный механизм внимания, который сохраняет произвольный доступ к контексту (структурное неисключение) для чрезвычайно длинных последовательностей. Это экспериментальная версия, демонстрирующая архитектуру Superlinear внимания, интегрированную в модифицированную гибридную модель nvidia/NVIDIA-Nemotron-3-Nano-30B-A3B-BF16. > ПРЕДУПРЕЖДЕНИЕ (Безопасность). Для этой модели требуется значение Trustremotecode=True, которое выполняет код Python из этого репозитория. Просмотрите код перед запуском в чувствительных средах. Суперлинейное внимание переформулирует причинное самовнимание как многоэтапную задачу поиска: 1. Накопление — эффективно обрабатывает последовательность и создает представителей для каждой позиции (через слои Мамбы-2 в гибридной архитектуре). 2. Поиск интервала — оценивает сублинейное количество интервалов-кандидатов с использованием изученной маршрутизации, а затем выбирает k лучших интервалов для каждого запроса. 3. Внимание к промежутку — вычисляет стандартное внимание на уровне токена в пределах выбранных смежных промежутков. 4. Комбинация. Выдает выходные данные, используя Softmax-взвешенное стробирование по выходным сигналам внимания. В базовой реализации N=2 как диапазон поиска, так и диапазон внимания масштабируются как O(L^(3/2)), что позволяет делать практические выводы при использовании нескольких миллионов токенов…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: concavity-ai
Теги: long-context, superlinear-attention, subquadratic, causal-lm, conversational, endpoints_compatible
Лайков: 22 | Загрузок: 61
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.