Языковая модель с параметрами 1.3B, которая заменяет внимание softmax на причинное моноидное сжатие состояний, обеспечивая время O(1) на токен и память O(1) при выводе — независимо от длины последовательности. Моноидное внимание сжимает всю причинную историю в матрицу состояний фиксированного размера S_t на голову: это моноид, потому что бинарный оператор (α, S) ⊕ (β, X) = (α·β,diag(β)·S + X) является ассоциативным, что позволяет O(T) параллельное сканирование префиксов для обучения и O(1) последовательное обновление для вывода. В отличие от скалярного распада (один α на голову), Спартак использует векторный распад: каждое измерение d-вектора имеет свою собственную независимую скорость распада α_t[i] ∈ (0, 1): Это позволяет специализировать различные измерения признаков: — Быстро затухающие измерения (α ≈ 0) — локальный синтаксис, пунктуация, функциональные слова — Медленно затухающие измерения (α ≈ 1) — память объекта, отслеживание тем, факты на большие расстояния Моноидная повторяемость корректно обрабатывается маска внимания для дополненных пакетов (например, заполнение слева во время генерации()`). Для позиций PAD (маска=0): Чистый эффект: St = 1·S{t-1} + 0 = S{t-1} — PAD действует как элемент идентичности моноида**, полностью невидимый для повторения. Это гарантирует идентичные выходные данные независимо от того, дополнены ли входные данные или нет. -…
Модальности:
Генерация текста
Области применения:
Логика и рассуждение Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: NoesisLab
Теги: monoid, causal-lm, linear-attention, state-space, O(1)-inference, vector-decay, reasoning, conversational
Лайков: 22 | Загрузок: 431
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.