Многопоточный вариант Qwen3-8B (стандартный преобразователь), который генерирует десять параллельных потоков одновременно за такт. Один прямой проход создает токен следующей строки для каждого канала; токены внутри строки не могут видеть друг друга (блок-причинное внимание), но каждый канал может обрабатывать токены каждой предыдущей строки. Это модель потока 8B, предназначенная для проверки возможности мониторинга большего количества внутренних потоков (именно поэтому в ней 8 внутренних потоков). — База: Qwen3-8B (36 слоев, плотный преобразователь с вниманием к групповым запросам). — Встраивание каналов: к встраиваниям токенов добавлено 10 изученных векторов. — Причинно-блочное внимание: для каждой строки все токены C=10 видят предыдущие строки и самих себя, но никогда не видят своих одноранговых элементов в той же строке. — Потеря/вывод: прогнозирование следующей строки со сдвигом на 10. Один ряд (10 жетонов) на каждый шаг вперед. Полное описание проекта, семантику каналов и обоснование архитектуры см. в карточке модели 27B — этот репозиторий 8B идентичен, но использует плотную магистраль трансформатора (без гибридизации DeltaNet). > Требуется Trustremotecode=True: встроенный файл modelingqwen3.py` > подключает встраивания каналов и пользовательскую обработку причинно-следственных позиций блоков. Для рендеринга сетки/пошаговой проверки…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: JonasGeiping
Теги: qwen3, stream-llm, multi-stream, parallel-cognition, monitorability, conversational, custom_code, en
Лайков: 6 | Загрузок: 65
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.