Susono-10B-A1B-Thinking — это модель рассуждения, созданная после обучения Susono-10B-A1B-Base с помощью SFT и DPO. Он запускает процесс рассуждения внутри блока … перед окончательным ответом. Это LLM с оригинальной архитектурой с общим количеством параметров 10B и примерно 1B активных параметров на токен (A1B), интегрирующий Engram (модуль условной памяти) и mHC-lite (Manifold-Constrained Hyper-Connections Lite) в гибридную магистраль Full Attention + GatedDeltaNet + MoE. Обучение проводилось на суперчипе NVIDIA GH200 Grace Hopper. Для Engram и mHC-lite были реализованы выделенные объединенные ядра, а обучение было оптимизировано с помощью обучения FP8 + разгрузки ЦП с использованием преимуществ архитектуры графического процессора GH200. Обратите внимание, что эта модель была разработана исключительно как личный хобби-проект и финансировалась из частных источников. Стоимость разработки составила всего около 1875 долларов США (примерно 300 000 иен), поэтому имейте в виду, что предварительное и последующее обучение не проводились в достаточной степени. > ⚠️Это модель мышления, посттренированная на рассуждение. Примените шаблон чата при создании ответов. Вывод начинается с процесса рассуждения, начиная с , а окончательный ответ следует после . > Мы предполагаем, что нет…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: puwaer
Теги: susono, conversational, en, ja, endpoints_compatible
Лайков: 7 | Загрузок: 162
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.