Эта модель представляет собой высокоэкспериментальную и оптимизированную модель рассуждения, созданную путем хирургического слияния SLERP двух мощных моделей рассуждения 4B. Целью этого слияния было объединение глубоких аналитических способностей Кими с математической и структурной точностью Квена, а также смягчение катастрофического забывания, обычно наблюдаемого при слияниях моделей SFT. После нескольких итераций и послойного тензорного анализа мы достигли «эффекта синергии 1+1=3» в логическом выводе и планировании, превзойдя как базовые модели, так и модель мышления Qwen. Стандартные слияния SLERP часто разрушают возможности RAG и соблюдение синтаксиса. Чтобы решить эту проблему, в этой модели используется специальная конфигурация слияния: 1. Исправление RAG/словаря: embedtokens и lmhead строго привязаны к версии 1.0 (Qwen). Модель читает и говорит, используя исключительно словарь Квена, полностью устраняя проблему деградации RAG. 2. Градиентное внимание. Промежуточные уровни внимания и MLP следуют плавному градиенту [0, 0,1, 0,2, 0,3, 0,5, 0,7, 0,8, 0,9, 1], чтобы предотвратить влияние веса на этапах глубокого рассуждения. — Тест: khazarai/Multi-Domain-Reasoning-Benchmark — Всего вопросов: 100 Идеально подходит для: сложных логических выводов, Python…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: khazarai
Теги: gguf, mergekit, merge, en, endpoints_compatible, conversational
Лайков: 7 | Загрузок: 419
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.