📌 Обзор защитных тензоров F32 QwenPaw-Flash-9B-heretic, плотной модели 9B, доработанной с помощью методологии Heretic на Qwen3.5-9B. 🧠 Детали модели — Базовая модель: Qwen3.5-9B — Точность: F32 (защитные датчики float32) — Параметры: ~9B — Шарды: модель-00001 ~ модель-00008 (8 файлов, основные веса F32) — Дополнительно: модель-00009 (BF16, глава прогнозирования нескольких токенов, извлеченная из Qwen3.5-9B) ⚡ MTP (Многотокенное предсказание) model-00009-of-00009.safetensors содержит веса головы MTP, извлеченные из Qwen3.5-9B. MTP позволяет модели прогнозировать несколько будущих токенов за один прямой проход, повышая скорость генерации за счет спекулятивного декодирования. — Коэффициент приема MTP: ~43% — Ускорение: ~1,5-1,9x пропускная способность декодирования. Для вывода GGUF с поддержкой MTP см. репозиторий MTP GGUF ниже. 📦 Квантованные версии GGUF Для вывода с помощью llama.cpp / Ollama / LM Studio используйте версии GGUF: — Стандартный GGUF (без MTP): SC117/QwenPaw-Flash-9B-heretic-GGUF — MTP GGUF (с головкой прогнозирования нескольких токенов): SC117/QwenPaw-Flash-9B-heretic-MTP-GGUF 🚀 Использование
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: SC117
Теги: qwen3_5, image-text-to-text, conversational, en, zh, endpoints_compatible
Лайков: 5 | Загрузок: 125
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.