GOBA-AI-Labs/PrunedHub-Qwen3.5-35B-A3B-80pct - Каталог нейросетей
Генерация текста

GOBA-AI-Labs/PrunedHub-Qwen3.5-35B-A3B-80pct

Добавлено:
GOBA-AI-Labs/PrunedHub-Qwen3.5-35B-A3B-80pct

13,67 ГБ | 204/256 экспертов | Q3KM | MMLU -1pp, GSM8K равно | Полная резидентность графического процессора на Mac с 24 ГБ памяти | ГГУФ | Apache 2.0 Урезанный вариант Qwen3.5-35B-A3B, который полностью помещается в память графического процессора на компьютере Mac с объемом памяти 24 ГБ, сохраняя при этом качество, близкое к исходному. Официальный Q4KM (21,2 ГБ) требует подкачки; эта модель работает полностью резидентно на графическом процессоре. — 13,67 ГБ: полный резидентный графический процессор на 24 ГБ Apple Silicon (без подкачки, без потоковой передачи на SSD) — на 19 % меньше, чем исходный Q3KM (16,80 ГБ), на 36 % меньше, чем Q4KM (21,2 ГБ) — MMLU 80 % (-1 pp от исходных 81 %)  – знания практически без потерь — GSM8K 82 % (равен оригиналу) — математические рассуждения полностью сохранены — LiveCodeBench Easy 83,1% (142 проблемы, без загрязнений) — надежная генерация кода — гибридная архитектура DeltaNet (75% Gated DeltaNet + 25% полного внимания) — Совместимость с llama.cpp (сборка 8140+) > Примечание. LiveCodeBench Easy (142 задачи конкурентного программирования от LeetCode/AtCoder/Codeforces, 2024+) — это основной тест кода. HumanEval 50Q ненадежен при таком размере выборки — LCB и HumanEval дали противоположные выводы при сравнении моделей в ходе нашего тестирования. Мы также протестировали Weight-80% + MxMoE (смешанное квантование, 12,69 ГБ), но обнаружили, что это ухудшает качество кода: дополнительная экономия в 1 ГБ…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: GOBA-AI-Labs
Теги: gguf, moe, mixture-of-experts, pruned, expert-pruning, qwen3.5, deltanet, language-aware-pruning
Лайков: 10  |  Загрузок: 43

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.