13,67 ГБ | 204/256 экспертов | Q3KM | MMLU -1pp, GSM8K равно | Полная резидентность графического процессора на Mac с 24 ГБ памяти | ГГУФ | Apache 2.0 Урезанный вариант Qwen3.5-35B-A3B, который полностью помещается в память графического процессора на компьютере Mac с объемом памяти 24 ГБ, сохраняя при этом качество, близкое к исходному. Официальный Q4KM (21,2 ГБ) требует подкачки; эта модель работает полностью резидентно на графическом процессоре. — 13,67 ГБ: полный резидентный графический процессор на 24 ГБ Apple Silicon (без подкачки, без потоковой передачи на SSD) — на 19 % меньше, чем исходный Q3KM (16,80 ГБ), на 36 % меньше, чем Q4KM (21,2 ГБ) — MMLU 80 % (-1 pp от исходных 81 %) – знания практически без потерь — GSM8K 82 % (равен оригиналу) — математические рассуждения полностью сохранены — LiveCodeBench Easy 83,1% (142 проблемы, без загрязнений) — надежная генерация кода — гибридная архитектура DeltaNet (75% Gated DeltaNet + 25% полного внимания) — Совместимость с llama.cpp (сборка 8140+) > Примечание. LiveCodeBench Easy (142 задачи конкурентного программирования от LeetCode/AtCoder/Codeforces, 2024+) — это основной тест кода. HumanEval 50Q ненадежен при таком размере выборки — LCB и HumanEval дали противоположные выводы при сравнении моделей в ходе нашего тестирования. Мы также протестировали Weight-80% + MxMoE (смешанное квантование, 12,69 ГБ), но обнаружили, что это ухудшает качество кода: дополнительная экономия в 1 ГБ…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: GOBA-AI-Labs
Теги: gguf, moe, mixture-of-experts, pruned, expert-pruning, qwen3.5, deltanet, language-aware-pruning
Лайков: 10 | Загрузок: 43
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.