sapidlabs/Hy3-REAP-48e - Каталог нейросетей
Генерация текста

sapidlabs/Hy3-REAP-48e

Добавлено:
sapidlabs/Hy3-REAP-48e

Экспертно-обрезанная версия tencent/Hy3, созданная с помощью REAP (экспертная обрезка активации с учетом маршрутизатора). 192 маршрутизируемых эксперта каждого уровня MoE сокращены до 48 наиболее важных, что сокращает размер контрольной точки с 557 ГБ до 157 ГБ (BF16). > ⚠️Экспериментальный исследовательский артефакт. Это агрессивный чернослив (75% экспертов удалено), откалиброванный на небольшом наборе, предназначенном только для кода. Он генерирует беглый текст и действительно хорош в кодировании, но общая/фактическая точность снижается (см. ниже). Не предназначен для производства. Планируется более калиброванная версия — этот репозиторий будет обновляться на месте. Весь конвейер работал на одном NVIDIA DGX Spark (128 ГБ) — модели, которая намного больше оперативной памяти — с использованием послойной потоковой передачи диска: — Метод: REAP, однократный (без переобучения). Каждый эксперт оценивается как среднее значение веса маршрутизатора × норма активации по калибровочному набору; наименее заметные отбрасываются. — Сжатие: степень сжатия 0,75 → 192 → 48 экспертов на каждом уровне MoE. — Калибровка: 64 образца из theblackcat102/evol-codealpaca-v1 (код). — Потоковая передача: модель объемом 557 ГБ была построена на мета`, и каждый из 80 слоев транслировался из фрагментов безопасных тензоров на диске (постоянно ~7 ГБ одновременно), как для калибровки, так и…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: sapidlabs
Теги: hy_v3, hunyuan, mixture-of-experts, moe, pruning, reap, expert-pruning, conversational
Лайков: 5  |  Загрузок: 223

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.