Вариант Laguna-S-2.1-oQ3e с настроенной скоростью, калиброванное 3-битное квантование MLX у бассейна/Laguna-S-2.1 (всего 118B, 8B активируется на каждый токен). Тот же улучшенный уровень oQ 3, те же 3-битные эксперты — единственное, что я изменил, это бюджет: вместо того, чтобы позволить oQ свободно тратиться на плотный позвоночник, я ограничил его целевым значением targetbpw = 3,50, и oQ уделил большую часть внимания 3-битной базе как таковой. Эффективная 3,56 бит/вес**, 49 ГБ на диске. Для Apple Silicon. — 49 ГБ на диске — по сути, то же самое, что и oQ3e, от которого он произошел; быстрый трюк использует полосу пропускания, а не размер, и экономия дискового пространства уменьшается по мере увеличения базовой разрядности — 48 слоев, 47 из них MoE с 256 маршрутизируемыми экспертами + 1 общий, топ-10 (L0 — плотный MLP); чередующееся внимание (12 глобальных с контекстом YaRN в 1M, 36 скользящих окон 512) — Пиковая память в моих тестах: 46,3 ГБ в контексте 1 КБ, 49,3 ГБ в контексте 64 КБ — подходит для Mac с 64 ГБ — 77,2 ток/с в контексте 1 КБ против 67,5 для oQ3e, с той же точностью в пределах шума — Преобразовано и протестировано на Macbook Pro M5 Max 128 ГБ, 40 графических процессоров. Только битовый бюджет. oQ получает разрядность каждого тензора на основе прохода чувствительности, откалиброванного с помощью imatrix; на улучшенном уровне 3 он попадает на 3-битных экспертов и распределяет внимание по…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: mlx-community
Теги: mlx, laguna, oq, quantized, moe, conversational, custom_code, 3-bit
Лайков: 5 | Загрузок: 975
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.