poolside/Laguna-XS.2-NVFP4 - Каталог нейросетей
Генерация текста

poolside/Laguna-XS.2-NVFP4

Добавлено:
poolside/Laguna-XS.2-NVFP4

Попробуйте Laguna XS.2 в Shimmer · Получите ключ API · Выпустите сообщение в блоге Laguna XS.2-NVFP4 — это модель Mixture-of-Experts с общим объемом 33 миллиарда параметров и 3 миллиардами активированных параметров на токен, предназначенная для агентского кодирования и долгосрочной работы на локальном компьютере. Он использует скользящее окно внимания с разделением 30 из 40 слоев для каждой головы для быстрого вывода и низких требований к кэш-памяти KV. > [!NOTE] > Это вариант NVFP4 с квантованным KV-кешем FP8. Варианты BF16, FP8 и INT4 также доступны на Hugging Face. — Смешанное SWA и расположение глобального внимания: Laguna XS.2 использует сигмовидное стробирование с послойной вращающейся шкалой, что позволяет использовать смешанное SWA (скользящее окно внимания) и глобальное внимание в соотношении 3:1 (всего 40 слоев) — Кэш KV в FP8: кэш KV квантуется до FP8, уменьшая объем памяти на каждый токен — Встроенная поддержка рассуждений: чередующееся мышление между вызовами инструментов с поддержкой включения и отключения мышления по запросу — Готовность к локальному использованию: при общем количестве параметров 33B и активированных 3B Laguna XS.2 достаточно компактна для работы на Mac с 36 ГБ оперативной памяти. Доступно на Ollama — лицензия Apache 2.0: свободно используйте и изменяйте в коммерческих и некоммерческих целях…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: poolside
Теги: vllm, laguna, laguna-xs.2, conversational, custom_code, 8-bit, compressed-tensors
Лайков: 15  |  Загрузок: 2,203

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.