Квантование LiquidAI/LFM2.5-8B-A1B NVFP4 (W4A4) — 8,3-битный / 1,5-активный процессор смешанных экспертов (контекст 131 КБ) работает на одном графическом процессоре Blackwell емкостью 16 ГБ и по-прежнему оставляет место для кэша KV с токенами ~650 K. Квантовано Lna-Lab с помощью оптимизатора модели NVIDIA TensorRT (modelopt). Насколько нам известно, это первая сборка NVFP4 архитектуры lfm2moe. > Почему это хорошо: всего 8,3Б / 1,5Б активного MoE + гибридная магистраль (только 6 из 24 слоев > являются вниманием; остальные — короткая свертка) означает, что KV-кэш крошечный. Уменьшите веса до 4 бит, и освобожденная видеопамять сразу перейдет в параллелизм — эта карта успешно обслуживает стек параллельных сеансов. — +22 % в однопоточном режиме и +67 % при четырехстороннем параллельном режиме по сравнению с FP8 на той же карте. — NVFP4 освобождает ~3,5 ГБ → +74 % емкости KV (378 000 → 658 000 токенов). Добавьте —kv-cache-dtype fp8, чтобы еще раз примерно удвоить значение. — Число «4 одновременных» — это просто —max-num-seqs 4; поднимите его — на этой карте достаточно запаса KV для еще многих параллельных сеансов. Жадная проверка правильности (temp 0): «столица Франции» → «Столица Франции – Париж.»; «2+2» → «4»; «назовите три основных цвета» → правильно отличает RYB от RGB. Рассуждение,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: sakamakismile
Теги: vllm, lfm2_moe, nvfp4, fp4, modelopt, moe, quantized, blackwell
Лайков: 6 | Загрузок: 905
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.