Я протестировал некоторые из этих моделей меньшего размера на NVIDIA с компиляцией CUDA по умолчанию и отличным выпуском от @cturan на графическом процессоре NVIDIA L40S. Поскольку графический процессор L40S имеет 48 ГБ видеопамяти, я смог запустить Q2K, Q3KM, Q4KS, Q40 и Q4MXFP4MOE, но Q4KM был слишком большим. Хоть и работает при использовании -ngl 45, но немного тормозит. Удалось получить хорошую скорость 53 токена в секунду при генерации и 800 токенов в секунду при оперативном чтении. Возможно, вам придется добавить /usr/local/cuda/bin в свой PATH, чтобы найти nvcc (компилятор Nvidia CUDA). Более подробную информацию о сборке CUDA см.: https://github.com/ggml-org/llama.cpp/blob/master/docs/build.md#cuda Эти квантованные модели были созданы с использованием отличного запроса на извлечение от @pwilkin # 16095 от 19 октября 2025 г. с закоммит 2fdbf16eb. по умолчанию будет загружен lefromage/Qwen3-Next-80B-A3B-Thinking-GGUF:Q4KM
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: lefromage
Теги: gguf, GGUF, endpoints_compatible, conversational
Лайков: 9 | Загрузок: 171
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.