Большое спасибо ymcki за обновление кода llama.cpp для поддержки «фиктивных» слоев. Используйте ветку llama.cpp из этого PR: https://github.com/ggml-org/llama.cpp/pull/12843, если она еще не была объединена. Обратите внимание, что иматричные данные, использованные для количественных показателей IQ, были получены на основе количественного анализа Q4! Квантованная версия: nvidia/Llama-31-Nemotron-Ultra-253B-v1
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: DevQuasar
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 7 | Загрузок: 187
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.