Исходная модель: https://huggingface.co/mistralai/Devstral-Small-2-24B-Instruct-2512 Спасибо ngxson и compilade за помощь в корректной работе преобразования из FP8. Вероятно, потребуется дополнительная работа, чтобы заставить сервер llama.cpp правильно работать с вызовом инструмента mistral-vibe, при быстром тестировании вызовы инструментов работают, но только когда они единичны, цепочки вызовов инструментов прерываются. Все кванты, сделанные с использованием опции imatrix с набор данных отсюда в сочетании с подмножеством complexallsmall.parquet от Эда Аддарио здесь. Запускайте их напрямую с помощью llama.cpp или любого другого проекта на основе llama.cpp. Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с встраиванием и выходными весами, квантованными до Q8_0 вместо того, что обычно используется по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (mistralaiDevstral-Small-2-24B-Instruct-2512-Q80), либо загрузить их все на месте (./). Раньше вы загружали Q4044/48/8_8, и их веса чередовались в памяти, чтобы повысить производительность на машинах ARM и AVX за счет загрузки большего количества данных в один…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: bartowski
Теги: gguf, mistral-common, conversational
Лайков: 48 | Загрузок: 10,396
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.