Я скопировал некоторую информацию из карточек моделей TheBloke, надеюсь, что все в порядке. Для модели такого размера с более сильным квантованием качество падает гораздо больше, чем для более крупных моделей. Лично я бы посоветовал для этой модели придерживаться fp16 или int8. Измените -ngl 32 на количество слоев, которые нужно выгрузить в графический процессор. Удалите его, если у вас нет ускорения графического процессора. Измените -c 2048 на нужную длину последовательности. Для моделей с расширенной последовательностью — например, 8K, 16K, 32K — необходимые параметры масштабирования RoPE считываются из файла GGUF и автоматически устанавливаются llama.cpp. Если вы хотите вести беседу в стиле чата, замените аргумент -p на -i -ins.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: eryk-mazus
Теги: gguf, llama, pl, conversational
Лайков: 5 | Загрузок: 115
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.