05.05.2024: После объединения коммита 889bdd7 у нас теперь есть предварительная токенизация BPE для этой модели, поэтому я буду обновлять все количественные данные. 09.04.2024: Поддержка этой модели добавлена в основную ветку. Запрос на включение PR #6491 Коммит 5dc9dd71 Форк Noeda не будет работать с этими весами, вам понадобится основная ветка llama.cpp. Кванты матрицы важности (imatrix) GGUF для https://huggingface.co/CohereForAI/c4ai-command-r-plus Матрица важности обучается для ~ 100 тыс. токенов (200 пакетов по 512 токенов) с использованием wiki.train.raw. Какой GGUF мне подойдет? (из Artefact2) — ось X — это размер файла, а ось Y — недоумение (меньше недоумения — лучшее качество). Некоторые из оптимальных точек (размер по сравнению с PPL) — это IQ4XS, IQ3M/IQ3S, IQ3XS/IQ3XXS, IQ2M и IQ2XS. Иматрица также используется для K-квантов (только для < Q6K). В этом нет необходимости, но вы можете объединить GGUF с помощью gguf-split —merge — это не требуется, начиная с f482bb2e. Чтобы загрузить разделенную модель, просто передайте первый фрагмент, используя аргумент —model или -m. Что такое матрица важности (иматрица)? Подробнее об этом можно прочитать у автора здесь. Другая информация здесь. Как использовать иматричные кванты? Как и любой другой GGUF, файл .dat…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: dranger003
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 141 | Загрузок: 1,463
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.