Исходная модель: https://huggingface.co/deepseek-ai/DeepSeek-V2.5-1210 Это будет «политика переполнения контекста для остановки на пределе» в LM Studio, например. Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с встраиванием и выходными весами, квантованными до Q8_0 вместо того, что обычно используется по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (DeepSeek-V2.5-1210-Q8_0), либо загрузить их все на месте (./). Новое: благодаря усилиям по онлайн-перепаковке весов в этом PR, теперь вы можете просто использовать Q4_0, если ваш llama.cpp скомпилирован для вашего ARM-устройства. Точно так же, если вы хотите получить немного лучшую производительность, вы можете использовать IQ4NL благодаря этому PR, который также переупаковает веса для ARM, хотя на данный момент только 44. Время загрузки может увеличиться, но это приведет к увеличению общей скорости. Щелкните, чтобы просмотреть информацию о Q40XX. Они НЕ* предназначены для разгрузки Metal (Apple) или графического процессора (nvidia/AMD/intel), только чипов ARM (и некоторых процессоров AVX2/AVX512). Если вы используете чип ARM, кванты Q40XX будут иметь существенное ускорение.…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: bartowski
Теги: gguf
Лайков: 16 | Загрузок: 285
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.