Для этой коллекции квантов ТРЕБУЕТСЯ ответвление ikllama.cpp для поддержки расширенных нелинейных квантов SotA. Не** загружайте эти большие файлы и рассчитывайте, что они будут работать на основных версиях vanilla llama.cpp, ollama, LM Studio, KoboldCpp и т. д.! ПРИМЕЧАНИЕ. ikllama.cpp` также может запускать существующие GGUF от bartowski, unsloth, mradermacher и т. д., если вы хотите опробовать его перед загрузкой моих квантов. Эти кванты обеспечивают лучшую в своем классе степень недоумения при заданном объеме памяти. Привет Венделлу и команде Level1Techs, форумам сообщества и каналу YouTube! ОГРОМНОЕ спасибо за предоставленную БОЛЬШУЮ экспертизу в области аппаратного обеспечения и доступ для проведения этих экспериментов и за то, что сделали эти замечательные квантовые данные доступными для сообщества!!! Также спасибо всем участникам сообщества по количественному анализу и выводам здесь и на r/LocalLLaMA за советы и подсказки, помогающие друг другу запускать все интересные новые модели! На данный момент это мои лучшие рецепты, предлагающие наименьшую сложность на модели ГиБ. Лучшее качество Контекст 32 КБ в 23704 МБ видеопамяти Контекст 16 КБ в 19 488 МБ видеопамяти Контекст 8 КБ в 17 380 МБ видеопамяти Только 13 126 МБ видеопамяти с -rtr -ot attn=CPU -nkvo Можно использовать кэш q40 кВ для меньшего использования видеопамяти! Самый маленький, с хорошим качеством. Контекст 32 КБ в 22306 МБ видеопамяти. Контекст 16 КБ в 18 090 МБ видеопамяти…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ubergarm
Теги: gguf, imatrix, gemma-3, conversational, ik_llama.cpp
Лайков: 12 | Загрузок: 55
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.