Для этой коллекции квантов ТРЕБУЕТСЯ разветвление ikllama.cpp для поддержки расширенных нелинейных квантов SotA и многоголового скрытого внимания (MLA). Не** загружайте эти большие файлы и рассчитывайте, что они будут работать на основных версиях vanilla llama.cpp, ollama, LM Studio, KoboldCpp и т. д.! ПРИМЕЧАНИЕ. ikllama.cpp` также может запускать существующие GGUF от bartowski, unsloth, mradermacher и т. д., если вы хотите опробовать его перед загрузкой моих квантов. Эти кванты обеспечивают лучшую в своем классе степень недоумения при заданном объеме памяти. Поддержка MLA обеспечивает длину контекста более 32 тыс. в видеопамяти графического процессора объемом менее 24 ГБ для R1 и V3, одновременно выгружая уровни MoE в ОЗУ. Эти кванты специально разработаны для систем ЦП+ГП с 24–48 ГБ видеопамяти, а также для установок только с ЦП, использующих динамическую переупаковку квантов (для максимальной пропускной способности памяти). Если у вас больше видеопамяти, я предлагаю другой квант, по крайней мере, с некоторыми маршрутизируемыми экспертными слоями, оптимизированными для разгрузки графического процессора. Вы можете быстро опробовать ikllama.cpp с существующими* квантами, поскольку он вычисляет тензоры MLA и переупаковывает кванты «на лету» при запуске (если у вас достаточно RAM+VRAM для размещения всей модели). Тогда приходите и проверьте эти количественные показатели жира здесь, как только вы увидите разницу. Привет Венделлу и команде Level1Techs, форумам сообщества,…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: ubergarm
Теги: gguf, mla, imatrix, deepseek_v3, conversational, ik_llama.cpp, endpoints_compatible
Лайков: 35 | Загрузок: 281
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.