bartowski/MiniMaxAI_MiniMax-M2.7-GGUF - Каталог нейросетей
Генерация текста

bartowski/MiniMaxAI_MiniMax-M2.7-GGUF

Добавлено:
bartowski/MiniMaxAI_MiniMax-M2.7-GGUF

Исходная модель: https://huggingface.co/MiniMaxAI/MiniMax-M2.7 — llama.cpp — ramalama — LM Studio — koboldcpp — Jan AI — Веб-интерфейс создания текста — LoLLMs. При работе с CUDA на модели с Q4K или Q5K для 61.blk.ffndownexps вам следует скомпилировать со следующим флагом: чтобы избежать активации NaN. Скорее всего, это проблема в самом файле llama.cpp, и мы надеемся, что она будет решена, но пока это решает проблему. Вы можете проверить информацию на Huggingface, какие модели затронуты, но, похоже, это Q5KS, Q4KS, Q3KXL, Q3KL, Q3KM, IQ3M, IQ3XS и IQ3XXS. Некоторые из этих квантов (Q3KXL, Q4KL и т. д.) являются стандартным методом квантования с встраиванием и выходными весами, квантованными до Q8_0 вместо того, что обычно используется по умолчанию. Если модель больше 50 ГБ, она будет разделена на несколько файлов. Чтобы загрузить их все в локальную папку, запустите: Вы можете либо указать новый локальный каталог (MiniMaxAIMiniMax-M2.7-Q80), либо загрузить их все на месте (./). Раньше вы загружали Q4044/48/8_8, и их веса чередовались в памяти, чтобы повысить производительность на машинах ARM и AVX за счет загрузки большего количества данных за один проход. Однако сейчас есть…

Модальности:
Генерация текста

Области применения:
Диалог / чат


Задача: Генерация текста
Автор: bartowski
Теги: gguf, endpoints_compatible, imatrix, conversational
Лайков: 16  |  Загрузок: 15,555

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.