exllamav3 квантование MiniMaxAI/MiniMax-M2.5. Квантовано с использованием коммита 89b841d ветки dev. Обратите внимание, что тензорный параллелизм в настоящее время не поддерживается для этой архитектуры, поэтому установкам с несколькими графическими процессорами будет труднее адаптировать эту модель, чем в противном случае (вы получите больше контекста от графического процессора с 1×96 ГБ, чем от графических процессоров с 4×24 ГБ). Measure.json — 2.0bpwH6 против 3.0bpwH6 Measure.json — 3.0bpwH6 против 4.0bpwH6 Measure.json — 4.0bpwH6 против 5.0bpwH6 2.0 bpw: !2.0 Catbench 2.1 bpw: !2.1 Catbench 2.5 bpw: !2.5 Catbench 3.0 bpw: !3.0 Catbench 3.06 bpw: !3.06 Catbench 3.5 bpw: !3.5 Catbench 4.0 bpw: !4.0 Catbench 5.0 bpw: !5.0 Catbench Запрашивается в веб-интерфейсе создания текста в режиме чата с рекомендуемыми настройками MiniMax AI (temp 1, верхний p 0,95, верх к 40). Обратите внимание, что для версий 2.1, 4.0 и 5.0 требовался один повторный бросок, чтобы получить работающий сценарий. Лучше всего здесь подойдет документация по exllamav3, а также по TabbyAPI или веб-интерфейсу для генерации текста (oobabooga). Вкратце: вам необходимо иметь достаточно видеопамяти, чтобы соответствовать модели и вашему контекстному кешу. Выше я дал несколько советов, которые могут оказаться полезными. На этом этапе ваши графические процессоры должны быть nVidia. AMD/ROCm, Intel и разгрузка в систему…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: MikeRoz
Теги: exllamav3, exl3
Лайков: 9 | Загрузок: 7
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.