Это квантованная GGUF версия Qwen3-30B-A3B-Instruct-2507, созданная с помощью ShapeLearn от ByteShape, которая изучает оптимальный тип данных для каждого тензора для поддержания высокого качества даже при очень малых битовых длинах. Чтобы узнать больше о ShapeLearn и просмотреть подробные тесты графических процессоров, процессоров и даже Raspberry Pi, посетите наш блог. Если у вас есть вопросы или вы хотите поделиться отзывом, свяжитесь с нами на Reddit. — ЦП: модели, обозначенные как KQ, оптимизированные для вывода ЦП с преобладанием квантования KQ. — Графические процессоры: модели, обозначенные как IQ, оптимизированные для вывода графических процессоров с использованием гибридного подхода, сочетающего квантование KQ и IQ для повышения пропускной способности. Каждая цель аппаратного обеспечения включает в себя ряд моделей, сочетающих разные размеры и качество. На диаграммах ниже показано соотношение качества и количества токенов в секунду для каждого устройства, сравнивая модели ShapeLearn с базовыми показателями Unsloth или MagicQuant. Правило выбора: выберите модель с наивысшим качеством при целевой пропускной способности или самую быструю модель, которая по-прежнему соответствует требуемому качеству. Таблица отсортирована по размеру модели (сопоставьте номера диаграмм с идентификаторами моделей): Таблица отсортирована по размеру модели (сопоставьте номера диаграмм с идентификаторами моделей): Ярлыки, которые вы видите (например, IQ4XS`), предназначены только для…
Модальности:
Генерация текста
Области применения:
Диалог / чат Следование инструкциям
Задача: Генерация текста
Автор: byteshape
Теги: gguf, qwen, qwen3, byteshape, endpoints_compatible, conversational
Лайков: 77 | Загрузок: 5,428
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.