DavidAU/Qwen3-30B-A1.5B-64K-High-Speed-NEO-Imatrix-MAX-gguf - Каталог нейросетей
Генерация текста

DavidAU/Qwen3-30B-A1.5B-64K-High-Speed-NEO-Imatrix-MAX-gguf

Добавлено:
DavidAU/Qwen3-30B-A1.5B-64K-High-Speed-NEO-Imatrix-MAX-gguf

Специальное примечание: все кванты этой модели могут использоваться на графическом процессоре и/или процессоре/ОЗУ только благодаря уникальной конструкции модели. Существует также несколько версий квантовых размеров со специальными функциями. Qwen3-30B-A1.5B-64K-High-Speed-NEO-Imatrix-MAX-gguf — также известный как «Ударь это!» Это простая «тонкая настройка» модели Qwen «Qwen 30B-A3B» (MOE), устанавливающая число используемых экспертов от 8 до 4 (из 128 экспертов). Этот метод почти вдвое увеличивает скорость модели и использует 1,5B (из 30B) параметров вместо 3B (из 30B). В зависимости от приложения вы можете использовать обычную модель («30B-A3B») и использовать эту модель для более простых вариантов использования, хотя я не заметил какой-либо потери функциональности во время обычного (но не обширного) тестирования. GGUF NEO Imatrix имеет расширенный контекст до контекста 64 КБ (65535) (по сравнению с 32 КБ/32768), как указано в технических примечаниях Qwen, с использованием «YARN». Набор данных NEO Imatrix был разработан собственными силами после тестирования и оценки более 50 наборов данных Imatrix и большого количества «доработок». Кванты (и конкретные процессы Imatrix) были специально разработаны для модели Qwen3 30B-A1.5B и использовали последние изменения в LLamacpp (15 апреля 2025 г. / B5127 и далее) для настройки самой структуры квантов. При этом…

Модальности:
Генерация текста

Области применения:
Логика и рассуждение Диалог / чат


Задача: Генерация текста
Автор: DavidAU
Теги: gguf, 64k context, high speed, all use cases, creative, creative writing, all genres, tool calls
Лайков: 26  |  Загрузок: 908

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.