JetBrains/Mellum2-12B-A2.5B-Instruct-GGUF-Q4_K_M - Каталог нейросетей
Генерация текста

JetBrains/Mellum2-12B-A2.5B-Instruct-GGUF-Q4_K_M

Добавлено:
JetBrains/Mellum2-12B-A2.5B-Instruct-GGUF-Q4_K_M

Этот репозиторий содержит квантование GGUF Q4KM JetBrains/Mellum2-12B-A2.5B-Instruct, готовое к работе с llama.cpp, Ollama, LM Studio и другими GGUF-совместимыми средами выполнения. Это квантование (Q4KM): 4-битный k-квант (средний). Сильный компромисс между качеством и размером (KLD ~0,106, 87% согласия топ-токенов) — хороший вариант по умолчанию. Mellum 2 Instruct — это модель помощника, состоящая из нескольких экспертов (64 эксперта, 8 активируемых на каждый токен, контекст из 131 072 токенов), которая отвечает напрямую, без внешней цепочки мыслей. Полное описание модели, результаты оценки и подробности архитектуры см. в исходной карточке модели: JetBrains/Mellum2-12B-A2.5B-Instruct. Расхождение KL и согласие топ-токена измеряются по логитам BF16 в Wikitext-2 (nctx=512`); более низкий KLD/более высокое согласие означает приближение к неквантованной модели. (Здесь опущено недоумение — оно ненадежно для моделей, настроенных с помощью инструкций, в Wikitext-2, который больше не распространяется.) Сервер предоставляет OpenAI-совместимый API на http://localhost:8080/v1: Полную карточку модели, результаты оценки и подробности архитектуры см. в исходной модели: JetBrains/Mellum2-12B-A2.5B-Instruct.

Модальности:
Генерация текста

Области применения:
Следование инструкциям Диалог / чат


Задача: Генерация текста
Автор: JetBrains
Теги: gguf, mellum, llama.cpp, quantized, moe, instruct, en, endpoints_compatible
Лайков: 8  |  Загрузок: 2,060

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.