Этот репозиторий содержит квантование GGUF Q6K JetBrains/Mellum2-12B-A2.5B-Instruct, готовое к работе с llama.cpp`, Ollama, LM Studio и другими GGUF-совместимыми средами выполнения. Это квантование (Q6K):** 6-битный k-квант. Очень близко к BF16 (KLD ~0,038, согласие 93% топ-токенов) при значительной экономии размера. Mellum 2 Instruct — это модель помощника, состоящая из нескольких экспертов (64 эксперта, 8 активируемых на каждый токен, контекст из 131 072 токенов), которая отвечает напрямую, без внешней цепочки мыслей. Полное описание модели, результаты оценки и подробности архитектуры см. в исходной карточке модели: JetBrains/Mellum2-12B-A2.5B-Instruct. Расхождение KL и согласие топ-токена измеряются по логитам BF16 в Wikitext-2 (nctx=512`); более низкий KLD/более высокое согласие означает приближение к неквантованной модели. (Здесь опущено недоумение — оно ненадежно для моделей, настроенных с помощью инструкций, в Wikitext-2, который больше не распространяется.) Сервер предоставляет OpenAI-совместимый API на http://localhost:8080/v1: Полную карточку модели, результаты оценки и подробности архитектуры см. в исходной модели: JetBrains/Mellum2-12B-A2.5B-Instruct.
Модальности:
Генерация текста
Области применения:
Следование инструкциям Диалог / чат
Задача: Генерация текста
Автор: JetBrains
Теги: gguf, mellum, llama.cpp, quantized, moe, instruct, en, endpoints_compatible
Лайков: 7 | Загрузок: 900
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.