Этот репозиторий содержит квантование GGUF Q80 JetBrains/Mellum2-12B-A2.5B-Instruct, готовое к работе с llama.cpp`, Ollama, LM Studio и другими GGUF-совместимыми средами выполнения. Это квантование (Q80):** 8-битное. Фактически без потерь — дивергенция KL от BF16 составляет ~0,016, и она удерживает верхний токен BF16 в 95% случаев. Mellum 2 Instruct — это модель помощника, состоящая из нескольких экспертов (64 эксперта, 8 активируемых на каждый токен, контекст из 131 072 токенов), которая отвечает напрямую, без внешней цепочки мыслей. Полное описание модели, результаты оценки и подробности архитектуры см. в исходной карточке модели: JetBrains/Mellum2-12B-A2.5B-Instruct. Расхождение KL и согласие топ-токена измеряются по логитам BF16 в Wikitext-2 (nctx=512`); более низкий KLD/более высокое согласие означает приближение к неквантованной модели. (Здесь опущено недоумение — оно ненадежно для моделей, настроенных с помощью инструкций, в Wikitext-2, который больше не распространяется.) Сервер предоставляет OpenAI-совместимый API на http://localhost:8080/v1: Полную карточку модели, результаты оценки и подробности архитектуры см. в исходной модели: JetBrains/Mellum2-12B-A2.5B-Instruct.
Модальности:
Генерация текста
Области применения:
Следование инструкциям Диалог / чат
Задача: Генерация текста
Автор: JetBrains
Теги: gguf, mellum, llama.cpp, quantized, moe, instruct, en, endpoints_compatible
Лайков: 6 | Загрузок: 2,389
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.