Этот репозиторий содержит квантование GGUF Q6K JetBrains/Mellum2-12B-A2.5B-Thinking, готовое к работе с llama.cpp`, Ollama, LM Studio и другими GGUF-совместимыми средами выполнения. Это квантование (Q6K):** 6-битный k-квант. Очень близко к BF16 (KLD ~0,014, согласие 95% топ-токенов) при значительной экономии размера. Мышление Меллума 2 — это модель рассуждения «Смесь экспертов» (64 эксперта, 8 активируемых на каждый токен, контекст из 131 072 токенов), которая излучает цепочку мыслей внутри … блоков перед окончательным ответом. Полное описание модели, результаты оценки и подробности архитектуры см. в исходной карточке модели: JetBrains/Mellum2-12B-A2.5B-Thinking. Расхождение KL и согласие топ-токена измеряются по логитам BF16 в Wikitext-2 (nctx=512`); более низкий KLD/более высокое согласие означает приближение к неквантованной модели. Сервер предоставляет OpenAI-совместимый API по адресу http://localhost:8080/v1. Полную карту модели, результаты оценки и сведения об архитектуре см. в исходной модели: JetBrains/Mellum2-12B-A2.5B-Thinking.
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: JetBrains
Теги: gguf, mellum, llama.cpp, quantized, moe, thinking, en, endpoints_compatible
Лайков: 8 | Загрузок: 1,271
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.