Hy3, самоквантованный до GGUF с помощью Atomic Chat. Создано прямо на основе исходных весов Tencent с матрицей важности для каждого тензора, поэтому это не перепаковка чьих-то файлов. Работает полностью в автономном режиме. — Параметры 298.8B: веса, которые квантует это репо. — Длина контекста: 262 144 токена (256 КБ), согласно публикации Tencent. — 80 слоев: смесь экспертов. — Полная иматричная лестница: каждый квант калибруется с помощью матрицы важности, опубликованной здесь вместе с квантами. > [!NOTE] > Эти GGUF самоквантуются из исходных весов, а не из перепаковки. Матрица важности приближает низкобитовые кванты к модели полной точности. > [!ВАЖНО] > Всегда используйте —jinja, чтобы применить шаблон чата Hy3. Без этого модель может выдавать неверные повороты. Оценки представляют собой опубликованные результаты Tencent для базового коэффициента tencent/Hy3, а не наши собственные измерения. Квантование сохраняет большую часть этого; Q4KM и выше сохраняют близкую к полной точности точность. > [!TIP] > Выберите самый большой файл, который соответствует вашей (V)RAM и оставляет место для контекста. Q4KM — оптимальное решение для большинства настроек; Q6K или Q80 для максимальной точности. — Атомный чат: самый простой путь. Откройте приложение, найдите AtomicChat/Hy3-GGUF, выберите количественный показатель и нажмите «Использовать эту модель». -…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: AtomicChat
Теги: gguf, atomic-chat, hy3, tencent, llama.cpp, imatrix, quantized, endpoints_compatible
Лайков: 5 | Загрузок: 1,284
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.