> [!NOTE] > Почему именно этот репозиторий? > Для работы оригинальной Prism-ml/Ternary-Bonsai-8B-gguf требуется специальная вилка. Этот репозиторий содержит модифицированные файлы GGUF, которые работают непосредственно с вышестоящим llama.cpp`** из коробки с использованием собственных троичных весов. — Ternary-Bonsai-8B-TQ20 (2,12 ГБ) — ⭐ РЕКОМЕНДУЕТСЯ Обеспечивает отличные результаты с почти незаметной разницей в качестве по сравнению с другими. Наилучший баланс размера и производительности.* — Ternary-Bonsai-8B-TQ20-Q6out (2.47 GB) Немного быстрее, чем стандартный TQ20 (использует тензоры вывода Q6, ускорение, потому что ядра llama ternary ужасны), но разница едва заметна (~12%, 16 tps против 18 tps на CPU). — Ternary-Bonsai-8B-Q40-lossless (4.61 GB) Практически бессмысленно для ежедневного использования. Это просто тройной формат, упакованный в стандартный 4-бит, занимающий 4 ГБ места без каких-либо реальных преимуществ.*
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: Minarut
Теги: gguf, endpoints_compatible, conversational
Лайков: 4 | Загрузок: 442
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.