Имена методов квантования соответствуют соглашению об именах: «q» + количество бит + используемый вариант (подробно описано ниже). Вот список всех моделей и соответствующих вариантов их использования, основанный на карточках моделей, созданных TheBloke: q2k: использует Q4K для тензоров alert.vw и Feedforward.w2, Q2K для остальных тензоров. q3kl: использует Q5K для тензоров «altention.wv», «attention.wo» и «feedforward.w2», иначе Q3K q3km: использует Q4K для тензоров «attention.wv», «attention.wo» и «feedforward.w2», иначе Q3K q3ks: использует Q3K для всех тензоров q40: оригинальный метод квантования, 4-битный. q41: более высокая точность, чем q40, но не такая высокая, как q50. Однако вывод происходит быстрее, чем у моделей q5. q4km: использует Q6K для половины тензоров «внимание.wv» и «feedforward.w2», в противном случае Q4K q4ks: использует Q4K для всех тензоров q50: более высокая точность, более высокое использование ресурсов и более медленный вывод. q51: Еще более высокая точность, использование ресурсов и более медленный вывод. q5km: использует Q6K для половины тензоров «внимание.wv» и «feedforward.w2», иначе Q5K q5ks: использует Q5K для всех тензоров q6k: использует Q8K для всех тензоров q80: почти неотличим от float16. Высокое потребление ресурсов и медленная работа. Не рекомендуется для большинства пользователей. TheBloke рекомендует использовать…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: tolgadev
Теги: gguf, llama, trendyol, llama-2, turkish, tr, en
Лайков: 4 | Загрузок: 432
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.