Для использования с внешними интерфейсами, поддерживающими квантованные модели GPT-NeoX GGML, такие как KoboldCpp и Oobabooga (с загрузчиком CTransformers). Другие версии моделей смотрите здесь: — GGMLv1 q43 (от 70M до 12B) — GGMLv1 q50/q51/q80 (от 70M до 2,8B) — GGMLv1 q40/q42 (от 70M до 2,8B) — GGMLv2 q40/q51 (от 70M до 2,8B) — GGMLv3 q40/ q51 (от 70M до 2,8B) Описание: — Мотивацией для этих квантований было то, что в серии LLaMA отсутствуют размеры ниже 7B, тогда как для старых моделей было нормой иметь всего лишь ~125M параметров. Из-за этого неудобно работать на оборудовании с объемом оперативной памяти менее 4 ГБ даже при 2-битном квантовании. Модель | Использование оперативной памяти :—:|:—: Выгружено | 41,3 МБ ggmlv3-pythia-70m-deduped-q40.bin | 95,5 МБ ggmlv3-pythia-160m-deduped-q40.bin | 201,1 МБ ggmlv3-pythia-410m-deduped-q40.bin | 415,1 МБ ggmlv3-pythia-1b-deduped-q40.bin | 762,2 МБ ggmlv3-pythia-1.4b-deduped-q40.bin | 1,0 ГиБ ggmlv3-pythia-2.8b-deduped-q40.bin | 1,9 ГиБ ggmlv3-pythia-70m-deduped-q51.bin | 108,7 МБ ggmlv3-pythia-160m-deduped-q51.bin | 226,9 МБ ggmlv3-pythia-410m-deduped-q51.bin | 494,0 МБ ggmlv3-pythia-1b-deduped-q51.bin | 943,9 МБ ggmlv3-pythia-1.4b-deduped-q51.bin | 1,3 ГиБ…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Crataco
Теги: ggml, causal-lm, pythia, en
Лайков: 16 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.