Ускорьте вывод, одновременно уменьшив объем памяти в 2–4 раза, используя вывод int8 в C++ на ЦП или графическом процессоре. Контрольная точка совместима с ctranslate2>=3.17.1 и hf-hub-ctranslate2>=2.12.0 — Computetype=int8float16 для устройства=»cuda» — Computetype=int8 для устройства=»cpu»` Это просто квантованная версия. Условия лицензии должны быть идентичны исходному репозиторию Huggingface. Llama 2 — это набор предварительно обученных и точно настроенных генеративных текстовых моделей масштаба от 7 до 70 миллиардов параметров. Это репозиторий для точно настроенной модели 7B, оптимизированной для сценариев использования диалогов и преобразованной для формата Hugging Face Transformers. Ссылки на другие модели можно найти в указателе внизу. Meta разработала и публично выпустила семейство больших языковых моделей (LLM) Llama 2 — коллекцию предварительно обученных и точно настроенных генеративных текстовых моделей с масштабом от 7 до 70 миллиардов параметров. Наши доработанные LLM, называемые Llama-2-Chat, оптимизированы для сценариев использования диалога. Модели Llama-2-Chat превосходят модели чата с открытым исходным кодом по большинству протестированных нами тестов, а по нашим человеческим оценкам полезности и безопасности находятся на одном уровне с некоторыми популярными моделями чата с закрытым исходным кодом, такими как ChatGPT и…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: michaelfeil
Теги: llama, ctranslate2, int8, float16, facebook, meta, llama-2, en
Лайков: 4 | Загрузок: 9
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.