В этом репозитории содержится модель из репозитория Sustainableai/StableBeluga2 со следующими изменениями: 1. Хранение весов в bfloat16 вместо float32. Это приводит к уменьшению размера файлов в 2 раза и небольшой потере качества, которая незначительна по сравнению с потерями, вызванными квантованием NF4, используемым в Petals по умолчанию. 1. Хранение весов в небольших шардах. Каждый блок-трансформер хранится в своем шарде (по 1,71 ГБ каждый). Входные и выходные эмбеддинги и смежные Layernorms также находятся в отдельном шарде (1,05 ГБ). Таким образом, клиентам и серверам Petals не придется загружать какие-либо лишние данные, кроме тех слоев, которые они фактически используют. 1. Использование Safetensors вместо Pickle. Это позволяет ускорить загрузку при меньших требованиях к оперативной памяти. Ниже мы предоставляем оригинальный README. Пожалуйста, обратитесь туда для получения подробной информации о модели и информации о лицензировании. Stable Beluga 2 — это модель Llama2 70B, настроенная на наборе данных в стиле Orca. Начните общение со Stable Beluga 2, используя следующий фрагмент кода: Разработано: Stability AI Тип модели: Stable Beluga 2 — это авторегрессионная языковая модель, настроенная на Llama2 70B. Язык(и): английский Библиотека: HuggingFace Transformers Лицензия: Точные настройки контрольных точек (Stable Beluga 2)…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: petals-team
Теги: llama, en, text-generation-inference, endpoints_compatible
Лайков: 20 | Загрузок: 13,854
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.