Тонкая настройка контекста 32 тыс. TinyLlama-1.1B с использованием увеличенной теты веревки (частотной базы веревки), предназначенной для использования в качестве модели спекулятивного декодирования с длинным контекстом. Создано с использованием TinyLlama-1.1B и дальнейшей предварительной подготовки при длине контекста 32768 на Togethercomputer/RedPajama-Data-1T-Sample. Следует отметить, что использованная базовая контрольная точка была взята из «окончательной модели» коммита fad4f1a5cd0563ac41349b8fec2e6e51156568a0, которая впоследствии была отменена, а не из текущей контрольной точки 3T основной ветки TinyLlama-1.1B. Квантованная модель совместима с моделью 70B с битрейтом 4,25 бита в секунду и длиной последовательности 32 тыс. на одном A6000 и обеспечивает заметное ускорение при спекулятивном декодировании.
Модальности:
Генерация текста
Задача: Генерация текста
Автор: Doctor-Shotgun
Теги: llama, llama 2, en, text-generation-inference, endpoints_compatible
Лайков: 30 | Загрузок: 535
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.