Модель Llama3.2 1B постоянно предварительно обучается с помощью рецепта LayerSkip, ранней потери выхода и исключения слоев, как показано в разделе «Пропуск слоя: включение раннего выхода и самоспекулятивного декодирования», и способна выполнять самоспекулятивное декодирование: декодировать с помощью более ранних слоев и проверять с оставшимися слоями. HuggingFace пока не имеет поддержки самоспекулятивного декодирования. Однако мы можем повторно использовать функцию спекулятивного декодирования, создав черновую модель, используя подмножество слоев основной модели: обратите внимание, что это не оптимальная реализация, поскольку она требует больше памяти для сохранения кэша KV и активации дублированных слоев. Оптимизированная реализация, которая повторно использует более ранние уровни, находится в нашей специальной реализации или в нашей быстрой реализации gpt. Если вы хотите измерить ускорение между самоспекулятивным декодированием и авторегрессионным декодированием, мы написали этот сценарий: Запуск этого сценария на одном графическом процессоре NVIDIA A100 с ночным git+ssh://git@github.com/huggingface/transformers.git@d6ba1ac041ac0b07bc589dd82a67cfb76f75d0f9#egg=transformers, ускорение==0.26.1, факел==2.2.0, тритон==2.2.0, мы получаем: Наша реализация самоспекулятивного декодирования на…
Модальности:
Генерация текста
Задача: Генерация текста
Автор: facebook
Теги: llama, facebook, meta, llama-3, en, model-index, text-generation-inference, endpoints_compatible
Лайков: 25 | Загрузок: 3,063
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.