facebook/layerskip-codellama-34B - Каталог нейросетей
Генерация текста

facebook/layerskip-codellama-34B

Добавлено:
facebook/layerskip-codellama-34B

Модель Code Llama 34B постоянно предварительно обучается с помощью LayerSkip, как показано в разделе «Пропуск слоя: включение раннего вывода вывода и самоспекулятивного декодирования», и способна выполнять самоспекулятивное декодирование: декодировать с помощью более ранних слоев и проверять с оставшимися слоями. HuggingFace пока не имеет поддержки самоспекулятивного декодирования. Однако мы можем повторно использовать функцию спекулятивного декодирования, создав черновую модель, используя подмножество слоев основной модели: обратите внимание, что это не оптимальная реализация, поскольку она требует больше памяти для сохранения кэша KV и активации дублированных слоев. Оптимизированная реализация, которая повторно использует более ранние уровни, находится в нашей специальной реализации или в нашей быстрой реализации gpt. Если вы хотите измерить ускорение между самоспекулятивным декодированием и авторегрессионным декодированием, мы написали этот сценарий: Запустив этот сценарий на одном графическом процессоре NVIDIA A100 с трансформаторами == 4.34.1, ускорением == 1.0.1, torch == 2.2.1, triton == 2.2.0, мы получим: Наша реализация самоспекулятивного декодирования на github.com/facebookresearch/LayerSkip имеет оптимизированная версия, которая не потребляет дополнительную память и повторно использует веса и KV-кэш предыдущих уровней в обоих…

Модальности:
Генерация текста

Области применения:
Генерация кода


Задача: Генерация текста
Автор: facebook
Теги: llama, facebook, meta, llama-2, code, en, model-index, text-generation-inference
Лайков: 4  |  Загрузок: 49

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.