Это репо было в основном создано, чтобы дать всем поправку на более быструю генерацию токенов с использованием моделей сокола. Этот же набор поправок применим и к другим семействам моделей соколов. Это оригинальный репозиторий https://huggingface.co/tiiuae/falcon-40b-instruct. Я поднял запрос на внесение изменений https://huggingface.co/tiiuae/falcon-40b-instruct/discussions/64 и удалю его, как только необходимые изменения будут внесены в этот оригинальный репозиторий. Корректировка была выполнена в основном в файле modelling_RW.py. Это подробная сводка исправлений Текущий код пропустил передачу значений pastkey при каждом проходе вперед для быстрой генерации токенов. Это приводит к большому количеству повторных вычислений. Этот «modellingRW.py», который я загружаю, решает эту проблему так, как того хочет pytorch huggingface transformers package generation/utils.py. Все изменения в основном вокруг, включая pastkey_values везде. Я думаю, что это применимо ко всем моделям соколов. Это именно те изменения, которые произошли. Те же изменения применяются практически ко всем моделям семейства соколов с медленной генерацией. 1) Метод прямого встраивания класса RotaryEmbedding Включите pastseqlength в прямой проход и примените ротационное встраивание в соответствии с…
Модальности:
Генерация текста
Области применения:
Следование инструкциям
Задача: Генерация текста
Автор: puru22
Теги: RefinedWeb, custom_code, text-generation-inference, endpoints_compatible
Лайков: 3 | Загрузок: 0
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.