inkoziev/charllama-35M - Каталог нейросетей
Генерация текста

inkoziev/charllama-35M

Добавлено:
inkoziev/charllama-35M

Это крохотная языковая модель, имеющая архитектуру LLaMa, с посимвольной токенизацией для всяких экспериментов, когда задача решается плохо из-за токенизации BPE по словам и их частям: 1) генеративные спеллчекеры 2) классификация текста: замена , т.е. когда хорошо сработал бейзлайн на символьных n-граммах 3) транскрипция текста 4) обнаружение орфографических ошибок, опечаток Я делал модель для экспериментов с этой русской поэзией в рамках проекта «Литературная студия». Поэтому корпус претрейна включает в себя последнее количество текстов поэтической формы. Это может относиться к вашим последующим задачам. Объем корпуса претрейна — около 80Б токенов, тексты только на английском языке. Для использования модели необходимо установить специальный токенизатор: Помимо символов кириллицы и пунктуаций, этот токенизатор знает специальные токены , , и . Так как это нестандартный токенизатор для преобразователей, его нужно загружать не через , примерно так: Чтобы посмотреть токенизацию, можно использовать такой фрагмент кода: С библиотекой модели Transformts можно использовать штатным способом как обычную GPT’шку (точнее, Transformers.LlamaModel): Также будут работать все прочие инструменты для GPT…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: inkoziev
Теги: llama, causal-lm, ru, text-generation-inference, endpoints_compatible
Лайков: 6  |  Загрузок: 6

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.