PleIAs/OCRonos-Vintage - Каталог нейросетей
Генерация текста

PleIAs/OCRonos-Vintage

Добавлено:
PleIAs/OCRonos-Vintage

OCRonos-Vintage — это небольшая специализированная модель для оптической коррекции архивов культурного наследия, предварительно обученная с помощью llm.c. OCRonos-Vintage — это всего 124 миллиона параметров. Он может легко работать на ЦП или обеспечивать коррекцию в масштабе на графических процессорах (> 10 тыс. токенов в секунду), обеспечивая при этом качество коррекции, сравнимое с GPT-4 или версией llama OCRonos для англоязычных культурных архивов. OCRonos-Vintage прошел предварительное обучение с нуля на наборе данных архивов культурного наследия Библиотеки Конгресса, Интернет-архива и Hathi Trust общим объемом 18 миллиардов токенов. Предварительная тренировка проходила в 2 эпохи с llm.c (всего 9060 шагов) на 4 H100 в течение двух с половиной часов. OCRonos-Vintage — первая модель, обученная на новом кластере Jean Zay H100 (грант на вычисления № GC011015451). Для обучения мы использовали следующую команду, в основном гиперпараметры по умолчанию, включая короткое контекстное окно из 1024 токенов. Токенизация в настоящее время выполняется с помощью токенизатора GPT-2. В конечном итоге он будет заменен специальным токенизатором, который обеспечит лучшую производительность и сжатие архивов культурного наследия и шумных источников OCR. OCRonos-Vintage — это историческая языковая модель с жесткой датой отсечения декабря…

Модальности:
Генерация текста


Задача: Генерация текста
Автор: PleIAs
Теги: gpt2, OCR, text-correction, ocr-correction, archives, GPT2, history, SLM
Лайков: 84  |  Загрузок: 382

Открыть на HuggingFace →

Описание основано на материалах HuggingFace. Перевод выполнен автоматически.