Dripper (MinerU-HTML) — это усовершенствованный инструмент для извлечения основного содержимого HTML, основанный на моделях большого языка (LLM). Он предоставляет полный конвейер для извлечения первичного контента из HTML-страниц с использованием классификации на основе LLM и генерации на основе конечного автомата. — 🚀 Извлечение на основе LLM: использует современные языковые модели для интеллектуальной идентификации основного контента — 🎯 Управление конечным автоматом: реализует обработку логитов с помощью конечных автоматов для структурированного вывода JSON — 🔄 Резервный механизм: при ошибках автоматически возвращается к альтернативным методам извлечения — 📊 Комплексная оценка: встроенная система оценки с ROUGE и метриками на уровне элементов — 🌐 Сервер REST API: сервер на базе FastAPI для простой интеграции — ⚡ Распределенная обработка: параллельная обработка на основе лучей для крупномасштабной оценки — 🔧 Несколько экстракторов: поддержка различных экстракторов базовых показателей для сравнения — Python >= 3.10 — Графический процессор с поддержкой CUDA (рекомендуется для вывода LLM) — Достаточный объем памяти для загрузки модели В процессе установки автоматически обрабатываются зависимости. Файл setup.py считывает зависимости из файла require.txt и, при необходимости, из baselines.txt. Для базового использования Dripper установите только основные зависимости:…
Модальности:
Генерация текста
Области применения:
Диалог / чат
Задача: Генерация текста
Автор: opendatalab
Теги: qwen3, commoncrawl, html-extraction, content-extraction, information-extraction, qwen, conversational, en
Лайков: 46 | Загрузок: 550
Описание основано на материалах HuggingFace. Перевод выполнен автоматически.