Инструмент распознавания текста: превращает PDF и изображения документов в структурированные данные для ИИ, поддерживает 100+ языков.
PaddleOCR извлекает текст, таблицы и формулы из фотографий и PDF и выдаёт результат в формате Markdown или JSON, готовом для передачи в языковые модели. Используется как основа для систем поиска по документам (RAG) в проектах вроде Dify и RAGFlow, показывает высокую точность на бенчмарках при небольшом размере моделей. Подходит для автоматизации обработки счетов, отчётов, печатей и рукописных документов.
Описание автора:Turn any PDF or image document into structured data for your AI. A powerful, lightweight OCR toolkit that bridges the gap between images/PDFs and LLMs. Supports 100+ languages.
Python★ 89 590создан 8 мая 2020форков 11 338Apache-2.0