Библиотека на Rust от Firecrawl, которая быстро определяет тип PDF-файла и превращает текстовые PDF в чистый Markdown без распознавания изображений.
За доли секунды инструмент определяет, содержит ли PDF готовый текст, отсканированные страницы или их смесь, и решает, нужно ли включать дорогое распознавание текста (OCR). Извлекает текст с учётом расположения на странице, распознаёт заголовки, списки, таблицы и код, конвертируя документ в Markdown. Есть версии для Python, Node.js и браузера.
Описание автора:Fast Rust library for PDF inspection, classification, and text extraction. Intelligently detects scanned vs text-based PDFs to enable smart routing decisions.