Инструмент на Rust, который сортирует страницы PDF перед распознаванием текста, чтобы не платить за OCR там, где текст уже есть.
Doc-router постранично анализирует PDF-документ и определяет, какие страницы уже содержат читаемый текст, а какие являются сканами и нуждаются в оптическом распознавании (OCR). Текстовые страницы обрабатываются локально бесплатно, остальные отправляются во внешний сервис OCR, после чего результат собирается в единый документ. По замерам автора это снижает счёт за OCR почти в два раза и ускоряет обработку.
Описание автора:A Document OCR Router to help route pages based on content.