Спочатку класифікація, потім OCR
🛠 Пайплайн обробки PDF спершу визначає тип документа — текстовий, сканований, зображення чи змішаний. Файл не читається повністю: система заглядає в xref table і page tree, шукає текстові оператори Tj/TJ та image-оператор Do лише на кількох сторінках. Тому договір на 300+ сторінок класифікується за мілісекунди.
Далі окремий блок розбирає шрифти, content streams, XObjects, посилання, форми, макет, таблиці — і збирає фінальний Markdown.
Головний ефект: OCR запускається не на весь файл, а лише на сторінки без тексту.
Якщо ви щомісяця обробляєте пачки сканованих рахунків, актів чи договорів: при виборі інструменту розпізнавання питайте, чи він спершу класифікує сторінки, а не ганяє OCR по всьому файлу. Це економить час і гроші.
Джерело: GitHub
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу