AI Фактор

Спочатку класифікація, потім OCR

Практика 18.08.2026
Спочатку класифікація, потім OCR

🛠 Пайплайн обробки PDF спершу визначає тип документа — текстовий, сканований, зображення чи змішаний. Файл не читається повністю: система заглядає в xref table і page tree, шукає текстові оператори Tj/TJ та image-оператор Do лише на кількох сторінках. Тому договір на 300+ сторінок класифікується за мілісекунди.

Далі окремий блок розбирає шрифти, content streams, XObjects, посилання, форми, макет, таблиці — і збирає фінальний Markdown.

Головний ефект: OCR запускається не на весь файл, а лише на сторінки без тексту.

Якщо ви щомісяця обробляєте пачки сканованих рахунків, актів чи договорів: при виборі інструменту розпізнавання питайте, чи він спершу класифікує сторінки, а не ганяє OCR по всьому файлу. Це економить час і гроші.

🔗 Більше практики на сайті

Джерело: GitHub
Читати в ТелеграміПрактика ШІ в бізнесі — щодня, без хайпу