Firecrawl прискорює обробку PDF без OCR
Firecrawl випустила pdf-inspector — швидку Rust-бібліотеку для класифікації PDF і витягування тексту. Вона визначає, чи документ текстовий, сканований, зображення або змішаний, зазвичай за 10–50 мс, і повертає рівень упевненості та маршрут OCR для кожної сторінки.
Ідея проста: не відправляти всі PDF в OCR. Якщо файл уже текстовий, pdf-inspector витягує текст локально приблизно за 150 мс і конвертує його в чистий Markdown без OCR. Для сторінок, яким OCR потрібен, Rust, CLI, Python і Node можуть обробляти лише їх.
Що це означає для бізнесу: компанії, які масово обробляють рахунки, звіти, юридичні документи чи дослідження, можуть зменшити витрати й затримки, не ганяючи кожен PDF через дорогі OCR-сервіси.