Firecrawl виклали під ліцензією MIT бібліотеку на Rust, яка бере офісні формати й віддає GitHub-flavored markdown. Без моделей, без хмари, без жодного виклику в мережу - чистий парсинг у локальному процесі.
Формати: doc/docx, ppt/pptx, xls/xlsx/xlsb, OpenDocument, RTF, EPUB, CSV і PDF. Тип файлу визначає за байтами, а не за розширенням, тож перейменований файл не зіб'є з пантелику. Виняток - CSV, його треба вказати явно.
Медіана конвертації - 4,7 мілісекунди на документ. Заголовки з якорями, таблиці, списки, виноски й вкладені картинки лишаються на місці: зображення віддаються байтами з типом медіа.
Ставиться під будь-що:
npx @firecrawl/anydoc report.docx, pip install firecrawl-anydoc або cargo add anydoc. Три тисячі зірок на GitHub.Головне обмеження варто знати заздалегідь: PDF тут - це витяг тексту, а не OCR. Скан лишиться порожнім, і саме під цей сценарій Firecrawl продає платний хмарний API. Для конвеєра «купа docx у базу знань» - те, що треба, для сканів дивись у бік MinerU.
https://github.com/firecrawl/anydoc
📎 Читайте також:
→ MinerU - PDF у markdown локально, з OCR
→ Firecrawl /search віддає агенту точний уривок
→ ditto.site - клонує сайт у чистий Next.js