Извлечение данных из разных документов для AI быстро
Мы в своей работе все больше используем AI и пайплайны автоматизации. Одна из задач доставать тексты из документов, чем быстрее тем лучше.
Потому что например LLM может тот же docx начать разбирать как XML и потратить много токенов и времени на это, или начать ставит по пути доп библиотеки для разбора, что не уменьшает время обработки.
Есть библиотека или тул на Rust для этого. Ставится локально утилитой и конвертирует практически любой документ, содержащий текст, в Markdown с сохранением заголовков и логики. Использовать или скиллом, или упомянуть в правилах (для экономии контекста).
Конвертация 10-100 страниц с текстом на 100-900кб занимает 50-130 мс.
Хорошо справляется с офисными форматами, pandoc не ровня.
Осознанно не умеет: обрабатывать картинки, просто их пропускает. Из pptx с картинками вы получите 500 байт текста на несколько слайдов, то есть только обертку, а из pdf со сканом вообще ничего.
Для агента с возможностью читать картинки - это не проблема, тот же Claude, и GPT умеют читать картинки.
Скачать: https://github.com/firecrawl/anydoc
#ai-tools #ai #markdown #инструменты
Post #254
145