LangExtract
Google выпустил open-source Python библиотеку для эффективного извлечения текста — LangExtract. Она позволяет большим моделям точно вытягивать структурированные данные из неструктурированного текста.
Поддерживает модели, включая Gemini, позволяет кастомизировать prompt для контроля структуры вывода, автоматически генерирует интерактивный визуальный интерфейс для быстрой проверки результатов извлечения.
Основные возможности:
🔸Кастомизация prompt и примеров для точного извлечения информации
🔸Структурированный вывод на основе небольшого количества примеров, подходит для любых доменов
🔸Поддержка обработки длинных текстов с разбиением на блоки, многократное извлечение и параллельная обработка
🔸Генерация интерактивного HTML для визуализации результатов одним взглядом
🔸Поддержка разных LLM — от Google Gemini до локальной модели Ollama
🔸Прямая работа с URL-документами, параллельная обработка для повышения производительности
Устанавливается через pip, требуется конфигурация API ключа модели. Подходит для разработчиков и аналитиков, которым нужно обрабатывать большие объёмы документов.
📁 Language: #Python (98.8%)
⭐️ Stars: 2.8k
➡️ Cсылка на GitHub
📱 @git_developer
Post #909
3.79K
- 👍 7
- ❤ 3