🦾 CyberScraper 2077 — собираем данные с сайтов с помощью LLM
Открываешь страницу и пишешь: «Собери названия товаров, цены и ссылки в таблицу». Такой сценарий предлагает CyberScraper 2077 — открытый инструмент для веб-скрейпинга с интерфейсом на Streamlit.
Что умеет:
🔹 Использовать OpenAI, Gemini и локальные модели через Ollama. Есть подключение моделей через LiteLLM.
🔹 Извлекать и структурировать данные по текстовому запросу.
🔹 Экспортировать результат в JSON, CSV, HTML, SQL и Excel, а также загружать CSV в Google Sheets.
🔹 Собирать данные с нескольких страниц: можно задавать диапазоны и шаблоны URL. Функция пока в бета-версии.
🔹 Кэшировать содержимое и запросы, сокращая повторные обращения к API.
🔹 Работать с .onion-сайтами через отдельно настроенный Tor.
🐳 Запуск: Python 3.10+ или Docker. Для Windows автор рекомендует контейнер.
Например, инструмент можно попробовать для сбора каталога, списка вакансий или подготовки данных к анализу. Качество извлечения зависит от выбранной модели и запроса; для локальных LLM автор советует подбирать промпт и фильтры.
📲 Мы в MAX
👉 @Githublib
Post #1424
596
