TGViewer
Блог о Data Science 💻 Наука о данных Блог о Data Science 💻 Наука о данных @notedatascience · 3.87K subscribers
Post #240 4.75K
🔤🔤🔤🔤🔤🔤🔤🔤1️⃣

Этот пост будет по большей части как self best practice. 🙃

Cпарсить можно абсолютно все что угодно!)

Если вы когда то проходили курсы по парсингу или веб скрапингу, то в жизни все не так просто, как на курсах. Большинство сайтов защищаются от ддос атак и подозрительных активностей, а парсеры могут сильно нагружать сайты. Поэтому вас на изи заблокать, но выход всегда есть.

Можно почувствовать себя немного хакером и бороться с системой, пытаться её обойти. Благо для этого есть достаточно инструментов. Знайте, что если у вас есть данные - у вас есть все.

🔵Шаг первый
Hello world + Dev Ops, потому что в дальнейшем хрен знает где мы вообще этот парсер запускать будем, а может распределенно придется парсить.

🔵Шаг второй
После чего мы можем начать писать первую версию парсера.
Хорошие парсер, адекватная программа не пишется в jupyter notebook, избавьте меня от этого пожалуйста.

Что нам для этого понадобиться?
• request
• BS4/selenium/scrapy
• json, csv, postgresql
• pytest
• superset (или че то такое, что бы картиночки смотреть)
• multiprocessing/joblib
• fakeuseragent, proxy server

Желательно создать отдельный скрипт бекапа данных на виртуальное хранилище и подгрузка в БД, которая находится на другом сервере.

🔵Шаг третий
Гуглим как парсить данные и пользоваться этим всем, поэтому вот вам гайд
- PythonToday[1][2][3] (Самое годное, что вы можете найти и повторить)
- Как спарсить что угодно?
- HTML не панацея [1][2]
- Request не панацея
- Distributed web parsing [1][2]

Вообще этот мужик годноту делает
Так же вам стоит знать, что запускать лучше всего свои парсеры несколько раз, на несколько параллельных джобах или серверах. (вообще лучше каждый сервер распределить на свой регион или участок, а джобы на один и тот же сектор, так получиться наиболее корректная валидация парсинга). Так вы валидируете результат, а потом просто смотрите по объему и удаляете дубликаты, это достаточно легко сделать.

🔵Шаг четвёртый
Парсим че угодно и радуемся жизни. Можно продать инфу конкурентам или сделать на ней аналитический отчет.

Если вам нужно что-то спарсить 👨‍💻 или вы хотите получить консультацию 📞
Можно всегда написать автору канала @redpf
  • 🔥 35
  • ❤ 2
  • 🐳 2
  • 👨‍💻 1
More from @notedatascience
  1. Sep 23, 2026В субботу, 17 октября, Москва станет точкой притяжения для всех специалистов в области Rec…
  2. May 19, 2026Андрей Карпаты перешёл в Anthropic @notedatascience
  3. Apr 23, 2026OpenAI показали GPT 5.5 Раскатывают уже сегодня на всех подписчиков. Модель заметно умнее…
  4. Mar 31, 2026Теперь и код Claude Code утек. 👍 Говорят его слили... Ошибка в map пакете и можно разобра…
  5. Mar 25, 2026И тут очень вовремя OpenAI закрывают Sora Нейротикток OpenAI в итоге не взлетел и не имел…
  6. Mar 18, 2026OpenAI запускают серию соревнований, подготовленных членами их исследовательской команды С…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →