TGViewer
BritLab BritLab @ru_vm · 1.25K subscribers
Post #8 829
7️⃣ Января, пока большинство людей отмечало Рождество и готовилось к завершению новогодних каникул, произошла довольно любопытная ситуация.

🔍 На платформе HackerOne (это платформа для поиска уязвимостей, где исследователи безопасности сообщают о найденных проблемах и могут зарабатывать на вознаграждениях) появился отчет от пользователя, который рассказал, что нашел в публичном Google документе секретные данные Министерства обороны США.
Ссылка на отчет: https://hackerone.com/reports/2926447

Организация подтвердила факт утечки и в течение нескольких дней удалила все данные.

Правда это или нет - неизвестно, но эта ситуация подняла важную проблему, с которой сталкиваются не только крупные компании, но и рядовые пользователи: публикация приватной информации в открытых местах.

📄 Особенно опасно, что в случае с Google Документами, доступ к данным можно получить через прямую ссылку. Эти ссылки могут быть довольно длинными, что делает невозможным перебор всех вариантов за адекватное время. И да, некоторые документы со временем удаляются, но это не всегда решает проблему.

Так как же защитить свою организацию от подобных утечек?

🚀 Есть организация под названием Common Crawl. Она занимается сбором и хранением огромных объемов данных со всего Интернета. Собираемые данные включают не только текстовое содержимое, но и метаданные, такие как ссылки, структура страниц и другая информация. По завершению сбора, данные сохраняются и становятся доступными для общего пользования.

Уже смекаете, к чему подходим ❓

Некоторые исследователи, скачивают эти данные себе и запускают поиск по ключевым словам, например, поиск по подстроке "https://docs.google.com/document/d/". Таким образом, исследователи получают множество прямых ссылок на документы, а в некоторых случаях и их содержимое.

Мой посыл в том, что если использовать домен вашей компании в качестве ключевого слова, то можно относительно быстро выявлять утечки данных (которые могут не замечать другие средства защиты) и оперативно их устранять.

Но есть и большие минусы:
1️⃣Common Crawl собирает не все страницы Интернета. И, скорее всего, документа из отчета HackerOne в его данных вы не найдете.
2️⃣ Исходных данных в Common Crawl — сотни терабайт, и обработать их на одном компьютере невозможно. Да, можно скачивать данные частями, например, по 10 ГБ, но проанализировать весь объём за один раз у вас не получится.

Если вам интересно, как работать с Common Crawl, ставьте реакции и подписывайтесь на канал! Если на этом посте наберется 40 реакций, то выпущу гайд, в котором будет описано, как упростить работу с Common Craw

#Безопасность #Common #Crawl #Google #DataScience
  • 🔥 11
More from @ru_vm
  1. Apr 23, 2026Бесплатный Google Proxy Несколько лет назад в Google Переводчике была фича, благодаря кото…
  2. Apr 4, 2026Не спеши уходить удалять username, если больше не хочешь вернутся Последние пару месяцев в…
  3. Jan 16, 2026БлоХчейн Каждый раз, меняя телефон или компьютер, мы теряем часть данных: фотографии, заме…
  4. Oct 11, 2025Прежде чем вновь исчезнуть, хочу поделиться одной из самых надежных методик оценки контраг…
  5. Oct 11, 2025Где же я пропадал все это время? Привет всем! Меня так давно не было, что пора поделиться…
  6. Aug 1, 2025Паша, что ты сделал? Вчера наткнулся на информацию, что в Telegram появится поиск по упоми…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →