TGViewer
🤖 The Bell Tech 🤖 The Bell Tech @bell_tech · 20.7K subscribers
Post #5197 26.4K
ИИ научился деанонимизировать пользователей по комментариям в соцсетях

НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИЗВЕДЕН И РАСПРОСТРАНЕН ИНОСТРАННЫМ АГЕНТОМ THE BELL ЛИБО КАСАЕТСЯ ДЕЯТЕЛЬНОСТИ ИНОСТРАННОГО АГЕНТА THE BELL. 18+

Группа исследователей обнаружила, что большие языковые модели могут по набору анонимных постов установить реальную личность пользователя. То, что раньше требовало кропотливой ручной работы и OSINT, теперь может выполнить ИИ-агент — быстро, дешево и довольно точно.

Что случилось

AI-инженер Саймон Лермен и его коллеги представили работу «Large-Scale Online Deanonymization with LLMs», в которой оценили способности LLM устанавливать личность пользователей по анонимным постам на разных площадках. Эксперименты проводились на данных Hacker News, Reddit, LinkedIn, а также на обезличенных интервью из датасета Anthropic.

Идея не нова. Еще в начале 2000-х профессор Гарварда Латанья Суини пришла к выводу, что 87% населения США можно идентифицировать всего по трем параметрам: почтовому индексу, полу и дате рождения. Но на практике деанонимизация долго оставалась трудоемким ручным процессом: данные разбросаны, не структурированы, и собрать из них портрет конкретного человека мог разве что опытный аналитик.

LLM ускоряют и автоматизируют этот процесс, причем делают это экономически эффективно, утверждают Лермен и его соавторы.

Как это работает

Сначала модель извлекает из комментариев пользователя косвенные сведения. Затем с помощью поиска на основе эмбеддингов (векторных математических "отпечатков" текста) формируется пул из 100 наиболее вероятных кандидатов, и на финальном шаге LLM «рассуждает» и выбирает наилучшее совпадение.

Для проверки в одном из тестов исследователи отобрали 338 пользователей Hacker News, чьи профили содержали ссылку на LinkedIn. После удаления прямых идентификаторов модели предлагалось восстановить соответствие между анонимизированным аккаунтом и реальным человеком. Модель дала верный ответ в 226 случаях из 338 (67%). При этом точность составила 90% — то есть в тех случаях, когда система вообще выдавала результат, она почти всегда оказывалась права.

В другом эксперименте историю одного аккаунта Reddit искусственно делили по времени и по тематическим сообществам. Задачей модели было «сшить» фрагменты обратно. Комбинация эмбеддингов и логического анализа значительно превзошла базовые методы методы сопоставления по метаданным и активности.

По мере увеличения пула кандидатов до десятков тысяч точность снижалась плавно, без обвала. Авторы экстраполировали результаты на базы в 100 млн пользователей и заключили, что при достаточных вычислительных мощностях уже можно «атаковать» крупные платформы. А с развитием LLM порог входа будет только снижаться.

Приводится в исследовании и реальный кейс. На датасете обезличенных интервью ученых модель смогла установить личности 9 из 125 участников. Но эталонных данных для данной задачи не было, и результаты проверялись вручную.

Весь эксперимент обошелся примерно в $2000. Стоимость деанонимизации одного профиля — от $1 до $4 (правда это все в экспериментальных условиях, в реальной жизни цифра была бы совсем другой).

Почему это важно

Авторы перечисляют несколько сценариев злоупотреблений. Правительства могут использовать технологию для преследования журналистов и активистов, корпорации — для построения сверхточных рекламных профилей, а злоумышленники — для целевого фишинга и социальной инженерии.

Тем не менее в сети напоминают, что деанонимизация по косвенным признакам известна давно. Часть пользователей указывает на ограниченность экспериментальных условий, а некоторый отмечают, что LLM не создают принципиально новую угрозу, а лишь автоматизируют уже существующие методы.

Как бы то ни было исследование не отменяет значимости базовой цифровой гигиены и осторожности.

---
Чтобы не остаться без новостей после блокировки Telegram, прямо сейчас подпишитесь на наши почтовые рассылки. Это можно сделать бесплатно.
  • 😱 12
  • ❤ 4
  • 🔥 3
  • 👀 3
More from @bell_tech
  1. Sep 29, 2026OpenAI хочет привлечь $30 млрд при оценке в $1,4 трлн НАСТОЯЩИЙ МАТЕРИАЛ (ИНФОРМАЦИЯ) ПРОИ…
  2. Sep 29, 2026Anthropic идет на IPO с убытком в $42 млрд и предупреждением о рисках для человечества НАС…
  3. Sep 29, 2026Техновторник: OpenAI отложила выпуск новой Astra из-за проблем с безопасностью, Anthropic…
  4. Sep 28, 2026«Цифровой ГУЛАГ» в действии. Готовы ли власти к новой мобилизации? НАСТОЯЩИЙ МАТЕРИАЛ (ИНФ…
  5. Sep 28, 2026Nvidia выпустила систему для изоляции ИИ-агентов. По словам компании, она остановила бы вз…
  6. Sep 28, 2026Технопонедельник: банки маркетплейсов целятся в топ-10, OpenAI приостанавливает обучение м…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →