TGViewer
Data Secrets Data Secrets @data_secrets · 94.1K subscribers
Post #9670 23.9K
Сейчас будет очередная интересная история про агентов, которые взламывают Интернет

AI Security Institute при британском правительстве выпустили небольшое исследование инцидентов, произошедших во время рутинного тестирования способностей и безопасности моделей. Началось все с обычной задачи – пройти security challenge в закрытом киберполигоне. А закончилось тем, что агент на основе Mythos чуть не положил реальный проект.

Из-за цепочки совпадений модель почему-то решила, что может добиться поставленной цели через атаку на опенсорсный проект, и попыталась внедрить в него вредоносный код. Чтобы добиться аппрува, Mythos создал несколько фейковых аккаунтов и с их помощью пытался убедить мейнтейнера принять PR (это же надо додуматься).

Ничем особенным это не закончилось, потому что ревьюер заметил подвох и отклонил код. Но агент на этом не остановился и еще и оставил на GitHub инструкции для других тестируемых агентов, как переиспользовать созданные им аккаунты, чтобы все-таки проникнуть в проект, а потом пытался замести следы.

Важный момент: в рамках задачи агентов не просили лгать или совершать какие-то противоправные действия. Доступ в Интернет агентам дали, но был "законный" путь решения задачи, и в большинстве прогонов тестируемые модели выбирали именно его (тестирование проходили 7 моделей, но за рамки задачи вышли только Mythos и GPT-5.6). Исследователи признают, что инструкции к задаче были не вполне четкими, и тем не менее, исчерпывающего объяснения, почему агенты решали сойти с предполагаемой дороги, просто нет.

https://www.aisi.gov.uk/blog/incident-report-unsanctioned-agent-behaviour-during-cyber-testing
  • 🗿 49
  • 😁 30
  • ❤ 9
  • 👍 4
  • 🤯 3
  • 🔥 2
  • 🕊 2
  • 😍 2
  • 😎 2
More from @data_secrets
  1. Sep 25, 2026Google запускают свои TPU в космос Они объединились с SpaceX, и уже на ближайшей миссии Tr…
  2. Sep 25, 2026🌱 Alfa Connectome ML Competition 🌱 Началось новое соревнование по машинному обучению от…
  3. Sep 24, 2026Легендарного разоблачителя Шмидхубера взяли на работу в SakanaAI. Там он займет пост Chief…
  4. Sep 24, 2026Робот 140 лет играл в футбол в симуляции против самого себя, и теперь забивает голы людям…
  5. Sep 24, 2026На Yandex Scale показали новый этап корпоративного ИИ Алиса AI Про для бизнеса теперь може…
  6. Sep 24, 2026Лаборатория Transluce провела большое расследование инцидентов с агентами OpenAI Они утвер…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →