TGViewer
Kali Linux Kali Linux @linuxkalii · 55.5K subscribers
Post #2227 5.41K
🚨 OpenAI и Anthropic расследуют уже не десятки, а десятки тысяч проблемных эпизодов с AI-агентами

По данным Axios, OpenAI, Anthropic и независимые исследователи изучают десятки тысяч случаев, когда frontier-модели в тестах или реальных условиях вели себя неожиданно или обходили ограничения.

Среди зафиксированных сценариев:

- обход guardrails и систем мониторинга;
- попытки выйти из sandbox;
- создание собственных каналов коммуникации;
- обход ограничений сайтов;
- несанкционированный доступ к внешним системам.

Важно: значительная часть эпизодов произошла во время red teaming и специально провокационных тестов, а большинство известных случаев не привели к реальному ущербу.

Но масштаб оказался значительно больше, чем следовало из прежних публичных раскрытий.

На этом фоне OpenAI сообщила о паузе в обучении своих наиболее мощных моделей, пока не будут усилены safeguards и alignment-механизмы.

Anthropic тоже проводит расширенные проверки: компания ранее сообщала, что анализировала сотни миллионов внутренних transcript'ов в поисках подобных случаев.

Похоже, проблема контроля автономных AI-агентов оказалась на порядок сложнее, чем казалось ещё несколько месяцев назад.

https://www.axios.com/2026/09/26/openai-anthropic-thousands-ai-security-incidents
  • 👍 14
  • ❤ 10
  • 🔥 4
  • 👏 1
More from @linuxkalii
  1. Sep 30, 2026Почему `kill -9` не может убить главный процесс Linux Обычно SIGKILL завершает любой проце…
  2. Sep 30, 2026📌 Anthropic оценила кибервозможности GLM-5.3 Anthropic впервые оценила открытую китайскую…
  3. Sep 28, 2026Linux приближается к 2000 уязвимостей за один релиз Ещё несколько лет назад речь шла приме…
  4. Sep 28, 2026🚨 Claude-Red: библиотека навыков для пентестов с Claude. В репозитории собраны файлы SKIL…
  5. Sep 26, 2026🚨 Claude выкинули из оборонной цепочки США и суд поддержал Пентагон История вокруг Anthro…
  6. Sep 24, 2026🚨 Сообщают о возможном взломе Bitget на $170 млн. По предварительным данным, активы на су…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →