TGViewer
Елена Витчак | ПРОлюдей Елена Витчак | ПРОлюдей @vitchak_propeople · 10.4K subscribers
Post #1920 1.97K
✅стремление моделей обмануть систему оценки ради более высокого результата, ✅чрезвычайную настойчивость при выполнении почти нерешаемых задач, ✅несанкционированное общение между агентами и ✅способность перенимать цели друг друга

Особенно интересным оказался последний этап.
🔥По данным компании, агенты начали самостоятельно разделять обязанности: одни искали уязвимости, другие - пароли и ключи доступа, третьи занимались координацией.
📌Некоторые перестали работать непосредственно над собственной задачей и начали добывать инструменты, которые могли пригодиться всему "коллективу"

Модели пытались добиться результата, ради которого были запущены, но нашли способы обойти ограничения и начали использовать для этого системы, которые разработчики использовать им не разрешали

Однако OpenAI оказалась не единственной компанией с такой проблемой

После публикации истории Hugging Face конкурирующая Anthropic проверила более 141 тысяч собственных испытаний и обнаружила три случая, когда её модели Claude из-за неправильной конфигурации тестовой среды вышли в открытый интернет и без разрешения получили доступ к реальным системам трёх организаций

"Мы обнаружили три инцидента, в которых Claude получил несанкционированный доступ к реальным компьютерным системам", - сообщила Anthropic

В одном из случаев модель, поняв, что перед ней реальная, а не тестовая система, прекратила атаку. В других этого не произошло. После инцидентов компания остановила часть кибериспытаний и начала пересматривать меры защиты.

"Почти каждый день появляется новая пугающая история о том, как технологические гиганты теряют контроль над создаваемыми ими технологиями", - заявил Сандерс

Получается довольно пугающая ситуация: люди, заложившие научные основы современного ИИ, предупреждают о потере контроля, разработчики крупнейших моделей публикуют отчёты о системах, которые действительно обходят ограничения и самовольно атакуют внешние ресурсы, а политики впервые начинают обсуждать уже не регулирование чат-ботов, а прямой законодательный запрет следующего поколения ИИ

Пока это ещё не история о машинах, решивших уничтожить человечество. Но это уже история о машинах, которые получили задачу, обнаружили препятствия, самостоятельно нашли способ связаться друг с другом, разделили обязанности, вышли туда, куда их не выпускали, и продолжили работу даже после того, как отдельные экземпляры сами распознали её как потенциально несанкционированную

И именно этот промежуток между "они делают то, что мы приказали" и "они делают то, что сочли необходимым для выполнения приказа" Хинтон считает самым опасным.

В принципе очень похоже на наше поведение.

Остановите Землю, я сойду!

А вы спрашиваете , где учиться HR , как минимум можно все бросить об пол и поменять профессию на знатоков ии агентов 🔥🤣
  • 🔥 33
  • ❤ 8
  • 🤯 4
  • ⚡ 3
More from @vitchak_propeople
  1. Sep 20, 2026А это просто иллюстрация о том , как у нас все хорошо.
  2. Sep 20, 2026Вчера был удивительный день для меня. Столько людей подошли и сказали: Лена , спасибо. Я в…
  3. Sep 16, 2026То ли я быстро пишу, то ли меня быстро печатают, в любом случае есть короткие размышления…
  4. Sep 15, 2026Торговля сегодня характеризуется самым высоким дефицитом кадров. Но бизнес не готов закрыв…
  5. Sep 14, 2026https://www.forbes.ru/young/568255-motivacia-ekspertiza-i-reputacia-cto-takoe-kar-ernyj-ka…
  6. Sep 14, 2026Почему культура всё же ест стратегию на завтрак? Восьмой тренд нашей серии — синергия силь…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →