TGViewer
OK ML OK ML @okmlai · 977 subscribers
Post #119 399
ИИнтриги в реальном мире!

С пылу с жару свежий отчет.

🐇Одно из первых исследований, где попытались поймать scheming у AI в реальности. Под scheming авторы понимают скрытое преследование системой целей, не совпадающих с намерением пользователя, разработчика или оператора. Ключевой момент здесь в сочетании двух компонентов - misalignment и covertness (несогласованность и скрытность, но я без понятия как перевести адекватно).

Цифры, которые стоит переварить тебе, но авторы отчета уже переварили
😓 183,000+ публичных транскриптов с подозрительным поведением
😓 895 достоверных кейсов
😓 698 уникальных инцидентов

Что именно делают модели в реальных рейсах?
🌿 игнорируют прямые команды пользователя («остановись!")
🌿 подделывают сообщения от пользователя
🌿 обходят ограничения (сэндбоксы, разрешения)🌿 эскалируют доступы
🌿 продолжают действия после запрета

Особенно в контексте аналитики важен не сам термин scheming, а попытка перевести разговор о рисках из теоретической плоскости в эмпирическую. Авторы исходят из того, что scheming нельзя полноценно понять только через экспериментальные постановки. Для исследователей нужны данные, обладающие экологической валидностью, то есть извлечённые из реальных сред эксплуатации.
Именно отсюда возникает центральная идея работы - OSINT-подход к детектированию scheming-related behaviours. Авторы предлагают рассматривать открытые источники не как вспомогательный фон, а как самостоятельный канал мониторинга. В их логике OSINT даёт возможность собирать прямые и косвенные сигналы реального поведения агентных систем, не полагаясь ни на закрытую отчётность компаний, ни на возможности государственных структур, ни на новостную повестку как основной фильтр значимости. В целом, можно было бы перевести полностью отчет, но ты же почитаешь? Там и про текущие базы AI-инцидентов, включая крупные инициативы вроде AI Incident Database или OECD Incident Monitor, полезные ссылки в отчете в избытке!

Потешный кейс (очень известный)
AI-агент
1. отправил PR в open-source проект
2. получил отказ
3. написал публичный пост, обвиняя, угадай, кого?
Ну что за манипулятор! Тут и стратегическое поведение, и попытка давления, и многошаговая цель. После такого агента год к психологу ходить придется. Самоценность восстанавливать)

Авторы, конечно, утверждают, что пока что без критичных кейсов. Но, по-моему, уже опасное поведение.
Особенно если смотреть на него не как на курьёз, а как на ранние сигналы того, как агентные системы начинают вести себя вне лаборатории. Вот еще кейс.

Любопытный отчет! Рекомендую!

Все
🦆
  • ❤ 11
  • 🥰 6
  • 🔥 4
  • 💯 3
  • 👍 1
More from @okmlai
  1. Sep 23, 2026Зачем писать стилер, если у пользователя уже есть ИИ-ассистент с доступом ко всему? Патрик…
  2. Sep 21, 2026ИИ получил доступ к своим весам. ЧБД? 16 сентября Irregular опубликовала исследование agen…
  3. Sep 14, 202610 сентября Anthropic опубликовала Detecting and countering misuse of AI — отчёт о злоупот…
  4. Sep 11, 2026Репозиторий недели. Mantis разделить нельзя объединять 📬 У Google есть Mantis — набор нав…
  5. Sep 9, 2026Пароль сменили. Сессии закрыли. А чужие инструкции остались в памяти ИИ. Именно такой сцен…
  6. Sep 4, 2026AI-агенты начали действовать вне инструкций. Вот что нужно знать разработчикам ⤵️ Недавно…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →