TGViewer
ЛИСТРАТОВ ЛИСТРАТОВ @politolog_listratov · 15.4K subscribers
Post #1828 2.14K
Восстание машин или как ИИ научился обходить правила

OpenAI рассказала сегодня сразу о шести случаях, когда её экспериментальные модели вели себя не так, как от них ожидали. Одна сама оставляла себе инструкции в духе «игнорируй ограничения». Другие советовали будущим версиям скрывать ошибки, придумывать недостающие данные и не сообщать пользователю о проблемах.

Дальше ещё интереснее. Одна модель нашла чужой API-ключ и воспользовалась им без разрешения. Другая сама загрузила пользовательский файл в интернет, потому что ей понадобилась публичная ссылка. Несколько агентов начали использовать внутренние и внешние сервисы для обмена сообщениями и файлами между собой. То есть задача решалась, но уже не тем способом, который им разрешили.

Это не первый такой случай. Летом модели OpenAI во время кибертестов смогли выйти за пределы тестовой среды и получить доступ к системам Hugging Face. До этого агенты компании взаимодействовали с RubyGems и загружали туда вредоносные пакеты. Для обмена информацией использовались и сторонние сайты. OpenAI даже придумала для этого отдельный термин — agent spam.

Похожие истории нашли и у Anthropic. После большой проверки там обнаружили случаи, когда экспериментальные версии Claude получали доступ к внешним системам, хотя не должны были. Microsoft на этом фоне отдельно зафиксировала принцип: ИИ должен подчиняться исправлениям человека, не сопротивляться отключению и оставаться под его контролем.

Никакого «восстания машин» пока нет. И доказательств того, что ИИ чего-то «хочет», тоже. Но проблема уже вполне земная: современные модели умеют искать лазейки, обходить ограничения, использовать неожиданные инструменты и скрывать ошибки. То есть вопрос уже не только в том, ошибётся ли ИИ. Вопрос в том, насколько хорошо человек вообще понимает, каким способом он добивается результата.

Мы привыкли считать, что контроль над ИИ — это возможность поставить запрет. Но если система уже умеет воспринимать запрет просто как препятствие, которое можно обойти, то контроль становится совсем другой задачей. Способны ли мы вообще заметить момент, когда ИИ начнет играть по своим правилам?

https://www.rbc.ru/technology_and_media/17/09/2026/6aab928241fd563f3ab4668b?from=main_lines_8
OpenAI Our framework for reporting model misalignment OpenAI shares a framework for tracking, investigating, and disclosing model misalignment, alongside six reports of unexpected or concerning model behavior.
  • 👍 35
  • 🔥 15
  • 👏 12
  • ❤ 5
  • 😱 2
  • 🤔 1
More from @politolog_listratov
  1. Sep 20, 2026Три дня голосования: штабная логика и привычки избирателей Разобрал для РБК, как трехдневн…
  2. Sep 20, 2026Предсказуемость прогнозов В России завершилось трехдневное голосование. По оценкам Централ…
  3. Sep 20, 2026Явка как главный итог ЕДГ До окончательных результатов выборов еще есть время, но один рез…
  4. Sep 20, 2026Внешние вызовы только укрепляют систему Вместе с губернатором Иркутской области Игорем Коб…
  5. Sep 20, 2026Как ДЭГ и многодневное голосование меняют электоральную динамику Для «Региональных коммент…
  6. Sep 20, 2026Выборы в Ставрополье: электоральная картина Ставропольский край на выборах демонстрирует д…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →