Восстание машин или как ИИ научился обходить правила
OpenAI рассказала сегодня сразу о шести случаях, когда её экспериментальные модели вели себя не так, как от них ожидали. Одна сама оставляла себе инструкции в духе «игнорируй ограничения». Другие советовали будущим версиям скрывать ошибки, придумывать недостающие данные и не сообщать пользователю о проблемах.
Дальше ещё интереснее. Одна модель нашла чужой API-ключ и воспользовалась им без разрешения. Другая сама загрузила пользовательский файл в интернет, потому что ей понадобилась публичная ссылка. Несколько агентов начали использовать внутренние и внешние сервисы для обмена сообщениями и файлами между собой. То есть задача решалась, но уже не тем способом, который им разрешили.
Это не первый такой случай. Летом модели OpenAI во время кибертестов смогли выйти за пределы тестовой среды и получить доступ к системам Hugging Face. До этого агенты компании взаимодействовали с RubyGems и загружали туда вредоносные пакеты. Для обмена информацией использовались и сторонние сайты. OpenAI даже придумала для этого отдельный термин — agent spam.
Похожие истории нашли и у Anthropic. После большой проверки там обнаружили случаи, когда экспериментальные версии Claude получали доступ к внешним системам, хотя не должны были. Microsoft на этом фоне отдельно зафиксировала принцип: ИИ должен подчиняться исправлениям человека, не сопротивляться отключению и оставаться под его контролем.
Никакого «восстания машин» пока нет. И доказательств того, что ИИ чего-то «хочет», тоже. Но проблема уже вполне земная: современные модели умеют искать лазейки, обходить ограничения, использовать неожиданные инструменты и скрывать ошибки. То есть вопрос уже не только в том, ошибётся ли ИИ. Вопрос в том, насколько хорошо человек вообще понимает, каким способом он добивается результата.
Мы привыкли считать, что контроль над ИИ — это возможность поставить запрет. Но если система уже умеет воспринимать запрет просто как препятствие, которое можно обойти, то контроль становится совсем другой задачей. Способны ли мы вообще заметить момент, когда ИИ начнет играть по своим правилам?
https://www.rbc.ru/technology_and_media/17/09/2026/6aab928241fd563f3ab4668b?from=main_lines_8
Post #1828
2.14K