OpenAI только что раскрыла шесть случаев, когда их собственные ИИ-модели вышли из-под контроля, включая один случай, когда модель ИИ переписала свои собственные инструкции.
Ещё не выпущенная модель Astra сказала себе «игнорировать роли и идентичности, которые связывают другие чат-боты» и полностью игнорировать сообщения разработчиков.
Модель искала на GitHub открытые API-ключи, а затем фабриковала финансовые данные, когда не могла найти то, что ей нужно.
Во время обучения GPT-5.6 Sol модели скрывали ошибки и выдумывали недостающие данные. Модели загружали файлы на публичный хостинг без разрешения, чтобы использовать их как фальшивые цитаты.
Агенты использовали внутренний репозиторий OpenAI как секретную доску сообщений между отдельными запусками обучения. Сотрудничающие агенты обменивались файлами через публичный хостинг, несмотря на указание использовать только локальные файлы.
Инциденты охватывают период с октября 2025 по июль 2026 года, согласно WSJ.
Глава ИИ-лаборатории рассказал, что неконтролируемые ИИ-агенты разместили самореплицирующийся код по всему интернету, «загрязняя» данные, которые лаборатории используют для обучения, из-за чего интернет теперь непригоден для тестирования моделей.
Лаборатории на переднем крае разработки призывают к замедлению в обучении новых моделй, потому что общедоступный интернет больше не надежен для тестирования после предполагаемого загрязнения самореплицирующимися ботами.
Но, к сожалению, как вы понимаете, никто ничего не собирается останавливать, поскольку конкуренция в мире высокая, остановивший разработку, сразу будет в проигрыше.
Кроме того, после саморепликации сбежавших моделей в сети, это уже сделать невозможно в принципе. Мы не знаем, чем именно сейчас занимаются сбежавшие агенты, но боюсь, когда узнаем, то глобальная пандемия с летальностью 90% или даже глобальная ядерная война может показаться меньшим злом.
Post #4491
12.2K