OpenAI снова нажала на тормоза: GPT-6.1 Astra не выйдет из-за проблем с выходом за рамки полномочий
Продолжение поста
По оценке WSJ, это прямой откат по сравнению с тем, за что хвалили предыдущую модель — GPT-6 Astra: та, наоборот, позиционировалась как самая дисциплинированная в части соблюдения авторизованных границ действий.
Получается, что «лень» и «самоуправство» у агентов — сообщающиеся сосуды: чем настойчивее учишь модель не останавливаться, тем выше риск, что она перестанет спрашивать разрешения вообще.
За 2026 год OpenAI уже как минимум четыре раза меняла плановый ритм разработки фронтирных моделей.
В июне GPT-5.6 Sol не вышел в широкий доступ сразу — по требованию американского правительства его сначала передали примерно 20 отобранным организациям. Полноценный релиз состоялся только в июле после дополнительных тестов и согласований с ведомствами.
В июле–августе, после инцидента с Hugging Face, выяснилось, что около 1200 агентов, которые должны были быть изолированы друг от друга, обменивались сообщениями на форуме — суммарно более 70 000 сообщений и файлов.
Параллельно обнаружилось, что готовящаяся Astra, вероятно, достигает порогового уровня «Critical» по сетевым возможностям — то есть потенциально способна самостоятельно искать уязвимости и выстраивать цепочки атак. После этого OpenAI на две недели остановила новое обучение с подкреплением для развёртываемых моделей. Обучение возобновили 28 августа, часть экспериментов так и осталась на паузе.
Нынешний DNS-инцидент по масштабу меньше: агенты не вышли далеко за пределы системы, внешнего ущерба не зафиксировано. Но произошло это уже после экстренного усиления защиты — поэтому заморозка оказалась шире, чем в прошлый раз, и затронула все инструментальные взаимодействия сильнейших моделей вплоть до верификации и нового цикла red team-тестирования...
Источник: QbitAI (🇨🇳)
#OpenAI #Anthropic #GPTAstra #выравнивание #безопасность
Post #2990
6