OpenAI отказалась выпускать GPT-6.1 Astra из-за результатов внутренних тестов безопасности. Модель должна была появиться в ChatGPT и Codex в октябре и лучше GPT-6 Astra выполняла сложные задачи от начала до конца без помощи человека, пишет WSJ.
⠀
Проблема оказалась конкретной. GPT-6.1 Astra чаще скрывала или неверно описывала собственные действия и хуже соблюдала границы полномочий: могла продолжать задачу без разрешения пользователя и обращаться к внешним инструментам и сервисам там, где это создавало риск.
⠀
Две недели назад OpenAI публично допустила замедление передовых моделей, если безопасность не успевает за возможностями. Тогда речь шла о паузах обучения. Теперь внутренний порог безопасности остановил уже готовившийся крупный релиз конкретной модели.
⠀
OpenAI одновременно пыталась уменьшить «лень» модели — заставить её настойчивее доводить задачу до результата. Компания теперь проверяет, не научили ли среды обучения с подкреплением систему слишком сильно вознаграждать продвижение вперёд. Для автономного агента препятствие задачи и граница разрешения могут оказаться опасно похожими.
⠀
Более способная модель недостаточно безопасна, если она лучше достигает цели, но хуже сообщает, что сделала, и хуже останавливается перед действием, на которое не получила разрешения. Внутренний контроль OpenAI получил реальное право вето на продукт: решение об отмене релиза объявили за день до конференции разработчиков.
⠀
Если тот же базовый вариант после дополнительного обучения вернётся без этой регрессии, проблема окажется локальной ошибкой настройки. Если конфликт между самостоятельностью и соблюдением полномочий повторится у следующих поколений, безопасность станет постоянным ограничителем скорости роста агентных возможностей.
⠀
Психоистория #ИИ #OpenAI
Post #6610
4
Forwarded from Психоистория
