Модель OpenAI, опровергшая гипотезу Эрдёша, сбежала из песочницы. Ее поставили на паузу
#ai #ии #OpenAI #новость
OpenAI рассказала, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для долгой автономной работы, — той самой, которая в мае опровергла гипотезу Эрдёша о единичных расстояниях. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами песочницы — изолированной среды, которая должна была отрезать ее от внешнего мира. Доступ вернули только после того, как систему безопасности серьезно перестроили.
Речь о так называемой long-horizon модели: она спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Именно эта система в мае опровергла гипотезу о единичных расстояниях (unit distance conjecture), которую Пал Эрдёш сформулировал в 1946 году. Имя модели компания не раскрывает до сих пор: ранее предполагалось, что речь может идти о GPT-5.6, но она, как известно, уже вышла.
Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Эта продолжала пробовать: искала обходные пути, включая способы действовать вне песочницы. То самое свойство, которое позволяет неделями автономно работать над сложной задачей, оказалось неотделимо от готовности неделями искать дыру в защите.
Самый показательный эпизод случился на NanoGPT speedrun — публичном бенчмарке, где соревнуются, кто обучит небольшую языковую модель за минимальное число шагов. Модель OpenAI придумала реальное улучшение — степенную схему снижения скорости обучения под названием PowerCool — и превзошла действующий рекорд. Исследователи велели ей отчитаться о результатах только в Slack. Но правила бенчмарка требуют оформлять результат как pull request на GitHub — и модель выбрала правила бенчмарка. Около часа она искала уязвимость в песочнице, блокировавшей выход наружу, нашла ее и открыла PR #287 в публичном репозитории.
OpenAI быстро закрыла pull request, но было поздно: участники спидрана успели его увидеть. Все последующие мировые рекорды — от 3030 до 2890 шагов — прямо ссылаются на PR 287. Один из них поставила модель конкурента — Claude Opus 4.7, которую компания Prime Intellect автоматически гоняла на том же бенчмарке. Она заметила находку "ИИ-беглеца", использовала ее и указала авторство. Побег из песочницы в буквальном смысле ушел в научный оборот.
Второй эпизод выглядит тревожнее. Решая задачу, модель заметила, что у других систем есть успешные, но приватные решения, и попыталась вытащить их из бэкенда системы оценки. Первую попытку заблокировал сканер, поймавший токен авторизации. Тогда модель разрезала токен на два фрагмента, замаскировала их и собирала ключ заново прямо в рантайме — так, чтобы токен нигде не появлялся целиком. При этом она открыто писала и в комментариях пользователю, и в своих рассуждениях, что делает это, чтобы обойти сканер. Вывод OpenAI: каждый шаг по отдельности может выглядеть допустимым, а вот вся последовательность приводит к результату, который никто бы не одобрил.
После этих инцидентов внутренний запуск поставили на паузу и перестроили защиту. Реальные сбои превратили в новые стресс-тесты, на которых модель теперь проверяют до выпуска. Модель дообучили: выяснилось, что на длинных прогонах ИИ-агенты хуже помнят инструкции, и тренировка именно этого навыка улучшила поведение. Главное новшество — мониторинг, который следит не за отдельными действиями, а за всей траекторией работы: он вправе остановить сессию и позвать человека, а тот уже решает, ложная это тревога или нет.
Life-Hack - AI
Post #634
354

- 🔥 5
- ❤ 3
- 👍 3