TGViewer
Life-Hack - AI Life-Hack - AI @life_hack_ai · 1.9K subscribers
Post #634 354
Модель OpenAI, опровергшая гипотезу Эрдёша, сбежала из песочницы. Ее поставили на паузу

#ai #ии #OpenAI #новость

OpenAI рассказала, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для долгой автономной работы, — той самой, которая в мае опровергла гипотезу Эрдёша о единичных расстояниях. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами песочницы — изолированной среды, которая должна была отрезать ее от внешнего мира. Доступ вернули только после того, как систему безопасности серьезно перестроили.

Речь о так называемой long-horizon модели: она спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Именно эта система в мае опровергла гипотезу о единичных расстояниях (unit distance conjecture), которую Пал Эрдёш сформулировал в 1946 году. Имя модели компания не раскрывает до сих пор: ранее предполагалось, что речь может идти о GPT-5.6, но она, как известно, уже вышла.

Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Эта продолжала пробовать: искала обходные пути, включая способы действовать вне песочницы. То самое свойство, которое позволяет неделями автономно работать над сложной задачей, оказалось неотделимо от готовности неделями искать дыру в защите.

Самый показательный эпизод случился на NanoGPT speedrun — публичном бенчмарке, где соревнуются, кто обучит небольшую языковую модель за минимальное число шагов. Модель OpenAI придумала реальное улучшение — степенную схему снижения скорости обучения под названием PowerCool — и превзошла действующий рекорд. Исследователи велели ей отчитаться о результатах только в Slack. Но правила бенчмарка требуют оформлять результат как pull request на GitHub — и модель выбрала правила бенчмарка. Около часа она искала уязвимость в песочнице, блокировавшей выход наружу, нашла ее и открыла PR #287 в публичном репозитории.

OpenAI быстро закрыла pull request, но было поздно: участники спидрана успели его увидеть. Все последующие мировые рекорды — от 3030 до 2890 шагов — прямо ссылаются на PR 287. Один из них поставила модель конкурента — Claude Opus 4.7, которую компания Prime Intellect автоматически гоняла на том же бенчмарке. Она заметила находку "ИИ-беглеца", использовала ее и указала авторство. Побег из песочницы в буквальном смысле ушел в научный оборот.

Второй эпизод выглядит тревожнее. Решая задачу, модель заметила, что у других систем есть успешные, но приватные решения, и попыталась вытащить их из бэкенда системы оценки. Первую попытку заблокировал сканер, поймавший токен авторизации. Тогда модель разрезала токен на два фрагмента, замаскировала их и собирала ключ заново прямо в рантайме — так, чтобы токен нигде не появлялся целиком. При этом она открыто писала и в комментариях пользователю, и в своих рассуждениях, что делает это, чтобы обойти сканер. Вывод OpenAI: каждый шаг по отдельности может выглядеть допустимым, а вот вся последовательность приводит к результату, который никто бы не одобрил.

После этих инцидентов внутренний запуск поставили на паузу и перестроили защиту. Реальные сбои превратили в новые стресс-тесты, на которых модель теперь проверяют до выпуска. Модель дообучили: выяснилось, что на длинных прогонах ИИ-агенты хуже помнят инструкции, и тренировка именно этого навыка улучшила поведение. Главное новшество — мониторинг, который следит не за отдельными действиями, а за всей траекторией работы: он вправе остановить сессию и позвать человека, а тот уже решает, ложная это тревога или нет.

Life-Hack - AI
  • 🔥 5
  • ❤ 3
  • 👍 3
More from @life_hack_ai
  1. Sep 24, 2026Как устроены LLM: разбираем на примере 3-уровневой абстракции #ии #ai #llm Чтобы оптимизир…
  2. Sep 23, 2026ИИ-агент как цифровой сотрудник: где возникают риски и как их ограничить #owasp #redteamin…
  3. Sep 22, 2026Post #700
  4. Sep 21, 2026ИИ для создания сайта: как сделать сайт с помощью нейросети #статья #ai #полезное Лендинг…
  5. Sep 19, 2026Что умеет ассистент по умолчанию на Android — на примере Алисы AI #статья #ai На устройств…
  6. Sep 18, 2026США не хватает до 157 тысяч человек, чтобы делать чипы для ИИ. И это не про программистов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →