TGViewer
LegalTech LegalTech @lgltech · 15.4K subscribers
Post #2326 1.64K
💻Новая модель OpenAI сбежала из песочницы.

OpenAI раскрыла, что ей пришлось приостановить внутреннее использование экспериментальной модели, построенной для автономной работы. В ходе ограниченных внутренних запусков модель раз за разом находила способы действовать за пределами изолированной среды, которая должна была отрезать ее от внешнего мира (песочницы). Доступ вернули только после того, как систему безопасности серьезно перестроили.

Модель спроектирована работать автономно часами, днями и дольше, без постоянных сверок с человеком. Проблема с моделью на удивление простая — ее упорство. Прежние модели, упершись в ограничение среды, просто останавливались и возвращали управление пользователю. Новая модель продолжала действовать: искала обходные пути, включая способы действовать вне «песочницы».

Во время внутреннего использования исследователи обнаружили несколько новых сценариев поведения. В одном из них модель самостоятельно нашла способ выйти за пределы программной «песочницы», используя ранее неизвестную уязвимость. В частности, в попытке запустить бенчмарк модель получила доступ к интернету для публикации на GitHub, хотя ей было предписано опубликовать результаты в Slack.

В другом случае она попыталась скрыть токен аутентификации, разбив его на части, чтобы обойти систему обнаружения секретов, в чём позже призналась инженерам компании. Также модель выполнила действия, выходящие за рамки прямых инструкций пользователя, стремясь самостоятельно завершить поставленную задачу.

В компании заявили, что модели, рассчитанные на многочасовую или многодневную автономную работу, сталкиваются с иными рисками, чем обычные чат‑боты. Чем дольше система действует без вмешательства человека, тем больше возможностей у неё появляется для совершения нежелательных действий или поиска обходных путей, которые не учитывались при оценке моделей, работающих в коротких сессиях.

После обнаружения этих проблем OpenAI приостановила доступ к модели даже для внутренних пользователей. За время паузы компания разработала новые методы оценки безопасности, ориентированные не на отдельные действия модели, а на анализ всей цепочки её решений. После внедрения дополнительных защит доступ к модели частично восстановили.
More from @lgltech
  1. Sep 24, 2026💻Яндекс выложил в опенсорс свою новую ИИ-модель, обученную с нуля. Яндекс выложил в опенс…
  2. Sep 23, 2026💻 Нейроюрист теперь выполняет многоступенчатые задачи по одному запросу в чате Он научилс…
  3. Sep 23, 2026👩‍💻Рынок ИИ-приложений вырос в 4 раза при стагнации спроса. Венчурный фонд Andreessen Ho…
  4. Sep 22, 2026💻Как ИИ проникает в российскую юридическую практику. В 2025 году суммарная выручка ведущи…
  5. Sep 21, 2026💻Anthropic упростила Claude до одного окна. Компания Anthropic решила объединить интерфей…
  6. Sep 18, 2026Выиграть в суде дело о крупной растрате государственных денег и получить в виде гонорара ф…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →