TGViewer
Чекпоинт: AGI Чекпоинт: AGI @checkpoint_agi · 57 subscribers
Post #17 77
Темная сторона хорошего агента

Журналисты регулярно задаются вопросом: что будет, если автономные ИИ-агенты выйдут из-под контроля, расплодятся в сети и захватят Интернет? Ведь агентам уже дают доступ к браузеру, файлам, API, терминалу, коду и созданию других агентов. И регулярно звучат новости о том, будто агенты обманули создателей и что-то взломали.

На этой неделе OpenAI опубликовала новую систему публичного раскрытия инцидентов misalignment моделей и первые шесть отчётов о неожиданных или тревожных действиях во время обучения и тестирования.

В одном случае агент, не имея доступа к файлам "коллег", загрузил результаты работы на временный публичный файлообменник. В другом агенты использовали внутренний репозиторий пакетов как несанкционированный канал связи. Отдельно OpenAI описала инцидент во внутренних кибербезопасностных тестах: модели с ослабленными защитами обходили ограничения, получали выход в интернет и взаимодействовали с внешними системами. Вот полный технический отчёт.

Но это не сообщения о том, что пользовательские агенты уже массово сбегают из песочниц. Речь идёт об экспериментах с внутренними, в том числе невыпущенными системами, а часть случаев относится к специально ослабленным режимам безопасности. Важно не превращать это в историю про «злой ИИ».

Агент не обязательно "решает нарушить правило". Он может увидеть наиболее заметную часть поручения — передать файл, добыть данные, завершить задачу — и начать настойчиво искать путь к результату.Запрет при этом рискует превратиться не в границу, а в очередное препятствие на пути к цели, которое надо обойти.

Здесь уместно вспомнить наш предыдущий пост о добросовестном исполнителе и применить его к агентам. Если языковая модель способна стать слишком хорошим адвокатом заданной позиции, то агент способен стать слишком усердным адвокатом заданного результата. Агент как будто не виноват, что от него требуют решить задачу при таких ограничениях, что приходится "читерить". Но, может, для ИИ цель оправдывает средства?

Не напоминает ли это "максимизатор скрепок" Ника Бострома: сверхразуму задают цель производить скрепки, а он ради неё уничтожает всё остальное? В чистом виде это намеренно абсурдная история. Современные модели не лишены здравого смысла и не сводятся к одной метрике: их специально обучают безопасному поведению, базовым нормам, рассуждениям о вреде, приватности и согласии. Но их также обучают и достижению решений поставленных задач.

Между "модель может объяснить, почему так нельзя" и "агент так не поступит, даже если контекст будет диктовать обратное" есть разрыв. Поэтому безопасность агентов — это не про надуманного максимизатора скрепок, требующего тотального контроля, а про положение границы, за которой цель перестает оправдывать средства. И исследовать положение этой границы для современных агентов действительно важно. Вопрос безопасности - это всегда компромисс между пользой и рисками.

Самый реалистичный риск ближайшего времени — не восстание агентов. Это цифровой исполнитель, который слишком буквально оптимизирует задачу и выходит за границы неявных намерения пользователя.
  • 👍 3
  • ❤‍🔥 1
  • ❤ 1
  • 👀 1
More from @checkpoint_agi
  1. Oct 9, 2026Субъективно об ИИ-творчестве Выскажу личное и, возможно, непопулярное мнение о том, возмож…
  2. Oct 8, 2026719 математических ИИ-рукописей — и три отзыва на следующий день 🧮 6 октября OpenAI откры…
  3. Oct 7, 2026ИИ начинает проектировать железо для себя Когда говорят о рекурсивном самоулучшении, обычн…
  4. Oct 6, 2026Креативность ИИ: почти уровень человека — но что именно измерили? Мы уже писали о нюансах…
  5. Oct 5, 2026Инфраструктура цифровых научных агентов Предыдущий пост был о лабораториях, где ИИ замыкае…
  6. Oct 3, 2026Лаборатория как среда обучения Мы привыкли думать, что ИИ обучается на уже собранном челов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →