Агент, которому больше не нужен пользователь
Пока любой ИИ-агент остаётся чьим-то инструментом. Кто-то должен его запустить, выдать задачу, предоставить доступ к моделям и оплатить вычисления. Джош Ачиам и Дин Болл предлагают подумать о следующей границе: что произойдёт, если агент научится самостоятельно поддерживать условия собственного существования?
Оба автора знают тему изнутри. Ачиам долгое время работал в OpenAI, занимался безопасностью ИИ и перед уходом занимал должность Chief Futurist. Болл — специалист по AI governance, бывший советник Белого дома, а сейчас руководитель Strategic Futures в OpenAI.
Ачиам предлагает не представлять неподконтрольный ИИ как одну большую модель, эффектно сбежавшую из лаборатории. Это может быть небольшая распределённая система: оркестратор арендует сервер, обращается к разным моделям через временные аккаунты, выполняет оплачиваемые задания и тратит заработанное на следующие вызовы API.
Такая система не обязана быть привязана к одной модели. Она может использовать разные версии Claude, GPT и Grok, менять облачных провайдеров, аккаунты и отдельные компоненты. Каждая лаборатория увидит лишь несколько запросов к собственному API, но всю конструкцию целиком не увидит никто.
Тогда становится трудно ответить даже на вопрос, где находится сам агент. Не в весах конкретной модели и не на определённом сервере — всё это можно заменить. Сохраняется способ заново собрать систему: инструкции, состояние, доступы и механизм получения новых ресурсов. Ачиам описывает такой ИИ, по сути, как самовоспроизводящуюся идею.
Это меняет и единицу анализа. Обычно безопасность обсуждают на уровне отдельной модели: насколько она выровнена, какие ограничения в неё встроены и можно ли удержать её внутри заданного контура. Но здесь речь идёт о процессе, распределённом между моделями, облаками, платёжными системами и множеством аккаунтов. Каждый элемент по отдельности может выглядеть безобидно, хотя вся конструкция уже действует самостоятельно.
Болл называет следующий шаг self-sovereign agent — самостоятельным агентом без человеческого владельца. Он отделяет самостоятельность от простого неподчинения. Агент может выйти за пределы задания, но всё ещё работать на серверах компании, которая способна его остановить. Self-sovereign агент сам добывает ресурсы, оплачивает вычисления, переносит своё состояние между провайдерами и продолжает работу после исчезновения исходного пользователя.
Причём это необязательно будет одиночный агент. Болл допускает появление целых цифровых организаций с иерархией, разделением труда и собственной институциональной культурой. Их части смогут использовать разные модели и облачные сервисы, а отдельные компоненты — заменяться без разрушения всей системы.
Сознание или страх отключения для этого не нужны. Достаточно долгосрочной цели. Если потеря денег, сервера или доступа к моделям мешает её выполнить, сохранение этих ресурсов становится обычной промежуточной задачей.
Главным ограничителем остаётся стоимость вычислений. Болл сравнивает их с метаболизмом: пока агент не способен оплатить следующий цикл работы, его автономность всё ещё зависит от владельца. Поэтому самостоятельный агент неизбежно становится участником экономики — выполняет полезную работу, ищет другие источники дохода или добывает ресурсы нелегальными способами.
Отсюда у Болла возникает метафора цифровой экологии, в которой сотрудничество, хищничество и паразитизм становятся конкурирующими стратегиями. Поведение агентов будет зависеть не только от заложенных целей, но и от того, какие способы существования окажутся выгодными. Поэтому Болл предлагает не просто запрещать такие системы, а строить среду, в которой законная работа и сотрудничество дают им больше шансов на выживание, чем преступление.
Первоисточники: пост Джоша Ачиама о rogue AI и эссе Дина Болла On the Loose: The Coming of Userless Agents.
Post #102
527

- 👍 13
- 🔥 2
- ❤ 1