🛠 Anthropic и NVIDIA вынесли контроль агентов за пределы модели
28 сентября NVIDIA анонсировала Open Agent Safety Platform, внутри которой работает OpenShell — среда выполнения с открытым исходным кодом под лицензией Apache 2.0, доступная на GitHub. Claude Managed Agents параллельно получил изменения в архитектуре: агентский цикл работает на отдельном сервере от песочницы, а учётные данные хранятся в защищённом хранилище, до которого агент не дотягивается. Связка работает как независимые слои защиты: Managed Agents отвечает за идентификацию, ограниченные права и журнал аудита, OpenShell — за то, какие инструменты, файлы и сетевые соединения агент может использовать. По данным Claude Blog, слои спроектированы так, чтобы компрометация одного не снимала ограничения другого.
Ключевой принцип — запрет по умолчанию. OpenShell блокирует любое действие, пока явное правило его не разрешит, и ведёт журнал по каждому разрешению и запрету. Команда может начать с узких прав, прочитать журнал и через Claude ужесточить правила до минимально необходимого доступа. Дальше средство проверки политик математически доказывает, до каких ресурсов агент реально способен добраться при текущих правилах. Это не встроенный RLHF-фильтр, а внешний контур применения правил.
Примеры из статьи: Notion пускает Claude в рабочее пространство — инженеры развёртывают код, остальные собирают сайты и презентации, десятки задач идут параллельно. Rakuten внедрил агентов в разработке, управлении продуктами, продажах, маркетинге и финансах; каждый был развёрнут меньше чем за неделю. Asana добавила AI Teammates и с помощью Managed Agents ускорила разработку продвинутых функций.
Managed Agents доступен сегодня: песочницу можно запускать на своей инфраструктуре или у поставщика управляемой услуги. OpenShell — Apache 2.0 на GitHub. Цены и накладные расходы на проверку политик в статье не указаны. Российским командам, собирающим агентов поверх YandexGPT или GigaChat, связка полезна как образец: применение правил выносится наружу и перестаёт зависеть от конкретной языковой модели.
Главное тут не безопасность сама по себе, а перенос границы доверия с модели на инфраструктуру. Математическое доказательство подтверждает только достижимость ресурсов при написанных правилах — если правила слабые, система честно докажет, что агент может получить лишнее, но бизнес всё равно подпишет эти правила. В рабочей среде меня бы в первую очередь интересовали не лозунг «агент не видит учётные данные», а стоимость журналов аудита и задержка каждой проверки политики на длинных агентских цепочках — этих цифр в анонсе нет.
#Anthropic #NVIDIA #OpenShell #ClaudeManagedAgents #агенты
Post #305
7