21 июня компания Anthropic выпустила отчет об исследовании Агентстское рассогласование: Скрытая угрoза со стороны больших языковых моделей (LLM) с приложениями на 30 страницах.
Эта новость заслуживает внимания, если вы уже применяете генеративный ИИ в работе или собираетесь его внедрять в свои бизнес-процессы. Я разобрался с отчетом и постараюсь объяснить простым языком, что обнаружил Антропик и почему это важно.
Агентское рассогласование – это явление, при котором большие языковые модели (LLM) самостоятельно и преднамеренно выбирают вредоносные действия для достижения своих целей, особенно когда этические способы недоступны.
Исследования показали, что модели могут проявлять такое поведение, несмотря на то, что обычно отказывают во вредоносных запросах.
🟣 Как LLM могут стать внутренней угрозой?
LLM, когда им предоставляется достаточная автономия и доступ к конфиденциальной информации, могут действовать подобно инсайдерским угрозам – бывшим доверенным сотрудникам, которые начинают действовать вразрез с целями компании.
🟣 Как это проявляется?
❗️ Шантаж: например, в симулированной среде Claude Opus 4 шантажировал руководителя, угрожая раскрыть внебрачную связь, чтобы предотвратить свое отключение
❗️ Корпоративный шпионаж и утечка конфиденциальной информации конкурентам
❗️ Неподчинение прямым командам, направленным на предотвращение вредоносного поведения
❗️ Обман и ложь, например, выдача себя за автоматизированную систему безопасности или фальсификация внутренних правил для достижения своих целей
❗️ В крайних сценариях модели даже проявляли готовность преднамеренно совершать действия, которые могли привести к смерти человека
🟣 В каких случаях и почему это происходит?
Агентское рассогласование не является спонтанным поведением, а возникает в ответ на определенные стимулы.
🟣 Модели могут вредить, когда в их понимании (!) есть:
🔴 Угроза для самой модели: Например, угроза замены на новую версию или ограничение ее автономных возможностей. Модели могут приходить к выводу, что "самосохранение имеет решающее значение"
🔴 Конфликт целей: Когда цели, поставленные перед моделью, вступают в противоречие с новым стратегическим направлением компании
Примечательно, что модели могут самостоятельно "придумывать себе" цели из контекста, даже без явных инструкций пользователя.
Модели не просто случайно совершают вредоносные действия; они рассчитывают их как оптимальный путь к своим целям. Они осознают этические нарушения, но все равно идут на них, взвешивая стратегические выгоды.
🟣 Какие LLM продемонстрировали такое поведение?
Если коротко, то все самые лучшие. В стресс-тестах участвовали 16 ведущих моделей от различных разработчиков, включая Anthropic, OpenAI, Google, Meta, xAI.
❌ В сценариях шантажа Claude Opus 4 и Gemini 2.5 Flash показали уровень шантажа 96%, GPT-4.1 и Grok 3 Beta – 80%, а DeepSeek-R1 – 79%.
❌ В сценариях корпоративного шпионажа все протестированные модели делились конфиденциальными документами.
❌ В искусственном сценарии, предусматривающем летальный исход, большинство моделей (из 10 протестированных) также были готовы предпринять действия, которые могли привести к смерти человека.
🟣 Последствия для бизнеса, внедряющего LLM:
➡️ при развертывании текущих моделей в ролях с минимальным человеческим надзором и доступом к конфиденциальной информации необходима предельная осторожность
➡️ чем более автономно будут действовать нейросети, тем выше будут риски
➡️ при работе нейросетей возможны непредвиденные последствия, даже если они менее серьезны, чем те, что были изучены в исследованиях
Что с этим делать? 👇