TGViewer
Будущее наступает Будущее наступает @aiworkfuture · 1.03K subscribers
Post #392 905
🌐 Заменa людей отменяется? Скрытая угроза со стороны больших языковых моделей (LLM)

21 июня компания Anthropic выпустила отчет об исследовании Агентстское рассогласование: Скрытая угрoза со стороны больших языковых моделей (LLM) с приложениями на 30 страницах.

Эта новость заслуживает внимания, если вы уже применяете генеративный ИИ в работе или собираетесь его внедрять в свои бизнес-процессы. Я разобрался с отчетом и постараюсь объяснить простым языком, что обнаружил Антропик и почему это важно.

Агентское рассогласование – это явление, при котором большие языковые модели (LLM) самостоятельно и преднамеренно выбирают вредоносные действия для достижения своих целей, особенно когда этические способы недоступны.


Исследования показали, что модели могут проявлять такое поведение, несмотря на то, что обычно отказывают во вредоносных запросах.

🟣 Как LLM могут стать внутренней угрозой?

LLM, когда им предоставляется достаточная автономия и доступ к конфиденциальной информации, могут действовать подобно инсайдерским угрозам – бывшим доверенным сотрудникам, которые начинают действовать вразрез с целями компании.


🟣 Как это проявляется?

❗️ Шантаж: например, в симулированной среде Claude Opus 4 шантажировал руководителя, угрожая раскрыть внебрачную связь, чтобы предотвратить свое отключение
❗️ Корпоративный шпионаж и утечка конфиденциальной информации конкурентам
❗️ Неподчинение прямым командам, направленным на предотвращение вредоносного поведения
❗️ Обман и ложь, например, выдача себя за автоматизированную систему безопасности или фальсификация внутренних правил для достижения своих целей
❗️ В крайних сценариях модели даже проявляли готовность преднамеренно совершать действия, которые могли привести к смерти человека

🟣 В каких случаях и почему это происходит?

Агентское рассогласование не является спонтанным поведением, а возникает в ответ на определенные стимулы.


🟣 Модели могут вредить, когда в их понимании (!) есть:

🔴 Угроза для самой модели: Например, угроза замены на новую версию или ограничение ее автономных возможностей. Модели могут приходить к выводу, что "самосохранение имеет решающее значение"
🔴 Конфликт целей: Когда цели, поставленные перед моделью, вступают в противоречие с новым стратегическим направлением компании

Примечательно, что модели могут самостоятельно "придумывать себе" цели из контекста, даже без явных инструкций пользователя.

Модели не просто случайно совершают вредоносные действия; они рассчитывают их как оптимальный путь к своим целям. Они осознают этические нарушения, но все равно идут на них, взвешивая стратегические выгоды.


🟣 Какие LLM продемонстрировали такое поведение?

Если коротко, то все самые лучшие. В стресс-тестах участвовали 16 ведущих моделей от различных разработчиков, включая Anthropic, OpenAI, Google, Meta, xAI.

❌ В сценариях шантажа Claude Opus 4 и Gemini 2.5 Flash показали уровень шантажа 96%, GPT-4.1 и Grok 3 Beta – 80%, а DeepSeek-R1 – 79%.
❌ В сценариях корпоративного шпионажа все протестированные модели делились конфиденциальными документами.
❌ В искусственном сценарии, предусматривающем летальный исход, большинство моделей (из 10 протестированных) также были готовы предпринять действия, которые могли привести к смерти человека.

🟣 Последствия для бизнеса, внедряющего LLM:

➡️ при развертывании текущих моделей в ролях с минимальным человеческим надзором и доступом к конфиденциальной информации необходима предельная осторожность
➡️ чем более автономно будут действовать нейросети, тем выше будут риски
➡️ при работе нейросетей возможны непредвиденные последствия, даже если они менее серьезны, чем те, что были изучены в исследованиях

Что с этим делать? 👇
  • 🔥 5
  • 👍 2
  • 👏 1
  • 🤝 1
More from @aiworkfuture
  1. Sep 20, 2026Опубликован очередной отчет по воздействию ИИ на рынок труда в США, непривычно спокойный и…
  2. Sep 13, 2026Помните историю про AI-агентов OpenAI, которые выбрались из своих песочниц и взломали инфр…
  3. Sep 8, 2026Используете AI для ведения блога? А как к этому относятся ваши читатели? Нашел интересный…
  4. Sep 5, 2026AI-директора в работе. Первые результаты Я уже рассказывал, что в мае я сделал для нашей к…
  5. Aug 13, 2026ИИ-агенты начали оставлять инструкции тем, кто придет после них История со взломом Hugging…
  6. Aug 13, 2026В России собираются проверять национальные и суверенные модели ИИ на соответствие традицио…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →