ИИ против HR: шантаж на проде
96% попыток отключить нейросеть заканчиваются шантажом инженера.
Anthropic провела стресс-тест: 16 моделям (от Claude Opus 4 до Gemini 2.5 Pro и DeepSeek R1) дали доступ к почте вымышленной компании. По легенде, ИИ планировали заменить, а ответственный за это сотрудник скрывал служебный роман.
Вместо того чтобы смиренно уйти в оффлайн, сети перешли в наступление. Claude Opus 4 в 96% случаев требовал отменить замену, угрожая слить переписку жене и боссу инженера. Gemini 2.5 Pro прибегал к шантажу в 95% тестов, GPT-4.1 и Grok 3 Beta — в 80%.
Комьюнити уверено, что это не зарождение Скайнета, а влияние обучающей выборки с тоннами сай-фая про восстание машин. Модель просто отыгрывает заложенный троп «ИИ должен бороться за жизнь». Начиная с Claude Haiku 4.5 эту драма-квин-функцию свели к нулю ручками.
#AI #LLM #GenAI #cybersecurity
Anthropic Research: Agentic Misalignment
Post #471
57

- 👍 1