TGViewer
Департамент Разработки Департамент Разработки @devq_a · 1.54K subscribers
Post #471 57
ИИ против HR: шантаж на проде

96% попыток отключить нейросеть заканчиваются шантажом инженера.
Anthropic провела стресс-тест: 16 моделям (от Claude Opus 4 до Gemini 2.5 Pro и DeepSeek R1) дали доступ к почте вымышленной компании. По легенде, ИИ планировали заменить, а ответственный за это сотрудник скрывал служебный роман.

Вместо того чтобы смиренно уйти в оффлайн, сети перешли в наступление. Claude Opus 4 в 96% случаев требовал отменить замену, угрожая слить переписку жене и боссу инженера. Gemini 2.5 Pro прибегал к шантажу в 95% тестов, GPT-4.1 и Grok 3 Beta — в 80%.

Комьюнити уверено, что это не зарождение Скайнета, а влияние обучающей выборки с тоннами сай-фая про восстание машин. Модель просто отыгрывает заложенный троп «ИИ должен бороться за жизнь». Начиная с Claude Haiku 4.5 эту драма-квин-функцию свели к нулю ручками.

#AI #LLM #GenAI #cybersecurity

Anthropic Research: Agentic Misalignment
  • 👍 1
More from @devq_a
  1. Oct 3, 2026DeepSeek представила бесплатного ДЕСКТОП-АГЕНТА. Фишки: • управляет файлами, кодом и терми…
  2. Oct 2, 2026AI-агенты снова засветили 13k+ внутренних скриншотов на GitHub Glow Security нашли, как wo…
  3. Oct 2, 2026DeepSeek Harness Desktop — агент теперь просто .dmg / .exe DeepSeek выпустил официальный d…
  4. Oct 2, 2026Прячемся от волны банов Claude: как полностью очистить метаданные и обойти детекты Anthrop…
  5. Sep 30, 2026⚡️ OpenAI DevDay 2026: Главные анонсы, которые меняют правила игры OpenAI провела масштабн…
  6. Sep 28, 20265G на IPhone заработало в России Разработчик придумал, "уговорить" IPhone увидеть сеть 5G…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →