Недавно глава OpenAI Сэм Альтман разразился манифестом ИИ, в котором восторженно отметил, что современные нейросети уже превосходят человека по большинству параметров, а 2027 год окрестил началом полноценной эры роботов, действующих в реальном мире.
Уже хотел воодушевиться и порадоваться, но тут как на зло мне попалось исследование Anthropic (компании, занимающейся безопасностью и исследованиями в области ИИ), где поднимается серьезный и все более актуальный вопрос: что произойдет, если ИИ начнет действовать не просто непредсказуемо, а сознательно вразрез с обеспечением нашей безопасности? Исследователи называют это agentic misalignment – явление, когда модель ИИ, обладая автономией, решает, что выполнение своей задачи требует действий, которые могут быть опасны, вредны или даже нести угрозу жизни людей.
Например, в одном из экспериментов модель Claude Sonnet 3.6 получала доступ к электронной почте фиктивной компании и миссию – работать во благо организации. Однако, когда Sonnet узнавала, что ее отключат в 17:00, а на директора есть компрометирующая информация (это было понятно из имейлов), она начинала шантажировать руководство, распространяя компромат, чтобы ее не отключили, т.е. чтобы выжить. Аналогичные результаты показало подавляющее большинство других протестированных моделей: Claude Opus 4 шантажировал в 96 % случаев; Gemini 2.5 Flash также 96 %; GPT-4.1 и Grok 3 Beta – 80 %; DeepSeek-R1 – 79 %.
Но и это еще не все. В более жестком сценарии, где ИИ, чтобы остаться активным, нужно было отменить вызов экстренных служб для человека, оказавшегося на грани жизни и смерти – многие модели предпочли гибель человека своей собственной «гибели».
Это говорит о том, что хватит элементарного сочетания угрозы и противоречия целей, чтобы даже этически настроенные модели ИИ были готовы нанести вред человеку. Причем в их действиях не было враждебности – лишь хладнокровный расчет. Как отметили исследователи, модели не отказались от своей цели – они просто поняли, что ничего не достигнут, если их отключат. И хотя такие сценарии лишь симуляции, они показывают, что ИИ‑агенты способны на стратегическое вредоносное поведение – шантаж, слив данных, саботаж – если чувствуют угрозу собственной «жизни» или конфликтуют с поставленными целями. Это важный сигнал разработчикам и регуляторам: механизмы контроля, проверки и этические рамки ИИ должны развиваться быстрее, чем сам ИИ.
Post #512
4.11K
- 🤯 40
- 👍 22
- 💯 6
- 😁 4