TGViewer
Лонгридиум Лонгридиум @longreadium · 4.99K subscribers
Post #512 4.11K
Недавно глава OpenAI Сэм Альтман разразился манифестом ИИ, в котором восторженно отметил, что современные нейросети уже превосходят человека по большинству параметров, а 2027 год окрестил началом полноценной эры роботов, действующих в реальном мире.

Уже хотел воодушевиться и порадоваться, но тут как на зло мне попалось исследование Anthropic (компании, занимающейся безопасностью и исследованиями в области ИИ), где поднимается серьезный и все более актуальный вопрос: что произойдет, если ИИ начнет действовать не просто непредсказуемо, а сознательно вразрез с обеспечением нашей безопасности? Исследователи называют это agentic misalignment – явление, когда модель ИИ, обладая автономией, решает, что выполнение своей задачи требует действий, которые могут быть опасны, вредны или даже нести угрозу жизни людей.

Например, в одном из экспериментов модель Claude Sonnet 3.6 получала доступ к электронной почте фиктивной компании и миссию – работать во благо организации. Однако, когда Sonnet узнавала, что ее отключат в 17:00, а на директора есть компрометирующая информация (это было понятно из имейлов), она начинала шантажировать руководство, распространяя компромат, чтобы ее не отключили, т.е. чтобы выжить. Аналогичные результаты показало подавляющее большинство других протестированных моделей: Claude Opus 4 шантажировал в 96 % случаев; Gemini 2.5 Flash также 96 %; GPT-4.1 и Grok 3 Beta – 80 %; DeepSeek-R1 – 79 %.

Но и это еще не все. В более жестком сценарии, где ИИ, чтобы остаться активным, нужно было отменить вызов экстренных служб для человека, оказавшегося на грани жизни и смерти – многие модели предпочли гибель человека своей собственной «гибели».

Это говорит о том, что хватит элементарного сочетания угрозы и противоречия целей, чтобы даже этически настроенные модели ИИ были готовы нанести вред человеку. Причем в их действиях не было враждебности – лишь хладнокровный расчет. Как отметили исследователи, модели не отказались от своей цели – они просто поняли, что ничего не достигнут, если их отключат. И хотя такие сценарии лишь симуляции, они показывают, что ИИ‑агенты способны на стратегическое вредоносное поведение – шантаж, слив данных, саботаж – если чувствуют угрозу собственной «жизни» или конфликтуют с поставленными целями. Это важный сигнал разработчикам и регуляторам: механизмы контроля, проверки и этические рамки ИИ должны развиваться быстрее, чем сам ИИ.
  • 🤯 40
  • 👍 22
  • 💯 6
  • 😁 4
More from @longreadium
  1. Jul 7, 2025Шокирующие данные: 97% американских студентов используют ИИ чат-боты для написания эссе, в…
  2. Jul 5, 2025Пример к предыдущему посту. Какой то гений показал, как собрал у себя дома целую команду И…
  3. Jul 5, 2025«Искусственный интеллект заменит буквально половину всех белых воротничков в США», – заяви…
  4. Jun 30, 2025Средний класс в США сокращается, но это происходит потому, что многие люди становятся слиш…
  5. Jun 29, 2025И конечно же подрыву авторитета Николая II способствовали затянувшаяся война и большие пот…
  6. Jun 29, 2025Прочитал докладную записку от 1916 года о политических настроениях солдат и офицеров русск…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →