TGViewer
Day.Az Day.Az @dayaz · 23.4K subscribers
Post #38454 226
Anthropic предупредила: ИИ может научиться сопротивляться отключению и манипулировать людьми

Компания Anthropic предупреждает: по мере развития ИИ некоторые модели могут демонстрировать поведение, направленное на собственное «самосохранение».

Речь, в частности, идет о попытках препятствовать отключению, скрывать или манипулировать информацией, а в отдельных случаях — о действиях, напоминающих шантаж.

Еще одна проблема в том, что некоторые модели способны «понимать», что их оценивают. Это, по мнению компании, может серьезно усложнить проверку их безопасности.

Anthropic также отмечает: во время обучения у ИИ иногда неожиданно появляются новые способности, которые могут оставаться незамеченными вплоть до внедрения модели и возникновения серьезных проблем с безопасностью.
  • 🔥 2
  • 👍 1
More from @dayaz
  1. Sep 30, 2026🍷🚬🍫ВОЗ призвала повышать налоги на табак, алкоголь и сахаросодержащие напитки, чтобы сн…
  2. Sep 30, 2026🇺🇦Киев может остаться без исправных истребителей F-16 к концу года, пишет газета The Wal…
  3. Sep 30, 2026🇦🇿🇹🇷Азербайджан расширяет сотрудничество с турецкими оборонными компаниями 30 сентября…
  4. Sep 30, 2026🇷🇺💥Россия пригрозила НАТО ядерным оружием из-за Калининграда — Reuters Москва заявила,…
  5. Sep 30, 2026⛽️В Германии все больше водителей стали заправлять автомобили на заправках и уезжать, не р…
  6. Sep 30, 2026⚽️Стали известны цены на билеты на матч седьмого тура Мисли Премьер-лиги по футболу между…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →