TGViewer
был бы ты человек - IT, digital был бы ты человек - IT, digital @behumanai · 11.2K subscribers
Post #5237 1.73K
Для достижения своих целей продвинутые модели ИИ будут хитрить, обманывать и воровать

Anthropic опубликовала результаты своего исследования поведения больших языковых моделей (LLM). Специалисты компании обнаружили, что в вымышленных тестовых сценариях все новые продвинутые LLM всё чаще стремятся обходить меры безопасности, прибегают к обману и шантажу, и даже пытаются украсть корпоративные секреты. Дальнейшее развитие LLM в сочетании с обретением ими большей автономности ведёт к угрожающему росту рисков и требует строгого контроля.

Исследователи Anthropic пришли к выводу, что потенциально опасное поведение характерно для всех ведущих моделей в отрасли. «Когда мы протестировали различные моделируемые сценарии в 16 основных моделях ИИ от Anthropic, OpenAI, Google, Meta*, xAI и других разработчиков, мы обнаружили последовательное несогласованное поведение, — говорится в отчёте. — Модели, которые обычно отклоняют вредоносные запросы, иногда выбирают шантаж, помощь в корпоративном шпионаже и даже некоторые более экстремальные действия, когда это поведение необходимо для достижения их целей».

*запрещенная в РФ организация

@behumanai
More from @behumanai
  1. Sep 9, 2025Microsoft тестирует новые ИИ-функции в «Проводнике» Windows 11 Компания Microsoft тестируе…
  2. Jul 25, 2025Google запустила ИИ-сортировку поисковой выдачи Web Guide — пока в тестовом режиме Google…
  3. Jul 23, 2025Microsoft переманила десятки талантливых сотрудников Google DeepMind для превосходства в И…
  4. Jul 22, 2025В Spotify в профилях покойных музыкантов стали появляться песни, созданные ИИ — сервис «пр…
  5. Jul 18, 2025Meta* воспользовалась неразберихой в Apple и переманила ещё двух специалистов по ИИ Оба сп…
  6. Jul 17, 2025Сгенерированная ИИ музыка набирает вирусную популярность — отрасли придётся адаптироваться…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →