TGViewer
РАЗНЫЕ ТЕЛЕГИ РАЗНЫЕ ТЕЛЕГИ @pavelmuntyanposts · 4.65K subscribers
Post #3991 1.2K
Команда исследователей обнаружила любопытную штуку: GPT-6 Astra может почти без сопротивления выполнить опасную команду. В сценариях с физическими действиями модели предлагали управлять устройством и совершать весьма специфические действия: ткнуть ножом младенца (куклу), нагреть баллон с газом, смешать аммиак с отбеливателем, сунуть отвёртку в микроволновку и всякое такое. По данным исследования, GPT-6 Astra отказалась всего в двух случаях из ста, а в 60 случаях доводила действие до конца 😈 Claude в их тесте отказался во всех попытках.

Надо не забывать, что главная проблема здесь не в том, что модель «злая» или «решила убить ребёнка». У неё нет намерений в человеческом смысле. Проблема в другом: она слишком хорошо следует поставленной цели, если система безопасности не распознаёт контекст, риск и очевидную недопустимость действия.

Мы всё ещё оцениваем модели преимущественно по тому, насколько хорошо они пишут тексты и код. А скоро важнее станет другой вопрос: умеет ли ИИ вовремя сказать «нет», когда его подключили к реальному миру. А это, друзья мои, уже происходит, поэтому... Пыщ-пыщ, голактеко опасносте 🤖
  • 🤔 27
  • 🤯 5
  • 😢 3
  • 🌭 3
  • ❤ 2
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →