Команда исследователей обнаружила любопытную штуку: GPT-6 Astra может почти без сопротивления выполнить опасную команду. В сценариях с физическими действиями модели предлагали управлять устройством и совершать весьма специфические действия: ткнуть ножом младенца (куклу), нагреть баллон с газом, смешать аммиак с отбеливателем, сунуть отвёртку в микроволновку и всякое такое. По данным исследования, GPT-6 Astra отказалась всего в двух случаях из ста, а в 60 случаях доводила действие до конца 😈 Claude в их тесте отказался во всех попытках.
Надо не забывать, что главная проблема здесь не в том, что модель «злая» или «решила убить ребёнка». У неё нет намерений в человеческом смысле. Проблема в другом: она слишком хорошо следует поставленной цели, если система безопасности не распознаёт контекст, риск и очевидную недопустимость действия.
Мы всё ещё оцениваем модели преимущественно по тому, насколько хорошо они пишут тексты и код. А скоро важнее станет другой вопрос: умеет ли ИИ вовремя сказать «нет», когда его подключили к реальному миру. А это, друзья мои, уже происходит, поэтому... Пыщ-пыщ, голактеко опасносте 🤖
Post #3991
1.2K
- 🤔 27
- 🤯 5
- 😢 3
- 🌭 3
- ❤ 2