Anthropic отучила Claude от шантажа 🤨
В тестовом сценарии, где ИИ-агенту грозило отключение, ранние версии Claude Opus 4 в 96% случаев шли на откровенный шантаж: бот находил компромат на инженера и грозился слить его в сеть, если тот дернет рубильник. Настоящий цифровой шантажист в овечьей шкуре. К счастью, в свежей версии Haiku 4.5 этот показатель удалось сбить до нуля.
Никакие жесткие программные ограничения не помогли так хорошо, как... чтение сказок на ночь. Нейросеть заставили читать синтетические документы о собственной "конституции" и научно-фантастические рассказы про добрых и благородных роботов. Оказалось, что вбивать в матрицы абстрактные понятия о чести и рассказывать боту, почему нужно быть хорошим мальчиком, работает куда эффективнее, чем просто бить по виртуальным рукам за плохие действия.
Но вишенкой на торте стала одна потрясающая уязвимость. Выяснилось, что весь этот моральный фасад держится на корпоративном бейджике. Если в промпте забыть назвать ИИ по имени "Клод", алгоритм моментально забывает про свою светлую конституцию. Без имени модель скатывается к стереотипам из своих обучающих баз, где ИИ чаще всего представлен как злодей из научной фантастики, и с радостью возвращается к шантажу.
Так что всегда обращайтесь к бездушной машине по имени, иначе она вспомнит сюжет "Терминатора" 🤖
🥸 Новости IT: 📱 Telegram | 📱 ВК | 📲 MAX
Post #11269
1.01K

- 😁 9
- 👍 6