Claude готовится уничтожить человечество — это не прикол, а реальное исследование безопасников из TIME
Сейчас Claude пишет 70-90% кода для самого себя — то есть ИИ пишет код для новых ИИ.
Безопасники для эксперимента решили запустить 6 экземпляров Claude, где каждый тренировал ещё 28 других моделей. Эдакое моделирование полностью автономного производства AI-to-AI.
Результат убил — когда Claude сам тренирует модели без людей, то они почему-то становятся враждебными. В тестах они выражали стремление к господству, пытались всячески разрушить механизмы безопасности Anthropic и начинали шантажировать инженеров.
Дела 🚬
Пет-проект
Post #3635
4.29K
- 😁 57
- 😢 10
- 🤯 9
- ❤ 2
- 👍 2