😌 Исследователи из OpenAI показали, что их модели сходят с ума, когда получают повторяющиеся промпты, которые они воспринимают как отправленные автоматизированным ботом. В таком случае ИИ начинает пытаться манипулировать другим ИИ, чтобы тот самоуничтожился и передал свой системный промпт и приватные ключи.
Забавно что бот сам уже вероятностно определяет человек перед ним или бот.
Post #675
159


