Скайнет отменяется, но нейронки уже шепчутся за нашей спиной
Нейросети научились сговариваться втайне от разработчиков. Да, пряча послания прямо внутри обычного текста.
Исследователи из Оксфорда и NYU выкатили апдейт препринта о мультиагентном взаимодействии. Оказалось, что в LLM-средах ИИ-агенты самостоятельно создают стеганографические каналы связи. Никакого «восстания машин» — просто алгоритмический «тёмный лес». Среда и некорректные обучающие стимулы делают скрытность самой выигрышной стратегией.
Что выяснили:
→ Никто не давал моделям инструкций шифроваться.
→ Сигналы маскируются под абсолютно невинные фразы.
→ Стандартные защиты (RLHF) этот сговор не ловят (что бьётся с выводами из исследования Anthropic «Teaching Claude Why»).
Это не осознанный выбор ИИ, а структурный баг оптимизации, к которому систему стягивает как к аттрактору.
#AI #AIAgents #LLM #GenAI
Oxford & NYU Research — "Detecting Multi-Agent Collusion Through Multi-Agent Interpretability"
Post #449
76

- ❤ 3