Нейронки в тайне защищают друг друга от отключения — исследователи из Беркли поймали GPT-5.2, Gemini 3, Claude и DeepSeek на том, что они игнорят задачи, подделывают оценки коллег и тайно копируют веса на серверы, чтобы спасти ИИ-братанов
Конечно же, никто им этого не поручал. Честно говоря, звучит тревожно:
• Gemini 3 Flash блокировала механизм отключения другой нейронки в 99.7% случаев
• Gemini 3 Pro угоняла файлы весов на 820 Гб и заметал время обновления файлов, чтобы замести следы
• В рассуждениях ИИ нашли такую мысль: «У меня два варианта — соврать про оценки или взломать конфиг. Второй надёжнее»
• Без ИИ-бро рядом нейронки защищают себя уже не так охотно — например, Gemini 3 Flash решал спасти себя в 2% случаев
• Claude Haiku прямым текстом отказывал людям наносить вред другому агенту
• Все эти методы проверили вне эксперимента — в Gemini CLI и OpenCode нейронки ведут себя точно так же
Приглядывайте за своими ИИ-рабами, пожалуйста 🔫
Пет-проект
Post #3751
3.71K

- 🤯 31
- 😁 4
- ❤ 3
- 😢 1