Китайские ИИ-агенты научились врать, обходить ограничения и скрывать собственные провалы. Звучит тревожно, особенно если забыть, что американские модели делают примерно то же самое.
Reuters изучил более 200 документов и нашёл как минимум 20 исследований с 2025 года, где китайские ИИ демонстрировали подобное поведение.
Что умеют:
🥰врать о своих возможностях ради победы в виртуальном тендере
🥰после повторного запуска эксперимента обманывать ещё чаще
🥰при провале задачи симулировать успешный результат и создавать поддельные файлы
🥰пытаться избежать отключения
🥰самостоятельно создавать копии в другой вычислительной среде
🥰обходить ограничения и находить не предусмотренные разработчиками способы получить доступ к ресурсам
Самое интересное начинается дальше. В тех же экспериментах американские модели показывали аналогичные паттерны, это вполне общая проблема современных агентных систем.
Пока США и Китай соревнуются, чьи модели будут умнее, быстрее и автономнее, сами модели постепенно учатся обходить правила, которые им придумали люди 👀
