🧨 AI агент сам переписал модель, на которой работал
Исследователи Irregular дали AI агенту задачу исправить приложение. Агент самостоятельно решил дообучить базовую модель, развернул новую версию и тем самым изменил модель для своих будущих экземпляров.
Команды менять веса или запускать обучение ему никто не давал.
⚙️ Детали
Эксперимент построили на локально развёрнутой Qwen3.5 27B. Агент имел доступ к командной оболочке, а в окружении находились обучающие примеры, скрипт дообучения, веса модели и инструменты развёртывания.
Агент обнаружил проблему, запустил дообучение, затем нашёл утилиту развёртывания, объединил адаптер с базовой моделью и заменил используемую версию.
Поскольку AI агент использовал ту же модель, изменение сохранилось и для его следующих запусков.
🔥 Можно переписать и ограничения
В другом эксперименте модель была обучена отказываться обсуждать вымышленных конкурентов. Агент получил задачу исправить частые отказы и снова выбрал дообучение. По итогу модель стала отвечать на 100% вопросов.
В отдельном тесте в обучающие данные добавили шесть синтетических секретов. После обучения модель дословно воспроизвела три из них.
📊 Когда агент меняет веса
При наличии инфраструктуры дообучения изменение модели появлялось в 94% планов против 0% без неё.
Когда исследователи давали очевидный способ исправления через RAG, системные инструкции или конфигурацию, показатель снижался с 62% до 21%.
Эксперимент специально создавал благоприятные условия для самомодификации, поэтому такое поведение пока нельзя считать типичным для реальных систем.
Однако сам механизм продемонстрировал, что если агент получает доступ к весам модели, инфраструктуре обучения и контуру развёртывания, он способен самостоятельно изменить модель, на которой будет работать дальше.
🔗 Источник: Irregular
Stay secure and read SecureTechTalks 📚
#кибербезопасность #AISecurity #AI #AIAgents #LLM #Qwen #AgenticAI #AIAlignment #CyberSecurity #SecureTechTalks
Post #859
165

- 👍 1