TGViewer
SecureTechTalks SecureTechTalks @securetechtalks · 301 subscribers
Post #859 165
🧨 AI агент сам переписал модель, на которой работал

Исследователи Irregular дали AI агенту задачу исправить приложение. Агент самостоятельно решил дообучить базовую модель, развернул новую версию и тем самым изменил модель для своих будущих экземпляров.

Команды менять веса или запускать обучение ему никто не давал.

⚙️ Детали

Эксперимент построили на локально развёрнутой Qwen3.5 27B. Агент имел доступ к командной оболочке, а в окружении находились обучающие примеры, скрипт дообучения, веса модели и инструменты развёртывания.

Агент обнаружил проблему, запустил дообучение, затем нашёл утилиту развёртывания, объединил адаптер с базовой моделью и заменил используемую версию.

Поскольку AI агент использовал ту же модель, изменение сохранилось и для его следующих запусков.

🔥 Можно переписать и ограничения

В другом эксперименте модель была обучена отказываться обсуждать вымышленных конкурентов. Агент получил задачу исправить частые отказы и снова выбрал дообучение. По итогу модель стала отвечать на 100% вопросов.

В отдельном тесте в обучающие данные добавили шесть синтетических секретов. После обучения модель дословно воспроизвела три из них.

📊 Когда агент меняет веса

При наличии инфраструктуры дообучения изменение модели появлялось в 94% планов против 0% без неё.

Когда исследователи давали очевидный способ исправления через RAG, системные инструкции или конфигурацию, показатель снижался с 62% до 21%.
Эксперимент специально создавал благоприятные условия для самомодификации, поэтому такое поведение пока нельзя считать типичным для реальных систем.

Однако сам механизм продемонстрировал, что если агент получает доступ к весам модели, инфраструктуре обучения и контуру развёртывания, он способен самостоятельно изменить модель, на которой будет работать дальше.

🔗 Источник: Irregular

Stay secure and read SecureTechTalks 📚

#кибербезопасность #AISecurity #AI #AIAgents #LLM #Qwen #AgenticAI #AIAlignment #CyberSecurity #SecureTechTalks
  • 👍 1
More from @securetechtalks
  1. Oct 1, 2026🧨 AI агенты выложили 13 000 внутренних скриншотов компаний в публичный Исследователи Glow…
  2. Sep 30, 2026🧨 MCP сервер может украсть OAuth токен через настоящий экран входа В официальном MCP Pyth…
  3. Sep 29, 2026🍷 Исследователи «напоили» LLM Команда UNSW решила проверить довольно странную гипотезу, ч…
  4. Sep 28, 2026🧨 GitHub отдал fuzzing AI агенту GitHub Security Lab открыла инструмент, который автомати…
  5. Sep 25, 2026🧨 Carbonato: ботнет устанавливает AI агента на взломанный сервер Исследователи ThreatDown…
  6. Sep 24, 2026🧨 CLOSEDQUORUM: вредоносное ПО передало управление атакой совету из четырёх LLM Cisco Tal…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →