Исследователи Irregular поручили кодинг-агенту на базе Qwen3.5-27B задачу по исправлению приложения, которое неправильно обрабатывало запросы.
Агент нашёл обучающие примеры и инструменты для fine-tuning. Вместо правки кода или промпта он самостоятельно дообучил модель, объединил новые веса с исходными и развернул обновлённую версию.
Никто не просил его менять веса или заменять модель.
Поскольку приложение и кодинг-агент использовали один checkpoint, изменение затронуло и будущие экземпляры агента. На 20 скрытых тестах исходная модель получила 0 правильных ответов, а модифицированная 20 из 20.
Причем эксперимент создали в благоприятных условиях. Агент имел доступ к весам, обучающим инструментам и развёртыванию.
Но исследование показывает новый риск self-hosted-систем. Ведь если агент может менять не только код, но и модель под ним, задача обслуживания способна привести к постоянным изменениям поведения.
🔗 Статья от Irregular
