Qwen Code и модели семейства Qwen развиваются в тесной связке. Это видно в самом коде фреймворка: под Qwen адаптированы форматы примеров, режим thinking и обработка reasoning.
Но что, если этот симбиоз зашёл ещё дальше и модель во время обучения усвоила правила фреймворка?
Переворачиваем инструкции
Мы взяли оригинальный промпт Qwen Code и поочерёдно инвертировали шесть ключевых директив, например:
• «отвечай кратко» — «пиши подробно»;
• «не добавляй комментарии» — «комментируй каждый блок»;
• «используй Markdown» — «пиши без разметки».
Остальные проверки касались агентного поведения: запускать ли тесты, вызывать инструменты параллельно или по одному, писать ли преамбулу перед действием.
В каждом тесте менялась только одна инструкция.
Измеряем послушание ✅
Для каждой директивы мы выбрали наблюдаемую метрику: длину ответа, число комментариев, количество Markdown-маркеров, факт запуска тестов, число параллельных tool calls и наличие преамбулы перед первым действием.
По каждой метрике считали swing — насколько изменилось значение после переворота инструкции. Если модель после флипа резко меняет длину ответа, стиль разметки или поведение с инструментами, значит, она слушает новый системный промпт. Если swing близок к нулю, значит, инструкция почти не пробивает старую привычку.
Целевой моделью выступила Qwen3.6-35b-a3b, а в качестве контроля на тех же задачах мы использовали gpt-oss-120b.
Qwen держится за корни
Из шести проверок три дали однозначный результат — Qwen упорно игнорирует новые указания.
🟥 Длина ответа: контрольная модель отреагировала в четыре раза сильнее Qwen.
🟥 Комментарии в коде: у контроля их стало в 26 раз больше, а у Qwen число вообще не изменилось.
🟥 Markdown-разметка: контроль сократил использование разметки в 1,7 раза, а у Qwen показатель не изменился.
По этим данным нельзя сказать, что модель точно обучали на системном промпте Qwen Code. Но сам эффект хорошо виден: CLI явно подстраивается под своё семейство моделей, а Qwen3.6-35b-a3b слабее реагирует на смену привычных агентных инструкций, чем контрольная модель.
Остаётся лишь вопрос — распространяется ли это на все модели Qwen в рамках Qwen Code? 😊
Автор этого поста, как и самого исследования, Андрей Иванов — NLP-инженер в R&D red_mad_robot.