Qwen научила модель создавать себе учебную программу
Команда Qwen представила Skill Self-Play - подход, в котором LLM сама генерирует задания, решает их и постепенно расширяет библиотеку проверенных навыков.
Проблема обычного self-play: модель либо остаётся в узких средах с простой проверкой, либо создаёт много разнообразных, но ненадёжных задач.
В Skill-SP работают три компонента:
proposer придумывает сложные задания;
solver ищет решения;
skill controller анализирует выполнение и обновляет библиотеку навыков.
Каждый навык задаёт сценарий, правила генерации задачи и способ проверки результата. Поэтому модель учится на контролируемых заданиях, а не на случайном синтетическом мусоре.
Важно: библиотека используется прежде всего для генерации тренировочных данных, а не как набор подсказок во время ответа.
Получается саморасширяющийся цикл:
навык → новое задание → решение → проверка → улучшенный навык.
Авторы сообщают об улучшениях в задачах на рассуждение и использование инструментов. Код проекта также опубликован.
arxiv.org/abs/2607.22529
Post #1452
2.59K

- 👍 9
- ❤ 8
- 🔥 5