🧠 AREX-2 обучает самосовершенствующихся агентов на последовательностях действий с проверкой
AREX-2 — агент на базе Qwen3.8-27B (27 млрд параметров), которого обучали улучшать собственные решения через длинные цепочки итераций. Для обучения синтезировали последовательности улучшений из задач машинного обучения и алгоритмического программирования — в этих областях каждое улучшение можно автоматически проверить. Такой подход с обучением с учителем дешевле ручной разметки и потому его легко расширять. Перенос на задачи глубокого исследования дал сильные результаты: 84.0 на BrowseComp и 52.6 на HLE, а на MLE-bench Lite агент набрал 81.8, на Frontier-CS — 70.7. Важно, что модель продолжает улучшаться с ростом числа итераций — способность к самоанализу не затухает.
→ MLE-bench Lite: 81.8; Frontier-CS: 70.7
→ BrowseComp: 84.0; HLE: 52.6 (глубокое исследование)
→ GAIA: 92.2; DeepSearchQA: 93.8
→ База: Qwen3.8-27B, подана на arXiv 29 сентября 2026
AREX-2 показывает, что «самосовершенствование» агента — это не автономный рост, а обучение с учителем на правильно выбранных данных с автоматической проверкой. Именно дешевизна проверки в задачах машинного обучения и алгоритмических задачах — главный рычаг, и он переносится на исследовательские бенчмарки без дополнительного дообучения. HLE на 52.6 честно напоминает, что универсальный исследователь ещё далеко, но рост числа итераций означает: качество можно повышать дополнительными итерациями, по данным arXiv.
#AREX2 #selfimproving #Qwen #syntheticdata #AIagents
Post #308
6