TGViewer
Нейролента Нейролента @nairolenta · 22 subscribers
Post #308 6
🧠 AREX-2 обучает самосовершенствующихся агентов на последовательностях действий с проверкой

AREX-2 — агент на базе Qwen3.8-27B (27 млрд параметров), которого обучали улучшать собственные решения через длинные цепочки итераций. Для обучения синтезировали последовательности улучшений из задач машинного обучения и алгоритмического программирования — в этих областях каждое улучшение можно автоматически проверить. Такой подход с обучением с учителем дешевле ручной разметки и потому его легко расширять. Перенос на задачи глубокого исследования дал сильные результаты: 84.0 на BrowseComp и 52.6 на HLE, а на MLE-bench Lite агент набрал 81.8, на Frontier-CS — 70.7. Важно, что модель продолжает улучшаться с ростом числа итераций — способность к самоанализу не затухает.

→ MLE-bench Lite: 81.8; Frontier-CS: 70.7
→ BrowseComp: 84.0; HLE: 52.6 (глубокое исследование)
→ GAIA: 92.2; DeepSearchQA: 93.8
→ База: Qwen3.8-27B, подана на arXiv 29 сентября 2026

AREX-2 показывает, что «самосовершенствование» агента — это не автономный рост, а обучение с учителем на правильно выбранных данных с автоматической проверкой. Именно дешевизна проверки в задачах машинного обучения и алгоритмических задачах — главный рычаг, и он переносится на исследовательские бенчмарки без дополнительного дообучения. HLE на 52.6 честно напоминает, что универсальный исследователь ещё далеко, но рост числа итераций означает: качество можно повышать дополнительными итерациями, по данным arXiv.

#AREX2 #selfimproving #Qwen #syntheticdata #AIagents
More from @nairolenta
  1. Oct 4, 2026⚠️ Общий канал может перенести атаку между изолированными агентами 1 октября Simon Williso…
  2. Oct 4, 2026🛠 MCP-сервер пишется за вечер, а работа в рабочей среде начинается после Агент написал MC…
  3. Oct 4, 2026⚠️ Apple ужесточит доступ ИИ-агентов к файлам Mac 2 октября Apple объявила о новых огранич…
  4. Oct 4, 2026📊 Цена решённой задачи важнее тарифа на токены На 3 октября в индексе Artificial Analysis…
  5. Oct 3, 2026🛠 Агент NVIDIA сократил число токенов на 49% в среде GPT-5.6 Sol Сама модель не менялась…
  6. Oct 3, 2026⚠️ GLM-5.3 — открытая модель с автономными киберэксплойтами и слабой защитой Zhipu AI выпу…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →