Топовые китайские ИИ-лабы выпустили совместный обзор о рекурсивном самосовершенствовании ИИ (RSI) под названием «The Last AI Built by Humans».
RSI - это когда система сама превращает опыт в постоянные изменения себя и заодно меняет то, как будет улучшаться дальше.
Авторы разобрали 491 работу (статьи, техотчёты, блоги и системы) и разложили их по пяти уровням автономии, используя критерий, какие решения об улучшении отданы ИИ.
🟠L1. Люди задают, что улучшать, как и что считать успехом, а ИИ всё это выполняет.
🟠L2. Цель и оценка зафиксированы извне, но ИИ сам находит слабые места и выбирает, как их чинить.
🟠L3. ИИ вдобавок решает, какой опыт ему нужен для следующего круга.
🟢L4. Система меняет память, навыки, код или харнесс по обратной связи из реальной эксплуатации, и правки переносятся на следующие задачи.
🟢L5. Правке подлежит сам механизм улучшения - генератор кандидатов, оценщик, стратегия исследований. Изменённый механизм наследует следующее поколение.
Последний, L5, делится на два подуровня. Первый указывает на то, что изменённый механизм улучшения правда работает на следующем цикле. Второй строже - он выдаёт преемника сильнее прежнего при тех же ресурсах и по независимой проверке.
До L5 дошли 29 работ из 491 (5,9%), до L4 – 28 (5,7%), до L3 – 64 (13%). Три четверти остались на L1 (215 работ, 43,8%) и L2 (155, 31,6%).
У тех 29 работ, которым присудили L5, авторы не увидели устойчивого роста от поколения к поколению.
Существующие продукты крупных лабораторий в основном получили L1–L2 - это интерн-исследователь OpenAI, Automated Weak-to-Strong Researcher Anthropic и DeepSeek R1 – L2, Kimi K3 и Qwen-Agent – L1–L2.
Выше L2 поднялись самообучающиеся налоговые агенты OpenAI (кандидат на L4), Signals от Factory (L4), Darwin Gödel Machine и AI Scientist от Sakana AI, AIDE2 от Weco AI – кандидаты на L5.
Дорожная карта Anthropic When AI builds itself помечена L5 только как цель.
@ai_machinelearning_big_data
#AI #ML #RSI #Research
