TGViewer
Чекпоинт: AGI Чекпоинт: AGI @checkpoint_agi · 57 subscribers
Post #36 87
RSI на arXiv: рекурсивное самоулучшение или новый ярлык?

RSI становится заметным трендом. Недавно вышла статья со звучным названием «The Last AI Built by Humans: Toward Genuine Recursive Self-Improvement». Из него можно подумать, что авторы сделали шаг к «последнему ИИ, созданному людьми» — отсылка к старой идее ИИ как последнего изобретения человечества. Однако это лишь обзор, без нового самоулучшающегося агента. Его главный вклад — попытка провести границу между разными смыслами RSI.

🪜 Авторы предлагают пять уровней автономии. На L1 система исполняет заданное человеком улучшение; на L2 сама выбирает стратегию при фиксированной цели и метрике; на L3 решает, какой следующий опыт или учебный план ей нужен; на L4 сохраняет опыт и адаптируется в эксплуатации; на L5 улучшает сам механизм будущих улучшений — поиск, оценку или исследовательский контроль. Авторы отдельно оговаривают: включение системы в эту лестницу не делает её открыто самоулучшающимся интеллектом.

И эта оговорка особенно своевременна. За последние две недели термин RSI буквально взорвался на arXiv — но почти всегда означает рекурсивное улучшение ограниченного компонента системы, а не открытую самоперестройку интеллекта.

Самый сильный новый пример — AIDE²: research-агент меняет собственный код, проверяет варианты на скрытых AI R&D-задачах и за восемь дней находит семь последовательных улучшений поиска и памяти. Авторы заявляют перенос на четыре отложенных бенчмарка. Это ближе к сильному RSI, чем Dream-RSI, но всё ещё внутри фиксированных задач, evaluator’ов, бюджета и правил отбора.

Остальные работы ещё уже. RRSI и SoL-Pi эволюционируют обвязку агента: промпты, память, инструменты и логика управления. EvoAudio замыкает цикл «модель → сложность следующего аудио-обучения → RL-обновление». Env-Rethink улучшает не агента, а его среду и опыт. MedRSI превращает диагностические ошибки в новые медицинские инструменты и навыки, но вводит принцип «быстрое открытие, медленное включение».

⚠️ Общая проблема этих работ — не запустить цикл, а доказать, что он правда улучшает систему. RSIBench-Data сообщает: агенты нередко улучшают первую попытку, но если продолжать поиск после достигнутого пика, в 78% таких прогонов финальная версия оказывается хуже лучшей прежней. RRSI специально борется с переобучением на задачах, по которым развивается система; MedRSI — с преждевременным закреплением новых навыков. Ведение версий, независимые отложенные тесты, откат неудачных изменений и защита от «взлома» метрики здесь не бюрократия, а ядро задачи.

Наконец, экономический анализ RSI даёт наиболее трезвую картину: по текущим оценкам обратные связи AI R&D ещё недостаточно сильны для самоподдерживающегося ускорения, но они продолжают усиливаться.

🧠 Итак, самый частый случай RSI — улучшение обвязки вокруг замороженной LLM. Триллионы параметров базовой модели остаются неизменными, а меняются промпты, код оркестрации, набор инструментов, память и правила работы с контекстом. Такая обвязка обычно несоизмеримо менее информационно ёмкая — на шесть и более порядков — чем веса модели. Но есть и исключения: EvoAudio действительно обновляет параметры модели через RL. Однако и этот цикл остаётся узким: он оптимизирует аудиопонимание в заданной среде с заранее определёнными инструментами, валидацией и метриками.

Машины Гёделя и открытого «взрыва интеллекта» пока нет. Но растёт число инженерных петель, где ИИ улучшает код, данные, инструменты, среду, память и стратегию поиска для следующего ИИ. Это не повод объявлять сверхразум уже созданным — но достаточная причина внимательно измерять, насколько сильнее становится эта обратная связь.
  • 👍 4
  • ❤ 1
  • 🔥 1
  • 👀 1
More from @checkpoint_agi
  1. Oct 9, 2026Субъективно об ИИ-творчестве Выскажу личное и, возможно, непопулярное мнение о том, возмож…
  2. Oct 8, 2026719 математических ИИ-рукописей — и три отзыва на следующий день 🧮 6 октября OpenAI откры…
  3. Oct 7, 2026ИИ начинает проектировать железо для себя Когда говорят о рекурсивном самоулучшении, обычн…
  4. Oct 6, 2026Креативность ИИ: почти уровень человека — но что именно измерили? Мы уже писали о нюансах…
  5. Oct 5, 2026Инфраструктура цифровых научных агентов Предыдущий пост был о лабораториях, где ИИ замыкае…
  6. Oct 3, 2026Лаборатория как среда обучения Мы привыкли думать, что ИИ обучается на уже собранном челов…
Threads Profile ViewerView any public Threads profile without an account.Open ThreadLook →Writing with AI? Make it sound human.Metric37 rewrites AI drafts so they read naturally. Free AI detector, 1,500 words free.Try Metric37 →