Большая новость в ИИ.
Google продемонстрировала цикл рекурсивного самоулучшения.
Исследователи Google и DeepMind представили Dream-RSI — систему, в которой ИИ-агент улучшает то, как он исследует задачи. Для этого он повторно проигрывает свои прошлые попытки, дешёво тестирует тысячи альтернативных стратегий, а затем использует более удачную стратегию в следующем раунде.
В задачах по разработке алгоритмов, математической оптимизации и созданию GPU-ядер система сохраняла или улучшала качество результатов, при этом значительно сокращая стоимость поиска. В одном из экспериментов количество вызовов агента удалось сократить до 162 раз.
Что важно, система улучшает именно стратегию исследования, а не веса самой модели.
https://arxiv.org/pdf/2609.14858
Post #3879
18.6K
