Робот 140 лет играл в футбол в симуляции против самого себя, и теперь забивает голы людям в реальной жизни
Стартап Skild AI занимается разработкой "общего робо-интеллекта". Месяц назад они выпустили модель S1, главная фишка которой была в том, что она была способна дообучаться без файнтюнинга, просто по нескольким демонстрациям.
Теперь они решили воскресить опыт Google, которые когда-то обучали AlphaGo с помощью техники self-play – игры модели против самой себя. Skild AI полигоном выбрали футбол: www.skild.ai/blogs/physical-self-play.
Сначала S1 дообучили базовым ударам по мячу и дриблингу, а затем отпустили в свободное плавание: гуманоид 140 симуляционных лет играл против предыдущих версий себя. И самое интересное, что отдельных ревордов за выучивание каких-то приемов не было, и единственное, за что робот получал награду – это голы.
Несмотря на это робот выучил обводки защитников, закрывание мяча корпусом, перехваты, много новых ударов и так далее. В предварительных матчах 4 агентов уже появляются пасы и координация. А ведь пространство действий в футболе огромное: модель 50 раз в секунду должна выдавать углы для каждого сустава.
То есть на основе self-play получилась автоматическая учебная программа, которая усложняется сама. Авторы верят, что эту технику можно масштабировать и переносить на любые другие домены, где есть понятная цель и симулятор.
Post #10010
17.7K