Робот Skild AI играл в футбол против себя 140 симуляционных лет
Стартап Skild AI, занимающийся разработкой общего робо-интеллекта, обучил свою модель S1 игре в футбол с помощью техники self-play. Гуманоид провел в симуляции против предыдущих версий самого себя 140 лет и научился забивать голы.
Месяц назад компания выпустила модель S1, способную дообучаться без файнтюнинга на основе нескольких демонстраций. Для дальнейшего развития разработчики решили повторить опыт Google по обучению AlphaGo и выбрали в качестве полигона футбол. Сначала нейросеть обучили базовым ударам по мячу и дриблингу.
После этого робота отпустили в свободное плавание, где он играл против предыдущих версий себя на протяжении 140 симуляционных лет. Отдельных наград за выучивание конкретных приемов не предусматривалось, единственным поощрением оставались забитые голы. Несмотря на это, машина самостоятельно освоила обводку защитников, закрытие мяча корпусом, перехваты и новые виды ударов.
Пространство действий в футболе отличается огромным объемом: модель должна 50 раз в секунду выдавать углы для каждого своего сустава. В предварительных матчах четырех агентов уже появляются пасы и координация.
В результате на основе self-play получилась автоматическая учебная программа, которая усложняется самостоятельно. Авторы проекта уверены, что эту технику можно масштабировать и переносить на любые другие домены, где присутствуют понятная цель и симулятор.

Добавить комментарий