Підписуйтеся на наш телеграм канал!
Стартап навчив робота грати у футбол через змагання із самим собою
Американський стартап Skild AI оголосив про прорив у навчанні фізичних роботів за допомогою методу self-play — коли модель штучного інтелекту вдосконалюється, змагаючись сама з собою у симуляції. Як демонстрацію компанія обрала футбол: робот навчився грати, маючи лише одне завдання — забивати голи.
Основу для експерименту склала S1 — флагманська фундаментальна модель Skild для робототехніки, яку представили місяць тому. Вона навчається виконувати завдання з демонстрацій, схожих на підказки для мовних моделей, що забезпечує широкий діапазон здібностей. Проте, оскільки S1 навчалася на людських даних, її можливості обмежені людським рівнем. Self-play, на думку розробників, дозволить роботам цю межу подолати.
Метод self-play має давню історію в цифровому штучному інтелекті. Саме завдяки йому AlphaGo у 2016 році переміг чемпіона світу Лі Седоля, зробивши знамениту «нелюдську» ходу № 37. Через три дні після початку самонавчання AlphaGo Zero розгромив попередню версію з рахунком 100:0. Пізніше підхід поширився на багатокористувацькі ігри: AlphaStar у StarCraft II та OpenAI Five у Dota 2 перемогли чемпіонів світу у 2019 році. Skild прагне перенести цей метод із цифрового середовища у фізичний світ.
Тренування проходило в симуляторі NVIDIA Isaac Sim. Перші симульовані місяці робот ледве міг ходити, а лише до «студентського віку» навчився підводитися після падінь. З часом він самостійно освоїв дриблінг, прикриття м’яча корпусом і боротьбу з суперником. Жодної з цих навичок розробники не закладали вручну — вони виникли самі, бо допомагали досягти єдиної мети: гол. Загалом симуляція тривала понад 140 умовних років.
Після симуляції модель перенесли у реального робота-гуманоїда і влаштували йому справжній матч. Успішне перенесення навичок із віртуального середовища у фізичне команда вважає важливим сигналом на шляху до фізичного загального штучного інтелекту.
Футбол обрали невипадково: він вимагає одночасно фізичних і стратегічних здібностей, а змагання роботів у ньому вже існують, хоча рівень гри досі далекий від людського. Проте самого футболу розробникам замало — підхід вже адаптують для побутових і промислових задач.
У наступному релізі Skild планує масштабувати self-play до командної гри й досліджувати, які соціальні моделі поведінки виникають у роботів — від спільної маніпуляції з предметами до навігації у масштабах міста. «Ми лише подряпали поверхню фізичного self-play», — зазначають у компанії, натякаючи, що 140 симульованих років на футбольному полі — це лише початок.