Підписуйтеся на наш телеграм канал!
Google DeepMind розробила ШІ для повного керування гуманоїдними роботами
Google DeepMind представила нове покоління моделей штучного інтелекту, здатних повністю керувати людиноподібними роботами. На відміну від попередніх розробок, що контролювали лише окремі механізми, нова архітектура координує рухи всього тіла робота одночасно — від ніг і рук до кистей і пальців. За словами розробників, уперше одна система може перетворювати команди та наміри людини на узгоджені рухи всього тіла машини.
Одна з головних проблем сучасної робототехніки полягає в тому, що більшість роботів розрахована на роботу в контрольованих умовах із заздалегідь визначеним набором операцій. Реальне середовище, де є люди, де простір постійно змінюється і виникають непередбачувані ситуації, залишалося серйозним викликом для галузі. Дослідники переконані, що для роботи поруч із людьми роботи потребують ШІ, здатного аналізувати обстановку, самостійно планувати дії та приймати рішення в умовах невизначеності.
Для вирішення цього завдання Google DeepMind розробила лінійку з трьох взаємопов’язаних моделей. Перша — Gemini Robotics 2 — належить до класу «зір — мова — дія» (Vision-Language-Action) і перетворює візуальну інформацію та текстові команди на конкретні рухи робота. Вона сумісна як із повноцінними гуманоїдними платформами, так і з окремими маніпуляторами. Розробники особливо попрацювали над точністю рухів кистей і здатністю акуратно захоплювати крихкі або дрібні предмети.
Друга модель — Gemini Robotics ER 2 — побудована на концепції втіленого міркування (Embodied Reasoning) і виконує роль інтелектуального координатора. Вона аналізує фізичне середовище, планує послідовність завдань і управляє всіма діями робота. Завдяки їй машина може самостійно виправляти власні помилки, адаптуватися до нових ситуацій і змінювати план дій без втручання людини. Модель також забезпечує взаємодію з іншими роботами та виконання інструкцій, отриманих від оператора.
Третя модель — Gemini Robotics On-Device 2 — призначена для локального запуску безпосередньо на самому роботі, без постійного підключення до хмарних обчислень. За твердженням Google DeepMind, вона дозволяє адаптувати систему керування до нових роботизованих платформ лише за кілька годин.
Для демонстрації можливостей технології компанія показала роботу гуманоїдного робота Apollo від Apptronik. Отримавши голосову команду поставити лійку у зелений контейнер на нижній полиці, робот самостійно розпізнав інструкцію, підійшов до столу, взяв лійку, дійшов до стелажа й акуратно розмістив предмет у вказаному місці. В інших тестах Apollo присідав, щоб підняти предмет із підлоги, вибирав потрібні речі на полицях, а також виконував завдання, що потребують тонкої моторики: зав’язував вузол на пакеті, застібав блискавку, герметично закривав пакет і навіть викручував електричну лампочку.
Розробники визнають, що роботам ще потрібно суттєво збільшити швидкість пересування та виконання операцій, однак вважають досягнутий результат важливим кроком до створення машин, здатних виконувати складні практичні завдання в реальному світі. Надалі Google DeepMind планує наближати спритність своїх роботів до можливостей людини, рухаючись від автоматизації окремих операцій до універсального ШІ, що ефективно діє у фізичному середовищі.