Роботизовані маніпулятори вже сьогодні широко використовуються для збирання, пакування, інспекції та багатьох інших завдань. Але здебільшого вони залишаються запрограмованими на виконання фіксованих, часто повторюваних дій. Щоб задовольнити зростаючу потребу в адаптивності в реальному середовищі, потрібні роботизовані «руки», які здатні приймати рішення та змінювати свою поведінку на основі даних у режимі реального часу. Це не лише розширює спектр завдань, які вони можуть виконувати в колаборативному середовищі, а й підвищує безпеку завдяки розпізнаванню потенційних загроз.
Цей випуск NVIDIA Robotics Research and Development Digest (R2D2) присвячений рішенням NVIDIA Research у сфері спритності, маніпуляцій та захватів. Зокрема, йдеться про такі інструменти:
-
DextrAH-RGB: робочий процес для спритного захоплення об’єктів із вхідних зображень стерео-RGB;
-
DexMimicGen: pipeline для генерації даних про дворукі маніпуляції на основі навчання через наслідування (ICRA 2025);
-
GraspGen: синтетичний набір із понад 57 мільйонів варіантів захоплень для різних роботів і захватних пристроїв.
Що таке спритні роботи?
Спритні (dexterous) роботи здатні маніпулювати об'єктами з точністю, адаптивністю й ефективністю. Вони мають добре розвинені моторні навички, координацію, а також здатність працювати в неструктурованому середовищі. Основні характеристики — надійне захоплення, маніпулювання, тактильна чутливість, гнучкість і координація.
Спритність критично важлива для автоматизації в таких галузях, як виробництво, медицина та логістика — там, де потрібна «людська точність».
Рішення NVIDIA для спритності та маніпуляцій
Спритне захоплення об’єктів — одна з найскладніших задач у робототехніці. Звичні підходи погано працюють з блискучими поверхнями та не пристосовані до змінного середовища. NVIDIA Research вирішує ці проблеми за допомогою моделей та робочих процесів, що забезпечують надійні маніпуляції з об’єктами в різних умовах.
DextrAH-RGB: спритне захоплення зі стерео-RGB
DextrAH-RGB — це pipeline, що навчає роботизовану руку захоплювати об’єкти, орієнтуючись лише на зображення з двох RGB-камер. Навчання повністю відбувається в симуляції на базі NVIDIA Isaac Lab.
Навчання проходить у два етапи:
-
Навчання «вчителя» — політика, навчена за допомогою підкріплення (RL), яка діє в просторі керування, орієнтованому на геометричні тканини (fabric-guided policy). Цей рівень дозволяє враховувати фізику середовища, уникати зіткнень та вчасно коригувати дії (наприклад, перехопити об’єкт повторно).
-
Навчання «учня» — на основі візуальної імітації (DAgger) за стерео-зображеннями. Це дозволяє моделі працювати в реальному світі без попередньої адаптації.
Співпраця з Boston Dynamics
NVIDIA і Boston Dynamics застосували DextrAH-RGB для управління верхньою частиною корпусу робота Atlas. Система демонструє різні типи захоплень — від легких предметів до важких — і навіть виявляє помилки, намагаючись повторити дію.
DexMimicGen: генерація даних для дворуких маніпуляцій
DexMimicGen дозволяє створювати великі набори даних для дворуких дій на основі лише кількох людських демонстрацій. Спершу оператор виконує завдання за допомогою телеробота, після чого система генерує тисячі симульованих траєкторій.
У публікації наведено приклад: із 60 демонстрацій вдалося згенерувати понад 21 000 симульованих прикладів. На цій базі тренується політика, яку згодом можна перенести на фізичного робота.
Особливості DexMimicGen:
-
підтримує три типи завдань: паралельні, координовані та послідовні;
-
реалізує асинхронне виконання, механізми синхронізації й обмеження порядку виконання;
-
дозволяє роботам узгоджено працювати обома руками, наприклад, одночасно піднімати ящик чи сортувати банки.
У реальних тестах робот із політикою, натренованою на згенерованих даних, показав 90% успішності при сортуванні банок — проти 0% при навчанні лише на людських демонстраціях.
GraspGen: датасет для різних роботів і захоплень
GraspGen — відкритий датасет на Hugging Face з 57 мільйонами варіантів захоплень для трьох типів маніпуляторів:
-
Franka Panda;
-
Robotiq 2F-140 (промисловий);
-
одноконтактний вакуумний присос.
Дані згенеровані в симуляції, містять трансформації захоплень (6D), мітки успішності й охоплюють велику кількість об’єктів.
Цей підхід дозволяє масштабувати навчальні дані без ручної генерації.
Підсумок
Щоб адаптувати роботизовані системи до складного і динамічного світу, потрібні гнучкі підходи до навчання й маніпуляцій. NVIDIA пропонує три рішення:
-
DextrAH-RGB — спритне захоплення з RGB-камер;
-
DexMimicGen — масштабована генерація даних для дворуких роботів;
-
GraspGen — величезний набір симульованих захоплень.
