Виртуальные миры, в которых обучаются роботы
Обучающие системы, позволяющие роботам ориентироваться в реальном мире, становятся все более совершенными.

**Виртуальные миры, в которых обучают роботов**
Робот Фреддо идет по офису и берет пластиковую бутылку, которую ему протягивает сотрудник.
Учитывая, что недавно робот побил рекорд Усейна Болта в беге на 100 метров, это вряд ли можно назвать самым удивительным достижением.
Впечатляет то, как быстро Фреддо научили ходить, распознавать бутылку и брать ее. Эти навыки были разработаны и загружены в Фреддо всего за несколько минут. Его создатели утверждают, что у конкурирующих систем на освоение тех же навыков могли бы уйти дни.
Я нахожусь в Vsim, британском стартапе в Кембридже. Основатели Мишель Лу и Кир Стори надеются, что однажды их программное обеспечение будет управлять роботами, способными ориентироваться в пространстве и выполнять полезные задачи дома и на работе.
Но впереди еще долгий путь.
«В робототехнике сложилась странная ситуация: то, что нам, людям, кажется невероятно сложным, например гимнастика, роботы могут делать довольно хорошо. А то, в чем люди действительно сильны, например тонкая моторика, дается роботам с большим трудом», — говорит Стори.
Способности Фреддо развивались в виртуальной среде, где задачу можно запускать в компьютерной симуляции миллионы раз. Как только находится наилучшее решение, известное как стратегия (policy), его можно загрузить и использовать на физическом роботе — в данном случае на Фреддо.
Виртуальные симуляции — широко используемый метод обучения роботов. У технологического гиганта Nvidia есть система под названием Isaac Sim, которая работает именно так — Лу и Стори оба работали над ее ранней версией.
В 2022 году они решили запустить Vsim, чтобы создать собственную среду обучения и другие инструменты.
Начало с чистого листа позволило Лу и Стори оптимизировать программное обеспечение так, чтобы оно могло использовать преимущества мощных компьютерных чипов, применяемых в сфере ИИ, известных как графические процессоры, или GPU.
«Базовые алгоритмы, которые мы использовали для большинства этих симуляций роботов, восходят к 1970-м и 1980-м годам, но эти алгоритмы не очень хорошо подходят для GPU», — говорит Стори.
Через несколько месяцев они поняли, что их система может работать гораздо быстрее всего, что они видели раньше.
«Спустя полтора года у нас есть полностью функциональный, сверхвысокопроизводительный симулятор», — говорит Лу.
Программное обеспечение настолько эффективно, что может работать на оборудовании, установленном на самом Фреддо. Это означает, что робот может выполнять десятки тысяч симуляций прямо во время движения.
«Он может заглядывать примерно на секунду вперед, просчитывая 20 000 различных вариантов развития событий», — объясняет Стори.
Это крайне важно для робота, работающего в неструктурированной среде, такой как обычный дом.
«Факторы, находящиеся вне контроля робота, такие как люди, животные или даже другие роботы, могут совершать действия, требующие изменения стратегии. Эти неожиданные события могут происходить очень быстро, и робот должен уметь быстро адаптироваться, чтобы его действия оставались безопасными и соответствовали задаче», — говорит Лу.
Vsim — это стартап, над технологиями которого работают 10 инженеров. Nvidia находится на другом полюсе индустрии. Она доминирует на рынке компьютерных чипов для ИИ и имеет ведущее подразделение по разработке программного обеспечения для робототехники со штатом в сотни инженеров.
Она не строит роботов; вместо этого она предлагает пакет программного обеспечения, разработанный для того, чтобы помочь организациям обучать их и управлять ими.
Сюда входят виртуальные симуляционные системы обучения и так называемая модель мира под названием Cosmos, которая дает роботу понимание физики реального мира и того, как может меняться его окружение при движении.
Но даже при наличии мощных вычислительных ресурсов, доступных Nvidia, программное обеспечение обеспечивает лишь базовое понимание реального мира.
«Манипуляция — когда я просто беру бутылку, это не слишком сложно. Проблема возникает, когда вы начинаете выполнять долгосрочные задачи, когда я говорю: "Я хочу, чтобы ты взял бутылку, наполнил ее и пошел налил"», — говорит Спенсер Хуанг, директор по продуктам в области робототехники в Nvidia.
Тем не менее, он уверен, что в этом направлении достигнут серьезный прогресс. В этом году Nvidia начала использовать ИИ-агентов для создания виртуальных сред для обучения роботов и проверки того, работают ли результаты обучения на практике.
«Когда мы говорим о создании [виртуального] мира и его сканировании — большая часть этого на самом деле является ручным трудом.
Мы просто подключаем к этому агентов... по сути, это дает нам огромную рабочую силу», — говорит Хуанг.
Симуляция — не единственный способ обучения роботов. Они также могут учиться, наблюдая за людьми или видеодемонстрациями.
Рика Антонова работает в области робототехники с 2015 года и сейчас является доцентом кафедры компьютерных наук и технологий Кембриджского университета.
Антонова работает с системой обучения MuJoCo, принадлежащей Google DeepMind с 2021 года. Это программное обеспечение с открытым исходным кодом, что означает, что исследователи могут использовать его бесплатно и им разрешено изменять код.
«Оно очень, очень удобно для пользователя. Так что для исследовательских групп или для небольших стартапов это полезно», — говорит она.
Она считает подход Vsim — чрезвычайно быструю симуляцию — многообещающим.
«Если у вас есть очень, очень быстрый симулятор, то вы можете смоделировать сотни миллионов вариантов за те несколько секунд, пока ваш робот думает о том, как скорректировать свое движение, и затем вы можете изменить движение практически в реальном времени», — говорит она.
Но симулированные среды остаются лишь грубым приближением к реальному миру, что ограничивает возможности обучения.
«Есть определенные вещи, которые трудно смоделировать в симуляции, например, сильно деформируемые объекты и резка», — говорит она.
Это вызов, который пытаются решить как Nvidia, так и Лу со Стори в Vsim.
Лу говорит, что их система «уменьшила степень приближения, используя точные симуляции для обучения моделей, которые действительно работают в реальности так же хорошо, как и в симуляциях».
Вскоре второй робот по имени Начо поможет в развитии этой технологии.
Лу говорит, что это должно ускорить процесс разработки и гарантировать, что их программное обеспечение сможет работать на различных машинах.
И, конечно же, составит компанию Фреддо.

