GEN-1.5 справлялась с физическими заданиями на основе одного показа длительностью от 3 до 12 секунд, не прибегая к градиентным обновлениям или дополнительной настройке.
Свежая базовая роботизированная модель может осваивать физические действия после одного показа продолжительностью от 3 до 12 секунд, после чего она способна выполнить поставленную задачу без градиентных обновлений и точной настройки.
Ирина Петрова

GEN-1.5 обучается физическим задачам на основе демонстраций продолжительностью в несколько секунд. Источник: Универсальный ИИ
Модель GEN-1.5, созданная фирмой Generalist AI, ориентирована на обучение напрямую через физические примеры, что освобождает инженеров от необходимости переучивать модель под каждую новую задачу. Как отмечают представители компании, модель может уловить суть требуемого действия по короткой сенсомоторной демонстрации и немедленно приступить к его выполнению.
В ходе проверки на 10 физических задачах GEN-1.5 достигла среднего показателя успеха 59 % при демонстрации лишь одного примера. Когда же было предоставлено пять минут данных, касающихся конкретной задачи, и десять ступеней градиента, средний уровень успеха поднялся до 83 %.
Задания были намеренно простыми и непродолжительными. Среди них были откручивание крышки стеклянной банки, извлечение денег из кошелька, складывание чашек, подметание мусора, открытие книги, расстегивание чехла для карандашей и снятие вакуумной насадки.
Такой подход действительно открывает новые перспективы для взаимодействия человека и робота, но одновременно поднимает вопросы о границах применимости. Пока что успешные примеры ограничены короткими действиями, которые длятся не более нескольких секунд и не требуют сложной последовательности операций или работы с мелкими, хрупкими объектами.
Если задача растягивается во времени, включает многошаговые манипуляции с изменением хвата или требует учета меняющихся внешних условий, модель может потерять нить из-за ограничений контекстного окна в 30 секунд.
Реальные производственные сценарии, такие как сборка электроники или сортировка деталей на конвейере, редко укладываются в такие рамки, поэтому для практического внедрения потребуется либо расширение контекста, либо механизм «памяти» для долгосрочных целей.
Роботы обучаются с помощью физических подсказок
GEN-1.5 представляет собой крупную мультимодальную модель, которая анализирует видео, а также данные с сенсоров, языковую информацию и проприоцептивные сигналы. Она сохраняет данные за последние 30 секунд в контексте и создает траектории действий с частотой 100 Гц.
Сама демонстрация служит тем, что специалисты Generalist AI называют «физической подсказкой». Она может поступать от человека, использующего ручные захваты, или от робота, выполняющего задачу. Как только пример попадает в контекстное окно модели, робот старается выполнить задачу без отдельного этапа обучения.
Компания утверждает, что GEN-1.5 не обучалась специально для обучения в контексте. Также не вносились архитектурные изменения, не добавлялись циклы метаобучения или дополнительные цели, направленные на то, чтобы научить модель импровизировать.
Таким образом, заявленный результат отличается от традиционного обучения роботов, где для новой задачи могут требоваться значительные объемы данных и повторная оптимизация.
GEN-1.5 также умеет объединять физические подсказки. В одной демонстрации модели показали отдельные примеры того, как расстегнуть чехол для карандашей и как извлечь из него деньги. После этого модель соединила эти два действия в непрерывную последовательность, добавив промежуточные движения для изменения положения и извлечения предмета, которых не было ни в одном из примеров.
Другой важный аспект — безопасность и воспроизводимость. Когда робот обучается на одном демонстрационном примере, он не получает информации о возможных неудачах, границах допустимых усилий или последствиях своих действий.
Например, научившись откручивать крышку банки, робот может применить чрезмерную силу к хрупкой пластиковой емкости, если показанный пример был сделан с металлической банкой.
Компания признает, что модель не была специально обучена для понимания причинно-следственных связей, и это создает риск непредсказуемого поведения в нестандартных ситуациях.
В индустриальных условиях, где цена ошибки может быть высокой — от повреждения оборудования до травмы человека, — потребуется дополнительный уровень валидации, возможно, с использованием симуляций для проверки безопасности перед реальным выполнением.
Одна демонстрация, разные решения
Модель также продемонстрировала умение обобщать увиденные действия. Запись, сделанная в симуляторе, может применяться для управления реальным роботом, хотя в предварительном обучении модели данные из симуляторов не использовались. В итоге поведение робота может подстраиваться под разные руки, а также под изменения в расположении и размере объекта.
В другом испытании человек показывал задачу, используя свои руки, находясь в поле зрения камер робота. Затем робот повторил это действие своими руками.
Фирма Generalist AI также проверила реакцию модели на тонкую настройку с применением всего нескольких градиентных шагов. GEN-1.5 может приспосабливаться к новым задачам за 1–10 шагов, используя от 1 до 5 минут данных, что примерно соответствует 10–50 демонстрациям.
Иногда модель выходила за рамки того, что ей показывали. Научившись применять щетку для смахивания блоков в миску, она использовала банан как импровизированную щетку, когда его показали. Получив совок, она выработала иную стратегию: использовала инструмент для подъема блоков и сбрасывания их в миску.
По словам представителей компании, такое поведение указывает на новый способ программирования роботов. Вместо написания детальных инструкций для каждой новой задачи пользователи могли бы просто показывать, чего они хотят, и позволять роботу самостоятельно разбираться с физическими деталями.
Стоит также отметить, что способность модели робота комбинировать разные демонстрации в единую последовательность указывает на зачатки планирования и абстрактного мышления. Это качественно отличает GEN-1.5 от предыдущих подходов, где робот выполнял строго заученные движения.
Если модель действительно умеет строить промежуточные действия, которых не было в примерах, это означает, что она формирует внутреннюю модель задачи, а не просто повторяет наблюдения. Дальнейшее развитие этого свойства могло бы привести к тому, что роботы начнут не только копировать, но и предлагать более эффективные способы выполнения задачи — например, изменять порядок операций или использовать нестандартные инструменты, как в случае с бананом-щеткой.
Перспектива
Тем не менее, если подход Generalist AI получит дальнейшее развитие, он может изменить экономику роботизации. Сейчас внедрение робота для новой операции требует недель работы инженеров: сбор данных, аннотирование, обучение модели, настройка и тестирование.
С GEN-1.5 этот цикл сокращается до минут, что открывает путь к использованию роботов в малых и средних предприятиях, где партии продукции небольшие и часто меняющиеся. Робот мог бы перенастраиваться между сменами, просто наблюдая за действиями оператора.
Это особенно актуально для пищевой промышленности, логистики или ресторанного бизнеса, где стандартизированные движения не подходят из-за разнообразия задач. Кстати, предполагается, что гуманоидные роботы Iron станут продавцами-консультантами в салонах электромобилей XPENG уже в 2027 году.
В ближайшей перспективе, вероятно, появятся гибридные системы, где GEN-1.5 используется для быстрого старта и адаптации, а затем классические методы обучения с подкреплением или точная настройка применяются для улучшения надежности.
Такой подход позволил бы получить лучшее из двух миров: скорость и гибкость одномоментного обучения и точность, обеспечиваемую итеративной оптимизацией. Компания уже показала, что модель может улучшать результаты при небольшом количестве градиентных шагов, так что этот сценарий выглядит реалистичным.
Однако ключевым вызовом остается вопрос о масштабировании: можно ли обучить модель на большем разнообразии задач, чтобы она сохраняла способность к быстрой адаптации, или же увеличение количества данных приведет к снижению гибкости. Это станет ясно только после дополнительных исследований и публикаций с более подробными данными о внутренностях модели.