
Компания Robbyant, подразделение воплощённого ИИ в составе китайской Ant Group, представила LingBot-VA 2.0 — видео-экшн модель мира, созданную нативно для робототехники. Разработчики позиционируют её как первую в отрасли систему такого класса, спроектированную с нуля для задач в физическом мире, а не адаптированную из генеративных видеомоделей, изначально предназначенных для создания цифрового контента.
Используя авторегрессивную архитектуру, LingBot-VA 2.0 предсказывает, как действия робота изменяют окружающую среду, и определяет следующий шаг на основе этих причинно-следственных связей. По утверждению Robbyant, такой подход улучшает физическую точность, эффективность выполнения и способность модели переносить навыки на новые задачи.
Переосмысление подхода к базовым моделям
Большинство существующих систем воплощённого ИИ опираются на видеомодели, изначально разработанные для генерации цифрового контента. Такие модели ставят во главу угла качество изображения и творческие возможности, а не физическую точность и скорость реакции. По словам Robbyant, их адаптация для робототехники нередко снижает способность к обобщению и ограничивает производительность в реальных условиях.
LingBot-VA 2.0 решает эти проблемы за счёт четырёх архитектурных инноваций. Семантический визуально-экшн токенизатор (semantic visual-action tokenizer) совместно сжимает визуальную информацию и данные о действиях, позволяя модели точнее переводить инструкции в движения робота. Стратегия строгого каузального предобучения (causal pre-training) обеспечивает корректную временну́ю последовательность предсказаний. Архитектура смеси экспертов (Mixture of Experts, MoE) увеличивает ёмкость модели без потери эффективности инференса. Наконец, усовершенствованный механизм асинхронного инференса позволяет роботу предсказывать будущие состояния параллельно с выполнением текущих действий и непрерывно уточнять решения на основе реальных наблюдений.
По данным компании, эти решения обеспечивают замкнутый контур управления в реальном времени на частоте 150 Гц на одном GPU. Модель также адаптируется к новым задачам манипуляции всего по 20 демонстрациям через контекстное обучение — без обновления параметров.
Практические демонстрации
Robbyant продемонстрировала модель на задачах с длинным горизонтом планирования и высокоточной манипуляцией: приготовление завтрака, распаковка посылок, вставка трубок, подбор винтов, складывание одежды и открывание ящиков. Компания также сообщила о высоких результатах на симуляционных бенчмарках RoboTwin 2.0 и LIBERO, где LingBot-VA 2.0 превзошла существующие методы в нескольких конфигурациях задач.
Долгосрочная память и планы развития
Отдельно Robbyant выделяет способность LingBot-VA к долгосрочной памяти: модель различает визуально идентичные, но контекстно разные ситуации и корректно выполняет многошаговые задачи, требующие счёта, соблюдения последовательности и повторяющихся действий.
«Robbyant продолжит исследовать новые возможности воплощённого интеллекта и одновременно ускорит формирование открытой технологической и прикладной экосистемы для ускорения внедрения роботов в промышленности и реальных сценариях», — заявил генеральный директор Robbyant Чжу Син (Zhu Xing).
Источник: interestingengineering.com
Команда редакторов каталога РобоСила. Собирает и систематизирует информацию о роботах.


