Каталог робототехники — характеристики, обзоры, сравнения

LingBot-VA 2.0: видео-экшн модель мира для управления роботами

Robbyant из Ant Group выпустила LingBot-VA 2.0 - видео-экшн модель мира, созданную специально для управления роботами. Физическая точность и работа в реальном времени вместо адаптированных генеративных решений.

Редакция РобоСила· редакция2 мин. чтения
LingBot-VA 2.0: видео-экшн модель мира для управления роботами

Компания Robbyant, подразделение воплощённого ИИ в составе китайской Ant Group, представила LingBot-VA 2.0 — видео-экшн модель мира, созданную нативно для робототехники. Разработчики позиционируют её как первую в отрасли систему такого класса, спроектированную с нуля для задач в физическом мире, а не адаптированную из генеративных видеомоделей, изначально предназначенных для создания цифрового контента.

Используя авторегрессивную архитектуру, LingBot-VA 2.0 предсказывает, как действия робота изменяют окружающую среду, и определяет следующий шаг на основе этих причинно-следственных связей. По утверждению Robbyant, такой подход улучшает физическую точность, эффективность выполнения и способность модели переносить навыки на новые задачи.

Переосмысление подхода к базовым моделям

Большинство существующих систем воплощённого ИИ опираются на видеомодели, изначально разработанные для генерации цифрового контента. Такие модели ставят во главу угла качество изображения и творческие возможности, а не физическую точность и скорость реакции. По словам Robbyant, их адаптация для робототехники нередко снижает способность к обобщению и ограничивает производительность в реальных условиях.

LingBot-VA 2.0 решает эти проблемы за счёт четырёх архитектурных инноваций. Семантический визуально-экшн токенизатор (semantic visual-action tokenizer) совместно сжимает визуальную информацию и данные о действиях, позволяя модели точнее переводить инструкции в движения робота. Стратегия строгого каузального предобучения (causal pre-training) обеспечивает корректную временну́ю последовательность предсказаний. Архитектура смеси экспертов (Mixture of Experts, MoE) увеличивает ёмкость модели без потери эффективности инференса. Наконец, усовершенствованный механизм асинхронного инференса позволяет роботу предсказывать будущие состояния параллельно с выполнением текущих действий и непрерывно уточнять решения на основе реальных наблюдений.

По данным компании, эти решения обеспечивают замкнутый контур управления в реальном времени на частоте 150 Гц на одном GPU. Модель также адаптируется к новым задачам манипуляции всего по 20 демонстрациям через контекстное обучение — без обновления параметров.

Практические демонстрации

Robbyant продемонстрировала модель на задачах с длинным горизонтом планирования и высокоточной манипуляцией: приготовление завтрака, распаковка посылок, вставка трубок, подбор винтов, складывание одежды и открывание ящиков. Компания также сообщила о высоких результатах на симуляционных бенчмарках RoboTwin 2.0 и LIBERO, где LingBot-VA 2.0 превзошла существующие методы в нескольких конфигурациях задач.

Долгосрочная память и планы развития

Отдельно Robbyant выделяет способность LingBot-VA к долгосрочной памяти: модель различает визуально идентичные, но контекстно разные ситуации и корректно выполняет многошаговые задачи, требующие счёта, соблюдения последовательности и повторяющихся действий.

«Robbyant продолжит исследовать новые возможности воплощённого интеллекта и одновременно ускорит формирование открытой технологической и прикладной экосистемы для ускорения внедрения роботов в промышленности и реальных сценариях», — заявил генеральный директор Robbyant Чжу Син (Zhu Xing).

Источник: interestingengineering.com

Поделиться:TelegramVKX
Редакция каталога РобоСила

Команда редакторов каталога РобоСила. Собирает и систематизирует информацию о роботах.