Модели класса Vision-Language-Action, или VLA, объединяют зрительное восприятие, текстовые инструкции и управление действиями робота. Благодаря этому робот может получать команду на естественном языке, анализировать окружающую среду и выполнять многошаговые физические задачи. Однако при переходе от лабораторных тестов к реальным роботам возникает важная проблема: даже сильная модель часто действует слишком медленно и выполняет много лишних движений.
Обычно ускорение ИИ-систем пытаются получить за счёт оптимизации вычислений: сокращают число токенов, используют квантование, повторно применяют кэш или улучшают движок инференса. Такие методы снижают задержку одного обращения к модели, но не решают проблему неэффективного поведения. Если робот всё равно постоянно останавливается, перепланирует действия, возвращается назад и исправляет собственные ошибки, выполнение задачи остаётся долгим.
Для решения этой проблемы исследователи предложили метод PolicyTrim. Его ключевая идея заключается в том, чтобы оптимизировать не только скорость вычислений, но и саму стратегию действий робота. Метод не требует менять архитектуру VLA-модели или собирать новый массив экспертных демонстраций. Он применяется как дополнительный этап обучения уже готовой модели.
PolicyTrim состоит из двух этапов. На первом модель учится надёжнее выполнять более длинные последовательности действий без постоянного пересчёта плана. Обычно VLA-система предсказывает сразу несколько движений, однако последние действия в такой последовательности менее надёжны: ошибки накапливаются, и робот вынужден часто заново анализировать ситуацию. Новый подход поощряет успешные траектории, в которых робот способен безопасно использовать более длинные фрагменты предсказанных действий.
На втором этапе система сокращает число физических шагов. Робот получает большее вознаграждение, если достигает цели по более короткой и прямой траектории. При этом специальные ограничения не позволяют модели искать рискованные «короткие пути», которые могли бы ухудшить вероятность успешного завершения задачи.
По данным авторов работы, метод позволил сократить число физических действий в среднем до 51,4% и получить ускорение выполнения задач до 5,83 раза на одном из тестовых наборов, сохраняя высокую успешность. В экспериментах на реальном манипуляторе среднее сквозное ускорение достигало 1,86 раза, в том числе в условиях, когда положение объекта менялось во время выполнения задачи.
Главный вывод исследования состоит в том, что эффективность робота определяется не только мощностью GPU и скоростью инференса. Не менее важно, насколько разумно робот строит свою траекторию.
Если система способна избегать лишних корректировок, повторов и колебаний у цели, она может выполнять те же действия быстрее и с меньшими затратами ресурсов. В перспективе такие методы могут сочетаться с аппаратным ускорением и оптимизацией моделей, обеспечивая ещё более заметный прирост производительности робототехнических систем.
sms_systems@inbox.ru
+ 7 (985) 982-70-55