Видео-генеративные модели часто называют шагом к созданию world models — систем, которые не просто рисуют правдоподобные сцены, а формируют внутреннее представление о физическом мире. Логика проста: если модель просмотрела огромные массивы видео, она должна научиться понимать гравитацию, столкновения, инерцию и причинно-следственные связи между действиями объектов.
Однако новое исследование команды S-Lab Наньянского технологического университета показывает, что этот вывод пока преждевременен. Даже сильнейшие современные модели плохо справляются с физическим рассуждением: максимальный результат на новом бенчмарке Apple-π составил лишь 0,473 из 1.
Apple-π создан специально для проверки того, понимает ли модель физические законы, а не просто генерирует визуально убедительное продолжение ролика. В его основе лежит набор Orchard из 400 сцен классической механики: падение под действием гравитации, столкновения, инерционное движение и комбинации нескольких законов. Для каждой сцены известны начальные условия, траектории объектов и ожидаемые физические результаты.
Тестирование разбито на несколько уровней. На первом модель должна распознать объекты, числовые метки и параметры сцены. Затем — выбрать подходящий закон или формулу, подставить переменные и определить положение или скорость объекта в заданный момент времени. На последнем уровне требуется построить полную последовательность движения, соответствующую исходным условиям и законам механики.
Именно на этапах выбора физической модели и динамического вывода у современных систем возникают основные проблемы. Многие из них могут прочитать подписи, заметить мяч или куб и даже сгенерировать движение, которое на глаз кажется естественным. Но при изменении начальных условий они нередко неверно выбирают формулу, не обновляют скорость и координаты последовательно или нарушают законы сохранения.
Это означает, что модель может воспроизводить визуальный шаблон физики, не имея устойчивого представления о причинных механизмах. Например, она знает, что падающий объект обычно движется вниз, но не обязательно способна корректно вывести траекторию при другой скорости, высоте, массе, столкновении или последовательности взаимодействий.
Авторы отмечают, что крупное видеопредобучение и специализированное дообучение действительно улучшают распознавание сцен и работу с объектами. Более сильные модели лучше считывают разметку, связывают объекты с параметрами и генерируют финальные кадры. Но переход от правдоподобного изображения к надёжной симуляции остаётся нерешённой задачей.
У самого бенчмарка есть ограничения. Он оценивает преимущественно простую механику твёрдых тел — гравитацию, столкновения и инерцию. В нём почти не представлены жидкости, теплообмен, электромагнетизм, разрушение материалов, биомеханика или сложные многокомпонентные среды. Кроме того, тестовые сцены используют ограниченный набор геометрических объектов и фиксированную камеру.
Тем не менее работа важна тем, что отделяет две вещи, которые часто смешивают в дискуссиях об ИИ: умение создать убедительный ролик и способность понимать законы мира. Современные модели уже заметно продвинулись в первом, но до второго им далеко.
Для появления настоящих мировых моделей, вероятно, потребуются не только ещё большие наборы видео. Нужны явное представление состояния сцены, данные для физического рассуждения, механизмы проверки причинных гипотез и специальное дообучение, ориентированное не на красоту следующего кадра, а на соблюдение законов динамики. Поэтому собственный «момент ChatGPT» для world models — массовый скачок от впечатляющей генерации к надёжному пониманию реальности — пока остаётся в будущем.
sms_systems@inbox.ru
+ 7 (985) 982-70-55