Исследователи предложили новую систему проверки подлинности AI-видео

Исследователи предложили новую систему проверки подлинности AI-видео
 

Стремительное развитие генеративных моделей для создания видео делает задачу выявления подделок все более сложной. Если еще несколько лет назад детекторы могли опираться на характерные визуальные артефакты, то современные модели, такие как Sora, Veo, Kling и другие, способны создавать ролики кинематографического качества, в которых традиционные признаки генерации практически незаметны.

На этом фоне исследователи из Университета искусственного интеллекта имени Мохамеда бин Заида (MBZUAI), Китайского народного университета и Гарвардского университета представили обзорную работу, в которой предлагают пересмотреть сам подход к обнаружению AI-видео. Статья уже принята к публикации на конференции ACL 2026.

Авторы считают, что задача больше не должна сводиться к простому ответу «настоящее видео или сгенерированное». Вместо этого предлагается концепция «проверки фактической достоверности» (Fact Fidelity Verification), при которой система должна объяснять, на каких доказательствах основан ее вывод и соответствует ли содержание ролика реальному миру.

Исследователи выделяют три основных типа современных AI-видео:

локально измененные реальные записи (например, дипфейки с заменой лица);

видео с изменением аудио, речи или синхронизации губ;

полностью сгенерированные ролики, созданные с нуля современными генеративными моделями.

Для анализа таких материалов предлагается четырехуровневая система проверки.

Первый уровень занимается поиском низкоуровневых визуальных признаков: анализируются шумы изображения, текстуры, особенности сжатия, физиологические сигналы человека (например, моргание или едва заметные движения лица), а также другие статистические отклонения.

Второй уровень оценивает пространственно-временную согласованность видео. Здесь проверяется, насколько естественно меняются объекты, движения, освещение и поведение персонажей на протяжении всего ролика. Даже качественно сгенерированные видео могут содержать ошибки в длинных последовательностях кадров или нарушать физическую логику происходящего.

Третий уровень анализирует соответствие различных модальностей между собой. Система сравнивает изображение, звук, речь, субтитры и текстовое описание, выявляя несоответствия между движением губ, голосом, содержанием речи и визуальным рядом.

Самый высокий, четвертый уровень предполагает проверку содержания с использованием мировых знаний и логического рассуждения. На этом этапе система должна определить, соответствует ли происходящее законам физики, общеизвестным фактам, причинно-следственным связям и здравому смыслу.

Авторы предлагают использовать для этого большие мультимодальные модели и специализированные ИИ-агенты, способные обращаться к внешним источникам информации и формировать объяснимую цепочку доказательств.

Исследователи подчеркивают, что будущие системы проверки должны не просто выдавать вероятность того, что видео создано искусственным интеллектом, а предоставлять прозрачное обоснование своих выводов. Такой подход особенно важен в условиях, когда AI-контент становится все сложнее отличить от реальной съемки, а ошибочные решения могут привести как к распространению дезинформации, так и к ложному обвинению подлинных видеоматериалов в использовании генеративного ИИ.

По мнению авторов, надежная проверка AI-видео потребует объединения достижений компьютерного зрения, обработки естественного языка, мультимодальных моделей и систем логического вывода. Только сочетание анализа изображения, понимания контекста и проверки фактов позволит создавать действительно объяснимые и устойчивые инструменты для выявления синтетического видеоконтента.

БОЛЬШЕ ИНФОРМАЦИИ

Email

sms_systems@inbox.ru

Телефон

+ 7 (985) 982-70-55

Если у вас есть инновационная идея, мы будем рады реализовать ее для Вас!

Специалисты нашей кампании и наши разработки для вас!