Google представила сразу два новых мультимодальных инструмента: Gemini Omni Flash для генерации и редактирования видео и Nano Banana 2 Lite — сверхбыструю и недорогую модель для создания изображений. Если коротко, компания явно делает ставку не столько на программирование, сколько на мультимодальный ИИ, и в этом направлении у нее действительно заметный прогресс.
Gemini Omni Flash уже доступна через Gemini API и Google AI Studio. Модель умеет работать сразу с несколькими типами входных данных — текстом, изображениями и видео — и на их основе создавать или редактировать ролики.
Среди ключевых возможностей: разговорное редактирование видео на естественном языке, использование мультимодальных референсов для сохранения сцены и стиля, опора на «знания о мире» из экосистемы Gemini, а также синхронизация текста, графики и движения в кадре.
Стоимость генерации составляет около 0,10 доллара за секунду видео, что делает решение довольно конкурентоспособным. Правда, пока есть и ограничения: длительность роликов ограничена 10 секундами, не поддерживаются аудиореференсы и расширение сцен, а согласованность персонажей при сложной смене планов еще не идеальна.
Вторая новинка — Nano Banana 2 Lite — ориентирована на задачи, где особенно важны скорость и цена. По данным Google, модель способна генерировать изображение примерно за 4 секунды, а картинка в разрешении 1K обходится примерно в 0,034 доллара.
Это делает ее особенно привлекательной для массовых сценариев: генерации товарных карточек, быстрого тестирования рекламных креативов и автоматизированных контентных конвейеров.
При этом удешевление и ускорение, как утверждается, не привели к заметному ухудшению качества: модель сохраняет хорошую работу с текстом на изображениях и в целом выглядит сильным обновлением по сравнению с предыдущими версиями.
Но самое интересное — не сами модели по отдельности, а их совместное использование. Google предлагает сценарий, при котором сначала пользователь быстро создает изображения с помощью Nano Banana 2 Lite, а затем передает их в Gemini Omni Flash, чтобы превратить статичные сцены в короткие видео.
Такой связанный workflow может оказаться особенно полезным в электронной коммерции, дизайне интерьеров, маркетинге и коротком видеоконтенте. Для демонстрации этой идеи Google даже показала несколько приложений: виртуальные туристические сцены по селфи, визуализацию интерьерных решений и генерацию рекламных материалов для товаров.
В более широком смысле запуск этих моделей показывает стратегию Google: компания стремится занять сильную позицию в области мультимодального ИИ, где важно не только писать код, но и объединять текст, изображение, видео и знания о реальном мире в единую систему.
На фоне жесткой конкуренции в coding-направлении это выглядит как попытка сделать ставку на другую сильную сторону. И если судить по новым релизам, именно в мультимодальности Google действительно может претендовать на лидерство.
sms_systems@inbox.ru
+ 7 (985) 982-70-55