Google Gemini Omni Flash появляется в API, превращая корпоративное производство видео в диалог
Источник: VentureBeat · Sam Witteveen
Для большинства предприятий 90-секундный обучающий видеоролик или презентация продукта никогда не давались легко. Это означает детально спланированный бриф, внутреннюю съемочную группу или стороннего подрядчика, съемку, монтаж и цикл правок. Стоит изменить одну строчку текста на экране из-за юридической проверки — и вся цепочка запускается заново. Именно из-за высокой стоимости и длительных сроков так много корпоративных видеороликов в итоге вообще не создаются.
Эту формулу и стремится переписать Google с помощью Gemini Omni Flash — первой модели из своего нового семейства «Omni», которая теперь становится доступной для разработчиков и корпоративных клиентов через API после своего дебюта для рядовых пользователей на конференции I/O 2026. Google формулирует амбиции семейства как создание чего угодно «из любого источника» (any input), начиная с видео. Но главным нововведением здесь является не просто более точный промпт для перевода текста в видео, а возможность редактировать готовый клип с помощью диалога.
Когда модель была представлена в мае, аналитический материал VentureBeat для бизнеса указал на подвох: из-за отсутствия программного интерфейса Omni была инструментом для потребителей и профессионалов-одиночек, а не для полноценного производства. Этот запуск API меняет дело. Он открывает возможности разговорного монтажа для маркетинговых команд и отделов обучения и развития, которые создают больше всего видеороликов в любой организации.
Суть предложения: конвейер из пяти инструментов сводится к одному диалогу
До сих пор многие команды собирали ИИ-видео сложным путем: объединяли LLM для сценария, модель «текст-изображение», модель «изображение-видео», отдельный инструмент для синхронизации губ и генератор голоса — и каждый со своим контрактом, выставлением счетов и каналом передачи данных.
Корпоративный аргумент Omni заключается в унификации: это единая модель, которая принимает текст, изображения и видео, а на выходе выдает готовый клип со синхронизированным звуком.
Фактор этой простотности — первое, на что следует обратить внимание лицам, принимающим решения. Сокращение нескольких специализированных инструментов до одной модели означает меньшее число вендоров, а также единое место для мониторинга результатов и соблюдения правил работы с данными. Для организации, которая избегала генеративного видео из-за того, что состыковка инструментов не стоила затраченных усилий, ситуация кардинально меняется.
Благодаря разговорному редактированию каждая новая инструкция опирается на предыдущую, поэтому маркетолог может изменить освещение на кадре с продуктом, скорректировать ракурс или сменить гардероб без необходимости запускать генерацию с нуля и терять то, что уже сработало. Это разница между заказом повторной съемки и отправкой короткой заметки.
Мультимодальные референсы и физический движок для брендовых активов
Omni принимает гораздо больше, чем просто текстовый запрос. Помимо описания того, что именно вам нужно, вы можете передать модели несколько справочных изображений и уже существующих видеоклипов, и она перенесет эти особенности в результат. Дайте ей фотографию конкретного объекта, попросите поместить этот объект в сцену, и она воспроизведет расцветку и примерную форму реального предмета, а не изобретет банальную замену. Хотя совпадение может быть не идеальным до пикселя, оно достаточно близко, чтобы объект был узнаваем. Именно такое управление на основе референсов делает эту функцию коммерчески интересной: фотографию продукта, логотип бренда или определенную локацию можно использовать как ингредиент, а не пытаться безуспешно описать словами в промпте.
Две из четырех ключевых сильных сторон, выделенных Google, напрямую касаются корпоративных задач. Первая — это модель мира (world model), понимание системой того, как ведут себя физические сцены. Добавьте небольшой дождь и лужи к существующему кадру, и модель отрисует отражения людей и объектов на мокром асфальте — ту самую физическую согласованность, которая отличает реальные кадры от очевидного ИИ-видео.
Вторая функция — вставка текста и логотипов. Укажите на сцену с обилием вывесок, и вы сможете переписать эти вывески на другом языке или для выбранного вами бренда, а также внедрить в кадр корпоративный логотип. Результаты не идеальны: во время тестирования отслеживание вывесок в сложных сценах не всегда работало безупречно, а часть текста между кадрами порой возвращалась к исходному языку. Для обучающих видеороликов, требующих подписей на экране, или рекламы с размещением логотипа в кадре эта функция заслуживает пристального внимания, а также напоминает, что результат все равно нуждается в проверке человеком перед релизом.
API взаимодействий и ограничения, которые всё еще дают о себе знать
Под капотом все это работает на новом Interactions API от Google — интерфейсе с поддержкой состояния (stateful), созданном для многошаговых задач, а не для открытого чата. Каждый шаг переносит предыдущее видео и его референсы дальше, что и позволяет правкам накапливаться последовательно. Разработчики могут объединять генерации в цепочки. Они могут создать клип, превратить кота в котенка пумы, придать видео сначала 8-битный ретро-стиль, а затем эффект акварели и сохранить каждую версию для создания ответвлений в будущем.
Ограничения вполне реальны, и их стоит учитывать при планировании бюджета. В настоящее время длительность клипов ограничена 10 секундами, согласно опубликованной карточке модели. Чтобы сделать видео длиннее, вы генерируете фрагменты и монтируете их вместе. Загруженные материалы также можно редактировать, если их длительность составляет 10 секунд или меньше и у пользователя есть на них права. В собственной карточке модели Google честно признает, что поддержание согласованности между правками и рендеринг точного текста остаются нерешенными проблемами.
Защитные механизмы, водяные знаки и черта, которую Google не пересечет
Для директора по информационной безопасности (CISO) демонстрационные ролики менее важны, чем инструменты подтверждения происхождения контента, поставляемые вместе с моделью. Каждый клип Omni несет в себе водяной знак SynthID от Google, компания внедряет стандарты C2PA Content Credentials во все свои генеративные инструменты и запустила API определения ИИ-контента (AI Content Detection API), который помечает созданные искусственным интеллектом медиафайлы — как от Google, так и от других вендоров.
Google также провела четкую границу. Модель не станет брать статичную фотографию человека и аудиозапись, чтобы синхронизировать движение губ для создания речи — это осознанный шаг для ограничения дипфейков. Однако она может взять запись чьего-то выступления и перевести ее на другой язык, что является полезным инструментом для локализации глобального учебного контента. Для регулируемых предприятий такие ограничения и встроенная система проверки происхождения являются скорее преимуществами, чем помехами.
VB Transform · 14–15 июля · Менло-Парк · Инференс и ИИ-инфраструктура
GM увеличила количество успешно объединенных PR-запросов на 300%, перестроив архитектуру под агентов. Вот что они создали.
Инфраструктурное направление на конференции Transform охватывает генерацию видео в реальном времени, механизмы машинного мышления и то, что на самом деле требуется для запуска агентов в масштабах предприятия.
Цифры: дешево, только 720p и (предварительно) первое место в рейтинге
Цены были объявлены одновременно с выходом API, и они весьма агрессивны. Omni Flash стоит $0,10 за секунду сгенерированного видео в разрешении 720p, что делает десятисекундный клип примерно равным одному доллару. Это соответствует показателям Veo 3.1 Fast в том же разрешении, вдвое превосходит Veo 3.1 Lite и на три четверти дешевле стандартного Veo 3.1.
|
За секунду (USD) |
Gemini Omni Flash |
Veo 3.1 Lite |
Veo 3.1 Fast |
Veo 3.1 |
|
720p |
$0,10 |
$0,05 |
$0,10 |
$0,40 |
|
1080p |
н/д |
$0,08 |
$0,12 |
$0,40 |
|
4K |
н/д |
н/д |
$0,30 |
$0,60 |
Однако эта таблица также обнажает и подвох. Omni Flash создает видео исключительно в разрешении 720p. Здесь нет опций 1080p или 4K, в то время как линейка Veo масштабируется вплоть до 4K. Для внутреннего обучения и большинства видео для соцсетей 720p вполне достаточно. Для премиальной рекламы бренда, предназначенной для большого экрана, это реальный потолок — и именно поэтому Veo 3.1 всё еще остается востребованным.
Клипы длятся от 3 до 10 секунд в нативном разрешении 720p, в альбомной (16:9) или портретной (9:16) ориентации. В качестве вспомогательных входных данных модель принимает до семи изображений и до трех видеоклипов длительностью три секунды или меньше. Она пока не принимает аудио на вход, хотя и генерирует звук вместе с производимым видео. На выходе получается стандартный файл MP4, а каждый клип поставляется со встроенными водяными знаками SynthID и учетными данными C2PA.
Что касается качества, первые показатели внушают оптимизм. В Text-to-Video Arena от LMArena — таблице лидеров, где пользователи голосуют за результаты прямого сравнения конкурирующих моделей — Omni Flash заняла первое место с баллами 1527.
Что это значит для бюджетов и чего всё еще не хватает
С появлением реальных цен концепция итераций приобретает конкретные очертания. Каждое разговорное редактирование — это новая генерация, за которую вы платите, поэтому сеанс с большим количеством правок все равно выливается в круглую сумму: примерно один доллар за каждый десятисекундный проход в 720p. Модель с сохранением контекста меняет не стоимость правки, а количество пустых попыток: поскольку контекст переносится между шагами, эти генерации тратятся на доработку кадра, который в целом уже удался, вместо того чтобы начинать все с чистого листа в надежде, что следующая попытка окажется удачной.
Omni не одинок в этой нише. Veo 3.1 остается надежным решением от Google производственного уровня, когда требуется более высокое разрешение, а конкуренты из Bytedance, Alibaba и OpenAI наступают на пятки в борьбе за те же бюджеты. Omni же привносит именно возможности монтажа: способность относиться к видео как к жимому документу, а не к результату разового рендеринга.



