Google представляет универсальную ИИ-модель Gemini Omni «любой к любому»: что нужно знать бизнесу
Хотя неутомимые продвинутые пользователи ИИ обнаружили ее еще несколько недель назад, новая модель Gemini Omni от Google сегодня официально дебютировала на ежегодной конференции разработчиков I/O в Маунтин-Вью, штат Калифорния, ознаменовав собой принципиально новую парадигму на более широком рынке ИИ и технологий.
Дело в том, что, как следует из приставки «omni» (от латинского omne — «всё»), это первая по-настоящему нативная мультимодальная модель Google, то есть «модель, способная создавать что угодно из любых входных данных — начиная с видео».
Эта модель знаменует попытку Google объединить мультимодальный стек генерации — текст в изображение, изображение в видео, видео в видео, генерацию аудио — в единую базовую модель с единым интерфейсом редактирования.
Главный вопрос для руководителей бизнеса: стоит ли переводить какую-либо часть собственного стека ИИ на Gemini Omni уже сейчас?
К сожалению, на деле сделать это прямо сейчас, возможно, не получится — модель доступна только индивидуальным пользователям по тарифным планам подписки Google на ИИ, начиная с тарифа «AI Plus» за 20 долларов на пользователя в месяц. В настоящее время доступ к ней можно получить на сайте Gemini и в мобильных приложениях, в веб-пакете Google для редактирования изображений и видео с помощью ИИ Flow, а также в YouTube Shorts.
И хотя компания заявляет, что в конечном итоге она станет доступна через программный интерфейс приложения (API), на который многие корпоративные клиенты полагаются в своих задачах с ИИ, он пока не готов.
В качестве исключения из привычной практики Google также (пока) не опубликовала никаких публичных бенчмарков для Gemini Omni. Впрочем, сторонние организации, несомненно, протестируют ее на различных задачах и пользовательских метриках качества. Пока же ее качество и скорость остаются отчасти субъективными.
Однако, учитывая возможности и более быстрое редактирование, которые обеспечивает новая модель Omni, отдельным сотрудникам вашей команды, вероятно, стоит всерьез рассмотреть переход на нее — особенно если они занимаются созданием визуальных материалов для технических схем, маркетинговых и коммуникационных материалов, учебных и корпоративных курсов, материалов для продаж и вообще всего, что связано с визуализацией.
Что на самом деле представляет собой Omni
Omni — это следующая глава работы, результатом которой стала Nano Banana, модель генерации и редактирования изображений, выпущенная Google примерно год назад.
Первая модель в семействе, Gemini Omni Flash, принимает на вход любую комбинацию текста, изображений, аудио и видео и выдает высококачественный результат в тех же модальностях — и всё это силами одной модели, а не цепочки специализированных систем.
Google заявляет, что модель является «нативно мультимодальной с самого основания», что важно не столько как маркетинговый текст, сколько как архитектурное утверждение: единая модель способна рассуждать по разным модальностям в рамках одного прямого прохода (forward pass), что обычно обеспечивает более целостное редактирование, меньше артефактов пайплайна и гораздо более прозрачный API для разработчиков.
OpenAI положила начало этому тренду еще в мае 2024 года с выходом GPT-4o — своей первой нативно «omni» модели, также обученной с нуля анализировать и генерировать множество различных типов контента: от текста до кода, изображений и аудио. Однако она не поддерживала генерацию видео, и в конечном итоге от модели отказались после сообщений о подобострастности и даже требований пользователей сохранить ее из-за возникших у них парасоциальных отношений с ИИ.
Грозит ли Gemini Omni появление столь же преданных поклонников? Время покажет.
Одно из главных отличий заключается в том, что ключевым паттерном взаимодействия здесь является диалоговое редактирование видео. Каждая инструкция «опирается на предыдущую», а прошлые указания сохраняются между шагами диалога, поэтому видео трансформируется последовательно по мере итераций пользователя.
Среди практических примеров, отмеченных Google, — изменение окружения внутри ролика, переосмысление действия или ракурса камеры, пошаговая доработка сцен за несколько итераций и генерация объясняющего контента по коротким промптам.
Google также подчеркивает улучшенную физику — гравитацию, кинетическую энергию, гидродинамику, — а ведь именно такие детали отличают видео категории «похоже на работу ИИ» от «выглядит как реальная съемка».
Развертывание, цены и вопрос об API
Первое, с чем руководителям предприятий следует внимательно ознакомиться, — это план развертывания. Omni Flash запускается сегодня в приложении Gemini для подписчиков из США на уровнях AI Plus, AI Pro и AI Ultra, включая новый тариф AI Ultra стоимостью 100 долларов в месяц, о котором Google объявила на том же мероприятии.
Google заявляет, что модель станет доступна разработчикам через API Vertex AI «в ближайшие недели». Эта задержка существенна. До тех пор, пока API Vertex не станет общедоступным, Omni фактически остается инструментом для потребителей и просьюмеров.
Пилотные корпоративные проекты, выходящие за рамки индивидуальных экспериментов по подписке на рабочее место, должны дождаться API — как потому, что именно там действуют корпоративные SLA Google и обязательства по обработке данных, так и потому, что генеративное видео промышленного уровня без программного интерфейса попросту нежизнеспособно.
Ее цена через API в расчете за миллион токенов (предположительно) также определит жизнеспособность модели как корпоративного продукта за пределами кино, телевидения, индустрии развлечений и искусства.
Для лиц, принимающих решения и оценивающих экономику подписок на пользователя прямо сейчас, новый тариф AI Ultra позиционируется специально для разработчиков, технических руководителей, интеллектуальных работников и продвинутых авторов, предлагая приоритетный доступ к Google Antigravity, увеличенные лимиты использования и включенный доступ к Omni Flash.
Для небольших творческих команд со сжатыми сроками это может стать самым быстрым способом оценить модель до появления API.
Действительно важные корпоративные сценарии использования
Проще всего свести сценарии использования к «маркетинговым видео», однако ценностное предложение Omni для предприятий гораздо шире, если рассматривать ее как программируемый движок для видео и медиа, а не просто приложение для творчества:
-
Продажи и маркетинг: быстрая генерация вариантов рекламных объявлений, локализованных креативов и демонстраций продуктов без необходимости тратить время на агентства под каждый отдельный ассет.
-
Внутренние коммуникации, обучение и развитие персонала (L&D): объясняющие видео, модули адаптации новых сотрудников и пошаговые разборы регламентов, созданные неспециалистами.
-
Клиентская поддержка и документация: динамические визуальные инструкции под конкретные запросы, прикрепляемые к справочным статьям.
-
Продукт и разработка: визуализация симуляций, демонстрации интерфейса и концептуальные видеоролики для согласования технических спецификаций.
-
Полевые операции: короткие обучающие ролики под конкретные ситуации, создаваемые по запросу.
Что меняется с появлением Omni по сравнению с предыдущим поколением инструментов, так это унификация. Многим предприятиям приходилось сшивать рабочий процесс из моделей генерации текста в изображение, изображения в видео, синхронизации губ и генерации голоса, причем каждая из них требовала отдельного контракта, биллинга и маршрута передачи данных. Единая модель на базе Vertex AI сводит закупки и мониторинг в единую точку — при условии, что готовый API обеспечит промышленную пропускную способность и низкую задержку.
Вопросы контроля и безопасности — самая недооцененная часть
Для CIO и CISO самым важным разделом анонса Google является не паспорт модели, а функционал проверки происхождения и безопасности контента, поставляемый вместе с ней.
Каждое видео, созданное с помощью Omni, содержит цифровой водяной знак Google SynthID. Google расширяет применение стандартов учетных данных контента C2PA (Content Credentials) во всех своих генеративных инструментах и запускает API обнаружения ИИ-контента (AI Content Detection API) на платформе Agent Platform, что позволит компаниям выявлять созданный ИИ контент как от Google, так и от других популярных моделей.
Партнерские интеграции, объявленные на этом же мероприятии, включая Shutterstock, Avid (в Pro Tools) и как минимум одно крупное новостное агентство, указывают на вектор развития этого стандарта.
Для корпоративного сектора это важно по трем конкретным причинам:
-
Это дает юридическим службам и отделам комплаенса надежный аудиторский след для медиаматериалов, созданных ИИ.
-
Это позволяет командам по безопасности бренда выявлять материалы, созданные ИИ, поступающие в контентные пайплайны от третьих сторон.
-
И это дает убедительный ответ регулирующим органам в юрисдикциях вроде ЕС, где ужесточаются правила раскрытия информации о синтетических медиа.
Также представлена программа «Персональные аватары» (Personal Avatars), позволяющая авторам записывать короткие видео для подтверждения права на использование их голоса и внешности в генерируемом контенте — как продемонстрировали сегодня сами руководители и сотрудники Google в публикациях, посвященных I/O, с использованием своих сгенерированных ИИ цифровых копий.
Это делает сервис прямым конкурентом британского ИИ-«единорога» Synthesia, специализирующегося в первую очередь на безопасных для корпоративного использования ИИ-видео и аватарах.
Для компаний, рассматривающих создание видеороликов с участием руководства, обучающих аватаров или контента с брендовыми амбассадорами, предложенная здесь модель согласия — правильная отправная точка, однако контракты и политики управления правами придется расширить, чтобы охватить эти сценарии.
Риски, на которые стоит обратить внимание
Основные риски Omni уже знакомы, но о них стоит напомнить еще раз.
Конкурентная среда перенасыщена: вышеупомянутая Synthesia, получившая признание модель Seedance от материнской компании TikTok — ByteDance, модели Kling AI от Kuaishou Technology, а также быстро развивающееся сообщество решений с открытым исходным кодом борются за одни и те же рабочие процессы.
Привязка к одной конкретной модели генерации видео вызывает серьезные опасения в условиях, когда качество выходных данных совершает качественные скачки каждый квартал.
Задержки и стоимость генерации видео в промышленных масштабах остаются непроверенными за рамками контролируемых демонстраций.
Кроме того, юридический статус обучающих данных для генеративного видео остается неурегулированным во многих юрисдикциях; компаниям следует требовать четких формулировок о возмещении убытков, прежде чем запускать сгенерированные видео в каналы, ориентированные на клиентов.
Кроме того, колумнист VentureBeat и ИИ-ютубер Сэм Виттевеен, генеральный директор поставщика корпоративных решений в сфере машинного обучения Red Dragon AI, получил ранний доступ к Gemini Omni и сообщил, что ограничения контента (которые некоторые расценивают как цензуру) оказались весьма жесткими, что потенциально может ограничить и заблокировать целый ряд сценариев использования, которые компания хотела бы реализовать.
Рекомендации для компаний, рассматривающих возможность внедрения
Omni заслуживает пилотного тестирования, однако структура пилота имеет решающее значение.
Для большинства предприятий правильным шагом на ближайшие 30–60 дней станет финансирование небольшого санкционированного эксперимента с одной или двумя подписками AI Ultra в отделах маркетинга или обучения и развития (L&D), в то время как команды по платформам и безопасности используют эту фору для подготовки к API Vertex AI: определят требования к размещению данных, настроят проверку SynthID и C2PA в пайплайне работы с контентом и развернут AI Content Detection API наряду с существующими инструментами управления медиаресурсами.
Относитесь к потребительскому запуску как к предварительному знакомству с интерфейсом, а не как к производственному плану. Когда появится API, компании, которые уже проделали работу по комплаенсу и управлению, смогут внедрить Omni в реальные рабочие процессы, пока остальные будут только разрабатывать внутренние регламенты.
Сама по себе Omni не повод полностью пересматривать корпоративную стратегию в области ИИ. Но это мощный сигнал о том, что стек мультимодальной генерации объединяется в единые модели со встроенными механизмами подтверждения происхождения — и лицам, принимающим технические решения, следует учитывать этот сдвиг в своих планах уже сейчас.



