Stability AI запускает Stable Audio 2.5

Stability AI запускает Stable Audio 2.5

Компания Stability AI изначально привлекла к себе внимание линейкой генеративных ИИ-моделей Stable Diffusion для преобразования текста в изображения, однако этим ее деятельность не ограничивается.

Сегодня Stability AI представила Stable Audio 2.5 — модель для генерации аудио, которая, по заявлению компании, стала первой аудиомоделью, созданной специально для корпоративного использования.

В то время как генерация изображений и текста прочно вошла в мейнстрим благодаря множеству конкурентных вариантов, корпоративное использование аудио часто сопряжено с большими трудностями. Компания впервые выпустила Stable Audio в 2023 году, а год спустя, в 2024-м, последовала версия 2.0. Новая модель — это не просто очередной прирост версий, а настоящий качественный скачок с акцентом на реализацию корпоративных сценариев использования.

Модель устраняет серьезный пробел в внедрении ИИ на уровне предприятий. Аудио влияет на вовлеченность клиентов, однако у большинства компаний отсутствует инфраструктура для масштабного производства индивидуального аудио, соответствующего бренду. Аудио требуется для самых разных точек контакта: от рекламных роликов до оформления магазинов.

Релиз знаменует собой технический прорыв, который сокращает количество вычислительных шагов при генерации аудио с 50 до всего лишь восьми, одновременно значительно повышая качество результатов. Модель нацелена на слабо освоенный рыночный сегмент: по данным компании, персонализированное аудио способно сделать бренды в 8 раз более запоминающимися, однако лишь 6% креативных проектов задействуют звуковую идентификацию.

«Версия 2.5 — это не просто итерация 2.0, — рассказал VentureBeat Зак Эванс (Zach Evans), руководитель исследований аудио в Stability AI. — Она отражает наш сдвиг в сторону возможностей корпоративного уровня: аудио профессионального качества, более высокая производительность и продвинутые средства контроля, необходимые для коммерческих сценариев и многошаговых итеративных рабочих процессов профессионалов в сфере креатива».

Технический прорыв делает возможным производство аудио корпоративного масштаба

Ключевая инновация заключается в новом методе пост-тренинга Adversarial Relativistic-Contrastive (ARC), разработанном Stability AI.

«Метод состязательного релятивистско-контрастивного обучения (ARC) представляет собой технику пост-тренинга, которая позволяет обойти традиционные подходы, требующие использования моделей-учителей, дистилляции или свободного от классификаторов наведения», — пояснил Эванс. — Вместо этих ресурсоемких методов ARC напрямую оптимизирует способность модели генерировать высококачественное аудио с меньшим количеством шагов вывода».

Прирост эффективности оказался существенным. Он отметил, что если для генерации Stable Audio 2.0 требовалось около 50 шагов, то Stable Audio 2.5 справляется всего за восемь. Это позволяет создавать треки продолжительностью до трех минут менее чем за две секунды на графических процессорах H100. С новой моделью компании теперь могут быстро перебирать десятки вариантов за считанные минуты вместо недель.

В модели также реализованы возможности инпейнтинга (дорисовывания) аудио. Творческие команды могут загрузить существующий аудиофрагмент, выбрать точки начала и окончания, а модель сгенерирует контекстно подходящее продолжение. Такой уровень детального контроля отвечает потребностям профессиональных производственных процессов, где итеративная доработка имеет решающее значение.

Конкурентная среда и отличия для корпоративного сектора

Сфера аудио-ИИ, как и большая часть рынка генеративного ИИ, становится все более конкурентной.

На рынке представлено множество вендоров с коммерческими продуктами, среди которых ElevenLabs, aiOla и GPT-4o transcribe от OpenAI. Синтез речи из текста — это общая функция для всех них, и Stable Audio 2.5, безусловно, тоже способна ее выполнять.

Stability AI стремится выделиться за счет возможностей, ориентированных именно на бизнес и часто отсутствующих в потребительских решениях. Аудиоинпейнтинг и возможность дообучения на собственных датасетах компании — это две ключевые особенности такого рода.

Другие важные отличия включают гибкие варианты развертывания. Сюда входят API, локальное размещение (on-premises) и веб-приложения. Коммерческая безопасность обеспечивается полностью лицензированными обучающими датасетами. Глубина кастомизации позволяет решать специфические задачи бренда.

Возможности модели по созданию музыкальных композиций также претерпели значительные улучшения. По словам Эванса, Stable Audio 2.5 способна генерировать более сложные, полноценно развитые композиции с меньшим количеством повторяющихся фрагментов и аудиоартефактов. Stability AI может работать с корпоративными клиентами для обучения кастомных моделей. Это позволяет встраивать фирменное звучание бренда в генеративные рабочие процессы, гарантируя соответствие результатов стандартам звуковой идентичности.

Для укрепления своих позиций в корпоративном сегменте Stability AI заключила партнерское соглашение с ведущим агентством звукового брендинга Amp (входящим в группу WPP) для совместной разработки корпоративных решений для брендов, стремящихся создать уникальный звуковой стиль. Благодаря этому партнерству Stable Audio 2.5 станет доступна глобальной клиентской базе WPP через платформу WPP Open, объединяя передовые технологии и творческую экспертизу.

Стратегическая база для принятия решений по модели «создать своими силами или купить»

Для компаний, оценивающих целесообразность внедрения аудио-ИИ, Stability AI рекомендует использовать концепцию из четырех факторов:

Анализ рентабельности инвестиций (ROI): сопоставьте текущие сроки и затраты на производство аудио с потенциальной экономией от вариантов, созданных ИИ, и ускоренными циклами итераций. Сможете ли вы снизить затраты и ускорить вывод продукта на рынок? Сколько времени занимает ваш существующий процесс создания необходимого аудио?

Творческое соответствие: оцените, какой уровень контроля и кастомизации вам необходим. Есть ли у вас внутренние специалисты, способные гарантировать соответствие аудиорезультатов конкретным стандартам бренда? Как вы убеждаетесь в том, что звук подходит для творческой концепции? Можете ли вы быстро тестировать и перебирать различные аудиоварианты, чтобы понять, что находит отклик у вашей аудитории?

Коммерческая безопасность: сравните имеющиеся ресурсы для производства коммерчески безопасной музыки с очищенными правами с датасетами, лицензированными вендором. Есть ли у вас возможность создавать коммерчески безопасную музыку с помощью имеющихся ресурсов?

Требования к инфраструктуре: определите технические возможности для самостоятельного обучения и развертывания моделей по сравнению с партнерством со специализированными вендорами. Есть ли у вас техническая инфраструктура и экспертиза для обучения и развертывания моделей собственными силами?

Будущие последствия для корпоративной стратегии в области аудио

В перспективе исследовательские приоритеты Stability AI будут выходить за рамки скорости генерации и распространяться на возможности реального времени и адаптивный аудиоопыт.

«Наша недавняя научная работа подчеркивает открывающиеся в будущем творческие возможности: от генерации музыки в реальном времени до интерактивного звукового дизайна с музыкой, которая динамически адаптируется к аудитории», — отметил Эванс.

Технические достижения в Stable Audio 2.5 знаменуют собой момент зрелости для компаний, рассматривающих внедрение аудио-ИИ. Корпоративные возможности, коммерческая безопасность и глубина кастомизации теперь объединены в рамках одной платформы. Прорыв в виде 8-шаговой генерации напрямую отвечает требованиям современных рекламных кампаний к скорости итераций в различных каналах и форматах.

Для компаний, стремящихся лидировать в сфере брендинга на базе ИИ, это событие сигнализирует о том, что индивидуальная звуковая идентичность переходит из категории «приятного дополнения» в разряд конкурентной необходимости. Сочетание быстрой генерации, возможностей дообучения и коммерческого лицензирования открывает четкий путь к масштабированию консистентного звукового оформления бренда. Это имеет решающее значение в условиях растущего объема цифровых точек контакта, где звуковая идентичность играет все более важную роль в привлечении аудитории.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.