Runway ML устраняет дрейф аватаров с помощью функции UX
Источник: VentureBeat · Ben Dickson
Компания Runway потратила несколько недель на попытки устранить упрямый баг: создаваемые ИИ аватары смещались от центра во время генерации видео в реальном времени. Решением стал не бэкенд-патч, а новая фронтенд-функция, которая просто обходила эту проблему. Именно об этом уроке рассказал Райан Филлипс, руководитель направления корпоративных продуктов в Runway ML, на конференции VB Transform 2026. Он отметил, что даже те компании, которые не создают базовые модели самостоятельно, могут почерпнуть много полезного из опыта Runway в разработке, оценке и выпуске таких систем.
«Я думаю, что даже если вы не занимаетесь самостоятельным созданием моделей, полезно узнать, как это делаем мы, поскольку практически все эти уроки применимы к вашей повседневной работе», — заявил Филлипс.
Runway — это компания, занимающаяся прикладными исследованиями в области искусственного интеллекта и создающая общие модели мира для работы генеративных инструментов. Во время своего выступления Филлипс продемонстрировал Runway Characters — модель видео в реальном времени, которая обеспечивает мгновенное взаимодействие с созданными ИИ аватарами без задержек. Пять лет назад создание видео с нечитаемым текстом и низкой частотой кадров требовало от художников сотен часов ручной сборки отдельных кадров, отметил он. Сегодня модели Runway генерируют интерактивное видео «на лету».
«Изучение того, как мы создаем эти модели реального времени, может вдохновить вас на создание и развертывание аналогичного опыта — с использованием агентов или без них — в ваших собственных компаниях уже сегодня», — сказал он.
Демистификация оценок (евалов)
Создание надежного ИИ-продукта начинается с качественного набора для оценки (eval set). Однако к созданию этого набора нельзя подходить исключительно как к инженерной задаче. Для определения того, как на самом деле выглядит «качество», требуется тесное межфункциональное взаимодействие команд продукта, дизайна, исследований и продаж.
Филлипс подчеркнул важность проведения внутренних воркшопов, на которых члены команды совместно изучают сгенерированные примеры. Цель состоит в том, чтобы сформировать у всей организации единое понимание конкретных сценариев сбоев, чтобы каждый разделял общее определение успешной генерации.
«Мы потратили много времени на работу с нашей командой, разбирая примеры… того, как выглядят успехи и неудачи, вплоть до самых детальных и придирчивых мелочей», — рассказал Филлипс.
Полученный набор для оценки должен охватывать как широкие потребительские сценарии использования, так и экстремальные краевые случаи. Например, Филлипс отметил, что для проверки предсказуемого поведения модели при выходе за рамки стандартной структуры человеческого лица использовался «Tooth» («Зуб») — нечеловеческий персонаж без носа и с очень необычными зубами.
Оценивая такие результаты генерации, команда Runway выискивает едва заметные артефакты. В одном из примеров видео, где лицо персонажа оставалось неизменным, но фоновые элементы (например, сетка) начинали деформироваться, строго оценивалось как неудачное.
Несмотря на передовой характер продукта, для отслеживания этих оценок команда Runway использует простой инструмент: таблицу Excel. Команда ежедневно фиксирует результаты тестов, классифицируя их как «незначительные» или «серьезные» сбои по сравнению с заранее определенным порогом успешности.
«Мы устанавливаем планку еще до начала работы — какой процент тестов мы должны пройти, и когда мы достигаем этого показателя, мы выпускаем модель», — пояснил Филлипс. «Так что здесь нет никакой магии».
Для корпоративных разработчиков, сталкивающихся с недетерминированным дрейфом качества в собственных конвейерах реального времени, ручная оценка в больших масштабах становится узким местом. Чтобы решить эту проблему, Филлипс отметил, что разработчики могут положиться на языковые модели для автоматизации процесса визуальной оценки.
«Большие языковые модели (LLM) довольно неплохо справляются с ролью арбитра для значительной части такого контента, особенно для тех видов деформаций или изменений, которые можно увидеть в наборе для оценки», — сказал он. Команды также могут передавать языковой модели закулисный контекст (например, от руки набросанный эскиз или структуру рекламного макета) для направления процессов генерации и валидации, обеспечивая качество без дополнительной когнитивной нагрузки на конечного пользователя.
Обучение моделей и превращение багов в функции
Поставка генеративного видео в реальном времени требует высокооптимизированного технологического стека. Процесс начинается с предварительного обучения массивной базовой модели, что требует больших ресурсов и медленно генерирует результаты. Для достижения задержек в реальном времени Runway опирается на дистилляцию, в ходе которой меньшая и более быстрая «студенческая» модель обучается имитировать большую «учительскую» модель. По словам Филлипса, дистилляция помогает Runway сократить «от 80 до 90% времени генерации».
Затем команда применяет состязательное постобучение (adversarial post-training, APT) к дистиллированной модели. Этот метод заставляет модель постоянно совершенствоваться, проверяя ее на устойчивость к системе, разработанной для поиска ее недостатков, что помогает вернуть визуальную четкость, утраченную в процессе дистилляции.
Однако изменение архитектуры модели порождает новые проблемы. Фазы дистилляции и APT привели к появлению упрямого бага: во время генерации в реальном времени персонажи раскачивались или смещались из центра кадра.
По его словам, команда потратила несколько недель на попытки исправить саму базовую модель, чтобы полностью исключить это смещение. В конце концов они обнаружили, что если исходное изображение пользователя было идеально отцентрировано, сгенерированное видео оставалось стабильным. Вместо того чтобы тратить больше времени на исправление кода на бэкенде, Runway переключилась на поиск решения на уровне пользовательского интерфейса.
«Когда мы заметили это во время оценок, мы сказали: «Что если просто предложить это в качестве функции?» Если пользователь предоставляет нам персонажа, повернутого влево, мы знаем, что видео будет деформироваться. Давайте просто исправим это за них», — рассказал Филлипс.
Они внедрили фронтенд-функцию под названием «Оптимизировать качество изображения», которая автоматически центрирует изображение пользователя перед началом генерации. Обернув ограничение бэкенд-модели во фронтенд-инструмент, пользователи восприняли это как полезную функцию, а не как инженерный изъян.
«Превращайте ограничения моделей в продуктовые фичи, чтобы фактически расширить возможности работы модели», — посоветовал Филлипс. «Внутри компании это может казаться ограничением, но ваши клиенты не увидят это в таком свете, если вы встроите это как продуктовую функцию».
Дьявол кроется в деталях инфраструктуры
Доставка видео по всему миру со скоростью 24 кадра в секунду требует оптимизации каждого слоя инфраструктурного стека. Это варьируется от кэширования и параллельного декодирования до внесения глубоких изменений в ядро системы в партнерстве с такими аппаратными провайдерами, как Nvidia.
Вскоре после запуска Runway Characters, по его словам, команда заметила, что 8% вызовов API проседают до 16 кадров в секунду, из-за чего видео у клиентов начинало подтормаживать.
Для поиска первопричины потребовалась глубокая наблюдаемость (observability). Команда использовала ИИ-агент на базе Claude в сочетании с такими инструментами мониторинга, как Datadog и Sentry, чтобы отследить аномалию. Сеанс отладки локализовал проблему в единственном дата-центре в регионе us-east-1.
«Решение на самом деле заключалось вовсе не в том, чтобы что-то починить или изменить конфигурацию», — пояснил Филлипс. «Они буквально поехали и физически заменили те графические процессоры в дата-центре, чтобы исправить это, и в конечном итоге именно это решило проблемы».
Для корпоративных команд, развертывающих приложения реального времени, вывод очевиден: аномалии в аппаратном обеспечении и инфраструктуре будут напрямую влиять на производительность модели, требуя строгих возможностей полностековой отладки.
«Не забывайте обо всех мелких деталях, потому что при развертывании таких моделей их невероятно много», — сказал Филлипс.
Выживание в «аду неудач» и будущее создания миров
Разработка ИИ-систем редко бывает линейным процессом. Команды часто застревают на недели над одной-единственной проблемой без видимого выхода — эту фазу Филлипс назвал «адом неудач».
«Мы считаем, что нужно пройти через эту боль и по-настоящему побороться с проблемой какое-то время, прежде чем совершить прорыв», — отметил он. Последовательные итерации в конечном счете сглаживают кривую сложности, вызывая внезапные экспоненциальные улучшения.
По мере того как базовые модели преодолевают эти технические препятствия, роль корпоративных креативщиков также кардинально меняется. Традиционно маркетинговые и дизайн-команды концентрировались на создании отдельных ассетов, таких как конкретная реклама или иллюстрация. В эпоху генерации в реальном времени и агентных рабочих процессов эта парадигма смещается в сторону определения параметров, эстетики и интеллектуальной собственности.
«Возможно, вы не будете проектировать отдельную рекламу, но вы можете спроектировать мир, на основе которого агент или модель видео в реальном времени смогут генерировать рекламные материалы», — заключил Филлипс.



