Подход Waymo к оценке ИИ и безопасности
Источник: VentureBeat · Carl Franzen
Лишь немногие компании сталкиваются со столь высокими ставками при развертывании ИИ, как Waymo — компания по разработке беспилотных автомобилей, входящая в состав Alphabet, которая выделилась из Google. Ее модели не просто генерируют текст или автоматизируют бэк-офисные задачи: они помогают автомобилям ориентироваться на непредсказуемых улицах, реагировать на других участников дорожного движения и принимать решения за доли секунды в реальном физическом мире.
Но методы, которые Waymo использует для управления этими рисками — непрерывная оценка, тщательно отобранные данные, контроль со стороны человека и четко определенные бизнес-цели — предлагают универсальное руководство для предприятий, внедряющих ИИ-агентов практически в любой отрасли.
Манаси Джоши (Manasi Joshi), директор Waymo по инженерным разработкам в области системного интеллекта и машинного обучения, рассказала на конференции VB Transform 2026 о том, как компания по созданию автономного транспорта обучает, тестирует и развертывает ИИ в больших масштабах. По данным компании, на сегодняшний день Waymo преодолела более 220 миллионов полностью автономных миль (то есть поездок без водителя в салоне), при этом количество серьезных травм в результате ДТП у нее в 17 раз ниже, чем у водителей-людей на аналогичном расстоянии.
По словам Джоши, чтобы достичь таких впечатляющих результатов, Waymo внедрила подход, который она назвала «разработкой, управляемой оценкой» (eval-forced development или eval-centric development), сделав тестирование неотъемлемой частью инженерии, а не финальной проверкой перед релизом.
«Уровень зрелости наших проектов можно легко определить по тому, насколько развита система их оценки», — отметила Джоши.
На практике Waymo оценивает готовность проекта во многом по степени зрелости тестов, которые его сопровождают. Этот подход имеет очевидное значение для предприятий, создающих агентов службы поддержки, помощников по программированию, финансовые системы или другие ИИ-приложения: если компания не может надежно измерить производительность системы, она, возможно, еще не готова запускать эту систему в производство.
Оценка должна продолжаться и после запуска
Джоши рассказала, что большая часть работы Waymo по обеспечению качества сместилась в сторону оценок, включая тесты, проводимые во время обучения моделей, после обучения, а также в рамках симуляций с открытым и закрытым контуром.
«Оценка — это не разовая задача для запуска модели», — подчеркнула она.
Вместо этого Waymo рассматривает оценку как непрерывный процесс, охватывающий вождение, моделирование и валидацию. Ее методология объединяет наборы данных, показатели эффективности и инфраструктуру, способную эффективно работать в больших масштабах.
Для бизнеса это означает, что тестирования агента перед запуском недостаточно. Команды должны продолжать его оценку по мере изменения базовых моделей, бизнес-процессов, поведения пользователей и поступающих данных. Кроме того, эти оценки должны быть связаны с реальными бизнес-результатами, а не опираться исключительно на общие отраслевые бенчмарки.
Джоши предостерегла, что измерения качества моделей заслуживают ровно такого же доверия, как и данные оценки, на которых они основаны. Поэтому Waymo подкрепляет свои заявления об эффективности информацией о свойствах наборов данных, использованных для тестирования своих систем.
Тестирование редких и опасных ситуаций
Иерархия оценок Waymo по-прежнему базируется на одной главной цели: безопасность.
Компания опирается на собственные журналы поездок, некоторые сторонние данные и реалистичные симуляции, которые подвергают ее системы испытаниям в сценариях, охватывающих миллиарды синтетических миль. Ответственные за задачи специалисты выбирают специализированные данные и метрики для ситуаций с участием уязвимых участников дорожного движения, на железнодорожных переездах, в зонах дорожных работ и в других сложных условиях.
Тот же принцип применим и за пределами автономного вождения. Предприятиям необходимо тестировать не только рутинные запросы, с которыми их агенты успешно справляются, но и нестандартные ситуации, где ошибки могут нанести финансовый, юридический, репутационный ущерб или подорвать безопасность.
Джоши подчеркнула, что Waymo не оставляет решения о релизе исключительно на усмотрение автоматизированных систем. Проверки готовности к производству включают в себя тщательный контроль со стороны человека, а внутренние руководители по безопасности утверждают выпуски программного обеспечения и расширение зон обслуживания.
«Это не полностью автоматизированный процесс на базе ИИ без какого-либо участия человека, — сказала она. — На кону человеческие жизни».
Эффективность не должна достигаться в ущерб надежности
Waymo сталкивается с другой проблемой, знакомой многим ИИ-командам в корпоративном секторе: спрос на вычислительные мощности, хранилища, память и пропускную способность сети растет быстрее, чем доступные ресурсы.
Компания стремится к эффективности во всем: от извлечения и хранения данных, распределенного обучения моделей, дистилляции моделей до симуляций и оценки. Она также уделяет особое внимание «эффективности данных», выбирая наиболее полезные примеры для обучения, вместо того чтобы считать больший объем данных изначально лучшим выбором.
Waymo начала использовать трансформеры в 2017 году и впоследствии расширила их применение до больших языковых моделей, многомодовых моделей «зрение-язык» (vision-language models) и моделей «зрение-язык-действие». По словам Джоши, теперь компания использует генеративные мультимодальные модели в рамках своей стратегии базовых (foundation) моделей.
Waymo разделяет свои технологии на бортовые системы внутри каждого автомобиля и наземную (off-board) инфраструктуру, используемую для разработки моделей, обработки данных и симуляций. Такое сочетание заставляет компанию оптимизировать как инференс в реальном времени, так и более крупные поддерживающие его системы.
Агентам нужны собственные оценки
Waymo также использует ИИ-агентов внутри компании в качестве инструментов повышения производительности для инженеров. Джоши рассказала, что агенты помогают анализировать распределение данных, оценивать эффективность данных и заниматься триажем проблем, обнаруженных в телеметрии автомобилей, процессах обучения и неудачных заданиях по оценке.
Цель состоит в том, чтобы ускорить расследования, чтобы инженеры могли уделять больше времени принятию решений и сложным техническим задачам. Однако Waymo также оценивает этих агентов, чтобы гарантировать, что они выдают заслуживающие доверия и точные результаты, а не уводят сотрудников по неверному пути.
Главный урок Waymo для корпоративных лидеров заключается в том, что агентный ИИ требует большего, чем просто выбор мощной модели. Организациям необходимы четко определенная цель, репрезентативные данные для оценки, непрерывное тестирование, способная эффективно работать инфраструктура и конкретные ответственные за принятие решений люди, которые отвечают за развертывание.
«Завоевание доверия имеет важнейшее значение», — резюмировала Джоши.



