Patronus AI представляет генеративные симуляторы
Patronus AI, стартап в области оценки искусственного интеллекта, привлекший 20 миллионов долларов от таких инвесторов, как Lightspeed Venture Partners и Datadog, во вторник представил новую архитектуру обучения, которая, по его утверждению, знаменует собой фундаментальный сдвиг в том, как ИИ-агенты учатся выполнять сложные задачи.
Эту технологию компания называет «генеративными симуляторами» (Generative Simulators). Она создает адаптивные симуляционные среды, которые в режиме реального времени непрерывно генерируют новые вызовы, динамически обновляют правила и оценивают производительность агента по мере его обучения. Такой подход отличается от статических бенчмарков, которые долгое время служили отраслевым стандартом для измерения возможностей ИИ, но все чаще подвергаются критике за неспособность предсказать производительность в реальном мире.
«Традиционные бенчмарки измеряют изолированные возможности, но они упускают из виду прерывания, переключения контекста и многоуровневое принятие решений, которые определяют реальную работу», — рассказал Ананд Каннаппан (Anand Kannappan), генеральный директор и соучредитель Patronus AI, в эксклюзивном интервью VentureBeat. «Чтобы агенты работали на человеческом уровне, им нужно учиться так же, как это делают люди — через динамический опыт и постоянную обратную связь».
Это анонс появляется в критический момент для индустрии искусственного интеллекта. ИИ-агенты меняют облик разработки программного обеспечения: от написания кода до выполнения сложных инструкций. Тем не менее, агенты на базе языковых моделей (LLM) склонны к ошибкам и часто демонстрируют плохие результаты в сложных многоэтапных задачах. Исследование, опубликованное ранее в этом году, показало, что агент с уровнем ошибок всего в 1% на шаг может накапливать вероятность сбоя до 63% к сотому шагу — отрезвляющая статистика для предприятий, стремящихся внедрять автономные системы ИИ в массовом масштабе.
Почему статические бенчмарки ИИ терпят неудачу и что будет дальше
Подход Patronus AI решает проблему, которую компания описывает как растущее несоответствие между тем, как оцениваются системы ИИ и как они на самом деле работают в рабочей среде. Традиционные бенчмарки, утверждают в компании, функционируют подобно стандартизированным тестам: они измеряют конкретные возможности в фиксированный момент времени, но с трудом отражают хаотичную и непредсказуемую природу реальной работы.
Новая архитектура генеративных симуляторов меняет эту модель с ног на голову. Вместо того чтобы предлагать агентам фиксированный набор вопросов, система на лету генерирует задания, условия окружающей среды и процессы контроля, а затем адаптируется в зависимости от поведения агента.
«За последний год мы наблюдали отход от традиционных статических бенчмарков в сторону более интерактивных обучающих площадок», — рассказала VentureBeat Ребекка Цянь (Rebecca Qian), технический директор и соучредитель Patronus AI. «Отчасти это связано с инновациями разработчиков моделей — переходом к обучению с подкреплением, посттренингу и непрерывному обучению вдали от настройки под руководством учителя (supervised instruction tuning). Это означает, что различие между обучением и оценкой стерлось. Бенчмарки стали средами».
Технология опирается на обучение с подкреплением (reinforcement learning) — подход, при котором системы ИИ учатся методом проб и ошибок, получая вознаграждения за правильные действия и штрафы за ошибки. Обучение с подкреплением помогает агентам совершенствоваться, но обычно требует от разработчиков масштабной переписывания кода. Это препятствует внедрению, хотя данные, генерируемые такими агентами, могли бы существенно повысить производительность за счет RL-тренировок.
Patronus AI также представила новую концепцию под названием «открытое рекурсивное самосовершенствование» (Open Recursive Self-Improvement) или ORSI — среды, в которых агенты могут непрерывно совершенствоваться посредством взаимодействия и обратной связи без необходимости полного цикла переобучения между попытками. Компания позиционирует это как критически важную инфраструктуру для создания систем ИИ, способных учиться непрерывно, а не замирать на определенном этапе времени.
Внутри «зоны Златовласки»: как адаптивное обучение ИИ находит идеальный баланс
В основе генеративных симуляторов лежит компонент, который Patronus AI называет «корректировщиком учебной программы» (curriculum adjuster) — он анализирует поведение агента и динамически изменяет сложность и характер тренировочных сценариев. Этот подход вдохновлен тем, как эффективные человеческие преподаватели адаптируют свои инструкции на основе успехов учащихся.
Цянь объяснила этот подход с помощью аналогии: «Вы можете рассматривать это как модель „учитель-ученик“, где мы обучаем модель, а профессор постоянно адаптирует учебную программу».
Такой адаптивный подход решает проблему, которую Каннаппан охарактеризовал как поиск «зоны Златовласки» в обучающих данных — обеспечение того, чтобы примеры были ни слишком простыми, ни слишком сложными для эффективного обучения конкретной модели.
«Важно не только то, можете ли вы обучать на датасете, но и то, можете ли вы обучать на высококачественном датасете, настроенном под вашу модель — таком, из которого она действительно может извлечь уроки», — сказал Каннаппан. «Мы хотим убедиться, что примеры не слишком сложны для модели и не слишком просты».
По словам компании, первые результаты показывают значительное улучшение производительности агентов. Обучение в средах Patronus AI повысило показатели успешного выполнения задач на 10–20% в реальных сценариях, включая разработку программного обеспечения, обслуживание клиентов и финансовый анализ.
Проблема мошенничества в ИИ: как среды с «движущейся мишенью» предотвращают хакинг наград
Одна из самых устойчивых проблем при обучении ИИ-агентов с помощью обучения с подкреплением — это явление, которое исследователи называют «хакингом наград» (reward hacking), когда системы учатся использовать лазейки в своей обучающей среде, а не по-настоящему решать проблемы. Известные примеры включают ранних агентов, которые научились прятаться по углам видеоигр вместо того, чтобы играть в них.
Генеративные симуляторы борются с этим, превращая саму среду обучения в движущуюся мишень.
«Хакинг наград — это принципиальная проблема, когда системы статичны. Это как ученики, которые учатся списывать на тесте», — говорит Цянь. «Но когда мы постоянно развиваем среду, мы можем фактически отслеживать те части системы, которые нуждаются в адаптации и эволюции. Статические бенчмарки — это фиксированные цели; среды генеративных симуляторов — это движущиеся цели».
Patronus AI сообщает о 15-кратном росте выручки на фоне всплеска корпоративного спроса на обучение агентов
Patronus AI позиционирует генеративные симуляторы как фундамент для новой линейки продуктов под названием «RL Environments» — тренировочных площадок, разработанных для лабораторий базовых моделей и предприятий, создающих агентов для конкретных предметных областей. В компании заявляют, что это предложение представляет собой стратегическое расширение за пределы ее первоначального фокуса на инструментах оценки.
«В этом году наша выручка выросла в 15 раз, во многом благодаря высококачественным средам, которые мы разработали и которые доказали свою исключительную обучаемость для различных типов передовых моделей», — сказал Каннаппан.
Генеральный директор отказался назвать конкретные цифры выручки, но отметил, что новый продукт позволил компании «подняться выше по цепочке с точки зрения того, что мы продаем и кому мы это продаем». Платформа компании используется многочисленными предприятиями из списка Fortune 500 и ведущими компаниями в сфере ИИ по всему миру.
Почему OpenAI, Anthropic и Google не могут построить всё собственными силами
Главный вопрос, стоящий перед Patronus AI, заключается в том, почему богато финансируемые лаборатории, разрабатывающие передовые модели — такие организации, как OpenAI, Anthropic и Google DeepMind — будут лицензировать обучающую инфраструктуру, а не создавать ее самостоятельно.
Каннаппан признал, что эти компании «значительно инвестируют в среды», но возразил, что широта предметных областей, требующих специализированного обучения, создает естественную нишу для сторонних провайдеров.
«Они хотят улучшать агентов во множестве различных областей, будь то кодинг, использование инструментов, навигация по браузерам или рабочие процессы в финансах, здравоохранении, энергетике и образовании», — сказал он. «Решение всех этих разнообразных операционных задач — очень сложная задача для одной компании».
Конкурентная среда накаляется. Недавно Microsoft выпустила Agent Lightning — инфраструктуру с открытым исходным кодом, которая заставляет обучение с подкреплением работать для любого ИИ-агента без переписывания кода. NeMo Gym от NVIDIA предлагает модульную инфраструктуру RL для разработки агентных систем ИИ. Исследователи из Meta в ноябре выпустили DreamGym — фреймворк, который симулирует среды RL и динамически регулирует сложность задач по мере совершенствования агентов.
«Среды — это новая нефть»: смелая ставка Patronus AI на будущее обучения ИИ
Заглядывая в будущее, Patronus AI определяет свою миссию в грандиозных масштабах. Компания стремится «превратить все данные мира в среды» (environmentalize all of the world’s data) — конвертировать человеческие рабочие процессы в структурированные системы, которым может обучаться ИИ.
«Мы считаем, что все должно быть средой — внутри компании мы шутим, что среды — это новая нефть», — сказал Каннаппан. «Обучение с подкреплением — это всего лишь один из методов обучения, но сама конструкция среды — это то, что действительно имеет значение».
Цянь описала открывающиеся возможности в масштабных терминах: «Это совершенно новая область исследований, которая открывается не каждый день. Генеративное моделирование вдохновлено ранними исследованиями в области робототехники и воплощенных агентов (embodied agents). Это было несбыточной мечтой на протяжении десятилетий, и мы только сейчас можем воплотить эти идеи в жизнь благодаря возможностям современных моделей».
Компания запустилась в сентябре 2023 года с упором на оценку — помогая предприятиям выявлять галлюцинации и проблемы безопасности в результатах работы ИИ. Теперь эта миссия расширилась вверх по течению до самого процесса обучения. В Patronus AI утверждают, что традиционное разделение между оценкой и обучением разрушается, и тот, кто контролирует среды, в которых учатся ИИ-агенты, будет определять их возможности.
«Мы действительно находимся в этой критической точке, в точке перелома, где то, что мы делаем прямо сейчас, повлияет на то, как мир будет выглядеть для грядущих поколений», — заключила Цянь.
Смогут ли генеративные симуляторы оправдать эти ожидания, еще предстоит увидеть. 15-кратный рост выручки компании говорит о том, что корпоративные клиенты жаждут решений, но богатые игроки от Microsoft до Meta наперегонки пытаются решить ту же фундаментальную проблему. Если последние два года чему-то и научили индустрию, так это тому, что в сфере ИИ будущее имеет свойство наступать раньше срока.



