Удалось ли этому стартапу наконец решить проблему надежности корпоративных ИИ-агентов? Знакомьтесь с Apollo-1 от AUI
Более десяти лет диалоговый ИИ обещает создать человекоподобных ассистентов, способных на большее, чем просто беседы. Тем не менее, даже несмотря на то, что большие языковые модели (LLM), такие как ChatGPT, Gemini и Claude, учатся рассуждать, объяснять и писать код, одна важнейшая категория взаимодействия остается практически нерешенной — надежное выполнение задач для пользователей вне чата.
Даже лучшие модели ИИ набирают лишь 30-й процентиль в Terminal-Bench Hard — стороннем бенчмарке, предназначенном для оценки производительности ИИ-агентов при выполнении различных задач в браузере, что намного ниже уровня надежности, требуемого большинством предприятий и пользователей. А отраслевые бенчмарки, такие как TAU-Bench airline, измеряющие надежность ИИ-агентов при поиске и бронировании авиабилетов от имени пользователя, также не могут похвастаться более высокими показателями успешности: лишь 56% у лучших агентов и моделей (Claude 3.7 Sonnet), что означает сбой агента почти в половине случаев.
Базирующийся в Нью-Йорке стартап Augmented Intelligence (AUI) Inc., основанный Охадом Элхело (Ohad Elhelo) и Ори Коэном (Ori Cohen), считает, что наконец нашел решение для повышения надежности ИИ-агентов до уровня, при котором большинство предприятий смогут доверять им выполнение инструкций с гарантированной надежностью.
Новая базовая модель компании под названием Apollo-1 — которая в настоящее время находится на стадии предварительного тестирования для ранних пользователей, но близка к скорому общедоступному релизу — построена на принципе, который компания называет событийно-ориентированными нейросимволическими рассуждениями (stateful neuro-symbolic reasoning).
Это гибридная архитектура, которую поддерживают даже скептики в отношении LLM, такие как Гэри Маркус (Gary Marcus), и которая призвана гарантировать стабильные и соответствующие внутренним правилам результаты при каждом взаимодействии с клиентом.
«Диалоговый ИИ состоит из двух принципиальных частей, — рассказал Элхело в недавнем интервью VentureBeat. — Первая половина — это диалог в свободном стиле, с которым прекрасно справляются LLM. Они созданы для творческих или исследовательских сценариев. Вторая половина — это ориентированный на задачи диалог, где у беседы всегда есть конкретная цель. Эта половина оставалась нерешенной, потому что она требует определенности».
В AUI определяют определенность как разницу между агентом, который «вероятно» выполняет задачу, и тем, который делает это почти «всегда».
Например, в TAU-Bench Airline показатель успешности выполнения задач достигает впечатляющих 92,5%, оставляя всех прочих текущих конкурентов далеко позади — согласно бенчмаркам, переданным VentureBeat и опубликованным на веб-сайте AUI.
Элхело привел простые примеры: банк, который должен требовать подтверждения личности для возврата средств на сумму свыше 200 долларов, или авиакомпания, которая всегда должна предлагать апгрейд до бизнес-класса перед эконом-классом.
«Это не просто предпочтения, — сказал он. — Это требования. И никакой чисто генеративный подход не способен обеспечить такую поведенческую определенность».
Компания AUI и ее работа по повышению надежности ранее освещались платно-подписным новостным изданием The Information, однако до сих пор не получали широкого освещения в общедоступных СМИ.
От сопоставления с образцом к предсказуемым действиям
Команда утверждает, что архитектура трансформеров по определению не может удовлетворить этим требованиям. Большие языковые модели генерируют правдоподобный текст, а не гарантированное поведение. «Когда вы говорите LLM всегда предлагать страховку перед оплатой, она может сделать это — обычно, — отметил Элхело. — Настройте Apollo-1 с этим правилом, и она будет делать это — каждый раз».
Это различие, по его словам, проистекает из самой архитектуры. Трансформеры предсказывают следующий токен в последовательности. Apollo-1, напротив, предсказывает следующее действие в разговоре, оперируя тем, что AUI называет типизированным символическим состоянием.
Коэн объяснил эту идею в более технических терминах. «Нейросимволический подход означает, что мы объединяем две доминирующие парадигмы, — сказал он. — Символический слой дает структуру — он понимает, что такое намерение (intent), сущность (entity) и параметр, — в то время как нейронный слой обеспечивает беглость речи. Нейросимволический модуль рассуждений находится между ними. Это принципиально иной тип «мозга» для диалога».
Там, где трансформеры рассматривают каждый вывод как генерацию текста, Apollo-1 запускает замкнутый цикл рассуждений: энкодер переводит естественный язык в символическое состояние, машина состояний поддерживает это состояние, механизм принятия решений определяет следующее действие, планировщик выполняет его, а декодер возвращает результат обратно в языковую форму. «Этот процесс носит итеративный характер, — пояснил Коэн. — Он циклически повторяется до тех пор, пока задача не будет выполнена. Именно так достигается детерминизм вместо вероятности».
Базовая модель для выполнения задач
В отличие от традиционных чат-ботов или специализированных систем автоматизации, Apollo-1 задумана как базовая модель для ориентированного на задачи диалога — единая, независимая от домена система, которую можно настроить для банковского дела, путешествий, розничной торговли или страхования с помощью того, что в AUI называют системным промптом (System Prompt).
«Системный промпт — это не файл конфигурации, — заявил Элхело. — Это поведенческий контракт. Вы четко определяете, как ваш агент должен вести себя в интересующих ситуациях, и Apollo-1 гарантирует выполнение этих поведенческих сценариев».
Организации могут использовать промпт для кодирования символических слотов — намерений, параметров и политик, — а также границ используемых инструментов и правил, зависящих от текущего состояния.
Например, приложение для доставки еды может применять правило «если упомянута аллергия, всегда сообщать в ресторан», в то время как телекоммуникационный провайдер может задать условие «после трех неудачных попыток оплаты приостановить предоставление услуг». В обоих случаях поведение выполняется детерминистически, а не статистически.
Восемь лет разработки
Путь AUI к созданию Apollo-1 начался в 2017 году, когда команда приступила к кодированию миллионов реальных диалоговых задач, обработанных штатом из 60 000 живых операторов.
Эта работа привела к созданию символического языка, способного отделять процедурные знания (шаги, ограничения и рабочие процессы) от описательных знаний, таких как сущности и атрибуты.
«Идея заключалась в том, что диалоги, ориентированные на выполнение задач, имеют универсальные процедурные паттерны, — сказал Элхело. — Доставка еды, обработка претензий и управление заказами — все они имеют схожую структуру. Как только вы моделируете это явно, вы можете производить над этим детерминированные вычисления».
Исходя из этого, компания создала нейросимволический модуль рассуждений — систему, которая использует символическое состояние для определения дальнейших шагов вместо того, чтобы полагаться на угадывание через предсказание токенов.
Бенчмарки показывают, что эта архитектура обеспечивает измеримую разницу в результатах.
По собственным оценкам AUI, модель Apollo-1 достигла более чем 90 процентов успешного выполнения задач в бенчмарке τ-Bench-Airline по сравнению с 60 процентами у Claude-4.
Она успешно завершила 83 процента реальных чатов по бронированию на Google Flights против 22 процентов у Gemini 2.5-Flash, и 91 процент сценариев в сфере розничной торговли на Amazon против 17 процентов у Rufus.
Бенчмарки модели Apollo-1, предоставленные компанией AUI. Источник: AUI
«Это не какие-то точечные улучшения, — подчеркнул Коэн. — Это разница в надежности на порядок».
Дополнение, а не конкурент
AUI не позиционирует Apollo-1 как замену большим языковым машинам, а представляет ее как их необходимый аналог. По словам Элхело: «Трансформеры оптимизированы под творческую вероятность. Apollo-1 оптимизирована под поведенческую определенность. Вместе они формируют полный спектр возможностей диалогового ИИ».
Модель уже проходит ограниченное пилотное тестирование в неназываемых компаниях из списка Fortune 500, представляющих такие сектора, как финансы, путешествия и ритейл.
AUI также подтвердила заключение стратегического партнерства с Google и объявила о планах по общедоступному релизу в ноябре 2025 года, когда компания откроет API, выпустит полную документацию, а также добавит поддержку голосовых и визуальных функций. Заинтересованные потенциальные клиенты и партнеры могут зарегистрироваться для получения дополнительной информации, когда она появится через форму на сайте AUI.
До тех пор компания держит детали в секрете. На вопрос о том, что будет дальше, Элхело улыбнулся. «Скажем так, мы готовим анонс, — сказал он. — Скоро».
На пути к диалогам, которые совершают действия
Несмотря на всю техническую сложность, суть предложения Apollo-1 проста: создать ИИ, которому бизнес может доверить реальные действия, а не просто разговоры. «Наша цель — сделать доступным ИИ, который действительно работает», — подытожил Коэн в конце интервью.
Станет ли Apollo-1 новым стандартом для ориентированного на задачи диалога, покажет время. Но если архитектура AUI будет работать так, как обещано, многолетний разрыв между чат-ботами, которые звучат по-человечески, и агентами, которые надежно выполняют человеческую работу, наконец начнет сокращаться.



