Исследование Upwork: сотрудничество человека с ИИ повышает скорость выполнения задач на 70%
Агенты на базе искусственного интеллекта, работающие на самых передовых языковых моделях в мире, регулярно не справляются даже с простыми профессиональными задачами в автономном режиме. Об этом свидетельствует новаторское исследование, опубликованное в четверг крупнейшей онлайн-платформой для работы фрилансеров Upwork.
Однако то же исследование указывает на более перспективный путь: когда агенты ИИ сотрудничают с экспертами-людьми, уровень успешного выполнения проектов возрастает на величину до 70%. Это намекает на то, что будущее труда может заключаться не в противостоянии людей и машин, а в их эффективном объединении новыми способами.
Полученные выводы основаны на анализе более чем 300 реальных клиентских проектов, размещенных на платформе Upwork. Это первая систематическая оценка того, как человеческая экспертиза повышает производительность ИИ-агентов в условиях реальной профессиональной работы, а не в ходе синтетических тестов или академических симуляций. Исследование ставит под сомнение как излишнюю шумиху вокруг полностью автономных ИИ-агентов, так и опасения по поводу того, что подобная технология неизбежно заменит «интеллектуальных работников» (knowledge workers).
«ИИ-агенты не столь уж автономны, то есть они не так уж хороши в этом», — отметил Эндрю Рабинович, технический директор Upwork и руководитель направления искусственного интеллекта и машинного обучения, в эксклюзивном интервью VentureBeat. — «Тем не менее, в паре с квалифицированными специалистами-людьми показатели выполнения проектов значительно улучшаются. Это подтверждает нашу твердую уверенность в том, что будущее труда будет определяться сотрудничеством людей и ИИ для достижения больших результатов, причем человеческая интуиция и предметная экспертиза будут играть критически важную роль».
Как ИИ-агенты проявили себя в более чем 300 реальных заказах для фрилансеров и почему они испытывали трудности
Индекс производительности людей и агентов Upwork (HAPI) оценил работу трех ведущих ИИ-систем — Gemini 2.5 Pro, GPT-5 от OpenAI и Claude Sonnet 4 — на реальных заказах, размещенных платежеспособными клиентами в таких категориях, как копирайтинг, наука о данных (data science), веб-разработка, инженерия, продажи и перевод.
Важно отметить, что Upwork намеренно выбирала простые, четко определенные проекты, где у ИИ-агентов были реальные шансы на успех. Эти задачи стоимостью до 500 долларов составляют менее 6% от общего объема валовых услуг Upwork — лишь малую долю общего бизнеса платформы и признание текущих ограничений ИИ.
«Реальность такова, что, несмотря на изучение ИИ — а я занимаюсь этим уже 25 лет — и видимые значительные прорывы, эти агенты не настолько самостоятельны», — рассказал Рабинович изданию VentureBeat. — «Поэтому, если мы поднимемся выше по цепочке создания стоимости, проблемы станут настолько сложными, что мы вообще не верим в их способность решить их хотя бы поверхностно. Именно поэтому мы специально выбрали более простые задачи, которые дали бы агенту хоть какую-то опору».
Даже при выполнении этих намеренно упрощенных задач ИИ-агенты, работающие независимо, сталкивались с трудностями. Но когда эксперты-фрилансеры предоставляли обратную связь, затрачивая в среднем всего по 20 минут на цикл проверки, результаты работы агентов существенно улучшались с каждой итерацией.
20 минут отзывов от человека повысили показатели завершения проектов ИИ на величину до 70%
Исследование выявило разительные различия в эффективности работы ИИ-агентов с участием человека и без него в различных сферах деятельности. В проектах по науке о данных и аналитике Claude Sonnet 4 продемонстрировал показатель успешного завершения на уровне 64% при самостоятельной работе, однако он подскочил до 93% после получения отзывов от эксперта-человека. В сфере продаж и маркетинга процент успешного выполнения заказов Gemini 2.5 Pro вырос с 17% при самостоятельной работе до 31% с учетом мнения человека. GPT-5 от OpenAI показала аналогичные драматические улучшения в инженерных и архитектурных задачах, поднявшись с 30% до 50% успешных завершений.
Эта закономерность прослеживалась практически во всех категориях, причем агенты демонстрировали особую отзывчивость к обратной связи при выполнении качественной, творческой работы, требующей редакторского суждения — в таких областях, как написание текстов, перевод и маркетинг, где показатели успешного завершения увеличивались на величину до 17 процентных пунктов за один цикл правок.
Это открытие ставит под сомнение фундаментальное предположение в индустрии искусственного интеллекта: о том, что бенчмарки агентов, проводимые изолированно, точно предсказывают их реальную производительность.
«Хотя мы показываем, что в задачах, отобранных для автономной работы агентов, они выступают на уровне ранее опубликованных открытых результатов, мы также продемонстрировали, что в сотрудничестве с людьми результативность этих агентов улучшается на удивление сильно», — подчеркнул Рабинович. — «Это не просто один обмен репликами туда-обратно: чем больше обратной связи предоставляет человек, тем лучше агент справляется с работой».
Почему ChatGPT может сдать SAT, но не может посчитать буквы «р» в слове «клубника»
Это исследование появилось в момент, когда индустрия искусственного интеллекта переживает кризис измерений. Традиционные бенчмарки — стандартизированные тесты, которые модели ИИ способны освоить (иногда набирая максимум баллов на экзаменах SAT или математических олимпиадах) — оказались плохими предсказателями реальных возможностей.
«С развитием больших языковых моделей мы видим, что эти статические академические датасеты полностью исчерпали себя», — отметил Рабинович. — «Вы можете получить идеальный балл на экзамене SAT, LSAT или любой математической олимпиаде, а затем спросить у ChatGPT, сколько букв «р» в слове «клубника», и он ответит неверно».
Этот феномен, при котором системы ИИ блестяще справляются с формальными тестами, но спотыкаются на тривиальных вопросах из реальной жизни, привел к росту скептицизма в отношении возможностей ИИ, даже несмотря на то, что компании спешат внедрять автономных агентов. Ряд недавних бенчмарков от других фирм тестировал агентов ИИ на заказах с Upwork, но те оценки измеряли лишь изолированную производительность, а не потенциал сотрудничества, который выявило исследование Upwork.
«Мы хотели оценить качество работы этих агентов на реальных задачах, обладающих экономической ценностью, и посмотреть не только на то, как они справляются сами, но и на их взаимодействие с людьми. Мы ведь и так уже знали, что изолированно они не настолько продвинуты», — пояснил Рабинович.
Для компании Upwork, которая связывает примерно 800 000 активных клиентов (размещающих более 3 миллионов вакансий ежегодно) с глобальным пулом фрилансеров, это исследование преследует стратегическую бизнес-цель: установить стандарты качества для ИИ-агентов, прежде чем разрешать им конкурировать или сотрудничать с людьми на платформе.
Экономика командной работы человека и ИИ: почему оплата экспертной обратной связи все равно экономит деньги
Несмотря на необходимость нескольких раундов правок от человека (каждый из которых занимает около 20 минут), временные затраты остаются «на несколько порядков отличными при сравнении работы человека в одиночку и работы человека с агентом ИИ», — заявил Рабинович. Если на самостоятельное выполнение проекта фрилансеру могут потребоваться дни, то подход «агент плюс человек» способен принести результат за считанные часы благодаря итеративным циклам автоматизированной работы и доработки экспертом.
Экономические последствия выходят за рамки простой экономии времени. Недавно компания Upwork сообщила, что объем валовых услуг от деятельности, связанной с ИИ, вырос на 53% в годовом исчислении в третьем квартале 2025 года, став одним из мощнейших драйверов роста компании. Тем не менее, руководство старается позиционировать ИИ не как замену фрилансерам, а как инструмент расширения их возможностей.
«ИИ был огромной угрозой для нашей оценки», — рассказала Эрика Гессерт, финансовый директор Upwork, в интервью CFO Brew в октябре. — «Существовало мнение, что вся работа исчезнет. ИИ заберет ее себе, особенно ту, что выполняют фрилансеры, поскольку они не постоянны. На самом деле все обстоит с точностью до наоборот».
Стратегия компании сосредоточена на том, чтобы позволить фрилансерам браться за более сложные и высокооцененные задачи, переложив рутину на ИИ. «Фрилансеры на самом деле предпочитают иметь инструменты, которые автоматизируют ручной труд и повторяющуюся часть их работы, позволяя сосредоточиться на творческой и концептуальной составляющей процесса», — отметил Рабинович.
По его мнению, вместо уничтожения рабочих мест ИИ трансформирует их: «Более простые задачи будут автоматизированы агентами, но сами проекты станут гораздо сложнее по количеству задач, так что объем работы, а следовательно, и заработки фрилансеров в итоге будут только расти».
ИИ-агенты для кодинга преуспевают, но творческое письмо и перевод по-прежнему нуждаются в людях
Исследование выявило четкую закономерность в возможностях агентов. Системы ИИ лучше всего справляются с «детерминированными и проверяемыми» задачами, имеющими объективно правильные ответы, такими как решение математических примеров или написание базового кода. «Большинство задач по программированию очень похожи друг на друга», — отметил Рабинович. — «Именно поэтому агенты для кодинга становятся такими успешными».
В тестах Upwork проекты по веб-разработке, созданию мобильных приложений и науке о данных (особенно те, которые включают структурированные вычислительные процессы) показали самые высокие показатели самостоятельного завершения задач ИИ-агентами. Claude Sonnet 4 выполнил 68% задач по веб-разработке и 64% проектов по науке о данных без посторонней помощи, в то время как Gemini 2.5 Pro достигла отметки в 74% в определенных технических заданиях.
Однако качественная работа оказалась гораздо более сложной задачей. Когда перед агентами ставилась задача разработать макет веб-сайта, написать маркетинговый текст или перевести контент с учетом культурных нюансов, они буксовали без экспертных подсказок. «Когда вы просите написать стихотворение, качество этого стихотворения крайне субъективно», — пояснил Рабинович. — «Поскольку критерии оценки задавались людьми, здесь присутствует определенная степень вариативности в представлении результатов».
Задачи по копирайтингу, переводу, продажам и маркетингу продемонстрировали наиболее драматичное улучшение показателей при добавлении обратной связи от человека. Так, при создании текстов показатели успешного завершения увеличивались на величину до 17 процентных пунктов после экспертной проверки. Инженерные и архитектурные проекты, требующие творческого решения проблем (например, гражданское строительство или архитектурный дизайн), улучшили свои показатели на целых 23 процентных пункта при контроле со стороны человека.
Эта тенденция говорит о том, что ИИ-агенты превосходно справляются сопоставлением паттернов и репликацией, но испытывают трудности с креативностью, здравым смыслом и контекстом — то есть именно с теми навыками, которые определяют более ценный профессиональный труд.
Внутри исследования: как Upwork тестировал ИИ-агентов с помощью рецензируемых научных методов
Upwork объединила усилия с элитными фрилансерами платформы для оценки каждого результата, созданного агентами ИИ, как независимо, так и после каждого цикла правок человеком. Эти эксперты разработали подробные критерии, определяющие, соответствуют ли проекты основным требованиям описаний вакансий, а затем оценивали результаты по итогам нескольких итераций.
Важно отметить, что оценщики концентрировались исключительно на критериях объективного завершения, исключая субъективные факторы (вроде стилистических предпочтений или суждений о качестве), которые могут возникать в реальных клиентских взаимоотношениях. «Показатели завершения на основе критериев не следует рассматривать как мерило того, получил бы агент оплату в реальных рыночных условиях», — отмечается в исследовании, — «но они служат индикатором его способности выполнять явно сформулированные запросы».
Это различие имеет принципиальное значение: ИИ-агент может технически выполнить все указанные требования, но при этом выдать работу, которую клиент отвергнет как неудовлетворительную. И наоборот — субъективная удовлетворенность клиента (истинный показатель успеха на рынке) по-прежнему лежит за пределами возможностей современных измерений.
Исследование прошло слепое рецензирование экспертами и было принято на NeurIPS — ведущую академическую конференцию по исследованиям в области ИИ, где Upwork представит полные результаты в начале декабря. Компания планирует опубликовать полную методологию и сделать бенчмарк доступным для исследовательского сообщества, регулярно обновляя пул задач во избежание переобучения (overfitting) по мере совершенствования агентов.
«Идея заключается в том, чтобы этот бенчмарк стал живой и развивающейся платформой, где агенты могут тестировать себя по всем категориям работ, причем предлагаемые задачи будут постоянно обновляться, чтобы агенты не переобучались и не заучивали конкретные задания наизусть», — сказал Рабинович.
ИИ-стратегия Upwork: создание Uma — «мета-агента», управляющего людьми и ИИ-работниками
Это исследование напрямую формирует продуктовую стратегию Upwork, поскольку компания позиционирует себя для работы в условиях того, что руководители называют «эпохой искусственного интеллекта и за ее пределами». Вместо создания собственных ИИ-агентов для выполнения конкретных задач, Upwork разрабатывает Uma — «метаоркестровочного агента», который координирует взаимодействие между людьми-работниками, системами ИИ и клиентами.
«Сегодня Upwork — это маркетплейс, где клиенты ищут фрилансеров для выполнения задач, а таланты приходят на Upwork в поисках работы», — пояснил Рабинович. — «Теперь это расширяется до модели, в которой клиенты приходят на Upwork, общаются с Uma — этим метаоркестровым агентом, а затем Uma определяет необходимые таланты для выполнения работы, доводит задачи до результата и передает его клиенту».
В рамках такого видения клиенты будут взаимодействовать в основном с Uma, а не нанимать фрилансеров напрямую. ИИ-система будет анализировать проектные требования, определять, какие задачи требуют человеческого участия, а какие — выполнения с помощью ИИ, координировать рабочий процесс и контролировать качество, выступая в роли интеллектуального руководителя проекта, а не замены сотрудникам.
«Мы не хотим создавать агентов, которые выполняют задачи напрямую; мы создаем метаоркестрового агента, который выясняет, какие человеческие таланты и агенты необходимы для завершения работы», — сказал Рабинович. — «Uma оценивает работу, предназначенную для клиента, организует взаимодействие между людьми и агентами и способна учиться на всех происходящих на платформе взаимодействиях тому, как разбивать проекты на задачи, чтобы они выполнялись вовремя и эффективно».
Недавно компания объявила о планах открыть свой первый международный офис в Лиссабоне (Португалия) к четвертому кварталу 2026 года с акцентом на развитие ИИ-инфраструктуры и технический найм. Это расширение последовало за рекордным третьим кварталом Upwork, который отчасти обеспечили инновации в продуктах на базе ИИ и высокий спрос на специалистов с навыками работы с искусственным интеллектом.
OpenAI, Anthropic и Google соревнуются в создании автономных агентов, но реальность отстает от шумихи
Выводы Upwork появились на фоне эскалации конкуренции в сфере ИИ-агентов. OpenAI, Anthropic, Google и многочисленные стартапы соперничают в разработке автономных агентов, способных справляться со сложными многоэтапными задачами — от бронирования поездок и анализа финансовых данных до написания программного обеспечения.
Однако недавние громкие неудачи умерили первоначальный энтузиазм. ИИ-агенты часто неверно понимают инструкции, допускают логические ошибки или выдают уверенно ложные результаты — явление, которое исследователи называют «галлюцинациями». Разрыв между отрепетированными демонстрационными видеороликами и надежной производительностью в реальном мире по-прежнему огромен.
«Появлялись результаты оценок от OpenAI и других платформ, где для выполнения агентами рассматривались реальные задачи с Upwork, и в целом опубликованные результаты не были слишком оптимистичными. Они показали, что агенты — даже самые лучшие, то есть работающие на базе самых продвинутых языковых моделей — не могут на равных конкурировать с людьми, поскольку показатели успешного завершения весьма невелики», — отметил Рабинович.
Вместо того чтобы ждать полного созревания ИИ (сроки которого остаются неопределенными), Upwork делает ставку на гибридный подход, который использует сильные стороны ИИ (скорость, масштабируемость, распознавание образов) и сохраняет сильные стороны человека (рассудительность, креативность, понимание контекста).
Эта философия распространяется на обучение и совершенствование. Современные модели ИИ обучаются преимущественно на статических датасетях, собранных из интернета, в сочетании с обратной оценкой человеческих предпочтений. Но большая часть профессиональной работы носит качественный характер, из-за чего системам ИИ трудно понять, действительно ли их результаты хороши, без экспертной оценки.
«Без такого сотрудничества между человеком и машиной, где человек выступает своего рода учителем, а машина — учеником, пытающимся найти новые решения, ничто из этого не станет возможным», — считает Рабинович. — «Upwork имеет уникальные возможности для создания подобной среды. Если вы попытаетесь сделать это, скажем, с беспилотными автомобилями, и поручите машинам Waymo искать новые пути проезда в аэропорт, например игнорируя дорожные знаки, произойдет много нехорошего. Если же при выполнении работы на Upwork создается неправильный веб-сайт, это не стоит дорого и не влечет за собой негативных побочных эффектов. При этом возможности для обучения абсолютно колоссальны».
Заберет ли ИИ вашу работу? Факты говорят о более сложной картине
Хотя большая часть публичных дискуссий об искусственном интеллекте сосредоточена на вытеснении с рынка труда, исторический опыт, по словам Рабиновича, говорит об обратном — хотя сам переход может оказаться болезненным.
«Общественный нарратив сводится к тому, что ИИ уничтожает рабочие места — будь то написание текстов, перевод, программирование или другая цифровая работа. Но никто особо не говорит об экспоненциальном росте новых видов труда, которые он создаст», — пояснил он. — «Когда мы изобрели электричество, паровые двигатели и тому подобные вещи, они определенно заменили определенные профессии, но количество появившихся новых рабочих мест выросло экспоненциально, и мы считаем, что то же самое произойдет и здесь».
В исследовании выделяются формирующиеся категории профессий, сосредоточенные на надзоре за ИИ: проектирование эффективных рабочих процессов взаимодействия человека и машины, предоставление качественной обратной связи для улучшения работы агентов и проверка того, соответствуют ли созданные ИИ продукты стандартам качества. Эти навыки — промпт-инжиниринг, надзор за агентами, проверка результатов — едва существовали два года назад, но теперь высоко ценятся на таких платформах, как Upwork.
«От людей потребуются новые типы навыков: как проектировать взаимодействие человека и машины, как направлять агентов для повышения их эффективности и, в конечном счете, как проверять правильность предложений агентов, поскольку это необходимо для продвижения технологий ИИ вперед», — подчеркнул Рабинович.
Вопрос в том, создаст ли этот переход — от непосредственного выполнения задач к их контролю — возможности так же быстро, как он разрушает существующие роли. Для фрилансеров на Upwork ответ, возможно, уже отражается на их банковских счетах: на платформе зафиксирован рост связанной с ИИ работы на 53% в годовом исчислении, даже несмотря на то, что заголовки СМИ пестрели страхами перед безработицей из-за искусственного интеллекта.



