Разметка данных не умерла — она превращается в краеугольный камень оценки агентного ИИ

Разметка данных не умерла — она превращается в краеугольный камень оценки агентного ИИ

По мере того как большие языковые модели (LLM) продолжают совершенствоваться, в отрасли возникают дискуссии о том, сохраняется ли необходимость в автономных инструментах разметки данных, ведь LLM всё лучше справляются с самыми разными типами информации. HumanSignal, ведущий коммерческий поставщик открытой программы Label Studio, придерживается иного мнения. Компания видит не спад спроса на разметку данных, а его рост.

Ранее в этом месяце компания HumanSignal приобрела Erud AI и запустила свои физические лаборатории Frontier Data Labs для сбора новых данных. Однако создание данных — это лишь полдела. Теперь компания берется за следующую задачу: доказательство того, что обученные на этих данных системы ИИ действительно работают. Новые возможности оценки мультимодальных агентов позволяют предприятиям проверять сложные ИИ-агенты, генерирующие приложения, изображения, код и видео.

«Если вы ориентируетесь на корпоративный сегмент, все создаваемые ими решения на базе ИИ по-прежнему нуждаются в оценке, что является лишь другим названием для разметки данных людьми, и в еще большей степени — экспертами», — отметил соучредитель и генеральный директор HumanSignal Михаил Малюк в эксклюзивном интервью VentureBeat.

Пересечение разметки данных и оценки агентного ИИ

Иметь правильные данные — это здорово, но это не конечная цель для предприятия. Современная разметка данных движется в сторону оценки.

Происходит фундаментальный сдвиг в том, что именно предприятиям необходимо проверять: не то, правильно ли их модель классифицировала изображение, а то, принял ли их ИИ-агент верные решения в ходе сложной многоэтапной задачи, требующей рассуждений, использования инструментов и генерации кода.

Если оценка — это всего лишь разметка данных для результатов работы ИИ, то переход от моделей к агентам представляет собой качественный скачок в том, что подлежит разметке. Если традиционная разметка данных может включать в себя отметку изображений или категоризацию текста, то оценка агентов требует суждения о многоэтапных цепочках рассуждений, решениях по выбору инструментов и мультимодальных результатах — и всё это в рамках одного взаимодействия.

«Возникает острая необходимость не просто в человеке в контуре (human-in-the-loop), а в эксперте в контуре», — сказал Малюк. Он указал на такие сферы с высокими ставками, как здравоохранение и юридические консультации, где стоимость ошибок остается непомерно высокой.

Связь между разметкой данных и оценкой ИИ гораздо глубже, чем просто семантика. Оба вида деятельности требуют одинаковых фундаментальных возможностей:

  • Структурированные интерфейсы для экспертной оценки: независимо от того, размечают ли рецензенты изображения для обучающих данных или оценивают, правильно ли агент задействовал несколько инструментов, им нужны специализированные интерфейсы для систематической фиксации их оценок.

  • Консенсус нескольких рецензентов: качественные обучающие наборы данных требуют участия нескольких разметчиков, которые урегулируют разногласия. Качественная оценка требует того же — нескольких экспертов, оценивающих результаты и разрешающих расхождения во мнениях.

  • Отраслевая экспертиза в широком масштабе: обучение современных систем ИИ требует профильных экспертов, а не просто краудсорсеров, кликающих по кнопкам. Оценка результатов работы ИИ в продакшене требует такой же глубины знаний.

  • Петли обратной связи с системами ИИ: размеченные обучающие данные подпитывают разработку моделей. Данные оценки питают непрерывное совершенствование, тонкую настройку (fine-tuning) и бенчмаркинг.

Оценка полного трека агента

Проблема оценки агентов заключается не только в объеме данных, но и в сложности того, что подлежит проверке. Агенты не выдают простые текстовые результаты: они генерируют цепочки рассуждений, выбирают инструменты и создают артефакты в разных модальностях.

Новые возможности Label Studio Enterprise отвечают требованиям проверки агентов:

  • Инспекция мультимодальных треков: платформа предоставляет унифицированные интерфейсы для анализа полных траекторий выполнения задач агентами — шагов рассуждений, вызовов инструментов и результатов в различных модальностях. Это решает распространенную проблему, когда командам приходится разбирать разрозненные потоки логов.

  • Интерактивная многошаговая оценка: оценщики анализируют диалоговые потоки, в которых агенты сохраняют состояние на протяжении нескольких ходов, проверяя отслеживание контекста и интерпретацию намерений во всей последовательности взаимодействия.

  • Агентная арена (Agent Arena): структура сравнительной оценки для тестирования различных конфигураций агентов (базовых моделей, шаблонов промптов, реализаций защитных барьеров) в идентичных условиях.

  • Гибкие критерии оценки: команды задают специфичные для предметной области критерии оценки программным путем, а не используют предопределенные метрики, поддерживая такие требования, как точность понимания, уместность ответа или качество вывода для конкретных сценариев использования.

Оценка агентов — новое поле битвы для поставщиков инструментов разметки данных

HumanSignal не одинока в понимании того, что оценка агентов представляет собой следующий этап развития рынка разметки данных. Конкуренты совершают аналогичные маневры в ответ на технологические сдвиги и изменения на рынке.

Labelbox запустила в августе 2025 года свою студию оценки (Evaluation Studio), сосредоточившись на оценке на основе критериев. Как и HumanSignal, компания выходит за рамки традиционной разметки данных в сферу валидации ИИ для продакшена.

Общий ландшафт конкуренции в сфере разметки данных кардинально изменился в июне, когда Meta инвестировала 14,3 миллиарда долларов в приобретение 49% акций Scale AI, прежнего лидера рынка. Эта сделка спровоцировала отток некоторых из крупнейших клиентов Scale. HumanSignal воспользовалась этой ситуацией: Малюк заявил, что в прошлом квартале ее компании удалось выиграть несколько конкурентных сделок. Малюк называет в качестве дифференцирующих факторов зрелость платформы, гибкость настройки и поддержку клиентов, хотя конкуренты заявляют о схожих преимуществах.

Что это значит для разработчиков ИИ

Для предприятий, создающих промышленные системы ИИ, слияние инфраструктуры разметки данных и оценки имеет ряд стратегических последствий:

Начинайте с эталонных данных (ground truth). Инвестиции в создание высококачественных размеченных наборов данных с участием нескольких экспертов-рецензентов, разрешающих разногласия, окупаются на протяжении всего жизненного цикла разработки ИИ — от начального обучения до непрерывного совершенствования в продакшене.

Наблюдаемость (observability) необходима, но недостаточна. Хотя мониторинг действий систем ИИ остается важным, инструменты наблюдаемости измеряют активность, а не качество. Предприятиям необходима специализированная инфраструктура оценки для анализа результатов и стимулирования улучшений. Это разные задачи, требующие разных возможностей.

Инфраструктура обучающих данных служит инфраструктурой оценки. Организации, которые инвестировали в платформы разметки данных для разработки моделей, могут распространить ту же инфраструктуру на оценку в продакшене. Это не две разные проблемы, требующие отдельных инструментов, а единый фундаментальный рабочий процесс, применяемый на разных этапах жизненного цикла.

Для предприятий, развертывающих ИИ в больших масштабах, узкое место сместилось с создания моделей на их валидацию. Организации, которые осознают этот сдвиг раньше других, получают преимущества в развертывании ИИ-систем в продакшене.

Ключевой вопрос для предприятий эволюционировал: дело не в том, достаточно ли сложны системы ИИ, а в том, могут ли организации систематически доказывать, что они соответствуют требованиям к качеству в конкретных областях с высокими ставками.

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.