Разметка данных не умерла — она превращается в краеугольный камень оценки агентного ИИ
По мере того как большие языковые модели (LLM) продолжают совершенствоваться, в отрасли возникают дискуссии о том, сохраняется ли необходимость в автономных инструментах разметки данных, ведь LLM всё лучше справляются с самыми разными типами информации. HumanSignal, ведущий коммерческий поставщик открытой программы Label Studio, придерживается иного мнения. Компания видит не спад спроса на разметку данных, а его рост.
Ранее в этом месяце компания HumanSignal приобрела Erud AI и запустила свои физические лаборатории Frontier Data Labs для сбора новых данных. Однако создание данных — это лишь полдела. Теперь компания берется за следующую задачу: доказательство того, что обученные на этих данных системы ИИ действительно работают. Новые возможности оценки мультимодальных агентов позволяют предприятиям проверять сложные ИИ-агенты, генерирующие приложения, изображения, код и видео.
«Если вы ориентируетесь на корпоративный сегмент, все создаваемые ими решения на базе ИИ по-прежнему нуждаются в оценке, что является лишь другим названием для разметки данных людьми, и в еще большей степени — экспертами», — отметил соучредитель и генеральный директор HumanSignal Михаил Малюк в эксклюзивном интервью VentureBeat.
Пересечение разметки данных и оценки агентного ИИ
Иметь правильные данные — это здорово, но это не конечная цель для предприятия. Современная разметка данных движется в сторону оценки.
Происходит фундаментальный сдвиг в том, что именно предприятиям необходимо проверять: не то, правильно ли их модель классифицировала изображение, а то, принял ли их ИИ-агент верные решения в ходе сложной многоэтапной задачи, требующей рассуждений, использования инструментов и генерации кода.
Если оценка — это всего лишь разметка данных для результатов работы ИИ, то переход от моделей к агентам представляет собой качественный скачок в том, что подлежит разметке. Если традиционная разметка данных может включать в себя отметку изображений или категоризацию текста, то оценка агентов требует суждения о многоэтапных цепочках рассуждений, решениях по выбору инструментов и мультимодальных результатах — и всё это в рамках одного взаимодействия.
«Возникает острая необходимость не просто в человеке в контуре (human-in-the-loop), а в эксперте в контуре», — сказал Малюк. Он указал на такие сферы с высокими ставками, как здравоохранение и юридические консультации, где стоимость ошибок остается непомерно высокой.
Связь между разметкой данных и оценкой ИИ гораздо глубже, чем просто семантика. Оба вида деятельности требуют одинаковых фундаментальных возможностей:
-
Структурированные интерфейсы для экспертной оценки: независимо от того, размечают ли рецензенты изображения для обучающих данных или оценивают, правильно ли агент задействовал несколько инструментов, им нужны специализированные интерфейсы для систематической фиксации их оценок.
-
Консенсус нескольких рецензентов: качественные обучающие наборы данных требуют участия нескольких разметчиков, которые урегулируют разногласия. Качественная оценка требует того же — нескольких экспертов, оценивающих результаты и разрешающих расхождения во мнениях.
-
Отраслевая экспертиза в широком масштабе: обучение современных систем ИИ требует профильных экспертов, а не просто краудсорсеров, кликающих по кнопкам. Оценка результатов работы ИИ в продакшене требует такой же глубины знаний.
-
Петли обратной связи с системами ИИ: размеченные обучающие данные подпитывают разработку моделей. Данные оценки питают непрерывное совершенствование, тонкую настройку (fine-tuning) и бенчмаркинг.
Оценка полного трека агента
Проблема оценки агентов заключается не только в объеме данных, но и в сложности того, что подлежит проверке. Агенты не выдают простые текстовые результаты: они генерируют цепочки рассуждений, выбирают инструменты и создают артефакты в разных модальностях.
Новые возможности Label Studio Enterprise отвечают требованиям проверки агентов:
-
Инспекция мультимодальных треков: платформа предоставляет унифицированные интерфейсы для анализа полных траекторий выполнения задач агентами — шагов рассуждений, вызовов инструментов и результатов в различных модальностях. Это решает распространенную проблему, когда командам приходится разбирать разрозненные потоки логов.
-
Интерактивная многошаговая оценка: оценщики анализируют диалоговые потоки, в которых агенты сохраняют состояние на протяжении нескольких ходов, проверяя отслеживание контекста и интерпретацию намерений во всей последовательности взаимодействия.
-
Агентная арена (Agent Arena): структура сравнительной оценки для тестирования различных конфигураций агентов (базовых моделей, шаблонов промптов, реализаций защитных барьеров) в идентичных условиях.
-
Гибкие критерии оценки: команды задают специфичные для предметной области критерии оценки программным путем, а не используют предопределенные метрики, поддерживая такие требования, как точность понимания, уместность ответа или качество вывода для конкретных сценариев использования.
Оценка агентов — новое поле битвы для поставщиков инструментов разметки данных
HumanSignal не одинока в понимании того, что оценка агентов представляет собой следующий этап развития рынка разметки данных. Конкуренты совершают аналогичные маневры в ответ на технологические сдвиги и изменения на рынке.
Labelbox запустила в августе 2025 года свою студию оценки (Evaluation Studio), сосредоточившись на оценке на основе критериев. Как и HumanSignal, компания выходит за рамки традиционной разметки данных в сферу валидации ИИ для продакшена.
Общий ландшафт конкуренции в сфере разметки данных кардинально изменился в июне, когда Meta инвестировала 14,3 миллиарда долларов в приобретение 49% акций Scale AI, прежнего лидера рынка. Эта сделка спровоцировала отток некоторых из крупнейших клиентов Scale. HumanSignal воспользовалась этой ситуацией: Малюк заявил, что в прошлом квартале ее компании удалось выиграть несколько конкурентных сделок. Малюк называет в качестве дифференцирующих факторов зрелость платформы, гибкость настройки и поддержку клиентов, хотя конкуренты заявляют о схожих преимуществах.
Что это значит для разработчиков ИИ
Для предприятий, создающих промышленные системы ИИ, слияние инфраструктуры разметки данных и оценки имеет ряд стратегических последствий:
Начинайте с эталонных данных (ground truth). Инвестиции в создание высококачественных размеченных наборов данных с участием нескольких экспертов-рецензентов, разрешающих разногласия, окупаются на протяжении всего жизненного цикла разработки ИИ — от начального обучения до непрерывного совершенствования в продакшене.
Наблюдаемость (observability) необходима, но недостаточна. Хотя мониторинг действий систем ИИ остается важным, инструменты наблюдаемости измеряют активность, а не качество. Предприятиям необходима специализированная инфраструктура оценки для анализа результатов и стимулирования улучшений. Это разные задачи, требующие разных возможностей.
Инфраструктура обучающих данных служит инфраструктурой оценки. Организации, которые инвестировали в платформы разметки данных для разработки моделей, могут распространить ту же инфраструктуру на оценку в продакшене. Это не две разные проблемы, требующие отдельных инструментов, а единый фундаментальный рабочий процесс, применяемый на разных этапах жизненного цикла.
Для предприятий, развертывающих ИИ в больших масштабах, узкое место сместилось с создания моделей на их валидацию. Организации, которые осознают этот сдвиг раньше других, получают преимущества в развертывании ИИ-систем в продакшене.
Ключевой вопрос для предприятий эволюционировал: дело не в том, достаточно ли сложны системы ИИ, а в том, могут ли организации систематически доказывать, что они соответствуют требованиям к качеству в конкретных областях с высокими ставками.



