Rapidata сокращает цикл разработки моделей ИИ с месяцев до дней благодаря RLHF почти в реальном времени

Rapidata сокращает цикл разработки моделей ИИ с месяцев до дней благодаря RLHF почти в реальном времени

Несмотря на растущие разговоры о будущем, в котором значительная часть человеческого труда будет автоматизирована с помощью ИИ, одним из парадоксов нынешнего технологического бума является то, насколько упрямо он продолжает зависеть от людей, в частности от процесса обучения моделей ИИ с использованием обучения с подкреплением на основе отзывов людей (RLHF).

Проще говоря, RLHF — это система репетиторства: после того как ИИ обучен на курированных данных, он все равно совершает ошибки или звучит как робот. Лаборатории ИИ массово нанимают людей-подрядчиков для оценки и ранжирования результатов работы новой модели в процессе ее обучения, и модель учится на их оценках, корректируя свое поведение так, чтобы выдавать более высоко оцененные результаты. Этот процесс становится еще более важным по мере того, как ИИ расширяется до создания мультимедийных материалов, таких как видео, аудио и изображения, которые могут иметь более тонкие и субъективные показатели качества.

Исторически сложилось так, что этот процесс репетиторства был для ИИ-компаний огромной логистической головной болью и PR-кошмаром, поскольку он опирался на разрозненные сети зарубежных подрядчиков и статические пулы разметки в конкретных региональных центрах с низким уровнем дохода, описанные СМИ как низкооплачиваемые и даже эксплуататорские. Это также неэффективно: ИИ-лаборатории вынуждены ждать недели или месяцы единичную партию отзывов, что задерживает прогресс моделей.

Теперь появился новый стартап, призванный сделать этот процесс гораздо более эффективным: платформа Rapidata фактически превращает RLHF в «игру», направляя вышеупомянутые задачи по проверке примерно 20 миллионам пользователей популярных приложений, включая Duolingo или Candy Crush, по всему миру. Задачи предлагаются в виде коротких опциональных заданий на оценку, которые пользователи могут выполнять вместо просмотра мобильной рекламы, причем данные отправляются обратно в заказавшую услугу лабораторию ИИ мгновенно.

Как сообщается в пресс-релизе, предоставленном VentureBeat, эта платформа позволяет лабораториям ИИ «проводить итерации моделей практически в реальном времени», значительно сокращая сроки разработки по сравнению с традиционными методами.

Генеральный директор и основатель Джейсон Коркилл (Jason Corkill) заявил в том же пресс-релизе, что Rapidata делает «человеческие суждения доступными в глобальном масштабе и практически в реальном времени, открывая будущее, в котором команды разработчиков ИИ смогут запускать постоянные циклы обратной связи и создавать системы, развивающиеся ежедневно, а не от одного цикла релизов к другому».

Rapidata founder and CEO Jason Corkill

Основатель и генеральный директор Rapidata Джейсон Коркилл. Фото: Rapidata

Rapidata рассматривает RLHF как высокоскоростную инфраструктуру, а не как проблему ручного труда. Сегодня компания эксклюзивно объявила нам в VentureBeat о своем выходе из тени и привлечении начального раунда (seed) финансирования в размере 8,5 млн долларов, со-инвесторами которого выступили Canaan Partners и IA Ventures при участии Acequia Capital и BlueYard, с целью масштабирования своего уникального подхода к работе с человеческими данными по требованию.

Разговор в пабе, который создал человеческое «облако»

Истоки Rapidata зародились не в зале заседаний совета директоров, а за столиком за кружкой пива. Когда Коркилл был студентом Швейцарской высшей технической школы Цюриха (ETH Zurich) и работал в сфере робототехники и компьютерного зрения, он столкнулся со стеной, с которой рано или поздно сталкивается каждый инженер по ИИ: «узким горлышком» аннотирования данных.

«В частности, я уже довольно давно работаю в области робототехники, ИИ и компьютерного зрения, учился в ETH здесь, в Цюрихе, и меня всегда расстраивало аннотирование данных», — вспоминает Коркилл в недавнем интервью. — «Всякий раз, когда вам нужны были люди или разметка данных человеком, проект как будто останавливался на месте, потому что до этого момента вы могли двигать его вперед, просто работая по ночам. Но когда вам требовалась масштабная разметка силами людей, вам приходилось идти к кому-то, а затем ждать несколько недель».

Устав от этих задержек, Коркилл и его сооснователи поняли, что существующая модель труда для ИИ принципиально сломана для мира, движущегося со скоростью современных вычислительных мощностей. В то время как вычислительные мощности растут по экспоненте, традиционная человеческая рабочая сила, ограниченная ручным вводом в должность, региональным наймом и медленными циклами оплаты труда, — нет. Rapidata родилась из идеи о том, что человеческие суждения могут предоставляться в качестве глобально распределенной и практически мгновенной услуги.

Технологии: превращение цифровых следов в обучающие данные

Ключевая инновация Rapidata заключается в методе дистрибуции. Вместо того чтобы нанимать штатных аннотаторов в определенных регионах, Rapidata использует существующую экономику внимания мира мобильных приложений. Сотрудничая с такими сторонними приложениями, как Candy Crush или Duolingo, Rapidata предлагает пользователям выбор: посмотреть традиционную рекламу или потратить несколько секунд на предоставление отзывов для модели ИИ.

« usuarios задают вопрос: «Эй, не хотели бы вы вместо просмотра рекламы и покупки вашего внимания компаниями… не хотели бы вы разметить немного данных, оставить отзыв?»», — поясняет Коркилл. По словам Коркилла, от 50% до 60% пользователей выбирают задачу с предоставлением обратной связи вместо традиционной видеорекламы.

Этот подход «коллективного интеллекта» позволяет командам разработчиков ИИ задействовать разнообразную глобальную аудиторию в беспрецедентных масштабах.

  • Глобальная сеть: В настоящее время аудитория Rapidata составляет от 15 до 20 миллионов человек.

  • Массивная параллелизация: Платформа способна обрабатывать 1,5 миллиона человеческих оценок всего за один час.

  • Скорость: Циклы обратной связи, которые раньше занимали недели или месяцы, сокращаются до часов или даже минут.

  • Контроль качества: Со временем платформа формирует профили доверия и экспертности респондентов, гарантируя, что сложные вопросы будут направлены наиболее подходящим людям-экспертам.

  • Анонимность: Хотя пользователи отслеживаются с помощью анонимизированных идентификаторов для обеспечения согласованности и надежности, Rapidata не собирает личные данные, сохраняя конфиденциальность и оптимизируя качество данных.

Онлайн-RLHF: перенос процесса прямо в GPU

Наиболее значительным технологическим скачком, который обеспечивает Rapidata, является то, что Коркилл описывает как «онлайн-RLHF». Традиционно ИИ обучается отключенными друг от друга порциями (батчами): вы обучаете модель, останавливаете процесс, отправляете данные людям, ждете недели результатов разметки, а затем возобновляете работу. Это создает «круг» информации, в котором часто не хватает свежих человеческих данных.

Rapidata переносит этот процесс оценки непосредственно в цикл обучения. Поскольку их сеть работает очень быстро, они могут интегрироваться через API непосредственно с графическими процессорами (GPU), на которых работает модель.

«У нас всегда была эта идея обучения с подкреплением на основе отзывов людей… до сих пор вам всегда приходилось делать это батчами, — говорит Коркилл. — Теперь же, если углубиться совсем глубоко, у нас есть несколько клиентов, где благодаря нашей невероятной скорости мы можем находиться непосредственно в самом процессе — на уровне процессора в GPU, понимаете? Графический процессор вычисляет какой-то результат и может немедленно, распределенным образом запросить у нас: «Ой, мне нужно, мне нужно, мне нужно, чтобы человек посмотрел на это». Я получаю ответ, а затем применяю этот штраф (loss), что раньше было невозможно».

В настоящее время платформа поддерживает примерно 5500 человек в минуту, предоставляющих живые отзывы моделям, работающим на тысячах графических процессоров. Это предотвращает «звеньевой взлом модели вознаграждения» (reward model hacking), когда две модели ИИ обманывают друг друга в цикле обратной связи, привязывая обучение к реальным человеческим нюансам.

Продукт: решение задач со вкусом и глобальным контекстом

По мере того как ИИ выходит за рамки простого распознавания объектов в сферу генеративных медиа, требования к разметке данных эволюционировали от объективного тегирования до субъективной кураторской обработки в зависимости от «вкусов». Речь идет уже не просто о том, «кошка ли это?», а о том, «убедителен ли этот синтез речи?» или «какое из этих двух резюме выглядит более профессиональным?».

Лили Клиффорд (Lily Clifford), генеральный директор стартапа в области голосового ИИ Rime, отмечает, что Rapidata изменила правила игры при тестировании моделей в реальных условиях. «Раньше сбор содержательных отзывов означал сшивание воедино подрядчиков и опросов по сегментам или странам, что не масштабировалось», — говорит Клиффорд. Используя Rapidata, Rime может находить нужную аудиторию — будь то в Швеции, Сербии или США — и смотреть, как модели работают в реальных рабочих процессах клиентов за дни, а не месяцы.

«Большинство моделей фактически верны, но я уверен, что вы получали электронные письма, которые кажутся… ну, неискренними, верно? — отмечает Коркилл. — Вы можете учуять письмо, созданное ИИ, вы можете учуять изображение или видео от ИИ, это сразу бросается в глаза… эти модели все еще не ощущаются человеческими, и для этого вам нужны отзывы людей».

<

Экономический и операционный сдвиг

С операционной точки зрения Rapidata позиционирует себя как уровень инфраструктуры, который избавляет компании от необходимости управлять собственными специализированными операциями по аннотированию. Предоставляя масштабируемую сеть, компания снижает барьер входа для команд разработчиков ИИ, которые раньше сталкивались со сложностями и затратами традиционных циклов обратной связи.

Джаред Ньюман (Jared Newman) из Canaan Partners, руководивший инвестициями, считает, что эта инфраструктура необходима для следующего поколения ИИ. «Каждое серьезное развертывание ИИ зависит от человеческих суждений на каком-то этапе жизненного цикла», — говорит Ньюман. — «По мере перехода моделей от экспертных задач к кураторству на основе вкуса спрос на масштабируемую обратную связь от людей будет резко расти».

Будущее человеческого использования

Хотя в настоящее время основное внимание уделяется модельным лабораториям в районе залива Сан-Франциско, Коркилл видит будущее, в котором сами модели ИИ станут основными заказчиками человеческих суждений. Он называет это «человеческим использованием» (human use).

В таком сценарии ИИ-автодизайнер не просто создаст автомобиль общего назначения; он сможет программно обратиться к Rapidata, чтобы узнать у 25 000 человек на французском рынке их мнение о конкретной эстетике, учесть эти отзывы и доработать дизайн за считанные часы.

«Общество находится в постоянном движении», — отметил Коркилл, затрагивая тенденцию использования ИИ для симуляции человеческого поведения. — «Если они смоделируют общество сейчас, симуляция будет стабильной и, возможно, будет отражать наше общество в течение нескольких месяцев, но затем она полностью изменится, потому что общество изменилось и развилось совершенно по-другому».

Создавая распределенный, программный способ доступа к человеческому интеллектуальному потенциалу по всему миру, Rapidata позиционирует себя как жизненно важный узел связи между кремнием и обществом. Получив 8,5 млн долларов нового финансирования, компания планирует действовать агрессивно, чтобы по мере масштабирования ИИ человеческий фактор перестал быть «узким горлышком» и превратился в функцию реального времени.

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.