Датасет EMM-1 от Encord: дебют 1 миллиарда пар данных
Модели ИИ ровно настолько хороши, насколько качественны данные, на которых они обучаются. Эти данные, как правило, необходимо разметить, упорядочить и структурировать, прежде чем модели смогут эффективно извлекать из них знания.
Одним из главных недостающих звеньев в экосистеме искусственного интеллекта было отсутствие крупного высококачественного открытого мультимодального набора данных. Ситуация меняется сегодня с выходом датасета EMM-1, который включает 1 миллиард пар данных и 100 миллионов групп данных в 5 модальностях: текст, изображения, видео, аудио и трехмерные облака точек. Мультимодальные наборы данных объединяют различные типы данных, которые системы ИИ могут обрабатывать одновременно. Это отражает то, как люди воспринимают мир, используя несколько органов чувств одновременно. Такие датасеты позволяют системам ИИ делать более точные выводы за счет понимания взаимосвязей между различными типами данных, а не обработки каждой модальности изолированно.
EMM-1 разработан поставщиком платформы для разметки данных Encord. Платформа компании позволяет командам отбирать, размечать и управлять обучающими данными в больших масштабах с использованием как автоматизированных рабочих процессов, так и с участием человека. Наряду с новой моделью, Encord разработала метод обучения EBind, который ставит качество данных выше чистых вычислительных мощностей. Такой подход позволил компактной модели с 1,8 миллиарда параметров сравняться по производительности с моделями, которые до 17 раз больше, при этом сократив время обучения с дней до часов на одном графическом процессоре вместо целых кластеров GPU.
«Главный секрет для нас заключался в том, чтобы сосредоточиться именно на данных и сделать их исключительно качественными, — рассказал Эрик Ландау (Eric Landau), соучредитель и генеральный директор Encord, в эксклюзивном интервью VentureBeat. — Нам удалось достичь того же уровня производительности, что и у моделей, которые в 20 раз больше, не потому, что мы придумали что-то сверххитрое в архитектуре, а потому, что мы обучили модель на действительно качественных данных».
Преимущество качества данных
По словам Ландау, датасет от Encord в 100 раз больше ближайшего сопоставимого мультимодального набора данных. Он функционирует в петабайтном масштабе с терабайтами сырых данных и более чем 1 миллионом человеческих аннотаций.
Но одни лишь масштабы не объясняют прирост производительности. Техническая инновация заключается в решении проблемы, которую Ландау называет «недооцененной» в обучении ИИ: утечки данных между обучающими и оценочными выборками.
«Проблема утечки — это то, чему мы уделили много времени, — пояснил Ландау. — Во многих наборах данных существует определенная утечка между различными подмножествами данных. Утечка на самом деле повышает ваши результаты. Она делает ваши оценки лучше. Но это момент, к которому мы отнеслись весьма скрупулезно».
Утечка данных происходит, когда информация из тестовых данных непреднамеренно попадает в обучающие данные, искусственно завышая показатели производительности модели. Многие эталонные датасеты страдают от этого загрязнения. Encord применила методы иерархической кластеризации, чтобы обеспечить четкое разделение при сохранении репрезентативного распределения по типам данных. Компания также использовала кластеризацию для устранения предвзятости и обеспечения разнообразного представления.
Как EBind повышает эффективность
Повышение качества данных идет рука об руку с архитектурным подходом, разработанным для обеспечения эффективности.
Методология EBind от Encord расширяет подход CLIP (Contrastive Language-Image Pre-training, изначально разработанный OpenAI) с двух модальностей до пяти. CLIP учится сопоставлять изображения и текст в общем пространстве представлений, что позволяет решать такие задачи, как поиск изображений по текстовым описаниям.
Если CLIP учится сопоставлять изображения и текст в общем латентном пространстве, то EBind делает то же самое для изображений, текста, аудио, 3D-облаков точек и видео.
Архитектурный выбор отдает приоритет эффективности использования параметров. Вместо развертывания отдельных специализированных моделей для каждой пары модальностей, EBind использует единую базовую модель с одним энкодером на каждую модальность.
«Другие методологии используют множество разных моделей и перенаправляют запрос на лучшую модель для встраивания этих пар, поэтому количество параметров у них стремительно растет, — отметил Ландау. — Мы обнаружили, что можем использовать единую базовую модель и обучать всего один энкодер на каждую модальность, сохраняя архитектуру очень простой и эффективной с точки зрения параметров, если мы подаем на вход этой общей архитектуре действительно очень качественные данные».
Полученная модель соперничает с OmniBind, гораздо более крупным конкурентом в мультимодальном пространстве, но требует значительно меньше вычислительных ресурсов как для обучения, так и для инференса. Это позволяет развертывать EBind в средах с ограниченными ресурсами, включая периферийные устройства для робототехники и автономных систем.
Ценность мультимодального датасета для бизнеса
Мультимодальные модели открывают возможности для корпоративных сценариев использования, охватывающих различные типы данных.
Большинство организаций хранят разные типы данных в изолированных системах: документы в платформах управления контентом, аудиозаписи в коммуникационных инструментах, учебные видео в системах управления обучением и структурированные данные в базах данных. Мультимодальные модели могут осуществлять поиск и извлечение информации по всем этим источникам одновременно.
«У предприятий есть самые разные типы данных. У них не только документы. У них есть аудиозаписи, учебные видео и CSV-файлы, — сказал Ландау. — Допустим, вы юрист, и у вас есть материалы дела, которые включают видеодоказательства, а также документы и записи, и все это разбросано по множеству изолированных хранилищ данных. Вы можете использовать EBind, чтобы собрать все релевантные данные воедино для поиска и получить нужную информацию гораздо быстрее, чем раньше».
Тот же принцип применим в различных отраслях. Медицинские учреждения могут связать данные визуализации пациентов с клиническими заметками и диагностическим аудио. Финансовые компании могут сопоставить записи транзакций с записями звонков отдела комплаенс и коммуникациями с клиентами. Производственные предприятия могут объединить данные датчиков оборудования с видеологами техобслуживания и отчетами об инспекциях.
Помимо офисной среды, еще одним рубежом является физический ИИ. Ландау отметил автономные транспортные средства, которые используют как визуальное восприятие, так и звуковые сигналы, такие как сирены экстренных служб. В производстве и на складах роботы, объединяющие визуальное распознавание с аудиообратной связью и пространственным восприятием, могут работать безопаснее и эффективнее, чем системы, полагающиеся только на зрение.
Корпоративный кейс: Расширение компьютерного зрения с помощью мультимодального контекста
Captur AI, клиент компании Encord, иллюстрирует, как компании планируют использовать датасет для конкретных бизнес-приложений. Этот стартап предоставляет инструмент проверки изображений на мобильных устройствах, валидируя фотографии в реальном времени на предмет подлинности, соответствия требованиям и качества перед их загрузкой. Компания работает со службами шеринга (например, Lime) и службами доставки, обрабатывающими миллиарды фотографий посылок.
Captur AI обрабатывает более 100 миллионов изображений прямо на устройстве и специализируется на сжатии моделей до 6–10 мегабайт, чтобы они могли работать на смартфонах без подключения к облаку. Однако генеральный директор Шарлотта Бак (Charlotte Bax) считает мультимодальные возможности критически важными для выхода в сегменты с более высокой ценностью.
«Рынок для нас огромлен. Вы отправляете фотографии для возврата товаров в ритейле. Вы отправляете фотографии в страховые компании при наступлении страховых случаев. Вы отправляете фотографии, когда выставляете товар на продажу на eBay, — рассказала Бак в эксклюзивном интервью VentureBeat. — Некоторые из этих сценариев связаны с очень высокими рисками или высокой стоимостью в случае ошибки, например страхование: изображение фиксирует лишь часть контекста, и аудио может стать важным сигналом».
Бак привела цифровой осмотр транспортных средств в качестве яркого примера. Когда клиенты фотографируют повреждения автомобиля для страховых выплат, они часто устно описывают произошедшее во время съемки. Аудиоконтекст может значительно повысить точность обработки претензий и снизить уровень мошенничества.
«Когда вы это делаете, клиент часто вслух описывает то, что произошло, — говорит Бак. — Несколько наших потенциальных клиентов из сферы InsurTech спрашивали нас, можем ли мы обрабатывать и аудио, так как это добавляет дополнительный контекст для пользователя, подающего заявку».
Задача заключается в том, чтобы сохранить главное преимущество Captur AI — эффективную работу моделей прямо на устройстве без необходимости облачной обработки. Компания планирует использовать датасет Encord для обучения компактных мультимодальных моделей, которые сохраняют возможности работы в реальном времени оффлайн, добавляя при этом аудио и контекст последовательности изображений.
«Самое важное, что вы можете сделать, — это постараться получить как можно больше контекста, — считает Бак. — Удастся ли сделать LLM достаточно маленькими для работы на устройстве в ближайшие три года, или можно ли запускать мультимодальные модели на самом устройстве? Решение проблемы качества данных до загрузки изображения — это очень интересный рубеж».
Что это значит для бизнеса
Результаты Encord бросают вызов фундаментальным предположениям о разработке ИИ и показывают, что следующим полем конкурентной борьбы могут стать операции с данными, а не масштабы инфраструктуры.
Мультимодальные наборы данных открывают новые возможности. Способность обучать модели, понимающие взаимосвязи между различными типами данных, открывает сценарии использования недоступные для одномодальных систем.
Операции с данными заслуживают таких же инвестиций, как и вычислительная инфраструктура. 17-кратный прирост эффективности параметров за счет лучшей курации данных означает колоссальную экономию средств. Организации, направляющие ресурсы в кластеры графических процессоров и относящиеся к качеству данных по остаточному принципу, возможно, оптимизируют не ту переменную.
Для компаний, создающих мультимодальные системы ИИ, оценка Ландау отражает стратегический сдвиг.
«Нам удалось достичь того же уровня производительности, что и у гораздо более крупных моделей, не потому, что мы придумали что-то сверххитрое в архитектуре, а потому, что мы обучили модель на действительно качественных данных», — отметил он.



