Финансовые LLM от Intuit повышают точность на 90%

Финансовые LLM от Intuit повышают точность на 90%

Intuit уже несколько лет занимается разработкой своей операционной системы генеративного ИИ (GenOS). Она используется для поддержки ИИ-агентов на таких платформах компании, как TurboTax, QuickBooks, Credit Karma и Mailchimp. Технология GenOS уже позволяет тысячам разработчиков создавать решения на базе ИИ и задействует таких агентов, как бухгалтерский помощник QuickBooks, который экономит малому бизнесу до 12 часов в месяц.

Теперь этот гигант финансового программного обеспечения анонсирует масштабные улучшения GenOS, которые демонстрируют, как компании могут создавать специализированные ИИ-системы, превосходящие универсальные аналоги. Последние обновления сосредоточены в трех ключевых областях: кастомные финансовые большие языковые модели (LLM), бесшовные возможности интеграции экспертов в рабочий процесс (human-in-the-loop) и передовые фреймворки оценки агентов.

Главным прорывом стали новые финансовые LLM собственной разработки Intuit, которые обеспечивают точность категоризации транзакций на уровне 90%. Это представляет собой заметное улучшение по сравнению с предыдущими моделями при одновременном сокращении задержки на 50% по сравнению с универсальными LLM. Для платформы, которая уже обрабатывает десятки миллионов взаимодействий с ИИ, такой прирост эффективности трансформируется в существенную экономию средств и кардинальное улучшение пользовательского опыта.

«Самое необычное здесь то, что по мере нашего продвижения вперед мы будем снижать затраты и задержки для этой модели, — рассказал Ашок Шривастава (Ashok Srivastava), директор по искусственному интеллекту Intuit, в эксклюзивном интервью VentureBeat. — Но одновременно мы видим и улучшение качества модели. Я давно говорю об этом: так называемая гонка на дно в отношении стоимости и задержек и гонка на вершину в плане точности».

Технологический прорыв: смысловое понимание в масштабе

Как же Intuit удалось сделать свои финансовые LLM настолько лучше?

Ключевая инновация заключается в том, как компания подошла к проблеме семантического понимания, которая досаждает многим корпоративным внедрениям ИИ. Традиционные модели машинного обучения изучают прямые соответствия между транзакциями и категориями. Финансовые LLM от Intuit понимают контекстуальный смысл, стоящий за финансовой терминологией.

Сопоставление транзакций с категориями — это то, чем финансовое ПО занимается уже некоторое время, хотя обычно с использованием жестких предопределенных категорий. Именно здесь Intuit стремится добиться лучших результатов.

«Если бы категории были предопределены, и Intuit нужно было бы просто найти их, а затем заставить всех клиентов сопоставлять данные с ними… это на самом деле простая задача, — отметил Шривастава. — Но в данном случае у каждого свой набор категорий, и мы этого добиваемся. Нам нужен такой уровень персонализации».

Финансовые LLM от Intuit работают таким образом, что система теперь фактически изучает категории пользователя, поскольку обладает лучшим пониманием семантики. Это семантическое понимание позволяет моделям справляться с персонализированными системами категоризации. Это критически важная способность для корпоративных внедрений, где разные организации имеют уникальные таксономии и бизнес-правила.

Процесс обучения начинается с данных о транзакциях из банков, которые были анонимизированы и очищены от личной информации. Затем Intuit улучшает модель с помощью контролируемой тонкой настройки (fine-tuning) и специализированных защитных механизмов, встроенных в процесс обучения для улучшения семантического понимания.

Этот многоэтапный процесс представляет собой результат месяцев инновационной работы специализированной команды Шриваставы по финансовым LLM. Такой методичный подход к обучению моделей для конкретных доменов предлагает шаблон для других предприятий, стремящихся создавать ИИ-системы, превосходящие универсальные аналоги в узких областях.

Оценка работы продвинутых ИИ-агентов: от точности к эффективности

Помимо повышения точности финансовых LLM, Intuit также значительно расширяет свою службу оценки GenOS (Evaluation Service) в составе пакета разработчика агентов (Agent Starter Kit). Хотя базовые возможности оценки существовали с момента зарождения GenOS, теперь компания вкладывает значительные средства в сложные фреймворки, которые измеряют эффективность агентов и качество принятия решений в условиях неопределенности.

Усовершенствованная служба оценки решает критический пробел в корпоративных внедрениях ИИ. Большинство компаний фокусируются на том, выдают ли ИИ-агенты точные результаты, но игнорируют вопрос о том, являются ли эти результаты оптимальными решениями.

«Когда вы работаете с агентами, агент принимает решения или предлагает решения от вашего имени, — пояснил Шривастава. — Вопрос в том, является ли этот набор решений правильным или нет? Номер один. Номер два — даже если он решает поставленную вами задачу, лучший ли это способ сделать ее?»

Он привел гипотетический сценарий. ИИ-агент предлагает маршрут из Сан-Франциско в Лос-Анджелес через Оклахома-Сити.

«Это потенциальное решение проблемы, но оно крайне неэффективно, — сказал он. — Когда вы создаете агентные технологии, вам нужно убедиться не только в том, что система точна — потому что, откровенно говоря, она точна, — но и в том, эффективна ли она».

Для корпоративных ИИ-команд это означает необходимость выхода за рамки бинарных метрик успешности для оценки путей принятия решений в условиях неопределенности. Ключ к успеху заключается в создании систем оценки, способных определить, выбрал ли агент наиболее эффективный маршрут к цели с учетом внешних факторов и ограничений.

Стратегические последствия для корпоративного ИИ

Эволюция GenOS от Intuit преподносит несколько уроков для корпоративных ИИ-команд.

Специализация по доменам превосходит генерализацию: Кастомные модели, обученные на специфических для отрасли данных, могут значительно превосходить универсальные альтернативы в специализированных задачах. Это происходит несмотря на необходимость более крупных первоначальных инвестиций.

Фреймворки оценки — это конкурентное преимущество: Сложные методы измерения эффективности ИИ-агентов и качества принятия решений в условиях неопределенности отличают успешные внедрения корпоративного ИИ от неудачных экспериментов.

Оркестрация человека и ИИ требует инфраструктуры: Бесшовные возможности интеграции экспертов в контур требуют специально созданных систем маршрутизации и передачи управления. Спонтанный человеческий надзор здесь недостаточен.

Повышение производительности разработчиков носит кумулятивный характер: Инвестиции в внутренние инструменты ИИ обеспечивают ускоряющуюся отдачу за счет повышения скорости работы разработчиков и качества кода.

Для компаний, стремящихся лидировать в деле внедрения ИИ, подход Intuit предлагает четкую стратегию. Выигрышный подход предполагает создание специализированных, ориентированных на конкретные области ИИ-систем со сложными фреймворками оценки. Простого развертывания универсальных моделей недостаточно.

ИИ

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.