Новая языковая модель Symphony от Corti превосходит OpenAI по точности медицинской терминологии, подчеркивая ценность специализированного ИИ
Сегодня базирующийся в Копенгагене медицинский ИИ-стартап Corti запускает Symphony for Speech-to-Text — новое поколение моделей распознавания речи клинического уровня, созданных специально для диктовки в реальном времени, транскрипции диалогов и пакетной обработки аудио. Уровень их точности является рекордным для данного конкретного сценария использования.
«Мы стремимся к тому, чтобы нашему медицинскому ИИ-ассистенту доверяли врачи, практикующие специалисты и пациенты… вся система здравоохранения в целом», — заявил Андреас Клев (Andreas Cleve), соучредитель и генеральный директор Corti, в эксклюзивном видеоинтервью изданию VentureBeat.
Данные о производительности, которые компания представляет на суд общественности, ярко иллюстрируют текущее состояние корпоративного ИИ: в высокорегулируемых специализированных отраслях модели, ориентированные на конкретную предметную область, способны превосходить провайдеров универсальных базовых моделей.
В недавно опубликованной исследовательской работе Corti сообщила, что ее новые речевые модели клинического уровня снизили частоту ошибок в словах (WER) на величину до 93% по сравнению с ведущими универсальными речевыми моделями и API в области медицинской терминологии.
При работе с английской медицинской терминологией модель Symphony for Speech-to-Text продемонстрировала чрезвычайно низкий показатель WER на уровне 1,4%. Для сравнения: речевая модель OpenAI показала WER 17.7%, ElevenLabs достигла 18.1%, Whisper зарегистрировала 17.4%, а Parakeet набрала 18.9%.
Анонс Corti служит важнейшей поворотной точкой для разработчиков в сфере здравоохранения. В то время как универсальные API, такие как Whisper от OpenAI, подходят для расширофки текста общего назначения, они часто спотыкаются о медицинские аббревиатуры, сложные дозировки лекарств, стенографические сокращения и шумную обстановку в отделениях неотложной помощи. Symphony for Speech-to-Text призвана решить эту проблему, предоставляя разработчикам высокоспециализированный API производственного уровня, разработанный с нуля для клинических рабочих процессов.
Эпоха агентов требует безупречных входных данных
Запуск Symphony for Speech-to-Text подчеркивает фундаментальный сдвиг в том, как здравоохранение использует голосовые технологии. На протяжении десятилетий медицинское распознавание речи сводилось в первую очередь к созданию статического текстового документа для просмотра врачом-человеком — цифровой замены блокноту.
Но по мере того как индустрия здравоохранения стремительно вступает в так называемую «эпоху агентов» (agentic era), когда автономные ИИ-агенты активно помогают в принятии клинических решений, навигации по электронным медицинским картам (ЭМК) и поддержке в реальном времени, стенограмма перестает быть конечным продуктом. Она становится базовым слоем данных.
«Речь всегда была одним из важнейших входных данных в здравоохранении, — отметил Клев в заявлении, предоставленном VentureBeat. — Меняется то, что происходит после того, как слова записаны. В эпоху агентов распознавание речи требует большего, чем просто создание стенограммы: нам нужно предоставить ИИ-системам точные клинические факты для логических выводов. Если модель расслышит лекарство, дозировку или симптом неправильно, каждый последующий шаг станет менее надежным. Symphony for Speech-to-Text дает разработчикам в сфере здравоохранения речевой слой, достаточно точный для работы в суровой клинической реальности».
Именно здесь в игру вступает нарастающая опасность высокой частоты ошибок в словах. Если универсальная ИИ-модель галлюцинирует при транскрипции — превращая «гипертиреоз» в «гипотиреоз» или неверно истолковывая критическую дозировку лекарства, — каждый последующий ИИ-агент, полагающийся на эту стенограмму, будет оперировать искаженными данными. Архитектура Corti снижает этот риск за счет формирования структурированных, пригодных для клинического использования результатов непосредственно через API, помогая последующим ИИ-приложениям оперировать чистыми фактами, а не зашумленным, неформатированным текстом.
Нигде это не проявляется так явно, как в бенчмарках Corti по извлечению сущностей. Модель Symphony for Speech-to-Text достигла поразительного показателя извлечения в 98,3% для отформатированных клинических сущностей — таких как дозировки, измерения и даты. Для сравнения, Corti сообщила, что сильнейшая базовая модель общего назначения набрала максимум 44,3% извлечения для тех же сущностей.
Для разработчиков, создающих инструменты для контекстной документирования на базе ИИ, этот разрыв в 54% — разница между инструментом, экономящим время врача, и инструментом, представляющим собой медицинскую ответственность.
Смещение лидеров индустрии
Хотя результаты тестов Corti в сравнении с современными разработчиками языковых моделей (LLM), такими как OpenAI и ElevenLabs, впечатляют, компания также нацелена на традиционных гигантов медицинской транскрипции.
Годами золотым стандартом для целенаправленной диктовки клиницистов был Dragon Medical One. Тем не менее, эти устаревшие системы исторически оптимизировались строго для намеренной диктовки врачом, а не в качестве базовой инфраструктуры для фонового ИИ, сложных многосторонних разговоров или инструментов клинической поддержки в реальном времени.
В ходе оценки реальной медицинской диктовки на английском языке Corti достигла показателя WER 4.6%, превзойдя результат Dragon в 5.7% (относительное улучшение на 19%).
Кроме того, Corti продемонстрировала более высокий процент извлечения медицинских терминов по сравнению с Dragon (93,5% против 92,9%).
Обеспечивая такой уровень точности через конечную точку API, Corti позволяет сторонним разработчикам, поставщикам ЭМК и платформам виртуального ухода создавать собственные инструменты диктовки и фонового прослушивания, которые превосходят традиционных лидеров отрасли.
«Мы хотим, чтобы люди создавали приложения на базе наших моделей, — сказал Клев. — Цель состоит в том, чтобы распространить эту технологию настолько широко, насколько это необходимо, чтобы она была максимально полезной для пациентов, их врачей и профессионалов».
Для Клева и его соучредителей эта миссия носит личный характер: его собственная мать была медицинским работником, на которую напал пациент, и она годами пыталась восстановить здоровье. Он стремился улучшить процессы в здравоохранении как способ почтить ее жертву.
Решение головоломки медицинских моделей
Потребности здравоохранения выходят далеко за рамки англоязычных больниц, и глобальные системы здравоохранения исторически обделены вниманием моделей клинической обработки естественного языка (NLP). Ранние последователи уже используют новые модели Corti в лингвистически сложных условиях, доказывая жизнеспособность технологии на сложных международных рынках.
Швейцария, например, требует оказания медицинской помощи на нескольких языках — часто одновременно в пределах одного медицинского учреждения. Это один из самых суровых полигонов для тестирования многоязычных моделей медицинской речи в мире. Модели Symphony от Corti продемонстрировали масштабный прирост производительности в этих тестах на неанглийских языках, достигнув показателя WER 2.4% в немецком (по сравнению с 13.0% у ближайшей альтернативной системы) и WER 3.9% во французском (против 10.6%).
«В клинической беседе каждое слово имеет значение — пропущенное название лекарства, расслышанная неверно дозировка или неправильно записанный симптом могут изменить смысл визита, — отметил Пьер Корбо (Pierre Corboz), руководитель отдела решений и развития бизнеса в Voicepoint, швейцарском провайдере медицинских технологий, в заявлении для VentureBeat. — Точность Symphony в отношении медицинской терминологии дает нам основу для внедрения более надежных возможностей ИИ в клинические рабочие процессы нашей платформы Voicepoint Xenon. Когда Corti улучшает речевой слой, создаваемые нами совместные рабочие процессы становятся эффективнее, безопаснее и полезнее для врачей в Швейцарии».
Вертикализация и специализация ИИ приносят плоды
Сегодняшний анонс Symphony for Speech-to-Text не является изолированным событием; это кульминация стратегического нарратива, который Corti активно продвигала последние несколько недель.
Более широкая платформа Symphony, которая обеспечивает работу клинических и административных приложений для глобальной сети поставщиков ЭМК и организаций в сфере наук о жизни, систематически доказывает жизнеспособность вертикальных ИИ-лабораторий на фоне горизонтальных технологических гигантов.
Это уже третий крупный бенчмарк, выпущенный Corti всего за шесть недель, затрагивающий различные уровни производительности медицинского ИИ.
В апреле компания сообщила, что ее система Symphony for Medical Coding превзошла модели общего назначения более чем на 25% в тестах на клиническую точность, решив одну из самых сложных задач в здравоохранении.
И всего на прошлой неделе Corti объявила, что ее флагманская модель клинического уровня превзошла OpenAI на HealthBench Professional, собственном медицинском бенчмарке OpenAI.
В совокупности эти три показателя — медицинское кодирование, клинические рассуждения и точность распознавания речи — иллюстрируют растущий консенсус в секторе корпоративных технологий: обобщенные модели достигают своего потолка в регулируемых отраслях.
Модели, развертываемые в больницах, должны органично понимать сложные аббревиатуры, внезапные прерывания, медицинский стенографический язык, специализированную лексику и строгие требования соответствия. Обучаясь конкретно на этих уникальных пограничных случаях, вертикальные ИИ-лаборатории, такие как Corti, строят грозный барьер, который компании, полагающиеся исключительно на вызовы API к обобщенным большим языковым моделям, не смогут легко преодолеть.
Доступность и линейка продуктов
Разработчики явно обращают внимание на разрыв в производительности. Согласно данным о динамике, предоставленным VentureBeat, Corti фиксирует 30-процентный рост числа новых регистраций на своей платформе при сравнении квартал к текущему моменту, что свидетельствует о том, что разработчики и создатели медицинских решений активно тяготеют к вертикальным моделям клинического уровня, а не к универсальным API.
Corti, которая уже ежегодно обслуживает более 100 миллионов пациентов в крупнейших системах здравоохранения, включая Национальную службу здравоохранения Великобритании (NHS), позиционирует Symphony for Speech-to-Text в качестве движка по умолчанию для нового поколения медицинского программного обеспечения.
Важно отметить, что Corti выпускает сегодня не саму общую платформу Symphony как таковую; скорее, Symphony for Speech-to-Text работает как новая, отдельная функция в рамках этой более широкой экосистемы, доступная через собственные конечные точки API.
Symphony for Speech-to-Text становится общедоступной с сегодняшнего дня. Разработчики и корпоративные архитекторы могут получить доступ к моделям через консоль API Corti, а полная техническая документация поможет интегрировать речевой слой клинического уровня в существующие приложения.
В рамках стремления к прозрачности исследований Corti также опубликовала свою полную научную работу с описанием методологии, а также отдельный инструмент сравнения, разработанный для поддержки прозрачной оценки систем медицинского распознавания речи в масштабах всей индустрии.
Поскольку индустрия здравоохранения продолжает стремительно внедрять автоматизацию на базе ИИ, базовый уровень данных никогда не был столь критически важным. Последний запуск Corti служит ярким напоминанием о том, что в медицинской сфере общий ИИ просто недостаточно хорош. Будущее принадлежит специалистам.



