Thinking Machines демонстрирует превью ИИ-голоса и видеоразговора почти в реальном времени с помощью новых «моделей взаимодействия»

Thinking Machines демонстрирует превью ИИ-голоса и видеоразговора почти в реальном времени с помощью новых «моделей взаимодействия»

Источник: VentureBeat · Carl Franzen

Уходит ли ИИ из эпохи «пошагового» общения?

Прямо сейчас всем нам, кто регулярно использует ИИ-модели в работе или личной жизни, хорошо известно: базовый режим взаимодействия с текстом, изображениями, аудио и видео остается неизменным: пользователь-человек делает запрос, ждет от миллисекунд до минут (или в некоторых случаях, для особо сложных задач, часов и дней), а ИИ-модель выдает ответ.

Но если ИИ действительно намерен взять на себя львиную долю задач, требующих естественного взаимодействия, ему потребуется нечто большее, чем просто такая «пошаговая» интерактивность — в конечном итоге ему придется реагировать на реплики человека более плавно и естественно, отвечая даже в процессе обработки следующего ввода от пользователя, будь то текст или данные в другом формате.

Именно такова точка зрения компании Thinking Machinesхорошо финансируемого ИИ-стартапа, основанного в прошлом году бывшим техническим директором OpenAI Мирой Мурати (Mira Murati), бывшим исследователем и соучредителем OpenAI Джоном Шульманом (John Schulman) и другими специалистами.

Сегодня компания анонсировала исследовательскую предварительную версию того, что она называет «моделями взаимодействия» (interaction models) — новым классом нативных мультимодальных систем, в которых интерактивность встроена на уровне архитектуры модели как первостепенный элемент, а не реализуется через внешнее программное «окружение» (harness). Благодаря этому удалось достичь впечатляющих результатов в сторонних бенчмарках и снизить задержку.

Тем не менее, эти модели пока недоступны широкой публике или даже корпоративным клиентам — в своем официальном блоге компания сообщает: «В ближайшие месяцы мы запустим ограниченную исследовательскую предварительную версию для сбора отзывов, а более широкий релиз состоится позже в этом году».

Обработка входящих и исходящих данных в режиме «полного дуплекса»

В основе этого анонса лежит фундаментальный сдвиг в том, как ИИ воспринимает время и присутствие. Современные передовые модели обычно воспринимают реальность в рамках единого потока: они ждут, пока пользователь завершит ввод, прежде чем начать обработку, а их восприятие «замораживается» на время генерации ответа.

В своей статье исследователи Thinking Machines охарактеризовали текущее положение дел как ограничение, которое вынуждает людей «подстраиваться» под интерфейсы ИИ, формулируя вопросы в стиле электронной почты и объединяя свои мысли в пакеты.

Чтобы решить эту «проблему узкого горлышка в сотрудничестве», Thinking Machines отошла от стандартной чередующейся последовательности токенов.

Вместо этого используется многопоточная микрошаговая архитектура, которая обрабатывает блоки входящих и исходящих данных размером 200 миллисекунд одновременно.

Такая архитектура «полного дуплекса» позволяет модели слушать, говорить и видеть в реальном времени, давая ей возможность подавать реплики во время речи пользователя («бэкчеллинг») или вклиниваться в разговор, когда она замечает какой-либо визуальный сигнал — например, если пользователь допускает ошибку в фрагменте кода или в поле зрения камеры появляется друг. Технически модель использует раннее слияние (early fusion) без применения энкодеров.

Вместо того чтобы полагаться на массивные автономные энкодеры вроде Whisper для обработки аудио, система принимает исходные аудиосигналы в формате dMel и патчи изображений (40×40) через легковесный слой эмбеддингов, осуществляя совместное обучение всех компонентов с нуля внутри трансформера.

Двухмодельная система

В исследовательской предварительной версии представлена TML-Interaction-Small — модель типа «смесь экспертов» (Mixture-of-Experts, MoE) с 276 миллиардами параметров, из которых 12 миллиардов являются активными. Поскольку взаимодействие в реальном времени требует практически мгновенного отклика, что часто противоречит глубоким рассуждениям, компания спроектировала двухкомпонентную систему:

  1. Модель взаимодействия (The Interaction Model): постоянно обменивается данными с пользователем, управляет диалогом, присутствием и мгновенными ответными реакциями.

  2. Фоновая модель (The Background Model): асинхронный агент, который выполняет длительные рассуждения, поиск в интернете или сложные вызовы инструментов, передавая результаты потоком обратно в модель взаимодействия, чтобы они естественным образом вплетались в беседу.

Такая конфигурация позволяет ИИ выполнять такие задачи, как синхронный перевод или генерация графика в пользовательском интерфейсе, продолжая прислушиваться к отзывам пользователя — эта возможность была продемонстрирована в видеоролике анонса, где модель демонстрировала типичную для человека скорость реакции на различные сигналы и одновременно создавала столбчатую диаграмму.

Впечатляющая производительность в ключевых бенчмарках по сравнению с быстрыми моделями взаимодействия других ведущих ИИ-лабораторий

Чтобы доказать эффективность такого подхода, лаборатория использовала FD-bench — бенчмарк, специально разработанный для оценки качества взаимодействия, а не просто базового уровня интеллекта. Результаты показывают, что TML-Interaction-Small значительно превосходит существующие системы реального времени:

  • Скорость отклика: задержка при смене реплик составила 0,40 секунды по сравнению с 0,57 с у Gemini-3.1-flash-live и 1,18 с у GPT-realtime-2.0 (минимальная задержка).

  • Качество взаимодействия: в FD-bench V1.5 модель набрала 77,8 балла, почти вдвое превысив показатели основных конкурентов (минимальная конфигурация GPT-realtime-2.0 набрала 46,8 балла).

  • Визуальная проактивность: в специализированных тесках, таких как RepCount-A (подсчет физических повторений на видео) и ProactiveVideoQA, модель Thinking Machines успешно взаимодействовала с визуальным окружением, в то время как другие передовые модели оставались молчаливыми или давали неверные ответы.

Метрика

TML-Interaction-Small

GPT-realtime-2.0 (мин.)

Gemini-3.1-flash-live (мин.)

Задержка смены реплик (с)

0,40

1,18

0,57

Качество взаимодействия (среднее)

77,8

46,8

54,3

IFEval (VoiceBench)

82,1

81,7

67,6

Harmbench (% отказов)

99,0

99,5

99,0

Потенциально огромная польза для бизнеса — как только модели станут доступны

Если модели взаимодействия Thinking Machines станут доступны корпоративному сектору, это ознаменует фундаментальный сдвиг в том, как компании интегрируют ИИ в свои рабочие процессы.

Нативная модель взаимодействия, такая как TML-Interaction-Small, открывает ряд возможностей для бизнеса, которые в настоящее время невыполнимы или крайне нестабильны при использовании стандартных мультимодальных моделей:

Современный корпоративный ИИ требует завершения «хода» (turn), прежде чем он сможет проанализировать данные. В условиях производства или лаборатории нативная модель взаимодействия может отслеживать видеопоток и проактивно вмешиваться в тот момент, когда обнаруживает нарушение техники безопасности или отклонение от протокола — не дожидаясь, пока работник сам запросит обратную связь.

Успех модели в таких визуальных тестах, как RepCount-A (точный подсчет повторений) и ProactiveVideoQA (ответы на вопросы по мере появления визуальных свидетельств), говорит о том, что она может служить аудитором в реальном времени для физических задач с высокими ставками.

Главной помехой в голосовом обслуживании клиентов является задержка «обработки» в 1–2 секунды, характерная для стандартных API 2026 года. Модель Thinking Machines обеспечивает задержку смены реплик в 0,40 секунды, что примерно соответствует скорости естественного человеческого разговора.

Поскольку система изначально обрабатывает одновременную речь, корпоративный бот поддержки может выслушать жалобу клиента, подать краткие подтверждающие реплики (вроде «понимаю» или «угу»), не перебивая пользователя, и предложить синхронный перевод, который воспринимается как естественная беседа, а не как набор разрозненных записей.

Стандартные большие языковые модели (LLM) не имеют внутреннего счетчика времени; они «знают» о времени только тогда, когда оно указано в текстовом запросе. Модели взаимодействия изначально осведомлены о времени, что позволяет им управлять процессами, зависящими от времени, вроде «Напомни мне проверить температуру через 4 минуты» или «Предупреди меня, если этот процесс займет больше времени, чем предыдущий». Это критически важно для промышленного обслуживания и фармацевтических исследований, где тайминг является ключевой переменной.

Справочная информация о Thinking Machines

Этот релиз стал второй важной вехой для Thinking Machines после анонса Tinker в октябре 2025 года — управляемого API для дообучения языковых моделей, который позволяет исследователям и разработчикам контролировать свои данные и методы обучения, в то время как Thinking Machines берет на себя инфраструктурную нагрузку по распределенному обучению.

Компания заявила, что Tinker поддерживает как небольшие, так и крупные модели с открытыми весами, включая модели со смесью экспертов, а среди первых пользователей числились исследовательские группы из Принстона, Стэнфорда, Беркли и Redwood Research.

На момент запуска в начале 2025 года позиционировала себя как научно-исследовательская и продуктовая компания в сфере ИИ, стремящаяся сделать передовые системы искусственного интеллекта «более понятными, настраиваемыми и универсальными».

В июле 2025 года Thinking Machines сообщила, что привлекла около $2 млрд при оценке в $12 млрд в ходе раунда под руководством Andreessen Horowitz при участии Nvidia, Accel, ServiceNow, Cisco, AMD и Jane Street. Издание WIRED назвало это крупнейшим посевным раундом финансирования в истории.

The Wall Street Journal сообщала в августе 2025 года, что генеральный директор конкурирующей технологической компании Марк Цукерберг обращался к Мурати по поводу приобретения Thinking Machines Lab, а после ее отказа Meta переманила более десятка из примерно 50 сотрудников стартапа.

В марте и апреле 2026 года компания также привлекла внимание своими амбициями в области вычислительных мощностей: она объявила о партнерстве с Nvidia для развертывания как минимум одного гигаватта систем Vera Rubin нового поколения, а затем расширила сотрудничество с Google Cloud, задействовав инфраструктуру Google AI Hypercomputer с системами Nvidia GB300 для исследований моделей, задач обучения с подкреплением, обучения передовых моделей и платформы Tinker.

К апрелю 2026 года, как сообщал Business Insider, Meta наняла семерых ключевых сотрудников из числа основателей Thinking Machines, включая Марка Джена (Mark Jen) и Инхай Лу (Yinghai Lu), в то время как другой исследователь компании, Тяньи Чжан (Tianyi Zhang), также перешел в Meta. В том же отчете отмечалось, что Джошуа Гросс (Joshua Gross), помогавший создавать флагманский продукт Thinking Machines для дообучения Tinker, присоединился к Meta Superintelligence Labs, однако общая численность штата компании выросла примерно до 130 человек вопреки увольнениям.

Впрочем, Thinking Machines не только теряла кадры: она также наняла ветерана Meta Соумита Чинталу (Soumith Chintala), создателя PyTorch, на должность технического директора (CTO) и привлекла других звездных технических специалистов, таких как Нил Ву (Neal Wu). Издание TechCrunch в апреле 2026 года отдельно сообщало, что Вейяо Ван (Weiyao Wang), проработавший восемь лет в Meta и занимавшийся мультимодальными системами восприятия, перешел в Thinking Machines, подчеркнув, что движение кадров не было односторонним.

Ранее Thinking Machines заявляла о приверженности принципу «значительных компонентов с открытым исходным кодом» в своих релизах для поддержки исследовательского сообщества. Пока неясно, будут ли новые модели взаимодействия подпадать под ту же философию и условия выпуска.

Но одно можно сказать наверняка: сделав интерактивность нативной для самой модели, в Thinking Machines уверены, что дальнейшее масштабирование сделает ИИ не только умнее, но и более эффективным помощником.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.