ИИ-модель Phi-4 от Microsoft повышает эффективность

ИИ-модель Phi-4 от Microsoft повышает эффективность

Компания Microsoft во вторник выпустила модель Phi-4-reasoning-vision-15B — компактную мультимодальную ИИ-модель с открытыми весами, которая, по заявлению компании, не уступает по производительности системам, превосходящим ее по размеру в несколько раз, или даже превосходит их, потребляя при этом лишь малую часть вычислительных ресурсов и обучающих данных. Этот релиз знаменует собой новую и самую технически амбициозную главу в годичной кампании технологического гиганта, доказывающей, что тщательно спроектированные малые модели могут конкурировать с крупнейшими ИИ-системами отрасли и превосходить их в ключевых областях.

Эта 15-миллиардная модель, доступная без промедления через Microsoft Foundry, HuggingFace и GitHub на условиях либеральной лицензии, обрабатывает как изображения, так и текст. Она способна решать сложные математические и научные задачи, интерпретировать графики и документы, ориентироваться в графических интерфейсах пользователя и справляться с повседневными визуальными задачами, такими как создание подписей к фотографиям и чтение чеков. Модель появляется в момент, когда индустрия искусственного интеллекта сталкивается с фундаментальным противоречием: самые крупные модели обеспечивают наилучшую «сырую» производительность, но их огромная стоимость, задержка и энергопотребление делают их непрактичными для многих реальных сценариев развертывания.

«Наша цель — поделиться с ИИ-сообществом практическим опытом создания более компактных и эффективных мультимодальных моделей для рассуждений, — написала команда Microsoft Research в официальном анонсе, — а также предоставить модель с открытыми весами, которая конкурентоспособна с аналогами аналогичного размера в общих зрительно-языковых задачах, отлично справляется с использованием компьютера и превосходно решает научные и математические мультимодальные задачи».

Как Microsoft обучила конкурентоспособную модель компьютерного зрения на данных, объем которых меньше в пять раз

Пожалуй, самое яркое утверждение в релизе касается того, как мало обучающих данных потребовалось модели по сравнению с конкурентами. Модель Phi-4-reasoning-vision-15B была обучена примерно на 200 миллиардах токенов мультимодальных данных на базе языкового фундамента Phi-4-Reasoning (который сам по себе обучен на 16 миллиардах токенов) и базовой модели Phi-4 (400 миллиардов уникальных токенов). Для сравнения: конкурирующие мультимодальные модели из семейства Qwen от Alibaba (2.5 VL и 3 VL), Kimi-VL от Moonshot AI, серия InternVL от SenseTime и Gemma3 от Google — каждая потребила более одного триллиона токенов в процессе обучения, то есть примерно в пять раз больше общего объема конвейера данных, использованного Microsoft.

Такое несоответствие имеет колоссальное значение для экономики. Обучение крупных ИИ-моделей обходится в миллионы долларов на облачные вычисления, а углеродный след тренировок на триллионах токенов вызывает все большее внимание как со стороны регулирующих органов, так и со стороны инвесторов. Если заявления Microsoft подтвердятся в ходе независимой оценки, эта модель станет значительным шагом вперед в эффективности обучения, способным перевернуть представления организаций о дилемме «создавать или покупать» при развертывании ИИ.

Секрет, по словам исследовательской группы, кроется не в масштабе, а в тщательном отборе данных. Итоговый набор данных команды формировался в основном из трех источников: датасетов с открытым исходным кодом, которые были «тщательно отфильтрованы и улучшены»; высококачественных внутренних данных для конкретных предметных областей; а также целевых приобретений данных. Исследователи описали процесс практического контроля качества, в ходе которого члены команды вручную просматривали образцы из каждого набора данных, обычно тратя от пяти до десяти минут на классификацию качества данных, прежде чем принять решение об использовании каждого источника. Для данных с неверными ответами они генерировали ответы заново с помощью GPT-4o и o4-mini. Когда вопросы не подлежали восстановлению, но изображения отличались высоким качеством, эти изображения перепрофилировали в качестве основы для новых данных описаний (капшенов) или визуальных вопросов-ответов. Они также сообщили об исправлении «удивительно большого количества ошибок форматирования и логики в широко используемых датасетах с открытым исходным кодом» — этот факт поднимает неудобные вопросы о качестве обучающих данных, лежащих в основе многих самых известных моделей индустрии.

Почему модель рассуждает о высшей математике, но молчит при создании подписей к изображениям

Самым технически инновационным вкладом модели может оказаться ее подход к процессу рассуждений. В мире чисто текстового ИИ «модели рассуждений» — системы, которые тратят дополнительное вычислительное время на пошаговое прорабатывание проблем — стали самой горячей категорией в этой области: здесь лидируют серия «o» от OpenAI и R1 от DeepSeek. Но перенос рассуждений на мультимодальные задачи с изображениями порождает трудность: для многих визуальных задач, таких как описание изображений или оптическое распознавание символов, пошаговые рассуждения не просто избыточны, но могут даже ухудшить производительность, внося ненужную многословность и задержки.

Решением от Microsoft стало создание модели, которую они называют «смешанной моделью рассуждений и прямых ответов» (mixed reasoning and non-reasoning model). Команда начала с Phi-4-Reasoning — уже способной языковой модели для рассуждений, — а затем обучила ее на гибридной смеси данных, где примерно 20% примеров содержали явные цепочки рассуждений (заключенные в теги ), а 80% были помечены для прямого ответа (с токеном ). Модель научилась задействовать структурированные рассуждения в таких областях, как математика и естественные науки, где это помогает, и переключаться на быстрые прямые ответы для задач, ориентированных на восприятие, где рассуждения не нужны.

Этот конструктивный выбор отражает прагматичный взгляд на рассуждения, контрастирующий с текущим энтузиазмом индустрии по поводу постоянного режима размышлений. Как пояснила исследовательская команда: «Для таких задач, как создание описаний изображений и оптическое распознавание символов (OCR), рассуждения часто избыточны и могут даже навредить, в то время как решение математических и научных задач выигрывает от многоэтапных рассуждений». Пользователи, желающие переопределить поведение модели по умолчанию, могут сделать это, явно используя в промптах токены или .

Команда изучила четыре возможных пайплайна обучения для мультимодальных рассуждений и выбрала тот, который, по их мнению, лучше всего балансирует между возможностями, эффективностью и требованиями к данным. Альтернативные подходы — одновременное обучение рассуждениям и мультимодальным возможностям на не ориентированной на рассуждения базе, предварительное освоение мультимодальных навыков с последующим добавлением рассуждений или требование цепочек рассуждений для всех обучающих данных — несли в себе серьезные недостатки. Обучение рассуждениям с нуля требует огромного объема мультимодальных данных для рассуждений. Добавление рассуждений после мультимодального обучения чревато катастрофическим забыванием. А принудительный запуск рассуждений для каждого запроса расточительно тратит вычислительные мощности на задачи, которые от этого не выигрывают.

Архитектура компьютерного зрения, благодаря которой легко читаются даже снимки экрана в высоком разрешении

«Под капотом» Phi-4-reasoning-vision-15B используется архитектура среднего слияния (mid-fusion), которая объединяет визуальный энкодер SigLIP-2 с языковым бэкэндом Phi-4-Reasoning. Выбор среднего слияния (при котором предобученный энкодер зрения преобразует изображения в токены, проецируемые в пространство встраивания языковой модели) вместо раннего слияния (early-fusion), где изображения и текст обрабатываются совместно в едином трансформере, обусловлен ресурсными ограничениями команды. Раннее слияние дает более богатые совместные представления, но требует значительно больше вычислений, памяти и данных.

Команда провела тщательные исследования на основе абляции (удаления компонентов) в отношении обработки разрешений изображений — критически важного вопроса для таких задач, как чтение плотных снимков экрана или мелких элементов интерфейса. Они протестировали четыре подхода: Dynamic S, Multi-crop, Multi-crop с S, а также динамическое разрешение с использованием варианта Naflex модели SigLIP-2 — и выяснили, что энкодеры с динамическим разрешением работают лучше всего, особенно на данных высокого разрешения. Они выбрали вариант SigLIP-2 Naflex с максимумом до 3600 токенов, что примерно соответствует родному разрешению 720p и обеспечивает особенно мощные результаты на бенчмарках, требующих детального визуального понимания, вроде ScreenSpot-Pro.

Это имеет ключевое значение для одного из главных сценариев применения модели: создания компьютерных агентов, которые управляют интерфейсами рабочего стола, веб-сайтов и мобильных устройств. Обладая высоким разрешением восприятия и возможностями точной локализации, модель может находить и определять интерактивные элементы, такие как кнопки, меню и текстовые поля, что является обязательным условием для автономных программных агентов, рассматриваемых многими в отрасли как следующий крупный рубеж внедрения ИИ. Команда отметила, что низкие требования модели к этапу инференса делают ее особенно подходящей «для интерактивных сред, где критически важны низкие задержки и компактный размер модели».

Бенчмарки демонстрируют модель, которая жертвует слепой точностью ради скорости и эффективности

Результаты бенчмарков рисуют картину системы, которая значительно превосходит свой весовой класс в плане эффективности, оставаясь при этом конкурентоспособной (хотя и не доминирующей) по «сырой» точности. По собственным оценкам команды на десяти бенчмарках, Phi-4-reasoning-vision-15B набрала 84,8 балла в AI2D (научные диаграммы), 83,3 в ChartQA, 75,2 в MathVista, 88,2 в ScreenSpot v2 (привязка элементов интерфейса) и 54,3 в MMMU (широкий тест на мультимодальное понимание).

Эти показатели в целом уступают гораздо более крупным моделям Qwen3-VL-32B (которые набрали соответственно 85,0, 84,0, 81,8, 93,9 и 70,6 балла в тех же бенчмарках), но остаются конкурентоспособными или превосходят сопоставимые по размеру системы, такие как Qwen3-VL-8B и Kimi-VL-A3B. Настоящая ценность модели, как иллюстрирует Рисунок 1 в анонсе, проявляется при сопоставлении точности с вычислительным временем и количеством выходных токенов: Phi-4-reasoning-vision-15B находится на границе Парето моделей, которые одновременно быстры и точны, выдавая конкурентоспособные результаты за малую долю времени, требуемого более крупным системам.

Команда Microsoft признала, что показатели их бенчмарков «могут быть ниже других ранее опубликованных цифр», поскольку они проводили все оценки самостоятельно, а не цитировали чужие позиции в таблицах лидеров. Они использовали температуру 0,0, жадное декодирование (greedy decoding) и ограничение максимального числа выходных токенов в 4096 без кастомных промптов и настройки параметров. Команда пообещала выпустить все логи оценок в публичный доступ — практика прозрачности, которая до сих пор остается редкой в этой сфере и должна позволить независимым исследователям проверить результаты. Тем не менее, независимое воспроизведение результатов будет иметь критическое значение: сообщество исследователей ИИ все скептичнее относится к самостоятельно заявляемым цифрам, особенно когда методологии оценки различаются у разных организаций.

Семейство Phi продолжает расширяться — от периферийных устройств до гуманоидных роботов

Модель Phi-4-reasoning-vision-15B не существует изолированно. Это последнее пополнение в семействе моделей Phi, которое быстро расширялось за последний год, превратившись из нишевого исследовательского проекта в центральный столп ИИ-стратегии Microsoft, охватывающий теперь язык, зрение, локальный инференс (на устройстве), образование и робототехнику.

Родословная прослеживается через несколько вех. В конце 2024 года Microsoft выпустила оригинальную Phi-4 — 14-миллиардную языковую модель, которая продемонстрировала силу синтетических данных и тщательного отбора. В апреле 2025 года компания запустила Phi-4 mini reasoning (3,8 миллиарда параметров), Phi-4 reasoning (14 миллиардов параметров) и Phi-4 reasoning plus. Последняя, согласно отчету TechCrunch того времени, приближалась по производительности к DeepSeek’s R1 — модели с 671 миллиардом параметров.

Семейство также расширилось в специализированные домены. Phi Silica, локальная малая языковая модель для ПК Copilot+, использовалась с точной настройкой LoRA для кастомизации генерации под конкретные задачи. В одном из кейс-стади, подробно описанных в блоге разработчиков Windows, образовательная команда Microsoft использовала LoRA-адаптеры с Phi Silica для генерации викторин Kahoot!, добившись сокращения частоты отклонений ответов на 75% и повышения субъективных оценок качества в 4,6 раза. На аппаратном фронте модель Phi-4-mini была оптимизирована для платформ NPU от MediaTek, достигнув скорости предварительного заполнения (prefill) более 800 токенов в секунду на чипе Dimensity 9400, чего достаточно для работы ИИ в реальном времени на смартфонах и планшетах.

А в рамках, пожалуй, самого амбициозного расширения на сегодняшний день компания Microsoft анонсировала Rho-alpha (ρα), названную «первой робототехнической моделью компании, производной от серии Phi от Microsoft». Согласно данным Microsoft Research, Rho-alpha переводит команды на естественном языке в управляющие сигналы для роботизированных систем, выполняющих задачи двуручного манипулирования, добавляя тактильное восприятие в стек восприятия и ориентируясь на двуручные установки и гуманоидных роботов.

Что модель Phi-4-reasoning-vision говорит о будущем корпоративного ИИ

Этот релиз кристаллизует более широкий сдвиг в центре тяжести индустрии искусственного интеллекта. Последние два года доминировал нарратив о том, что больше значит лучше: «сырой» масштаб параметров, данных и вычислительной мощности является главным драйвером возможностей. Семейство Phi от Microsoft представляет собой самого заметного корпоративного защитника контраргумента: тщательная проработка качества данных, методологии обучения и архитектурного дизайна может заменить грубую масштабируемость. Этот тезис имеет серьезные последствия для внедрения технологий в бизнесе. Организации, развертывающие ИИ в условиях жестких ограничений по задержкам или ресурсам (периферийные устройства, интерактивные приложения, локальные серверы), практически не могут запускать триллионные модели. 15-миллиардная модель, обеспечивающая от 80 до 90% точности фронтирной модели при десятой доле затрат на инференс, способна открыть сценарии развертывания, которые ранее были нерентабельными.

Выпуск модели с открытыми весами, сопровождаемый кодом для тонкой настройки и логами бенчмарков, также отражает конкурентную стратегию. Сделав модель общедоступной и детально задокументированной, Microsoft позиционирует Phi как фундамент для экосистемы прикладных приложений, многие из которых будут работать на Azure, использовать инструменты разработки Microsoft или интегрироваться с ее стеком корпоративного программного обеспечения.

Тем не менее, модель по-прежнему уступает крупнейшим конкурентам с открытыми весами в самых сложных бенчмарках, в частности в математических рассуждениях (где Qwen3-VL-32B-Thinking-40K набирает 78,2 балла на MathVerse по сравнению с 53,1 у Phi-4-reasoning-vision с принудительными рассуждениями) и общем мультимодальном понимании (баллы MMMU 72,2 против 55,0). Разделение данных на рассуждения и не-рассуждения в пропорции 20/80 является, по признанию самой команды, эвристикой, которая «может быть не оптимальна для всех доменов или контекстов развертывания». А способность модели правильно решать, когда нужно рассуждать, а когда отвечать напрямую, остается тем, что исследователи назвали «открытой проблемой».

Microsoft делает ставку на то, что в реальном мире, где бюджеты на задержки жестко ограничены, аппаратное обеспечение конечено, а затраты на развертывание растут с каждым вызовом API, самая умная модель — не самая большая, а та, которая знает, когда думать, а когда просто дать ответ. Оправдается ли эта ставка, будет зависеть не столько от таблиц бенчмарков, сколько от того, что произойдет, когда миллионы разработчиков начнут применять Phi-4-reasoning-vision на практике. Модель уже доступна на Microsoft Foundry, HuggingFace и GitHub. Таблица лидеров, как всегда, открыта.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.