Perceptron Mk1 поражает высокопроизводительной ИИ-моделью видеоанализа, которая на 80–90% дешевле, чем у Anthropic, OpenAI и Google
Искусственный интеллект, способный видеть и понимать происходящее на видео (особенно в прямом эфире), вполне закономерно является привлекательным продуктом для множества предприятий и организаций. Помимо выполнения роли охранного «сторожа» на объектах и территориях, такая модель ИИ может использоваться для нарезки самых ярких моментов из маркетинговых видеороликов и их адаптации под соцсети, выявления несоответствий и оплошностей на видео с последующей пометкой для удаления, а также для распознавания языка тела и действий участников в ходе контролируемых исследований или кандидатов при прохождении собеседований.
Хотя сегодня существуют некоторые модели ИИ, предлагающие подобный функционал, до массового распространения им еще далеко. Однако двухлетний стартап Perceptron Inc. намерен это изменить. Сегодня компания объявила о выпуске своей флагманской проприетарной модели рассуждений для видеоанализа Mk1 (сокращение от «Mark One»). Ее стоимость составляет 0,15 доллара за миллион входных токенов и 1,50 доллара за миллион выходных токенов при запросе через программный интерфейс приложения (API), что примерно на 80–90% ниже по сравнению с другими ведущими проприетарными аналогами, а именно Claude Sonnet 4.5 от Anthropic, GPT-5 от OpenAI и Gemini 3.1 Pro от Google.
Парето-диаграмма стоимости Perceptron Mk1. Источник: Perceptron
Компанию возглавляют сооснователь и генеральный директор Армен Агаджанян (ранее работавший в Meta FAIR и Microsoft). Команда потратила 16 месяцев на разработку «мультимодального рецепта» с нуля для решения сложностей физического мира.
Этот запуск знаменует собой новую эру, в которой от моделей ожидают понимания причинно-следственных связей, динамики объектов и законов физики с той же беглостью, которую они ранее применяли к грамматике.
Заинтересованные пользователи и потенциальные корпоративные клиенты могут опробовать модель самостоятельно на общедоступном демо-сайте Perceptron.
Производительность на пространственных и видеобенчмарках
Производительность модели подкреплена набором стандартных для индустрии бенчмарков, ориентированных на обоснованное понимание.
Сравнительная таблица бенчмарков Perceptron Mk1. Источник: Perceptron
В тестах на пространственные рассуждения (бенчмарки ER) модель Mk1 набрала 85,1 балла в EmbSpatialBench, обогнав Robotics-ER 1.5 от Google (78,4) и Q3.5-27B от Alibaba (около 84,5).
В специализированном тесте RefSpatialBench результат Mk1, составляющий 72,4 балла, представляет собой колоссальный скачок по сравнению с конкурентами, такими как GPT-5m (9,0) и Sonnet 4.5 (2,2), что подчеркивает значительное преимущество в понимании ссылочных выражений (referring expression comprehension).
Сравнительная диаграмма видеобенчмарков Perceptron Mk1. Источник: Perceptron
Видеобенчмарки демонстрируют аналогичное превосходство: в «сложном подмножестве» бенчмарка EgoSchema, где вывода по первому и последнему кадрам недостаточно, Mk1 набрала 41,4 балла, сравнявшись с Q3.5-27B от Alibaba и существенно опередив Gemini 3.1 Flash-Lite (25,0).
В VSI-Bench модель Mk1 достигла 88,5 балла — это самый высокий показатель среди сравниваемых моделей, что дополнительно подтверждает ее способность справляться с реальными задачами темпоральных рассуждений.
Рыночное позиционирование и граница эффективности
Perceptron целенаправленно ориентируется на «границу эффективности» (Efficiency Frontier) — метрику, которая соотносит средние баллы в бенчмарках видео- и воплощенных рассуждений со смешанной стоимостью за миллион токенов.
Данные бенчмаркинга показывают, что Mk1 занимает уникальное положение: она соответствует или превосходит производительность «флагманских» моделей, таких как GPT-5 и Gemini 3.1 Pro, сохраняя при этом ценовой профиль, более близкий к версиям «Lite» или «Flash».
В частности, стоимость Perceptron Mk1 составляет 0,15 доллара за миллион входных токенов и 1,50 доллара за миллион выходных токенов. Для сравнения, график «границы эффективности» показывает значительно более высокую смешанную стоимость GPT-5 (около 2,00 долларов) и Gemini 3.1 Pro (около 3,00 долларов), в то время как Mk1 находится на отметке смешанной стоимости в 0,30 доллара при более высоких баллах рассуждения.
Эта агрессивная ценовая стратегия призвана сделать высококлассный физический ИИ доступным для крупномасштабного промышленного применения, а не только для экспериментальных исследований.
Архитектура и временная непрерывность
Техническим ядром Perceptron Mk1 является способность обрабатывать нативное видео со скоростью до 2 кадров в секунду (FPS) в рамках значительного окна контекста на 32 тыс. токенов.
В отличие от традиционных моделей «зрение-язык» (VLM), которые часто рассматривают видео как разрозненную последовательность статичных изображений, Mk1 разработана с учетом временной непрерывности.
Эта архитектура позволяет модели «просматривать» протяженные потоки и сохранять идентичность объектов даже в условиях их перекрытия (окклюзии), что является критически важным требованием для робототехники и систем видеонаблюдения.
Разработчики могут запрашивать у модели определенные моменты в длинном потоке и получать в ответ структурированные тайм-коды, что оптимизирует процесс нарезки видео и обнаружения событий.
Рассуждения с учетом законов физики
Главным отличительным признаком Mk1 является ее способность к «физическим рассуждениям». Perceptron определяет это как высокую точность пространственного восприятия, которая позволяет модели понимать динамику объектов и физические взаимодействия в реальных условиях.
Например, модель может проанализировать сцену, чтобы определить, был ли бросок мяча в баскетболе совершен до или после сирены, за счет совместного анализа положения мяча в воздухе и показаний на табло.
Для этого требуется нечто большее, чем просто распознавание образов; требуется понимание того, как объекты движутся в пространстве и времени.
Модель способна осуществлять «попиксельно точное» указание и подсчет сотен объектов в плотных, сложных сценах. Она также может считывать аналоговые датчики и часы, интерпретировать которые с высокой надежностью цифровым системам зрения раньше было сложно.
Кроме того, она обладает солидным запасом общих и исторических знаний. В ходе моего краткого тестирования я загрузил старинный общедоступный фильм о строительстве небоскребов в Нью-Йорке 1906 года из Библиотеки Конгресса США, и Mk1 не только смогла правильно описать содержимое кадров (включая такие необычные детали, как рабочие, подвешенные на веревках), но и сделала это быстро, а также безошибочно определила примерную дату (начало 1900-х годов) исключительно по внешнему виду видеоряда.
Скриншот демо-теста Perceptron Mk1 от VentureBeat
Платформа для разработчиков физического ИИ
Релизу модели сопутствует расширенная платформа для разработчиков, созданная для превращения этих возможностей восприятия высокого уровня в функциональные приложения при минимальном написании кода.
SDK Perceptron, доступный на Python, представляет несколько специализированных функций, таких как «Фокус» («Focus»), «Подсчет» («Counting») и «Контекстное обучение» («In-Context Learning»).
Функция Focus позволяет пользователям автоматически приближать и кадрировать определенные области кадра на основе запроса на естественном языке, например для обнаружения и локализации средств индивидуальной защиты (СИЗ) на строительной площадке. Функция Counting оптимизирована для плотных сцен — например, для поиска и указания каждого щенка в группе или отдельных единиц продукции.
Кроме того, платформа поддерживает контекстное обучение, позволяя разработчикам адаптировать Mk1 под конкретные задачи, предоставляя всего несколько примеров: например, показав изображение яблока и дав модели указание пометить каждый экземпляр Категории 1 в новой сцене.
Стратегии лицензирования и серия Isaac
Perceptron использует двухпутевую стратегию в отношении весов своих моделей и лицензирования. Флагманский Perceptron Mk1 представляет собой модель с закрытым исходным кодом, доступ к которой осуществляется через API; она разработана для обеспечения производительности и безопасности корпоративного уровня.
Тем не менее компания также развивает свою серию «Isaac», стартовавшую с выпуска Isaac 0.1 в сентябре 2025 года в качестве альтернативы с открытыми весами. Выпущенная в декабре 2025 года модель Isaac 0.2-2b-preview представляет собой модель «зрение-язык» с 2 миллиардами параметров и возможностями рассуждения, доступную для периферийных развертываний с низким временем отклика.
В то время как веса моделей Isaac открыты в популярном сообществе разработчиков ИИ-кода Hugging Face, Perceptron предлагает коммерческие лицензии для компаний, которым требуется максимальный контроль или развертывание весов на собственной инфраструктуре (on-premise).
Такой подход позволяет компании поддерживать как сообщество открытого кода, так и специализированных промышленных партнеров, нуждающихся в проприетарной гибкости. В документации отмечается, что модели Isaac 0.2 специально оптимизированы для достижения времени до первого токена менее 200 мс, что делает их идеальными для периферийных устройств реального времени.
Предыстория основания и специализация Perceptron
Perceptron AI — это стартап в области физического ИИ из Бельвью (штат Вашингтон), основанный Агаджаняном и Акшатом Шриваставой (Akshat Shrivastava), бывшими научными сотрудниками исследовательской лаборатории Facebook AI Research (FAIR) компании Meta.
В публичных материалах компании датой ее основания указан ноябрь 2024 года, в то время как в регистрационных данных корпоративного реестра штата Вашингтон для Perceptron.ai Inc. фигурирует более ранняя зарубежная регистрационная заявка от 9 октября 2024 года, где Шривастава и Агаджанян указаны в качестве руководителей.
В публикациях основателей, вышедших в конце 2024 года, Агаджанян сообщил, что покинул Meta почти после шести лет работы и «объединил усилия» со Шриваставой для создания ИИ для физического мира, в то время как Шривастава отметил, что компания выросла из его работы над эффективностью, мультимодальностью и новыми архитектурами моделей.
Основание компании, судя по всему, стало прямым продолжением работы пары над мультимодальными базовыми моделями в Meta. В мае 2024 года исследователи из Meta опубликовали работу о Chameleon — семействе моделей раннего слияния (early-fusion), предназначенных для понимания и генерации смешанных последовательностей текста и изображений. Позже Perceptron охарактеризовала эту разработку как часть родословной своих собственных моделей.
В последовавшей в июле 2024 года научной работе MoMa изучалось более эффективное обучение раннему слиянию для смешанно-модальных моделей, причем Шривастава и Агаджанян были указаны среди авторов. Заявленный тезис Perceptron распространяет это исследовательское направление на «физический ИИ»: модели, способные обрабатывать видеоматериалы из реального мира и другие сенсорные потоки для таких сценариев использования, как робототехника, производство, геопространственный анализ, безопасность и модерация контента.
Партнерские экосистемы и перспективы на будущее
Реальное влияние модели Mk1 уже демонстрируется через партнерскую сеть Perceptron. Ранние последователи используют модель для самых разных задач, например для автоматической нарезки хайлайтов из спортивных трансляций в реальном времени, что задействует темпоральное понимание модели для выявления ключевых моментов без участия человека.
В секторе робототехники партнеры отбирают эпизоды телеуправления в обучающие данные, фактически автоматизируя процесс разметки и очистки данных для роботов-манипуляторов и мобильных платформ.
Среди других сценариев использования — мультимодальные агенты контроля качества на производственных линиях, способные обнаруживать дефекты и проверять этапы сборки в режиме реального времени, а также носимые ассистенты на базе умных очков, оказывающие пользователям контекстно-зависимую помощь.
Агаджанян заявил, что эти релизы являются кульминацией исследований, призванных обеспечить наилучшую работу ИИ в физическом мире, приближая нас к будущему, в котором «физический ИИ» станет столь же повсеместным, сколь и цифровой.



