Perplexity заключает партнерство с Nvidia для запуска Portable Computer — полностью локального ИИ-агента с нулевой стоимостью токенов

Perplexity заключает партнерство с Nvidia для запуска Portable Computer — полностью локального ИИ-агента с нулевой стоимостью токенов

Источник: VentureBeat · Michael Nuñez

Perplexity сегодня запускает Portable Computer — версию своей агентной платформы «Computer», которая работает полностью на «железе», уже имеющемся у пользователей. Первыми в этом списке стали настольный суперкомпьютер Nvidia DGX Spark и Linux-машины, оснащенные видеокартами Nvidia RTX GPU.

Этот запуск, разработанный в тесном партнерстве с Nvidia, является одной из самых агрессивных попыток перенести серьезные рабочие нагрузки ИИ-агентов из облака на локальные устройства. Модель, файлы пользователя и сама работа — все это может оставаться на компьютере. Задачи, выполняемые локально, не расходуют кредиты на оплату, и, как заявляет компания, по умолчанию любая задача запускается на устройстве, а система запрашивает разрешение перед отправкой какого-либо отдельного шага более мощной передовой модели в облаке.

«Мы по сути перенесли точно такой же пользовательский интерфейс в полностью локальное приложение», — рассказал в понедельник на пресс-конференции Нейт (Nate), вице-президент Perplexity по разработке инфраструктуры и корпоративных решений. — «Это включает в себя всю систему агента целиком, инференс и все необходимое для локальной работы».

Для Nvidia, которая последние два года продавала миру триллионные дата-центры для ИИ, анонс знаменует собой нечто более тонкое, но стратегически важное: производитель чипов считает, что локальный ИИ перешагнул рубеж от любопытства энтузиаста к практическому инструменту, и компания хочет продавать «железо», на котором он работает.

«Локальный ИИ достиг точки перегиба», — заявил Надер (Nader), директор Nvidia по технологиям для разработчиков, специализирующийся на инструментах разработки и открытом исходном коде. — «Долгое время это были любители и энтузиасты, которые запускали квантованные модели, уменьшенные до крошечных размеров… И хотя это круто, это не очень практично. Но все изменилось с появлением множества новых моделей с открытым исходным кодом, которые оказались невероятно полезными».

Как Portable Computer упаковывает полноценный стек локального ИИ в единое приложение

Perplexity Computer, агентная платформа компании для работы со знаниями, координирует работу ИИ-моделей, файлов, инструментов и веб-доступа для выполнения многошаговых задач: просмотра папок с документами, анализа данных, подготовки отчетов и передачи результатов в бизнес-системы. Portable Computer воспроизводит этот опыт локально: локальные модели, агентный каркас (harness), движок инференса, инструменты, коннекторы приложений и защитная песочница упакованы в единую систему. В этом объединении и заключается суть. В большинстве современных стеков локального ИИ пользователям приходится собирать и запускать эти части по отдельности: скачивать веса моделей, развертывать сервер инференса, связывать инструменты и настраивать производительность.

«Исторически настройка стека локального ИИ была настоящей болью», — отметил Нейт. — «В Portable Computer мы сосредоточились на том, чтобы сделать этот опыт максимально простым, чтобы пользователи могли быстро все настроить и начать работу».

В ходе одной из демонстраций в понедельник система примерила на себя роль розничного инвестора, изучающего папку с формами 1099 и инвестиционными документами — тем самым чувствительным финансовым материалом, которым многие пользователи побоялись бы делиться с облачным сервисом. Запустив 27-миллиардную модель Qwen при полной загрузке графического процессора на DGX Spark, агент проанализировал каждый документ и указал на случаи, когда гипотетический инвестор переплачивал лишние комиссии. Элемент интерфейса, который обычно отображает текущий баланс облачных кредитов, «просто застыл на нуле», отметил Нейт, «потому что все это происходит на самом устройстве».

Вторая демонстрация показала гибридную сторону продукта. Выступая в роли основателя стартапа, Нейт попросил агента локально проанализировать CSV-файл с данными воронки пользователей, а затем отправить готовый анализ в канал Slack с помощью экосистемы коннекторов Perplexity — это доказательство того, что концепция «локальное прежде всего» не означает изоляцию.

Система также подключается к Google Drive, Gmail и GitHub и может переключаться на передовую облачную модель, когда возможности локальной исчерпываются. На момент запуска пользователи могут настроить Qwen 3.8 27B или PPLX 27B — версию, которую Perplexity дообучила на собственном фреймворке. Скоро также появится поддержка Nvidia Nemotron 3.5 Lightning.

Portable Computer становится доступен сегодня для подписчиков Pro, Max, Enterprise Pro и Enterprise Max на Linux, а поддержка Windows появится в сентябре. Любая видеокарта RTX с объемом видеопамяти не менее 24 ГБ (примерно уровня GeForce RTX 3090 или новее) соответствует этому требованию. Нейт назвал данный порог «неким минимумом, при котором мы действительно хотим обеспечить отличный пользовательский опыт, но при этом сделать продукт максимально доступным».

Почему совместное проектирование модели и агентного фреймворка превосходит универсальные решения

Параллельно с запуском Perplexity опубликовала исследовательскую работу, в которой утверждается, что для эффективной работы локальных агентов модель и агентный фреймворк (то есть каркас из промптов, инструментов и логики оркестрации вокруг модели) должны проектироваться совместно. Основной вывод таков: универсальные фреймворки рассчитаны на передовые модели, способные обрабатывать огромные контексты, ориентироваться в бесчисленных инструментах и выстраивать планы на дальнюю перспективу. Маленькие локальные модели ломаются под такими нагрузками.

В ходе экспериментов Perplexity выяснила, что хотя такие модели, как Qwen 3.8 27B, заявляют контекстные окна в 260 000 токенов, они начинают испытывать трудности при превышении отметки в 100 000 токенов. Поэтому компания создала намеренно минималистичный фреймворк: лаконичный системный промпт, небольшой набор базовых инструментов и функции, которые загружаются и выгружаются по требованию в виде «навыков», а не висят в контексте постоянно. Популярные коннекторы, такие как Gmail и GitHub, были переведены из «прожорливых» до токенов MCP-серверов в компактные инструменты командной строки, добавлены механизмы самопроверки для мониторинга работоспособности задач и обеспечена постоянная изоляция на уровне операционной системы (песочница). Если песочница недоступна, фреймворк отключается сам, вместо того чтобы запускать команды с полными правами пользователя по умолчанию — в отличие от открытых фреймворков, которые так и делают.

Результаты бенчмарков, опубликованные Perplexity, впечатляют, хотя они получены в ходе внутренних тестов компании. На собственном внутреннем бенчмарке Local Knowledge Work Bench (53 задачи, охватывающие глубокие исследования, финансовый анализ и создание документов, которые Perplexity планирует сделать открытыми) Computer, работающий на базе Qwen 3.8 27B на DGX Spark, набрал 82,6% против 77,6% у открытого фреймворка Pi и 74,0% у Hermes на той же модели.

Дообученная версия PPLX 27B от Perplexity подняла этот показатель до 85,4%. На более сложных задачах разрыв увеличивается еще сильнее: в бенчмарке веб-исследований BrowseComp система Computer показала точность 66,7% против 50,2% у Pi и 43,9% у Hermes, затратив при этом на 51% меньше времени и используя на 70% меньше токенов, чем Pi. В задаче мультимодального понимания документов Computer набрал 65,1% против 34,6% у Hermes и 13,9% у Pi.

Токеновая экономика, переносящая ИИ-агентов из облака на локальное «железо»

Стратегическая логика запуска становится понятна, если посмотреть на то, как изменились рабочие нагрузки ИИ. Чат предполагал кратковременные запросы: вопрос, ответ, готово. С агентами все иначе.

«С агентами вы хотите, чтобы они работали постоянно, если это возможно. Вы хотите, чтобы агенты потребляли как можно больше токенов», — сказал Надер. — «Мы видим ненасытный спрос на токены, и именно это делает локальный ИИ столь прекрасным. Как вы видели во всех этих демонстрациях, у вас нет лимитов по токенам. Вы не платите за токены. Так что для агентов это просто убийственное решение».

Это переосмысляет ценность локального оборудования. Агент, который работает часами, просматривая документы, проверяя собственную работу и выполняя итеративный анализ, накопил бы значительные счета за API в облаке. На устройстве, которым пользователь уже владеет, предельная стоимость этих токенов стремится к нулю. В документе Perplexity корпоративная версия этого аргумента сформулирована прямо: по мере масштабирования агентов на отдельные рабочие процессы и целые организации расходы на токены и перемещение данных «становится все труднее контролировать». Локальное выполнение решает обе проблемы сразу: затраты (поскольку инференс бесплатен) и конфиденциальность (поскольку конфиденциальные токены никогда не покидают устройство).

Пожалуй, самый коммерчески интересный результат касается гибридной промежуточной сферы. В Terminal Bench 2.1, сложном бенчмарке по написанию кода, полностью локальная модель Qwen набрала 59,6% при практически нулевых предельных затратах. Передача задачи на уровень «советника» Claude Opus 5 в облаке подняла результат до 73,0% при расчетной стоимости около $0,415 за задачу. Запуск исключительно передовой модели показал 82,4% при цене $0,65 за задачу. Иными словами, эскалация позволила вернуть примерно три пятых разрыва до уровня передовой производительности при примерно двух третях затрат — и пользователь сам решает, стоит ли этот компромисс свеч. Перед любым обращением к советнику фреймворк запускает класификатор персональных данных (PII) по исходящему контексту и показывает пользователю точный объем информации, который покинет устройство. Удаленная модель возвращает только текстовые рекомендации и никогда не обращается к локальным файлам или инструментам.

Где Portable Computer располагается относительно Ollama и стека самодельного локального ИИ

Джейсон Хинер (Jason Hiner) из The Deep View расспросил представителей компаний о том, как Portable Computer соотноситеся с существующими инструментами локального инференса, такими как Ollama. Ответ Нейта провел четкую границу: эти инструменты решают задачи на разных уровнях проблемы.

«Основная часть усилий здесь была сосредоточена на уровне агентного фреймворка», — пояснил он, отметив, что в основе системы для хостинга инференса используется vLLM, а для пользователей, желающих подключить собственный эндпоинт инференса, предусмотрен расширенный режим. — «Мы провели масштабное дообучение моделей Qwen и Nemotron, с которыми работаем, чтобы добиться наилучших результатов… Наш фокус был направлен на доработку всего стека сверху донизу: модели инференса и фреймворка в связке».

Надер выразился более живописно: «Настроить быстрый запуск инференса на Spark — путь плавный. Вы можете использовать Ollama. Вы можете все настроить. Но затем, когда вы начинаете делать более сложные, более агентные вещи, вам внезапно требуется больше производительности. Вы начинаете присматриваться к другим моделям. Вы ищете другие фреймворки, и это похоже на океан: чем глубже заплываешь, тем он глубже».

Этот подход «готового прибора» пришелся по душе по крайней мере одному из участников. Бен, рассказавший, что он столкнулся со сложностями при настройке собственного DGX Spark, несмотря на то, что является инженером («этот опыт ужасен, нам нужно это исправить»), заявил, что продукт ощущается как долгожданный ключ, «который нужен людям, чтобы по-настоящему прочувствовать и понять, что значит «агентный», а для этого нужен правильный UX». В Nvidia также подчеркнули масштабируемость оборудования: объединение двух Spark через общую память позволяет запускать передовые открытые модели, такие как новейшая от DeepSeek, а четыре таких устройства справятся с GLM 5.2 или Nemotron Ultra. «Я даже видел конфигурации из восьми соединенных Spark», — поделился Надер.

Что углубление альянса Nvidia и Perplexity означает для обеих компаний

Запуск расширяет партнерство, которое строилось больше года. В июне 2025 года Nvidia и Perplexity объявили о сотрудничестве с целью предоставления суверенных ИИ-моделей европейским издателям и телекоммуникационным компаниям. Это часть поездки генерального директора Дженсена Хуанга (Jensen Huang) по странам Европы с целью убедить правительства в том, что, как сообщило агентство Associated Press с конференции VivaTech в Париже, «<а href=»https://apnews.com/article/nvidia-france-artificial-intelligence-1a6b50633db24c22b584597142a564ac»>каждой стране необходима национальная инфраструктура интеллекта». Идея суверенного ИИ — концепция, согласно которой данные «принадлежат вашим людям, вашей стране, вашей культуре», по словам Хуанга, — философски совпадает с аргументом, который выдвигает Portable Computer на уровне отдельного рабочего стола: интеллект под вашим контролем, работающий на вашем «железе».

Здесь есть и прагматичный расчет для обеих компаний. Perplexity, которая привлекала капитал при постоянно растущих оценках и одновременно сталкивалась с юридическим давлением со стороны издателей из-за своей практики работы с контентом (включая иск от The New York Times в декабре 2025 года и более ранний публичный конфликт с Forbes), получает продукт, экономика которого не зависит от учета каждого токена, а также получает эффективный инструмент выхода на чувствительные к конфиденциальности компании в сфере юриспруденции, здравоохранения и финансов. Nvidia получает убойное приложение для DGX Spark — устройства, которое, по признанию участников понедельничного брифинга, было легче купить, чем использовать. Когда один из репортеров спросил, может ли Spark поставляться с предустановленными Portable Computer и моделью Nemotron, Надер воздержался от прямого ответа, не исключая такой возможности: «Это было бы круто… цель состоит в том, чтобы обеспечить супергладкий опыт для каждого пользователя».

Вопросы остаются. Самые впечатляющие цифры Perplexity получены в ходе внутренних бенчмарков компании, и сама она признает, что компактные модели все еще значительно отстают от передовых систем в сложных логических задачах — эскалация к советнику «сужает, но не устраняет разрыв полностью». Запуск пока ограничивается только Linux, порог в 24 ГБ видеопамяти исключает подавляющее большинство потребительских ПК, а чипы Apple Silicon, популярные среди энтузиастов локального ИИ, заметно отсутствуют в дорожной карте. «Сейчас мы очень сосредоточены на оборудовании Nvidia», — ответил Нейт на соответствующий вопрос.

Но вектор движения очевиден. Исследователи Perplexity описывают запуск как часть «более широкого сдвига, при котором все более мощные агенты перемещаются с удаленной инфраструктуры на индивидуальные и локальные устройства», и обе компании делают ставку на то, что достижения в области чипов и открытых моделей продолжат расширять возможности настольных систем. Во время демонстраций в понедельник самой показательной деталью был вовсе не результат бенчмарка, а тот самый счетчик кредитов в углу экрана, замерзший на нуле, пока агент обрабатывал папку с налоговыми документами. В течение двух лет индустрия искусственного интеллекта измеряла свои амбиции гигаваттами и токенами на доллар. Portable Computer предлагает другой измеритель — тот, который никогда не исчерпает свой ресурс.

Инфраструктура

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут. Материалы переведены с venturebeat.com.