Apple AFM 3 преодолевает ограничения памяти для локального ИИ

Apple AFM 3 преодолевает ограничения памяти для локального ИИ

Источник: VentureBeat · Sean Michael Kerner

Локальные модели ИИ до сих пор оставались небольшими, поскольку весь набор весов должен размещаться в оперативной памяти (DRAM), что ограничивает практическое количество параметров значениями, значительно меньшими тех, что используются в серверных развертываниях. Корпоративным архитекторам, оценивающим агентские рабочие нагрузки, приходилось выбирать между мощными облачными моделями и ограниченными локальными. Базовые модели Apple третьего поколения, представленные на WWDC26, преодолевают это ограничение, полностью перенося набор весов из оперативной памяти.

Семейство AFM 3 было разработано в сотрудничестве с Google и охватывает пять моделей: две локальные и три серверные, и все они работают в рамках защищенного периметра Private Cloud Compute от Apple. Серверные модели, в том числе AFM 3 Cloud Pro для использования агентских инструментов и сложных рассуждений, работают на графических процессорах Nvidia в Google Cloud. Локальная архитектура является собственной разработкой Apple. AFM 3 Core Advanced — это модель с 20 миллиардами параметров, которая хранит веса в флеш-памяти NAND, а не в DRAM.

«Вместо того чтобы принудительно помещать всю модель в DRAM, полная модель хранится во флеш-памяти, — писала исследовательская группа Apple. — Поскольку пропускная способность канала связи между NAND и DRAM слишком мала для подгрузки весов токен за токеном, как того требуют стандартные модели типа «мозговой штурм экспертов» (MoE), AFM 3 Core Advanced принимает решения о маршрутизации для каждого запроса».

Как эта архитектура работает на практике

Памятная стена, которую обходит Apple, — это проблема, с которой сталкивается каждый разработчик локального ИИ.

«Вы не можете разместить 20 миллиардов параметров в оперативной памяти с какой-либо приемлемой точностью», — написал в X Авни Ханнун (Awni Hannun), исследователь из Anthropic и бывший научный сотрудник Apple. — Чтобы заставить это работать, по сегодняшним меркам они используют весьма экзотическую архитектуру. Небольшая модель на основе запроса (промпта) предсказывает, каких экспертов нужно загрузить из NAND в оперативную память».

Этот механизм прогнозирования и загрузки состоит из трех отдельных компонентов, каждый из которых обусловлен аппаратными ограничениями потребительских процессоров.

Весь набор из 20 миллиардов весов хранится во флеш-памяти, а не в DRAM. AFM 3 Core Advanced хранит весь свой набор параметров во флеш-памяти NAND, а не в активной памяти. Стандартные локальные развертывания требуют, чтобы вся модель помещалась в DRAM, что и ограничивает количество ее параметров. Подход Apple, который компания называет прунингом с учетом следования инструкциям (Instruction-Following Pruning — IFP) и который был разработан совместно с ее собственными исследователями, рассматривает флеш-память как постоянное хранилище модели, а DRAM — как рабочий буфер для тех экспертов, которые требуются для конкретного запроса.

Маршрутизация экспертов происходит один раз на запрос, а не на каждый токен. В обычной модели «Смесь экспертов» (Mixture of Experts) маршрутизатор выбирает разных экспертов для каждого генерируемого токена, что потребовало бы непрерывного перемещения весов между флеш-памятью и DRAM на скорости инференса. Пропускная способность памяти NAND-DRAM не способна это поддержать. AFM 3 Core Advanced выполняет маршрутизацию один раз во время подачи запроса, выбирает фиксированный набор экспертов, загружает его в DRAM вместе с постоянно активными общими экспертами и генерирует все токены с помощью этой же конфигурации.

«Ключевое отличие от типичной модели MoE заключается в том, что вы делаете это один раз за запрос, а затем генерируете все токены с одними и теми же экспертами», — написал Ханнун.

The AFM 3 Core Advanced model architecture

Источник: Исследования в области машинного обучения Apple, 8 июня 2026 г.

Количество активных параметров масштабируется от 1 до 4 миллиардов в зависимости от сложности задачи. Вместо запуска модели фиксированного размера для каждого запроса, AFM 3 Core Advanced настраивает количество активируемых параметров в зависимости от требований задачи: от 1 миллиарда для более простых операций до 4 миллиардов для более сложных, причем все они выбираются из пула в 20 миллиардов параметров во флеш-памяти.

Что Apple раскрыла, а что оставила в секрете

В документе об архитектуре подробно описаны конструкция памяти и механизм разреженной активации. В нем гораздо меньше информации о практических ограничениях развертывания.

Инструменты профилирования от Apple показывают время выполнения, но не метрики, определяющие жизнеспособность в продакшене. «Энергопотребление, пропускная способность памяти, тепловыделение? Этого нет в документации», — написал в X Марко Абис (Marco Abis), создающий Ziraph, профилировщик для локального ИИ на чипах Apple Silicon. — Заметный пробел, учитывая, что именно эти факторы определяют большую часть производительности на устройстве».

Абис также не нашел в документации Apple — ни в документах по Core AI, ни в документах по базовым моделям, ни в публикации по безопасности Private Cloud Compute — упоминания о том, когда локальный запрос незаметно перенаправляется в облако, и видна ли эта маршрутизация разработчику или пользователю. Для предприятий, которым необходимо документально подтверждать, где именно выполняется инференс, это прямая проблема с соблюдением требований.

В настоящее время доступна не вся информация. Apple сообщила, что полноценный технический отчет с бенчмарками выйдет позже этим летом.

Что это значит для корпоративных архитекторов

Регулируемые отрасли, оценивающие развертывание агентского ИИ, теперь должны принять конкретное архитектурное решение.

  • Предел DRAM для локальных агентов сдвинулся. Компании, оценивающие агенты, которые должны работать без обращения к облаку, теперь получили в свое распоряжение локальный вариант с 20 миллиардами параметров. Ограничение смещается с возможностей модели на аппаратное обеспечение устройства.

  • Граница между локальным устройством и облаком теперь является предметом архитектурного выбора, а не стандартом по умолчанию. Более простые запросы остаются на устройстве; сложные агентские задачи перенаправляются на AFM 3 Cloud Pro в Private Cloud Compute. Apple пока публично не уточняет, в каких случаях запрос выгружается наружу и видна ли эта маршрутизация разработчику — пробел, который усложняет принятие политик для организаций, которым нужно документировать места запуска инференса.

  • Уровень серверных агентов зависит от Google Cloud. AFM 3 Cloud Pro работает на графических процессорах Nvidia в Google Cloud. Гарантия Private Cloud Compute распространяется на конфиденциальность данных. Она не отменяет зависимость от Google Cloud для серверного инференса.

AFM 3 Core Advanced предоставляет предприятиям локальный вариант с 20 миллиардами параметров, которого не существовало до WWDC26. То, можно ли развернуть его в больших масштабах, зависит от ответов, которые Apple еще не опубликовала. Эти детали должны появиться в летнем техническом отчете.

Технологии

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.