Технология EPICACHE от Apple сокращает объем памяти для ИИ в 6 раз
Исследователи компании Apple разработали революционную структуру, которая значительно сокращает требования к памяти для систем искусственного интеллекта, задействованных в долгих диалогах. Это достижение способно существенно снизить затраты на корпоративное внедрение чат-ботов и виртуальных помощников.
В исследовании, опубликованном на этой неделе, представлена система под названием EPICACHE. Она позволяет большим языковым моделям сохранять контекст на протяжении длительных бесед, используя при этом в шесть раз меньше памяти по сравнению с существующими подходами. Эта методика может оказаться крайне важной, поскольку компании все чаще внедряют системы ИИ для обслуживания клиентов, технической поддержки и других задач, требующих непрерывного диалога.
«Недавние достижения в области больших языковых моделей (LLM) увеличили длину контекста, позволяя ассистентам удерживать длинные истории для формирования связных, персонализированных ответов, — пишут исследователи в своей научной работе. — Однако эта способность зависит от кэширования ключей и значений (KV-caching), объем памяти которого растет линейно с увеличением длины диалога и быстро становится доминирующим фактором в условиях жестких ресурсных ограничений».
Проблема нехватки памяти стала серьезным препятствием для внедрения ИИ. В ходе многодневных бесед между пользователями и ИИ-помощниками исследователи обнаружили, что использование памяти может превышать 7 ГБ всего после 30 сеансов для относительно небольшой модели — что превосходит размер параметров самой модели.
Как системы ИИ учатся запоминать разговоры подобно людям
Решение команды Apple заключается в разбивке долгих бесед на связные «эпизоды» по теме с последующим выборочным извлечением релевантных фрагментов при ответе на новые запросы. По их словам, этот подход имитирует то, как люди способны вспоминать конкретные части долгого разговора.
«EPICACHE ограничивает рост кэша посредством блочного предварительного заполнения (prefill) и сохраняет контекст, имеющий отношение к теме, с помощью эпизодического сжатия KV-кэша, которое объединяет историю беседы в когерентные эпизоды и применяет кэш-эвикцию для KV, специфичную для каждого эпизода», — пояснили исследователи.
Тестирование на трех различных бенчмарках диалогового ИИ продемонстрировало впечатляющие улучшения. «На трех бенчмарках LongConvQA система EPICACHE повышает точность до 40% по сравнению с недавними базовыми показателями, поддерживает практически полную точность KV при сжатии в 4–6 раз, а также снижает задержку и потребление памяти до 2,4 и 3,5 раз соответственно», — отмечается в исследовании.
Почему этот прорыв в области памяти может сэкономить компаниям миллионы на затратах на ИИ
Исследование решает важнейшую проблему для организаций, развертывающих диалоговый ИИ в больших масштабах. Существующие системы сталкиваются с фундаментальным компромиссом: они могут либо сохранять обширную историю бесед для лучшего контекста, но потреблять огромное количество памяти, либо ограничивать использование памяти, но терять важную контекстную информацию.
«KV-кэш сохраняет состояния ключей и значений каждого токена для повторного использования при авторегрессивной генерации, но его размер растет линейно с длиной контекста, создавая серьезные проблемы в затянувшихся диалогах», — отмечается в документе.
Новая структура может оказаться особенно ценной для корпоративных приложений, где важна экономическая эффективность. Снижая как использование памяти, так и задержки вычислений, EPICACHE может сделать развертывание сложных ИИ-ассистентов для обслуживания клиентов, техподдержки и внутренних бизнес-процессов более экономически выгодным.
Технологическая инновация, делающая управление памятью ИИ возможным без дополнительного обучения
Исследовательская группа под руководством Минсу Кима из Университета Ханьян в сотрудничестве с Apple разработала несколько ключевых инноваций. Их система использует семантическую кластеризацию для определения тем разговора и применяет так называемое «адаптивное послойное распределение бюджета» для более эффективного распределения ресурсов памяти между различными частями модели ИИ.
Кроме того, эта структура является «не требующей обучения» (training-free), что означает возможность ее применения к существующим моделям ИИ без необходимости их дообучения — значительное преимущество для практического развертывания.
В ходе тестирования исследователи выяснили, что их подход стабильно превосходит существующие методы управления памятью при различных размерах моделей и типах диалогов. Система сохраняла высокую точность даже при сжатии истории бесед в четыре-шесть раз.
Гонка за практичными решениями в сфере ИИ накаляется
Это исследование отражает неизменный фокус Apple на решении практических проблем, которые мешают ИИ полностью реализовать свой потенциал в бизнес-среде. В то время как конкуренты соревнуются в создании все более мощных моделей, подход Apple направлен на повышение эффективности и удобства развертывания существующих систем ИИ.
Эта работа также сигнализирует о более широком сдвиге в исследованиях ИИ от погони за чистой производительностью к практической оптимизации. По мере того как первоначальный ажиотаж вокруг больших языковых моделей спадает, компании обнаруживают, что проблемы развертывания — использование памяти, вычислительные затраты и надежность — зачастую важнее, чем сырые возможности.
Для лиц, принимающих решения в бизнесе, данное исследование намекает на то, что следующий этап конкурентного преимущества в сфере ИИ может прийти не от обладания самыми крупными моделями, а от наличия самых эффективных. В мире, где каждый разговор с ИИ-помощником стоит денег, эффективное запоминание может оказаться ценнее, чем способность помнить всё остальное.



