Файлы AWS S3 интегрируют объектное хранилище

Файлы AWS S3 интегрируют объектное хранилище

Источник: VentureBeat · Sean Michael Kerner

ИИ-агенты функционируют в файловых системах, используя стандартные инструменты для навигации по каталогам и чтения путей к файлам. 

Однако сложность заключается в том, что огромные объемы корпоративных данных хранятся в системах объектного хранения, в частности в Amazon S3. Объектные хранилища предоставляют данные через вызовы API, а не через пути к файлам. Для устранения этого разрыва требовалось создавать отдельный уровень файловой системы параллельно с S3, дублировать данные и настраивать конвейеры синхронизации.

Савентный ИИ (agentic AI) еще больше усугубляет эту проблему, с которой столкнулась и сама компания Amazon. Инженерные команды в AWS, использующие такие инструменты, как Kiro и Claude Code, постоянно натыкались на одно и то же препятствие: агенты по умолчанию обращались к локальным файловым инструментам, в то время как данные находились в S3. Локальная загрузка работала до тех пор, пока контекстное окно агента не сжималось и состояние сеанса не терялось.

Ответом Amazon стал сервис S3 Files, который позволяет подключать любой бакет S3 непосредственно в локальную среду агента с помощью одной команды. Данные остаются в S3, никакой миграции не требуется. «Под капотом» AWS связывает свою технологию Elastic File System (EFS) с S3, обеспечивая полноценную семантику файловой системы, а не временный обходной путь. Сервис S3 Files уже доступен в большинстве регионов AWS.

«Сделав данные в S3 мгновенно доступными так, будто они являются частью локальной файловой системы, мы заметили колоссальное ускорение в работе таких инструментов, как Kiro и Claude Code, с этими данными», — рассказал VentureBeat Энди Уорфилд (Andy Warfield), вице-президент и выдающийся инженер AWS.

В чем разница между файловым и объектным хранилищами и почему это важно

S3 создавался для обеспечения надежности, масштабируемости и доступа на уровне объектов через API. Именно эти свойства сделали его стандартным уровнем хранения для корпоративных данных. Но они же создали фундаментальную несовместимость с файловыми инструментами, от которых зависят разработчики и агенты.

«S3 — это не файловая система, и во многих аспектах у него нет файловой семантики, — отметил Уорфилд. — Вы не можете выполнить перемещение, атомарное перемещение объекта, да и каталогов в S3 на самом деле не существует».

Предыдущие попытки преодолеть этот разрыв опирались на FUSE (Filesystems in USErspace) — программный уровень, позволяющий разработчикам монтировать пользовательскую файловую систему в пространстве пользователя без изменения базового хранилища. Такие инструменты, как собственный Mount Point от AWS, gcsfuse от Google и blobfuse2 от Microsoft, использовали драйверы на базе FUSE, чтобы представить свои объектные хранилища в виде файловых систем. 

Уорфилд подчеркнул, что проблема заключалась в том, что эти объектные хранилища все равно не становились файловыми системами. Эти драйверы либо имитировали поведение файлов, внедряя дополнительные метаданные в бакеты (что нарушало работу объектного API), либо просто не поддерживали те файловые операции, с которыми объектное хранилище не могло справиться.

S3 Files использует совершенно другую архитектуру. AWS подключает свою технологию EFS (Elastic File System) напрямую к S3, предоставляя полноценный нативный уровень файловой системы и сохраняя при этом S3 в качестве системы учета. И API файловой системы, и API объектов S3 остаются доступными одновременно для одних и тех же данных.

Как S3 Files ускоряет агентный ИИ

До появления S3 Files агенту, работающему с объектными данными, нужно было явно давать указание скачивать файлы перед использованием инструментов. Это порождало проблему состояния сеанса. По мере того как агенты сжимали свои контекстные окна, записи о том, что именно было загружено локально, часто терялись.

«Мне приходилось снова и снова напоминать агенту, что данные доступны локально», — поделился Уорфилд.

Уорфилд описал рабочий процесс до и после внедрения технологии на примере типовой задачи агента по анализу логов. Он пояснил, что если разработчик использует Kiro или Claude Code для работы с логами, то в случае только с объектами ему пришлось бы указывать агенту, где находятся файлы журналов, и отправлять его на их скачивание. Если же логи можно мгновенно смонтировать в локальной файловой системе, разработчик может просто указать конкретный путь к ним, и агент сразу же получает к ним доступ.

В конвейерах с несколькими агентами (multi-agent pipelines) сразу несколько агентов могут одновременно обращаться к одному и тому же смонтированному бакету. По данным AWS, к единой файловой системе S3 могут одновременно подключаться тысячи вычислительных ресурсов, а совокупная пропускная способность чтения достигает нескольких терабайт в секунду — показатели, которые VentureBeat не смог проверить независимым образом.

Общее состояние (shared state) между агентами поддерживается благодаря стандартным соглашениям файловой системы: подкаталогам, файлам заметок и общим каталогам проектов, которые может читать и в которые может писать любой агент в конвейере. Уорфилд рассказал, что инженерные команды AWS используют этот паттерн внутри компании: агенты записывают заметки о расследованиях и сводки задач в общие каталоги проектов.

Для команд, строящих конвейеры RAG поверх общего контента агентов, сервис S3 Vectors, запущенный на конференции AWS re:Invent в декабре 2024 года, обеспечивает поиск по сходству и генерацию с дополненным извлечением (RAG) непосредственно для этих же данных.

Что говорят аналитики: это не просто улучшенный FUSE

AWS противопоставляет S3 Files файловому доступу на базе FUSE от Azure Blob NFS и Google Cloud Storage FUSE. Для рабочих нагрузок ИИ принципиальное отличие заключается далеко не только в производительности.

«S3 Files устраняет пересылку данных между объектным и файловым хранилищами, превращая S3 в общее рабочее пространство с низкими задержками без копирования данных, — отметил Джефф Фогель (Jeff Vogel), аналитик Gartner, в интервью VentureBeat. — Файловая система становится представлением, а не еще одним набором данных».

При подходах на основе FUSE каждый агент поддерживает собственное локальное представление данных. Когда несколько агентов работают одновременно, эти представления могут расходиться.

«Это исключает целый класс возможных сбоев, включая необъяснимые ошибки обучения и инференса, вызванные устаревшими метаданными, которые традиционно крайне сложно отлаживать, — подчеркнул Фогель. — Решения на базе FUSE переносят сложность и проблемы на пользователя».

Последствия на уровне агентов идут еще дальше. Архитектурные дебаты важны меньше, чем то, какие возможности они открывают на практике.

«Для агентного ИИ, который мыслит категориями файлов, путей и локальных скриптов, это недостающее звено, — заявил Дэйв Маккарти (Dave McCarthy), аналитик IDC. — Это позволяет ИИ-агенту воспринимать бакет масштаба эксабайта как собственный локальный жесткий диск, обеспечивая уровень автономной оперативной скорости, который раньше сдерживался накладными расходами API, присущими таким подходам, как FUSE».

Помимо рабочих процессов агентов, Маккарти рассматривает S3 Files как более широкий переломный момент в том, как предприятия используют свои данные.

«Запуск S3 Files — это не просто S3 с новым интерфейсом; это устранение последней преграды между огромными озерами данных и автономным искусственным интеллектом, — добавил он. — Объединяя файловый и объектный доступ с помощью S3, они открывают дверь к большему количеству сценариев использования при меньших затратах на переработку».

Что это значит для бизнеса

Для корпоративных команд, которым приходилось поддерживать отдельную файловую систему наряду с S3 для работы файловых приложений или агентских нагрузок, такая архитектура теперь стала избыточной.

Для предприятий, консолидирующих ИИ-инфраструктуру на базе S3, практический сдвиг очевиден: S3 перестает быть просто местом назначения для результатов работы агентов и превращается в среду, где эта работа непосредственно выполняется.

«Все эти изменения API, которые вы видите со стороны команд хранения данных, продиктованы практическим опытом и реальным опытом клиентов, использующих агентов для работы с данными, — заключил Уорфилд. — Мы целиком и полностью сосредоточены на устранении любых препятствий и на том, чтобы эти взаимодействия проходили максимально эффективно».

Данные

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.