ИИ-агенты создают корпоративные приложения за считанные часы
Во время недавнего трансатлантического перелета Марк Раддок (Mark Ruddock), приглашенный предприниматель-резидент в компании GALLOS Technologies, решил задействовать свою команду ИИ-агентов. Он находился на высоте 10 700 метров над Атлантикой, до важной демонстрации продукта ключевому клиенту оставалось менее 48 часов, а его программная платформа еще не была готова.
Как он рассказал в интервью VentureBeat, к тому моменту, как самолет пролетал над Исландией, его «рой Claude Code» создал более 50 компонентов React, набор фиктивных API для трех корпоративных интеграций и полноценный интерфейс администратора. То, на что у человеческой команды обычно уходит 18 человеко-дней разработки, было сжато в шестичасовой полет. Результатом стал не просто прототип, а полностью задокументированная, протестированная и защищенная структура приложения со вспомогательными конфигурациями Docker, готовыми к производству, и CI/CD-пайплайном.
«Я больше никогда не буду создавать софтверную компанию прежним способом, обещаю вам», — заявил мне Раддок в вчерашнем интервью.
Опыт Раддока, о котором он впервые написал в LinkedIn на прошлой неделе, отнюдь не единичен. Это лишь снимок масштабного скачка возможностей ИИ, произошедшего этим летом. Всего за несколько месяцев способность искусственного интеллекта выполнять сложные задачи по разработке ПО ускорилась в головокружительном, нелинейном темпе. Это улучшение нашло подтверждение в самых разных аспектах. Обусловленное рядом крупных технологических и практических прорывов, оно представляет собой фундаментальный сдвиг в том, как создается программное обеспечение — сдвиг, который уже делает прошлогодние парадигмы устаревшими.
Эпоха «вайб-кодинга» (vibe coding) — разговорной и зачастую исследовательской практики создания запросов к ИИ для написания кода, <определение которой дал Андрей Карпати) — уступила место более дисциплинированной концепции: кодингу с помощью роев агентов (agentic swarm coding).
(Конечно, вайб-кодинг, возможно, еще не умер для абсолютного большинства разработчиков, пытающихся собрать что-то на лету, но здесь мы говорим о серьезных разработчиках корпоративных приложений, которые составляют нашу целевую аудиторию.)
Лето, когда для разработчиков наступил настоящий общeискусственный интеллект (AGI)
«Даже термин Карпати «вайб-кодинг» теперь относится к прошлому. Он устарел», — заявил мне в недавней беседе Вал Беркович (Val Bercovici), директор по искусственному интеллекту компании WEKA. — «Его вытеснила концепция агентного кодинга роями, где множество скоординированных агентов выдают… очень функциональные MVP (минимально жизнеспособные продукты) и приложения первой версии». И это говорит человек, чей авторитет бесспорен: он является давним ветераном инфраструктуры, который работал техническим директором в NetApp и был одним из членов-основателей совета директоров Cloud Native Compute Foundation (CNCF), курирующего Kubernetes.
Сама идея роев не совсем нова — собственный SDK агентов от OpenAI изначально назывался Swarm, когда его только выпустили в качестве экспериментального фреймворка в прошлом году. Однако возможности этих роев достигли точки перелома именно этим летом.
Беркович, называющий себя бывшим скептиком в отношении AGI, заявил, что теперь уверовал в скорое появление сильного искусственного интеллекта, став свидетелем летних прорывов в кодинге и трансформации собственной команды. Он рассказал, как даже его самый циничный инженер по прозвищу «Князь Тьмы» был обращен в новую веру благодаря чистой эффективности и скорости работы современных агентных систем.
Для разработчиков, оттачивавших свое мастерство десятилетиями, все это кажется почти научной фантастикой. «Опытные разработчики программного обеспечения… видят, как все наше ремесло, развивавшееся 30-40 лет, кардинально меняется за пару месяцев», — отметил Беркович.
Деконструкция скачка: как работают рои агентов
Схождение сразу нескольких технологических достижений стимулирует этот внезапный рывок: новое поколение базовых моделей, зрелость агентных архитектур и стремительная эволюция навыков людей, которые ими управляют.
Судя по моим беседам с Раддоком и другими лидерами отрасли, это ускорение обусловлено тремя ключевыми столпами.
1. Более умные базовые модели: «Чистый» интеллект базовых моделей от OpenAI (GPT-5), Anthropic (серия Claude 4) и xAI (Grok 4) сделал значительный шаг вперед этим летом. В стандартном для индустрии бенчмарке SWE-bench, который тестирует способность ИИ решать реальные задачи из GitHub, новые модели, выпущенные этим летом, побили предыдущие рекорды. Например, GPT-5 от OpenAI теперь демонстрирует успешность в 74,9% в таких задачах, требующих глубокого контекста, планирования и отладки. Для сравнения: предыдущий рекорд OpenAI составлял 58,4 процента и был установлен моделью o3 в июле. Claude Opus 4.1 набрал 74,5 процента в августе по сравнению с 72,4 процента у Claude Opus в мае.
2. Сложные агентные архитектуры: Однако важнее любой отдельной модели то, как они оркестрируются. «Рой» — это архитектура, в которой задача декомпозируется и распределяется между несколькими специализированными агентами. В мартовском отчете организации METR, изучающей передовые системы ИИ, сообщалось, что «продолжительность задач, с которыми справляется ИИ, удваивается каждые 7 месяцев». Тем не менее, Амджад Масад (Amjad Masad), генеральный директор Replit, написал в среду в соцсетях, что это утверждение «крайне недооценивает» 10-кратный рост масштабируемости, который программный агент Replit продемонстрировал за тот же период благодаря оркестровке, включая многоагентную архитектуру (см. график вверху и ниже). Напомним, Replit — это то же агентное решение, которое использует Марк Раддок из GALLOS.
Возможности базовых моделей по написанию кода стремительно растут. Источник: METR
Это новое поколение агентных систем освоило несколько ключевых структурных возможностей:
-
Перепланирование: Агенты теперь могут динамически редактировать собственные списки задач, адаптируясь в случае сбоя какого-то этапа или появления более оптимального пути. Эта способность является ключевой причиной, почему такие агентные фреймворки, как Warp, достигли в этом месяце рекордных показателей SWE-bench в 75,8 процента при запуске с пользовательской настройкой оркестровки.
-
Многоагентная специализация: Вместо того чтобы один ИИ пытался делать все подряд, агентные рои распределяют роли. Агент-«планировщик» декомпозирует задачу, агенты-«кодеры» пишут код, а агент-«критик» проверяет работу. Это зеркально отражает структуру человеческой команды разработчиков и лежит в основе таких фреймворков, как Claude Flow, разработанный базирующимся в Торонто Рувеном Коэном (Reuven Cohen). Беркович описал это как систему, в которой «десятки экземпляров Claude code параллельно координируются для работы над спецификациями, документацией… полным циклом жизни CICD DevOps». Именно этот движок стоит за агентным роем, спрессовывая месяц командной работы в один час.
-
Переключение моделей: Продвинутые системы могут интеллектуально направлять подзадачи наиболее подходящей для этого модели — например, используя Claude для рассуждений высокого уровня, GPT-5 для чистого синтеза кода и Grok 4 для быстрой итерации.
-
Интеграция с реальными инструментами: Пожалуй, это самый главный фактор изменений. Агенты больше не пишут код в вакууме. Теперь они погружены в реальное окружение разработчика, используя такие необходимые инструменты, как grep для поиска по кодовой базе, pytest для запуска тестов, инструменты сборки вроде make или pip для компиляции и настройки проектов, а также git diff для управления изменениями. Это замыкает цикл между генерацией кода и его проверкой в реальных условиях.
-
Непрерывная автономная работа: Ранние агенты терялись или исчерпывали контекст при выполнении сложных задач. Как написал в среду в соцсетях основатель Y Combinator Пол Грэм (Paul Graham), ключевым тестом для ИИ является то, как долго он может «продуктивно размышлять над чем-либо». Этим летом этот временной отрезок резко увеличился. Например, Агент 3 от Replit теперь может работать автономно до 200 минут для выполнения задачи — это драматический рост по сравнению с 20-минутными сессиями его предшественника Агента 2 в феврале.
3. Появление «агентного инженера»: Финальный элемент — это человек. Самые эффективные практики не занимаются пассивным вводом промптов; они являются тем, кого Раддок называет «агентными инженерами». Они обеспечивают основу, дисциплину и строгий надзор, превращая сгенерированную ИИ «цифровую массу» (slop) в программное обеспечение корпоративного уровня.
Процесс Раддока, например, предполагает, что агенты сначала пишут подробный документ с требованиями к продукту (PRD). Затем он задействует второго агента со скептическим «типажем» (персоной) для проверки кода первого агента. Наконец, он проводит собственный аудит. «К этому нужно подходить предельно осознанно, — пояснил он. — Сейчас у меня это получается намного лучше, потому что я знаю, как спросить, о чем просить и как задать рамки для самопроверки системы».
От прототипа к продакшену: инженерия для корпоративного сегмента
Самое весомое доказательство летнего прорыва заключается в том, что результаты работы роев агентов вышли далеко за рамки прототипов, которые еще недавно считались потолком для агентного кодинга. Агенты закладывают фундамент готовых к продакшену приложений. Это опровергает распространенную критику о том, что код, сгенерированный ИИ, — это «цифровой мусор», непригодный для реального развертывания.
Раддок категоричен в этом вопросе. Приложение, созданное во время его полета, было «совместимо с Docker, Kubernetes, проходило все проверки безопасности, которых можно ожидать… и все это к моменту приземления». Это не было случайностью — это закладывалось изначально. Он начинает свои проекты с «канонического шаблона» в GitHub, который уже включает рабочие процессы для сканирования безопасности и проверки качества кода.
Именно здесь специализация агентов становится критически важной для корпоративных нужд. Раддок назначает своим агентам определенные роли для поддержания дисциплины. Например, он инструктирует одного агента действовать как «15-летний ветеран безопасности» с глубоким опытом анализа кода на уязвимости. Этому специализированному агенту поручено проверять работу основных агентов-кодеров, создавая систему сдержек и противовесов, имитирующую рецензирование старшим инженером.
Опыт Берковича подтверждает это. Он отмечает, что агентные рои теперь поставляют приложения в комплекте с «аудитами безопасности, тестированием на проникновение (red teaming), документацией по соответствию требованиям и корпоративной аутентификацией» — со всеми компонентами, которые отличают демоверсию от готового к развертыванию продукта. По его словам, рой автоматизирует весь строгий жизненный цикл CI/CD и DevOps.
Этот сдвиг грандиозен. Дискуссия перешла от того, может ли ИИ написать функцию или собрать прототип на вайбе, к тому, способна ли команда ИИ-агентов создавать, тестировать, защищать и развертывать целое приложение.
С одной огромной оговоркой.
Взгляд суровой реальности: взлеты и падения
Эта новая парадигма по-прежнему сопряжена с трудностями. Производительность роев агентов может быть нестабильной. «Бывают дни, когда появляются блестящие агенты, чьей работой я восхищаюсь и провожу аудит», — признается Раддок. «А бывают дни, когда агенты ведут себя как… полные кретины». По его словам, никогда не знаешь заранее, какого агента получишь. Чтобы обойти это, он заставляет агентов параллельно запускать несколько версий идентичного продукта одновременно, чтобы выбрать агента, показавшего наилучший результат.
Суть, однако, в том, что когнитивная нагрузка на управление этими системами огромна. «Узкое горлышко» смещается со скорости написания кода на скорость его проверки. Это утомляет людей и вызывает у них разочарование. Недавнее исследование Metr.org показало, что инструменты ИИ могут фактически замедлять работу опытных разработчиков при решении сложных задач, поскольку время, потраченное на скрупулезную проверку и отладку, сводит на нет первоначальный прирост от генерации кода.
В отличие от философии «вайб-кодинга», предполагающей работу ИИ без глубокого участия человека, опытные инженеры хотят больше контроля, а не меньше. Они все охотнее используют языковые модели (LLM), но противятся идее системы, которая строит все подряд без тесной разговорной обратной связи. Настоящая задача для агентных платформ заключается в том, чтобы обеспечить мощную автоматизацию, не лишая разработчика возможности вмешиваться, задавать вопросы и направлять процесс.
Это подчеркивает еще один важный момент: агентные рои направлены не столько на замену разработчиков, сколько на усиление самых квалифицированных из них, трансформируя их роль из кодеров, пишущих руками на клавиатуре, в высокоуровневых архитекторов и валидаторов команды инженеров на базе ИИ.
Хайп опережает реальность. Шесть месяцев назад генеральный директор Anthropic предсказывал, что ИИ будет «писать 90 процентов кода» уже к настоящему моменту — веха, до которой нам явно еще очень далеко. Хотя прогресс, несомненно, носит экспоненциальный характер, как показывают графики METR и Replit, путь к поистине автономному и надежному созданию ПО по-прежнему полон сложностей.
На недавнем мероприятии DeepMind кто-то спросил генерального директора Google DeepMind Джеффа Дина (Jeff Dean), когда мы сможем настолько доверять программному обеспечению, написанному LLM, чтобы доверить ему управление самолетом. После длинной паузы Дин, как сообщается, ответил: «А в самолете есть люди?» Его ответ, хоть и шутливый, подчеркивает сохраняющиеся проблемы с верификацией. Затем Дин добавил, что, хотя при реализации необходима осторожность, технологии развиваются с такой скоростью, что в недалеком будущем он действительно ожидает написания большей части софта с помощью языковых моделей.
Новый защитный ров (moat) для бизнеса
Чрезвычайное ускорение прошедшего летом навсегда изменило ландшафт разработки программного обеспечения. Демократизация агентных воркфлоу, ускоренная ориентированными на пользователя инструментами выполнения кода, такими как интерпретатор кода Claude, на что указал эксперт Саймон Уиллисон (Simon Willison), означает, что барьер для создания сложного развернутого ПО рушится.
Это создает новую конкурентную реальность для корпоративного сектором. Как выразился Раддок, современный «ров» (moat) для софтверной компании заключается в наличии «уникального взгляда на предметную область» и способности «действовать с невероятной скоростью». Дело уже не столько в самом программном обеспечении, которое можно создать за считанные дни, если не часы.
Для корпоративных лидеров и лиц, принимающих технические решения, лето 2025 года запомнится как момент, когда прозвучал стартовый выстрел в новой гонке по созданию приложений — гонке, в которой победят те, кто сможет наиболее эффективно оркестрировать агентный интеллект.



