Нет Claude Fable 5? Не проблема: Sakana достигает передовых показателей с новой мультимодельной системой автоматического синтеза Fugu

Нет Claude Fable 5? Не проблема: Sakana достигает передовых показателей с новой мультимодельной системой автоматического синтеза Fugu

Источник: VentureBeat · Carl Franzen

Прошедшей ночью ориентированный на корпоративный сектор ИИ-стартап Sakana представил Fugu — многоагентную систему оркестрации, которая обеспечивает производительность ИИ передового уровня через единый API, совместимый с OpenAI.

Разработанная для разработчиков, предприятий и государств, стремящихся к устойчивости к привязке к поставщикам и геополитическим экспортным ограничениям, система Fugu (что на японском означает «рыба-фугу») обходит традиционную монолитную структуру моделей путем динамической маршрутизации запросов к заменяемому пулу специализированных ИИ-агентов.

Генеральный директор и соучредитель Sakana Дэвид Ха (David Ha), ранее работавший в Google Brain, позиционировал Fugu как более надежный вариант для корпоративных рабочих процессов по сравнению с любым отдельным провайдером ИИ-моделей. Это произошло на фоне решения компании Anthropic от 12 июня отозвать публичный доступ к своим самым мощным моделям, Claude Mythos 5 и Claude Fable 5, в связи с предписанием правительства США об экспортном контроле. Как написал Ха в сегодняшнем посте в X:

«Fugu динамически оркестрирует лучшие модели мира для решения сложных задач. Мы доказываем, что хорошо оркестрированный пул взаимозаменяемых агентов может не уступать ограниченным передовым моделям вроде Fable и Mythos.

Но Fugu — это нечто большее, чем просто производительность. Я считаю, что модели оркестрации — это следующий рубеж, выходящий за рамки создания все более крупных моделей.

Опора на модель одной компании для национальной инфраструктуры — это огромный риск. Как показали недавние экспортные ограничения, доступ к топовым моделям может исчезнуть за одну ночь.

Коллективный интеллект — это практическая страховка от подобной концентрации власти. Fugu просто обходит ограничения поставщиков, полагаясь на полностью взаимозаменяемый пул агентов».

В Sakana AI прямо заявляют, что конкретные модели, выбираемые Fugu, и способы их координации являются проприетарными, то есть эта информация о маршрутизации намеренно скрыта от пользователя. В документации лишь в общих чертах упоминаются «разнообразный пул мощных моделей», «множество больших языковых моделей (LLM)» или «специализированные модели» без указания точного их количества.

Выступая в роли сложного координатора, а не автономной базовой модели, Fugu соответствует качеству вывода моделей высшего уровня (таких как Fable и Mythos) на сторонних бенчмарках агентных задач, одновременно коренным образом меняя подход разработчиков к развертыванию критически важной инфраструктуры ИИ.

Как работает Sakana Fugu и в чем она превосходит Claude Fable 5 от Anthropic

По своей сути Sakana Fugu работает как главный генеральный подрядчик. При поступлении сложного запроса Fugu не пытается выполнить каждый шаг самостоятельно.

Вместо этого она разбивает проблему на части, делегирует подзадачи пулу экспертных базовых моделей, проверяет их работу и синтезирует окончательный результат.

Sakana Fugu functional diagram

Функциональная схема Sakana Fugu. Иллюстрация: Sakana AI

«Fugu сама по себе является большой языковой моделью (LLM), обученной вызывать различные LLM в пуле агентов, включая рекурсивные вызовы собственных экземпляров», — отметили в своем техническом релизе специалисты Sakana AI.

Основанная на двух исследовательских работах Sakana 2026 года — TRINITY и Conductor, — система автономно управляет всем жизненным циклом выбора моделей и их верификации с помощью изученных стратегий координации, а не заранее созданных вручную рабочих процессов. Для конечного пользователя этот рой многоагентных систем полностью абстрагирован за стандартной конечной точкой API.

Sakana AI предлагает два варианта системы для различных рабочих нагрузок:

  • Fugu: Высокоскоростная модель с низким временем отклика (латентностью), оптимизированная для повседневных задач. Она разработана как стандартный движок для интерактивных чат-ботов и напрямую интегрируется в такие среды программирования, как Codex.

  • Fugu Ultra: Флагманский уровень, созданный для сложных, критически важных задач, таких как исследования в области ИИ, анализ кибербезопасности и многоэтапные патентные расследования. По заявлению Sakana, Fugu Ultra координирует более глубокий пул экспертов и не уступает ведущим в отрасли монолитным моделям в строгих научных и логических бенчмарках.

Кроме того, в тарифном плане с оплатой по факту использования (pay-as-you-go) стандартная Fugu взимает динамическую плату в зависимости от конкретных задействованных базовых моделей, в то время как Fugu Ultra использует фиксированную структуру ценообразования: от 5 долларов за миллион входных токенов и 30 долларов за миллион выходных токенов.

Как показывают сравнительные таблицы бенчмарков, опубликованные Sakana, Fugu фактически превосходит производительность Claude Fable 5 от Anthropic на LiveCodeBench — открытом бенчмарке для оценки навыков программирования на регулярно обновляемых задачах по разработке ПО (Fugu Ultra: 93.2, Fugu: 92.9, Fable: 89.8), а также обходит предыдущую модель Claude Mythos Preview в тесте GPQA-D (Diamond), включающем 198 вопросов с выбором одного варианта ответа университетского уровня по биологии, физике и химии (Fugu Ultra: 95.5, Fugu: 95.5, Mythos Preview: 94.6).

Fugu benchmark comparison chart

Сравнительная диаграмма бенчмарков производительности Sakana Fugu с другими ведущими передовыми моделями. Иллюстрация: Sakana AI

Оркестрируя несколько моделей от разных провайдеров, Fugu по сути закладывает встроенную избыточность в стек ИИ. Если у одного из провайдеров происходит сбой или вводятся внезапные регуляторные ограничения, Fugu перенаправляет запросы в обход неполадок для поддержания бесперебойной работы.

Лицензирование и доступность

Fugu предлагается в качестве коммерческого проприетарного API-сервиса, а не как проект с открытым исходным кодом.

Поскольку ключевая интеллектуальная собственность Sakana заключается в неочевидных паттернах совместной работы, точная информация о маршрутизации — то есть какие именно базовые модели Fugu выбирает для конкретного запроса — является проприетарной и намеренно скрыта от пользователя.

Тем не менее, Sakana предлагает критически важные средства контроля для обеспечения соответствия корпоративным требованиям к данным. Разработчики могут явно исключать определенные модели или провайдеров из своего пула маршрутизации Fugu для поддержания строгих стандартов конфиденциальности компании.

Кроме того, пользователи могут отказаться от использования их промтов для обучения будущих моделей. Географически Fugu запрещено использовать на территории Европейского Союза (ЕС) и Европейской экономической зоны (ЕEE), пока Sakana работает над приведением своей архитектуры маршрутизации черного ящика в соответствие с требованиями GDPR.

Довольно высокие цены

Fugu доступна сразу в большинстве регионов (за временным исключением ЕС и ЕЭЗ) по подписке и тарифным планам с оплатой по факту использования.

Команды могут выбрать ежемесячные тарифы с лимитами, разработанные для индивидуального или практического использования: тариф Standard стоимостью 20 долл./месяц для легких рабочих процессов, тариф Pro стоимостью 100 долл./месяц, предоставляющий десятикратный объем стандартного использования, и тариф Max стоимостью 200 долл./месяц, предлагающий двадцатикратный объем для непрерывных долгосрочных задач. Мне не удалось найти точное количество токенов, включенных в эти планы, но я обратился к Ха в X за дополнительной информацией.

В рамках первоначального запуска Sakana предлагает второй месяц в подарок тем пользователям, которые оформят подписку на любой тариф до 31 июля 2026 года.

Для масштабирования на уровне предприятий и развертывания в продакшене Sakana предлагает гибкий тариф с оплатой по мере использования. Что крайне важно для ответственных сред, запросы, сделанные по этой модели потребления, обслуживаются с более высоким приоритетом, чем запросы по ежемесячным планам подписки.

В рамках этой схемы стандартный движок Fugu взимает единую плату по максимальному тарифу среди базовых моделей, задействованных в запросе, без какого-либо суммирования многоагентных комиссий. Флагманский уровень Fugu Ultra (fugu-ultra-20260615) использует фиксированную структуру ценообразования за один миллион токенов: 5 долларов за ввод, 30 долларов за вывод и 0,50 доллара за кэшированный ввод. Эти ставки возрастают до 10, 45 и 1,00 долларов соответственно для экстремальных рабочих нагрузок с контекстным окном более 272 тыс. токенов. Это делает ее одним из наиболее дорогих вариантов по сравнению с отдельными ИИ-моделями через API провайдеров:

Модель

Ввод

Вывод

Общая стоимость

Источник

MiMo-V2.5 Flash

$0.10

$0.30

$0.40

Xiaomi MiMo

deepseek-v4-flash

$0.14

$0.28

$0.42

DeepSeek

deepseek-v4-pro

$0.435

$0.87

$1.305

DeepSeek

MiniMax-M3

$0.30

$1.20

$1.50

MiniMax

Gemini 3.1 Flash-Lite

$0.25

$1.50

$1.75

Google

Qwen3.7-Plus

$0.40

$1.60

$2.00

Alibaba Cloud

MiMo-V2.5

$0.40

$2.00

$2.40

Xiaomi MiMo

Grok 4.3 (малый контекст)

$1.25

$2.50

$3.75

xAI

MiMo-V2.5 Pro (≤256K)

$1.00

$3.00

$4.00

Xiaomi MiMo

Kimi-K2.6

$0.95

$4.00

$4.95

Moonshot

GLM-5.2

$1.40

$4.40

$5.80

Z.ai

Grok 4.3 (большой контекст)

$2.50

$5.00

$7.50

xAI

MiMo-V2.5 Pro (>256K)

$2.00

$6.00

$8.00

Xiaomi MiMo

Qwen3.7-Max

$2.50

$7.50

$10.00

Alibaba Cloud

Gemini 3.5 Flash

$1.50

$9.00

$10.50

Google

Gemini 3.1 Pro Preview (≤200K)

$2.00

$12.00

$14.00

Google

GPT-5.4

$2.50

$15.00

$17.50

OpenAI

Gemini 3.1 Pro Preview (>200K)

$4.00

$18.00

$22.00

Google

Claude Opus 4.8

$5.00

$25.00

$30.00

Anthropic

GPT-5.5

$5.00

$30.00

$35.00

OpenAI

Sakana Fugu Ultra

$5.00

$30.00

$35.00

Sakana AI

Claude Fable 5 / Claude Mythos 5

$10.00

$50.00

$60.00

Anthropic

Разработчикам, рассчитывающим операционные расходы, также следует учесть важную архитектурную особенность тарификации Fugu для многоагентных возможностей. Согласно документации для разработчиков, ответы API Fugu Ultra содержат подробные поля использования, которые отделяют генерацию токенов, видимых пользователю, от внутренней работы по оркестрации. Фоновые токены, потребляемые и генерируемые при делегировании Fugu подзадач, верификации кода или маршрутизации между базовыми агентами, не покрываются провайдером за свой счет — они представляют собой реальное потребление токенов и учитываются в конечной стоимости запроса по стандартным расценкам.

Ландшафт оркестрации: Fugu в сравнении с другими решениями и результаты тестов

Чтобы понять положение Fugu в экосистеме ИИ середины 2026 года, крайне важно различать маршрутизацию моделей и многоагентную оркестрацию.

За последний год внедрение стандартных платформ маршрутизации предприятиями (таких как Not Diamond, Martian и открытый фреймворк RouteLLM) резко возросло. Эти системы действуют как интеллектуальные диспетчеры воздушного движения: используя семантические классификаторы или метамодели, они анализируют входящий промт и прогнозируют, какая отдельная базовая модель выдаст наиболее качественный или экономичный ответ, направляя запрос соответствующим образом.

Fugu работает на принципиально иной парадигме. Вместо принятия единовременного решения о маршрутизации, Fugu ближе к сложным многораундовым системам вроде Router-R1 (фреймворка, представленного на NeurIPS 2025). Она разбивает запрос, чередует рассуждения с делегированием и динамически назначает подзадачи нескольким моделям параллельно или последовательно перед синтезом окончательного ответа.

Хотя такие фреймворки, как LangGraph, CrewAI и Microsoft AutoGen, предоставляют разработчикам инструменты для создания аналогичных многоагентных систем, они требуют огромной ручной настройки: определения ролей, настройки условных переходов и управления состоянием в долго выполняющихся циклах.

Fugu полностью абстрагирует эти операционные накладные расходы. По сути, это рабочий процесс в стиле LangGraph, упакованный в виде единой конечной точки API типа «черный ящик».

Система оркестрации в конечном счете ограничена базовыми возможностями моделей в своем пуле — реальность, которая отражена в собственных бенчмарк-тестах Sakana против автономных передовых моделей.

В сложных задачах программирования и агентных тестах коллективный интеллект демонстрирует явное преимущество перед стандартными моделями. Fugu Ultra набрала 73.7 балла на SWE-Bench Pro, значительно превзойдя Claude Opus 4.8 от Anthropic (69.2) и GPT-5.5 от OpenAI (58.6).

Тем не менее, Fugu не является панацеей, и ее производительность не безупречна по всем направлениям. При сравнении с высокоспециализированными или ограниченными в доступе монолитными моделями Fugu иногда уступает:

  • SWE-Bench Pro: Хотя Fugu Ultra (73.7) обошла большинство доступных моделей, она уверенно проиграла ограниченной в доступе модели Anthropic Fable 5 (80.0), которая в настоящее время отсутствует в пуле заменяемых моделей Fugu из-за предписания правительства США об экспортном контроле и последовавшей за этим реакции Anthropic на полное удаление модели из глобального использования.

  • Humanity’s Last Exam: Fugu Ultra (50.0) лишь немного опередила Opus 4.8 (49.8), но снова не дотянула до Fable 5 (53.3).

  • Длинный контекст и безопасность: В тесте на извлечение из длинного контекста MRCRv2 лидирует GPT-5.5 от OpenAI (94.8 против 93.6 у Fugu Ultra), а Opus 4.8 осталась лидером в бенчмарке кибербезопасности CTI-REALM (69.6 против 69.4 у Fugu Ultra).

Количественные данные указывают на однозначный вывод: Fugu крайне эффективна для повышения производительности в запутанных многоэтапных задачах (например, написание сложной HTML5-игры с нуля) за счет опоры на комбинированные сильные стороны множества моделей среднего и высокого уровня.

Однако для чистых, грубых рассуждений в рамках одного узкоограниченного домена крупнейшие автономные модели индустрии по-прежнему сохраняют преимущество — при условии, что компания может поддерживать к ним бесперебойный доступ.

Предыстория создания Sakana и ее заметные достижения на сегодняшний день

Компания Sakana AI была основана в Токио в 2023 году Ллионом Джонсом (Llion Jones), соавтором фундаментальной работы Google 2017 года «Attention Is All You Need», и Дэвидом Ха, бывшим главой исследований в Stability AI.

Разочаровавшись в бюрократии крупных технологических компаний и гиперфиксации индустрии на масштабировании единичных массивных базовых моделей, основатели построили Sakana на принципах биомимикрии и эволюционных вычислений.

Название компании, происходящее от японского слова «рыба», отражает ее ключевой технический тезис: использование коллективного «роевого» интеллекта вместо грубой вычислительной мощности. После оценки в 2,6 миллиарда долларов в рамках раунда Серии B в конце 2025 года и недавнего июньского запуска Marlin в 2026 году (автономного восьмичасового исследовательского агента для B2B-сектора), Fugu представляет собой коммерциализацию технологии многоагентной маршрутизации от Sakana для повседневных разработчиков.

Смешанная реакция в широком ИИ-сообществе в сети

Сообщество разработчиков отреагировало на Fugu строгим тестированием ее практических компромиссов, взвешивая эффективность маршрутизации против чистой мощи монолитных базовых моделей.

ИИ-обозреватель, разработчик и инфлюенсер Крис (@ChrissGPT в X) подчеркнул специфическую полезность Fugu по сравнению с сырым базовым ИИ.

«Для одного чистого промта вы, вероятно, [использовали бы Fable 5, Mythos или GPT-5.5 напрямую]», — отметил он, но возразил, что истинная ценность Fugu проявляется в запутанных многоэтапных средах. «…будь то делегирование, верификация, синтез, ревью кода, циклы исследований, анализ безопасности… тем более целесообразно использовать это», — написал он.

Крис также указал на стратегическое геополитическое преимущество архитектуры Fugu, отметив, что в случае внезапного прекращения доступа к передовому ИИ из-за регулирования или экспортных ограничений оркестратор может динамически менять модели во избежание полного сбоя системы.

Владелец креативного агентства Марк Сантос (@markksantos) из Mark Studios провел прямое практическое сравнение, поручив и Fugu Ultra, и Claude Opus 4.8 создать клон игры «Crossy Road» с использованием Three.js. Результаты подчеркнули операционные различия между оркестратором и монолитным гигантом:

  • Sakana Fugu Ultra: Завершила задачу за 22 минуты, используя ~89 000 токенов примерно за 7,32 доллара. Однако в готовой игре наблюдались небольшие логические ошибки, такие как инвертированные повороты направления и странные углы обзора камеры.

  • Claude Opus 4.8: Потратила 79 минут, сожгла ~940 000 токенов почти на 37,85 долларов и застряла в цикле повторных попыток, потребовав вмешательства человека. Несмотря на неэффективность, в конечном итоге она создала более качественный дизайн и функционал приложения.

Сантос завершил эксперимент словами: «С точки зрения функциональности, качества и дизайна приложения победил Opus. С точки зрения скорости и производительности модели победила… Fugu».

Эли Бакуш (Elie Bakouch), инженер-исследователь облачного провайдера открытой ИИ-инфраструктуры и систем Prime Intellect, отметил в X, что «если быть точным, это закрытый оркестратор поверх закрытых моделей. Если раньше вы не контролировали модели, то теперь вы даже не контролируете, какие из них используются и в каком объеме. это не „суверенитет ИИ“…»

Эти первые тесты и реакции отражают мнение, сформулированное пользователем Reddit GreedyWorking1499 в первоначальных обсуждениях платформы: «Пока не доказано обратное, это просто продвинутый роутер/обертка, а не фундаментальный скачок в интеллекте, каким был Mythos/Fable.»

И тем не менее, по мере того как компании все сильнее требуют средств защиты от зависимости от одного поставщика, Sakana доказывает, что упаковка коллективного интеллекта в единую конечную точку API является весьма жизнеспособным коммерческим путем.

Оркестрация

Смотреть все

Подпишитесь на свежие новости!

Глубокая аналитика для руководителей в области корпоративного ИИ, данных и безопасности

Подписаться по RSS

RSS-ленты обновляются каждые 15 минут.