Титульная hero-карточка для Fugu Ultra v2 под названием «Fugu Ultra v2» с подзаголовком «Пул стал меньше, а оценка выросла», плашки-пилюли с надписями «Chartography 48.3», «DeepSWE 74.3» и «$5 / $30 за 1 млн», строка нижнего колонтитула «Sakana AI — выпущено 11 сентября 2026», и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Sakana Fugu Ultra v2, объяснение: пул стал меньше, а счёт вырос

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Fugu Ultra v2 — странного рода обновление: Sakana AI выпустила его 11 сентября 2026 года с пулом моделей, в котором больше нет Claude Fable 5, Claude Fable 5.1 или GPT-6 Astra — трёх из сильнейших систем, доступных сейчас на рынке, — и всё ещё утверждает, что превосходит все три. Новый флагман токийской лаборатории в качественном сегменте, выпущенный в тот же день, что и более дешёвый собрат под названием Fugu Max, является лучшим или делит первое место в пяти из восьми бенчмарков в собственной оценке Sakana, включая 48,3 в Chartography против 27,3 у Claude Opus 5 и 29,5 у Claude Fable 5, а также 74,3 в DeepSWE. Ни одна из этих цифр не была независимо воспроизведена, и до сих пор нет страницы Artificial Analysis ни для одной модели Fugu. Этот разрыв и есть суть: то, что вам предлагают купить, — это слой координации, весь посыл которого в том, что ему не нужны лучшие модели, чтобы выдавать лучшие ответы.

Sakana AI была основана в 2023 году Llion Jones, соавтором статьи о Transformer, и David Ha. Линейка Fugu была запущена в июне 2026 года как мультиагентная система, поставляемая в виде одной модели: вы обращаетесь к одной конечной точке, совместимой с OpenAI, а за ней обученный координатор разбирает запрос, порождает агентов и синтезирует результат. Исследования реальны и опубликованы — TRINITY (arXiv 2512.04695) развила лёгкого координатора, который назначает роли Thinker, Worker и Verifier; Conductor (arXiv 2512.04388) научился координировать агентов на естественном языке; технический отчёт Fugu находится на arXiv 2606.21228. Чего Sakana никогда не публиковала — это то, что на самом деле нужно всем: идентичность моделей в пуле и решения о маршрутизации для каждой задачи.

Что на самом деле изменилось по сравнению с июньским Fugu Ultra?

Версия 2.0 — это точечное обновление примерно через одиннадцать недель после оригинальной версии, а не новая архитектура. Сам производитель позиционирует Fugu Ultra v2 и Fugu Max как «одну и ту же базовую архитектуру оркестрации», настроенную под две разные задачи: Max снижает границу соотношения цена-производительность, а Ultra повышает пиковую производительность.fugu-ultra-v2.0, а Sakana утверждает, что переход с более ранней версии Fugu — это изменение одной строки параметра без миграции SDK — что является самым удобным для потребителя аспектом этого релиза.

Содержательные изменения — это два обрамляющих элемента. Во-первых, дата отсечки обучающих данных сдвинулась на 20260828, так что координатор был перенастроен на текущее поколение передовых моделей. Во-вторых, и это гораздо интереснее, состав пула изменился так, что Sakana решила это разрекламировать: Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra явно исключены. Аргумент Sakana состоит в том, что это доказывает, что оценки не зависят от одной проприетарной передовой модели, что важно, если вас беспокоит привязка к поставщику, отзывы API или исчезновение модели из-за экспортного контроля.

Есть следствие второго порядка, на котором Sakana не останавливается. Если пул исключает три самые сильные доступные модели, то сравнения по бенчмаркам с Fable 5 и Fable 5.1 проводятся против систем, которые оркестратор не смог бы вызвать, даже если бы захотел. Сравнение правомерно — это утверждение об архитектуре, а не о доступе — но это не тест в одинаковых условиях на то, у кого модель лучше. Это тест на то, превосходит ли координация сырую мощь. Это по-настоящему интересный вопрос. Просто это не тот вопрос, который табло подразумевает на первый взгляд.

A single-column scoreboard for Fugu Ultra v2 titled 'Fugu Ultra v2 - the scoreboard' listing Best or joint-best 5 of 8 benchmarks, Chartography 48.3, DeepSWE 74.3, Agent pool excludes Fable 5, Fable 5.1, GPT-6 Astra, Price $5.00 / $30.00 per 1M, and Independent evaluation none published, with a footer 'All figures vendor-reported by Sakana AI, September 2026; no independent evaluation.' and the OrcaRouter logo in the bottom-right corner.

Цифры и кто их произвёл

Каждый показатель в этом разделе основан на данных вендора. Sakana не выпустила ни стенда для оценки, ни таблицы баллов по отдельным задачам, ни методики воспроизведения, а архитектура оркестрации делает независимое воспроизведение скорее сложнее, чем проще: чтобы воспроизвести оценку, нужен доступ ко всем моделям в пуле в тех же версиях и с той же топологией, а по замыслу топология меняется для каждого запроса.

• Chartography (визуальное рассуждение по диаграммам и структурированным документам) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — по данным вендора

• DeepSWE (разработка ПО в реальных условиях) — Fugu Ultra v2 74,3 — по данным поставщика; утверждается, что превосходит модели, которые стоят в три–пять раз больше за токен

• Лучший или совместно лучший результат — в пяти из восьми бенчмарков: GDP.pdf, Chartography, SWEFish, DeepSWE и Toolathon — по данным вендора

• Вхождение в топ-2 — семь из восьми бенчмарков — по данным вендора

• Предыдущая Fugu Ultra (июнь 2026 г., для сравнения) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — по данным производителя

Строка Chartography заслуживает того акцента, который ей уделяют, потому что это единственная категория, где разрыв с названным текущим флагманом не является незначительным. Разрыв в 21 пункт с Claude Opus 5 на бенчмарке визуального рассуждения — это тот тип цифр, который обычно появляется в независимом лидерборде в течение нескольких дней. На момент написания этого текста ни один такой не появился. Рассматривайте эту строку как гипотезу с прикреплённой к ней суммой в долларах, а не как окончательный результат.

Цены: без изменений с июня, и откровенно дорого за вывод.

Fugu Ultra v2 стоит $5 за миллион входных токенов, $30 за миллион выходных токенов и $0,50 за миллион кэшированных входных токенов. При контексте свыше 272 000 токенов эти цены становятся $10, $45 и $1,00 соответственно. Fugu Max устроен совершенно иначе: $2 за вход, $6 за выход, $0,25 за кэширование, одинаково при любой длине контекста, плюс $0,007 за каждый веб-поиск или вызов выборки.

Две вещи в этой таблице цен стоит внимательно изучить. Первая: вывод в шесть раз превышает ввод — агрессивное соотношение, которое тарифицирует многословность модели, а оркестрация — дело многословное. Координатор, который порождает агентов и синтезирует их ответы, выдаёт много токенов, и вы платите за все из них по $30 за миллион. Заявление Sakana об эффективности касается лежащего в основе пула, а не того, сколько текста система создаёт от вашего имени, и это разные показатели. Планируйте бюджет исходя из наблюдаемого количества токенов, а не из заявленной ставки.

Второй — это ценовой обрыв на отметке 272K. Удвоение ставки за токен выше порога — законный способ ценообразования для работы с длинным контекстом, но это означает, что фактическая стоимость запуска агента с длинным контекстом — не то число, которое указано на странице с ценами. Если ваша нагрузка находится вблизи границы, арифметика существенно меняется по обе стороны от неё.

Тарифные уровни подписки Fugu — Standard за $20, Pro за $100 и Max за $200 в месяц, с лимитами 10x и 20x — все включают доступ к Fugu, Fugu Ultra и Fugu Max. Sakana также устанавливает цену для базовой модели Fugu по самому высокому уровню, присутствующему в пуле для данного запроса, и чётко заявляет, что добавление новых агентов не умножает счёт. Это реальное отличие от модели затрат на fan-out, которую вы получили бы, вызывая несколько передовых моделей самостоятельно.

Что Sakana вам не расскажет

Спросите, какие модели ответили на ваш вопрос, и FAQ отвечает прямо: "эта информация о маршрутизации не раскрывается по замыслу." Пулы Ultra и Max фиксированы, поэтому вы не можете исключить вендора; только базовая модель Fugu поддерживает отказ на уровне отдельных моделей в настройках консоли. Корпоративные клиенты могут согласовать индивидуальные конфигурации.

Эта непрозрачность — суть критики, которую линейка Fugu вызывает с июня, и это справедливая критика, а не враждебная. Когда оркестратор показывает высокий результат, комбинируя модели других лабораторий, результат принадлежит системе — это реально и оправданно можно продавать, — но он не переносится на какую-либо отдельную модель и не поддаётся аудиту. Рецензенты высказали это прямо: Fugu не превзошла флагман, а наняла его. На проверяемых задачах с дешёвым чекером, например на бенчмарке по программированию с набором тестов, комитет действительно может превзойти своего лучшего участника. На задачах без такого чекера панель, производящая выборку из нескольких передовых моделей и сообщающая лучший результат, отчасти сообщает об удаче. Собственные категории Sakana — Chartography, DeepSWE, Toolathon — тяготеют к проверяемому концу; это правильное место для такого утверждения и одновременно причина, по которой это утверждение нельзя обобщить без издержек.

Независимые тестировщики также указали на разброс задержек как на практическую цену оркестрации: на сложных задачах координатор размышляет, а на простых такое размышление — чистые накладные расходы. Сообщается, что одна задача исследователя по шейдерам заняла около тридцати минут, а качество было оценено лишь как приемлемое.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, the 'Start Using Sakana Fugu' and 'Contact Us' buttons, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Где вы действительно можете это получить

Fugu Ultra v2 уже доступна через собственный API Sakana, совместимый с OpenAI, — направьте существующий клиент на эндпоинт с API-ключом и измените одну строку — а также через несколько сторонних платформ. OrcaRouter не предоставляет модели Fugu; если вы хотите вызывать Fugu Ultra v2, прямой путь — собственный API вендора.

Что стоит отметить — это альтернатива, с которой Sakana неявно конкурирует. Пул, благодаря которому работает Fugu Ultra v2, собирается из моделей, которые по отдельности доступны для вызова уже сегодня, а соперники, с которыми его сравнивают, — это те, что команды уже используют. Claude Opus 5, DeepSeek V4 Pro и Gemini 3.1 Pro доступны на OrcaRouter по каталожным ценам своих провайдеров с наценкой 0%, а значит, снижение цены любым из этих вендоров действует на нашей стороне в тот же день, когда о нём объявляют. Если причина, по которой вы рассматриваете оркестратор, — это устойчивость (нежелание, чтобы продакшн-путь зависел от времени безотказной работы одного вендора или от политики одного вендора), то слой маршрутизации с автоматическим переключением между провайдерами решает часть этой проблемы на уровне моделей, а Fugu Ultra v2 решает другую часть на уровне рассуждений. Один API для 200+ моделей с переключением при сбое — не замена обученному координатору, а обученный координатор — не замена независимости от одного вендора. Некоторые команды захотят и то, и другое.

Подвох с соблюдением требований

Fugu недоступен в Европейском союзе или Европейской экономической зоне. Формулировка поставщика однозначна: пока недоступен в ЕС/ЕЭЗ, пока он работает над соответствием GDPR и специфическим для ЕС нормативным требованиям, а в остальных регионах доступ может быть ограничен условиями сети или местными правилами. Если в сферу охвата вашей организации входят юридические лица в ЕС, это исключает вариант с Fugu из рассмотрения независимо от результатов бенчмарков, и это стоит знать до оценки, а не после неё.

A screenshot of the OrcaRouter models catalogue page (captured September 11, 2026, English UI), showing the OrcaRouter navigation with Models, Leaderboard, Offers and Developers entries, the search field, and the 'Get API key' button over the browsable model catalogue.

Что посмотреть

Три вещи превратили бы Fugu Ultra v2 из интересного заявления в выбор, на который можно по-настоящему опереться. Независимая оценка — запись в Artificial Analysis, место в LMArena, что угодно с испытательным стендом за спиной — закрыла бы вопрос Chartography за неделю. Воспроизведённые третьей стороной числа на проверяемых бенчмарках по программированию подтвердили бы выигрыш на уровне системы, который предсказывает архитектура. А раскрытый пул, или хотя бы частично раскрытый, позволил бы покупателям понять, какие именно единые точки отказа они принимают, когда направляют продакшен-трафик через координатор, который не могут проверить.

До тех пор честная позиция такова. Fugu Ultra v2 — самая серьёзная на сегодняшний день попытка продавать оркестрацию как продукт, а не как исследовательский демо-проект, от лаборатории с опубликованными работами за плечами, по цене, которая делает наценку за оркестрацию явной, а не скрытой. Если ваша рабочая нагрузка рассчитана на длительный горизонт, поддаётся проверке и ограничена регионом, где Sakana может вам оказывать услуги, стоит провести ограниченный по масштабу пилот с включённым учётом токенов. Если нет, то модели, с которыми сравнивают Fugu Ultra v2, доступны в одном вызове API по прейскурантной цене, с доказательствами того, что они умеют.

Сравнение в этой статье3

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно