
Sakana Fugu Ultra v2, объяснение: пул стал меньше, а счёт вырос
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Fugu Ultra v2 — странного рода обновление: Sakana AI выпустила его 11 сентября 2026 года с пулом моделей, в котором больше нет Claude Fable 5, Claude Fable 5.1 или GPT-6 Astra — трёх из сильнейших систем, доступных сейчас на рынке, — и всё ещё утверждает, что превосходит все три. Новый флагман токийской лаборатории в качественном сегменте, выпущенный в тот же день, что и более дешёвый собрат под названием Fugu Max, является лучшим или делит первое место в пяти из восьми бенчмарков в собственной оценке Sakana, включая 48,3 в Chartography против 27,3 у Claude Opus 5 и 29,5 у Claude Fable 5, а также 74,3 в DeepSWE. Ни одна из этих цифр не была независимо воспроизведена, и до сих пор нет страницы Artificial Analysis ни для одной модели Fugu. Этот разрыв и есть суть: то, что вам предлагают купить, — это слой координации, весь посыл которого в том, что ему не нужны лучшие модели, чтобы выдавать лучшие ответы.
Sakana AI была основана в 2023 году Llion Jones, соавтором статьи о Transformer, и David Ha. Линейка Fugu была запущена в июне 2026 года как мультиагентная система, поставляемая в виде одной модели: вы обращаетесь к одной конечной точке, совместимой с OpenAI, а за ней обученный координатор разбирает запрос, порождает агентов и синтезирует результат. Исследования реальны и опубликованы — TRINITY (arXiv 2512.04695) развила лёгкого координатора, который назначает роли Thinker, Worker и Verifier; Conductor (arXiv 2512.04388) научился координировать агентов на естественном языке; технический отчёт Fugu находится на arXiv 2606.21228. Чего Sakana никогда не публиковала — это то, что на самом деле нужно всем: идентичность моделей в пуле и решения о маршрутизации для каждой задачи.
Что на самом деле изменилось по сравнению с июньским Fugu Ultra?
Версия 2.0 — это точечное обновление примерно через одиннадцать недель после оригинальной версии, а не новая архитектура. Сам производитель позиционирует Fugu Ultra v2 и Fugu Max как «одну и ту же базовую архитектуру оркестрации», настроенную под две разные задачи: Max снижает границу соотношения цена-производительность, а Ultra повышает пиковую производительность.fugu-ultra-v2.0, а Sakana утверждает, что переход с более ранней версии Fugu — это изменение одной строки параметра без миграции SDK — что является самым удобным для потребителя аспектом этого релиза.
Содержательные изменения — это два обрамляющих элемента. Во-первых, дата отсечки обучающих данных сдвинулась на 20260828, так что координатор был перенастроен на текущее поколение передовых моделей. Во-вторых, и это гораздо интереснее, состав пула изменился так, что Sakana решила это разрекламировать: Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra явно исключены. Аргумент Sakana состоит в том, что это доказывает, что оценки не зависят от одной проприетарной передовой модели, что важно, если вас беспокоит привязка к поставщику, отзывы API или исчезновение модели из-за экспортного контроля.
Есть следствие второго порядка, на котором Sakana не останавливается. Если пул исключает три самые сильные доступные модели, то сравнения по бенчмаркам с Fable 5 и Fable 5.1 проводятся против систем, которые оркестратор не смог бы вызвать, даже если бы захотел. Сравнение правомерно — это утверждение об архитектуре, а не о доступе — но это не тест в одинаковых условиях на то, у кого модель лучше. Это тест на то, превосходит ли координация сырую мощь. Это по-настоящему интересный вопрос. Просто это не тот вопрос, который табло подразумевает на первый взгляд.

Цифры и кто их произвёл
Каждый показатель в этом разделе основан на данных вендора. Sakana не выпустила ни стенда для оценки, ни таблицы баллов по отдельным задачам, ни методики воспроизведения, а архитектура оркестрации делает независимое воспроизведение скорее сложнее, чем проще: чтобы воспроизвести оценку, нужен доступ ко всем моделям в пуле в тех же версиях и с той же топологией, а по замыслу топология меняется для каждого запроса.
• Chartography (визуальное рассуждение по диаграммам и структурированным документам) — Fugu Ultra v2 48,3, Claude Opus 5 27,3, Claude Fable 5 29,5 — по данным вендора
• DeepSWE (разработка ПО в реальных условиях) — Fugu Ultra v2 74,3 — по данным поставщика; утверждается, что превосходит модели, которые стоят в три–пять раз больше за токен
• Лучший или совместно лучший результат — в пяти из восьми бенчмарков: GDP.pdf, Chartography, SWEFish, DeepSWE и Toolathon — по данным вендора
• Вхождение в топ-2 — семь из восьми бенчмарков — по данным вендора
• Предыдущая Fugu Ultra (июнь 2026 г., для сравнения) — LiveCodeBench 93.2, GPQA-Diamond 95.5, TerminalBench 82.1, SWE-Bench Pro 73.7 — по данным производителя
Строка Chartography заслуживает того акцента, который ей уделяют, потому что это единственная категория, где разрыв с названным текущим флагманом не является незначительным. Разрыв в 21 пункт с Claude Opus 5 на бенчмарке визуального рассуждения — это тот тип цифр, который обычно появляется в независимом лидерборде в течение нескольких дней. На момент написания этого текста ни один такой не появился. Рассматривайте эту строку как гипотезу с прикреплённой к ней суммой в долларах, а не как окончательный результат.
Цены: без изменений с июня, и откровенно дорого за вывод.
Fugu Ultra v2 стоит $5 за миллион входных токенов, $30 за миллион выходных токенов и $0,50 за миллион кэшированных входных токенов. При контексте свыше 272 000 токенов эти цены становятся $10, $45 и $1,00 соответственно. Fugu Max устроен совершенно иначе: $2 за вход, $6 за выход, $0,25 за кэширование, одинаково при любой длине контекста, плюс $0,007 за каждый веб-поиск или вызов выборки.
Две вещи в этой таблице цен стоит внимательно изучить. Первая: вывод в шесть раз превышает ввод — агрессивное соотношение, которое тарифицирует многословность модели, а оркестрация — дело многословное. Координатор, который порождает агентов и синтезирует их ответы, выдаёт много токенов, и вы платите за все из них по $30 за миллион. Заявление Sakana об эффективности касается лежащего в основе пула, а не того, сколько текста система создаёт от вашего имени, и это разные показатели. Планируйте бюджет исходя из наблюдаемого количества токенов, а не из заявленной ставки.
Второй — это ценовой обрыв на отметке 272K. Удвоение ставки за токен выше порога — законный способ ценообразования для работы с длинным контекстом, но это означает, что фактическая стоимость запуска агента с длинным контекстом — не то число, которое указано на странице с ценами. Если ваша нагрузка находится вблизи границы, арифметика существенно меняется по обе стороны от неё.
Тарифные уровни подписки Fugu — Standard за $20, Pro за $100 и Max за $200 в месяц, с лимитами 10x и 20x — все включают доступ к Fugu, Fugu Ultra и Fugu Max. Sakana также устанавливает цену для базовой модели Fugu по самому высокому уровню, присутствующему в пуле для данного запроса, и чётко заявляет, что добавление новых агентов не умножает счёт. Это реальное отличие от модели затрат на fan-out, которую вы получили бы, вызывая несколько передовых моделей самостоятельно.
Что Sakana вам не расскажет
Спросите, какие модели ответили на ваш вопрос, и FAQ отвечает прямо: "эта информация о маршрутизации не раскрывается по замыслу." Пулы Ultra и Max фиксированы, поэтому вы не можете исключить вендора; только базовая модель Fugu поддерживает отказ на уровне отдельных моделей в настройках консоли. Корпоративные клиенты могут согласовать индивидуальные конфигурации.
Эта непрозрачность — суть критики, которую линейка Fugu вызывает с июня, и это справедливая критика, а не враждебная. Когда оркестратор показывает высокий результат, комбинируя модели других лабораторий, результат принадлежит системе — это реально и оправданно можно продавать, — но он не переносится на какую-либо отдельную модель и не поддаётся аудиту. Рецензенты высказали это прямо: Fugu не превзошла флагман, а наняла его. На проверяемых задачах с дешёвым чекером, например на бенчмарке по программированию с набором тестов, комитет действительно может превзойти своего лучшего участника. На задачах без такого чекера панель, производящая выборку из нескольких передовых моделей и сообщающая лучший результат, отчасти сообщает об удаче. Собственные категории Sakana — Chartography, DeepSWE, Toolathon — тяготеют к проверяемому концу; это правильное место для такого утверждения и одновременно причина, по которой это утверждение нельзя обобщить без издержек.
Независимые тестировщики также указали на разброс задержек как на практическую цену оркестрации: на сложных задачах координатор размышляет, а на простых такое размышление — чистые накладные расходы. Сообщается, что одна задача исследователя по шейдерам заняла около тридцати минут, а качество было оценено лишь как приемлемое.

Где вы действительно можете это получить
Fugu Ultra v2 уже доступна через собственный API Sakana, совместимый с OpenAI, — направьте существующий клиент на эндпоинт с API-ключом и измените одну строку — а также через несколько сторонних платформ. OrcaRouter не предоставляет модели Fugu; если вы хотите вызывать Fugu Ultra v2, прямой путь — собственный API вендора.
Что стоит отметить — это альтернатива, с которой Sakana неявно конкурирует. Пул, благодаря которому работает Fugu Ultra v2, собирается из моделей, которые по отдельности доступны для вызова уже сегодня, а соперники, с которыми его сравнивают, — это те, что команды уже используют. Claude Opus 5, DeepSeek V4 Pro и Gemini 3.1 Pro доступны на OrcaRouter по каталожным ценам своих провайдеров с наценкой 0%, а значит, снижение цены любым из этих вендоров действует на нашей стороне в тот же день, когда о нём объявляют. Если причина, по которой вы рассматриваете оркестратор, — это устойчивость (нежелание, чтобы продакшн-путь зависел от времени безотказной работы одного вендора или от политики одного вендора), то слой маршрутизации с автоматическим переключением между провайдерами решает часть этой проблемы на уровне моделей, а Fugu Ultra v2 решает другую часть на уровне рассуждений. Один API для 200+ моделей с переключением при сбое — не замена обученному координатору, а обученный координатор — не замена независимости от одного вендора. Некоторые команды захотят и то, и другое.
Подвох с соблюдением требований
Fugu недоступен в Европейском союзе или Европейской экономической зоне. Формулировка поставщика однозначна: пока недоступен в ЕС/ЕЭЗ, пока он работает над соответствием GDPR и специфическим для ЕС нормативным требованиям, а в остальных регионах доступ может быть ограничен условиями сети или местными правилами. Если в сферу охвата вашей организации входят юридические лица в ЕС, это исключает вариант с Fugu из рассмотрения независимо от результатов бенчмарков, и это стоит знать до оценки, а не после неё.

Что посмотреть
Три вещи превратили бы Fugu Ultra v2 из интересного заявления в выбор, на который можно по-настоящему опереться. Независимая оценка — запись в Artificial Analysis, место в LMArena, что угодно с испытательным стендом за спиной — закрыла бы вопрос Chartography за неделю. Воспроизведённые третьей стороной числа на проверяемых бенчмарках по программированию подтвердили бы выигрыш на уровне системы, который предсказывает архитектура. А раскрытый пул, или хотя бы частично раскрытый, позволил бы покупателям понять, какие именно единые точки отказа они принимают, когда направляют продакшен-трафик через координатор, который не могут проверить.
До тех пор честная позиция такова. Fugu Ultra v2 — самая серьёзная на сегодняшний день попытка продавать оркестрацию как продукт, а не как исследовательский демо-проект, от лаборатории с опубликованными работами за плечами, по цене, которая делает наценку за оркестрацию явной, а не скрытой. Если ваша рабочая нагрузка рассчитана на длительный горизонт, поддаётся проверке и ограничена регионом, где Sakana может вам оказывать услуги, стоит провести ограниченный по масштабу пилот с включённым учётом токенов. Если нет, то модели, с которыми сравнивают Fugu Ultra v2, доступны в одном вызове API по прейскурантной цене, с доказательствами того, что они умеют.
Сравнение в этой статье3
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
