Титульная карточка героя для Fugu Ultra v2 против Claude Opus 5 с подзаголовком «Одинаковая цена ввода, две разные ставки», бейджи-пилюли с надписями «$5.00 за ввод у обоих», «Chartography 48.3 против 27.3» и «контекст 1M», строка в подвале «Sakana AI против Anthropic — сентябрь 2026» и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Fugu Ultra v2 против Claude Opus 5: одинаковая цена за ввод, две разные ставки

Автор

Gideon Frost

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Fugu Ultra v2 и Claude Opus 5 стоят ровно одинаково, когда нужно задать вопрос, и совершенно по-разному, когда нужно получить ответ. У обоих заявленная цена — $5.00 за миллион входных токенов. Затем Fugu Ultra v2 берёт $30.00 за миллион выходных токенов против $25.00 у Claude Opus 5 — и разрыв между этими двумя числами не является различием из-за округления, потому что обе системы выдают очень разный объём текста, чтобы прийти к ответу. Sakana AI выпустила Fugu Ultra v2 11 сентября 2026 года как систему оркестрации, которая координирует пул моделей других лабораторий за одним OpenAI-совместимым эндпоинтом; Claude Opus 5 от Anthropic, работающий с конца июля 2026 года, — это одна модель. Это различие определяет большую часть этого сравнения ещё до обращения к бенчмарку, и в собственной таблице Sakana есть неловкая строка: производитель сообщает 48.3 по Chartography против 27.3 у Claude Opus 5, а это самый большой отрыв в релизе и одновременно число, под которым меньше всего внешних доказательств.

Совпадение, которое формирует всё

Начните с того, в чём совпадают эти два продукта, потому что это больше, чем заявленная цена.

• Цена ввода — Fugu Ultra v2 $5.00 за 1 млн токенов против Claude Opus 5 $5.00 за 1 млн токенов

• Цена вывода — Fugu Ultra v2 $30.00 за 1 млн токенов против Claude Opus 5 $25.00 за 1 млн токенов

• Кэшированный ввод — Fugu Ultra v2: $0.50 за 1 млн сверх базового тарифа, в отличие от Claude Opus 5, где кэширование тарифицируется как скидка до 90% на кэшированный ввод

• Контекст — Fugu Ultra v2, 1 млн токенов, при этом тарифы удваиваются после 272 тыс. в отличие от Claude Opus 5 с 1 млн токенов и фиксированной ставкой

• Потолок вывода — Fugu Ultra v2 не опубликован как единый показатель по сравнению с Claude Opus 5 128K токенов

• Доступность — Fugu Ultra v2 не продаётся в ЕС/ЕЭЗ, тогда как Claude Opus 5 общедоступен на стандартных условиях API

• Доказательства — бенчмарки Fugu Ultra v2, заявленные производителем, независимой оценки пока нет, против бенчмарков Claude Opus 5 от производителя плюс многомесячные позиции в сторонних лидербордах

Именно в последней строке сравнение фактически переламывается. При одинаковой цене за ввод вы выбираете между системой, оценки которой приходится принимать на веру, и моделью, оценки которой воспроизвели другие. Обрыв на 272K усугубляет ситуацию: после этого порога тариф Fugu Ultra v2 за ввод удваивается до $10, а за вывод — до $45, тогда как тариф Claude Opus 5 не меняется. Для запусков агентов с длинным контекстом — именно той рабочей нагрузки, для которой создан Fugu Ultra v2, — ценовое преимущество более низкой заявленной цены исчезает ровно там, где система, как предполагается, должна блистать.

A screenshot of the Sakana Fugu product page at sakana.ai/fugu (captured September 11, 2026, English UI), showing the 'Sakana Fugu' wordmark with the subtitle 'One Model to Command Them All', the description that Fugu dynamically orchestrates the world's best models behind a single API, and the notice reading 'Not yet available in the EU/EEA while we work toward compliance with GDPR and EU-specific regulations.'

Что каждый из них на самом деле из себя представляет

Claude Opus 5 — флагманский продакшн-продукт Anthropic, и его устройство понятно со стороны. По умолчанию он использует адаптивное мышление, сам решая, как долго рассуждать перед ответом, а при желании заставить его углубиться в размышления и заплатить за это доступна явная шкала усилий от low до max. У него контекстное окно на 1 млн токенов, потолок вывода 128K, поддержка зрения, вызова инструментов и режима JSON. Anthropic сообщает о 96,0% на SWE-bench Verified и 79,2% на SWE-bench Pro — более чем вдвое превышая результат Frontier-Bench v0.1 у предшественника, — и примерно 30,2% на ARC-AGI 3 против 7,8% у GPT-5.6 Sol; все это данные самого вендора, и все они измерены на одной модели, которую можно зафиксировать по версии. Кроме того, он перенаправляет помеченные запросы к более старой модели, а не возвращает ошибку, — операционная деталь, которая важна, если в процессе есть проверка на соответствие требованиям.

Fugu Ultra v2 — это не то, и разница не косметическая. Это координатор — небольшая обученная модель, по сообщениям, примерно на 7B параметров, которая читает ваш запрос, собирает команду агентов, назначает роли Thinker, Worker и Verifier из работы Sakana над TRINITY и синтезирует окончательный ответ. Базовые модели не раскрываются, решения о маршрутизации не раскрываются по замыслу, а для уровня Ultra пул фиксирован: вы не можете исключить того или иного вендора. Согласно собственному описанию Sakana версии 2, дата отсечки обучения сдвинулась на 28 августа 2026 года, а состав пула изменился — в частности, чтобы исключить Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra.

Это исключение — самая показательная деталь в релизе. Fugu Ultra v2 заявляет о победах в бенчмарках над тремя сильнейшими доступными моделями, одновременно подтверждая, что не вызывает ни одну из них. Что бы ни содержал пул, по собственным подсчётам Sakana, это не вершина рынка. Замысел в том, что координация побеждает возможности. Это реальный тезис, и на проверяемых задачах с дешёвым чекером у этого тезиса есть доказательства. Это не то же самое утверждение, что «эта система умнее Claude Opus 5», и табло устроено так, что эти два легко перепутать.

Табло, которое выбрала Sakana

Все приведённые ниже числа взяты из собственной оценки Sakana для Fugu Ultra v2. Показатели Claude Opus 5 приведены по измерениям Sakana в том же сравнении, если не указано иное. Ни одна независимая сторона не воспроизвела столбец Fugu, и на момент написания этого текста в Artificial Analysis нет записи ни для одной модели Fugu.

• Chartography — Fugu Ultra v2 48.3 против Claude Opus 5 27.3 — по данным производителя, разрыв в 21 пункт

• DeepSWE — Fugu Ultra v2 74.3 против отсутствия опубликованного показателя Claude Opus 5 в той же таблице — по данным вендора

• Позиция в бенчмарках — Fugu Ultra v2 лучший или делит первое место в пяти из восьми, входит в топ-2 в семи из восьми — по данным производителя

• SWE-bench Verified — для Fugu Ultra v2 нет показателя в сравнении с 96,0 % у Claude Opus 5 — по данным Anthropic

• SWE-bench Pro — нет показателя для Fugu Ultra v2 против 79,2% у Claude Opus 5 — по данным Anthropic

• ARC-AGI 3 — нет показателя Fugu Ultra v2 против Claude Opus 5 ~30,2% — по данным Anthropic

Воспринимайте это как форму, а не как рейтинг. Sakana опубликовала таблицу с восемью бенчмарками, где она побеждает в пяти, а сильнейшие публично задокументированные результаты Claude Opus 5 — строки SWE-bench, ARC-AGI 3 — просто в ней отсутствуют. Это не обвинение в недобросовестности; так выглядит таблица результатов вендора, в том числе у каждого вендора. Но это значит, что по этому релизу нельзя заключить, что Fugu Ultra v2 превосходит Claude Opus 5 в разработке ПО, потому что две системы не измерялись на одних и тех же строках достаточно часто, чтобы это утверждать. В единственной строке, где присутствуют обе и оба числа публичны — Chartography — Fugu Ultra v2 заявляет о крупной победе. По самым широким строкам рассуждений и программирования опубликовала результаты только одна сторона.

A two-column scoreboard for Fugu Ultra v2 vs Claude Opus 5 titled 'Fugu Ultra v2 vs Claude Opus 5 - the scoreboard'. Left column Fugu Ultra v2: Input price $5.00 / 1M, Output price $30.00 / 1M, Chartography 48.3, Evidence vendor-reported only, Weights closed, pool undisclosed, Context 1M, doubles past 272K. Right column Claude Opus 5: Input price $5.00 / 1M, Output price $25.00 / 1M, Chartography 27.3, Evidence independent evals, Weights closed, single model, Context 1M, flat. Footer 'Fugu figures vendor-reported by Sakana; Opus 5 rows as measured by Sakana, plus Anthropic-reported evals.', with the OrcaRouter logo bottom-right.

Стоимость за задачу, а не за токен

Счёт за токены оркестратора — это не его ставка за токен. Fugu Ultra v2 порождает агентов, каждый из которых добавляет токены рассуждений и вывода, а сам координатор создаёт текст синтеза. В FAQ по ценам Sakana есть действительно полезное обещание — с вас берут одну смешанную ставку на основе задействованной модели верхнего уровня, и добавление агентов не умножает счёт, — что устраняет умножение при fan-out в худшем случае, из-за которого наивные мультиагентные схемы становятся дорогими. Но это не устраняет объём. Количество оплачиваемых выходных токенов по-прежнему зависит от того, сколько агентов работало и сколько они написали, и при $30 за миллион этот объём — та переменная, которую нельзя предсказать по странице с ценами.

Структура затрат Claude Opus 5 — обратная. Один вызов, одна модель, регулируемая вами ручка усилий и ставка $25 за вывод при доступной пакетной обработке со скидкой 50% для работы, не требующей реального времени. Это можно прогнозировать. Для рабочей нагрузки, которую вы запускаете десять тысяч раз в день, прогнозируемость стоит гораздо больше, чем преимущество в бенчмарке на задаче чтения графиков.

Именно здесь вопрос маршрутизации чётко отделяется от вопроса модели. Claude Opus 5 размещён на OrcaRouter по каталожной цене Anth​ropic с наценкой 0% — тариф провайдера передаётся как есть, поэтому изменение цены у вендора вступает в силу на том же ключе в тот же день, а при ограничении скорости или недоступности одного из провайдерских путей автоматически происходит переключение на другой. Fugu Ultra v2 нет в нашем каталоге; до вас он доходит через собственный OpenAI-совместимый API Sakana и несколько сторонних платформ, а переход с более ранней версии Fugu — это изменение одного параметра в строке. Если вам на самом деле нужна предсказуемость Claude Opus 5 при меньшей зависимости от одного провайдера, ответ — роутер, а не оркестратор. Если же вам нужна система, которая пробует несколько подходов к сложной задаче без того, чтобы вы сами писали fan-out, то именно это и делает Fugu Ultra v2 — и запускать пилот стоит с включённым учётом токенов.

Где Fugu Ultra v2 действительно побеждает

Отдайте системе должное. Результат Chartography, если он подтвердится, — это тот тип победы, который одиночным моделям трудно подделать: визуальное рассуждение по структурированным документам вознаграждает попытку прочтения, проверку её по документу и повторную попытку — а именно для этого и нужна роль верификатора. Та же логика применима к Toolathon и DeepSWE, где ответ можно проверить, а не обсуждать. Опубликованные кейсы Sakana указывают в ту же сторону: прогон AutoResearch из 123 экспериментов за четырнадцать часов на одном H100; решатель кубика Рубика на чистом Python, который завершил все 300 перемешанных кубиков, тогда как две анонимизированные фронтирные базовые модели полностью сломались; механическая CAD-диафрагма, которая действительно открывается и закрывается. Это выбранные вендором примеры с анонимизированными базовыми линиями, поэтому они доказывают меньше, чем кажется. Но паттерн последователен, и он указывает на реальную категорию: задачи, где корректность проверяема, а сложная часть — это настойчивость.

Есть также структурный аргумент, не имеющий отношения к бенчмаркам. Claude Opus 5 — это модель одного вендора, зависящая от ценовых решений, графика вывода из эксплуатации и политики одного вендора. Fugu Ultra v2 спроектирована так, чтобы пережить изменение любого отдельно взятого из этих факторов, и Sakana прямо говорит, что суть именно в этом — привязка к вендору, отзывы API-доступов, экспортный контроль. На рынке, где модели отзывали из регионов почти без предупреждения, это не гипотетический сценарий. Это хедж, а хеджирование стоит денег: $5 больше за миллион выходных токенов — примерно столько стоит этот хедж.

Вердикт

Claude Opus 5 побеждает в решении, которое на самом деле принимает большинство команд. За ним стоят месяцы независимой оценки, окно в 1M токенов, цена которого не удваивается на середине вашего документа, потолок вывода в 128K, опубликованная цена, которую можно спрогнозировать, регулятор усилий, позволяющий покупать рассуждения только тогда, когда задача этого заслуживает, и сторонние результаты на тех самых бенчмарках — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — которые агентные и кодинг-команды ценят больше всего. Fugu Ultra v2 побеждает в более узком и более интересном вопросе: может ли координатор с меньшим пулом превзойти флагман на задачах, где ответ можно проверить. Собственная таблица результатов Sakana говорит «да» в пяти из восьми строк, а исключение из пула говорит о том, что победа была одержана без трёх лучших моделей мира.

Если вы выполняете верифицируемую, долгосрочную, проверяемую работу и находитесь вне ЕС/ЕЭЗ, Fugu Ultra v2 заслуживает ограниченного пилота — измеряйте выходные токены на завершённую задачу, а не на токен, и установите потолок до начала. Если вам нужен путь в продакшен уже сегодня, подкреплённый доказательствами, и прогнозируемый счёт, Claude Opus 5 остаётся выбором с лучшей доказательной базой, и до него — один API-ключ по прайс-листу Anth​ropic, при этом тариф провайдера передаётся без изменений.

A screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5, captured September 11, 2026, English UI), showing the Featured badge, the endpoint list for /v1/chat/completions and /v1/messages, the pricing tiles reading INPUT $5.00 and OUTPUT $25.00 per 1M tokens with p50 TTFT 4.94s and 195.4M tokens of 7-day traffic, the capability tags Vision, Tools, JSON and Reasoning, the 1M token context and 128K max output, and the OpenAI-compatible Python code sample pointing at api.orcarouter.ai/v1.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно