
Fugu Ultra v2 против Claude Opus 5: одинаковая цена за ввод, две разные ставки
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Fugu Ultra v2 и Claude Opus 5 стоят ровно одинаково, когда нужно задать вопрос, и совершенно по-разному, когда нужно получить ответ. У обоих заявленная цена — $5.00 за миллион входных токенов. Затем Fugu Ultra v2 берёт $30.00 за миллион выходных токенов против $25.00 у Claude Opus 5 — и разрыв между этими двумя числами не является различием из-за округления, потому что обе системы выдают очень разный объём текста, чтобы прийти к ответу. Sakana AI выпустила Fugu Ultra v2 11 сентября 2026 года как систему оркестрации, которая координирует пул моделей других лабораторий за одним OpenAI-совместимым эндпоинтом; Claude Opus 5 от Anthropic, работающий с конца июля 2026 года, — это одна модель. Это различие определяет большую часть этого сравнения ещё до обращения к бенчмарку, и в собственной таблице Sakana есть неловкая строка: производитель сообщает 48.3 по Chartography против 27.3 у Claude Opus 5, а это самый большой отрыв в релизе и одновременно число, под которым меньше всего внешних доказательств.
Совпадение, которое формирует всё
Начните с того, в чём совпадают эти два продукта, потому что это больше, чем заявленная цена.
• Цена ввода — Fugu Ultra v2 $5.00 за 1 млн токенов против Claude Opus 5 $5.00 за 1 млн токенов
• Цена вывода — Fugu Ultra v2 $30.00 за 1 млн токенов против Claude Opus 5 $25.00 за 1 млн токенов
• Кэшированный ввод — Fugu Ultra v2: $0.50 за 1 млн сверх базового тарифа, в отличие от Claude Opus 5, где кэширование тарифицируется как скидка до 90% на кэшированный ввод
• Контекст — Fugu Ultra v2, 1 млн токенов, при этом тарифы удваиваются после 272 тыс. в отличие от Claude Opus 5 с 1 млн токенов и фиксированной ставкой
• Потолок вывода — Fugu Ultra v2 не опубликован как единый показатель по сравнению с Claude Opus 5 128K токенов
• Доступность — Fugu Ultra v2 не продаётся в ЕС/ЕЭЗ, тогда как Claude Opus 5 общедоступен на стандартных условиях API
• Доказательства — бенчмарки Fugu Ultra v2, заявленные производителем, независимой оценки пока нет, против бенчмарков Claude Opus 5 от производителя плюс многомесячные позиции в сторонних лидербордах
Именно в последней строке сравнение фактически переламывается. При одинаковой цене за ввод вы выбираете между системой, оценки которой приходится принимать на веру, и моделью, оценки которой воспроизвели другие. Обрыв на 272K усугубляет ситуацию: после этого порога тариф Fugu Ultra v2 за ввод удваивается до $10, а за вывод — до $45, тогда как тариф Claude Opus 5 не меняется. Для запусков агентов с длинным контекстом — именно той рабочей нагрузки, для которой создан Fugu Ultra v2, — ценовое преимущество более низкой заявленной цены исчезает ровно там, где система, как предполагается, должна блистать.

Что каждый из них на самом деле из себя представляет
Claude Opus 5 — флагманский продакшн-продукт Anthropic, и его устройство понятно со стороны. По умолчанию он использует адаптивное мышление, сам решая, как долго рассуждать перед ответом, а при желании заставить его углубиться в размышления и заплатить за это доступна явная шкала усилий от low до max. У него контекстное окно на 1 млн токенов, потолок вывода 128K, поддержка зрения, вызова инструментов и режима JSON. Anthropic сообщает о 96,0% на SWE-bench Verified и 79,2% на SWE-bench Pro — более чем вдвое превышая результат Frontier-Bench v0.1 у предшественника, — и примерно 30,2% на ARC-AGI 3 против 7,8% у GPT-5.6 Sol; все это данные самого вендора, и все они измерены на одной модели, которую можно зафиксировать по версии. Кроме того, он перенаправляет помеченные запросы к более старой модели, а не возвращает ошибку, — операционная деталь, которая важна, если в процессе есть проверка на соответствие требованиям.
Fugu Ultra v2 — это не то, и разница не косметическая. Это координатор — небольшая обученная модель, по сообщениям, примерно на 7B параметров, которая читает ваш запрос, собирает команду агентов, назначает роли Thinker, Worker и Verifier из работы Sakana над TRINITY и синтезирует окончательный ответ. Базовые модели не раскрываются, решения о маршрутизации не раскрываются по замыслу, а для уровня Ultra пул фиксирован: вы не можете исключить того или иного вендора. Согласно собственному описанию Sakana версии 2, дата отсечки обучения сдвинулась на 28 августа 2026 года, а состав пула изменился — в частности, чтобы исключить Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra.
Это исключение — самая показательная деталь в релизе. Fugu Ultra v2 заявляет о победах в бенчмарках над тремя сильнейшими доступными моделями, одновременно подтверждая, что не вызывает ни одну из них. Что бы ни содержал пул, по собственным подсчётам Sakana, это не вершина рынка. Замысел в том, что координация побеждает возможности. Это реальный тезис, и на проверяемых задачах с дешёвым чекером у этого тезиса есть доказательства. Это не то же самое утверждение, что «эта система умнее Claude Opus 5», и табло устроено так, что эти два легко перепутать.
Табло, которое выбрала Sakana
Все приведённые ниже числа взяты из собственной оценки Sakana для Fugu Ultra v2. Показатели Claude Opus 5 приведены по измерениям Sakana в том же сравнении, если не указано иное. Ни одна независимая сторона не воспроизвела столбец Fugu, и на момент написания этого текста в Artificial Analysis нет записи ни для одной модели Fugu.
• Chartography — Fugu Ultra v2 48.3 против Claude Opus 5 27.3 — по данным производителя, разрыв в 21 пункт
• DeepSWE — Fugu Ultra v2 74.3 против отсутствия опубликованного показателя Claude Opus 5 в той же таблице — по данным вендора
• Позиция в бенчмарках — Fugu Ultra v2 лучший или делит первое место в пяти из восьми, входит в топ-2 в семи из восьми — по данным производителя
• SWE-bench Verified — для Fugu Ultra v2 нет показателя в сравнении с 96,0 % у Claude Opus 5 — по данным Anthropic
• SWE-bench Pro — нет показателя для Fugu Ultra v2 против 79,2% у Claude Opus 5 — по данным Anthropic
• ARC-AGI 3 — нет показателя Fugu Ultra v2 против Claude Opus 5 ~30,2% — по данным Anthropic
Воспринимайте это как форму, а не как рейтинг. Sakana опубликовала таблицу с восемью бенчмарками, где она побеждает в пяти, а сильнейшие публично задокументированные результаты Claude Opus 5 — строки SWE-bench, ARC-AGI 3 — просто в ней отсутствуют. Это не обвинение в недобросовестности; так выглядит таблица результатов вендора, в том числе у каждого вендора. Но это значит, что по этому релизу нельзя заключить, что Fugu Ultra v2 превосходит Claude Opus 5 в разработке ПО, потому что две системы не измерялись на одних и тех же строках достаточно часто, чтобы это утверждать. В единственной строке, где присутствуют обе и оба числа публичны — Chartography — Fugu Ultra v2 заявляет о крупной победе. По самым широким строкам рассуждений и программирования опубликовала результаты только одна сторона.

Стоимость за задачу, а не за токен
Счёт за токены оркестратора — это не его ставка за токен. Fugu Ultra v2 порождает агентов, каждый из которых добавляет токены рассуждений и вывода, а сам координатор создаёт текст синтеза. В FAQ по ценам Sakana есть действительно полезное обещание — с вас берут одну смешанную ставку на основе задействованной модели верхнего уровня, и добавление агентов не умножает счёт, — что устраняет умножение при fan-out в худшем случае, из-за которого наивные мультиагентные схемы становятся дорогими. Но это не устраняет объём. Количество оплачиваемых выходных токенов по-прежнему зависит от того, сколько агентов работало и сколько они написали, и при $30 за миллион этот объём — та переменная, которую нельзя предсказать по странице с ценами.
Структура затрат Claude Opus 5 — обратная. Один вызов, одна модель, регулируемая вами ручка усилий и ставка $25 за вывод при доступной пакетной обработке со скидкой 50% для работы, не требующей реального времени. Это можно прогнозировать. Для рабочей нагрузки, которую вы запускаете десять тысяч раз в день, прогнозируемость стоит гораздо больше, чем преимущество в бенчмарке на задаче чтения графиков.
Именно здесь вопрос маршрутизации чётко отделяется от вопроса модели. Claude Opus 5 размещён на OrcaRouter по каталожной цене Anthropic с наценкой 0% — тариф провайдера передаётся как есть, поэтому изменение цены у вендора вступает в силу на том же ключе в тот же день, а при ограничении скорости или недоступности одного из провайдерских путей автоматически происходит переключение на другой. Fugu Ultra v2 нет в нашем каталоге; до вас он доходит через собственный OpenAI-совместимый API Sakana и несколько сторонних платформ, а переход с более ранней версии Fugu — это изменение одного параметра в строке. Если вам на самом деле нужна предсказуемость Claude Opus 5 при меньшей зависимости от одного провайдера, ответ — роутер, а не оркестратор. Если же вам нужна система, которая пробует несколько подходов к сложной задаче без того, чтобы вы сами писали fan-out, то именно это и делает Fugu Ultra v2 — и запускать пилот стоит с включённым учётом токенов.
Где Fugu Ultra v2 действительно побеждает
Отдайте системе должное. Результат Chartography, если он подтвердится, — это тот тип победы, который одиночным моделям трудно подделать: визуальное рассуждение по структурированным документам вознаграждает попытку прочтения, проверку её по документу и повторную попытку — а именно для этого и нужна роль верификатора. Та же логика применима к Toolathon и DeepSWE, где ответ можно проверить, а не обсуждать. Опубликованные кейсы Sakana указывают в ту же сторону: прогон AutoResearch из 123 экспериментов за четырнадцать часов на одном H100; решатель кубика Рубика на чистом Python, который завершил все 300 перемешанных кубиков, тогда как две анонимизированные фронтирные базовые модели полностью сломались; механическая CAD-диафрагма, которая действительно открывается и закрывается. Это выбранные вендором примеры с анонимизированными базовыми линиями, поэтому они доказывают меньше, чем кажется. Но паттерн последователен, и он указывает на реальную категорию: задачи, где корректность проверяема, а сложная часть — это настойчивость.
Есть также структурный аргумент, не имеющий отношения к бенчмаркам. Claude Opus 5 — это модель одного вендора, зависящая от ценовых решений, графика вывода из эксплуатации и политики одного вендора. Fugu Ultra v2 спроектирована так, чтобы пережить изменение любого отдельно взятого из этих факторов, и Sakana прямо говорит, что суть именно в этом — привязка к вендору, отзывы API-доступов, экспортный контроль. На рынке, где модели отзывали из регионов почти без предупреждения, это не гипотетический сценарий. Это хедж, а хеджирование стоит денег: $5 больше за миллион выходных токенов — примерно столько стоит этот хедж.
Вердикт
Claude Opus 5 побеждает в решении, которое на самом деле принимает большинство команд. За ним стоят месяцы независимой оценки, окно в 1M токенов, цена которого не удваивается на середине вашего документа, потолок вывода в 128K, опубликованная цена, которую можно спрогнозировать, регулятор усилий, позволяющий покупать рассуждения только тогда, когда задача этого заслуживает, и сторонние результаты на тех самых бенчмарках — SWE-bench Verified, SWE-bench Pro, ARC-AGI 3 — которые агентные и кодинг-команды ценят больше всего. Fugu Ultra v2 побеждает в более узком и более интересном вопросе: может ли координатор с меньшим пулом превзойти флагман на задачах, где ответ можно проверить. Собственная таблица результатов Sakana говорит «да» в пяти из восьми строк, а исключение из пула говорит о том, что победа была одержана без трёх лучших моделей мира.
Если вы выполняете верифицируемую, долгосрочную, проверяемую работу и находитесь вне ЕС/ЕЭЗ, Fugu Ultra v2 заслуживает ограниченного пилота — измеряйте выходные токены на завершённую задачу, а не на токен, и установите потолок до начала. Если вам нужен путь в продакшен уже сегодня, подкреплённый доказательствами, и прогнозируемый счёт, Claude Opus 5 остаётся выбором с лучшей доказательной базой, и до него — один API-ключ по прайс-листу Anthropic, при этом тариф провайдера передаётся без изменений.

Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
