
Fugu Ultra v2 против Grok 4.6: пятикратная цена вывода, один общий бенчмарк
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiНОВИНКАOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleНОВИНКАGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenНОВИНКАQwen: Qwen3.8 Max (0902)2026-09-0240Интеллект72Кодинг
- anthropicНОВИНКАAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0340Интеллект72Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Интеллект78Кодинг
- googleGoogle: Gemini 3.6 Flash2026-07-2134Интеллект69Кодинг
Существует ровно один бенчмарк, по которому Fugu Ultra v2 и Grok 4.6 оба публикуют числовой результат, и это DeepSWE: Sakana AI сообщает 74,3 для Fugu Ultra v2 в своём анонсе от 11 сентября 2026 года, тогда как в материалах xAI к запуску Grok 4.6 его собственный результат по DeepSWE v1.1 указан на уровне 65,9%. Это разрыв в 8,4 балла, и это единственное корректное сравнение, которое могут предложить обе компании. Всё остальное, что вы могли бы сопоставить — Chartography и SWEFish от Sakana против GPQA Diamond и CursorBench от Grok — измеряется на разных инструментах разными лабораториями. Так что честный вопрос не в том, «кто умнее». А в том, стоит ли заявленное преимущество Fugu Ultra v2 того, чтобы платить 30 долларов за миллион выходных токенов, тогда как Grok 4.6 берёт 6 долларов.
Два разных ответа на одну и ту же проблему
Grok 4.6 — это одна модель, и она является текущим флагманом линейки Grok — указана как «Latest» в собственной документации производителя для разработчиков, приходит на смену Grok 4.5 с тем же контекстным окном на 500 000 токенов, теми же возможностями ввода текста/изображений/файлов и теми же базовыми тарифами. Дата отсечки знаний — 1 февраля 2026 года; доступны уровни усилия рассуждений low, medium, high и xhigh, при этом high используется по умолчанию. Одна деталь, которая удивляет людей: рассуждения нельзя отключить. Токены размышления тарифицируются при каждом запросе, поэтому реальная стоимость вывода Grok 4.6 зависит от того, насколько интенсивно она решит размышлять.
Fugu Ultra v2 — вовсе не модель в привычном смысле. Это уровень максимальных возможностей оркестрационной линейки Sakana AI — единый OpenAI-совместимый эндпоинт, который разбирает задачу на части и распределяет её по пулу других моделей, одни из которых с открытыми весами, другие — специализированные. Sakana формулирует это так: он достигает результатов передового уровня «без непременной опоры на передовые модели, которыми он управляет», и прямо заявляет, что Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra исключены из этого пула. Вы платите за слой планирования и за каждый токен, который сжигают суб-агенты.
Это различие не косметическое. Именно оно — причина существования ценового разрыва, и только оно делает этот разрыв оправданным.
Тарифные карты, включая повторяющуюся часть
• Ввод — Fugu Ultra v2 — 5,00 $ за 1 млн против Grok 4.6 — 2,00 $ за 1 млн. Fugu в 2,5 раза дороже ещё до каких-либо подвызовов.
• Вывод — Fugu Ultra v2 $30.00 за 1 млн против Grok 4.6 $6.00 за 1 млн. Разрыв в 5 раз, и именно он определяет большинство счетов.
• Кэшированный ввод — $0.50 за 1 млн у обоих. Идентично. Два поставщика, не имеющих между собой ничего общего, пришли к одной и той же цене чтения из кэша, что делает агентные циклы с интенсивным использованием кэша единственной рабочей нагрузкой, в которой эти двое действительно сопоставимы строка за строкой.
• Пересмотр цен для длинного контекста — Grok 4.6 удваивается до $4.00 / $12.00, как только промпт превышает 200 000 токенов, причём новый тариф применяется к всему запросу, а не только к превышению. Указанный тариф Fugu Ultra v2 свыше примерно 272 000 входных токенов повышается до около $10.00 / $45.00, также на весь запрос. Оба штрафуют за длинные промпты; Grok начинает штрафовать на 72 тыс. токенов раньше.
• Контекстное окно — Grok 4.6: 500 тыс. токенов против 1M у Fugu Ultra v2, согласно сторонним спискам. На странице анонса Sakana вообще не указано значение контекста, поэтому считайте его 1M не подтверждённым производителем.
Длинноконтекстный сценарий — палка о двух концах, и здесь стоит посчитать. Запрос на 300 тыс. токенов обходится в $4.00 за миллион входных на Grok 4.6 и примерно в $10.00 на Fugu Ultra v2. Запрос на 150 тыс. токенов стоит $2.00 на Grok и $5.00 на Fugu. Модель Sakana дороже при любой длине запроса — вопрос лишь в том, как часто её нужно вызывать.

Аргумент в пользу пятикратной оплаты за результат
Аргумент в пользу оркестратора не в том, что он дешевле в расчёте на токен. А в том, что ему требуется меньше попыток и что токены, которые он тратит на координацию, дешевле, чем токены, которые вы потратили бы на неудачные попытки.
Это весомый аргумент, и Sakana прямо его формулирует: Fugu Ultra v2 нацелена на сложную многоэтапную работу — автономные исследования, full-stack-разработку — где режим отказа отдельной модели состоит в том, что она сбивается с курса где-то на середине долгого прогона. Если тариф $30 за выходные токены позволяет выполнить задачу с первого прохода, а не с третьего, надбавка за токен не имеет значения.
Есть подтверждающие данные и со стороны самого вендора, хотя они благоприятны для вендора, и воспринимать их следует именно так. В материалах запуска Grok 4.6 от xAI упоминается примерно 53 хода и около 0,5 млрд входных токенов для решения долгосрочных задач — против примерно 103 ходов и 2,0 млрд входных токенов у конкурирующей фронтирной модели; это аргумент в пользу того, что сам Grok экономичен в расчёте на задачу даже при низкой цене за токен. Обе компании делают один и тот же ход: подталкивают вас уйти от тарифной сетки к стоимости за выполненную задачу.
А значит, решающее число — то, которое не публикует ни один из вендоров, и которое вам придётся измерить самому: сожжённые токены, от начала до конца, на задаче, похожей на вашу.
Где каждый из них действительно слаб
Опубликованная слабая сторона Grok 4.6 — работа в терминале. Его результат в Terminal-Bench v3.0 составляет 26%, что сильно отстаёт от лидеров области, хотя та же модель показывает гораздо более высокие 88,4% на более старой Terminal-Bench v2.1 — это разные тесты, и их смешение является ошибкой, которую вы увидите во многих публикациях. Она также имеет самый высокий результат GPQA Diamond среди моделей своего поколения — 94,9%, но с тех пор GPQA Diamond был исключён из индекса Artificial Analysis как насыщенный, поэтому высокий результат там больше не позволяет различать передовые модели так, как это было год назад.
На независимой стороне Artificial Analysis оценивает Grok 4.6 в 44 балла по своему Индексу интеллекта v4.3, присваивая ему 20-е место из 200, при стоимости за задачу $1.86. Часто распространяемая цифра 61 относится к устаревшей шкале индекса, и её не следует приводить, не указав, какая версия её дала.
Слабое место Fugu Ultra v2 — верификация. На момент публикации ни одно из утверждений Sakana о ней — пять результатов уровня «лучший или наравне с лучшим», оценка 48.3 в Chartography против 27.3 у Opus 5 и 29.5 у Fable 5, 74.3 в DeepSWE — не было независимо воспроизведено. Также не опубликованы показатели задержки или пропускной способности, а для оркестратора это важнее, чем для отдельной модели, потому что время её отклика полностью зависит от того, что она решит вызвать. О предыдущей Fugu Ultra тестировщики публично сообщали о прогонах, растягивавшихся примерно до 30 минут; это модель июня 2026 года, не v2, но именно этот режим отказа и нужно проверять, прежде чем закладывать производственный путь.

Примечание о названии поставщика
Об одной особенности стоит знать, прежде чем искать Grok 4.6 в консоли разработчика: модель неизменно называется Grok 4.6, но брендинг вендора вокруг неё сейчас нестабилен. В собственной документации xAI теперь используется название SpaceXAI — перемена, которую большинство материалов о запуске ещё не отразили. Идентификаторы модели и поверхность API не изменились — Grok 4.6 — это полноценная модель OpenAI Responses, и она встраивается в существующие циклы вызова инструментов без слоя трансляции — но если вы ищете карточку модели, а брендинг выглядит неправильно, это не ваша ошибка.
Вызов любого из них на практике
Grok 4.6 доступен в OrcaRouter по тарифу самого провайдера — $2,00 за миллион входных токенов и $6,00 за миллион выходных, передаваемые без наценки, поэтому изменение цены поставщика доходит сюда в тот же день, а не по графику миграции. Он совместим с OpenAI на том же базовом URL, что и всё остальное в каталоге, а значит, его можно поставить за цепочкой резервных вариантов или правилом маршрутизации вместо жёсткого прописывания, и вы можете A/B-тестировать его против другой модели без второго договора или изменения кода.
Fugu Ultra v2 не маршрутизируется нами. Он доступен через собственный OpenAI-совместимый API Sakana AI, и компания утверждает, что существующая интеграция Fugu переходит на него при изменении одного параметра. Если вы хотите сравнить оба варианта на своей рабочей нагрузке, самый дешёвый вариант — оставить Grok 4.6 на вашем шлюзе и вызывать Fugu Ultra v2 напрямую из Sakana за фича-флагом — оба используют один и тот же формат запросов, поэтому один и тот же тестовый стенд работает с обоими.

Вердикт
Grok 4.6 — рациональный выбор по умолчанию для большинства команд, и по цене он вне конкуренции. При $2.00 / $6.00, чтении из кэша за $0.50 и окне контекста в 500K он справляется с рассуждениями по длинным документам, агентами для программирования и мультимодальной работой с файлами по цене, составляющей пятую часть стоимости вывода Fugu Ultra v2, а его оценки и бенчмарки независимы. Его уязвимости — длина промпта (после порога 200K стоимость всего запроса удваивается) и агентные циклы с интенсивным использованием терминала, где его опубликованные результаты неконкурентоспособны.
Fugu Ultra v2 оправдывает свою премиальную цену только если у вас есть специфический тип рабочей нагрузки: длительные, многошаговые задачи с высокой степенью автономности, в которых одна модель склонна сбиваться с пути, и в которых вы также хотите получить архитектурное свойство, которое продаёт Sakana — уровень возможностей, не зависящий от того, останется ли какой-либо передовой поставщик доступным или дешёвым. Это вполне реальное желание. Но это утверждение, а не измерение, и разрыв в DeepSWE, который делает его правдоподобным, — это единственный бенчмарк от единственного поставщика в день релиза.
Если вы не можете сказать, какая из ваших задач сейчас не удаётся со второй или третьей попытки, у вас ещё нет числа, которое оправдало бы разницу в цене. Сначала измерьте это. Тарифные карты уже говорят вам всё остальное.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
