
Fugu Ultra v2 против Gemini 3.1 Pro: противник, который, возможно, уже находится внутри машины
- OrcaНОВИНКАOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 за 1 млн токенов
- orcaНОВИНКАOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 за 1 млн токенов
- deepseekНОВИНКАDeepSeek: DeepSeek V4.1 Flash2026-09-1040Интеллект
- openaiOpenAI: GPT-6 Astra2026-09-0453Интеллект77Кодинг
- googleGoogle: Gemini 3.8 Flash2026-09-0241Интеллект76Кодинг
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Интеллект76Кодинг
- anthropicAnthropic: Claude Fable 5.12026-09-0153Интеллект82Кодинг
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 за 1 млн токенов
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Интеллект72Кодинг
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 за 1 млн токенов
- z-aiZ.ai: GLM 5.32026-08-1845Интеллект75Кодинг
- obsidianQwen3.8 27B2026-08-1534Интеллект68Кодинг
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Интеллект69Кодинг
- grokSpaceXAI: Grok 4.62026-08-1244Интеллект77Кодинг
- metaMeta: Muse Spark 1.22026-08-0540Интеллект72Кодинг
- qwenQwen: Qwen3.8 Max2026-08-0345Интеллект76Кодинг
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Интеллект69Кодинг
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 за 1 млн токенов
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Есть версия сравнения Fugu Ultra v2 и Gemini 3.1 Pro, в которой Gemini побеждает при любом исходе теста — потому что часть работы, возможно, выполняет она сама. Система оркестрации Sakana AI, выпущенная 11 сентября 2026 года, не раскрывает, какие модели она координирует; как сообщалось, в пул июньской Fugu Ultra среди прочих входила Gemini 3.1 Pro, а версия 2.0 сообщает лишь о том, что она убрала, называя исключёнными Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra. Gemini 3.1 Pro от Google — это единая мультимодальная фронтирная модель с контекстом в 1 млн токенов, которая обрабатывает текст, изображения, PDF-файлы, аудио и видео и находится в общем доступе с мая 2026 года по цене 2,00 доллара за миллион входных и 12,00 доллара за миллион выходных токенов. Одна из них — модель, которую можно изучить. Другая — система, чьи победы в бенчмарках могут идти через первую, и ни один из поставщиков не скажет, происходит ли это на самом деле.
Чем на самом деле является каждая система
Gemini 3.1 Pro отличается редкой для фронтирных релизов понятностью. Это разреженный трансформер со смесью экспертов от Google DeepMind, впервые выпущенный в предварительной версии 19 февраля 2026 года; один источник относит общую доступность к маю 2026 года — в нашем собственном каталоге он указан под идентификатором preview-модели. У него входное окно на 1 млн токенов и потолок вывода в 65 тыс. токенов, он принимает текст, изображения, PDF, аудио, видео и код, а также предоставляет трёхуровневое управление рассуждениями — низкий, средний или высокий — причём высокий является значением по умолчанию в API. Google сообщает о 77,1% на ARC-AGI-2 — более чем вдвое выше 31,1% у предыдущего поколения; 94,3% на GPQA Diamond; 80,6% на SWE-bench Verified; 68,5% на Terminal-Bench 2.0; 85,9% на BrowseComp; и 44,4% на Humanity's Last Exam без инструментов, с ростом до 51,4% при использовании поиска и выполнения кода. Это данные производителя. Дата отсечения знаний — январь 2025 года, и на это стоит обратить внимание, если ваша работа зависит от недавних событий.
Fugu Ultra v2 — это координатор. Это обученная модель, по сообщениям, около 7 млрд параметров, которая читает запрос, собирает команду агентов с ролями Thinker, Worker и Verifier, взятыми из исследования TRINITY компании Sakana, и синтезирует ответ за OpenAI-совместимым эндпоинтом. У неё нет собственного опубликованного списка модальностей — всё, что она может видеть, она видит потому, что это может видеть какая-то модель в её пуле. Её контекст — 1 млн токенов с резким скачком цен на отметке 272K, где тарифы удваиваются до $10 за ввод и $45 за вывод. Её потолок вывода не опубликован. Её пул не раскрывается, её решения о маршрутизации «не раскрываются по замыслу», а для уровня Ultra пул фиксирован, поэтому вы не можете исключить провайдера.
Эта асимметрия и составляет суть всего противостояния. Gemini 3.1 Pro — это компонент, который можно купить напрямую и о котором можно рассуждать. Fugu Ultra v2 — это сборка, детали которой вы не видите, и самые сильные заявления о результатах её бенчмарков могут отчасти быть собственными результатами Gemini, объединёнными с чьими-то ещё.

Сравнение, где эти два пересекаются
Лишь очень малая часть опубликованных данных позволяет сопоставить эти две системы в одной строке. Приведённые ниже показатели Gemini 3.1 Pro — это собственные данные Google; у Fugu Ultra v2 — собственные данные Sakana; там, где сторонний агрегатор опубликовал общую строку, она помечена и сопровождается оговоркой, что данные носят ориентировочный, а не решающий характер.
• Мультимодальное рассуждение (CharXiv, общая строка) — Fugu Ultra v2 86,6% против Gemini 3.1 Pro 80,2%, по данным BenchLM, которая помечает категорию как ориентировочную и отказывается называть победителя
• TerminalBench 2.1 — нет показателя Fugu Ultra v2 v2.0 в сравнении с Gemini 3.1 Pro; сопоставимого опубликованного показателя нет; июньский Fugu Ultra показал 82,1% против 70,3% у Gemini 3.1 Pro в сторонней агрегации
• SWE-Bench Pro — нет данных по Fugu Ultra v2 v2.0 в сравнении с Gemini 3.1 Pro; сопоставимого опубликованного показателя нет; в июне Fugu Ultra сообщил о 73,7% против 54,2% у Gemini 3.1 Pro
• ARC-AGI-2 — нет показателя для Fugu Ultra v2 против 77,1% у Gemini 3.1 Pro, по данным производителя
• Humanity's Last Exam — нет показателя для Fugu Ultra v2 v2.0 в сравнении с Gemini 3.1 Pro: 44,4% без инструментов, 51,4% с инструментами, по данным вендора
• Покрытие модальностей — Fugu Ultra v2 наследует всё, что поддерживает его пул, при этом не раскрыто; в отличие от Gemini 3.1 Pro, где текст, изображения, PDF, аудио, видео и код задокументированы.
• Цена ввода / вывода — Fugu Ultra v2 $5.00 / $30.00 за 1M, удваивается свыше 272K против Gemini 3.1 Pro $2.00 / $12.00 за 1M до 200K, $4.00 / $18.00 свыше, кэшированный ввод $0.20 / $0.40
• Контекст и вывод — Fugu Ultra v2: контекст 1M, потолок вывода не опубликован, против Gemini 3.1 Pro: 1M на входе, 65K на выходе
• Веса и доступ — Fugu Ultra v2 закрыта, ЕС/ЕЭЗ исключены, в отличие от Gemini 3.1 Pro — проприетарной, но широко доступной на всех платформах Google
Мультимодальная строка — та, с которой нужно обращаться осторожно, потому что её цитируют чаще всего, а обоснована она меньше всего. Агрегация CharXiv от BenchLM ставит Fugu Ultra v2 вперёд на 6,4 нормализованных пункта — и на той же странице прямо сказано, что строки с направленностью никогда не получают победителя, что у Gemini не было измеренных результатов в категориях агентных систем, программирования, знаний или многоязычности, а у Fugu их не было в математике или многоязычности. Категория, в которой в большинстве строк измерена только одна сторона, не может дать вердикт. Если вы не вынесете из этого сравнения ничего другого, вынесите вот что: конкретно в работе с мультимодальностью опубликованные данные не поддерживают вывод ни в ту, ни в другую сторону, а единственная существующая строка явно не является устоявшимся результатом.
Возможность, которая меняет рамки
Sakana не сообщает, что находится в пуле. Это задокументированное проектное решение, а не упущение — в FAQ сказано, что информация о маршрутизации не раскрывается по замыслу, и нет механизма, чтобы её проверить. Из июньской генерации нам известно, что, согласно сообщениям, среди участников пула были Gemini 3.1 Pro наряду с другими передовыми моделями. Версия 2.0 изменила пул, и Sakana описала это изменение только через исключение: Claude Fable 5, Claude Fable 5.1 и GPT-6 Astra выбыли. Ничто в релизе не говорит о том, что Gemini всё ещё в пуле.
Если Gemini 3.1 Pro входит в пул, из этого следуют три последствия, и все три практические, а не философские. Во-первых, некоторая доля мультимодальной производительности Fugu Ultra v2 — это производительность Gemini, объединённая с производительностью других моделей, а значит, вы платите надбавку за координацию сверх ставки за токен, которую могли бы платить напрямую. Во-вторых, Fugu Ultra v2 при $30 за миллион выходных токенов против $12 у Gemini 3.1 Pro — это надбавка за сборку, а не за исходные возможности; если ваша задача — один мультимодальный вопрос, Gemini отвечает на него дешевле, и вы точно видите, какая модель ответила. В-третьих, и это самое полезное, честный бенчмарк оркестратора — не «превосходит ли он свои компоненты», а «превосходит ли он свой лучший компонент, когда вы используете его отдельно». Архитектура Sakana построена на утверждении, что на проверяемых задачах он превосходит свой лучший компонент. Это утверждение стоит проверить на собственной рабочей нагрузке, прежде чем принимать его на основании бенчмарка по чтению графиков.
Есть версия, в которой ответ — «нет», и при этом оркестратор всё равно заслуживает своего места. Если Gemini входит в пул, а результат Fugu Ultra v2 в Chartography — 48,3 против 27,3 у Claude Opus 5 — подтвердится, то то, что построила Sakana, — это координационный слой, который надёжно получает от одной и той же модели больше, чем можно получить, обратившись к ней один раз. Это настоящий продукт, и открытый вопрос лишь в том, покрывает ли маржа цену. Никто не опубликовал этот эксперимент.

Там, где честные границы
Преимущества Gemini 3.1 Pro конкретны. Он примерно две пятых цены Fugu Ultra v2 на входе и выходе, и, в отличие от Fugu, его тарифы не удваиваются после превышения порога контекста — повышение на 200K мягче, чем обрыв на 272K. Он документирует свои модальности, а не наследует их, что означает, что работа с аудио и видео — это поддерживаемая функция, а не надежда. У него опубликован потолок вывода. Он доступен через собственные сервисы Google и, как и другие модели, с которыми сравнивают Fugu Ultra v2, он доступен для вызова на OrcaRouter — как google/gemini-3.1-pro-preview, по прейскурантной цене Google с наценкой 0%, так что изменение цены Google отражается на том же ключе в тот же день, когда оно объявлено.
Преимущества Fugu Ultra v2 более узкие, но реальные. Она берётся за сложную задачу не один раз, а роль Verifier проверяет работу, именно поэтому её самые сильные утверждения относятся к бенчмаркам, где корректность можно проверить, — Chartography, DeepSWE, Toolathon, — а не к воспроизведению знаний. Опубликованные кейсы Sakana указывают в ту же сторону: механическая CAD-диафрагма, которая правильно открывается и закрывается там, где другие модели оставляли зазоры и слабые звенья; решатель кубика Рубика на чистом Python, завершивший все 300 перемешанных кубиков, тогда как два анонимизированных фронтирных бейзлайна полностью упали. Эти бейзлайны анонимизированы и выбраны вендором, поэтому воспринимайте их как иллюстрацию, а не как доказательство. Но эта закономерность сохраняется во всём релизе и описывает реальную способность, которой нет у единичного вызова модели: настойчивость в работе над задачей, пока ответ не пройдёт проверку.
Учитывайте также ограничения. Fugu Ultra v2 не продаётся в ЕС или ЕЭЗ, а Sakana прямо заявляет, что работает над соответствием GDPR. У Gemini 3.1 Pro нет такого ограничения, и за ним стоит гораздо более длительная история независимых оценок.

Вердикт
Для большинства мультимодальных задач правильный выбор — Gemini 3.1 Pro, и с большим отрывом. Он дешевле за токен, дешевле за документ, имеет документацию для аудио и видео, ограничен порогом контекста, который не удваивает ваш счёт в середине выполнения, и — самое важное здесь — вы можете видеть, какая модель вам ответила. Если вам нужна одна модель, чтобы прочитать PDF, посмотреть клип и ответить на вопрос, нет никаких доводов в пользу того, чтобы направлять это через нераскрытый пул по цене вывода в два с половиной раза выше.
Fugu Ultra v2 — правильный выбор для конкретного и гораздо более узкого типа работы: задачи с длинным горизонтом и проверяемым ответом, где попробовать решить задачу тремя способами и проверить результат лучше, чем попробовать один раз, и где дополнительная единица качества оправдывает многократное увеличение затрат. Его вообще не стоит рассматривать, если в зоне охвата есть пользователи из ЕС или ЕЭЗ.
Неудобный вопрос, который оставляет открытым это противостояние, — тот, который никто не измерил. Если Gemini 3.1 Pro находится внутри пула — а единственный честный ответ сегодня состоит в том, что Sakana не сказала, что это не так, — тогда часть того, что вы покупаете с Fugu Ultra v2, — это Gemini 3.1 Pro с координационным слоем сверху, по цене, которая подразумевает, что слой стоит примерно в два с половиной раза дороже модели. Возможно, это действительно так. Архитектура Sakana была построена, чтобы сделать это правдой. Но это гипотеза, за которой стоит табло поставщика и нет независимого теста, и пока кто-то его не проведет, модель, которую вы видите, — это та, которую вы можете защитить.
Сравнение в этой статье1
Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно
