Титульная карточка с надписью «Fugu Ultra v2 против Qwen3.8-Max» и подзаголовком «Почему ценник — это не та цифра», три пилюлевидных бейджа с надписями «Вывод: $30.00 против $6.00», «Выше 272K: ставка удваивается» и «Независимая оценка Fugu: отсутствует», строка в футере «Sakana AI, 11 сентября 2026 против Alibaba, август 2026», и логотип OrcaRouter в правом нижнем углу.
Guides & Insights

Fugu Ultra v2 против Qwen3.8-Max: почему ценник — это не тот показатель

Автор

Alistair Wren

Дата публикации

Новые модели · 20Все модели
Бенчмарки: Artificial Analysis · обновляется ежедневно
Назад ко всем статьям

Fugu Ultra v2 стоит $30,00 за миллион выходных токенов. Qwen3.8-Max стоит $6,00. Это разрыв в пять раз, и если выбирать между этими двумя агентными системами по такому соотношению, вы ошибётесь — потому что ни одна из них на самом деле не тарифицируется так, как предполагает её прайс-лист. По собственным измерениям Artificial Analysis, Qwen3.8-Max сгенерировала 180 миллионов выходных токенов, чтобы пройти Intelligence Index, — более чем вдвое больше, чем 89 миллионов у медианной модели, — при стоимости $2,67 за задачу. Это экономная модель по токенам и расточительная по ответу. Fugu Ultra v2 от Sakana AI, выпущенная 11 сентября 2026 года, имеет противоположную форму: нераскрытый пул моделей других лабораторий, которые она запускает и координирует по запросу, с оплатой по единому смешанному тарифу, который, по словам Sakana, не умножается при добавлении агентов. Одна — единая модель с 2,4 триллиона параметров, которая долго размышляет вслух. Другая — небольшой координатор, который нанимает помощников. Сравнение их цен за токены почти ничего не говорит о том, какая из них дешевле в эксплуатации.

Два противоположных способа быть дорогим

Начните с механизма, потому что он объясняет все остальные различия в этом сравнении.

Qwen3.8-Max — это разреженная модель смеси экспертов: 2,4 триллиона общих параметров, примерно 95 миллиардов активных на токен — она достигает результатов, сопоставимых с фронтирными, не за счёт большего размера, а за счёт более длительной работы. Artificial Analysis замерила её на 37,8 выходных токенов в секунду, поставив на №154 место из 200 моделей по скорости, при 180 млн выходных токенов, сгенерированных в рамках Intelligence Index (№70 из 200 по многословности). Стоимость выполнения одной задачи Intelligence Index составляет $2,67, а скидка за кэш необычно глубока — 88%, и именно этот рычаг фактически определяет расходы здесь: длительный агентный прогон, который постоянно перечитывает один и тот же контекст, обходится дёшево, а тот, что постоянно генерирует новый текст, — нет.

Fugu Ultra v2 подходит к той же проблеме с другого конца. Это оркестратор — небольшой обученный координатор, по сообщениям, около 7 миллиардов параметров, который читает запрос, собирает команду агентов с ролями Thinker, Worker и Verifier из работы TRINITY от Sakana, а затем синтезирует ответ. Его счёт за токены — это сумма того, что производят его субагенты, плюс собственный текст синтеза координатора. Sakana в своём разделе FAQ по ценам заверяет, что с вас взимается плата по единой смешанной ставке, привязанной к задействованной модели верхнего уровня, и что добавление агентов не умножает счёт, — это устраняет классический мультиагентный взрыв расходов, когда разветвление умножает стоимость. Чего оно не устраняет — так это объём. При $30.00 за миллион выходных токенов ключевое число — сколько агентов было запущено и сколько они написали, а это число ни вы, ни Sakana не можете предсказать, глядя на страницу с ценами.

Это честная формулировка ценового разрыва: это ставка, а не итоговая сумма. Ставка, в пять раз более высокая, применённая к рабочей нагрузке, объём результатов которой вы не можете спрогнозировать, — это не пятикратные затраты, а множитель без верхней границы с предсказуемым нижним пределом.

A two-column scoreboard titled 'Fugu Ultra v2 vs Qwen3.8-Max Scoreboard' contrasting six dimensions. Fugu Ultra v2: price $5.00/$30.00 per 1M, context 1M tokens, above 272K input doubles to $10, AA Index none published, speed not measured, weights closed with pool undisclosed. Qwen3.8-Max: price $2.00/$6.00 per 1M, context 1M tokens, above 272K no surcharge, AA Index 40 ranked #30 of 200, speed 37.8 tokens/sec, weights open checkpoint published. Footer reads 'Fugu Ultra v2 figures vendor-reported; no independent evaluation. Qwen3.8-Max figures per Artificial Analysis, recalibrated scale.' OrcaRouter logo bottom-right.

Спецификация и та самая строка, которая всё решает

• Цена — Fugu Ultra v2: $5.00 за вход / $30.00 за выход за 1 млн токенов в сравнении с Qwen3.8-Max: $2.00 за вход / $6.00 за выход

Кэшированный ввод — Fugu Ultra v2 $0,50 за 1 млн против Qwen3.8-Max $0,25 за 1 млн чтения, а также скидка 88% на кэш по данным Artificial Analysis

• Надбавка за длинный контекст — у Fugu Ultra v2 входная цена удваивается до $10.00, а выходная — до $45.00 при превышении 272K токенов, тогда как у Qwen3.8-Max нет надбавки за длинный промпт, цена остаётся фиксированной вплоть до окна

• Контекстное окно — Fugu Ultra v2 1M токенов против Qwen3.8-Max 1M токенов

• Потолок вывода — Fugu Ultra v2 не опубликован как единый показатель; у Qwen3.8-Max — примерно 128K токенов

• Входная модальность — текст Fugu Ultra v2, за которым стоят собственные возможности пула, против текста, изображений, видео и PDF Qwen3.8-Max

• Веса — Fugu Ultra v2 закрыты, состав пула намеренно не раскрывается, тогда как Qwen3.8-Max — открытые веса, опубликованные для чекпоинта класса Max по пользовательской лицензии

• Региональная доступность — Fugu Ultra v2 не продаётся в ЕС/ЕЭЗ, тогда как Qwen3.8-Max доступен без региональных ограничений

• Независимая оценка — Fugu Ultra v2: не опубликовано ни одной, и ни для одной модели Fugu не существует страницы Artificial Analysis, в отличие от Qwen3.8-Max — активной записи Artificial Analysis с опубликованными показателями скорости, многословности и стоимости за задачу

Прочитайте две последние строки вместе — и сравнение обостряется. Qwen3.8-Max — это модель, которую можно закрепить по версии, прочитать её лицензию, скачать контрольную точку и сверить с табло третьей стороны. Fugu Ultra v2 — это система, которую нельзя изучить, нельзя развернуть у себя, нельзя купить в Европе и нельзя проверить ни у кого за пределами Sakana. Надбавка за 272K усугубляет ситуацию: после этого порога тариф на ввод Fugu Ultra v2 удваивается, а тариф на вывод возрастает наполовину, тогда как тариф Qwen3.8-Max не меняется. Для долгосрочной работы с документами и репозиториями, для которой созданы обе системы, более дешёвая заявленная цена также оказывается и более ровной.

Цифра Qwen3.8-Max, которую все цитируют, устарела

Если вы читали об этой модели где-либо за последние две недели, вы, вероятно, видели индекс интеллекта Artificial Analysis, равный 58, или 58,1, или 58,4. Эти цифры были реальными, но уже неактуальны. 7 сентября 2026 года Artificial Analysis перекалибровала свой индекс до версии v4.3, сжав оценки повсеместно, и текущая страница Qwen3.8-Max теперь показывает40, что ставит её на #30 из 200 моделей — со значком «Updated», который отмечает пересчитанный балл. В более старых обзорах также фигурировал налог на усилия, измеренный по прежней шкале: 64 хода на задачу против 14 у предыдущего поколения Qwen, и примерно $1,14 за задачу Intelligence Index. На текущей странице указано $2,67 за задачу, 37,8 выходных токенов в секунду и 180 миллионов выходных токенов по индексу.

Отсюда следуют два вывода. Во-первых, на перекалиброванной шкале Qwen3.8-Max находится в той же полосе, что и остальные модели второго эшелона фронтира, а не на одном уровне с ним, и любое сравнение, которое вы прочтёте, где его ранжируют рядом с Claude Opus 5 или Kimi K3 на отметке 58, сравнивает снимки с разных шкал. Во-вторых, и это полезнее для данного противостояния, поправка однонаправленная: у Qwen3.8-Max есть число, которое может оказаться неверным, а затем быть исправлено. У Fugu Ultra v2 числа нет. Каждая цифра Fugu в этой статье взята из собственной оценки Sakana, и по состоянию на 11 сентября не существует страницы Artificial Analysis для Fugu Ultra v2 или любой другой модели Fugu — URL выдаёт 404. Когда вендор публикует таблицу результатов, а независимая сторона не запускала модель, эта таблица результатов и есть вся имеющаяся запись.

Где они на самом деле пересекаются, а где — нет

Sakana сообщает, что Fugu Ultra v2 является лучшей или одной из лучших по пяти из восьми бенчмарков — GDP.pdf, Chartography, SWEFish, DeepSWE и Toolathon — и входит в топ-2 по семи из восьми. Две конкретные цифры в пресс-релизе — это Chartography с 48,3 против 27,3 у Claude Opus 5 и 29,5 у Claude Fable 5 в той же таблице, а также DeepSWE с 74,3. В собственных опубликованных данных Alibaba для Qwen3.8-Max указаны Terminal-Bench 2.1 с 86,6, OSWorld-Verified с 86,1, GPQA Diamond с 92,6 и SWE-bench Pro с 67,7.

Заметьте, что общего у этих двух списков: ничего. Ни один бенчмарк не встречается в обеих таблицах вендоров. Нет строки, где можно поставить показатель Sakana и показатель Alibaba рядом и определить победителя, а значит, честный ответ на вопрос «кто лучше в роли кодинг-агента» состоит в том, что ни одно опубликованное свидетельство на него не отвечает. Что есть: одна система с восемью строками, выбранными вендором, и без внешней проверки, и одна система со строками вендора плюс независимая запись, которая измеряет стоимость и скорость, а не сравнивает способности напрямую. Это пробел в доказательствах, а не пробел в моделях, и это должно изменить то, как вы покупаете: вы не можете выбирать между ними по бенчмаркам, поэтому выбирайте по свойствам, которые действительно можете проверить.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, with the opening paragraphs arguing that the frontier which matters is two-dimensional — capability against cost — and stating that Fugu Ultra v2 pushes peak performance higher without indispensable reliance on the frontier models it orchestrates.

Открытые веса против нераскрытого пула

Именно здесь обычный аргумент о блокировке переворачивается, и это самое интересное в этом сочетании.

Презентационный тезис Sakana для Fugu Ultra v2 — суверенитет. Заменяемый пул открытых и специализированных моделей означает, что ни одно ценовое решение, график вывода из эксплуатации или изменение политики отдельного поставщика не сможет обрушить ваш продукт, и релиз прямо это подчёркивает, отмечая, что состав пула изменился в v2. Компания также прямо заявляет, что оценки Fugu Ultra v2 были достигнуты без Claude Fable 5, Claude Fable 5.1 или GPT-6 Astra в пуле агентов — заявляя о победах над тремя сильнейшими доступными моделями, при этом подтверждая, что не вызывает ни одну из них. Что бы ни содержал пул, по собственным подсчётам Sakana это не верхушка рынка.

Но у такой страховки есть издержка, которой нет в прайс-листе. Вы не можете увидеть пул, не можете включить или исключить участника из уровня Ultra, не можете развернуть ничего из этого на собственных серверах и вообще не можете запускать это в ЕС/ЕЭЗ — оркестрация из Сингапура поверх весов других лабораторий даёт иной профиль риска, чем владение весами. Qwen3.8-Max переворачивает это ровно наоборот. Это модель одного вендора и потому она зависит от решений одного вендора, но Alibaba опубликовала открытые веса для чекпоинта Qwen3.8-2.4T-A95B класса Max по кастомной лицензии, а значит, запасной выход реален, а не риторичен: если цены или условия изменятся, модель можно обслуживать со своей инфраструктуры. Для команды, которая на самом деле боится, что вендор выдернет ковёр из-под ног, скачиваемый чекпоинт — более сильная гарантия, чем обещание насчёт пула, который вам не разрешено проверять.

Есть один второстепенный момент для всех, кто запускает агентов в обеих системах. Qwen3.8-Max есть в нашем каталоге по цене $2.00 за входящие и $6.00 за исходящие, что соответствует цене из прайс-листа Alibaba с 0% наценки, перекладываемой напрямую — изменение цены поставщика применяется к тому же ключу в тот же день, а автоматическое переключение при сбое покрывает путь к провайдеру при ограничении частоты запросов или деградации. Fugu Ultra v2 отсутствует в OrcaRouter. Доступ к Fugu Ultra v2 осуществляется через собственный OpenAI-совместимый API Sakana и несколько сторонних платформ, а переход с более ранней версии Fugu — это изменение одного параметра в одной строке. Роутер не заменяет координатор, а координатор не заменяет возможность переключения при сбое; если вам нужны оба свойства, вы используете системы двух поставщиков и должны закладывать бюджет на два счёта.

Какой из них вам стоит выбрать

Выбирайте Qwen3.8-Max, если вам нужна модель, которую можно прогнозировать, проверять и от которой можно уйти. По прайс-листу её тариф на вывод составляет треть от тарифа Fugu Ultra v2, у неё нет обрыва на длинном контексте, она принимает изображения, видео и PDF, тогда как модальность пула Fugu — это то, что случайно поддерживают лежащие в его основе агенты, она публикует чекпойнт, к которому можно откатиться, она продаётся везде, и у неё есть живая независимая запись, измеряющая то, что реально формирует ваш счёт, — 37,8 токена в секунду и показатель стоимости за задачу, который можно смоделировать до того, как вы примете решение. Её слабые места столь же конкретны, и их стоит назвать: она медленная, занимает 154-е место из 200 по скорости, она чрезвычайно многословна — 180 миллионов токенов в индексе, — а Artificial Analysis отдельно измерила рост её уровня галлюцинаций с 23% до 40% по сравнению с предыдущим поколением, что вызывает серьёзные опасения именно для автономной многошаговой работы, для которой её продвигают. Заложите в бюджет верификатор и агрессивно используйте скидку за глубокий кэш.

Выбирайте Fugu Ultra v2, если ваша работа долгосрочна и проверяема, ваш бюджет исследовательский, а не производственный, и вы находитесь за пределами ЕС/ЕЭЗ. Структурная аргументация в пользу координатора реальна, и примеры самого поставщика последовательно на неё указывают — автоматизированный исследовательский прогон из 123 экспериментов за четырнадцать часов на одном H100, решатель кубика Рубика на чистом Python, который прошёл все 300 перемешанных кубиков, тогда как две анонимизированные фронтирные базовые модели попросту упали. Это отобранные поставщиком примеры с анонимизированными базовыми моделями, и они доказывают меньше, чем кажется, но закономерность связная: в задачах, где корректность проверяема, а трудная часть — настойчивость, порождение верификатора лучше, чем просить одну модель усерднее. Вы покупаете именно эту настойчивость по цене в пять раз выше, чем у Qwen3.8-Max, в системе, качество которой вы не можете проверить аудитом и пул которой вы не можете зафиксировать. Проведите пилот с ограниченным охватом, измеряйте выходные токены на выполненную задачу, а не на токен, и установите потолок до первого запуска.

A screenshot of the OrcaRouter model page for Qwen3.8 Max (English UI, captured September 11, 2026), showing the model title, the 'Featured' badge, the identifier qwen/qwen3.8-max, vision, tools, JSON and reasoning capability tags, a 1M-token context window, text and image and video input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, and an OpenAI-compatible base URL with Python and cURL code samples.

Причина, по которой ценник — неправильное число, заключается в том, что оба этих продукта отвязали стоимость ответа от стоимости токена. Fugu Ultra v2 делает это, распределяя запросы по моделям, которые не назовёт. Qwen3.8-Max делает это, размышляя на протяжении 180 миллионов токенов. Если вы уже знаете свой объём токенов на задачу, арифметика тривиальна, и вам следует это сделать. Большинство команд не знают этого числа, и для них решение сводится к более простому: Qwen3.8-Max — это выбор, который можно проверить, оценить и отбросить, а Fugu Ultra v2 — это выбор, который делает ставку на то, что координация превосходит возможности. Оба варианта обоснованы. Только один из них идёт с квитанциями.

Сравнение в этой статье1

Определено по этой статье · Бенчмарки: Artificial Analysis · обновляется ежедневно