
Fugu Max vs. Qwen3.8-Max: Gleicher Preis, gleicher Benchmark, eine veröffentlichte Zahl
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Fugu Max und Qwen3.8-Max werden zum selben Tarif gelistet: 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens. Sakana AI veröffentlichte Fugu Max am 11. September 2026, und Alibaba stellt Qwen3.8-Max seit Anfang August bereit, und die beiden Anbieter landeten aus entgegengesetzten Richtungen bei einer identischen Preisliste – der eine bepreist eine Routing-Richtlinie, der andere ein 2,4-Billionen-Parameter-Modell. Der Gleichstand nimmt den Preis vollständig aus der Entscheidung heraus, was ungewöhnlich sauber ist. Was bleibt, sind Belege, und darin unterscheiden sich die beiden Seiten stärker als irgendwo sonst. Beide Anbietertabellen nennen Terminal Bench 2.1. Alibaba gibt für Qwen3.8-Max 86,6 an. Sakana sagt, Fugu Max erziele die beste Gesamtpunktzahl bei Terminal Bench 2.1, und nennt überhaupt keine Zahl – weder für diesen Test noch für die anderen fünf, die es zu gewinnen behauptet.
Der eine Maßstab, den beide Seiten nennen
Dies ist das gesamte Matchup, komprimiert in eine einzige Zeile, also lohnt es sich, präzise zu sein.
Sakanas Veröffentlichung listet sechs Benchmarks auf, bei denen Fugu Max die beste Gesamtpunktzahl erzielt: Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench und SWEFish. Fünf sind anerkannte öffentliche Evaluierungen, und die sechste, SWEFish, ist Sakanas eigener Coding-Benchmark. Für keine der sechs nennt die Veröffentlichung einen Wert, einen Abstand oder die Zahl eines Wettbewerbers, die man danebenstellen könnte. Die parallele Behauptung – dass Fugu Max die Kosten-Leistungs-Pareto-Grenze bei sieben von zehn Benchmarks erweitert – ist ebenfalls eine Aussage über die Position in einem Diagramm statt über einen Punkt auf einer Achse.
Alibabas veröffentlichte Zeilen für Qwen3.8-Max umfassen Terminal-Bench 2.1 mit 86,6, OSWorld-Verified mit 86,1, GPQA Diamond mit 92,6 und SWE-bench Pro mit 67,7. Alles vom Anbieter gemeldet, alles Zahlen. Auf dem einzigen Test also, den beide Unternehmen zu nennen wählten, hat das eine eine Zahl veröffentlicht und das andere einen Rang. Daraus kann man nicht schließen, welches System besser ist – Sakanas „best overall“ könnte 91 oder 87 bedeuten. Was man schließen kann, ist, dass zum Zeitpunkt der Veröffentlichung keine öffentlichen Belege die Frage beantworten und der Anbieter mit der größeren Behauptung derjenige ist, der darauf verzichtet, sie zu beziffern.
Identische Preise, gegensätzliche Konstruktion
• Eingabe — Fugu Max 2,00 $ pro 1 Mio. Token vs. Qwen3.8-Max 2,00 $ pro 1 Mio. Token
• Ausgabe — Fugu Max 6,00 $ pro 1 Mio. Token vs. Qwen3.8-Max 6,00 $ pro 1 Mio. Token
• Gecachte Eingabe — Fugu Max 0,25 $ pro 1 Mio. Tokens vs. Qwen3.8-Max 0,25 $ pro 1 Mio. Tokens, und Artificial Analysis misst unabhängig einen Cache-Rabatt von 88 Prozent auf der Qwen-Seite
• Zuschlag für lange Prompts — Fugu Max: im Release keine Stufe angegeben vs. Qwen3.8-Max: pauschal bis zum Fenster, ohne Zuschlag
• Kontext und Ausgabe — Fugu Max: keine der beiden Angaben veröffentlicht; im Gegensatz zu Qwen3.8-Max: ein 1M-Token-Fenster mit einer Ausgabegrenze von etwa 128K
• Eingabemodalität — Fugu Max Text, dahinter die eigenen Fähigkeiten des Pools, vs. Qwen3.8-Max Text, Bild, Video und PDF
• Architektur — Fugu Max, ein trainierter Koordinator über einen nicht offengelegten Pool, für Max erweitert um Open-Weights- und spezialisierte Modelle, darunter die NVIDIA Nemotron-Familie durch eine Zusammenarbeit mit NVIDIA vs. Qwen3.8-Max: ein Sparse-Mixture-of-Experts-Modell mit insgesamt ungefähr 2,4 Billionen Parametern und etwa 95 Milliarden aktiven Parametern pro Token
• Gewichte — Fugu Max geschlossen, Pool-Mitgliedschaft bewusst nicht offengelegt, im Gegensatz zu den offenen Gewichten von Qwen3.8-Max, die für den Checkpoint der Max-Klasse unter einer eigenen Lizenz veröffentlicht wurden
• Unabhängige Bewertung — Fugu Max: keine veröffentlicht, und es gibt keine Seite von Artificial Analysis für irgendein Fugu-Modell, während Qwen3.8-Max ein aktiver Eintrag bei Artificial Analysis mit veröffentlichten Angaben zu Geschwindigkeit, Ausführlichkeit und Kosten pro Aufgabe ist
Vier dieser Zeilen lauten auf der Fugu-Seite „nicht veröffentlicht“ und tragen auf der Qwen-Seite eine Zahl. Wenn die Sätze identisch sind, ist das der gesamte Vergleich: Für dasselbe Geld bekommt man ein System, das man beschreiben kann, und eines, das man nicht beschreiben kann.

Hinter einer Spalte steht ein Dritter
Artificial Analysis bewertet Qwen3.8-Max mit 40 im überarbeiteten v4.3 Intelligence Index, auf Rang #30 von 200, mit Kosten von 2,67 $ pro Intelligence-Index-Aufgabe und 37,8 Ausgabe-Tokens pro Sekunde – langsam genug für Rang #154 von 200 bei der Geschwindigkeit. Derselbe Eintrag verzeichnet 180 Millionen über den Index generierte Ausgabe-Tokens, mehr als doppelt so viele wie die 89 Millionen des Medianmodells, sowie einen Cache-Rabatt von 88 Prozent.
Bevor irgendetwas davon zitiert wird, sind zwei Korrekturen anzubringen. Die erste: Die weithin verbreitete Zahl 58 – oder 58,1 oder 58,4 – für Qwen3.8-Max stammt aus der Zeit vor der Neukalibrierung des Index durch Artificial Analysis im September 2026, und die Live-Seite trägt das „Updated“-Badge, das eine neu ausgewiesene Punktzahl kennzeichnet. Die älteren Berichte wiesen außerdem eine andere Aufwandslast aus der früheren Skala aus: 64 Turns pro Aufgabe gegenüber 14 für die vorherige Qwen-Generation bei ungefähr 1,14 $ pro Intelligence-Index-Aufgabe; die aktuelle Seite zeigt 2,67 $. Die zweite ist eine echte Warnung und kein Skalenartefakt: Artificial Analysis hat separat gemessen, dass die Halluzinationsrate von Qwen3.8-Max gegenüber der vorherigen Generation von 23 Prozent auf 40 Prozent gestiegen ist. Für ein Modell, das für autonome mehrstufige Arbeit vermarktet wird, sind das Kosten, die man in Verifizierern einplant, keine Fußnote.
Fugu Max hat keinerlei eigenständigen Eintrag. Jede Zahl, die ihm zugeordnet wird, stammt von Sakana, und zum Zeitpunkt des Schreibens existiert weder für Fugu Max noch für eines seiner Geschwister eine Seite bei Artificial Analysis. Das ist kein Vorwurf – ein vor wenigen Stunden veröffentlichtes Modell wird keine Berichterstattung durch Dritte haben –, aber es bedeutet, dass die beiden Spalten nicht gleichermaßen überprüfbar sind, und das wird so bleiben, bis jemand außerhalb von Sakana das Ding laufen lässt.
Zwei Wege, zu viel auszugeben
Beide dieser Systeme haben die Kosten einer Antwort von den Kosten eines Tokens entkoppelt, und sie tun es in entgegengesetzte Richtungen. Qwen3.8-Max ist sparsam bei den Tokens und verschwenderisch bei der Antwort: 180 Millionen Ausgabe-Tokens im Intelligence Index, doppelt so viel wie der Median, bei 2,67 US-Dollar pro Aufgabe. Es arbeitet lange, statt groß zu sein, und der Cache-Rabatt von 88 Prozent ist der Hebel, der die Rechnung bestimmt — ein langer Agentenlauf, der denselben Kontext immer wieder liest, bleibt günstig, einer, der ständig frischen Text generiert, nicht.
Fugu Max ist pro Token teuer und in seinen Antworten unvorhersehbar. Sein Koordinator startet Sub-Agenten, von denen jeder Reasoning- und Ausgabetext verfasst, der mit $6.00 pro Million abgerechnet wird, plus die eigene Synthese des Koordinators. Sakana sagt zu, dass Multi-Agenten-Läufe mit einem einheitlichen Mischpreis abgerechnet werden, der an das leistungsstärkste beteiligte Modell gekoppelt ist, und dass das Hinzufügen von Agenten die Rechnung nicht vervielfacht, was die Worst-Case-Fan-out-Explosion beseitigt, die naive Multi-Agenten-Systeme unbezahlbar macht. Es beseitigt das Volumen nicht. Und zur Volumenfrage schweigt sich die Veröffentlichung auf eine Weise aus, die von Bedeutung ist: Sakanas eigene Berichterstattung gibt an, dass ein Modellwechsel mitten in einer Aufgabe die Wiederverwendung des Kontext-Caches verringern und zusätzliche Orchestrierungs-Tokens erzeugen kann, und bestätigt, dass das Unternehmen nicht die Cache-Trefferrate von Max oder seine Gesamtkosten pro Aufgabe in Token offengelegt hat.
Der gleiche Satz von 2,00 $ / 6,00 $ ist also auf der einen Seite eine vorhersagbare Zahl und auf der anderen ein unbegrenztes Vielfaches mit einer Untergrenze. Die Ausführlichkeit von Qwen3.8-Max ist messbar, bevor man sich festlegt; die von Fugu Max nicht.
Der Notausstieg-Test
Hier kehrt sich das übliche Lock-in-Argument um, und es ist das Nützlichste an dieser Paarung.
Sakanas Argument für Fugu Max ist Resilienz. Ein Pool, der Open-Weights- und spezialisierte Modelle umfasst und für Max um die NVIDIA-Nemotron-Familie erweitert wurde, bedeutet, dass kein einzelner Frontier-Anbieter mit Abkündigung, Preisänderung oder regionalem Rückzug Ihr Produkt lahmlegen kann – eine echte Absicherung, und eine, mit der das Unternehmen offen wirbt. Doch die Absicherung ist von außen nicht überprüfbar. Sie können den Pool nicht einsehen, kein Mitglied hinzufügen oder entfernen, nichts davon selbst hosten und ihn in der EU/dem EWR überhaupt nicht betreiben. Ein Versprechen über einen Pool, den Sie nicht inspizieren dürfen, ist eine schwächere Garantie, als es klingt.
Qwen3.8-Max führt das Argument in die andere Richtung. Es ist das Modell eines einzigen Anbieters und damit den Entscheidungen eines einzigen Anbieters ausgesetzt – doch Alibaba hat offene Gewichte für den Checkpoint Qwen3.8-2.4T-A95B der Max-Klasse unter einer eigenen Lizenz veröffentlicht, was bedeutet, dass der Ausweg real und nicht bloß rhetorisch ist: Sollten sich Preise oder Bedingungen ändern, kann das Modell aus der eigenen Infrastruktur heraus betrieben werden. Für ein Team, dessen eigentliche Angst ist, dass ein Anbieter den Teppich unter ihm wegzieht, schlägt ein herunterladbarer Checkpoint jede Beschreibung eines Pools.
Einen von beiden anrufen
Qwen3.8-Max ist in unserem Katalog für 2,00 $ Input und 6,00 $ Output pro Million Tokens, was Alibabas Listenpreis mit 0 % Aufschlag entspricht, sodass eine Preisänderung des Anbieters noch am selben Tag auf demselben Schlüssel landet und nicht erst nach einem Migrationsplan. Es ist OpenAI-kompatibel unter derselben Base-URL wie der Rest des Katalogs, was bedeutet, dass Sie es hinter eine bedingte Routing-Regel, eine Failover-Kette oder ein Modell-Fusion-Panel hängen können – ohne zweiten Vertrag oder Codeänderung – und das automatische Failover deckt einen ratenbegrenzten oder beeinträchtigten Anbieterpfad ab. In den letzten sieben Tagen liefen 127,7 Millionen Tokens über das Gateway.
Fugu Max ist nicht auf OrcaRouter. Es erreicht Sie über Sakanas eigene OpenAI-kompatible API und mehrere Drittanbieter-Plattformen, und das Unternehmen sagt, dass eine bestehende Fugu-Integration mit einer einzeiligen Parameteränderung aktualisiert werden kann. Da beide dasselbe Anfrageformat sprechen, ist der kostengünstigste Weg, die Benchmark-Lücke zu klären, nicht länger darauf zu warten, dass Sakana sie veröffentlicht: Lassen Sie beide hinter einem Flag auf Ihrer eigenen Arbeitslast laufen und zählen Sie die Ausgabe-Tokens pro abgeschlossener Aufgabe. Das ist die Messung, die keiner der beiden Anbieter geliefert hat.

Welches, und wann
Qwen3.8-Max ist die Wahl, die Sie auditieren, bepreisen und aufgeben können. Bei identischer Preisliste bietet es Ihnen ein 1M-Token-Fenster ohne Lang-Prompt-Zuschlag, Bild-, Video- und PDF-Eingabe, einen herunterladbaren Checkpoint der Max-Klasse, einen unabhängigen Live-Eintrag, der die Dinge misst, die Ihre Rechnung bestimmen, und 88 Prozent Rabatt auf zwischengespeicherte Eingaben. Seine Kosten sind ebenso konkret: Es ist langsam mit 37,8 Token pro Sekunde, rangiert in puncto Geschwindigkeit nahe dem unteren Ende des Feldes, ist enorm geschwätzig mit 180 Millionen Token im Index, und seine gemessene Halluzinationsrate hat sich gegenüber der vorherigen Generation etwa verdoppelt — was genau für die autonome Arbeit, für die es verkauft wird, ein ernstes Problem darstellt. Nutzen Sie den Cache-Rabatt intensiv und kalkulieren Sie einen Verifier ein.
Fugu Max ist die Wette darauf, dass Koordination Fähigkeit schlägt. Wenn deine Arbeit langfristig angelegt und überprüfbar ist und ein Koordinator, der einen Verifizierer startet, Aufgaben erledigt, an denen ein einzelnes Modell zweimal scheitert, dann sind die Orchestrierungs-Tokens billiger als die Wiederholungsversuche, und die identische Preisliste ist keineswegs ein Gleichstand. Was du kaufst, ist Persistenz – in einem System, dessen Pool du nicht festlegen kannst, dessen Kontextfenster nicht veröffentlicht ist und dessen sechs Benchmark-Siege ohne zugehörige Werte dastehen – von einem Anbieter, der sich dafür entschied, den Test zu benennen und die Zahl zurückzuhalten.
Beide Produkte kosten pro Token gleich viel. Nur eines davon verrät dir, was du dafür bekommst.

