Eine Hero-Titelkarte mit der Aufschrift „Fugu Max vs Grok 4.6“ und dem Untertitel „Identische Tarifkarten, ein veröffentlichter Score“, drei Pillen-Badges mit der Aufschrift „$2.00 vs $2.00 Eingabe“, „$6.00 vs $6.00 Ausgabe“ und „Sechs Siege, null Zahlen“, eine Fußzeile mit der Aufschrift „Sakana AI, September 2026 vs SpaceXAI, August 2026“ sowie das OrcaRouter-Logo in der unteren rechten Ecke.
Guides & Insights

Fugu Max vs. Grok 4.6: Identische Tarifkarten, ein veröffentlichter Score

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Fugu Max und Grok 4.6 kosten exakt dasselbe. Sakana AI brachte Fugu Max am 11. September 2026 heraus, zum Preis von 2,00 $ pro Million Eingabe-Tokens und 6,00 $ pro Million Ausgabe-Tokens – und das ist Zeile für Zeile die Preisliste, die SpaceXAI für Grok 4.6 seit dessen Start am 12. August berechnet. Die Übereinstimmung ist der nützlichste Fakt in diesem Duell, denn sie streicht den Preis aus der Argumentation. Wenn zwei Produkte identisch abgerechnet werden, bleibt als einzige Frage, was man für das Geld bekommt, und genau dort trennen sich die beiden vollständig. Grok 4.6 ist ein einzelnes Modell, das man per Version festnageln, für das man eine Benchmark-Tabelle lesen und das man gegen einen unabhängigen Index prüfen kann. Fugu Max ist ein trainierter Koordinator, der jede Aufgabe an das günstigste Modell in seinem Pool weiterleitet, und Sakanas Ankündigung behauptet, dass es in sechs Benchmarks die beste Gesamtpunktzahl erzielt, ohne eine Zahl aus einer von ihnen zu nennen. Einer dieser Käufe ist messbar, bevor man ihn tätigt. Der andere nicht.

Zwei Produkte, eine Preisliste

• Eingabe — Fugu Max 2,00 $ pro 1 Mio. Tokens vs. Grok 4.6 2,00 $ pro 1 Mio. Tokens

• Ausgabe — Fugu Max 6,00 $ pro 1 Mio. Tokens vs. Grok 4.6 6,00 $ pro 1 Mio. Tokens

• Zwischengespeicherte Eingabe — Fugu Max 0,25 $ pro 1 Mio. Token vs. Grok 4.6 0,50 $ pro 1 Mio. Token, die einzige Zeile, in der sich die beiden Preise überhaupt unterscheiden

• Kontextfenster — Fugu Max vom Anbieter nicht veröffentlicht vs. Grok 4.6 500.000 Tokens, unverändert gegenüber Grok 4.5

• Neupreisgestaltung für lange Prompts — Fugu Max: keine Tarifstufe im Release genannt vs. Grok 4.6 verdoppelt sich auf 4,00 $ / 12,00 $, sobald eine einzelne Anfrage 200.000 Token überschreitet, angewendet auf die gesamte Anfrage statt nur auf die Überschreitung

• Reasoning-Steuerung — Fugu Max nicht verfügbar vs. Grok 4.6 mit vier Effort-Stufen, von low bis xhigh, standardmäßig auf high und nicht abschaltbar

• Architektur — Fugu Max: ein trainierter Koordinator über einen nicht offengelegten Pool, der Open-Weights- und spezialisierte Modelle umfasst, für Max um die NVIDIA Nemotron-Familie durch eine Zusammenarbeit mit NVIDIA erweitert, gegenüber Grok 4.6: ein Modell in einer Version

• Unabhängige Bewertung — für Fugu Max wurde keine veröffentlicht, und es gibt keine Artificial-Analysis-Seite für irgendein Fugu-Modell vs. Grok 4.6 mit einem Live-Artificial-Analysis-Intelligence-Index von 44, Rang #20 von 200

Die billige Spalte ist die unvorhersagbare.

Schauen Sie sich an, wo Fugu Max beim Preis tatsächlich punktet: beim Cache-Read, zu der Hälfte von Grok 4.6. Das ist ein echter Vorteil, und es ist genau der falsche Ort, um ein Kostenmodell darauf aufzubauen, denn Cache-Preise zahlen sich nur im Verhältnis zu Ihrer Cache-Trefferquote aus – und Sakana veröffentlicht keine für Fugu Max. Die Veröffentlichung nennt auch kein Kontextfenster, keine Long-Context-Stufe und keine Obergrenze für die Ausgabe. Die eine Spalte, in der Fugu Max Grok 4.6 unterbietet, ist also ein Rabatt unbekannter Höhe auf einen unbekannten Anteil Ihrer Tokens.

Die Schwächen von Grok 4.6 sind zumindest sichtbar. Seine Schwelle von 200.000 Token ist aggressiv – sie bepreist die gesamte Anfrage neu, sodass ein Prompt mit 250.000 Token ab dem ersten Token zum doppelten Satz abgerechnet wird, nicht erst ab dem 200.001sten. Aber man kann die Klippe sehen, seine Prompts daran messen und entscheiden, ob man aufteilt. Das ist hier der Unterschied der Art: Das eine System veröffentlicht einen Preisplan mit einer Struktur, um die man herum planen kann, und das andere veröffentlicht einen Schlagzeilen-Tarif, dem kein Plan beigefügt ist.

Sechs Siege und kein einziger Treffer

Die Benchmarks, die Sakana nennt, sind Terminal Bench 2.1, GPQAD, AA-LCR, GDP.pdf, AutomationBench und SWEFish. Fünf davon sind anerkannte öffentliche Evaluierungen. Der sechste, SWEFish, ist Sakanas eigener Coding-Benchmark, was bedeutet, dass einer der sechs beanspruchten Siege anhand eines Tests bewertet wird, den der Anbieter selbst geschrieben und nicht veröffentlicht hat. Zu den anderen fünf heißt es in der Mitteilung lediglich, Fugu Max erziele die insgesamt beste Punktzahl – und dabei bleibt es: keine Punktzahl, kein Vorsprung, keine Zahl eines Wettbewerbers, die man danebenstellen könnte.

Vergleichen Sie das mit der Tabelle, die SpaceXAI für Grok 4.6 veröffentlicht hat, die durchweg vom Anbieter angegeben ist, aber zumindest eine Tabelle darstellt: GDPVal-AA v2 bei 1.753, AA-Briefcase bei 1.577, DeepSWE v1.1 bei 65,9 %, CursorBench v3.2 bei 69,9 % und GPQA Diamond bei 94,9 %. Das Launch-Material berichtet außerdem von etwa 53 Turns und rund einer halben Milliarde Eingabe-Token, um Long-Horizon-Aufgaben auf AA-Briefcase zu lösen, gegenüber etwa 103 Turns und zwei Milliarden Token für ein konkurrierendes Frontier-Modell – ein Argument, wiederum vom Anbieter angegeben, dass Grok pro abgeschlossener Aufgabe günstig ist, selbst bei einem bescheidenen Preis pro Token.

Zwei dieser Grok-Zahlen müssen eingeordnet werden, bevor Sie sie zitieren. Die erste: Der plakative GPQA-Diamond-Wert von 94,9 % stammt aus einem Benchmark, den Artificial Analysis inzwischen als gesättigt zurückgezogen hat – er trennt Frontier-Modelle nicht mehr so wie einst. Die zweite ist die Zahl, die Ihnen in älteren Berichten begegnen wird: ein Artificial Analysis Intelligence Index von 61 für Grok 4.6. Das war die Skala vor der Neuberechnung. Artificial Analysis hat den Index im September 2026 neu kalibriert, und der aktuelle Wert liegt bei 44 auf Platz 20 von 200, bei Kosten von 1,86 $ pro Intelligence-Index-Aufgabe. Wer Grok 4.6 anhand einer 61 gegen Claude Fable 5 oder GPT-5.6 Sol einordnet, vergleicht Messwerte von zwei verschiedenen Instrumenten.

A two-column scoreboard titled 'Fugu Max vs Grok 4.6 - the scoreboard' contrasting six dimensions. Fugu Max: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.25 per 1M, context not published, benchmarks six wins with no figures, evidence vendor-reported only. Grok 4.6: output price $6.00 per 1M, input price $2.00 per 1M, cached input $0.50 per 1M, context 500K with a 200K repricing cliff, benchmarks GDPVal 1,753 and DeepSWE 65.9%, evidence Artificial Analysis Index 44 ranked #20 of 200. Footer reads 'Fugu Max figures vendor-reported by Sakana AI; Grok 4.6 rows SpaceXAI-reported and per Artificial Analysis. No independent Fugu Max evaluation exists.' OrcaRouter logo bottom-right.

Was im Token-Preis eines Orchestrators nicht enthalten ist

Sakanas eigene Berichterstattung über die Veröffentlichung räumt das strukturelle Problem ein. Weil Fugu Max innerhalb einer einzigen Aufgabe zwischen Modellen wechselt, „kann es die Wiederverwendung des Kontext-Caches verringern und zusätzlich Orchestrierungs-Tokens erzeugen“ – und das Unternehmen hat weder die daraus resultierende Cache-Trefferrate noch die gesamten Token-Kosten pro Aufgabe offengelegt. Jeder Agent, den der Koordinator startet, schreibt Reasoning- und Ausgabetext, und all das wird mit $6.00 pro Million abgerechnet. Der Tarif ist identisch mit dem von Grok 4.6. Das Volumen ist es nicht, und das Volumen ist die Variable, die eine Preisseite Ihnen nicht zeigen kann.

Beide Anbieter drängen Sie zu derselben Korrektur – hören Sie auf, Preise zu vergleichen, und beginnen Sie, die Kosten pro fertiggestelltem Auftrag zu vergleichen –, doch nur einer von ihnen liefert Ihnen eine Zahl, mit der Sie anfangen können. Grok 4.6 kommt mit einem veröffentlichten Turns-und-Tokens-Profil. Fugu Max kommt mit der Anweisung, es selbst zu messen.

Es gibt eine faire Lesart für das Schweigen von Fugu Max, und sie verdient es, ausgesprochen zu werden. Max ist die kostenoptimierte Stufe der Fugu-Reihe und erschien am selben Tag wie Fugu Ultra v2, der Leistungsschub mit 5,00 $ für Eingabe und 30,00 $ für Ausgabe. Sakanas visuelles Argument für Max ist ein Pareto-Diagramm – Fähigkeit gegen Kosten –, und in einem Pareto-Diagramm ist ein roher Benchmark-Wert nebensächlich; der Score pro Dollar ist die ganze Behauptung. Wenn das das Argument ist, wäre das Abdrucken von sechs gewinnenden Benchmark-Werten ohne ihre Kosten das irreführende Diagramm, nicht das fehlende. Was die Veröffentlichung einem Käufer noch schuldet, ist ein Nenner, und sie liefert keinen.

Wo Grok 4.6 wirklich exponiert ist

Terminalarbeit ist die schwächste veröffentlichte Disziplin von Grok 4.6. Der Wert bei Terminal-Bench v3.0 liegt bei 26 % und damit deutlich hinter der Spitze des Feldes. Vorsicht bei der benachbarten Zahl: Dasselbe Modell erreicht 88,4 % bei Terminal-Bench v2.1, und das sind unterschiedliche Tests. In der Berichterstattung werden die beiden oft vermischt, und diese Vermischung schmeichelt Grok erheblich.

Die zweite Schwachstelle besteht darin, dass sich das Reasoning nicht abschalten lässt. Thinking-Tokens werden bei jeder Anfrage abgerechnet, sodass die effektiven Ausgabekosten von Grok 4.6 davon abhängen, wie intensiv das Modell über deinen Prompt nachzudenken beschließt. Der Effort-Regler gibt dir am unteren Ende Kontrolle, doch eine Null-Einstellung gibt es nicht.

Dagegen hat Grok 4.6 etwas, das Fugu Max derzeit zu keinem Preis bieten kann: eine Zahl. Jede Zeile oben kann von Dritten überprüft werden, und der Eintrag bei Artificial Analysis bedeutet, dass bereits eine überprüft wurde. Fugu Max' sechs Siege wurden am selben Tag wie das Modell veröffentlicht, von dem Unternehmen, das es entwickelt hat, und zum Zeitpunkt des Schreibens hat niemand außerhalb von Sakana es ausgeführt.

Den einen rufen, den anderen steuern

Grok 4.6 ist auf OrcaRouter zum Listenpreis von SpaceXAI verfügbar — $2,00 pro Million Input-Tokens, $0,50 bei einem Cache-Hit, $6,00 pro Million Output-Tokens — mit 0 % Aufschlag durchgereicht, sodass eine Preisänderung des Anbieters noch am selben Tag unser Gateway erreicht und nicht erst nach einem Migrationszeitplan. Es ist OpenAI-kompatibel unter derselben Basis-URL wie der Rest des Katalogs, was bedeutet, dass Sie es in eine Failover-Kette oder hinter eine bedingte Routing-Regel setzen können, statt einen Anbieter fest in einen Produktionspfad zu verdrahten, und Sie können es ohne einen zweiten Vertrag gegen ein anderes Modell A/B-testen. In den letzten sieben Tagen hat es 46,6 Millionen Tokens durch das Gateway geleitet.

Fugu Max ist nicht in unserem Katalog. Es erreicht Sie über Sakanas eigene OpenAI-kompatible API und mehrere Drittanbieter-Plattformen, und das Unternehmen sagt, dass eine bestehende Fugu-Integration mit einer einzigen Parameteränderung darauf umgestellt werden kann. Da beide dasselbe Anfrageformat sprechen, ist eine Evaluierung, die sie hinter einem einzigen Flag zusammenführt, eher ein Austausch der Basis-URL als ein Rewrite – was der richtige Weg ist, diese spezielle Streitfrage zu klären, denn es geht um Tokens pro abgeschlossener Aufgabe, und nur Ihre eigene Arbeitslast kann diese Zahl liefern.

A screenshot of the Sakana AI announcement page (English UI, captured September 11, 2026) headed 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' and dated September 11, 2026, showing the introductory argument that a system deploying a multi-trillion-parameter model for a simple lookup is wasteful, and a cost-versus-performance chart placing Fugu Max on a frontier formed by Fugu models above the frontier formed by single models.

Welches soll ich kaufen?

Grok 4.6 ist der verteidigbare Standard. Bei einer Preisliste, die identisch mit der von Fugu Max ist, bietet es Ihnen ein 500K-Kontextfenster, mit dem Sie planen können, eine Version, die Sie pinnen können, vier Stufen der Reasoning-Kontrolle, eine unabhängige Index-Platzierung bei 44 mit einer Kosten-pro-Aufgabe-Zahl daneben und Monate an Messungen durch Dritte. Seine Kosten sind konkret und bekannt: die 200K-Preisanpassungsklippe, Reasoning, das immer berechnet wird, und ein Terminal-Arbeitsprofil, das hinter dem Feld zurückbleibt.

Fugu Max ist die interessantere Wette und – nach der verfügbaren Beweislage – die weniger nachprüfbare. Die Design-Begründung ist stichhaltig: Wenn ein Koordinator zuverlässig das günstigste Modell auswählt, das Ihre Aufgabe erledigen kann, sinken Ihre Mediankosten pro abgeschlossenem Auftrag selbst dann, wenn Ihre Preisliste nicht sinkt. Doch bei 2,00 $ / 6,00 $ liegt der Tokenpreis nicht dort, wo Fugu Max’ Vorteil liegt; dieser Preis entspricht genau dem von Grok 4.6. Der Vorteil muss daraus entstehen, weniger Token zu verbrauchen, und Sakana hat die Messung nicht veröffentlicht, die zeigen würde, dass dies der Fall ist.

Führen Sie den Vergleich also so durch, wie beide Anbieter es von Ihnen verlangen. Setzen Sie Grok 4.6 auf Ihr Gateway, rufen Sie Fugu Max hinter einem Feature-Flag auf und zählen Sie die Ausgabe-Tokens pro abgeschlossener Aufgabe bei Arbeit, die Ihrer ähnelt. Wenn Fugu Max mit weniger Tokens abschließt als ein einzelnes Modell zum selben Tarif, dann sind der Cache-Rabatt und die Koordination echtes Geld wert, und der Wechsel ist gerechtfertigt. Wenn nicht, zahlen Sie identische Tarife für ein System, dessen Zusammensetzung sich unter Ihnen ändern kann, ohne dass sich seine Versionsnummer ändert.

Für alles, was Sie in diesem Quartal ohne diese Messung entscheiden können, beginnen Sie mit dem Modell, das über eine Anzeigetafel verfügt.

A screenshot of the OrcaRouter model page for Grok 4.6 (English UI, captured September 11, 2026), showing the NEW and Featured badges, the identifier grok/grok-4.6, by SpaceXAI dated 2026-08-12, vision, tools, JSON and reasoning capability tags, a 500K-token context window with text, image and file input, a p50 TTFT of 10.00 seconds, list pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens, traffic of 46.6 million tokens over 7 days, and an OpenAI-compatible base URL with Python and cURL code samples.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert