
Fugu Ultra v2 vs Grok 4.6: Fünffacher Ausgabepreis, ein gemeinsamer Benchmark
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiNEUOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleNEUGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenNEUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligenz72Coding
- anthropicNEUAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligenz72Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligenz78Coding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligenz69Coding
Es gibt genau einen Benchmark, für den Fugu Ultra v2 und Grok 4.6 beide eine Zahl veröffentlichen, und das ist DeepSWE: Sakana AI meldet 74,3 für Fugu Ultra v2 in seiner Ankündigung vom 11. September 2026, während das Markteinführungsmaterial von xAI für Grok 4.6 seinen eigenen DeepSWE-v1.1-Wert mit 65,9 % angibt. Das ist eine Lücke von 8,4 Punkten, und es ist der einzige saubere Vergleich, den die beiden Unternehmen bieten. Alles andere, was man gegenüberstellen könnte – Sakanas Chartography und SWEFish gegen Groks GPQA Diamond und CursorBench –, wird mit unterschiedlichen Instrumenten von unterschiedlichen Labors gemessen. Die ehrliche Frage ist also nicht „Welches ist klüger?“, sondern ob der behauptete Vorsprung von Fugu Ultra v2 es wert ist, 30 $ pro Million Ausgabe-Token dafür zu bezahlen, wenn Grok 4.6 6 $ verlangt.
Zwei verschiedene Antworten auf dasselbe Problem
Grok 4.6 ist ein einzelnes Modell und das aktuelle Flaggschiff der Grok-Reihe – in der eigenen Entwicklerdokumentation des Anbieters als „Latest" aufgeführt, als Nachfolger von Grok 4.5 mit demselben Kontextfenster von 500.000 Token, derselben Eingabeoberfläche für Text/Bilder/Dateien und derselben Grundbepreisung. Es hat einen Wissensstand bis zum 1. Februar 2026 und bietet Reasoning-Aufwand in den Stufen low, medium, high und xhigh, wobei high die Standardeinstellung ist. Ein Detail, das viele überrascht: Reasoning lässt sich nicht abschalten. Thinking-Token werden bei jeder Anfrage abgerechnet, wodurch die tatsächlichen Ausgabekosten von Grok 4.6 davon abhängen, wie intensiv es zu denken beschließt.
Fugu Ultra v2 ist im üblichen Sinne überhaupt kein Modell. Es ist die Spitzenfähigkeitsstufe von Sakana AIs Orchestrierungslinie – ein einzelner OpenAI-kompatibler Endpunkt, der eine Aufgabe zerlegt und sie auf einen Pool anderer Modelle verteilt, einige mit offenen Gewichten, einige spezialisiert. Sakana formuliert es so, dass er Ergebnisse auf Frontier-Niveau erreicht, „ohne die unverzichtbare Abhängigkeit von den Frontier-Modellen, die er orchestriert“, und gibt unmissverständlich an, dass Claude Fable 5, Claude Fable 5.1 und GPT-6 Astra aus diesem Pool ausgeschlossen sind. Man bezahlt für die Scheduling-Schicht und für jedes Token, das die Sub-Agenten verbrauchen.
Diese Unterscheidung ist nicht kosmetisch. Sie ist der eigentliche Grund dafür, dass die Preisdifferenz überhaupt existiert, und sie ist das Einzige, was die Differenz verteidigbar macht.
Die Tarifkarten, einschließlich des Teils, der sich wiederholt
• Eingabe — Fugu Ultra v2 5,00 $ pro 1 Mio. vs. Grok 4.6 2,00 $ pro 1 Mio. Fugu ist 2,5× so teuer, bevor überhaupt Sub-Aufrufe stattfinden.
• Ausgabe — Fugu Ultra v2 30,00 $ pro 1 Mio. vs. Grok 4.6 6,00 $ pro 1 Mio. Ein 5-facher Unterschied – und derjenige, der die meisten Rechnungen entscheidet.
• Zwischengespeicherte Eingabe — 0,50 $ pro 1 Mio. bei beiden. Identisch. Zwei Anbieter, die sonst nichts gemeinsam haben, sind beim selben Cache-Lesepreis gelandet, was cache-intensive Agent-Loops zur einzigen Workload macht, bei der die beiden wirklich Zeile für Zeile vergleichbar sind.
• Preisanpassung für langen KontextBei Grok 4.6 verdoppeln sich die Preise auf 4,00 $ / 12,00 $, sobald ein Prompt 200.000 Token überschreitet, und die Preisanpassung gilt für die gesamte Anfrage, nicht nur für den übersteigenden Teil. Die für Fugu Ultra v2 gemeldete Stufe oberhalb von rund 272.000 Eingabe-Token steigt auf etwa 10,00 $ / 45,00 $, ebenfalls für die gesamte Anfrage. Beide bestrafen lange Prompts; Grok bestraft bereits 72.000 Token früher.
• Kontextfenster — Grok 4.6 mit 500K Token vs. Fugu Ultra v2 mit 1M laut Angaben von Drittanbietern. Sakanas Ankündigungsseite nennt überhaupt keine Kontextgröße, daher ist die Angabe von 1M als vom Anbieter unbestätigt zu behandeln.
Die Langkontext-Zeile wirkt in beide Richtungen, und es lohnt sich, die Rechnung dazu aufzumachen. Ein Prompt mit 300K Token kostet Sie $4.00 pro Million Input bei Grok 4.6 und rund $10.00 bei Fugu Ultra v2. Ein Prompt mit 150K Token kostet $2.00 bei Grok und $5.00 bei Fugu. Sakanas Modell ist bei jeder Prompt-Länge teurer — die einzige Frage ist, wie oft es aufgerufen werden muss.

Das Argument dafür, 5× für Output zu zahlen
Das Argument für einen Orchestrator ist nicht, dass er pro Token günstiger ist. Es ist, dass er weniger Versuche braucht und dass die Tokens, die er für die Koordination aufwendet, günstiger sind als die Tokens, die du fürs Scheitern aufwenden würdest.
Das ist ein echtes Argument, und Sakana bringt es ausdrücklich vor: Fugu Ultra v2 zielt auf komplexe mehrstufige Arbeit ab – autonome Forschung, Full-Stack-Entwicklung –, bei der das typische Versagen eines einzelnen Modells darin besteht, auf halber Strecke eines langen Laufs aus der Spur zu geraten. Wenn ein Ausgabepreis von 30 $ Ihnen eine Aufgabe verschafft, die im ersten Durchgang statt im dritten abgeschlossen wird, ist der Aufpreis pro Token irrelevant.
Es gibt unterstützende Belege von Seiten des Anbieters selbst, doch sie sind anbieterfreundlich und sollten auch so gelesen werden. xAIs Einführungsmaterial für Grok 4.6 nennt etwa 53 Turns und rund 0,5 Milliarden Eingabe-Tokens, um Long-Horizon-Aufgaben zu lösen, gegenüber ungefähr 103 Turns und 2,0 Milliarden Eingabe-Tokens für ein konkurrierendes Frontier-Modell – ein Argument dafür, dass Grok selbst pro Aufgabe wirtschaftlich ist, sogar bei einem niedrigen Preis pro Token. Beide Unternehmen machen denselben Schachzug: Sie drängen Sie von der Preisliste weg und hin zu den Kosten pro abgeschlossener Aufgabe.
Das bedeutet, dass die entscheidende Zahl eine ist, die kein Anbieter veröffentlicht und die man selbst messen muss: verbrauchte Tokens, von Anfang bis Ende, bei einer Aufgabe, die der eigenen ähnelt.
Wo jedes Einzelne wirklich schwach ist
Die veröffentlichte Schwachstelle von Grok 4.6 ist Terminal-Arbeit. Sein Ergebnis bei Terminal-Bench v3.0 liegt bei 26 % und damit deutlich hinter der Spitze des Feldes, obwohl dasselbe Modell beim älteren Terminal-Bench v2.1 einen viel stärkeren Wert von 88,4 % erzielt – das sind unterschiedliche Tests, und sie zu vermischen ist ein Fehler, den man in vielen Berichten sehen wird. Außerdem hat es mit 94,9 % den höchsten Wert bei GPQA Diamond in seiner Kohorte, doch GPQA Diamond wurde inzwischen als gesättigt aus dem Artificial Analysis index entfernt, sodass ein hoher Wert dort nicht mehr so zwischen Frontier-Modellen unterscheidet wie noch vor einem Jahr.
Auf unabhängiger Seite bewertet Artificial Analysis Grok 4.6 mit 44 auf seinem v4.3 Intelligence Index, auf Rang #20 von 200, bei Kosten von 1,86 $ pro Aufgabe. Die häufig kursierende Zahl 61 stammt aus einer überholten Indexskala und sollte nicht zitiert werden, ohne anzugeben, welche Version sie hervorgebracht hat.
Die Schwachstelle von Fugu Ultra v2 ist die Verifizierung. Zum Zeitpunkt der Veröffentlichung wurde nichts von dem, was Sakana dazu behauptet hat – die fünf besten bzw. gleichauf besten Ergebnisse, der Chartography-Wert von 48,3 gegenüber 27,3 bei Opus 5 und 29,5 bei Fable 5, der DeepSWE-Wert von 74,3 – unabhängig reproduziert. Es gibt auch keine veröffentlichten Latenz- oder Durchsatzwerte, was für einen Orchestrator stärker ins Gewicht fällt als für ein einzelnes Modell, weil seine Antwortzeit vollständig davon abhängt, was es aufzurufen beschließt. Für das vorherige Fugu Ultra berichteten Tester öffentlich von Läufen, die sich bis auf rund 30 Minuten erstreckten; das ist das Modell von Juni 2026, nicht v2, aber das ist der Fehlermodus, auf den getestet werden sollte, bevor man einen Produktionspfad festschreibt.

Ein Hinweis zum Anbieternamen
Eine Besonderheit, die Sie kennen sollten, bevor Sie in einer Entwicklerkonsole nach Grok 4.6 suchen: Das Modell wird durchgängig Grok 4.6 genannt, doch das Branding des Anbieters darum herum ist im Umbruch. Die eigene Dokumentation von xAI trägt inzwischen den Namen SpaceXAI, eine Änderung, mit der die meisten Launch-Berichte noch nicht Schritt gehalten haben. Die Modell-IDs und die API-Oberfläche sind unverändert — Grok 4.6 ist ein vollwertiges OpenAI-Responses-Modell und fügt sich ohne Übersetzungsschicht in bestehende Tool-Calling-Schleifen ein — aber wenn Sie nach einer Modellkarte suchen und das Branding falsch aussieht, ist das nicht Ihr Fehler.
Eine dieser beiden in der Praxis aufrufen
Grok 4.6 ist auf OrcaRouter zum Tarif des Anbieters selbst verfügbar — 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token, ohne Aufschlag durchgereicht, sodass eine Preisänderung des Anbieters noch am selben Tag hier ankommt und nicht erst nach einem Migrationsplan. Es ist OpenAI-kompatibel unter derselben Basis-URL wie alles andere im Katalog, was bedeutet, dass Sie es hinter eine Fallback-Kette oder eine Routing-Regel setzen können, statt es fest zu verdrahten, und Sie können es gegen ein anderes Modell A/B-testen, ohne einen zweiten Vertrag oder eine Codeänderung.
Fugu Ultra v2 wird nicht von uns geroutet. Es ist über die eigene OpenAI-kompatible API von Sakana AI verfügbar, und das Unternehmen sagt, dass eine bestehende Fugu-Integration mit einer einzigen Parameteränderung darauf umzieht. Wenn Sie die beiden mit Ihrer Arbeitslast vergleichen möchten, ist die günstigste Lösung, Grok 4.6 auf Ihrem Gateway zu belassen und Fugu Ultra v2 direkt von Sakana hinter einem Feature-Flag aufzurufen — beide verwenden dasselbe Request-Format, sodass dasselbe Test-Harness für beide funktioniert.

Das Urteil
Grok 4.6ist die vernünftige Standardwahl für die meisten Teams, und beim Preis ist der Abstand alles andere als knapp. Bei $2,00 / $6,00 mit $0,50 pro Cache-Lesevorgang und einem 500K-Fenster bewältigt es Reasoning über lange Dokumente, Coding-Agenten und multimodale Dateiarbeit zu einem Fünftel der Output-Rate von Fugu Ultra v2, und es wird unabhängig bewertet und unabhängig gebenchmarkt. Seine Schwachstelle ist die Prompt-Länge — die 200K-Klippe verdoppelt die gesamte Anfrage — sowie stark terminallastige Agenten-Schleifen, in denen seine veröffentlichten Werte nicht konkurrenzfähig sind.
Fugu Ultra v2 ist seinen Aufpreis nur wert, wenn Sie eine bestimmte Art von Arbeitslast haben: lange, mehrstufige, autonomielastige Aufgaben, bei denen ein einzelnes Modell dazu neigt, aus der Bahn zu geraten, und bei denen Sie außerdem die architektonische Eigenschaft wollen, die Sakana verkauft – eine Fähigkeitsstufe, die nicht davon abhängt, dass ein Frontier-Anbieter verfügbar oder günstig bleibt. Das ist ein echtes Bedürfnis. Aber es ist eine Behauptung, noch keine Messung, und die DeepSWE-Lücke, die sie glaubwürdig erscheinen lässt, ist ein einziger Benchmark von einem einzigen Anbieter am Tag der Veröffentlichung.
Wenn Sie nicht sagen können, welche Ihrer Aufgaben derzeit beim zweiten oder dritten Versuch fehlschlägt, haben Sie noch nicht die Zahl, die den Preisunterschied rechtfertigen würde. Messen Sie das zuerst. Die Tarifkarten sagen Ihnen bereits alles andere.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
