Eine Hero-Titelkarte für „Fugu Max vs GLM-5.3“ mit dem Untertitel „Das Wertmodell wird vom Volumenmodell unterboten“, drei Pill-Badges mit der Aufschrift „$6.00 vs $3.96 Ausgabe“, „7.962,7 Mio. Token pro 7 Tage“, „$2.00 vs $1.26 Eingabe“, einer Fußzeile mit dem Text „Sakana AI vs. Z.ai – September 2026“ und dem OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

Fugu Max vs. GLM-5.3: Das Wertmodell wird vom Volumenmodell unterboten

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Fugu Max wurde auf Kostenführerschaft ausgelegt, und GLM-5.3 ist auf beiden Achsen günstiger. Der Coordinator von Sakana AI startete am 11. September 2026 zu 2,00 $ pro Million Input-Tokens und 6,00 $ pro Million Output-Tokens und wurde dafür gebaut, jede Aufgabe an das günstigste Modell weiterzuleiten, das sie bewältigen kann. GLM-5.3 von Z.ai, seit dem 18. August 2026 gelistet, liegt auf OrcaRouter bei 1,26 $ Input und 3,96 $ Output pro Million – zwischen einem Drittel und zwei Fünfteln unter Fugu Max auf beiden Werten, und das von einem einzigen reinen Textmodell mit einem veröffentlichten Kontextfenster von 1M und einer Obergrenze von 128K für die Ausgabe. GLM-5.3 ist außerdem mit großem Abstand das meistgenutzte Modell in unserem Katalog. Diese Kombination – günstiger pro Token und nachweislich mit Produktionsverkehr in großem Umfang belastet – macht dies zu dem Duell, in dem sich der Aufpreis für Orchestrierung am schwersten rechtfertigen lässt.

Auf beiden Achsen günstiger, mit veröffentlichter Spezifikation.

Der Vergleich ist für Fugu Max unangenehm, noch bevor überhaupt ein Benchmark ins Spiel kommt, denn es geht nicht darum, Leistungsfähigkeit gegen Preis zu tauschen. GLM-5.3 ist für sich genommen ein Flaggschiff nahe der Frontier – Z.ai beschreibt es als ein Modell, das beim Coding eine Verbesserung von rund 50 % gegenüber GLM-5.2 liefert und bei ausgewählten Cybersicherheitsfähigkeiten mit Mythos 5 gleichzieht. Es ist kein Budgetmodell, das als billige Alternative angeboten wird. Es ist ein Flaggschiff, dessen Preis unter dem eines kostenoptimierten Orchestrators liegt.

• Eingabepreis — Fugu Max 2,00 $ pro 1 Mio. Tokens vs. GLM-5.3 1,26 $ pro 1 Mio. Tokens

• Ausgabepreis — Fugu Max 6,00 $ pro 1 Mio. Token vs. GLM-5.3 3,96 $ pro 1 Mio. Token

• Zwischengespeicherte Eingabe — Fugu Max 0,25 $ pro 1 Mio. Token vs. GLM-5.3-Caching, das als Rabatt auf den Basis-Eingabetarif abgerechnet wird

• Kontext — Fugu Max nicht veröffentlicht vs. GLM-5.3 1M Tokens

• Ausgabeobergrenze — Fugu Max nicht veröffentlicht vs. GLM-5.3 128K Tokens

• Modalität — Fugu Max nicht veröffentlicht vs. GLM-5.3 nur Text, als solche dokumentiert

• Fähigkeits-Tags — Fugu Max: keine veröffentlicht vs. GLM-5.3: Tool-Nutzung, JSON-Modus, Reasoning

• Benchmark-Zahlen — für Fugu Max werden sechs Siege ohne Punktzahlen behauptet, gegenüber GLM-5.3 mit vom Anbieter gemeldeten DeepSWE-Werten von 46,2 bis 66,9 gegenüber der vorherigen Generation, plus ein veröffentlichter Intelligenz-Score von Artificial Analysis

• Gewichte — Fugu Max geschlossen, Pool nicht offengelegt vs. GLM-5.3 aus einem Labor mit einer Offene-Gewichte-Tradition

• Beobachteter Verkehr auf OrcaRouter — Fugu Max: keine, nicht übertragen vs. GLM-5.3: 7.962,7 Mio. Tokens in den letzten sieben Tagen

Beachte, was die letzten beiden Zeilen zusammen bewirken. GLM-5.3 stammt aus einer Linie mit offenen Gewichten, was die stärkste verfügbare Form des Arguments für Anbieterunabhängigkeit ist, das Sakana als die gesamte Prämisse von Fugu Max verkauft. Und es hat eine beobachtbare Traffic-Zahl, die um eine Größenordnung über der der meisten Modelle liegt, die wir bedienen. Wenn die Frage lautet: „Was lasse ich für textlastige Produktionsarbeit zu einem niedrigen Tarif laufen?“, deutet die Beweislage auf etwas anderes als den Orchestrator hin.

A two-column scoreboard titled "Fugu Max vs GLM-5.3 - the scoreboard". Left column Fugu Max: Output price $6.00 / 1M, Input price $2.00 / 1M, Context not published, Output ceiling not published, Modality not published, Observed traffic not carried. Right column GLM-5.3: Output price $3.96 / 1M, Input price $1.26 / 1M, Context 1M tokens, Output ceiling 128K tokens, Modality text-only and documented, Observed traffic 7,962.7M tokens over 7 days. Footer reading "Fugu Max figures vendor-reported by Sakana AI; GLM-5.3 pricing and traffic from OrcaRouter, September 11 2026.", with the OrcaRouter logo bottom-right.

Das Volumenargument – und warum es nicht nur ein Beliebtheitswettbewerb ist

Eine Traffic-Zahl ist keine Qualitätskennzahl, und sie sollte nicht als eine solche gelesen werden. Was 7,96 Milliarden Tokens in sieben Tagen jedoch belegen, ist, dass GLM-5.3 von vielen unabhängigen Teams im Produktionsmaßstab und mit realen Workloads betrieben wurde und keine Massenabwanderung weg von ihm ausgelöst hat. Das ist ein schwaches Signal für Qualität und ein starkes Signal für Betriebstauglichkeit: Die Latenz ist stabil, der Durchsatz hält stand, die API verhält sich unter Last, und die Fehlermodi sind einer ausreichend großen Nutzerschaft bekannt, sodass sie öffentlich sichtbar werden. Ein Modell, das in derselben Woche wie Fugu Max veröffentlicht wurde, kann nichts davon vorweisen.

Die Latenzzeile schärft den Punkt. GLM-5.3 zeigt eine p50-Zeit bis zum ersten Token von 4,33 Sekunden über den Verkehr, den wir bedienen. Bei agentischer Arbeit – der Arbeitslast, auf die beide Produkte abzielen – summiert sich die Zeit bis zum ersten Token über jeden Turn jedes Subagenten, den der Koordinator startet. Ein günstigerer Orchestrator, der vier Agenten startet, ist nicht günstiger, wenn jeder mehrere Sekunden wartet, bevor er überhaupt etwas ausgibt, und diese Kosten tauchen nie auf einer Preisliste auf.

Das Gegenargument von Fugu Max lautet, dass sein Koordinator jede Anfrage an das schlankste fähige Modell weiterleitet, was im Prinzip bedeutet, dass viele Aufgaben überhaupt nie ein teures Backend berühren. Sakanas Pool-Erweiterung in dieser Version fügte Open-Weights- und spezialisierte Modelle hinzu, darunter die NVIDIA-Nemotron-Familie durch eine NVIDIA-Kollaboration, die günstigen Sprossen dieser Leiter sind also real. Die Frage ist, ob die Sprossen günstiger sind als 3,96 US-Dollar pro Million Ausgabe-Tokens. Bei den meisten Textaufgaben sind sie es nicht – das ist eine niedrige Messlatte, und Open-Weights-Modelle, die zu Hosting-Preisen laufen, übertreffen sie im Allgemeinen nur knapp.

Fragen, die sich lohnen, bevor Sie wählen

Ist ein Orchestrator günstiger als ein einzelnes Open-Weights-Modell? Nicht standardmäßig, und die Intuition läuft in die falsche Richtung. Orchestrierung fügt die Synthese-Tokens eines Koordinators hinzu und bei Multi-Agent-Läufen die Ausgabe jedes Agenten im Team. Sakana's Fugu-Preisgestaltung beseitigt den schlimmsten Fall, indem sie einen einzigen Mischpreis auf Basis des leistungsstärksten beteiligten Modells abrechnet, statt Agenten zu stapeln, was ein echtes Zugeständnis ist. Aber der Basispreis, den Sie mischen, sind $6.00 Ausgabe, und das einzelne Modell, das Sie andernfalls aufrufen würden, liegt bei $3.96. Orchestrierung spart Geld, wenn sie Wiederholungsversuche verhindert, nicht wenn sie Parallelität um ihrer selbst willen hinzufügt.

Spielt eine Einschränkung auf Text bei einem der beiden eine Rolle? Bei GLM-5.3 ist sie dokumentiert, also eine Einschränkung, auf die man sich einstellen kann – keine Vision, kein Audio, kein Video, und so steht es im Katalog. Für Fugu Max ist die Modalität schlicht nicht veröffentlicht. Das ist schlimmer als eine Einschränkung, denn man kann nicht sagen, ob eine Pipeline, die ein PDF sendet, funktionieren wird, bis man es ausprobiert. Eine ungenannte Einschränkung ist nicht dasselbe wie eine fehlende.

Was passiert mit jedem einzelnen, wenn sich die zugrunde liegenden Modelle ändern? GLM-5.3 ist ein Modell in einer Version, trainiert und bereitgestellt von Z.ai. Wenn Z.ai seine Preisgestaltung ändert, wirkt sich die Änderung noch am selben Tag über OrcaRouter mit 0 % Aufschlag auf Ihren Schlüssel aus, und Sie können sie sehen und darauf reagieren. Das Verhalten von Fugu Max ist eine Funktion eines Pools, dessen Mitglieder Sakana nicht offenlegt, sodass die Abschaffung oder Preisänderung eines Frontier-Labors stillschweigend verändert, was Sie kaufen, ohne dass sich der Produktname ändert. Sakana präsentiert dies als Resilienz. Es ist Resilienz für den Anbieter und Undurchsichtigkeit für den Käufer.

A screenshot of the Sakana AI release page at sakana.ai/fugu-max-release (captured September 11, 2026, English UI), showing the sakana.ai wordmark, the headline 'Introducing Fugu Max and Fugu Ultra v2: Orchestrating the Pareto Frontier' dated September 11, 2026, the opening copy arguing that the frontier which matters is two-dimensional with capability on one axis and cost on the other, a 'Try Sakana Fugu Max and Fugu Ultra v2' link, and a Pareto chart plotting performance against cost with a red 'Fugu Max' point at the low-cost end, a red 'Fugu Ultra' point at the top, a shaded 'Frontier formed by Fugu models' region and grey points labelled 'Frontier formed by single models'.

Wo Routing-Entscheidungen tatsächlich getroffen werden

Beide sind im Grunde Routing-Entscheidungen – Fugu Max trifft sie innerhalb eines undurchsichtigen Koordinators, und Sie treffen sie auf der API-Ebene. OrcaRouter ist die zweite Art: eine API für über 200 Modelle mit einer Routing-DSL, mit der Sie die Richtlinie explizit ausdrücken können, automatisches Failover, wenn sich ein Anbieterpfad verschlechtert, und Modellfusion, wenn Sie Ausgaben bewusst kombinieren möchten, statt einer Blackbox zu vertrauen, dass sie es schon richtet. GLM-5.3 steht in diesem Katalog zum Listenpreis von Z.ai mit 0 % Aufschlag, was für ein Modell mit so viel Verkehr dahinter mehr wert ist als üblich: Der Preis, den Sie sehen, ist der Preis, den Z.ai veröffentlicht – unverändert weitergegeben.

Der praktische Unterschied ist die Auditierbarkeit. Wenn Fugu Max ein Modell für Ihre Anfrage auswählt, erfahren Sie nichts darüber, welches es war oder warum. Wenn Sie die Routing-Richtlinie selbst verfassen, befindet sich die Entscheidung in Ihrem Repository, ist für alle überprüfbar, die Ihren Code überprüfen, und änderbar, ohne auf einen Anbieter warten zu müssen. Für Teams, die irgendeiner Art von Compliance- oder Kostenrechnungspflicht unterliegen, ist das kein philosophischer Unterschied.

Das Urteil

GLM-5.3 gewinnt diesen Vergleich in den Punkten, die für ein Produktionsteam am wichtigsten sind: Es ist günstiger bei Input und Output, sein Kontextfenster und seine Obergrenze für die Ausgabe sind veröffentlicht, seine Modalitätsgrenzen sind angegeben, es bietet Tool-Nutzung, JSON-Modus und Reasoning als dokumentierte Fähigkeiten, es stammt aus einer Open-Weights-Linie und weist eine Sieben-Tage-Traffic-Zahl von annähernd acht Milliarden Tokens auf. Es gibt keine Lesart der öffentlichen Belege, nach der Fugu Max zu diesem Preis die besser belegte Kaufentscheidung wäre.

Fugu Max hat ein Argument, und es ist ein stichhaltiges: Für Aufgaben, bei denen ein zweiter Durchlauf eines Koordinators einen Fehler abfängt, den der erste Durchlauf ausgeliefert hätte, können die Kosten pro abgeschlossener Aufgabe die Kosten pro Token unterbieten. Das ist einen abgegrenzten Pilotversuch wert, wenn Ihre Arbeit überprüfbar, hochvolumig ist und Sie außerhalb der EU/EWR sind – mit einer im Voraus festgelegten Obergrenze für Ausgabe-Token und einer Messung der Token pro abgeschlossener Aufgabe. Andernfalls ist das einzelne Modell, das ein Drittel weniger kostet und seit einem Monat unter Produktionslast läuft, die Antwort, und es ist auf OrcaRouter zum Listenpreis von Z.ai verfügbar, wobei der Tarif des Anbieters durchgereicht wird.

A screenshot of the OrcaRouter model page for GLM 5.3 (z-ai/glm-5.3, captured September 11, 2026, English UI), showing the NEW and Featured badges, the z-ai/glm-5.3 model ID, the Tools, JSON and Reasoning tags over a text-only model, the listing date 2026-08-18, the /v1/chat/completions endpoint, the pricing tiles reading INPUT $1.26 and OUTPUT $3.96 per 1M tokens with p50 TTFT 4.33s and 7,962.7M tokens of 7-day traffic, the 1M token context with 128K max output, and the OpenAI-compatible Python sample pointing at api.orcarouter.ai/v1.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert