Eine Hero-Titelkarte für „Qwen 4 Max vs Gemini 3.1 Pro“ mit dem Untertitel „Das nicht angekündigte Flaggschiff gegen die Vorschau, die nie endete“, drei Pillen-Badges mit den Aufschriften „Vorschau seit dem 19. Februar 2026“, „1.048.576 Token-Kontext“ und „26,3 % Retrieval bei 1M“, eine Fußzeile mit der Aufschrift „Alibaba kündigte am 22. September 2026 an; Google zeigte am 19. Februar 2026 eine Vorschau“, und das OrcaRouter-Logo in der unteren rechten Ecke.
Engineering & Research

Qwen 4 Max vs. Gemini 3.1 Pro: das nicht angekündigte Flaggschiff gegen die Vorschau, die nie zu Ende ging

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Die meisten Vergleiche stellen ein ausgeliefertes Produkt einem ausgelieferten Produkt gegenüber. Dieser hier ist ungewöhnlich: Qwen 4 Max wurde am 22. September 2026 auf der Yunqi-Konferenz in Hangzhou vorgestellt – ohne Veröffentlichungsdatum, ohne Preis und ohne Gewichte –, und Gemini 3.1 Pro befindet sich seit dem 19. Februar 2026 in der Vorschau und ist es auch sieben Monate später noch – ohne angekündigtes Datum der allgemeinen Verfügbarkeit und ohne Abschaltdatum in seiner Deprecation-Tabelle. Keines der Modelle in diesem Duell ist ein fertiges Produkt. Das ist kein Grund, den Vergleich auszulassen. Es ist der Vergleich, und es ist das Einzige daran, das wirklich informativ ist.

Sieben Monate Vorschau

Ein Preview-Label soll einen kurzlebigen Zustand kennzeichnen. Gemini 3.1 Pro trägt es nun schon über drei Flash-Veröffentlichungen desselben Labors hinweg, einschließlich Gemini 3.8 Flash vom 2. September 2026, das Google als sein intelligentestes Flash-Modell beschreibt. In den unabhängigen Composites erzielt dieses Modell inzwischen bessere Werte als 3.1 Pro. Googles Pro-Reihe hat kein neueres Mitglied: Es gibt kein Gemini 3.8 Pro, und die 3.5-Pro-Generation wurde verzögert und Berichten zufolge zurückgestellt. Der praktische Effekt ist, dass das Modell, das den Namen Pro trägt, nicht mehr das bestbewertete Modell des eigenen Anbieters ist.

Googles eigener Einschränkungstext im Katalogeintrag rät dazu, die Einstellung der Preview einzuplanen – was die ehrliche Art ist, den Status zu lesen. Eine Preview ohne GA-Termin und ohne Abschaltdatum ist ein Modell, auf das man bauen kann, aber nicht terminlich planen kann.

Die Qwen-Seite ist ein Spiegelbild mit umgekehrtem Vorzeichen. Qwen 4 Max befindet sich nicht in einer langen Vorschau; es ist Pre-Preview, wobei überhaupt nichts veröffentlicht wurde. Die beiden Fehlermodi sind entgegengesetzt: Gemini 3.1 Pro ist ein echter Endpunkt, dessen langfristige Existenz nicht spezifiziert ist, und Qwen 4 Max ist ein spezifizierter Roadmap-Eintrag ohne Endpunkt.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

Der Vergleich und die Long-Context-Kennzahl, die den Ausschlag gibt

Die Spezifikation von Gemini 3.1 Pro ist öffentlich und konkret. Die von Qwen 4 Max ist leer. Es lohnt sich, bei einer Zeile der Gemini-Spalte zu verweilen, denn es ist die Art von Zahl, die zitiert wird und nicht zitiert werden sollte:

• Status — Gemini 3.1 Pro seit dem 19. Februar 2026 in der Vorschau, gegenüber Qwen 4 Max, am 22. September 2026 angekündigt, ohne Datum

• Eingabepreis — Gemini 3.1 Pro 2,00 $ pro 1 Mio. Token bis zu einem 200K-Prompt und 4,00 $ darüber, im Gegensatz zu Qwen 4 Max, für den kein Preis veröffentlicht wurde

• Ausgabepreis — Gemini 3.1 Pro 12,00 $ pro 1 Mio. bis 200 K und 18,00 $ darüber; Qwen 4 Max hingegen nicht veröffentlicht.

• Zwischengespeicherte Eingabe — Gemini 3.1 Pro 0,20 $ pro 1 Mio. bei einem Cache-Lesevorgang, im Vergleich zu Qwen 4 Max: nicht veröffentlicht

• Kontext — Gemini 3.1 Pro 1.048.576 Token, gegenüber Qwen 4 Max nicht veröffentlicht

• Ausgabe-Obergrenze — Gemini 3.1 Pro 65.536 Token, bei Qwen 4 Max hingegen nicht veröffentlicht

• Modalität — Gemini 3.1 Pro Text-, Bild-, Video-, Audio- und PDF-Eingabe mit Textausgabe, gegenüber Qwen 4 Max nicht veröffentlicht

• Reasoning-Steuerung — Gemini 3.1 Pro mit niedrigen, mittleren und hohen Denkstufen, im Vergleich zu Qwen 4 Max: nicht veröffentlicht

• Langkontext-Retrieval — von Gemini 3.1 Pro vom Anbieter gemeldete MRCR v2 bei 84,9 Prozent, gemittelt über acht Needles bei 128K, aber 26,3 Prozent bei der punktweisen Einstellung mit einer Million Token, im Vergleich zu Qwen 4 Max, für das nichts berichtet wurde

• Vom Anbieter gemeldete Werte — Gemini 3.1 Pro SWE-bench Verified 80,6 Prozent, GPQA Diamond 94,3 Prozent, ARC-AGI-2 77,1 Prozent, Humanity's Last Exam 44,4 Prozent ohne Werkzeuge, gegenüber Qwen 4 Max: nichts gemeldet

• Unabhängiger Score — Gemini 3.1 Pro 30 im Artificial Analysis Intelligence Index v4.3.2, im Vergleich zu Qwen 4 Max, für das keine unabhängige Bewertung vorliegt

Diese Zeile zum Langkontext ist die, die man mitnehmen sollte. Ein Kontextfenster von 1.048.576 Token ist eine Marketingzahl; 26,3 Prozent Retrieval bei der Einstellung mit einer Million Token ist das, was derselbe Anbieter meldet, wenn er das ferne Ende dieses Fensters misst. Beide Zahlen stammen von Google, was die Kluft zu einer Aussage über das Modell statt über den Evaluator macht. Wenn Ihre Workload darauf angewiesen ist, eine Tatsache zu finden, die nahe dem Ende eines Prompts mit einer Million Token vergraben ist, sagt Ihnen die plakative Kontextzahl nichts Nützliches, und diese Zeile sagt Ihnen fast alles.

Der Index bewegte sich, das Modell nicht.

Gemini 3.1 Pro erschien am 19. Februar 2026 mit 57 auf dem Artificial Analysis Intelligence Index, an der Spitze des Feldes. In der Indexrevision v4.3.2, veröffentlicht am 19. September 2026, steht er bei 30. Zwischen diesen beiden Daten hat sich am Modell nichts geändert. Der Maßstab wurde neu gebaut – und zwar vier Tage vor Alibabas Qwen-4-Ankündigung.

Diese Koinzidenz ist mehr wert als die Zahlen selbst. Drei der vier Modelle in diesem Vergleichspaket – Gemini 3.1 Pro, Claude Opus 5 und das Flaggschiff Qwen 3.8 – weisen unabhängige Punktwerte auf, die sich unter derselben Revision verschoben haben, und in jedem Fall war die Verschiebung groß genug, um eine Rangfolge umzukehren. Jeder Vergleich, der in diesem Monat entsteht und einen einzelnen Indexwert nennt, ohne die Revision anzugeben, vergleicht Werte, die mit unterschiedlichen Maßstäben ermittelt wurden, und der Fehler wird für den Leser nicht sichtbar sein.

Für Qwen 4 Max bedeutet das, dass sich das Ziel ständig verschiebt. Wenn Alibaba schließlich veröffentlicht, ist die zu schlagende Punktzahl in diesem Index das, was die aktuelle Revision an diesem Tag aussagt, und die Revision hat sich in der letzten Woche mindestens einmal geändert.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Was die operativen Zahlen sagen, einschließlich der unangenehmen

Gemini 3.1 Pro ist auf OrcaRouter als google/gemini-3.1-pro-preview routbar und trägt die Badges „Flagship" und „Featured" ohne Vorab-Veröffentlichungsbanner, zu Googles Listenpreis von 2,00 $ und 12,00 $ pro Million Token bei 0 % Aufschlag. Das Routing selbst ist ehrlich – der auf der Seite angegebene Tarif ist der Tarif, den Google veröffentlicht. Auch die Betriebszahlen für die sieben Tage bis zum 22. September sollte man lieber abdrucken als auslassen: eine p50-Zeit bis zum ersten Token von 10,00 Sekunden, eine Ausgabegeschwindigkeit von rund 632 Token pro Sekunde und eine Fehlerrate von 77,5 Prozent über den gesamten Zeitraum. Diese Fehlerrate ist keine Fußnote. Für ein Modell der Preview-Stufe ohne GA-Termin ist sie die mit Abstand entscheidungsrelevanteste Zahl auf der Seite, und ein Vergleich, der den Preis ohne sie nennt, verkauft, statt zu informieren.

Derselbe Katalog umfasst knapp 200 Modelle an einem einzigen OpenAI-kompatiblen Endpunkt mit automatischem Failover und einer Routing-DSL, und genau dieser Mechanismus macht eine Fehlerrate wie diese überlebbar statt fatal: Ein beeinträchtigter Provider-Pfad kann per Failover umgangen werden, statt ganz auszufallen. Die Qwen-3.8-Familie – Qwen3.8-Max, Qwen3.8-Flash und Qwen3.8-27B – sitzt am selben Endpunkt wie Gemini 3.1 Pro Preview, sodass die Substitution, um die es in diesem Artikel eigentlich geht, diejenige, die Sie heute vornehmen können, eine Änderung der Routing-Richtlinie ist und kein Migrationsprojekt. Qwen 4 Max ist nicht im Katalog, und keine Qwen-4-Stufe ist es; sobald eine erscheint, würde sie dort auftauchen.

Die Entscheidung, so wie sie ist

Keines der beiden Modelle hier ist ein Produkt, auf das man sich festlegen kann, und der ehrliche Rat ist, beide entsprechend zu behandeln. Gemini 3.1 Pro ist heute zu einem veröffentlichten Preis mit einem veröffentlichten Kontextfenster und einer öffentlichen Evaluierungsspur aufrufbar, einschließlich der Retrieval-Schwäche am äußersten Ende dieses Fensters; es ist außerdem eine Preview, deren Anbieter Ihnen sagt, dass Sie mit einer Abschaffung planen sollen, und die mit einer Fehlerrate läuft, die für eine Produktionsabhängigkeit inakzeptabel wäre. Qwen 4 Max hat keines dieser Probleme, weil es keine dieser Eigenschaften hat.

Wenn Sie jetzt ein Modell brauchen, liegt die Wahl nicht zwischen diesen beiden. Sie liegt zwischen Gemini 3.1 Pro und dem derzeit erhältlichen Qwen-Flaggschiff, und nach den verfügbaren Belegen ist das eine Entscheidung über die Qualität der Langkontext-Wiederauffindung gegenüber einem Eingabepreis von 2,00 US-Dollar mit veröffentlichten Gewichten. Wenn Sie warten können, achten Sie auf zwei Dinge statt auf eines: eine Modellkarte für Qwen 4 Max und ein Datum für die allgemeine Verfügbarkeit von Gemini 3.1 Pro. Was zuerst kommt, verrät Ihnen, welche dieser beiden Roadmaps Alibaba und Google tatsächlich priorisieren.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert