Eine generierte Hero-Titelkarte mit der Aufschrift „Gemini 3.1 Pro vs Qwen3.8-27B", mit dem Untertitel „Eine siebenmonatige Preview vs. ein Checkpoint, den man herunterladen kann", mit zwei Karten: Gemini 3.1 Pro, in Preview seit dem 19. Februar 2026, zu 2,00 $ Input und 12,00 $ Output pro 1 Mio. Token und einem Artificial Analysis Intelligence Index von 29,7, gegenüber Qwen3.8-27B, offene Gewichte seit dem 14. August 2026, zu 0,50 $ Input und 3,00 $ Output pro 1 Mio. Token und einem Index von 33,7, mit einem VS-Medaillon dazwischen und dem OrcaRouter-Logo unten rechts. Fußzeile: „Artificial Analysis Intelligence Index v4.3.2, erfasst am 2026-09-23; Preise sind Listenpreise der Anbieter."
Guides & Insights

Gemini 3.1 Pro vs. Qwen3.8-27B: Eine Siebenmonats-Vorschau vs. ein Checkpoint, den man herunterladen kann

Autor

Magnus Corvin

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Am 18. September 2026 begannen Nutzer im eigenen KI-Entwicklerforum des Anbieters zu berichten, dass Gemini 3.1 Pro aus dem Modellselektor von AI Studio verschwunden sei – auch bei bezahlten Konten, trotz geleertem Cache und Inkognito-Fenstern. Der Thread, in dem der Anbieter gefragt wurde, ob es sich um „einen Bug oder Absicht“ handele, war am 21. September noch aktiv. Es gibt keine Deprecation-Mitteilung, keinen Migrationspfad und keine Antwort von Mitarbeitenden. Währenddessen Qwen3.8-27B, das das Labor am 14. August unter Apache 2.0 als Open Source veröffentlichte, kann niemandem, der es heruntergeladen hat, weggenommen werden. Diese Asymmetrie – nicht die Benchmark-Lücke, die real, aber bescheiden ist – ist es, worauf es in diesem Duell tatsächlich ankommt, und sie ist der Grund, warum die beiden Modelle nicht wirklich um denselben Platz konkurrieren, obwohl die Vergleichstabellen sie nebeneinander stellen.

Was folgt, ist der direkte Vergleich der Zahlen, die es gibt, wobei jede einzelne gekennzeichnet ist: Artificial Analysis-Zahlen aus Erhebungen vom 23. September 2026, Alibabas eigene Modellkarte, Googles Launch-Post und unsere eigene Routing-Telemetrie – durchgängig getrennt gehalten. Wo nichts gemessen wurde, sagt diese Seite das, anstatt zu raten.

Was diese Woche passiert ist – und was das bedeutet und was nicht.

Die Berichte sind konkret und stammen aus Googles eigenem Forum statt aus dem Blog eines Konkurrenten. Ein Thread mit dem Titel „Gemini 3.1 Pro fehlt seit 2026-09-18 in AI Studio – Bug oder Absicht?“ beschreibt, wie zahlende Nutzer das Modell ohne Ankündigung verlieren, wie der Google One-Support unzusammenhängende Fehlerbehebungsschritte anbietet und die Google-Statusseite nichts Falsches anzeigt. Ein zweiter Thread, „Gemini 3.1 Pro Preview-Modell nicht in AI Studio verfügbar, um App zu erstellen“, sammelt dieselbe Beschwerde, einschließlich von einem Nutzer, dessen Coding-Assistent monatelang auf der Preview aufgebaut war und der sagt, Flash „macht Schlampigkeit“ auf seiner Codebasis.

Drei ehrliche Vorbehalte. Es ist ein Verschwinden aus der Entwicklerkonsole, kein bestätigter API-Ausfall: Gemini 3.1 Pro ist in unserem eigenen Katalog weiterhin gelistet und routbar, wo es in den letzten sieben Tagen 94,7 Mio. Token verarbeitet hat. Es ist von Nutzern gemeldet – Google hat sich nicht geäußert, also kann niemand außerhalb von Google „stille Deprecation“, „Kapazitätsproblem“ oder „Konsolenfehler“ auseinanderhalten. Und das Timing ist nicht schmeichelhaft, wenn man bedenkt, dass dieses Modell als Vorschau seit dem 19. Februar 2026 läuft – sieben Monate, ohne veröffentlichtes GA-Datum, während Google eine ganze Leiter von Flash-Modellen darunter auf den Markt gebracht hat. Davon getrennt hat GitHub Copilot Gemini 3.1 Pro am 1. September 2026 unter Einhaltung einer 30-tägigen Ankündigungsfrist eingestellt, was ein anderes und unzusammenhängendes Ereignis ist, aber es weist in dieselbe Richtung: Ein Preview-Endpunkt ohne GA-Zusage ist eine Abhängigkeit, bei der man nervös sein darf.

Eine Zahl von unserer Seite sollte man neben diesen Kontext stellen, denn wir können sie nicht erklären und geben das lieber zu. Unsere Sieben-Tage-Telemetrie zum Katalogeintrag von Gemini 3.1 Pro zeigt eine Fehlerrate von 80,5 %; die benachbarten Modelle, die wir am selben Morgen geprüft haben – Qwen3.8-Max, Claude Fable 5.1 – liegen bei 5,9 % und 6,9 %. Wir wissen nicht, ob es dasselbe Problem ist, von dem das Forum berichtet, eine schlechte Woche für einen vorgelagerten Anbieter oder ein Instrumentierungsartefakt. Betrachten Sie es als Grund, einen Canary-Test durchzuführen, bevor Sie sich festlegen, nicht als Urteil über das Modell.

Derselbe Maßstab, zwei verschiedene Ergebnisse

Dies ist der Punkt, den die meisten Vergleichsseiten falsch machen, deshalb lohnt es sich, hier sorgfältig vorzugehen. Artificial Analysis bewertet beide dieser Modelle anhand des Intelligence Index v4.3.2. Wir haben beide Seiten am 23. September 2026 erfasst, und beide tragen dieselbe Revision – anders als bei den meisten modellübergreifenden Index-Angaben stammt diese hier also aus demselben Snapshot, und der Abstand ist real.

• Qwen3.8-27B (xhigh) — Intelligenzindex 33,7

Gemini 3.1 Pro Preview — Intelligenzindex 29.7

Qwen führt auf dem aktuellen Maßstab mit vier Punkten Vorsprung. Die schwierigere Frage ist, was das bedeutet, denn der Maßstab selbst hat sich in diesem Jahr mindestens dreimal verschoben. Im Februar veröffentlichte Artificial Analysis einen Artikel, in dem Gemini 3.1 Pro Preview als „der neue Spitzenreiter im Bereich KI“ bezeichnet wurde, mit vier Punkten Vorsprung vor Claude Opus 4.6, und die damalige Berichterstattung nannte einen Wert von 57 auf dem damaligen Index v4.0. Auf v4.3.2 sind es 29,7. Artificial Analysis kündigte v4.3 am 7. September 2026 an, vier Tage nach v4.2, und die Revision tauschte Terminal-Bench 2.1 gegen den viel schwierigeren Terminal-Bench 4.0 mit 66 Aufgaben aus und ersetzte τ³-Banking durch AutomationBench-AA. Die Stärken von Gemini 3.1 Pro im Februar lagen in Evaluierungen, die der neue Index gestrichen oder neu gewichtet hat. Also: Das Modell wurde nicht schlechter, die Prüfung schon. Doch wenn Sie heute ein Modell auswählen, ist die heutige Zahl diejenige, auf deren Grundlage Sie tatsächlich handeln können, und die heutige Zahl spricht für Qwen.

Wo die beiden wirklich auseinandergehen

Aggregierte Scores verbergen die Form des Unterschieds, und die Form ist der nützliche Teil. Jede der folgenden Zahlen stammt aus derselben Erfassung vom 23. September der v4.3.2-Seiten von Artificial Analysis für beide Modelle, auf derselben Revision.

• Schlussfolgerndes Denken und Wissen — Gemini liegt klar vorn. GPQA Diamond 94,1 vs. 90,5; Humanity's Last Exam 47,0 vs. 33,9; SciCode 58,7 vs. 46,6; CritPt 17,7 vs. 5,4.

• Berufliche Aufgaben aus der Praxis – Qwen führt, und zwar deutlich. GDPval normalisiert 45,4 % vs. 13,8 %.

• Agentisches Banking und Transaktionen — Qwen führt. τ-Banking 48,0 vs. Geminis 21,4.

• Agentische Tool-Nutzung in einem allgemeinen Benchmark — Gemini führt, wo Qwen nicht gemessen wurde. τ²-Bench 95,6 für Gemini; für Qwen3.8-27B existiert kein Wert.

• Terminal-Arbeit — knapp, und beide schlecht im neuen Benchmark. Terminal-Bench 2.1: Qwen 79,8, Gemini 73,8. Terminal-Bench 4.0: Qwen 5,6 %, Gemini 4,0 % — beide einstellig.

• Kalibrierung — die schärfste Abweichung auf beiden Seiten. Bei AA-Omniscience erzielt Gemini 31,9 bei 54,9 % Genauigkeit und einer Halluzinationsrate von 50,9 %; Qwen erzielt −10,0 bei 15,6 % Genauigkeit und einer Halluzinationsrate von 30,3 %. Gemini weiß mehr und erfindet in mehr als der Hälfte der Fälle Inhalte; Qwen lehnt häufig eine Antwort ab und halluziniert bei etwa einem Drittel dessen, was es tatsächlich beantwortet.

• Langer Kontext – bei Long-Context-Recall absolut gleichauf, jeweils 82,0. Beim multimodalen Long-Context-Recall: Qwen 21,7 % vs. Gemini 15,6 %.

Lies die Einträge „nicht gemessen“ als das, was sie sind. Gemini hat keinen veröffentlichten normalisierten GDPval-AA-Wert gegenüber Qwens 45,4 %, und für Qwen gibt es keinen Wert bei τ²-Bench, IFBench, Terminal-Bench Hard oder ITBench-SRE gegenüber Geminis 77,1, 53,8 und 30,3. Jede dieser Lücken ist eine Stelle, an der eine Übersichtstabelle stillschweigend einen Sieger gesetzt hätte.

A generated two-column scoreboard headed 'Gemini 3.1 Pro vs Qwen3.8-27B — the scoreboard', with the same six dimension labels in both columns. Gemini 3.1 Pro: AA Index 29.7, price per 1M $2.00 input and $12.00 output, context 1M tokens, output speed 116.5 tokens per second, open weights no (preview API), cost to run the index $1,310. Qwen3.8-27B: AA Index 33.7, price per 1M $0.50 input and $3.00 output, context 262K native, output speed 41.3 tokens per second, open weights yes (Apache 2.0), cost to run the index $1,336. Footer: 'Artificial Analysis Intelligence Index v4.3.2, captured 2026-09-23; prices are provider list rates.'

Die Divergenz, die über Budgets entscheidet: gleiche Kosten für den Betrieb des Index

Qwen3.8-27B ist pro Token dramatisch günstiger. Laut den von Artificial Analysis veröffentlichten Marktzahlen kostet es 0,50 $ pro Million Input-Token und 3,00 $ pro Million Output-Token, mit 80 % Cache-Rabatt und einem gewichteten 7:2:1-Mischsatz von 0,47 $. Gemini 3.1 Pro Preview kostet 2,00 $ und 12,00 $ — das Vierfache des Input-Preises und das Vierfache des Output-Preises — mit 90 % Cache-Rabatt und einem Mischsatz von 1,74 $.

Dann die Zahl, die niemand druckt: Artificial Analysiss eigene Abrechnung beziffert die Kosten für den Betrieb des gesamten Intelligence Index auf 1.310,21 $ für Gemini 3.1 Pro Preview und 1.335,92 $ für Qwen3.8-27B. Qwen ist im Betrieb nicht günstiger. Es ist minimal teurer, weil es länger braucht, um dorthin zu gelangen. Von Qwens Ausgabenrechnung entfielen 512,36 $ auf Reasoning-Tokens gegenüber 82,51 $ für die eigentliche Antwort; bei Gemini entfielen 691,82 $ auf Reasoning gegenüber 113,08 $ für die Antwort. Der Preis pro Token ist ein Satz, keine Rechnung.

Zwei weitere Preis-Fakten, die Vergleichstabellen unterschlagen. Erstens: Der Preis von Gemini 3.1 Pro ist nach der Größe des Inputs jeder Anfrage gestaffelt: 2,00 $/12,00 $ bis 200K Input-Tokens, danach 4,00 $/18,00 $ darüber, wobei sich Cache-Reads von 0,20 $ auf 0,40 $ verdoppeln. Das Kontextfenster von einer Million Tokens ist real, doch die letzten 800.000 Tokens darin kosten das Doppelte. Zweitens: Unser eigener Katalogeintrag für Qwen3.8-27B — in Block-FP8 ausgeliefert, Vision-Tower in voller Präzision — listet 0,40 $ Input und 4,21 $ Output, was beim Input günstiger und beim Output teurer ist als die obige Marktangabe, und veröffentlicht überhaupt keinen Tarif für gecachte Tokens. Andere Anbieter, andere Aufteilung. Prüfe den Tarif, der dir tatsächlich in Rechnung gestellt wird.

Beide Modelle sind über einen einzigen OrcaRouter-Schlüssel zum Listenpreis des Anbieters mit 0 % Aufschlag erreichbar, sodass eine Preisänderung eines Anbieters noch am selben Tag bei uns ankommt und nicht erst nach einem Preisanpassungszyklus – was mehr als sonst zählt, wenn eines der beiden eine Tarifgrenze bei 200K Tokens hat.

Latenz: Das schnellste erste Token gehört zum langsameren Modell.

Dies ist das irreführendste Zahlenpaar im gesamten Vergleich, und es ist dasjenige, auf das ein Leser am ehesten falsch reagieren wird.

• Zeit bis zum ersten Chunk — Qwen 4,04 s vs. Gemini 28,37 s. Qwen wirkt siebenmal schneller.

• Zeit bis zur eigentlichen Antwort — Gemini 28,37 s vs. Qwen 52,52 s. Gemini gewinnt um ungefähr das 1,8-Fache, weil Qwen 48,48 Sekunden damit verbringt, zwischen dem ersten Chunk und dem ersten Antwort-Token nachzudenken.

• Ausgabegeschwindigkeit — Gemini 116,5 Token pro Sekunde vs. Qwen 41,3. Gemini ist 2,8-mal schneller, sobald es mit dem Schreiben beginnt, gegenüber einem Vergleichsmedian von 95,4 Token pro Sekunde, den Artificial Analysis angibt. Qwens eigene Seite bezeichnet es als „auffallend langsam“.

Wenn dein Produkt ein erstes Token an einen Nutzer streamt, ist Qwens beworbene Latenz eine Lüge, die du dir selbst nur einmal erzählen wirst. Wenn dein Produkt auf eine vollständige Antwort wartet, ist Gemini das schnellere Modell. Beide Werte sind Messungen von Artificial Analysis; beide entstanden bei Qwens xhigh-Effort-Einstellung, der Standardeinstellung der Modellkarte.

Diese Standardeinstellung ist ein akuter Beschwerdepunkt unter Praktikern, und die Modellkarte gibt es halb zu. Qwen3.8-27B bietet einen reasoning_effort-Parameter mit drei Stufen — xhigh (die Standardeinstellung, „für komplexe Aufgaben, die eine gründliche Analyse erfordern“), medium und low. Community-Berichte bis September melden, dass xhigh sehr lange Denkphasen erzeugt, und empfehlen, auf medium oder low herunterzugehen und das Reasoning-Budget zu begrenzen. Alibabas eigene Modellkarte warnt, dass bei agentischer Arbeit über mehrere Turns hinweg eine Verringerung des Aufwands „nicht immer die gesamte Aufgabenbearbeitungszeit verkürzt“ – was für eine Modellkarte eine offene Aussage ist und eine Warnung, dass die naheliegende Lösung nicht immer die Lösung ist.

Kontext: 1M vs. 262K und was tatsächlich passt

Gemini 3.1 Pro verfügt über ein Kontextfenster von 1.000.000 Token mit einer maximalen Ausgabe von 65.536 Token. Qwen3.8-27B verfügt nativ über 262.144 Token, erweiterbar auf 1.000.000 mit YaRN-Skalierung, wobei darin separate Budgets empfohlen werden: Reasoning-Inhalt bis zu 262.144 und eine finale Antwort bis zu 131.072.

Zwei ehrliche Fußnoten. Die Spezifikationstabelle von Artificial Analysis führt Qwens Kontextfenster mit 256.000 auf, während der eigene FAQ-Text 260K und die Modellkarte 262.144 nennen – das sind Rundungsunterschiede bei derselben Zahl, aber nennen Sie 262.144, weil das auf der Karte steht. Und die Erweiterung auf 1M ist eine Skalierungstechnik, nicht dasselbe wie ein natives Million-Token-Kontextfenster: Der Long-Context-Recall bei 1M mit einem YaRN-erweiterten Modell ist nicht das, was der AA-LCR-Wert von 82,0 misst. Niemand hat einen 1M-Kontext-Recall-Score für Qwen3.8-27B veröffentlicht. Betrachten Sie Geminis Kontextfenster als dasjenige mit dem bei voller Länge gemessenen Verhalten und Qwens als dasjenige, das Sie selbst testen sollten, bevor Sie darauf aufbauen – und denken Sie daran, dass sich bei mehr als 200K Eingabe-Token der Preis von Gemini verdoppelt.

Agentische Arbeit und Tool-Aufruf

Hier ist der Vergleich wirklich unentschieden, und hier wäre ein konstruierter Sieger einfach und falsch. Qwen3.8-27B hat gemessene agentische Scores, die Gemini fehlen, und umgekehrt.

Qwens Argument stützt sich auf eine starke unabhängige Zahl und eine starke Anbieterzahl. Die unabhängige Zahl ist τ-Banking mit 48,0 gegenüber Geminis 21,4 – mehr als das Doppelte, auf derselben Revision, bei einem Benchmark zu mehrstufiger Tool-Nutzung innerhalb einer Banking-Umgebung. Die Anbieterzahl ist Alibabas eigene Modellkarte, auf der OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 und Agents' Last Exam 20,4 Pass@1 aufgeführt sind. Das sind Alibabas eigene Evaluierungen, die von niemand anderem erneut durchgeführt wurden, und sie liegen genau in den Kategorien, in denen das unabhängig gemessene GDPval-Ergebnis (45,4 % normalisiert vs. 13,8 %) in dieselbe Richtung weist.

Für Gemini spricht, dass es den einen hohen absoluten agentischen Wert im Vergleich besitzt – τ²-Bench 95,6 – und Qwen überhaupt keinen τ²-Bench-Wert hat. Außerdem hat es IFBench 77,1 für Instruction-Following, eine weitere Leerstelle auf Qwens Seite. Und es hat eine siebenmonatige Produktionshistorie, die eine fünf Wochen alte Open-Weights-Veröffentlichung nicht vorweisen kann.

Der Tiebreaker ist kein Punktwert, sondern deine Topologie. Qwens agentischer Vorteil wird an Benchmarks gemessen, bei denen das Modell in einem großen, bereits bestehenden Softwaresystem arbeitet, das es nicht entworfen hat. Der von Gemini wird an Benchmarks gemessen, bei denen das Modell über lange Zeit Anweisungen präzise befolgen muss. Das sind unterschiedliche Fähigkeiten, und beide sind real.

A screenshot of the Artificial Analysis comparison page for Gemini 3.1 Pro Preview against Qwen3.8-27B, showing an Intelligence Index of 29.7 for Gemini 3.1 Pro Preview and 33.7 for Qwen3.8-27B on revision v4.3.2, with blended price rows of $1.74 and $0.47 per 1M tokens, cost per task of $1.01 and $0.67, cost to run the full Intelligence Index of $1,310 and $1,336, and the output-token breakdown beneath.

Programmieren

Beim Programmieren ist die Aufteilung dieselbe, weshalb „Welches ist besser beim Programmieren?“ hier keine eindeutige Antwort hat. Gemini führt beim wissenschaftlichen Rechnen – SciCode 58.7 vs. 46.6 – und sein AA Coding Index von 68.8 auf unserer Katalogseite liegt innerhalb eines Rundungsfehlers von Qwens 68.1, weit innerhalb jedes Konfidenzintervalls, das es wert ist, zitiert zu werden. Bei agentischer Terminal-Arbeit liegen die beiden beim älteren Benchmark nahe beieinander, Qwen 79.8 vs. Gemini 73.8 bei Terminal-Bench 2.1, und beim neueren sind sie nicht zu unterscheiden, wo beide auf einstellige Werte einbrechen.

Alibabas Model Card behauptet viel mehr – SWE-bench Pro 61,7, LiveCodeBench v6 90,3, QwenSWEBench 79,0 –, doch diese Werte sind vom Anbieter gemeldet, und in einer Fußnote auf der Model Card heißt es, dass SWE-bench Pro und QwenSWEBench im Claude-Code-Harness ausgeführt wurden, der nicht der Harness ist, der für die Zahlen eines Wettbewerbers verwendet worden wäre. Die sichere Aussage ist, dass bei dem einen Coding-Benchmark, bei dem die Modelle beider Labore von einem Dritten gemessen wurden, die beiden auf Terminal-Bench 2.1 vier Punkte und auf Terminal-Bench 4.0 1,6 Punkte auseinanderliegen und beide beim schwierigeren schlecht abschneiden.

Offene Gewichte versus ein Vorschau-Endpunkt

Dies ist die Achse, auf der die beiden überhaupt nicht vergleichbar sind, und sie ist die mit der größten praktischen Konsequenz.

Qwen3.8-27B ist Apache 2.0, 27B dichte Parameter, 64 Schichten, mit einem Hybrid aus linearer Gated-DeltaNet-Attention und voller Attention in einem Verhältnis von etwa 3:1 – das Design, das ein 262K-Fenster bezahlbar zu bedienen macht. Es läuft. Auf 4 Bit quantisiert passt es in etwa 17 GB, was einer Consumer-GPU entspricht; innerhalb von fünf Wochen entstand darum ein ganzes Komprimierungs-Ökosystem, von Unsloths Dynamic-V3-Quantisierungen, einschließlich eines 1-Bit-Builds, von dem Unsloth sagt, dass er in 8 GB mit etwa 77 % der ursprünglichen Genauigkeit läuft, bis hin zu PrismMLs Ternary Bonsai 2 27B Mitte September. Man kann es feinabstimmen, man kann es auditieren, und man kann es auf einem Laptop mit abgestecktem Netzwerk laufen lassen.

Gemini 3.1 Pro ist ein geschlossener Preview-Endpunkt, sieben Monate alt, ohne GA-Termin, mit einer Modellkarte, die ausdrücklich davor warnt, dass Previews möglicherweise nicht die Stabilität, Verfügbarkeit und den Support einer stabilen Version bieten, und – seit dieser Woche – einer Entwicklerkonsole, die es offenbar still und leise verlassen hat. Man kann es nicht herunterladen, man kann keine Version fixieren, und man kann kein Failover auf sich selbst durchführen.

Wenn du die ehrliche Routing-Antwort willst statt eines Urteils: Die Existenz des offenen Checkpoints ist es, was die Abhängigkeit von Gemini überlebensfähig macht. Setze Qwen3.8-27B als Fallback hinter einen lokalen oder selbstgehosteten Pfad, behalte Gemini 3.1 Pro auf dem primären Pfad für die schlussfolgerungsintensive Arbeit, bei der es messbar besser ist, und stelle beide hinter einen einzigen Endpunkt mit automatischem Failover, sodass ein stilles Verschwinden aus der Konsole von jemand anderem ein Vorfall ist, den deine Routing-Schicht absorbiert, statt ein Ausfall, den deine Nutzer sehen. Das ist keine Werbung für ein Produkt – es ist die einzige Konfiguration, in der die Nachrichten dieser Woche dich kein Wochenende kosten.

Wähle Gemini 3.1 Pro, wenn

• Ihre anspruchsvollste Arbeit ist wissensintensives Reasoning statt langfristiger Tool-Nutzung — es führt GPQA Diamond von 94,1 auf 90,5, Humanity's Last Exam von 47,0 auf 33,9, SciCode von 58,7 auf 46,6 und CritPt von 17,7 auf 5,4.

• Sie brauchen wirklich lange Eingaben. Ein tatsächlich gemessenes Millionen-Token-Fenster, dessen Recall-Verhalten eingehend getestet wurde, schlägt ein 262K-Fenster, das durch Technik erweitert wurde – vorausgesetzt, Sie können damit leben, dass sich der Preis jenseits von 200K Eingabe-Tokens verdoppelt.

• Die Zeit bis zur vollständigen Antwort ist wichtiger als die Zeit bis zum ersten Token, und Sie möchten 116,5 Token pro Sekunde statt 41,3.

• Sie brauchen heute breite Multimodalität: Audio-, Datei-, Bild-, Text- und Video-Eingabe gegenüber Qwens Text, Bild und Video.

• Sie sind bereit, das Vorschau-Risiko zu akzeptieren, und Sie haben einen Fallback, den Sie selbst kontrollieren.

Wähle Qwen3.8-27B, wenn

• Ihre Agenten arbeiten innerhalb großer bestehender Systeme — τ-Banking 48,0 zu 21,4 und GDPval 45,4 % zu 13,8 % normalisiert sind die beiden größten Vorteile eines einzelnen Modells im gesamten Vergleich.

• Sie brauchen eine Antwort, die ehrlich statt selbstsicher ist. Eine Halluzinationsrate von 30,3 % gegenüber 50,9 % von Gemini ist eine andere Art von Produkt.

• Lizenzierungs- oder Datenresidenzvorschriften schließen eine geschlossene API aus, oder Sie müssen ein Feintuning mit Ihren eigenen Daten durchführen.

• Du willst eine Pro-Token-Abrechnung, die ein Viertel von der von Gemini beträgt, und akzeptierst, dass du die Differenz für Thinking-Tokens ausgibst — der Index kostet auf beiden gleich viel im Betrieb.

• Sie sind bereit, reasoning_effort von seinem xhigh-Standardwert herunterzuregeln, statt ihn unverändert auszuliefern.

Was wir nicht verifizieren konnten

Für das Protokoll – und weil eine Vergleichsseite nur so gut ist wie ihre Leerstellen: Für Qwen3.8-27B wurde keine unabhängige Bewertung bei reduziertem Reasoning-Aufwand veröffentlicht, weshalb sein Kompromiss zwischen Geschwindigkeit und Qualität bei mittel und niedrig ungemessen ist. Für die YaRN-erweiterte 1M-Konfiguration existiert kein Long-Context-Recall-Score. Gemini 3.1 Pro hat keinen veröffentlichten normalisierten GDPval-AA-Score, und Qwen3.8-27B hat keinen für τ²-Bench, IFBench oder ITBench-SRE. Und niemand – auch Google nicht – hat gesagt, warum Gemini 3.1 Pro am 18. September aus dem AI Studio Selector verschwunden ist. Wir werden diese Seite aktualisieren, sobald sich einer dieser Punkte ändert.

A screenshot of the OrcaRouter model page for Qwen3.8 27B (obsidian/qwen3.8-27b), showing Vision, Tools, JSON and Reasoning badges, a 2026-08-15 catalogue date, a 262K-token context window, list pricing of $0.40 input and $4.21 output per 1M tokens with no cached-token rate published, a p50 time to first token of 3.92s and a p95 of 10.00s over seven days, 1023.1M tokens of traffic in the same window, and a description noting the model is served in block-FP8 with the vision tower kept at full precision.

In diesem Artikel verglichen2

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert