Generierte redaktionelle Hero-Karte mit dem Titel „Ling-3.1-flash vs Gemini 3.8 Flash“ und dem Untertitel „Eine kostenlose 256K-Testversion gegen eine Produktions-API mit 1M Token“. Zwei Vergleichszeilen lauten „Ling-3.1-flash: kostenlose zweiwöchige Testversion, 262.144-Token-Kontext, keine Gewichte veröffentlicht“ und „Gemini 3.8 Flash: 0,75 $ / 3,75 $ pro 1M Token, 1.048.576-Token-Kontext, multimodale Eingabe“, über einer Fußzeile mit dem Text „Ling-Zahlen vom Anbieter angegeben; Gemini-Zahlen laut OrcaRouter und Artificial Analysis.“
Guides & Insights

Ling-3.1-flash vs. Gemini 3.8 Flash: Ein 256K-Testmodell gegen ein Live-Modell mit 1M-Token

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Stellt man Ling-3.1-flash und Gemini 3.8 Flash nebeneinander, liegt die Diskrepanz nicht in der Intelligenz – sondern im Status. Ling-3.1-flash, das ~560 Mrd. Parameter umfassende Mixture-of-Experts-Modell von Ant Group, angekündigt am 29. und 30. September 2026, ist ein kostenloser zweiwöchiger Test mit einem bereitgestellten Kontext von 256K, einer Ausgabegrenze von 32.768 Token, reiner Texteingabe und ohne veröffentlichte Gewichte, Lizenz oder Preis. Gemini 3.8 Flash, Googles Flash-Tier-Reasoning-Modell, veröffentlicht am 2. September 2026, ist eine allgemein verfügbare API mit einem vollständigen 1.048.576-Token-Fenster, 65.536-Token-Ausgabe, multimodaler Eingabe und einer öffentlichen Preisliste. Auf dem Papier ist das ein Vergleich zweier Modelle; in der Praxis ist es ein Vergleich eines Modells, auf dem man heute aufbauen kann, gegen eines, das man nur diesen Monat testen kann.

Das ist kein Grund, Ling-3.1-flash abzutun. Ein kostenloses 560B-MoE mit agentischer Ausrichtung ist zwei Wochen der Evaluierungszeit von jedem wert. Aber es verändert, wofür ein Direktvergleich da ist: nicht „auf welche sollte ich standardisieren“, sondern „ist das Testmodell gut genug, dass ich mich bei der Antwort in fünfzehn Tagen absichern sollte“. Das sind unterschiedliche Fragen, und sie haben auf jeder der unten aufgeführten Achsen unterschiedliche Antworten.

Die drei Dinge, die den Ausschlag geben, noch bevor es irgendein Benchmark tut

Die meisten Vergleiche beginnen mit Bewertungen. Dieser sollte mit der Verfügbarkeit beginnen, denn die Lücke dort ist keine Frage des Grades.

• Preisgestaltung — Ling-3.1-flash ist für die Dauer seiner Testphase kostenlos und hat überhaupt keine veröffentlichte Preisliste nach der Testphase. Gemini 3.8 Flash wird während seines Aktionszeitraums mit 0,75 $ pro Million Eingabe-Tokens und 3,75 $ pro Million Ausgabe-Tokens gelistet, wobei die Preise am 1. Januar 2027 wieder auf 1,50 $ / 7,50 $ zurückgehen. Vom Anbieter angegebene Listenpreise; beide Änderungen vorbehalten.

• Kontext — Ling-3.1-flash bedient in der Testphase 262.144 Token, wobei 1.000.000 als letztendliches Ziel genannt werden. Gemini 3.8 Flash bedient heute die vollen 1.048.576 Token. Wenn Ihr Workload auf das Million-Token-Fenster angewiesen ist, hat derzeit nur einer dieser beiden es.

• Gewichte — Ling-3.1-flash hat keine veröffentlichten: kein Repository, keine Lizenz, keinen Checkpoint, nur die erklärte Absicht, nach der Testphase Open Source zu werden. Gemini 3.8 Flash ist geschlossen und wird es immer bleiben, aber es ist eine verwaltete API, die Sie heute ohne Unklarheiten aufrufen können.

Zusammen gelesen laufen diese drei auf einen Punkt hinaus: Die Hauptvorteile des Ling-Modells sind entweder werblich (kostenlos) oder prospektiv (1M Kontext, offene Gewichte), während die Vorteile des Gemini-Modells vertraglich sind. Diese Asymmetrie zieht sich durch alles, was folgt.

Wo das Ling-Modell wirklich gewinnt

Zwei Orte, und beide sind real.

Der erste Punkt sind die Kosten während der Evaluierung. Eine zweiwöchige kostenlose Testphase für ein Modell dieser Größe ist kein Marketing-Gag, den man einfach wegwischen kann – sie ist der günstigste Weg herauszufinden, ob ein 560B-Mixture-of-Experts mit Ihren Prompts zurechtkommt. Gemini 3.8 Flash ist, egal was es kostet, nicht kostenlos, und eine ernsthafte Evaluierung über ein paar tausend Aufrufe kostet echtes Geld.

Der zweite Punkt ist die Offenheits-Trajektorie. Ling-3.1-flash ist der Nachfolger eines Modells, das tatsächlich MIT-lizenzierte Gewichte veröffentlicht hat, und Ant hat öffentlich erklärt, auch dieses Modell als Open Source freigeben zu wollen. Wenn das mit einer permissiven Lizenz kommt, bekommt man etwas, das Gemini 3.8 Flash nie bieten kann: die Möglichkeit, ein 560B-Basismodell selbst zu hosten, feinabzustimmen oder zu destillieren. Der Haken ist der, der am meisten zählt – man setzt auf ein Versprechen, und das Versprechen der vorherigen Generation wurde mit zwei Wochen Verzögerung eingelöst, nicht garantiert.

Wo Gemini 3.8 Flash weit davon entfernt ist zu verlieren

Lässt man das Verfahren und die Frage der Offenheit außer Acht, fällt der operative Vergleich einseitig zugunsten Googles aus.

• Eingabe – Gemini 3.8 Flash akzeptiert Text, Bild, Video, Datei und Audio. Ling-3.1-flash akzeptiert Text und gibt Text zurück. Für Dokument-, Screenshot- oder Video-Workflows ist dies keine Präferenz, sondern eine Grenze der Leistungsfähigkeit.

• Obergrenze für die Ausgabe – 65.536 Tokens gegenüber 32.768. Relevant, sobald Sie Berichte, Codedateien oder lange strukturierte Ausgaben in einem einzigen Durchgang erzeugen.

• Durchsatz — unabhängige Tests setzen die mediane Ausgabegeschwindigkeit von Gemini 3.8 Flash auf nahezu 249 Token pro Sekunde, wobei OrcaRouters eigene Sieben-Tage-Telemetrie 552 Token pro Sekunde bei einem p50 von 4,95 Sekunden bis zum ersten Token misst. Für das Testhosting von Ling-3.1-flash wurden etwa 63 Token pro Sekunde gemeldet. Das Gemini-Modell spielt in einer anderen Geschwindigkeitsklasse.

• Referenztiefe — Gemini 3.8 Flash hat eine Fülle unabhängiger Messungen hinter sich; die Zahlen von Ling-3.1-flash stammen alle aus erster Hand, auf einem brandneuen Endpunkt, und noch hat kein Dritter sie nachgerechnet.

• Multimodale Agenten — alles, was einen Screenshot, ein PDF oder einen aufgezeichneten Anruf lesen muss, ist von der Architektur her eine Gemini-Aufgabe, nicht wegen der Qualität.

Headless capture of the OrcaRouter model page for Gemini 3.8 Flash, model ID google/gemini-3.8-flash. It is marked FEATURED and credited to Google with a 2026-09-02 date, carries Vision, Audio, Tools, JSON and Reasoning capability chips, and describes the model as Google's most intelligent Flash model with significant gains over 3.7 Flash on software engineering, agentic tasks and multi-step reasoning. A stat strip reads input $0.75 and output $3.75 per 1M tokens, p50 time to first token 4.95 s, p95 10.00 s and 149.9M tokens of traffic over seven days; the pricing table lists $0.750 input, $3.75 output and $0.075 cache read per 1M tokens.

Benchmarks und warum sich die beiden Sets nicht wirklich vergleichen lassen

Der vom Anbieter gemeldete Wert für Ling-3.1-flash ist ein Aggregat von 81,0 über fünf Agent-Benchmarks, mit 40,4 % bei Terminal-Bench 4.0, 55,9 % bei SWE-Atlas und 65,35 % bei HealthBench Professional; Ants eigene Darstellung ergänzt 1.673 Elo bei GDPVal-AA v2.1 und 75,16 bei FrontierSWE. Jede einzelne dieser Angaben ist Ants eigene Messung. Es wurde kein Harness veröffentlicht und, was noch wichtiger ist, es gibt keine Gewichte, mit denen irgendjemand die Suite erneut laufen lassen kann.

Das Bild von Gemini 3.8 Flash ist grundlegend anders. Im aktuellen Build des Intelligence Index von Artificial Analysis (v4.3.2) erzielt es 40,9 bei hohem Reasoning-Aufwand, 39,8 bei mittlerem und 33,5 bei niedrigem – und es ist erwähnenswert, dass der Index kürzlich überarbeitet wurde, sodass Zahlen, die früher im Herbst zu diesem Modell veröffentlicht wurden, auf Grundlage eines anderen Builds berechnet wurden und mit diesen nicht direkt vergleichbar sind. Googles eigene Angaben zu dem Modell umfassen 54,9 bei HLE-Verified und starke Ergebnisse bei Terminal-Bench 2.1 im hohen 80er-Bereich. Unabhängige Zahlen und Anbieterzahlen, Seite an Seite, beide legitim, nicht austauschbar.

Es gibt einen sauberen Quervergleich, der sich lohnt, weil beide zur selben Benchmark-Familie gehören. Auf Terminal-Bench 4.0 liegt die Anbieterangabe für Ling-3.1-flash bei 40,4 %. Claude Sonnet 5.5 – ein Modell der mittleren Kategorie, kein Flaggschiff – erreicht 70,6 % auf derselben Version. Diese eine Zeile ist das stärkste Argument dagegen, Ants Karte als „frontier-adjacent“ zu lesen: Das Modell ist wettbewerbsfähig bei den agentischen Messgrößen, die Ant hervorheben wollte, und eindeutig im Hintertreffen bei der Terminal-Coding-Messgröße, für die eine externe Zahl existiert.

Generated two-column scoreboard titled "Ling-3.1-flash vs Gemini 3.8 Flash - the scoreboard". The Ling-3.1-flash column reads Context 262,144, Output 32,768, Input text only, Price free trial, Weights none, Speed ~63 tok/s. The Gemini 3.8 Flash column reads Context 1,048,576, Output 65,536, Input text, image, audio, Price $0.75 / $3.75, Weights closed, Speed 552 tok/s. A footer reads "Ling figures vendor-reported; Gemini figures per OrcaRouter and Artificial Analysis."

Die praktische Gestalt der Wahl

Wenn Sie in den nächsten zwei Wochen etwas bauen müssen, fällt die Antwort nicht knapp aus, und das ist kein Seitenhieb gegen Ling-3.1-flash. Gemini 3.8 Flash ist das einzige der beiden, das Ihnen einen stabilen Endpunkt, einen veröffentlichten Preis, ein volles Million-Token-Fenster, multimodalen Input und eine Lizenz bietet, die Sie lesen können. Es ist ein Produktionsmodell der Flash-Klasse.

Ling-3.1-flash ist ein Evaluierungsziel. Sein Wert liegt derzeit darin, dass die Evaluierung kostenlos ist und das Modell interessant: Ein 560B-MoE mit nur ~25B aktiven Parametern pro Token ist eine Wette auf Sparsity, und Ant hat es genau für die Agent-, Such- und Büroautomatisierungs-Workloads positioniert, um die Modelle der Flash-Klasse konkurrieren. Während des Testzeitraums eigene Prompts durch das Modell laufen zu lassen, lohnt sich gerade deshalb, weil noch niemand außerhalb von Ant dies getan hat – Sie wären unter den Ersten mit einer anbieterunabhängigen Meinung.

Der Entscheidungsbaum, der diesen Monat Sinn ergibt: Leite die Produktion auf Gemini 3.8 Flash um, verbringe die kostenlose Testphase damit, Ling-3.1-flash gegen deine härtesten Prompts laufen zu lassen, und halte die Open-Weight-Frage als die eigentliche Verzweigung offen. Wenn die Gewichte permissiv daherkommen und ein Preis nahe der Flash-Stufe landet, wird Ling-3.1-flash zu einer echten zweiten Option – einer, die du selbst hosten kannst, was Gemini nie sein wird. Wenn sie mit Auflagen kommen, endet die Testphase – und damit auch der Vergleich.

Beides mit einer Taste ausführen und ehrlich sagen, was fehlt

Gemini 3.8 Flash ist heute im OrcaRouter-Katalog unter der Modell-ID google/gemini-3.8-flash zu Googles eigenem Listenpreis ohne Aufschlag verfügbar — wenn der Aktionspreis im Januar ausläuft, passt sich der Preis, den Sie hier zahlen, automatisch an, statt einen neuen Vertrag zu erfordern. DeepSeek-V4.1-Flash, das andere günstige Flash-Tier-Modell, das es wert ist, im selben Experiment gemessen zu werden, befindet sich im selben Katalog zum Listenpreis seines Anbieters, sodass ein Drei-Wege-Test des Testmodells gegen etablierte Flash-Tier-Optionen hinter einem einzigen API-Schlüssel mit automatischem Failover zwischen ihnen läuft.

Ling-3.1-flash ist nicht in unserem Katalog, und eine Abfrage gegen unsere öffentliche Modell-API liefert für es und für die vorherige Generation not-found — die ehrliche Formulierung ist also, dass die Testphase dort läuft, wo sie läuft, über die eigene Oberfläche des Anbieters und Inferenzplattformen von Drittanbietern, und wir behaupten nicht, es zu hosten. Das ist der Teil dieses Vergleichs, der sich am schnellsten ändern könnte: Ein Modell in einer kostenlosen Testphase mit nicht angekündigtem Preis ist genau die Art von Sache, die in dem Moment auf eine Routing-Schicht gelangt, in dem Ant und seine Hoster eine Preisliste veröffentlichen, und Zero-Markup-Pass-through bedeutet, dass an dem Tag, an dem das geschieht, der Preis hier der Preis dort ist.

Das Urteil ist also enger, als die Parameterzahlen vermuten lassen. Ling-3.1-flash ist das ambitioniertere Modell und das interessantere Forschungsergebnis; Gemini 3.8 Flash ist dasjenige, mit dem man ausliefern kann. Solange es keine Lizenz und keinen Preis gibt, ist das der gesamte Unterschied – und es ist keiner, den eine Benchmark-Zeile entscheiden wird.

Headless capture of the Artificial Analysis page for Gemini 3.8 Flash (High), marked "Released September 2026". Summary tiles read Intelligence 41 (rank 50 of 224), Speed 248.5 output tokens per second (rank 4 of 224), Cost $1.24 per Intelligence Index task at $0.75 input and $3.75 output per 1M tokens with a 90% cache discount (rank 62 of 224), and Verbosity 170M output tokens (rank 96 of 224). The comparison summary states the model is notably fast but very verbose, takes text, image, speech and video input, outputs text, and has a 1M-token context window, and the page names the current Artificial Analysis Intelligence Index build as v4.3.2.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert