Hero-Titelkarte: DeepSeek V4.1 Flash vs. Gemini 3.1 Pro – eines davon ist noch eine Vorschau
Guides & Insights

DeepSeek V4.1 Flash vs. Gemini 3.1 Pro: Eines davon ist noch eine Vorschau

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Das Nützlichste, was man über DeepSeek V4.1 Flash im Vergleich zu Gemini 3.1 Pro wissen sollte, steht auf keinem der beiden Datenblätter. DeepSeek V4.1 Flash ist ein allgemein verfügbares Modell, veröffentlicht am 10. September 2026 mit MIT-lizenzierten Gewichten, die Sie herunterladen können. Gemini 3.1 Pro befindet sich seit dem 19. Februar 2026 in der Vorschau und wird rund sieben Monate später noch immer unter einem Vorschau-Build-Namen bereitgestellt. Diese Asymmetrie entscheidet nicht darüber, welches Modell besser ist, aber sie entscheidet darüber, welche Art von Verpflichtung Sie eingehen, wenn Sie auf einem der beiden aufbauen, und sie bildet den Rahmen für alles Folgende.

Beide fassen eine Million Tokens Kontext. Beide akzeptieren Bilder. Die Unterschiede, die sie tatsächlich trennen, sind die Preiskurve oberhalb von 200.000 Eingabe-Tokens, die Eingabemodalitäten, die Obergrenze der Ausgabe und die Tatsache, dass eines dieser beiden eine Datei ist, die man besitzen kann, und das andere eine API.

Wo die beiden tatsächlich stehen

• Preis pro 1 Mio. Token, bis zu 200K Kontext — DeepSeek V4.1 Flash 0,15 $ Eingabe / 0,60 $ Ausgabe vs. Gemini 3.1 Pro 2,00 $ Eingabe / 12,00 $ Ausgabe. Das ist das 13-Fache des Eingabepreises und das 20-Fache des Ausgabepreises.

• Preis pro 1 Mio. Tokens, oberhalb von 200K Kontext — V4.1 Flash unverändert bei $0,15 / $0,60 vs. Gemini 3.1 Pro $4,00 Input / $18,00 Output. Der Input-Multiplikator wächst auf 27× genau an dem Punkt, an dem Long-Context-Arbeit zu Hause ist.

• Zwischengespeicherte Eingabe — V4.1 Flash 0,003 $ pro 1M außerhalb der Spitzenzeiten vs. Gemini 3.1 Pro 0,40 $ pro 1M. Zwei Größenordnungen, und zwar beim Posten, der darüber entscheidet, ob ein erneut gelesener Kontext bezahlbar ist.

• Kontextfenster — 1M Tokens vs. 1M Tokens. Ebene.

• Maximale Ausgabe — V4.1 Flash 384K Token vs. Gemini 3.1 Pro 65K Token. Sechsmal die Obergrenze.

• Eingabemodalitäten — V4.1 Flash verarbeitet Text und Bilder, während Gemini 3.1 Pro Text, Bilder, Audio, Video und Datei-Uploads verarbeitet.

• Gewichte — V4.1 Flash MIT, herunterladbar vs. Gemini 3.1 Pro geschlossen, nur API.

• Release-Status — V4.1 Flash seit 10. September 2026 allgemein verfügbar vs. Gemini 3.1 Pro seit 19. Februar 2026 in der Vorschau.

• Beobachtete Latenz bis zum ersten Token — V4.1 Flash 2,63 s bei p50 und 9,05 s bei p95 vs. Gemini 3.1 Pro 10,00 s bei p50 und 10,00 s bei p95, auf Basis von OrcaRouters eigener 7-Tage-Telemetrie. Die mediane Wartezeit des teuren Modells liegt am Telemetrie-Obergrenze, und sein Tail bewegt sich nicht davon weg.

Liest man die Liste ohne die Preise, ist das Muster aus jedem Open-Weights-gegen-Frontier-Vergleich vertraut: Das herunterladbare Modell gewinnt bei der Ausgabeobergrenze, liegt beim Kontext gleichauf und ist bei der beobachteten Latenz vorn. Das geschlossene Modell gewinnt bei den Modalitäten, und dort gewinnt es klar. Nichts hier erklärt für sich genommen einen 13-fachen Input-Multiplikator.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

Der 200K-Cliff ist die Preis-Story

Der beworbene Preis von Gemini 3.1 Pro ist kein einheitlicher Preis. Prompts mit bis zu 200.000 Eingabe-Token werden mit 2,00 $ pro Million Eingabe und 12,00 $ pro Million Ausgabe abgerechnet; ein Prompt, der diese Schwelle überschreitet, wird mit 4,00 $ und 18,00 $ abgerechnet. DeepSeek V4.1 Flash hat keine Staffel – es berechnet 0,15 $ und 0,60 $, egal ob die Anfrage 2.000 Token oder 900.000 Token umfasst, mit der einen Einschränkung, dass DeepSeek seinen Preis während der Spitzenzeiten verdoppelt und am Wochenende vollständig außerhalb der Spitzenzeiten läuft.

Diese Tarifstufengrenze fällt für Long-Context-Arbeit an die denkbar ungünstigste Stelle, denn Long-Context-Arbeit ist per Definition die Arbeit, die diese Grenze überschreitet. Ein durchgerechneter Vergleich macht es konkret: Nehmen wir eine Pipeline mit 20.000 Aufrufen pro Monat, bei der jeder durchschnittlich 250.000 Eingabe-Tokens und 4.000 Ausgabe-Tokens umfasst – ein Dokumentenanalyse-Job über große Dateien.

• DeepSeek V4.1 Flash zu Off-Peak-Tarifen: 20.000 × 250.000 sind 5.000 Mio. Input-Tokens bei $0,15 pro Million, also $750,00. Der Output beträgt 20.000 × 4.000, das sind 80 Mio. Tokens bei $0,60 pro Million, also $48,00. Insgesamt $798,00.

• Gemini 3.1 Pro in seiner Tarifstufe oberhalb von 200K: Dieselben 5.000 Mio. Eingabe-Tokens zu 4,00 $ pro Million ergeben 20.000,00 $, und 80 Mio. Ausgabe-Tokens zu 18,00 $ pro Million ergeben 1.440,00 $. Gesamt: 21.440,00 $.

Das ist ein 27-facher Unterschied bei den monatlichen Ausgaben für identischen Traffic, und es ist nicht der Faktor, den Sie anhand der Schlagzeilen-Zahlen vermutet hätten. Der Schlagzeilen-Faktor beträgt 13×. Der Faktor, den Sie für Arbeit mit langem Kontext tatsächlich zahlen, beträgt 27×, weil die Stufengrenze genau dort liegt, wo Ihre Prompts sitzen.

Was dich das Vorschau-Label tatsächlich kostet

Ein Preview-Build ist in der gesamten Branche ein Preview-Build: Er bringt keine veröffentlichte Stabilitätsgarantie mit sich. Der Anbieter hat sich nicht dazu verpflichtet, den Endpunkt bei diesem Verhalten, diesem Preis oder diesem Namen zu belassen. Das ist keine Kritik an Gemini 3.1 Pro — es ist das, was das Label bedeutet, und es ist der Grund, warum der Preview-Suffix sieben Monate überdauert hat, statt eine zweiwöchige Formalität zu sein.

Für einen Prototyp ist das nichts. Für einen Produktionspfad ist es ein konkretes, quantifizierbares Risiko: Sie wetten darauf, dass der Build, auf den Sie abgestimmt haben, unverändert bleibt. Der Kontrast zur anderen Seite dieses Vergleichs ist struktureller Natur, nicht rhetorisch. DeepSeek V4.1 Flash ist GA, und seine Gewichte sind MIT-lizenziert und herunterladbar, was bedeutet, dass das Modell selbst dann noch in Ihren Händen wäre, wenn die gehostete API morgen ihre Bedingungen ändern würde. Ein geschlossenes Vorschaumodell bietet Ihnen weder die GA-Zusage noch den Notausstieg. Wenn Ihre Workload auf einem der beiden laufen kann, ist dieser Unterschied mehr wert als ein Benchmark-Punkt.

Wo Gemini 3.1 Pro das bessere Instrument ist

Die Modalitätslücke ist kein Rundungsfehler, und sie ist die einzige Dimension auf dieser Liste, bei der das günstige Modell um keinen Preis ersetzt werden kann. Gemini 3.1 Pro akzeptiert Audio und Video als vollwertige Eingabe, plus Datei-Uploads. DeepSeek V4.1 Flash akzeptiert Text und Bilder. Wenn Ihre Pipeline eine Anrufaufzeichnung, eine Bildschirmaufnahme oder ein Video-Review aufnimmt, ist DeepSeek V4.1 Flash keine günstigere Option — es ist keine Option. Der Faktor 13 ist irrelevant für eine Aufgabe, die ein Modell erledigen kann und das andere nicht.

Es gibt einen zweiten, leiseren Fall. Gemini 3.1 Pro ist seit Februar in irgendeiner Form öffentlich verfügbar, und es ist das Modell mit der längeren Produktionshistorie – mehr Menschen sind an seine Grenzen gestoßen, und sein Verhalten im realen Verkehr ist besser dokumentiert als das einer zwölf Tage alten Veröffentlichung. Für interaktive Arbeit mit hohem Ausgabevolumen, bei der eine mediane Wartezeit von zehn Sekunden akzeptabel ist, weil der Job im Hintergrund läuft, ist diese Erfolgsbilanz das Argument, und es ist ein echtes Argument. Es ist kein Latenzargument: In der obigen Telemetrie ist das günstigere Modell das schnellere der beiden, sowohl beim Median als auch im Tail.

Und da ist die Frage, was das Preview-Label für diese Historie bedeutet. Sieben Monate Verfügbarkeit unter dem Namen eines Preview-Builds sind länger, als die meisten Modelle bekommen, und es sind zugleich sieben Monate ohne GA-Zusage. DeepSeek V4.1 Flash ist zum Zeitpunkt des Schreibens zwölf Tage alt, und seine unabhängige Bilanz ist dünn: Die eine aktuelle Drittanbieter-Testreihe, in der es auftaucht, das am 21. September 2026 veröffentlichte Agentic-Coding-Board von Agents on Rails, platzierte es bei maximalem Aufwand bei 17 %, im Mittelfeld. Zwölf Tage sind nicht genug Zeit, damit die Reputation eines Modells irgendetwas bedeutet, in die eine oder andere Richtung — was der ehrliche Grund dafür ist, dass ein Käufer hier das ältere Modell bevorzugen könnte, und das hat nichts mit Geschwindigkeit zu tun.

Routing nach Kontextlänge, denn das ist die eigentliche Entscheidung

Die Entscheidung, die dieser Vergleich impliziert, ist nicht „wähle eines aus“. Es ist eine Regel mit zwei Klauseln: Arbeit mit langem Kontext und hohem Volumen geht an DeepSeek V4.1 Flash, und alles, was Audio oder Video enthält, geht an Gemini 3.1 Pro. Der unangenehme Teil ist, dass diese Regel leicht zu formulieren, aber lästig umzusetzen ist, weil die beiden Klauseln normalerweise bei verschiedenen Anbietern mit unterschiedlichen Schlüsseln, unterschiedlichen SDKs und unterschiedlichen Ratenlimits liegen.

Beide Modelle sind über einen einzigen OrcaRouter-Schlüssel erreichbar, was die Regel zu einer Routing-Regel macht statt zu Verzweigungscode in Ihrer Anwendung — Sie können die Entscheidung direkt an der Kontextlänge der Anfrage festmachen, also an der Dimension, die hier tatsächlich den Kostenunterschied ausmacht. OrcaRouter gibt die Listenpreise der Anbieter mit 0 % Aufschlag weiter, sodass die oben genannten Staffeltarife Googles eigene sind und der Peak-Zeitplan von DeepSeek DeepSeeks eigener ist, wobei eine Preisänderung eines Anbieters am selben Tag bei uns live geht. Und da eine Seite dieser Paarung ein Preview-Build ist, lohnt es sich, ein automatisches Failover dahinterzusetzen: Wenn der Build unter Ihnen überarbeitet wird, landet die Anfrage auf dem anderen Modell statt auf einer Fehlerseite.

Dieser letzte Punkt ist die praktische Version all dessen, was oben steht. Der 27×-Faktor bei Long-Context-Arbeit ist der Grund, zu routen statt auszuwählen, und das Preview-Label an einem der beiden Modelle ist der Grund, einen Ort zu haben, an den die Anfrage gehen kann, wenn sich der Build ändert.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Was zu sehen

• Ob Gemini 3.1 Pro den Preview-Status verlässt. Ein GA-Release würde den Stabilitätsvorbehalt aufheben und die Gestalt dieses Vergleichs stärker verändern, als es jede Preisänderung vermöchte.

• Ob sich die Stufe über 200K ändert. Die Stufengrenze verrichtet in der Kostenrechnung mehr Arbeit als der beworbene Satz.

• Ob DeepSeek V4.1 Flash eine unabhängige Erfolgsbilanz aufbaut. Ein Modell mit MIT-Gewichten, einer Ausgabegrenze von 384K und einem Kontext von 1M bei 0,15 $ pro Million Eingabe-Token ist ein ungewöhnliches Paket; ob die Leistungsfähigkeit vorhanden ist, ist eine Frage, die noch kein öffentlicher Benchmark beantwortet hat.

Bis das Erste davon eintrifft, lautet die korrekte Zusammenfassung so: DeepSeek V4.1 Flash ist beim Input etwa dreizehnmal günstiger und bei Input mit langem Kontext etwa siebenundzwanzigmal günstiger als Gemini 3.1 Pro, es ist das einzige der beiden, das man herunterladen kann, und das einzige der beiden, hinter dem eine GA-Zusage steht. Gemini 3.1 Pro ist das Modell mit der längeren Produktionshistorie und das einzige der beiden, das Audio und Video lesen kann. Routen Sie entsprechend.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart