
DeepSeek V4.1 Flash vs Gemini 3.1 Pro: Een van deze is nog steeds een preview
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 mln tokens
- orcaNIEUWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligentie76Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Het nuttigste dat je moet weten over DeepSeek V4.1 Flash in vergelijking met Gemini 3.1 Pro staat op geen van beide specificatiebladen. DeepSeek V4.1 Flash is een algemeen beschikbaar model, uitgebracht op 10 september 2026 met MIT-gelicentieerde gewichten die je kunt downloaden. Gemini 3.1 Pro is sinds 19 februari 2026 in preview en wordt ongeveer zeven maanden later nog steeds onder een preview-buildnaam aangeboden. Die asymmetrie bepaalt niet welk model beter is, maar bepaalt wel wat voor soort verbintenis je aangaat wanneer je op een van beide voortbouwt, en het vormt het kader voor alles hieronder.
Beide ondersteunen een context van een miljoen tokens. Beide accepteren afbeeldingen. De verschillen die hen echt onderscheiden, zijn de prijscurve boven 200.000 invoertokens, de invoermodaliteiten, het uitvoerplafond, en het feit dat een van deze twee een bestand is dat je kunt bezitten en de andere een API.
Waar de twee daadwerkelijk staan
• Prijs per 1 miljoen tokens, tot 200K context — DeepSeek V4.1 Flash $0,15 in / $0,60 uit vs Gemini 3.1 Pro $2,00 in / $12,00 uit. Dat is 13 keer de invoerprijs en 20 keer de uitvoerprijs.
• Prijs per 1 mln. tokens, boven een context van 200K — V4.1 Flash blijft ongewijzigd op $0,15 / $0,60 tegenover Gemini 3.1 Pro $4,00 in / $18,00 uit. De inputfactor loopt op tot 27× precies op het punt waar werk met lange context plaatsvindt.
• Gecachte invoer — V4.1 Flash $0,003 per 1M buiten piekuren vs Gemini 3.1 Pro $0,40 per 1M. Twee ordes van grootte, op de kostenpost die bepaalt of het opnieuw lezen van een context betaalbaar is.
• Contextvenster — 1M tokens vs 1M tokens. Niveau.
• Maximale output — V4.1 Flash 384K tokens vs Gemini 3.1 Pro 65K tokens. Zes keer de bovengrens.
• Invoermodaliteiten — V4.1 Flash ondersteunt tekst en afbeeldingen, terwijl Gemini 3.1 Pro tekst, afbeeldingen, audio, video en bestandsuploads ondersteunt.
• Gewichten — V4.1 Flash MIT, downloadbaar vs Gemini 3.1 Pro gesloten, alleen API.
• Releasestatus — V4.1 Flash algemeen beschikbaar sinds 10 september 2026 vs Gemini 3.1 Pro in preview sinds 19 februari 2026.
• Waargenomen latentie tot het eerste token — V4.1 Flash 2,63 s bij p50 en 9,05 s bij p95 versus Gemini 3.1 Pro 10,00 s bij p50 en 10,00 s bij p95, op basis van de eigen 7-daagse telemetrie van OrcaRouter. De mediane wachttijd van het dure model zit op het plafond van de telemetrie, en de staart wijkt er niet van af.
Lees de lijst zonder de prijzen en de vorm komt bekend voor uit elke vergelijking tussen open-weights en frontier: het downloadbare model wint op uitvoerplafond, evenaart op context en ligt voor op waargenomen latentie. Het gesloten model wint op modaliteiten, en op die punten wint het ronduit. Niets hier verklaart op zichzelf een inputfactor van 13×.

De 200K-kloof is het prijsverhaal
Het hoofdtarief van Gemini 3.1 Pro is niet één tarief. Prompts tot 200.000 invoertokens worden gefactureerd tegen $2,00 voor invoer en $12,00 voor uitvoer per miljoen; een prompt die die drempel overschrijdt, wordt gefactureerd tegen $4,00 en $18,00. DeepSeek V4.1 Flash kent geen staffel — het rekent $0,15 en $0,60, of het verzoek nu 2.000 tokens of 900.000 tokens is, met als enige kanttekening dat DeepSeek zijn tarief tijdens piekuren verdubbelt en in het weekend volledig buiten de piek draait.
Die tariefgrens ligt op de slechtst mogelijke plek voor langcontextwerk, omdat langcontextwerk per definitie het werk is dat die grens overschrijdt. Een uitgewerkte vergelijking maakt het concreet. Neem een pijplijn die 20.000 aanroepen per maand doet, met gemiddeld 250.000 invoertokens en 4.000 uitvoertokens per aanroep — een documentanalysetaak over grote bestanden.
• DeepSeek V4.1 Flash tegen dalurentarieven: 20.000 × 250.000 is 5.000M invoertokens tegen $0,15 per miljoen, ofwel $750,00. Uitvoer is 20.000 × 4.000, dat is 80M tokens tegen $0,60 per miljoen, ofwel $48,00. Totaal $798,00.
• Gemini 3.1 Pro in de categorie boven 200K: dezelfde 5.000M invoertokens tegen $4,00 per miljoen kosten $20.000,00, en 80M uitvoertokens tegen $18,00 per miljoen kosten $1.440,00. Totaal $21.440,00.
Dat is een verschil van 27× in maandelijkse uitgaven voor identiek verkeer, en het is niet de factor die je op basis van de kopcijfers zou hebben geraden. De factor in de koppen is 13×. De factor die je daadwerkelijk betaalt voor werk met een lange context is 27×, omdat de niveaugrens precies ligt waar jouw prompts zich bevinden.
Wat het previewlabel je werkelijk kost
Een preview-build is een preview-build in de hele sector: er geldt geen gepubliceerde stabiliteitsgarantie. De leverancier heeft zich er niet toe verbonden om het endpoint op dat gedrag, die prijs of die naam te houden. Dat is geen kritiek op Gemini 3.1 Pro — het is wat het label betekent, en het is de reden waarom het achtervoegsel preview al zeven maanden standhoudt in plaats van een formaliteit van twee weken te zijn.
Voor een prototype stelt dit niets voor. Voor een productiepad is het een specifiek, kwantificeerbaar risico: je gokt erop dat de build waartegen je hebt afgestemd blijft staan. Het contrast met de andere kant van deze vergelijking is structureel而非 retorisch. DeepSeek V4.1 Flash is GA, en de gewichten zijn MIT-gelicentieerd en downloadbaar, wat betekent dat zelfs als de gehoste API morgen zijn voorwaarden zou wijzigen, het model zelf nog steeds in jouw handen zou zijn. Een gesloten previewmodel geeft je noch de GA-toezegging, noch de ontsnappingsroute. Als je workload op beide kan draaien, is dat verschil meer waard dan een benchmarkpunt.
Waar Gemini 3.1 Pro het betere instrument is
De modaliteitskloof is geen afrondingsfout, en het is de enige dimensie op deze lijst waarop het goedkope model tegen geen enkele prijs kan worden vervangen. Gemini 3.1 Pro ondersteunt audio en video als eersteklas input, plus bestandsuploads. DeepSeek V4.1 Flash ondersteunt tekst en afbeeldingen. Als je pipeline een gespreksopname, een schermopname of een videoreview verwerkt, is DeepSeek V4.1 Flash geen goedkopere optie — het is geen optie. De factor 13× is irrelevant voor een taak die het ene model wel en het andere niet kan.
Er is een tweede, stiller argument. Gemini 3.1 Pro is sinds februari in enige vorm publiek beschikbaar, en het is het model met de langere productiegeschiedenis — meer mensen zijn op zijn grenzen gestuit, en zijn gedrag bij echt verkeer is beter gedocumenteerd dan dat van een twaalf dagen oude release. Voor interactief werk met veel output, waarbij een mediane wachttijd van tien seconden acceptabel is omdat de taak op de achtergrond draait, is dat trackrecord het argument, en het is een reëel argument. Het is geen latency-argument: in de bovenstaande telemetrie is het goedkopere model het snelste van de twee, zowel bij de mediaan als in de staart.
En dan is er de vraag wat het preview-label voor die geschiedenis betekent. Zeven maanden beschikbaarheid onder een preview-buildnaam is langer dan de meeste modellen krijgen, en het zijn ook zeven maanden zonder een GA-toezegging. DeepSeek V4.1 Flash is op het moment van schrijven twaalf dagen oud en de onafhankelijke staat van dienst is dun: de enige recente third-party sweep waarin het voorkomt, het Agents on Rails agentic-coding board gepubliceerd op 21 september 2026, plaatste het op 17% bij maximale inspanning, midden in het veld. Twaalf dagen is niet genoeg tijd voor de reputatie van een model om er iets toe te doen, in welke richting dan ook — wat de eerlijke reden is waarom een koper hier misschien de voorkeur geeft aan het oudere model, en dat heeft niets met snelheid te maken.
Routeren op contextlengte, want dat is de echte beslissing.
De beslissing die deze vergelijking impliceert is niet "kies er één." Het is een regel met twee clausules: werk met lange context en grote volumes gaat naar DeepSeek V4.1 Flash, en alles met audio of video erin gaat naar Gemini 3.1 Pro. Het lastige is dat deze regel gemakkelijk te formuleren is en vervelend om te implementeren, omdat de twee clausules meestal bij verschillende leveranciers zitten, met verschillende sleutels, verschillende SDK's en verschillende rate limits.
Beide modellen zijn bereikbaar via één OrcaRouter-sleutel, waardoor de regel een routeringsregel wordt in plaats van vertakkende code in je applicatie — je kunt de beslissing rechtstreeks baseren op de lengte van de aanvraagcontext, de dimensie die hier daadwerkelijk het kostenverschil bepaalt. OrcaRouter geeft de lijstprijzen van providers door met 0% opslag, dus de bovenstaande staffeltarieven zijn die van Google zelf en het DeepSeek-piekschema is dat van DeepSeek zelf, waarbij een prijswijziging van een leverancier dezelfde dag nog aan onze kant live gaat. En omdat één kant van deze combinatie een preview-build is, is het de moeite waard om automatische failover erachter te zetten: als de build onder je voeten wordt herzien, komt de aanvraag bij het andere model terecht in plaats van op een foutpagina.
Dat laatste punt is de praktische versie van alles hierboven. De factor 27× bij werk met lange context is de reden om te routeren in plaats van te kiezen, en het preview-label op een van de twee modellen is de reden om een plek te hebben waar het verzoek naartoe kan wanneer de build verandert.

Wat te kijken
• Of Gemini 3.1 Pro de preview-fase verlaat. Een GA-release zou het stabiliteitsvoorbehoud wegnemen en de vorm van deze vergelijking meer veranderen dan welke prijswijziging dan ook.
• Of de schijf boven de 200K verandert. De grens van de schijf doet meer werk in de kostenberekening dan het genoemde tarief.
• Of DeepSeek V4.1 Flash een eigen staat van dienst opbouwt. Een model met MIT-gewichten, een uitvoerplafond van 384K en een context van 1M voor $0,15 per miljoen input is een ongebruikelijk pakket; of het vermogen er is, is een vraag die nog geen enkele publieke benchmark heeft beantwoord.
Totdat de eerste daarvan verschijnt, luidt de nauwkeurige samenvatting als volgt: DeepSeek V4.1 Flash is ongeveer dertien keer goedkoper op invoer en zevenentwintig keer goedkoper op invoer met lange context dan Gemini 3.1 Pro, het is de enige van de twee die je kunt downloaden, en het is de enige van de twee met een GA-toezegging erachter. Gemini 3.1 Pro is het model met de langere productiegeschiedenis en is de enige van de twee die audio en video kan lezen. Routeer dienovereenkomstig.

