Hero-titelkort: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — en av dessa är fortfarande en förhandsversion
Guides & Insights

DeepSeek V4.1 Flash vs Gemini 3.1 Pro: En av dessa är fortfarande en förhandsversion

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det mest användbara att känna till om DeepSeek V4.1 Flash mot Gemini 3.1 Pro står inte på något av specifikationsbladen. DeepSeek V4.1 Flash är en allmänt tillgänglig modell som släpptes den 10 september 2026 med MIT-licensierade vikter som du kan ladda ner. Gemini 3.1 Pro har varit i förhandsversion sedan den 19 februari 2026 och tillhandahålls fortfarande under ett förhandsversionsbyggnamn ungefär sju månader senare. Den asymmetrin avgör inte vilken modell som är bättre, men den avgör vilken typ av åtagande du gör när du bygger på en av dem, och den är ramen för allt nedan.

Båda har en kontext på en miljon token. Båda tar emot bilder. De skillnader som faktiskt skiljer dem åt är priskurvan över 200 000 indatatoken, indatamodaliteterna, utdatataket och det faktum att en av dessa två är en fil du kan äga och den andra är ett API.

Var de två egentligen står

• Pris per 1 miljon tokens, upp till 200K kontext — DeepSeek V4.1 Flash $0,15 in / $0,60 ut mot Gemini 3.1 Pro $2,00 in / $12,00 ut. Det är 13 gånger priset för indata och 20 gånger priset för utdata.

• Pris per 1M tokens, över 200K kontext — V4.1 Flash ligger oförändrat på $0,15 / $0,60 jämfört med Gemini 3.1 Pro $4,00 in / $18,00 ut. Indatamultipeln vidgas till 27× precis vid den punkt där arbete med lång kontext hör hemma.

• Cachad indata – V4.1 Flash $0,003 per 1M under lågtrafik jämfört med Gemini 3.1 Pro $0,40 per 1M. Två storleksordningar, på den kostnadspost som avgör om en omläsning av kontexten är överkomlig.

• Kontextfönster — 1M tokens vs 1M tokens. Jämnt.

• Maximal utdata — V4.1 Flash 384K tokens vs Gemini 3.1 Pro 65K tokens. Sex gånger så högt tak.

• Indatamodaliteter – V4.1 Flash tar emot text och bilder, medan Gemini 3.1 Pro tar emot text, bilder, ljud, video och filuppladdningar.

• Vikter — V4.1 Flash MIT, nedladdningsbar kontra Gemini 3.1 Pro sluten, endast API.

• Utgivningsstatus — V4.1 Flash allmänt tillgänglig sedan 10 september 2026 jämfört med Gemini 3.1 Pro i förhandsversion sedan 19 februari 2026.

• Observerad latens till första token — V4.1 Flash 2,63 s vid p50 och 9,05 s vid p95 jämfört med Gemini 3.1 Pro 10,00 s vid p50 och 10,00 s vid p95, enligt OrcaRouters egen 7-dagars telemetri. Den dyra modellens medianväntetid ligger vid telemetrins tak, och dess svans rör sig inte bort från det.

Läs listan utan priserna, och formen känns igen från varje jämförelse mellan öppna vikter och frontier: den nedladdningsbara modellen vinner på utdatataket, ligger lika på kontext och ligger före i observerad latens. Den slutna modellen vinner på modaliteter, och på dem vinner den ohotat. Ingenting här förklarar en 13× indatamultipel i sig.

Two-column scoreboard: DeepSeek V4.1 Flash vs Gemini 3.1 Pro — price per 1M tokens $0.15 input and $0.60 output vs $2.00 and $12.00 up to 200K and $4.00 and $18.00 above, cached input $0.003 vs $0.40, context window 1M tokens on both, max output 384K tokens vs 65K tokens, input modalities text and images vs audio, file, image, text and video, weights MIT vs closed, release state generally available since 2026-09-10 vs in preview since 2026-02-19, and a time to first token of 2.63 s at p50 and 9.05 s at p95 vs 10.00 s at p50 and p95

200K-stupet är prisberättelsen

Det pris som anges i rubriken för Gemini 3.1 Pro är inte ett enda pris. Prompter på upp till 200 000 indatatoken faktureras med 2,00 USD för indata och 12,00 USD för utdata per miljon; en prompt som passerar den gränsen faktureras med 4,00 USD för indata och 18,00 USD för utdata. DeepSeek V4.1 Flash har ingen prisnivå – den fakturerar 0,15 USD för indata och 0,60 USD för utdata oavsett om begäran är 2 000 token eller 900 000, med den enda haken att DeepSeek fördubblar sin taxa under högtrafik och körs helt off-peak på helger.

Den nivågränsen hamnar på sämsta tänkbara plats för arbete med lång kontext, eftersom arbete med lång kontext per definition är just det arbete som korsar den. En genomräknad jämförelse gör det konkret. Ta en pipeline som gör 20 000 anrop i månaden, där varje anrop i genomsnitt har 250 000 indatatokens och 4 000 utdatatokens — ett dokumentanalysjobb över stora filer.

• DeepSeek V4.1 Flash till lågtrafikpriser: 20 000 × 250 000 är 5 000 M indatatoken till $0,15 per miljon, eller $750,00. Utdata är 20 000 × 4 000, vilket är 80 M token till $0,60 per miljon, eller $48,00. Totalt $798,00.

• Gemini 3.1 Pro på sin nivå över 200K: samma 5 000 M indatatoken till $4,00 per miljon är $20 000,00, och 80 M utdatatoken till $18,00 per miljon är $1 440,00. Totalt $21 440,00.

Det är en 27× skillnad i månatliga utgifter för identisk trafik, och det är inte den multipel du skulle ha gissat utifrån rubriksiffrorna. Rubrikens multipel är 13×. Den multipel du faktiskt betalar för långkontextarbete är 27×, eftersom nivågränsen ligger exakt där dina prompter befinner sig.

Vad preview-etiketten faktiskt kostar dig

En förhandsversion är en förhandsversion i hela branschen: den medför ingen publicerad stabilitetsgaranti. Leverantören har inte förbundit sig att hålla slutpunkten vid det beteendet, det priset eller det namnet. Det är inte en kritik av Gemini 3.1 Pro – det är vad beteckningen innebär, och det är därför som förhandsversionssuffixet har överlevt i sju månader i stället för att vara en tvåveckorsformalitet.

För en prototyp är detta ingenting. För en produktionsväg är det en specifik, kvantifierbar risk: du satsar på att bygget du trimmade mot förblir oförändrat. Kontrasten mot den andra sidan av den här jämförelsen är strukturell snarare än retorisk. DeepSeek V4.1 Flash är GA, och dess vikter är MIT-licensierade och nedladdningsbara, vilket innebär att även om det hostade API:et ändrade sina villkor i morgon, skulle modellen själv fortfarande vara i dina händer. En stängd förhandsvisningsmodell ger dig varken GA-åtagandet eller nödutgången. Om din arbetsbelastning kan köras på endera är den skillnaden värd mer än en benchmarkpoäng.

Där Gemini 3.1 Pro är det bättre instrumentet

Modalitetsgapet är inte ett avrundningsfel, och det är den enda dimensionen på den här listan där den billiga modellen inte kan ersättas till något pris. Gemini 3.1 Pro tar ljud och video som förstklassig indata, plus filuppladdningar. DeepSeek V4.1 Flash tar text och bilder. Om din pipeline tar in en samtalsinspelning, en skärmdump eller en videorecension är DeepSeek V4.1 Flash inte ett billigare alternativ – det är inte ett alternativ. Faktorn 13× är irrelevant för en uppgift som den ena modellen kan utföra och den andra inte.

Det finns ett andra, tystare fall. Gemini 3.1 Pro har varit offentligt tillgänglig, i någon form, sedan februari, och det är modellen med den längre produktionshistoriken – fler har stött på dess gränser, och dess beteende i verklig trafik är bättre dokumenterat än vad som är fallet för en tolv dagar gammal lansering. För utdatatungt interaktivt arbete där en medianväntetid på tio sekunder är acceptabel eftersom jobbet körs i bakgrunden, är den historiken argumentet, och det är ett verkligt sådant. Det är inte ett latensargument: enligt telemetrin ovan är den billigare modellen den snabbare av de två både vid medianen och vid svansen.

Och så är det frågan om vad förhandsvisningsbeteckningen innebär för den historiken. Sju månaders tillgänglighet under benämningen förhandsvisningsbygge är längre än vad de flesta modeller får, och det är också sju månader utan ett GA-åtagande. DeepSeek V4.1 Flash är tolv dagar gammal när detta skrivs och dess oberoende historik är tunn: den enda färska tredjepartsutvärderingen som den förekommer i, Agents on Rails-tavlan för agentisk kodning som publicerades den 21 september 2026, placerade den på 17 % vid maximal ansträngning, i mitten av fältet. Tolv dagar är inte tillräckligt med tid för att en modells rykte ska betyda något, i endera riktningen — vilket är det ärliga skälet till att en köpare kan föredra den äldre modellen här, och det har inget med hastighet att göra.

Routning baserat på kontextlängd, eftersom det är det verkliga beslutet

Beslutet som den här jämförelsen antyder är inte "välj en". Det är en regel med två klausuler: arbete med lång kontext och hög volym går till DeepSeek V4.1 Flash, och allt som innehåller ljud eller video går till Gemini 3.1 Pro. Det besvärliga är att den här regeln är lätt att formulera och irriterande att implementera, eftersom de två klausulerna vanligtvis finns hos olika leverantörer med olika nycklar, olika SDK:er och olika hastighetsbegränsningar.

Båda modellerna kan nås med en enda OrcaRouter-nyckel, vilket gör regeln till en routingregel i stället för förgreningskod i din applikation – du kan basera beslutet direkt på begärans kontextlängd, vilket är den dimension som faktiskt driver kostnadsskillnaden här. OrcaRouter förmedlar leverantörens listpriser vidare med 0 % påslag, så de stegvisa priserna ovan är Googles egna och DeepSeeks peak-schema är DeepSeeks eget, med en leverantörsprisändring live hos oss samma dag. Och eftersom ena sidan av detta par är en förhandsversion är automatisk failover värt att lägga bakom den: om versionen revideras under dig landar begäran på den andra modellen i stället för på en felsida.

Den sista punkten är den praktiska versionen av allt ovan. 27×-multipeln för arbete med lång kontext är anledningen till att routa i stället för att välja, och preview-etiketten på en av de två modellerna är anledningen till att ha någonstans dit begäran kan ta vägen när bygget ändras.

Screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the model id, 1M-token context, 65K max output, audio, file, image, text and video input, $2.00 input and $12.00 output per 1M tokens, and observed time to first token of 10.00 s at both p50 and p95

Vad du ska titta på

• Huruvida Gemini 3.1 Pro lämnar förhandsversionen. En GA-lansering skulle ta bort stabilitetsförbehållet och förändra formen på den här jämförelsen mer än någon prisförändring skulle göra.

• Huruvida nivån över 200K förändras. Nivågränsen spelar större roll i kostnadsberäkningen än vad den annonserade räntan gör.

• Huruvida DeepSeek V4.1 Flash bygger upp ett oberoende track record. En modell med MIT-vikter, ett tak på 384K utdata och en kontext på 1M för $0,15 per miljon indata är en ovanlig kombination; huruvida förmågan finns där är en fråga som ingen offentlig benchmark ännu har besvarat.

Tills den första av dessa blir tillgänglig är den korrekta sammanfattningen denna: DeepSeek V4.1 Flash är ungefär tretton gånger billigare på indata och tjugosju gånger billigare på indata med lång kontext än Gemini 3.1 Pro, det är den enda av de två som du kan ladda ner, och det är den enda av de två med ett GA-åtagande bakom sig. Gemini 3.1 Pro är modellen med den längre produktionshistoriken och är den enda av de två som kan läsa in ljud och video. Routa därefter.

Screenshot of DeepSeek's own release page for DeepSeek-V4.1-Flash dated 2026/09/10, showing the 552B-parameter MoE architecture with 8B active for input and 16B for output, a KV-cache memory-reduction graphic, and DeepSeek's own four-benchmark comparison chart