
GPT-6.1 Sol vs DeepSeek V4 Pro: Tre mätare, tre olika svar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Fråga hur långt ifrån varandra GPT-6.1 Sol och DeepSeek V4 Pro är, och det ärliga svaret är att det beror på vilken mätare du läser, och de tre mätarna skiljer sig åt mer än vad de flesta modelljämförelser gör när de är oense om allt. När det gäller pris per miljon token, blandat i förhållandet 3:1 mellan indata och utdata, ligger de på 4,00 USD mot 0,99 USD — en faktor fyra. När det gäller vad det faktiskt kostade att köra samma utvärderingssvit, ligger de på 0,72 USD mot 0,67 USD per uppgift — sju procent. I Artificial Analysis Intelligence Index ligger de på 51,8 mot 36 — sexton punkter, vilket låter avgörande tills man tittar på vilka varje siffra jämfördes mot, eftersom den utvärderarens egen metodik placerar de två modellerna i olika ligor. GPT-6.1 Sol släpptes den 29 september 2026 med ett pris på 2,00 USD för indata och 10,00 USD för utdata, med ett fönster på 1 050 000 token. DeepSeek V4 Pro är en MIT-licensierad mixture-of-experts-flaggskeppsmodell, 1,6 biljoner parametrar med 49 miljarder aktiva, släppt den 13 augusti 2026 med ett pris på 0,66 USD och 1,98 USD och ett fönster på 1 048 576 token. Den ena är en textmodell som du kan ladda ner. Den andra ser bilder. Att reda ut vilken av de tre mätarna du faktiskt bör styra efter är hela jobbet.
Indexraden är inte den jämförelse som den verkar vara.
Börja med siffran som citeras mest, eftersom det är den som oftast citeras fel.
Artificial Analysis publicerar sin metodik tillsammans med sin resultattavla, och två meningar i den är viktiga här. Modeller med öppna vikter, står det, jämförs endast med andra modeller med öppna vikter i samma storleksklass – tiny, small, medium, large, med gränsen vid 150 miljarder parametrar. Proprietära modeller jämförs i stället över ett prisintervall, vid ett blandat förhållande mellan input och output på 3:1. Det är två olika jämförelsegrupper. DeepSeek V4 Pro 0813 har öppna vikter – utvärderarens egen FAQ säger det och hänvisar till de publicerade vikterna – och med 1,6 biljoner parametrar totalt hamnar den i den stora klassen för öppna vikter. GPT-6.1 Sol är proprietär och poängsätts mot modeller i sitt eget prisintervall.
En 51,8 och en 36 som står i intilliggande rader i samma tabell är därför inte en direkt jämförelse. De är ett resultat mot en uppsättning jämförbara modeller och ett resultat mot en annan, vilket är precis anledningen till att kostnadssiffrorna per uppgift är jämförbara medan de råa indexsiffrorna inte är det. Om du vill veta om DeepSeek V4 Pro är bra för en nedladdningsbar modell, är 36 siffran som svarar på det. Om du vill veta hur den står sig mot en hostad frontiermodell kommer indexkolumnen inte att berätta det, och det här är ett fall där det ärliga valet är att säga det i stället för att subtrahera 36 från 51,8 och kalla det ett gap.
Vad kan jämföras rent: priskorten, gränserna för kontext och utdata, modalitetslistorna och kostnaden för att köra samma utvärderingssvit – eftersom den sista siffran är en redovisning av identiskt arbete, inte en poäng.
Vad de råa mätarna säger

• Indatapris — GPT-6.1 Sol $2.00 mot DeepSeek V4 Pro $0.66 per miljon tokens
• Pris för utdata — GPT-6.1 Sol $10.00 vs DeepSeek V4 Pro $1.98, som steg till $1.32 och $3.96 inom två fyratimmars UTC-fönster på vardagar
• Cacheläsning — GPT-6.1 Sol 0,10 $ mot DeepSeek V4 Pro 0,022 $ per miljon tokens; båda använder cache, och den billiga sidan är dessutom 4,5× billigare
• Kostnad per indextask — GPT-6.1 Sol $0,72 vs DeepSeek V4 Pro $0,67
• Utdatatokens emitterade på indexsviten — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M
• Maximal utdata — DeepSeek V4 Pro 384 000 tokens mot GPT-6.1 Sol 128 000 tokens
• Modaliteter — GPT-6.1 Sol tar emot text, bilder och filer; DeepSeek V4 Pro tar endast emot text
Den fjärde och femte raden är det intressanta paret. DeepSeek V4 Pro genererar 2,4 gånger så många tokens i samma svit och landar ändå 7 % billigare per uppgift, eftersom dess utdatataxa är en femtedel av GPT-6.1 Sols. Så ser en prisdriven modell ut när man mäter utdata i stället för taxa: mångordigheten är verklig, och den suddar inte ut fördelen. Tidsfönstret är asterisken. Två fyratimmarsblock på vardagar – 40 av veckans 168 timmar – fördubblar den listade taxan till $1,32 och $3,96, och den tilläggsavgiften gäller samma tokens som annars skulle vara de billigaste på endera kortet.
Vad den billigare modellen inte gör
Tre saker, och var och en är en hård gräns snarare än en avvägning.
Den ser inte. DeepSeek V4 Pro är text in, text ut. Inga skärmbilder, inga skannade PDF:er, ingen diagramläsning, inga diagram i ett ärende. Datoranvändning och dokumenttunga arbetsflöden – exakt de arbetsbelastningar som GPT-6.1 Sol är positionerad för – är inte aktuella till något pris. Om din pipeline redan skickar bilder till en visionsmodell är detta ett icke-problem; om den inte gör det är det den avgörande begränsningen.
Den har ingen utgivningstakt som du kan planera efter. Namnet "deepseek-v4-pro" har sedan augusti pekat på 0813-bygget, och det gick inte tyst till: leverantören meddelade att bygget skulle avvecklas den 14 september, drog tillbaka meddelandet två dagar före datumet och fortsatte att betjäna API:t med oförändrad fakturering. Vår egen katalog listar den fortfarande som flaggskeppet med samma kontext, utdatatak och samtidighetsgräns. En leverantör som kan dra tillbaka en avveckling på två dagar kan också låta bli; den operativa slutsatsen är inte att modellen är instabil utan att namnet är en pekare, och att låsa beteendet vid en byggidentifierare i stället för ett ruttnamn är den billiga försäkringen.
Den bär inte med sig den omgivande kunskapen. GPT-6.1 Sol är åtta dagar gammal och har redan en oberoende konfiguration publicerad; DeepSeek V4 Pro har en längre utvärderingshistorik och en mycket större bas av utövare, inklusive en publicerad serving-stack och arbete med genomströmning från tredje part. För en självhostad driftsättning är den materialmängden värd mer än indexraden, eftersom det är vad man konsulterar när modellen beter sig underligt på din hårdvara snarare än på ett benchmark.
När den fyra gånger billigare mätaren är fel mätare
Om den billiga modellen helt enkelt var sämre på allt skulle det här bli en kort artikel. Det besvärande faktumet är att de två ligger 7 % ifrån varandra per uppgift vid identiskt arbete, och 2,4× ifrån varandra i hur mycket de skriver för att komma dit. Det betyder att den blandade token-mätaren – den som säger 4× – mäter en skillnad som du mestadels inte betalar, eftersom den prissätter en tokenblandning som du kanske aldrig skickar. Och indexmätaren, den som säger 16 punkter, mäter mellan två jämförelsegrupper och kan inte subtraheras.
Så den praktiska uppdelningen är inte "frontiermodell för svårt arbete, billig modell för enkelt arbete". Det är en modalitetsuppdelning och en volymuppdelning. Allt som innehåller en bild går till GPT-6.1 Sol, och det gör även allt där svaret är kort och resonemanget är den dyra delen — dess fem ansträngningsnivåer, från low till max med medium som standard, låter dig köpa resonemang utan att köpa prosa, och dess cachade indata på $0.10 gör en lång upprepad prompt billig. Allt som är enbart text, hög volym och tål ett längre svar — klassificering, extrahering, sammanfattning, massgenerering mot en utdatabudget på 384 000 token — går till DeepSeek V4 Pro, helst utanför de två UTC-fönstren.
Båda på en och samma tangent, och uppdelningen är en konfigrad.
Båda modellerna finns på OrcaRouter till sina leverantörers egna publicerade priser, utan påslag: GPT-6.1 Sol till $2.00 / $10.00, som stiger till $4.00 / $15.00 över 272 000 prompt-tokens, och DeepSeek V4 Pro till $0.66 / $1.98 med de två tidsfönstren tillämpade enligt listan. En nyckel, en faktura, en OpenAI-kompatibel slutpunkt för båda.
Det är därför uppdelningen ovan är värd att skriva ned i stället för att argumentera om. En modalitetsuppdelning kan uttryckas som en dirigeringsregel, så att bildinnehållande förfrågningar går till visionsmodellen och merparten av texten går till den billiga modellen utan att applikationen ändras; om en rutt försämras flyttar redundansväxlingen anropet i stället för att låta det misslyckas. Och eftersom båda ligger på samma slutpunkt kan den prisjämförelse som faktiskt spelar roll – din egen, för din trafik, med din tokenmix – tas fram från dina egna fakturor i stället för från genomsnittet för en benchmarksvit.


Domen, i en rad, är att den fyra gånger billigare avläsningen är den man ska misstro och sjuprocentsavläsningen är den man ska kontrollera. Fyra gånger är vad den sammanvägda mätaren säger om en tokenmix som du kanske inte skickar. Sju procent är vad samma utvärdering kostade för båda, och det kommer med en inbyggd skillnad i ordrikedom på 2,4×. De sexton punkterna är verkliga, de är också fördelade över två referensgrupper, och den begränsning som faktiskt avgör de flesta driftsättningar av det här paret är inte en siffra alls: en av dessa modeller kan läsa en skärmbild och den andra kan inte.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
