
Nex-N2.5 Pro vs Gemini 3.1 Pro: En endagars öppen modell vs en sju månaders förhandsvisning
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
Den märkligaste symmetrin i den här uppgörelsen är att båda modellerna är officiellt ofärdiga, och varje sida bevisar det på ett sätt som den andra inte kan. Gemini 3.1 Pro Preview, Googles stängda multimodala flaggskepp, har varit i preview sedan den 19 februari 2026 – sju månader, en evighet för en banbrytande modell – och dess tillverkare har fortfarande inte deklarerat allmän tillgänglighet. Nex-N2.5 Pro, modellen för datoranvändning med 397 miljarder parametrar från den öppna modellalliansen Nex-AGI, är en dag gammal när detta skrivs och tar redan emot trafik från kostnadsfria hostade API-slutpunkter – ändå är dess Apache-2.0-vikter märkta ”kommer snart” på Hugging Face, vilket gör den ofärdig på ett annat sätt. Den ena är en färdig produkt i alla avseenden utom leverantörens vilja att säga det. Den andra är en ofärdig produkt i alla avseenden utom leverantörens vilja att skicka ut den.
Dessa två varianter av ofullständighet förändrar hur varje siffra nedan bör läsas. Gemini 3.1 Pro är Googles nuvarande flaggskeppsmodell för resonemang — multimodal, med stöd för text, bild, ljud, video och filer, en kontext på 1M token, ett utdatatak på 65K och ett pris på 2,00 USD per miljon token för inmatning och 12,00 USD per miljon token för utdata, där priset trappas upp när en förfrågan passerar 200K inmatade token. Nex-N2.5 Pro är en gles mixture-of-experts-modell med totalt 397B parametrar, varav cirka 17B är aktiva, text och bild in, text ut, med en kontext på 262 144 token och en visionslinga byggd för att styra datorer och webbläsare. De ligger i samma prisnära hörn av typen ”premium agentmodell”, är oense om nästan allt annat, och ingen av dem har en leverantör som är villig att förklara den färdig.
Specifikationsbladet: två multimodala modeller av 1M-klass.
Lägg kuverten bredvid varandra:
• Status — Nex-N2.5 Pro: tillkännagavs den 8 september 2026; värdbaserade slutpunkter är live, vikter väntar. Gemini 3.1 Pro: i förhandsvisning sedan den 19 februari 2026, fortfarande inte GA.
• Skala — Nex-N2.5 Pro: 397B totalt / ~17B aktiv MoE, eftertränad från Qwen3.5-linjen. Gemini 3.1 Pro: antalet parametrar ej offentliggjorda.
• Modalitet — Nex-N2.5 Pro: text- och bildinmatning, textutmatning; visionen är återkopplingskanalen för datoranvändning. Gemini 3.1 Pro: text-, bild-, ljud-, video- och filinmatning, textutmatning.
• Kontext / utdata — Nex-N2.5 Pro: kontext på 262 144 token, dokumenterad serveringslängd. Gemini 3.1 Pro: kontext på 1M token, 65K utdatatak.
• Resonemangskontroll — Nex-N2.5 Pro: ingen / medel (adaptiv, standard) / hög. Gemini 3.1 Pro: justerbar tankebudget; inget offentligt ”max”-nivådrama.
• Vikter — Nex-N2.5 Pro: Apache-2.0, kommer snart. Gemini 3.1 Pro: stängd.
• Pris per 1M tokens — Nex-N2.5 Pro: kostnadsfri värdnivå, inget listpris publicerat. Gemini 3.1 Pro: $2.00 / $12.00, som stiger till $4.00 / $18.00 över 200K inmatningstokens, $0.20 för cachad inmatning.
De två specifikationsbladen är överens om väldigt lite utöver ”lång kontext, multimodal, dyr att bygga.” De viktiga skillnaderna är tillägget för 200K indata på Gemini-sidan, de kostnadsfria men overifierbara ekonomiska villkoren på Nex-sidan, och det faktum att endast Nex-N2.5 Pro är arkitekterad för att läsa av en skärm.

Två olika sätt att vara ofärdig
Google: sju månaders förhandsvisning som ett produktbeslut
Gemini 3.1 Pro:s förhandsvisningsstatus är inte kosmetisk, och den blir alltmer den viktigaste faktorn om modellen. Googles Pre-GA-villkor tillåter produktionsanvändning samtidigt som de förbehåller sig rätten att ändra beteende eller avveckla slutpunkten – en reell risk för ett team som placerar en flaggskeppsmodell på en kritisk väg. Modellens bana har inte gjort något för att avveckla den risken: den lanserades i februari som den högst presterande modellen på marknaden, 57 på Artificial Analysis Intelligence Index vid den tidpunkten, och har sedan dess mätts om på en strängare indexskala till ungefär 48, medan dess tänkta efterträdare, Gemini 3.5 Pro, gled från ett tillkännagivande i maj till upprepade förseningar och rapporter om eventuell inställd utgivning. Under tiden skickade Google ut Gemini 3.7 Flash i augusti för 0,75 $ / 3,75 $ och Gemini 3.8 Flash i början av september, och den billigare Flash-serien har klättrat förbi Pro-flaggskeppet på det oberoende indexet. Att anta Gemini 3.1 Pro idag innebär att man antar ett flaggskepp vars leverantör håller det i förhandsvisning medan dess billigare syskon överträffar det och dess efterträdare befinner sig i limbo.
Nex-AGI: en dag av "kommer snart" som leveransstatus

Nex-N2.5 Pros ofullständighet går i motsatt riktning: allt levereras utom det som skulle göra den verklig. De värdbaserade slutpunkterna är live och gratis, de OpenAI-kompatibla anropen fungerar, och modellkortet är fyllt med benchmark-siffror — OSWorld-2 på 56.4, Terminal-Bench 2.1 på 82.7, SWE-Bench Pro på 61.2, alla uppmätta genom alliansens eget NexCUA-testramverk, som man säger ska bli öppen källkod men inte har gjort. Men vikterna går inte att ladda ner, inget releasedatum är kopplat till bannern, och inget oberoende laboratorium har kört modellen, eftersom ingen kan det. Medan Gemini 3.1 Pro är mätbar men inte utlovad, är Nex-N2.5 Pro utlovad men inte mätbar. Båda tillstånden borde få ett produktionslag att tveka, av olika skäl.
Där de oberoende bevisen lever
Det oberoende facit i denna uppgörelse tillhör nästan uteslutande en sida. Gemini 3.1 Pro har sex månaders offentlig testning bakom sig: oberoende labb har benchmarkat den, produktionsteam har kört den hårt, och den har ett aktuellt Artificial Analysis Intelligence Index-värde på nära 48 — blygsamt för en flaggskeppsmodell, och anledningen till att Googles billigare Flash-modeller har gått om den, men en faktisk mätning utförd av någon annan än tillverkaren. Nex-N2.5 Pro saknar motsvarande facit. Dess enda poäng är Nex-AGI:s egna, på en testmiljö som allmänheten inte har sett. Den jämförelse som räknas är därför inte "48 mot ingenting" — utan "en modell vars svagheter är dokumenterade" mot "en modell vars styrkor är påstådda." För en arbetsuppgift där ett felaktigt svar är kostsamt är den asymmetrin ofta avgörande oavsett siffrorna.
Så här ser lagförslaget om lång kontext ut
Båda modellerna marknadsför lång kontext, men de tar betalt för det på sätt som avslöjar deras avsikter. Gemini 3.1 Pro:s 1M-tokenfönster har en avgift på $2.00 / $12.00 som stiger till $4.00 / $18.00 när en begäran överstiger 200K tokens i inmatning – en premie på ungefär 60 % för inmatning och 50 % för utdata som läggs exakt på de arbetsbelastningar som 1M-fönstret finns till för. Om du matar den med en repositorykontext på 500K tokens vid varje tur i en agentsession, läggs den premien på vartenda anrop. Nex-N2.5 Pro:s 262K-kontext är mer blygsam, men dess hostade nivå är gratis och Nex-AGI har inte publicerat någon betald taxa alls, så det finns ingen premie för lång kontext att prissätta – det finns inte heller någon prissignal för vad modellen är värd. Google berättar exakt vad dess fönster kostar, och priset är högt; Nex-AGI berättar ingenting, vilket inte är samma sak som billigt.
Vad du kan dirigera idag

Här skiljer sig de två sidorna tydligt åt för ett fungerande team. Gemini 3.1 Pro finns på OrcaRouter till Googles listpris — samma $2.00 / $12.00 med steget över 200K som skickas vidare oförändrat — och dess status som förhandsversion är precis argumentet för att dirigera runt den snarare än att satsa en kritisk sökväg på den: automatisk redundans innebär att ett förhandsproblem eller en avveckling omdirigeras till en reserv utan kodändring, och routing-DSL:et låter dig skicka de förfrågningar som behöver Googles multimodalitet till Gemini medan billigare modeller tar hand om rutintrafiken. Nex-N2.5 Pro finns inte på OrcaRouter — ingen nex-agi-modell är listad i vår katalog — eftersom dess enda levande byggen är de kostnadsfria slutpunkterna som Nex-AGI länkar från sitt kort. Den dag en leverantör erbjuder den till ett verkligt listpris, kommer den att dyka upp här till det priset utan påslag, och denna jämförelse blir körbar snarare än teoretisk.
Vem ska röra vilken?
Det ärliga svaret formas av vilken typ av risk du tål. Om du behöver multimodalt resonemang i stor skala idag och kan tolerera en leverantör som håller sitt flaggskepp i förhandsversion medan dess färdplan skiftar, är Gemini 3.1 Pro det mätbara valet — sex månaders oberoende testning är en verklig tillgång, och Flash-syskonens framväxt är ett skäl att dirigera om snarare än ett skäl att undvika familjen. Om du bygger datoranvändande agenter på öppna vikter och är beredd att vänta på något verifierbart, är Nex-N2.5 Pro den mer intressanta långsiktiga satsningen — men den är ännu inte en satsning du kan göra, eftersom du inte kan köra den, reproducera dess resultat eller skriva under ett kontrakt som är beroende av den. De team som blir nöjdast med endera beslutet är de som ser båda modellerna för vad de är: en sju månader gammal förhandsversion som alla har testat, och en en dag gammal förhandsversion som ingen har testat.
