
Nex-N2.5 Pro vs MiniMax M3: det påstådda 34-punktersgapet och modellen du faktiskt kan ladda ner
- openaiNYOpenAI: GPT-6 Astra2026-09-0455Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0247Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0247Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0157Intelligens82Kodning
- AlibabaNYQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiNYZ.ai: GLM 5.3 Flash2026-08-2646Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1541Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1251Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0547Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligens49Kodning
Den mest slående siffran i den här duellen är 56,4 mot 22,3 – och den minst verifierbara. Det är OSWorld-2-poängen som Nex-AGI:s Nex-N2.5 Pro och MiniMax M3 har på den nya modellens eget benchmark-kort: Pro på 56,4 och MiniMax M3 på 22,3 – en skillnad på 34 poäng på det långsiktiga computer-use-riktmärket som varje seriös GUI-agent numera mäts mot. Nex-N2.5 Pro, som introducerades den 8 september 2026, är den multimodala agenten med totalt 397B parametrar (cirka 17B aktiva), vars vikter fortfarande är ”coming soon”. MiniMax M3, som släpptes den 1 juni 2026, är det multimodala flaggskeppet med öppna vikter (totalt 428B parametrar, varav cirka 23B aktiva), som även tar emot video, erbjuder en 1M-kontext via MiniMax Sparse Attention och har varit nedladdningsbar sedan början av juni. Den ena av dessa två modeller kan du hämta från hubben och köra i kväll. Den andra är en hostad förhandsversion med ett löfte. Och den skillnad på 34 poäng som gör duellen värd att läsa publiceras av tillverkaren av den modell du inte kan köra och gäller ett riktmärke där till och med den nuvarande ledarens egen siffra är självrapporterad.
Så den här sidan handlar egentligen om hur du väger en dramatisk, overifierbar ledtråd mot en modest, delvis verifierbar sådan – och om vad den billiga modellens existens gör med den dyra modellens säljargument. MiniMax M3 är motvikten som varje specialist med väntande vikter måste argumentera emot: den gör redan det mesta av jobbet, den kostar nästan ingenting, och dess filer ligger på din disk. För att Nex-N2.5 Pro ska spela roll måste 34-punktspåståendet överleva de tre kontroller som följer.
Första kontrollen: mäter siffrorna ens samma sak?
OSWorld-2 är den långsiktiga, verklighetsbaserade utökningen av det ursprungliga OSWorld-riktmärket: en agent använder äkta skrivbordsprogramvara för att genomföra flerstegsuppgifter och poängsätts utifrån om den får verkligt arbete utfört, inte om den klickar på rätt knapp. Den är dramatiskt svårare än sin föregångare, och det är det riktmärke där Nex-AGI hävdar att dess Pro-nivå skiljer sig från de multimodala konkurrenterna. Men titta var de två raderna kommer ifrån. Nex-N2.5 Pros 56,4 är Nex-AGI:s egen mätning genom sin interna NexCUA-testmiljö, som modellkortet säger kommer att göras till öppen källkod ”snart”. MiniMax M3:s 22,3 är en siffra som Nex-AGI tagit fram för en konkurrerande modell — MiniMax har inte publicerat något eget OSWorld-2-resultat, och M3:s offentliga datoranvändningssiffra är det äldre, enklare OSWorld-Verified, som Nex-AGI:s modellkort också listar på 75,2 för M3 mot 82,2 för Pro. Båda raderna i rubriken 56,4 mot 22,3 kommer från samma testmiljö, körda av samma leverantör, samma dag, om en modell som den äger och en modell som den inte äger. Det gör inte gapet falskt — testmiljöer finns just för att jämföra modeller under identiska förhållanden. Det innebär däremot att siffran är en enda leverantörs kontrollerade jämförelse, inte ett resultat som något externt labb har bekräftat, och gapet är exakt lika tillförlitligt som den testmiljö som producerade det.
Andra kontrollen: vad levererar modellen som du faktiskt kan köra?
MiniMax M3 behöver inte sin OSWorld-2-rad för att vara användbar, eftersom dess sak vilar på saker du kan verifiera genom att ladda ner den. Den är 428B totalt / ~23B aktiv, byggd på MiniMax Sparse Attention, med en kontext på 1M-token och en utdatabudget på 512K; den tar emot text, bild och video och returnerar text; dess vikter har funnits på Hugging Face sedan första veckan i juni; och dess listpris på MiniMax:s API är $0,30 per miljon inmatningstokens och $1,20 per miljon utdatatokens, med $0,06 för cachad inmatning — ungefär en femtedel av utdatapriset för de billigaste slutna frontmodellerna, med video fakturerat separat. Dess oberoende ställning är verklig men blygsam: en 44:a på Artificial Analysis Intelligence Index placerar den i mellanskiktet bland flaggskeppsmodeller, under det 56–61-spann som de slutna ledarna upptar. Dess rubriksiffror för agenter — 75,2 OSWorld-Verified enligt Nex:s kort, ~70 i MiniMax:s egen rapportering, 83,5 BrowseComp — är leverantörsrapporterade och inte oberoende reproducerade, samma asterisk som följer Nex. Skillnaden är att M3:s påståenden pekar på en modell som du själv kan köra och testa om, vilket är varför "leverantörsrapporterad" svider mindre på sidan med nedladdningsbara vikter.

Tredje kontrollen: vad skulle du faktiskt göra med var och en?
• Köp idag — MiniMax M3: riktiga vikter, en prislista och ett fungerande API. Nex-N2.5 Pro: en gratis webbaserad förhandsvisning och en färdplan.
• Datoranvändning — MiniMax M3: en generalist som hanterar skärmbilder och video och vars GUI-poäng hamnar mitt i fältet. Nex-N2.5 Pro: en visionsnativ agent som är byggd för den visuella återkopplingsslingan och som gör anspråk på den klassledande platsen i OSWorld-2.
• Pris — MiniMax M3: $0.30 / $1.20, cache $0.06 — billigt nog att kasta på långa agentloopar. Nex-N2.5 Pro: inget publicerat pris ännu; effektivitetsargumentet (17B aktiva parametrar på en enda 8×H100-nod) är en prognos, inte en faktura.
• Kontext — MiniMax M3: 1M tokens, där förfrågningar över 512K faktureras till 2×. Nex-N2.5 Pro: 262K familjekonfiguration.
• Indata — MiniMax M3: text, bild och video, nativt. Nex-N2.5 Pro: bild och text, inriktad mot perception på skärmnivå.
• Verifierbarhet — MiniMax M3: självhostbar, så alla påståenden kan testas internt. Nex-N2.5 Pro: inga vikter, så alla påståenden är Nex-AGI:s ord.
• Oberoende index — MiniMax M3: 44 (AA). Nex-N2.5 Pro: inget ännu.
Varför den billiga etablerade aktören är den svårare motståndaren
Det finns en anledning till att Nex-AGI valde att ta med MiniMax M3 i sin multimodal-tabell snarare än att ignorera den: M3 är prisancharet som gör det svårt att motivera premien för en specialist på datoranvändning. Om en generalist som kostar 0,30/1,20 dollar och accepterar video kan klara även 70–75 % av vad en dedikerad GUI-agent hävdar, måste specialisten vara dramatiskt bättre på själva uppgiften för att förtjäna sin plats – och Nex-N2.5 Pro:s kort säger att den är det, på OSWorld-2, med 34 poäng. Men en ledning på 34 poäng som utmanaren trycker om sin ännu inte lanserade modell är en hypotes, medan M3:s 44 Index, dess öppna vikter och dess pris är fakta du kan bygga på. Den ekonomiskt rationella hållningen är inte att avfärda hypotesen – det är att kräva att den överlever en oberoende körning innan den kostar någon pengar.
Kör jämförelsen med din egen nyckel.
Routningslagret är där en prisankrad jämförelse som denna testas utan att binda sig vid någondera sidan. MiniMax M3 finns på OrcaRouter till MiniMax:s listpris – $0.30 / $1.20, med 0 % påslag, så den dag MiniMax ändrar ett pris är ändringen live på samma nyckel som du redan använder för resten av katalogen. Nex-N2.5 Pro erbjuds inte genom oss, så du når den via Nex-AGI:s hostade förhandsversion tills de utlovade vikterna dyker upp. Experimentet som faktiskt besvarar denna matchning: rikta din högvolymstrafik av långkontextagenter mot MiniMax M3 genom den ena slutpunkten, kör en mindre utvärderingsgren mot Nex-N2.5 Pro:s förhandsversion och jämför dem på din egen uppgiftsmix medan automatisk failover håller båda ärliga – ett leverantörspåstående om 34 poäng är värt exakt lika mycket som din egen reproduktion av det, och M3 är tillräckligt billig för att reproducera testet nästan utan kostnad. När Pro:s vikter dyker upp är receptet med åtta H100 den verkliga leveransen att kontrollera: huruvida den 17B-aktiva specialisten håller sitt OSWorld-2-försprång när någon annan än Nex-AGI kör den.


Den dom som bevisen stöder
När det gäller allt som går att agera på just nu vinner MiniMax M3 den här uppgörelsen per automatik: den går att ladda ner, den är prissatt till en femtedel av vad som är norm bland frontier-modellerna, den tar emot video, den har ett oberoende Index, och dess computer-use-anspråk – även om de kommer från leverantören – pekar mot en modell som du kan testa om i din egen stack den här veckan. Nex-N2.5 Pro är den mer intressanta modellen och det sämre köpet: en vision-nativ computer-use-specialist vars eget modellkort gör anspråk på ett klassledande OSWorld-2-resultat och vars vikter ännu inte existerar. Betrakta gapet 56.4 mot 22.3 som den bästa tillgängliga hypotesen om vart computer use är på väg, inte som ett resultat du kan agera på – och betrakta MiniMax M3 som anledningen till att specialisten, när den väl släpps, kommer att behöva bevisa det gapet på någon annans testbänk för att motivera ett pris över $0.30/$1.20.
