
Nex-N2.5 Pro tegen GPT-5.6 Sol: het leveranciersnummer van de nieuwkomer blijft achter bij het onafhankelijke nummer van de gevestigde speler.
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0455Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0247Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0247Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0157Intelligentie82Coderen
- AlibabaNIEUWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiNIEUWZ.ai: GLM 5.3 Flash2026-08-2646Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1849Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1541Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1251Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0547Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0347Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2140Intelligentie69Coderen
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Intelligentie49Coderen
Neem de enige benchmark {{1}}waar beide een getal naast elkaar hebben staan{{/1}}, en voor een lancering is de volgorde verkeerd. De modelkaart van Nex-AGI geeft Nex-N2.5 Pro een score van 56,4 op OSWorld-2, gemeten met de eigen NexCUA-testharness van de alliantie, die het publiek niet heeft gezien. Het OSWorld 2.0-leaderboard van BenchLM, bijgewerkt op 29 augustus, plaatst GPT-5.6 Sol op 62,6 — een onafhankelijke score die het vendorcijfer van de nieuwkomer ronduit overtreft. Op het thuishonk van het één dag oude model — computergebruik via schermlezen, het enige waarvoor het speciaal is gebouwd — heeft de volwassen generalist waarmee het wordt vergeleken niet eens een asterisk nodig om hoger te scoren. Op geen enkele dimensie die door iemand anders dan de maker van de nieuwkomer is gemeten, is Nex-N2.5 Pro tegenover GPT-5.6 Sol een nek-aan-nekrace. Het is een casestudy over wat een productierecord waard is, en alleen al daarom is het de moeite waard om te lezen.
De twee modellen zijn nauwelijks elkaars rivalen qua doel. Nex-N2.5 Pro, aangekondigd op 8 september 2026, is een sparse mixture-of-experts-model met 397 miljard parameters en ongeveer 17 miljard actieve parameters, multimodaal (tekst en beeld in, tekst uit), nageposttraind vanuit de Qwen3.5-lijn, en gebouwd om computers en browsers te bedienen via een visuele feedbacklus. De Apache-2.0-gewichten staan nog steeds op "coming soon" op Hugging Face, en de enige live builds zijn gratis gehoste endpoints die Nex-AGI vanaf zijn kaart linkt. GPT-5.6 Sol is OpenAI's vlaggenschip voor "het zwaarste werk" — diepgaande meerstapsredenering, grootschalige software-engineering en agentische workflows over lange tijdshorizon — sinds 9 juli in de API, met gesloten gewichten, en draagt nu het gewicht van het frontier-referentiepunt te zijn geweest tot OpenAI op 3 september GPT-6 Astra uitbracht. Waar Nex-N2.5 Pro een specialist is die zijn eigen gewichten niet heeft uitgebracht, is GPT-5.6 Sol een bewezen generalist die al twee maanden draait onder de meest veeleisende productiebelasting in de industrie.
GPT-5.6 Sol is het model met een bestand.
Begin met wat Sol wél heeft en Nex-N2.5 Pro niet heeft: een trackrecord. Sinds 9 juli wordt GPT-5.6 Sol in onafhankelijke testomgevingen gedraaid, door beveiligingsonderzoekers zwaar op de proef gesteld en opgenomen in agentframeworks en Codex-workflows. De onafhankelijke metingen zijn grondig en openbaar: 61 op de Artificial Analysis Intelligence Index bij maximale redeneerinspanning, 88.0 op Terminal-Bench 2.1 en 73.0 op DeepSWE, gemeten met dezelfde onafhankelijke testomgeving, en een gemeten outputsnelheid van ongeveer 71 tokens per seconde, met een kostprijs van ruwweg $0.95 per Intelligence Index-taak. Niets daarvan maakt Sol onverslaanbaar — OpenAI heeft GPT-6 Astra sindsdien boven Sol gepositioneerd — maar elk van die getallen is een meting die door iemand anders dan OpenAI is uitgevoerd. Nex-N2.5 Pro heeft nergens een onafhankelijke notering, om een structurele reden: niemand buiten de alliantie kan het draaien.
De enige benchmark waar beide een nummer hebben
De OSWorld-vergelijking is de meest zuivere indicatie die beschikbaar is, en verdient daarom dat de kanttekeningen worden genoemd voordat ze wordt gebruikt. De 56,4 van Nex-N2.5 Pro is Nex-AGI's eigen meting op OSWorld-2 via hun NexCUA-harness. De 62,6 van GPT-5.6 Sol komt van de OSWorld 2.0-ranglijst van BenchLM, een externe momentopname gedateerd 29 augustus 2026, die vijftien modellen vermeldt en Claude Opus 5 als eerste plaatst met 70,6, met GPT-5.6 Sol als tweede met 62,6 en GPT-5.6 Terra als derde met 50,2. "OSWorld-2" en "OSWorld 2.0" zijn nauwe verwanten maar niet bewezen identiek, dus het exacte verschil van vier tot zes punten moet als richtinggevend worden gelezen, niet als precies. Wat de kanttekeningen overleeft is de volgorde: bij het beste getal dat elke partij kan overleggen, verslaat een onafhankelijk Sol-cijfer een leverancierscijfer van Nex op de benchmark die Nex heeft gekozen om te publiceren. Een nieuwkomer wiens eigen getal lager is dan het onafhankelijke getal van de gevestigde partij, heeft geen overtuigende reden gegeven om over te stappen.

Specificatie-enveloppen
De rest van de specsheet loopt in dezelfde richting:
• Uitgebracht — Nex-N2.5 Pro: 8 september 2026 (gehoste endpoints live, gewichten volgen nog). GPT-5.6 Sol: 9 juli 2026, algemeen beschikbaar.
• Schaal — Nex-N2.5 Pro: 397B totaal / ~17B actieve MoE. GPT-5.6 Sol: aantal parameters niet bekendgemaakt.
• Modaliteit — Nex-N2.5 Pro: tekst en afbeelding in, tekst uit, computer-use vision loop. GPT-5.6 Sol: tekst-, afbeeldings- en bestandsinvoer, tekstuitvoer, met tool calling en JSON-modus.
• Context / uitvoer — Nex-N2.5 Pro: een context van 262.144 tokens. GPT-5.6 Sol: een context van ~1,05M tokens, met een uitvoerlimiet van 128K.
• Redeneercontrole — Nex-N2.5 Pro: geen / gemiddeld (adaptief, standaard) / hoog. GPT-5.6 Sol: redeneerinspanning tot het maximum, plus een aparte snelle verwerkingslaag.
• Gewichten — Nex-N2.5 Pro: Apache-2.0, binnenkort beschikbaar. GPT-5.6 Sol: gesloten.
• Prijs per 1M tokens — Nex-N2.5 Pro: gratis gehoste laag, geen catalogusprijs. GPT-5.6 Sol: $4.00 / $20.00 promotionele catalogusprijs sinds 21 augustus, $0.40 voor gecachte invoer, tarief wordt boven 272K invoertokens heringedeeld naar $8.00 / $30.00.
Sol's context van ~1,05M tokens en uitvoerplafond van 128K doen Nex-N2.5 Pro's venster van 262K verbleken voor langetermijnwerk, en Sol's prijs is, hoewel verre van goedkoop, een vast bedrag waar een budget mee kan rekenen. Nex-N2.5 Pro's gratis laag is het enige getal aan zijn kant, en dat is geen prijs.
Wat een dag oude score waard is

Elke benchmarkclaim rond Nex-N2.5 Pro — OSWorld-2 op 56,4, Terminal-Bench 2.1 op 82,7, SWE-Bench Pro op 61,2, BrowseComp op 89,7 — deelt één eigenschap: Nex-AGI heeft hem geproduceerd, via een harness waarvan de alliantie zegt die te zullen open-sourcen, maar dat heeft ze nog niet gedaan. Geen van die cijfers is onafhankelijk gereproduceerd; dat kan ook niet: de gewichten zijn niet te downloaden en er hangt geen datum aan de 'coming soon'-banner. Dat speelt bij deze vergelijking een grotere rol dan bij de meeste, omdat het model waarmee Nex-N2.5 Pro wordt vergeleken het langste onafhankelijke trackrecord in de industrie heeft. Wanneer de hele bewijsvoering van de uitdager op eigen opgave berust en die van de gevestigde partij niet, ligt de bewijslast volledig bij de uitdager; een gratis endpoint voldoet daar niet aan. Zodra de shards landen en een onafhankelijk lab Nex-N2.5 Pro draait, worden de cijfers in dit artikel controleerbaar en wordt de vergelijking echt. Tot die tijd is 'day-old score' de juiste term — een score die niet valt te inspecteren op een model dat niet valt te draaien.
Prijs, route en de vorm van de beslissing
De kosten zijn het punt waarop de twee zijden het minst vergelijkbaar zijn, omdat slechts één zijde een prijs heeft. Het tarief van $4,00 / $20,00 voor GPT-5.6 Sol is de promotionele lijstprijs van OpenAI die sinds 21 augustus geldt en waarvan is aangegeven dat deze ten minste tot en met 21 november blijft gelden, verlaagd van $5,00 / $30,00 — een verlaging die het vlaggenschip aanzienlijk betaalbaarder maakte voor grootschalig agentisch werk, en die een pass-through-router dezelfde dag doorberekent als OpenAI haar doorvoert. Sol staat op OrcaRouter tegen die lijstprijs, zonder opslag, met de batch-tier en fast-tier beschikbaar via dezelfde API-sleutel als 200+ andere modellen. Zo kan een team verzoeken die de diepgang van OpenAI nodig hebben naar Sol routeren, en goedkopere modellen naar al het overige. Nex-N2.5 Pro heeft geen lijstprijs, alleen gratis gehoste endpoints — prima om een model te evalueren, maar een slechte basis voor een productiebudget. Je kunt geen uitgaven plannen rond een getal dat niet bestaat, en je kunt geen architectuur plannen rond gewichten die niet zijn vrijgegeven.

De beslissing waartoe deze onderlinge vergelijking daadwerkelijk dwingt, gaat over risico, niet over mogelijkheden. Als je een model nodig hebt dat er over een kwartaal nog zal zijn, met een bekende prijs, een bekend faalprofiel en maanden van adversariële tests achter de rug, is GPT-5.6 Sol de rationele keuze — en dat OpenAI er GPT-6 Astra boven heeft gelanceerd, maakt die keuze alleen maar sterker, want Sol is nu het bewezen werkpaard, met de prijsverlaging die rechtstreeks op productievolume is gericht. Als je computer-use-agents bouwt op open gewichten en het je kunt veroorloven om te wachten op iets verifieerbaars, is Nex-N2.5 Pro het volgen waard — een 17B-actieve multimodale specialist is precies het soort model dat de gesloten frontier herhaaldelijk op kosten heeft onderboden. Maar volgen is hier het sleutelwoord. Op elke dimensie die door iemand anders dan de maker wordt gemeten, blijft Nex-N2.5 Pro achter bij het model met het dossier, en totdat de gewichten beschikbaar komen, eindigt de vergelijking daar.
Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
