
Solar Mini 4 vs Granite 4.2 3B: een model dat je aanroept en een checkpoint dat je downloadt
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 per 1 mln tokens
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 per 1 mln tokens · 159 tok/s
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 220 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaNIEUWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
Zet Solar Mini 4 naast Granite 4.2 3B en het interessante getal is niet de benchmarkkloof. Het is dat Granite 4.2 3B, het Apache-2.0-redeneermodel van IBM dat op 25 augustus 2026 is uitgebracht, vanavond gratis op een laptop draait, terwijl Solar Mini 4, het propriëtaire model van Upstage dat op 22 september 2026 is uitgebracht, op geen enkel apparaat dat jij bezit zal draaien en $0,10 per miljoen inputtokens en $0,40 per miljoen outputtokens in rekening brengt om een vraag te beantwoorden. Beide activeren per token ongeveer drie miljard parameters aan rekenkracht. De een is een bestand. De ander is een meter.
Dat verschil bepaalt bijna al het andere aan deze vergelijking, inclusief welke benchmarks het überhaupt waard zijn om naast elkaar te leggen. Granite 4.2 3B onderging al lang voordat Solar Mini 4 dat deed een onafhankelijke evaluatie — Artificial Analysis geeft het een 9 op de Intelligence Index v4.3.2, uit dezelfde evaluatiesuite en van dezelfde organisatie die Solar Mini 4 een 24 geeft. Wat betekent dat de kloof van vijftien punten hier ongewoon goed onderbouwd is: het is één lab, één methodologie en twee modellen die niemand op goed vertrouwen hoefde aan te nemen.
De specificatie, op de dimensies die hen daadwerkelijk onderscheiden
• Architectuur — Solar Mini 4 is een sparse mixture-of-experts: 35B totale parameters, 3B actief per token, volgens Upstage. Granite 4.2 3B is dense, ongeveer 3B parameters met ruwweg 4B totaal inclusief embeddings volgens de safetensors-metadata. Hetzelfde activeringsbudget, twee verschillende manieren om het te besteden.
• Gewichten — Solar Mini 4 is propriëtair en gesloten. Granite 4.2 3B wordt uitgebracht onder Apache 2.0, met een gedocumenteerd trainingsrecept tot op het niveau van de dataproporties.
• Context — Upstage documenteert 512K tokens met tot 128K uitvoer; Artificial Analysis vermeldt 1,0M voor hetzelfde model, dus beschouw het plafond als onbeslist. Granite 4.2 3B draait native 131.072 tokens, uitgebreid naar 512K door een vijfde pre-trainingfase.
• Prijs — Solar Mini 4 voor $0,10 / $0,01 gecached / $0,12, momenteel tot 22 oktober 2026. Granite 4.2 3B heeft geen leverancierstariefkaart omdat er niets te huren valt; de gehoste endpoints die Artificial Analysis volgt prijzen het rond $0,03 / $0,12, en zelfhosting kost elektriciteit.
• Intelligentie-index — 24 voor Solar Mini 4, 9 voor Granite 4.2 3B, beide van Artificial Analysis v4.3.2.
• Snelheid — 204 outputtokens per seconde voor Solar Mini 4 en 223 voor Granite 4.2 3B, beide gemeten door hetzelfde lab, met een tijd tot de eerste chunk van respectievelijk 1,5 s en 0,5 s. Het dense model is op beide punten het snelste.
Waar het gat van vijftien punten eigenlijk uit bestaat

Afzonderlijke evaluaties vertellen een minder flatteus verhaal dan de kop voor Granite 4.2 3B, en een gecompliceerder verhaal voor Solar Mini 4. Op AA-LCR v1.1, de benchmark voor redeneren met lange context, scoort Solar Mini 4 83% en Granite 4.2 3B 24%. Die enkele evaluatie is verantwoordelijk voor een enorm deel van het indexverschil, en het is geen toeval van schaal — het is wat je koopt met 512K tot 1M tokens context en de training om die te benutten. Het venster van Granite 4.2 3B reikt native tot 131K; de uitgebreide fase van 512K bestaat, maar het model is niet afgestemd om daarbinnen te redeneren zoals Solar Mini 4 dat is.
Op algemene kennis wordt de kloof kleiner en slaat daarna om van karakter. Granite 4.2 3B scoort 55,9% op GPQA, en Solar Mini 4 heeft helemaal geen GPQA-cijfer; op Humanity's Last Exam zijn de twee respectievelijk 6,6% en 25,8%, wat de directere vergelijking is en degene die het grootteverschil voorspelt. Wat Granite 4.2 3B volgens Artificial Analysis niet doet, is verzinnen: het niet-hallucinatiepercentage op AA-Omniscience is 73,7%, hoger dan de 64,2% van Solar Mini 4. Het kleinere model is minder geneigd een antwoord te verzinnen dat het niet heeft.
Agentisch coderen is waar beide modellen onderuitgaan, en waar het aankomt op het lezen van de cijfers. Solar Mini 4 scoort 1% op Terminal-Bench 4.0 en 22,3% op AutomationBench-AA. Granite 4.2 3B scoort 0% op Terminal-Bench 4.0, 13,9% op de oudere Terminal-Bench 2.1 en 5,6% op τ³-Banking. Geen van beide modellen is het juiste instrument voor autonoom werk in de terminal. De 8B- en 30B-modellen van de Granite 4.2-familie kregen de agentische reinforcement learning van IBM en hebben SWE-Bench- en Terminal-Bench-resultaten; de 3B sloeg dat trainingsblok expliciet over, en het model van Upstage is geprijsd voor retrieval, structurering en beleidstoepassing in plaats van voor het aansturen van een shell.
Waar Granite 4.2 3B nog steeds het juiste antwoord is
Zeven en een derde gigabyte aan gewichten in bfloat16, minder dan vier gigabyte bij een praktische kwantisatie, en een Apache 2.0-licentie waarmee je het op je eigen data kunt fine-tunen en het resultaat kunt uitbrengen zonder het iemand te hoeven vragen. Een student met één consumenten-GPU, een ziekenhuis dat patiënttekst niet naar een derde partij mag sturen, een product dat moet werken in een vliegtuig of in een fabriekskelder, een team dat een model wil bezitten in plaats van een endpoint te huren — elk van die gevallen kiest Granite 4.2 3B en kijkt niet meer achterom. De engine draait via vLLM, SGLang, Transformers en GGUF, en Ollama vermeldt een granite4.2:3b-build.
De door de leverancier gerapporteerde cijfers verdienen de gebruikelijke voorzichtigheid. IBM's modelkaart claimt 78,33 op AIME 2025, 66,67 op HMMT februari 2025 en 69,71 op LiveCodeBench v6 — geen enkele derde partij heeft ze kunnen reproduceren, en voor een dense 3B-model ligt de AIME-score ver boven het historische bereik. De Artificial Analysis-index van 9 registreert het model als daadwerkelijk nuttig en verre van de frontier, wat juist het betrouwbaardere signaal is, precies omdat IBM het niet heeft gepubliceerd.
Waar Solar Mini 4 het juiste antwoord is
Alles waarbij het werk een lang document is, een herhaalde gestructureerde extractie, of een beleid dat consistent op grote schaal moet worden toegepast — en waarbij negentig seconden latentie acceptabel is. Het profiel van Solar Mini 4 is dat van een specialist: 83% op lang-contextredenering, 48% op wetenschappelijk programmeren, 64% op niet-hallucineren, en een gedocumenteerde neiging om zich van een oordeel te onthouden in plaats van te gokken. Het spreekt ook Koreaans als volwaardige taal naast Engels en Japans, wat voor een uitrol in de Koreaanse markt geen voetnoot is.
Wat kopers niet moeten doen, is de twee tokenprijzen met elkaar vergelijken en concluderen dat Solar Mini 4 drie keer zo duur is. Artificial Analysis mat Solar Mini 4 op $0,36 per voltooide Intelligence Index-taak — en, op dezelfde suite, Granite 4.2 3B op $0,006. Dat is een factor zestig, gedreven door dezelfde factoren die de kosten van Solar Mini 4 opdrijven ten opzichte van GPT-6 Luna (max): 88.300 outputtokens per taak tegenover 18.600 van Granite, en een kostenstructuur waarin prompt-cache-schrijfacties goed zijn voor $0,30 van de $0,36 van Solar Mini 4, tegenover $0,0006 van de $0,006 van Granite. Een goedkope outputprijs bij een verbose model is geen goedkope taak.

Geen van beide modellen staat op OrcaRouter — we routeren noch Granite noch Upstage — dus als je Granite 4.2 3B wilt, komt die van Hugging Face, en als je Solar Mini 4 wilt, komt die van de eigen API van Upstage en platformen van derden. Maar het patroon met twee modellen dat deze vergelijking suggereert, is er een waarvoor routers zijn gebouwd, en het is de reden dat OrcaRouter meer dan 200 modellen achter één sleutel zet tegen 0% opslag bovenop de lijstprijs van de provider: laat het werk voor lange documenten en Koreaans draaien op welk model dan ook dat zijn kosten daadwerkelijk waard is, houd de deterministische extractiestappen op iets dat je zelf host, en laat routing en failover een verzoek per aanroep in plaats van per contract tussen hen verplaatsen.

Een laatste opmerking over de bovenstaande cijfers. Elk cijfer voor Solar Mini 4 dat van Artificial Analysis komt, is een onafhankelijke meting; elk cijfer voor Granite 4.2 3B uit IBM's modelkaart is een claim van de leverancier die door geen enkele derde partij is gereproduceerd. De indexscores van 24 en 9 van Artificial Analysis zijn de enige twee getallen hier die door hetzelfde lab onder dezelfde omstandigheden zijn geproduceerd — en dat zijn de twee waarop een beslissing gebaseerd moet worden.
