
Solar Mini 4 vs Granite 4.2 3B: Ein Modell, das man aufruft, und ein Checkpoint, den man herunterlädt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 pro 1 Mio. Tokens
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 pro 1 Mio. Tokens · 159 tok/s
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 220 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Stell Solar Mini 4 neben Granite 4.2 3B, und die interessante Zahl ist nicht die Benchmark-Lücke. Es ist die Tatsache, dass Granite 4.2 3B, IBMs unter Apache-2.0 stehendes Reasoning-Modell, veröffentlicht am 25. August 2026, heute Abend kostenlos auf einem Laptop läuft, während Solar Mini 4, Upstages proprietäres Modell, veröffentlicht am 22. September 2026, nirgends läuft, wo du es besitzt, und 0,10 $ pro Million Input-Tokens sowie 0,40 $ pro Million Output-Tokens berechnet, um eine Frage zu beantworten. Beide aktivieren pro Token grob drei Milliarden Parameter an Rechenleistung. Das eine ist eine Datei. Das andere ist ein Zähler.
Dieser Unterschied entscheidet über fast alles andere in diesem Vergleich, einschließlich der Frage, welche Benchmarks überhaupt einen direkten Vergleich wert sind. Granite 4.2 3B wurde unabhängig evaluiert, lange bevor Solar Mini 4 dies wurde — Artificial Analysis bewertet es mit 9 auf dem Intelligence Index v4.3.2, aus derselben Evaluationssuite und von derselben Organisation, die Solar Mini 4 mit 24 bewertet. Das bedeutet, dass die Fünfzehn-Punkte-Lücke hier ungewöhnlich gut fundiert ist: ein Labor, eine Methodik und zwei Modelle, bei denen niemand etwas einfach glauben musste.
Die Spezifikation, hinsichtlich der Dimensionen, die sie tatsächlich trennen
• Architektur — Solar Mini 4 ist ein sparse Mixture-of-Experts-Modell: 35B Gesamtparameter, 3B aktiv pro Token, laut Upstage. Granite 4.2 3B ist dense, etwa 3B Parameter, mit insgesamt ungefähr 4B einschließlich Embeddings laut den safetensors-Metadaten. Gleiches Aktivierungsbudget, zwei verschiedene Arten, es einzusetzen.
• Gewichte — Solar Mini 4 ist proprietär und geschlossen. Granite 4.2 3B erscheint unter Apache 2.0 mit einem dokumentierten Trainingsrezept bis hinunter zu den Datenanteilen.
• Kontext — Upstage dokumentiert 512K Token bei bis zu 128K Ausgabe; Artificial Analysis gibt für dasselbe Modell 1,0M an, weshalb die Obergrenze als ungeklärt gelten sollte. Granite 4.2 3B verarbeitet nativ 131.072 Token, erweitert auf 512K durch eine fünfte Vor-Trainingsphase.
• Preis — Solar Mini 4 zu 0,10 $ / 0,01 $ mit Caching / 0,40 $ pro Million Token, derzeit 50 % Rabatt bis zum 22. Oktober 2026. Granite 4.2 3B hat keine Preisliste des Anbieters, weil es nichts zu mieten gibt; die gehosteten Endpunkte, die Artificial Analysis erfasst, berechnen dafür rund 0,03 $ / 0,12 $, und Selbsthosting kostet Strom.
• Intelligence Index — 24 für Solar Mini 4, 9 für Granite 4.2 3B, beide von Artificial Analysis v4.3.2.
• Geschwindigkeit — 204 Ausgabe-Tokens pro Sekunde für Solar Mini 4 und 223 für Granite 4.2 3B, beide vom selben Labor gemessen, mit einer Zeit bis zum ersten Chunk von 1,5 s bzw. 0,5 s. Das Dense-Modell ist bei beiden Werten das schnellere.
Woraus die Fünfzehn-Punkte-Lücke tatsächlich besteht

Einzelbewertungen zeichnen für Granite 4.2 3B ein weniger schmeichelhaftes Bild als die Schlagzeile und für Solar Mini 4 ein komplizierteres. Bei AA-LCR v1.1, dem Langkontext-Reasoning-Benchmark, erreicht Solar Mini 4 83 % und Granite 4.2 3B 24 %. Diese einzelne Bewertung macht einen enormen Anteil der Indexdifferenz aus, und sie ist kein Zufall der Skalierung – sie ist das, was man mit 512K bis 1M Tokens Kontext und dem Training, sie zu nutzen, erkauft. Das Fenster von Granite 4.2 3B reicht nativ bis 131K; die erweiterte 512K-Phase existiert, aber das Modell wurde nicht darauf abgestimmt, Schlussfolgerungen über sie hinweg anzustellen, so wie es bei Solar Mini 4 der Fall war.
Beim Allgemeinwissen verringert sich die Lücke und kehrt dann ins Gegenteil um. Granite 4.2 3B erzielt 55,9 % bei GPQA, und Solar Mini 4 hat überhaupt keinen GPQA-Wert; bei Humanity's Last Exam liegen die beiden bei 6,6 % bzw. 25,8 %, was der direktere Vergleich ist und derjenige, den der Größenunterschied vorhersagt. Was Granite 4.2 3B laut Artificial Analysis nicht tut, ist fabrizieren: Seine AA-Omniscience-Nicht-Halluzinationsrate beträgt 73,7 %, höher als die 64,2 % von Solar Mini 4. Es ist weniger wahrscheinlich, dass das kleinere Modell eine Antwort erfindet, die es nicht hat.
Agentisches Coding ist der Bereich, in dem beide Modelle versagen – und in dem es entscheidend ist, die Zahlen richtig zu lesen. Solar Mini 4 erzielt 1 % auf Terminal-Bench 4.0 und 22,3 % auf AutomationBench-AA. Granite 4.2 3B erzielt 0 % auf Terminal-Bench 4.0, 13,9 % auf dem älteren Terminal-Bench 2.1 und 5,6 % auf τ³-Banking. Keines der beiden Modelle ist das richtige Instrument für autonome Terminal-Arbeit. Die 8B- und 30B-Mitglieder der Granite-4.2-Familie erhielten IBMs agentisches Reinforcement Learning und tragen SWE-Bench- und Terminal-Bench-Ergebnisse; das 3B übersprang diesen Trainingsblock ausdrücklich, und Upstages Modell ist für Retrieval, Strukturierung und Richtlinienanwendung positioniert, nicht für das Steuern einer Shell.
Wo Granite 4.2 3B immer noch die richtige Antwort ist
Sieben und ein Drittel Gigabyte Gewichte in bfloat16, unter vier Gigabyte bei einer praktischen Quantisierung und eine Apache-2.0-Lizenz, die es Ihnen erlaubt, das Modell auf Ihren eigenen Daten feinabzustimmen und das Ergebnis auszuliefern, ohne jemanden fragen zu müssen. Ein Student mit einer einzigen Consumer-GPU, ein Krankenhaus, das Patiententexte nicht an Dritte senden darf, ein Produkt, das in einem Flugzeug oder in einem Fabrikkeller funktionieren muss, ein Team, das ein Modell besitzen statt einen Endpunkt mieten möchte – jeder dieser Fälle entscheidet sich für Granite 4.2 3B und schaut nicht mehr zurück. Die Engine läuft über vLLM, SGLang, Transformers und GGUF, und Ollama führt einen Build für granite4.2:3b auf.
Die vom Anbieter gemeldeten Zahlen verdienen die übliche Vorsicht. IBMs Modellkarte gibt 78,33 auf AIME 2025, 66,67 auf HMMT Februar 2025 und 69,71 auf LiveCodeBench v6 an – allesamt nicht von Dritten reproduziert, und für ein dichtes 3B-Modell liegt der AIME-Wert weit über dem historischen Bereich. Der Indexwert von 9 bei Artificial Analysis verzeichnet das Modell als wirklich nützlich und weit von der Frontier entfernt, was gerade deshalb das vertrauenswürdigere Signal ist, weil IBM ihn nicht veröffentlicht hat.
Wo Solar Mini 4 die richtige Antwort ist
Alles, bei dem es sich bei der Arbeit um ein langes Dokument, eine wiederholte strukturierte Extraktion oder eine Richtlinie handelt, die in großem Umfang konsistent angewendet werden muss – und bei dem neunzig Sekunden Latenz akzeptabel sind. Das Profil von Solar Mini 4 ist ein Spezialistenprofil: 83 % beim Schlussfolgern über langen Kontext, 48 % beim wissenschaftlichen Programmieren, 64 % bei Nicht-Halluzination und eine dokumentierte Neigung, sich eher zu enthalten, als zu raten. Außerdem spricht es Koreanisch als vollwertige Sprache neben Englisch und Japanisch, was für einen Einsatz im koreanischen Markt keine Randnotiz ist.
Was Käufer nicht tun sollten, ist, die beiden Token-Preise zu vergleichen und daraus zu schließen, dass Solar Mini 4 dreimal teurer ist. Artificial Analysis hat Solar Mini 4 mit 0,36 $ pro abgeschlossener Intelligence-Index-Aufgabe gemessen – und, in derselben Suite, Granite 4.2 3B mit 0,006 $. Das ist ein Faktor von sechzig, getrieben von denselben Dingen, die Solar Mini 4 gegenüber GPT-6 Luna (max) in die Höhe treiben: 88.300 Output-Tokens pro Aufgabe gegenüber 18.600 bei Granite, und eine Kostenstruktur, in der Prompt-Cache-Schreibvorgänge 0,30 $ der 0,36 $ von Solar Mini 4 ausmachen, gegenüber 0,0006 $ der 0,006 $ von Granite. Ein niedriger Output-Preis bei einem wortreichen Modell ist keine günstige Aufgabe.

Keines der beiden Modelle ist auf OrcaRouter — wir routen weder Granite noch Upstage —, wenn Sie also Granite 4.2 3B möchten, kommt es von Hugging Face, und wenn Sie Solar Mini 4 möchten, kommt es aus Upstages eigener API und von Drittanbieterplattformen. Doch das Zwei-Modell-Muster, das dieser Vergleich nahelegt, ist genau eines, für das Router gebaut sind, und es ist der Grund, warum OrcaRouter mehr als 200 Modelle hinter einem einzigen Schlüssel mit 0 % Aufschlag auf den Listenpreis der Anbieter bereitstellt: Lassen Sie die Arbeit an langen Dokumenten und die koreanischsprachige Arbeit mit dem Modell laufen, das seine Kosten tatsächlich rechtfertigt, behalten Sie die deterministischen Extraktionsschritte auf etwas, das Sie selbst hosten, und lassen Sie Routing und Failover eine Anfrage pro Aufruf statt pro Vertrag zwischen ihnen verschieben.

Eine letzte Anmerkung zu den obigen Zahlen. Jeder Wert für Solar Mini 4, der von Artificial Analysis stammt, ist eine unabhängige Messung; jeder Wert für Granite 4.2 3B aus IBMs Model Card ist eine Herstellerangabe, die kein Dritter reproduziert hat. Die Indexwerte von Artificial Analysis – 24 und 9 – sind die einzigen beiden Werte hier, die vom selben Labor unter denselben Bedingungen erzeugt wurden – und sie sind die beiden, auf die man eine Entscheidung stützen sollte.
