
Solar Mini 4 erzielte 24 im Artificial Analysis Index – und kostet pro Aufgabe fünfmal mehr als GPT-6 Luna
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 pro 1 Mio. Tokens
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 pro 1 Mio. Tokens · 159 tok/s
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 220 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
Solar Mini 4 berechnet dasselbe pro Eingabe-Token wie GPT-6 Luna, und etwa fünfmal so viel, um eine Aufgabe tatsächlich abzuschließen. Das ist die ganze Geschichte der ersten unabhängigen Bewertung des neuen Modells von Upstage, und es ist nicht die Geschichte, die die Launch-Materialien erzählt haben. Solar Mini 4 ging am 22. September 2026 als ein Sparse-Mixture-of-Experts-Modell mit 35 Milliarden Parametern live, das etwa 3 Milliarden Parameter pro Token aktiviert, zu einem Preis von 0,10 $ pro Million Eingabe-Token und 0,40 $ pro Million Ausgabe. GPT-6 Luna, OpenAIs Effizienzstufe, wird mit 0,10 $ und 0,50 $ gelistet, mit einer Long-Context-Stufe oberhalb von 272.000 Token, die beide in etwa verdoppelt. Auf einer Preisliste sehen sie wie derselbe Kauf aus. Auf dem Intelligence Index von Artificial Analysis, auf dem beide Modelle durch dieselbe Suite aus zehn Evaluierungen liefen, kostet Solar Mini 4 0,36 $ pro abgeschlossener Aufgabe gegenüber 0,07 $ für GPT-6 Luna (max) — ein Faktor von 5,4, der vollständig daraus resultiert, wie sich die beiden Modelle während einer Aufgabe verhalten, und nicht daraus, was sie für einen Token berechnen.
Am 30. September 2026 veröffentlichte Artificial Analysis seine Ausarbeitung zu dem Modell, das24 Punkte im Intelligence Index v4.3.2 erreicht. Alles in diesem Artikel, das Artificial Analysis zugeschrieben wird, ist die eigene Messung jener Organisation; alles, was Upstage zugeschrieben wird, ist die Behauptung des Anbieters. Die Unterscheidung ist hier wichtiger als sonst, denn die beiden Zahlenreihen stimmen nicht immer überein.
Was der unabhängige Durchlauf tatsächlich sagt

Solar Mini 4 erreicht 24,05 im Intelligence Index, gegenüber einem Median von 12 unter den Reasoning-Modellen seiner Preisklasse. Damit liegt es deutlich über dem Durchschnitt seiner Gewichtsklasse, und Upstages eigene Darstellung – „höchste Gesamtpunktzahl unter den 3B-aktiven Modellen im Vergleich des Artificial Analysis Intelligence Index“ – übersteht unabhängige Tests in genau diesem Punkt. Qwen3.6 35B A3B, das ebenfalls 3B Parameter aktiviert, erreicht 18,2 im selben Index. K2 Horizon MoVA 36B A4B mit 4B aktiven Parametern erreicht 25,3 – und das bei einem kürzeren Kontext: 524K Token gegenüber 1,05 Mio. Token bei Solar Mini 4. Gegen Inkling, ein im Juli veröffentlichtes Open-Weights-MoE mit 975 Milliarden Parametern, liegt Solar Mini 4 mit 24,1 gegenüber 25,0 – nur einen Punkt von einem Modell entfernt, das fast dreißigmal so groß ist und $1,00/$4,05 pro Million Token kostet.
Das Profil in dieser Partitur ist ungleichmäßig, und die Ungleichmäßigkeit ist der nützliche Teil:
• Das Schlussfolgern über lange Kontexte ist die relative Stärke. Solar Mini 4 erreicht 83 % bei AA-LCR v1.1, gleichauf mit MiniMax-M3 und GPT-6 Luna (max) und vor Gemini 3.8 Flash (high) und GPT-6 Astra (max) mit 81 %.
• Wissenschaftliches Programmieren hält stand. 48 % bei SciCode, einen Punkt vor MiniMax-M3 und Inkling (xhigh).
• Agentisches Coding bricht ein. 1 % bei Terminal-Bench 4.0. Nicht „schwach“ – 1 %. Bei AutomationBench-AA, das mehrstufige Workflows über echte SaaS-Anwendungen hinweg ausführt, 22,3 %.
• Die Wissensgenauigkeit ist niedrig, aber das Modell weiß, dass es rät. AA-Omniscience liefert −11 bei 18 % Genauigkeit; das Modell enthält sich bei etwa der Hälfte der ihm gestellten Fragen. Seine Nicht-Halluzinations-Rate liegt bei 64 % und damit deutlich vor Inkling (xhigh) mit 32 % und GPT-6 Luna (max) mit 23 %. Ein Modell, das die Hälfte der Zeit „Ich weiß es nicht“ sagt und in zwei Dritteln der Fälle, in denen es antwortet, richtig liegt, ist ein anderes Instrument als ein Modell, das selbstsicher konfabuliert.
Bei agentischer Wissensarbeit liegen die Werte bei 1072 Elo auf GDPval-AA und 872 Elo auf AA-Briefcase, beide nahe an Inkling (xhigh).
Die fünffache Zahl, entschlüsselt
Die Kosten-pro-Aufgabe-Kennzahl von Artificial Analysis ist diejenige, die die meisten Beschaffungsgespräche entscheiden wird, und sie sollte als Aufschlüsselung gelesen und nicht als Schlagzeile zitiert werden. Zwei Dinge bestimmen sie.
Zuerst das Volumen. Solar Mini 4 erzeugt etwa 88.300 Ausgabe-Tokens pro Intelligence-Index-Aufgabe; 71.600 davon sind Reasoning-Tokens. Bei 0,40 $ pro Million Ausgabe-Tokens sind das ungefähr 0,035 $ der Rechnung — günstig, weil Ausgabe günstig ist. Was es stattdessen kostet, ist Zeit: Bei gemessenen 204 Tokens pro Sekunde verzeichnet Artificial Analysis 430 Sekunden Arbeit für eine durchschnittliche Index-Aufgabe, oder etwa 7,2 Minuten. GPT-6 Luna (max) erzeugt 50.000 Ausgabe-Tokens pro Aufgabe bei 127 Tokens pro Sekunde und braucht 396 Sekunden. Inkling (xhigh), ein Open-Weights-Modell mit 975 Milliarden Parametern, erzeugt 34.700 Tokens und ist in 169 Sekunden fertig. Solar Mini 4 ist langsamer als beide, aber um einen Abstand, der nichts mit der fünffachen Kostendifferenz zu tun hat.
Zweitens – und das ist die ganze Geschichte – Cache-Write-Input. Die Kostenaufschlüsselung von Artificial Analysis rechnet bei Solar Mini 4 etwa 0,30 $ der 0,36 $ pro Aufgabe den Tokens zu, die in den Prompt-Cache geschrieben werden, gegenüber 0,03 $ für Cache-Reads, 0,035 $ für Ausgabe und einem Rundungsfehler für wirklich ungecachte Eingabe. Bei GPT-6 Luna (max) beträgt der Cache-Write 0,012 $ von 0,068 $ – etwa 17 % der Rechnung, gegenüber 82 % bei Solar Mini 4. Gecachte Eingabe ist mit 0,01 $ pro Million der günstigste Posten auf der Preisliste von Upstage, und das Modell von Artificial Analysis nutzt sie auch; das Problem ist, wie viel geschrieben werden muss, bevor sie gelesen werden kann. Ein Agent, der in jedem Turn eine wachsende Konversation erneut sendet, zahlt die Schreibkosten weitaus häufiger als ein Modell, das in einem kurzen, abgeschlossenen Turn antwortet.
Das ist die Erkenntnis, die es wert ist, in die Produktion übernommen zu werden: Bei einem Modell wie diesem sagt der Preis pro Token fast nichts über die Rechnung pro Aufgabe aus. Das Cache-Verhalten schon.
Wo die eigenen Zahlen von Upstage abweichen

Der Launch-Post von Upstage, veröffentlicht am 1. Oktober 2026 unter dem Titel „Solar Mini 4: Gebaut für Agent-Workloads mit hohem Volumen“, meldet 24,1 im Artificial Analysis Intelligence Index – praktisch derselbe Wert – und erhebt mehrere Behauptungen, die neben den unabhängigen Daten stehen, statt auf ihnen aufzubauen.
Der Anbieter nennt 22,3 % bei AutomationBench-AA, was genau den Angaben von Artificial Analysis entspricht, und 47,2 bei τ³-Banking, einem Benchmark für Policy- und Tool-Nutzung, den die Index-Suite seither nicht mehr führt. Er meldet 83,3 % bei AA-LCR und 47,6 % bei SciCode, beide innerhalb eines Rundungsfehlers von den unabhängigen Zahlen. Bei Humanity's Last Exam meldet er 19,6 %, während die Seite von Artificial Analysis 25,8 % für dasselbe Modell angibt; beides sind plausible Lesarten einer notorisch schwankungsanfälligen Evaluation, aber sie sind nicht dieselbe Zahl, und keine von beiden sollte als die andere dargestellt werden.
Zwei Spezifikationsangaben stimmen ebenfalls nicht überein. Upstage dokumentiert ein Kontextfenster von 512K Token mit bis zu 128K Ausgabe-Token. Artificial Analysis führt ein Kontextfenster von 1,0M Token und eine maximale Ausgabe von 262K auf. Upstage erklärt in seinem Blog ausdrücklich, dass die 512K-Angabe der verbindliche Wert für die Auslieferung ist; diese Diskrepanz ist genau die Art von Problem, die man anhand einer API-Antwort klären sollte, bevor jemand darauf eine Retrieval-Pipeline aufbaut.
Der Anbieter führt außerdem den einen Vergleich durch, den er nach eigenen Maßstäben durchführen kann: einen internen Test über drei koreanischsprachige Agenten-Aufgaben, die pro Modell dreimal ausgeführt wurden, bei dem das Abschließen von 1.000 Sets aus je drei Aufgaben schätzungsweise 1,25 US-Dollar mit Solar Mini 4 und 2,20 US-Dollar mit MiMo-V2.5 kostete. Das ist ein vom Anbieter durchgeführter Test mit vom Anbieter ausgewählten Aufgaben, bei dem die Latenz ausgeschlossen wurde, und er weist in die entgegengesetzte Richtung zum Ergebnis von Artificial Analysis. Er ist nicht falsch – unterschiedliche Aufgaben beanspruchen unterschiedliche Token-Budgets –, aber es ist eine Marketingzahl, und der veröffentlichte Einführungsrabatt des Modells ist ein separater Grund, die eigenen Zahlen erneut zu berechnen, statt die von irgendjemandem zu übernehmen.
Preise, Stand der Live-Dokumentation der Upstage-Konsole: 0,10 $ pro Million Input-Tokens, 0,01 $ pro Million gecachte Input-Tokens, 0,40 $ pro Million Output-Tokens, mit einem derzeit beworbenen Einführungsrabatt von 50 % bis zum 22. Oktober 2026 UTC, wodurch die effektiven Sätze bis dahin bei 0,05 $ für Input, 0,005 $ für gecachten Input und 0,20 $ für Output liegen.
Was das bedeutet, wenn Sie die zahlende Person sind
Das Interessante an Solar Mini 4 ist nicht, dass es ein schlechtes Modell ist. Es ist, dass es ein wirklich gutes kleines Modell ist, dessen Wirtschaftlichkeit von Verhalten dominiert wird, das eine Preisliste Ihnen nicht zeigen kann. Eine 24 im Index bei drei aktiven Parametern ist ein echtes Engineering-Ergebnis, und koreanischsprachige Workloads – die erklärte Stärke des Modells, neben Englisch und Japanisch – sind genau der Bereich, in dem dieses Ergebnis am ehesten seinen Preis wert sein dürfte.
Der unangenehme Teil ist alles, was auf den ersten Aufruf folgt. Lange Assistenten-Turns, geringe Cache-Wiederverwendung und eine Aufgabe, die sieben Minuten Decodierung pro Index-Lauf benötigt, summieren sich zu einer Zahl, die überhaupt nicht wie $0.10/$0.40 aussieht. Wenn Sie es evaluieren, ist das ehrliche Experiment ein Test der Kosten pro abgeschlossenem Auftrag mit Ihrer eigenen Arbeitslast, bei dem Prompt-Caching so aktiviert ist, wie Ihr Produktions-Stack es tatsächlich verwenden würde – und nicht ein Vergleich der Token-Preise.
Dies ist ebenfalls die Klasse von Problemen, für deren Lösung ein Router überhaupt existiert, und der Grund, warum OrcaRouter die Listenpreise der Anbieter mit 0 % Aufschlag weitergibt, sodass eine Preisänderung eines Anbieters noch am selben Tag auf Ihrer Rechnung ankommt. Wir routen keine Upstage-Modelle, daher ist weder Solar Mini 4 noch Solar Pro 4 über uns verfügbar — sie stammen aus Upstages eigener API und von Drittanbieter-Plattformen. Was wir routen, ist die andere Hälfte dieses Vergleichs: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash und mehr als 200 weitere Modelle hinter einem einzigen Schlüssel, was es praktikabel macht, ein günstiges und ein teures Modell für dieselbe Aufgabe vorzuhalten und automatisches Failover und Routing pro Anfrage entscheiden zu lassen, welches antwortet. Wenn der Unterschied zwischen zwei Modellen eine fünffache Kosten-pro-Aufgabe-Lücke ist, die keine Preisliste verrät, zählt die Fähigkeit, eine einzelne Anfrage zwischen ihnen zu verschieben, mehr als jede Benchmark-Tabelle.

Die Kurzfassung: Solar Mini 4 ist der neue Pareto-Punkt, den Artificial Analysis für Modelle unter drei Milliarden aktiven Parametern zeichnet, und es ist pro abgeschlossener Aufgabe ungefähr fünfmal teurer als ein Modell, das zum selben Input-Preis gelistet ist. Beide Aussagen sind wahr, und die zweite ist diejenige, die auf einer Rechnung auftaucht.
