
Solar Mini 4: Das 3B-Active-Agentenmodell von Upstage und das stille Modell, mit dem es ausgeliefert wurde
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
Upstage hat am 22. September 2026 zwei Dinge veröffentlicht, und das zweite ist der Grund, warum es sich lohnt, über das erste hinaus weiterzulesen. Solar Mini 4 ist das Modell: ein Mixture-of-Experts-Checkpoint mit 35 Milliarden Parametern, von denen pro Token 3 Milliarden Parameter aktiv sind, ein Kontextfenster von 512.000 Tokens, bis zu 128.000 Tokens Ausgabe und ein Listenpreis von 0,10 US-Dollar pro Million Eingabe-Tokens und 0,40 US-Dollar pro Million Ausgabe-Tokens. Es ging in der Upstage Console, im Playground und als On-Premises-Bereitstellung live – ohne Vorschaukennzeichnung und ohne Warteliste. Das ist der Launch, und er ist vernünftig. Das andere, was Upstage am selben Tag ausgeliefert hat, war Solar Jev, ein Entscheidungs-Endpunkt, der auf Solar Mini 4 aufsetzt und überhaupt keinen Fließtext erzeugt – er gibt in einem einzigen Vorwärtsdurchlauf eine Auswahl, einen Score oder eine Ja/Nein-Antwort mit zugehöriger Wahrscheinlichkeit zurück, und Upstage stellt seine Ausgabe-Tokens mit null in Rechnung. Eine dieser beiden Ankündigungen ist eine Modellveröffentlichung. Die andere ist eine kleine Wette darauf, dass eine nützliche Klasse von Agentenarbeit nicht möchte, dass ein Sprachmodell redet.
Was tatsächlich am 22. September landete
Der Changelog-Eintrag für Solar Mini 4 ist kurz und ohne Wenn und Aber. Neues Modell, jetzt verfügbar. Upstages eigene Darstellung ist Kosteneffizienz für agentische Arbeit „wo Antwortgeschwindigkeit und Kosten zählen“ — der Satz, den ein Labor schreibt, wenn es möchte, dass man es mit etwas vergleicht, das dreimal so teuer ist, statt mit der Frontier.

Das Datenblatt, laut der Modellverlaufsseite von Upstage:
• Parameter — 35B insgesamt, 3B aktiv pro Token. Ein sparse Mixture-of-Experts, sodass man für das Speichern von 35B zahlt und mit 3B rechnet. Upstage schlüsselt nicht auf, wie viele Experten es gibt oder wie sie geroutet werden.
• Kontext — 512.000 Token, mit maximal 128.000 Ausgabe-Token. Beide Werte sind identisch mit denen des Flaggschiffs, was die interessanteste Zeile auf dem Datenblatt ist.
• Trainings-Cut-off — Februar 2026. Zum Zeitpunkt der Veröffentlichung sieben Monate veraltet, was für ein Modell dieser Größe normal ist und was man wissen sollte, bevor man es zu etwas Aktuellem befragt.
• Sprachen — Englisch, Koreanisch und Japanisch. Upstage beschreibt es als „fließendes Koreanisch mit starken Englisch- und Japanisch-Fähigkeiten“, was die richtige Reihenfolge für ein koreanisches Labor und wahrscheinlich die richtige Reihenfolge für das Modell ist.
• Fähigkeiten — Chat, Reasoning, strukturierte Ausgaben und Tool-Calling. Reasoning ist eine Änderung gegenüber der vorherigen Generation: Die älteren solar-mini-Modelle ignorieren einen reasoning_effort-Parameter vollständig, Solar Mini 4 hingegen nicht.
• Modell-IDs — solar-mini4 ist der Alias, und er löst derzeit auf den datierten Snapshot solar-mini4-260922 auf. Ein solar-mini4-preview-Identifier kursiert außerdem im Agent-Tooling von Drittanbietern, was man wissen sollte, wenn man Routing-Konfiguration gegen einen Preview-String schreibt, der möglicherweise nicht bestehen bleibt.
• Verfügbarkeit — Upstage Console, Playground und On-Premises. Keine offenen Gewichte. Upstage hat bereits zuvor offene Gewichte veröffentlicht (Solar Open 2 wurde als Hugging-Face-Release veröffentlicht, und die API-Bereitstellung endete am 12. August 2026), aber nichts an Solar Mini 4 deutet darauf hin, dass dies hier der Plan ist.
Solar Jev ist der Teil, über den niemand schreiben wird.
Solar Jev befindet sich in der Beta-Phase für einen neuen Endpunkt POST /v1/systemone. Sie senden einen Teil des Zustands – ein Dokument, eine Logzeile, ein Support-Ticket – plus eine Liste typisierter Fragen und erhalten eine Auswahl aus einer von Ihnen bereitgestellten Menge, eine Punktzahl nach einem Bewertungsraster oder eine Ja/Nein-Antwort zurück, wobei jede eine kalibrierte Wahrscheinlichkeit trägt, die direkt aus dem Modell stammt und nicht als Text ausgeschrieben wird.
Die Konsequenz für das Design ist, dass es keine Prosa gibt. Keine Erklärung, keine Gedankenkette, kein Vorwort. Upstage sagt, jede Entscheidung sei ein einzelner Forward-Pass und Ausgabe-Tokens seien kostenlos. Mit einem Kontextfenster von 512K kann der gesamte Zustand – ein ganzer Vertrag, ein ganzes Transkript – die Eingabe sein.
Das ist ein enger zugeschnittenes Produkt, als es zunächst scheint, und genau diese Enge ist der Punkt. Ein Modell, das nichts schreibt, kann nichts Falsches schreiben. Wenn Ihre Pipeline derzeit ein Chat-Modell auffordert, ein JSON-Urteil zurückzugeben, und es dann parst, und Sie überhaupt Zeit damit verbracht haben, sich dagegen abzusichern, dass das Modell dieses JSON in einen freundlichen Satz verpackt, dann ist Solar Jev genau auf Sie ausgerichtet. Der Kompromiss ist, dass Sie eine Wahrscheinlichkeit und keine Begründungsspur erhalten, sodass Sie, wenn es falsch liegt, nichts zum Lesen haben.
Es lohnt sich, präzise zu sein, was Solar Jev nicht ist: Es ist kein kleineres Solar Mini 4 und kein Fine-Tune, den man herunterladen kann. Es ist ein bereitgestellter Endpunkt auf Basis von Solar Mini 4, verfügbar in der Upstage Console, als Beta. Beta ist das entscheidende Wort.
Was es kostet – und wie lange der Rabatt noch gilt
Der Listenpreis beträgt 0,10 $ pro Million Input-Tokens, 0,01 $ pro Million gecachte Input-Tokens und 0,40 $ pro Million Output-Tokens. Alle Angaben verstehen sich zzgl. 10 % MwSt.
Diese Listenpreise sind nicht das, was Sie heute bezahlen werden. Upstage gewährt einen Einführungsrabatt von 50 %, den die eigene Preisseite auf den 22. Oktober 2026 (UTC) datiert – die zugrunde liegenden strukturierten Daten auf dieser Seite geben den Zeitraum als 22. September 05:00 UTC bis 23. Oktober 00:00 UTC an, was dasselbe ist, nur auf zwei Arten gesagt. Während dieses Zeitraums gelten die Tarife: 0,05 $ Eingabe, 0,005 $ zwischengespeichert, 0,20 $ Ausgabe.

Daraus folgen zwei Dinge. Erstens: Wenn Sie dies gegen irgendetwas anderes kalkulieren, kalkulieren Sie es mit beiden Zahlen, denn ein Rabatt von 50 %, der in einem Monat ausläuft, ist kein Preis, sondern eine Werbeaktion. Zweitens, zur Einordnung, wo der Listenpreis liegt: Die vorherige Generation von Solar Mini wird mit 0,15 $ pro Million Token für Eingabe und Ausgabe gelistet, mit einem 32.768-Token-Kontext und überhaupt keinem Reasoning-Modus. Solar Mini 4 ist bei der Eingabe günstiger, bei der Ausgabe teurer und bietet Ihnen ein sechzehnmal so großes Kontextfenster sowie einen Reasoning-Modus. Das ist kein Refresh. Das ist ein anderes Produkt, das denselben Namen trägt.
Was noch niemand gemessen hat
Solar Mini 4 ist einen Tag alt und hat keine unabhängige Bewertung. Kein Artificial Analysis Intelligence Index, keine Platzierung in der Agent Arena, kein Agentic-Benchmark von Drittanbietern. Upstage hat auch keine Benchmark-Tabelle dafür veröffentlicht – der Changelog-Eintrag enthält Spezifikationen und keine Ergebnisse. Wer Ihnen eine Zahl für dieses Modell nennt, zitiert etwas anderes.
Es gibt genau einen drittanbieterartigen Datenpunkt im Umlauf, und dieser muss sorgfältig eingeordnet werden, denn er ist keines der beiden Dinge, nach denen er aussieht. Ein Community-Repository, hunkim/solar-mini4-jev, verpackt Solar Mini 4 hinter einer kompatiblen Form für die TypeSafe Jev Decision API und veröffentlicht einen eigenen test400-Lauf, bewertet von einem anderen Modell nach einer angegebenen Rubrik. In diesem Lauf erzielte Solar Mini 4 bei reasoning_effort=none eine Feldgenauigkeit von 98,4 % gegenüber 94,2 % des Wrappers selbst, wobei 7 von 447 bewerteten Feldern fehlten gegenüber 26; es lag sowohl bei Koreanisch (98,8 %) als auch bei Englisch (98,4 %) vorn; und es benötigte durchschnittlich 1,21 Sekunden pro Aufruf gegenüber 0,38 Sekunden des Wrappers.
Lies das für das, was es ist. Es ist kein Anbieter-Benchmark – Upstage hat ihn nicht veröffentlicht. Es ist keine unabhängige Evaluation – keine neutrale Instanz hat sie durchgeführt, der Prüfrahmen stammt vom Wettbewerber selbst, und der Bewerter ist ein Modell. Es ist der selbst berichtete Vergleich eines einzelnen Entwicklers, der eine gehostete API gegen seinen eigenen Wrapper stellt, und die ehrliche Zusammenfassung lautet: Es ist das einzige verfügbare Signal, und es sollte eine Produktionsentscheidung nicht für sich allein beeinflussen. Es legt allerdings zwei Dinge nahe, die man selbst testen sollte: dass das Modell schnell genug für interaktive Nutzung ist, und dass sein Koreanisch mindestens so stark ist wie sein Englisch.
Wie man es ausprobiert, ohne eine Pipeline darauf zu verwetten
Das Unangenehme an einem einen Tag alten Modell ohne unabhängige Bewertungen ist, dass die einzige Möglichkeit herauszufinden, ob es passt, darin besteht, echten Datenverkehr durch es zu leiten, und die einzige Möglichkeit, das sicher zu tun, darin besteht, einen Ort zu haben, an den dieser Datenverkehr ausweichen kann, wenn es nicht passt.
Failover ist hier die ehrliche Antwort, und genau dafür ist eine Routing-Schicht da. Du setzt Solar Mini 4 hinter einen Endpoint, behältst das Modell, das du bereits betreibst, als Fallback und lässt den Router den Traffic verschieben, wenn das neue Modell Fehler wirft, ein Timeout hat oder anfängt, strukturierte Ausgaben zurückzugeben, die dein Parser ablehnt. So ist die erste Woche mit einem neuen Modell ein Experiment mit einer Absicherung darunter statt eines Launches, den du verteidigen musst.
Eine Korrektur, die man ruhig deutlich aussprechen sollte, weil sonst leicht etwas anderes suggeriert wird: OrcaRouter leitet heute kein Upstage-Modell weiter. Solar Mini 4, Solar Pro 4 und Solar Jev sind über Upstages eigene API und mehrere Drittanbieter-Plattformen verfügbar, und wenn Sie speziell Solar Mini 4 möchten, bekommen Sie es dort. Was wir anbieten, ist ein API-Schlüssel für die rund 190 Modelle, die wir tatsächlich weiterleiten, was nützlich ist, wenn das Experiment, das Sie eigentlich durchführen möchten, lautet: „Schlägt ein kompaktes Agentenmodell das, was ich habe?“ und nicht: „Schlägt dieses spezifische koreanische Modell das, was ich habe?“ Das sind unterschiedliche Fragen, und nur eine davon hat eine falsche Antwort.

Die offene Frage
Upstage hat jetzt ein kompaktes Modell und ein Flaggschiff auf demselben 512K/128K-Datenblatt herausgebracht – drei Wochen Abstand bei den Preisstufen – und hat einen Entscheidungs-Endpunkt beim kleinen statt beim großen Modell platziert. Diese Reihenfolge ist bewusst: Solar Jev wird auf Solar Mini 4 bereitgestellt, weil eine Entscheidung, die keine Prosa erzeugt, nicht das Reasoning eines Flaggschiffs braucht, und weil man das günstige Modell will, wenn man eine Million davon erzeugt.
Was noch nicht klar ist, ist, ob 3B aktive Parameter genug Reasoning für agentische Arbeit sind, die mehr als Extraktion umfasst. Das Marketing von Upstage sagt agentisch. Die Benchmarks von Upstage sagen nichts. Bis eine unabhängige Stelle es testet – und angesichts des Veröffentlichungsdatums ist das bestenfalls Wochen entfernt –, ist die richtige Vorgehensweise, es an Ihrer eigenen Aufgabe zu testen, zum Aktionspreis, mit konfiguriertem Fallback, und jede Aussage über seine agentische Qualität, einschließlich der des Anbieters, als Hypothese zu behandeln.
