Titelkarte mit der Aufschrift GPT-6 Astra vs Solar Pro 4, mit dem Untertitel „Zwölf Indexpunkte, ein 512K-Fenster auf der einen Seite und ein Preisverhältnis, das sich am Sonntag ändert“, über einer generierten Illustration zweier leuchtender Würfelmaschinen mit Preisschildern am Fuß
Guides & Insights

GPT-6 Astra vs. Solar Pro 4: Zwölf Indexpunkte und ein Preisverhältnis, das sich am Sonntag ändert

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Bei den beiden unabhängig durchgeführten Evaluierungen, die dieses Paar gemeinsam hat, GPT-6 Astra führt Solar Pro 4 bei allgemeinem Wissen mit großem Abstand und bei den Bereichen, in denen die Modelle tatsächlich eingesetzt werden, mit einem kleineren Vorsprung. Artificial Analysis setzt GPT-6 Astra auf 54,7 im Intelligence Index und auf 96,1 bei GPQA Diamond; derselbe Evaluator setzt Solar Pro 4 auf 42 und 86,8. Bei agentischen Aufgaben schrumpft der Abstand auf elf bzw. sechs Punkte bei Terminal-Bench 2.1 und τ²-Banking. Der Preisgeschichte haftet inzwischen eine Frist an, die kaum jemand damit verbunden hat: Die aktuelle Aktion von Solar Pro 4 endet um 00:00 UTC am Sonntag, 11. Oktober 2026, wenn das Modell von 0,09 $ auf 0,15 $ pro Million Eingabe-Tokens und von 0,36 $ auf 0,60 $ pro Million Ausgabe-Tokens wechselt. Die Frage, die dieser Vergleich beantworten muss, ist also nicht, welches Modell besser ist. Sie lautet, ob eine Leistungslücke von etwa zwölfeinhalb Punkten das 42- bis 139-Fache des Ausgabetarifs rechtfertigt, und diese Antwort ist eine Eigenschaft Ihrer Arbeitslast und nicht eines der beiden Modelle.

Die Tarifkarten, einschließlich derjenigen, die an diesem Wochenende angepasst wird.

Der Listenpreis für Solar Pro 4 beträgt 0,30 $ für Input, 0,06 $ für gecachten Input und 1,20 $ für Output pro Million Token, und Upstage hat es seit der Markteinführung durchgängig unter Listenpreis berechnet. Der Tarifplan auf der eigenen Preisseite von Upstage ist explizit, man muss also nicht raten, welche Zahl man für die Budgetierung zugrunde legen soll:

• Upstage-Aktion bis zum 11. Oktober 2026, 00:00 UTC — 0,09 $ Eingabe, 0,018 $ Cache, 0,36 $ Ausgabe pro 1 Mio. Tokenbr /> • Upstage-Aktion ab dem 11. Oktober 2026 — 0,15 $ Eingabe, 0,03 $ Cache, 0,60 $ Ausgabe pro 1 Mio. Token, ohne Enddatum aufgeführt, was bedeutet, dass dafür ein Budget eingeplant werden mussbr /> • Upstage-Listenpreis — 0,30 $ Eingabe, 0,06 $ Cache, 1,20 $ Ausgabe pro 1 Mio. Tokenbr /> • GPT-6 Astra bis zu 272.000 Eingabe-Token — 10,00 $ Eingabe, 1,00 $ Cache, 12,50 $ Cache-Schreibvorgang, 50,00 $ Ausgabe pro 1 Mio. Tokenbr /> • GPT-6 Astra über 272.000 Eingabe-Token — 20,00 $ Eingabe, 2,00 $ Cache, 25,00 $ Cache-Schreibvorgang, 75,00 $ Ausgabe pro 1 Mio. Token, angewendet auf die gesamte Anfrage, sobald der Schwellenwert überschritten wird

Als Verhältniswerte gelesen sind das 11× beim Input und 5,6× beim Output zu den Preisen von Solar Pro 4 nach der Aktion, 33× und 42× gegenüber seinem Listenpreis sowie 111× und 139×, wenn man die beiden Modelle an den heutigen Aktionszahlen misst. Die Spanne ist so groß, weil sich beide Seiten des Bruchs bewegen: Astras Karte ist die Spitze des Marktes, und Solar Pro 4 liegt derzeit nahe an dessen unterem Ende.

Die Langkontext-Regeln sind die andere Zeile, die man zweimal lesen sollte, denn sie sind nicht symmetrisch. Astras Schwelle liegt bei 272.000 Tokens, und seine Regel ist eine Neuberechnung der gesamten Anfrage – jeder Token in einer langen Anfrage wird mit doppeltem Input und 1,5× Output berechnet, nicht nur die Tokens jenseits der Grenze. Upstages Karte enthält keinen entsprechenden Schritt, daher wird eine Solar-Pro-4-Anfrage mit 400.000 Tokens genau zum gleichen Preis pro Token abgerechnet wie eine mit 4.000 Tokens. Wenn Ihre Prompts regelmäßig über eine Viertelmillion Tokens hinausgehen, liegt Astras effektiver Input-Preis bei 20,00 $ statt bei 10,00 $, und die Lücke, die Sie zahlen, wird genau bei der Arbeitslast größer, bei der ein Modell mit 512K-Kontext konkurriert.

Woher der Zwölf-Punkte-Abstand kommt

Beide Modelle haben Zahlen von Drittanbietern, was diesen Vergleich einfacher macht als die meisten in dieser Klasse. Das Muster ist bei beiden konsistent: Die Zugewinne von Solar Pro 4 gegenüber seinem eigenen Vorgänger konzentrierten sich auf agentische Aufgaben, und genau dort ist es Astra am nächsten.

• Intelligence Index — GPT-6 Astra 54,7, Solar Pro 4 42br /> • GPQA Diamond, Naturwissenschaften auf Graduierten-Niveau — Astra 96,1, Solar Pro 4 86,8br /> • Terminal-Bench 2.1, Steuerung eines echten Terminals — Astra 88,4, Solar Pro 4 75,1br /> • τ²-Banking, Tool-Nutzung gegen Richtlinien — Astra 41,4, Solar Pro 4 35,0br /> • Langkontext-Erinnerung, AA-LCR — Astra 80,7, Solar Pro 4 71br /> • Kosten für die Ausführung der durchschnittlichen Evaluierungsaufgabe — Astra 0,0516 $, Solar Pro 4 zwischen 0,0039 $ und 0,0155 $br /> • Tatsächliche Laufzeit pro Evaluierungsaufgabe — Astra etwa 8,6 Minuten, bei einem Modell, das etwa 70 Token pro Sekunde zurückgibt

Die Zeile mit den Aufgabenkosten ist diejenige, die das Argument neu einordnet. Eine einzelne schwierige Evaluierungsaufgabe auf Solar Pro 4 kostet zwischen vier und dreizehn Cent, je nachdem, welche Stufe der Promotion gilt, gegenüber fünf Cent auf Astra zu Standardtarifen. „Zweiundvierzigmal der Ausgabepreis“ und „dreizehnmal die Kosten pro Aufgabe“ sind beides zutreffende Aussagen über dasselbe Modellpaar, und die zweite ist die Zahl, die auf einer Rechnung erscheint. Der Unterschied ist, dass Astra nach den Messungen von Artificial Analysis mit weniger Tokens zu seiner Antwort gelangt als der Vorgänger von Solar Pro 4 – 43.000 Ausgabe-Tokens pro Aufgabe – und es ist nach wie vor das teurere Modell, um eine Aufgabe abzuschließen, nur bei Weitem nicht 42-mal teurer.

Zwei Vorbehalte zur Spalte Solar Pro 4. Es ist pro Aufgabe langsamer als Astra, gemessen an der Wall-Clock-Zeit, obwohl es weniger Tokens verbraucht, und seine veröffentlichten agentischen Scores bringen eine Besonderheit mit sich, die man kennen sollte: In der Evaluation seines Vorgängers verbesserte es seinen Ehrlichkeitswert größtenteils dadurch, dass es die Antwort verweigerte, und unternahm bei 41 % der Fragen einen Antwortversuch, verglichen mit 92 % bei Pro 3. Für einen Agenten, der handeln muss, ist eine Verweigerung oft besser als eine selbstsichere falsche Antwort – aber sie verändert die Art und Weise, wie man jeden Vergleich von Erfolgsquoten liest.

Comparison card with two columns. GPT-6 Astra: Intelligence Index 54.7, $10.00/$50.00 per 1M, long-context tier $20.00/$75.00 above 272K in, cached input $1.00, 1,050,000 context and 128,000 max output, Terminal-Bench 2.1 88.4. Solar Pro 4: Intelligence Index 42, promotion $0.09/$0.36 to 11 October 2026, then $0.15/$0.60, list $0.30/$1.20, 512,000 context and 128,000 max output, Terminal-Bench 2.1 75.1

Der Vergleich, den Ihnen die Karte keines der beiden Anbieter liefert

Die Benchmark-Zeilen oben sind übereinstimmend: Beide Seiten haben dieselbe Evaluierung durchgeführt. Interessant sind die Zeilen, die fehlen, denn die beiden Anbieter sind sich uneinig darüber, was veröffentlicht werden soll.

• Reasoning-Aufwand — Astra bietet fünf benannte Stufen (low, medium, high, xhigh, max); Solar Pro 4 dokumentiert einen reasoning_effort-Parameter mit mindestens einer medium-Einstellung, und das Material von Upstage zur Stufenleiter ist dünnbr /> • Architektur — Astras Parameteranzahl wird nicht offengelegt; die Parameteranzahl von Solar Pro 4 wird ebenfalls nicht offengelegt, sodass keine Seite die Offenlegung zur Serving-Ökonomie bietet, die ihre günstigeren Geschwister bietenbr /> • Langkontext-Verhalten unter Last — Astra veröffentlicht eine Kostenschwelle und einen dokumentierten Recall-Wert; Upstage veröffentlicht das Fenster und keine eigene Recall-Evaluierungbr /> • Eingabeoberfläche — Astra nimmt Text, Bild und Datei entgegen; Solar Pro 4 ist ein Textmodellbr /> • Modalitäts-Obergrenze — 128.000 maximale Ausgabe-Tokens auf beiden Seiten, was ein ungewöhnlicher Punkt ist, an dem ein günstiges Modell Parität erreicht, und die mit Abstand nützlichste Angabe auf dem Datenblatt von Solar Pro 4 für Langtextgenerierung ist

Die Reasoning-Effort-Zeile ist wichtiger, als es den Anschein hat. Ein Modell, bei dem man das Denkbudget herunterdrehen kann, ist ein Modell, dessen effektiver Preis pro einfacher Anfrage weit unter seinem Listenpreis liegt, weil man für weniger Reasoning-Tokens bei Arbeit bezahlt, die keine braucht. Beide Anbieter stellen den Parameter bereit; keiner veröffentlicht, was die Stufen in Tokens kosten, was bedeutet, dass die einzige Möglichkeit, den tatsächlichen Faktor zwischen diesen beiden Modellen herauszufinden, darin besteht, ihn am eigenen Traffic zu messen.

Text card headed 'Cost per token is not cost per finished task' with rows: average evaluation task $0.0516 on GPT-6 Astra and $0.0039-$0.0155 on Solar Pro 4; input $0.09 vs $10.00 per 1M; output $0.36 vs $50.00 per 1M; roughly 8.6 minutes wall clock per task on GPT-6 Astra

Die Gewinnschwelle, einfach ausgedrückt

Ignoriere Indexpunkte für einen Moment und halte die Arbeitslast konstant. Wenn deine Anwendung Extraktion, Klassifizierung, Zusammenfassung oder strukturierte Ausgabe über Dokumente mit bis zu einer halben Million Tokens ist, erledigt Solar Pro 4 die Aufgabe zu einer Rate, an die Astra nicht herankommt, und braucht die Reasoning-Leiter überhaupt nicht – kein plausibler Qualitätsunterschied bei einer JSON-Extraktionsaufgabe ist 42× bei der Ausgabe wert. Wenn deine Anwendung ein Long-Horizon-Agent ist, der plant, Tools aufruft, sich von einem fehlgeschlagenen Schritt erholt und abschließen muss, sind die Elf-Punkte-Lücke bei Terminal-Bench und die Sechs-Punkte-Lücke bei τ²-Banking die Zahlen, die vorhersagen, ob er fertig wird, und ein fehlgeschlagener Agentenlauf kostet den vollen Preis des Laufs plus den Wiederholungsversuch.

Der wirklich schwierige Fall ist die Mitte: kurze, schwere Single-Shot-Reasoning-Aufgaben, bei denen Astras GPQA-Vorteil groß ist und seine Kosten pro Aufgabe weiterhin nur ein paar Cent betragen. Dort ist der entscheidende Faktor nicht die Preisliste, sondern die Token-Anzahl – und die einzige Messung, die darauf eine Antwort gibt, besteht darin, die eigenen Prompts durch beide Modelle laufen zu lassen und die Nutzung abzulesen. Das ist auch der Fall, in dem eine Preissenkung am stärksten durchschlägt, weil das günstigere Modell dasjenige ist, das gegen das teure getestet wird, und eine Veränderung von 67 % beim Tarif des günstigeren Modells die Rechnung des Tests zwischen Montag und heute verändert.

Text card headed 'Which tier gets your traffic' with rows mapping extraction and summarisation to Solar Pro 4, single-shot hard reasoning to GPT-6 Astra decided on tokens per answer, long-horizon agent runs to GPT-6 Astra on Terminal-Bench 2.1 88.4 vs 75.1, and prompts beyond 272K tokens to either with Astra repricing the whole request to $20.00/$75.00

Warum dies eine Routing-Entscheidung und keine Bestellung ist

GPT-6 Astra ist im OrcaRouter-Katalog als openai/gpt-6-astra zu OpenAIs eigenen Listenpreisen enthalten, durchgereicht mit 0 % Aufschlag, und genau das ist der Grund, warum ein Vergleich wie dieser in einer Regel statt in einem Vertrag mündet. Die Solar-Familie von Upstage ist ein anderer Fall, und die ehrliche Antwort ist die, die wir immer verwenden: OrcaRouter leitet kein Upstage-Modell weiter, daher ist Solar Pro 4 hier nicht verfügbar — es stammt aus Upstages eigener API und von mehreren Drittanbieter-Plattformen, und die oben genannte Preisübersicht ist ihre und nicht unsere.

Wozu ein Router in dieser Paarung eigentlich dient, ist die Aufteilung in Stufen. Das günstige Modell und das teure Modell befinden sich hinter einem einzigen OpenAI-kompatiblen Endpunkt, eine Routing-Regel schickt den Extraktionsverkehr an die Stufe, die dafür geeignet ist, und ein automatisches Failover stuft einen Aufruf auf das stärkere Modell hoch, wenn beim günstigeren ein Fehler auftritt oder es eine Ausgabe zurückgibt, die Ihr Parser verwirft. Der letztgenannte Mechanismus ist die praktische Antwort auf das Fehlleitungsrisiko, das dieser Vergleich erzeugt: Der teure Fehlerfall ist nicht, das falsche Modell zu wählen, sondern das falsche Modell zu wählen und zweimal dafür zu bezahlen.

Was vor Sonntag zu tun ist

Wenn Solar Pro 4 ein Kandidat für Ihren Stack ist, ist dies die günstigste Woche, die Sie bekommen werden, um es zu testen. Der Aktionspreis gilt bis zum 11. Oktober um 00:00 UTC; der Preis nach der Aktion von 0,15 $ und 0,60 $ liegt bereits ein Drittel unter dem Listenpreis, und die vom Modell selbst veröffentlichten Belege – die Terminal-Bench- und τ²-Banking-Zahlen – beschreiben Arbeit, die Sie an einem Nachmittag an Ihrem eigenen Aufgabensatz reproduzieren können. Führen Sie beide Modelle mit denselben Prompts aus, halten Sie die Reasoning-Einstellungen konstant und erfassen Sie Tokens pro abgeschlossener Aufgabe statt Tokens pro Aufruf. Die Zahl, die dabei herauskommt, ist das einzige Vielfache, das zählt, und es wird nicht 42× sein. Dann entscheiden Sie – im Wissen, dass, wenn die günstigere Seite gewinnt, der Preis, zu dem Sie es getestet haben, am Sonntag ausläuft, und dass, wenn die teurere Seite gewinnt, die zwölfeinhalb Indexpunkte die sind, für die Sie bezahlen.

GPT-6 Astra ist im OrcaRouter-Katalog als openai/gpt-6-astra zu OpenAI-eigenen Listenpreisen, mit 0 % Aufschlag durchgereicht.