
GPT-6.1 Sols erste unabhängige Bewertung ist da: 0,84 Punkte hinter Astra, bei weniger als einem Viertel der Aufgabenkosten
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 397 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2237Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens · 195 tok/s
- OrcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1141 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 106 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
Jeder Artikel über GPT-6.1 Sol, der in den Tagen nach dem DevDay-Release von OpenAI am 29. September 2026 veröffentlicht wurde – einschließlich dieses Blogs –, enthielt denselben Vorbehalt: Die Fähigkeitswerte stammten vom Anbieter, und kein Dritter habe das Modell bewertet. Dieser Vorbehalt ist jetzt überholt. Artificial Analysis hat einen Eintrag für GPT-6.1 Sol in seinem Intelligence Index, ausgeführt mit maximalem Reasoning-Aufwand, und es ist die erste Zahl im kurzen Leben dieses Modells, die nicht von OpenAI stammt. Sie liegt bei 51,8 gegenüber 52,7 für GPT-6 Astra und 47,5 für GPT-6 Sol – ein Abstand von weniger als einem Punkt zum $10/$50-Flaggschiff und ein Anstieg um 4,3 Punkte gegenüber dem Modell, das GPT-6.1 Sol ersetzt. Die Zahl, die die Zeile interessant macht, ist die daneben stehende: Das Board bepreist den Evaluierungslauf hinter jedem Punktwert, und der Index-Lauf von GPT-6.1 Sol kostete 0,72 $ pro Aufgabe, während Astra 3,26 $ kostete. Viereinhalbmal so viel Geld für 0,84 Punkte ist der ganze Vergleich in einer Zeile, und diese ist jetzt eine gemessene Zeile statt der Darstellung eines Anbieters.
Die Zeile selbst und worauf sie ausgeführt wurde

Artificial Analysis veröffentlicht seinen Intelligence Index als ein Komposit aus zehn Evaluierungen, und die am 30. September 2026 laufende Version war v4.3.2 – AA-Briefcase v1.1, GDPval-AA v2.1, AutomationBench-AA, Terminal-Bench 4.0, SciCode, Humanity's Last Exam, GDP.pdf, CritPt, AA-Omniscience und AA-LCR v1.1. Alle drei OpenAI-Modelle in diesem Beitrag laufen auf derselben Version, sodass der folgende Vergleich in einer Weise direkt vergleichbar ist, wie es die eigene Launch-Tabelle eines Anbieters nie ist. Das Board verzeichnet außerdem das Veröffentlichungsdatum, das es für das Modell führt – 2026-09-29, das DevDay-Datum – und bewertet es in der Max-Effort-Konfiguration, also der Einstellung, die die Seite in ihrer eigenen Überschrift nennt.
• Intelligenzindex — 51,8 für GPT-6.1 Sol (max), 52,7 für GPT-6 Astra (max), 47,5 für GPT-6 Sol (max).
• Kosten pro Index-Aufgabe — 0,72 $ für GPT-6.1 Sol, 3,26 $ für Astra, 1,05 $ für GPT-6 Sol. Dies ist die eigene Zahl des Boards dafür, was die Durchführung einer vollständigen Indexbewertung gekostet hat, keine Preisliste.
• Für den Lauf verbrauchte Ausgabe-Tokens — 67,2 Millionen für GPT-6.1 Sol, 60,0 Millionen für Astra, 76,8 Millionen für GPT-6 Sol. Der eigene Kommentar von AA nennt 67 Millionen „ziemlich knapp“ gegenüber einem Board-Median von 82 Millionen, was ein zweiter, leiserer Sieg über das Modell ist, das es ersetzt.
• Ausgabegeschwindigkeit — 66,8 Tokens pro Sekunde für GPT-6.1 Sol, 57,0 für Astra, 76,2 für GPT-6 Sol.
• Preise, wie sie das Board aufführt — 2,00 $ Eingabe und 10,00 $ Ausgabe pro Million Tokens für GPT-6.1 Sol, mit zwischengespeicherter Eingabe zu 0,10 $ und Cache-Schreibvorgängen zu 2,50 $. Diese vier Zahlen stimmen exakt mit der Preisseite des Anbieters überein, was das am wenigsten Dramatische und Nützlichste an der Zeile ist: eine unabhängige Liste der Tarife, die wir bereits genannt haben.
Eine einordnende Anmerkung, bevor die Zahlen als Munition verwendet werden. Der AA-Index umfasst zehn Evaluierungen, und die Evaluierungen, mit denen OpenAI seine eigene Ankündigung eröffnete – DeepSWE v1.1, OSWorld 2.0, Terminal-Bench Science 0.1 –, sind nicht darunter. AA betreibt eine eigene AutomationBench-Variante, die nicht dasselbe Harness ist wie die vom Anbieter zitierte AutomationBench-Version. Die unabhängige Bilanz bestätigt oder widerlegt also die vier zentralen Behauptungen aus dem Launch-Post nicht; sie misst eine weitgehend andere Aufgabenmenge, und es lohnt sich, sie als zweite Meinung zur Gestalt des Modells zu lesen, nicht als Urteil über diese konkreten Sätze.
Astra gewinnt nach wie vor, um weniger als einen Punkt, für viereinhalbmal so viel Geld.

Beide Modelle bieten eine Aufwandsleiter, und das Board hat inzwischen einen Score und Laufkosten für jede Sprosse beider Leitern veröffentlicht. In der Gegenüberstellung sagen die Leitern etwas, was der einzelne Schlagzeilenvergleich nicht sagen kann: Die beste Konfiguration von GPT-6.1 Sol tritt nicht gegen die beste von Astra an. Sie tritt gegen die zweitbeste von Astra an.
• GPT-6.1 Sol, max — 51,8, 0,72 $ pro Index-Aufgabe. GPT-6 Astra, max — 52,7, 3,26 $.
• GPT-6.1 Sol, xhigh — 51,0, 0,39 $. GPT-6 Astra, xhigh — 52,4, 2,31 $.
• GPT-6.1 Sol, high — 50,2, 0,32 $. GPT-6 Astra, high — 50,9, 1,73 $.
• GPT-6.1 Sol, medium — 47,8, 0,21 $. GPT-6 Astra, medium — 49,6, 1,54 $.
• GPT-6.1 Sol, low — 42,1, 0,13 $. GPT-6 Astra, low — 45,8, 0,82 $.
Astra führt auf jeder Stufe, was die ehrliche Zusammenfassung des Duells ist und zugleich der am wenigsten interessante Teil davon. Der interessante Teil ist das Tauschverhältnis. Wer die günstigste Astra-Konfiguration will, die die Bestleistung von GPT-6.1 Sol schlägt, nimmt Astra auf xhigh: 52,4 gegen 51,8, für 2,31 $ gegen 0,72 $. Das sind 0,56 Indexpunkte für 1,59 $ mehr pro Evaluierungslauf — grob 3,2-mal die Kosten für weniger als ein Prozent der Punktzahl. In die andere Richtung: Wenn man GPT-6.1 Sol auf xhigh herunterstuft, verliert man 0,8 Punkte, während die Rechnung auf 0,39 $ fällt, was 5,9-mal günstiger als Astras xhigh und ein Neuntel von Astras Lauf mit maximalem Aufwand ist.
Es gibt eine zweite Lesart derselben Leiter, die gegen den Kauf von Astra mit maximalem Aufwand argumentiert. Die vier unteren Sprossen von Astra sind alle günstiger als sein Maximum, und sein xhigh liegt 0,29 Punkte unter seinem Maximum – etwas mehr als ein halbes Prozent der Punktzahl für eine Senkung der Laufkosten um 29 %. Jedes Beschaffungsgespräch über dieses Paar, das mit „Astra auf Maximum“ beginnt und bei „Astra kostet 4,5-mal mehr“ endet, lässt die eigenen günstigeren Sprossen von Astra beim Vergleich außen vor.
Sechs Bewertungen gehen an Astra, zwei gehen an GPT-6.1 Sol, zwei enden unentschieden.
Der zusammengesetzte Wert verbirgt eine Spaltung. Bewertet man Eval für Eval bei maximalem Aufwand, ist GPT-6.1 Sol kein durchweg etwas schlechteres Astra – es ist bei zwei Dingen besser und bei sechs schlechter.
• GDPval-AA — Elo 1575,1 für GPT-6.1 Sol gegenüber 1541,9 für Astra, ein Vorsprung von 33 Punkten bei Aufgaben aus dem professionellen Arbeitsumfeld. Dies ist der größte einzelne unabhängige Sieg für das günstigere Modell.
• AA-LCR v1.1, Langkontext-Reasoning — 0,830 gegenüber 0,807. GPT-6.1 Sol führt.
• AA-Briefcase v1.1 — Elo 1564,2 gegenüber 1568,9. Astra um 4,7 vorn.
• AutomationBench-AA — 0,649 gegenüber 0,685. Astra um 3,6 Punkte vorn.
• Terminal-Bench 4.0 — 0,561 gegenüber 0,591. Astra um 3,0 Punkte vorn.
• SciCode — 0,542 gegenüber 0,565. Astra um 2,3 Punkte vorn.
• Humanity's Last Exam — 0,529 gegenüber 0,547. Astra um 1,8 Punkte vorn.
• AA-Omniscience — 41,5 gegenüber 43,4. Astra um 1,9 Punkte vorn.
• GDP.pdf und CritPt — exakte Gleichstände bei 0,310 bzw. 0,317, bei beiden Modellen.
Zwei dieser Zeilen sind mehr wert als ihre Position in der Liste. Der GDPval-AA-Vorsprung ist die einzige Stelle, an der der Vorteil des günstigeren Modells groß genug ist, um einen Wechsel des Harness zu überstehen, und er fällt genau auf die Arbeitslast, die die Positionierungsaussage des Anbieters beansprucht – professionelle, dokumentenlastige Arbeit. Und die beiden toten Unentschieden liegen bei den Bewertungen mit den engsten Abständen, was daran erinnert, dass eine zusammengesetzte Lücke von 0,84 Punkten aus Zeilen zusammengesetzt wird, die einzeln von einem 33-Punkte-Sieg bis zu einer 3,6-Punkte-Niederlage reichen.
Im Vergleich zum Modell, das es ersetzt, ist der Zuwachs real, aber nicht gleichmäßig.
Der Vergleich, der für jeden relevant ist, der GPT-6 Sol bereits in einem Produktionspfad einsetzt, ist der, den 6.1 Sol gegen seinen eigenen Vorgänger anstellt, und die unabhängige Aufzeichnung ist in dieser Hinsicht schärfer als der Beitrag des Anbieters. Acht von zehn Evaluierungen verbessern sich. Zwei verschlechtern sich.
• SciCode — GPT-6.1 Sol erreicht 0,542, während GPT-6 Sol 0,576 erzielte. Das neuere Modell ist beim wissenschaftlichen Code um 3,5 Punkte schlechter.
• AA-LCR v1.1 — 0,830 für 6.1 Sol gegenüber 0,837 für GPT-6 Sol. Um Haaresbreite, aber in die falsche Richtung, bei der Long-Context-Evaluierung.
• AA-Omniscience — 41,5 gegen 27,1. Dies ist die größte Veränderung in der Zeile: ein Sprung um 14,4 Punkte bei der Wissensbewertung, und die Genauigkeit auf diesem Set steigt von 0,545 auf 0,621.
• Halluzinationsrate auf demselben Set — 0,543 für GPT-6.1 Sol, ein Rückgang von 0,601 für GPT-6 Sol und weiterhin über den 0,513 von GPT-6 Astra. AA-Omniscience teilt seine Punktzahl in „richtig gewusst“ und „selbstsicher falsch“ auf, und genau diese Aufteilung ist es, durch die sich das 6.1-Refresh bezahlt macht: Es ist ein deutlich weniger unehrliches Modell als Sol und dennoch das unehrlichste der drei.
• Terminal-Bench 4.0 — 0,561 gegen 0,439, ein Zugewinn von 12,2 Punkten. AA-Briefcase — 1482,8 auf 1564,2 Elo. GDP.pdf — 0,248 auf 0,310.
Die Lesart ist, dass dies eher eine Auffrischung bei Wissen und Tooling war als eine Auffrischung des Reasoning. Die Evaluierungen, die sich am stärksten verändert haben, sind diejenigen, die belohnen, Dinge zu wissen und sie nicht zu erfinden; die Evaluierung, die gefallen ist, ist eine eng gefasste, technische. Wer wegen der Cache-Einsparung auf 6.1 Sol gewechselt ist, bekommt den Wissenszuwachs als Bonus und sollte nicht annehmen, dass er sich auf jede Harness erstreckt, die er ausführt.
Wo das Gremium es einordnet und was darüber steht

In der Standardreihenfolge des Intelligence Index der Bestenliste liegt GPT-6 Astra mit maximalem Aufwand auf Platz 7 und GPT-6.1 Sol mit maximalem Aufwand auf Platz 10, während GPT-6 Sol mit maximalem Aufwand Platz 20 belegt. Die neun Zeilen über GPT-6.1 Sol sind zwei Astra-Konfigurationen, drei Claude Opus 5.5-Konfigurationen, eine Claude Sonnet 5.5-Konfiguration und zwei Claude Fable 5.1-Konfigurationen — das Modell, dem GPT-6.1 Sol am nächsten ist, ist also das Flaggschiff seiner eigenen Familie, und das Modell, das es in dieser Reihenfolge tatsächlich verdrängt hat, ist sein eigener Vorgänger, dreizehn Plätze weiter unten.
Lässt man die Effort-Einstellung weg, rückt die Rangfolge so zusammen, dass es für die Kostenplanung relevant ist: GPT-6.1 Sol rangiert mit xhigh auf Platz 13, mit high auf Platz 15, mit medium auf Platz 19 und mit low auf Platz 35, während Astra mit high auf Platz 14, mit medium auf Platz 16 und mit low auf Platz 26 liegt. Mit anderen Worten: GPT-6.1 Sol mit xhigh steht im Ranking vor Astra mit high, und GPT-6.1 Sol mit medium steht vor Astra mit low. Der Effort ist hier ein größerer Hebel als die Modellwahl, zumindest bei diesen beiden.
Was man mit der Nummer machen soll, ehrlich gesagt
Die Herstellerbehauptung, die in dieser Zeile getestet wurde, war, dass GPT-6.1 Sol das Flaggschiff bei ungefähr einem Fünftel des Preises fast erreicht. Die unabhängige Version dieses Satzes lautet: Es liegt nur 0,84 Indexpunkte hinter dem Flaggschiff, und der Evaluierungsdurchlauf, der hinter seiner Punktzahl steht, kostete 22 % von dem des Flaggschiffs. Das kommt der Behauptung nahe genug, dass sich niemand dadurch in die Irre geführt fühlen sollte, und es ist in jeder Hinsicht, die für einen Käufer zählt, eine stärkere Aussage als „nicht verifiziert“.
Was die Zeile nicht tut, ist die Bepreisung deiner Workload. Ein Indexlauf ist eine bestimmte Mischung aus Aufgaben, und die Zahl, die eine echte Rechnung bestimmt, ist die Preisliste im Vergleich zu deinem eigenen Token-Profil — weshalb die Cache-Zeile weiterhin die Zeile ist, die es zu modellieren gilt: GPT-6.1 Sols 0,10 $ für gecachte Eingabe gegenüber Astras 1,00 $ ist ein Zehnfach-Unterschied, den kein Indexwert berührt. Auf unserer Seite gilt dieselbe Durchreichung: OrcaRouter bedient GPT-6 Astra, GPT-6 Sol und GPT-6 Luna zu OpenAIs eigenen Listenpreisen ohne Aufschlag, sodass an dem Tag, an dem sich ein Anbietertarif ändert, der Tarif auf unserer Seite mitgeht, statt auf einen zweiten Vertrag zu warten. GPT-6.1 Sol ist nicht auf unseren Routen — der öffentliche Katalog liefert „model not found“ für openai/gpt-6.1-sol heute, und es gibt keine ehrliche Möglichkeit, ein Modell zu beschreiben, das wir nicht bedienen können. Was ein einziger API-Schlüssel dir im Moment tatsächlich verschafft, ist das Paar, über das der Benchmark tatsächlich streitet — Astra für die härteste Arbeit, Sol für das Volumen — mit Anbieter-Listenpreisen, die unverändert durchgereicht werden, und automatischem Failover zwischen Anbietern, wenn einer von ihnen Fehler liefert.
Zwei Dinge würden das weiter schärfen. Ein zweiter unabhängiger Prüfstand für dasselbe Modell würde uns sagen, ob der GDPval-AA-Vorsprung eine Eigenschaft des Modells oder dieser Bewertung ist, und er ist der mit Abstand nützlichste fehlende Datenpunkt in der Zeile. Und eine unabhängige Messung der 272.000-Token-Long-Context-Stufe wäre wichtiger als ein weiterer zusammengesetzter Punkt, denn dort hört die Preisgestaltung dieser Familie auf, günstig zu sein.
In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
