Ein generiertes zweispaltiges Vergleichs-Scoreboard mit dem Titel „GPT-6.1 Sol vs. Kimi K3 – das Scoreboard“. Linke Spalte „GPT-6.1 Sol“: Zeilen mit „Intelligenzindex: 51.8“, „Kosten pro Index-Aufgabe: $0.72“, „Ausgabe-Token beim Index-Lauf: 67M“, „AA-LCR-Langkontext: 0.83“, „Kontextfenster: 1,050,000“, „Gewichte: geschlossen“. Rechte Spalte „Kimi K3“: Zeilen mit „Intelligenzindex: 43.6“, „Kosten pro Index-Aufgabe: $2.00“, „Ausgabe-Token beim Index-Lauf: 160M“, „AA-LCR-Langkontext: 0.89“, „Kontextfenster: 1,048,576“, „Gewichte: offen auf Hugging Face“. Eine Fußzeile lautet: „Unabhängige Zahlen gemäß Artificial Analysis v4.3.2 bei maximalem Aufwand.“
Guides & Insights

GPT-6.1 Sol vs Kimi K3: Den Download gibt es, und er ist immer noch nicht die günstige Option

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Kimi K3 ist das Gegenbeispiel, das diese Art von Argumentation gewöhnlich entscheidet. Moonsh​ot AI lieferte das Modell mit 2,8 Billionen Parametern im Juli 2026 aus und veröffentlichte die Gewichte — moonshotai/Kimi-K3 ist auf Hugging Face, ohne Zugangsbeschränkung, mit mehr als einer Million Downloads und einer letzten Überarbeitung im September. Es gibt hier also kein Sternchen im Sinne von „im Prinzip offen, zur Sicherheitshärtung zurückgehalten", keine zwei Wochen Verzögerung, die man aussitzen müsste. GPT-6.1 Sol, das Open​AI am 29. September 2026 veröffentlichte, ist geschlossen und nur per API zugänglich, und das wird immer so bleiben. Und auf dem unabhängigen Board erzielt das herunterladbare Modell 43,6 gegenüber 51,8 des geschlossenen Modells, kostet dabei aber 2,00 $ pro abgeschlossener Index-Aufgabe gegenüber 0,72 $. Offene Gewichte gelten als der günstige Ausweg; in dieser Gegenüberstellung sind sie die teure Seite des Geschäfts, und der Grund dafür ist nicht die Lizenz.

Was jedes Modell ist

Kimi K3 ist ein Sparse-Mixture-of-Experts-Modell mit 2,8 Billionen Gesamtparametern und rund 104 Milliarden – etwa 3,7 % – pro Token aktiv. Es verfügt über ein Kontextfenster von 1.048.576 Token, nimmt Text und Bilder als Eingabe entgegen und gibt Text zurück. Der veröffentlichte Checkpoint ist ein FP8-Artefakt und ein wirklich großer Download; ein Produktionseinsatz auf eigener Hardware ist eher eine Cluster-Entscheidung als eine Workstation-Entscheidung. Die architektonische Behauptung von Moonsh​oot ist ein hybrides Linear-Attention-Schema, das laut eigenen Angaben bei der Dekodierung langer Kontexte deutlich schneller ist, plus die Residual- und Routing-Arbeit, die ein 2,8-Billionen-Parameter-Modell überhaupt erst betreibbar machte.

GPT-6.1 Sol ist Open​AIs Mid-Tier-Refresh — unterhalb von GPT-6 Astra, oberhalb von GPT-6 Luna — mit einem Fenster von 1.050.000 Token, einer Ausgabegrenze von 128.000 Token, Text-, Bild- und Dateieingabe sowie einem Wissensstichtag vom 30. April 2026. Reasoning läuft von low bis max, wobei medium der Standard ist; die none Stufe, die das vorherige GPT-6 Sol akzeptierte, wird rundheraus abgelehnt, und Open​AIs eigener Migrationshinweis verweist Entwickler auf low stattdessen. Der Preis beträgt 2,00 $ und 10,00 $ pro Million Token, wobei gecachte Eingabe 0,10 $ kostet.

Eine Zeile pro Dimension, beide Seiten jeweils aktiviert:

• Eingabe — GPT-6.1 Sol 2,00 $ pro 1 Mio. vs. Kimi K3 3,00 $ pro 1 Mio.
• Ausgabe — GPT-6.1 Sol 10,00 $ pro 1 Mio. vs. Kimi K3 15,00 $ pro 1 Mio.
• Zwischengespeicherte Eingabe — GPT-6.1 Sol 0,10 $ pro 1 Mio. vs. Kimi K3 0,30 $ pro 1 Mio.
• Kontextfenster — 1.050.000 Tokens vs. 1.048.576 Tokens; ein Unterschied von 0,1 %, unerheblich
• Maximale Ausgabe — 128.000 Tokens bei beiden
• Gesamt- und aktive Parameter — nicht offengelegt vs. 2.800 Milliarden gesamt, 104 Milliarden aktiv pro Token
• Modalität — Text, Bild und Datei als Eingabe, Text als Ausgabe vs. Text und Bild als Eingabe, Text als Ausgabe
• Gewichte — geschlossen, nur API vs. offen, ohne Zugangsbeschränkung, über 1 Mio. Downloads
• Langkontextklausel — berechnet die gesamte Anfrage oberhalb von 272.000 Eingabe-Tokens mit 2× für Eingabe und Cache sowie 1,5× für Ausgabe neu vs. keine entsprechende Klausel auf der veröffentlichten Karte
• Intelligenzindex, unabhängig, maximaler Aufwand — 51,8 vs. 43,6
• Kosten pro Index-Aufgabe, unabhängig — 0,72 $ vs. 2,00 $
• Ausgabe-Tokens beim Index-Lauf — 67 Millionen vs. 160 Millionen, gegenüber einem Board-Median von 140 Millionen für seine Vergleichsklasse

Die eine Evaluation, die K3 gewinnt, und warum sie wichtig ist

Vor der Arithmetik die Ausnahme, denn sie ist real. Bei Bewertung für Bewertung mit maximalem Aufwand auf Artificial Analysis v4.3.2 führt GPT-6.1 Sol in sieben von zehn und liegt nie gleichauf, doch das Modell, das die Long-Context-Reasoning-Bewertung gewinnt, ist K3:

• AA-LCR v1.1 — Kimi K3 0,887 vs. GPT-6.1 Sol 0,830. Ein Sechs-Punkte-Vorsprung bei der Bewertung, die speziell für das Reasoning über lange Eingaben entwickelt wurde.
• SciCode — Kimi K3 0,595 vs. GPT-6.1 Sol 0,542. K3 führt auch beim wissenschaftlichen Programmieren.
• Terminal-Bench 4.0 — Kimi K3 0,126 vs. GPT-6.1 Sol 0,561. Ein 43-Punkte-Abstand in die andere Richtung und mit Abstand der größte Unterschied im Paarvergleich.
• Humanity's Last Exam — Kimi K3 0,469 vs. GPT-6.1 Sol 0,529.
• AA-Omniscience — Kimi K3 19,7 vs. GPT-6.1 Sol 41,5; hinsichtlich der faktischen Zuverlässigkeit gehören die beiden nicht derselben Modellklasse an.
• GDPval-AA v2.1 — Kimi K3 Elo 1536,5 vs. GPT-6.1 Sol Elo 1575,1.
• MMMU-Pro — Kimi K3 0,805 vs. GPT-6.1 Sol 0,860.
• AutomationBench-AA, GDP.pdf, CritPt — K3 0,583, 0,22 und 0,234; Sol 0,649, 0,310 und 0,317.

Das AA-LCR-Ergebnis ist das, was man ernst nehmen sollte, denn es ist die einzige Zahl, die der Kosten-pro-Aufgabe-Erzählung widerspricht, und es deutet auf eine Workload hin, bei der die billig aussehende Antwort in beide Richtungen falsch ist. Wenn Ihr Traffic aus sehr langen Eingaben, einer moderaten generierten Antwort und starker Wiederverwendung eines stabilen Präfixes besteht – der Form, in der Weitschweifigkeit nie zum Tragen kommt –, dann ist K3s Kombination aus einem erstklassigen Long-Context-Score, einem Bildeingang und einem herunterladbaren Checkpoint besser geeignet als die von Sol, und die Kosten-pro-Aufgabe-Zahl für den Index-Lauf gilt für Sie nicht. Das ist die ehrliche Version von „offene Gewichte sind einen Aufpreis wert“: Manchmal ist das offene Modell einfach das bessere Modell für die Aufgabe, und hier ist es das auf einer Achse.

Es lohnt sich außerdem zu benennen, was diese beiden Erfolge gemeinsam haben. K3 ist stark, wo eine Aufgabe in einem einzigen langen Akt des Lesens oder Schlussfolgerns beantwortet werden kann, und schwach, wo sie in vielen kleinen Schritten ausgeführt und überprüft werden muss. Die 43-Punkte-Lücke bei Terminal-Bench und die 22-Punkte-Lücke bei Allwissenheit sind derselbe Befund aus zwei Blickwinkeln: Anhaltende agentische Ausführung ist nicht das, wofür dieser Checkpoint optimiert wurde.

Die Arithmetik, die tatsächlich den Ausschlag gibt

Die Preisliste von K3 liegt in jeder Position beim 1,5-Fachen von Sol, und die gemessenen Kosten pro abgeschlossener Index-Aufgabe betragen das 2,8-Fache; der Unterschied zwischen 1,5 und 2,8 erklärt sich vollständig durch das Token-Volumen. Die eigene Messung des Boards ergibt 160 Millionen Ausgabe-Tokens für K3 gegenüber 67 Millionen für Sol bei derselben Suite aus zehn Evaluierungen. K3 erzeugt die 2,4-fache Ausgabe zum 1,5-fachen Preis, und 2,4 × 1,5 ist 3,6 – die Zahl des Boards von 2,00 $ gegenüber 0,72 $ ist etwas freundlicher als das reine Verhältnis, weil Eingabe- und Cache-Beiträge sie leicht ausgleichen, aber die Richtung ist unbestritten.

Das eigene Marketing von Moonsh​oot läuft dem auf eine Weise zuwider, die ein sorgfältiges Lesen verdient. Das Unternehmen behauptet, K3 gebe weniger Ausgabe-Tokens aus als sein Vorgänger, und die architektonische Arbeit – das Attention-Schema, das Residual-Design – zielt direkt auf die Dekodierungskosten bei langem Kontext ab. Beides kann zutreffen, und trotzdem ist das Modell auf einer allgemeinen Benchmark-Suite noch doppelt so wortreich wie der Benchmark-Median. Die beiden Behauptungen betreffen unterschiedliche Dinge: Effizienz gegenüber einem früheren Kimi und Effizienz gegenüber dem Feld. Nur die zweite ist das, woran Sie abgerechnet werden, und sie ist diejenige, die das unabhängige Gremium misst.

Caching mildert das ab. Beide Tarife für gecachte Eingaben betragen ein Zehntel des Tarifs für ungecachte Eingaben des jeweiligen Modells – 0,30 $ für K3, 0,10 $ für Sol –, sodass die Cache-Zeile die Rangfolge nicht ändert, aber es bedeutet, dass eine anfragelastige, antwortarme Arbeitslast die Lücke eher auf ungefähr das Verhältnis der Preisliste als auf das gemessene Aufgabenverhältnis verringert. Und Sols Langkontext-Klausel wirkt in die andere Richtung: Oberhalb von 272.000 Eingabe-Tokens berechnet sie die gesamte Anfrage mit 4,00 $ und 15,00 $ neu, mit Cache bei 0,20 $, was der einzige Bereich ist, in dem K3s Pauschaltarif klar gewinnt. Das ist aus zwei Gründen wissenswert, denn es ist auch der Bereich, in dem K3s Langkontext-Ergebnis die beste Zahl in diesem Vergleich ist.

A generated hero card for a GPT-6.1 Sol versus Kimi K3 comparison, headed 'The download exists, and it is still the dearer option', with two badges reading 'Kimi K3: $2.00 per index task' and 'GPT-6.1 Sol: $0.72 per index task', and the OrcaRouter logo in the bottom-right corner.

Was offene Gewichte hier tatsächlich wert sind

Drei Dinge – und es lohnt sich, sie zu trennen, denn „Open Weights“ wird meist als ein Argument verwendet, obwohl es drei sind.

Der erste Punkt ist, dass Sie gehen können. Wenn Moonsh​oot übernommen wird, die Lizenz für zukünftige Versionen ändert, K3 als veraltet einstuft oder seinen API-Preis erhöht, läuft ein Checkpoint, den Sie bereits heruntergeladen haben, weiter. Das ist für dieses Labor kein hypothetischer Fall: Moonsh​oot setzte neue Abonnements innerhalb von etwa 48 Stunden nach einem früheren Release aus, um die Servicequalität für bestehende zahlende Kunden zu schützen, was anschaulich zeigt, dass API-Zugang eine Richtlinienentscheidung und keine Eigenschaft ist. Nichts davon taucht in einer Kosten-pro-Aufgabe-Tabelle auf, und all das ist real.

Das Zweite ist, dass man festnageln kann. Eine feste Revision, fein abgestimmt, die innerhalb einer Grenze läuft, die Sie kontrollieren, ist etwas, das man einem Prüfer zeigen kann und das eine API nicht bieten kann. Für regulierten Verkehr ist das mehr wert als eine Preisliste.

Das dritte – das gewöhnlich angenommene – ist, dass es günstiger sein wird. Ist es nicht. Der Checkpoint ist ein FP8-Artefakt mit 2,8 Billionen Parametern, und die veröffentlichte Bereitstellungsanleitung ist auf Multi-Beschleuniger-Konfigurationen statt auf einen einzelnen Knoten ausgerichtet. Ein Team, das bereits diese Klasse von Cluster betreibt, hat hier eine echte Option, und die Rechnung ändert sich vollständig, weil die Grenzkosten eines Tokens zu Strom werden. Ein Team, das das nicht tut, vergleicht eine API-Rechnung mit einer Kapitalinvestition, und die API-Rechnung gewinnt mit großem Abstand. Die ehrliche Zusammenfassung ist, dass offene Gewichte hier die Fähigkeit geben, zu gehen, nicht die Fähigkeit, günstig zu betreiben.

Beides auf einer Taste – genau das macht den Tausch nützlich.

Kimi K3 ist auf OrcaRouter zum eigenen Listenpreis von Moonsh​oot verfügbar – 3,00 $ und 15,00 $ pro Million Tokens bei 0,30 $ für Cache-Reads, unverändert gegenüber der Karte des Anbieters – und GPT-6.1 Sol ist am Veröffentlichungstag zu Open​AIs Preis auf unseren Routen gelandet, 2,00 $ und 10,00 $ mit gecachtem Input zu 0,10 $, und der 272.000-Token-Schritt wurde genau wie gelistet durchgereicht. Zu beidem wird nichts hinzugerechnet. Die Plattform reicht den Listenpreis der Anbieter durch, statt ihn aufzuschlagen, sodass eine Preisänderung von Moonsh​oot und eine von Open​AI auf unserer Seite am selben Tag erscheinen, an dem sie beim Anbieter erscheinen – ohne zweiten Vertrag und ohne zwischengeschalteten Reseller.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the listing dated 2026-07-15, the model described as Moonshot AI's 2.8-trillion-parameter mixture-of-experts flagship for long-horizon coding and end-to-end knowledge work, a 1M-token context with text and image input, and the list price of $3.00 input and $15.00 output per million tokens with an 8.48 s median time to first token.

Der Grund, der bei diesem Paar stärker zählt als bei den meisten, ist, dass die beiden Modelle zu unterschiedlichen Ausfallmodi gehören. GPT-6.1 Sol ist das Modell, das man für dauerhafte Ausführung, Tool-Schleifen und Faktenzuverlässigkeit laufen lässt; Kimi K3 ist das Modell, das man für sehr lange Eingaben laufen lässt, wenn man die beste Long-Context-Bewertung will und einen Checkpoint als Absicherung gegen die Geschäftsentscheidung von jemand anderem braucht. Das sind keine konkurrierenden Optionen, sondern zwei Routen im selben Verkehr. Beide hinter einem Endpunkt zu betreiben, mit automatischem Failover zwischen ihnen und einer Regel, die Arbeit mit langen Eingaben an K3 und Ausführungsarbeit an Sol weiterleitet, ist das, was „wir haben einen Open-Weight-Fallback“ von einer Zeile in einem Designdokument in etwas verwandelt, das um drei Uhr morgens in einem Call funktioniert, der gerade fehlschlägt.

A screenshot of the OrcaRouter model page for openai/gpt-6.1-sol, showing the listing dated 2026-09-29, a 1M-token context with 128K maximum output, text, image and file input, a reasoning effort ladder running from low to max, and the pass-through list price of $2.00 input and $10.00 output per million tokens with cached input at $0.10.

Wo jeder Einzelne hingehört

• Terminal-Agenten, Coding im Repo-Maßstab, mehrstufige Ausführung — GPT-6.1 Sol, bei einem 43-Punkte-Abstand in Terminal-Bench 4.0. Das ist nicht knapp.
• Antworten, bei denen eine Halluzination teuer ist — GPT-6.1 Sol, bei einem AA-Omniscience-Abstand von 22 Punkten.
• Sehr lange Eingaben mit einer kurzen generierten Antwort — Kimi K3. Bester Long-Context-Reasoning-Score in diesem Vergleich, Bildeingabe und eine Ausführlichkeit, die nie zum Tragen kommt.
• Self-Hosting oder ein Inferenz-Stack, den man einfrieren können muss — Kimi K3, und nur, wenn Sie die Hardware bereits betreiben. Der Checkpoint ist das Deliverable; die Wirtschaftlichkeit des Betriebs ist eine separate Frage.
• Eine Absicherung dagegen, dass ein Anbieter seine Bedingungen ändert — Kimi K3, und das ist das eine Argument, das GPT-6.1 Sol zu keinem Preis beantworten kann.
• Auswahl anhand der Preisliste — weder K3 noch Sol ist in diesem Vergleich die günstige Option, und keines von beiden ist die günstige Option in der GPT-6-Linie. Wenn die Rechnung die entscheidende Eingangsgröße ist, liegt das gewünschte Modell weiter unten in der Preisliste, nicht in dieser Tabelle.

In diesem Artikel verglichen1

Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert