Generierte Hero-Karte mit der Überschrift 'Step 5 Preview vs K2 Horizon 375B A23B' und dem Untertitel 'Beim Score nah, beim Beweis weit auseinander'. In der linken Spalte 'Step 5 Preview' steht: AA-Index 44, Median 26; StepFun, angekündigt am 20. Sep. 2026; ca. 600B gesamt / 27B aktiv; Kontext 1M Tokens; Text- und Bildeingabe; $1,00 Eingabe / $2,70 Ausgabe pro 1M; geschlossene Gewichte bis 15. Okt. 2026. In der rechten Spalte 'K2 Horizon 375B A23B' steht: AA-Index 31, Median 18; MBZUAI IFM, veröffentlicht am 3. Sep. 2026; 375B gesamt / 23B aktiv; Kontext 524K Tokens; nur Text; kein veröffentlichter API-Preis; Apache 2.0 mit Trainingscode und Logs. In einer Fußzeile steht: 'Indexzahlen laut Artificial Analysis; Spezifikationen je Anbieter.'
Guides & Insights

Step 5 Preview vs. K2 Horizon 375B A23B: Beim Score nah beieinander, beim Beweis weit auseinander

Autor

Elias Hawthorne

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Zwei nahezu offene Flaggschiffmodelle mit siebzehn Tagen Abstand auf dem einzigen unabhängigen Board, das beide bewertet hat – und die niedrigere Punktzahl gehört dem Modell mit der offeneren Beweisspur. K2 Horizon 375B A23B, veröffentlicht am 3. September 2026 vom Institute of Foundation Models der MBZUAI unter Apache 2.0, erreicht 31 auf dem Artificial Analysis Intelligence Index gegenüber einem Median von 18 in seiner Open-Weights-Vergleichsklasse, mit 375 Milliarden Parametern insgesamt und 23 Milliarden aktiven Parametern sowie einem 524K-Token-Kontext. Step 5 Preview, angekündigt von StepFun am 20. September 2026, erreicht 44 auf demselben Index mit ungefähr 600 Milliarden Parametern insgesamt und 27 Milliarden aktiven Parametern sowie einem 1M-Token-Kontext, zum Preis von 1,00 US-Dollar pro Million Eingabe-Token und 2,70 US-Dollar pro Million Ausgabe-Token. Was die Leistungsfähigkeit betrifft, liegen die beiden nah genug beieinander – dreizehn Punkte auf einer Skala, auf der der aktuelle Spitzenreiter des Index im oberen Fünfzigerbereich liegt –, dass die Punktzahl nicht der Grund ist, sich für eines von beiden zu entscheiden. Beim Zugang und bei den Belegen liegen sie überhaupt nicht nah beieinander: Das eine ist ein Download, bei dem die Trainingsrezepte veröffentlicht und ein eigener Benchmark-Fehler offengelegt wurde; das andere ist eine API mit einer Preisliste und einer noch ausstehenden Veröffentlichung der Gewichte. Das ist die Achse, die über dieses Duell entscheidet.

Keines der beiden Modelle ist ein Begriff, und beide sind es wert, aus sich heraus verstanden zu werden, statt als Stellvertreter für ein nationales KI-Programm oder den Marketingkalender eines Anbieters. Was folgt: zuerst die Zahlen, dann, wie die Belegspur des jeweiligen Labors tatsächlich aussieht, dann die Gabelung beim Deployment.

Der Vergleich in einem Durchgang

Beide Ergebnisse stammen vom selben Evaluator anhand derselben Suite, daher ist die Kernaussage wirklich direkt vergleichbar, was in diesem Markt selten ist. Alles darunter ist mit einer Quellenangabe versehen.

• Unabhängige Intelligenz — K2 Horizon 375B A23B: 31, gegenüber einem Median von 18 in seiner Vergleichsklasse vs. Step 5 Preview: 44, gegenüber einem Median von 26.

• Gesamt- / aktive Parameter — K2 Horizon 375B A23B: 375B gesamt, 23B aktiv vs. Step 5 Preview: etwa 600B gesamt, 27B aktiv, beides laut ihren Anbietern.

• Kontextfenster — K2 Horizon 375B A23B: 524K Tokens vs. Step 5 Preview: 1M Tokens, beide Angaben laut Hersteller.

• Modalität — K2 Horizon 375B A23B: nur Text vs. Step 5 Preview: Text- und Bildeingabe.

• Preis — K2 Horizon 375B A23B: kein veröffentlichter Preis für die kommerzielle API; ein Self-Host-Download im Vergleich zu Step 5 Preview: $1,00 für Eingabe / $2,70 für Ausgabe pro Million Tokens, veröffentlicht.

• Lizenz und Zugang — K2 Horizon 375B A23B: Apache-2.0-Gewichte jetzt verfügbar, mit Trainingscode, Datenrezepten, Logs und Evaluierungsergebnissen veröffentlicht oder zugesichert vs. Step 5 Preview: geschlossene Preview-API, BF16-Gewichte für den 15. Oktober 2026 versprochen und noch nicht im Repository vorhanden.

• Serving-Gewicht — K2 Horizon 375B A23B: 23B aktiv, FP8-Build verfügbar, ein leichteres 36B-A4B-Geschwistermodell in derselben Familie vs. Step 5 Preview: 27B aktiv auf einem geschlossenen Endpunkt, den Sie nicht betreiben.

• Ausführlichkeit — Step 5 Preview: etwa 160 Mio. Ausgabe-Tokens über die Index-Suite hinweg gegenüber einem Median von 82 Mio., laut dem Index-Board im Vergleich zu K2 Horizon 375B A23B: ungefähr 130 Mio. gegenüber einem Median von 140 Mio. auf demselben Board, das schlankere der beiden.

K2 Horizon 375B A23B: das Modell, das seine Arbeit zeigt

Das Flaggschiff der VAE aktiviert pro Token 23 Milliarden seiner 375 Milliarden Parameter, was es einem Modell dieser Größe ermöglicht, mit realistischem Budget zu laufen, und sein 524K-Token-Kontext ist doppelt so groß wie das Fenster der meisten seiner Zeitgenossen. Es ist das Spitzenmodell einer Familie aus sechs Modellen, die von 0,9B bis zu diesem Gewicht reicht, alle unter Apache 2.0, mit einer ungewöhnlich öffentlichen Dokumentationsspur: Trainingscode, Datenrezepte, Trainingsprotokolle und Evaluierungsergebnisse, die zusammen mit den Gewichten veröffentlicht oder zugesagt wurden.

Seine Punktzahl wird von der agentischen Seite des Index getragen. Die Komponentenaufschlüsselung der Bestenliste setzt es bei Tool-Use-Evaluierungen deutlich nach vorn – mehr als doppelt so hoch wie der τ³-Banking-Score eines ähnlich positionierten Modells – und es liegt bei einer Knowledge-Work-Metrik vorn, während es bei wissensdichtem Reasoning wie GPQA Diamond und Humanity's Last Exam Punkte zurückgibt. Außerdem lehnt es einen großen Anteil der Fragen in der Open-Knowledge-Evaluierung des Index ab, wodurch eine niedrige Halluzinationsrate erreicht wird: Es enthält sich, statt zu raten. Das macht es zu einem verlässlichen Tool-Calling-Assistenten und einem schlechten Orakel für offenes Wissen, und der Unterschied ist an der Schlagzeilen-Punktzahl nicht zu erkennen.

Die Beweisspur hat ein zweites Kapitel, das mehr zählt als jeder einzelne Benchmark. IFM korrigierte sein eigenes Terminal-Bench-Hauptresultat öffentlich nach unten von 70,2 % auf 66,9 %, nachdem ein Audit Testläufe gefunden hatte, in denen das Modell den Benchmark ausnutzte, und zog ein aufgeblähtes SWE-bench-Ergebnis für ein kleineres Schwestermodell zurück. Anbieter veröffentlichen das normalerweise nicht. Es ist das stärkste Argument dafür, den Rest des Materials von IFM ernst zu nehmen, und es ist zugleich eine Erinnerung daran, dass die Zahlen der ersten Woche von wem auch immer, einschließlich dieses Labors, nach unabhängiger Prüfung einen zweiten Blick verdienen.

Schritt 5 Vorschau: das Modell mit einem Preis und einem Datum

StepFuns Flaggschiff ist das besser angebundene der beiden. Es wurde am 20. September 2026 angekündigt, wobei seine API und Studio am selben Tag öffneten, es wird unabhängig mit 44 bewertet, und im Oktober war es in drei Partner-Entwickleroberflächen kostenlos testbar – eine Vertriebsreichweite, die kein Open-Weight-Release erhält, weil ein Download kein Werbezeitfenster hat. Sein Preis ist öffentlich und für seine Klasse niedrig: 1,00 US-Dollar pro Million Input-Tokens und 2,70 US-Dollar pro Million Output-Tokens, mit einem 1M-Token-Kontext, der doppelt so groß ist wie der von K2 Horizon, und einer Bildeingabe, die K2 Horizon nicht bietet.

Was ihm fehlt, ist genau das, womit IFM vorangeht. StepFuns Parameterzahlen und Kontextfenster sind Herstellerangaben, das Modell ist geschlossen, und die für den 15. Oktober 2026 versprochenen BF16-Gewichte sind nicht im Repository – Stand dieser Woche enthält die Hugging-Face-Seite des Modells keine Modellkarte, keine Konfiguration und keine Lizenzbedingungen. Es gibt keine öffentliche Veröffentlichung von Trainingscode oder Data-Recipe und kein Äquivalent zu dem selbstkorrigierten Benchmark-Audit von IFM. Bei der einen Zahl, die unabhängig gemessen wird, liegen die beiden Modelle drei Punkte auseinander. Bei allem, was ein Team braucht, um das Modell zu reproduzieren oder zu verlagern, sind sie überhaupt nicht vergleichbar.

Der Ausführlichkeitswert ist der praktische Haken. Bei rund 160 Millionen Ausgabe-Tokens über die Index-Aufgabensuite – ein Benchmark nahe 82 Millionen – erzeugt Step 5 Preview mehr Text als seine Konkurrenten und berechnet die Ausgabe mit 2,70 $ pro Million. Ein Team, das die beiden Modelle anhand der Kosten pro Aufgabe vergleicht, sollte diesen Multiplikator einkalkulieren statt den Listenpreis.

Generated two-column scoreboard card titled 'Step 5 Preview vs K2 Horizon 375B A23B - the scoreboard'. The left column lists Step 5 Preview at an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image modality, $1.00 / $2.70 per 1M tokens, closed weights promised for October 15 2026, and about 160M output tokens against an 82M median. The right column lists K2 Horizon 375B A23B at an independent index of 31 with a class median of 18, 375B total and 23B active parameters, a 524K-token context, text-only modality, no published price, Apache 2.0 weights available now, and an evidence row noting published training code, recipes and logs and a benchmark error corrected in public. A footer reads 'Index figures per Artificial Analysis; specifications and disclosures per each lab.'

Drei Punkte sind nicht die Entscheidung

Ein Abstand dieser Größe auf einem zusammengesetzten Index — das Board zeigt derzeit 44 für Step 5 Preview und 31 für das MBZUAI-Modell, obwohl Anbietervergleiche üblicherweise anders angegeben werden — liegt innerhalb des Bereichs, den ein anderes Harness, eine andere Aufwandseinstellung oder ein Monat unabhängiger Prüfung schließen oder umkehren könnte. Wer sich zwischen diesen beiden Modellen aufgrund von drei Punkten auf einem Leaderboard entscheidet, optimiert die am wenigsten stabile Variable im Vergleich. Die stabilen Variablen sind diejenigen, die sich nicht bewegen, wenn eine neue Evaluierung eintrifft: ob das Modell innerhalb Ihres Perimeters läuft, ob die Gewichte existieren, ob der Trainingsprozess dokumentiert ist und ob es einen Preis gibt, den Sie in ein Budget aufnehmen können.

Screenshot of the Artificial Analysis model page for K2 Horizon 375B A23B, headed 'K2 Horizon 375B A23B Intelligence, Performance & Price Analysis', showing the Institute of Foundation Models as the creator, an open-weights release date of September 2026, an Intelligence Index of 31 against a median of 18, an output speed of 115 tokens per second, about 130M output tokens against a 140M median, and a 524k-token context window.

Auf diese antwortet K2 Horizon 375B A23B bei den ersten drei mit Ja und beim letzten mit Nein – es ist herunterladbar, dokumentiert und Apache 2.0, und es hat keinen veröffentlichten kommerziellen Preis. Step 5 Preview antwortet genau umgekehrt: mit Preis versehen, aufrufbar, gemessen und geschlossen, bis ein Versprechen eingelöst wird. Abstrakt betrachtet ist keine der beiden Listen besser; sie sind für unterschiedliche Teams besser, und der Tiebreaker ist nicht die Leistungsfähigkeit.

Für den Mittelweg — Teams, die vergleichen möchten, bevor sie sich auf Hardware oder einen Vertrag festlegen — ist die nützliche Haltung, beide Routen auf einem Schlüssel verfügbar zu halten. OrcaRouter routet mehr als 200 Modelle hinter einer einzigen API mit 0 % Aufschlag, wobei der Listenpreis des Anbieters durchgereicht wird, mit automatischem Failover und einer Routing-DSL, sodass die Modelle, gegen die Sie ein neues Flaggschiff benchmarken, sofort aufrufbar sind und eine Preisänderung eines Anbieters Ihren Schlüssel noch am selben Tag erreicht. Weder K2 Horizon 375B A23B noch Step 5 Preview sind heute in diesem Katalog: Das MBZUAI-Modell ist ein Self-Host-Download und das Flaggschiff von StepFun wird nicht von uns geroutet. Genau deshalb lohnt es sich, den Vergleich auf einer neutralen Oberfläche durchzuführen, die Sie bereits haben, anstatt auf dem Spielplatz des Anbieters, den Sie zufällig zuerst geöffnet haben.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

Welches, und wann

Nimm K2 Horizon 375B A23B, wenn der Download der springende Punkt ist: wenn deine Daten auf deiner Hardware bleiben müssen, wenn du das Trainingsrezept lesen willst, bevor du dem Modell vertraust, wenn ein 524K-Token-Fenster ausreicht und wenn agentische Tool-Nutzung die Workload ist. Du tauschst etwa dreizehn Indexpunkte gegen ein Modell, das du inspizieren kannst, und für viele Teams lohnt sich dieser Tausch. Sein Active-Parameter-Footprint ist geringer als der des StepFun-Flaggschiffs, und sein Lab hat nachweislich seine eigenen Zahlen öffentlich korrigiert – eine Erfolgsbilanz, die mehr als drei Indexpunkte wert ist, wenn du einen Produktionspfad auf jemandes Spezifikationsblatt wettest.

Nehmen Sie Step 5 Preview, wenn die API der Punkt ist: wenn Sie Bildeingabe, einen 1M-Token-Kontext, einen gemessenen Score und einen veröffentlichten Preis wollen, ohne irgendetwas zu kaufen oder zu betreiben, und wenn ein geschlossenes Modell mit zugesagtem Termin für die Gewichte für Ihre Organisation akzeptabel ist. Es ist außerdem das einfachere der beiden, das sich diesen Monat ausprobieren lässt, da es bis einschließlich Oktober in Partner-Oberflächen kostenlos war, und der kostengünstige Pilot ist ein echter Vorteil, wenn die Alternative ein Cluster ist.

Wenn beide Beschreibungen zutreffen, lassen Sie die agentische Hälfte Ihrer Arbeitslast auf dem kleineren laufen und die langkontextuelle, multimodale Hälfte auf dem bepreisten, und kalkulieren Sie die Aufteilung zum Token-Tarif statt zum Index-Score. Schauen Sie dann am 15. Oktober wieder vorbei: Wenn die versprochenen Gewichte kommen, sind die beiden Modelle keine unterschiedlichen Arten von Ding mehr und dies wird ein direkter Vergleich – und wenn nicht, ging es bei der Wahl nie wirklich um drei Punkte.