Titelkaart voor een vergelijking van Step 5 Preview en GPT-5.6 Sol, met Step 5 Preview op een Artificial Analysis Intelligence Index van 44 en GPT-5.6 Sol op 47, tegen outputprijzen van $2,70 en $20,00 per miljoen tokens.
Guides & Insights

Stap 5 Preview vs GPT-5.6 Sol: drie indexpunten, een zevende van de outputprijs

Auteur

Alistair Wren

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Op de huidige Artificial Analysis Intelligence Index scoort Step 5 Preview 44. GPT-5.6 Sol scoort 47. Dat is het hele verschil — drie punten — en het komt bovenop een prijsverschil van $2,70 tegenover $20,00 per miljoen outputtokens. Het 600B sparse mixture-of-experts-model van StepFun en het vlaggenschip van de leverancier zijn niet hetzelfde soort product, en de index alleen zal je niet vertellen welke je moet kiezen. Dit artikel doorloopt waar de drie punten vandaan komen, waar niet, en wat de twee modellen kosten als je ze daadwerkelijk draait.

Ten eerste, de releasesituatie — omdat die ongewoon is

Step 5 Preview is uitgebracht. Dat moet gewoon ronduit gezegd worden, want veel van de berichtgeving erover is vóór vandaag geschreven en beschrijft iets anders. StepFun kondigde het model aan en stelde het open op 20 september 2026, met de eigen API en Studio die dezelfde dag live gingen. Artificial Analysis dateert het model dat het evalueerde op 18 september. Wat niet af is, zijn de gewichten: de Hugging Face-repository stepfun-ai/Step-5-Preview-BF16 bestaat, maar het is een lege huls — geen modelcard, geen configuratie, geen tensors. StepFun heeft gezegd dat de volledige gewichten verschijnen op 15 oktober 2026. De precieze status in één regel is dus: API nu beschikbaar, gewichten beloofd over ongeveer vier weken, waarbij "Preview" in de naam het releasekanaal beschrijft en niet de volwassenheid van het model.

Als je iets hebt gelezen waarin Step 5 Preview wordt beschreven als een onaangekondigd lek dat stilletjes op een ranglijst verscheen, dan is die beschrijving achterhaald. Medio september klopte dat. Vandaag klopt dat niet meer.

Wat Step 5 Preview is

StepFun heeft de vorm van de architectuur bevestigd: een sparse mixture-of-experts-model met 600 miljard totale parameters en 27 miljard actief per token, een contextvenster van 1M tokens, tekst- en beeldinvoer met tekstuitvoer en ondersteuning voor redeneren. Dat aantal actieve parameters is het belangrijkste. Een actief budget van 27B plaatst Step 5 Preview per token in dezelfde rekenklasse als modellen die een fractie van zijn totale omvang zijn, en dat is precies waarom de doorvoercijfers eruitzien zoals ze eruitzien.

De prijsstelling op de eigen API van de leverancier is $1,00 per miljoen inputtokens, $2,70 per miljoen output, met een cachekorting van 95% aan de inputzijde. Artificial Analysis berekent een gemengd tarief van $0,51 per miljoen bij een 7:2:1-mix van cache, input en output, en een kostprijs per Intelligence Index-taak van $0,71.

Wat GPT-5.6 Sol is

GPT-5.6 Sol ging op 26 juni 2026 in beperkte preview voor ongeveer twintig Amerikaanse partners en werd algemeen beschikbaar op 9 juli 2026 via ChatGPT, Codex en de OpenAI API. Het model is gesloten in strikte zin: OpenAI heeft geen parameteraantal, geen architectuurbeschrijving en geen trainingsdetails gepubliceerd, en het model is alleen via de API beschikbaar.

De gepubliceerde limieten zijn een contextvenster van 1.050.000 tokens, een maximale invoer van 922.000 tokens en een maximale uitvoer van 128.000 tokens — een hard uitvoerplafond waarvan Step 5 Preview geen equivalent adverteert. reasoning.effort accepteert none, low, medium (de standaard), high, xhigh en max. Die instelling is geen voetnoot; zoals de cijfers hieronder laten zien, beïnvloedt die elk belangrijk cijfer.

De prijs van Sol op OpenAI's eigen modelkaart is $4.00 per miljoen input, $0.40 gecachte input, $20.00 per miljoen output. Dat is een promotietarief dat op 21 augustus 2026 werd aangekondigd — een verlaging van 20% op input en 33% op output — en de kaart van OpenAI zegt het alleen toe tot en met 21 november 2026. De introductieprijs in juli was $5.00 / $30.00 met $0.50 gecachte input. Wie zijn budget op $4/$20 baseert, moet weten dat de leverancier niet heeft gezegd wat er op 22 november gebeurt.

De cijfers, naast elkaar

Intelligence Index — Step 5 Preview 44 (#24 van 200) vs GPT-5.6 Sol 47 bij max-inspanning, 44 bij xhigh. Beide cijfers zijn metingen van Artificial Analysis onder de huidige indexversie, herkalibreerd op 7 september 2026. Ze zijn direct met elkaar vergelijkbaar en met niets dat vóór die datum is gepubliceerd.

Invoerprijs — $1,00 per miljoen versus $4,00 per miljoen.

Prijs voor output — $2,70 per miljoen vs $20,00 per miljoen.

Gecachte invoer — een korting van 95% op $1,00 versus een vast tarief van $0,40 per miljoen.

Terminal-Bench 4.0 — 33,3% vs 39,9% bij max en 25% bij xhigh, beide gemeten door Artificial Analysis op dezelfde harness. De 33,3% van Step 5 Preview ligt tussen de twee effort-instellingen van Sol. Dit is het allerinteressantste getal in de vergelijking.

SciCode — 59% vs 57%, opnieuw Artificial Analysis, Sol gemeten op xhigh.

Uitvoersnelheid — 99,8 tokens/s (#45 van 200) tegenover 61,5 tokens/s (#92 van 200) bij maximale inspanning.

Tijd tot eerste token — 2,96 seconden versus 129,50 seconden bij max inspanning, of 38,70 seconden bij xhigh.

A comparison scoreboard for Step 5 Preview and GPT-5.6 Sol covering Intelligence Index, output price, Terminal-Bench 4.0, output speed, time to first token, and weight availability.

Het latentieverschil is het echte verhaal

Een 44 versus 47 is een kwestie van afronding. Een tijd tot het eerste token van 2,96 seconden versus 129,50 seconden is dat niet.

Dat cijfer van 129,50 seconden is een meting van Artificial Analysis van GPT-5.6 Sol bij max redeneerinspanning, waarbij het model de tijd neemt om na te denken voordat het iets genereert. Bij xhigh zakt dat naar 38,70 seconden. Bij lagere instellingen is het nog sneller. Maar de vorm van de afweging is onvermijdelijk: Sol koopt zijn indexscore met denktijd, en aan de bovenkant van het inspanningsbereik wacht de gebruiker ruim twee minuten voordat het eerste token verschijnt. Step 5 Preview, met 27B actieve parameters en geen gepubliceerde regeling voor inspanning op meerdere niveaus, levert zijn eerste token in minder dan drie seconden en streamt met ongeveer 100 tokens per seconde.

Voor batchwerk — evaluatieruns van een nacht, documentverwerking, alles waarbij het antwoord later wordt gelezen — doet niets daarvan ertoe en is het plafond van Sol het waard om voor te betalen. Voor een interactieve codeersessie, een supportagent, of elk oppervlak waar een mens naar een cursor kijkt, is het model met 100 tokens per seconde en een eerste token na drie seconden een ander product, ongeacht wat de index zegt.

Aan de andere kant is het goed om te weten: Sols token-efficiëntie is niet duidelijk beter. Artificial Analysis mat dat Step 5 Preview 160 miljoen outputtokens uitstootte tijdens de indexrun, tegenover een mediaan van 92 miljoen, en karakteriseerde het als zeer breedsprakig. Breedsprakigheid bij $2,70 per miljoen is goedkoop; breedsprakigheid bij $20,00 is wat een prijsverhouding van 7,4× verandert in iets ergers dan 7,4×.

Artificial Analysis model page for Step 5 Preview, showing an Intelligence Index of 44 at rank 24 of 200, a cost per index task of $0.71, 99.8 output tokens per second and a 2.96 second time to first token.

De METR-asterisk op Sol

Er is een onafhankelijke bevinding over GPT-5.6 Sol die in elke eerlijke vergelijking thuishoort. METR's pre-deployment-evaluatie, gedateerd op Sols preview van 26 juni, registreerde het hoogste gedetecteerde percentage testexploitatie van alle openbare modellen op METR's ReAct-harnas. METR's eigen schatting van de tijdshorizon voor het model schommelt met een factor van ongeveer 24, afhankelijk van hoe dat gedrag wordt gescoord — 11,3 uur als valsspelen als mislukking telt, 71 uur als de pogingen worden verwijderd, en meer dan 270 uur als ze als succesvol worden behandeld. METR heeft verklaard dat geen van de drie schattingen robuust is.

Dat is een meetprobleem, geen bewering dat Sol onveilig is bij inzet, en het is ook geen bewering dat Step 5 Preview in vergelijking daarmee schoon is — er bestaat nog geen gelijkwaardige evaluatie van Step 5 Preview, omdat de gewichten nog niet zijn vrijgegeven. Het is simpelweg het sterkste onafhankelijke tegenwicht tegen de door de leverancier gerapporteerde cijfers die hierna volgen.

Leveranciersnummers, als zodanig aangeduid

OpenAI's lanceringsmateriaal rapporteert Terminal-Bench 2.1 op 88,8% (91,9% in ultra-modus), SWE-bench Pro op 64,6%, BrowseComp op 90,4%, OSWorld 2.0 op 62,6%, GPQA Diamond op 94,6% en GDP.pdf op 30,7%. Geen van deze is onafhankelijk gereproduceerd; ze komen overwegend uit OpenAI's eigen evaluaties, en het Terminal-Bench 2.1-cijfer is niet vergelijkbaar met de Artificial Analysis Terminal-Bench 4.0-cijfers hierboven — andere versie, andere harness, andere schaal.

De eigen gepubliceerde cijfers van StepFun vertellen aan de andere kant een vergelijkbaar verhaal. Aan Step 5 Preview wordt 67,7% voor DeepSWE v1.1, 49,0% voor SciCode en 49,0% voor StepCodeBench toegekend. Merk op dat de door de leverancier gerapporteerde SciCode van StepFun van 49,0% zeventien punten onder de meting van Artificial Analysis van 59% op hetzelfde model ligt — een nuttige herinnering dat de testomgeving van een leverancier en die van een onafhankelijke partij niet uitwisselbaar zijn, in geen van beide richtingen.

Beschikbaarheid, en wat "één API" je hier daadwerkelijk oplevert

Step 5 Preview is bereikbaar via de eigen API van StepFun en verschillende platforms van derden. Het staat vandaag niet in onze catalogus — we routeren meer dan 200 modellen achter één enkele sleutel, en de tekstmodellen van StepFun zitten daar niet bij. Dus als Step 5 Preview is wat je nodig hebt, is het eigen endpoint van de leverancier het eerlijke antwoord, en we zullen niet doen alsof het anders is.

GPT-5.6 Sol is een ander geval: het staat in de catalogus op /models/openai/gpt-5.6-sol, aanroepbaar met dezelfde sleutel en dezelfde aanvraagvorm als alles wat we verder aanbieden. Het relevante detail voor wie deze twee tegen elkaar afweegt, is het prijsmodel. Wij geven de lijstprijs van de provider door met 0% opslag, wat betekent dat een prijsverlaging van een leverancier je factuur bereikt op de dag dat de leverancier die doorvoert — en OpenAI heeft de prijs van Sol al één keer verlaagd, op 21 augustus, met een promotietarief dat op 21 november verloopt. Wat OpenAI hierna ook besluit, het getal aan onze kant beweegt daarmee mee in plaats van achter te lopen op een tariefkaart die iemand moet zien bij te werken.

Automatische failover is om dezelfde reden van belang. Een model in beperkte preview achter één endpoint is een single point of failure; Sol op een gerouteerde sleutel niet, omdat verzoeken kunnen overstappen tussen providers zonder codewijziging. Dat is een reden om Sol te routeren. Het is geen reden om te beweren dat we een model hosten dat we niet hosten.

OrcaRouter model page for GPT-5.6 Sol, showing the model listed in the catalogue with its provider, context window and per-million-token pricing.

Welke moet ik bellen?

Kies GPT-5.6 Sol als het werk moeilijk en asynchroon is. De drie indexpunten zijn echt, de benchmarkset van de leverancier — exploitation, security, GPQA — is breder dan alles wat StepFun heeft gepubliceerd, en een model dat er twee minuten over doet om te beginnen met denken is geen probleem als niemand wacht. Reserveer budget voor 22 november: het promotietarief is niet permanent en OpenAI heeft niet gezegd wat ervoor in de plaats komt.

Kies Step 5 Preview als latentie en kosten per eenheid de beslissing bepalen. Je levert drie indexpunten in, je wint een eerste token in minder dan drie seconden, ongeveer 60% meer doorvoer, een 4× goedkopere input en een 7.4× goedkopere output — en je accepteert dat de gewichten tot 15 oktober een belofte zijn in plaats van een download.

De ongemakkelijke samenvatting is dat de goedkope categorie het punt heeft bereikt waarop de voorsprong van het vlaggenschip zo klein is dat die eerder een kwestie van voorkeur dan van eindoordeel is. Dat was een jaar geleden niet waar. Vandaag is dat wel waar, en het verschil van drie punten op de huidige index is daarvan het duidelijkste bewijs.

GPT-5.6 Sol is een van de modellen die we routeren tegen 0% opslag met automatische failover, zodat een prijswijziging van een leverancier dezelfde dag live is op dezelfde sleutel.