Gegenereerde titelkaart met de titel 'Step 5 Preview vs DeepSeek V4 Pro — wat je kunt downloaden' met twee kolommen: Step 5 Preview op AA Index 44, 600B totaal / 27B actief, gewichten beloofd op 15 oktober en een repository met één .gitattributes-bestand; DeepSeek V4 Pro op AA Index 36, 1,6T totaal / 49B actief, gewichten MIT en nu downloadbaar en een volledige checkpoint op Hugging Face. Een voettekst luidt: 'Beide indexcijfers volgens Artificial Analysis Intelligence Index v4.3.2 bij maximale redeneerinspanning.'
Guides & Insights

Step 5 Preview vs DeepSeek V4 Pro: de een is een belofte, de ander een MIT-licentie

Auteur

Rowan Sterling

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Alles in deze confrontatie draait om een vraag die niets met benchmarks te maken heeft: wat kun je daadwerkelijk downloaden? DeepSeek V4 Pro — de build die de leverancier op 13 augustus 2026 uitbracht als DeepSeek-V4-Pro-0813 — is een mixture-of-experts-model met 1,6 biljoen parameters onder een MIT-licentie, met gewichten die nu op Hugging Face staan. Step 5 Preview, dat StepFun op 20 september 2026 aankondigde, is een sparse MoE met 600 miljard parameters die acht punten hoger scoort op hetzelfde onafhankelijke board en een Hugging Face-repository heeft met precies één bestand, .gitattributes. StepFun zegt dat het BF16-checkpoint op 15 oktober komt. De eerlijke vorm van deze vergelijking is dus niet "welk model is beter". Het is "op welke van deze twee kun je dit kwartaal bouwen, en op welke wacht je nog."

Die framing is minder spannend dan een benchmark-shootout en aanzienlijk nuttiger, omdat het gat van acht punten en de wachttijd van vijfentwintig dagen niet hetzelfde soort feit zijn. Met een van de twee kun je vandaag al rekening houden.

Acht punten, en de vier die ertoe doen

Artificial Analysis haalt beide modellen door Intelligence Index v4.3.2 — tien evaluaties — wat de enige plek is waar deze twee door dezelfde hand zijn gemeten.

• Intelligentie-index — Step 5 Preview 44 vs DeepSeek V4 Pro 36

• Positie op die ranglijst — Step 5 Preview 24e van 200 vs DeepSeek V4 Pro 7e van 113 in zijn klasse

• Terminal-Bench 4.0 — Step 5 Preview 33,3%; DeepSeek V4 Pro staat niet op hetzelfde leaderboard vermeld, dus er is geen gelijkwaardige agentische rij om te citeren

• Uitvoersnelheid — Step 5 Preview 99,8 tokens/seconde vs DeepSeek V4 Pro 88,8 tokens/seconde

• Tijd tot eerste token — Step 5 Preview 2,96s vs DeepSeek V4 Pro 1,69s

• Prijs per 1M tokens — Step 5 Preview $1,00 in / $2,70 uit vs DeepSeek V4 Pro $1,32 in / $3,96 uit tegen het piektarief van DeepSeek, halverend naar $0,66 / $1,98 buiten de piek

• Cachekorting — Step 5 Preview 95% vs DeepSeek V4 Pro 97%

• Context — beide 1 miljoen tokens; DeepSeek publiceert een uitvoerplafond van 384.000 tokens, StepFun heeft er geen gepubliceerd.

• Gewichten — Step 5 Preview gesloten, BF16-checkpoint gepland voor 15 oktober; DeepSeek V4 Pro MIT, nu downloadbaar

Twee rijen staan haaks op de kop. DeepSeek V4 Pro levert zijn eerste token in 1,69 seconden, tegenover de 2,96 van Step 5 Preview — een voorsprong van 43% bij elke aanroep, wat zich in een lange agent-loop opstapelt tot echte kloktijd. En zijn cachekorting is twee punten beter, wat het belangrijkst is voor precies de workload waarvoor beide modellen worden verkocht: een agent die bij elke beurt dezelfde systeemprompt en repositorycontext opnieuw verstuurt, valt bijna volledig binnen die korting.

Het geaggregeerde verschil van acht punten is reëel, en het is ook smaller dan acht punten doen vermoeden. Een index is een samengestelde maatstaf van tien evaluaties, en de samenstelling is waar de twee modellen uiteenlopen. De 33,3% van Step 5 Preview op Terminal-Bench 4.0 is een echt agentisch resultaat; de eigen voornaamste sterkte van DeepSeek V4 Pro is langetermijnredenering tegen een prijs die niets anders in de open-weights-klasse evenaart. Geen van beide boards publiceert een rij waarin de twee direct tegenover elkaar staan, wat de eerlijke reden is dat deze vergelijking niet met één enkel getal kan worden beslecht.

Screenshot of the Artificial Analysis model page for Step 5 Preview, showing StepFun as the creator and a September 2026 release date, an Intelligence Index of 44 at rank 24 of 200, output speed 99.8 tokens per second, cost per Intelligence Index task $0.71, verbosity 160M output tokens, pricing of $1.00 per million input tokens and $2.70 per million output tokens with a 95% cache discount, and technical specifications listing reasoning, text and image input, and a 1M-token context window.

Wat 'open' je oplevert wanneer de leverancier van gedachten verandert

Dit is het deel van deze matchup dat een specificatieblad niet kan overbrengen, en het is de moeite waard om het met de werkelijke data te vermelden, want het gebeurde elf dagen voordat Step 5 Preview werd aangekondigd.

DeepSeek vertelde gebruikers dat het V4 Pro zou uitfaseren. Op 9 september zei het bedrijf dat verzoeken zouden worden doorgestuurd naar de nieuwere DeepSeek V4.1 Flash; op 10 september werd de datum definitief vastgesteld op 12:00 uur Pekingse tijd op 14 september. Op 11 september draaide het bedrijf dit terug — de V4 Pro API-dienst blijft na 14 september bestaan, de facturering blijft ongewijzigd, in DeepSeek's eigen woorden. De model-string, de context van 1 miljoen tokens en de limiet van 500 gelijktijdige verzoeken zijn allemaal nog precies zoals ze waren, en de pagina Modellen en Prijzen van DeepSeek vermeldt de terugdraaiing als voetnoot bij de deepseek-v4-pro rij.

Vat dat op als een demonstratie van het ding waartegen open gewichten je daadwerkelijk beschermen, en van het ding waartegen ze dat niet doen. De API werd bijna weggenomen door een planningsbeslissing. De gewichten konden dat niet. Een MIT-gelicentieerde checkpoint op je eigen hardware heeft geen leverancier die de stopzetting ervan kan aankondigen, en dat is een ander soort garantie dan een prijsbelofte — het is helemaal geen belofte.

Dat is precies het gat waarin Step 5 Preview zich bevindt. StepFun heeft zich vastgelegd op 15 oktober voor het BF16-checkpoint, en de repositorynaam die het al heeft gereserveerd — stepfun-ai/Step-5-Preview-BF16 — is het formaat waarop je fine-tunet en quantiseert, bij aanmaak benoemd en later gevuld. Dat is een planningssignaal, geen artefact. Zolang de repository niets anders bevat dan een .gitattributes, is Step 5 Preview een model dat je huurt, op de voorwaarden van één leverancier, zonder licentie om te lezen en zonder fallback als de voorwaarden veranderen.

De twee manieren om de goedkope optie te zijn

Beide modellen onderbieden de gesloten frontier met een ruime marge, en de mechanismen zijn niet dezelfde, wat van belang is voor hoe duurzaam die prijs is.

DeepSeek V4 Pro is goedkoop omdat een lab de gewichten publiceerde en een concurrerende serveermarkt de marge eruit drukte. Dat is een structurele ondergrens: iedereen kan het checkpoint serveren, dus de prijs wordt bepaald door de kosten van een GPU-uur in plaats van door het prijsbeleid van een bedrijf. DeepSeek's eigen API prijst het in twee vensters — $1,32 en $3,96 tijdens piekuren, de helft daarvan buiten die uren — en de piek is smal, een paar uur op weekdagochtenden in UTC, dus het meeste verkeer komt op het goedkopere tarief uit en in het weekend geldt nooit het hogere.

Step 5 Preview is goedkoop omdat StepFun heeft besloten het zo te prijzen. Er is één endpoint, één prijslijst en geen tweede bron. Dat is geen beschuldiging — een 600B/27B-sparse model kost echt minder om te serveren dan het aantal parameters suggereert, en de verhouding geactiveerde parameters is de reden. Het is simpelweg een ander soort prijs, en het verschil wordt duidelijk op de dag dat StepFun besluit dat de preview zijn werk heeft gedaan.

Het prijsverschil tussen de twee is klein genoeg dat het niets zou moeten beslissen: $1,00 en $2,70 tegenover $1,32 en $3,96 is een verschil van 24% op input en 32% op output, ruim binnen het bereik dat een cachekorting, een verschil in outputlengte of een herkansingspercentage kan uitwissen. Wat de kwestie van uitgebreidheid betreft, liggen de twee dicht bij elkaar — Step 5 Preview genereerde 160M outputtokens in de index-run tegenover een mediaan van 92M, en de eigen run van DeepSeek V4 Pro zit in dezelfde band. Geen van beide is een zuinig model, en beide worden verkocht op basis van goedkoop per token in plaats van goedkoop per taak.

Generated two-column comparison scoreboard titled 'Step 5 Preview vs DeepSeek V4 Pro — the scoreboard'. The left column gives Step 5 Preview the rows AA Index 44, parameters 600B total / 27B active, price $1.00 / $2.70, cache discount 95%, TTFT 2.96s, and weights due October 15. The right column gives DeepSeek V4 Pro the rows AA Index 36, parameters 1.6T total / 49B active, price $1.32 / $3.96, cache discount 97%, TTFT 1.69s, and weights MIT-licensed and downloadable now. A footer reads 'Both per Artificial Analysis Intelligence Index v4.3.2 at maximum reasoning effort.'

Waar elk van hen thuishoort in een echte stack

Als je een model nodig hebt dat je kunt fine-tunen, kunt kwantiseren, in je eigen VPC kunt hosten of aan een juridisch team kunt overhandigen met een licentiebestand dat ze kunnen lezen, dan is dit geen moeilijke keuze en gaat het niet om benchmarks. DeepSeek V4 Pro is vandaag beschikbaar onder MIT. Step 5 Preview heeft geen licentie, geen configuratie en geen parameterbestand, en het vroegste waarop je kunt plannen is medio oktober. Het indexverschil van acht punten verandert die rekensom niet, want een model dat je niet kunt downloaden, kan niet worden geïmplementeerd.

Als wat je wilt het sterkste agentische resultaat is dat beschikbaar is voor een dollar per miljoen inputtokens, dan staat Step 5 Preview voorop op het enige board dat beide heeft gemeten, en het is de betere standaardkeuze voor het trial-and-errorwerk dat het grootste deel van een agent-loop vult: extractie, classificatie, testscaffolding, de routineaanroepen tussen de twee die ertoe doen. De 99,8 tokens per seconde zorgen er ook voor dat de uitvoer sneller klaar is dan de 88,8 van DeepSeek V4 Pro, waardoor de loop zelf wordt verkort en niet alleen de rekening.

De lastige situatie is degene waarin de meeste teams zich in de praktijk bevinden: je wilt het Step 5 Preview-getal, maar je kunt een preview-endpoint dat op de lanceerdag openging, zonder gepubliceerd outputplafond, niet op een productiepad zetten. Dat is een routeringsprobleem, en dat is het probleem waarop deze vergelijking eindigt. DeepSeek V4 Pro is bereikbaar via OrcaRouter voor $0,66 en $1,98 per miljoen tokens, de dalurenhelft van de DeepSeek-tariefkaart van $1,32 en $3,96, en de omringende tekstmodellen daarnaast — achter één sleutel voor meer dan 200 modellen met 0% opslag, zodat een prijsherziening van DeepSeek dezelfde dag op je factuur belandt in plaats van bij verlenging. Richt het verkennende deel van het verkeer op de preview en houd het productiepad op het model met een licentie erachter, waarbij automatische failover tussen providers het werk doet dat de capaciteitscurve van een preview-endpoint noodzakelijk maakt.

Screenshot of the OrcaRouter model page for DeepSeek V4 Pro at www.orcarouter.ai/models/deepseek/deepseek-v4-pro, showing the model id deepseek/deepseek-v4-pro, a 1M-token context and 384K max output, input pricing of $0.66 and output pricing of $1.98 per million tokens, a p50 time to first token of 4.01 seconds, 3,730M tokens of traffic over seven days, and the endpoints and SDK snippets behind the OrcaRouter API.

Wat zou het beslechten?

Drie dingen, en alle drie zijn controleerbaar in plaats van betwistbaar.

Het eerste is de licentie. Wanneer het BF16-checkpoint beschikbaar komt, wat zegt de repository dan dat een bedrijf ermee mag doen? Een permissieve licentie dicht het grootste deel van deze kloof al op zichzelf, omdat ze van de voorsprong van acht punten iets maakt dat je kunt bezitten in plaats van huren. Een restrictieve laat DeepSeek V4 Pro als het enige model in het tweetal over waarop je daadwerkelijk een product kunt bouwen.

Het tweede is het uitvoerplafond. DeepSeek publiceert 384.000 tokens. De aankondiging van StepFun zegt 1M context en vermeldt geen uitvoerlimiet, en een aparte configuratie van een derde partij die tijdens het lek circuleerde, vermeldde 350.000 context met een uitvoermaximum van 64.000. Voor het agentische werk met een lange horizon waarvoor beide modellen worden verkocht, is dat aantal geen voetnoot.

Het derde is of de prijs standhoudt zodra het achtervoegsel 'preview' verdwijnt. Een previewprijs is een klantenwervingsgetal; een definitieve prijs is een businessmodel. De ondergrens van DeepSeek V4 Pro wordt bepaald door een concurrerende markt voor het aanbieden van modellen en kan niet veel verschuiven. Die van Step 5 Preview kan op een dinsdag zomaar verschuiven.

Totdat de eerste twee zijn beantwoord, is de praktische lezing dat DeepSeek V4 Pro het model is dat je inzet en Step 5 Preview het model waartegen je benchmarkt — met de kanttekening dat een preview-endpoint van een paar dagen oud, dat acht punten boven een volwassen, MIT-gelicenseerd vlaggenschip staat, een echt resultaat is, en de reden dat 15 oktober een plek in de agenda verdient in plaats van een schouderophalen.

Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt