Generata scheda di confronto hero intitolata "Step 5 Preview vs A.X-K2" con il sottotitolo "Un modello API da 600B contro un download da 690B". La colonna sinistra "Step 5 Preview" riporta: AA Index 44, mediana 26; StepFun, annunciato il 20 settembre 2026; circa 600B totali / 27B attivi; contesto 1M token; 1,00 $ input / 2,70 $ output per 1M; API, a pagamento. La colonna destra "A.X-K2" riporta: AA Index 21, mediana 18; SK Telecom, rilasciato il 12 agosto 2026; circa 690B totali / 33B attivi; contesto 262K token; nessun prezzo API pubblicato; download Apache-2.0. Una nota a piè di pagina recita: "Dati dell'indice secondo Artificial Analysis; specifiche di A.X-K2 secondo SK Telecom."
Guides & Insights

Step 5 Preview vs A.X-K2: un modello API da 600B contro un download da 690B

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Step 5 Preview e A.X-K2 sono le due metà di una decisione che continua a ripresentarsi questo autunno: noleggiare un modello di classe frontier tramite API, oppure portarsi a casa un flagship open-weight e farlo girare da sé. Step 5 Preview di StepFun è il noleggio — annunciato il 20 settembre 2026, chiamabile lo stesso giorno a 1,00 $ per milione di token in input e 2,70 $ per milione di token in output, circa 600 miliardi di parametri totali con 27 miliardi attivi, un contesto da 1M di token e un punteggio di 44 all'Artificial Analysis Intelligence Index, calcolato in modo indipendente. A.X-K2 di SK Telecom è il download — rilasciato il 12 agosto 2026 con licenza Apache 2.0, da circa 688 a 692 miliardi di parametri totali con 33 miliardi attivi, un contesto da 262K token e un punteggio di 21 all'indice. Uno è più grande, uno ha un prezzo, e quello che ha un prezzo è quello che ottiene un punteggio molto più alto. Questa inversione è l'intero confronto, e vale la pena capirla prima di schierarsi per principio.

La classificazione abituale di questi due modelli è nazionale: il fiore all'occhiello dell'AI sovrana della Corea contro uno dei laboratori più aggressivi della Cina. Questa classificazione non è utile per una decisione di deployment. Ciò che è utile è che A.X-K2 è l'unico dei due che puoi tenere, e Step 5 Preview è l'unico dei due che puoi acquistare a token. Tutto il resto discende da questa divisione.

I numeri, ancorati alle loro fonti

La sola misurazione veramente omogenea è l'Intelligence Index, ed è indipendente su entrambi i fronti: 44 per Step 5 Preview contro una mediana di 26 tra i modelli comparabili, e 21 per A.X-K2 contro una mediana di 18 nella sua classe di confronto open-weights, entrambi misurati dalla stessa terza parte sulla stessa scala. Letti al momento della stesura, questi sono i valori di oggi: i punteggi su questo indice cambiano quando il valutatore ricalibra, e una lettura precedente della stessa pagina di A.X-K2 mostrava un numero più alto. Tutto il resto in questo confronto arriva con un'attribuzione che bisogna portarsi dietro.

• Intelligenza indipendente — Anteprima Step 5: 44 sull'Artificial Analysis Intelligence Index vs A.X-K2: 21 sullo stesso indice, misurato in modo indipendente.

• Parametri totali / attivi — Step 5 Preview: circa 600B totali, 27B attivi secondo StepFun vs A.X-K2: circa 688–692B totali, 33B attivi secondo i materiali di SK Telecom e la scheda indice.

• Finestra di contesto — Step 5 Preview: 1M token per StepFun vs A.X-K2: 262K token.

• Modalità — Step 5 Preview accetta testo e immagini; A.X-K2 è solo testo.

• Prezzo — Step 5 Preview: 1,00 $ per milione di token in input e 2,70 $ per milione in output, pubblicati dal fornitore, contro A.X-K2: nessun prezzo API commerciale pubblicato.

• Dove viene eseguito — Step 5 Preview: API e Studio proprietari di StepFun, più superfici partner durante le finestre promozionali vs A.X-K2: il tuo hardware, da un download.

• Rilascio — Step 5 Preview annunciato il 20 settembre 2026 contro A.X-K2 rilasciato il 12 agosto 2026.

• Licenza — Step 5 Preview: anteprima chiusa con pesi BF16 promessi per il 15 ottobre 2026 vs A.X-K2: Apache 2.0.

A.X-K2: lo strumento più pesante, con l'evidenza più tenue

SK Telecom ha creato A.X-K2 come successore di A.X K1, e l'architettura è mirata dritta al costo del contesto lungo: una struttura mixture-of-experts con 256 esperti e 8 attivi per token, addestrata nativamente in FP8, con un meccanismo che l'azienda chiama Sparse Gated Attention. Si tratta di un lavoro di ingegneria serio, ed è il motivo per cui un modello con quasi 700 miliardi di parametri totali può essere servito in assoluto da un'organizzazione che non è un hyperscaler.

Ciò che non ha è una conferma indipendente. SK Telecom riporta un guadagno medio di 32,2 punti su quattordici benchmark rispetto ad A.X K1, un balzo di circa 83,9 punti nelle valutazioni su contesto lungo e agenti, 97,1 su AIME 2026, 80,5 sul benchmark di conoscenza coreana KMMLU-Pro e 91,6 su CLIcK, e afferma di eguagliare o superare le recenti release di Qwen e DeepSeek in matematica e lavori in lingua coreana. Ognuno di questi è un dato del fornitore stesso. Il punteggio indipendente — 21 sull'Intelligence Index — supera la mediana di 18 della sua classe di confronto open-weights ma si colloca ventitré punti sotto Step 5 Preview, e l'insieme di punti di forza di A.X-K2 è proprio dove quell'indice non pesa molto: le sue nove valutazioni sono in gran parte in inglese, incentrate su ragionamento e agenti, e nemmeno una di esse è un benchmark in lingua coreana.

Niente di tutto ciò rende A.X-K2 un modello peggiore di quanto dica il suo punteggio. Rende il suo punteggio un limite inferiore a ciò che fa per un carico di lavoro in lingua coreana o a forte impronta matematica, stando a quanto dichiara il fornitore, finché un laboratorio indipendente non pubblica quelle valutazioni. Il lato dei costi è più concreto: un deployment di riferimento di questa classe di peso richiede quattro GPU di classe B300 e circa 656 GiB in FP8. Questo è il prezzo del download e, a differenza di una bolletta a token, non si riduce quando l'esperimento finisce.

Anteprima del Passo 5: quella che puoi provare oggi via HTTP

Il vantaggio di Step 5 Preview non è che sia più grande o più aperto — non è né l'uno né l'altro — ma che abbia un prezzo, sia invocabile e valutato in modo indipendente, e che sia stato possibile provarlo gratuitamente in tre superfici partner durante ottobre. Per un team che valuta invece di fare self-hosting, quella combinazione vale più di una licenza Apache 2.0, perché trasforma una decisione hardware in una chiamata API. Il journal di StepFun sul modello è però scarso nei punti abituali: la coppia di parametri 600B/27B e il contesto da 1M token sono numeri dello stesso fornitore, i pesi promessi non sono stati rilasciati, e il dato più utile della classifica indipendente al riguardo non è probabilmente il punteggio di 44, ma la verbosità — circa 160 milioni di token di output generati nella suite di task dell'indice, rispetto a una mediana vicina a 82 milioni, e A.X-K2 è ancora più distante, a circa 230 milioni contro una mediana di 140 milioni. Su un modello che addebita $2,70 per milione di token di output, quel divario è la differenza tra una valutazione economica e un'abitudine produttiva costosa.

Perché il modello più grande ottiene un punteggio più basso

Il numero di parametri non è un punteggio, e questo accostamento lo dimostra chiaramente. I ~300 miliardi di parametri totali in più di A.X-K2 garantiscono una densità che si manifesta nei punti in cui la sua stessa suite di valutazione premia — profondità della lingua coreana, matematica, conoscenza ampia — mentre l'indice su cui compaiono entrambi i modelli è per lo più inglese, ad alto contenuto di ragionamento e incentrato sugli agenti, dove gli sviluppatori di Step 5 Preview sembrano aver messo a punto deliberatamente. Il design con 27B attivi rende inoltre il modello StepFun marcatamente più economico da servire a qualsiasi livello di throughput, ed è per questo che esiste persino un prezzo per l'hosting.

C'è una seconda lettura, meno lusinghiera, che va nella direzione opposta. A.X-K2 è disponibile dal 12 agosto e Step 5 Preview dal 20 settembre; il modello più recente ha alle spalle meno settimane di scrutinio indipendente, e il suo 44 potrebbe ancora cambiare man mano che arrivano nuove valutazioni. Entrambi i numeri sono provvisori nello stesso senso in cui lo sono i punteggi del primo trimestre di qualsiasi modello. La differenza è che il punteggio provvisorio di A.X-K2 è la migliore prova a disposizione di chiunque al di fuori di SK Telecom, mentre il punteggio provvisorio di Step 5 Preview poggia su una scheda tecnica del fornitore che una terza parte ha almeno in parte riprodotto.

L'economia delle porzioni, ovvero dove risiede effettivamente la decisione.

Se puoi chiamarlo, paghi 1,00 $ in input e 2,70 $ in output per milione di token e hai finito — niente approvvigionamento, niente GPU, niente gestione operativa. Se lo scarichi, paghi l'hardware, l'energia, il lavoro di quantizzazione e l'infrastruttura di valutazione, e puoi tenere i tuoi prompt e i tuoi dati all'interno del tuo perimetro. A.X-K2 con 33B attivi non è un modello da laptop; la configurazione di riferimento è un piccolo cluster. L'anteprima chiusa di Step 5 Preview non offre alcun perimetro fino al 15 ottobre, quando i pesi BF16 sono promessi — e finché quei file non compaiono nel repository, quella data è un impegno più che un'opzione.

Generated two-column scoreboard card titled 'Step 5 Preview vs A.X-K2 - the scoreboard'. The left column gives Step 5 Preview an independent index of 44 with a class median of 26, about 600B total and 27B active parameters, a 1M-token context, text and image input, $1.00 / $2.70 per 1M tokens, vendor API access as a closed preview, and a September 20 2026 release date. The right column gives A.X-K2 an independent index of 21 with a class median of 18, about 688-692B total and 33B active parameters, a 262K-token context, text-only input, no published price, Apache-2.0 download access, and an August 12 2026 release date. A footer reads 'Index figures per Artificial Analysis; vendor specifications per each lab, unreproduced.'

Questo è il punto in cui un livello di routing si guadagna il suo posto invece di limitarsi a farsi pubblicità. La maggior parte dei team non vuole rispondere a «noleggiare o acquistare» una volta per tutte; vuole sapere come si comporta un modello sul proprio traffico prima di comprarne l'hardware, e poi mantenere la possibilità di spostarsi se la risposta cambia. OrcaRouter non instrada Step 5 Preview e non instrada A.X-K2 — entrambi sono fuori dal nostro catalogo oggi. Quello che fa è mettere più di 200 modelli dietro un'unica chiave API e un'unica fattura a markup 0%, con il prezzo di listino del provider passato così com'è, così l'insieme di confronto con cui provi l'uno o l'altro nuovo modello di punta è quello che puoi chiamare oggi pomeriggio, e il failover automatico mantiene attivo un percorso di produzione mentre stai ancora decidendo.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.Screenshot of the Artificial Analysis model page for A.X-K2, headed 'A.X-K2 Intelligence, Performance & Price Analysis', showing SK Telecom as the creator, an open-weights release date of August 2026, the line 'A.X-K2 scores 21 on the Artificial Analysis Intelligence Index, placing it above average among comparable models (median: 18)', a 262k-token context window, and the note that it generated 230M output tokens against a median of 140M.

Quale scegliere?

Scegli Step 5 Preview se il tuo carico di lavoro è ragionamento generale, coding agentico o qualsiasi cosa con contesto lungo, se vuoi pagare per token invece di acquistare silicio, e se l'input di immagini è importante — vince sul punteggio indipendente, sulla lunghezza del contesto, sulla latenza alla prima risposta e sulla varietà di modalità, ed è l'unico dei due che puoi mettere dietro a un progetto pilota senza procurement questo mese.

Scegli A.X-K2 se la tua lingua è il coreano, se il tuo carico di lavoro è denso di matematica, o se i dati semplicemente non possono uscire dalla tua infrastruttura — e fallo sapendo che stai accettando sulla fiducia la tabella di benchmark di SK Telecom, che il conto dell'hardware è reale, e che il punteggio indipendente a cui puoi fare riferimento è inferiore di ventitré punti. Se questo compromesso ti sembra sbagliato, la risposta onesta non è scegliere l'altro flagship; è testare entrambi sul tuo traffico, che è l'unico confronto che i numeri di nessuno dei due fornitori può sostituire.

Nessuno dei due modelli è il default sicuro. Step 5 Preview è l'opzione economica, misurata e invocabile, con i pesi ancora in arrivo; A.X-K2 è l'opzione più pesante, sovrana, con le prove ancora dovute. Scegli il vincolo che vincola davvero il tuo team — il perimetro o la bolletta — e lascia andare l'altro.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno