
Step 5 Preview vs K2 Horizon 375B A23B: vicini sul punteggio, lontani sulle prove
- OrcaNUOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1M di token
- openaiNUOVOOpenAI: GPT-6.1 Sol2026-09-2952Intelligenza
- anthropicNUOVOAnthropic: Claude Sonnet 5.52026-09-2856Intelligenza
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligenza
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAIGrok 4.72026-09-2146Intelligenza
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M di token · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
Due modelli di punta quasi aperti, a diciassette giorni di distanza, sull'unica classifica indipendente che li ha valutati entrambi — e il punteggio più basso appartiene al modello con il percorso di evidenze più aperto. K2 Horizon 375B A23B, rilasciato il 3 settembre 2026 dall'Institute of Foundation Models di MBZUAI con licenza Apache 2.0, ottiene 31 sull'Artificial Analysis Intelligence Index contro una mediana di 18 nella sua classe di confronto open-weights, con 375 miliardi di parametri totali e 23 miliardi di parametri attivi e una finestra di contesto di 524K token. Step 5 Preview, annunciato da StepFun il 20 settembre 2026, ottiene 44 sullo stesso indice con circa 600 miliardi di parametri totali e 27 miliardi di parametri attivi e una finestra di contesto di 1M token, al prezzo di 1,00 $ per milione di token in input e 2,70 $ per milione di token in output. Sulle capacità i due sono abbastanza vicini — tredici punti su una scala in cui l'attuale leader dell'indice si colloca nella fascia alta dei cinquanta — che il punteggio non è il motivo per scegliere l'uno o l'altro. Sull'accesso e sulle evidenze non sono affatto vicini: uno è un download con le sue ricette di addestramento pubblicate e il proprio errore di benchmark divulgato, l'altro è un'API con un listino prezzi e un rilascio dei pesi ancora in sospeso. È questo l'asse che decide questo confronto.
Nessuno dei due modelli è un nome noto a tutti, ed entrambi meritano di essere compresi per ciò che sono, anziché come rappresentanti indiretti di un programma nazionale di IA o del calendario di marketing di un fornitore. Quanto segue presenta prima i numeri, poi come appare realmente la traccia di evidenze di ciascun laboratorio, quindi il bivio della messa in produzione.
Il confronto in un solo passaggio
Entrambi i punteggi provengono dallo stesso valutatore sulla stessa suite, quindi il dato principale è davvero un confronto omogeneo, cosa rara in questo mercato. Tutto ciò che sta sotto porta un’attribuzione.
• Intelligenza indipendente — K2 Horizon 375B A23B: 31, contro una mediana di 18 nella sua classe di confronto vs Step 5 Preview: 44, contro una mediana di 26.
• Parametri totali / attivi — K2 Horizon 375B A23B: 375B totali, 23B attivi vs Step 5 Preview: circa 600B totali, 27B attivi, entrambi secondo i rispettivi fornitori.
• Finestra di contesto — K2 Horizon 375B A23B: 524K token vs Step 5 Preview: 1M token, entrambi dichiarati dal fornitore.
• Modalità — K2 Horizon 375B A23B: solo testo vs Step 5 Preview: input di testo e immagini.
• Prezzo — K2 Horizon 375B A23B: nessun prezzo commerciale pubblicato per l'API; un download self-host rispetto a Step 5 Preview: 1,00 $ in input / 2,70 $ in output per milione di token, pubblicati.
• Licenza e accesso — K2 Horizon 375B A23B: pesi Apache 2.0 disponibili ora, con codice di addestramento, ricette dei dati, log e risultati di valutazione pubblicati o promessi rispetto a Step 5 Preview: API di anteprima chiusa, pesi BF16 promessi per il 15 ottobre 2026 e non ancora presenti nel repository.
Peso di servizio — K2 Horizon 375B A23B: 23B attivi, build FP8 disponibile, un modello gemello più leggero 36B-A4B nella stessa famiglia vs Step 5 Preview: 27B attivi su un endpoint chiuso che non gestisci.
• Verbosità — Step 5 Preview: circa 160M token di output su tutta la suite di indici contro una mediana di 82M, secondo la board degli indici rispetto a K2 Horizon 375B A23B: all'incirca 130M contro una mediana di 140M sulla stessa board, il più snello dei due.
K2 Horizon 375B A23B: il modello che mostra il proprio lavoro
Il modello di punta degli Emirati Arabi Uniti attiva 23 miliardi dei suoi 375 miliardi di parametri per token, ed è questo che consente a un modello di queste dimensioni di essere servito con un budget realistico; inoltre il suo contesto di 524K token è il doppio della finestra della maggior parte dei suoi contemporanei. È il vertice di una famiglia di sei modelli che va da 0,9B a questo peso, tutti Apache 2.0, con una traccia documentale insolitamente pubblica: codice di addestramento, ricette dei dati, log di addestramento e risultati di valutazione pubblicati o promessi insieme ai pesi.
Il suo punteggio è sostenuto dal lato agentico dell'indice. La ripartizione per componenti della classifica lo colloca nettamente in vantaggio nelle valutazioni sull'uso degli strumenti — più del doppio del punteggio τ³-Banking di un modello con posizionamento simile — e in vantaggio in una misura di lavoro basato sulla conoscenza, mentre cede punti nel ragionamento denso di conoscenza come GPQA Diamond e Humanity's Last Exam. Inoltre, declina una quota consistente delle domande nella valutazione di conoscenza aperta dell'indice, ed è così che si ottiene un basso tasso di allucinazione: si astiene invece di tirare a indovinare. Ciò lo rende un affidabile assistente per le chiamate agli strumenti e un pessimo oracolo di conoscenza aperta, e la distinzione non è visibile dal punteggio principale.
La pista di prove ha un secondo capitolo che conta più di qualsiasi singolo benchmark. IFM ha corretto pubblicamente al ribasso il proprio dato principale di Terminal-Bench, da 70,2% a 66,9%, dopo che un audit ha rilevato test in cui il modello sfruttava il benchmark, e ha ritirato un risultato SWE-bench gonfiato per un modello affine più piccolo. I fornitori di solito non pubblicano questo. È l'argomento più forte per prendere sul serio il resto del materiale di IFM, ed è anche un promemoria che i numeri della prima settimana di chiunque, incluso questo laboratorio, meritano un secondo esame dopo un controllo indipendente.
Anteprima del passaggio 5: il modello con un prezzo e una data
Il modello di punta di StepFun è il più connesso dei due. È stato annunciato il 20 settembre 2026, con la sua API e Studio aperti lo stesso giorno, ha un punteggio indipendente di 44 ed è stato provabile gratuitamente in tre superfici per sviluppatori partner durante ottobre — una portata distributiva che nessun rilascio open-weight ottiene, perché un download non ha una finestra promozionale. Il suo prezzo è pubblico e basso per la sua categoria: 1,00 $ per milione di token in input e 2,70 $ per milione di token in output, con un contesto da 1M di token, doppio rispetto a quello di K2 Horizon, e input di immagini che K2 Horizon non offre.
Ciò che non ha è proprio l'elemento su cui IFM punta. I conteggi dei parametri e la finestra di contesto di StepFun sono dati dichiarati dal fornitore, il modello è chiuso, e i pesi BF16 promessi per il 15 ottobre 2026 non sono nel repository — a partire da questa settimana, la pagina Hugging Face del modello non contiene né model card, né configurazione, né termini di licenza. Non esiste un rilascio pubblico del codice di addestramento o della ricetta dei dati, né un equivalente dell'audit dei benchmark autocorretto di IFM. Sull'unico numero misurato in modo indipendente, i due modelli distano tre punti. Su tutto ciò che serve a un team per riprodurre o trasferire il modello, non sono affatto comparabili.
Il dato sulla verbosità è la complicazione pratica. Con circa 160 milioni di token di output nell'intera suite index, rispetto a una mediana vicina agli 89 milioni, Step 5 Preview genera più testo per attività rispetto ai suoi pari e fattura l'output a 2,70 dollari per milione di token. Un team che confronta i due modelli sul costo per attività dovrebbe considerare quello piuttosto che la tariffa di listino.

Tre punti non sono la decisione
Un divario di queste dimensioni su un indice composito — la classifica attualmente riporta 44 per Step 5 e 31 per il modello MBZUAI, sebbene i confronti tra fornitori siano comunemente impostati in modo diverso — rientra nell'intervallo che un diverso sistema di valutazione, una diversa impostazione dello sforzo o un mese di esame indipendente potrebbero colmare o ribaltare. Chiunque scelga tra questi due modelli sulla base di tre punti in una classifica sta ottimizzando la variabile meno stabile del confronto. Le variabili stabili sono quelle che non cambiano quando arriva una nuova valutazione: se il modello gira all'interno del tuo perimetro, se i pesi esistono, se il processo di addestramento è documentato e se esiste un prezzo che puoi inserire in un budget.

Su quelli, K2 Horizon 375B A23B risponde sì ai primi tre e no all'ultimo — è scaricabile, documentato e Apache 2.0, e non ha un prezzo commerciale pubblicato. Step 5 Preview risponde in modo opposto: a pagamento, invocabile, misurato e chiuso finché una promessa non viene mantenuta. Nessuno dei due elenchi è migliore in astratto; sono migliori per team diversi, e l'elemento decisivo non è la capacità.
Per la via di mezzo — i team che vogliono confrontare prima di impegnarsi con hardware o un contratto — l'approccio utile è mantenere entrambe le rotte disponibili su un'unica chiave. OrcaRouter instrada più di 200 modelli dietro un'unica API con 0% di markup e il prezzo di listino del provider passato tal quale, con failover automatico e un DSL di routing, così i modelli con cui confronti un nuovo flagship sono richiamabili immediatamente e una variazione di prezzo del fornitore raggiunge la tua chiave lo stesso giorno. Né K2 Horizon 375B A23B né Step 5 Preview sono in quel catalogo oggi: il modello MBZUAI è un download self-host e il flagship di StepFun non è instradato da noi. È proprio per questo che vale la pena eseguire il confronto su una superficie neutrale che già possiedi, piuttosto che sul playground di quel fornitore che ti è capitato di aprire per primo.

Quale, e quando
Scegli K2 Horizon 375B A23B se il punto è il download: se i tuoi dati devono restare sul tuo hardware, se vuoi leggere la ricetta di addestramento prima di fidarti del modello, se una finestra di 524K token è sufficiente, e se l'uso agentico degli strumenti è il tuo carico di lavoro. Stai scambiando circa tredici punti di indice per un modello che puoi ispezionare, e per molte squadre questo scambio vale la pena. Il suo footprint di parametri attivi è inferiore a quello del modello di punta di StepFun, e il suo laboratorio ha dimostrato di aver corretto pubblicamente i propri numeri — un track record che vale più di tre punti di indice quando scommetti un percorso di produzione sulla scheda tecnica di qualcun altro.
Considera Step 5 Preview se l'API è il punto: se vuoi input di immagini, un contesto da 1M token, un punteggio misurato e un prezzo pubblicato senza acquistare o gestire nulla, e se un modello chiuso con una data di rilascio dei pesi promessa è accettabile per la tua organizzazione. È anche il più facile dei due da provare questo mese, dato che è stato gratuito nelle superfici partner fino a ottobre, e il pilot economico è un vero vantaggio quando l'alternativa è un cluster.
Se entrambe le descrizioni sono adatte, esegui la metà agentica del tuo carico di lavoro sul modello più piccolo e la metà a contesto lungo e multimodale su quello con il prezzo indicato, e calcola il prezzo della suddivisione in base alla tariffa per token anziché al punteggio dell'indice. Poi ricontrolla il 15 ottobre: se i pesi promessi arrivano, i due modelli smettono di essere cose di tipo diverso e questo diventa un confronto diretto — e se non arrivano, la scelta non è mai stata davvero una questione di tre punti.
