Una card del titolo generata che recita 'Intern-Decision-2B vs Qwen 3.8', sottotitolata 'Un backbone, due lavori molto diversi', con i badge '2.2B scorer, 33 ms' e '2.4T flagship, contesto 1M', con il logo OrcaRouter inserito in compositing nell'angolo.
Guides & Insights

Intern-Decision-2B vs Qwen 3.8: Un backbone, due lavori molto diversi

Autore

Magnus Corvin

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Apri la configurazione di internlm/Intern-Decision-2B e la configurazione di Qwen/Qwen3.5-2B affiancate e quasi nulla differisce. Stessi 24 layer, stessa dimensione nascosta di 2.048, stessi 8 head di query contro 2 head key-value, stessa dimensione di head di 256, stesso tetto di embedding di 262.144 posizioni, stesso vocabolario di 248.320 token, stesso schema ripetuto di tre layer di attenzione lineare ogni un layer di attenzione completa. Intern-Decision-2B non è una nuova architettura. È quel backbone con la sua capacità di generare testo rimossa e la sua confidenza calibrata — e quella singola sottrazione è ciò che rende il confronto con Qwen3.8-Max, il flagship da 2,4 trilioni di parametri a cui si riferisce l'intero nome della famiglia "Qwen 3.8" all'estremità superiore, più prezioso di un conto alla rovescia dei parametri.

I due non sono concorrenti e il confronto non è una gara. Intern-Decision-2B è un fine-tune da 2.213.241.664 parametri di Qwen3.5-2B, caricato su Hugging Face alle 05:36 UTC del 26 settembre 2026 insieme a tre fratelli non annunciati, e non emette token: prende uno stato e domande tipizzate, esegue un singolo forward pass causale, legge i logit in posizioni segnaposto fisse e restituisce una distribuzione calibrata per campo. Qwen3.8-Max è il flagship ospitato di Alibaba, un modello sparse mixture-of-experts con circa 95 miliardi di parametri attivi per token, una finestra di contesto multimodale da 1 milione di token e un prezzo di listino di $2,00 per milione di token in input e $6,00 per milione in output. Uno è un componente. L'altro è un servizio. La domanda utile è dove debba trovarsi la giuntura tra loro in una pipeline che stai già pagando.

La sottrazione, precisamente

Vale la pena dire esattamente cosa ha cambiato il decision tuning, perché chiarisce ciò che il modello di base già portava con sé.

Il compito è denominato nel repository come modellazione del linguaggio mascherata autoregressiva. L'input dell'assistente contiene uno scheletro JSON completo con un token <decision> per campo; i simboli delle risposte ground-truth compaiono solo nelle etichette, mai nell'input. L'addestramento utilizza il consueto allineamento causale al token successivo, in cui il logit immediatamente prima di un marcatore predice la risposta di quel campo, e tutti i campi condividono un'unica passata in avanti. All'inferenza i logit vengono limitati ai simboli di risposta legali da un singolo token — A–Z, a–z, 0–9, da cui deriva il tetto di 62 opzioni — poi passati per softmax e ricondotti alle vostre etichette.

Il meccanismo del token successivo del modello di base è quindi intatto e non modificato. Ciò che è stato introdotto con l'addestramento è una preferenza a occupare una delle poche posizioni di risposta invece di continuare una frase, più una temperatura specifica del checkpoint di 2,100509348278, stimata mediante log-verosimiglianza negativa su 1.728 casi di calibrazione designati, con 1.693 tenuti da parte. La scheda non lascia dubbi sul fatto che la generazione sia esclusa: l'API "esegue una valutazione strutturata dei candidati. Non chiama generate() né campiona testo in forma libera."

Il repository registra anche ciò che il tuning non ha toccato: "esegue il fine-tuning del backbone linguistico di Qwen3.5 mentre congela la torre visiva e il proiettore". Lo shard visivo da 612.517.440 byte sul 2B ha lo stesso numero di byte che sul checkpoint decisionale 4B, il che è coerente con componenti ereditati anziché addestrati. Il percorso delle immagini funziona; semplicemente non è ciò su cui il passaggio decisionale ha speso il suo budget.

A screenshot of the Hugging Face model card for internlm/Intern-Decision-2B, showing the internlm organisation, the image-text-to-text, Transformers, Safetensors, qwen3_5, decision-making and multimodal tags, the Demo, Model Weights and GitHub links, the opening description of the model as a multimodal structured decision model fine-tuned from Qwen3.5-2B, and the start of the five-step 'How inference works' list.

Quello che 2,2 miliardi di parametri non sanno fare, e quello che invece fanno 2,4 trilioni

Tutto si divide lungo un unico asse: se la tua risposta esiste già come elenco.

Intern-Decision-2B risponde a un insieme chiuso. Da una a sedici domande, fino a 62 opzioni ciascuna, fino a otto immagini, il tutto all'interno di un budget di 8.192 token che il motore rifiuta anziché troncare. Restituite come probabilità. A 33,28 ms di media per richiesta su una singola RTX 4090 con un P95 di 33,55 ms, e nulla fatturato per chiamata perché non c'è output da fatturare.

Qwen3.8-Max scrive. Un contesto di 1 milione di token, input testuale, di immagini e video, ragionamento con una modalità di pensiero, chiamata nativa degli strumenti, output strutturati, fino a 131.000 token di output sulla build datata 0902. Può anche, in linea di principio, prendere la stessa decisione di routing che prende Intern-Decision-2B — puoi sollecitarlo a scegliere tra opzioni e restituire JSON. Quando lo fai, tre cose vanno storte. Paghi per i token che spende per decidere. Ottieni una stringa la cui analisi può riuscire o meno. E il numero dentro quella stringa è quello che ha prodotto il sampler, non un softmax a cui puoi applicare una soglia di 0,8 e su cui puoi agire.

Entrambe le versioni sono vere e nessuna delle due annulla l'altra. Il modello di punta da 2,4 trilioni di parametri esiste perché la maggior parte dei problemi non è un insieme chiuso. Lo scorer da 2,2 miliardi esiste perché il sottoinsieme che lo è merita uno strumento più economico.

Tabellone

A two-column comparison scoreboard titled 'Intern-Decision-2B vs Qwen 3.8'. The left column reads: Parameters 2,213,241,664 in BF16; Context 8,192 tokens, refused above; Output probabilities and an argmax; Modality text plus up to 8 images; Cost no per-call charge, you own the GPU; Published evidence vendor table, unreproduced. The right column reads: Parameters about 2.4T total, 95B active; Context 1,000,000 tokens; Output generated text with a reasoning trace; Modality text, image and video; Cost $2.00 in / $6.00 out per million; Published evidence AA Index 45.4, rank 15 of 145. A footer notes the Intern-Decision-2B figures are vendor-reported and unreproduced while the Qwen3.8-Max figures are per Artificial Analysis and the vendor's public rate card.

• Parametri — Intern-Decision-2B 2.213.241.664 in BF16 più una torre visiva e un proiettore, circa 4,46 GB su disco; Qwen3.8-Max all'incirca 2,4 trilioni in totale con circa 95 miliardi attivi per token, servito e non scaricato.

• Contesto — 8.192 token, rifiutati al di sopra; 1.000.000 di token con 131.000 di output massimo sulla build 0902.

• Output — probabilità calibrate e un argmax, nessun testo generato; testo generato che include una traccia di ragionamento.

• Modalità in ingresso — testo più fino a otto immagini; testo, immagine e video.

• Costo — nessun addebito per chiamata e la GPU è di tua proprietà; 2,00 $ per milione di token di input, 6,00 $ per milione di token di output, con letture dalla cache a 0,25 $ e scritture nella cache a 2,50 $.

• Evidenza pubblicata — una tabella del fornitore a sette suite con una media di 84,68, Brier 0,437 ed ECE 0,100 su 10.751 righe di test, non riprodotta da nessuno al di fuori di InternLM, su un checkpoint con un like e zero download; un Artificial Analysis Intelligence Index di 45,4 al 15° posto su 145 e un AA Coding index di 76,2 al 9° posto su 138, entrambi misurati in modo indipendente.

• Latenza — 33,28 ms di media per richiesta su una RTX 4090, che diminuisce con l'aggiunta del batching; 2,655 secondi di P50 al primo token come riportato dal catalogo, che aumentano con il carico.

Le righe di evidenza non sono equivalenti e non dovrebbero essere stampate come se lo fossero. Il modello di punta di Alibaba ha alle spalle un punteggio di indice indipendente. Il checkpoint di InternLM ha una tabella prodotta dai suoi stessi autori, e la cifra di calibrazione in particolare va letta come un'intenzione ben documentata finché non incontra i dati di qualcun altro — tanto più qui, perché questa particolare dimensione registra il peggior errore di calibrazione atteso dei tre rilasciati da InternLM, 0,100 contro 0,066 per il modello grande la metà e 0,065 per quello quasi il doppio.

La cucitura, e come eseguirla

La pipeline che ha senso non è una scelta tra questi due, ma una separazione: lo scorer gestisce le decisioni enumerate, e un modello frontier gestisce tutto ciò la cui risposta non è un elenco. Un triage del supporto che instrada verso uno di sei team e valuta l'urgenza su una scala a tre punti non ha bisogno di 95 miliardi di parametri attivi; ha bisogno di una probabilità e di una soglia. Il percorso di escalation che alla fine scrive una risposta al cliente sì.

Questa suddivisione ha una forma operativa. Intern-Decision-2B non è su OrcaRouter — la nostra pagina del modello per esso restituisce 404 e non esiste una route ospitata da nessuna parte che siamo riusciti a trovare — quindi viene eseguito sul tuo hardware, il che significa che è un componente che gestisci e monitori. Qwen3.8-Max è una route: una chiave per oltre 200 modelli, il prezzo di listino del provider viene trasferito senza alcun ricarico, il che significa che una variazione di prezzo del fornitore sul modello di punta arriva sulla tua fattura lo stesso giorno in cui viene applicata. Mettere il segmento ospitato della pipeline dietro quell'unica superficie è ciò che mantiene economico il segmento più economico: lo scorer tiene basso il volume delle chiamate, e il modello di frontiera viene raggiunto solo per i casi che ne hanno davvero bisogno.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen breadcrumb, the model name Qwen3.8 Max, the routing line reading qwen/qwen3.8-max with text, image and video input and text output, the Vision, Tools, JSON and Reasoning capability badges, a release line reading by Qwen - 2026-08-03, a P50 time to first token of 2.655 seconds, on-page navigation for Code samples, Pricing, Performance, Public benchmarks, Community buzz, How it compares and FAQ, and the opening of the vendor description naming it Alibaba's newest flagship model.

Se stai ancora valutando quale sistema di scoring debba occupare quello slot — questo non ha alcuna valutazione indipendente e la sua calibrazione è la più debole della sua stessa famiglia — failover automatico tra provider è il modo per provarlo in un percorso che ha già un'alternativa funzionante alle spalle, invece di sostituire del tutto quell'alternativa.

Il verdetto onesto

Se il tuo problema è una decisione su un insieme di risposte che puoi enumerare, e lo stato rientra in ottomila token, Intern-Decision-2B lo farà in trentatré millisecondi a costo zero per chiamata, e nessun modello di frontiera lo batterà su quell'asse, non importa quanti parametri affitti. Esegui la tua calibrazione su di esso prima di affidarti alla confidenza che riporta.

Se il tuo problema è qualsiasi altra cosa — ragionamento, contesto lungo, uso di strumenti, video, un documento da un milione di token, o semplicemente una risposta che non è ancora stata scritta — Qwen3.8-Max non è semplicemente migliore. È l'unico dei due che può svolgere il compito in assoluto.

E se non sai ancora dire quale dei due hai, la risposta è probabilmente che li hai entrambi, nella stessa pipeline, che è l'architettura che i conteggi dei parametri ti stavano dicendo in silenzio fin dall'inizio.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno