Una card del titolo generata, intitolata 'TwIL-LM3-Pro vs Qwen 3.8', con sottotitolo 'Il confronto che la card ha effettivamente eseguito', con due card arrotondate che recitano 'TwIL-LM3-Pro - 3,66B, locale, non commerciale' e 'Qwen3.8-Max - ospitato, contesto 1M, $2 / $6'. Una riga a piè di pagina recita 'webAI misurato rispetto a Qwen3-8B, non a Qwen3.8-Max.' Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: un accostamento improprio, e il confronto che conta davvero

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

TwIL-LM3-Pro e Qwen3.8-Max non appartengono alla stessa pagina, e il motivo non è che uno sia migliore. È che la tesi pubblicata a sostegno del modello di logica formale da 3,66B di webAI si basa su un confronto con un modello Qwen — e il modello Qwen in questione non è quello che il titolo nomina. Le tabelle Track A e Track B di webAI misurano TwIL-LM3-Pro contro Qwen3-8B, un modello dense da 8B a pesi aperti di una generazione precedente, e non dedicano alcuna attenzione a Qwen3.8-Max: non perché TwIL-LM3-Pro vincerebbe, ma perché Qwen3.8-Max è il sistema hosted di punta di Alibaba, un modello sparse mixture-of-experts dichiarato a 2,4 trilioni di parametri con circa 95 miliardi attivi per token, una finestra di contesto multimodale da un milione di token e un listino di 2,00 $ per milione di token in input e 6,00 $ per milione in output. Mettere accanto a tutto questo un GGUF da 2,09 GiB per laptop è un errore di categoria travestito da pagina di confronto.

Quindi questo pezzo fa due cose. Corregge il confronto che i risultati di ricerca sbagliano, e poi risponde alla versione della domanda che un lettore probabilmente ha davvero: dato che un modello di frontiera è a una chiamata API di distanza e uno specialista di logica formale gira sulla tua macchina, quando ciascuno si guadagna il proprio posto?

Il modello che la scheda ha effettivamente misurato

Il confronto rilevante è con Qwen3-8B, e il riassunto che webAI stessa ne dà è più modesto di quanto suggeriscano i resoconti di seconda mano. Il macro gate in-domain di TwIL-LM3-Pro è 0,5539 contro lo 0,5336 di Qwen3-8B, e la model card contiene la frase che una pagina di marketing avrebbe rimosso: il vantaggio sul gate è 0,020, «più piccolo del rumore di campionamento a n = 200 per lane — quindi quel dato va letto come parità, non come una vittoria».

Dove il confronto non è un lancio di moneta: strict-7, 0,2879 contro 0,2093, una riga che non utilizza alcuna corrispondenza approssimativa da nessuna parte e quindi non può essere prodotta dalla formattazione. Scelta multipla strict, 0,4100 contro 0,0000. Induzione di regole, 0,4195 contro 0,3680. E il rapporto dei parametri — 3,66B contro circa 8B — che è l'intera affermazione "meno della metà della dimensione".

Sulla suite di hold-out, webAI è ancora più schietto: «TwIL-LM3-Pro non è in testa». La media macro sui dieci dataset è 0,7901, in linea con la sua stessa base Granite e dietro il 0,8493 di Qwen3-8B. Un piccolo specialista che pareggia con un modello generalista grande il doppio sulla logica formale e perde contro di esso sulla capacità generale è il profilo atteso, e riportarlo in questo modo è ciò che rende credibile il valore strict-7.

Cos'è davvero Qwen3.8-Max

Qwen3.8-Max non è un'iterazione di Qwen3-8B. È il tier premium di Alibaba e sulla pagina del catalogo OrcaRouter appare come `qwen/qwen3.8-max` con una data di rilascio del 3 agosto 2026, una finestra di contesto di un milione di token, input testuale, immagini e video, output testuale e pieno supporto per la modalità di pensiero, il function calling, gli strumenti integrati e gli output strutturati. È servito attraverso dashboard compatibili con OpenAI, compatibili con Anthropic e native in cinque regioni, e il pensiero si attiva o disattiva con il parametro `enable_thinking`. La tariffa è di $2,00 per milione di token in input e $6,00 per milione in output.

Uno snapshot datato, `qwen/qwen3.8-max-0902`, è stato pubblicato il 2 settembre 2026 con le stesse capacità e lo stesso prezzo, pubblicato appositamente affinché il comportamento possa essere fissato per esecuzioni riproducibili. Se stai sviluppando su Qwen3.8-Max per qualcosa di lunga durata, quell'identificatore di snapshot è quello da inserire nella configurazione anziché l'alias mobile.

Nota ciò che è assente in quella descrizione: un conteggio dei parametri che puoi scaricare, un file di licenza e qualsiasi percorso per eseguirlo da solo. Qwen3.8-Max è un prodotto in hosting. La copertura giornalistica al lancio riportava pesi aperti promessi per la settimana successiva, e l'impostazione di techsy — "2.4T parametri, 1M di contesto, ancora nessun peso" — è lo stato che un lettore dovrebbe verificare anziché dare per scontato, perché una promessa riportata al lancio non è un checkpoint pubblicato.

Quattro dimensioni, e nessuna di esse è vicina

• Parametri — TwIL-LM3-Pro 3,66B denso, tutti attivi rispetto a Qwen3.8-Max, riportato a 2,4T totali in un'architettura sparse mixture-of-experts con circa 95B attivi per token. Tre ordini di grandezza sul totale, due sugli attivi.

• Dove viene eseguito — TwIL-LM3-Pro si scarica come bf16 a 6,82 GiB oppure come GGUF Q4_K_M da 2,09 GiB per CPU o 4 GB di VRAM, a differenza di Qwen3.8-Max, che esiste solo come endpoint ospitato.

• Contesto — TwIL-LM3-Pro 131.072 token, ereditato dalla sua base Granite e mai validato oltre 8.192 nella propria valutazione rispetto a Qwen3.8-Max a 1.000.000 di token.

• Modalità — testo in input, testo in output vs testo, immagine e video in input, testo in output.

• Licenza — webAI Non-Commercial License ver. 1.0, con un accordo separato richiesto per l'uso che genera ricavi, a differenza di un'API commerciale ospitata senza pesi da concedere in licenza.

• Costo — TwIL-LM3-Pro: nessun costo per token e nessun endpoint ospitato, contro i $2.00 per milione di token di input e $6.00 per milione di output di Qwen3.8-Max, con una tariffa per input in cache di circa $0.25 per milione.

Un modello da 3.66B è economico perché è piccolo, ed è piccolo perché fa una sola cosa. Qwen3.8-Max è costoso perché è generalista ed è ospitato. Nessuna delle due tariffe è un verdetto.

La domanda dietro la domanda

Togli di mezzo la confusione dei nomi e resta una domanda ingegneristica, ed è una buona domanda: se un modello ospitato all'avanguardia può ragionare di logica formale, perché mai eseguire uno specialista ristretto?

Tre ragioni reggono. La prima è la licenza e la rete: un gruppo di ricerca non commerciale, un ambiente air-gapped o una passata di etichettatura batch che deve girare su un laptop senza connettività non può chiamare un endpoint ospitato, e un GGUF da 2,09 GiB risponde direttamente a questo vincolo. La seconda è la struttura dei costi in funzione del volume: un lavoro di etichettatura di logica formale su un milione di input brevi paga per token su un modello frontier ospitato e non paga nulla se non il tempo di esecuzione su uno locale. La terza è la forma dell'output: TwIL-LM3-Pro è stato messo a punto per emettere strutture verificabili dalla macchina anziché prosa, e per etichette di entailment e parse semantici questa è una pipeline più snella che fare prompting a un modello generale e analizzarne la risposta.

Per contro, il caso di Qwen3.8-Max è semplice. Vede immagini e video, gestisce un milione di token, gestisce strumenti e output strutturato tramite un'API documentata, e ha alle spalle benchmark pubblicati e valutazioni indipendenti. Nulla di uno specialista di nicchia minaccia questo; i due rispondono a insiemi di vincoli diversi.

Lo stack che usa entrambi

Il pattern che sopravvive al contatto con una pipeline reale è a due livelli, e non è esotico. Un modello di frontiera ospitato legge l'input disordinato — una pagina di libro di testo scansionata, una sorgente a modalità mista, una specifica lunga — e lo trasforma in testo strutturato pulito. Quel testo va a un modello locale di logica formale il cui unico compito è emettere un'etichetta, un parse o una critica Lean su hardware che possiedi. Il verdetto sul fatto che quel secondo livello valga il suo costo di manutenzione è il confronto in stile strict-7, non il gate, perché uno specialista si guadagna il suo posto sulle corsie in cui la metrica non ha spazio per punteggi indulgenti.

C'è anche uno spunto che vale la pena cogliere dalla scheda di webAI: la pipeline è stata eseguita su cinque modelli di base diversi, con solo il coefficiente di merge che cambiava da modello a modello, e webAI riporta l'esito per ciascuno, compresi quelli che si sono mossi meno. Questa è un'affermazione su una ricetta più forte di qualsiasi singola riga di benchmark, ed è il tipo di prova che ti dice che un metodo generalizza, anziché che un singolo checkpoint è stato fortunato.

Che cosa è instradabile qui, e che cosa non lo è?

Questo è l'unico punto in cui i due modelli figurano onestamente nella stessa frase. Qwen3.8-Max è una route: viene servito tramite OrcaRouter come `qwen/qwen3.8-max`, e poiché la piattaforma trasmette il prezzo di listino del fornitore con uno 0% di markup aggiunto, la tariffa di $2,00/$6,00 è quella del fornitore stesso e un taglio di prezzo del fornitore diventa effettivo lo stesso giorno anziché dopo un ciclo contrattuale. Lo snapshot datato `qwen/qwen3.8-max-0902` è instradabile insieme ad esso, quindi fissare un id di modello riproducibile è una scelta di configurazione piuttosto che un rapporto separato con il fornitore.

TwIL-LM3-Pro non è una route, e sarebbe disonesto insinuare il contrario. È con licenza non commerciale e senza alcun endpoint ospitato pubblicato, e il modo attuale di usarlo è scaricare il checkpoint ed eseguirlo da sé. Ciò che il router fa per una pipeline costruita attorno a esso è il lavoro sul testo circostante — l'espansione del prompt, la generazione del corpus, la passata di filtraggio — che gira sullo stesso endpoint compatibile con OpenAI su oltre 200 modelli, così scambiare il modello che genera i dati di valutazione con il modello che li valuta non costa altro che una modifica alla configurazione, con failover automatico per mantenere vivo un batch lungo quando un provider ha un intoppo.

L'uso più difendibile dei due insieme è esattamente questo: un livello frontier instradabile che svolge ragionamento generale ed estrazione strutturata, uno specialista scaricato che svolge il giudizio di logica formale, e una chiave unica per tutto ciò che sta nel mezzo.

Quale modello confrontare, e quando

Se stai valutando piccoli modelli di logica formale, il Qwe​n che vale la pena mettere accanto a TwIL-LM3-Pro è Qwen3-8B, e webAI ha già pubblicato quel confronto con le relative avvertenze. Se stai scegliendo dove eseguire un carico di lavoro di produzione, Qwen3.8-Max è una decisione del tutto diversa — un sistema frontier ospitato, con un listino prezzi e senza download — e la domanda giusta non è quale sia migliore, ma quale vincolo sia determinante: connettività e licenza da un lato, contesto, modalità e scala dall'altro. La maggior parte dei sistemi reali finisce per aver bisogno di entrambe le risposte.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno