Una card di titolo hero generata per un articolo intitolato 'Grok 4.7 vs Qwen 3.8 Max — un testa o croce sulla carta', con il sottotitolo 'Prezzo identico, a un punto indice di distanza, forme opposte' e chip statistiche che riportano AA Index 46 vs 45, prezzo $2/$6 su entrambi, e contesto 500K vs 984K.
Guides & Insights

Grok 4.7 vs Qwen 3.8 Max: Prezzo identico, separati da un punto, forme opposte

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due modelli di punta closed, entrambi a 2 $ per milione di token in input e 6 $ per milione in output, entrambi con un punteggio entro un singolo punto l'uno dall'altro sullo stesso benchmark indipendente, rilasciati a diciannove giorni di distanza. Grok 4.7 è arrivato il 21 settembre 2026 da SpaceXAI; Qwen 3.8 Max è stato rilasciato dal fornitore il 3 agosto 2026 e aggiornato il 2 settembre 2026. Sul corrente Artificial Analysis Intelligence Index, versione v4.3.2, Grok 4.7 totalizza 46 e Qwen 3.8 Max totalizza 45. Quanto a prezzo e a capacità misurata, questi due modelli sono lo stesso acquisto. Su tutto il resto — contesto, modalità, velocità di servizio, apertura e ciò che ciascun fornitore ha scelto di ottimizzare — non potrebbero essere più diversi, ed è questo che rende questo confronto degno di essere fatto anziché saltato.

Prima, la cronologia, perché Qwen 3.8 Max ha due date

Questo crea confusione in molte trattazioni, quindi vale la pena chiarirlo subito. Qwen 3.8 Max è stato lanciato il 3 agosto 2026 come il modello più grande e più capace di Alibaba, costruito sull'architettura visione-linguaggio Qwen 3.5 secondo un design sparse mixture-of-experts riportato a 2,4 trilioni di parametri totali con 95 miliardi attivi per token. Il 2 settembre 2026 Alibaba ha rilasciato una build aggiornata — la revisione 0902, che è la versione con gli ID modello attuali e la versione a cui Artificial Analysis fa risalire la propria pagina. Se hai visto sia una data di agosto sia una di settembre per Qwen 3.8 Max, ecco perché: una è il lancio, l'altra è la revisione a cui la maggior parte delle persone si riferisce effettivamente oggi.

Grok 4.7 ha una storia più pulita e una più disordinata alle spalle. SpaceXAI lo ha rilasciato il 21 settembre 2026 dopo un lancio che è slittato ripetutamente — Musk aveva indicato finestre a fine agosto, all'inizio di settembre e a metà settembre prima che il modello venisse effettivamente distribuito. Il rilascio in sé è stato limitato: un modello base più grande di Grok 4.6, una sessione di reinforcement learning più lunga mirata a compiti di più ore, e nessun cambiamento al listino prezzi da $2/$6 che Grok 4.6 applicava dal 12 agosto.

Per cosa ha ottimizzato ciascun fornitore

Leggi i due annunci di lancio come una coppia e le scommesse sul design sono quasi perfettamente opposte.

SpaceXAI ottimizzato per l'esecuzione agentica. I numeri riportati dal fornitore di Grok 4.7 sono concentrati sul lavoro in terminale e repository: Terminal-Bench 4.0 al 38,0% contro il 20,3% di Grok 4.6, CursorBench 4.0 al 46,3%, DeepSWE v1.1 al 71,0% con sforzo di ragionamento elevato, EEBench al 64,0%. La descrizione del rilascio fornita dall'azienda indica l'autoverifica e la gestione di contesti lunghi all'interno dell'ambiente Grok Bot come obiettivi. Grok 4.7 offre una finestra di 500.000 token, accetta testo e immagini in input, restituisce testo e espone lo sforzo di ragionamento da basso a xhigh. È un modello progettato per portare a termine i lavori.

Alibaba ha ottimizzato per la portata. Qwen 3.8 Max offre una finestra di contesto di circa 984.000 token — di fatto un milione — e i suoi punti di forza dichiarati sono l'ampiezza più che la profondità in un singolo ambito: un punteggio di 86,6 su Terminal Bench 2.1, 67,7 su SWE-bench Pro, 93,0 su PaperBench, 92,6 su GPQA Diamond, 82,3 su MMMU-Pro, 86,1 su OSWorld-Verified. Accetta input testuali, immagini e video e restituisce testo, supporta livelli di sforzo di ragionamento con xhigh come impostazione predefinita, e il suo punto più debole tra quelli dichiarati è Humanity's Last Exam con 43,6. È un modello costruito per gestire qualunque cosa gli si sottoponga.

Ogni cifra in quel paragrafo è dichiarata dal fornitore. Nessuno dei due set è stato riprodotto in modo indipendente, e i due set non sono comunque direttamente confrontabili — Terminal-Bench 2.1 e Terminal-Bench 4.0 sono benchmark diversi, quindi l'86,6 di Qwen e il 38,0 di Grok non devono mai essere messi l'uno accanto all'altro.

• Composito indipendente — Grok 4.7 46 su AA Intelligence Index v4.3.2 vs Qwen 3.8 Max 45 sulla stessa versione. Un pareggio statistico.

• Prezzo per milione di token — 2,00 $ in / 6,00 $ out su entrambi. Lo sconto cache di Qwen è indicato all'88%, con una tariffa combinata di 1,18 $ per milione; i termini di cache di Grok 4.7 non sono pubblicati sulla stessa base.

• Finestra di contesto — Grok 4.7 500.000 token contro Qwen 3.8 Max circa 984.000. Qwen vince quasi del doppio, e questa è la singola differenza di specifiche più grande tra i due.

• Modalità di input — Grok 4.7 testo e immagine vs Qwen 3.8 Max testo, immagine e video.

• Pesi — entrambi proprietari. Nessuno dei due modelli può essere scaricato, il che elimina del tutto da questo confronto il consueto argomento dei pesi aperti.

• Parametri — Grok 4.7 non divulgati su alcuna scheda tecnica di SpaceXAI (la cifra di ~2,1T è un'affermazione di Musk) vs Qwen 3.8 Max riportato a 2,4T totali con 95B attivi, che Alibaba non ha confermato nemmeno su una scheda di specifiche.

• Velocità di erogazione — Qwen 3.8 Max a 38,8 token di output al secondo con 3,08 secondi al primo token, secondo Artificial Analysis; Grok 4.7 posizionato da SpaceXAI come all'incirca due volte più veloce rispetto a modelli comparabili, dato riportato dal fornitore, senza alcun dato indipendente di throughput pubblicato finora.

A generated two-column comparison scoreboard for Grok 4.7 and Qwen 3.8 Max with six rows: AA Intelligence Index 46 vs 45, price $2.00/$6.00 on both, context 500K vs 984K tokens, modalities text and image vs text, image and video, weights proprietary on both, and speed vendor-claimed twice as fast vs 38.8 tokens per second measured, with a footer noting index scores are per Artificial Analysis v4.3.2 and all benchmark figures are vendor-reported.

La differenza di contesto è la vera decisione

Quando prezzo e capacità sono identici, la decisione ricade su tutto ciò che altro differisce, e qui entra in gioco il contesto. Raddoppiare la finestra da 500.000 a circa 984.000 token non è un vezzo da scheda tecnica — è la differenza tra suddividere un repository in blocchi e tenerlo intero.

La finestra più lunga di Qwen 3.8 Max comporta un'avvertenza documentata che conta per gli acquirenti: la versione open-weights annunciata da Alibaba per la settimana del 10 agosto 2026 era solo testuale e non includeva il contesto completo da un milione di token. Ciò non riguarda l'endpoint ospitato di cui tratta questo confronto, ma è utile saperlo se avevi intenzione di basare i tuoi piani sul rilascio aperto.

C'è una seconda considerazione sul fronte Grok. La linea Grok ha storicamente applicato un salto di prezzo a 200.000 token di input, per cui una richiesta che supera la soglia ricalcola l'intera richiesta al doppio della tariffa: 4 $ in input e 12 $ in output. Con una finestra da 500.000 token, quella soglia si colloca ben dentro l'intervallo operativo del modello. Prima di indirizzare il lavoro a contesto lungo verso Grok 4.7, verifica il tariffario attuale del modello distribuito, perché è proprio nell'interazione tra una finestra ampia e un salto di riprezzamento che le bollette per il contesto lungo vanno storte.

Quanto costa un mese di lavoro su ciascuno

Poiché le tariffe pubblicizzate sono identiche, il confronto dei costi deve basarsi sul comportamento dei token anziché sul listino prezzi, e qui i due modelli divergono in modo misurabile.

Artificial Analysis ha misurato che Grok 4.7 genera 240 milioni di token di output durante l'esecuzione del suo Intelligence Index, rispetto a una mediana di 92 milioni tra i modelli presenti nella classifica — è un ragionatore prolisso. Qwen 3.8 Max ha generato 190 milioni di token di output sullo stesso indice, con un costo di valutazione totale di $4.934,79 e una velocità misurata di 38,8 token al secondo. Entrambi sono ben al di sopra della verbosità mediana, e Grok 4.7 è il più prolisso dei due.

Quindi, a un identico $6 per milione di output, il modello che emette più token per attività costa di più per attività. Le cifre di verbosità pubblicate suggeriscono che Grok 4.7 consumerà più token di output per un lavoro di indicizzazione equivalente, il che significa che la parità sul prezzo è in realtà un piccolo vantaggio per Qwen 3.8 Max sul costo per attività — compensato dal vantaggio di velocità dichiarato di Grok 4.7, che accorcia il tempo effettivo e quindi il costo umano dell'attesa per l'esecuzione di un agente. Nessuno di questi compensi è visibile su un listino prezzi, ed entrambi vale la pena misurarli sul proprio traffico invece di darli per scontati.

L'unica asimmetria su cui non si discute è il caching. Qwen 3.8 Max dichiara uno sconto sulla cache dell'88% e una tariffa mista di 1,18 $ con un mix 7:2:1 di cache hit, input e output. Per i carichi di lavoro con un ampio prefisso stabile — un prompt di sistema, un'intestazione di codebase, un insieme di documenti — è proprio in quello sconto che si trovano i risparmi reali, e vale la pena verificare come si confrontano le condizioni di cache di Grok 4.7 prima di impegnare volumi consistenti.

Screenshot of the Artificial Analysis model page for Qwen3.8 Max showing an Intelligence Index of 45 on index version v4.3.2, a context window of approximately 984k tokens, text and image input, listed pricing of $2.00 input and $6.00 output per million tokens, and an output speed of 38.8 tokens per second.

Scegliere, quando i numeri si rifiutano di scegliere per te

Un 46 e un 45 sullo stesso indice, allo stesso prezzo, è quanto di più vicino a un vero pareggio questo blog possa mai pubblicare. Ciò significa che la decisione dovrebbe essere presa sugli assi in cui i due modelli differiscono davvero, e ce ne sono quattro.

Scegli Grok 4.7 se il tuo lavoro è coding agentico ed esecuzione da terminale, se la velocità effettiva sulle esecuzioni lunghe conta più del margine di contesto, e se desideri una regolazione del ragionamento per singola richiesta per mantenere economico il traffico semplice. Scegli Qwen 3.8 Max se gestisci abitualmente input più grandi di mezzo milione di token, se l'input video è nella tua roadmap, se vuoi lo sconto dell'88% sulla cache per carichi di lavoro con molti prefissi, o se vuoi un modello il cui fornitore pubblica un'ampia matrice di valutazione anziché una concentrata su un unico ambito.

Se la risposta onesta è "un po' di entrambe", quella è la risposta normale, ed è il caso per cui questa coppia è costruita. Qwen 3.8 Max è su OrcaRouter al prezzo di listino di Alibaba, e OrcaRouter applica i prezzi di listino dei provider con uno 0% di ricarico, quindi i 2 $/6 $ qui sopra sono ciò che paghi effettivamente e una variazione delle tariffe del fornitore è attiva qui lo stesso giorno, non al rinnovo. Una sola chiave API copre Qwen 3.8 Max più oltre 200 altri modelli, il che significa che la decisione sul contesto diventa una regola di routing per singola richiesta anziché un impegno di piattaforma: invia gli input sovradimensionati alla finestra da 984k e mantieni tutto il resto sull'endpoint più veloce ed economico per quel compito, con failover automatico se un provider peggiora. Quando un compito richiede davvero entrambe le forme — una lettura a contesto lungo seguita da una passata di esecuzione agentica — il DSL di routing compone i modelli in un'unica chiamata invece di obbligarti a scegliere una parte.

Una precisazione che vale la pena fare, dato che nessuno dei due modelli è aperto: nulla in questo confronto riguarda pesi scaricabili. Entrambi sono endpoint ospitati, e l'auto-hosting non è un'opzione per nessuno dei due.

L'unico numero da tenere a mente

Quarantasei contro quarantacinque non è un motivo per scegliere un modello, e non dovrebbe esserlo. Ciò che decide questo confronto è la finestra di contesto — 500.000 token contro circa 984.000 — e la forma che ciascun fornitore ha scelto: Grok 4.7 ottimizzato per completare rapidamente compiti agentici difficili, Qwen 3.8 Max ottimizzato per gestire qualunque cosa gli si affidi. Stesso prezzo, stessa capacità misurata, compiti diversi. Questa è una decisione di routing, ed è il tipo di decisione che dovrebbe richiedere un pomeriggio per essere testata piuttosto che un trimestre per essere acquisita.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (model ID qwen/qwen3.8-max), showing Alibaba's list pricing of $2.00 per million input tokens and $6.00 per million output tokens, a 1M token context window, and the vision, tools, JSON and reasoning capability tags.

Confrontati in questo articolo3

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno