Una card con titolo hero per "Qwen 4 Max vs Gemini 3.1 Pro" con il sottotitolo "Il flagship non annunciato contro l'anteprima che non è mai finita", tre badge a pillola con scritto "Anteprima dal 19 febbraio 2026", "Contesto di 1.048.576 token" e "26,3% di retrieval a 1M", una riga a piè di pagina con scritto "Alibaba ha annunciato il 22 settembre 2026; Google ha presentato in anteprima il 19 febbraio 2026", e il logo OrcaRouter nell'angolo in basso a destra.
Engineering & Research

Qwen 4 Max vs Gemini 3.1 Pro: l'ammiraglia non annunciata contro l'anteprima che non è mai finita

Autore

Alistair Wren

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

La maggior parte dei confronti mette un prodotto già rilasciato contro un prodotto già rilasciato. Questo è insolito: Qwen 4 Max è stato presentato in anteprima alla conferenza Yunqi di Hangzhou il 22 settembre 2026, senza data di rilascio, senza prezzo e senza pesi, mentre Gemini 3.1 Pro è in anteprima dal 19 febbraio 2026 ed è ancora in anteprima — sette mesi dopo, senza alcuna data di disponibilità generale annunciata e senza data di dismissione nella sua tabella di deprecazione. Nessuno dei due modelli in questo confronto è un prodotto consolidato. Non è una ragione per saltare il confronto. È il confronto stesso, ed è l'unica cosa al riguardo che sia davvero informativa.

Sette mesi di anteprima

Un'etichetta di anteprima dovrebbe indicare uno stato di breve durata. Gemini 3.1 Pro l'ha ormai mantenuta attraverso tre rilasci Flash dello stesso laboratorio, incluso Gemini 3.8 Flash il 2 settembre 2026, che Google descrive come il suo modello Flash più intelligente. Nei composite indipendenti quel modello ora ottiene un punteggio superiore a 3.1 Pro. La linea Pro di Google non ha membri più recenti: non esiste un Gemini 3.8 Pro, e la generazione 3.5 Pro è stata ritardata e, secondo quanto riferito, messa da parte. L'effetto pratico è che il modello che porta il nome Pro non è più il modello con il punteggio più alto del suo stesso fornitore.

Il testo di limitazione di Google stesso sulla scheda di catalogo consiglia di pianificare la deprecazione della preview, che è il modo onesto di leggere lo stato. Una preview senza data di GA e senza data di dismissione è un modello su cui puoi costruire ma intorno al quale non puoi pianificare.

Il lato Qwen è un'immagine speculare con il segno invertito. Qwen 4 Max non è in una lunga anteprima; è in pre-anteprima, senza nulla di pubblicato. Le due modalità di errore sono opposte: Gemini 3.1 Pro è un endpoint reale la cui esistenza a lungo termine non è specificata, e Qwen 4 Max è un elemento di roadmap specificato senza alcun endpoint.

A two-column scoreboard titled "Qwen 4 Max vs Gemini 3.1 Pro - the scoreboard". Left column Qwen 4 Max: Status announced, no date; Input price not published; Output price not published; Context window not published; Long-context retrieval not published; Independent score none exists. Right column Gemini 3.1 Pro: Status preview since Feb 19 2026; Input price $2.00 per 1M tokens; Output price $12.00 per 1M tokens; Context window 1,048,576 tokens; Long-context retrieval 26.3% at 1M tokens; Independent score 30 on index v4.3.2. Footer reads "Gemini 3.1 Pro pricing and vendor-reported retrieval from Google; index v4.3.2 published September 19 2026.", with the OrcaRouter logo bottom-right.

Il confronto, e il dato sul contesto lungo che lo decide

La specifica di Gemini 3.1 Pro è pubblica e dettagliata. Quella di Qwen 4 Max è vuota. Ciò su cui vale la pena soffermarsi è una riga della colonna Gemini, perché è il genere di numero che viene citato e non dovrebbe esserlo:

• Stato — Gemini 3.1 Pro in anteprima dal 19 febbraio 2026, rispetto a Qwen 4 Max annunciato il 22 settembre 2026 senza data

• Prezzo di input — Gemini 3.1 Pro 2,00 $ per 1M token fino a un prompt di 200K e 4,00 $ oltre, mentre per Qwen 4 Max non è pubblicato

• Prezzo di output — Gemini 3.1 Pro $12,00 per 1M fino a 200K e $18,00 oltre, mentre quello di Qwen 4 Max non è pubblicato

• Input in cache — Gemini 3.1 Pro 0,20 $ per 1M per una lettura dalla cache, mentre Qwen 4 Max non è pubblicato

• Contesto — Gemini 3.1 Pro 1.048.576 token, a fronte di Qwen 4 Max non pubblicato

• Limite di output — Gemini 3.1 Pro 65.536 token, rispetto a Qwen 4 Max non pubblicato

• Modalità — Gemini 3.1 Pro: input di testo, immagini, video, audio e PDF con output testuale, a fronte di Qwen 4 Max non pubblicato

• Controllo del ragionamento — Gemini 3.1 Pro con livelli di pensiero basso, medio e alto, rispetto a Qwen 4 Max non pubblicato

• Recupero a contesto lungo — MRCR v2 riportato dal fornitore per Gemini 3.1 Pro: 84,9 per cento in media su otto needle a 128K, ma 26,3 per cento nell’impostazione puntuale da un milione di token, mentre per Qwen 4 Max non è riportato nulla

• Punteggi riportati dal fornitore — Gemini 3.1 Pro SWE-bench Verified 80,6 percento, GPQA Diamond 94,3 percento, ARC-AGI-2 77,1 percento, Humanity's Last Exam 44,4 percento senza strumenti, rispetto a Qwen 4 Max nulla di riportato

• Punteggio indipendente — Gemini 3.1 Pro 30 sull'Artificial Analysis Intelligence Index v4.3.2, mentre per Qwen 4 Max non esiste alcuna valutazione indipendente

Quella riga sul contesto lungo è quella da portare a casa. Una finestra di contesto da 1.048.576 token è un numero di marketing; il 26,3 percento di recupero con l'impostazione a un milione di token è ciò che lo stesso fornitore dichiara quando misura l'estremità lontana di quella finestra. Entrambe le cifre provengono da Google, il che fa del divario un'affermazione sul modello piuttosto che sul valutatore. Se il tuo carico di lavoro dipende dal trovare un fatto sepolto verso la fine di un prompt da un milione di token, la cifra di contesto in evidenza non ti dice nulla di utile e questa riga ti dice quasi tutto.

L'indice si è mosso, il modello no.

Gemini 3.1 Pro è stato lanciato il 19 febbraio 2026 a 57 sull'Artificial Analysis Intelligence Index, primo nel settore. Secondo la revisione v4.3.2 dell'indice, pubblicata il 19 settembre 2026, il valore è 30. Nulla del modello è cambiato tra quelle due date. Il righello è stato ricostruito, ed è stato ricostruito quattro giorni prima dell'annuncio di Qwen 4 di Alibaba.

Quella coincidenza vale più dei numeri stessi. Tre dei quattro modelli di questa serie di confronti — Gemini 3.1 Pro, Claude Opus 5 e il flagship Qwen 3.8 — hanno punteggi indipendenti che si sono spostati con la stessa revisione, e in ogni caso lo spostamento è stato abbastanza ampio da ribaltare una classifica. Qualsiasi confronto scritto questo mese che citi un singolo valore di indice senza indicare la revisione sta confrontando punteggi rilevati con righelli diversi, e l'errore non sarà visibile a un lettore.

Per Qwen 4 Max la conseguenza è che il bersaglio continua a spostarsi. Quando Alibaba alla fine pubblicherà, il punteggio da battere su questo indice sarà quello che la revisione corrente indicherà in quel giorno, e la revisione è cambiata almeno una volta nell'ultima settimana.

A screenshot of the OrcaRouter page for Gemini 3.1 Pro in its cost-estimator view (English UI), showing a monthly token volume of 10M against a sample summarisation prompt, an estimated $50.00 per month falling to $43.70 with prompt caching at list price, a cost per request of $0.006040, a note that the estimate uses base-tier rates and that actual token counts depend on the provider's tokenizer, and a PERFORMANCE panel for the last 7 days reading p50 time-to-first-token 10.00 s, output speed 632 tok/s and an error rate of 77.5%, above a 7-day latency trend chart running 09-16 to 09-22.

Cosa dicono i numeri operativi, incluso quello scomodo

Gemini 3.1 Pro è instradabile su OrcaRouter come google/gemini-3.1-pro-preview, con i badge Flagship e Featured e senza alcun banner di pre-rilascio, al prezzo di listino di Google di 2,00 $ e 12,00 $ per milione di token con 0% di markup. Il routing in sé è onesto: la tariffa indicata sulla pagina è quella pubblicata da Google. Anche i dati operativi dei sette giorni fino al 22 settembre meritano di essere riportati anziché saltati: un p50 del tempo al primo token di 10,00 secondi, una velocità di output di circa 632 token al secondo e un tasso di errore del 77,5 per cento nell'intero periodo. Quel tasso di errore non è una nota a piè di pagina. Per un modello di livello preview senza data di GA, è il singolo numero più rilevante per le decisioni presente sulla pagina, e un confronto che riporta il prezzo senza di esso fa promozione, non informazione.

Lo stesso catalogo comprende quasi 200 modelli su un unico endpoint compatibile con OpenAI, con failover automatico e un DSL di routing, che è il meccanismo che rende un tasso di errore come quello sopravvivibile anziché fatale: un percorso provider degradato può essere oggetto di failover invece di essere messo fuori servizio. La famiglia Qwen 3.8 — Qwen3.8-Max, Qwen3.8-Flash e Qwen3.8-27B — si trova sullo stesso endpoint di Gemini 3.1 Pro Preview, quindi la sostituzione di cui questo articolo parla davvero, quella che si può fare oggi, è un cambio di policy di routing più che un progetto di migrazione. Qwen 4 Max non è nel catalogo, e nessun tier di Qwen 4 lo è; quando ne verrà rilasciato uno, è lì che comparirebbe.

La decisione, se così si può chiamare

Nessuno dei due modelli qui è un prodotto su cui puoi impegnarti, e il consiglio onesto è di trattarli entrambi di conseguenza. Gemini 3.1 Pro è invocabile oggi a un prezzo pubblicato, con una finestra di contesto pubblicata e un percorso di valutazione pubblico, inclusa la debolezza nel recupero all'estremità più lontana di quella finestra; è anche un'anteprima il cui fornitore ti dice di pianificare la dismissione, con un tasso di errore che sarebbe inaccettabile per una dipendenza di produzione. Qwen 4 Max non ha nessuno di questi problemi perché non ha nessuna di queste proprietà.

Se ti serve un modello adesso, la scelta non è tra questi due. È tra Gemini 3.1 Pro e il flagship Qwen in distribuzione, e in base alle prove disponibili si tratta di decidere tra qualità del recupero su contesti lunghi e una tariffa di input di $2,00 con pesi pubblicati. Se puoi aspettare, tieni d’occhio due cose invece di una: una model card di Qwen 4 Max e una data di disponibilità generale per Gemini 3.1 Pro. Quale delle due arriva per prima ti dice a quale di queste due roadmap Alibaba e Google stanno effettivamente dando priorità.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (English UI), showing the header reading "199 models, 15 providers, one API key, one bill", the sort and filter rail with Newest selected alongside controls for input modalities and context length, the "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions with a model and messages JSON body, and the first catalogue cards including openai/gpt-5-mini with a 200 Status badge.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno