Generata scheda del titolo hero intitolata 'GPT-6 Luna vs Grok 4.6' con il sottotitolo 'Venti volte il prezzo, e un precipizio a 200.000 token', un piè di pagina che recita 'Prezzi secondo OpenAI e xAI; valori dell'indice secondo Artificial Analysis.', e il logo OrcaRouter composto in basso a destra.
Guides & Insights

GPT-6 Luna vs Grok 4.6: il divario di prezzo è di venti volte e la finestra è la vera differenza

Autore

Gideon Frost

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Metti GPT-6 Luna e Grok 4.6 sulla stessa pagina e il primo confronto si scrive da solo. Luna ha un prezzo di listino di $0.10 per milione di token in input e $0.50 per milione in output. Grok 4.6 è a listino a $2.00 e $6.00 con $0.50 per la lettura in cache. Venti volte sull'input, dodici volte sull'output, e una tariffa per l'input in cache cinquanta volte più alta sul modello del fornitore. Questo è il prezzo di listino, e sul listino la risposta non è nemmeno vicina.

Il motivo per cui vale la pena scrivere il resto di questo pezzo è che i due modelli sono in disaccordo su qualcosa di più strutturale del prezzo. Grok 4.6 dispone di una finestra di contesto di 500.000 token e rimodula il prezzo dell'intera richiesta una volta che il prompt supera i 200.000 token. GPT-6 Luna ne dispone di 1.050.000 e rimodula il prezzo a 272.000. Entrambe le soglie sono discontinuità, non tariffe marginali: se ne superi una, l'intera richiesta viene fatturata al valore più alto, non solo la parte che oltrepassa la soglia. La posizione di queste due soglie, e ciò che accade a un carico di lavoro con contesto lungo dal lato sbagliato di ciascuna, determina questa comparazione più di quanto faccia il fattore venti del titolo.

Due modelli, due posture molto diverse

Grok 4.6 è il modello di xAI del 12 agosto 2026 ed è un rilascio di frontiera generalista: testo in ingresso, testo in uscita, una finestra di 500.000 token, un costo pubblicato per attività di $1,86 sulla board indipendente a sforzo elevato e una velocità misurata di 57,7 token di output al secondo. È il tipo di modello che un team adotta perché è bravo in molte cose e il fornitore pubblica rapidamente.

GPT-6 Luna è la posizione opposta. OpenAI l'ha rilasciato il 22 settembre 2026 come fascia di volume della famiglia GPT-6, al di sotto di GPT-6 Sol a $2,00/$10,00 e del modello di punta GPT-6 Astra a $10,00/$50,00. Testo e immagini in input, testo in output, finestra di 1.050.000 token con un input massimo di 922.000 token, un limite di output di 128.000 token e una scala di ragionamento che va da none a low, medium, high, xhigh e max, con medium come impostazione predefinita. Non è un modello che si adotta per la sua ampiezza. È un modello che si mette sotto a un carico di lavoro.

Quindi l'impostazione onesta non è "quale di questi è migliore". È "quale di questi ha un prezzo commisurato alla forma del lavoro che hai", e le due forme sono davvero diverse.

Le carte, riga per riga

Una riga per dimensione, entrambi i lati su ciascuna:

• Input per 1M — GPT-6 Luna $0.10 vs Grok 4.6 $2.00

• Output per 1M — GPT-6 Luna $0,50 vs Grok 4.6 $6,00

• Input in cache per 1M — GPT-6 Luna $0,01 vs Grok 4.6 $0,50, un decimo della propria tariffa di input contro un quarto di quella di xAI

• Soglia di contesto lungo — GPT-6 Luna 272.000 token di input vs Grok 4.6 200.000 token di prompt

• Tariffe per contesto lungo — GPT-6 Luna riprezza l'intera richiesta a 0,20 $ in input, 0,75 $ in output, 0,02 $ in cache, mentre Grok 4.6 riprezza l'intera richiesta a 4,00 $ in input, 12,00 $ in output, 1,00 $ in cache

• Finestra di contesto — GPT-6 Luna 1.050.000 token vs Grok 4.6 500.000 token

• Output massimo — GPT-6 Luna 128.000 token vs Grok 4.6 non pubblicato come tetto separato sulla scheda

• Intelligence Index, indipendente — GPT-6 Luna 37 a sforzo massimo contro Grok 4.6 44 a sforzo elevato sulla revisione v4.3.2 dell'indice

• Punteggio con sforzo predefinito — GPT-6 Luna 29 al suo livello medio predefinito contro Grok 4.6 43 a medio, dove anche la classifica lo misura

• Costo per attività Index, indipendente — GPT-6 Luna circa $0,07 contro Grok 4.6 $1,86 con sforzo elevato

• Token di output sul run dell'indice — GPT-6 Luna 150M vs Grok 4.6 94M, rispetto a una mediana della classifica di 88M

• Velocità di output, indipendente — GPT-6 Luna 153,9 token/sec vs Grok 4.6 57,7 token/sec in modalità alta

• Tempo al primo token, indipendente — Grok 4.6 38,63 s, end-to-end 47,31 s; GPT-6 Luna restituisce un primo token in un tempo che permette a un utente di restare in attesa

• Capacità cyber, indipendente — Grok 4.6 ottiene 57 nella valutazione cyber del board; non è pubblicato alcun dato comparabile per GPT-6 Luna

• Su OrcaRouter — GPT-6 Luna non presente nel nostro catalogo vs Grok 4.6 instradabile al prezzo di listino di xAI

Generated two-column scoreboard titled 'GPT-6 Luna vs Grok 4.6 - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, Long-context threshold 272,000, Context 1,050,000, AA Index 37 at max effort, Cost per index task $0.07. Right column Grok 4.6 rows: Price in/out $2.00 / $6.00, Cached input $0.50, Long-context threshold 200,000, Context 500,000, AA Index 44 at high effort, Cost per index task $1.86. Footer: 'Prices per OpenAI and xAI; index figures per Artificial Analysis.'

200.000 contro 272.000 è l'intero argomento

Leggi le due soglie accanto alle due finestre e il confronto si riorganizza da sé.

Il cliff di Grok 4.6 si colloca a 200.000 token all'interno di una finestra di 500.000 token — al 40% del percorso. Quello di GPT-6 Luna si colloca a 272.000 su 1.050.000 — al 26% del percorso. Quindi il modello più economico non solo inizia a riprezzare più tardi, ma ha più del doppio dello spazio dopo la soglia prima di esaurire del tutto la finestra.

In concreto: una richiesta da 450.000 token rientra in entrambi i modelli. Su GPT-6 Luna viene fatturata al tier long-context a $0,20 e $0,75. Su Grok 4.6 viene fatturata a $4,00 e $12,00. Si tratta di venti volte in input e sedici volte in output per lo stesso prompt — ed è una richiesta che Grok 4.6 può servire, quindi la scelta è reale e non teorica.

Il caso inverso è quello che coglie le persone di sorpresa. Una richiesta da 190.000 token si colloca al di sotto di entrambe le soglie e viene fatturata alle tariffe standard su entrambi: $0,10/$0,50 contro $2,00/$6,00, un netto rapporto di venti a uno e dodici a uno. Una richiesta da 210.000 token supera la soglia di Grok 4.6 e resta al di sotto di quella di GPT-6 Luna. Viene fatturata a $4,00/$12,00 su Grok 4.6 e a $0,10/$0,50 su Luna — un divario di quaranta a uno e ventiquattro a uno, prodotto interamente da una differenza di 20.000 token nella lunghezza del prompt, senza alcuna modifica a nessuno dei due modelli.

Non è un motivo per evitare Grok 4.6. È un motivo per sapere dove finiscono davvero i tuoi prompt, perché un carico di lavoro che fa in media 180.000 token e raggiunge picchi di 220.000 paga due tariffe diverse e sembrerà un errore di fatturazione il primo mese in cui accade.

Cosa compra il divario di prezzo nel consiglio indipendente

Grok 4.6 ottiene 44 sull'Artificial Analysis Intelligence Index ad alto sforzo. GPT-6 Luna ottiene 37 a massimo sforzo. Sette punti, su un composito in cui un singolo punto è all'interno del rumore di una riesecuzione — e i due modelli sono separati da circa ventisei volte sul costo per attività completata, $1,86 contro circa $0,07.

Due cose di quella coppia di numeri meritano di essere distinte.

Il primo è il valore predefinito dello sforzo. Il 37 di GPT-6 Luna è un valore con sforzo massimo e il suo valore predefinito è medio, dove ottiene 29. Il 44 di Grok 4.6 è un valore con sforzo elevato, e la classifica lo misura anche a medio, dove ottiene 43. Quindi il confronto omogeneo con le impostazioni predefinite è 29 contro 43 — quattordici punti, non sette, e la versione da quattordici punti è quella che un team che li implementa entrambi e non cambia nulla sperimenterà davvero. Grok 4.6 perde un punto passando da elevato a medio. GPT-6 Luna ne perde otto. La manopola dello sforzo costa al modello economico molto più di quanto costi a quello costoso, e questa asimmetria è invisibile nelle cifre principali dell'indice.

Il secondo è la verbosità, e qui la direzione è opposta a quanto suggerisce il rapporto di prezzo. GPT-6 Luna ha generato 150 milioni di token di output per completare l'indice; Grok 4.6 ne ha generati 94 milioni. Il modello che costa un dodicesimo per token di output ha consumato il 60% in più di token per arrivare a un punteggio inferiore. Su una scheda con prezzo basato sull'output, questa è la differenza tra un divario di costo per attività di ventisei volte e uno più piccolo, ed è il motivo per cui qualsiasi confronto basato soltanto sui prezzi di listino sopravvaluterà i meriti della fascia economica.

Grok 4.6 pubblica anche un punteggio di capacità cyber di 57 nella stessa classifica. Non esiste un dato comparabile per GPT-6 Luna, quindi quella dimensione ha un solo lato — ma è il tipo di riga che conta se il tuo carico di lavoro tocca strumenti di sicurezza, e la sua assenza sul modello più economico è informazione, non una lacuna da colmare con supposizioni.

Latenza, dove i due non sono vicini e non nella stessa direzione

Le cifre di latenza indipendenti di Grok 4.6 sono 38,63 secondi al primo token e 47,31 secondi end-to-end con effort alto. Si tratta di un valore per un modello che svolge un ragionamento serio prima di parlare, e non è compatibile con una persona che guarda un cursore. La nostra scheda per il modello registra un p50 del tempo al primo token di 6,71 secondi e un p95 di 10,00 secondi su una finestra di sette giorni, che misura un punto diverso della risposta e non è comparabile alla cifra indipendente — i due numeri non sono in disaccordo, rispondono a domande diverse.

GPT-6 Luna funziona a 153,9 token di output al secondo e restituisce il primo token abbastanza velocemente da sostenere una superficie interattiva. È quasi tre volte il throughput di Grok 4.6 ad alto sforzo. Per un processo batch, quella differenza è una comodità in termini di tempo di esecuzione. Per qualunque cosa su cui un utente sia in attesa, è la differenza tra un prodotto e un prototipo.

La combinazione è insolita e vale la pena definirla chiaramente: il modello economico è quello veloce, il modello costoso è quello lento, e il modello costoso è avanti di sette punti sul composito a parità di impegno. Questo è il profilo di un modello progettato per pensare a fondo una volta sola, e di un modello progettato per rispondere rapidamente moltissime volte. Se il tuo carico di lavoro prevede una chiamata per attività, la latenza di Grok 4.6 è sostenibile. Se ne prevede mille per attività, non lo è.

Cosa stai effettivamente acquistando sul fronte xAI

Grok 4.6 costa circa ventisei volte tanto per attività completata rispetto a GPT-6 Luna ed è avanti di sette punti indice a parità di impegno. È un rapporto di scambio sfavorevole per un carico di lavoro generico, e ragionevole per una specifica categoria di lavoro.

Tre cose lo giustificano. Il punteggio cyber di 57 è una capacità di cui GPT-6 Luna non pubblica un equivalente. L'esecuzione dell'indice da 94 milioni di token rispetto ai 150 milioni di Luna è un vero vantaggio di concisione in qualsiasi attività in cui l'output è consumato da una persona anziché da un parser. E il modello è in produzione dal 12 agosto, sei settimane in più rispetto a tutta l'esistenza di GPT-6 Luna — il che non è un benchmark, ma è un track record, e per un team che ha già costruito su di esso, il costo di migrazione per abbandonarlo fa parte del prezzo da pagare per abbandonarlo.

Di contro, il caso di GPT-6 Luna non è principalmente il tasso di venti volte. È la soglia di 272.000 token all'interno di una finestra di un milione di token, la capacità di ricevere l'ordine di interrompere del tutto il ragionamento, una tariffa per input in cache di un centesimo per milione e un valore di throughput che lo rende utilizzabile come componente anziché come endpoint. Queste sono proprietà strutturali della fascia economica, e nessuna quantità di vantaggio di indice dall'altra parte può sostituirle.

Eseguendone uno, o entrambi

Grok 4.6 è su OrcaRouter al prezzo di listino di xAI, con un prezzo pass-through che fa ricadere su di noi una variazione delle tariffe del fornitore lo stesso giorno, invece di aspettare che un rivenditore rinegozi. Il failover automatico è la parte che si merita il suo posto proprio per questo modello: una finestra di 500.000 token con un punto critico a 200.000 token è un carico di lavoro in cui una richiesta finisce occasionalmente dalla parte sbagliata del limite, e una rotta che si sposta tra upstream senza un deployment vale più di una frazione di centesimo per token.

GPT-6 Luna non è nel nostro catalogo al momento in cui scriviamo e ad esso si accede tramite l'API di OpenAI stessa. Quindi un team che li vuole entrambi usa una sola chiave per Grok 4.6 insieme a qualunque cosa già usi per OpenAI. Il DSL di routing è l'elemento che si adatta a questo abbinamento: una regola che invia i prompt al di sopra di una soglia di token al modello il cui scalino superano, e tutto ciò che sta al di sotto al modello che costa un dodicesimo, è esprimibile come configurazione anziché come un ramo nella tua applicazione — il che conta quando le soglie sono tanto vicine alle dimensioni comuni dei prompt quanto lo sono queste due.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Quale, e quando

Prendi GPT-6 Luna se il tuo carico di lavoro è ad alto volume, consumato da programmi e di breve durata. Classificazione, estrazione, routing, sintesi in blocco, il ciclo interno di un agente. A $0,10/$0,50 con una lettura in cache da un centesimo, contro un modello che costa ventisei volte tanto per attività completata per sette punti di indice a parità di effort, il confronto numerico non è nemmeno ravvicinato. Imposta esplicitamente il parametro effort — il valore predefinito è medium e il 37 in evidenza è un numero con effort massimo — e mantieni le chiamate lunghe sotto i 272.000 token.

Scegli Grok 4.6 se ti serve la capacità cyber, se il tuo output viene letto da una persona e la sua concisione vale il prezzo, oppure se hai un carico di lavoro da 300.000 a 500.000 token che GPT-6 Luna può servire, ma in cui preferiresti non essere il primo team a scoprire come si comporta a quella lunghezza. Prevedi esplicitamente nel budget il cliff dei 200.000 token, e non metterlo dietro una superficie interattiva con sforzo elevato — 38 secondi al primo token non sono un valore di latenza, sono una dichiarazione su a cosa serve il modello.

L'errore che questo confronto invita a commettere è trattare il rapporto di venti volte come la decisione. Lo è per una forma di carico di lavoro. Per l'altra, la decisione si prende a 200.000 e 272.000 token, e il rapporto di prezzo è un dettaglio che si legge dopo.

Screenshot of the OrcaRouter model page for Grok 4.6 showing the xAI vendor label, list pricing of $2.00 input and $6.00 output per 1M tokens, a 500,000-token context window, recorded latency statistics, an uptime chart, and the provider routing section.

Confrontati in questo articolo1

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno