Una hero card generata per GPT-6.1 Sol vs DeepSeek V4 Pro, con il titolo 'Tre metri, tre risposte diverse', tre card metriche che recitano 'Prezzo misto 4x', 'Costo per attività indice 1,07x' e 'Indice di intelligenza 16 punti', una riga che recita 'Uno è proprietario e vede le immagini. Uno è a pesi aperti con licenza MIT e solo testo.', un footer che recita 'Prezzi secondo OpenAI e DeepSeek; cifre di indice e costo per attività secondo Artificial Analysis, che confronta modelli a pesi aperti e proprietari in gruppi di pari diversi.', e il logo OrcaRouter nell'angolo in basso a destra.
Guides & Insights

GPT-6.1 Sol vs DeepSeek V4 Pro: tre metri, tre risposte diverse

Autore

Elias Hawthorne

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli →
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Chiedi quanto distano GPT-6.1 Sol e DeepSeek V4 Pro e la risposta onesta è che dipende da quale indicatore leggi, e i tre indicatori divergono più di quanto la maggior parte dei confronti tra modelli diverga su tutto. Sul prezzo per milione di token, ponderato con un rapporto input-output di 3:1, sono $4,00 contro $0,99 — un fattore di quattro. Su quanto è effettivamente costato eseguire la stessa suite di valutazione, sono $0,72 contro $0,67 per attività — sette per cento. Sull'Artificial Analysis Intelligence Index sono 51,8 contro 36 — sedici punti, che sembrano decisivi finché non guardi con chi è stato confrontato ciascun numero, perché la metodologia stessa di quel valutatore colloca i due modelli in categorie diverse. GPT-6.1 Sol è stato rilasciato il 29 settembre 2026 a $2,00 in input e $10,00 in output con una finestra di 1.050.000 token. DeepSeek V4 Pro è un modello ammiraglia mixture-of-experts con licenza MIT, 1.600 miliardi di parametri con 49 miliardi attivi, rilasciato il 13 agosto 2026 a $0,66 e $1,98 con una finestra di 1.048.576 token. Uno è un modello testuale che puoi scaricare. L'altro vede le immagini. Capire da quale dei tre indicatori dovresti davvero orientarti è tutto il lavoro.

La riga dell'indice non è il confronto che sembra.

Inizia dal numero che viene citato più spesso, perché è quello che viene citato più spesso in modo sbagliato.

Artificial Analysis pubblica la propria metodologia insieme alla sua classifica, e due frasi al suo interno sono rilevanti in questo contesto. I modelli open-weights, si legge, vengono confrontati solo con altri modelli open-weights della stessa classe dimensionale — minuscola, piccola, media, grande, con il confine fissato a 150 miliardi di parametri. I modelli proprietari vengono invece confrontati all'interno di una fascia di prezzo, con un rapporto combinato input-output di 3:1. Questi sono due gruppi di riferimento diversi. DeepSeek V4 Pro 0813 è open-weights — lo afferma la FAQ dello stesso valutatore, che rimanda ai pesi pubblicati — e con 1,6 trilioni di parametri totali rientra nella classe grande degli open-weights. GPT-6.1 Sol è proprietario e viene valutato rispetto a modelli nella sua stessa fascia di prezzo.

Un 51,8 e un 36 che si trovano in righe adiacenti della stessa tabella non sono quindi un confronto diretto. Sono un punteggio rispetto a un insieme di pari e un punteggio rispetto a un altro, ed è proprio per questo che le cifre di costo per attività sono confrontabili mentre i numeri grezzi dell'indice non lo sono. Se vuoi sapere se DeepSeek V4 Pro è valido per un modello scaricabile, 36 è il numero che risponde. Se vuoi sapere come se la cava contro un modello frontier ospitato, la colonna dell'indice non te lo dirà, e questo è un caso in cui la mossa onesta è dirlo invece di sottrarre 36 da 51,8 e chiamarlo divario.

Ciò che può essere confrontato in modo pulito: le schede dei prezzi, i limiti di contesto e di output, gli elenchi delle modalità e il costo di esecuzione della stessa suite di valutazione — perché quest'ultimo dato è una contabilità di lavoro identico, non un punteggio.

Cosa dicono i contatori grezzi

A screenshot of the OrcaRouter model page for deepseek/deepseek-v4-pro, credited to DeepSeek and dated 2026-04-24, showing the model identifier, text-only input with tools, JSON and reasoning, a 1M-token context window with a 384K maximum output, and a rate row reading $0.66 input and $1.98 output per million tokens alongside a 1.92-second median latency and a 1030.7M seven-day traffic figure.

• Prezzo di input — GPT-6.1 Sol $2,00 vs DeepSeek V4 Pro $0,66 per milione di token

• Prezzo di output — GPT-6.1 Sol $10.00 vs DeepSeek V4 Pro $1.98, passando a $1.32 e $3.96 all'interno di due finestre UTC di quattro ore nei giorni feriali

• Lettura cache — GPT-6.1 Sol $0,10 vs DeepSeek V4 Pro $0,022 per milione di token; entrambi usano la cache, e il lato economico è ancora 4,5× più economico

• Costo per attività di indicizzazione — GPT-6.1 Sol $0,72 vs DeepSeek V4 Pro $0,67

• Token di output emessi sulla suite di indici — GPT-6.1 Sol 67M vs DeepSeek V4 Pro 160M

• Output massimo — DeepSeek V4 Pro 384.000 token vs GPT-6.1 Sol 128.000 token

• Modalità — GPT-6.1 Sol accetta testo, immagini e file; DeepSeek V4 Pro accetta solo testo

La quarta e la quinta riga sono la coppia interessante. DeepSeek V4 Pro emette 2,4 volte tanti token sulla stessa suite e conclude comunque con un costo inferiore del 7% per attività, perché la sua tariffa di output è un quinto di quella di GPT-6.1 Sol. Ecco come appare un modello guidato dal prezzo quando si misura l'output anziché la tariffa: la verbosità è reale e non cancella il vantaggio. La finestra temporale è l'asterisco. Due blocchi di quattro ore nei giorni feriali — 40 delle 168 ore di una settimana — raddoppiano la tariffa indicata portandola a $1,32 e $3,96, e quel sovrapprezzo si applica agli stessi token che altrimenti sarebbero i più economici su entrambe le carte.

Ciò che il modello più economico non fa

Tre cose, e ognuna è un limite invalicabile anziché un compromesso.

Non vede. DeepSeek V4 Pro è testo in input, testo in output. Nessuno screenshot, nessun PDF scansionato, nessuna lettura di grafici, nessun diagramma in un ticket. L'uso del computer e i flussi di lavoro ad alto contenuto documentale — esattamente i carichi di lavoro per cui GPT-6.1 Sol è posizionato — sono fuori discussione a qualsiasi prezzo. Se la tua pipeline indirizza già le immagini verso un modello di visione, questo non è un problema; in caso contrario, è il vincolo decisivo.

Non ha una cadenza di rilascio su cui si possa pianificare. Il nome "deepseek-v4-pro" è risolto alla build 0813 da agosto, e arrivarci non è stato tranquillo: il fornitore ha annunciato la dismissione della build per il 14 settembre, ha ritirato l'annuncio due giorni prima della data e ha continuato a servire l'API con la fatturazione invariata. Il nostro catalogo continua a elencarlo come flagship con lo stesso contesto, tetto di output e limite di concorrenza. Un fornitore che può ritirare una deprecazione in due giorni può anche decidere di non farlo; il punto operativo non è che il modello sia instabile, ma che il nome è un puntatore, e ancorare il comportamento a un identificatore di build anziché a un nome di route è l'assicurazione a basso costo.

Non porta con sé la conoscenza che lo circonda. GPT-6.1 Sol ha otto giorni di vita e ha già una configurazione indipendente pubblicata; DeepSeek V4 Pro ha una cronologia di valutazione più lunga e una base di professionisti molto più ampia, inclusi uno stack di serving pubblicato e lavori sul throughput di terze parti. Per un deployment self-hosted, quella mole di materiale vale più della riga dell'indice, perché è ciò che consulti quando il modello si comporta in modo strano sul tuo hardware invece che su un benchmark.

Quando il contatore quattro volte più economico è il contatore sbagliato

Se il modello economico fosse semplicemente peggiore in tutto, questo sarebbe un breve articolo. Il fatto scomodo è che i due sono distanti del 7% per attività su lavoro identico, e distanti 2,4 volte in quanto scrivono per arrivarci. Ciò significa che il misuratore di token combinati — quello che dice 4× — sta misurando una differenza che per lo più non paghi, perché prezza un mix di token che potresti non inviare mai. E il misuratore dell'indice, quello che dice 16 punti, misura su due gruppi peer e non può essere sottratto.

Quindi la suddivisione pratica non è «modello di frontiera per il lavoro difficile, modello economico per il lavoro facile». È una suddivisione per modalità e una suddivisione per volume. Tutto ciò che contiene un'immagine va a GPT-6.1 Sol, e così anche tutto ciò in cui la risposta è breve e il ragionamento è la parte costosa — i suoi cinque livelli di effort, da low a max con medium come impostazione predefinita, ti permettono di comprare ragionamento senza comprare prosa, e il suo input in cache a 0,10 $ rende economico un lungo prompt ripetuto. Tutto ciò che è solo testo, ad alto volume e tollerante a una risposta più lunga — classificazione, estrazione, sintesi, generazione in blocco entro un budget di output di 384.000 token — va a DeepSeek V4 Pro, idealmente al di fuori delle due finestre UTC.

Entrambi su un unico tasto, e la separazione è una riga di configurazione

Entrambi i modelli sono su OrcaRouter alle tariffe pubblicate dei rispettivi fornitori, senza aggiunte: GPT-6.1 Sol a $2.00 / $10.00, che passa a $4.00 / $15.00 oltre 272,000 token di prompt, e DeepSeek V4 Pro a $0.66 / $1.98 con le due finestre temporali riportate come elencato. Una chiave, una fattura, un endpoint compatibile con OpenAI per entrambi.

Ecco perché la suddivisione di cui sopra vale la pena di essere messa per iscritto anziché discussa. Una suddivisione per modalità è esprimibile come regola di instradamento, così le richieste contenenti immagini vanno al modello di visione e il grosso del testo va a quello economico senza modificare l'applicazione; se una rotta si degrada, il failover sposta la chiamata invece di farla fallire. E poiché entrambi sono sullo stesso endpoint, il confronto dei prezzi che conta davvero — il tuo, sul tuo traffico, con il tuo mix di token — può essere prodotto dalle tue stesse fatture anziché dalla media di una suite di benchmark.

A screenshot of OpenAI's developer model page for GPT-6.1 Sol, headed 'GPT-6.1 Sol' with the tagline 'Near-Astra performance for complex work at a lower cost', showing a 1,050,000-token context window, 128,000 max output tokens, an Apr 30, 2026 knowledge cutoff, a price row reading $2 input and $10 output per million tokens, and the note that reasoning.effort supports low, medium (default), high, xhigh and max while none and minimal are not supported.A generated scoreboard titled 'GPT-6.1 Sol vs DeepSeek V4 Pro — the scoreboard' showing two columns on six shared rows: input price $2.00 against $0.66 per million tokens; output price $10.00 against $1.98; cache read $0.10 against $0.022; cost per index task $0.72 against $0.67; maximum output 128,000 against 384,000 tokens; modalities text, image and file against text only. A footer reads 'Prices per OpenAI and DeepSeek as listed on OrcaRouter; cost-per-task figures per Artificial Analysis, whose index compares open-weights and proprietary models in different peer groups.'

Il verdetto, in una riga, è che la lettura quattro volte più economica è quella di cui diffidare e la lettura del sette percento è quella da verificare. Quattro volte è ciò che dice il misuratore misto su un mix di token che potresti non inviare. Il sette percento è quanto è costata la stessa valutazione su entrambi, e comporta una differenza di verbosità di 2,4× incorporata. I sedici punti sono reali, sono anche distribuiti su due gruppi di pari, e il vincolo che effettivamente decide la maggior parte dei deployment di questa coppia non è affatto un numero: uno di questi modelli può leggere uno screenshot e l'altro no.

Confrontati in questo articolo2

Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno