
Dots vs MiniMax M3: Noleggiare il Worker o Scaricare il Reader
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 349 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 210 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
Il modello più economico di questo lotto è anche quello che ti è consentito tenere, e questa combinazione è l'intero confronto. MiniMax M3, pubblicato il 31 maggio 2026, è descritto come il modello fondazionale open-weight di punta di MiniMax: testo, immagini e video in input con testo in output, una finestra di contesto di 1.048.576 token, fino a 512.000 token di output in una singola risposta, e un prezzo di listino di $0,30 per milione di token di input e $1,20 per milione di token di output, con letture in cache a $0,06 — all'incirca un tredicesimo di quanto la frontiera fa pagare per gli stessi token. Dots è l'agente sempre attivo dell'azienda, annunciato al DevDay il 29 settembre 2026: dispone di un proprio computer cloud e browser, funziona su più di 4.000 app connesse, gira su GPT-6 Astra, ed è incluso con Pro e Business Premium senza alcuna cifra di allowance pubblicata da nessuna parte. Uno è un componente che puoi tenere in mano. L'altro è un servizio a cui puoi solo abbonarti.
Il prezzo non è il numero interessante.
Trenta centesimi per milione di token di input è la notizia principale, ma le cifre interessanti sono le due che determinano ciò che puoi chiedere. La prima è 512.000 token di output massimo — sei volte quello che GPT-5.6 Sol emetterà in una risposta, e il tetto di output più alto di qualsiasi modello in questo insieme di confronto. La seconda è 83 sul recall a contesto lungo, un valore sufficientemente alto da rendere la finestra di contesto una superficie di lavoro utilizzabile anziché un numero su una scheda tecnica.
Mettendo insieme queste cose, una specifica classe di attività diventa economica: generare la cosa lunga dalla fonte lunga. Un manuale tecnico di 400 pagine riscritto per un pubblico diverso. Una guida alla migrazione prodotta da un intero repository. Un riassunto di ricerca che è esso stesso lungo quanto un report. A $0.30 e $1.20 per milione, un lavoro che sarebbe una voce a quattro cifre su un modello di frontiera qui è un errore di arrotondamento — e il fatto che il tetto di output sia misurato in centinaia di migliaia di token anziché in decine di migliaia è ciò che lo rende una singola richiesta invece di venti.
C'è un'avvertenza che vale la pena menzionare sulla misurazione. Il pannello di latenza del nostro catalogo riporta un tempo mediano di 10,00 secondi al primo token per M3 nella stessa finestra di sette giorni che mostra 18,35 milioni di token di traffico, e quel valore si trova esattamente al limite superiore dell'intervallo visualizzato dal pannello. Interpretalo come un artefatto della finestra piuttosto che come una caratterizzazione del modello. Il dato sul traffico è quello che ti dice che le persone lo stanno effettivamente usando.

Il video è l'input che nessuno pianifica
La visione ormai è un requisito imprescindibile, quindi la modalità che continua a fare la differenza è il video. M3 lo accetta in modo nativo, insieme a testo e immagini, e questo cambia la forma di una pipeline anziché limitarsi ad aggiungere una funzionalità a un elenco. Un archivio di supporto di registrazioni dello schermo, una serie di clip della dashcam, un semestre di registrazioni di lezioni: in precedenza erano un problema di preelaborazione, in cui si campionavano i fotogrammi con uno strumento e li si descriveva con un altro. Un modello che legge direttamente il video fonde due fasi in un'unica chiamata.
Rende anche meno prevedibile il calcolo dei costi, perché guardare un video è costoso in un modo in cui il testo non lo è, e la cifra più alta in una fattura è di solito l'input che nessuno aveva messo a budget. Una tariffa bassa per token è ciò che rende sicuro sperimentare: a 0,30 $ per milione di token di input, un'acquisizione occasionale di cinque ore è abbastanza economica da poter essere prototipata invece che discussa in una riunione di pianificazione.
Cosa cambiano realmente i pesi aperti
MiniMax descrive M3 come un modello open-weight, il che significa che i pesi sono pubblicati anziché soltanto erogati, e si tratta di un tipo di garanzia diverso da quello di un abbonamento. Se MiniMax smettesse di erogarlo domani, o rivedesse i prezzi, o dichiarasse obsoleto l'identificativo, il modello non scomparirebbe: continuerebbe a funzionare sull'hardware che avevi già acquistato, con qualunque quantizzazione fosse compatibile. Ciò non rende l'auto-hosting più economico nel caso generale; servire da sé un grande mixture-of-experts sparso è un vero progetto di ingegneria. Rende la dipendenza sopravvivibile, che è un'affermazione diversa e quella che conta quando decidi su cosa costruire.
Un punto offre la garanzia opposta. OpenAI possiede il computer, il browser, i connettori e la quota, e il tuo rimedio se qualcosa cambia è smettere di usarlo. È un accordo equo — l'affitto è il modo in cui la maggior parte dei team dovrebbe iniziare — ma non è lo stesso accordo, e la differenza diventa visibile solo il giorno in cui conta.

Sei differenze che cambiano una decisione
• Garanzia — un servizio che può cambiare i termini, contro pesi che puoi tenere (MiniMax M3 è descritto come open-weight; un punto non è scaricabile in alcun senso)
Costo per unità di lavoro — non pubblicato per un punto, rispetto a 0,30 $ e 1,20 $ per milione di token, con letture in cache a 0,06 $, la tariffa più bassa in questo insieme di confronto
• Limite massimo per singola richiesta — non documentato per un punto, a fronte di 1.048.576 token di input e 512.000 token di output
• Modalità in ingresso — messaggi e dati delle app connesse per un dot, rispetto a testo, immagine e video per il modello
• Modalità escluse — modifiche all'interno di altro software, rispetto al testo e solo al testo
• Posizionamento indipendente — non esiste un benchmark per un punto; M3 ha un Artificial Analysis Intelligence Index di 29,2, collocandolo al sessantesimo posto su 145 modelli misurati, che è a metà classifica e vale la pena saperlo prima di presumere che la tariffa economica compri ragionamento di frontiera. Non è così.
Dove ognuno si guadagna la propria riga in fattura
La lettura onesta del profilo pubblicato di M3 è che si tratta di un modello di volume, non di frontiera: 92,9 su GPQA Diamond è competitivo, 59 su SWE Bench Pro è rispettabile, e l'Intelligence Index di fascia media è l'elemento rivelatore. I punti su cui vince sono il costo per unità di lavoro, il tetto di output, il video e la deployabilità, in quest'ordine. È un buon modello da mettere sotto lo strato costoso di una pipeline — le fasi di riepilogo, estrazione, trascrizione, generazione di testo lungo e fan-out di molti tentativi — e uno scarso da mettere in cima.
OrcaRouter lo serve come minimax/minimax-m3 al prezzo di listino del provider MiniMax con 0% di ricarico, in lo stesso catalogo di oltre 200 modelli dietro un'unica chiave, con failover automatico tra provider upstream e un DSL di routing per inviare una singola richiesta al modello che dovrebbe gestirla. Questa struttura è ciò che rende la suddivisione a due livelli pratica anziché teorica: la stessa chiave che raggiunge un modello economico per il volume raggiunge un modello di frontiera per le chiamate che devono essere corrette, e nulla arriva dentro un dot perché i dot non sono affatto nel catalogo — nessun endpoint, nessun identificatore, nessuna intelligenza sostitutiva.
Cosa fare lunedì
Se hai un corpus di audio o video e nessun modo economico per esaminarlo, inizia da lì: M3 è l'unico modello di questo set che legge i video in modo nativo a questo prezzo, e l'esperimento costa quasi nulla. Se hai una categoria di lavoro che continua a essere trascurata perché nessuno la insegue, dot è il prodotto pensato per quello, e il modello a consumo non pretenderà di esserlo.
Le due cose entrano in conflitto solo se si presume che una debba vincere. L'abbonamento insegue; il lettore scaricato legge. Possiedi il secondo, affitta il primo e mantieni il confine tra loro abbastanza esplicito da poter sostituire uno qualsiasi dei due senza riscrivere l'altro.

