
Dots vs Kimi K3: Uno legge l'intera biblioteca, l'altro va a cercarla
- typesafeNUOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M di token · 349 tok/s
- OpenAINUOVOOpenAI: GPT-6 Luna2026-09-2237Intelligenza
- OpenAINUOVOOpenAI: GPT-6 Sol2026-09-2248Intelligenza
- AnthropicNUOVOAnthropic: Claude Opus 5.52026-09-2258Intelligenza
- xAINUOVOGrok 4.72026-09-2146Intelligenza
- OrcaNUOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1M di token · 210 tok/s
- OrcaNUOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M di token · 680 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenza
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenza77Codice
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenza76Codice
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenza76Codice
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenza82Codice
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M di token · 49 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M di token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenza72Codice
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M di token · 219 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenza75Codice
- obsidianQwen3.8 27B2026-08-1534Intelligenza68Codice
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenza69Codice
- xAISpaceXAI: Grok 4.62026-08-1244Intelligenza77Codice
C'è un tipo specifico di lavoro che solo uno di questi due può svolgere, e vale la pena nominarlo prima di ogni altra cosa. Kimi K3, pubblicato da Moonshot AI il 15 luglio 2026, è un modello mixture-of-experts da 2,8 trilioni di parametri con una finestra di contesto di 1.048.576 token che accetta testo e immagini e restituisce testo, al prezzo di $3,00 per milione di token di input e $15,00 per milione di token di output, con letture in cache a $0,30. Dots è l'agente sempre attivo dell'azienda, annunciato al DevDay il 29 settembre 2026, con un proprio computer cloud e browser, connettori a più di 4.000 app e un posto dentro ChatGPT, Slack e Teams, funziona su GPT-6 Astra ed è incluso con Pro e Business Premium. K3 può contenere un intero archivio in una singola richiesta e rispondere a domande su di esso. Un dot può andare a recuperare il prossimo documento a cui non hai ancora pensato. Leggere e recuperare sono lavori diversi, e scegliere quello sbagliato è l'errore costoso.
Il numero che Kimi K3 detiene in assoluto
Il recall su contesti lunghi è la misura che separa il marketing dalla capacità reale, perché una grande finestra di contesto è banale da dichiarare e difficile da usare. K3 ottiene 88,7 in questa metrica — il valore più alto di qualsiasi modello che elenchiamo, sopra l'84 di GPT-5.6 Sol, l'83 di MiniMax M3 e l'82 di Gemini 3.1 Pro. Registra inoltre 93,5 su GPQA Diamond e 59,5 su SciCode, e porta un Artificial Analysis Coding Index di 76,2 che lo colloca nono su 138 modelli misurati e un Intelligence Index di 43,6 al diciannovesimo posto su 145. Sono tutti dati di terze parti, riportati nel nostro catalogo con le relative fonti allegate anziché ripetuti da un post di lancio.
Quello che ti offre è una classe di attività che semplicemente non si scompone: leggere un'intera base di codice prima di rispondere a una domanda su di essa, confrontare un anno di contratti con un nuovo modello, oppure sostenere una lunga sessione agentica senza che la sua parte centrale cada fuori dalla memoria. K3 è costruito esattamente per questo — Moonshot lo posiziona per agenti di programmazione e lavoro di conoscenza a lungo orizzonte — ed è insolito nel rifiutare del tutto i parametri di campionamento. Non c'è temperature, né top_p, né seed; la profondità di ragionamento è un'unica manopola chiamata reasoning_effort. È un compromesso deliberato: meno manopole, più coerenza nell'arco di una lunga sessione.

A cosa serve un punto, detto senza il marketing
Un dot è un lavoratore con un calendario. I suoi input sono banali — i tuoi messaggi, i dati della tua app, un compito che hai descritto in una frase — e il suo output è un cambiamento da qualche altra parte: un file spostato, un ticket aggiornato, un messaggio redatto e inviato dopo la tua approvazione, una pagina aperta nel suo browser. I materiali di lancio di OpenAI ne descrivono uno che porta avanti diversi progetti contemporaneamente e impara dai feedback, e la lettura onesta è che stai acquistando il tessuto connettivo, non l'intelligenza.
Il tessuto connettivo è la parte costosa da costruire. Un browser che si comporta come quello di una persona, connettori mantenuti dai fornitori delle app, una vista delle attività, varchi di approvazione, isolamento dalla propria macchina — niente di tutto ciò è difficile in linea di principio e tutto quanto è tedioso in pratica. È per questo che si paga l'abbonamento. Quello per cui non si paga è la misurabilità.
• Costo — incluso con Pro o Business Premium, quota non pubblicata (Dots) rispetto a 3,00 $ per milione di input e 15,00 $ per milione di output, letture dalla cache 0,30 $ (Kimi K3)
• Limite massimo per una richiesta — non documentato per un punto, a fronte di 1.048.576 token di contesto e di un 88,7 mobile-friendly nel recall su contesto lungo (Kimi K3)
• Input e output — messaggi e dati delle app connesse in ingresso, modifiche all'interno di altro software in uscita (Dots) rispetto a testo e immagine in ingresso, testo in uscita (Kimi K3)
• Controllo del campionamento — nessun controllo pubblicato (Dots) contro nessuna temperatura, nessun top_p e nessun seed, con la profondità di ragionamento impostata da reasoning_effort da solo (Kimi K3)
• Velocità che dovresti aspettarti — non documentata per un punto, rispetto a un tempo mediano di 8,82 secondi al primo token e circa 39 token di output al secondo nella nostra misurazione di sette giorni (Kimi K3)
• Prove indipendenti — demo dei fornitori e dichiarazioni sulle capacità, nessun benchmark (Dots) rispetto all'AA Coding Index 76,2 al nono posto su 138, GPQA Diamond 93,5, recall su contesto lungo 88,7 (Kimi K3)
La cosa che nessuno menziona quando si acquista un agente
Un abbonamento con una quota non pubblicata ha una proprietà che un listino prezzi non ha: non puoi distinguere tra un'attività economica e una costosa. Ogni lavoro costa lo stesso — nulla di marginale — fino esattamente al momento in cui non è più così, e allora la risposta arriva sotto forma di limite anziché di fattura. Per un team il cui lavoro è esplorativo, è una funzionalità. Per un team che deve attribuire i costi a un progetto, è un buco nella contabilità.
C'è anche un effetto di secondo ordine. Quando il costo marginale di una chiamata è invisibile, smetti di chiederti se la chiamata fosse necessaria, e l'ottimizzazione più economica in qualunque pipeline — non effettuare la richiesta — non è più disponibile per te. Un modello a consumo impone quella domanda ogni volta che qualcuno legge il tariffario.

Comporli senza fingere che siano alternative
La forma che funziona è un punto che se ne accorge e un modello a contesto lungo che legge. Arriva del lavoro — un documento in un drive condiviso, un messaggio in un thread — e il punto decide se è importante. Se lo è, il documento va a Kimi K3 con tutto il resto di cui potrebbe aver bisogno allegato, in una sola richiesta, e la risposta torna completamente ancorata alla fonte anziché a un riassunto della fonte. Il punto si occupa dei solleciti e della noiosa logistica; il modello si occupa della lettura, a un volume che nessun ciclo di piccole chiamate avrebbe assemblato correttamente.
Kimi K3 è instradato su OrcaRouter come kimi/kimi-k3 al prezzo di listino di Moonshot, senza alcun ricarico aggiunto, e si trova nello stesso catalogo di oltre 200 altri modelli dietro un'unica chiave, con failover automatico tra i provider upstream quando uno peggiora e un DSL di routing per comporre diversi modelli in un'unica chiamata. Questa è la metà a consumo della pipeline e nulla di più: i dots non sono nel catalogo, non esiste un endpoint per uno di essi e non esiste alcun identificatore a cui indirizzare una richiesta. Se il livello di lettura è la parte che devi controllare — e per qualsiasi cosa tu intenda far girare per un anno, di solito lo è — è quel livello che devi possedere.
Quale acquisto spreca denaro?
Comprare un dot per leggere un grande corpus è uno spreco, perché il dot recupererà e riassumerà invece di conservare tutto quanto, e il riassunto è il luogo in cui il dettaglio che ti serviva va a morire. Comprare Kimi K3 per inseguire un progetto su cinque applicazioni è uno spreco per il motivo speculare: un modello che risponde quando viene chiamato non ti chiama.
Se il lavoro è recupero e logistica, noleggia il worker. Se il lavoro è comprensione su larga scala, compra il contatore e dagli tutto in una volta. Le due cose si sovrappongono molto meno di quanto suggerisca la parola «agentico», e la sovrapposizione non è dove l'una o l'altra eccelle.

Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
