Inkling-Small-1
Guides & Insights

Inkling-Small: il modello di un quarto delle dimensioni che batte il proprio modello di punta, e resta ancora indietro rispetto all'indice

Autore

Jim Song

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Thinking Machines Lab ha impiegato le due settimane successive al rilascio del suo primo modello a pesi aperti per costruirne uno di circa un quarto delle dimensioni, e nel proprio quadro di valutazione vince quello più piccolo. Inkling-Small riporta 80.2% su SWE-bench Verified rispetto a Inkling che ha il 77.6%, 89.5% su GPQA Diamond contro 87.2%, 64.7% su Terminal-Bench 2.1 contro 63.8%, e 31.6% su Humanity's Last Exam contro 29.7% — con 276B parametri totali e 12B attivi, piuttosto che 975B con 41B. Dei numeri principali che le due schede tecniche condividono, il modello di punta da 975B ne detiene esattamente uno: AIME 2026, con un margine di 1.6 punti.

Poi Artificial Analysis ha eseguito entrambi in modo indipendente e ha posizionato Inkling-Small a 40 sul suo Intelligence Index contro il 41 di Inkling — il modello più piccolo di un punto dietro. Entrambi questi risultati sono reali, e lo spazio tra loro è la cosa più utile di questa presentazione. Tutto ciò che segue separa ciò che Thinking Machines riferisce sul proprio modello da ciò che qualcun altro ha misurato: i dati del fornitore provengono dall'annuncio e dalle due schede dei modelli di Hugging Face, i dati indipendenti dalle esecuzioni di Artificial Analysis, e i numeri di prezzo e contesto dai dati dell'endpoint live di OpenRouter, verificati il giorno in cui è stato scritto questo. Dove questi tre non concordano — e sulla lunghezza del contesto lo fanno — lo diciamo piuttosto che scegliere quello lusinghiero.

Cosa è stato effettivamente spedito il 30 luglio

{{1}}Inkling-Small è un transformer a miscela sparsa di esperti: 276B parametri in totale, 12B attivi per token, 42 strati, con ogni token instradato a 6 dei 256 esperti più 2 esperti condivisi che si attivano su tutto.{{/1}} {{2}}L'attenzione alterna strati locali e globali.{{/2}} {{3}}I pesi sono su Hugging Face sotto Apache 2.0 senza restrizioni commerciali, si può mettere a punto sull'API Tinker di Thinking Machines, e puoi parlarci in testo, immagine e audio nel Tinker Playground.{{/3}} {{4}}Il laboratorio afferma che è stato addestrato su sistemi NVIDIA GB300 NVL72.{{/4}}

Inkling-Small-2

La multimodalità è nativa, non una funzionalità aggiunta a posteriori, e la scheda è insolitamente specifica sul come. Non esiste un encoder separato per la visione o per l'audio: l'audio arriva come spettrogrammi dMel, le immagini come patch di 40×40 pixel elaborate da un hMLP a quattro strati, ed entrambi vengono incorporati direttamente nello stesso flusso di token del testo. L'input è testo, immagini e audio; l'output è solo testo, il che vale la pena di dire chiaramente, perché "multimodale" viene interpretato come "sa parlare" abbastanza spesso da causare un brutto pomeriggio. Lo sforzo di pensiero è una manopola con cinque impostazioni — minimo, basso, medio, alto, extra-alto — così gli stessi pesi possono girare a costo ridotto o a piena potenza.

La parte interessante della ricetta è il post-addestramento. Inkling-Small è stato distillato on-policy con l'Inkling completo come insegnante, e poi ha ricevuto circa due settimane aggiuntive di apprendimento per rinforzo potenziato sulla codifica agentica. Quest'ordine spiega la forma dei risultati: lo studente ha ereditato la competenza generale dell'insegnante, poi ha ricevuto un addestramento extra proprio sull'asse in cui ora supera l'insegnante.

Il tabellone pubblicato da Thinking Machines

I benchmark dei fornitori sono marketing finché qualcuno non li riproduce, quindi leggi questa sezione come ciò che il laboratorio afferma, non come ciò che è stato verificato. È comunque un set ampio, e lo è in una direzione poco lusinghiera per il modello di punta.

Inkling-Small-3

Oltre ai quattro numeri condivisi, la scheda completa il resto del quadro — tutte le esecuzioni proprie di Thinking Machines:

Lavoro agentico — 1269 Elo su GDPval-AA v2, un benchmark di compiti economici realistici anziché enigmi.

Grafici e documenti — 77,4% su CharXiv RQ, che sale all'81,3% quando al modello è consentito scrivere ed eseguire Python. Questo balzo di 3,9 punti è un utile indizio che l'accesso agli strumenti offre più vantaggi nel lavoro di ragionamento visivo rispetto all'ingegneria dei prompt.

Vision — 74,0% su MMMU Pro, un filo sopra il 73,5% di Inkling.

Audio — 90.1% VoiceBench e 77.0% MMAU, entrambi di poco sotto il 91.4% e 77.2% del modello di punta. L'audio è uno dei due punti in cui la riduzione è chiaramente costata qualcosa.

Sicurezza — 98,4% StrongREJECT e 96,9% sui prompt benigni FORTRESS, ma 71,6% sui prompt avversari di FORTRESS contro il 78,0% del modello di punta. Questo è l'altro costo: una regressione di 6,4 punti nella robustezza avversaria, che conta più di qualsiasi guadagno in termini di codifica se il modello deve trovarsi dietro una casella di testo pubblica.

Forecasting — Indice di Brier di 61.3 ± 0.46 su ForecastBench senza accesso alla ricerca, e punteggio di Brier di 0.1238 ± 0.0086 su Prophet Arena. Riportare anche solo le barre di errore è più disciplina di quanto faccia la maggior parte dei post di lancio.

Una lacuna: la scheda del modello di punta riporta il 54,3% su SWE-bench Pro, il fratello più difficile di SWE-bench Verified. La scheda di Inkling-Small non riporta SWE-bench Pro. Dato quanto risalto viene dato al numero di Verified, la sua assenza è il dato che più vorremmo vedere colmato.

Cosa dice invece l'indice indipendente

Artificial Analysis colloca Inkling-Small a 40 sulla versione 4.1 del suo Intelligence Index, un punto sotto Inkling a 41. L'indice è un composto di nove valutazioni — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR — e questo elenco spiega gran parte dell'apparente contraddizione. Solo due delle nove si sovrappongono alla vetrina di ragionamento sulla scheda di Thinking Machines. Il resto è orientato verso l'uso agentico di strumenti, il recupero a lungo contesto e la resistenza alle allucinazioni, e un modello può vincere i benchmark che un laboratorio sceglie di pubblicare mentre perde quelli che una terza parte sceglie di eseguire. Nessuna delle due parti sta mentendo; stanno misurando cose diverse.

Inkling-Small-4

C'è anche un dettaglio nelle scritte in piccolo che vale più del titolo che annuncia il vantaggio di un punto: Artificial Analysis elenca la voce del modello di punta come Inkling (xhigh) — la sua impostazione di massimo sforzo di pensiero — mentre la riga Inkling-Small non riporta alcun suffisso di sforzo. Quindi il vantaggio di un punto del modello di punta è stato registrato con la manopola del ragionamento al massimo. Se l'equiparazione dello sforzo spostasse anche solo di poco quel confronto, l'ultimo argomento a favore del modello più grande basato sulla sola capacità verrebbe meno.

Dove i dati indipendenti non sono affatto vicini è nella velocità e nei costi, e qui il vantaggio va al modello piccolo con margini che nessuna tabella di benchmark riesce a comunicare:

Velocità di output — 133 token al secondo rispetto a 80 per Inkling (xhigh). Artificial Analysis classifica Inkling-Small al 7° posto su 101 modelli della sua classe per velocità, contro una mediana di classe di 66.

Tempo al primo token — 1,63s rispetto a 1,84s. Un vantaggio reale ma minimo.

Blended price per 1M tokens — $0.22 versus $0.72 on their weighting. Roughly a third the cost, for one index point less.

Classifica di intelligenza#15 su 101, contro il punteggio mediano della classe, pari a 25. Comodamente sopra la media, ben lontano dalla frontiera.

Prolissità — e qui sta il punto. Ha bruciato 130M token di output per attraversare l'indice, contro una mediana di 100M. Il riepilogo di Artificial Analysis lo definisce "notevolmente veloce, ma un po' prolisso." Pensa circa il 30% in più rispetto al tipico, il che riduce silenziosamente parte dello sconto per token.

Una piccola nota contabile, dato che chiunque confronti le fonti ci si imbatterà: Artificial Analysis elenca il numero di parametri come 266B in totale, mentre l'annuncio, entrambe le model card e OpenRouter dicono tutti 276B. Abbiamo usato 276B ovunque. Non cambia alcuna conclusione, ma è il tipo di discrepanza che vale la pena conoscere prima di citare un numero in un documento di progettazione.

Ciò che puoi effettivamente noleggiare oggi, che non è ciò che dice la scheda tecnica.

Il divario tra un annuncio di pesi aperti e un endpoint utilizzabile è il punto in cui la maggior parte della copertura del lancio smette di prestare attenzione. Thinking Machines pubblicizza una finestra di contesto fino a 1 milione di token, e Artificial Analysis elenca anch'essa 1 milione. Su OpenRouter, entrambi i fornitori che attualmente servono Inkling-Small la limitano a 524.288 token — la metà della cifra pubblicizzata. Non è tanto una contraddizione quanto una differenza tra ciò che l'architettura supporta e ciò che qualcuno ha effettivamente messo in produzione. Per contrasto, il modello di punta Inkling ha un endpoint alla piena dimensione di 1.048.576 token, sebbene lo stesso endpoint limiti i completamenti a 32.768 token.

Il resto del quadro in tempo reale, letto dai dati degli endpoint di OpenRouter:

Due fornitori, due prezzi — $0,45 per 1M di input e $1,20 per 1M di output da uno, $0,50 e $1,20 dall'altro. Artificial Analysis elenca la tariffa first-party di Thinking Machines ancora più bassa, a $0,30 e $1,20, con input in cache a $0,06. L'hosting di terze parti applica un sovrapprezzo del 50–67% sull'input per gli stessi pesi.

Cache dei prompt — $0,10 per 1M di token di input in cache tramite OpenRouter, contro $0,17 per il modello di punta.

I valori numerici che affitti non sono quelli che sono stati sottoposti a benchmark — la scheda del modello elenca BF16 e NVFP4. L'endpoint più economico serve fp8; l'altro non dichiara alcuna quantizzazione. I punteggi dei benchmark del fornitore non sono stati misurati su un servizio fp8 di questi pesi, e gli effetti della quantizzazione su esecuzioni agentiche lunghe sono esattamente il tipo di cosa che un margine di 0,9 punti su Terminal-Bench non può sopravvivere. Se stai riproducendo un numero, nota quale endpoint hai usato.

La copertura delle funzionalità è disomogenea da un provider all'altro — entrambi gli endpoint espongono reasoning e reasoning_effort, quindi la manopola del ragionamento a cinque impostazioni funziona. Ma solo uno pubblicizza tool calling e logprobs, e nessuno dei due attualmente pubblicizza response_format, il parametro per l'output strutturato/modalità JSON. L'ammiraglia Inkling ha un endpoint che lo supporta. Se la tua pipeline dipende da JSON con schema obbligatorio, questo è il dettaglio che ti si ritorcerà contro fin dal primo giorno, ed è una limitazione del provider, non del modello.

Tetto di completamento — 262.144 token sull'endpoint fp8; l'altro non dichiara alcun limite.

Il caso dei costi, sui conteggi dei token misurati

I prezzi per milione di token sono un cattivo modo per confrontare i modelli di ragionamento, perché la vera variabile è quanti token consumano pensando. Artificial Analysis pubblica la spesa effettiva, che è uno strumento molto migliore: far passare Inkling-Small attraverso l'intero Intelligence Index ha consumato circa 130M token di output ed è costato $192.37, che equivale a circa $0.07 per compito sulla loro media ponderata.

Metti questo a confronto con la stessa misurazione per i modelli che le persone effettivamente mettono in produzione: DeepSeek V4 Flash a $0.03 per attività, gpt-oss-120b a $0.08, Gemini 3.6 Flash a $0.56, GLM-5.2 a $0.57, Kimi K3 a $0.86, GPT-5.6 Sol a $1.23, Claude Opus 5 a $2.34, Claude Fable 5 a $3.15. Inkling-Small è il secondo modello più economico di quel gruppo e circa 18 volte più economico per attività rispetto a GPT-5.6 Sol, che ottiene 59 contro i suoi 40.

C'è anche un modo più pulito per capire perché il prezzo è sceso dove è sceso. I parametri attivi sono scesi da 41B a 12B, un fattore di 3.4. Il prezzo di output è sceso da $4.05 a $1.20 per milione, un fattore di 3.375. Il prezzo di noleggio di una MoE sparsa è essenzialmente solo il suo costo di calcolo per token, e Thinking Machines ha fatto pagare di conseguenza piuttosto che prezzare in base al benchmark.

Una nota pratica su come eseguire tu stesso quel confronto: Inkling-Small oggi non è nel catalogo OrcaRouter, quindi lo affitteresti dai suoi stessi endpoint. I modelli chiusi con cui lo confronteresti — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash e il resto di quella lista — si trovano su OrcaRouter dietro un'unica chiave con un ricarico dello 0%, il che significa che paghi il prezzo di listino di ogni provider senza alcun sovrapprezzo. Questo è particolarmente rilevante per un modello di costo: il numero che inserisci nel foglio di calcolo è quello che viene addebitato, e quando un provider taglia i prezzi, da noi arriva lo stesso giorno, non dopo una rinegoziazione. Il failover automatico tra provider copre l'altra metà di una valutazione, cioè il braccio di base che si interrompe a metà esecuzione e inquina silenziosamente i tuoi numeri.

Dove si colloca effettivamente tra i modelli open-weight

Letto in confronto al modello di punta, Inkling-Small sembra un trionfo. Letto in confronto alla concorrenza, sembra un solido modello open-weights di metà classifica, e la copertura del lancio ha per lo più saltato la seconda lettura.

Nell'Artificial Analysis Intelligence Index, i modelli che precedono entrambi gli Inklings includono Claude Opus 5 a 61, Claude Fable 5 a 60, GPT-5.6 Sol a 59, Kimi K3 a 57, Grok 4.5 a 54, GLM-5.2 e Muse Spark 1.1 a 51, e Gemini 3.6 Flash a 50. Ciò è previsto: si tratta di sistemi all'avanguardia, per lo più chiusi, alcuni dei quali enormi.

Quello che dovrebbe effettivamente cambiare una decisione è DeepSeek V4 Flash, che ottiene 50 contro i 40 di Inkling-Small con 284B totali e 13B attivi — praticamente la stessa classe dimensionale e lo stesso affare open-weights, a meno della metà del costo per attività. Se ciò che vuoi è il modello open-weight capace più economico, i numeri indipendenti puntano lì, non qui. È anche, a differenza di Inkling-Small, disponibile tramite OrcaRouter, quindi testare quell'alternativa sul tuo carico di lavoro è un cambio di stringa del modello piuttosto che un esercizio di procurement.

Ciò che Inkling-Small ha e DeepSeek V4 Flash non ha è l'input nativo di audio e immagini negli stessi pesi, un selettore di pensiero a cinque livelli e il fine-tuning Tinker del laboratorio che lo ha addestrato. Questi sono veri differenziatori per un agente multimodale, e sono il motivo onesto per sceglierlo — non il punteggio dell'indice.

Chi dovrebbe spostarsi, e chi dovrebbe restare al suo posto.

La decisione si divide nettamente, il che è abbastanza insolito da meritare di essere dichiarato esplicitamente.

Move from Inkling to Inkling-Small if you are running coding agents. The vendor numbers favour the small model on SWE-bench Verified and Terminal-Bench, the extra agentic RL is the documented reason, and it costs about a third as much and returns tokens 1.66× faster. Paying 3.3× for one index point measured at maximum thinking effort is a hard case to make.

Passa se il costo per task di ragionamento è il vincolo stringente e puoi accontentarti di un 40 sull'indice. $0,07 per task con un tasso di cache-hit di $0,06 per milione sull'endpoint di prima parte è un prezzo aggressivo per un modello con audio e visione nativi.

Passa se stai facendo fine-tuning. Un modello 276B/12B è notevolmente più economico da adattare e servire rispetto a 975B/41B, e Tinker supporta entrambi.

Resta su Inkling se hai bisogno di audio lungo. Questa è la regressione più marcata del rilascio ed è nascosta nelle schede dei modelli: il modello di punta raccomanda input audio sotto i 20 minuti, mentre la scheda di Inkling-Small raccomanda sotto i 2 minuti. Una riduzione di dieci volte. Se stavi trascrivendo o analizzando riunioni, il modello piccolo non è un sostituto diretto a nessun prezzo.

Resta se hai bisogno di contesto oltre 512K da un endpoint ospitato, o di completamenti più lunghi di 262K token. Oggi solo il modello di punta ha un endpoint che serve il milione completo.

Resta se ti serve JSON con schema imposto senza dover scrivere il tuo loop di validazione e retry, finché un provider non offre response_format per il modello piccolo.

Resta se la robustezza avversariale è portante. Il 71,6% contro il 78,0% su FORTRESS adversarial è la direzione sbagliata per qualsiasi cosa rivolta all'utente, ed è il numero del laboratorio stesso.

Tre domande che la copertura del lancio ha lasciato aperte

Inkling-Small è solo una versione distillata di Inkling?

In parte, e la parte che non lo è è quella che conta. La distillazione on-policy con Inkling come insegnante è stata una fase del post-training, quindi gran parte della capacità generale è effettivamente ereditata. Ma questo è un modello con architettura separata: 42 livelli contro i 66 del modello di punta, con la stessa topologia di routing di 6 esperti attivi su 256 più 2 condivisi, il che significa che gli esperti stessi sono più stretti piuttosto che meno numerosi. E ha ricevuto circa due settimane di RL di coding agentico che l'insegnante non ha mai avuto. Quell'ultima fase è il motivo per cui uno studente distillato supera il suo insegnante nei benchmark di coding, cosa che altrimenti non dovrebbe accadere.

Posso realisticamente auto-ospitarlo?

{{1}}Solo su hardware serio.{{/1}} {{2}}276B di parametri corrispondono a circa 276GB di pesi in 8-bit e a circa 552GB in BF16, prima di qualsiasi KV cache — in ogni caso un nodo multi-GPU, non una workstation.{{/2}} {{3}}Il vantaggio del MoE sparso è il costo di inferenza, non l'ingombro di memoria; si memorizzano tutti i 276B e si calcola con 12B.{{/3}} {{4}}La scheda indica SGLang, vLLM, TokenSpeed, Unsloth e Hugging Face Transformers come percorsi di servizio supportati e elenca le numeriche BF16 e NVFP4.{{/4}} {{5}}Nota anche che entrambi gli endpoint ospitati oggi servono una versione quantizzata, quindi "lo stesso modello" self-hosted in BF16 non si comporterà in modo identico all'API che hai testato.{{/5}}

La 975B Inkling ha ancora una ragione di esistere?

Tre, e sono tutte limitate: il contesto servito completo da 1 milione di token, input audio più lunghi di due minuti e un migliore comportamento di sicurezza avversariale. È interessante notare che "è più intelligente" non figura con certezza in quella lista — un punto di indice al massimo sforzo di pensiero, contro una serie di benchmark del fornitore che il modello più piccolo per lo più vince, non è un argomento di capacità. Due settimane dopo il lancio di un'ammiraglia da 975B, Thinking Machines ha rilasciato il modello che rende difficile consigliarla. Questo è o una franchezza insolita o una velocità insolita, e in ogni caso è un buon segno per il laboratorio.

Cosa guardare dopo

Tre cose decideranno come invecchierà questo rilascio. Se un endpoint apparirà a servire il contesto da 1M pubblicizzato, il che eliminerebbe il vantaggio più chiaro rimasto al modello di punta. Se qualcuno pubblicherà un confronto indipendente a parità di sforzo tra i due modelli, che è l'unico modo per sapere se quel punto indice è reale. E se la raccomandazione audio di 2 minuti sia un limite di addestramento o un'impostazione predefinita di servizio — perché se fosse quest'ultima, la ragione principale per restare sul modello più grande svanisce. Fino ad allora, il riepilogo onesto è che Thinking Machines ha rilasciato un modello che costa un terzo, è due terzi più veloce, migliore nella programmazione secondo le proprie prove, marginalmente indietro nei punteggi aggregati indipendenti, e chiaramente indietro rispetto a un rivale della stessa dimensione che la maggior parte della copertura non ha menzionato.

© 2026 OrcaRouter

Per i provider

Gestisci una piattaforma di inferenza? Porta i tuoi modelli su OrcaRouter.

Contattaci

Unisciti alla community

DiscordEmailXGitHubYouTube