
Recensione del modello AI Inkling: Il primo modello a pesi aperti di Thinking Machines, testato e spiegato
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- qwenNUOVOQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 2030 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
- z-aiZ.ai: GLM 5.22026-06-1653Intelligenza69Codice60Matematica
Questa recensione del modello AI Inkling analizza attentamente il rilascio di debutto di Thinking Machines Lab, la startup guidata dall'ex CTO di OpenAI Mira Murati. Inkling è un modello open-weights, multimodale Mixture-of-Experts (MoE) con una finestra di contesto di 1 milione di token e un quadrante controllabile di "thinking effort". È veloce, economico da auto-ospitare e costruito per la personalizzazione piuttosto che per la supremazia nelle classifiche. Di seguito, separiamo i benchmark auto-dichiarati dal fornitore dalle misurazioni indipendenti, esaminiamo l'architettura, mostriamo come eseguirlo e spieghiamo esattamente chi dovrebbe (e non dovrebbe) adottarlo.
A partire dal: 16 luglio 2026 — un giorno dopo il lancio. Si tratta di una recensione basata su ricerche; non esistono ancora test pratici a lungo termine per nessun modello così nuovo, e segnaliamo ogni dato non verificato qui sotto.
Una nota per gli sviluppatori: se vuoi provare Inkling insieme ad altri modelli, OrcaRouter funge da front-end per i modelli disponibili tramite API con un singolo endpoint compatibile con OpenAI, così puoi confrontare e cambiare senza nuove integrazioni.
- TL;DR verdetto: Inkling è un modello open genuinamente capace ed efficiente, che eccelle per fine-tuning e deployment attento ai costi, ma non è un leader di frontiera e il suo creatore lo dice apertamente. Se vuoi una base personalizzabile e royalty-free con un'enorme finestra di contesto, è uno dei lanci più interessanti del 2026. Se vuoi il singolo modello più forte disponibile, cerca altrove.
- Cos'è: Un modello di ragionamento MoE (Mixture of Experts) con pesi aperti (Apache 2.0). A chi è rivolto: Professionisti che vogliono fare fine-tuning e auto-ospitare invece di pagare per un'API frontiera chiusa.
Punti chiave
Produttore e data: Thinking Machines Lab; rilasciato il 15 luglio 2026 come primo modello del laboratorio.
Architettura: Sparse MoE, 975B totali / 41B parametri attivi, 66 layer, fino a 1M token di contesto nei pesi (256K tramite API ospitate).
Licenza: Apache 2.0 — pesi completi su Hugging Face, gratuito per uso commerciale e self-hosting.
Posizionamento onesto: L'azienda afferma esplicitamente che “non è il modello più forte disponibile oggi, chiuso o aperto.”
Punteggio indipendente: 41/100 sull'Artificial Analysis Intelligence Index — #10 su 97 modelli, e davanti a diversi pari aperti (vedi riconciliazione sotto).
Costo: I pesi sono esenti da royalty per l'auto-hosting; l'accesso ospitato parte da circa $1.87 / 1M input tokens.
Avvertenza: Quasi tutti i benchmark principali sono auto-riportati dai venditori e non verificati indipendentemente.
Chi c’è dietro Inkling?
- Founder box. Inkling è il primo modello di Thinking Machines Lab (thinkingmachines.ai), fondato da Mira Murati, precedentemente Chief Technology Officer presso OpenAI. Il laboratorio ha operato in relativo silenzio prima di questo lancio e ha adottato una posizione di open-weights che contrasta con l'approccio closed-flagship del suo ex datore di lavoro. Thinking Machines non monetizza il modello stesso — le entrate fluiscono attraverso la sua Tinker piattaforma di fine-tuning e partner di hosting di terze parti. Questo modello di business è centrale per comprendere Inkling: i pesi sono un on-ramp gratuito, e l'azienda guadagna quando personalizzi o espandi.
Cos'è Inkling?
Inkling è un modello linguistico e di ragionamento di grandi dimensioni, open-weights, multimodale, Mixture-of-Experts, annunciato da Thinking Machines Lab il 15 luglio 2026 e rilasciato sotto la permissiva Apache 2.0 licenza con tutti i pesi su Hugging Face.
Ciò che rende notevole questo lancio è l'inquadramento. Invece di rivendicare una corona di frontiera, Thinking Machines descrive Inkling come un modello aperto versatile, efficiente e personalizzabile. In un'ammissione insolitamente sincera per un giorno di lancio, l'azienda afferma che Inkling “non è il modello più forte disponibile oggi, chiuso o aperto.” Questa onestà dà il tono a tutta questa recensione: Inkling è uno strumento progettato per essere adattato, auto-ospitato e messo a punto, non un trofeo di benchmark.
La copertura di Fortune e TechCrunch ha fatto eco a questa lettura. TechCrunch ha sostenuto che Inkling non minaccia OpenAI, Anthropic o Google al livello di frontiera, ma fa pressione sullo strato intermedio dei fornitori di hosting open-weights e delle piattaforme di fine-tuning. Forbes ha inquadrato la strategia dei pesi aperti di Murati come più vicina al manuale dei modelli aperti cinese (DeepSeek, Qwen, Kimi) che ai flagship chiusi statunitensi — una narrativa open-weights Stati Uniti contro Cina che attraversa gran parte dei commenti sul lancio.
Architettura e specifiche
Sotto il cofano, Inkling è un trasformatore sparso Mixture-of-Experts. Solo una frazione dei suoi parametri si attiva per token, il che mantiene l'inferenza efficiente nonostante l'elevato numero totale di parametri. I dettagli sono documentati nella scheda del modello ufficiale e nel blog di Hugging Face.
Parametri totali: 975B
Parametri attivi: 41B (MoE sparso)
Livelli: trasformatore solo decoder a 66 strati
Esperti: 256 instradati + 2 condivisi; 6 su 256 instradati per token (i 2 condivisi sempre attivi)
Instradamento: Sigmoid / aux-loss-free
Attenzione: Hybrid, 5:1 finestra scorrevole (locale) a globale; 8 KV heads
Codifica posizionale: appresiincorporamenti di posizione relativa (non RoPE)
Multimodalità: senza encoder — audio come spettrogrammi dMel, immagini come patch 40×40, alimentati direttamente
Extra: convoluzioni brevi (SConv); strati MTP per decodifica speculativa
Numeriche: BF16, MXFP8, NVFP4 (NVFP4 checkpoint per NVIDIA Blackwell)
Finestra di contesto: Fino a 1,000,000 di token nei pesi (256K sulle API ospitate)
Variante più piccola: Inkling-Small, 276B totali / 12B attivi (anteprima, pesi non ancora rilasciati)

Alcune scelte di progettazione distinguono Inkling da un MoE vanilla:
Disposizione degli esperti. Con 256 esperti instradati più 2 esperti condivisi, e 6 esperti instradati che si attivano per token, la coppia condivisa agisce come un "pozzo di esperti" sempre attivo che cattura la computazione comune mentre gli esperti instradati si specializzano. Il routing sigmoide senza perdita ausiliaria evita il termine di penalità di bilanciamento del carico utilizzato da molti progetti MoE.
Embedding di posizione relativi, non RoPE. La maggior parte dei modelli moderni a lungo contesto si basa su embedding rotatori; Inkling invece utilizza embedding di posizione relativi appresi, una scelta insolita a questa scala.
Multimodalità senza encoder. Invece di aggiungere encoder separati per visione e audio, Inkling acquisisce direttamente patch di immagini 40×40 e spettrogrammi audio dMel nello stack del trasformatore. Questo semplifica la pipeline e fa parte del motivo per cui il modello è descritto come nativamente multimodale.
MTP per decodifica speculativa. I livelli di predizione multi-token (MTP) funzionano come un bozzatore integrato, accelerando la generazione senza un modello di bozza separato.
Nota dell'editor — aggiungi immagine: Un diagramma a blocchi etichettato di uno strato Inkling — attenzione a finestra scorrevole vs attenzione globale (5:1), il router di esperti 256+2 con 6 esperti attivi evidenziati, SConv e la MTP drafter head.
Addestramento e la manopola dello “sforzo di pensiero”
Inkling è stato pre-addestrato su 45 trilioni di token multimodali che coprono testo, immagini, audio e video, utilizzando un ottimizzatore ibrido (Muon per i pesi delle matrici grandi, Adam per il resto) su sistemi NVIDIA GB300 NVL72. Il post-addestramento ha utilizzato apprendimento per rinforzo asincrono su larga scala esteso oltre 30M+ rollout su due lunghe esecuzioni continue, avviato da un iniziale fine-tuning supervisionato su dati sintetici.
Una caratteristica distintiva è un parametro controllabile di sforzo di ragionamento, mostrato variabile approssimativamente da 0,2 a 0,99, dove valori più alti significano più ragionamento e più costo. Ciò consente agli operatori di bilanciare latenza e spesa rispetto alla profondità di pensiero. Tutti i dati di benchmark qui sotto sono stati eseguiti con Effort = 0,99.
Sforzo di pensiero controllabile: una guida operativa
In deployment, il controllo dello sforzo è esposto come un enum reasoning_effort con i livelli nessuno / minimo / basso / medio / alto / xhigh / massimo. Non esiste un'unica impostazione “giusta”: è una leva dinamica per il compromesso tra latenza, costo e qualità. Utilizza la tabella seguente come mappa di partenza (indicazione relativa; la qualità di livello benchmark è stata misurata all'estremo superiore dell'intervallo):
nessuno / minimo. Latenza relativa e costo token: Il più basso; Ideale per: Classificazione, estrazione, formattazione, instradamento, incollaggio di recupero
basso. Latenza relativa e costo dei token: Basso; Migliore per: Domande e risposte brevi, riepilogo semplice, lavori batch ad alto volume
medio. Latenza relativa e costo dei token: Moderato; Ideale per: Chat generali, bozze, la maggior parte delle chiamate a strumenti degli agenti
Alto. Latenza relativa e costo dei token: Maggiore; Ideale per: Ragionamento multi-step, generazione di codice, analisi
xhigh / max. Latenza relativa e costo token: Massimo; Migliore per: Matematica difficile, ragionamento da competizione, parità di benchmark (Effort=0.99)

Puoi eseguirlo localmente? Hardware e VRAM
Poiché Inkling è un modello da 975 miliardi di parametri, "locale" significa realisticamente un server multi-GPU, non un laptop. Requisiti approssimativi (secondo la copertura del lancio e gli strumenti della comunità):
BF16 (completo). VRAM aggregata approssimativa: ~2 TB; Configurazioni di esempio: 8× NVIDIA B300 o 16× H200
NVFP4 (quantizzato). VRAM aggregata approssimativa: ~600 GB; Configurazioni di esempio: 4× NVIDIA B300, o 8× H200
GGUF (community). VRAM aggregata approssimativa: Varia per quant; Configurazioni di esempio: Esistono build Unsloth GGUF per ingombri più piccoli/quantizzati
Il checkpoint NVFP4 — spedito specificamente per NVIDIA Blackwell — riduce la memoria necessaria di circa due terzi rispetto a BF16, che è la differenza tra un nodo B300 con 8 GPU e uno con 4 GPU. Per la maggior parte dei team, questo indica ancora un fornitore di servizi hosted o un nodo GPU in affitto piuttosto che hardware di proprietà. Le quantizzazioni GGUF di Unsloth estendono ulteriormente la portata verso il basso della scala hardware per la sperimentazione, con qualche costo in termini di qualità.
Avvio rapido del deployment
Inkling espone un'API compatibile con OpenAI, quindi la maggior parte del codice client esistente funziona come drop-in con un URL di base e un nome di modello modificati. I tre percorsi di servizio comuni:
vLLM — server a comando singolo (porta predefinita 8000):
vllm serve thinkingmachines/Inkling --port 8000
# quindi chiama l'endpoint compatibile con OpenAI su http://localhost:8000/v1
SGLang — shard su 8 GPU (porta predefinita 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --porta 30000
Hugging Face transformers — carica tramite la classe auto multimodale:
datransformers importare AutoModelForMultimodalLM, AutoProcessor
modello = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processore = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# passare reasoning_effort in {nessuno, minimale, basso, medio, alto, molto alto, massimo}
Poiché l'endpoint è compatibile con OpenAI, migrare un'app esistente di solito consiste nel puntare il tuo SDK al nuovo base URL e impostare reasoning_effort a piacere. Ulteriori runtime al lancio includono TokenSpeed e Unsloth.
Dove eseguirlo: disponibilità del provider di inferenza
Se preferisci non gestire GPU, diversi partner ospitano Inkling. Opzioni "Run Inkling on X" al lancio:
Tinker (Thinking Machines). Ruolo: Fine-tuning; Note: Opzioni contesto 64K e 256K; 50% sconto di lancio a tempo limitato (a pagamento)
Together AI. Ruolo: Inferenza ospitata; Note: Endpoint compatibili con OpenAI
Fireworks. Ruolo: Inferenza ospitata; Note: —
Modal. Ruolo: Inferenza ospitata / GPU serverless; Note: —
Databricks. Ruolo: Inferenza ospitata; Note: via Unity AI Gateway
Baseten. Ruolo: Inferenza ospitata; Note: —
Benchmark: dichiarazioni del fornitore vs. misurazioni indipendenti
Questa è la sezione più importante di qualsiasi onesta Inkling review 2026, perché i numeri provengono da due luoghi molto diversi.
Informativa:Con la sola eccezione dell'Artificial Analysis Index, ogni benchmark Inkling di seguito è auto-dichiarato dal fornitore al lancio(Effort = 0.99, temperatura 1.0) e ha non è stato sottoposto a audit indipendente. I numeri dei concorrenti provengono da terze parti (MarkTechPost, Artificial Analysis) o sono stati rieseguiti da Thinking Machines, e sono analogamente non sottoposti a audit indipendente qui. Alcune cifre presentano qualificatori di harness o di sottoinsieme. Consideratele tutte come indicative, non come verità assoluta.
Punteggi autodichiarati del fornitore
Secondo gli stessi materiali di lancio di Thinking Machines:
AIME 2026 (matematica): 97,1%
GPQA Diamond (ragionamento scientifico): 87.2%
SWE-bench Verified (codifica, ambiente solo bash): 77.6%
SWE-bench Pro (Public): 54.3%
MMMU Pro (multimodale): 73.3%
VoiceBench (audio): 91.4%
MMAU (audio): 77.2%
IFBench (seguimento delle istruzioni): 79.8%
Terminal Bench 2.1 (terminale agentico): 63.8
FORTRESS Adversarial: 78.0%
SimpleQA Verificato: 43.9%
Sulla carta sembrano solidi, specialmente i dati di ragionamento matematico e scientifico. Ma l'azienda ha confrontato Inkling con versioni concorrenti di prossima uscita (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) utilizzando punteggi generati da sé. Quei numeri dei concorrenti potrebbero non corrispondere ai dati dichiarati dai rivali stessi, quindi i confronti diretti vanno presi con cautela.
Testa a testa tra più modelli (rivali con pesi aperti)
Il confronto più chiaro di Inkling con altri modelli a pesi aperti proviene da la tabella comparativa di MarkTechPost (riprodotta sotto, attribuita a MarkTechPost). È utile proprio perché mette i rivali in un unico quadro:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%
FORTRESS (avversario). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. Non sottoposto a revisione indipendente.
Il modello è chiaro e coerente con la modestia di Thinking Machines. Inkling è leader su FORTRESS (sicurezza avversaria) e batte Nemotron 3 Ultra su tutta la linea, ma è inferiore a GLM 5.2, Kimi K2.6 e DeepSeek V4 Pro su HLE, SWE-bench Verified e specialmente Terminal Bench 2.1 (63,8% contro l'82,7% di GLM 5.2). Se la codifica agentica e i compiti di terminale sono la tua priorità, i migliori modelli open cinesi sono in vantaggio oggi.
Misurazione indipendente (Artificial Analysis)
Per una lettura più neutrale, Artificial Analysis ha valutato Inkling il 2026-07-15 e lo ha posizionato a 41/100 sul suo Intelligence Index, classificato al #10 su 97 modelli. Due punti su come interpretare correttamente quella classifica:
È una buona prestazione di un modello open, non un #1 assoluto. Secondo Artificial Analysis, l'indice di Inkling di 41 si colloca davanti a Nemotron 3 Ultra (38), Gemma 4 31B (29) e gpt-oss-120b (24) — quindi tra i pari con pesi aperti è competitivo fino a leader. Ma #10 su 97 significa che nove modelli si posizionano più in alto in generale, coerente con l'inquadramento “capace, non all'avanguardia”.
L'efficienza è il suo punto di forza. Artificial Analysis nota una forte efficienza dei token — circa 25K token per completare il suo set di valutazione contro 37–43K per i modelli di confronto — e un Elo GDPval-AA v2 di 1238, davanti a Kimi (1190) e DeepSeek V4 Flash (1189), più un piccolo vantaggio (+2) su AA-Omniscience.
Velocità di output misurata 72.7 token/sec con un tempo di primo token di 1.75s. In breve: un rispettabile piazzamento nella top ten, e uno genuinamente efficiente — ma evitiamo deliberatamente di enfatizzarlo come una vittoria in classifica.

Capacità multimodali e di lungo contesto
Inkling accetta testo (UTF-8), immagini (da 40px a 4096px tramite un codificatore gerarchico a patch) e audio (WAV a 16kHz, fino a circa 20 minuti, utilizzando codifica a token discreti). L'output è solo testo — non c'è generazione di immagini o audio, quindi pianifica per un modello di comprensione, non di generazione. Il video è stato utilizzato durante il pre-training ma è non un input supportato o valutato al lancio, quindi non pianificare ancora in base ad esso.
La capacità principale è la finestra di contesto da 1 milione di token nei pesi rilasciati, che apre la strada all'analisi del codice dell'intero repository, alla sintesi di documenti lunghi e a sessioni di agente multi-turno estese senza chunking aggressivo. Nota la sfumatura pratica: le API ospitate espongono fino a 256K token, quindi l'intero 1M è una funzionalità self-host oggi. Combinata con il design dell'attenzione a finestra scorrevole e la decodifica speculativa, il tema del lungo contesto rimane uno dei punti di forza più pratici di Inkling.
Prezzi, livelli e costo totale di proprietà
Inkling è genuinamente aperto. I pesi completi (un checkpoint BF16 e un checkpoint NVFP4) sono su Hugging Face con licenza Apache 2.0, quindi il self-hosting è esente da royalty — paghi solo per il calcolo. Thinking Machines non monetizza il modello stesso; le entrate fluiscono attraverso Tinker e host terzi.
Prezzo ospitato per token (secondo Artificial Analysis), per livello di contesto:
64K. Input / 1M: $1.87; Input in cache / 1M: $0.374; Output / 1M: $4.68
256K. Input / 1M: $3.74; Input in cache / 1M: $0.748; Output / 1M: $9.36
Riflette uno sconto di lancio del 50% a tempo limitato; le cifre esatte per token di Tinker sono presenti nella documentazione e cambieranno.
Self-host vs API — come pensare al TCO. L'economia dipende dal volume e dall'utilizzo:
API (Tinker / partners): costo fisso zero, pagamento per token, avvio quasi istantaneo. Migliore per volumi bassi o irregolari, o durante la prototipazione.
Self-hosting (GPU in affitto o di proprietà): paghi per un nodo da 4–8 GPU indipendentemente dal fatto che sia occupato o meno, ma il costo marginale per token si avvicina al costo dell'elettricità grezza. Poiché Inkling attiva solo 41B parametri ed è efficiente in termini di token (~25K contro 37–43K secondo il set Artificial Analysis), il throughput per GPU-ora è favorevole, e carichi di lavoro pesanti e costanti possono risultare materialmente più economici rispetto ai prezzi per token delle API una volta che un nodo è ben utilizzato. I commenti al lancio hanno inquadrato il self-hosting di pesi aperti come all'incirca il 40–60% più economico rispetto all'uso di API chiuse su larga scala — un'affermazione direzionale, non un dato certificato.
Nota dell'editor — aggiungi un elemento visivo: Un grafico di pareggio — volume mensile di token (x) vs costo totale (y) con tre linee: closed frontier API, Inkling hosted API e Inkling self-hosted su un nodo GPU noleggiato — che mostra il punto di incrocio in cui l'auto-hosting vince.
Sicurezza, allineamento e censura
La sicurezza è uno degli aspetti più forti e differenziati di Inkling. Sul FORTRESS adversarial benchmark ottiene un punteggio di 78.0% — il migliore tra i modelli open-weight nel confronto di MarkTechPost, davanti a GLM 5.2 (71.3%), Kimi K2.6 (65.6%), e molto più avanti di DeepSeek V4 Pro (36.0%). Thinking Machines sottolinea anche l'incertezza calibrata negli output del modello.
La copertura di VentureBeat ha evidenziato una proprietà correlata: resistenza alla censura. Combinato con una licenza permissiva Apache 2.0, questo posiziona Inkling come un modello aperto che i team possono allineare alle proprie politiche piuttosto che ereditare un regime di contenuti opaco e imposto dal fornitore — una considerazione significativa per implementazioni regolamentate o specifiche per regione. Come sempre per un modello al giorno del lancio, nessun audit indipendente di red-team o di sicurezza di terze parti era emerso al momento della scrittura, quindi tratta il lead FORTRESS come proveniente dal fornitore/terze parti piuttosto che certificato esternamente.
Dovresti mettere a punto Inkling?
Il fine-tuning è probabilmente la ragione d'essere di Inkling. Un rapido quadro decisionale:
Ottimizza (tramite Tinker o la tua pipeline) se: hai dati proprietari, un dominio ristretto, o un compito in cui un modello specializzato più piccolo batte un generalista; devi possedere i pesi; o vuoi incorporare un tono, formato o policy specifici. Le opzioni di contesto Tinker da 64K/256K e lo sconto di lancio abbassano la barriera.
Usa solo il modello base (self-host o API) se: il tuo compito è di uso generale, il tuo volume è basso, o non hai ancora verificato che il fine-tuning migliori la tua metrica. L'ingegneria dei prompt combinata con la manopola reasoning_effort spesso ti porta abbastanza lontano.
Cerca altrove se: hai bisogno di codifica agentica di frontiera oggi (GLM 5.2 e Kimi K2.6 sono in testa in quei benchmark) oppure richiedi garanzie di qualità verificate in modo indipendente.
Pro e contro
Vantaggi
Pesi completamente aperti sotto Apache 2.0, esente da royalty per l'hosting autonomo e gratuito per uso commerciale.
Efficiente MoE sparso (solo 41B attivi) più una forte efficienza dei token mantiene il costo e la velocità di inferenza competitivi.
Massiccio contesto da 1M token nei pesi (256K via API).
Genuina multimodalità (testo, immagine, audio input).
Manopola dello sforzo di ragionamento controllabile (nessuno → massimo) per compromessi costi/qualità in tempo reale.
Sicurezza avversaria a peso aperto di prim'ordine (FORTRESS 78.0%, secondo MarkTechPost) e "resistenza alla censura".
Posizione forte e indipendente — tra i primi 10 su 97 nell'Artificial Analysis Index, davanti a Nemotron 3 Ultra, Gemma 4 31B e gpt-oss-120b.
Contro
Esplicitamente non un modello di frontiera, per stessa ammissione del produttore.
È in ritardo rispetto ai principali rivali aperti (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) nei benchmark agentici e di codifica (Terminal Bench 2.1, SWE-bench Verified, HLE).
La maggior parte dei benchmark sono auto-dichiarati dai fornitori e non sono sottoposti a verifiche indipendenti.
Output solo testo; nessuna generazione di immagini/audio; nessun input video al lancio; Inkling-Small è ancora in anteprima.
Un vero uso “locale” necessita di un nodo multi-GPU (~600 GB di VRAM anche quantizzato).
Nessuna revisione indipendente sostanziale, critica o di sicurezza/red-team era emersa al momento del lancio.
Chi dovrebbe usare Inkling?
Inkling è un'ottima scelta se sei un professionista o un team che vuole possedere e personalizzare il tuo modello piuttosto che noleggiare un'API chiusa. I casi d'uso ideali includono:
I team di fine-tuning che costruiscono modelli specifici per dominio tramite Tinker o la propria pipeline.
Distribuzioni ad alto volume e sensibili ai costidove l'hosting autonomo senza royalty supera i prezzi di frontiera per token.
Carichi di lavoro a contesto lungo come assistenza al codice a livello di repository, analisi di documenti e sessioni lunghe di agenti.
Applicazioni multimodali che necessitano di comprensione combinata di testo, immagine e audio.
Implementazioni sensibili alle politiche che desiderano una base aperta, con forte sicurezza e resistente alla censura, per allinearsi.
Non è adatto se hai bisogno delle prestazioni di ragionamento assolutamente più forti o di codifica agentica, hai bisogno di input video o output generativo, o richiedi benchmark controllati in modo indipendente prima della distribuzione.
Verdetto e valutazione finale
Parliamo direttamente dell'elefante: Inkling non è il modello più forte disponibile oggi, e Thinking Machines dice esattamente questo. Letto cinicamente, è una barra bassa. Letto onestamente, è il punto centrale: Inkling è ottimizzato per un obiettivo diverso che superare una classifica. È efficiente (41B attivi, budget di circa 25.000 token per attività), con licenza aperta (Apache 2.0), sicuro secondo gli standard dei pesi aperti (FORTRESS 78%), e costruito per essere messo a punto e auto-ospitato. Questa combinazione lo rende uno dei lanci di modelli aperti più ponderati del 2026, anche se è in ritardo rispetto a GLM 5.2 e Kimi K2.6 nei benchmark più difficili per agenti e codifica.
Gli asterischi rimanenti sono i benchmark in gran parte auto-dichiarati e l'assenza di qualsiasi revisione critica indipendente così presto. Ma per il suo pubblico di riferimento — costruttori che apprezzano la proprietà, la personalizzazione, il controllo dei costi e un'enorme finestra di contesto rispetto ai diritti di vanteria di frontiera — Inkling offre.
Valutazione: 4 su 5 per il suo pubblico target di costruttori e perfezionatori; più bassa se stai cercando strettamente capacità di frontiera.
Domande frequenti
Cos'è Inkling e chi l'ha creata? Inkling è il primo modello di Thinking Machines Lab, la startup di IA guidata da Mira Murati (ex CTO di OpenAI). È stato lanciato il 15 luglio 2026 come modello di ragionamento Mixture-of-Experts multimodale e con pesi aperti.
Inkling è il miglior modello di AI? No, e l'azienda non afferma che lo sia — afferma che Inkling “non è il modello più forte disponibile oggi, chiuso o aperto.” Misurazioni indipendenti (Artificial Analysis) lo classificano al #10 su 97 in totale, sebbene sia leader rispetto a diversi pari aperti.
Quanti parametri ha Inkling e qual è la finestra di contesto?975B totali con 41B attivi (sparse MoE), su 66 layer. La finestra di contesto arriva fino a 1.000.000 di token nei pesi rilasciati, e fino a 256K sulle API ospitate.
Inkling è open source e qual è la licenza? I pesi sono rilasciati sotto Apache 2.0, che consente uso commerciale e self-hosting. Sono “pesi aperti” — i pesi completi del modello sono su Hugging Face.
Inkling è gratuito da usare?I pesi sono gratuiti e senza royalty per l'auto-hosting. Il fine-tuning su Tinker e l'inferenza ospitata tramite fornitori come Together AI, Fireworks, Modal, Databricks o Baseten sono servizi a pagamento. L'accesso ospitato parte da circa $1,87 / 1 milione di token di input (uno sconto di lancio a tempo limitato).
Come eseguo o scarico Inkling, e di quale hardware ho bisogno? Scarica i pesi da Hugging Face e servili con vLLM, SGLang o Hugging Face transformers tramite un'API compatibile con OpenAI. Aspettati circa ~2TB di VRAM aggregata per BF16 (8× B300 / 16× H200) o ~600GB per il checkpoint quantizzato NVFP4 (4× B300 / 8× H200). Le build GGUF di Community Unsloth abbassano la soglia per la sperimentazione.
Come faccio a fare fine-tuning di Inkling? Usa Thinking Machines’ Tinker piattaforma, che offre opzioni di contesto da 64K e 256K e uno sconto di lancio limitato del 50%, oppure fai il fine-tuning dei pesi aperti nella tua pipeline.
Che cos'è lo sforzo di pensiero controllabile? Un'impostazione reasoning_effort (none / minimal / low / medium / high / xhigh / max) che scambia latenza e costo dei token con la profondità di ragionamento. Lo sforzo basso è adatto per classificazione ed estrazione; lo sforzo massimo è adatto per matematica difficile e corrisponde alla configurazione di benchmark (Effort=0.99).
Come si confronta Inkling con Kimi, GLM, DeepSeek e Nemotron?Secondo il confronto di MarkTechPost, Inkling è in testa su FORTRESS (sicurezza) e batte ampiamente Nemotron 3 Ultra, ma è in ritardo rispetto a GLM 5.2, Kimi K2.6 e DeepSeek V4 Pro su Terminal Bench 2.1, SWE-bench Verified e HLE. È competitivo ma non è il modello open più forte nel coding agentico.
Inkling può elaborare immagini, audio e video? Accetta testo, immagini (40px–4096px) e audio (WAV a 16kHz, fino a ~20 minuti) come input. L'output è solo testo — nessuna generazione di immagini o audio. Il video è stato utilizzato nel pre-addestramento ma non è un input supportato al lancio.
I punteggi di benchmark di Inkling sono affidabili? Trattali con cautela. A parte l'indipendente Artificial Analysis Intelligence Index, i numeri principali sono auto-dichiarati dal fornitore al momento del lancio e non sono verificati in modo indipendente. I dati della concorrenza provengono da terze parti (MarkTechPost) o sono stati rieseguiti da Thinking Machines e potrebbero non corrispondere ai numeri riportati dai rivali.
Cos'è Inkling-Small e cosa c'è nella roadmap? Inkling-Small è una variante più piccola (276B totali / 12B attivi). Al momento del lancio era ancora in anteprima, con i pesi non ancora rilasciati. Il modello principale già include strati MTP per decodifica speculativa.
Confrontati in questo articolo2
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
