Inkling AI Model Review: Thinking Machines’ eerste open-gewichten model, getest en uitgelegd
Guides & Insights

Inkling AI Model Review: Thinking Machines’ eerste open-gewichten model, getest en uitgelegd

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Deze Inkling AI model review neemt een grondige blik op de debuutrelease van Thinking Machines Lab, de startup onder leiding van voormalig OpenAI CTO Mira Murati. Inkling is een open‑weights, multimodaal Mixture‑of‑Experts (MoE) model met een contextvenster van 1 miljoen tokens en een regelbare “thinking effort” dial. Het is snel, goedkoop om zelf te hosten, en gebouwd voor maatwerk in plaats van leaderboard‑dominantie. Hieronder scheiden we de door de leverancier zelf gerapporteerde benchmarks van onafhankelijke metingen, doorlopen we de architectuur, laten we zien hoe je het kunt uitvoeren, en leggen we precies uit wie het zou moeten (en niet zou moeten) adopteren.

Per: 2026-07-16 — één dag na lancering. Dit is een onderzoeksgedreven beoordeling; er bestaat nog geen langdurige praktijktest voor enig model dat zo nieuw is, en we markeren elk onbevestigd cijfer hieronder.

Een opmerking voor bouwers: als je Inkling naast andere modellen wilt uitproberen, OrcaRouter biedt API-beschikbare modellen aan via een enkel OpenAI-compatibel eindpunt, zodat je kunt vergelijken en wisselen zonder nieuwe integraties.

- TL;DR oordeel: Inkling is een echt capabel, efficiënt open model dat uitblinkt voor fine-tuning en kostenbewuste implementatie, maar het is geen toonaangevend model en de maker zegt dat openlijk. Als je een aanpasbare, royalty-vrije basis wilt met een enorm contextvenster, is het een van de interessantste lanceringen van 2026. Als je het allersterkste model wilt dat beschikbaar is, kijk dan elders.

- Wat het is: Een open-weights (Apache 2.0) MoE redeneermodel. Voor wie het is: Professionals die willen finetunen en zelf hosten in plaats van te betalen voor een gesloten frontier-API.

Belangrijkste conclusies

Maker & datum: Thinking Machines Lab; uitgebracht op 15 juli 2026 als het eerste model van het lab.

Architectuur: Sparse MoE, 975B totaal / 41B actieve parameters, 66 lagen, tot 1M-token context in de gewichten (256K via gehoste API's).

Licentie: Apache 2.0 — volledige gewichten op Hugging Face, gratis voor commercieel gebruik en self-hosting.

Eerlijke positionering: Het bedrijf stelt ronduit dat het “niet het sterkste model is dat vandaag beschikbaar is, gesloten of open.”

Onafhankelijke score: 41/100 op de Artificial Analysis Intelligence Index — #10 van 97 modellen, en voor op verschillende open peers (zie reconciliatie hieronder).

Kosten: Gewichten zijn royaltyvrij om zelf te hosten; gehoste toegang begint bij ongeveer $1.87 / 1M input tokens.

Let op: Bijna alle prominente benchmarks worden door leveranciers zelf gerapporteerd en niet onafhankelijk gecontroleerd.

Wie zit er achter Inkling

- Oprichtersbox.Inkling is het eerste model van Thinking Machines Lab (thinkingmachines.ai), opgericht door Mira Murati, voorheen Chief Technology Officer bij OpenAI. Het lab opereerde in relatieve stilte voor deze lancering en heeft een open-gewichten-houding aangenomen die contrasteert met de gesloten-vlaggenschipbenadering van Murati's voormalige werkgever. Thinking Machines doet niet het model zelf te gelde maken — inkomsten stromen via zijn Tinker fine-tuning-platform en externe hostingspartners. Dat bedrijfsmodel is essentieel om Inkling te begrijpen: de gewichten zijn een gratis instap, en het bedrijf verdient wanneer je aanpast of opschaalt.

Wat is Inkling?

Inkling is een open-weights, multimodaal, Mixture-of-Experts groot taal- en redeneermodel, aangekondigd door Thinking Machines Lab op 15 juli 2026 en uitgebracht onder de permissieve Apache 2.0 licentie met volledige gewichten op Hugging Face.

Wat deze lancering opmerkelijk maakt, is de framing. In plaats van te claimen een grensverleggende kroon te veroveren, beschrijft Thinking Machines Inkling als een veelzijdig, efficiënt, aanpasbaar open model. In een ongewoon openhartige bekentenis voor een lancering, stelt het bedrijf dat Inkling “is niet het sterkste model dat vandaag beschikbaar is, gesloten of open.” Die eerlijkheid bepaalt de toon voor deze hele recensie: Inkling is een hulpmiddel dat is ontworpen om te worden aangepast, zelf gehost en fijn afgesteld, geen benchmark-trofee.

Berichtgeving van Fortune en TechCrunch herhaalde deze lezing. TechCrunch betoogde dat Inkling geen bedreiging vormt voor OpenAI, Anthropic of Google op het grensgebied, maar in plaats daarvan druk uitoefent op de middenlaag van aanbieders van open-weight hosting en fine-tuning platforms. Forbes schetste Murati's open-weights strategie als dichter bij het Chinese open-model draaiboek (DeepSeek, Qwen, Kimi) dan bij gesloten Amerikaanse vlaggenschepen — een VS-versus-China open-weights verhaal dat door een groot deel van het lanceringcommentaar loopt.

Architectuur en specificaties

Onder de motorkap is Inkling een schaarse Mixture-of-Experts-transformer. Slechts een fractie van zijn parameters wordt per token geactiveerd, wat de inferentie efficiënt houdt ondanks het grote totale aantal parameters. De details zijn gedocumenteerd in de officiële modelkaart en de Hugging Face-blog.

Totale parameters: 975B

Actieve parameters: 41B (sparse MoE)

Lagen: 66-laags decoder-only transformator

Deskundigen: 256 gerouteerd + 2 gedeeld; 6 van de 256 gerouteerd per token (de 2 gedeelde altijd actief)

Routering: Sigmoid / aux-loss-free

Let op: Hybride, 5:1 schuifvenster (lokaal) naar globaal; 8 KV koppen

Positiecodering: Geleerde relatieve positie-embeddings (niet RoPE)

Multimodaliteit: Encoder-vrij — audio als dMel-spectrogrammen, afbeeldingen als 40×40-patches, rechtstreeks gevoed

Extra's: Korte convoluties (SConv); MTP lagen voor speculatieve decodering

Numerieken: BF16, MXFP8, NVFP4 (NVFP4 checkpoint voor NVIDIA Blackwell)

Contextvenster: Tot 1.000.000 tokens in de weights (256K op hosted API's)

Kleinere variant: Inkling-Small, 276B totaal / 12B actief (preview, gewichten nog niet uitgebracht)

Een paar ontwerpkeuzes onderscheiden Inkling van een vanilla MoE:

Expert lay-out. Met 256 gerouteerde experts plus 2 gedeelde experts, en 6 gerouteerde experts die per token vuren, fungeert het gedeelde paar als een altijd actieve "expert sink" die gemeenschappelijke berekeningen opvangt terwijl de gerouteerde experts specialiseren. Hulpverliesvrije sigmoïde-routering vermijdt de strafterm voor belastingsevenwicht die door veel MoE-ontwerpen wordt gebruikt.

Relatieve positie-embeddings, niet RoPE. De meeste moderne modellen voor lange context vertrouwen op rotatie-embeddings; Inkling gebruikt daarentegen aangeleerde relatieve positie-embeddings, een ongebruikelijke keuze op deze schaal.

Encoder-vrije multimodaliteit. In plaats van aparte visie-/audio-encoders toe te voegen, voert Inkling 40×40 beeldpatches en dMel-audiospectrogrammen rechtstreeks in de transformer-stack in. Dit vereenvoudigt de pijplijn en is mede de reden waarom het model wordt beschreven als native multimodal.

MTP voor speculatieve decodering. Multi-token-prediction (MTP)-lagen fungeren als een ingebouwde opsteller, wat generatie versnelt zonder een apart draftmodel.

Redacteurnotitie — voeg visual toe:Een gelabeld blokdiagram van één Inkling-laag — sliding-window versus globale aandacht (5:1), de 256+2 expert-router met 6 actieve experts gemarkeerd, SConv, en de MTP-drafterskop.

Training en de “denkinspanning”-knop

Inkling werd voorgetraind op 45 biljoen multimodale tokens tekst, afbeeldingen, audio en video omvattend, gebruikmakend van een hybride optimizer (Muon voor grote matrixgewichten, Adam voor de rest) op NVIDIA GB300 NVL72-systemen. Post-training gebruikte grootschalig asynchroon reinforcement learning, opgeschaald tot meer dan 30 miljoen+ rollouts over twee lange continue runs, opgestart vanuit initiële supervised fine-tuning op synthetische data.

Een opvallend kenmerk is een instelbare parameter voor redeneerinspanning, waarvan is aangetoond dat deze kan variëren van ruwweg 0,2 tot 0,99, waarbij hogere waarden meer redeneren en hogere kosten betekenen. Hierdoor kunnen operators latentie en uitgaven afwegen tegen de diepte van het redeneren. Alle onderstaande benchmarkcijfers zijn uitgevoerd met Effort = 0,99.

Beheersbare denkinspanning: een operationele gids

In de implementatie wordt de inspanningscontrole blootgesteld als een reasoning_effort enum met de niveaus none / minimal / low / medium / high / xhigh / max. Er is geen enkele 'juiste' instelling — het is een levende hefboom voor de afweging tussen latentie, kosten en kwaliteit. Gebruik de onderstaande tabel als startkaart (relatieve richtlijn; benchmark-kwaliteit werd gemeten aan de top van het bereik):

geen / minimaal. Relatieve latentie & token kosten: Laagste; Beste voor: Classificatie, extractie, opmaak, routering, retrieval glue

laag. Relatieve latentie & token kosten: Laag; Beste voor: Korte Q&A, eenvoudige samenvatting, batchtaken met hoog volume

medium. Relatieve latentie & tokenkosten: Matig; Het beste voor: Algemene chat, opstellen, de meeste agent-toolaanroepen

hoog. Relatieve latentie & token kosten: Hoger; Beste voor: Meerstapsredenering, codegeneratie, analyse

xhigh / max. Relatieve latentie & token kosten: Hoogste; Beste voor: Moeilijke wiskunde, wedstrijd-achtig redeneren, benchmark-pariteit (Effort=0.99)

Kun je het lokaal draaien? Hardware en VRAM

Omdat Inkling een model met 975B parameters is, betekent 'lokaal' in de praktijk een multi-GPU-server, niet een laptop. Geschatte vereisten (volgens de lanceringberichtgeving en community-tools):

BF16 (volledig). Ongeveer geaggregeerd VRAM: ~2 TB; Voorbeeldconfiguraties: 8× NVIDIA B300, of 16× H200

NVFP4 (gekwantiseerd). Ongeveer geaggregeerd VRAM: ~600 GB; Voorbeeldconfiguraties: 4× NVIDIA B300, of 8× H200

GGUF (community). Geschatte geaggregeerde VRAM: Varieert per quant; Voorbeeldconfiguraties: Unsloth GGUF builds bestaan voor kleinere/gekwantiseerde footprints

De NVFP4-checkpoint — speciaal geleverd voor NVIDIA Blackwell — verlaagt de geheugenkosten met ruwweg tweederde vergeleken met BF16, wat het verschil is tussen een 8-GPU en een 4-GPU B300-knooppunt. Voor de meeste teams wijst dit nog steeds op een gehoste provider of een gehuurd GPU-knooppunt in plaats van eigen hardware. Unsloth GGUF-kwantificaties breiden het bereik verder uit naar beneden in de hardwareladder voor experimenten, tegen enige kwaliteitskosten.

Implementatie-snelstartgids

Inkling biedt een OpenAI-compatibele API, dus de meeste bestaande clientcode werkt als een drop-in met een gewijzigde basis-URL en modelnaam. De drie veelvoorkomende serveerpaden:

vLLM — server met één commando (standaard poort 8000):

vllm serve thinkingmachines/Inkling --port 8000
# roep vervolgens het OpenAI-compatibele eindpunt aan op http://localhost:8000/v1

SGLang — shard over 8 GPU's (standaard poort 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — laad via de multimodale auto class:

from transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# specificeer reasoning_effort in {none, minimal, low, medium, high, xhigh, max}

Omdat de endpoint OpenAI-compatibel is, is het migreren van een bestaande app meestal een kwestie van het richten van uw SDK op de nieuwe basis-URL en het instellen van reasoning_effort naar wens. Extra runtimes bij lancering zijn TokenSpeed en Unsloth.

Waar het uit te voeren: beschikbaarheid van inferentieproviders

Als u liever geen GPU's beheert, hosten verschillende partners Inkling. Opties "Run Inkling op X" bij de lancering:

Tinker (Thinking Machines). Rol: Fijnafstemming; Opmerkingen: 64K en 256K contextopties; 50% tijdelijke lanceringskorting (betaald)

Together AI. Rol: Gehoste inferentie; Notities: OpenAI-compatibele endpoints

Fireworks. Rol: Gehoste inferentie; Opmerkingen:

Modal. Rol: Gehoste inferentie / serverless GPU; Opmerkingen:

Databricks. Rol: Gehoste inferentie; Opmerkingen: via Unity AI Gateway

Baseten. Rol: Gehoste inferentie; Opmerkingen:

Benchmarks: leveranciersclaims vs. onafhankelijke meting

Dit is het belangrijkste onderdeel van elke eerlijke Inkling review 2026, omdat de cijfers uit twee heel verschillende plaatsen komen.

Openbaarmaking:Met de enige uitzondering van de Artificial Analysis Index, is elke onderstaande Inkling-benchmark door de leverancier zelf gerapporteerd bij lancering (Effort = 0.99, temperature 1.0) en is niet onafhankelijk gecontroleerd. Cijfers van concurrenten zijn afkomstig van derden (MarkTechPost, Artificial Analysis) of zijn opnieuw uitgevoerd door Thinking Machines, en zijn eveneens niet onafhankelijk gecontroleerd hier. Sommige cijfers hebben harnas- of subsetkwalificaties. Beschouw ze allemaal als richtinggevend, niet als evangelie.

Zelfgerapporteerde leveranciersscores

Volgens de eigen lanceringsmaterialen van Thinking Machines:

AIME 2026 (wiskunde): 97.1%

GPQA Diamond (wetenschappelijk redeneren): 87.2%

SWE-bench Geverifieerd (coderen, bash-only harnas): 77,6%

SWE-bench Pro (Public): 54,3%

MMMU Pro (multimodaal): 73.3%

VoiceBench (audio): 91.4%

MMAU (audio): 77.2%

IFBench (instructie volgen): 79.8%

Terminal Bench 2.1 (agentische terminal): 63.8

FORTRESS Adversarial: 78.0%

SimpleQA geverifieerd: 43.9%

Op papier zien deze er sterk uit, vooral de cijfers voor wiskunde en natuurwetenschappelijk redeneren. Maar het bedrijf heeft Inkling vergeleken met bijna-toekomstige versies van concurrenten (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) met behulp van scores die het zelf heeft gegenereerd. Die concurrentencijfers komen mogelijk niet overeen met de eigen gerapporteerde cijfers van de rivalen, dus head-to-head-vergelijkingen moeten met voorzichtigheid worden geïnterpreteerd.

Multi-model head-to-head (open-weights rivalen)

De meest overzichtelijke naast-elkaar-vergelijking van Inkling met andere open-weight modellen komt van MarkTechPost’s vergelijkingstabel (hieronder weergegeven, toegeschreven aan MarkTechPost). Het is precies nuttig omdat het de rivalen in één kader plaatst:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77,6%; Nemotron 3 Ultra: 70,7%; Kimi K2.6: 80,2%; GLM 5.2: 80,0%; DeepSeek V4 Pro: 80,6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. Niet onafhankelijk gecontroleerd.

Het patroon is duidelijk en consistent met de bescheidenheid van Thinking Machines. Inkling leidt op FORTRESS (adversarial safety) en verslaat Nemotron 3 Ultra over de hele linie, maar het blijft achter GLM 5.2, Kimi K2.6 en DeepSeek V4 Pro op HLE, SWE-bench Verified, en vooral Terminal Bench 2.1 (63,8% tegenover 82,7% van GLM 5.2). Als agentische codeer- en terminaltaken uw prioriteit zijn, dan zijn de toonaangevende Chinese open modellen vandaag de dag vooruit.

Onafhankelijke meting (Artificial Analysis)

Voor een neutralere lezing evalueerde Artificial Analysis Inkling op 2026-07-15 en plaatste het op 41/100 op zijn Intelligence Index, gerangschikt op #10 van 97 modellen. Twee punten over hoe die ranglijst eerlijk te lezen:

Het is een sterke prestatie van open modellen, maar geen algemene nummer één. Volgens Artificial Analysis staat Inkling’s index van 41 boven Nemotron 3 Ultra (38), Gemma 4 31B (29) en gpt-oss-120b (24) — dus onder open-gewicht concurrenten is het concurrerend tot leidend. Maar #10 van 97 betekent dat negen modellen over het algemeen hoger scoren, in overeenstemming met de framing “capabel, niet grensverleggend”.

Efficiëntie is waar het in uitblinkt. Artificial Analysis constateert een sterke token-efficiëntie — ongeveer 25K tokens om zijn evaluatieset te voltooien versus 37–43K voor vergelijkingsmodellen — en een GDPval-AA v2 Elo van 1238, voor Kimi (1190) en DeepSeek V4 Flash (1189), plus een klein voordeel (+2) op AA-Omniscience.

Uitvoersnelheid gemeten 72,7 tokens/sec met een tijd-tot-eerste-token van 1,75s. Kortom: een respectabele top-tien plaatsing, en een werkelijk efficiënte — maar we vermijden bewust om het te overdrijven als een leaderboard-overwinning.

Multimodale en lange-contextmogelijkheden

Inkling accepteert tekst (UTF-8), afbeeldingen (40px tot 4096px via een hiërarchische patch-encoder), en audio (16kHz WAV, tot ongeveer 20 minuten, met behulp van discrete token-codering). Uitvoer is alleen tekst — er is geen beeld- of audiogeneratie, dus plan voor een begripsmodel, niet een generatiemodel. Video is gebruikt tijdens de pre-training maar is niet een ondersteunde of geëvalueerde invoer bij de lancering, dus plan er nog niet op in.

De voornaamste mogelijkheid is het contextvenster van 1 miljoen tokens in de uitgebrachte gewichten, wat de deur opent naar analyse van volledige repository’s, synthese van lange documenten en uitgebreide multi-turn agent-sessies zonder agressieve chunking. Let op de praktische nuance: gehoste API’s bieden tot 256K tokens, dus de volledige 1M is vandaag een self-host-functie. In combinatie met het ontwerp van sliding-window attention en speculatieve decodering blijft het lange-contextverhaal een van de meest praktische verkoopargumenten van Inkling.

Prijzen, prijsniveaus en totale eigendomskosten

Inkling is echt open. Volledige gewichten (een BF16-checkpoint plus een NVFP4-checkpoint) staan op Hugging Face onder Apache 2.0, dus self-hosting is royaltyvrij — je betaalt alleen voor rekenkracht. Thinking Machines verdient niet aan het model zelf; inkomsten komen via Tinker en externe hosts.

Gehoste per-token prijzen (volgens Artificial Analysis), per contextniveau:

64K. Invoer / 1M: $1.87; Gecachete invoer / 1M: $0.374; Uitvoer / 1M: $4.68

256K. Invoer / 1M: $3.74; Gecachte invoer / 1M: $0.748; Uitvoer / 1M: $9.36

Weerspiegelt een tijdelijke lanceringskorting van 50%; exacte Tinker per-token cijfers staan in de documentatie en zullen veranderen.

Self-host vs API — hoe te denken over TCO. De economie draait om volume en benutting:

API (Tinker / partners): nul vaste kosten, betalen per token, bijna onmiddellijk te starten. Het beste bij laag of piekvolume, of tijdens het prototypen.

Zelf-hosten (gehuurde of eigen GPU's): je betaalt voor een 4–8 GPU-node, ongeacht of deze bezet is, maar de marginale tokencost nadert de ruwe elektriciteitsprijs. Omdat Inkling slechts 41B parameters activeert en token-efficiënt is (~25K vs 37–43K volgens de Artificial Analysis set), is de doorvoer per GPU-uur gunstig, en zware, constante workloads kunnen aanzienlijk goedkoper uitvallen dan per-token API-prijzen zodra een node goed wordt benut. Commentaren rond de lancering stelden dat het zelf hosten van open weights ongeveer 40–60% goedkoper is dan vergelijkbaar closed-API-gebruik op schaal — een richtinggevende claim, geen gecontroleerd cijfer.

Redactienotitie — voeg visual toe: Een break-even-diagram — maandelijks tokenvolume (x) vs totale kosten (y) met drie lijnen: closed frontier API, Inkling hosted API en Inkling zelf-gehost op een gehuurde GPU-node — die het omslagpunt laat zien waar zelf-hosten wint.

Veiligheid, afstemming en censuur

Veiligheid is een van de sterkere en meer onderscheidende verhalen van Inkling. Op de FORTRESS adversarial benchmark scoort het 78,0% — de beste onder open-weight modellen in de vergelijking van MarkTechPost, voor GLM 5.2 (71,3%), Kimi K2.6 (65,6%) en ver voor DeepSeek V4 Pro (36,0%). Thinking Machines benadrukt ook gekalibreerde onzekerheid in de outputs van het model.

VentureBeat’s berichtgeving benadrukte een gerelateerde eigenschap: weerstand tegen censuur. In combinatie met een permissieve Apache 2.0-licentie positioneert dit Inkling als een open model dat teams kunnen afstemmen op hun eigen beleid in plaats van het overnemen van een ondoorzichtig, door de leverancier opgelegd contentregime — een belangrijke overweging voor gereguleerde of regiospecifieke implementaties. Zoals altijd bij een model op de dag van lancering, was er op het moment van schrijven geen onafhankelijke red-team of externe veiligheidsaudit verschenen, dus behandel de FORTRESS-lead als afkomstig van leverancier/derde partij in plaats van extern gecertificeerd.

Moet je Inkling fine-tunen?

Finetuning is wellicht de bestaansreden van Inkling. Een snel beslissingskader:

Fijnstemmen (via Tinker of je eigen pijplijn) als: je hebt eigen data, een smal domein, of een taak waarbij een kleiner gespecialiseerd model een generalist verslaat; je moet de gewichten bezitten; of je wilt een specifieke toon, formaat of beleid inbouwen. De 64K/256K Tinker contextopties en lanceringskorting verlagen de drempel.

Gebruik gewoon het basismodel (self-host of API) als: je taak algemeen van aard is, je volume laag is, of je nog niet hebt gevalideerd dat fine-tuning je metriek verbetert. Prompt engineering plus de reasoning_effort dial brengt je vaak ver genoeg.

Kijk elders als: je vandaag geavanceerde agentische codering nodig hebt (GLM 5.2 en Kimi K2.6 leiden op die benchmarks) of je onafhankelijk gecontroleerde kwaliteitsgaranties vereist.

Voor- en nadelen

Voordelen

Volledig open gewichten onder Apache 2.0, royaltyvrij om zelf te hosten en gratis voor commercieel gebruik.

Efficiënte sparse MoE (slechts 41B actief) plus sterke tokenefficiëntie houdt de inferentiekosten en -snelheid concurrerend.

Enorme 1M-token context in de gewichten (256K via API).

Echte multimodaliteit (tekst, afbeelding, audio invoer).

Regelbare redeneerinspanning-knop (geen → max) voor live kosten/kwaliteit afwegingen.

Open-gewicht adversariële veiligheid van de beste klasse (FORTRESS 78,0%, per MarkTechPost) en “weerstand tegen censuur.”

Sterke onafhankelijke positie — top 10 van 97 op de Artificial Analysis Index, voor Nemotron 3 Ultra, Gemma 4 31B en gpt-oss-120b.

Nadelen

Expliciet niet een frontier model, volgens eigen zeggen van de maker.

Loopt achter op toonaangevende open concurrenten (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) op agentic- en codeerbenchmarks (Terminal Bench 2.1, SWE-bench Verified, HLE).

De meeste benchmarks worden door leveranciers zelf gerapporteerd en niet onafhankelijk gecontroleerd.

Alleen tekstuitvoer; geen beeld/audiogeneratie; geen video-invoer bij lancering; Inkling-Small nog in voorvertoning.

Echt “lokaal” gebruik vereist een multi-GPU node (~600GB VRAM, zelfs gekwantiseerd).

Bij de lancering was er geen inhoudelijke onafhankelijke kritische of veiligheids-/red-team-review naar voren gekomen.

Wie zou Inkling moeten gebruiken?

Inkling is een goede keuze als u een professional of team bent dat wil bezitten en aanpassen van uw model in plaats van een gesloten API te huren. Ideale gebruikssituaties zijn:

Afstemmingsteams bouwen domeinspecifieke modellen via Tinker of hun eigen pijplijn.

Kostengevoelige, hoogvolume-implementaties waar royalty-vrij self-hosten per-token frontier pricing verslaat.

Werklasten met lange context zoals code-assistentie voor de gehele repository, documentanalyse, en lange agentsessies.

Multimodale toepassingen die gecombineerde tekst-, beeld- en audiobegrip vereisen.

Beleidsgevoelige implementaties die een sterk veilige, censuurbestendige open basis willen om zich aan te sluiten.

Het is een slechte keuze als je de absoluut sterkste redeneer- of agentische codeerprestaties nodig hebt, video-invoer of generatieve uitvoer nodig hebt, of onafhankelijk gecontroleerde benchmarks nodig hebt vóór implementatie.

Oordeel en eindbeoordeling

Laten we de olifant in de kamer direct benoemen: Inkling is niet het sterkste model dat vandaag beschikbaar is, en Thinking Machines zegt dat precies. Cynisch gelezen is dat een lage lat. Eerlijk gelezen is het precies het punt — Inkling is geoptimaliseerd voor een ander doel dan het aanvoeren van een ranglijst. Het is efficiënt (41B actief, ~25K-token taakbudgetten), open gelicenseerd (Apache 2.0), veilig naar open-gewicht standaarden (FORTRESS 78%), en ontworpen om te worden gefinetuned en zelf gehost. Die combinatie maakt het een van de doordachtere open-model lanceringen van 2026, zelfs terwijl het achterblijft bij GLM 5.2 en Kimi K2.6 op de moeilijkste agentische en codeerbenchmarks.

De overgebleven sterretjes zijn de grotendeels zelfgerapporteerde benchmarks en het ontbreken van een onafhankelijke kritische beoordeling zo vroeg. Maar voor de beoogde doelgroep — bouwers die waarde hechten aan eigendom, aanpassing, kostenbeheersing en een groot contextvenster boven frontier-braggingsrechten — levert Inkling.

Beoordeling: 4 van de 5 voor zijn doelgroep van bouwers en fine-tuners; lager als u strikt op zoek bent naar geavanceerde mogelijkheden.

Veelgestelde vragen

Wat is Inkling en wie heeft het gemaakt? Inkling is het eerste model van Thinking Machines Lab, de AI-startup onder leiding van Mira Murati (voormalig CTO van OpenAI). Het werd gelanceerd op 15 juli 2026 als een open-weights, multimodaal Mixture-of-Experts redeneermodel.

Is Inkling het beste AI-model? Nee, en het bedrijf beweert dat ook niet — het stelt dat Inkling “niet het sterkste model is dat vandaag beschikbaar is, gesloten of open.” Onafhankelijke meting (Artificial Analysis) rangschikt het op #10 van 97 algemeen, hoewel het voorloopt op verschillende open concurrenten.

Hoeveel parameters heeft Inkling en wat is de contextvenstergrootte?In totaal 975B met 41B actief (sparse MoE), verdeeld over 66 lagen. De contextvenstergrootte is maximaal 1.000.000 tokens in de vrijgegeven gewichten, en maximaal 256K op gehoste API's.

Is Inkling open source, en wat is de licentie? De gewichten worden vrijgegeven onder Apache 2.0, wat commercieel gebruik en self-hosting toestaat. Het zijn “open gewichten” — volledige modelgewichten staan op Hugging Face.

Is Inkling gratis te gebruiken?De gewichten zijn gratis en royaltyvrij om zelf te hosten. Fine-tuning op Tinker en gehoste inferentie via providers zoals Together AI, Fireworks, Modal, Databricks of Baseten zijn betaalde diensten. Gehoste toegang begint rond $1.87 / 1M invoertokens (een tijdelijke lanceringskorting).

Hoe voer ik Inkling uit of download ik het, en welke hardware heb ik nodig?Download de gewichten van Hugging Face en serveer ze met vLLM, SGLang of Hugging Face transformers via een OpenAI-compatibele API. Verwacht ongeveer ~2TB geaggregeerd VRAM voor BF16 (8× B300 / 16× H200) of ~600GB voor het NVFP4 gekwantiseerde checkpoint (4× B300 / 8× H200). Community Unsloth GGUF builds verlagen de drempel voor experimenten.

Hoe fine-tune ik Inkling? Gebruik Thinking Machines’ Tinker platform, dat 64K en 256K contextopties biedt en een tijdelijke 50% lanceringskorting, of fine-tune de open weights in je eigen pijplijn.

Wat is controleerbare denkinspanning? Een reasoning_effort-instelling (none / minimal / low / medium / high / xhigh / max) die latentie en tokenkosten afweegt tegen redeneerdiepte. Lage inspanning is geschikt voor classificatie en extractie; maximale inspanning is geschikt voor moeilijke wiskunde en komt overeen met de benchmarkconfiguratie (Effort=0.99).

Hoe verhoudt Inkling zich tot Kimi, GLM, DeepSeek en Nemotron? Volgens de vergelijking van MarkTechPost leidt Inkling op FORTRESS (veiligheid) en verslaat het Nemotron 3 Ultra ruimschoots, maar blijft het achter op GLM 5.2, Kimi K2.6 en DeepSeek V4 Pro op Terminal Bench 2.1, SWE-bench Verified en HLE. Het is concurrerend, maar niet het sterkste open model op het gebied van agentische codering.

Kan Inkling afbeeldingen, audio en video verwerken? Het accepteert tekst, afbeeldingen (40px–4096px) en audio (16kHz WAV, tot ~20 minuten) als invoer. De uitvoer is alleen tekst — geen afbeelding of audiogeneratie. Video werd gebruikt in pretraining maar is bij lancering geen ondersteunde invoer.

Zijn de benchmarkscores van Inkling betrouwbaar?Behandel ze voorzichtig. Afgezien van de onafhankelijke Artificial Analysis Intelligence Index, zijn de belangrijkste cijfers door leveranciers zelf gerapporteerd bij de lancering en niet onafhankelijk gecontroleerd. Concurrentencijfers komen van derden (MarkTechPost) of zijn opnieuw uitgevoerd door Thinking Machines en komen mogelijk niet overeen met de eigen gerapporteerde cijfers van concurrenten.

Wat is Inkling-Small, en wat staat er op de roadmap? Inkling-Small is een kleinere variant (276B totaal / 12B actief). Bij de lancering was het nog in preview, met gewichten die nog niet zijn vrijgegeven. Het hoofdmodel wordt al geleverd met MTP layers voor speculatieve decodering.



Vergeleken in dit artikel2

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube