
Inkling AI Model Recension: Thinking Machines Första Open-Weights-modell, Testad och Förklarad
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- qwenNYQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2031 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
- z-aiZ.ai: GLM 5.22026-06-1653Intelligens69Kodning60Matematik
Denna Inkling AI-modellrecension tar en närmare titt på den första releasen från Thinking Machines Lab, startupen som leds av före detta OpenAI CTO Mira Murati. Inkling är en open-weights, multimodal Mixture-of-Experts (MoE)-modell med ett 1-miljon-tokens kontextfönster och en kontrollerbar “thinking effort”-ratt. Den är snabb, billig att självhosta, och byggd för anpassning snarare än ledartavledominans. Nedan skiljer vi leverantörens egna riktmärken från oberoende mätning, går igenom arkitekturen, visar hur du kör den, och förklarar exakt vem som bör (och inte bör) anta den.
Per: 2026-07-16 — en dag efter lansering. Detta är en forskningsdriven recension; inga praktiska långtidstester finns ännu för någon så här ny modell, och vi flaggar varje overifierad siffra nedan.
En anteckning till byggare: om du vill prova Inkling tillsammans med andra modeller, OrcaRouter frontar API-tillgängliga modeller med en enda OpenAI-kompatibel slutpunkt, så att du kan jämföra och byta utan nya integrationer.
- TL;DR omdöme: Inkling är en genuint kapabel, effektiv öppen modell som utmärker sig för finjustering och kostnadskänslig driftsättning, men den är inte en frontlinjeledare och dess skapare säger det öppet. Om du vill ha en anpassningsbar, royaltyfri bas med ett enormt kontextfönster, är den en av de mest intressanta lanseringarna under 2026. Om du vill ha den enskilt starkaste tillgängliga modellen, leta någon annanstans.
- Vad det är: En modell med öppna vikter (Apache 2.0) MoE-resonemangsmodell. Vem det är för: Utövare som vill finjustera och självvärda istället för att betala för ett slutet frontier API.
Viktiga slutsatser
Tillverkare & datum: Thinking Machines Lab; släppt den 15 juli 2026 som labets första modell.
Arkitektur: Sparse MoE, 975B totalt / 41B aktiva parametrar, 66 lager, upp till 1M-tokens sammanhang i vikterna (256K via värdbaserade API:er).
Licens: Apache 2.0 — fulla vikter på Hugging Face, gratis för kommersiellt bruk och egen hosting.
Ärlig positionering: Företaget säger rakt ut att det “inte är den starkaste modellen som finns idag, vare sig sluten eller öppen.”
Oberoende poäng: 41/100 på Artificial Analysis Intelligence Index — #10 av 97 modeller, och före flera öppna motsvarigheter (se avstämning nedan).
Kostnad: Vikterna är royaltyfria att självhosta; hostad åtkomst börjar från cirka $1,87 / 1M input tokens.
Varning: Nästan alla rubrikbenchmarks är leverantörsrapporterade och inte oberoende granskade.
Vem står bakom Inkling
- Founder box. Inkling är den första modellen från Thinking Machines Lab (thinkingmachines.ai), grundat av Mira Murati, tidigare Chief Technology Officer på OpenAI. Laboratoriet arbetade i relativ hemlighet före denna lansering och har intagit en öppna-vikter-ställning som kontrasterar med den stängda-flagg-skepps-metoden hos Muratis tidigare arbetsgivare. Thinking Machines använder inte modellen för intäktsgenerering – intäkterna kommer från dess Tinker fine-tuning-plattform och tredjepartshanteringspartners. Den affärsmodellen är central för att förstå Inkling: vikterna är en gratis ingång, och företaget tjänar pengar när du anpassar eller skalar.
Vad är Inkling?
Inkling är en stor språk- och resonemangsmodell med öppna vikter, multimodal, Mixture-of-Experts, tillkännagiven av Thinking Machines Lab den 15 juli 2026 och utgiven under den tillåtande Apache 2.0 licensen med fulla vikter på Hugging Face.
Det som gör denna lansering anmärkningsvärd är inramningen. Istället för att göra anspråk på en frontlinjekrona beskriver Thinking Machines Inkling som en mångsidig, effektiv, anpassningsbar öppen modell. I en ovanligt uppriktig bekännelse för en lanseringsdag uppger företaget att Inkling“är inte den starkaste modellen som finns tillgänglig idag, vare sig sluten eller öppen.” Den ärligheten sätter tonen för hela denna recension: Inkling är ett verktyg utformat för att anpassas, självhostas och finjusteras, inte en benchmark-trofe.
Rapportering från Fortune och TechCrunch återspeglade denna tolkning. TechCrunch hävdade att Inkling inte hotar OpenAI, Anthropic eller Google på frontiertiernivå, utan istället pressar mellanskiktet av open-weight-värdleverantörer och finjusteringsplattformar. Forbes inramade Muratis open-weights-strategi som närmare den kinesiska open-model-manualen (DeepSeek, Qwen, Kimi) än till stängda amerikanska flaggskepp — en USA-mot-Kina open-weights-berättelse som löper genom mycket av lanseringskommentarerna.
Arkitektur och specifikationer
Under huven är Inkling en gles Mixture-of-Experts-transformer. Endast en bråkdel av dess parametrar aktiveras per token, vilket gör att inferensen förblir effektiv trots det stora totala antalet parametrar. Detaljerna dokumenteras i det officiella modellkortet och Hugging Face-bloggen.
Totala parametrar: 975B
Aktiva parametrar: 41B (sparse MoE)
Lager: 66-lagers avkodare-enbart transformator
Experter: 256 dirigerade + 2 delade; 6 av 256 dirigerade per token (de 2 delade alltid aktiva)
Routning: Sigmoid / aux-loss-free
Observera: Hybrid, 5:1 glidfönster (lokalt) till globalt; 8 KV huvuden
Positionskodning: Inlärda relativa positionsinbäddningar (inte RoPE)
Multimodalitet: Kodarfri — ljud som dMel-spektrogram, bilder som 40×40 patches, matas direkt
Tillägg: Korta faltningar (SConv); MTP-lager för spekulativ avkodning
Numerik: BF16, MXFP8, NVFP4 (NVFP4-kontrollpunkt för NVIDIA Blackwell)
Kontextfönster: Upp till 1 000 000 token i vikterna (256K på värdbaserade API:er)
Mindre variant: Inkling-Small, 276B totalt / 12B aktiva (förhandsvisning, vikter inte släppta än)

Några designval skiljer Inkling från en vanilla MoE:
Expertlayout. Med 256 routade experter plus 2 delade experter, och 6 routade experter som aktiveras per token, fungerar det delade paret som en alltid-på "expert sink" som fångar vanlig beräkning medan de routade experterna specialiserar sig. Aux-loss-free sigmoid-routing undviker den lastbalanseringsstraffterm som används av många MoE-designer.
Relativa positionsinbäddningar, inte RoPE. De flesta moderna långkontextmodeller lutar sig mot roterande inbäddningar; Inkling använder istället inlärda relativa positionsinbäddningar, ett ovanligt val i denna skala.
Multimodalitet utan kodare.Istället för att koppla på separata syn-/ljudkodare, matar Inkling in 40×40 bildpatches och dMel ljudspektrogram direkt i transformer-stacken. Detta förenklar pipelinen och är en del av varför modellen beskrivs som naturligt multimodal.
MTP för spekulativ avkodning. Multi-token-prediction (MTP)-lager fungerar som en inbyggd utkastare, vilket påskyndar genereringen utan en separat utkastmodell.
Redaktörsanteckning — lägg till bild: Ett märkt blockdiagram över ett Inkling-lager — glidande fönster vs global uppmärksamhet (5:1), 256+2-expertroutern med 6 aktiva experter markerade, SConv och MTP-utkastarhuvudet.
Träning och reglaget för “tankeansträngning”
Inkling förtränades på 45 biljoner multimodala tokens som omfattar text, bilder, ljud och video, med en hybridoptimerare (Muon för stora matrisvikter, Adam för resten) på NVIDIA GB300 NVL72-system. Efterträning använde storskalig asynkron förstärkningsinlärning skalad över 30M+ rollouter i två långa kontinuerliga körningar, startad från initial finjustering med övervakning på syntetisk data.
En utmärkande egenskap är en kontrollerbar resoneringsinsats-parameter, som demonstrerats variera från cirka 0,2 till 0,99, där högre värden innebär mer resonerande och högre kostnad. Detta låter operatörer väga fördröjning och utgifter mot tankedjup. Alla benchmarksiffror nedan kördes vid Effort = 0,99.
Kontrollerbar tankeansträngning: en operativ guide
Vid distribution exponeras ansträngningskontrollen som en reasoning_effort-uppräkning med nivåerna ingen / minimal / låg / medel / hög / xhög / max. Det finns ingen enskild “rätt” inställning — det är en levande spak för avvägningen mellan latens, kostnad och kvalitet. Använd tabellen nedan som en startkarta (relativ vägledning; referenskvalitet mättes i den övre delen av intervallet):
ingen / minimal. Relativ latens & token-kostnad: Lägst; Bäst för: Klassificering, extrahering, formatering, routning, retrieval glue
låg. Relativ latens & token-kostnad: Låg; Bäst för: Korta Q&A, enkel sammanfattning, högvolyms batchjobb
medel. Relativ latens och tokenkostnad: Måttlig; Bäst för: Allmän chatt, utkast, de flesta agentverktygsanrop
hög. Relativ latens & token-kostnad: Högre; Bäst för: Flerstegsresonemang, kodgenerering, analys
xhigh / max. Relativ latens och tokenskostnad: Högst; Bäst för: Svår matematik, tävlingsliknande resonemang, benchmark-paritet (Effort=0.99)

Kan du köra det lokalt? Hårdvara och VRAM
Eftersom Inkling är en 975B-parametermodell, innebär "lokal" realistiskt sett en multi-GPU-server, inte en bärbar dator. Ungefärliga krav (enligt lanseringstäckningen och community-verktyg):
BF16 (full). Ungefärlig sammanlagd VRAM: ~2 TB; Exempelkonfigurationer: 8× NVIDIA B300, eller 16× H200
NVFP4 (kvantiserad). Ungefärlig sammanlagd VRAM: ~600 GB; Exempelkonfigurationer: 4× NVIDIA B300, eller 8× H200
GGUF (gemenskap). Ungefärlig aggregerad VRAM: Varierar beroende på quant; Exempelkonfigurationer: Unsloth GGUF-byggen finns för mindre/kvantiserade fotavtryck
NVFP4-kontrollpunkten — som skickats specifikt för NVIDIA Blackwell — minskar minneskostnaden med ungefär två tredjedelar jämfört med BF16, vilket är skillnaden mellan en 8-GPU- och en 4-GPU B300-nod. För de flesta team pekar detta fortfarande mot en värdleverantör eller en hyrd GPU-nod snarare än ägd hårdvara. Unsloth GGUF-kvantiseringar förlänger räckvidden ytterligare nedåt på hårdvarustegen för experimentering, till viss kvalitetskostnad.
Snabbstart för driftsättning
Inkling exponerar ett OpenAI-kompatibelt API, så den mesta befintliga klientkoden fungerar som en drop-in med en ändrad bas-URL och modellnamn. De tre vanliga serveringsvägarna:
vLLM — enkommandoserver (standardport 8000):
vllm serve thinkingmachines/Inkling --port 8000
# anropa sedan den OpenAI-kompatibla slutpunkten på http://localhost:8000/v1
SGLang — sharda över 8 GPU:er (som standard på port 30000):
python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000
Hugging Face transformers — ladda via den multimodala autoklassen:
from transformers import AutoModelForMultimodalLM, AutoProcessor
model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# skicka reasoning_effort i {none, minimal, low, medium, high, xhigh, max}
Eftersom slutpunkten är OpenAI-kompatibel, handlar migrering av en befintlig app oftast om att peka ditt SDK mot den nya bas-URL:en och ställa in reasoning_effort efter smak. Ytterligare körtider vid lansering inkluderar TokenSpeed och Unsloth.
Var man kör det: tillgänglighet för inferensleverantör
Om du hellre inte vill hantera GPU:er, finns det flera partners som är värd för Inkling. Alternativen "Kör Inkling på X" vid lanseringen:
Tinker (Thinking Machines). Roll: Finjustering; Anteckningar: 64K och 256K kontextalternativ; 50% tidsbegränsad lanseringsrabatt (betald)
Together AI. Roll: Värdbaserad inferens; Anteckningar: OpenAI-kompatibla slutpunkter
Fireworks. Roll: Värdbaserad inferens; Anteckningar: —
Modal. Roll: Värdbaserad inferens / serverlöst GPU; Anteckningar: —
Databricks. Roll: Värdbaserad inferens; Anteckningar: via Unity AI Gateway
Baseten. Roll: Hostad inferens; Anteckningar: —
Benchmark: leverantörspåståenden vs. oberoende mätning
Detta är den viktigaste delen av någon ärligInkling review 2026, eftersom siffrorna kommer från två mycket olika platser.
Upplysning:Med det enda undantaget av Artificial Analysis Index, är varje Inkling-riktmärke nedan leverantörs egenrapporterat vid lansering (Effort = 0.99, temperature 1.0) och har inte har granskats oberoende. Konkurrentsiffror är hämtade från tredje part (MarkTechPost, Artificial Analysis) eller har körts om av Thinking Machines, och är likaså inte oberoende granskade här. Vissa siffror bär harness- eller delmängdskvalificeringar. Betrakta dem alla som vägledande, inte som sanning.
Leverantörers självrapporterade poäng
Enligt Thinking Machines egna lanseringsmaterial:
AIME 2026 (matematik): 97.1%
GPQA Diamond (vetenskapligt resonemang): 87.2%
SWE-bench Verified (kodning, enbart bash-testmiljö): 77.6%
SWE-bench Pro (Public): 54.3%
MMMU Pro (multimodal): 73.3%
VoiceBench (ljud): 91.4%
MMAU (ljud): 77.2%
IFBench (instruktionsföljning): 79.8%
Terminal Bench 2.1 (agentisk terminal): 63.8
FORTRESS Adversarial: 78,0%
SimpleQA Verifierad: 43.9%
På papper ser dessa starka ut, särskilt matematik- och naturvetenskapsresonemangen. Men företaget benchmarkade Inkling mot nära framtida konkurrentversioner (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) med hjälp av poäng som det själv genererade. Dessa konkurrentsiffror kanske inte stämmer överens med rivalernas egna rapporterade siffror, så direkta jämförelser bör tolkas med försiktighet.
Multimodell huvud-mot-huvud (rivaler med öppna vikter)
Den renaste jämförelsen sida vid sida av Inkling mot andra open-weight-modeller kommer från MarkTechPost's comparison table (återgiven nedan, tillskriven MarkTechPost). Det är användbart just för att det sätter rivalerna i en ram:
HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%
AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%
SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%
Terminal Bench 2.1. Inkling: 63,8 %; Nemotron 3 Ultra: 56,4 %; Kimi K2.6: 71,3 %; GLM 5.2: 82,7 %; DeepSeek V4 Pro: 64 %
FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%
MarkTechPost. Inte oberoende granskad.
Mönstret är tydligt och överensstämmer med Thinking Machines egen blygsamhet. Inkling leder inom FORTRESS (adversarial safety) och slår Nemotron 3 Ultra över hela linjen, men den ligger efter GLM 5.2, Kimi K2.6 och DeepSeek V4 Pro på HLE, SWE-bench Verified, och särskilt Terminal Bench 2.1 (63.8% mot GLM 5.2:s 82.7%). Om agentisk kodning och terminaluppgifter är din prioritet, ligger de ledande kinesiska öppna modellerna före idag.
Oberoende mätning (Artificial Analysis)
För en mer neutral läsning, Artificial Analysis utvärderade Inkling den 2026-07-15 och placerade den på 41/100 på sitt Intelligence Index, rankad #10 av 97 modeller Två punkter om hur man läser den rankingen rättvist:
Det är en stark prestation från en öppen modell, inte en total #1. Enligt Artificial Analysis, Inkling’s index på 41 ligger före Nemotron 3 Ultra (38), Gemma 4 31B (29) och gpt-oss-120b (24) — så bland öppna viktmodeller är den konkurrenskraftig till ledande. Men #10 av 97 betyder att nio modeller rankas högre totalt, i linje med ramverket “capable, not frontier”.
Effektivitet är där den utmärker sig. Artificial Analysis noterar stark tokeneffektivitet — ungefär 25K tokens för att slutföra sin utvärderingsuppsättning jämfört med 37–43K för jämförelsemodeller — och en GDPval-AA v2 Elo på 1238, före Kimi (1190) och DeepSeek V4 Flash (1189), plus en liten fördel (+2) på AA-Omniscience.
Uthastning uppmätt till 72.7 tokens/sekund med en tid till första token på 1.75s. Kort sagt: en respektabel topp-tio-placering, och en genuint effektiv sådan — men vi undviker medvetet att överdriva det som en leaderboard-vinst.

Multimodala och långkontextuella förmågor
Inkling accepterar text (UTF-8), bilder (40px till 4096px via en hierarkisk patch-kodare) och ljud (16kHz WAV, upp till cirka 20 minuter, med diskret token-kodning). Utdata är endast text — det finns ingen bild- eller ljudgenerering, så planera för en förståelsemodell, inte en generationsmodell. Video användes under förträning men är inte ett stött eller utvärderat indata vid lansering, så planera inte runt det än.
Huvudfunktionen är 1-miljon-tokens kontextfönster i de släppta vikterna, vilket öppnar dörren för analys av hela databasers kod, syntes av långa dokument och utökade flervarvsagentdialoger utan aggressiv uppdelning. Notera den praktiska nyansen: värdbaserade API:er exponerar upp till 256K tokens, så hela 1M är en egenvärd-funktion idag. Kombinerat med den glidande fönster-uppmärksamhetsdesignen och spekulativ avkodning förblir långkontextberättelsen en av Inkling’s mest praktiska säljargument.
Prissättning, nivåer och total ägandekostnad
Inkling är verkligen öppen. Fullständiga vikter (en BF16-kontrollpunkt plus en NVFP4-kontrollpunkt) finns på Hugging Face under Apache 2.0, så egen hosting är royaltyfri — du betalar bara för beräkning. Thinking Machines tjänar inte pengar på själva modellen; intäkter kommer via Tinker och tredjepartsvärdar.
Hostad per-token-prissättning (per Artificial Analysis), efter kontextnivå:
64K. Indata / 1M: $1.87; Cachelagrad indata / 1M: $0.374; Utdata / 1M: $4.68
256K. Indata / 1M: $3.74; Cachad indata / 1M: $0.748; Utdata / 1M: $9.36
Återspeglar en tidsbegränsad lanseringsrabatt på 50%; exakta Tinker per-token-siffror finns i dokumentationen och kommer att ändras.
Self-host vs API — hur man tänker kring TCO. Ekonomin beror på volym och utnyttjande:
API (Tinker / partners): noll fast kostnad, betala per token, nästan omedelbar start. Bäst vid låg eller ojämn volym, eller under prototypframställning.
Egen hosting (hyrda eller egna GPU:er): du betalar för en nod med 4–8 GPU:er oavsett om den är belastad eller inte, men marginalkostnaden per token närmar sig kostnaden för el. Eftersom Inkling aktiverar endast 41B parametrar och är token-effektiv (~25K jämfört med 37–43K per Artificial Analysis-uppsättningen), är genomströmningen per GPU-timme fördelaktig, och tunga, stabila arbetsbelastningar kan bli avsevärt billigare än priser per token för API när en nod är väl utnyttjad. Kommentarer kring lanseringen beskrev egen hosting av öppna vikter som ungefär 40–60% billigare än jämförbar användning av slutet API i stor skala — en riktningsangivelse, inte en granskad siffra.
Redaktörsanteckning — lägg till bild: Ett break-even-diagram — månatlig tokenvolym (x) vs total kostnad (y) med tre linjer: closed frontier API, Inkling hosted API och Inkling self-hosted på en hyrd GPU-nod — som visar brytpunkten där egen hosting vinner.
Säkerhet, anpassning och censur
Säkerhet är en av Inklings starkare och mer differentierade berättelser. På FORTRESS adversarial benchmarket ger den 78.0% — den bäst bland open-weight-modeller i MarkTechPosts jämförelse, före GLM 5.2 (71.3%), Kimi K2.6 (65.6%), och långt före DeepSeek V4 Pro (36.0%). Thinking Machines betonar även kalibrerad osäkerhet i modellens utdata.
VentureBeat's rapportering lyfte fram en relaterad egenskap: motstånd mot censur. I kombination med en tillåtande Apache 2.0-licens positionerar detta Inkling som en öppen modell som team kan anpassa till sina egna policyer istället för att ärva en otydlig, leverantörspålagd innehållsregim – en meningsfull övervägning för reglerade eller regionsspecifika implementeringar. Som alltid med en lanseringsdagsmodell hade inget oberoende red-team eller tredjeparts säkerhetsgranskning dykt upp vid skrivandets tidpunkt, så behandla FORTRESS-ledningen som leverantörs-/tredjepartskälla snarare än externt certifierad.
Bör du finjustera Inkling?
Finjustering är onekligen Inkling’s anledning att existera. Ett snabbt beslutsramverk:
Finjustera (via Tinker eller din egen pipeline) om: du har proprietär data, en smal domän, eller en uppgift där en mindre specialiserad modell överträffar en generalist; du behöver äga vikterna; eller du vill baka in en specifik ton, format eller policy. 64K/256K Tinker-kontextalternativen och lanseringsrabatten sänker tröskeln.
Använd bara basmodellen (självhostad eller API) om: din uppgift är generell, din volym är låg, eller du ännu inte har validerat att finjustering påverkar din metrik. Prompt engineering plus reasoning_effort-ratten räcker ofta långt.
Titta någon annanstans om: du behöver banbrytande agentisk kodning idag (GLM 5.2 och Kimi K2.6 leder på dessa riktmärken) eller du kräver oberoende granskade kvalitetsgarantier.
Fördelar och nackdelar
Fördelar
Fullt öppna vikter under Apache 2.0, royaltyfritt att självhosta och gratis för kommersiellt bruk.
Effektiv gles MoE (endast 41B aktiv) plus stark tokeneffektivitet håller inferenskostnad och hastighet konkurrenskraftig.
Massiv 1M-tokens kontext i vikterna (256K via API).
Äkta multimodalitet (text, bild, ljud input).
Kontrollerbar reasoning_effort ratt (ingen → max) för realtids kostnad/kvalitet-avvägningar.
Bäst-i-klassen open-weight adversarial säkerhet (FORTRESS 78.0%, enligt MarkTechPost) och "motstånd mot censur."
Stark oberoende placering — topp 10 av 97 på Artificial Analysis Index, före Nemotron 3 Ultra, Gemma 4 31B och gpt-oss-120b.
Nackdelar
Explicitely inte en frontmodell, enligt tillverkarens egen uppgift.
Trails leder öppna rivaler (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) på agentiska och kodningsbenchmarks (Terminal Bench 2.1, SWE-bench Verified, HLE).
De flesta riktmärken är leverantörs självrapporterade och inte oberoende granskade.
Endast textutdata; ingen bild-/ljudgenerering; ingen videoinmatning vid lansering; Inkling-Small är fortfarande i förhandsvisning.
Verklig “lokal” användning kräver en multi-GPU-nod (~600 GB VRAM även kvantiserad).
Ingen substantiell oberoende kritisk eller säkerhets-/red-team-granskning hade dykt upp vid lanseringen.
Vem borde använda Inkling?
Inkling passar bra om du är en praktiker eller ett team som vill äga och anpassa din modell istället för att hyra ett slutet API. Ideala användningsfall inkluderar:
Finjusteringsteam bygger domänspecifika modeller via Tinker eller deras egen pipeline.
Kostnadskänsliga högvolymsdistributioner där royaltyfri egen värd slår per-token frontprissättning.
Arbetsbelastningar med långt kontext såsom repo-övergripande kodassistans, dokumentanalys och långa agentsessioner.
Multimodala applikationer som kräver kombinerad förståelse av text, bild och ljud.
Policykänsliga distributioner som vill ha en starkt säker, censurresistent öppen bas att anpassa sig till.
Det är en dålig passform om du behöver det absolut starkaste resonemanget eller agentisk kodningsprestanda, behöver videoinmatning eller generativ utdata, eller kräver oberoende granskade riktmärken före driftsättning.
Dom och slutbetyg
Låt oss ta itu med elefanten direkt: Inkling är inte den starkaste modellen som finns tillgänglig idag, och Thinking Machines säger precis det. Läs cyniskt, så är det en låg ribba. Läs rättvist, det är hela poängen — Inkling är optimerad för ett annat mål än att toppa en topplista. Den är effektiv (41B aktiva, ~25K-token uppgiftsbudgetar), öppet licensierat (Apache 2.0), säker enligt öppna viktstandarder (FORTRESS 78%), och byggd för att finjusteras och självhostas. Den kombinationen gör den till en av de mer genomtänkta öppna modellanseringarna under 2026, även om den ligger efter GLM 5.2 och Kimi K2.6 i de svåraste agent- och kodningsriktmärkena.
De återstående asteriskerna är de till stor del självrapporterade riktmärkena och avsaknaden av någon oberoende kritisk granskning så här tidigt. Men för dess avsedda publik — byggare som värderar ägande, anpassning, kostnadskontroll och ett enormt kontextfönster framför frontlinjens skryträttigheter — levererar Inkling.
Betyg: 4 av 5 för sin målgrupp av byggare och finjusterare; lägre om du handlar uteslutande efter frontekapacitet.
FAQ
Vad är Inkling och vem skapade den? Inkling är den första modellen från Thinking Machines Lab, AI-startupen som leds av Mira Murati (tidigare CTO på OpenAI). Den lanserades den 15 juli 2026 som en open-weights, multimodal Mixture-of-Experts resonemangsmodell.
Är Inkling den bästa AI-modellen?Nej, och företaget påstår inte det — de säger att Inkling "inte är den starkaste modellen som finns idag, vare sig sluten eller öppen." Oberoende mätning (Artificial Analysis) rankar den #10 av 97 totalt, även om den leder över flera öppna konkurrenter.
Hur många parametrar har Inkling, och vad är kontextfönstret?975B totalt med 41B aktiva (sparse MoE), över 66 lager. Kontextfönstret är upp till 1 000 000 tokens i de utgivna vikterna, och upp till 256K på värdbaserade API:er.
Är Inkling öppen källkod och vad är licensen? Vikterna släpps under Apache 2.0, vilket tillåter kommersiellt bruk och egen hosting. Det är ”öppna vikter” – fulla modellvikter finns på Hugging Face.
Är Inkling gratis att använda?Vikterna är gratis och royaltyfria att självhosta. Finjustering på Tinker och hostad inferens via leverantörer som Together AI, Fireworks, Modal, Databricks eller Baseten är betaltjänster. Hostad åtkomst börjar vid cirka 1,87 USD per 1M inmatningstokens (en tidsbegränsad lanseringsrabatt).
Hur kör eller laddar jag ner Inkling, och vilken hårdvara behöver jag?Ladda ner vikterna från Hugging Face och servera dem med vLLM, SGLang eller Hugging Face transformers via ett OpenAI-kompatibelt API. Förvänta dig ungefär ~2TB aggregerat VRAM för BF16 (8× B300 / 16× H200) eller ~600GB för den NVFP4‑kvantiserade kontrollpunkten (4× B300 / 8× H200). Communityns Unsloth GGUF‑byggen sänker tröskeln för experiment.
Hur finjusterar jag Inkling? Använd Thinking Machines’ Tinker plattform, som erbjuder 64K- och 256K-kontextalternativ och en tidsbegränsad 50% lanseringsrabatt, eller finjustera de öppna vikterna i din egen pipeline.
Vad är kontrollerbar tankeansträngning? En reasoning_effort-inställning (none / minimal / low / medium / high / xhigh / max) som växlar latens och tokenkostnad mot resonemangsdjup. Låg ansträngning passar klassificering och extraktion; max ansträngning passar svår matematik och matchar benchmarkkonfigurationen (Effort=0.99).
Hur står sig Inkling jämfört med Kimi, GLM, DeepSeek och Nemotron? Enligt MarkTechPosts jämförelse leder Inkling inom FORTRESS (säkerhet) och slår Nemotron 3 Ultra brett, men ligger efter GLM 5.2, Kimi K2.6 och DeepSeek V4 Pro på Terminal Bench 2.1, SWE-bench Verified och HLE. Det är konkurrenskraftigt men inte den starkaste öppna modellen för agentisk kodning.
Kan Inkling bearbeta bilder, ljud och video? Den accepterar text, bilder (40px–4096px) och ljud (16kHz WAV, upp till ~20 minuter) som indata. Utdata är endast text — ingen bild- eller ljudgenerering. Video användes vid förträning men är inte ett inmatningsformat som stöds vid lanseringen.
Är Inkling’s benchmark-resultat pålitliga? Behandla dem med försiktighet. Förutom det oberoende Artificial Analysis Intelligence Index är rubriksiffrorna leverantörs självrapporterade vid lansering och inte oberoende granskade. Konkurrentsiffror kommer från tredje parter (MarkTechPost) eller omkördes av Thinking Machines och kanske inte stämmer överens med konkurrenternas egna rapporterade siffror.
Vad är Inkling-Small, och vad finns på färdplanen? Inkling-Small är en mindre variant (276B totalt / 12B aktiv). Vid lanseringen var den fortfarande i förhandsgranskning, med vikter som ännu inte släppts. Huvudmodellen levereras redan med MTP-lager för spekulativ avkodning.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
