
TwIL-LM3-Pro: een formeel-logisch model van 3,66 miljard dat op aanvraag per e-mail wordt geleverd
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
TwIL-LM3-Pro is een redeneermodel met 3,66 miljard parameters van webAI, specifiek gebouwd voor formele logica in plaats van voor algemene gesprekken, en het staat sinds 3 september 2026 op Hugging Face. Het is geen nieuwe release, en de framing die er deze week rond circuleert — dat webAI "een 3,66B-model heeft uitgebracht" — loopt een maand achter op de weights. Wat er de afgelopen dagen werkelijk is veranderd, is kleiner en nuttiger: het checkpoint is op 30 september herzien, en op 1 oktober publiceerde webAI een LiteRT-LM-build van het model voor on-device-inferentie op Android en iOS. De interessante vraag is dus niet wat TwIL-LM3-Pro is, maar of je het kunt krijgen, en het antwoord hangt ervan af in welk van de drie distributiekanalen je je bevindt — want een ervan is een formulier.
Dat onderscheid is belangrijker dan het normaal zou zijn, omdat TwIL-LM3-Pro geen product is dat je zomaar kunt aanroepen. Het is een checkpoint dat je downloadt, op je eigen hardware draait en waarvoor je de voorwaarden van een licentie accepteert die commercieel gebruik verbiedt. De vergelijking die de eigen modelkaart uitnodigt — met Qwen3-8B, een model met meer dan twee keer zoveel parameters — is reëel, maar het is een vergelijking van door leveranciers uitgevoerde benchmarks op een door de leverancier gebouwde testomgeving, en de modelkaart zegt dat zelf op meer plaatsen dan de meeste. Dit stuk leest die kaart nauwgezet en scheidt wat webAI heeft gemeten van wat wie dan ook verder heeft.
Wat het model eigenlijk is
`. Need translate into Dutch. Keep URLs/brand names. We need output only translated text with markers. No markers present. Need preserve code identifiers exactly likely. Need translate prose. Need be careful with technical terms. We need produce Dutch translation. Need preserve `GraniteForCausalLM`, `granite-4.2-3b`, parameter count, context window numbers, `<think>…</think>`, greedy decoding? Translate maybe "greedy decoding" as "greedy decoding" or "hebberige decoding"? In Dutch ML, "greedy decoding" often kept. "dense Granite decoder" maybe "dense Granite-decoder". "attention heads against 8 key-value heads" -> "40 attention heads tegenover 8 key-value-heads". "derived from" -> "afgeleid van". "IBM's" -> "IBM's". "real total" -> "werkelijke totaal". "context window is base model's 131,072 tokens carried through unchanged" -> "het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen." "It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." -> "Het zendt een `<think>…</think>`-blok uit voordat het antwoordt en werd geëvalueerd met greedy decoding bij een budget van 2.048 tokens." Need Dutch number formatting maybe 2.560, 3,66 miljard? Parameter count exact 3,659,737,600. In Dutch thousands separators periods, decimals comma. But exact number maybe preserve? It says "3.66B parameter count is the real total, 3,659,737,600" We can write "3,66 miljard" or "3,66B". But preserve exact number "3.659.737.600"? The original exact has commas. Should we localize number formatting? Translation into Dutch should use Dutch conventions perhaps. But exact number maybe should be preserved to avoid ambiguity. We can write "3.659.737.600" Dutch. But user says preserve URLs and brand/product names, not necessarily numbers. But numbers in Dutch use periods for thousands. However exact parameter count with commas is English formatting. In Dutch, "3.659.737.600". Context window "131.072 tokens". Hidden size "2.560". Budget "2.048". Need decide. The instruction says translate. Usually localization includes number formatting. But exact numbers could be kept? I'd localize to Dutch formatting. But "3.66B" -> "3,66 miljard". However exact total "3,659,737,600" if converted to "3.659.737.600" is correct Dutch. Maybe "3,659,737,600" could be read as decimal? In Dutch comma decimal, so that would be wrong. Thus use periods. Need ensure backticks and code identifiers. "dense Granite decoder" maybe "dense Granite-decoder". "hidden size" -> "verborgen grootte" or "hidden size"? In Dutch ML sometimes "verborgenheidsgrootte" no; "omvang van de verborgen laag" maybe. Better technical: "verborgen grootte" or "hidden size" kept. "40 attention heads against 8 key-value heads" -> "40 attention heads tegenover 8 key-value-heads". "key-value heads" maybe "key-value-heads". "attention heads" often "attention heads". Could translate as "aandachtshoofden" but technical audiences use English. The source has English technical terms. Dutch translation can retain common loanwords. Need natural. "TwIL-LM3-Pro is een dense Granite-decoder — `GraniteForCausalLM`, 40 lagen, verborgen grootte 2.560, 40 attention heads tegenover 8 key-value-heads — afgeleid van IBM's `granite-4.2-3b`." Is "dense" maybe "dichte"? In ML "dense" means dense model. Dutch "dense" often kept. "dense Granite-decoder" okay. "against" -> "tegenover" or "versus". "40 attention heads tegenover 8 key-value-heads" okay. "The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged." -> "Het aantal parameters van 3,66 miljard is het werkelijke totaal, 3.659.737.600, en het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen." Should "parameter count" maybe "parameteraantal". "Het parameteraantal van 3,66B is het werkelijke totaal..." I'd write "Het parameteraantal van 3,66 miljard is het werkelijke totaal, 3.659.737.600, en het contextvenster is de 131.072 tokens van het basismodel, die ongewijzigd zijn overgenomen." Actually "carried through unchanged" -> "ongewijzigd overgenomen". The tokens are "de 131.072 tokens ... ongewijzigd overgenomen." Good. "It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." -> "Het geeft een `<think>…</think>`-blok weer voordat het antwoordt en werd geëvalueerd met greedy decoding met een budget van 2.048 tokens." "emits" -> "zendt uit" but for model output "genereert" maybe. "Het genereert een `<think>…</think>`-blok voordat het antwoordt..." That is natural. "was evaluated with greedy decoding at a 2,048-token budget" -> "en werd geëvalueerd met greedy decoding bij een budget van 2.048 tokens." Good. Need preserve `<think>…</think>` exactly. The ellipsis is a single char? It shows `…`. Preserve. Backticks around `<think>…</think>`? Source: "a `<think>…</think>` block" with backticks. So keep backticks. No span markers. Output only translated text. Ensure no preamble. Final in Dutch. Potential issue "TwIL-LM3-Pro" brand. Keep. "GraniteForCausalLM" keep. "granite-4.2-3b" keep. "IBM's" keep? Translate as "IBM's" same. "dense" maybe should we translate? In Dutch, "dense" English adjective. Could say "een dense Granite-decoder". Fine. Need decide number formatting for "3.66B" -> "3,66B" or "3,66 miljard". Source says "3.66B parameter count". Dutch decimal comma. "3,66B" is concise but B is English billion. Dutch "3,66 miljard" more localized. The exact total "3,659,737,600" -> "3.659.737.600". Hidden size 2,560 -> 2.560. Context 131,072 -> 131.072. Budget 2,048 -> 2.048. Need ensure "40 attention heads against 8 key-value heads" maybe "40 attention-heads tegen 8 key-value-heads". Use "tegenover" okay. "key-value-heads" maybe hyphenated. Let's craft: "TwIL-LM3-Pro is een dense Granite-decoder — `GraniteForCausalLM`, 40 lagen, verborgen grootte 2.560, 40 attention-heads tegenover 8 key-value-heads — afgeleid van IBM's `granite-4.2-3b`. Het parameteraantal van 3,66 miljard is het werkelijke totaal, 3.659.737.600, en het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen. Het genereert een `<think>…</think>`-blok voordat het antwoordt en werd geëvalueerd met greedy decoding bij een budget van 2.048 tokens." Check "40 attention heads" source no hyphen. Dutch compound maybe "attention-heads". Fine. "verborgen grootte" maybe "verborgenheidsgrootte"? In ML "hidden size" is "verborgen grootte" or "hidden size". Maybe keep "hidden size" as technical: "hidden size 2.560". But translation should Dutch. "verborgen grootte" is understandable. Could say "hidden size 2.560" to avoid awkward. The instruction is translate. I can keep "hidden size" as jargon. But I'd translate. "verborgen grootte" is literal but okay. "afgeleid van IBM's `granite-4.2-3b`." Source says "derived from IBM's `granite-4.2-3b`." Dutch "afgeleid van IBM's `granite-4.2-3b`." Good. "Het parameteraantal van 3,66 miljard is het werkelijke totaal" - "parameter count" could be "aantal parameters". "Het aantal parameters van 3,66 miljard is het werkelijke totaal" more natural. Use that. "en het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen." Good. Maybe "dat van het basismodel" but source says base model's. "het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen." Fine. "Het genereert een `<think>…</think>`-blok voordat het antwoordt" - source "before answering" -> "voordat het antwoordt". Good. "en werd geëvalueerd met greedy decoding bij een budget van 2.048 tokens." Good. Need output only. Final. Wait: The system says "You are a professional software-localization engine. Translate the user's message into Dutch. The text contains numbered span markers like ..." There are none. Output only translated text. Good. Need maybe preserve `<think>…</think>` exactly. I have backticks. Good. Potential issue "TwIL-LM3-Pro" capitalization. Preserve. "GraniteForCausalLM" code. Good. Should "dense" be translated? In Dutch ML literature, "dense" is used. Could say "dicht" no. Keep dense. Should "attention heads" be translated? In Dutch, "aandachtshoofden" is literal but not common. Keep "attention-heads". Could write "attention heads" without hyphen. In Dutch compound maybe hyphen. Source "40 attention heads". I wrote "40 attention-heads". That's okay. Maybe preserve exact English term "attention heads" no hyphen. I'd write "40 attention heads tegenover 8 key-value-heads" to keep source term. Let's adjust: "40 attention heads tegenover 8 key-value-heads". Good. Should "key-value-heads" maybe "key-value-heads" with hyphen. Fine. "verborgen grootte" maybe "verborgen dimensie"? Hidden size is "hidden size" or "verborgen dimensie". In Dutch, "verborgen grootte" is literal. Maybe "verborgenheidsgrootte" no. I can keep "hidden size" as technical term: "hidden size 2.560". But translation expected. Hmm. "verborgen grootte" is acceptable. I'll use "verborgen grootte". Number "2.560" in Dutch. But if hidden size is 2,560, Dutch "2.560". Good. But code/params often use comma in English; Dutch uses period. Fine. Need final only.TwIL-LM3-Pro is een dense Granite-decoder — `GraniteForCausalLM`, 40 lagen, verborgen grootte 2.560, 40 attention heads tegenover 8 key-value-heads — afgeleid van IBM's `granite-4.2-3b`. Het aantal parameters van 3,66 miljard is het werkelijke totaal, 3.659.737.600, en het contextvenster is de 131.072 tokens van het basismodel, ongewijzigd overgenomen. Het genereert een `<think>…</think>`-blok voordat het antwoordt en werd geëvalueerd met greedy decoding bij een budget van 2.048 tokens.
De post-trainingstack is het deel waar webAI eigenlijk wil dat je naar kijkt, en is ongewoon goed gedocumenteerd voor een model van deze omvang: een gesuperviseerde fine-tune met rank-64 LoRA op een synthetisch corpus met formele logica, multipath-distillatie om meerdere redeneersporen per prompt te produceren, checkpointfusie in de parameterruimte in plaats van het nemen van de laatste checkpoint, een WiSE-FT-interpolatie bij α = 0,15 die met TIES en DARE-SLERP terug in de richting van de voorgetrainde basis wordt samengevoegd, en ten slotte een entropiegewogen GRPO-fase — webAI noemt die MGPO — tegen een programmatische verifier, uitgevoerd tot stap 2580, de checkpoint die is uitgebracht.
Het gepubliceerde artefact is de samengevoegde policy in plaats van een LoRA-adapter, wat het praktische detail is: je kunt het als zelfstandig model draaien, in bf16 met 6,82 GiB, of als een Q4_K_M GGUF van 2,09 GiB op een CPU of 4 GB VRAM. Dat is de 'draait op een laptop'-bewering, en het is de enige bewering op de hele modelkaart die eenvoudig te verifiëren is en daarom het vertrouwen waard.
De Qwen3-8B-vergelijking, lees aandachtig
De kop die webAI op het model zet, is dat TwIL-LM3-Pro de top bereikt van zijn eigen Track A-samenvattingsrijen bij 3,66 miljard parameters. De vier samenvattingsrijen zijn een macro gate van 0,5539, strict-7 van 0,2879, een six-lane average van 0,5389, en macro_primary van 0,5875. Tegenover Qwen3-8B is de macro gate 0,5539 versus 0,5336 — en de modelkaart zelf schrijft de zin die een marketingpagina zou hebben verwijderd: "de gate-voorsprong op Qwen3-8B is 0,020 — kleiner dan de steekproefruis bij n = 200 per lane — dus lees die als pariteit, geen overwinning."
Dat is de allerbelangrijkste regel op de pagina. webAI's eigen framing van het hoofdresultaat is dat het een gelijkspel is. Waar de vergelijking geen gelijkspel is:
• Strict-7 — TwIL-LM3-Pro 0.2879 vs Qwen3-8B 0.2093, en deze rij gebruikt nergens credit voor losse overeenkomsten, dus die kan niet door geluk met de opmaak tot stand zijn gekomen.
• Strikte MCQ — TwIL-LM3-Pro 0.4100 vs Qwen3-8B 0.0000, het grootste baanverschil van de elf gerapporteerde rijen.
• Regelinductie — TwIL-LM3-Pro 0.4195 vs Qwen3-8B 0.3680.
• Corpusfit — de laagste `lm_corpus`-perplexiteit van alle arms op 2,3130, Qwen3-8B op 2,547.
• Parameters — 3,66 miljard versus ongeveer 8 miljard, wat de volledige basis vormt voor de bewering "minder dan de helft van de parameters".
Twee kanttekeningen hangen aan die tabel en webAI vermeldt beide. Track A-generaties van TwIL-LM3-Pro zijn gemiddeld 1.902 tokens en 24,2% ervan bereikt de lengtelimiet, tegenover 564 tokens voor zijn eigen voorganger TwIL-LM3; het woord van de kaart voor het resulterende verschil is "indicatief in plaats van exact." En de doorvoercijfers in de tabel zijn gemeten in een latere sessie op een nieuwere vLLM (0.19.1) dan de vergelijkingskolommen (0.11.2), dus de rijen met tokens per seconde zijn onderling vergelijkbaar en slechts bij benadering met de rest.
Waar het niet wint
Op de achtergehouden suite is de modelkaart bot: "TwIL-LM3-Pro voert die niet aan." De macro over 10 datasets is 0,7901, statistisch gelijk aan die van zijn eigen basismodel op 0,7942, en ver achter Qwen3-8B op 0,8493 en gpt-oss-120b op 0,8689. Zijn macro over 14 datasets van 0,7425 verslaat zijn basismodel met 0,009, en die hele winst komt van BBH-logic (0,9540 tegen 0,9013 van het basismodel) — haal die ene rij eruit en het model komt gemiddeld uit op 0,7263 over de resterende dertien, onder de 0,7350 van VibeThinker-3B.
Er zijn drie echt zwakke plekken binnen de specialisatie, allemaal openbaar gemaakt: exacte overeenkomst voor FOL-vertaling op 0,0100, `procedural` op 0,1200 strikt, en exacte overeenkomst voor semantische parse op 0,0000. Regelinductie parseert slechts 56,5% van zijn uitvoer. En het model is per constructie breedsprakig — ongeveer 792 tokens per Track B-antwoord tegenover 482 voor zijn voorganger — wat een kostenpost is, geen capaciteit.
Niets hiervan is kritiek op het model. Zo ziet een goed geschreven modelkaart eruit, en daarom kunnen de cijfers hier überhaupt worden geciteerd.
Drie manieren om het te krijgen, en één ervan is een formulier.
De distributiesituatie is het echte nieuws van de week en het is de moeite waard om die precies te verwoorden.
De gewichten staan op Hugging Face, zonder toegangsbeperking, onder de webAI Non-Commercial License ver. 1.0 — die onderzoek en persoonlijk gebruik toestaat en een aparte overeenkomst met webAI vereist voor implementatie die inkomsten genereert. Die licentie is de bindende beperking voor de hele release, en daarom is TwIL-LM3-Pro geen model dat de meeste productteams eenvoudigweg kunnen adopteren.
webAI zegt dat de familie in een maand tijd de half miljoen downloads heeft gepasseerd, een cijfer dat het bedrijf in zijn eigen aankondiging heeft gepubliceerd en dat niet onafhankelijk is gecontroleerd. Downloads van een gratis niet-commercieel checkpoint zijn geen proxy voor productiegebruik, en webAI presenteert ze niet als zodanig.
Het eigen platform van de leverancier is intussen geen publiek endpoint. webAI beschrijft zichzelf als een enterpriseplatform dat AI naar je data brengt, met een local-first modelapplicatie, en de commerciële route is een enterprise-regeling in plaats van een gepubliceerde tariefkaart per token. TwIL-LM3-Pro ontbreekt ook op de grote inferentieplatforms van derden die open checkpoints indexeren — we hebben het gecontroleerd, en het staat ook niet in de OrcaRouter-catalogus — dus het praktische antwoord op "waar kan ik dit vanuit een API aanroepen" is dat je dat op dit moment meestal niet doet; je downloadt het.
Het derde kanaal is het nieuwe. De repository `TwIL-LM3-Pro-LiteRT-LM` verscheen op 1 oktober 2026, met `.litertlm`-artefacten en getagd voor Android en iOS — webAI's eigen LiteRT-LM runtime-packaging van dezelfde gewichten. Of die build de niet-commerciële licentie erft, is de vraag die beantwoord moet worden voordat je eromheen gaat plannen, want de bovenliggende repository doet dat.
Waarom een specialist in formele logica bij een bedrijf van deze omvang het volgen waard is
De reden dat deze release blijft opduiken, is niet de benchmarktabel. Het komt doordat webAI de hele pipeline publiceerde, het identieke recept op vijf verschillende basismodellen uitvoerde en rapporteerde wat er gebeurde. De familievergelijkingstabel registreert de macro-gate-verschuiving van Track A van +0,012 tot +0,145, afhankelijk van de basis, terwijl de held-out-suite binnen ±0,013 blijft — de audittrail-versie van "dit generaliseert." De ene coëfficiënt die per model wordt gekozen, is het mergegewicht, dat via een sweep op held-outprestaties wordt bepaald: 0,15 voor SmolLM3, 0,20 voor Granite en de TwIL-basis, 0,50 voor VibeThinker-3B.
Dat is een herbruikbaar recept om een klein algemeen model om te vormen tot een smalle specialist zonder te vernietigen wat het al wist, gepubliceerd met de negatieve resultaten erbij. Voor iedereen die entailment-labels, formalisatie van Lean-statements of semantische parses nodig heeft in plaats van vloeiend proza, is een 2,09 GiB GGUF die offline werkt zonder kosten per aanroep en zonder netwerkafhankelijkheid iets heel anders dan welk gehost model dan ook, wat de Elo-tabel ook zegt.
De open vraag is of de gewichten ooit onder een licentie verschijnen die commercieel gebruik toestaat, en of de LiteRT-LM-port met dezelfde beperking wordt geleverd. Tot dan is TwIL-LM3-Pro een onderzoeksartefact met een ongewoon eerlijke modelkaart — wat niet niets is.

Als u deze functionaliteit vandaag in productie nodig hebt
Voor een commerciële deployment is de licentie, niet de benchmarks, de belemmering, en het praktische alternatief is een gehost model waar je naartoe kunt routeren. Dat is de laag waarin OrcaRouter opereert: één OpenAI-compatibel endpoint voor meer dan 200 modellen tegen de lijstprijs van de provider, zonder extra opslag, zodat een prijsverlaging van een leverancier dezelfde dag live is in plaats van na een contractcyclus. Voor de paar plekken waar een klein formal-logic checkpoint echt past — offline batch-labeling, een air-gapped entailment-pass, een voorverwerkingsstap waarvan de output een label is in plaats van proza — is de eerlijke splitsing om het lokale model te draaien waar de werkbelasting text-to-label is, en de omringende redenering, prompt-uitbreiding en QA naar gehoste modellen op dezelfde sleutel te routeren.
Eén voorbehoud dat juist in deze sectie herhaald moet worden: met automatische failover kun je ook naar een model verwijzen voordat je het op een productiepad vertrouwt, en terugdraaien door een routeringsregel te bewerken in plaats van opnieuw uit te rollen. Dat is het patroon dat past bij een model als dit wanneer de commerciële status ervan onopgelost is.

Wat te kijken
Drie dingen zouden dit verhaal veranderen. Een licentiewijziging, of een duidelijk gelicentieerde LiteRT-LM-port, zou TwIL-LM3-Pro van onderzoeksartefact naar inzetbare component verplaatsen. Verschijning op een groot gehost inferentieplatform zou het een echte API geven. En een onafhankelijke evaluatie — iemand anders dan webAI die de Track A-harness draait — zou ons vertellen of de strict-7-voorsprong op Qwen3-8B standhoudt wanneer die wordt gemeten door iemand die de harness niet heeft gebouwd. Geen van de drie is tot nu toe gebeurd, en de modelkaart is eerlijk genoeg dat je precies kunt zien wat er zou moeten gelden om ze van belang te laten zijn.

