
TwIL-LM3-Pro: En 3,66B formell logikmodell som levereras via e-postförfrågan
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeNYTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 219 tok/s
- OpenAINYOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAINYOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicNYAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAINYGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
TwIL-LM3-Pro är en resonemangsmodell med 3,66 miljarder parametrar från webAI, byggd specifikt för formell logik snarare än för allmän konversation, och den har funnits på Hugging Face sedan den 3 september 2026. Det är ingen ny lansering, och den framställning som cirkulerat kring den här veckan – att webAI ”har släppt en 3,66B-modell” – är en månad efter vikterna. Det som faktiskt förändrades de senaste dagarna är mindre och mer användbart: checkpointen reviderades den 30 september, och den 1 oktober publicerade webAI ett LiteRT-LM-bygge av modellen för inferens på enheten för Android och iOS. Så den intressanta frågan är inte vad TwIL-LM3-Pro är, utan om du kan få tag på det, och svaret beror på vilken av tre distributionskanaler du står i – eftersom en av dem är ett formulär.
Den distinktionen spelar större roll än den annars skulle göra, eftersom TwIL-LM3-Pro inte är en produkt som du bara kan anropa. Det är en checkpoint som du laddar ner, kör på din egen hårdvara och accepterar villkoren för en licens som förbjuder kommersiell användning. Jämförelsen som dess eget modellkort inbjuder till – mot Qwen3-8B, en modell med mer än dubbelt så många parametrar – är verklig, men det är en jämförelse av benchmarks som leverantören kört i en testbänk som leverantören byggt, och modellkortet säger det självt på fler ställen än de flesta. Den här artikeln läser det kortet noggrant och skiljer det som webAI mätte från det som någon annan har.
Vad modellen faktiskt är
` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Swedish: "TwIL-LM3-Pro är en tät Granite-avkodare – `GraniteForCausalLM`, 40 lager, dold storlek 2 560, 40 uppmärksamhetshuvuden mot 8 nyckel-värde-huvuden – härledd från IBMs `granite-4.2-3b`. Parametrantalet 3,66B är den verkliga summan, 3 659 737 600, och kontextfönstret är basmodellens 131 072 token som förs vidare oförändrat. Den avger ett `<think>…</think>`-block innan den svarar och utvärderades med girig avkodning vid en budget på 2 048 token." Need consider "dense" in ML Swedish "tät" or "dens"? "dense Granite decoder" likely "tät Granite-avkodare". "attention heads" = "uppmärksamhetshuvuden" maybe "attention-huvuden" but Swedish. "key-value heads" = "nyckel-värde-huvuden". "derived from" = "härstammar från" perhaps. "parameter count" = "parametrantalet". "real total" = "verkliga totalsumman". "carried through unchanged" = "förs vidare oförändrat". "greedy decoding" = "girig avkodning" or "greedy-avkodning". In Swedish ML often "greedy avkodning" maybe hybrid. "at a 2,048-token budget" = "med en budget på 2 048 token". Need preserve `<think>…</think>` exactly, ellipsis maybe. The instruction says any text inside KEEP only. No markers. Need output only translated text. Ensure no English left except identifiers. "Granite decoder" maybe "Granite-avkodare". "dense" = "tät" but "dense Granite decoder" maybe "dens Granite-avkodare"? Swedish ML "tät" is used for dense layers? "dense" as opposed to MoE = "tät". Could use "tät". "Granite-avkodare" okay. "IBM's" = "IBMs". "3.66B parameter count" decimal comma Swedish: 3,66B. Thousands spaces: 3 659 737 600. 2 560. 131 072. 2 048. "token" can be plural "token" or "tokens"; Swedish often "token" both. Use "token". "131 072 token". "2 048-token budget" => "2 048-tokenbudget" or "budget på 2 048 token". Need no markers. Potential issue "TwIL-LM3-Pro" is a product name keep. "`GraniteForCausalLM`" code keep. "`granite-4.2-3b`" keep. `<think>…</think>` keep exactly? It is code-ish. Should we preserve ellipsis char? Yes. Output should have `<think>…</think>` same. Need maybe "40 attention heads against 8 key-value heads" = "40 attention heads mot 8 nyckel-värde-huvuden". In Swedish "attention heads" often "attention-huvuden" not "uppmärksamhetshuvuden"? The text uses technical. Could translate "uppmärksamhetshuvuden" but in ML Swedish many use "attention heads". The prompt says translate into Swedish. Use "uppmärksamhetshuvuden" but "attention heads" maybe a technical term. I'd use "uppmärksamhetshuvuden" or "attention-huvuden". "key-value heads" = "nyckel-värde-huvuden". Good. "dense Granite decoder" maybe "tät Granite-avkodare" perhaps okay. "Granite" brand keep. "decoder" = "avkodare". "derived from IBM's" = "härledd från IBMs". Could "härstammar från IBMs" more natural. "derived from IBM's `granite-4.2-3b`" = "härledd från IBMs `granite-4.2-3b`". We can use "härstammar från" because model derived. "härledd" maybe direct translation. "som härstammar från IBMs" better. But syntax: "TwIL-LM3-Pro är en tät Granite-avkodare – ... – som härstammar från IBMs..." That works. "The 3.66B parameter count is the real total, 3,659,737,600" = "Parametrantalet på 3,66B är den verkliga totalsumman, 3 659 737 600". "3.66B" maybe "3,66B" but B = billion? Swedish "miljarder"? Since product spec, keep B. "3,66B". "real total" = "faktiska totalen" maybe. "den verkliga totalsumman". Good. "and the context window is the base model's 131,072 tokens carried through unchanged." = "och kontextfönstret är basmodellens 131 072 token, oförändrat vidarefört." Better: "och kontextfönstret är basmodellens 131 072 token som förs vidare oförändrat." That's fine. "It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." = "Den avger ett `<think>…</think>`-block innan den svarar och utvärderades med girig avkodning vid en budget på 2 048 token." Good. Need maybe "greedy decoding" = "greedy-avkodning" because technical term. Swedish translation often "girig avkodning" exists. Use "girig avkodning". If wanting preserve term maybe "greedy-avkodning". The instruction says translate into Swedish. "girig avkodning" is Swedish. Fine. Need output only translated text no quotes. Ensure exact punctuation. Could use en dash or em dash? Original has "—" em dash. Swedish can use "–" en dash. But maybe preserve punctuation? Not markers. Use "–" or "—". We can use "–". Doesn't matter. But output only translated. Let's final.TwIL-LM3-Pro är en tät Granite-avkodare – `GraniteForCausalLM`, 40 lager, dold storlek 2 560, 40 uppmärksamhetshuvuden mot 8 nyckel-värde-huvuden – som härstammar från IBMs `granite-4.2-3b`. Parametrantalet på 3,66B är den verkliga totalsumman, 3 659 737 600, och kontextfönstret är basmodellens 131 072 token som förs vidare oförändrat. Den avger ett `<think>…</think>`-block innan den svarar och utvärderades med girig avkodning vid en budget på 2 048 token.
Efterträningsstacken är den del som webAI faktiskt vill att du ska titta på, och den är ovanligt väl dokumenterad för en modell av den här storleken: en övervakad finjustering med LoRA av rang 64 på en syntetisk korpus för formell logik, flervägsdestillering för att producera flera resonemangsspår per prompt, fusion av checkpoints i parameterrummet i stället för att ta den slutliga checkpointen, en WiSE-FT-interpolering vid α = 0,15 som sammanfogas tillbaka mot den förtränade basen med TIES och DARE-SLERP, och slutligen ett entropivägt GRPO-steg – webAI kallar det MGPO – mot en programmatisk verifierare, körd fram till steg 2580, vilket är den checkpoint som släpptes.
Den publicerade artefakten är den sammanslagna policyn snarare än en LoRA-adapter, vilket är den praktiska detaljen: du kan köra den som en fristående modell, i bf16 vid 6,82 GiB, eller som en Q4_K_M GGUF vid 2,09 GiB på en CPU eller 4 GB VRAM. Det är påståendet "runs on a laptop", och det är det enda påståendet i hela modellkortet som är trivialt verifierbart och därför värt att lita på.
Jämförelsen av Qwen3-8B, läs noga
Rubriken som webAI sätter på modellen är att TwIL-LM3-Pro når toppen av sina egna sammanfattningsrader för Track A vid 3,66B parametrar. De fyra sammanfattningsraderna är en makrogrind på 0,5539, strict-7 på 0,2879, ett medelvärde över sex banor på 0,5389 och macro_primary på 0,5875. Jämfört med Qwen3-8B är makrogrinden 0,5539 mot 0,5336 — och själva modellkortet skriver meningen som en marknadsföringssida skulle ha tagit bort: "försprånget i makrogrinden gentemot Qwen3-8B är 0,020 — mindre än samplingsbruset vid n = 200 per bana — så läs den siffran som likvärdighet, inte som en vinst."
Det är den enskilt viktigaste raden på sidan. webAI:s egen framställning av huvudresultatet är att det är oavgjort. Där jämförelsen inte är oavgjord:
• Strict-7 — TwIL-LM3-Pro 0.2879 mot Qwen3-8B 0.2093, och den här raden använder inte någon poäng för lös matchning någonstans, så den kan inte vara resultatet av tur med formateringen.
• Strikt MCQ — TwIL-LM3-Pro 0,4100 vs Qwen3-8B 0,0000, det bredaste banavståndet bland de elva rapporterade raderna.
• Regelinduktion — TwIL-LM3-Pro 0.4195 mot Qwen3-8B 0.3680.
• Korpusanpassning — den lägsta `lm_corpus`-perplexiteten bland alla armar, på 2,3130, med Qwen3-8B på 2,5478.
• Parametrar — 3,66B mot ungefär 8B, vilket är hela grunden för påståendet om "mindre än hälften så många parametrar".
Två förbehåll gäller den tabellen, och webAI uppger båda. Track A-genereringar från TwIL-LM3-Pro uppgår i genomsnitt till 1 902 tokens och 24,2 % av dem når längdtaket, jämfört med 564 tokens för dess egen föregångare TwIL-LM3; kortets ord för den resulterande skillnaden är ”vägledande snarare än exakt”. Och genomströmningssiffrorna i tabellen mättes i en senare session på en nyare vLLM (0.19.1) än jämförelsekolumnerna (0.11.2), så raderna för tokens per sekund är jämförbara med varandra och bara ungefärligt med resten.
Där det inte vinner
På held-out-sviten är modellkortet utan omsvep: "TwIL-LM3-Pro leder den inte." Makrot över 10 datamängder är 0,7901, statistiskt i nivå med dess egen basmodell på 0,7942, och klart efter Qwen3-8B på 0,8493 och gpt-oss-120b på 0,8689. Dess makro över 14 datamängder på 0,7425 slår basmodellen med 0,0093, och hela den vinsten kommer från BBH-logic (0,9540 mot basmodellens 0,9013) – tar man bort den raden hamnar modellen i genomsnitt på 0,7263 över de återstående tretton, under VibeThinker-3B:s 0,7350.
Det finns tre genuint svaga punkter inom specialiseringen, alla redovisade: exakt matchning för FOL-översättning på 0,0100, `procedural` på 0,1200 strikt och exakt matchning för semantisk parsning på 0,0000. Regelinduktion tolkar endast 56,5 % av sina utdata. Och modellen är mångordig till sin konstruktion – cirka 792 tokens per Track B-svar jämfört med 482 för sin föregångare – vilket är en kostnad, inte en förmåga.
Inget av detta är kritik mot släppet. Det är så ett välskrivet modellkort ser ut, och det är därför siffrorna här överhuvudtaget kan citeras.
Tre sätt att få det, och ett av dem är ett formulär
Distributionssituationen är veckans egentliga nyhet och den är värd att formuleras exakt.
Vikterna finns på Hugging Face, fritt tillgängliga, under webAI Non-Commercial License ver. 1.0 – som tillåter forskning och personligt bruk och kräver ett separat avtal med webAI för intäktsgenererande driftsättning. Den licensen är den bindande begränsningen för hela släppet, och det är därför TwIL-LM3-Pro inte är en modell som de flesta produktteam helt enkelt kan ta till sig.
webAI säger att familjen har passerat en halv miljon nedladdningar på en månad, en siffra som företaget publicerade i sitt eget tillkännagivande och som inte har granskats oberoende. Nedladdningar av en gratis icke-kommersiell checkpoint är inte en proxy för produktionsanvändning, och webAI framställer dem inte som en sådan.
Leverantörens egen plattform är emellertid inte någon offentlig slutpunkt. webAI beskriver sig som en företagsplattform som gör AI tillgänglig för dina data, med en modellapplikation som i första hand körs lokalt, och dess kommersiella modell är ett företagsavtal snarare än en publicerad prislista per token. TwIL-LM3-Pro saknas också på de stora tredjepartsplattformarna för inferens som indexerar öppna checkpoints – vi kontrollerade, och den finns inte i OrcaRouters katalog heller – så det praktiska svaret på "var anropar jag det här från ett API" är att det gör man för närvarande mestadels inte; man laddar ner det.
Den tredje kanalen är den nya. Repot `TwIL-LM3-Pro-LiteRT-LM` dök upp den 1 oktober 2026, med `.litertlm`-artefakter och taggat för Android och iOS – webAI:s egen paketering av samma vikter för LiteRT-LM-runtime. Huruvida den byggversionen ärver den icke-kommersiella licensen är frågan som måste besvaras innan man planerar utifrån den, eftersom moderrepot gör det.
Varför en specialist på formell logik i den här storleken är värd att hålla ögonen på
Anledningen till att den här utgåvan fortsätter återkomma är inte benchmark-tabellen. Det är att webAI publicerade hela pipelinen, körde exakt samma recept på fem olika basmodeller och rapporterade vad som hände. Familjejämförelsetabellen registrerar Track A:s macro-gate-rörelse på +0,012 till +0,145 beroende på basmodellen, medan held-out-sviten håller sig inom ±0,013 – pappersspårsversionen av ”detta generaliserar”. Den enda koefficienten som väljs per modell är merge-vikten, svept över held-out-prestanda: 0,15 för SmolLM3, 0,20 för Granite och TwIL-basen, 0,50 för VibeThinker-3B.
Det är ett återanvändbart recept för att förvandla en liten allmän modell till en nischad specialist utan att förstöra vad den redan kunde, publicerat med de negativa resultaten bifogade. För alla som behöver entailment-etiketter, formalisering av Lean-påståenden eller semantiska parsningar i stället för flytande prosa är en GGUF på 2,09 GiB som körs offline utan avgift per anrop och utan nätverksberoende en annan sak än vilken hostad modell som helst, vad Elo-tabellen än säger.
Den öppna frågan är om vikterna någonsin dyker upp under en licens som tillåter kommersiell användning, och om LiteRT-LM-porten levereras med samma begränsning. Fram till dess är TwIL-LM3-Pro en forskningsartefakt med ett ovanligt ärligt modellkort – vilket inte är ingenting.

Om du behöver den här funktionen i produktion idag
För en kommersiell driftsättning är det licensen, inte benchmarkresultaten, som är hindret, och den praktiska ersättningen är en hostad modell som du kan routa till. Det är lagret som OrcaRouter verkar i: en OpenAI-kompatibel endpoint framför över 200 modeller till leverantörens listpris utan påslag, så en leverantörs prissänkning slår igenom samma dag i stället för efter en avtalscykel. För de få platser där en liten checkpoint för formell logik verkligen passar — offline-batchmärkning, en luftgapad entailment-körning, ett förbearbetningssteg vars utdata är en etikett snarare än prosa — är den ärliga uppdelningen att köra den lokala modellen där arbetsbelastningen är text-till-etikett, och routa det omgivande resonemanget, promptutökningen och QA till hostade modeller med samma nyckel.
Ett förbehåll som är värt att upprepa särskilt i det här avsnittet: med automatisk failover kan du också peka på en modell innan du litar på den i en produktionsväg, och rulla tillbaka genom att redigera en routningsregel i stället för att driftsätta igen. Det är mönstret som passar en modell som denna när dess kommersiella status är oklar.

Vad du ska titta på
Tre saker skulle förändra den här historien. En licensändring, eller en tydligt licensierad LiteRT-LM-port, skulle flytta TwIL-LM3-Pro från forskningsartefakt till driftsättningsbar komponent. Att den dyker upp på en stor värdbaserad inferensplattform skulle ge den ett riktigt API. Och en oberoende utvärdering – någon annan än webAI som kör Track A-testramverket – skulle visa oss om strict-7-försprånget över Qwen3-8B står sig när det mäts av någon som inte byggde testramverket. Inget av de tre har hänt ännu, och modellkortet är tillräckligt ärligt för att man ska kunna se exakt vad som skulle behöva gälla för att de ska ha betydelse.

