Eine generierte Titelkarte mit der Überschrift „TwIL-LM3-Pro“, dem Untertitel „Ein 3,66B-Formallogik-Modell“, mit drei abgerundeten Statistik-Karten mit der Aufschrift „3,66B Parameter“, „2,09 GiB Q4_K_M“ und „131.072-Token-Kontext“. Eine Fußzeile lautet „Anbieter-Benchmarks: webAI Track A / Track B-Harness.“ Das OrcaRouter-Logo ist in der unteren rechten Ecke eingefügt.
Guides & Insights

TwIL-LM3-Pro: Ein 3,66B-Formal-Logik-Modell, das auf Anfrage per E-Mail versendet wird

Autor

Alistair Wren

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen →
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

TwIL-LM3-Pro ist ein Reasoning-Modell mit 3,66 Milliarden Parametern von webAI, das speziell für formale Logik statt für allgemeine Konversation entwickelt wurde und seit dem 3. September 2026 auf Hugging Face zu finden ist. Es ist keine Neuveröffentlichung, und die in dieser Woche darüber kursierende Darstellung – dass webAI „ein 3,66B-Modell veröffentlicht habe“ – ist gegenüber den Gewichten um einen Monat zu spät. Was sich in den letzten Tagen tatsächlich geändert hat, ist kleiner und nützlicher: Der Checkpoint wurde am 30. September überarbeitet, und am 1. Oktober veröffentlichte webAI einen LiteRT-LM-Build des Modells für On-Device-Inferenz unter Android und iOS. Die interessante Frage ist also nicht, was TwIL-LM3-Pro ist, sondern ob man es bekommen kann, und die Antwort hängt davon ab, in welchem von drei Distributionskanälen man steht – denn einer davon ist ein Formular.

Diese Unterscheidung ist wichtiger, als sie es normalerweise wäre, denn TwIL-LM3-Pro ist kein Produkt, das man einfach aufrufen kann. Es ist ein Checkpoint, den man herunterlädt, auf eigener Hardware ausführt und die Bedingungen einer Lizenz akzeptiert, die kommerzielle Nutzung verbietet. Der Vergleich, zu dem die eigene Modellkarte einlädt – mit Qwen3-8B, einem Modell mit mehr als doppelt so vielen Parametern –, ist real, aber es ist ein Vergleich von vom Anbieter durchgeführten Benchmarks auf einer vom Anbieter erstellten Testumgebung, und die Modellkarte sagt das selbst an mehr Stellen als die meisten. Dieser Beitrag liest diese Karte genau und trennt, was webAI gemessen hat, von dem, was alle anderen haben.

Was das Modell tatsächlich ist

`. Need preserve URLs and brand/product names. Need output ONLY translated text with its markers. No preamble. We need produce German translation. Need be careful: "TwIL-LM3-Pro" brand/product name preserve. "Granite decoder", `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads against 8 key-value heads, derived from IBM's `granite-4.2-3b`. "The 3.66B parameter count is the real total, 3,659,737,600, and the context window is the base model's 131,072 tokens carried through unchanged. It emits a `<think>…</think>` block before answering and was evaluated with greedy decoding at a 2,048-token budget." Need translate. No markers in input, so output no markers. But maybe "TwIL-LM3-Pro" maybe product. "dense Granite decoder" -> "ein dichter Granite-Decoder"? Dense likely "dichter" or "dense" as architecture. German ML: "dichter Decoder" maybe "dense Granite-Decoder" preserving "dense"? We can translate "dense" as "dichter" but may be technical term. The phrase "Granite decoder" -> "Granite-Decoder". "40 layers" -> "40 Schichten". "hidden size 2,560" -> "Hidden-Size 2.560" or "verdeckte Größe"? In German ML often "Hidden-Size" or "versteckte Dimension". "hidden size 2,560" -> "verdeckte Größe 2.560" maybe. "40 attention heads against 8 key-value heads" -> "40 Attention-Heads gegenüber 8 Key-Value-Heads". "derived from IBM's `granite-4.2-3b`" -> "abgeleitet von IBMs `granite-4.2-3b`". "The 3.66B parameter count is the real total, 3,659,737,600" -> "Die Parameteranzahl von 3,66 Mrd. ist die tatsächliche Gesamtzahl, 3.659.737.600" But "3.66B" maybe preserve? Could translate "3,66 Mrd. Parameter". "context window" -> "Kontextfenster". "base model's 131,072 tokens carried through unchanged" -> "die 131.072 Token des Basismodells unverändert übernommen". "It emits a `<think>…</think>` block before answering" -> "Es gibt einen `<think>…</think>`-Block aus, bevor es antwortet" or "Es erzeugt vor der Antwort einen `<think>…</think>`-Block". "was evaluated with greedy decoding at a 2,048-token budget." -> "und wurde mit Greedy Decoding bei einem Budget von 2.048 Token evaluiert." Need maybe use German number formatting: 2.560, 131.072, 3.659.737.600, 2.048, 3,66 Mrd. Preserve 3.66B? The number "3.66B" could be translated "3,66 Mrd." but "B" maybe billion. They specified "3.66B parameter count is the real total, 3,659,737,600". We can write "Die Parameteranzahl von 3,66 Mrd. ist die tatsächliche Gesamtzahl, 3.659.737.600". But "3.66B" maybe should preserve? It says preserve URLs and brand/product names. Numbers can be translated. However if "3.66B" is a count, maybe German "3,66 Mrd." okay. Need ensure no markers. Output only translated text. Could include backticks and angle tags exactly? "Preserve URLs and brand/product names." `GraniteForCausalLM` is code, product? Should keep as-is. `granite-4.2-3b` keep. `<think>…</think>` keep exactly? The ellipsis maybe `…` preserve. We can include backticks around `<think>…</think>`? Original has `<think>…</think>` without backticks. We should keep same. "TwIL-LM3-Pro" keep. "IBM" keep. Need maybe "dense Granite decoder" -> "dichter Granite-Decoder". Is Granite brand? Yes. "Granite" preserve. "decoder" maybe "Decoder". "dense" in ML often "dense" (not "dicht"). But German translation "dichter Granite-Decoder" is okay. Maybe more natural: "ein dichter Granite-Decoder". "40 Aufmerksamkeitsköpfe gegenüber 8 Key-Value-Köpfen" or "40 Attention-Heads gegen 8 Key-Value-Heads". German ML often uses "Attention-Heads" and "Key-Value-Heads". "gegen" maybe "gegenüber" better. "hidden size" maybe "Hidden-Size". Phrase: "Hidden-Size 2.560". "40 Attention-Heads gegenüber 8 Key-Value-Heads". "abgeleitet von IBMs `granite-4.2-3b`". "Die Parameteranzahl von 3,66 Mrd. ist die tatsächliche Gesamtzahl, 3.659.737.600, und das Kontextfenster ist das des Basismodells mit 131.072 Token, unverändert übernommen." Good. "Es gibt vor der Antwort einen `<think>…</think>`-Block aus und wurde mit Greedy Decoding bei einem Budget von 2.048 Token evaluiert." Or "Es erzeugt vor der Beantwortung einen `<think>…</think>`-Block und wurde ..." Better "Es erzeugt vor der Antwort einen `<think>…</think>`-Block". Need maybe "It emits" refers model. "Es gibt ... aus" is okay. "greedy decoding" maybe "Greedy Decoding" preserve. "2,048-token budget" -> "Budget von 2.048 Token". Need ensure no extra spaces? We can output one paragraph. Potential issue: "against 8 key-value heads" maybe "gegen" vs "gegenüber". "40 attention heads against 8 key-value heads" is grouped-query attention: 40 attention heads to 8 key-value heads. German: "40 Attention-Heads gegenüber 8 Key-Value-Heads". Good. "dense Granite decoder — `GraniteForCausalLM`, 40 layers, hidden size 2,560, 40 attention heads against 8 key-value heads — derived from IBM's `granite-4.2-3b`." German word order: "TwIL-LM3-Pro ist ein dichter Granite-Decoder — `GraniteForCausalLM`, 40 Schichten, Hidden-Size 2.560, 40 Attention-Heads gegenüber 8 Key-Value-Heads — abgeleitet von IBMs `granite-4.2-3b`." Good. "parameter count" maybe "Parameterzahl" or "Parameteranzahl". "The 3.66B parameter count is the real total, 3,659,737,600" -> "Die Parameteranzahl von 3,66 Mrd. ist die tatsächliche Gesamtsumme, 3.659.737.600". "Gesamtzahl" vs "Gesamtsumme". "real total" = "tatsächliche Gesamtzahl". Good. "context window is the base model's 131,072 tokens carried through unchanged" -> "das Kontextfenster sind die 131.072 Token des Basismodells, unverändert übernommen" Actually "context window is ... tokens" in German "das Kontextfenster umfasst die 131.072 Token des Basismodells, die unverändert übernommen wurden." But preserving sense: "das Kontextfenster ist das des Basismodells mit 131.072 Token, unverändert übernommen." Better: "das Kontextfenster entspricht den 131.072 Token des Basismodells und wurde unverändert übernommen." But "context window is the base model's 131,072 tokens carried through unchanged" means window is 131,072 tokens unchanged from base. "das Kontextfenster ist das des Basismodells mit 131.072 Token, unverändert übernommen." Good. "evaluated with greedy decoding at a 2,048-token budget." -> "mit Greedy Decoding bei einem Budget von 2.048 Token evaluiert." Good. No markers, so final exactly. Need maybe no markdown? It's text. Fine. Double-check German punctuation: decimal commas for numbers. 2,560 -> 2.560. 131,072 -> 131.072. 3,659,737,600 -> 3.659.737.600. 2,048 -> 2.048. 3.66B -> 3,66 Mrd. Good. Potential issue: "TwIL-LM3-Pro" might have TwIL not TwIL? preserve exactly. Should we translate "Granite decoder" as "Granite-Decoder" but "Granite" product name. Yes. Could "dense" be "dense" not "dichter"? The phrase "dense Granite decoder" in ML "dense" = not MoE. German often "dicht" or "dense". "dichter Granite-Decoder" is acceptable. Maybe "Dense Granite-Decoder" more common? If we preserve "dense" as adjective maybe "ein Dense-Granite-Decoder". But instruction says translate. I'd use "dichter Granite-Decoder". Should we preserve `GraniteForCausalLM` in backticks. Yes. `granite-4.2-3b` backticks. Angle tags exactly. Use German quotes? No. Final only translated text.TwIL-LM3-Pro ist ein dichter Granite-Decoder — `GraniteForCausalLM`, 40 Schichten, Hidden-Size 2.560, 40 Attention-Heads gegenüber 8 Key-Value-Heads — abgeleitet von IBMs `granite-4.2-3b`. Die Parameteranzahl von 3,66 Mrd. ist die tatsächliche Gesamtzahl, 3.659.737.600, und das Kontextfenster ist das des Basismodells mit 131.072 Token, unverändert übernommen. Es erzeugt vor der Antwort einen `<think>…</think>`-Block und wurde mit Greedy Decoding bei einem Budget von 2.048 Token evaluiert.

Der Post-Training-Stack ist der Teil, auf den webAI Sie tatsächlich lenken möchte, und er ist für ein Modell dieser Größe ungewöhnlich gut dokumentiert: ein überwachtes Fine-Tuning mit Rang-64-LoRA auf einem synthetischen Korpus formaler Logik, Multipath-Destillation, um mehrere Reasoning-Traces pro Prompt zu erzeugen, eine Checkpoint-Fusion im Parameterraum statt der Übernahme des finalen Checkpoints, eine WiSE-FT-Interpolation bei α = 0,15, die mit TIES und DARE-SLERP zurück in Richtung der vortrainierten Basis gemergt wird, und schließlich eine entropiegewichtete GRPO-Stufe – webAI nennt sie MGPO – gegen einen programmatischen Verifier, ausgeführt bis Schritt 2580, dem Checkpoint, der ausgeliefert wurde.

Das veröffentlichte Artefakt ist die zusammengeführte Policy und nicht ein LoRA-Adapter, was das praktische Detail ist: Man kann es als eigenständiges Modell ausführen, in bf16 mit 6,82 GiB oder als Q4_K_M GGUF mit 2,09 GiB auf einer CPU oder 4 GB VRAM. Das ist die Behauptung „läuft auf einem Laptop“, und sie ist die einzige Behauptung auf der ganzen Karte, die trivial überprüfbar und daher vertrauenswürdig ist.

Der Qwen3-8B-Vergleich, sorgfältig gelesen

Die Schlagzeile, die webAI dem Modell verpasst, lautet, dass TwIL-LM3-Pro mit 3,66 Mrd. Parametern die Spitze seiner eigenen Track-A-Zusammenfassungszeilen erreicht. Die vier Zusammenfassungszeilen sind ein Macro-Gate von 0,5539, strict-7 von 0,2879, ein Sechs-Lane-Durchschnitt von 0,5389 und macro_primary von 0,5875. Gegenüber Qwen3-8B beträgt das Macro-Gate 0,5539 gegenüber 0,5336 – und die Modellkarte selbst schreibt den Satz, den eine Marketingseite gestrichen hätte: „Der Gate-Vorsprung gegenüber Qwen3-8B beträgt 0,020 – kleiner als das Stichprobenrauschen bei n = 200 pro Lane –, also lesen Sie diesen Wert als Gleichstand, nicht als Sieg.“

Das ist die mit Abstand wichtigste Zeile auf der Seite. webAIs eigene Darstellung des zentralen Ergebnisses lautet, dass es ein Unentschieden ist. Wo der Vergleich kein Unentschieden ist:

• Strict-7: TwIL-LM3-Pro 0.2079 vs. Qwen3-8B 0.2093, und diese Zeile verwendet nirgends eine Loose-Match-Anrechnung, weshalb sie nicht durch Formatierungsglück erzeugt werden kann.

• Strenges MCQ — TwIL-LM3-Pro 0,4100 vs. Qwen3-8B 0,0000, der größte Abstand zwischen den Spuren der elf berichteten Zeilen.

• Regelinduktion — TwIL-LM3-Pro 0.4195 vs. Qwen3-8B 0.3680.

• Korpus-Fit — die niedrigste `lm_corpus`-Perplexität aller Arme bei 2,3130, wobei Qwen3-8B bei 2,5478 liegt.

• Parameter — 3,66B vs. ungefähr 8B, was die gesamte Grundlage für die Behauptung „weniger als die Hälfte der Parameter“ ist.

Zwei Vorbehalte haften an dieser Tabelle, und webAI führt beide an. Die Track-A-Generierungen von TwIL-LM3-Pro umfassen durchschnittlich 1.902 Tokens, und 24,2 % davon stoßen an die Längenobergrenze, gegenüber 564 Tokens bei seinem eigenen Vorgänger TwIL-LM3; die Karte bezeichnet die daraus resultierende Lücke als „eher indikativ als exakt“. Und die Durchsatzwerte in der Tabelle wurden in einer späteren Sitzung mit einem neueren vLLM (0.19.1) gemessen als die Vergleichsspalten (0.11.2), sodass die Tokens-pro-Sekunde-Zeilen untereinander vergleichbar sind und mit dem Rest nur näherungsweise.

Wo es nicht gewinnt

In der Held-out-Suite ist die Modellkarte unverblümt: „TwIL-LM3-Pro führt sie nicht an.“ Das Makro über 10 Datensätze liegt bei 0,7901, statistisch auf Augenhöhe mit seinem eigenen Basismodell bei 0,7942, und deutlich hinter Qwen3-8B mit 0,8493 und gpt-oss-120b mit 0,8689. Sein Makro über 14 Datensätze von 0,7425 schlägt sein Basismodell um 0,0093, und dieser gesamte Gewinn stammt aus BBH-logic (0,9540 gegenüber 0,9013 beim Basismodell) – lässt man diese eine Zeile weg, liegt das Modell im Durchschnitt über die verbleibenden dreizehn bei 0,7263, unter den 0,7350 von VibeThinker-3B.

Es gibt drei wirklich schwache Stellen innerhalb der Spezialisierung, alle offengelegt: exakte Übereinstimmung bei der FOL-Übersetzung bei 0,0100, `procedural` bei 0,1200 streng und exakte Übereinstimmung beim semantischen Parsen bei 0,0000. Regelinduktion parst nur 56,5 % ihrer Ausgaben. Und das Modell ist von Natur aus wortreich — etwa 792 Token pro Track-B-Antwort gegenüber 482 bei seinem Vorgänger —, was ein Kostenfaktor ist, keine Fähigkeit.

Nichts davon ist eine Kritik an dem Release. So sieht eine gut geschriebene Model Card aus, und deshalb lassen sich die Zahlen hier überhaupt zitieren.

Drei Wege, es zu bekommen, und einer davon ist ein Formular

Die Vertriebssituation ist die eigentliche Nachricht der Woche, und es lohnt sich, sie präzise zu benennen.

Die Gewichte sind auf Hugging Face, ohne Zugangsbeschränkung, unter der webAI Non-Commercial License ver. 1.0 — die Forschung und persönliche Nutzung erlaubt und eine separate Vereinbarung mit webAI für Umsatz generierenden Einsatz erfordert. Diese Lizenz ist die bindende Einschränkung für die gesamte Veröffentlichung, und deshalb ist TwIL-LM3-Pro kein Modell, das die meisten Produktteams einfach übernehmen können.

webAI sagt, die Familie habe innerhalb eines Monats eine halbe Million Downloads überschritten, eine Zahl, die das Unternehmen in seiner eigenen Ankündigung veröffentlicht hat und die nicht unabhängig geprüft wurde. Downloads eines kostenlosen, nicht kommerziellen Checkpoints sind kein Indikator für Produktionsnutzung, und webAI stellt sie auch nicht als einen solchen dar.

Die eigene Plattform des Anbieters ist hingegen kein öffentlicher Endpunkt. webAI beschreibt sich selbst als Unternehmensplattform, die KI zu Ihren Daten bringt, mit einer Local-First-Modellanwendung, und sein kommerzieller Weg ist eine Enterprise-Vereinbarung statt einer veröffentlichten Preisliste pro Token. TwIL-LM3-Pro fehlt zudem auf den großen Inferenzplattformen von Drittanbietern, die offene Checkpoints indexieren – wir haben es überprüft, und es ist auch nicht im OrcaRouter-Katalog gelistet –, sodass die praktische Antwort auf „Wo rufe ich das über eine API auf?“ lautet: Im Moment tun Sie das größtenteils nicht; Sie laden es herunter.

Der dritte Kanal ist der neue. Das Repository `TwIL-LM3-Pro-LiteRT-LM` erschien am 1. Oktober 2026, enthielt `.litertlm`-Artefakte und war für Android und iOS getaggt — webAIs eigenes LiteRT-LM-Runtime-Packaging derselben Gewichte. Ob dieser Build die nichtkommerzielle Lizenz übernimmt, ist die Frage, die vor einer Planung damit zu beantworten ist, denn das übergeordnete Repository übernimmt sie.

Warum ein Spezialist für formale Logik bei dieser Größe beachtenswert ist

Der Grund, warum dieses Release immer wieder auftaucht, ist nicht die Benchmark-Tabelle. Es ist, dass webAI die gesamte Pipeline veröffentlicht, das identische Rezept auf fünf verschiedene Basismodelle angewendet und berichtet hat, was passierte. Die Familienvergleichstabelle verzeichnet eine Track-A-Makro-Gate-Bewegung von +0,012 bis +0,145 je nach Basis, wobei die Held-out-Suite innerhalb von ±0,013 bleibt — die mit Belegen untermauerte Version von „das generalisiert“. Der eine pro Modell gewählte Koeffizient ist das Merge-Gewicht, das anhand der Held-out-Leistung abgestimmt wurde: 0,15 für SmolLM3, 0,20 für Granite und die TwIL-Basis, 0,50 für VibeThinker-3B.

Das ist ein wiederverwendbares Rezept, um ein kleines allgemeines Modell in einen engen Spezialisten zu verwandeln, ohne dabei zu zerstören, was es bereits wusste – veröffentlicht samt beigefügten negativen Ergebnissen. Für alle, die Entailment-Labels, Lean-Statement-Formalisierung oder semantische Parses statt flüssiger Prosa brauchen, ist eine 2,09 GiB große GGUF-Datei, die offline läuft, ohne Gebühr pro Aufruf und ohne Netzwerkabhängigkeit, ein anderes Angebot als jedes gehostete Modell, ganz gleich, was die Elo-Tabelle sagt.

Die offene Frage ist, ob die Gewichte jemals unter einer Lizenz erscheinen, die kommerzielle Nutzung erlaubt, und ob der LiteRT-LM-Port mit derselben Einschränkung ausgeliefert wird. Bis dahin ist TwIL-LM3-Pro ein Forschungsartefakt mit einer ungewöhnlich ehrlichen Model Card – was nicht nichts ist.

A generated single-column scoreboard headed 'TwIL-LM3-Pro - the scoreboard' with six rows: Macro gate 0.5539; Strict-7 0.2879; Strict MCQ 0.4100; Rule induction 0.4195; Held-out 10-set macro 0.7901; Parameters 3.66B dense. A footer line reads 'All figures vendor-reported by webAI; no independent evaluation yet.' The OrcaRouter logo is composited in the bottom-right corner.

Wenn Sie diese Funktion heute in der Produktion benötigen

Für einen kommerziellen Einsatz ist die Lizenz und nicht die Benchmarks das Hindernis, und die praktische Alternative ist ein gehostetes Modell, das man ansteuern kann. Das ist die Schicht, auf der OrcaRouter operiert: ein OpenAI-kompatibler Endpunkt vor über 200 Modellen zum Listenpreis des Anbieters ohne Aufschlag, sodass eine Preissenkung eines Anbieters noch am selben Tag wirksam wird statt erst nach einem Vertragszyklus. Für die wenigen Fälle, in denen ein kleiner Checkpoint für formale Logik wirklich passt — Offline-Batch-Kennzeichnung, ein air-gapped Entailment-Durchlauf, ein Vorverarbeitungsschritt, dessen Ausgabe ein Label und keine Prosa ist —, besteht die ehrliche Aufteilung darin, das lokale Modell dort laufen zu lassen, wo die Arbeitslast Text-zu-Label ist, und die umgebende Reasoning-, Prompt-Erweiterungs- und QA-Arbeit über denselben Schlüssel an gehostete Modelle zu routen.

Ein Vorbehalt, der gerade in diesem Abschnitt wiederholt werden sollte: Mit automatischem Failover können Sie auch ein Modell ansteuern, bevor Sie ihm auf einem Produktionspfad vertrauen, und per Bearbeitung einer Routing-Regel statt durch erneutes Deployment zurückrollen. Das ist das Muster, das zu einem Modell wie diesem passt, wenn sein kommerzieller Status ungeklärt ist.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro, showing the webAI author line, the tags for Text Generation, Transformers, Safetensors, GGUF, English, granite-4.2, formal-logic, reasoning, lora, reinforcement-learning and grpo, and the licence badge reading 'License: webai-non-commercial-license-ver.-1.0'.

Was zu sehen

Drei Dinge würden diese Geschichte verändern. Eine Lizenzänderung oder eine eindeutig lizenzierte LiteRT-LM-Portierung würden TwIL-LM3-Pro vom Forschungsartefakt zur einsetzbaren Komponente machen. Eine Aufnahme auf einer großen gehosteten Inferenzplattform würde ihm eine echte API geben. Und eine unabhängige Evaluierung – jemand anderes als webAI, der den Track-A-Harness ausführt – würde uns sagen, ob der strict-7-Vorsprung gegenüber Qwen3-8B bestehen bleibt, wenn er von jemandem gemessen wird, der den Harness nicht gebaut hat. Keines der drei ist bisher eingetreten, und die Modellkarte ist ehrlich genug, dass man genau erkennen kann, welche Bedingungen erfüllt sein müssten, damit sie eine Rolle spielen.

A screenshot of the Hugging Face model card for webAI-Official/TwIL-LM3-Pro-LiteRT-LM, created 1 October 2026, showing the tags TextGeneration, LiteRT-LM, on-device, android, ios, granite, granite-4.2 and reasoning, and the card text describing TwIL-LM3-Pro converted to Google's LiteRT-LM (.litertlm) format for on-device inference, requiring LiteRT-LM 0.16 or newer, preserving the ChatML prompt format and pre-opening the think block.