
TwIL-LM3-Pro vs. Qwen 3.8: Ein Missverhältnis, und der Vergleich, der wirklich zählt
- openaiNEUOpenAI: GPT-6.1 Sol2026-09-2952Intelligenz
- anthropicNEUAnthropic: Claude Sonnet 5.52026-09-2856Intelligenz
- typesafeNEUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 pro 1 Mio. Tokens · 219 tok/s
- OpenAINEUOpenAI: GPT-6 Luna2026-09-2238Intelligenz
- OpenAINEUOpenAI: GPT-6 Sol2026-09-2248Intelligenz
- AnthropicNEUAnthropic: Claude Opus 5.52026-09-2258Intelligenz
- xAINEUGrok 4.72026-09-2146Intelligenz
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 pro 1 Mio. Tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 pro 1 Mio. Tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
TwIL-LM3-Pro und Qwen3.8-Max gehören nicht auf dieselbe Seite, und der Grund dafür ist nicht, dass eines besser ist. Es ist vielmehr der, dass die veröffentlichte Argumentation für webAIs 3,66B-Formallogikmodell auf einem Vergleich mit einem Qwen-Modell aufbaut – und das betreffende Qwen-Modell ist nicht das, welches die Schlagzeile nennt. webAIs Tabellen für Track A und Track B messen TwIL-LM3-Pro gegen Qwen3-8B, ein dichtes Open-Weights-Modell mit 8B aus einer früheren Generation, und schenken Qwen3.8-Max überhaupt keine Beachtung: nicht, weil TwIL-LM3-Pro gewinnen würde, sondern weil Qwen3.8-Max Alibabas gehostetes Flaggschiffsystem ist, ein sparse Mixture-of-Experts-Modell mit Berichten zufolge 2,4 Billionen Parametern und rund 95 Milliarden aktiven pro Token, einem multimodalen Kontextfenster von einer Million Token und einer Preisliste von 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token. Ein 2,09-GiB-Laptop-GGUF daneben zu stellen, ist ein Kategorienfehler, der als Versus-Seite verkleidet ist.
Dieser Beitrag tut also zwei Dinge. Er korrigiert den Vergleich, den die Suchergebnisse falsch darstellen, und beantwortet dann die Version der Frage, die ein Leser wahrscheinlich tatsächlich hat: Wenn ein Frontier-Modell mit einem einzigen API-Aufruf erreichbar ist und ein Spezialist für formale Logik auf dem eigenen Rechner läuft, wann verdient dann jedes von beiden seinen Platz?
Das Modell, das die Karte tatsächlich gemessen hat
Der relevante Vergleich ist der gegen Qwen3-8B, und webAIs eigene Zusammenfassung dazu ist bescheidener, als die Berichte aus zweiter Hand nahelegen. Das domäneninterne Makro-Gate von TwIL-LM3-Pro liegt bei 0,5539 gegenüber 0,5336 bei Qwen3-8B, und die Modellkarte enthält den Satz, den eine Marketingseite entfernt hätte: Der Vorsprung beim Gate beträgt 0,020, „kleiner als das Stichprobenrauschen bei n = 200 pro Spur – also diesen Wert als Gleichstand lesen, nicht als Sieg.“
Wo der Vergleich kein Münzwurf ist: strict-7, 0,2879 gegen 0,2093, eine Zeile, die nirgends eine Gutschrift für lockere Übereinstimmungen verwendet und daher nicht durch Formatierung erzeugt werden kann. Striktes Multiple-Choice, 0,4100 gegen 0,0000. Regelinduktion, 0,4195 gegen 0,3680. Und das Parameterverhältnis – 3,66B gegen etwa 8B –, was die ganze Behauptung „weniger als halb so groß“ ausmacht.
Auf der Hold-out-Suite ist webAI noch unverblümter: „TwIL-LM3-Pro führt sie nicht an.“ Der Makrowert über zehn Datensätze liegt bei 0,7901, gleichauf mit der eigenen Granite-Basis und hinter den 0,8493 von Qwen3-8B. Ein kleiner Spezialist, der auf formaler Logik mit einem doppelt so großen Allzweckmodell gleichzieht und bei allgemeinen Fähigkeiten gegen es verliert, ist die zu erwartende Form, und genau diese Darstellung macht die strict-7-Zahl glaubwürdig.
Was Qwen3.8-Max tatsächlich ist
Qwen3.8-Max ist keine Iteration von Qwen3-8B. Es ist Alibabas Premium-Stufe und erscheint auf der OrcaRouter-Katalogseite als `qwen/qwen3.8-max` mit einem Veröffentlichungsdatum vom 3. August 2026, einem Kontextfenster von einer Million Token, Text-, Bild- und Videoeingabe, Textausgabe und vollständiger Unterstützung für Denkmodus, Funktionsaufrufe, integrierte Tools und strukturierte Ausgaben. Es wird in fünf Regionen über OpenAI-kompatible, Anthropic-kompatible und native Dashboards bereitgestellt, und der Denkmodus wird mit dem Parameter `enable_thinking` umgeschaltet. Der Preis beträgt 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token.
Ein datierter Snapshot, `qwen/qwen3.8-max-0902`, wurde am 2. September 2026 mit denselben Fähigkeiten und derselben Preisgestaltung veröffentlicht – und zwar speziell zu dem Zweck, dass das Verhalten für reproduzierbare Läufe festgeschrieben werden kann. Wenn Sie für irgendetwas Langlebiges gegen Qwen3.8-Max entwickeln, ist diese Snapshot-Kennung diejenige, die in die Konfiguration gehört, statt des beweglichen Alias.
Beachten Sie, was in dieser Beschreibung fehlt: eine herunterladbare Parameteranzahl, eine Lizenzdatei und irgendeinen Weg, es selbst laufen zu lassen. Qwen3.8-Max ist ein gehostetes Produkt. Die journalistische Berichterstattung zum Start berichtete von offenen Gewichten, die für die darauffolgende Woche versprochen wurden, und die Formulierung von techsy – „2,4T Parameter, 1M Kontext, noch keine Gewichte“ – ist der Zustand, den ein Leser überprüfen statt annehmen sollte, denn ein beim Start berichtetes Versprechen ist kein veröffentlichter Checkpoint.
Vier Dimensionen, und keine davon ist nah dran.
• Parameter — TwIL-LM3-Pro 3,66B dicht, alle aktiv, gegenüber Qwen3.8-Max, das mit insgesamt 2,4T in einem Sparse-Mixture-of-Experts-Design mit rund 95B aktiven Parametern pro Token angegeben wird. Drei Größenordnungen bei der Gesamtzahl, zwei bei den aktiven Parametern.
• Wo es — Twi-LM3-Pro lässt sich als bf16 mit 6,82 GiB oder als Q4_K_M GGUF mit 2,09 GiB für CPU oder 4 GB VRAM herunterladen, im Vergleich zu Qwen3.8-Max, das nur als gehosteter Endpunkt existiert.
• Kontext — TwIL-LM3-Pro 131.072 Token, von seiner Granite-Basis geerbt und in seiner eigenen Evaluierung gegen Qwen3.8-Max bei 1.000.000 Token nie über 8.192 hinaus validiert.
• Modalitäten — Text rein, Text raus vs. Text, Bild und Video rein, Text raus.
• Lizenz — webAI Non-Commercial License ver. 1.0, wobei für umsatzgenerierende Nutzung eine gesonderte Vereinbarung erforderlich ist, im Unterschied zu einer gehosteten kommerziellen API, bei der keine Gewichte zu lizenzieren sind.
• Kosten — TwIL-LM3-Pro: keine Gebühr pro Token und ein gehosteter Endpunkt, gegenüber Qwen3.8-Max mit 2,00 $ pro Million Eingabe-Token und 6,00 $ pro Million Ausgabe-Token, bei einem Tarif für gecachte Eingaben von 0,25 $ pro Million.
Ein 3,66-Milliarden-Modell ist günstig, weil es klein ist, und es ist klein, weil es nur eine Sache tut. Qwen3.8-Max ist teuer, weil es universell einsetzbar und gehostet ist. Keiner der beiden Preise ist ein Urteil.
Die Frage hinter der Frage
Legt man den Namenswirrwarr beiseite, bleibt eine technische Frage, und zwar eine gute: Wenn ein gehostetes Frontier-Modell über formale Logik schlussfolgern kann, warum dann überhaupt einen engen Spezialisten betreiben?
Drei Gründe sind stichhaltig. Der erste sind die Lizenz und das Netzwerk: Eine nichtkommerzielle Forschungsgruppe, eine Air-Gap-Umgebung oder ein Batch-Labeling-Lauf, der auf einem Laptop ohne Konnektivität laufen muss, kann keinen gehosteten Endpunkt aufrufen, und ein GGUF mit 2.09 GiB beantwortet diese Einschränkung direkt. Der zweite ist die Kostenstruktur über das Volumen hinweg — eine Formal-Logik-Kennzeichnungsaufgabe über eine Million kurze Eingaben zahlt bei einem gehosteten Frontier-Modell pro Token und bei einem lokalen nichts außer Wanduhrzeit. Der dritte ist die Ausgabeform: TwIL-LM3-Pro wurde darauf abgestimmt, maschinell prüfbare Strukturen statt Prosa auszugeben, und für Entailment-Labels und semantische Parses ist das eine kleinere Pipeline, als ein allgemeines Modell zu prompten und dessen Antwort zu parsen.
Im Gegensatz dazu ist der Fall von Qwen3.8-Max einfach. Es sieht Bilder und Videos, es fasst eine Million Token, es unterstützt Tools und strukturierte Ausgabe über eine dokumentierte API, und hinter ihm stehen veröffentlichte Benchmarks und unabhängige Evaluierungen. Nichts an einem eng gefassten Spezialisten bedroht das; die beiden beantworten unterschiedliche Anforderungssätze.
Der Stack, der beides verwendet
Das Muster, das den Kontakt mit einer echten Pipeline übersteht, ist zweistufig, und es ist nicht exotisch. Ein gehostetes Frontier-Modell liest die unordentliche Eingabe – eine gescannte Lehrbuchseite, eine gemischtmodale Quelle, eine lange Spezifikation – und verwandelt sie in sauberen, strukturierten Text. Dieser Text geht an ein lokales formal-logisches Modell, dessen gesamte Aufgabe darin besteht, ein Label, einen Parse oder eine Lean-Kritik auf Hardware auszugeben, die Sie besitzen. Das Urteil darüber, ob diese zweite Stufe ihre Wartungskosten wert ist, ist der Vergleich im Strict-7-Stil, nicht das Gate, denn ein Spezialist verdient seinen Platz auf den Bahnen, auf denen die Metrik keinen Raum für wohlwollende Bewertung lässt.
Es gibt außerdem einen Hinweis, den man aus der eigenen Karte von webAI mitnehmen sollte: Die Pipeline wurde auf fünf verschiedenen Basismodellen ausgeführt, wobei sich nur der Merge-Koeffizient pro Modell änderte, und webAI berichtet das Ergebnis für jedes, einschließlich derer, die sich am wenigsten verändert haben. Das ist eine stärkere Aussage über ein Rezept als jede einzelne Benchmark-Zeile, und es ist die Art von Beleg, die zeigt, dass eine Methode generalisiert, statt dass ein einzelner Checkpoint Glück hatte.
Was ist hier routingfähig und was nicht?
Dies ist die einzige Stelle, an der die beiden Modelle tatsächlich im selben Satz stehen. Qwen3.8-Max ist eine Route: Sie wird über OrcaRouter als `qwen/qwen3.8-max` bereitgestellt, und da die Plattform den Listenpreis des Anbieters mit 0 % Aufschlag durchreicht, ist der Tarif von 2,00 $/6,00 $ der des Anbieters selbst, und eine Preissenkung des Anbieters wird noch am selben Tag wirksam statt erst nach einem Vertragszyklus. Der datierte Snapshot `qwen/qwen3.8-max-0902` lässt sich daneben routen, sodass das Festlegen einer reproduzierbaren Modell-ID eine Konfigurationsentscheidung ist und keine separate Anbieterbeziehung.
TwIL-LM3-Pro ist keine Route, und es wäre unehrlich, etwas anderes zu behaupten. Es ist nicht-kommerziell lizenziert und es gibt keinen veröffentlichten gehosteten Endpoint; der derzeitige Weg, es zu nutzen, besteht darin, den Checkpoint herunterzuladen und selbst auszuführen. Was der Router für eine darauf aufgebaute Pipeline übernimmt, ist die umgebende Textarbeit — die Prompt-Erweiterung, die Korpusgenerierung, den Filterdurchlauf —, die auf demselben OpenAI-kompatiblen Endpoint gegen über 200 Modelle läuft, sodass der Austausch des Modells, das Evaluierungsdaten erzeugt, gegen das Modell, das diese bewertet, nichts weiter kostet als eine Konfigurationsänderung, mit automatischem Failover, damit ein langer Batch am Leben bleibt, wenn ein Anbieter ins Stocken gerät.
Die am besten vertretbare Nutzung der beiden zusammen ist genau die: eine routbare Frontier-Stufe, die allgemeines Reasoning und strukturierte Extraktion übernimmt, ein heruntergeladener Spezialist, der das formal-logische Urteil fällt, und ein einziger Schlüssel für alles dazwischen.
Welches Modell soll verglichen werden, und wann
Wenn Sie kleine formal-logische Modelle bewerten, ist das Qwen, das Sie neben TwIL-LM3-Pro stellen sollten, Qwen3-8B, und webAI hat diesen Vergleich bereits mit den dazugehörigen Vorbehalten veröffentlicht. Wenn Sie entscheiden, wo eine Produktions-Workload ausgeführt werden soll, ist Qwen3.8-Max eine ganz andere Entscheidung – ein gehostetes Frontier-System mit Preisliste und ohne Download – und die richtige Frage ist nicht, welches besser ist, sondern welche Einschränkung bindet: Konnektivität und Lizenz auf der einen Seite, Kontext, Modalität und Skalierung auf der anderen. Die meisten realen Systeme brauchen am Ende beide Antworten.



In diesem Artikel verglichen1
Aus diesem Artikel erkannt · Benchmarks: Artificial Analysis · täglich aktualisiert
