
TwIL-LM3-Pro vs Qwen 3.8: Een mismatch, en de vergelijking die er echt toe doet
- openaiNIEUWOpenAI: GPT-6.1 Sol2026-09-2952Intelligentie
- anthropicNIEUWAnthropic: Claude Sonnet 5.52026-09-2856Intelligentie
- typesafeNIEUWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 mln tokens · 219 tok/s
- OpenAINIEUWOpenAI: GPT-6 Luna2026-09-2238Intelligentie
- OpenAINIEUWOpenAI: GPT-6 Sol2026-09-2248Intelligentie
- AnthropicNIEUWAnthropic: Claude Opus 5.52026-09-2258Intelligentie
- xAINIEUWGrok 4.72026-09-2146Intelligentie
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 mln tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 mln tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligentie76Coderen
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 mln tokens · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
TwIL-LM3-Pro en Qwen3.8-Max horen niet op dezelfde pagina thuis, en de reden is niet dat de een beter is dan de ander. De reden is dat het gepubliceerde pleidooi voor webAI's 3,66B-formeel-logische model is gebouwd op een vergelijking met een Qwen-model — en het Qwen-model in kwestie is niet degene die in de kop wordt genoemd. webAI's Track A- en Track B-tabellen meten TwIL-LM3-Pro tegen Qwen3-8B, een dense 8B open-weightsmodel uit een eerdere generatie, en schenken Qwen3.8-Max totaal geen aandacht: niet omdat TwIL-LM3-Pro zou winnen, maar omdat Qwen3.8-Max Alibaba's gehoste vlaggenschipsysteem is, een sparse mixture-of-expertsmodel dat naar verluidt 2,4 biljoen parameters heeft met ongeveer 95 miljard actieve per token, een multimodaal contextvenster van een miljoen tokens, en een prijslijst van $2,00 per miljoen inputtokens en $6,00 per miljoen outputtokens. Een GGUF van 2,09 GiB voor een laptop naast dat alles zetten is een categorievergissing vermomd als een versus-pagina.
Dit stuk doet twee dingen. Het corrigeert de vergelijking die in zoekresultaten verkeerd wordt weergegeven, en beantwoordt vervolgens de versie van de vraag die een lezer waarschijnlijk echt heeft: gegeven dat je een frontiermodel met één API-aanroep kunt bereiken en een specialist in formele logica op je eigen machine draait, wanneer verdient elk ervan zijn plek?
Het model dat de kaart daadwerkelijk heeft gemeten
De relevante vergelijking is met Qwen3-8B, en webAI's eigen samenvatting ervan is bescheidener dan de secundaire verslagen suggereren. De in-domain macro gate van TwIL-LM3-Pro is 0,5539 tegenover de 0,5336 van Qwen3-8B, en de modelkaart bevat de zin die een marketingpagina zou hebben verwijderd: de voorsprong bij de gate is 0,020, "kleiner dan de steekproefruis bij n = 200 per lane — dus lees die als pariteit, niet als een overwinning."
Waar de vergelijking geen kwestie van kop of munt is: strict-7, 0,2879 tegen 0,2093, een rij die nergens krediet voor losse overeenkomsten gebruikt en dus niet door formattering kan worden gecreëerd. Strikte meerkeuze, 0,4100 tegen 0,0000. Regelinductie, 0,4195 tegen 0,3680. En de parameterverhouding — 3,66B tegen ongeveer 8B — die de hele bewering 'minder dan half zo groot' vormt.
Op de achtergehouden suite is webAI nog botter: "TwIL-LM3-Pro voert het niet aan." De macro over tien datasets is 0,7901, gelijk aan zijn eigen Granite-basis en achter de 0,8493 van Qwen3-8B. Een kleine specialist die op formele logica een algemeen model dat twee keer zo groot is evenaart en het op algemene capaciteit tegen dat model aflegt, is de verwachte vorm, en het op die manier rapporteren is wat het strict-7-cijfer geloofwaardig maakt.
Wat Qwen3.8-Max eigenlijk is
Qwen3.8-Max is geen iteratie van Qwen3-8B. Het is het premiumniveau van Alibaba, en op de cataloguspagina van OrcaRouter verschijnt het als `qwen/qwen3.8-max` met een releasedatum van 3 augustus 2026, een contextvenster van één miljoen tokens, tekst-, afbeelding- en video-invoer, tekstuitvoer en volledige ondersteuning voor denkmodus, functieaanroepen, ingebouwde tools en gestructureerde uitvoer. Het wordt aangeboden via OpenAI-compatibele, Anthropic-compatibele en native dashboards in vijf regio's, en de denkmodus wordt in- of uitgeschakeld met de parameter `enable_thinking`. Het tarief is $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens.
Een gedateerde snapshot, `qwen/qwen3.8-max-0902`, werd op 2 september 2026 gepubliceerd met dezelfde mogelijkheden en dezelfde prijsstelling, specifiek gepubliceerd zodat gedrag kan worden vastgezet voor reproduceerbare runs. Als je voor iets langdurigs voortbouwt op Qwen3.8-Max, is die snapshot-identificatie degene die je in de config moet zetten in plaats van de bewegende alias.
Merk op wat er in die beschrijving ontbreekt: een parameteraantal dat je kunt downloaden, een licentiebestand, en welke manier dan ook om het zelf te draaien. Qwen3.8-Max is een gehost product. Journalistieke berichtgeving bij de lancering meldde dat open weights voor de daaropvolgende week waren beloofd, en de framing van techsy — "2,4T parameters, 1M context, nog geen gewichten" — is de situatie die een lezer moet verifiëren in plaats van aannemen, omdat een belofte die bij de lancering werd gemeld geen gepubliceerd checkpoint is.
Vier dimensies, en geen enkele komt in de buurt.
• Parameters — TwIL-LM3-Pro 3,66B dense, allemaal actief versus Qwen3.8-Max gerapporteerd op 2,4T totaal in een sparse mixture-of-experts-ontwerp met ongeveer 95B actief per token. Drie orden van grootte op het totaal, twee op het actieve.
• Waar het draait — TwIL-LM3-Pro is te downloaden als bf16 van 6,82 GiB of als een Q4_K_M GGUF van 2,09 GiB voor CPU of 4 GB VRAM, tegenover Qwen3.8-Max, dat alleen als een gehoste endpoint bestaat.
• Context — TwIL-LM3-Pro 131.072 tokens, geërfd van zijn Granite-basis en nooit verder gevalideerd dan 8.192 in zijn eigen evaluatie tegenover Qwen3.8-Max bij 1.000.000 tokens.
• Modaliteiten — tekst in, tekst uit vs. tekst, afbeelding en video in, tekst uit.
• Licentie — webAI Non-Commercial License ver. 1.0, waarbij voor inkomsten genererend gebruik een afzonderlijke overeenkomst vereist is, versus een gehoste commerciële API zonder gewichten om te licentiëren.
• Kosten — TwIL-LM3-Pro: geen kosten per token en geen gehoste endpoint, tegenover de $2,00 per miljoen invoertokens en $6,00 per miljoen uitvoertokens van Qwen3.8-Max, met een tarief voor gecachte invoer van ongeveer $0,25 per miljoen.
Een model van 3,66B is goedkoop omdat het klein is, en het is klein omdat het één ding doet. Qwen3.8-Max is duur omdat het algemeen inzetbaar is en gehost wordt. Geen van beide tarieven is een oordeel.
De vraag achter de vraag
Haal de naamgevingsverwarring weg en er blijft een engineeringvraag over, en het is een goede: als een gehost frontier-model kan redeneren over formele logica, waarom zou je dan überhaupt een smalle specialist draaien?
Drie redenen zijn steekhoudend. De eerste is de licentie en het netwerk: een niet-commerciële onderzoeksgroep, een air-gapped omgeving of een batch-labelronde die op een laptop zonder connectiviteit moet draaien, kan geen gehost endpoint aanroepen, en een GGUF van 2,09 GiB komt direct aan die beperking tegemoet. De tweede is de kostenstructuur bij volume — een formal-logic-labeltaak over een miljoen korte inputs betaalt per token op een gehost frontier-model en betaalt op een lokaal model niets anders dan wandkloktijd. De derde is de vorm van de uitvoer: TwIL-LM3-Pro is afgestemd op het produceren van machinecontroleerbare structuren in plaats van proza, en voor entailment-labels en semantische parses is dat een kleinere pipeline dan het prompten van een algemeen model en het parsen van het antwoord.
Daar staat tegenover dat het pleidooi voor Qwen3.8-Max eenvoudig is. Het ziet afbeeldingen en video, het kan een miljoen tokens aan, het ondersteunt tools en gestructureerde output via een gedocumenteerde API, en het heeft gepubliceerde benchmarks en onafhankelijke evaluatie achter zich. Een specialist met een nauwe focus vormt daarvoor geen bedreiging; de twee beantwoorden aan verschillende verzamelingen beperkingen.
De stack die beide gebruikt
Het patroon dat contact met een echte pipeline overleeft, is tweetraps, en het is niet exotisch. Een gehost frontier-model leest de rommelige invoer — een gescande tekstboekpagina, een bron met gemengde modaliteiten, een lange specificatie — en zet die om in schone, gestructureerde tekst. Die tekst gaat naar een lokaal formeel-logisch model waarvan de hele taak is om een label, een parse of een Lean-kritiek af te geven op hardware die je zelf bezit. Het oordeel over de vraag of die tweede laag zijn onderhoudskosten waard is, is de vergelijking in strict-7-stijl, niet de poort, want een specialist verdient zijn plek op de banen waar de metriek geen ruimte heeft voor welwillende scoring.
Er is ook een aanwijzing die het waard is over te nemen uit webAI's eigen kaart: de pipeline werd uitgevoerd op vijf verschillende basismodellen, waarbij alleen de merge-coëfficiënt per model veranderde, en webAI rapporteert de uitkomst voor elk daarvan, inclusief de modellen die het minst bewogen. Dat is een sterkere bewering over een recept dan welke enkele benchmarkregel dan ook, en het is het soort bewijs dat aangeeft dat een methode generaliseert in plaats van dat één checkpoint geluk had.
Wat is hier routeerbaar, en wat niet?
Dit is de enige plek waar de twee modellen eerlijk in dezelfde zin staan. Qwen3.8-Max is een route: het wordt via OrcaRouter aangeboden als `qwen/qwen3.8-max`, en omdat het platform de lijstprijs van de provider met 0% opslag doorgeeft, is het tarief van $2,00/$6,00 dat van de leverancier zelf en gaat een prijsverlaging van de leverancier dezelfde dag in in plaats van na een contractcyclus. De gedateerde snapshot `qwen/qwen3.8-max-0902` is ernaast routeerbaar, dus het vastpinnen van een reproduceerbare model-id is een configuratiekeuze en geen aparte leveranciersrelatie.
TwIL-LM3-Pro is geen route, en het zou oneerlijk zijn om iets anders te suggereren. Het heeft een niet-commerciële licentie zonder gepubliceerd gehost endpoint, en de huidige manier om het te gebruiken is de checkpoint downloaden en het zelf draaien. Wat de router doet voor een pipeline die eromheen is gebouwd, is het omringende tekstwerk — de promptuitbreiding, de corpusgeneratie, de filterronde — dat op hetzelfde OpenAI-compatibele endpoint draait tegen meer dan 200 modellen, zodat het verwisselen van het model dat evaluatiegegevens genereert voor het model dat beoordeelt niets anders kost dan een aanpassing in de configuratie, met automatische failover om een lange batch in leven te houden wanneer een provider hapert.
De meest verdedigbare manier om de twee samen te gebruiken is precies dat: een routeerbare frontlinie die algemeen redeneren en gestructureerde extractie doet, een gedownloade specialist die het formeel-logische oordeel velt, en één sleutel voor alles daartussen.
Welk model moet worden vergeleken, en wanneer
Als je kleine modellen voor formele logica evalueert, is de Qwen die het waard is om naast TwIL-LM3-Pro te zetten, Qwen3-8B, en webAI heeft die vergelijking al gepubliceerd met de bijbehorende kanttekeningen. Als je kiest waar je een productiewerklast wilt draaien, is Qwen3.8-Max een heel andere beslissing — een gehost frontier-systeem met een tariefkaart en zonder download — en de juiste vraag is niet wat beter is, maar welke beperking bindend is: connectiviteit en licentie aan de ene kant, context, modaliteit en schaal aan de andere kant. De meeste echte systemen hebben uiteindelijk beide antwoorden nodig.



Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
