Ett genererat titelkort med rubriken 'TwIL-LM3-Pro vs Qwen 3.8', med underrubriken 'Jämförelsen som kortet faktiskt körde', med två rundade kort där det står 'TwIL-LM3-Pro – 3.66B, lokal, icke-kommersiell' och 'Qwen3.8-Max – hostad, 1M kontext, $2 / $6'. En sidfotsrad lyder 'webAI mättes mot Qwen3-8B, inte Qwen3.8-Max.' OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

TwIL-LM3-Pro vs Qwen 3.8: En felaktig jämförelse, och jämförelsen som faktiskt spelar roll

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

TwIL-LM3-Pro och Qwen3.8-Max hör inte hemma på samma sida, och anledningen är inte att den ena är bättre. Det är att det publicerade argumentet för webAI:s 3,66B-modell för formell logik bygger på en jämförelse mot en Qwen-modell – och Qwen-modellen i fråga är inte den som rubriken namnger. webAI:s tabeller för Track A och Track B mäter TwIL-LM3-Pro mot Qwen3-8B, en dense 8B-modell med öppna vikter från en tidigare generation, och ägnar Qwen3.8-Max ingen uppmärksamhet alls: inte för att TwIL-LM3-Pro skulle vinna, utan för att Qwen3.8-Max är Alibabas hostade flaggskeppssystem, en sparse mixture-of-experts-modell som rapporteras ha 2,4 biljoner parametrar med ungefär 95 miljarder aktiva per token, ett multimodalt kontextfönster på en miljon tokens och en prislista på 2,00 USD per miljon indata-tokens och 6,00 USD per miljon utdata. Att ställa en 2,09 GiB laptop-GGUF bredvid det är ett kategorifel uppklätt till en versus-sida.

Så den här texten gör två saker. Den korrigerar jämförelsen som sökresultaten får fel på, och sedan besvarar den den version av frågan som en läsare förmodligen faktiskt har: med tanke på att en frontier-modell är ett API-anrop bort och en specialist på formell logik körs på din egen maskin, när förtjänar var och en sin plats?

Modellen som kortet faktiskt mätte

Den relevanta jämförelsen görs mot Qwen3-8B, och webAIs egen sammanfattning av den är mer återhållsam än vad andrahandsskildringarna antyder. TwIL-LM3-Pros makro-gate inom domänen är 0,5539 mot Qwen3-8B:s 0,5336, och modellkortet innehåller meningen som en marknadsföringssida skulle ha tagit bort: gate-övertaget är 0,020, ”mindre än samplingsbruset vid n = 200 per bana – så läs det som paritet, inte som en vinst.”

Där jämförelsen inte är en slantsingling: strict-7, 0,2879 mot 0,2093, en rad som inte använder någon poäng för lös matchning någonstans och därför inte kan fabriceras genom formatering. Strikt flerval, 0,4100 mot 0,0000. Regelinduktion, 0,4195 mot 0,3680. Och parameterkvoten – 3,66B mot ungefär 8B – vilket är hela påståendet om ”mindre än halva storleken”.

På held-out-sviten är webAI ännu mer oförblommerad: "TwIL-LM3-Pro leder den inte." Makron för de tio datamängderna är 0,7901, i nivå med dess egen Granite-bas och efter Qwen3-8B:s 0,8493. En liten specialist som matchar en allmän modell dubbelt så stor i formell logik och förlorar mot den i allmän förmåga är den förväntade formen, och att rapportera det så är vad som gör strict-7-siffran trovärdig.

Vad Qwen3.8-Max faktiskt är

Qwen3.8-Max är inte en iteration av Qwen3-8B. Det är Alibabas premiumnivå, och på OrcaRouters katalogsida visas det som `qwen/qwen3.8-max` med ett releasedatum den 3 augusti 2026, ett kontextfönster på en miljon token, text-, bild- och videoinmatning, textutmatning samt fullt stöd för tänkandeläge, funktionsanrop, inbyggda verktyg och strukturerade utdata. Det tillhandahålls via OpenAI-kompatibla, Anthropic-kompatibla och nativa dashboards i fem regioner, och tänkandeläget växlas med parametern `enable_thinking`. Taxan är 2,00 USD per miljon indatatoken och 6,00 USD per miljon utdatatoken.

En daterad ögonblicksbild, `qwen/qwen3.8-max-0902`, publicerades den 2 september 2026 med samma funktioner och samma prissättning, publicerad specifikt för att beteendet ska kunna låsas för reproducerbara körningar. Om du bygger mot Qwen3.8-Max för något långlivat är det den ögonblicksbildens identifierare som ska anges i konfigurationen i stället för det rörliga aliaset.

Notera vad som saknas i den beskrivningen: ett parametrantal du kan ladda ner, en licensfil och någon väg till att köra det själv. Qwen3.8-Max är en hostad produkt. Journalistisk bevakning vid lanseringen rapporterade öppna vikter som utlovats till veckan därpå, och techsys formulering – ”2,4T parametrar, 1M kontext, inga vikter ännu” – är det tillstånd en läsare bör verifiera snarare än anta, eftersom ett löfte som rapporterades vid lanseringen inte är en publicerad checkpoint.

Fyra dimensioner, och ingen av dem är nära.

• Parametrar — TwIL-LM3-Pro 3,66B tät, alla aktiva mot Qwen3.8-Max som rapporteras vara 2,4T totalt i en gles mixture-of-experts-design med ungefär 95B aktiva per token. Tre storleksordningar på totalen, två på de aktiva.

• Var den körs — TwIL-LM3-Pro laddas ner som bf16 på 6,82 GiB eller en 2,09 GiB Q4_K_M GGUF för CPU eller 4 GB VRAM mot Qwen3.8-Max, som endast finns som en hostad slutpunkt.

• Kontext — TwIL-LM3-Pro 131 072 tokens, ärvda från dess Granite-bas och aldrig validerade bortom 8 192 i dess egen utvärdering mot Qwen3.8-Max vid 1 000 000 tokens.

• Modaliteter — text in, text ut kontra text, bild och video in, text ut.

• Licens — webAI Non-Commercial License ver. 1.0, där ett separat avtal krävs för intäktsgenererande användning, till skillnad från ett hostat kommersiellt API utan vikter att licensiera.

• Kostnad — TwIL-LM3-Pro: ingen avgift per token och ingen hostad slutpunkt, mot Qwen3.8-Maxs $2,00 per miljon input-tokens och $6,00 per miljon output, med en taxa för cachad input på omkring $0,25 per miljon.

En 3,66B-modell är billig eftersom den är liten, och den är liten eftersom den gör en enda sak. Qwen3.8-Max är dyr eftersom den är generell och eftersom den är hostad. Inget av dessa priser är ett slutgiltigt omdöme.

Frågan bakom frågan

Rensa bort namnförvirringen, så kvarstår en ingenjörsfråga, och det är en bra fråga: om en hostad frontiermodell kan resonera kring formell logik, varför ens köra en smal specialist?

Tre skäl håller. Det första är licensen och nätverket: en icke-kommersiell forskargrupp, en air-gappad miljö eller en satsvis märkningskörning som måste köras på en bärbar dator utan anslutning kan inte anropa en hostad slutpunkt, och en GGUF på 2,09 GiB svarar direkt på den begränsningen. Det andra är kostnadsstrukturen vid volymer – ett märkningsjobb inom formell logik över en miljon korta indata kostar per token hos en hostad frontier-modell och kostar inget annat än väggklockstid hos en lokal sådan. Det tredje är utdatans form: TwIL-LM3-Pro trimmades för att avge maskinkontrollerbara strukturer i stället för prosa, och för entailment-etiketter och semantiska parsningar är det en mindre pipeline än att prompta en generell modell och parsa dess svar.

Mot det är Qwen3.8-Maxs argument enkelt. Den ser bilder och video, den rymmer en miljon tokens, den hanterar verktyg och strukturerad utdata via ett dokumenterat API, och den har publicerade benchmarks och oberoende utvärdering bakom sig. Inget hos en smal specialist hotar detta; de två svarar på olika uppsättningar av begränsningar.

Stacken som använder båda

Mönstret som överlever kontakt med en verklig pipeline är tvåskiktat, och det är inte exotiskt. En frontier-hostad modell läser den stökiga indatan – en skannad lärobokssida, en källa med blandade modaliteter, en lång specifikation – och omvandlar den till ren strukturerad text. Den texten går till en lokal formallogisk modell vars enda uppgift är att avge en etikett, en parsning eller en Lean-kritik på hårdvara du äger. Domen om huruvida det andra skiktet är värt sin underhållskostnad är jämförelsen i strict-7-stil, inte grinden, eftersom en specialist förtjänar sin plats på de banor där måttet inte har utrymme för välvillig poängsättning.

Det finns också en ledtråd värd att ta till sig från webAI:s eget kort: pipelinen kördes på fem olika basmodeller, där endast merge-koefficienten ändrades per modell, och webAI rapporterar resultatet för var och en, inklusive de som förändrades minst. Det är ett starkare påstående om ett recept än någon enskild benchmarkrad, och det är den typ av bevis som säger att en metod generaliserar snarare än att en enda checkpoint hade tur.

Vad är routbart här, och vad är inte det?

Detta är den enda platsen där de två modellerna ärligt talat står i samma mening. Qwen3.8-Max är en rutt: den serveras via OrcaRouter som `qwen/qwen3.8-max`, och eftersom plattformen för vidare leverantörens listpris med 0 % påslag, är priset $2,00/$6,00 leverantörens eget och en leverantörsprissänkning gäller samma dag i stället för efter en avtalscykel. Den daterade ögonblicksbilden `qwen/qwen3.8-max-0902` kan routas vid sidan av den, så att låsa ett reproducerbart modell-id är ett konfigurationsval snarare än en separat leverantörsrelation.

TwIL-LM3-Pro är inte en rutt, och det vore oärligt att antyda något annat. Det är licensierat för icke-kommersiellt bruk utan någon publicerad hostad endpoint, och det nuvarande sättet att använda det är att ladda ner checkpointen och köra det själv. Vad routern gör för en pipeline som byggts kring det är arbetet med den omgivande texten – promptexpansionen, korpusgenereringen, filtreringspasset – som körs på samma OpenAI-kompatibla endpoint mot över 200 modeller, så att byta ut modellen som genererar utvärderingsdata mot modellen som betygsätter den kostar inte mer än en konfigändring, med automatisk failover för att hålla en lång batch vid liv när en leverantör strular.

Den mest försvarbara användningen av de två tillsammans är just detta: en dirigerbar frontier-nivå som gör allmänna resonemang och strukturerad extraktion, en nedladdad specialist som gör den formallogiska bedömningen, och en enda nyckel för allt däremellan.

Vilken modell ska jämföras, och när

Om du utvärderar små formella logikmodeller är den Qwe​n som är värd att ställa bredvid TwIL-LM3-Pro Qwen3-8B, och webAI har redan publicerat den jämförelsen med tillhörande förbehåll. Om du väljer var en produktionsarbetsbelastning ska köras är Qwen3.8-Max ett helt annat beslut — ett hostat frontier-system med en prislista och ingen nedladdning — och rätt fråga är inte vilket som är bättre utan vilken begränsning som binder: anslutning och licens på ena sidan, kontext, modalitet och skala på den andra. De flesta verkliga system behöver till slut båda svaren.

A generated two-column scoreboard headed 'TwIL-LM3-Pro vs Qwen3.8-Max - the scoreboard' with six shared dimension rows. TwIL-LM3-Pro: Parameters 3.66B dense; Where it runs local download; Context 131,072 tokens; Input text only; Licence non-commercial; Cost no per-token fee. Qwen3.8-Max: Parameters 2.4T total, sparse MoE; Where it runs hosted endpoint; Context 1,000,000 tokens; Input text, image, video; Licence hosted commercial API; Cost $2.00 in / $6.00 out. A footer line reads 'Qwen3.8-Max specs per its OrcaRouter catalogue page; TwIL figures vendor-reported by webAI.' The OrcaRouter logo is composited in the bottom-right corner.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max, showing the Qwen author line and release date 2026-08-03, the Vision, Tools, JSON and Reasoning capability badges, the vendor description positioning Qwen3.8-Max against GPT-5.5, Claude Opus 4.7 and Gemini 3.1 Pro, the /v1/chat/completions, /v1/messages and /v1/responses wire formats, and the $2.00 input and $6.00 output rates.A screenshot of the OrcaRouter model page for qwen/qwen3.8-max-0902, headed 'Qwen3.8 Max (0902)', showing the dated snapshot identifier, the Vision, Tools, JSON and Reasoning badges, text plus image and video input, and a 131K maximum output length field.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen