
Boreal vs Qwen3.8 Max: Raden som varje leverantör hoppas att du ska hoppa över
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Varje modellansering publicerar ett kort med siffror, och varje kort har en rad som leverantören helst inte vill att du dröjer vid. För Qwen3.8 Max, som släpptes den 3 augusti 2026, är de smickrande raderna lätta att hitta: den tog förstaplatsen på CodeArenas front-end-topplista med 1 691 poäng, den nådde ett Artificial Analysis Agentic Index på 58 och tangerade därmed Claude Opus 5 vid hög ansträngning – det närmaste ett kinesiskt labb hade kommit toppen av den listan – och den landade på en GDPval-AA-poäng på 1 739 Elo, före GPT-5.6 Sol. Raden under dem är svårare att läsa. I samma utvärderares testsvit steg den uppmätta hallucinationen från 23 % i den tidigare generationen till 40 %, och modellens poäng för lång kontext-återvinning sjönk med två punkter. Boreal, Creatifys reklamvideomodell, som släpptes den 15 september 2026 för en cent per sekund, har en rad av samma slag på sitt eget kort – och den är mer specifik, eftersom leverantören publicerade den.
Ingen av raderna är diskvalificerande. Båda är mer informativa än rubriksiffrorna, vilket är anledningen till att det är värt att ställa dem sida vid sida i stället för att jämföra bannerna.
Vad Qwen3.8 Max verkligen är bäst på
Vinsterna är verkliga och de är inte små.
Qwen3.8 Max är en mixture-of-experts-modell med 2,4 biljoner parametrar, varav ungefär 95 miljarder är aktiva per token, och det är den första Max-klassade Qwen som Alibaba har sagt ska släppas som öppna vikter – aviserad till veckan den 10 augusti 2026 utan licens eller fast datum, en detalj värd att notera eftersom aviseringen inte är släppet. Den har ett kontextfönster på 1M tokens med ett tak på 131 072 tokens för utdata, och den tar text, bilder och video som indata. Den sista punkten förtjänar betoning i just den här jämförelsen: av de fyra frontier-textmodeller som den här serien ställer mot Boreal är Qwen3.8 Max en av bara två som kan ges ett färdigt videoklipp och få en fråga om det.
Prissättningen är aggressiv på ett sätt som har omformat segmentet. Med $2,00 per miljon indata och $6,00 per miljon utdata, med cacheläsningar på $0,25, underbjuder den den tidigare generationen med omkring 20 % samtidigt som den fördubblar den maximala utdatalängden. På vår resultattavla hamnar det på $2,00 och $6,00, en kontext på 1M token, en p50-tid till första token på 10,00 sekunder — taket som vår instrumentering rapporterar, så läs det som ”långsam” snarare än exakt — och 183,0 miljoner token i trafik under de senaste sju dagarna.
Och raden under
Här är delen som inte blir rubriken i lanseringsinlägget.
Den oberoende utvärderingen från Artificial Analysis registrerade två regressioner mellan Qwen3.7-Max och Qwen3.8 Max. Dess mått för hämtning i långa kontexter föll med två punkter. Dess allvetenhetsmått föll med tio, och den hallucineringsfrekvens som utvärderaren mäter steg från 23 % till 40 %. Samtidigt steg modellens kostnad per uppgift i intelligensindexet från 0,53 $ till 1,14 $ — den tog ungefär 64 turer per uppgift, medan dess föregångare tog 14.
Läser man dem tillsammans framträder en sammanhängande bild. Qwen3.8 Max är en modell som blev bättre på det som benchmarks med ett enda rätt svar kan mäta – kod, slutförande av agentiska uppgifter, strukturerad problemlösning – och sämre på det som är svårast att poängsätta: att veta när den inte vet. En modell som överväger mer och hallucinerar mer motsäger inte sig själv. Längre resonemangsspår skapar fler möjligheter att låsa sig vid ett självsäkert felaktigt svar, och en benchmark som belönar slutförande av uppgifter straffar inte det förrän uppgiften har en dold invariant att bryta mot.
För en köpare är den praktiska konsekvensen snäv och specifik. Om din användning av modellen är kodgenerering eller ett agentiskt arbetsflöde där ett felaktigt svar misslyckas högljutt – ett test misslyckas, ett bygge går sönder – är regressionerna till stor del osynliga och vinsterna är hela historien. Om din användning är informationsinhämtning, sammanfattning eller något annat där ett flytande felaktigt svar når en människa utan kontroll, är förflyttningen från 23 till 40 det tal som bör avgöra din utvärdering, inte CodeArena-placeringen.
Boreals egen sämsta rad, publicerad av leverantören
Kontrasten som gör den här kombinationen användbar är att Creatify gjorde något som de flesta leverantörer inte gör: la sitt svagaste resultat i samma inlägg som sitt starkaste.
Boreal testades blint mot sin egen orörda basmodell, med prompt, upplösning, antal bildrutor och seed fixerade, över 40 produktionsfall. Creatify rapporterar en preferens på 81 % för Boreal – 25 mot 6 med 9 oavgjorda, teckentest p<0,001 – och bryter sedan ner det genomsnittet. Produktannonser: 83 %. Scener med skapare och UGC: 85 %. Klipp med en person som talar: 60 %.
Den sista siffran är raden. Talking heads är bland de vanligaste formaten inom direktresponsannonsering, och det är formatet där modellens fördel gentemot dess egen bas är som tunnast – knappt bättre än en slantsingling mot en modell som ingen tänkte lansera. Rendering anges till 1:1 med realtid i 720p-klass, och findetaljbevarandet förbättrades med 11,3 % vid p=0,004, så helhetsbilden är genuint positiv. Uppdelningen säger helt enkelt vilken halva av kategorin den här modellen är trimmad för, och det är inte halvan med en person som pratar mot kameran.
Notera också vilken typ av bevis var och en av dessa rader är. Qwen3.8 Max regression hittades av en oberoende utvärderare som körde sitt eget testramverk. Boreals svaga rad avslöjades av leverantören, i ett test som leverantören utformade och körde. Den andra är mer trovärdig som faktapåstående och mindre informativ som jämförelse, eftersom det inte finns någon oberoende siffra någonstans i Boreals fil.

Spec-kontrast
• Utdata — Boreal: renderad video, 720p-klass, text-till-video och bild-till-video. Qwen3.8 Max: endast text, upp till 131 072 tokens.
• Indata — Boreal: en textprompt eller en stillbild. Qwen3.8 Max: text, bilder och video.
• Pris — Boreal: 0,01 USD per sekund färdig video. Qwen3.8 Max: 2,00 USD per 1 miljon indata / 6,00 USD per 1 miljon utdata, cacheläsningar till 0,25 USD.
• Kontext — Boreal: inte publicerad. Qwen3.8 Max: 1M tokens in, 131K ut.
• Latens — Boreal: anges till 1:1 mot realtid. Qwen3.8 Max: p50-tid till första token på 10,00 sekunder på vårt kort.
• Vikter – Boreal: proprietär, ägs och driftas av Creatify. Qwen3.8 Max: proprietär vid lanseringen; Alibaba har meddelat ett släpp med öppna vikter för den första Qwen-modellen i Max-klassen, utan bekräftad licens eller datum.
• Bevis — Boreal: leverantörsgenomfört blindtest med 40 fall, ingen oberoende utvärdering. Qwen3.8 Max: oberoende benchmarktäckning inklusive två uppmätta regressioner, vid sidan av leverantörsrader på 86,1 på OSWorld-Verified och 86,6 på Terminal-Bench 2.1.
Vad en regression är värd för någon som köper
Regressioner på topplistor brukar behandlas som kuriosa. De ligger närmare det mest beslutsrelevanta som en benchmark publicerar, eftersom de är de enda raderna som talar om vad en leverantör har gett avkall på.
Det användbara draget är inte att läsa något av korten, utan att köra båda modellerna på din egen trafik – och det praktiska hindret är att detta normalt innebär två avtal, två SDK:er och två faktureringsrelationer, vilket är tillräckligt mycket friktion för att de flesta team hoppar över testet och köper utifrån rubrikpoängen i stället.
Den friktionen är den del som ett routningslager tar bort. Qwen3.8 Max finns i vår katalog tillsammans med den föregående generationen, så att jämföra dem på din egen utvärderingsuppsättning är en ändring på en rad i modellsträngen i stället för en upphandlingscykel, och samma nyckel når resten av katalogen när jämförelsen visar att du vill ha en annan modell för ett annat steg i pipelinen. Den ligger på leverantörens listpris med 0 % påslag, vilket spelar roll här av en specifik anledning: Qwen3.8 Max lanserades cirka 20 % billigare än generationen den ersatte, och en sådan prisändring från en leverantör är något som bör hamna på din faktura när den sker i stället för vid nästa förnyelse.
Boreal finns inte i vår katalog. OrcaRouter erbjuder inte videogenereringsmodeller, och inget här bör läsas som ett påstående om motsatsen. Det vi erbjuder är lagret ovanför det – texten, varianterna, efterlevnadskontrollen, analysen av vad som presterade – och två av modellerna i den här serien, Qwen3.8 Max bland dem, kan ges det färdiga klippet för granskning.

Så här läser du endera kortet
Qwen3.8 Max är det starkare köpet om ditt arbete är kod, agenter eller strukturerat resonemang, till ett pris som underskred priset för dess egen föregångare, och de två oberoende regressionerna är anledningen till att testa den på din trafik för retrieval och sammanfattning innan du dirigerar produktionstrafik dit. Siffran på 40 % hallucinationer är inte ett skäl att undvika modellen; det är ett skäl att veta vilka av dina arbetsbelastningar som kan tolerera det.
Boreal är den enda av de två som producerar den artefakt som den här jämförelsen formellt sett handlar om, och det är det billigaste trovärdiga alternativet utifrån publicerade priser för kortformatig reklamvideo. Dess begränsning är formatspecifik och anges av dess egen leverantör: 60 % preferens för klipp med en person som talar. Testa det formatet före produktannonserna, eftersom det är där utrymmet är som minst.
Två saker skulle förändra detta. Om Alibaba släpper de öppna vikter som man har annonserat för Qwen3.8 Max, förändras både prissättningen och modellens hållbarhet, och licensen som den släpps under kommer att spela större roll än datumet. Och för Boreal skulle den första oberoende utvärderingen – av vilket slag som helst, av vem som helst – ersätta ett leverantörstest med 40 fall som för närvarande bär hela bevisbördan för en modell som säljs in i ett format där varumärken är ovanligt känsliga för hur deras produkt ser ut.

Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
