
Boreal vs Qwen3.8 Max: De rij die elke leverancier hoopt dat je overslaat
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligentie
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Bij elke modellancering verschijnt een kaart vol cijfers, en elke kaart heeft een rij waarop de leverancier liever niet heeft dat je blijft stilstaan. Voor Qwen3.8 Max, uitgebracht op 3 augustus 2026, zijn de flatterende rijen gemakkelijk te vinden: het model pakte de eerste plaats op de CodeArena-front-endleaderboard met 1.691 punten, bereikte een Artificial Analysis Agentic Index van 58 en kwam daarmee bij hoge inspanning op gelijke hoogte met Claude Opus 5 — het dichtst dat een Chinees lab ooit bij de top van dat klassement was gekomen — en het scoorde 1.739 Elo op GDPval-AA, vóór GPT-5.6 Sol. De rij daaronder is moeilijker te lezen. In de suite van dezelfde evaluator steeg de gemeten hallucinatie van 23% bij de vorige generatie naar 40%, en de long-context-retrievalscore van het model zakte twee punten. Boreal, het advertentievideomodel van Creatify, gelanceerd op 15 september 2026 voor één cent per seconde, heeft een rij van hetzelfde soort op zijn eigen kaart — en die is specifieker, omdat de leverancier die zelf heeft gepubliceerd.
Geen van beide rijen is diskwalificerend. Beide zijn informatiever dan de scores in de koppen, en daarom loont het de moeite om ze naast elkaar te leggen in plaats van de banners te vergelijken.
Waar Qwen3.8 Max echt het beste in is
De overwinningen zijn echt en ze zijn niet klein.
Qwen3.8 Max is een mixture-of-experts-model met 2,4 biljoen parameters, waarvan ongeveer 95 miljard parameters per token actief zijn, en het is de eerste Qwen uit de Max-klasse waarvan Alibaba heeft gezegd dat die als open weights zal worden uitgebracht — aangekondigd voor de week van 10 augustus 2026, zonder licentie of harde datum, een detail dat het vermelden waard is omdat de aankondiging niet de release is. Het heeft een contextvenster van 1M tokens met een uitvoerplafond van 131.072 tokens, en het accepteert tekst, afbeeldingen en video als invoer. Dat laatste punt verdient in deze specifieke vergelijking extra nadruk: van de vier frontier-tekstmodellen die deze reeks tegenover Boreal plaatst, is Qwen3.8 Max een van slechts twee die een afgeronde videoclip kunnen krijgen en daar een vraag over kunnen beantwoorden.
De prijsstelling is agressief op een manier die het segment heeft hervormd. Met $2,00 per miljoen input en $6,00 per miljoen output, met cache-reads tegen $0,25, ligt de prijs ongeveer 20% onder die van de vorige generatie, terwijl de maximale outputlengte verdubbelt. Op ons dashboard komt dat uit op $2,00 en $6,00, een context van 1M tokens, een p50-tijd tot het eerste token van 10,00 seconden — de bovengrens die onze instrumentatie rapporteert, dus lees het als "traag" in plaats van precies — en 183,0 miljoen tokens aan verkeer in de afgelopen zeven dagen.
En de rij eronder
Hier is het deel dat de kop van de lanceringspost niet haalt.
De onafhankelijke evaluatie van Artificial Analysis registreerde twee regressies tussen Qwen3.7-Max en Qwen3.8 Max. De maatstaf voor langcontextretrieval daalde met twee punten. De alwetendheidsmaatstaf daalde met tien, en het door de evaluator gemeten hallucinatiepercentage steeg van 23% naar 40%. Tegelijkertijd stegen de kosten per taak van het model op de intelligentie-index van $0,53 naar $1,14 — het had ongeveer 64 beurten per taak nodig, terwijl zijn voorganger er 14 nodig had.
Lees die samen en er ontstaat een samenhangend beeld. Qwen3.8 Max is een model dat beter is geworden in de dingen die benchmarks met één juist antwoord kunnen meten — code, het voltooien van agentische taken, gestructureerd problemen oplossen — en slechter is geworden in het ding dat het moeilijkst te beoordelen is: weten wanneer het iets niet weet. Een model dat meer nadenkt en meer hallucineert, spreekt zichzelf niet tegen. Langere redeneersporen creëren meer mogelijkheden om zich vast te leggen op een stellig fout antwoord, en een benchmark die taakvoltooiing beloont, bestraft dat niet totdat de taak een verborgen invariant heeft die geschonden kan worden.
Voor een koper is het praktische gevolg beperkt en specifiek. Als je gebruik van het model codegeneratie is of een agentische workflow waarbij een fout antwoord luidruchtig faalt — een test faalt, een build breekt — dan zijn de regressies grotendeels onzichtbaar en vormen de winsten het hele verhaal. Als je gebruik retrieval, samenvatting of iets is waarbij een vloeiend geformuleerd maar fout antwoord een mens bereikt zonder controle, dan is de verschuiving van 23 naar 40 het getal dat je evaluatie zou moeten bepalen, niet de CodeArena-plaatsing.
Boreals eigen slechtste rij, gepubliceerd door de leverancier
Het contrast dat deze combinatie nuttig maakt, is dat Creatify iets deed wat de meeste leveranciers niet doen: het zette zijn zwakste resultaat in dezelfde post als zijn sterkste.
Boreal werd blind getest tegen zijn eigen onaangeraakte basismodel, waarbij prompt, resolutie, framecount en seed vast werden gehouden, over 40 productiecases. Creatify rapporteert een voorkeur van 81% voor Boreal — 25 tegen 6 met 9 gelijke uitkomsten, tekentoets p<0,001 — en splitst dat gemiddelde vervolgens uit. Productadvertenties: 83%. Creator- en UGC-scènes: 85%. Clips met één pratende persoon: 60%.
Dat laatste cijfer is de rij. Talking heads behoren tot de meest voorkomende formaten in direct-responseadvertising, en het is het formaat waarin het voordeel van het model ten opzichte van zijn eigen basis het kleinst is — amper beter dan een muntworp tegen een model dat niemand zou uitbrengen. Rendering wordt opgegeven als 1:1 met realtime in de 720p-klasse, en het behoud van fijne details verbeterde met 11,3% bij p=0,004, dus het totaalbeeld is echt positief. De uitsplitsing vertelt je simpelweg voor welke helft van de categorie dit model is afgestemd, en dat is niet de helft met een persoon die tegen de camera praat.
Let ook op wat voor bewijs elk van deze rijen is. De regressie van Qwen3.8 Max werd gevonden door een onafhankelijke evaluator die zijn eigen harness draaide. De zwakke rij van Boreal werd door de leverancier bekendgemaakt, in een test die de leverancier zelf heeft ontworpen en uitgevoerd. De tweede is betrouwbaarder als feitelijke bewering en minder informatief als vergelijking, omdat er nergens in Boreals bestand een onafhankelijk cijfer staat.

Het specificatiecontrast
• Uitvoer — Boreal: gerenderde video, 720p-klasse, tekst-naar-video en afbeelding-naar-video. Qwen3.8 Max: alleen tekst, tot 131.072 tokens.
• Invoer — Boreal: een tekstprompt of een stilstaand beeld. Qwen3.8 Max: tekst, afbeeldingen en video.
Prijs — Boreal: $0,01 per seconde voltooide video. Qwen3.8 Max: $2,00 per 1 mln. input / $6,00 per 1 mln. output, cachereads tegen $0,25.
• Context — Boreal: niet gepubliceerd. Qwen3.8 Max: 1M tokens in, 131K uit.
• Latentie — Boreal: opgegeven als 1:1 met realtime. Qwen3.8 Max: p50-tijd tot eerste token van 10,00 seconden op ons board.
• Gewichten — Boreal: propriëtair, eigendom van en geserveerd door Creatify. Qwen3.8 Max: propriëtair bij de lancering; Alibaba heeft een open-weights-release aangekondigd voor de eerste Qwen in de Max-klasse, zonder bevestigde licentie of datum.
• Bewijs — Boreal: door de leverancier uitgevoerde blinde test met 40 cases, geen onafhankelijke evaluatie. Qwen3.8 Max: onafhankelijke benchmarkdekking met inbegrip van twee gemeten regressies, naast leveranciersregels van 86,1 op OSWorld-Verified en 86,6 op Terminal-Bench 2.1.
Wat een regressie waard is voor iemand die koopt
Regressies op ranglijsten worden meestal als trivia beschouwd. Ze staan dichter bij het meest beslissingsrelevante dat een benchmark publiceert, omdat het de enige rijen zijn die je vertellen wat een leverancier heeft opgeofferd.
De nuttige zet is niet om een van beide kaarten te lezen, maar om beide modellen op je eigen verkeer te draaien — en het praktische obstakel is dat dit normaal gesproken twee contracten, twee SDK's en twee factureringsrelaties betekent, wat genoeg wrijving oplevert dat de meeste teams de test overslaan en in plaats daarvan op de score in de koppen kopen.
Die frictie is precies het onderdeel dat een routeringslaag wegneemt. Qwen3.8 Max staat in onze catalogus naast de vorige generatie, dus ze vergelijken op je eigen evaluatieset is een wijziging van één regel in de modelstring in plaats van een inkooptraject, en dezelfde sleutel geeft toegang tot de rest van de catalogus wanneer uit de vergelijking blijkt dat je een ander model wilt voor een andere fase van de pipeline. Het staat op het lijsttarief van de provider met 0% opslag, wat hier om een specifieke reden van belang is: Qwen3.8 Max kwam ongeveer 20% goedkoper uit dan de generatie die het verving, en een dergelijke prijsherziening door een leverancier is iets dat op je factuur terecht moet komen op het moment dat het gebeurt, en niet bij de volgende verlenging.
Boreal staat niet in onze catalogus. OrcaRouter levert geen modellen voor videogeneratie, en niets hier mag worden opgevat als een bewering van het tegendeel. Wat wij leveren is de laag daarboven — de copy, de varianten, de compliancecontrole, de analyse van wat presteerde — en twee van de modellen in deze serie, waaronder Qwen3.8 Max, kan de voltooide clip worden voorgelegd ter beoordeling.

Hoe je een van beide kaarten leest
Qwen3.8 Max is de sterkere aankoop als je werk code, agents of gestructureerd redeneren is, tegen een prijs die lager is dan die van zijn eigen voorganger, en de twee onafhankelijke regressies zijn de reden om het te testen op je retrieval- en samenvattingsverkeer voordat je productie daarheen routeert. Het cijfer van 40% hallucinatie is geen reden om het model te vermijden; het is een reden om te weten welke van je workloads het kunnen tolereren.
Boreal is van de twee de enige die het artefact produceert waar deze vergelijking in naam om draait, en het is de goedkoopste geloofwaardige optie op basis van gepubliceerde tarieven voor kortvormige advertentievideo's. De beperking is formaatspecifiek en wordt door de leverancier zelf genoemd: 60% voorkeur bij clips met één persoon die praat. Test dat formaat vóór de productadvertenties, want daar is de speelruimte het kleinst.
Twee dingen zouden dit in beweging brengen. Als Alibaba de open gewichten uitbrengt die het voor Qwen3.8 Max heeft aangekondigd, veranderen zowel de prijsstelling als de duurzaamheid van het model, en de licentie waaronder het uitkomt zal belangrijker zijn dan de datum. En voor Boreal zou de eerste onafhankelijke evaluatie — van welke aard dan ook, door wie dan ook — een leverancierstest met 40 cases vervangen die momenteel de volledige bewijslast draagt voor een model dat wordt verkocht in een format waarin merken ongewoon gevoelig zijn voor hoe hun product eruitziet.

Vergeleken in dit artikel1
Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt
