Gegenereerde hero-titelkaart met als kop 'GPT-6 Luna vs Qwen3.8-Max' en als ondertitel 'Het goedkoopste model hier is niet het model dat video bekijkt', een voettekst met 'Prijzen volgens OpenAI en Alibaba Cloud; indexcijfers volgens Artificial Analysis.', en het OrcaRouter-logo rechtsonder gecomposeerd.
Guides & Insights

GPT-6 Luna vs Qwen3.8-Max: Het goedkoopste model in deze vergelijking is ook het enige dat video bekijkt

Auteur

Gideon Frost

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

De voor de hand liggende invalshoek voor deze combinatie is de verkeerde. Qwen3.8-Maxheeft een prijs van $2,00 per miljoen inputtokens en $6,00 per miljoen output, met cache-reads tegen $0,25. GPT-6 Lunastaat op $0,10 en $0,50, met cache-reads tegen een cent. Twintig keer op input, twaalf keer op output, vijftig keer op gecachte input — een prijsverschil zo groot dat de vergelijking al beslecht lijkt voordat ze begint.

Het is niet beslist, want de twee modellen concurreren niet om hetzelfde verzoek. Qwen3.8-Max accepteert tekst, afbeelding en video, en zijn uitvoerplafond van 131.072 tokens ligt iets boven de 128.000 van GPT-6 Luna. GPT-6 Luna accepteert alleen tekst en afbeelding. Het model van Alibaba scoort 58 op de onafhankelijke Intelligence Index — de eerste in zijn klasse op het agentic-board — en GPT-6 Luna scoort 37 bij maximale inspanning, 29 bij de standaardinstelling. De een is een vlaggenschip met een open-weight-lijn en een video-invoermodaliteit. De ander is een volumelaag met een snelheidscijfer en een cachetarief van één cent. Het prijsverschil is geen korting op hetzelfde; het is een beschrijving van twee verschillende dingen.

Wat elk van deze twee is

Qwen3.8-Max is het vlaggenschip van Alibaba uit de 3.8-generatie, een checkpoint uit de Max-klasse waarvan het onderliggende model — Qwen3.8-2.4T-A95B — op 12 augustus 2026 publiekelijk werd uitgebracht onder een aangepaste licentie, waarmee het de eerste Max-klasse Qwen is die überhaupt open gewichten heeft. Het gehoste vlaggenschip zelf staat bij de onafhankelijke raad nog steeds als propriëtair vermeld. Het heeft een contextvenster van 1.000.000 tokens, een uitvoerplafond van 131.072 tokens, tekst-, beeld- en video-invoer, en een redeneerinspanning die instelbaar is op laag, gemiddeld en extra hoog. Een vastgezette Qwen3.8-Max-0902-revisie is beschikbaar voor dezelfde prijs, wat een klein detail is met echte operationele waarde.

GPT-6 Luna is OpenAI's efficiëntieniveau van 22 september 2026, onder GPT-6 Sol op $2,00/$10,00 en de vlaggenschip-GPT-6 Astra op $10,00/$50,00. Tekst en afbeelding in, tekst uit, een venster van 1.050.000 tokens met 922.000 maximale invoer, een uitvoerplafond van 128.000 tokens, en effort van none tot low, medium, high, xhigh en max, met medium als standaard. Gesloten, één identificatie, beschikbaar voor iedereen met een API-sleutel.

De ene accepteert video en kan in zijn basisvorm worden gedownload. De andere accepteert afbeeldingen en is snel. Beide zijn geprijsd voor gebruik op volume. De overlap tussen die twee uitspraken is kleiner dan de prijsverhouding doet vermoeden.

De kaarten, regel voor regel

Eén regel per dimensie, beide zijden op elk:

• Input per 1 miljoen — GPT-6 Luna $0,10 vs Qwen3.8-Max $2,00

• Output per 1 mln — GPT-6 Luna $0,50 vs Qwen3.8-Max $6,00

• Gecachte invoer per 1 mln — GPT-6 Luna $0,01 vs. Qwen3.8-Max $0,25 voor impliciete cachereads, met een expliciete cacheread tegen $0,17 en een expliciete cachewrite tegen $2,50

• Clausule voor lange context — GPT-6 Luna verdubbelt input en cache en verhoogt output met 1,5× boven 272.000 inputtokens, toegepast op het hele verzoek, tegenover Qwen3.8-Max met een vast tarief over het volledige venster, wat de enige plek is waar de Qwen-kaart structureel beter is in plaats van marginaal goedkoper

• Contextvenster — GPT-6 Luna 1.050.000 tokens vs Qwen3.8-Max 1.000.000 tokens

• Maximale uitvoer — GPT-6 Luna 128.000 tokens vs Qwen3.8-Max 131.072 tokens

• Invoermodaliteiten — GPT-6 Luna tekst en afbeelding versus Qwen3.8-Max tekst, afbeelding en video

• Redeneerinspanning — GPT-6 Luna geen, laag, gemiddeld (standaard), hoog, xhigh, max vs Qwen3.8-Max laag, gemiddeld en extra hoog

• Intelligence Index, onafhankelijk — GPT-6 Luna 37 bij maximale inspanning vs Qwen3.8-Max 58

• Agentic Index, onafhankelijk — Qwen3.8-Max 58, eerste in zijn klasse; geen vergelijkbaar GPT-6 Luna-cijfer gepubliceerd

• Score voor standaardinspanning — GPT-6 Luna 29 op de standaardinstelling medium versus Qwen3.8-Max gemeten op de maximale instelling

• Kosten per Index-taak, onafhankelijk — GPT-6 Luna ongeveer $0,07 vs Qwen3.8-Max $5,41

• GDPval, onafhankelijk — Qwen3.8-Max 1.739 Elo bij 64 beurten per taak, wat neerkomt op ongeveer $1,14 per voltooide taak in die evaluatie; er is geen vergelijkbare GPT-6 Luna-run gepubliceerd

• Hallucinatiepercentage op AA-Omniscience — Qwen3.8-Max 40%, een regressie ten opzichte van 23% in de vorige generatie; GPT-6 Luna 77%, gedaald van 93%

• Gedateerde momentopname — GPT-6 Luna, één enkele doorlopende identifier, versus Qwen3.8-Max-0902, beschikbaar als een vastgezette revisie van 2 september 2026 tegen dezelfde prijs

• Gewichten — GPT-6 Luna gesloten, uitsluitend via API, tegenover Qwen3.8-Max: het basischeckpoint Qwen3.8-2.4T-A95B is sinds 12 augustus 2026 openbaar onder een aangepaste licentie, terwijl het gehoste vlaggenschip als propriëtair wordt vermeld

• Op OrcaRouter — GPT-6 Luna niet in onze catalogus vs Qwen3.8-Max routeerbaar tegen Alibaba's lijstprijs

Generated two-column scoreboard titled 'GPT-6 Luna vs Qwen3.8-Max - the scoreboard'. Left column GPT-6 Luna rows: Price in/out $0.10 / $0.50, Cached input $0.01, AA Index 37 at max effort, Context 1,050,000, Input text + image, Cost per index task $0.07. Right column Qwen3.8-Max rows: Price in/out $2.00 / $6.00, Cached input $0.25, AA Index 58, Context 1,000,000, Input text + image + video, Cost per index task $5.41. Footer: 'Prices per OpenAI and Alibaba Cloud; index figures per Artificial Analysis.'

Video is geen functielijn, het is een andere workload

De modaliteitsrij is degene die meer echte vergelijkingen bepaalt dan de prijsrij, en wordt meestal gelezen als een selectievakje.

Qwen3.8-Max accepteert video. GPT-6 Luna niet. Als je pipeline moet redeneren over een schermopname, een productdemo, een college-opname, een segment van een beveiligingscamera of een UI-walkthrough, dan eindigt de vergelijking bij die grens en wordt het twintigvoudige prijsverschil irrelevant — je kiest niet tussen een dure optie en een goedkope, je kiest tussen een optie en geen optie. Frames extraheren en ze als afbeeldingen doorgeven is een workaround, niet een equivalent, en iedereen die er een heeft gebouwd kent het verschil in zowel kosten als kwaliteit.

Als je pipeline uit tekst en afbeeldingen bestaat, zwijgt de modaliteitsregel en spreekt de prijsregel. Dat is de eerlijke tweedeling, en het is de moeite waard om ronduit te zeggen aan welke kant daarvan je staat voordat je iets anders op deze pagina leest.

De agentische kloof is reëel en vormt de dure helft van het prijsverschil.

Qwen3.8-Max scoort 58 op de onafhankelijke Intelligence Index. GPT-6 Luna scoort 37 bij maximale inspanning en 29 op de standaard medium-instelling. Eenentwintig punten bij overeenkomende instellingen, negenentwintig bij standaardinstellingen — op een samengestelde score waar één punt binnen de ruis van een herhaling valt, is een verschil van die grootte geen ruis.

De positie van Qwen3.8-Max is geconcentreerd in agentisch werk. Het scoort 58 op de onafhankelijke Agentic Index, als eerste in zijn klasse, en 1.739 Elo op GDPval bij 64 beurten per taak. Dat laatste cijfer is het informatieve gegeven, want het is een meting van een model dat een taak overeind houdt gedurende vierenzestig opeenvolgende beslissingen, en er hangt een prijskaartje aan: ongeveer $1,14 per voltooide taak in die evaluatie. Vergelijk dat met de kosten per indextaak van GPT-6 Luna van ongeveer $0,07, en de eerlijke uitspraak is niet dat Qwen duur is. Het is dat Qwen wordt gevraagd iets veel moeilijkers te doen, en dat ook doet.

Het gevolg is dat ook het tekort van eenentwintig punten van GPT-6 Luna niet gelijkmatig over je werklast is verdeeld. Bij een korte, goed gespecificeerde taak die door een programma wordt verwerkt — dit veld extraheren, dit ticket classificeren, dit verzoek routeren — zullen beide modellen bijna altijd hetzelfde bruikbare antwoord produceren, en de indexkloof zal onzichtbaar zijn in je evaluatie. Bij een taak die vierenzestig opeenvolgende acties vereist met een checkpoint aan het einde, is de kloof het verschil tussen afmaken en halverwege stilletjes stoppen, en dat is de taak waarvoor Qwen3.8-Max is gebouwd en GPT-6 Luna niet.

Eén getal wijst de andere kant op en verdient het om genoemd te worden in plaats van begraven. Het hallucinatiepercentage van Qwen3.8-Max op het omniscience-board is 40%, tegenover 23% bij de vorige generatie — een substantiële regressie, en het soort dat zich in productie manifesteert als zelfverzekerde foute antwoorden in plaats van als een benchmarkregel. Dat van GPT-6 Luna is 77%, tegenover 93%. Beide cijfers zijn in absolute zin hoog, en het goedkopere model is op deze maatstaf nog steeds het slechtste van de twee. Geen van beide getallen is een reden om het ene model boven het andere te verkiezen; beide zijn redenen om een mens of een verifier in het proces te houden bij alles waarbij een verzonnen feit duur is.

De long-contextclausule is de enige regel waar Qwen wint qua structuur

GPT-6 Luna bevat een clausule die Qwen3.8-Max niet heeft: verzoeken boven 272.000 inputtokens worden gefactureerd tegen twee keer de input- en cachetarieven en 1,5× het outputtarief, toegepast op het volledige verzoek in plaats van op het deel dat de grens overschrijdt. Een aanroep van 300.000 tokens op GPT-6 Luna wordt gefactureerd tegen $0,20 per miljoen input voor alle 300.000 tokens omdat deze 28.000 over de grens ging. Splits hetzelfde document in twee aanroepen en de kosten halveren zonder dat de prompt verandert.

Qwen3.8-Max is vlak over zijn volledige venster van 1.000.000 tokens. Voor echt enorme afzonderlijke verzoeken maakt dat het twaalfvoudige verschil in outputprijs kleiner dan het lijkt, en kan het zelfs omkeren: boven 272.000 inputtokens verdubbelt het effectieve inputtarief van GPT-6 Luna naar $0,20, en stijgt het outputtarief naar $0,75, tegenover Qwens vlakke $2,00 en $6,00. Het verschil wordt kleiner, van twintig keer naar tien keer op input en van twaalf naar acht op output. Nog steeds groot — maar de workloads die het meest waarschijnlijk een werkcontext van 300.000 tokens hebben, zijn precies de agentische workloads waarin beide leveranciers verkopen, en de teams die ze draaien zijn de teams die het zullen merken.

De andere structurele lijn is de vastgepinde revisie. Qwen3.8-Max-0902 is beschikbaar tegen dezelfde prijs als de rollende identifier, wat betekent dat een team dat reproduceerbaar gedrag nodig heeft bij een modelupdate, dat kan krijgen zonder een premie te betalen. GPT-6 Luna biedt geen equivalent. Dat is een kleine regel op een tariefkaart en een grote regel in een post-mortem.

Een van beide uitvoeren, of allebei

Qwen3.8-Max staat op OrcaRouter tegen Alibaba's lijstprijs, onder de pass-through-prijsstelling, wat betekent dat een tariefwijziging van een leverancier dezelfde dag nog aan onze kant live is. Twee dingen aan onze routeringslaag verdienen hun plaats voor dit specifieke model: automatische failover, omdat een gehoste flagship met een gepubliceerde open-weight-basis meer upstreams heeft dan een gesloten model van één leverancier en meer manieren waarop een daarvan kan verslechteren; en de pinned-revision-afhandeling, die een route Qwen3.8-Max-0902 expliciet laat vasthouden in plaats van over te nemen wat de rolling identifier volgende week ook oplevert.

GPT-6 Luna staat op het moment van schrijven niet in onze catalogus en is alleen bereikbaar via OpenAI's eigen API, dus een team dat beide wil, gebruikt één sleutel voor Qwen3.8-Max naast wat het al voor OpenAI gebruikt. Dit is ook de combinatie waarbij de routing-DSL meer waard is dan een statische splitsing, omdat de grens tussen de twee modellen een modaliteitscontrole en een lengtecontrole is in plaats van een voorkeur: verzoeken met video gaan naar Qwen3.8-Max omdat niets anders ze kan bedienen, verzoeken boven 272.000 inputtokens gaan naar Qwen3.8-Max omdat de cliff van het andere model ze daar duurder maakt, en al het overige gaat naar het model dat een twintigste van de prijs kost. Dat is een regel, en die hoort thuis in de configuratie in plaats van in een applicatietak.

Screenshot of OpenAI's developer documentation page for GPT-6 Luna, showing the model selector, the description 'Our most efficient model for focused, high-volume tasks', reasoning set to High, speed Fast, price $0.1 · $0.5, text and image input with text output, a 1,050,000-token context window, 128,000 maximum output tokens, a May 18, 2026 knowledge cutoff, and pricing cards of $0.10 input, $0.01 cached input, $0.125 cache writes and $0.50 output per 1M tokens.

Welke, en wanneer?

Kies Qwen3.8-Max als een van de volgende situaties van toepassing is. Je pipeline heeft video-invoer nodig. Je aanvragen overschrijden routinematig 272.000 invoertokens, waarbij zijn vaste tarief de prijsherziening van GPT-6 Luna verslaat. Je uitvoer overschrijdt 128.000 tokens. Je werk is agentische uitvoering met een lange horizon en een verifieerbaar eindpunt, waarbij de 58 op de agentische ranglijst en 1.739 Elo op GDPval bij 64 beurten per taak het bewijs zijn dat ertoe doet. Of je hebt een vastgezette revisie nodig voor reproduceerbaarheid en bent bereid ervoor te betalen — wat, tegen dezelfde prijs als de rollende identificatie, betekent dat je dat niet bent.

Kies GPT-6 Luna als geen van die gevallen van toepassing is en je workload een hoog volume heeft, door programma's wordt gebruikt, tekst en afbeeldingen combineert en kort is. Classificatie, extractie, routering, bulk-samenvatting, de inner loop van een agent die een snel antwoord nodig heeft in plaats van een zorgvuldig antwoord. Met $0,10/$0,50, een gecachte read van één cent en een kosten per voltooide taak van ongeveer een vijftiende van die van Qwen3.8-Max, is de rekensom niet eens close. Stel de effort-parameter expliciet in — de standaardwaarde is medium en het kopcijfer 37 is een waarde voor maximale inspanning — en houd lange calls aan de goede kant van de grens van 272.000 tokens.

De fout waartoe deze vergelijking uitnodigt, is de twintigvoudige invoerprijs als een oordeel te lezen. Het is een oordeel over één vorm van werklast, en het zwijgt over de drie regels die de andere bepalen: of het verzoek video bevat, of het de 272.000 tokens haalt, en of het antwoord vierenzestig opeenvolgende stappen moet doorstaan.

Screenshot of the OrcaRouter model page for Qwen3.8 Max (0902) showing the breadcrumb Home > Models > Qwen > Qwen3.8 Max (0902), a NEW badge, the model id qwen/qwen3.8-max-0902, Vision, Tools, JSON and Reasoning chips, a Qwen attribution dated 2026-09-02, the description of a September 2, 2026 snapshot accepting text, image and video input with a 1M-token context, input pricing of $2.00 and output of $6.00 per 1M tokens, a p50 time to first token of 3.50s, a p95 of 9.38s, and traffic of 196.6M tokens over seven days.

Vergeleken in dit artikel3

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt