Snapshot van Qwen3.8 Max, gedateerd 2 september 2026, Alibaba's vlaggenschip multimodaal redeneermodel: tekst + beeld + video in, tekst uit, 1M-token context. Dezelfde mogelijkheden en prijzen als het basismodel; pin het vast voor reproduceerbaar gedrag.
Qwen3.8 Max (0902) is een modelvermelding op OrcaRouter van provider qwen, gepubliceerd met de model-ID qwen/qwen3.8-max-0902. De notatie 0902 wordt in de lijst weergegeven, maar de aangeleverde…
Het model ondersteunt een contextvenster van 1.000.000 tokens. Dat is de totale hoeveelheid invoer waar het model in één verzoek gebruik van kan maken, inclusief de tekst-, afbeeldings- en video-inhoud in de prompt. Er wordt in de feiten geen verdere limiet gegeven, dus praktische beperkingen hangen af van hoe OrcaRouter en de provider tokenisatie en time-outs voor verzoeken handhaven. Voor lange tekst maakt 1.000.000 tokens het mogelijk om veel omvangrijke documenten in één prompt op te nemen, waardoor de noodzaak om te chunkten of samen te vatten vóór het aanroepen van het model afneemt. Voor video vermelden de feiten niet hoeveel tokens er per seconde, per frame of per videobestand worden verbruikt, dus u moet dit schatten op basis van metadata of testaanroepen. Het is ook belangrijk om te onthouden dat de grootte van het contextvenster niet vertelt hoe nauwkeurig het model is bij een prompt van 1.000.000 tokens; er worden geen benchmarkgegevens geleverd. Als uw toepassing exacte kwaliteit voor lange contexten nodig heeft, evalueer dit dan op een steekproef van uw eigen documenten voordat u overgaat tot productie.
Wanneer tekst, afbeeldingen en video als invoer worden geaccepteerd, kan het model worden gevraagd om te redeneren over bronmateriaal dat deze typen in hetzelfde verzoek combineert. Voorbeelden zijn het lezen van instructies in tekst, het onderzoeken van een afbeelding en het verwijzen naar een video bij het produceren van een antwoord. Het informatieblad van de provider vermeldt geen taakspecifieke mogelijkheden zoals OCR, objectdetectie of temporeel videoredeneren, dus dergelijk gedrag mag niet worden verondersteld. Wat van het model kan worden verwacht, hangt voornamelijk af van de getrainde vaardigheden, die niet zijn gedocumenteerd in de verstrekte feiten. Het veilige ontwerp is om het te gebruiken voor taken die een tekstuitvoer vereisen van een prompt met gemengde modaliteiten en die de kosten van het opslaan van afbeeldingen en video als invoertokens kunnen verdragen. Als een workload alleen tekst bevat, is een ander model zonder afbeelding- en video-invoer wellicht eenvoudiger. Als een taak nauwkeurige video-operaties op timestempelniveau vereist, geeft de modelkaart geen bewijs of dergelijk gedrag betrouwbaar is.
Een goedkoper model kiezen is logisch wanneer de taak geen gebruik maakt van de functies die deze vermelding kenmerken. Een korte tekstvraag heeft geen context van 1.000.000 tokens of een uitvoerlimiet van 131.072 tokens nodig. Een workflow met alleen tekst heeft geen beeld- of video-invoer nodig. OrcaRouter factureert dit model tegen $2,00 per 1.000.000 invoertokens en $6,00 per 1.000.000 uitvoertokens. Als een goedkoper alternatief lagere prijzen per token heeft en voldoende context- en modaliteitsondersteuning biedt, verlaagt dat de kosten. Er zijn geen kwaliteits- of snelheidsbenchmarks in de verstrekte feiten, dus het kiezen van dit model boven andere modellen kan niet worden gerechtvaardigd door gemeten nauwkeurigheid; het moet worden gerechtvaardigd door expliciete productvereisten: grote context, gemengde tekst-/beeld-/video-invoer of lange uitvoer in één generatie. Omdat de invoerprijs van toepassing is op elk token in de context, kunnen calls met een zeer grote context duurder zijn dan kleinere calls, zelfs als de gebruikersvraag kort is. Vermijd dus het opvullen van prompts.
De aangeleverde modelfeiten voor Qwen3.8 Max (0902) bevatten geen benchmarkscores, evaluatiesets of nauwkeurigheidscijfers. Om die reden zou elke uitspraak over modelkwaliteit speculatie zijn, en OrcaRouter publiceert geen afgeleide scores. Als u een cijfer nodig hebt om kandidaten te vergelijken, voer dan uw eigen tests uit op representatieve invoer, inclusief de afbeeldings- en videogevallen die u verwacht te verzenden. Een benchmark zoals een openbare kennistest zou u niet vertellen hoe goed het model een specifieke videoprompt van 1.000.000 tokens verwerkt. Houd er rekening mee dat een modelnaam als Max een label is, geen bewijs van kwaliteit. De meetbare zaken in deze vermelding zijn het contextvenster, de maximale uitvoerlengte, invoermodaliteiten en prijs. Die kenmerken bepalen of een workload past, maar ze beschrijven geen nauwkeurigheid, redeneerdiepte, instructie-opvolging of veiligheidsgedrag. Behandel capaciteiten op die gebieden als niet-geverifieerd, tenzij u zelf een evaluatie uitvoert.
De modelfeiten geven geen tokens-per-seconde-snelheden, time-to-first-token-waarden, richtlijnen voor request-timeouts of andere prestatiemetingen. OrcaRouter claimt geen latentiecijfer voor dit providermodel. De snelheid hangt af van de serving-infrastructuur van de provider, de grootte van de invoer en de hoeveelheid gevraagde uitvoer. Een invoer van 1.000.000 tokens en een uitvoer van 131.072 tokens duren waarschijnlijk langer dan een kort verzoek, maar de vermelding geeft geen exacte relatie. Video-invoer kan de latentie ook verslechteren, omdat deze eerst tot tokens moet worden verwerkt voordat het model er aandacht aan kan besteden; de feiten kwantificeren die stap niet. Beoordelaars moeten niet aannemen dat lage prijzen per token snelle decodering impliceren. De enige snelheidsgerelateerde beslissing die door de feiten wordt ondersteund, is het testen van representatieve verzoekgroottes onder uw verwachte belasting. Leid realtime-geschiktheid niet af uit de contextvenstergrootte of de modelnaam.
Vermelde sterke punten zijn structureel. Het model heeft een contextvenster van 1.000.000 tokens, een hoge maximale uitvoer van 131.072 tokens en accepteert tekst-, beeld- en video-invoer. Deze zijn nuttig voor toepassingen die in één modelaanroep een grote of gemengde hoeveelheid materiaal moeten observeren voordat ze een lang antwoord schrijven. Beperkingen zijn ook eenvoudiger op basis van de feiten vast te stellen dan sterke punten. Er worden geen kwaliteitsbenchmarks gepubliceerd, dus nauwkeurigheid, redenering en veiligheid zijn niet gedocumenteerd. Er is geen aparte vermelding van de trainingsgegevens, release notes of updatemethodologie achter het label 0902. Beeld- en video-invoer garanderen geen exact visueel of temporeel begrip. Context- en uitvoerlimieten zijn maxima, geen aanbevolen gebruik; zeer grote uitvoer kan duur zijn en kost $6,00 per 1.000.000 uitvoertokens. Een verzoek dat de context van 1.000.000 tokens volledig vult, verbruikt $2,00 aan invoertokens voordat er enige uitvoer wordt gegenereerd, wat een aanzienlijke operationele kost is.
De vermelde eenheidsprijzen zijn $2,00 per 1.000.000 invoertokens en $6,00 per 1.000.000 uitvoertokens. OrcaRouter factureert het model tegen het provider-tarief zonder opslag, dus de vermelde prijs is het doorberekende provider-tarief. Invoertokens omvatten de tekst-, afbeeldings- en videotokens die in de prompt worden verzonden. Uitvoertokens zijn de gegenereerde respons-tokens. Bij deze tarieven kosten 1.000.000 invoertokens $2,00; 1.000.000 uitvoertokens kosten $6,00. Een kleinere aanvraag kost evenredig minder: 100.000 invoertokens zouden $0,20 zijn en 100.000 uitvoertokens zouden $0,60 zijn, op voorwaarde dat die hoeveelheden door de provider worden gemeten. De modelkaart bevat geen aparte prijzen voor gecachte invoer, batch-aanvragen of interactieve lagen, dus dergelijke prijzen mogen niet worden aangenomen. De exacte gefactureerde tokenaantallen moeten voor elke aanroep worden gecontroleerd in de OrcaRouter-gebruiksreactie of in de logs.
Wanneer OrcaRouter zegt dat een model wordt gefactureerd tegen het providerstarief zonder opslag, betekent dit dat OrcaRouter voor deze aanbieding geen eigen vergoeding per token toevoegt bovenop het providerstarief. Het uiteindelijke bedrag voor tokenverbruik moet daarom gebaseerd zijn op de vermelde prijzen van $2,00 voor invoer en $6,00 voor uitvoer per 1.000.000 tokens. Dat betekent niet noodzakelijkerwijs dat de uiteindelijke factuur geen andere kosten bevat; belastingen of kosten op accountniveau kunnen van toepassing zijn afhankelijk van jouw regeling, maar dergelijke kosten zijn in deze feiten niet gedocumenteerd. Het betekent ook niet dat het model gratis te gebruiken is, omdat het tarief per token nog steeds van toepassing is. Bij het vergelijken van providers moet de prijs die OrcaRouter voor dit model toont, dezelfde eenheden vertegenwoordigen als deze aanbieding. Als een andere gateway een andere prijs vermeldt, is het verschil een kwestie van factureringsstructuur, niet een wijziging in het contextvenster van het model.
Kostenbeheer zou moeten beginnen met de lengte van de prompt. Aangezien invoer $2.00 per 1,000,000 tokens kost, verhoogt elke extra token de invoerprijs, en elke afbeelding of video die in een verzoek wordt verzonden, wordt omgezet in tokens op basis van regels die niet in deze vermelding worden verstrekt. Het inkorten van irrelevant bronmateriaal kan de kosten verlagen. De uitvoer kost drie keer de eenheidsprijs van de invoer, dus het beperken van de gevraagde uitvoerlengte beheerst ook de kosten. Een model met een uitvoerlimiet van 131,072 tokens kan reacties genereren die geld kosten; bij $6.00 per 1,000,000 tokens zouden 131,072 uitvoertokens alleen al aan uitvoertokens ongeveer $0.79 kosten. Het genereren van zoveel tokens is niet automatisch, omdat de prompt de omvang van de reactie bepaalt. Er is geen cacheprijs gepubliceerd voor dit model, dus ga er niet vanuit dat herhaalde context korting krijgt. Het ontbreken van cache- of batchprijzen in de feiten is geen bewijs dat dergelijke opties niet bestaan; het betekent simpelweg dat ze geen deel uitmaken van deze vermelding.
Qwen3.8 Max (0902) wordt blootgesteld via de OpenAI-compatibele API van OrcaRouter. Stel de client-basis-URL in op https://api.orcarouter.ai/v1 en gebruik de exacte model-ID qwen/qwen3.8-max-0902. Met een OpenAI-compatibele SDK is de verzoekstructuur in feite hetzelfde als bij elke chat-completions-aanroep: geef een API-sleutel voor OrcaRouter, de bovenstaande basis-URL en de model-ID in de body door. Gebruik geen generieke naam zoals Qwen3.8 Max of qwen3.8; de vermelding vereist qwen/qwen3.8-max-0902. Dezelfde model-ID moet worden gebruikt in directe HTTP-verzoeken aan de basis-URL, waarbij het pad en de payload de OpenAI-compatibele overeenkomst volgen die door OrcaRouter wordt blootgesteld. Omdat het OpenAI-compatibel is, kan bestaande code die is geschreven voor OpenAI-chat-completions doorgaans worden gemigreerd door de parameters base_url en model te wijzigen, maar de authenticatiegegevens moeten overeenkomen met de vereisten van OrcaRouter.
Voor een OpenAI-compatibele chatcompletie worden parameters zoals model, messages en outputtokenlimiet op dezelfde manier behandeld als bij andere compatibele modellen. De feiten geven een maximale output van 131,072 tokens, dus als je een outputlimiet instelt, mag deze niet hoger zijn dan 131,072; de standaardoutputlimiet wordt niet vermeld in de feiten. Temperatuur, top-p, stop en andere samplingparameters zijn niet gedocumenteerd in de meegeleverde modelfeiten, dus volg de API-documentatie van OrcaRouter en de standaard OpenAI-parametersemantiek. Gebruik voor beeld- en video-invoer de multimodale inhoudsindeling die door de API van OrcaRouter wordt verwacht; de feiten bevatten geen voorbeeld. Als de API een fout retourneert over niet-ondersteunde parameternamen, controleer dan of je SDK verouderde parameters verzendt. Het contextvenster is 1,000,000 tokens, dus de prompt moet alle invoertokens, inclusief beeld- en videotokens, onder die limiet houden. Reacties tellen afzonderlijk mee voor het maximum van 131,072 tokens.
Omdat OrcaRouter een OpenAI-compatibele API aanbiedt op https://api.orcarouter.ai/v1, is migratie voornamelijk een configuratiewijziging. Vervang de basis-URL door https://api.orcarouter.ai/v1, vervang het API-sleutelveld door een OrcaRouter-sleutel en stel het model in op qwen/qwen3.8-max-0902. Als uw code een OpenAI-compatibele clientbibliotheek gebruikt, werk dan de base_url en api_key van de client bij en laat de meeste berichtstructuren intact, ervan uitgaande dat het multimodale formaat overeenkomt met dit model. De feiten zeggen niet of dit model elke OpenAI-specifieke parameter ondersteunt; controleer daarom vóór de migratie de parameters die uw applicatie verzendt. Aangezien de contextlimiet 1,000,000 bedraagt en de maximale uitvoer 131,072, moet u de truncatielogica voor aanvragen aanpassen aan deze limieten. Bestaande code waarin een andere maximale contextlengte is vastgelegd, moet mogelijk worden bijgewerkt. Bevestig ten slotte dat de verwachtingen van uw applicatie op het gebied van dataverwerking in overeenstemming zijn met de voorwaarden van OrcaRouter, omdat de feiten over het model zelf niet ingaan op dataretentie.
Het belangrijkste vergelijkingscriterium is het inputcontract. Qwen3.8 Max (0902) accepteert tekst, afbeeldingen en video, dus een tekst-only alternatief zou die modaliteiten elimineren. Als je daadwerkelijke workload alleen tekst bevat, is een tekst-only model met een voldoende grote context waarschijnlijk een directere match en kan het andere prijzen hebben. De modelfeiten bevatten geen nauwkeurigheids- of snelheidsvergelijkingen met andere modellen, dus je kunt niet kiezen op basis van publieke kwaliteitsscores. Je kunt structurele kenmerken vergelijken: een tekst-only alternatief kan een kleinere context, een kortere outputlimiet of een lagere inputprijs hebben. OrcaRouter factureert dit model op $2,00 input en $6,00 output per 1.000.000 tokens. Het feit dat het beeld- en video-input ondersteunt, is alleen nuttig als die inputs ook daadwerkelijk worden gebruikt. Als die inputs niet worden gebruikt, betaal je mogelijk voor multimodale capaciteit die irrelevant is voor de taak.
Kies Qwen3.8 Max (0902) wanneer het taakprofiel overeenkomt met de vermelde kenmerken. Ten eerste heb je een context van 1.000.000 tokens nodig omdat het bronmateriaal niet kan worden ingekort om in een kleiner venster te passen. Ten tweede heb je afbeelding- en video-invoer in dezelfde prompt nodig, of je verwacht die modaliteiten in toekomstige verzoeken. Ten derde wil je een uitvoermaximum van maximaal 131.072 tokens. Als je werklast geen van deze vereisten heeft, blijven veel voordelen van deze vermelding onbenut. Kies het niet omdat de naam Max sterk klinkt; de vermelding bevat geen benchmarkbewijs. Aangezien OrcaRouter modellen beschikbaar stelt via dezelfde OpenAI-compatibele API, is het wisselen van model-ID's eenvoudig, zodat je dit model op je eigen taak tegen een andere kandidaat kunt testen. Onthoud alleen dat de prijzen voor invoer en uitvoer verschillen en dat voor dit model geen cacheprijzen zijn gespecificeerd.
Bij het vergelijken van kosten moet u eerst normaliseren naar dezelfde tokenbasis. Dit model gebruikt $2,00 per 1.000.000 invoertokens en $6,00 per 1.000.000 uitvoertokens; deze prijzen worden zonder opslag rechtstreeks van de aanbieder doorberekend. Een concurrerend model met een lagere prijs per invoertoken kan voor een verzoek met volledige context feitelijk goedkoper zijn, maar ook het contextvenster en de maximale uitvoer moeten worden meegenomen. Een verzoek van 1.000.000 tokens kan bijvoorbeeld in één aanroep gebruikmaken van de volledige context van dit model; een model met een context van 200.000 tokens zou meerdere aanroepen vereisen, en de extra uitvoer- of samenvattingsdoorgangen kunnen de totale prijs veranderen. De aangeleverde informatie bevat geen objectieve nauwkeurigheids- of latentiewaarden, dus elke vergelijking van de kosten per correct antwoord moet voortkomen uit uw eigen tests. Controleer ook of een concurrerend model afzonderlijke kosten in rekening brengt voor beeld- of videotokens, aangezien die hier niet worden beschreven. Voer bij twijfel een representatieve workload uit op OrcaRouter en vergelijk de gemeten tokenconsumptie en antwoordkwaliteit in plaats van u uitsluitend te baseren op catalogusprijzen.
OpenAI-compatibel — behoud je huidige SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Invoer / 1M tokens | $2.00 |
| Uitvoer / 1M tokens | $6.00 |
| Cache lezen / 1M | $0.250 |
| Cache schrijven / 1M | $2.50 |
| Valuta | USD |
Schatting op basis van catalogusprijs
Alleen een schatting — het werkelijke aantal tokens hangt af van de tokenizer van de aanbieder.
Waar ontwikkelaars het deze week over hebben
GET /api/public/models/qwen/qwen3.8-max-0902Openen @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902