Ögonblicksbild daterad 2 september 2026 av Qwen3.8 Max, Alibabas flaggskeppsmodell för multimodalt resonemang: text + bild + video in, text ut, 1M-tokens kontext. Samma funktioner och prissättning som basmodellen; fäst den för reproducerbart beteende.
Qwen3.8 Max (0902) är en modellpost på OrcaRouter från leverantören qwen, publicerad med modell-ID:t qwen/qwen3.8-max-0902. Notationen 0902 visas i listningen, men de angivna fakta förklarar inte om…
Modellen stöder ett kontextfönster på 1 000 000 tokens. Detta är den totala mängden indata som modellen kan beakta i en begäran, inklusive text-, bild- och videoinnehåll i prompten. Ingen ytterligare gräns anges i faktauppgifterna, så praktiska begränsningar beror på hur OrcaRouter och leverantören tillämpar tokenisering och tidsgränser för förfrågningar. För lång text möjliggör 1 000 000 tokens att många omfattande dokument kan inkluderas i en enda prompt, vilket minskar behovet av att dela upp eller sammanfatta innan modellen anropas. För video anger faktauppgifterna inte hur många tokens som förbrukas per sekund, per bildruta eller per videofil, så du bör uppskatta från metadata eller testanrop. Det är också viktigt att komma ihåg att kontextfönstrets storlek inte säger hur exakt modellen är på en prompt med 1 000 000 tokens; inga riktmärkesdata tillhandahålls. Om din applikation behöver exakt långkontextkvalitet, utvärdera på ett urval av dina egna dokument innan du produktionssätter.
Med text, bild och video som accepterade indata kan modellen ombes att resonera över källmaterial som kombinerar dessa typer i samma förfrågan. Exempel inkluderar att läsa instruktioner i text, granska en bild och hänvisa till en video när ett svar produceras. Leverantörens faktablad listar inte uppgiftsspecifika förmågor som OCR, objektdetektering eller temporal videoresonemang, så sådana beteenden bör inte antas. Vad som kan förväntas av modellen beror huvudsakligen på dess tränade förmågor, som inte dokumenteras i de angivna fakta. Den säkra utformningen är att använda den för uppgifter som kräver textutdata från en prompt med blandad modalitet och som kan tolerera kostnaden för att lagra bilder och video som indatatokens. Om en arbetsbelastning är textbaserad kan en annan modell utan bild- och videoindata vara enklare. Om en uppgift kräver exakta videooperationer på tidsstampsnivå ger modellkortet inga bevis för huruvida sådant beteende är tillförlitligt.
Att välja en billigare modell är vettigt när uppgiften inte kräver de funktioner som definierar detta erbjudande. En kort textfråga behöver inte en kontext på 1,000,000 token eller ett utdatatak på 131,072 token. Ett arbetsflöde som endast hanterar text behöver inte bild- eller videoinmatning. OrcaRouter prissätter denna modell till $2.00 per 1,000,000 inmatningstoken och $6.00 per 1,000,000 utmatningstoken. Om ett billigare alternativ har lägre priser per token och tillräckligt stöd för kontext och modaliteter, kommer det att minska kostnaden. Det finns inga kvalitets- eller hastighetsmätningar i de tillhandahållna fakta, så att välja denna modell framför andra modeller kan inte motiveras av uppmätt noggrannhet; det bör motiveras av explicita produktkrav: stor kontext, blandad text/bild/video-inmatning eller lång utmatning i en enda generering. Eftersom inmatningspriset gäller för varje token i kontexten, kan anrop med mycket stor kontext kosta mer än mindre anrop även när användarens fråga är kort, så undvik att fylla ut prompts med onödig text.
De tillhandahållna modellfakta för Qwen3.8 Max (0902) innehåller inte benchmarkresultat, utvärderingsset eller noggrannhetssiffror. Därför skulle alla påståenden om modellens kvalitet vara spekulation, och OrcaRouter publicerar inte härledda poäng. Om du behöver en siffra för att jämföra kandidater bör du köra egna tester på representativa indata, inklusive de bild- och videofall som du räknar med att skicka. Ett riktmärke som ett offentligt kunskapstest skulle inte tala om för dig hur väl modellen hanterar en specifik videoprompt på 1 000 000 tokens. Tänk på att ett modellnamn som Max är en etikett, inte ett bevis på kvalitet. De mätbara sakerna i den här listningen är kontextfönstret, maximal utdatalängd, indatamodaliteter och pris. Dessa attribut påverkar om en arbetsbelastning passar, men de beskriver inte noggrannhet, resonemangsdjup, instruktionsföljsamhet eller säkerhetsbeteende. Behandla förmågan inom dessa områden som overifierad om du inte genomför en utvärdering.
Modellfakta anger inte hastigheter i tokens per sekund, tider för första token, tidsgränser för förfrågningar eller några andra prestandamätningar. OrcaRouter anger ingen latenssiffra för denna leverantörsmodell. Hastigheten beror på leverantörens serveringsinfrastruktur, storleken på indata och mängden utdata som begärs. En indata på 1 000 000 tokens och en utdata på 131 072 tokens kommer sannolikt att ta längre tid än en kort förfrågan, men listningen ger inget exakt samband. Videoindata kan också förvärra latensen eftersom den måste bearbetas till tokens innan modellen kan hantera den; fakta kvantifierar inte det steget. Granskare bör inte anta att lågt pris per token innebär snabb avkodning. Det enda hastighetsrelaterade beslut som fakta stöder är att testa representativa förfrågningsstorlekar under din förväntade belastning. Dra inte slutsatser om realtidslämplighet utifrån kontextfönstrets storlek eller modellnamnet.
Angivna styrkor är strukturella. Modellen har ett kontextfönster på 1 000 000 tokens, en hög maximal utdatalängd på 131 072 tokens och accepterar text-, bild- och videoinmatning. Dessa är användbara för applikationer som behöver ett enda modellanrop för att observera ett stort eller blandat material innan de skriver ett långt svar. Begränsningar är också lättare att ange utifrån fakta än styrkor. Det finns inga publicerade kvalitetsriktmärken, så noggrannhet, resonemang och säkerhet är odokumenterade. Det finns ingen separat förteckning över träningsdata, versionsinformation eller uppdateringsmetodik bakom etiketten 0902. Bild- och videoinmatning garanterar inte exakt visuell eller tidsmässig förståelse. Kontext- och utdatagränserna är maxvärden, inte rekommenderad användning. Mycket stora utdata kan bli kostsamma: 6,00 USD per 1 000 000 utdatatokens. En förfrågan som fyller kontexten på 1 000 000 tokens skulle förbruka 2,00 USD i indatatokens innan någon utdata genereras, vilket är en betydande driftskostnad.
De angivna enhetspriserna är 2,00 USD per 1 000 000 inmatningstokens och 6,00 USD per 1 000 000 utmatningstokens. OrcaRouter debiterar modellen till leverantörens taxa utan påslag, så det angivna priset är leverantörens pris som förs vidare. Inmatningstokens inkluderar text-, bild- och videotokens som skickas i prompten. Utmatningstokens är genererade svartokens. Vid dessa priser kostar 1 000 000 inmatningstokens 2,00 USD; 1 000 000 utmatningstokens kostar 6,00 USD. En mindre begäran kostar proportionellt mindre: 100 000 inmatningstokens skulle kosta 0,20 USD och 100 000 utmatningstokens 0,60 USD, förutsatt att dessa mängder mäts av leverantören. Modellkortet innehåller inte separata priser för cachad inmatning, batchförfrågningar eller interaktiva nivåer, så inga sådana priser ska antas. Det exakta antalet fakturerade tokens bör kontrolleras mot OrcaRouters användningssvar eller loggar för varje anrop.
När OrcaRouter säger att en modell faktureras till leverantörens pris utan påslag, innebär det att OrcaRouter inte lägger till någon egen avgift per token utöver leverantörens pris för denna listning. Slutbeloppet för tokenanvändning bör därför baseras på de angivna priserna på 2,00 USD för inmatning och 6,00 USD för utmatning per 1 000 000 tokens. Det innebär inte nödvändigtvis att den slutliga fakturan saknar andra avgifter; skatter eller avgifter på kontonivå kan tillkomma beroende på ditt avtal, men inga sådana avgifter är dokumenterade i dessa uppgifter. Det innebär inte heller att modellen är gratis att driva, eftersom priset per token fortfarande gäller. Vid jämförelse av leverantörer bör priset som OrcaRouter visar för denna modell representera samma enheter som i denna listning. Om en annan gateway anger ett annat pris, är skillnaden en fråga om faktureringsstruktur, inte en ändring av modellens kontextfönster.
Kostnadshantering bör börja med promptlängd. Eftersom inmatning kostar 2,00 USD per 1 000 000 tokens, ökar varje extra token inmatningsavgiften, och varje bild eller video som skickas i en begäran omvandlas till tokens med regler som inte anges i denna lista. Att trimma bort irrelevant källmaterial kan minska kostnaden. Utmatning kostar tre gånger så mycket som inmatningens enhetspris, så att begränsa den begärda utmatningslängden kontrollerar också kostnaden. En modell med en utmatningsgräns på 131 072 tokens kan generera svar som kostar pengar; vid 6,00 USD per 1 000 000 tokens skulle 131 072 utmatningstokens kosta cirka 0,79 USD enbart i utmatningstokens. Att generera så många tokens är inte automatiskt, eftersom prompten styr svarstorleken. Det finns inget publicerat cachepris för denna modell, så anta inte att upprepad kontext får rabatt. Avsaknaden av cache- eller batchpriser i uppgifterna är inte ett bevis för att sådana alternativ inte finns; det betyder helt enkelt att de inte ingår i denna lista.
Qwen3.8 Max (0902) exponeras via OrcaRouters OpenAI-kompatibla API. Ställ in klientens bas-URL till https://api.orcarouter.ai/v1 och använd det exakta modell-ID:t qwen/qwen3.8-max-0902. Med en OpenAI-kompatibel SDK är förfrågningsstrukturen i princip densamma som för alla chat-completions-anrop: skicka en API-nyckel för OrcaRouter, bas-URL:en ovan och modell-ID:t i förfrågans brödtext. Använd inte ett generiskt namn som Qwen3.8 Max eller qwen3.8; listningen kräver qwen/qwen3.8-max-0902. Samma modell-ID ska användas i direkta HTTP-förfrågningar till bas-URL:en, där sökvägen och nyttolasten följer det OpenAI-kompatibla kontrakt som exponeras av OrcaRouter. Eftersom det är OpenAI-kompatibelt kan befintlig kod skriven för OpenAI chat completions vanligtvis migreras genom att ändra parametrarna base_url och model, även om autentiseringsdetaljerna måste matcha OrcaRouters krav.
För en OpenAI-kompatibel chattkomplettering hanteras parametrar som model, messages och gräns för utdatatoken på samma sätt som för andra kompatibla modeller. Fakta anger en maximal utdatalängd på 131 072 token, så om du anger en utdatagräns bör den inte vara högre än 131 072; standardgränsen för utdata anges inte i fakta. Temperatur, top-p, stop och andra samplingsparametrar är inte dokumenterade i de medföljande modellfakta, så följ OrcaRouters API-dokumentation och standard OpenAI-parametersemantik. För bild- och videoinmatning, använd det multimodala innehållsformat som förväntas av OrcaRouters API; fakta tillhandahåller inget exempel. Om API:t returnerar ett fel om parameternamn som inte stöds, kontrollera om din SDK skickar äldre parametrar. Kontextfönstret är 1 000 000 token, så prompten måste hålla alla inmatningstoken, inklusive bild- och videotoken, under den gränsen. Svar räknas separat mot maxvärdet på 131 072 token.
Eftersom OrcaRouter erbjuder ett OpenAI-kompatibelt API på https://api.orcarouter.ai/v1, är migreringen till största delen en konfigurationsändring. Ersätt bas-URL:en med https://api.orcarouter.ai/v1, ersätt API-nyckelfältet med en OrcaRouter-nyckel och ställ in modellen på qwen/qwen3.8-max-0902. Om din kod använder ett OpenAI-kompatibelt klientbibliotek, uppdatera klientens base_url och api_key och lämna de flesta meddelandestrukturerna intakta, under förutsättning att det multimodala formatet matchar denna modell. Fakta anger inte huruvida denna modell stödjer alla OpenAI-specifika parametrar, så granska parametrarna som din applikation skickar innan du migrerar. Eftersom kontextgränsen är 1 000 000 och den maximala utdatan är 131 072, justera även trunkeringslogiken för begäranden till dessa gränser. Eventuell befintlig kod som hårdkodat en annan maximal kontextlängd kan behöva uppdateras. Slutligen, bekräfta att din applikations förväntningar på datahantering överensstämmer med OrcaRouters villkor, eftersom modellfakta i sig inte diskuterar datalagring.
Den huvudsakliga jämförelsegrunden är indatakontraktet. Qwen3.8 Max (0902) accepterar text, bild och video, så ett text-only-alternativ skulle eliminera dessa modaliteter. Om din faktiska arbetsbelastning endast innehåller text, är en text-only-modell med tillräckligt stor kontext sannolikt en mer direkt passform och kan ha annan prissättning. Modellfakta inkluderar inte noggrannhets- eller hastighetsjämförelser mot någon annan modell, så du kan inte välja baserat på offentliga kvalitetspoäng. Du kan jämföra strukturella attribut: ett text-only-alternativ kan ha en mindre kontext, en kortare utdatagräns eller ett lägre indatapris. OrcaRouter fakturerar denna modell med $2.00 för indata och $6.00 för utdata per 1,000,000 tokens. Det faktum att den har bild- och videoindata är användbart endast om dessa indata används. Om dessa indata inte används kan du betala för multimodal kapacitet som är irrelevant för uppgiften.
Välj Qwen3.8 Max (0902) när uppgiftsprofilen matchar de listade egenskaperna. För det första behöver du en kontext på 1 000 000 token, eftersom källmaterialet inte kan förkortas för att passa ett mindre fönster. För det andra behöver du bild- och videoinmatning i samma prompt, eller så förväntar du dig dessa modaliteter i framtida förfrågningar. För det tredje vill du ha ett utdatamaximum på upp till 131 072 token. Om din arbetsbelastning inte har något av dessa krav, förblir många av fördelarna med denna listning outnyttjade. Välj den inte för att namnet Max verkar starkt; listningen innehåller inga belägg från benchmarktester. Eftersom OrcaRouter exponerar modeller genom samma OpenAI-kompatibla API, är det enkelt att byta modell-ID, så du kan testa denna modell mot en annan kandidat på din egen uppgift. Kom bara ihåg att priserna för inmatning och utdata skiljer sig åt, och ingen cacheprissättning är specificerad för denna modell.
When comparing cost, first normalize to the same token basis. This model uses $2.00 per 1,000,000 input tokens and $6.00 per 1,000,000 output tokens, passed through from the provider at zero markup. A competing model at a lower per-token input price may actually be cheaper for a full context request, but context window and maximum output must be considered too. For example, a 1,000,000-token request can use this model's full context in one call; a model with a 200,000-token context would require multiple calls, and the additional output or summarization passes can change total price. The supplied facts do not provide objective accuracy or latency values, so any cost-per-correct-answer comparison must come from your own tests. Also check whether a competing model imposes separate charges for image or video tokens, because those are not described here. When in doubt, run a typical workload on OrcaRouter and compare measured token usage and response quality rather than relying only on list prices.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Inmatning / 1M token | $2.00 |
| Utdata / 1M tokens | $6.00 |
| Cacheläsning / 1M | $0.250 |
| Cache-skrivning / 1M | $2.50 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
Vad utvecklare säger den här veckan
GET /api/public/models/qwen/qwen3.8-max-0902Öppna @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902