Hero-titelkort för Qwen3.8 Max Prime, Alibabas serveringsnivå med 1.5–2x genomströmning för flaggskeppet Qwen3.8-Max, med specchips som visar samma 2.4T totalt och ~95B aktiva, Prime till $3.301/$9.902, standard till $1.65/$4.951.
Guides & Insights

Qwen3.8 Max Prime: Alibaba lägger ett andra priskort bredvid sitt flaggskepp

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Den 22 september 2026, på Yunqi-konferensen i Hangzhou, tillkännagav Alibabas MaaS-affärsområde en serving-nivå som det kallar Prime-läge — 优速模式 — och satte ett nytt modell-ID på prislistan för den: qwen3.8-max-prime. Det ID:t är inte en ny modell. Det är Qwen3.8-Max, det sparse mixture-of-experts-flaggskeppet med 2,4 biljoner parametrar som blev allmänt tillgängligt den 3 augusti 2026, levererat via en snabbare kanal. Qwen3.8 Max Prime har samma vikter, samma kontextfönster, samma verktygsuppsättning och samma användningsgränser som basmodellen. Det som skiljer är genomströmning och pris, och priset är ungefär dubbelt så högt.

Det här är andra gången på sju veckor som Alibaba har ändrat hur Qwen3.8-Max säljs utan att ändra vad det är. Den 2 september släppte företaget en post-tränad uppdatering med beteckningen Qwen3.8-Max-0902, inriktad på kodning och agentiskt arbete, endast via API. Den 22 september lades snabbnivån till. Ingen av dem var en lansering, och att tolka någon av dem som en sådan kommer att kosta dig pengar.

Scoreboard infographic for Qwen3.8 Max Prime: underlying model Qwen3.8-Max GA August 3 2026, 2.4T total and ~95B active parameters, throughput 1.5-2x standard, Prime price $3.301/$9.902, standard price $1.65/$4.951, no independent Prime score yet.

Vad Prime-läget faktiskt är

Alibabas egen dokumentation beskriver Prime-läget som en kanal för "scenarier som är känsliga för utdatahastighet" — AI-kodningsassistenter, flerstegsresonemang hos agenter, realtidssamtal — och anger fördelen rakt ut: TPS höjs till 1,5 till 2 gånger jämfört med standard-API:et. Det finns ingen ny parameter att ställa in. Du ändrar modellvärdet till Prime-ID:t och du är i snabbfilen.

Dokumentationen är lika tydlig med vad som inte förändras: "Modellstödda funktioner och användningsbegränsningar är desamma som för originalmodellen." Så det finns ingen större kontext, inget bättre resonemangsläge, ingen extra verktygsyta. Det är samma serving-stack med mer utrymme bakom sig.

The endpoint shape is worth noting because it tells you who this is for. Prime requests go to a workspace-scoped Beijing address of the form https://{workspace_id}.cn-beijing.maas.aliyuncs.com/compatible-mode/v1, on the OpenAI-compatible path. This is a production traffic decision, not an experiment.

Prislistan, läs noggrant

Aliba​bas internationella prissättningssida listar de två ID:na sida vid sida, vilket gör jämförelsen ovanligt tydlig. Per miljon tokens:

• Indata — qwen3.8-max-prime $3,301 vs qwen3.8-max $1,65

• Utdata — qwen3.8-max-prime $9.902 vs qwen3.8-max $4.951

• Cache-träff — qwen3.8-max-prime $0.413 jämfört med ett cache-läsningspris för standard-ID:t som samma sida anger som en rabattrad

• Förhållande — 2,0× på både indata och utdata, inte en avrundad uppskattning utan den bokstavliga aritmetiken i de publicerade siffrorna

På prislistan för Kina gäller samma 2× i yuan: ¥24 för indata och ¥72 för utdata per miljon för Prime ID, mot ¥12 och ¥36 för standardversionen, med cacheträffar på ¥3.

Den vida citerade lanseringssiffran för Qwen3.8-Max är 2 USD för input och 6 USD för output per miljon. Det är rubriken som bevakningen i augusti körde med, och det är inte siffran på den internationella prislistan i dag. Om du modellerar utgifter bör du använda prislistan för din region i stället för lanseringsrubriken, och kontrollera den igen innan du binder dig — Aliba​ba har reviderat den här sidan två gånger sedan 2 september.

Screenshot of Alibaba Cloud's international Model Studio pricing page listing the qwen3.8-max-prime and qwen3.8-max model IDs side by side, with Prime at $3.301 per million input tokens and $9.902 per million output tokens against $1.65 and $4.951 for the standard ID.

Strypningsregeln är den verkliga funktionen

Raden som de flesta bara skummar förbi är den som spelar störst roll för produktion. Alibabas Prime-dokumentation anger att när din användning når hastighetsgränsen, kommer du, om plattformen fortfarande har lediga resurser, inte att begränsas, så den genomströmning du faktiskt har tillgång till kommer inte att understiga den angivna gränsen.

Det är ett mjukt tak med ett hårt golv, vilket är en annan form än en vanlig nivågräns. Det betyder att siffran 1,5–2× är ett löfte om golvet, inte ett tak uppåt: vid konkurrens får du gränsen, och vid ledig kapacitet kan du få mer. För en agentloop som skickar dussintals sekventiella anrop är den asymmetrin värd mer än den råa TPS-multiplikatorn, eftersom det är svanslatensen på det långsammaste anropet som avgör om ditt arbetsflöde blir klart.

Standardmodellens dynamiska TPM-gränser är nivåindelade efter månatliga Model Studio-utgifter – samma dokumentationsfamilj visar bas-ID:t qwen3.8-max vid 5 000 000, 10 000 000 och 20 000 000 TPM över nivåerna, uppdaterat månadsvis. Prime tar inte bort den strukturen; det förändrar hur den slår.

Screenshot of the Artificial Analysis model page for Qwen3.8-Max on the 0902 build, showing an Intelligence Index of 45 and a measured cost per task of $5.41 on the standard ID.

Vad ingen har mätt ännu

Här är det ärliga gapet. Siffran 1,5–2× är leverantörsuppgiven. Det finns ingen oberoende genomströmningsmätning i Prime-läge som vi kan hitta, och det spelar roll eftersom standardbyggets egna oberoende siffror inte är smickrande när det gäller hastighet.

Artificial Analysis, som mäter modeller i sitt eget testramverk, ger för närvarande Qwen3.8-Max i 0902-bygget ett Intelligence Index på 45, med GPQA Diamond på 92,8 %, Terminal-Bench Hard på 38,9 % och Humanity's Last Exam på 43,1 % — och anger den uppmätta kostnaden per uppgift till $5.41. Det är oberoende siffror för standard-SKU:n, insamlade 2026-09-24. De är också en påminnelse om att indexet har reviderats sedan bevakningen av lanseringen i augusti, så ställ inte ett äldre indexvärde bredvid ett aktuellt och kalla det en trend.

Det som AA inte har är en Prime-rad. Tills någon mäter det är hastighetspåståendet enbart Alibabas, och rätt förhållningssätt är att testa det på din egen arbetsbelastning i stället för att anta att det är toppen av sortimentet.

Var detta lämnar routingbeslutet

Prime är en nivå som Aliba​ba säljer via sitt eget API, och det är den enda platsen att få den. Vi hostar inte qwen3.8-max-prime här. Det OrcaRouter routar är standard-Qwen3.8-Max och dess daterade pin Qwen3.8-Max-0902, båda på samma nyckel som resten av Qwen3.8-familjen — Qwen3.8, Qwen3.8-Flash, Qwen3.8-27B — tillsammans med över 200 andra modeller, med leverantörens listpris vidarefört med 0 % påslag. Den sista delen är anledningen till att uppdateringen den 2 september och eventuella framtida ändringar av Max-priset slår igenom hos oss samma dag som de slår igenom hos Aliba​ba.

Den praktiska uppdelningen ser ut så här. Kör din standardtrafik på standard-ID:t via en router, där failover skyddar dig om en enskild leverantörsväg försämras. Flytta de specifika anropen där wall-clock-latensen är själva produkten – den interaktiva kompletteringen, det snäva agentsteget – till Prime, och prissätta det beslutet mot 2× i stället för mot 1,5×.

Vem bör byta, och vem bör vänta

Byt om dina användare väntar på tokens: en autokomplettering, en chattvända, en kodredigeringsloop där en människa tittar på. I den övre delen av hastighetsintervallet är Prime kostnadsneutralt per sekund av borttagen latens — du betalar exakt dubbelt för exakt halva tiden. I den nedre delen av intervallet betalar du 2× för 1,5×, vilket är en premie på 33 % per sparad sekund. Om din arbetsbelastning är ett batchjobb som körs över natten, köper den premien dig inget du behövde.

Vänta om din kostnadsmodell bygger på lanseringsrubriken $2/$6, eller om dina förfrågningar är input-tunga. Leverantörens hastighetspåstående gäller TPS – utdatatoken per sekund – och prefill är ett annat steg i pipelinen. En förfrågan med lång kontext betalar dubbelt för indatatoken oavsett om utdatan anländer snabbare eller inte. Mät det fallet innan du migrerar det.

Och kolla datumet på din prislista. Qwen3.8-Max har funnits på marknaden sedan 3 augusti, uppdaterats en gång och paketerats om en gång, och är fortfarande sju veckor gammal. Nivån är nyheten; modellen är det inte.

Jämförda i den här artikeln1

Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen