Qwen3.7-Max (2026-05-20 snapshot) — Daterad checkpoint av Alibabas flaggskeppsmodell för agent-eran, fastställd för reproducerbara produktionsarbetsbelastningar. Inbyggt 1M token-kontextfönster, med ett utökat tankeläge (och preserve_thinking över omgångar) finjusterat för agentiska uppgifter. Frontlinjenivåresultat inom kodning (SWE-Verified, SWE-Pro, Terminal-Bench), resonemang (GPQA Diamond, HMMT, IMO), verktygsanvändning (BFCL, MCP-Mark, MCP-Atlas) och flerspråkiga riktmärken (WMT24++ över 55 språk). Konstruerad för långsiktig autonom exekvering och konsekvent beteende över agent-ställningar inklusive Claude Code, OpenClaw och Qwen Code. Använd denna fastställda version när du behöver stabilt beteende mellan utgåvor; använd qwen/qwen3.7-max för det rullande aliaset.
Qwen3.7 Max är en stor språkmodell från Alibabas Qwen-serie, specifikt kontrollpunkten som släpptes den 20 maj 2026. Det är en endast-avkodande transformator optimerad för textinmatning och…
Qwen3.7 Max utmärker sig vid textgenerering, resonemang, sammanfattning, frågebesvarande och kodgenerering. Dess stora kontextfönster möjliggör uppgifter som att läsa en hel bok och sedan svara på detaljerade frågor om den, eller att analysera ett komplett kodarkiv för att identifiera buggar. Modellen kan följa komplexa flerstegsinstruktioner som är inbäddade i en systemprompt som sträcker sig över tusentals tokens. Den stöder standardgenereringsparametrar som temperatur, top_p, max_tokens och stoppsekvenser genom det OpenAI-kompatibla API:et. Eftersom den endast är textbaserad kan den inte utföra bildigenkänning, ljudtranskription eller andra multimodala uppgifter. För textuppgifter som kräver mycket lång kontext eller utdata är Qwen3.7 Max ett starkt val.
Modellens bästa användningsområden centreras kring arbetsbelastningar med lång kontext och hög produktion. Exempel inkluderar: att sammanfatta ett 500-sidigt juridiskt kontrakt i en enda genomgång; att generera en 50 000-ord teknisk manual från en kort disposition; att utföra djup faktakontroll över en stor samling forskningsartiklar; och att generera syntetisk data för träning av andra modeller där långa sekvenser krävs. Utvecklare som hanterar kodbaser kan be modellen att refaktorera hela filer eller skriva enhetstester som täcker många funktioner. Modellen är också lämplig för konversationsagenter som behöver behålla kontext över mycket långa dialoger, men notera att utdata är begränsad till 64 000 tokens. För uppgifter med kort kontext kan mindre modeller på OrcaRouter erbjuda bättre latens och kostnadseffektivitet.
Medan Qwen3.7 Max erbjuder extrema kontext- och utdatalängder, är det prissatt högre per token än många mindre modeller. Om dina uppgifter kräver kontextfönster under 32 000 token och utdata under 4 000 token, överväg att använda en billigare modell som Qwen3.5-7B eller andra kompakta LLM:er som finns tillgängliga på OrcaRouter. Dessutom, om du inte behöver resonemangsförmågan hos en stor modell, kan en mindre modell vara tillräcklig. För applikationer där latens är kritisk, ger mindre modeller också snabbare svarstider. Utvärdera alltid din typiska förfrågningsstorlek och komplexitet; att använda en stor modell för triviala uppgifter leder till onödig kostnad. OrcaRouters prissida listar alla tillgängliga modeller för att underlätta jämförelse.
Ja, Qwen3.7 Max stöder strömmande svar via det OpenAI-kompatibla API:et. Du kan ställa in parametern `stream` till `true` för att ta emot tokens inkrementellt, vilket förbättrar användarupplevelsen för långa genereringar. Modellen fungerar också bra med Chat Completions endpoint, som accepterar meddelanden i standardformatet (system, user, assistant roller). Flerturskonversationer stöds inom ramen för kontextfönstrets gräns. Eftersom modellen endast är textbaserad måste alla meddelanden innehålla textinnehåll. Det stora kontextfönstret möjliggör mycket långa chathistoriker, vilket gör den lämplig för utökade interaktiva sessioner. Strömmande rekommenderas för utdata som är längre än några tusen tokens för att undvika timeouts.
Specifika benchmark-poäng för denna exakta kontrollpunkt (2026-05-20) anges inte i denna katalogpost. Qwen-serien har historiskt presterat konkurrenskraftigt på benchmark inom resonemang, kodning och språkförståelse. Vi rekommenderar att du utvärderar modellen på dina egna representativa uppgifter för att bedöma prestandan. OrcaRouter tillhandahåller en lekplats där du kan testa modellen med dina uppmaningar utan att ådra dig avgifter utöver tokenanvändning. Modellens stora kontextfönster kan förbättra prestandan på uppgifter som kräver långdistansberoenden, men utan publicerade siffror bör användare utföra sin egen validering. Benchmark som MMLU, HumanEval eller GSM8K används vanligtvis för jämförelse men citeras inte här.
Latens beror på det totala antalet in- och utmatningstokens, samt serverbelastningen vid tidpunkten för begäran. Eftersom Qwen3.7 Max hanterar upp till 1 000 000 tokens i kontext, kan förfrågningar med mycket stora indata ta längre tid att behandla på grund av attention-beräkning. Typisk tid-till-första-token för indata av måttlig längd (t.ex. 10 000 tokens) ligger i tiotals sekunder, men exakta siffror är inte offentligt tillgängliga. Strömning kan minska upplevd latens genom att returnera tokens allt eftersom de genereras. För bästa prestanda, håll inmatningsprompter koncisa när det är möjligt. OrcaRouters infrastruktur är optimerad för att minimera överhead; kontakta support om du behöver latensgarantier för produktionsanvändningsfall.
Den främsta styrkan är dess kontextfönster på 1 000 000 token, vilket möjliggör bearbetning av mycket långa dokument i en enda förfrågan. Utmatningsgränsen på 64 000 token är också bland de högsta som finns. Modellen är byggd på Alibabas Qwen-arkitektur, som har visat stark prestanda inom resonemang, kodning och allmänna kunskapsuppgifter. Den noll-påslagsprissättning genom OrcaRouter innebär att du endast betalar leverantörens taxa utan extra avgifter. För arbetsflöden som kräver bibehållen koherens över extremt långa sekvenser—som boknivåanalys eller massiv kodgenerering—är denna modell ett ledande alternativ. Dess textbaserade fokus bidrar till att hålla kostnaderna lägre än multimodala modeller med liknande kontextstorlekar.
Modellen är enbart text; den kan inte bearbeta bilder, ljud eller video. Dess prissättning, även om den är konkurrenskraftig för sin klass, är högre än mindre modeller: $1,25/1M indata och $3,75/1M utdata. För uppgifter med kort sammanhang är billigare modeller mer kostnadseffektiva. Inga multimodala funktioner finns, så applikationer som kräver syn eller tal måste använda andra modeller. Benchmark-poäng anges inte här, så du kan inte lita på tredjepartsrankningar; du måste testa modellen själv. Modellen är en kontrollpunkt från maj 2026; kunskapen kan vara föråldrad för mycket senaste händelser. Slutligen kan det stora kontextfönstret öka latens och beräkningskostnad, särskilt om indata är nära 1M-gränsen.
Priserna är enkla: 1,25 USD per 1 000 000 indatatokens och 3,75 USD per 1 000 000 utdatatokens. Dessa priser är leverantörens egna; OrcaRouter lägger inte på någon marginal. Det finns inga månatliga abonnemangsavgifter eller minimikrav. Du debiteras baserat på faktisk tokenanvändning, mätt enligt modellens tokeniserare. Indatatokens inkluderar systemmeddelandet, användarmeddelanden och eventuell samtalshistorik. Utdatatokens inkluderar endast genererad text. Det stora kontextfönstret innebär att även en enskild begäran kan förbruka betydande mängder tokens. Till exempel kostar en begäran med 500 000 indatatokens och 10 000 utdatatokens (500k * 1,25 USD + 10k * 3,75 USD)/1M = 0,625 USD + 0,0375 USD = 0,6625 USD.
Den huvudsakliga avvägningen är kostnad kontra kapacitet. Medan Qwen3.7 Max erbjuder bästa i klassen kontext- och utmatningslängd, är den dyrare än mindre modeller med kortare fönster. Om dina typiska förfrågningar använder färre än 100 000 kontexttokens och färre än 10 000 utmatningstokens, kan du betala mindre genom att använda en modell som Qwen3.5-14B eller Qwen3-72B om tillgängliga. Men om du behöver undvika att dela upp långa dokument, kan kostnaden för att bearbeta hela dokumentet i ett anrop vara motiverad av ökad noggrannhet och enkelhet. Nollpåslagsprissättningen innebär att du inte betalar extra för API-lagret; du betalar bara leverantörens taxa. Inga cachningsdetaljer anges—kontakta OrcaRouter support för aktuella cachningsalternativ som kan minska kostnaden för upprepade uppmaningar.
För att uppskatta kostnader, beräkna genomsnittligt antal inmatningstokens och utmatningstokens per förfrågan. Använd formeln: kostnad = (input_tokens * 1.25 + output_tokens * 3.75) / 1,000,000. Till exempel, en förfrågan med 200,000 inmatningstokens och 5,000 utmatningstokens kostar (200k * 1.25 + 5k * 3.75)/1M = $0.25 + $0.01875 = $0.26875. För batchbearbetning, multiplicera med antalet förfrågningar. OrcaRouter’s användningsdashboard ger realtidsantal tokens och kostnadsuppdelningar. Eftersom det inte finns någon pålägg, är kostnaden du ser leverantörens kostnad. Du kan ange en budgetgräns i dina API-nyckelinställningar för att undvika oväntade avgifter. För högvolymproduktionsanvändning, överväg att förhandla om en volymrabatt direkt med leverantören (inte via OrcaRouter).
Nej. OrcaRouter tar inga plattformsavgifter, inga påslag, inga månadsavgifter och inga minimiåtaganden. Du betalar endast för de tokens du använder till leverantörens publicerade priser. Det finns inga avgifter för misslyckade förfrågningar eller timeout (även om tokens som förbrukats före en timeout fortfarande kan debiteras). Autentisering sker via API-nyckel, som är gratis att skapa. Du kan börja använda Qwen3.7 Max omedelbart genom att lägga till pengar på ditt OrcaRouter-konto. Bas-URL och modell-ID är stabila; inga dolda kostnader finns. För företagskunder finns anpassade avtal tillgängliga men är inte obligatoriska. Granska alltid den senaste prissidan på OrcaRouters webbplats eftersom priserna kan ändras, även om snabba uppdateringar av katalogen görs.
Använd det OpenAI-kompatibla API:t med bas-URL https://api.orcarouter.ai/v1, modell-ID "qwen/qwen3.7-max-2026-05-20". Autentisering använder en API-nyckel som tillhandahålls i OrcaRouter-instrumentpanelen. Exempel med Python: ```python import openai client = openai.OpenAI(api_key="your_key", base_url="https://api.orcarouter.ai/v1") response = client.chat.completions.create( model="qwen/qwen3.7-max-2026-05-20", messages=[{"role":"user","content":"Explain quantum computing in 50 words."}], max_tokens=100 ) print(response.choices[0].message.content) ``` Se till att du ställer in parametern `max_tokens` till önskad utdatalängd, upp till 64 000.
OrcaRouter API stöder standard OpenAI-chattkompletteringsparametrar: `model`, `messages`, `max_tokens`, `temperature`, `top_p`, `n`, `stop`, `stream`, `presence_penalty`, `frequency_penalty`, `logit_bias` och `user`. `temperature` styr slumpmässigheten (0–2, standard 1). `top_p` är nucleus sampling. `stop` definierar sekvenser som avbryter genereringen. `stream` möjliggör token-för-token-utdata. `max_tokens` kan ställas in upp till 64,000. Den totala prompten + genererade tokens får inte överstiga kontextfönstret på 1,000,000. Om den sammanlagda summan skulle överstiga det, kommer API:et att returnera ett fel. Du kan justera tokenanvändningen genom att trimma meddelandehistorik eller använda kortare prompter.
Migration är enkel eftersom OrcaRouter använder OpenAI-kompatibelt API. Ändra bas-URL:en i din befintliga kod från den tidigare slutpunkten till https://api.orcarouter.ai/v1. Uppdatera modell-ID:t till "qwen/qwen3.7-max-2026-05-20". Ersätt din API-nyckel med en från OrcaRouter. Inga ändringar av begärandeformatet behövs; samma meddelandestruktur, parametrar och strömningslogik fungerar. Om du tidigare använde ett annat modell-ID för samma Qwen3.7 Max-kontrollpunkt, justera därefter. OrcaRouter erbjuder även ett proxyläge för att omdirigera begäranden utan kodändringar; kontakta support för detaljer. Testa med några anrop för att verifiera beteendet innan du växlar produktionstrafik.
Autentisering utförs med en API-nyckel som skickas i HTTP Authorization-huvudet: `Authorization: Bearer YOUR_API_KEY`. Du kan få en API-nyckel från OrcaRouter-instrumentpanelen efter att ha skapat ett konto. Nyckeln måste hållas hemlig och får inte exponeras i klientkod. OrcaRouter stöder hastighetsbegränsningar per nyckel och användningsspårning. Om du behöver högre samtidighet, begär en nyckel med ökade begränsningar. Det finns inget ytterligare autentiseringssteg; nyckeln ensam ger åtkomst. För säkerhet, rotera nycklar regelbundet och använd miljövariabler för att lagra dem. Nycklar är inte bundna till en specifik modell; med samma nyckel kan du komma åt valfri modell som finns på OrcaRouter.
Qwen3.7 Max är den största i Qwen3.7-familjen, med det längsta kontextfönstret (1M tokens) och högsta utdatagränsen (64k). Standard Qwen3.7-modeller har vanligtvis mindre kontextfönster (t.ex. 128k eller 32k) och lägre utdatagränser (ofta 8k eller 16k). Max-varianten är optimerad för uppgifter i extrem skala. Priset är högre än för mindre Qwen-modeller; till exempel kan Qwen3.7-72B kosta mindre per token. Prestandan i resonemang och kodning förväntas vara liknande eller något bättre på grund av den större skalan, även om inga specifika jämförelser ges. För de flesta arbetsbelastningar erbjuder de mindre modellerna bättre kostnadseffektivitet; Qwen3.7 Max bör sparas för uppgifter som verkligen kräver dess massiva kontext och utdata.
Qwen3.7 Max har ett större kontextfönster (1M token) än GPT-4 Turbo (128k) och Claude 3.5 (200k). Dess utmatningsgräns på 64k token överskrider även dessa modeller (vanligtvis 4k-8k). GPT-4 och Claude stöder dock multimodala indata (bilder, dokument), medan Qwen3.7 Max endast hanterar text. Priser: Qwen3.7 Max till $1,25/$3,75 per 1M token är generellt billigare än GPT-4 Turbo ($10/$30) och konkurrenskraftigt med Claude 3.5 Haiku ($0,25/$1,25), även om det har en högre kostnad per token för utmatning. Valet beror på om du behöver multimodala möjligheter eller den extrema kontextlängden. För rena textbaserade långdokumentuppgifter kan Qwen3.7 Max vara mer lämpligt och kostnadseffektivt än GPT-4 eller Claude när man räknar med behovet av att dela upp dessa modeller (chunking).
Välj Qwen3.7 Max när din uppgift kräver bearbetning av mer än 200 000 tokens kontext i en enda passning, eller när du behöver generera utdata längre än 10 000 tokens. Det är också ett bra val om du vill undvika komplexiteten med att dela upp dokument. För uppgifter med mindre kontextbehov erbjuder andra modeller på OrcaRouter—som Qwen3.5-7B, Qwen3-72B eller Llama 3.1-405B—lägre latens och kostnad. Den nollpåslagsprissättningen på OrcaRouter innebär att du kan experimentera med flera modeller utan att oroa dig för plattformsavgifter. Om du behöver multimodala funktioner, överväg Qwen-VL eller GPT-4V-modeller. Benchmarka alltid ditt specifika användningsfall för att hitta den bästa kostnads-prestandabalansen.
Qwen3.7 Max är en proprietär modell som nås via API. Öppen källkodsmodeller som Qwen2.5-72B eller Llama 3.1 kan självhostas, vilket potentiellt minskar kostnaden per token vid hög volym. Självhostning kräver dock GPU-hårdvara, underhåll och skalningsexpertis. Qwen3.7 Max:s 1M kontextfönster är större än de flesta öppen källkodsmodeller (vanligtvis 128k eller mindre) och dess 64k utdata är också över vad många öppna modeller stöder. API-modellen drar också nytta av hanterad infrastruktur, automatiska uppdateringar och ingen initial investering. För team utan omfattande ML Ops ger API-vägen med Qwen3.7 Max omedelbar tillgång till toppmoderna funktioner. För högvolym och förutsägbara arbetsbelastningar kan självhostning av en mindre modell vara billigare, men du förlorar fördelarna med stort kontext.
OpenAI-kompatibel — behåll det SDK du redan använder
https://api.orcarouter.ai/v1https://api.orcarouter.aifrom openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.7-max-2026-05-20",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Inmatning / 1M token | $1.25 |
| Utdata / 1M tokens | $3.75 |
| Cacheläsning / 1M | $0.250 |
| Cache-skrivning / 1M | $1.563 |
| Valuta | USD |
Uppskattning baserad på listpris
Endast en uppskattning — faktiskt antal token beror på leverantörens tokenizer.
GET /api/public/models/qwen/qwen3.7-max-2026-05-20Öppna @misc{orcarouter_qwen3_7_max_2026_05_20,
title = {Qwen3.7 Max (2026-05-20) API},
author = {qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.7-max-2026-05-20}
}qwen. (2026). Qwen3.7 Max (2026-05-20) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.7-max-2026-05-20