
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning vs Qwen3.8-Max: Veckan då öppna vikter togs på allvar
- openaiNYOpenAI: GPT-6.1 Sol2026-09-2952Intelligens
- anthropicNYAnthropic: Claude Sonnet 5.52026-09-2856Intelligens
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1M tokens · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligens
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligens
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligens
- xAIGrok 4.72026-09-2146Intelligens
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1M tokens · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1M tokens · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligens
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligens76Kodning
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1M tokens · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1M tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
Öppna vikter hade precis en vecka. Den 12 augusti 2026, eller däromkring, släppte Alibaba den första öppna Max-klassmodellen från Qwen någonsin — Qwen3.8 Max, en flaggskeppsmodell med 2,4 biljoner parametrar, publicerad som Qwen3.8-2.4T-A95B på Hugging Face och ModelScope. Två dagar senare, den 14 augusti, publicerade NVIDIA NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — en resonerande lärarmodell med 550 miljarder parametrar, varav 55 miljarder aktiva, från Nemotron 3 Ultra-träningspipelinen — även den på Hugging Face. Båda är enorma, nyligen öppnade checkpoints från frontier-labb, och likheterna slutar där. Qwen3.8 Max är öppen så att du själv kan köra en frontier-modell; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning är öppen så att du kan träna med den. Att jämföra dem handlar egentligen om vilket slags team du är — men det faktum att båda landade inom 72 timmar är en signal om vart branschen är på väg.
Vad varje release faktiskt innehåller
Qwen3.8 Max är den som går att driftsätta. Det är en gles mixture-of-experts-modell med totalt 2,4 biljoner parametrar, cirka 95 miljarder aktiva per token över 512 experter, byggd på Qwen3.5-familjens hybridarkitektur. I sin öppna viktform är den textbaserad med ett nativt kontext på 262K-token (utökningsbart förbi 1M), och – anmärkningsvärt – krävs tänkande: modellen genererar resonemang mellan `<think>`-taggar och kan inte stängas av. Den hostade API-versionen som Alibaba lanserade den 3 augusti lägger till bild- och videoinmatning, ett standardkontext på 1M och valfritt tänkande. Licensen för öppna vikter är en anpassad Qwen3.8 Max-licens, tillåtande men med intäktsbaserade villkor för mycket stora kommersiella driftsättningar. Om du har hårdvara med flera noder kan du köra en modell i frontklass på din egen infrastruktur.
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning är den för träningsfasen. Den är en av de över tio domänspecialiserade lärarna från Multi-Teacher On-Policy Distillation (MOPD)-receptet bakom Nemotron 3 Ultra, härledd från den eftertränade Ultra-studenten genom ett extra resonemangsspecialiserat SFT- och förstärkningsinlärningssteg. Dess roll i den pipelinen är att generera långa resonemangsspår för de svåraste matematik-, logik- och abstrakta resonemangsproblemen och att fungera som den domare som bedömer fritextsvar. Den levereras under den kommersiellt vänliga OpenMDW-1.1-licensen med de offentliggjorda efterträningsdata, och den har inga riktmärkesiffror – NVIDIA pekar istället på en noggrannhetsgraf och Ultra-teknikrapporten. Dess kunder är destillationskörningar, inte produktionstrafik.
Qwen3.8 Max, det första öppna flaggskeppet i Max-klass
Alibabas lansering är betydelsefull eftersom Max-klassens Qwen-modeller historiskt sett bara har varit tillgängliga via API. Qwen3.8 Max bryter det mönstret: vikterna är nedladdningsbara, och modellen är genuint i frontlinjen — Artificial Analysis ger den ett Intelligence Index på 58 och ett Agentic Index på 58, vilket innebär att den ligger i nivå med de främsta stängda generalisterna i agentiska sammanhang. De leverantörsrapporterade höjdpunkterna är starka: 93,0 på PaperBench (före GPT-5.6 Sol och Fable 5), 92,6 på GPQA Diamond, 86,1 på OSWorld-Verified. Dess svaga punkter är lika verkliga — 67,7 på SWE-bench Pro och 43,6 på Humanity's Last Exam släpar efter ledarna, och oberoende tester visade att den är dyr per slutförd uppgift, med i genomsnitt 64 steg per uppgift i agentiska körningar. På Alibabas API prissätts den till 2,00 dollar per miljon input-token, 6,00 dollar per miljon output-token och 0,25 dollar per miljon cachade input-token, en sänkning med 20 % jämfört med förhandsvisningspriset.
Läraren: träningsinfrastruktur med ett modellkort
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning konkurrerar inte med några av dessa siffror eftersom det inte har publicerat några. Vad det erbjuder i stället är samma LatentMoE Mamba-2 + Transformer-hybridarkitektur som Ultra-studenten, upp till 1M tokens kontext och en resonemangskontroll – enable_thinking true/false, ett medium_effort-läge och ett fast reasoning_budget-tak – som en destillationspipeline behöver för att lägga ner djup resonemang på svåra exempel och hoppa över det på enkla. Minimihårdvara är 4×B200 (eller 8×H100), servering via vLLM, SGLang eller TensorRT-LLM, och checkpojnten är en nedladdning på 1,12 terabyte. Den är inte driftsatt av någon inferensleverantör, och NVIDIA har inte annonserat NIM-hotell. Detta är ett släpp med endast vikter, riktat till labb som redan kör stora GPU-parker.
Specifikationer, sida vid sida
• Syfte — Lärare: specialist på resonemang under träningstid och domare. Qwen3.8 Max: utplacerbart banbrytande flaggskepp.
• Scale — Lärare: 550B totalt / 55B aktiva, LatentMoE med MTP. Qwen3.8 Max: 2,4T totalt / ~95B aktiva, 512 experter, Qwen3.5 hybrid.
• Kontext — Teacher: upp till 1M token, 256K som standard. Qwen3.8 Max: 262K inbyggd open-weights-kontext, utbyggbar bortom 1M; API-version: 1M som standard.
• Vikter — Lärare: OpenMDW-1.1, släppt 14 aug. 2026. Qwen3.8 Max: Qwen3.8 Max License, släppt ~12 aug. 2026.
• Oberoende bevis — Teacher: inga ännu. Qwen3.8 Max: AA Intelligence Index 58, Agentic Index 58, Coding Index 71.8.
• Tänkande — Lärare: enable_thinking-växling, medium_effort, tak för reasoning_budget. Qwen3.8 Max: obligatoriskt på i öppna vikter, kan inte inaktiveras.
• Pris — Teacher: inget listpris, självhostad capex. Qwen3.8 Max: $2.00 / $6.00 per miljon tokens, $0.25 cachad input.


Bevisasymmetrin är hela historien.
Qwen3.8 Max har testats; {{1}}det har inte läraren{{/1}}. Det beror delvis på ålder — Qwen3.8 Max lanserades den 3 augusti och har haft två veckors leaderboard-körningar, medan läraren släpptes igår — och delvis på avsikt, eftersom lärarens kort aldrig var tänkt att tävla i poäng. Men asymmetrin har en verklig konsekvens för jämförelsen: {{2}}varje konkret siffra på denna sida med en källa tillhör Qwen3.8 Max{{/2}}, och {{3}}varje siffra som kopplas till läraren är en arkitekturspecifikation{{/3}}. Lärarens resonemangskvalitet har inte verifierats av någon utanför NVIDIA, och dess familjenivåsiffror (Ultra-studentens leverantörsrapporterade SWE-Bench Verified 71.9, MMLU-Pro 86.8, LiveCodeBench v6 89.0) beskriver en annan modell. Den som baserar ett beslut på "vilken presterar bättre" måste vänta på oberoende körningar av läraren — vilket är exakt det gap som de närmaste veckorna bör sluta.
Två tankevred, inställda olika.
Den mest intressanta tekniska kontrasten mellan dessa två utgåvor är vad som händer när du ber dem att resonera. Qwen3.8 Max i sin öppna viktform har inget val: tänkande är alltid på, och resonemangsspåret är en del av varje svar. Det är utmärkt för svarskvalitet och transparens men dyrt för massgenerering. Läraren behandlar resonerande som en ratt: enable_thinking växlar det, medium_effort stryper det, och ett reasoning_budget-tak sätter gränsen. För en destillationspipeline är skillnaden avgörande – att generera miljontals resonemangsspår med en modell som alltid tänker mångdubblar din tokenräkning, medan lärarens omkopplare låter dig betala för djup resonerande enbart där ett svårt exempel kräver det. Detta är inte konkurrerande designfilosofier; det är två verktyg optimerade för motsatta ändar av samma problem, och vart och ett är rätt verktyg för sin ände.

Slutsatsen
Om du vill köra en frontmodell på din egen hårdvara — eller anropa en till ett rimligt pris — är Qwen3.8 Max den utgåva som räknas, och den finns på OrcaRouter till Alibabas listpris, förmedlad med 0 % påslag, så prissänkningen som Alibaba tillkännagav vid lanseringen är live hos oss samma dag. Om du vill träna eller destillera en resonemangsmodell — eller granska signalen som formade Nemotron 3 Ultra — är NVIDIA-Nemotron-Labs-Teacher-General-Reasoning den utgåva som räknas, och den är endast självhostad för närvarande. Den större nyheten är att båda landade samma vecka: öppna vikter gick precis från "tillräckligt öppna för att titta på" till "tillräckligt öppna för att bygga på," på två olika punkter i modellens leveranskedja. Team som håller sitt modellager utbytbart bakom ett gränssnitt — självhostad träning på ena sidan, hanterad frontinferens på den andra — är de som är positionerade att använda båda.
Jämförda i den här artikeln2
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
