
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning kontra Qwen3.8-Max: Tydzień, w którym otwarte wagi stały się poważną sprawą
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 114 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 367 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Open weights właśnie miały udany tydzień. W okolicach 12 sierpnia 2026 roku Alibaba wypuściło pierwszy w historii model klasy Max z otwartymi wagami — Qwen3.8 Max, flagowy model o 2,4 biliona parametrów, opublikowany jako Qwen3.8-2.4T-A95B na Hugging Face i ModelScope. Dwa dni później, 14 sierpnia, NVIDIA opublikowała na Hugging Face model NVIDIA-Nemotron-Labs-Teacher-General-Reasoning — nauczyciela rozumowania o 550 miliardach parametrów, z czego 55 miliardów aktywnych, pochodzącego z potoku treningowego Nemotron 3 Ultra. Oba to ogromne, świeżo udostępnione checkpointy z czołowych laboratoriów, a na tym podobieństwa się kończą. Qwen3.8 Max jest otwarty, dzięki czemu możesz samodzielnie uruchomić model z czołówki; NVIDIA-Nemotron-Labs-Teacher-General-Reasoning jest otwarty, abyś mógł na nim trenować. Porównywanie ich to tak naprawdę pytanie, jakim zespołem jesteś — ale fakt, że oba pojawiły się w ciągu 72 godzin, sygnalizuje, w jakim kierunku zmierza branża.
Co faktycznie zawiera każde wydanie
Qwen3.8 Max to model, który można wdrożyć. To rzadki model mieszanki ekspertów z 2,4 biliona łącznych parametrów, około 95 miliardów aktywnych na token w ramach 512 ekspertów, zbudowany na hybrydowej architekturze rodziny Qwen3.5. W wersji z otwartymi wagami jest modelem wyłącznie tekstowym z natywnym kontekstem 262 tys. tokenów (możliwym do rozszerzenia powyżej 1 mln), a — co istotne — myślenie jest wymagane: model generuje treść rozumowania między tagami <think> i nie można go wyłączyć. Hostowana wersja API, którą Alibaba uruchomił 3 sierpnia, dodaje obsługę obrazu i wideo, domyślny kontekst 1 mln oraz opcjonalne myślenie. Licencja na otwarte wagi to autorska licencja Qwen3.8 Max — permisywna, ale z warunkami opartymi na przychodach dla bardzo dużych wdrożeń komercyjnych. Jeśli dysponujesz sprzętem wielowęzłowym, możesz uruchomić model klasy frontier na własnej infrastrukturze.
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning to wersja treningowa. To jeden z ponad dziesięciu nauczycieli wyspecjalizowanych w domenach z receptury Multi-Teacher On-Policy Distillation (MOPD) stojącej za Nemotron 3 Ultra, wywodzący się z potrenowanego ucznia Ultra poprzez dodatkowy etap SFT specjalizowany w rozumowaniu oraz uczenie przez wzmacnianie. Jego rolą w tym potoku jest generowanie długich śladów rozumowania dla najtrudniejszych problemów matematycznych, logicznych i abstrakcyjnego rozumowania oraz pełnienie funkcji sędziego oceniającego odpowiedzi w swobodnej formie. Jest udostępniany na przyjaznej komercyjnie licencji OpenMDW-1.1 wraz z ujawnionymi danymi po treningu i nie posiada żadnych wyników benchmarków — NVIDIA wskazuje natomiast na wykres dokładności oraz raport techniczny Ultra. Jego odbiorcami są przebiegi destylacji, a nie ruch produkcyjny.
Qwen3.8 Max, pierwszy otwarty flagowiec klasy Max
Publikacja Alibaba jest istotna, ponieważ modele Qwen klasy Max były dotąd dostępne wyłącznie przez API. Qwen3.8 Max to zmienia: wagi są do pobrania, a model jest naprawdę z czołówki — Artificial Analysis przyznaje mu Indeks Inteligencji 58 i Indeks Agentowy 58, co stawia go na równi z najlepszymi zamkniętymi modelami ogólnymi w środowiskach agentowych. Najważniejsze wyniki deklarowane przez producenta są solidne: 93,0 na PaperBench (przed GPT-5.6 Sol i Fable 5), 92,6 na GPQA Diamond oraz 86,1 na OSWorld-Verified. Jego słabe strony są równie realne — 67,7 na SWE-bench Pro i 43,6 na Humanity's Last Exam pozostają w tyle za liderami, a niezależne testy wykazały, że jest drogi w przeliczeniu na ukończone zadanie, osiągając średnio 64 kroki na zadanie w trybach agentowych. W API Alibaba ceny wynoszą 2,00 USD za milion tokenów wejściowych, 6,00 USD za milion tokenów wyjściowych oraz 0,25 USD za milion tokenów wejściowych z pamięci podręcznej, co stanowi 20% obniżkę względem cen z fazy zapowiedzi.
Nauczyciel: infrastruktura treningowa z kartą modelu
NVIDIA-Nemotron-Labs-Teacher-General-Reasoning nie konkuruje w żadnej z tych liczb, ponieważ nie opublikował żadnych. Zamiast tego oferuje tę samą hybrydową architekturę LatentMoE Mamba-2 + Transformer co model Ultra, do 1 miliona tokenów kontekstu oraz pokrętło rozumowania — enable_thinking true/false, tryb medium_effort i twardy górny limit reasoning_budget — które pozwala potokowi destylacji poświęcać głębokie rozumowanie trudnym próbkom, a pomijać je na łatwych. Minimalny sprzęt to 4×B200 (lub 8×H100), serwowanie przez vLLM, SGLang lub TensorRT-LLM, a punkt kontrolny to plik do pobrania o rozmiarze 1,12 terabajta. Nie jest wdrożony przez żadnego dostawcę wnioskowania, a NVIDIA nie ogłosiła hostingu NIM. To wydanie zawierające wyłącznie wagi, skierowane do laboratoriów, które już obsługują duże farmy GPU.
Specyfikacje obok siebie
• Cel — Nauczyciel: specjalista ds. rozumowania w czasie treningu i sędzia. Qwen3.8 Max: wdrażalny flagowy model z czołówki.
• Skala — Nauczyciel: 550B łącznie / 55B aktywnych, LatentMoE z MTP. Qwen3.8 Max: 2,4T łącznie / ~95B aktywnych, 512 ekspertów, Qwen3.5 hybrydowy.
• Kontekst — Nauczyciel: do 1M tokenów, 256K domyślnie. Qwen3.8 Max: 262K natywny kontekst z otwartymi wagami, możliwy do rozszerzenia powyżej 1M; wersja API domyślnie 1M.
• Wagi — Nauczyciel: OpenMDW-1.1, wydany 14 sierpnia 2026 r. Qwen3.8 Max: Qwen3.8 Max License, wydana ok. 12 sierpnia 2026 r.
• Niezależne dowody — Nauczyciel: jeszcze brak. Qwen3.8 Max: indeks inteligencji AA 58, indeks agentowy 58, indeks kodowania 71.8.
• Myślenie — Teacher: przełącznik enable_thinking, medium_effort, górny limit reasoning_budget. Qwen3.8 Max: w otwartych wagach wymagany włączony, nie można wyłączyć.
• Cena — Teacher: brak ceny katalogowej, nakłady inwestycyjne self-hosted. Qwen3.8 Max: $2.00 / $6.00 za milion tokenów, $0.25 za wejście z pamięci podręcznej.


Asymetria dowodów to cała historia.
Qwen3.8 Max został przetestowany; nauczyciel nie. To częściowo kwestia wieku — Qwen3.8 Max zadebiutował 3 sierpnia i ma za sobą dwa tygodnie rund rankingowych, podczas gdy nauczyciel trafił na rynek wczoraj — a częściowo zamierzenia, bo karta nauczyciela nigdy nie miała rywalizować wynikami. Ta asymetria ma jednak realne konsekwencje dla porównania: każda konkretna liczba na tej stronie z podanym źródłem należy do Qwen3.8 Max, a każda liczba przypisana nauczycielowi to specyfikacja architektury. Jakość rozumowania nauczyciela nie została zweryfikowana przez nikogo spoza NVIDIA, a jego dane na poziomie całej rodziny (podawane przez producenta wyniki ucznia Ultra: SWE-Bench Verified 71,9, MMLU-Pro 86,8, LiveCodeBench v6 89,0) opisują inny model. Każdy, kto podejmuje decyzję w oparciu o pytanie „który wypada lepiej", musi poczekać na niezależne testy nauczyciela — i właśnie tę lukę powinny wypełnić najbliższe tygodnie.
Dwa pokrętła myślenia, ustawione inaczej.
Najbardziej interesujący techniczny kontrast między tymi dwoma wydaniami ujawnia się, gdy poprosimy je o rozumowanie. Qwen3.8 Max w formie o otwartych wagach nie ma wyboru: myślenie jest zawsze włączone, a ślad rozumowania stanowi część każdej odpowiedzi. To świetnie wpływa na jakość odpowiedzi i przejrzystość, ale podnosi koszty generowania masowego. Model nauczyciela traktuje rozumowanie jak pokrętło: enable_thinking je przełącza, medium_effort je dławi, a sufit reasoning_budget ogranicza jego górną granicę. Dla potoku destylacji różnica jest decydująca — generowanie milionów śladów rozumowania modelem z zawsze włączonym myśleniem mnoży rachunek za tokeny, podczas gdy przełącznik nauczyciela pozwala płacić za głębokie rozumowanie tylko tam, gdzie wymaga tego trudna próbka. To nie są konkurujące ze sobą filozofie projektowe; to dwa narzędzia zoptymalizowane pod przeciwne końce tego samego problemu i każde z nich jest właściwym narzędziem dla swojego końca.

Najważniejsze
Jeśli chcesz uruchomić model graniczny na własnym sprzęcie — albo wywoływać go po rozsądnej cenie — Qwen3.8 Max to wydanie, które się liczy. Jest dostępny na OrcaRouter po cenie katalogowej Alibaba, z zerowym narzutem, więc obniżka ogłoszona przez Alibaba przy premierze jest u nas aktywna tego samego dnia. Jeśli chcesz trenować lub destylować model rozumujący — albo audytować sygnał, który ukształtował Nemotron 3 Ultra — NVIDIA-Nemotron-Labs-Teacher-General-Reasoning to wydanie, które się liczy, i na razie jest dostępny wyłącznie self-hosted. Ważniejsze jest jednak to, że oba pojawiły się w tym samym tygodniu: otwarte wagi właśnie przeszły z „wystarczająco otwartych, by je obejrzeć” do „wystarczająco otwartych, by na nich budować” — w dwóch różnych punktach łańcucha dostaw modeli. Zespoły, które utrzymują wymienną warstwę modeli za jednym interfejsem — z jednej strony samodzielnie hostowane trenowanie, z drugiej zarządzana inferencja modeli granicznych — to te, które są w stanie wykorzystać oba.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
