
TwIL-LM3-Pro vs Qwen 3.8: Niedopasowanie i porównanie, które naprawdę ma znaczenie
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 219 tok/s
- OpenAINOWOŚĆOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAINOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAINOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
TwIL-LM3-Pro i Qwen3.8-Max nie należą do tej samej strony, a powód nie jest taki, że jeden jest lepszy. Chodzi o to, że opublikowana argumentacja na rzecz 3,66-miliardowego modelu logiki formalnej webAI opiera się na porównaniu z modelem Qwen — a ów model Qwen to nie ten, którego nazwę podaje nagłówek. Tabele Track A i Track B firmy webAI mierzą TwIL-LM3-Pro wobec Qwen3-8B, gęstego modelu open-weights o 8 mld parametrów z wcześniejszej generacji, a Qwen3.8-Max nie poświęcają żadnej uwagi: nie dlatego, że TwIL-LM3-Pro by wygrał, lecz dlatego, że Qwen3.8-Max to flagowy hostowany system Alibaby, rzadki model mieszanki ekspertów (MoE) raportowany na 2,4 biliona parametrów, z około 95 miliardami aktywnymi na token, multimodalnym oknem kontekstu o długości miliona tokenów oraz cennikiem 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion wyjściowych. Postawienie obok tego 2,09 GiB modelu GGUF na laptopa to błąd kategorii przebrany za stronę porównawczą.
Ten tekst robi więc dwie rzeczy. Poprawia porównanie, które wyniki wyszukiwania błędnie przedstawiają, a następnie odpowiada na wersję pytania, które czytelnik prawdopodobnie naprawdę ma: skoro model frontierowy jest dostępny za jednym wywołaniem API, a specjalista od logiki formalnej działa na twoim własnym komputerze, to kiedy każde z nich zasługuje na swoje miejsce?
Model, który karta faktycznie zmierzyła
Właściwym punktem odniesienia jest Qwen3-8B, a własne podsumowanie tego modelu autorstwa webAI jest bardziej zachowawcze, niż sugerują wtórne opracowania. Makropróg (macro gate) w domenie TwIL-LM3-Pro wynosi 0,5539 wobec 0,5336 dla Qwen3-8B, a karta modelu zawiera zdanie, które strona marketingowa usunęłaby: przewaga w progu wynosi 0,020, „mniejsza niż szum próbkowania przy n = 200 na pasmo — więc należy to odczytywać jako parytet, a nie zwycięstwo”.
Tam, gdzie porównanie nie jest rzutem monetą: strict-7, 0,2879 wobec 0,2093, wiersz, który nigdzie nie korzysta z punktów za luźne dopasowanie i dlatego nie da się go wygenerować przez formatowanie. Ścisły wybór wielokrotny, 0,4100 wobec 0,0000. Indukcja reguł, 0,4195 wobec 0,3680. A stosunek liczby parametrów — 3,66B wobec około 8B — który stanowi całe twierdzenie o „mniej niż połowie rozmiaru”.
W odłożonym zestawie testowym webAI jest jeszcze bardziej dosadny: „TwIL-LM3-Pro nie przewodzi mu”. Makro dziesięciowymiarowe wynosi 0,7901, czyli tyle samo co własna baza Granite i plasuje się za Qwen3-8B z 0,8493. Mały specjalista, który dorównuje ogólnemu modelowi dwukrotnie większemu od siebie w logice formalnej, a przegrywa z nim w ogólnych zdolnościach, to oczekiwany obraz, a raportowanie tego w ten sposób czyni wynik strict-7 wiarygodnym.
Czym właściwie jest Qwen3.8-Max
Qwen3.8-Max nie jest iteracją Qwen3-8B. To poziom premium Alibaby, a na stronie katalogowej OrcaRouter występuje jako `qwen/qwen3.8-max` z datą premiery 3 sierpnia 2026 r., oknem kontekstowym o rozmiarze miliona tokenów, wejściem tekstowym, obrazowym i wideo, wyjściem tekstowym oraz pełnym wsparciem dla trybu myślenia, wywoływania funkcji, wbudowanych narzędzi i ustrukturyzowanych danych wyjściowych. Jest udostępniany w panelach zgodnych z OpenAI, zgodnych z Anthropic oraz natywnych w pięciu regionach, a tryb myślenia przełącza się parametrem `enable_thinking`. Stawka wynosi 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych.
Snapshot z datą, `qwen/qwen3.8-max-0902`, został opublikowany 2 września 2026 r. z takimi samymi możliwościami i taką samą ceną; opublikowano go specjalnie po to, aby można było przypiąć zachowanie dla powtarzalnych uruchomień. Jeśli budujesz cokolwiek długoterminowego w oparciu o Qwen3.8-Max, to właśnie ten identyfikator snapshotu należy wpisać w konfiguracji, a nie zmieniający się alias.
Zauważ, czego brakuje w tym opisie: liczby parametrów, którą można pobrać, pliku licencji i jakiejkolwiek ścieżki do samodzielnego uruchomienia. Qwen3.8-Max to produkt hostowany. Doniesienia dziennikarskie z premiery mówiły o otwartych wagach obiecanych na następny tydzień, a sformułowanie techsy — „2,4 bln parametrów, kontekst 1 mln, wciąż brak wag” — to stan, który czytelnik powinien zweryfikować, a nie zakładać, ponieważ obietnica podana przy premierze nie jest opublikowanym checkpointem.
Cztery wymiary, a żaden z nich nie jest blisko
• Parametry — TwIL-LM3-Pro 3,66B gęsty, wszystkie aktywne, w porównaniu z Qwen3.8-Max, w przypadku którego podano 2,4T łącznie w rzadkiej architekturze mieszanki ekspertów, z około 95B aktywnych na token. Trzy rzędy wielkości w całkowitej liczbie, dwa w liczbie aktywnych.
• Gdzie działa — TwIL-LM3-Pro pobiera się jako bf16 o rozmiarze 6,82 GiB lub jako 2,09 GiB Q4_K_M GGUF na CPU albo 4 GB VRAM, w przeciwieństwie do Qwen3.8-Max, który istnieje wyłącznie jako hostowany endpoint.
• Kontekst — TwIL-LM3-Pro 131 072 tokenów, odziedziczony po swojej bazie Granite i nigdy niezwalidowany powyżej 8192 w jego własnej ewaluacji w porównaniu z Qwen3.8-Max przy 1 000 000 tokenów.
• Modalności — tekst na wejściu, tekst na wyjściu vs tekst, obraz i wideo na wejściu, tekst na wyjściu.
• Licencja — webAI Non-Commercial License wer. 1.0, przy czym do użytku generującego przychody wymagana jest osobna umowa, w przeciwieństwie do hostowanego komercyjnego API bez wag do licencjonowania.
• Koszt — TwIL-LM3-Pro: brak opłaty za token i brak hostowanego endpointu, w porównaniu z Qwen3.8-Max, który pobiera 2,00 USD za milion tokenów wejściowych i 6,00 USD za milion tokenów wyjściowych, przy stawce około 0,25 USD za milion w przypadku wejścia z pamięci podręcznej.
Model 3.66B jest tani, bo jest mały, a jest mały, bo robi jedną rzecz. Qwen3.8-Max jest drogi, bo jest uniwersalny i hostowany. Żadna z tych stawek nie jest wyrokiem.
Pytanie kryjące się za pytaniem
Odsuń na bok zamieszanie związane z nazewnictwem, a pozostaje pytanie inżynierskie — i to dobre: jeśli czołowy model hostowany potrafi rozumować o logice formalnej, to po co w ogóle uruchamiać wąskiego specjalistę?
Trzy powody się bronią. Pierwszy to licencja i sieć: niekomercyjna grupa badawcza, środowisko odizolowane od sieci albo przebieg etykietowania wsadowego, który musi działać na laptopie bez łączności, nie może wywołać hostowanego punktu końcowego, a GGUF o rozmiarze 2,09 GiB wprost odpowiada na to ograniczenie. Drugi to struktura kosztów przy dużej skali — zadanie etykietowania w logice formalnej na milionie krótkich danych wejściowych płaci za token w hostowanym modelu frontier, a lokalnie nie płaci nic poza czasem zegarowym. Trzeci to kształt danych wyjściowych: TwIL-LM3-Pro dostrojono tak, aby generował struktury weryfikowalne maszynowo, a nie prozę, a w przypadku etykiet wynikania i parsowań semantycznych to mniejszy potok przetwarzania niż promptowanie modelu ogólnego i parsowanie jego odpowiedzi.
W przeciwieństwie do tego, sprawa Qwen3.8-Max jest prosta. Widzi obrazy i wideo, obsługuje milion tokenów, radzi sobie z narzędziami i ustrukturyzowanym wyjściem poprzez udokumentowane API, a za nim stoją opublikowane benchmarki i niezależna ocena. Nic w wąskim specjaliście temu nie zagraża; te dwa podejścia odpowiadają na różne zestawy ograniczeń.
Stos, który używa obu
Wzorzec, który przetrwa kontakt z rzeczywistym potokiem, jest dwupoziomowy i nie jest egzotyczny. Hostowany model klasy frontier czyta nieuporządkowane dane wejściowe — zeskanowaną stronę podręcznika, źródło o mieszanej modalności, długą specyfikację — i zamienia je w czysty, ustrukturyzowany tekst. Ten tekst trafia do lokalnego modelu logiki formalnej, którego całym zadaniem jest wygenerowanie etykiety, wyniku parsowania lub krytyki w Lean na sprzęcie, który posiadasz. Rozstrzygnięcie, czy ten drugi poziom jest wart swojego kosztu utrzymania, to porównanie w stylu strict-7, a nie bramka, ponieważ specjalista zasługuje na swoje miejsce na torach, na których metryka nie pozostawia miejsca na łagodne ocenianie.
Jest też wskazówka, którą warto zaczerpnąć z samej karty webAI: pipeline uruchomiono na pięciu różnych modelach bazowych, przy czym dla każdego modelu zmieniał się wyłącznie współczynnik scalania, a webAI podaje wynik dla każdego z nich, w tym dla tych, które zmieniły się najmniej. To silniejsze twierdzenie o przepisie niż jakakolwiek pojedyncza linia benchmarku i właśnie ten rodzaj dowodu mówi, że metoda się generalizuje, a nie że jeden checkpoint miał szczęście.
Co jest tutaj routowalne, a co nie
To jedyne miejsce, w którym oba modele uczciwie występują w tym samym zdaniu. Qwen3.8-Max to trasa: jest obsługiwany przez OrcaRouter jako `qwen/qwen3.8-max`, a ponieważ platforma przekazuje cenę katalogową dostawcy z doliczeniem 0% marży, stawka $2.00/$6.00 jest stawką samego dostawcy, a obniżka ceny dostawcy obowiązuje tego samego dnia, a nie po zakończeniu cyklu umownego. Migawka `qwen/qwen3.8-max-0902` z datą jest również dostępna w routingu obok niego, więc przypięcie powtarzalnego identyfikatora modelu to wybór konfiguracji, a nie odrębna relacja z dostawcą.
TwIL-LM3-Pro nie jest trasą i nieuczciwe byłoby sugerować inaczej. Ma licencję niekomercyjną i nie ma opublikowanego hostowanego punktu końcowego, a obecnym sposobem korzystania z niego jest pobranie checkpointu i uruchomienie go samodzielnie. Zadaniem routera w potoku zbudowanym wokół niego jest otaczająca praca na tekście — rozwijanie promptu, generowanie korpusu, przebieg filtrowania — która działa na tym samym punkcie końcowym zgodnym z OpenAI, obsługującym ponad 200 modeli, więc zamiana modelu generującego dane ewaluacyjne na model, który je ocenia, nie kosztuje nic poza edycją konfiguracji, z automatycznym przełączaniem awaryjnym, które utrzymuje długą partię przy życiu, gdy dostawca ma chwilowe problemy.
Najbardziej uzasadnione zastosowanie obu razem jest dokładnie takie: routowalna warstwa frontier zajmująca się ogólnym rozumowaniem i ekstrakcją strukturalną, pobrany specjalista dokonujący oceny w zakresie logiki formalnej oraz jeden klucz do wszystkiego pomiędzy.
Który model porównać i kiedy
Jeśli oceniasz małe modele logiki formalnej, tym, co warto postawić obok TwIL-LM3-Pro, jest Qwen Qwen3-8B, a webAI opublikowało już to porównanie wraz z zastrzeżeniami. Jeśli wybierasz, gdzie uruchomić obciążenie produkcyjne, Qwen3.8-Max to zupełnie inna decyzja — hostowany system klasy frontier z cennikiem i bez możliwości pobrania — a właściwym pytaniem nie jest to, który jest lepszy, lecz to, które ograniczenie wiąże: łączność i licencja z jednej strony, kontekst, modalność i skala z drugiej. Większość rzeczywistych systemów ostatecznie potrzebuje obu odpowiedzi.



Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
