Qwen 3.8 vs Claude Fable 5: Build 0902 przejmuje prowadzenie w kodowaniu
Guides & Insights

Qwen 3.8 vs Claude Fable 5: Build 0902 przejmuje prowadzenie w kodowaniu

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Kiedy Alibaba zaprezentowała Qwen3.8-Max w Szanghaju 19 lipca 2026 roku, ogłosiła coś głośniej niż cokolwiek innego: ten model o 2,4 biliona parametrów jest blisko poziomu czołowego i ustępuje jedynie modelowi Claude Fable 5. W tamtym czasie nie dało się tego ocenić. Nie było cennika, tabeli benchmarków ani licencji — tylko oświadczenie o pozycjonowaniu.

3 sierpnia 2026 roku Qwen3.8-Max stał się powszechnie dostępny — z prawdziwym cennikiem $2 / $6 za milion tokenów, tabelą benchmarków z konkretnymi liczbami i punktem końcowym zgodnym z OpenAI i DashScope. 2 września Alibaba wypuściła kolejny krok bez zmiany numeru wersji: Qwen3.8-Max-0902, odświeżenie po treningu nastawione na kodowanie i pracę agentową, które zadebiutowało na 1. miejscu w rankingu Code Arena: WebDev z wynikiem 1691 Elo. Claude Fable 5, model, za którym Alibaba przez lipiec pozycjonowała się bezpośrednio, ma na tej samej liście 1628 Elo. Pytanie z lipca stało się ostrzejsze: czy Qwen 3.8 wciąż jest „drugi tylko po Fable 5”, czy oś kodowania już się odwróciła?

Uwaga dla twórców — najszybszym sposobem na rozstrzygnięcie takiego sporu jest uruchomienie obu modeli na własnych promptach. OrcaRouter udostępnia ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, więc możesz porównać Qwen 3.8 Max z Fable 5 w tym samym zadaniu bez konfigurowania dwóch SDK.

Werdykt w skrócie. Qwen3.8-Max-0902 to najmocniejsze dotychczasowe wydanie flagowego modelu Alibaby o parametrach 2,4T, a nowa część jego argumentacji nie jest już tylko deklaracją producenta: zadebiutował na 1. miejscu w niezależnym rankingu Code Arena: WebDev z wynikiem 1 691 Elo, wyprzedzając Claude Fable 5 (1 628, #8) w tym rankingu. Cena się nie zmieniła i nadal jest decydująca — przy stałych stawkach $2 / $6 za 1 mln tokenów Qwen jest tańszy od Fable 5 ($10 / $50) o około 5× na wejściu i 8× na wyjściu. Luka w ogólnych zastosowaniach nie została domknięta: Artificial Analysis ocenia Qwen3.8-Max na 56 w swoim Indeksie Inteligencji wobec 62 dla Claude Fable 5, a w ostatnim opublikowanym tygodniu na ogólnej liście rankingowej Arena (24–30 sierpnia) Fable 5 utrzymuje #1 (1 508 Elo), podczas gdy Qwen3.8-Max zajmuje #20 (1 479). Są więc dwa werdykty: w kodowaniu wersja 0902 Qwena ma już arbitra i zwycięstwo; w szerokim, audytowanym rozumowaniu Claude Fable 5 — oraz nowszy Claude Fable 5.1 od Anthropica, który prowadzi w indeksie AA z wynikiem 66 — nadal utrzymują pozycję.

Najważniejsze wnioski

Qwen3.8-Max osiągnął GA 3 sierpnia 2026 r., a jego odświeżenie 0902 pojawiło się 2 września — bez podniesienia wersji, ten sam cennik 2 $ / 6 $, ten sam kontekst 1 mln tokenów.

Różnica cen jest ogromna: Qwen za $2 / $6 za 1M w porównaniu z Fable 5 za $10 / $50. To ~5× dla wejścia i ~8× dla wyjścia, a stawka Qwena jest stała dla całego kontekstu 1M tokenów, bez dopłaty za długie prompty.

Obie strony mają teraz niezależne wyniki — i wskazują one w różnych kierunkach. Qwen3.8-Max uzyskuje 56 punktów w Artificial Analysis Intelligence Index (Claude Fable 5: 62), a jego kompilacja 0902 zajmuje pierwsze miejsce w Code Arena: WebDev z wynikiem 1 691 Elo wobec 1 628 dla Fable 5.

Własna tabela benchmarkowa Qwena jest nadal mocna i nadal pochodzi od producenta. GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6, OSWorld-Verified 86.1 — ale odświeżenie z 2 września to pierwszy wynik Qwena, który niezależna arena sklasyfikowała na pierwszym miejscu.

Luka dotycząca architektury w specyfikacji została domknięta. Qwen3.8-2.4T-A95B to ~95 mld aktywnych parametrów z 2,4 bln wszystkich, rozłożonych na 512 ekspertów — ujawniono to przy wydaniu otwartych wag 12 sierpnia. Architektura Fable 5 pozostaje nieujawniona.

Otwarte wagi są dostępne, nie tylko zapowiedziane. Qwen3.8-2.4T-A95B (BF16 i FP8) trafił do Hugging Face i ModelScope 12 sierpnia na niestandardowej licencji Qwen3.8-Max, a Qwen3.8-27B pojawił się 14 sierpnia na licencji Apache 2.0. Fable 5 jest zamknięty i dostępny wyłącznie przez API, na stałe.

Nota o dokładności: wyniki z własnej tabeli benchmarkowej Alibaby pozostają deklaracjami producenta i nie zostały niezależnie zweryfikowane. Podane tu niezależne wartości są opatrzone znacznikami czasu i pochodzą od stron trzecich: Artificial Analysis Intelligence Index (Qwen3.8-Max 56, Claude Fable 5 62, Claude Fable 5.1 66), lista Elo Code Arena: WebDev oraz ogólna tygodniowa tablica Arena — wyniki Arena dryfują w miarę napływu głosów, a pozycja #1 wydania 0902 jest zgodna z ogłoszeniem Alibaby o zestawieniu z konkretnego momentu. Wynik Fable 5 na poziomie 95.0% w SWE-bench Verified pochodzi od Anthropica; ceny Qwena to cennik GA z Alibaba Model Studio.

Specyfikacje i cena, obok siebie

Oto twarde dane, każda liczba przypisana do swojego źródła.

• Producent / status — Qwen3.8-Max: Alibaba; GA 3 sierpnia 2026; aktualizacja 0902 — 2 września 2026. Claude Fable 5: Anthropic; flagowy model GA

• Architektura — Qwen3.8-Max: 2,4T łącznie / ~95B aktywnych, rzadki MoE, 512 ekspertów (ujawnione 12 sierpnia); Fable 5: nieujawnione

• Okno kontekstowe — Qwen3.8-Max: 1M tokenów (983 616 z myśleniem; maks. wyjście 131 072); Fable 5: flagowy model długiego kontekstu

• Indeks Inteligencji AA — Qwen3.8-Max: 56; Claude Fable 5: 62; Claude Fable 5.1 (1 września): 66, prowadzi

• SWE-bench Verified — Qwen3.8-Max: Nie podano (Alibaba podaje zamiast tego FrontierSWE 73.5); Fable 5: 95.0% (Anthropic / buildfastwithai)

• Mocne strony niezależne i raportowane przez dostawcę — Qwen3.8-Max: Code Arena WebDev #1 z wynikiem 1691 (0902, niezależnie); tabela dostawcy: GPQA Diamond 92.6, PaperBench 93.0, Terminal-Bench 2.1 86.6. Claude Fable 5: AA 62; SWE-bench Verified 95.0%

• Cennik (wejście / wyjście) — Qwen3.8-Max: $2.00 / $6.00 za 1M, stała stawka dla kontekstu 1M; wejście z pamięci podręcznej $0.25; Fable 5: $10 / $50 za 1M

• Otwarte wagi — Qwen3.8-Max: wydany 12 sierpnia 2026 (licencja niestandardowa, nie Apache); Qwen3.8-27B pod Apache 2.0 14 sierpnia. Fable 5: nie — zamknięty / tylko API.

• Multimodalność — Qwen3.8-Max: tekst, obraz, wideo na wejściu → tekst na wyjściu; Fable 5: flagowy model multimodalny

Dwie rzeczy wyznaczają ramy całego porównania. Pierwsza zmieniła się 3 sierpnia i nadal obowiązuje; druga zmieniła się ponownie 2 września.

Po pierwsze, kolumna cen jest teraz najbardziej rzucającym się w oczy elementem strony. W lipcu przewaga kosztowa Qwena była kuponem rabatowym — 90% zniżki na kredyty, tymczasowa, bez stawki za token, na której można by oprzeć plany. Teraz to cennik, a różnica ma charakter strukturalny, a nie promocyjny. Przy 6 dolarach za wyjście w porównaniu z 50 dolarami Fable, możesz wykonać około ośmiu wywołań Qwena za cenę jednego wywołania Fable. W przypadku każdego obciążenia, w którym płacisz za wolumen, a nie za pojedynczą najtrudniejszą odpowiedź, ten stosunek zmienia architekturę tego, co budujesz.

Po drugie, kolumna benchmarków przestała być jednostronna. Przez większą część sierpnia uczciwy obraz był wąski: Alibaba podało FrontierSWE 73,5 oraz tabelę wyników z własnych testów, Anthropic podało zweryfikowany przez stronę trzecią wynik 95,0% SWE-bench Verified, a żaden niezależny ewaluator nie ocenił Qwena w ogóle. Wersja 0902 to zakończyła. Code Arena: WebDev to ślepa, parami oceniana arena z głosami ludzi — projekt znany wcześniej jako WebDev Arena, prowadzony przez nikogo z Alibaby — a Qwen3.8-Max-0902 wszedł do niej na pozycji #1 z 1691 Elo, przed Claude Opus 5 (1688), Kimi K3 (1674) i Claude Fable 5 (1628, #8). Dwa zastrzeżenia trzymają to w ryzach: to jedna tablica, mierząca agentowe tworzenie front-endu, a nie ogólną zdolność, oraz „debiut na #1” to ogłoszenie Alibaby dotyczące listy z danego momentu. Ale twierdzenie, że Qwen nie ma żadnego arbitra, nie jest już prawdziwe, i to zmienia porównanie bardziej niż jakakolwiek pojedyncza liczba na niej.

Co tak naprawdę kupujesz za różnicę w cenie

Wiele abstrakcyjnych przykładów jest mniej przydatnych niż jeden konkretny przykład, więc oto taki. Weźmy agenta do przeglądu kodu, który wysyła 150 000 tokenów kontekstu repozytorium i generuje 6 000 tokenów recenzji na jedno wywołanie.

Qwen3.8-Max: 0.15M × $2 = $0.30, plus 0.006M × $6 = $0.036. ≈ $0.34 za wywołanie.

Claude Fable 5: 0.15M × $10 = $1.50, plus 0.006M × $50 = $0.30. ≈ $1.80 za wywołanie.

• Przy 2,000 wywołań dziennie: Qwen ≈ $672/dzień; Fable ≈ $3,600/dzień. W ciągu miesiąca to mniej więcej $20,000 w porównaniu z $108,000.

• Dzięki buforowaniu promptów w stabilnym kontekście repozytorium, buforowane wejście Qwena w cenie $0,25/1M obniża koszt wejścia z $0,30 do poniżej $0,04, redukując koszt wywołania do ≈ $0,08 — około 22× taniej niż Fable za wywołanie.

To nie jest marginalna oszczędność; to różnica między uruchamianiem reviewera na każdym pull requeście a uruchamianiem go tylko na ryzykownych. A płaska stawka za kontekst Qwen sprawia, że efekt jest tym silniejszy, im dłuższe są prompty: ponieważ Alibaba nie pobiera dodatkowej opłaty za długie prompty, przepuszczenie kontekstu o 900 000 tokenów kosztuje tyle samo za token, co kontekstu o 5 000 tokenów.

Uczciwą przeciwwagą jest to, że cena za token nie jest ceną za rozwiązane zadanie. Jeśli Fable 5 rozwiązuje problem w jednym przejściu, podczas gdy tańszy model potrzebuje trzech prób oraz korekty człowieka, tańszy model może łącznie kosztować więcej — a przy najtrudniejszych zadaniach wymagających rozumowania audytowany ranking #1 Fable'a jest najlepszym dostępnym dowodem na to, że faktycznie rozwiązuje więcej w jednym przejściu. Argument kosztowy przemawiający za Qwenem jest najmocniejszy przy zadaniach o dużej skali i wysokiej tolerancji, a najsłabszy przy zadaniach o małej skali i wysokiej stawce.

Nazewnictwo 0902: możliwości skoczyły w górę, ale numer wersji nie.

To, co wyróżnia 2 września, to czego Alibaba nie zrobiła: nie wypuściła Qwen 3.9. Ulepszenie trafiło na rynek jako punkt kontrolny z datą pod tą samą nazwą modelu — Qwen3.8-Max-0902 — a API serwowało go pod tą samą nazwą i w tej samej cenie. W tym kierunku zmierza branża: gdy skok możliwości nie gwarantuje już nowego numeru wersji, pytanie „którego modelu użyć” staje się kwestią buildów i dat, a nie tylko nazw rodzin.

Oznacza to również, że wynik benchmarku przypisany do „Qwen3.8-Max” ma datę ważności: wynik zmierzony dla wersji z lipca lub sierpnia może nie opisywać modelu, który API zwraca dzisiaj. Sprawdź identyfikator kompilacji endpointu, który faktycznie wywołujesz — numer 0902 to różnica między modelem, który pozostawał w tyle za Claude Fable 5, a modelem, który go wyprzedza w Code Arena: WebDev.

Dowód i dlaczego nadal decyduje o tym starciu

Najczęściej przytaczany praktyczny dowód na możliwości Qwen3.8-Max pochodzi z recenzji z okresu przedpremierowego (thomas-wiegold.com), która przetestowała model na czterech prawdziwych projektach. Wyniki były naprawdę imponujące: Qwen przeszedł symulację Go pokera za jednym podejściem — dopiero trzeci model w historii, któremu udało się rozwiązać ten prompt w jednym przebiegu, obok Fable 5 i Grok 4.5 — a na prompcie strony palarni kawy wygenerował najlepszy rezultat, jaki recenzent kiedykolwiek widział w tym teście, dodając z czystej skrupulatności niezamówiony koszyk zakupów, sekcję hurtową i integrację z Instagramem.

Haczyk tkwił w szybkości: 30+ minut na stronie internetowej i 1 godzina 20 minut na symulacji pokera, co czyniło go najwolniejszym modelem, jakiego używał ten recenzent. To ustalenie wymaga teraz zastrzeżenia, którego nie wymagało w lipcu. Pomiar wykonano na infrastrukturze preview, przez jednego recenzenta, podczas niezwykle długich przebiegów agentowych. Serwowanie GA to inny system. W każdym razie własna 7-dniowa telemetria OrcaRouter pokazuje obecnie p50 time-to-first-token na poziomie 1,64 sekundy dla Qwen3.8-Max — pomiar własny, choć TTFT i przepustowość end-to-end przy godzinnych kompilacjach to różne wielkości. Uczciwe stanowisko jest takie, że ustalenie dotyczące spowolnienia w preview należy przetestować ponownie, zamiast powtarzać je jako aktualny fakt.

Aktualizacja 0902 nie zmieniła tego, że najmocniejsze dowody po każdej ze stron wciąż pochodzą z różnych źródeł. #1 Qwen3.8-Max-0902 na Code Arena: WebDev to niezależny wynik głosowania na ślepo, ale dotyczy tylko jednej tablicy, a tabela benchmarków przygotowana przez Alibabę pozostaje wytworem producenta — laboratoria wybierają, które benchmarki raportować. Najsłabszy opublikowany wynik Alibaby (IFBench 82.8, podążanie za instrukcjami) wciąż jest zgodny z wcześniejszym zarzutem, że model dostarcza więcej, niż trzeba, i ignoruje zakres. Dowody dotyczące Claude Fable 5 są szersze i w większości pochodzą od stron trzecich: 62 w AA Intelligence Index, #1 na ogólnej tablicy Arena, 95.0% SWE-bench Verified — a nowszy model Anthropica, Claude Fable 5.1, przewodzi w indeksie AA z wynikiem 66 od 1 września. Na pytanie „który model poradzi sobie z pracą, w której nie mogę sobie pozwolić na błąd”, ogólna odpowiedź pozostaje bez zmian. Na pytanie „który model dostarcza najlepszy front-end za jedną dziesiątą ceny”, odpowiedź zmieniła się 2 września.

Otwartość: oś, w której Qwen już wygrał.

Fable 5 nigdy nie będzie można hostować samodzielnie. Qwen3.8-Max już można hostować samodzielnie: 12 sierpnia wagi modelu Qwen3.8-2.4T-A95B — BF16 oraz oficjalny wariant FP8 — pojawiły się na Hugging Face i ModelScope, co czyni go pierwszym modelem Qwen z klasy Max, który każdy może pobrać. Dwa zastrzeżenia zasługują na równą uwagę.

Pierwsze jest legalne. Wydanie jest objęte niestandardową licencją „Qwen3.8-Max”, a nie Apache 2.0: dostawcy prowadzący działalność model-jako-usługa lub biznesy asystentów AI, których przychody za ostatnie 12 miesięcy przekraczają 50 mln USD, muszą negocjować osobną licencję z Qwen, a produkty komercyjne przekraczające 100 mln aktywnych użytkowników miesięcznie lub 20 mln USD przychodów miesięcznie muszą wyświetlać nazwę modelu. W przypadku użytku wewnętrznego i startupów progi te rzadko mają zastosowanie — ale to nie jest pełna dowolność.

Drugi ma charakter fizyczny. Model MoE o łącznej liczbie parametrów 2,4T zajmuje około 4,9 TB w BF16 (mniej więcej połowę w oficjalnym punkcie kontrolnym FP8) przy około 141 GB pamięci na H200 — zatem samodzielne hostowanie flagowca oznacza szafę akceleratorów, zanim obsłużysz token. Ujawnione ok. 95 mld aktywnych parametrów pozwalają przynajmniej oszacować, co taka szafa daje. Dla niemal każdego zespołu praktyczną ścieżką jest hostowane API w cenie $2 / $6.

Dlatego właśnie Qwen3.8-27B, którego wagi na licencji Apache-2.0 pojawiły się 14 sierpnia i który podobno działa w ~17GB pamięci VRAM, pozostaje praktycznie istotnym wydaniem do samodzielnego hostingu. Jeśli powodem, dla którego wolisz Qwen od Fable 5, jest lokalizacja danych lub kontrola on-premise, a nie surowa wydajność, to model 27B faktycznie to zapewnia — i po obu stronach porównanie otwartości nie jest już tylko teoretyczne.

Często zadawane pytania

Czy Qwen 3.8 jest lepszy od Claude Fable 5?

To teraz zależy od osi, co jest prawdziwą zmianą względem sierpnia. W kodowaniu prowadzi Qwen3.8-Max-0902: #1 w Code Arena: WebDev z wynikiem 1691 Elo wobec 1628 dla Claude Fable 5, w cenie $2/$6 wobec $10/$50 za Fable 5. W szeroko zakrojonej, audytowanej jakości wciąż prowadzi Fable 5: 62 punkty w AA Intelligence Index wobec 56 dla Qwena, 95,0% w SWE-bench Verified i #1 na ogólnej tablicy Arena. Do pracy, w której błędna odpowiedź jest kosztowna, lepiej udokumentowanym wyborem jest Fable 5; przy kodowaniu o dużej skali i agentowych pracach webowych najnowszy Qwen jest zarówno tańszy, jak i wyżej notowany w rankingu Arena.

Czy twierdzenie „ustępujące tylko Fable 5” jest prawdziwe?

Pozycjonowanie Alibaby zostało dokonane bez niezależnych liczb, a build 0902 od tego czasu zmienił swój kształt. Qwen3.8-Max-0902 zajmuje miejsce przed Claude Fable 5 w Code Arena: WebDev (1 691 vs 1 628), ale za nim w Indeksie Inteligencji AA (56 vs 62) oraz na ogólnej tablicy Arena (Qwen #20 z Elo 1 479; Fable 5 #1 z 1 508). Tak więc „drugi po Fable 5” stało się „przed Fable 5 na tablicy kodowania, której dotyczyło to odświeżenie, za nim na szerokich tablicach ogólnego przeznaczenia”.

O ile tańszy jest Qwen 3.8 niż Fable 5?

Zasadniczo tak — to teraz realna stawka, a nie zniżka. Qwen3.8-Max kosztuje $2 / $6 za 1 mln tokenów w porównaniu z $10 / $50 u Fable 5 — czyli ok. 5× taniej na wejściu i 8× na wyjściu. Stawka Qwena jest też stała dla całego kontekstu 1M, a odczyt z pamięci podręcznej po $0.25/1M sprawia, że obciążenia o powtarzalnym kontekście są jeszcze tańsze.

Czy Qwen 3.8 Max opuścił już wersję preview?

Tak. Osiągnął ogólną dostępność 3 sierpnia 2026 r., z opublikowaną kartą taryfową i punktem końcowym zgodnym z OpenAI i DashScope. Kampania kredytów Qoder i zapowiedzi wersji preview z 90% zniżką, które krążyły w lipcu, nie opisują już sposobu sprzedaży tego modelu.

Czy Qwen 3.8 jest nadal najwolniejszym modelem, jak mówiły wczesne recenzje?

To ustalenie pochodzi od jednego recenzenta na infrastrukturze podglądowej podczas godzinnych agentowych kompilacji i należy je ponownie przetestować w środowisku GA, a nie traktować jako aktualny fakt. Siedmiodniowa telemetria OrcaRouter pokazuje p50 czasu do pierwszego tokena wynoszący 1,64 sekundy, choć mierzy to opóźnienie pierwszego tokena, a nie przepustowość przy bardzo długich kompilacjach.

Czy mogę samodzielnie hostować Qwen 3.8 zamiast płacić za Fable 5?

Tak dla Qwen, z zastrzeżeniami. Qwen3.8-2.4T-A95B jest dostępny do pobrania od 12 sierpnia na licencji niestandardowej (nie Apache 2.0), a Qwen3.8-27B na licencji Apache 2.0 od 14 sierpnia. Praktyczną barierą jest sprzęt: model MoE o łącznej wielkości 2,4T wymaga około 4,9 TB w BF16 — czyli szafy akceleratorów — więc większość zespołów nadal będzie wywoływać hostowane API po $2/$6 zamiast samodzielnie serwować flagowy model. Fable 5 jest zamknięty na stałe.

Którego powinienem dzisiaj użyć?

Do ogólnej pracy, w której błędna odpowiedź jest kosztowna — trudne rozumowanie, ścieżki produkcyjne o wysokiej stawce — Claude Fable 5 pozostaje lepiej udokumentowanym wyborem, a Claude Fable 5.1 firmy Anthropic jeszcze powiększa tę przewagę. Przy kodowaniu o dużym wolumenie i agentowym tworzeniu aplikacji webowych Qwen3.8-Max-0902 ma obecnie przewagę w niezależnych rankingach arena oraz około 8× niższą cenę generowania wyników: masowy przegląd kodu, generowanie front-endu, analiza długich dokumentów. Wiele zespołów powinno korzystać z obu modeli i dobierać je w zależności od zadania.

Sedno sprawy

Porównanie Qwen 3.8 i Claude Fable 5 wygląda dziś inaczej niż miesiąc temu, a jeszcze inaczej niż tydzień temu. Qwen3.8-Max to ogólnie dostępny model z cennikiem, który jest 5× niższy na wejściu i 8× niższy na wyjściu niż Fable 5, płasko w całym milionie tokenów — a od 2 września ta sama nazwa oznacza build 0902, który według niezależnej areny zajmuje obecnie 1. miejsce w programowaniu agentowym w sieci, wyprzedzając Fable 5 na tej liście.

Żaden z modeli nie posiada już wyłączności na całe porównanie. Claude Fable 5 — oraz Claude Fable 5.1 od Anthropica, który od 1 września prowadzi w AA Intelligence Index z wynikiem 66 — zajmują szeroką, audytowaną pozycję w zadaniach ogólnego przeznaczenia, a tabela wyników samego Alibaby pozostaje artefaktem producenta. Ale powód, dla którego ten pojedynek był w lipcu jednostronny — całkowity brak niezależnego arbitra dla modelu Qwen — wygasł 2 września: Qwen3.8-Max-0902 to model nr 1 w Code Arena: WebDev. Rozsądna odpowiedź nadal brzmi: podział wg stawki i zadania — Fable 5 do ogólnego rozumowania, gdzie błąd jest kosztowny, Qwen3.8-Max do wielkoskalowego kodowania, gdzie i różnica w cenie, i przewaga na arenie działają na jego korzyść — oraz przetestowanie obu na własnych promptach.

Porównane w tym artykule3

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie