
Ember-1 kontra Qwen3.8-Max: Oszczędzający tokeny wariant pochodny przeciwko flagowcowi
- openaiNOWOŚĆOpenAI: GPT-6 Luna2026-09-2237Inteligencja
- openaiNOWOŚĆOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- grokNOWOŚĆGrok 4.72026-09-2146Inteligencja
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów · 177 tok/s
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
Dwa modele w tym pojedynku mają prawdziwą liczbę na tym samym benchmarku, a to wciąż niczego nie rozstrzyga. Ember-1 to wyspecjalizowana pochodna Kimi K3 od Moonshot AI, opracowana przez Fireworks Research, opublikowana 23 września 2026, osiągająca 82,0% na Terminal Bench 2.1 przy zużyciu około połowy tokenów, które zużywa jego model bazowy. Qwen3.8-Max to flagowy model Alibaby — rzadki model mieszaniny ekspertów o około 2,4 biliona parametrów, z około 95 miliardami aktywnymi na token — ogólnie dostępny od 3 sierpnia 2026, raportujący 86,6% na tym samym benchmarku. Obie te liczby są raportowane przez dostawców, oba laboratoria uruchomiły własne środowiska testowe, a różnica 4,6 punktu między dwoma nieopublikowanymi konfiguracjami ewaluacyjnymi nie jest werdyktem. To, co jest porównywalne, to pieniądze, i to właśnie tutaj ten pojedynek staje się interesujący: cała teza jednego modelu jest taka, że nie należy płacić za tokeny, których się nie potrzebuje, a drugi to flagowy model w cenie 2 dolarów za milion na wejściu i 6 dolarów za milion na wyjściu.
Czym tak naprawdę jest każdy model
Ember-1 nie jest nowym modelem w żadnym sensie architektonicznym. To Kimi K3 ponownie wytrenowany, by rozumować bardziej zwięźle, zbudowany przez Fireworks Research w ramach ponad 50 eksperymentów treningowych i ponad 200 ewaluacji na własnym bezserwerowym stosie treningowym. Twierdzenie laboratorium jest takie, że rozumowanie K3 jest dłuższe, niż wymagają tego zadania, a nadmiar można usunąć bez zmiany odpowiedzi — długość rozumowania spadła o 35–50% bez utraty dokładności w siedmiu benchmarkach i dwóch produkcyjnych testach A/B u klientów. Jest dostępny jako podgląd badawczy na własnej bezserwerowej platformie dostawcy, bez opublikowanych wag i bez opublikowanej ceny.
Qwen3.8-Max to zupełnie inny rodzaj obiektu. To flagowy poziom Alibaba, natywnie multimodalny w zakresie danych wejściowych tekstowych, obrazowych i wideo, z oknem kontekstu wynoszącym milion tokenów, odświeżony dwukrotnie od premiery: aktualizacja po treningu z 2 września 2026 r. ukierunkowana na kodowanie i profesjonalną pracę biurową oraz szybsza warstwa serwowania ogłoszona 22 września 2026 r. Alibaba pozycjonuje go przeciwko GPT-5.5, Claude Opus 4.7 i Gemini 3.1 Pro, a jej opublikowany arkusz oceny odzwierciedla tę ambicję — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 oraz Humanity's Last Exam na poziomie 43,6, wszystkie raportowane przez dostawcę.

Karty stawek obok siebie
Jedno z nich ma cenę, a drugie nie, co jest pierwszą praktyczną asymetrią.
• Dane wejściowe — Ember-1: brak opublikowanych; arkusz benchmarkowy wylicza dolary na podstawie cennika Kimi K3. Qwen3.8-Max: 2,00 USD za milion tokenów w OrcaRouter.
• Dane wyjściowe — Ember-1: nie opublikowano. Qwen3.8-Max: 6,00 USD za milion tokenów.
• Buforowane wejście — Ember-1: nie dotyczy. Qwen3.8-Max: 0,25 USD za milion tokenów za odczyty z pamięci podręcznej, co stanowi jedną ósmą stawki za wejście i ma ogromne znaczenie w pętlach agentowych, w których ten sam kontekst jest przesyłany ponownie w każdej turze.
• Okno kontekstowe — Ember-1: nie opublikowano dla wersji zapoznawczej; jego model bazowy ma 1 048 576 tokenów. Qwen3.8-Max: 1 000 000 tokenów.
• Multimodalność — Ember-1: tekst. Qwen3.8-Max: tekst, obraz i wideo na wejściu, tekst na wyjściu.
• Wagi — Ember-1: brak. Qwen3.8-Max: istnieje wydanie z otwartymi wagami, ale jest tylko tekstowe i brakuje mu pełnego okna kontekstowego oraz wejścia wizyjnego udostępnianego punktu końcowego.
• Dostęp — Ember-1: podgląd badawczy, dwutygodniowe okno serverless, trwałość uzależniona od zapotrzebowania. Qwen3.8-Max: ogólnie dostępny i wyceniony.
Zanim zaczniesz cokolwiek modelować, zwróć uwagę na jedną rzecz dotyczącą stawek Qwen3.8-Max: Alibaba od premiery wielokrotnie zmieniała sposób pakietowania tego modelu, a międzynarodowy cennik nie zawsze odpowiadał sierpniowej cenie z nagłówka. Przyjmij, że 2,00 USD i 6,00 USD to obecna cena tej trasy na naszej platformie — która przekazuje cenę katalogową dostawcy bez marży, więc zmiana u dostawcy pojawia się tego samego dnia — i sprawdź cennik, zanim przeznaczysz na to budżet.
Dlaczego porównanie benchmarków nie działa
82,0% Ember-1 i 86,6% Qwen3.8-Max to oba wyniki z Terminal Bench 2.1, co sprawia, że wyglądają na porównywalne, ale nie czyni ich porównywalnymi. Arkusz Ember-1 podaje swoją liczbę względem wariantów Kimi K3 ocenianych przez Fireworks Research, na 89 próbkach, z dołączonymi deltami tokenów i kosztów. Liczba Qwen3.8-Max pochodzi z własnego arkusza ewaluacyjnego Alibaba. Różne laboratoria, różne środowiska testowe, różne szkielety agentów — a w benchmarku, w którym wyniki zmieniają się o kilka punktów już przy samym wyborze szkieletu, różnica 4,6 punktu mieści się w granicach szumu metodologicznego.
To, co można odczytać z arkusza Ember-1, to kolumna tokenów – jedyna rzecz, do zmiany której wytrenowano model. Względem własnej bazy Ember-1 zużywa o 51,9% mniej tokenów na Terminal Bench 2.1, o 32,5% mniej na SWE-Interact, o 23,7% mniej na DeepSWE 1.1 i tylko o 5,9% mniej na τ-2 Bench Airline. Ta rozpiętość to uczciwy nagłówek. Model, który ogranicza deliberację, jest wart bardzo wiele na benchmarkach, na których model bazowy myśli nadmiernie, a prawie nic tam, gdzie tego nie robi, i nie można wiedzieć, z jakim rodzajem obciążenia ma się do czynienia, bez zmierzenia własnego.
Koszt na ukończone zadanie, rozpracowany
Oto arytmetyka, która faktycznie o tym decyduje, wykorzystująca opublikowane stawki Kimi K3 jako zastępcze dla kosztu Ember-1, ponieważ Ember-1 nie ma własnych. Kimi K3 to 3,00 USD za milion tokenów wejściowych, 0,30 USD za tokeny z pamięci podręcznej i 15,00 USD za tokeny wyjściowe — dokładnie taki cennik, jakiego Fireworks Research użył we własnym porównaniu. Qwen3.8-Max to 2,00 USD za wejście i 6,00 USD za wyjście, przy czym odczyty z pamięci podręcznej kosztują 0,25 USD.
Po stronie wejściowej Qwen3.8-Max jest już tańszy o jedną trzecią. Po stronie wyjściowej jest 2,5 razy tańszy za token. Oznacza to, że redukcja liczby tokenów w Ember-1 nie konkuruje ze statycznym rachunkiem — konkuruje z flagowym modelem, który jest tańszy za token, zanim jeszcze wykonana zostanie jakakolwiek praca nad wydajnością. Własny produkcyjny test A/B Fireworks Research pokazał spadek liczby tokenów wyjściowych z 49,3 tys. do 29,9 tys., czyli łączną redukcję o 39%; zastosuj to do stawki wyjściowej Qwen3.8-Max, a otrzymasz takie samo 39% oszczędności, co jest mniejszą korzyścią absolutną niż ten sam procent zastosowany do stawki 15 USD w K3.
Argument za efektywnością Ember-1 jest zatem najsilniejszy, gdy porówna się go z jego własnym modelem bazowym, i dokładnie taki argument przedstawia premiera. W zestawieniu z Qwen3.8-Max porównanie przenosi się na możliwości na dolara, gdzie większy kontekst flagowego modelu, wejście multimodalne i dostępność za określoną cenę są kontrargumentami — i gdzie nikt nie opublikował bezpośredniego porównania, które by to rozstrzygnęło.

Co pokazują nasze własne dane routingu
Dwa z trzech uwzględnionych tu modeli to aktywne trasy w OrcaRouter, co daje obraz, jakiego nie zawiera żaden arkusz benchmarkowy. Qwen3.8-Max jest udostępniany z kontekstem 1 000 000 tokenów, z medianą opóźnienia pierwszego tokenu na poziomie około 2,0 sekundy i około 52,7 tokenów wyjściowych na sekundę w ciągu ostatnich siedmiu dni, przy współczynniku błędów około 4,2%. Kimi K3 — model bazowy Ember-1 i punkt odniesienia dla każdej oszczędności, jaką deklaruje Ember-1 — działa z kontekstem 1 048 576 tokenów, z medianą opóźnienia blisko 8,0 sekundy, około 43,6 tokenów wyjściowych na sekundę i współczynnikiem błędów około 0,27%, przy znacznie większym ruchu. Sam Ember-1 nie znajduje się w OrcaRouter.
Te liczby stawiają tę decyzję w nowym świetle. Kimi K3 ma znacznie dłuższy czas do pierwszego tokenu i jest około dwa razy droższy w przeliczeniu na token wyjściowy niż Qwen3.8-Max, zachowując przy tym znacznie niższy współczynnik błędów pod dużo większym obciążeniem. Oszczędzająca tokeny pochodna K3 zmniejsza różnicę w kosztach, ale nie zamyka luki w opóźnieniach, ponieważ skrócenie rozumowania skraca fazę generowania, a nie kolejkę. Jeśli Twoje obciążenie jest wrażliwe na opóźnienia, a nie na koszty, model flagowy jest dziś lepszym wyborem, a kwestia wydajności nie ma tu znaczenia.
Który przekierować
Kieruj ruch do Qwen3.8-Max, gdy potrzebujesz okna kontekstu, danych wejściowych multimodalnych, opublikowanej ceny i usługi, pod którą możesz zaplanować budżet. Z założenia jest to bezpieczniejszy z tych dwóch: ogólnie dostępny, wyceniony i odświeżany dwa razy w ciągu dwóch miesięcy przez dostawcę, który ma za sobą utrzymywanie endpointu na bieżąco.
Wypróbuj Ember-1, gdy twój rachunek jest zdominowany przez tokeny rozumowania w długich pętlach agentowych, a korzystasz z modelu hostowanego, a nie z własnego sprzętu. Właściwym testem są dwa tygodnie, które daje ci wersja zapoznawcza, uruchomione w trybie shadow na ruchu produkcyjnym, z pomiarem tokenów na ukończone zadanie, a nie tokenów na żądanie. Czego nie należy robić, to wstawiać go jako bezpośredniego zamiennika flagowego modelu na podstawie wyniku 40%, który waha się od 6% do 52% w zależności od obciążenia.
Jeśli prawdziwym pytaniem jest, czy w ogóle dalej uruchamiać Kimi K3, na to możesz odpowiedzieć już dziś, bez żadnego podglądu: zarówno Kimi K3, jak i Qwen3.8-Max są dostępne w OrcaRouter za jednym kluczem, w cenie z cennika dostawcy bez marży, z automatycznym przełączaniem awaryjnym między dostawcami. Porównanie kosztu Twojego obciążenia w obu przypadkach to zmiana routingu, a nie projekt zakupowy — i daje Ci punkt odniesienia, dzięki któremu każdą deklarację o wydajności Ember-1 można zmierzyć własnymi liczbami, a nie liczbami laboratorium.

Szczera konkluzja jest taka, że te dwa modele są optymalizowane pod różne ograniczenia. Qwen3.8-Max powstał, by być najbardziej zaawansowanym dostępnym rozwiązaniem, i odpowiednio go wyceniono; Ember-1 powstał, by uczynić już drogi model tańszym w eksploatacji. Oba mają swoje uzasadnienie, a powodem, dla którego tego starcia nie da się jednoznacznie rozstrzygnąć, jest to, że oszczędności modelu pochodnego są określane względem cennika, w porównaniu z którym flagowiec jest znacząco tańszy.
Porównane w tym artykule1
Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie
