Wygenerowana karta tytułowa o treści „Ember-1 kontra Qwen3.8-Max” z podtytułem „Oszczędna na tokenach pochodna przeciwko flagowcowi”, nad dwiema kartami: Ember-1 — „deklarowane o 40% mniej tokenów” i „brak opublikowanej ceny”; Qwen3.8-Max — „2 dolary na wejściu, 6 dolarów na wyjściu” i „kontekst 1 mln tokenów”.
Guides & Insights

Ember-1 kontra Qwen3.8-Max: Oszczędzający tokeny wariant pochodny przeciwko flagowcowi

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Dwa modele w tym pojedynku mają prawdziwą liczbę na tym samym benchmarku, a to wciąż niczego nie rozstrzyga. Ember-1 to wyspecjalizowana pochodna Kimi K3 od Moonshot AI, opracowana przez Fireworks Research, opublikowana 23 września 2026, osiągająca 82,0% na Terminal Bench 2.1 przy zużyciu około połowy tokenów, które zużywa jego model bazowy. Qwen3.8-Max to flagowy model Aliba​by — rzadki model mieszaniny ekspertów o około 2,4 biliona parametrów, z około 95 miliardami aktywnymi na token — ogólnie dostępny od 3 sierpnia 2026, raportujący 86,6% na tym samym benchmarku. Obie te liczby są raportowane przez dostawców, oba laboratoria uruchomiły własne środowiska testowe, a różnica 4,6 punktu między dwoma nieopublikowanymi konfiguracjami ewaluacyjnymi nie jest werdyktem. To, co jest porównywalne, to pieniądze, i to właśnie tutaj ten pojedynek staje się interesujący: cała teza jednego modelu jest taka, że nie należy płacić za tokeny, których się nie potrzebuje, a drugi to flagowy model w cenie 2 dolarów za milion na wejściu i 6 dolarów za milion na wyjściu.

Czym tak naprawdę jest każdy model

Ember-1 nie jest nowym modelem w żadnym sensie architektonicznym. To Kimi K3 ponownie wytrenowany, by rozumować bardziej zwięźle, zbudowany przez Fireworks Research w ramach ponad 50 eksperymentów treningowych i ponad 200 ewaluacji na własnym bezserwerowym stosie treningowym. Twierdzenie laboratorium jest takie, że rozumowanie K3 jest dłuższe, niż wymagają tego zadania, a nadmiar można usunąć bez zmiany odpowiedzi — długość rozumowania spadła o 35–50% bez utraty dokładności w siedmiu benchmarkach i dwóch produkcyjnych testach A/B u klientów. Jest dostępny jako podgląd badawczy na własnej bezserwerowej platformie dostawcy, bez opublikowanych wag i bez opublikowanej ceny.

Qwen3.8-Max to zupełnie inny rodzaj obiektu. To flagowy poziom Aliba​ba, natywnie multimodalny w zakresie danych wejściowych tekstowych, obrazowych i wideo, z oknem kontekstu wynoszącym milion tokenów, odświeżony dwukrotnie od premiery: aktualizacja po treningu z 2 września 2026 r. ukierunkowana na kodowanie i profesjonalną pracę biurową oraz szybsza warstwa serwowania ogłoszona 22 września 2026 r. Aliba​ba pozycjonuje go przeciwko GPT-5.5, Claude Opus 4.7 i Gemini 3.1 Pro, a jej opublikowany arkusz oceny odzwierciedla tę ambicję — GPQA Diamond 92,6, OSWorld-Verified 86,1, SWE-bench Pro 67,7, PaperBench 93,0, IFBench 82,8 oraz Humanity's Last Exam na poziomie 43,6, wszystkie raportowane przez dostawcę.

A two-column scoreboard titled "Ember-1 vs Qwen3.8-Max — the scoreboard" comparing six dimensions. Ember-1: input/output price not published, computed from Kimi K3 rates of $3 and $15; context not published, base model carries 1M; text input; Terminal Bench 2.1 82.0% vendor-reported; research preview with a two-week window; not routed on OrcaRouter. Qwen3.8-Max: $2.00 in and $6.00 out per 1M tokens; 1,000,000-token context; text, image and video input; Terminal Bench 2.1 86.6% vendor-reported; generally available and priced; routed on OrcaRouter. The footer notes both Terminal Bench figures are vendor-reported and were produced on different harnesses.

Karty stawek obok siebie

Jedno z nich ma cenę, a drugie nie, co jest pierwszą praktyczną asymetrią.

• Dane wejściowe — Ember-1: brak opublikowanych; arkusz benchmarkowy wylicza dolary na podstawie cennika Kimi K3. Qwen3.8-Max: 2,00 USD za milion tokenów w OrcaRouter.

• Dane wyjściowe — Ember-1: nie opublikowano. Qwen3.8-Max: 6,00 USD za milion tokenów.

• Buforowane wejście — Ember-1: nie dotyczy. Qwen3.8-Max: 0,25 USD za milion tokenów za odczyty z pamięci podręcznej, co stanowi jedną ósmą stawki za wejście i ma ogromne znaczenie w pętlach agentowych, w których ten sam kontekst jest przesyłany ponownie w każdej turze.

• Okno kontekstowe — Ember-1: nie opublikowano dla wersji zapoznawczej; jego model bazowy ma 1 048 576 tokenów. Qwen3.8-Max: 1 000 000 tokenów.

• Multimodalność — Ember-1: tekst. Qwen3.8-Max: tekst, obraz i wideo na wejściu, tekst na wyjściu.

• Wagi — Ember-1: brak. Qwen3.8-Max: istnieje wydanie z otwartymi wagami, ale jest tylko tekstowe i brakuje mu pełnego okna kontekstowego oraz wejścia wizyjnego udostępnianego punktu końcowego.

• Dostęp — Ember-1: podgląd badawczy, dwutygodniowe okno serverless, trwałość uzależniona od zapotrzebowania. Qwen3.8-Max: ogólnie dostępny i wyceniony.

Zanim zaczniesz cokolwiek modelować, zwróć uwagę na jedną rzecz dotyczącą stawek Qwen3.8-Max: Alibaba od premiery wielokrotnie zmieniała sposób pakietowania tego modelu, a międzynarodowy cennik nie zawsze odpowiadał sierpniowej cenie z nagłówka. Przyjmij, że 2,00 USD i 6,00 USD to obecna cena tej trasy na naszej platformie — która przekazuje cenę katalogową dostawcy bez marży, więc zmiana u dostawcy pojawia się tego samego dnia — i sprawdź cennik, zanim przeznaczysz na to budżet.

Dlaczego porównanie benchmarków nie działa

82,0% Ember-1 i 86,6% Qwen3.8-Max to oba wyniki z Terminal Bench 2.1, co sprawia, że wyglądają na porównywalne, ale nie czyni ich porównywalnymi. Arkusz Ember-1 podaje swoją liczbę względem wariantów Kimi K3 ocenianych przez Fireworks Research, na 89 próbkach, z dołączonymi deltami tokenów i kosztów. Liczba Qwen3.8-Max pochodzi z własnego arkusza ewaluacyjnego Alibaba. Różne laboratoria, różne środowiska testowe, różne szkielety agentów — a w benchmarku, w którym wyniki zmieniają się o kilka punktów już przy samym wyborze szkieletu, różnica 4,6 punktu mieści się w granicach szumu metodologicznego.

To, co można odczytać z arkusza Ember-1, to kolumna tokenów – jedyna rzecz, do zmiany której wytrenowano model. Względem własnej bazy Ember-1 zużywa o 51,9% mniej tokenów na Terminal Bench 2.1, o 32,5% mniej na SWE-Interact, o 23,7% mniej na DeepSWE 1.1 i tylko o 5,9% mniej na τ-2 Bench Airline. Ta rozpiętość to uczciwy nagłówek. Model, który ogranicza deliberację, jest wart bardzo wiele na benchmarkach, na których model bazowy myśli nadmiernie, a prawie nic tam, gdzie tego nie robi, i nie można wiedzieć, z jakim rodzajem obciążenia ma się do czynienia, bez zmierzenia własnego.

Koszt na ukończone zadanie, rozpracowany

Oto arytmetyka, która faktycznie o tym decyduje, wykorzystująca opublikowane stawki Kimi K3 jako zastępcze dla kosztu Ember-1, ponieważ Ember-1 nie ma własnych. Kimi K3 to 3,00 USD za milion tokenów wejściowych, 0,30 USD za tokeny z pamięci podręcznej i 15,00 USD za tokeny wyjściowe — dokładnie taki cennik, jakiego Fireworks Research użył we własnym porównaniu. Qwen3.8-Max to 2,00 USD za wejście i 6,00 USD za wyjście, przy czym odczyty z pamięci podręcznej kosztują 0,25 USD.

Po stronie wejściowej Qwen3.8-Max jest już tańszy o jedną trzecią. Po stronie wyjściowej jest 2,5 razy tańszy za token. Oznacza to, że redukcja liczby tokenów w Ember-1 nie konkuruje ze statycznym rachunkiem — konkuruje z flagowym modelem, który jest tańszy za token, zanim jeszcze wykonana zostanie jakakolwiek praca nad wydajnością. Własny produkcyjny test A/B Fireworks Research pokazał spadek liczby tokenów wyjściowych z 49,3 tys. do 29,9 tys., czyli łączną redukcję o 39%; zastosuj to do stawki wyjściowej Qwen3.8-Max, a otrzymasz takie samo 39% oszczędności, co jest mniejszą korzyścią absolutną niż ten sam procent zastosowany do stawki 15 USD w K3.

Argument za efektywnością Ember-1 jest zatem najsilniejszy, gdy porówna się go z jego własnym modelem bazowym, i dokładnie taki argument przedstawia premiera. W zestawieniu z Qwen3.8-Max porównanie przenosi się na możliwości na dolara, gdzie większy kontekst flagowego modelu, wejście multimodalne i dostępność za określoną cenę są kontrargumentami — i gdzie nikt nie opublikował bezpośredniego porównania, które by to rozstrzygnęło.

A screenshot of OrcaRouter's model page for Qwen3.8 Max, showing the qwen/qwen3.8-max listing priced at $2.00 per 1M input tokens and $6.00 per 1M output tokens, a p50 time-to-first-token of 1.98s, 33.3M tokens of traffic over seven days, a 1M-token context window accepting text, image and video, and a Python snippet calling api.orcarouter.ai/v1.

Co pokazują nasze własne dane routingu

Dwa z trzech uwzględnionych tu modeli to aktywne trasy w OrcaRouter, co daje obraz, jakiego nie zawiera żaden arkusz benchmarkowy. Qwen3.8-Max jest udostępniany z kontekstem 1 000 000 tokenów, z medianą opóźnienia pierwszego tokenu na poziomie około 2,0 sekundy i około 52,7 tokenów wyjściowych na sekundę w ciągu ostatnich siedmiu dni, przy współczynniku błędów około 4,2%. Kimi K3 — model bazowy Ember-1 i punkt odniesienia dla każdej oszczędności, jaką deklaruje Ember-1 — działa z kontekstem 1 048 576 tokenów, z medianą opóźnienia blisko 8,0 sekundy, około 43,6 tokenów wyjściowych na sekundę i współczynnikiem błędów około 0,27%, przy znacznie większym ruchu. Sam Ember-1 nie znajduje się w OrcaRouter.

Te liczby stawiają tę decyzję w nowym świetle. Kimi K3 ma znacznie dłuższy czas do pierwszego tokenu i jest około dwa razy droższy w przeliczeniu na token wyjściowy niż Qwen3.8-Max, zachowując przy tym znacznie niższy współczynnik błędów pod dużo większym obciążeniem. Oszczędzająca tokeny pochodna K3 zmniejsza różnicę w kosztach, ale nie zamyka luki w opóźnieniach, ponieważ skrócenie rozumowania skraca fazę generowania, a nie kolejkę. Jeśli Twoje obciążenie jest wrażliwe na opóźnienia, a nie na koszty, model flagowy jest dziś lepszym wyborem, a kwestia wydajności nie ma tu znaczenia.

Który przekierować

Kieruj ruch do Qwen3.8-Max, gdy potrzebujesz okna kontekstu, danych wejściowych multimodalnych, opublikowanej ceny i usługi, pod którą możesz zaplanować budżet. Z założenia jest to bezpieczniejszy z tych dwóch: ogólnie dostępny, wyceniony i odświeżany dwa razy w ciągu dwóch miesięcy przez dostawcę, który ma za sobą utrzymywanie endpointu na bieżąco.

Wypróbuj Ember-1, gdy twój rachunek jest zdominowany przez tokeny rozumowania w długich pętlach agentowych, a korzystasz z modelu hostowanego, a nie z własnego sprzętu. Właściwym testem są dwa tygodnie, które daje ci wersja zapoznawcza, uruchomione w trybie shadow na ruchu produkcyjnym, z pomiarem tokenów na ukończone zadanie, a nie tokenów na żądanie. Czego nie należy robić, to wstawiać go jako bezpośredniego zamiennika flagowego modelu na podstawie wyniku 40%, który waha się od 6% do 52% w zależności od obciążenia.

Jeśli prawdziwym pytaniem jest, czy w ogóle dalej uruchamiać Kimi K3, na to możesz odpowiedzieć już dziś, bez żadnego podglądu: zarówno Kimi K3, jak i Qwen3.8-Max są dostępne w OrcaRouter za jednym kluczem, w cenie z cennika dostawcy bez marży, z automatycznym przełączaniem awaryjnym między dostawcami. Porównanie kosztu Twojego obciążenia w obu przypadkach to zmiana routingu, a nie projekt zakupowy — i daje Ci punkt odniesienia, dzięki któremu każdą deklarację o wydajności Ember-1 można zmierzyć własnymi liczbami, a nie liczbami laboratorium.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window and a Python snippet calling api.orcarouter.ai/v1.

Szczera konkluzja jest taka, że te dwa modele są optymalizowane pod różne ograniczenia. Qwen3.8-Max powstał, by być najbardziej zaawansowanym dostępnym rozwiązaniem, i odpowiednio go wyceniono; Ember-1 powstał, by uczynić już drogi model tańszym w eksploatacji. Oba mają swoje uzasadnienie, a powodem, dla którego tego starcia nie da się jednoznacznie rozstrzygnąć, jest to, że oszczędności modelu pochodnego są określane względem cennika, w porównaniu z którym flagowiec jest znacząco tańszy.

Porównane w tym artykule1

Wykryto na podstawie tego artykułu · Benchmarki: Artificial Analysis · aktualizowane codziennie