Wygenerowana karta tytułowa z napisem „Ember-1” i podtytułem „Jakość Kimi K3, około 40% mniej tokenów rozumowania” oraz trzema kartami: redukcja rozumowania 35–50%, Terminal Bench 2.1 82,0%, premiera: podgląd badawczy. W stopce widnieje: dane raportowane przez Fireworks, nieodtworzone; opublikowano 23 września 2026.
Guides & Insights

Ember-1 redukuje rozumowanie Kimi K3 o 40% — a najważniejszy jest drobny druk

Autor

Alistair Wren

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Liczba, która będzie przytaczana, to 40%. Fireworks Research opublikowało Ember-1 23 września 2026 r., opisując go jako wyspecjalizowaną pochodną Kimi K3 od Moonshot AI, która zachowuje dokładność K3, zużywając przy tym około 40% mniej tokenów. To realne i wyjątkowo konkretne twierdzenie, a towarzyszą mu trzy elementy: pełny arkusz benchmarków z kolumnami redukcji tokenów, dwa testy A/B klientów z produkcyjnego ruchu związanego z kodowaniem oraz status wydania, który nie jest ogólną dostępnością. Ember-1 ukazał się jako podgląd badawczy, na własnej platformie serverless dostawcy, z dwutygodniowym oknem dostępu i decyzją o stałym udostępnieniu, która zależy od popytu. Zrozumienie, która część tego jest dostarczonym produktem, a która dobrze uzasadnionym wynikiem badań, to cała istota ćwiczenia.

Jest też kolizja nazw, którą warto wyjaśnić, zanim przejdziemy do czegokolwiek innego. Osobny otwarty projekt badawczy o nazwie Ember (v0.1.5, od Slow Lit Labs) przez cały 2026 rok publikował ewaluacje spójności na długim horyzoncie i nie ma żadnego związku z tym modelem. Wszystko, co przeczytasz o tym, że Ember nie zdołał pobić Qwen3-8B w dopasowanych ustawieniach inferencji, dotyczy tamtego projektu. Ember-1, o którym tu mowa, jest pochodną Kimi K3 od Fireworks Research.

Czym właściwie jest Ember-1

Ember-1 nie jest nową architekturą ani nowym modelem bazowym. To Kimi K3, ponownie wytrenowany, aby rozumować bardziej zwięźle. Fireworks Research przeprowadziło ponad 50 eksperymentów treningowych i ponad 200 ewaluacji na własnym bezserwerowym stosie treningowym, obejmujących matematykę, programowanie, przestrzeganie instrukcji, konwersację, wyszukiwanie, korzystanie z narzędzi i inżynierię oprogramowania, z wyraźnym celem usunięcia rozumowania, które nie zmienia odpowiedzi. Laboratorium twierdzi, że długość rozumowania można by skrócić o 35–50% bez utraty dokładności w siedmiu benchmarkach i dwóch zbiorach ruchu produkcyjnego klientów. Każda z tych liczb jest raportowana przez dostawcę i nie została niezależnie odtworzona; na dzień pisania żadna strona trzecia nie opublikowała przebiegu Ember-1.

Sposób ujęcia ma znaczenie, ponieważ oczywista alternatywa już istniała. Kimi K3 jest dostarczany z ustawieniami intensywności rozumowania, a tani sposób na zużycie mniejszej liczby tokenów polega na zmniejszeniu intensywności. Fireworks Research twierdzi, że próbował tego i niskie ustawienie zbyt wiele traciło na jakości — co jest znanym wynikiem dla każdego, kto dostrajał poziomy intensywności w modelu rozumującym. Twierdzenie Ember-1 jest takie, że pokrętło intensywności jest zbyt zgrubne, a ponowne trenowanie jest precyzyjne.

A single-column scoreboard titled "Ember-1 — the scoreboard": base model Kimi K3 (Moonshot AI); what changed, shorter reasoning with the same answers; token reduction claimed 35-50% across seven benchmarks; Terminal Bench 2.1 82.0% against K3 Max 80.9%; SWE-bench Verified 92.2% against K3 Max 93.2%; weights and price, none published — research preview. The footer states every figure is Fireworks-reported and unreproduced.

Dlaczego tokeny rozumowania są warte aż tyle wysiłku

Rachunek modelu rozumującego nie jest zdominowany przez jego odpowiedź. Fireworks Research zauważa, że K3 może przeznaczyć ponad 90% generowanych tokenów na wewnętrzne rozumowanie, zanim napisze cokolwiek, co zobaczy użytkownik. W przypadku pojedynczego żądania jest to jedynie kosztowne. W pętli agenta obejmującej wiele tur to się kumuluje, ponieważ każda tura odtwarza poprzednią rozmowę, więc ślady rozumowania z wcześniejszych tur są ponownie odczytywane i ponownie rozliczane przy każdym kolejnym wywołaniu. Fireworks Research opisuje kontekst rosnący w przybliżeniu kwadratowo wraz z liczbą tur. To jest faktyczny cel tego wydania i dlatego głównym wskaźnikiem jest około 40% mniej tokenów, a nie skok jakości.

Mechanizm wyjaśnia również ryzyko. Kompresja, która usuwa zmarnowane rozważania, jest darmowa; kompresja, która usuwa krok potrzebny modelowi, już nie. Powszechnie opisywanym trybem awarii zbyt agresywnej redukcji rozumowania jest model, który pomija pośrednią weryfikację i przeskakuje do wniosku, co w przypadku agenta ujawnia się znacznie później jako błędne wywołanie narzędzia, a nie błędne zdanie. Powtarzane przez Fireworks Research podkreślanie równoważnej jakości brzmi jak odpowiedź na tę obawę, a liczby z testów A/B są najbliższym dowodem na jej poparcie — ze zwykłym zastrzeżeniem, że zbiory testowe, kryteria zaliczenia i wielkości próby zostały wybrane przez stronę formułującą to twierdzenie.

Arkusz benchmarku wraz z dołączoną do niego proweniencją.

To dane Fireworks Research, nieodtworzone. Prawa kolumna jest tą częścią, którą warto uważnie przeczytać: łączy każdy wynik z liczbą tokenów i dolarów, jakich wymagał w stosunku do K3 Max.

• Terminal Bench 2.1 (n=89) — Ember-1 82,0% vs K3 Max 80,9%, K3 High 77,6%, K3 Low 76,4%; o 51,9% mniej tokenów, o 23,10 USD mniej na zadanie.

• SWE-bench Verified (n=500) — Ember-1 92,2% vs K3 Max 93,2%; o 15,5% mniej tokenów, o 68,10 USD mniej na zadanie.

• SWE-Interact (n=75) — Ember-1 20,0% vs K3 Max 21,3%, K3 High 13,3%, K3 Low 6,7%; 32,5% mniej tokenów.

• DeepSWE 1.1 (n=113) — Ember-1 75,2% vs K3 Max 66,4%; o 23,7% mniej tokenów, o 126,90 USD mniej na zadanie.

• τ-2 Bench Airline (n=50) — Ember-1 66% vs K3 Max 64%, K3 High i Low — oba po 64%; o 5,9% mniej tokenów, o 0,30 USD mniej na zadanie.

Dwie rzeczy się wyróżniają. Po pierwsze, Ember-1 wygrywa bezapelacyjnie na Terminal Bench 2.1 i DeepSWE 1.1, przegrywając jednocześnie nieznacznie na SWE-bench Verified i SWE-Interact — wzorzec spójny z modelem, który nie tyle utracił zdolności, ile zmienił, na które zadania przeznacza deliberację. Po drugie, oszczędności tokenów są skrajnie nierówne: 51,9% na Terminal Bench wobec 5,9% na τ-2 Airline. Cokolwiek Ember-1 się nauczył, nie jest to jednolite 40-procentowe cięcie na myślenie. „Około 40%” w nagłówku to średnia w rozrzucie od mniej więcej 6% do mniej więcej 52%, a zespół, którego obciążenie pracą przypomina τ-2 Airline, nie powinien oczekiwać, że to odczuje.

Produkcyjne testy A/B są bardziej przekonującym dowodem, właśnie dlatego że nie zostały stworzone jako benchmarki. W jednym z obciążeń koderskich klienta Ember-1 uzyskał wynik 0,753 wobec 0,751 K3, potrzebował 21,4 kroku wobec 23,8 i wygenerował 29,9 tys. tokenów wyjściowych wobec 49,3 tys. — co stanowi redukcję tokenów rozumowania o 71,3% i tokenów ogółem o 39%, przy mniej więcej równoważnej jakości. Drugi klient zaobserwował około 35% mniej tokenów na zadanie przy porównywalnej jakości, a Fireworks Research twierdzi, że najpierw przeprowadził tę zmianę na własnym wewnętrznym ruchu koderskim i coworkingowym, a zgłoszonym rezultatem było to, że nikt tego nie zauważył. Traktuj to wszystko jako dane zgłoszone przez dostawcę, ale traktuj je jako najsilniejszą formę danych zgłoszonych przez dostawcę: preferencje w testach A/B i dane o ukończeniu zadań trudniej jest zmanipulować niż ranking.

Jest jeszcze jedna ocena, na Bedside Bench firmy Doximity — 500 zwalidowanych przez lekarzy przypadków klinicznych w dziesięciu kategoriach — w której Fireworks Research twierdzi, że Ember-1 wyznaczył nową granicę Pareto pod względem kosztu na zadanie, porównując go z modelami otwartymi i zamkniętymi, w tym GPT-5.6 Sol, GPT-6 Astra i Claude Opus 5. To twierdzenie dostawcy o pozycji na granicy Pareto, które jest twierdzeniem o dwuwymiarowym kompromisie, a nie o pojedynczym wyniku, i jest tyle warte, ile założenia kosztowe, które się za nim kryją. Te założenia pochodziły z publicznego cennika API Kimi K3. Co prowadzi nas do części tej historii, którą czytelnik może dziś faktycznie zweryfikować.

A screenshot of OrcaRouter's model page for Kimi K3, showing the MoonshotAI Kimi K3 listing priced at $3.00 per 1M input tokens and $15.00 per 1M output tokens, a p50 time-to-first-token of 8.00s, 749.2M tokens of traffic over seven days, a 1M-token context window, and a Python snippet calling the model at api.orcarouter.ai/v1.

Model bazowy to część, którą możesz już kierować

Cała argumentacja kosztowa Ember-1 jest mierzona względem opublikowanych stawek Kimi K3. Kimi K3 jest dostępny na OrcaRouter w cenie 3,00 USD za milion tokenów wejściowych, 0,30 USD za milion tokenów wejściowych z pamięci podręcznej i 15,00 USD za milion tokenów wyjściowych, z oknem kontekstu wynoszącym 1 048 576 tokenów. To ten sam cennik, którego używa porównanie Fireworks Research, i warto wiedzieć, że oszczędności w tych kolumnach redukcji tokenów są obliczane względem liczb, które możesz zobaczyć samodzielnie, a nie względem wewnętrznego modelu kosztów dostawcy.

Sam Ember-1 nie znajduje się na OrcaRouter. Jest dostępny wyłącznie za pośrednictwem własnej platformy serverless dostawcy, w ramach podglądu badawczego, a Fireworks Research nie opublikował dla niego ceny — więc kwoty w dolarach w tabeli benchmarków pochodzą ze stawek K3 i liczby tokenów, a nie z istniejącej karty cenowej Ember-1. Jeśli interesuje cię arytmetyka, uczciwa kolejność działań jest taka: wycenić obciążenie według dzisiejszej trasy K3, przyjąć procentowe redukcje tokenów jako górną granicę tego, co może dać przełączenie, i poczekać na opublikowaną stawkę, zanim oszczędność zacznie się modelować jako pieniądze.

To, w czym OrcaRouter faktycznie pomaga w tej sytuacji, to zabezpieczenie. Badawcza wersja zapoznawcza z dwutygodniowym oknem dostępu to dokładnie taki model, jaki chcesz wypróbować, nie opierając na nim ścieżki produkcyjnej, a sposobem, by zrobić to bez drugiej umowy, jest umieszczenie go za tym samym punktem końcowym co wszystko inne, co wywołujesz. OrcaRouter obsługuje ponad 200 modeli za jednym API z automatycznym przełączaniem awaryjnym, więc model w wersji zapoznawczej, który okaże się niedostępny w przyszłym miesiącu, to zmiana routingu, a nie migracja. Nic w Ember-1 tego nie wymaga — ale nic w dwutygodniowym oknie też nie przemawia przeciwko temu.

Co zrobić z tym wydaniem

Jeśli już uruchamiasz Kimi K3 w pętli agentowej, liczby Ember-1 opisują twój rachunek. Problem wieloetapowego odtwarzania jest realny, stanowi dominujący koszt w długich przebiegach agentowych, a model, który skraca własne ślady bez zmiany odpowiedzi, jest wart czasu poświęconego na ewaluację. Właściwym testem nie jest tabela benchmarków; to twój własny ruch, uruchomiony w trybie shadow — wyślij część rzeczywistych żądań do obu modeli, porównaj wyniki, przez tydzień lub dwa pozostaw wyniki na produkcji bez zmian, zanim cokolwiek zmienisz. To również rada, której udziela własne krytyczne grono odbiorców tego wydania, i jest ona słuszna.

Jeśli uruchamiasz obciążenie o niskiej deliberacji albo takie, w którym dominują krótkie wywołania jednorazowe, oszczędności w dużej mierze znikają, a wiersz τ-2 Airline to twoje realistyczne oczekiwanie. A jeśli potrzebujesz zobowiązania klasy produkcyjnej — ceny, poziomu usług, gwarancji, że punkt końcowy będzie istniał za sześć miesięcy — Ember-1 jeszcze go nie oferuje. To podgląd badawczy, którego trwałość Fireworks Research wyraźnie uzależnia od popytu. Ciekawym pytaniem w ciągu najbliższego miesiąca jest to, czy dwutygodniowe okno stanie się stałą opcją serwowania i czy strona trzecia odtworzy którąkolwiek z tych liczb. Dopóki jedno z nich nie nastąpi, to mocny wynik do przeczytania i słaby do oparcia na nim budżetu.

A screenshot of OrcaRouter's model catalogue headed "Models — 203 models · 15 providers · one API, one bill", with filter panels for input modalities, context length and input price, a "How to call any model" panel showing a POST to api.orcarouter.ai/v1/chat/completions, and model cards for OpenAI GPT-6 Luna, OpenAI GPT-6 Sol, Anthropic Claude Opus 5 and Grok 4.7 with their per-million-token rates.

Nic z tego nie powinno być odczytywane jako umniejszanie tej pracy. Usuwanie rozumowania bez utraty dokładności to trudniejszy problem niż dodawanie go, a robienie tego na bazie cudzego modelu frontier zamiast trenowania własnego to kształt, jaki przybrała duża część prac nad możliwościami w 2026 roku. Ember-1 to pierwsze wydanie z serii, która według Fireworks Research ma być kontynuowana, a szablon — weź model, który już jest dobry, ponownie wytrenuj jedną oś jego zachowania, sprzedawaj deltę w tokenach — jest wart obserwowania niezależnie od tego, jak wypadnie ten konkretny podgląd.