Wygenerowana karta hero zatytułowana 'Reflection Beam vs Kimi K3' z podtytułem 'Ta sama nazwa benchmarku, dwa różne środowiska testowe.' oraz trzema żetonami statystyk o treści 'Terminal-Bench 2.1: 80.1 vs 88.3', 'niezależny przebieg: 85.0' i 'cena: niepublikowana vs $3 / $15'. Trzy płaskie ikony liniowe znajdują się poniżej: schowek ze znacznikiem wyboru, linijka mierząca słupek i lupa nad wykresem słupkowym. Logo OrcaRouter jest wkomponowane w prawym dolnym rogu.
Guides & Insights

Reflection Beam vs Kimi K3: ta sama nazwa benchmarku, dwa różne harnessy

Autor

Rowan Sterling

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Reflection Beam uzyskuje 80,1 punktu w Terminal-Bench 2.1. Kimi K3 uzyskuje 88,3. Postaw te dwie liczby obok siebie — tak jak zrobiła to większość publikacji z tego tygodnia — a dojdziesz do wniosku, że Beam jest około ośmiu punktów za najlepszym otwartym modelem w tej dziedzinie. Ale te dwie liczby nie pochodzą z tego samego pokoju. Wynik Beam 80,1 jest raportowany przez dostawcę i pochodzi z tabeli w samym wpisie Reflection o premierze. Wynik Kimi K3 88,3 również jest raportowany przez dostawcę, tym razem z własnej tabeli Moonshot — a tabela dostawcy podaje wynik konkurenta tylko wtedy, gdy został on uzyskany na własnym środowisku testowym dostawcy, przy własnym zestawie promptów dostawcy i przy własnym ustawieniu poziomu wysiłku dostawcy. Podmiot trzeci, Artificial Analysis, przeprowadził od tego czasu test Kimi K3 na benchmarku o tej samej nazwie i opublikował wynik 85,0. To różnica 4,9 punktu, a nie 8,2 — a kierunek tej korekty jest całkowicie przewidywalny, ponieważ liczba, która topnieje, zawsze pochodzi z laboratorium, które ma coś do udowodnienia.

Na tym polega cały problem z porównaniem, które zapowiada tytuł tego artykułu, i dlatego ten tekst poświęca pierwszą połowę na pochodzenie modeli, a nie na wyniki. Reflection Beam to rzadki model typu mixture-of-experts o 501 miliardach parametrów, z 23 miliardami parametrów aktywnych na token, ogłoszony 5 października 2026 r. przez Reflection AI, z beta endpointem zgodnym z OpenAI dostępnym tego samego dnia. Kimi K3 to flagowy otwarty model Moonshot AI, wpisany do naszego własnego katalogu z datą premiery 15 lipca 2026 r. i niezależnie oceniony przez Artificial Analysis. Jeden z nich to gotowy produkt z cennikiem i uruchomieniem w niezależnym środowisku testowym; drugi to beta z listą oczekujących, której wagi, raport techniczny i cena jeszcze nie istnieją. Porównywanie ich nie jest symetrycznym ćwiczeniem, a udawanie, że jest inaczej, dałoby stronę, która wygląda precyzyjnie, a jest błędna.

Wersja 30-sekundowa

• Beam jest na papierze szybszy w przeliczeniu na FLOP, w praktyce nie ma podanej ceny i pozostaje nieodtworzony. Kimi K3 jest oceniany przez podmiot trzeci, wyceniony na 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, i jest ogólnie dostępny.

• W przypadku jedynego benchmarku, na którym uruchomiono oba — Terminal-Bench 2.1 — uczciwa różnica wynosi około pięciu punktów, a nie ośmiu, gdy liczby każdej ze stron pochodzą z neutralnego środowiska testowego.

• Prawdziwe zalety Beama mają charakter strukturalny, a nie liczbowy: profil serwowania z 23 mld aktywnych parametrów i obiecana licencja Apache 2.0. Żadnego z nich nie można dziś wykorzystać.

• Jeśli potrzebujesz modelu w tym tygodniu, to nie jest rzut monetą. To jeden model już dostępny i jedna lista oczekujących.

Co Reflection faktycznie opublikowało, i przeciwko komu

Post premierowy Reflection przedstawia jeden scorecard na tle siedmiu innych modeli: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max i DeepSeek V4.1 Flash. Wszystkie liczby w tabeli pochodzą od dostawcy, żadna nie została niezależnie odtworzona, a na stronie Artificial Analysis nie ma podstrony dla Reflection Beam — podstrona modelu zwraca błąd 404 na ich witrynie na dzień 6 października 2026 r. Kilka komórek w oryginale oznaczono jako NR, ponieważ danego modelu nie uruchomiono.

Oto cały wycinek tej tabeli dotyczący porównania Beam i K3, po jednej linii na wymiar:

• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2

• DeepSWE v1.1 — Beam 44.4 kontra Kimi K3 68.0

• SWE Atlas Codebase QnA — Beam 34.6 vs Kimi K3 68.0

• HLE, bez narzędzi — Beam 36.2 vs Kimi K3 46.9

• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5

• SciCode — Beam 49,7 vs Kimi K3 58,7

• MCP Atlas — Beam 78.7 vs Kimi K3 82.3

• BrowseComp z zarządzaniem kontekstem — Beam 77,4 vs Kimi K3 91,2

• DeepSearchQA z zarządzaniem kontekstem — Beam 80.1 vs Kimi K3 95.0

Przeczytaj tę listę uczciwie, a wyłoni się kształt premiery. Reflection nigdzie nie twierdzi, że wygrywa z K3. Twierdzi, że plasuje się blisko czołówki swojego poziomu, zużywając przy tym od trzech do czterech razy mniej mocy obliczeniowej na wnioskowanie niż GLM 5.2 przy porównywalnych wynikach rozumowania — a jedyny wiersz, w którym oba modele są blisko siebie, Terminal-Bench 2.1, jest tym wierszem, w którym porównanie jest najmniej wiarygodne.

Dlaczego harness ma większe znaczenie niż wynik

Nazwa benchmarku to etykieta, a nie specyfikacja. Terminal-Bench 2.1 oznacza konkretny zestaw zadań uruchamianych w ramach konkretnego szkieletu agenta, z konkretną polityką ponownych prób, konkretnym budżetem tokenów i konkretnym ustawieniem wysiłku rozumowania. Dwa laboratoria mogą uczciwie podać wynik „Terminal-Bench 2.1” i uzyskać liczby, których nie da się porównać, ponieważ szkielet i ustawienie wysiłku odpowiadają za większość wariancji. Artificial Analysis istnieje jako organizacja właśnie z tego powodu: uruchamia jeden harness, w jednej konfiguracji, na wielu modelach, dzięki czemu jego liczby można od siebie odejmować.

Więc 80,1, które Reflection podaje dla Beam, to liczba producenta uzyskana na producenckim stanowisku testowym, a 88,3, które podaje dla K3, to również liczba producenta — przy czym tym producentem jest Reflection, mierzący własnego konkurenta. Ta druga wartość to najmniej wiarygodna liczba w tym wierszu: laboratorium uruchamiające wagi rywala na własnym szkielecie testowym nie ma żadnej zachęty, by uruchamiać je w najlepszej konfiguracji rywala, ani obowiązku ujawnienia tej, którą wybrało. Nie ma w tym nic nieuczciwego; to po prostu liczba, której pochodzenie nie uzasadnia wagi, jaką przypisały jej relacje medialne.

Własny przebieg Artificial Analysis daje Kimi K3 wynik 85,02 w Terminal-Bench 2.1, obok 12,6 w Terminal-Bench v4.0 — innym i trudniejszym teście — AA Coding Index na poziomie 76,2 (9. miejsce wśród modeli na liście rankingowej), Intelligence Index na poziomie 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 i Long-Context Recall na poziomie 88,7. Są one odczytane z karty katalogowej K3 w naszym własnym systemie, ze źródłem artificialanalysis.ai, a migawka ewaluacji jest datowana na 15 lipca 2026 r. Beam ma jedną liczbę w uniwersum tej listy i pochodzi ona od Reflection. Ta nieobecność powinna być tymczasowa, a nie trwała: Artificial Analysis oświadczyło, że Reflection dało mu dostęp i że poddaje ten model benchmarkowi, a jego własne wczesne sformułowanie — że Beam „będzie jednym z najbardziej oszczędnych pod względem tokenów otwartych modeli, jakie widzieliśmy na jego poziomie inteligencji” — to ośrodek benchmarkowy sygnalizujący oczekiwanie, a nie raportujący wynik. Dopóki ten wynik się nie pojawi, liczby z tego artykułu nie są odejmowalne, i nie zamierzamy udawać, że jest inaczej.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Ile kosztuje każdy z nich i czym każdy z nich jest

Porównanie kosztów nie jest wyrównane, a właściwie wcale nie jest porównaniem, ponieważ jedna jego strona jest pusta.

• Cena — Kimi K3: 3,00 USD za milion tokenów wejściowych / 15,00 USD za milion tokenów wyjściowych, z odczytami z pamięci podręcznej po 0,30 USD, w porównaniu z Reflection Beam: brak opublikowanej ceny gdziekolwiek na blogu, w dokumentacji lub na liście modeli Reflection, a konsola platformy znajduje się za ścianą rejestracji.

• Kontekst — 1 048 576 tokenów w Kimi K3 vs 256 000 w wersji beta Beam, z przypisem w samej dokumentacji Beam o treści: „okno kontekstowe może się zmienić w trakcie trwania wersji beta”.

• Modalność — Kimi K3 przyjmuje tekst i obrazy; Reflection Beam to tekst na wejściu, tekst na wyjściu — bez ścieżki obrazu ani dźwięku na premierze.

• Dostępność — Kimi K3 jest ogólnie dostępny od dziś; Reflection Beam to beta z listą oczekujących, a jej wagi obiecano udostępnić później w październiku na licencji Apache 2.0.

• Niezależne wyniki — K3 ma pełny wiersz Artificial Analysis; Beam nie ma żadnych.

• Profil serwowania — Kimi K3 to duży, dość gęsty model klasy frontier osiągający 46,8 tokenów wyjściowych na sekundę w naszym własnym pomiarze w playgroundzie z ostatniego tygodnia; 23B aktywnych parametrów Beam to prawdziwy argument architektoniczny za niższym opóźnieniem i niższym kosztem na token, ale nie ma publicznie dostępnego endpointu, na którym można by go zmierzyć.

Twierdzenie o wydajności zasługuje na jeszcze jedno zdanie ostrożności, bo to główny nagłówek premiery i wykonuje więcej pracy, niż jest w stanie udźwignąć. „3 do 4× mniej obliczeń na wnioskowanie" w Reflection pochodzi z wykresu, który przybliża FLOPs jako dwukrotność liczby aktywnych parametrów pomnożoną przez średnią liczbę wygenerowanych tokenów. Ten wzór celowo pomija wstępne przetwarzanie promptu, koszt uwagi i narzut obsługi — czyli te pozycje rachunku, które dominują w długokontekstowej pracy agentowej. To szacunek na kolanie stosunku obliczeń, a nie pomiar, nie kwota w dolarach, i został stworzony przez dostawcę. Traktuj go jako hipotezę, którą wagi pozwolą przetestować komuś innemu.

Gdzie w tym plasuje się OrcaRouter

Kimi K3 to jedna z naszych tras. Jest wyceniony na 3,00 USD za wejście i 15,00 USD za wyjście za milion tokenów, a odczyt z pamięci podręcznej kosztuje 0,30 USD — to stawka dostawcy Moonshot przekazana dalej bez żadnych dodatków, więc jeśli Moonshot zmieni swój cennik, kwota na naszej stronie zmieni się tego samego dnia, a nie wtedy, gdy odsprzedawca zaktualizuje ofertę. Można go wywołać za pomocą jednego klucza zgodnego z OpenAI, obok ponad 200 innych modeli, co ma tu znaczenie z konkretnego powodu: uczciwa odpowiedź na pytanie „Beam czy K3?” brzmi, że zespół, który się zabezpiecza, nie powinien wybierać. Ponieważ automatyczne przełączanie awaryjne jest częścią routingu, a nie czymś, co trzeba zbudować, model taki jak Beam — w wersji beta, bez ceny, nieoceniony przez żadną stronę trzecią — jest dokładnie tym, co umieszcza się na części ruchu, a nie na ścieżce krytycznej. Domyślnie kierujesz pracę do K3, wysyłasz Beamowi wycinek, gdy przyjdzie zaproszenie z listy oczekujących, i pozwalasz routingowi wrócić do K3 w razie błędu. To decyzja, którą można podjąć w sprawie nieprzetestowanego modelu. Postawienie na niego produkcyjnej ścieżki już nie.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

Co zmieniłoby ten werdykt?

Trzy rzeczy, w kolejności od najważniejszej do najmniej ważnej.

Cena. Gdyby Beam uplasował się poniżej poziomu K3, argument o wydajności stałby się konkretny, a nie teoretyczny. Po drugie, wagi. Apache 2.0 plus raport techniczny pozwoliłyby każdemu dysponującemu kilkoma węzłami zmierzyć liczbę tokenów na sekundę na GPU przy ustalonym progu jakości — to test, który faktycznie rozstrzyga twierdzenie o możliwościach obliczeniowych. Po trzecie, uruchomienie zestawu testowego przez niezależną stronę. Reflection dał Artificial Analysis dostęp i oczekuje się, że da to wynik; dopóki ta liczba nie zostanie opublikowana, każda krążąca liczba z porównania Beam–K3 prowadzi z powrotem do dokumentu napisanego przez jednego z dwóch dostawców.

Dwa pytania, na które warto odpowiedzieć bezpośrednio

Czy Reflection Beam jest lepszy niż Kimi K3?

Na podstawie dostępnych dziś dowodów — nie, i nikt nie opublikował dowodów, że tak jest. Własna tabela Reflection stawia K3 na czele we wszystkich dziesięciu wspólnych wierszach powyżej, a w kilku z nich przewaga (SWE Atlas 34.6 vs 68.0, DeepSearchQA 80.1 vs 95.0) nie jest mała. Argument Beam opiera się na koszcie na jednostkę możliwości, a ten argument pozostaje wykresem narysowanym przez dostawcę, dopóki nie istnieją wagi i cena.

Czy powinienem poczekać na wagi Beam, zanim zacznę budować na K3?

Tylko jeśli self-hosting jest wymogiem, a nie preferencją, ponieważ to jedyna oś, na której te dwa rozwiązania nie są zamiennikami — K3 oferuje wyłącznie API, podczas gdy Beam obiecuje wagi na licencji Apache 2.0. Jeśli korzystasz z API, K3 jest dostępne, ocenione i wycenione, a Beam to lista oczekujących. Nie ma wariantu tej decyzji, dla którego warto byłoby opóźniać projekt.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection dał nam datę i wykres, a data to nie model. Jedyne, co premiera rzeczywiście ustala, to że model 501B aktywujący 23B parametrów można wytrenować tak, by plasował się w odległości kilku punktów od otwartej granicy — co, jeśli wagi się pojawią, a liczby się utrzymają, jest istotnym wynikiem dotyczącym efektywności. To jeszcze nie powód, by przenosić pracę z modelu, który faktycznie został zmierzony przez stronę trzecią.