
Reflection Beam vs Kimi K3: ta sama nazwa benchmarku, dwa różne harnessy
- openaiNOWOŚĆOpenAI: GPT-6.1 Sol2026-09-2952Inteligencja
- anthropicNOWOŚĆAnthropic: Claude Sonnet 5.52026-09-2856Inteligencja
- typesafeNOWOŚĆTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 za 1 mln tokenów · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligencja
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligencja
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligencja
- xAIGrok 4.72026-09-2146Inteligencja
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 za 1 mln tokenów · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 za 1 mln tokenów · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
Reflection Beam uzyskuje 80,1 punktu w Terminal-Bench 2.1. Kimi K3 uzyskuje 88,3. Postaw te dwie liczby obok siebie — tak jak zrobiła to większość publikacji z tego tygodnia — a dojdziesz do wniosku, że Beam jest około ośmiu punktów za najlepszym otwartym modelem w tej dziedzinie. Ale te dwie liczby nie pochodzą z tego samego pokoju. Wynik Beam 80,1 jest raportowany przez dostawcę i pochodzi z tabeli w samym wpisie Reflection o premierze. Wynik Kimi K3 88,3 również jest raportowany przez dostawcę, tym razem z własnej tabeli Moonshot — a tabela dostawcy podaje wynik konkurenta tylko wtedy, gdy został on uzyskany na własnym środowisku testowym dostawcy, przy własnym zestawie promptów dostawcy i przy własnym ustawieniu poziomu wysiłku dostawcy. Podmiot trzeci, Artificial Analysis, przeprowadził od tego czasu test Kimi K3 na benchmarku o tej samej nazwie i opublikował wynik 85,0. To różnica 4,9 punktu, a nie 8,2 — a kierunek tej korekty jest całkowicie przewidywalny, ponieważ liczba, która topnieje, zawsze pochodzi z laboratorium, które ma coś do udowodnienia.
Na tym polega cały problem z porównaniem, które zapowiada tytuł tego artykułu, i dlatego ten tekst poświęca pierwszą połowę na pochodzenie modeli, a nie na wyniki. Reflection Beam to rzadki model typu mixture-of-experts o 501 miliardach parametrów, z 23 miliardami parametrów aktywnych na token, ogłoszony 5 października 2026 r. przez Reflection AI, z beta endpointem zgodnym z OpenAI dostępnym tego samego dnia. Kimi K3 to flagowy otwarty model Moonshot AI, wpisany do naszego własnego katalogu z datą premiery 15 lipca 2026 r. i niezależnie oceniony przez Artificial Analysis. Jeden z nich to gotowy produkt z cennikiem i uruchomieniem w niezależnym środowisku testowym; drugi to beta z listą oczekujących, której wagi, raport techniczny i cena jeszcze nie istnieją. Porównywanie ich nie jest symetrycznym ćwiczeniem, a udawanie, że jest inaczej, dałoby stronę, która wygląda precyzyjnie, a jest błędna.
Wersja 30-sekundowa
• Beam jest na papierze szybszy w przeliczeniu na FLOP, w praktyce nie ma podanej ceny i pozostaje nieodtworzony. Kimi K3 jest oceniany przez podmiot trzeci, wyceniony na 3,00 USD za milion tokenów wejściowych i 15,00 USD za milion tokenów wyjściowych, i jest ogólnie dostępny.
• W przypadku jedynego benchmarku, na którym uruchomiono oba — Terminal-Bench 2.1 — uczciwa różnica wynosi około pięciu punktów, a nie ośmiu, gdy liczby każdej ze stron pochodzą z neutralnego środowiska testowego.
• Prawdziwe zalety Beama mają charakter strukturalny, a nie liczbowy: profil serwowania z 23 mld aktywnych parametrów i obiecana licencja Apache 2.0. Żadnego z nich nie można dziś wykorzystać.
• Jeśli potrzebujesz modelu w tym tygodniu, to nie jest rzut monetą. To jeden model już dostępny i jedna lista oczekujących.
Co Reflection faktycznie opublikowało, i przeciwko komu
Post premierowy Reflection przedstawia jeden scorecard na tle siedmiu innych modeli: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max i DeepSeek V4.1 Flash. Wszystkie liczby w tabeli pochodzą od dostawcy, żadna nie została niezależnie odtworzona, a na stronie Artificial Analysis nie ma podstrony dla Reflection Beam — podstrona modelu zwraca błąd 404 na ich witrynie na dzień 6 października 2026 r. Kilka komórek w oryginale oznaczono jako NR, ponieważ danego modelu nie uruchomiono.
Oto cały wycinek tej tabeli dotyczący porównania Beam i K3, po jednej linii na wymiar:
• Terminal-Bench 2.1 — Beam 80,1 vs Kimi K3 88,3
• SWE-Bench Pro v2-Hard — Beam 77,2 vs Kimi K3 88,2
• DeepSWE v1.1 — Beam 44.4 kontra Kimi K3 68.0
• SWE Atlas Codebase QnA — Beam 34.6 vs Kimi K3 68.0
• HLE, bez narzędzi — Beam 36.2 vs Kimi K3 46.9
• GPQA Diamond — Beam 90,5 vs Kimi K3 93,5
• SciCode — Beam 49,7 vs Kimi K3 58,7
• MCP Atlas — Beam 78.7 vs Kimi K3 82.3
• BrowseComp z zarządzaniem kontekstem — Beam 77,4 vs Kimi K3 91,2
• DeepSearchQA z zarządzaniem kontekstem — Beam 80.1 vs Kimi K3 95.0
Przeczytaj tę listę uczciwie, a wyłoni się kształt premiery. Reflection nigdzie nie twierdzi, że wygrywa z K3. Twierdzi, że plasuje się blisko czołówki swojego poziomu, zużywając przy tym od trzech do czterech razy mniej mocy obliczeniowej na wnioskowanie niż GLM 5.2 przy porównywalnych wynikach rozumowania — a jedyny wiersz, w którym oba modele są blisko siebie, Terminal-Bench 2.1, jest tym wierszem, w którym porównanie jest najmniej wiarygodne.
Dlaczego harness ma większe znaczenie niż wynik
Nazwa benchmarku to etykieta, a nie specyfikacja. Terminal-Bench 2.1 oznacza konkretny zestaw zadań uruchamianych w ramach konkretnego szkieletu agenta, z konkretną polityką ponownych prób, konkretnym budżetem tokenów i konkretnym ustawieniem wysiłku rozumowania. Dwa laboratoria mogą uczciwie podać wynik „Terminal-Bench 2.1” i uzyskać liczby, których nie da się porównać, ponieważ szkielet i ustawienie wysiłku odpowiadają za większość wariancji. Artificial Analysis istnieje jako organizacja właśnie z tego powodu: uruchamia jeden harness, w jednej konfiguracji, na wielu modelach, dzięki czemu jego liczby można od siebie odejmować.
Więc 80,1, które Reflection podaje dla Beam, to liczba producenta uzyskana na producenckim stanowisku testowym, a 88,3, które podaje dla K3, to również liczba producenta — przy czym tym producentem jest Reflection, mierzący własnego konkurenta. Ta druga wartość to najmniej wiarygodna liczba w tym wierszu: laboratorium uruchamiające wagi rywala na własnym szkielecie testowym nie ma żadnej zachęty, by uruchamiać je w najlepszej konfiguracji rywala, ani obowiązku ujawnienia tej, którą wybrało. Nie ma w tym nic nieuczciwego; to po prostu liczba, której pochodzenie nie uzasadnia wagi, jaką przypisały jej relacje medialne.
Własny przebieg Artificial Analysis daje Kimi K3 wynik 85,02 w Terminal-Bench 2.1, obok 12,6 w Terminal-Bench v4.0 — innym i trudniejszym teście — AA Coding Index na poziomie 76,2 (9. miejsce wśród modeli na liście rankingowej), Intelligence Index na poziomie 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 i Long-Context Recall na poziomie 88,7. Są one odczytane z karty katalogowej K3 w naszym własnym systemie, ze źródłem artificialanalysis.ai, a migawka ewaluacji jest datowana na 15 lipca 2026 r. Beam ma jedną liczbę w uniwersum tej listy i pochodzi ona od Reflection. Ta nieobecność powinna być tymczasowa, a nie trwała: Artificial Analysis oświadczyło, że Reflection dało mu dostęp i że poddaje ten model benchmarkowi, a jego własne wczesne sformułowanie — że Beam „będzie jednym z najbardziej oszczędnych pod względem tokenów otwartych modeli, jakie widzieliśmy na jego poziomie inteligencji” — to ośrodek benchmarkowy sygnalizujący oczekiwanie, a nie raportujący wynik. Dopóki ten wynik się nie pojawi, liczby z tego artykułu nie są odejmowalne, i nie zamierzamy udawać, że jest inaczej.

Ile kosztuje każdy z nich i czym każdy z nich jest
Porównanie kosztów nie jest wyrównane, a właściwie wcale nie jest porównaniem, ponieważ jedna jego strona jest pusta.
• Cena — Kimi K3: 3,00 USD za milion tokenów wejściowych / 15,00 USD za milion tokenów wyjściowych, z odczytami z pamięci podręcznej po 0,30 USD, w porównaniu z Reflection Beam: brak opublikowanej ceny gdziekolwiek na blogu, w dokumentacji lub na liście modeli Reflection, a konsola platformy znajduje się za ścianą rejestracji.
• Kontekst — 1 048 576 tokenów w Kimi K3 vs 256 000 w wersji beta Beam, z przypisem w samej dokumentacji Beam o treści: „okno kontekstowe może się zmienić w trakcie trwania wersji beta”.
• Modalność — Kimi K3 przyjmuje tekst i obrazy; Reflection Beam to tekst na wejściu, tekst na wyjściu — bez ścieżki obrazu ani dźwięku na premierze.
• Dostępność — Kimi K3 jest ogólnie dostępny od dziś; Reflection Beam to beta z listą oczekujących, a jej wagi obiecano udostępnić później w październiku na licencji Apache 2.0.
• Niezależne wyniki — K3 ma pełny wiersz Artificial Analysis; Beam nie ma żadnych.
• Profil serwowania — Kimi K3 to duży, dość gęsty model klasy frontier osiągający 46,8 tokenów wyjściowych na sekundę w naszym własnym pomiarze w playgroundzie z ostatniego tygodnia; 23B aktywnych parametrów Beam to prawdziwy argument architektoniczny za niższym opóźnieniem i niższym kosztem na token, ale nie ma publicznie dostępnego endpointu, na którym można by go zmierzyć.
Twierdzenie o wydajności zasługuje na jeszcze jedno zdanie ostrożności, bo to główny nagłówek premiery i wykonuje więcej pracy, niż jest w stanie udźwignąć. „3 do 4× mniej obliczeń na wnioskowanie" w Reflection pochodzi z wykresu, który przybliża FLOPs jako dwukrotność liczby aktywnych parametrów pomnożoną przez średnią liczbę wygenerowanych tokenów. Ten wzór celowo pomija wstępne przetwarzanie promptu, koszt uwagi i narzut obsługi — czyli te pozycje rachunku, które dominują w długokontekstowej pracy agentowej. To szacunek na kolanie stosunku obliczeń, a nie pomiar, nie kwota w dolarach, i został stworzony przez dostawcę. Traktuj go jako hipotezę, którą wagi pozwolą przetestować komuś innemu.
Gdzie w tym plasuje się OrcaRouter
Kimi K3 to jedna z naszych tras. Jest wyceniony na 3,00 USD za wejście i 15,00 USD za wyjście za milion tokenów, a odczyt z pamięci podręcznej kosztuje 0,30 USD — to stawka dostawcy Moonshot przekazana dalej bez żadnych dodatków, więc jeśli Moonshot zmieni swój cennik, kwota na naszej stronie zmieni się tego samego dnia, a nie wtedy, gdy odsprzedawca zaktualizuje ofertę. Można go wywołać za pomocą jednego klucza zgodnego z OpenAI, obok ponad 200 innych modeli, co ma tu znaczenie z konkretnego powodu: uczciwa odpowiedź na pytanie „Beam czy K3?” brzmi, że zespół, który się zabezpiecza, nie powinien wybierać. Ponieważ automatyczne przełączanie awaryjne jest częścią routingu, a nie czymś, co trzeba zbudować, model taki jak Beam — w wersji beta, bez ceny, nieoceniony przez żadną stronę trzecią — jest dokładnie tym, co umieszcza się na części ruchu, a nie na ścieżce krytycznej. Domyślnie kierujesz pracę do K3, wysyłasz Beamowi wycinek, gdy przyjdzie zaproszenie z listy oczekujących, i pozwalasz routingowi wrócić do K3 w razie błędu. To decyzja, którą można podjąć w sprawie nieprzetestowanego modelu. Postawienie na niego produkcyjnej ścieżki już nie.

Co zmieniłoby ten werdykt?
Trzy rzeczy, w kolejności od najważniejszej do najmniej ważnej.
Cena. Gdyby Beam uplasował się poniżej poziomu K3, argument o wydajności stałby się konkretny, a nie teoretyczny. Po drugie, wagi. Apache 2.0 plus raport techniczny pozwoliłyby każdemu dysponującemu kilkoma węzłami zmierzyć liczbę tokenów na sekundę na GPU przy ustalonym progu jakości — to test, który faktycznie rozstrzyga twierdzenie o możliwościach obliczeniowych. Po trzecie, uruchomienie zestawu testowego przez niezależną stronę. Reflection dał Artificial Analysis dostęp i oczekuje się, że da to wynik; dopóki ta liczba nie zostanie opublikowana, każda krążąca liczba z porównania Beam–K3 prowadzi z powrotem do dokumentu napisanego przez jednego z dwóch dostawców.
Dwa pytania, na które warto odpowiedzieć bezpośrednio
Czy Reflection Beam jest lepszy niż Kimi K3?
Na podstawie dostępnych dziś dowodów — nie, i nikt nie opublikował dowodów, że tak jest. Własna tabela Reflection stawia K3 na czele we wszystkich dziesięciu wspólnych wierszach powyżej, a w kilku z nich przewaga (SWE Atlas 34.6 vs 68.0, DeepSearchQA 80.1 vs 95.0) nie jest mała. Argument Beam opiera się na koszcie na jednostkę możliwości, a ten argument pozostaje wykresem narysowanym przez dostawcę, dopóki nie istnieją wagi i cena.
Czy powinienem poczekać na wagi Beam, zanim zacznę budować na K3?
Tylko jeśli self-hosting jest wymogiem, a nie preferencją, ponieważ to jedyna oś, na której te dwa rozwiązania nie są zamiennikami — K3 oferuje wyłącznie API, podczas gdy Beam obiecuje wagi na licencji Apache 2.0. Jeśli korzystasz z API, K3 jest dostępne, ocenione i wycenione, a Beam to lista oczekujących. Nie ma wariantu tej decyzji, dla którego warto byłoby opóźniać projekt.

Reflection dał nam datę i wykres, a data to nie model. Jedyne, co premiera rzeczywiście ustala, to że model 501B aktywujący 23B parametrów można wytrenować tak, by plasował się w odległości kilku punktów od otwartej granicy — co, jeśli wagi się pojawią, a liczby się utrzymają, jest istotnym wynikiem dotyczącym efektywności. To jeszcze nie powód, by przenosić pracę z modelu, który faktycznie został zmierzony przez stronę trzecią.
