Ett genererat hero-kort med titeln 'Reflection Beam mot Kimi K3' och underraden 'Samma benchmarknamn, två olika testramverk.' samt tre statistikchips med texten 'Terminal-Bench 2.1: 80.1 mot 88.3', 'oberoende körning: 85.0' och 'pris: ej publicerat mot $3 / $15'. Tre platta linjeikoner sitter under: en skrivplatta med en bock, en linjal som mäter en stapel och ett förstoringsglas över ett stapeldiagram. OrcaRouter-logotypen är komponerad i nedre högra hörnet.
Guides & Insights

Reflection Beam vs Kimi K3: Samma benchmarknamn, två olika testramverk

Författare

Rowan Sterling

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller →
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Reflection Beam får 80,1 på Terminal-Bench 2.1. Kimi K3 får 88,3. Ställ de två siffrorna sida vid sida, som större delen av veckans rapportering har gjort, och du drar slutsatsen att Beam ligger ungefär åtta poäng efter den bästa öppna modellen i fältet. Men de två talen kommer inte från samma rum. Beams 80,1 är rapporterad av leverantören, hämtad från tabellen i Reflections eget lanseringsinlägg. Kimi K3:s 88,3 är också rapporterad av leverantören, den här gången från Moonshots egen tabell — och en leverantörs tabell visar bara sin konkurrents poäng när den har körts i leverantörens egen testmiljö, med leverantörens egen promptuppsättning, vid leverantörens egen effort-inställning. En tredje part, Artificial Analysis, har sedan dess kört Kimi K3 på ett benchmark med samma namn och publicerat 85,0. Det är en skillnad på 4,9 poäng, inte 8,2 — och riktningen på korrigeringen är helt förutsägbar, eftersom talet som urholkas alltid är det som kom från labbet med något att bevisa.

Det är hela problemet med den jämförelse som den här artikelns rubrik utlovar, och det är anledningen till att den här texten ägnar sin första halva åt proveniens i stället för åt poäng. Reflection Beam är en gles mixture-of-experts-modell med 501 miljarder parametrar och 23 miljarder aktiva parametrar per token, tillkännagiven den 5 oktober 2026 av Reflection AI med en betaversion av en OpenAI-kompatibel endpoint i drift samma dag. Kimi K3 är Moonshot AI:s främsta öppna modell, listad i vår egen katalog med ett utgivningsdatum den 15 juli 2026 och oberoende poängsatt av Artificial Analysis. Den ena är en produkt i drift med prislista och en körning i ett tredjepartsramverk; den andra är en betaversion med väntelista vars vikter, tekniska rapport och pris ännu inte existerar. Att jämföra dem är inte en symmetrisk övning, och att låtsas något annat skulle ge en sida som ser exakt ut och är fel.

30-sekundersversionen

• Beam är snabbare per FLOP på papper, inte prissatt i praktiken och inte reproducerad. Kimi K3 är poängsatt av en tredje part, prissatt till $3.00 för indata och $15.00 för utdata per miljon tokens och allmänt tillgänglig.

• På det enda benchmark som båda har körts på — Terminal-Bench 2.1 — är den ärliga skillnaden omkring fem poäng, inte åtta, när båda sidornas siffror kommer från en neutral testrigg.

• Beams verkliga fördelar är strukturella, inte numeriska: en serving-profil med 23B aktiva parametrar och en utlovad Apache 2.0-licens. Ingen av dem kan användas i dag.

• Om du behöver en modell den här veckan är detta inte ett myntkast. Det är en modell som levereras och en väntelista.

Vad Reflection faktiskt publicerade, och mot vem

Reflections lanseringsinlägg ställer en resultatöversikt mot sju andra modeller: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max och DeepSeek V4.1 Flash. Varje siffra i tabellen är leverantörsrapporterad, ingen av dem har reproducerats oberoende, och det finns ingen Artificial Analysis-sida för Reflection Beam – modellsidan ger 404 på deras webbplats per den 6 oktober 2026. Flera celler i originalet är markerade NR eftersom modellen inte kördes.

Här är hela Beam-mot-K3-utsnittet av den tabellen, en rad per dimension:

• Terminal-Bench 2.1 — Beam 80,1 mot Kimi K3 88,3

• SWE-Bench Pro v2-Hard — Beam 77,2 mot Kimi K3 88,2

• DeepSWE v1.1 — Beam 44,4 vs Kimi K3 68,0

• SWE Atlas kodbas-QnA — Beam 34,6 vs Kimi K3 68,0

• HLE, inga verktyg — Beam 36,2 vs Kimi K3 46,9

• GPQA Diamond — Beam 90,5 mot Kimi K3 93,5

• SciCode — Beam 49,7 mot Kimi K3 58,7

• MCP Atlas — Beam 78,7 vs Kimi K3 82,3

• BrowseComp med kontexthantering — Beam 77,4 vs Kimi K3 91,2

• DeepSearchQA med kontexthantering — Beam 80,1 vs Kimi K3 95,0

Läs den listan ärligt, och lanseringens form framträder. Reflection gör inte någonstans anspråk på att vinna över K3. Det man gör anspråk på är att landa nära toppen av ett skikt samtidigt som man förbrukar tre till fyra gånger mindre inferensberäkning än GLM 5.2 vid jämförbara resonemangspoäng – och den enda raden där de två modellerna ligger nära varandra, Terminal-Bench 2.1, är den rad där jämförelsen är minst tillförlitlig.

Varför selen spelar större roll än poängen

Ett benchmarknamn är en etikett, inte en specifikation. Terminal-Bench 2.1 betyder en viss uppsättning uppgifter som körs under ett visst agentscaffold, med en viss återförsökspolicy, en viss tokenbudget och en viss inställning för resonemangsansträngning. Två labb kan båda ärligt rapportera en siffra för "Terminal-Bench 2.1" och producera tal som inte är jämförbara, eftersom det är i scaffoldet och inställningen för resonemangsansträngning som merparten av variansen finns. Artificial Analysis finns som organisation just därför: det kör en enda harness, i en enda konfiguration, över många modeller, så att dess siffror kan subtraheras från varandra.

Så 80,1 som Reflection redovisar för Beam är ett nummer från en leverantör i en leverantörsrigg, och 88,3 som Reflection redovisar för K3 är också ett nummer från leverantören – leverantören är Reflection, som mäter sin egen konkurrent. Den andra siffran är det minst tillförlitliga numret i raden: ett labb som kör en rivals modellvikter i sitt eget ramverk har inget incitament att köra dem i rivalens bästa konfiguration och ingen skyldighet att avslöja vilken det valde. Det finns inget ohederligt i det; det är helt enkelt ett nummer vars proveniens inte stöder den vikt som bevakningen har lagt på det.

I Artificial Analysiss egen körning har Kimi K3 85,02 i Terminal-Bench 2.1, vid sidan av 12,6 i Terminal-Bench v4.0 – ett annat och svårare test – ett AA Coding Index på 76,2 (plats 9 bland modellerna på resultattavlan), ett Intelligence Index på 43,6, GPQA Diamond 93,5, HLE 46,9, SciCode 59,5, tau-banking 45,98 och en Long-Context Recall på 88,7. De är avlästa från K3:s katalogkort i vårt eget system, med artificialanalysis.ai som källa, med utvärderingsögonblicksbilden daterad 15 juli 2026. Beam har ett nummer i den listans universum, och det kommer från Reflection. Den avsaknaden bör vara tillfällig snarare än permanent: Artificial Analysis har sagt att Reflection gav dem tillgång och att de benchmarkar modellen, och dess egen tidiga formulering – att Beam "kommer att vara en av de mest tokeneffektiva öppna modeller vi har sett för dess intelligensnivå" – är ett benchmarkhus som signalerar en förväntan, inte rapporterar ett resultat. Tills den poängen publiceras går siffrorna i den här artikeln inte att subtrahera, och vi tänker inte låtsas något annat.

A two-column infographic titled 'Reflection Beam vs Kimi K3 - the scoreboard'. The left column 'Reflection Beam' reads 'Terminal-Bench 2.1: 80.1 vendor', 'Context window: 256K beta', 'Input modality: text only', 'Price per 1M tokens: not published', 'Cache reads: none documented', 'AA Intelligence Index: none'. The right column 'Kimi K3' reads 'Terminal-Bench 2.1: 88.3 vendor, 85.0 independent', 'Context window: 1.05M', 'Input modality: text + image', 'Price per 1M tokens: 3.00 / 15.00', 'Cache reads: 0.30', 'AA Intelligence Index: 43.6'. A footer reads 'Beam figures vendor-reported and unreproduced; K3 figures per Artificial Analysis and MoonshotAI's published rate card.' The OrcaRouter logo is composited in the bottom-right corner.

Vad var och en kostar, och vad var och en är

Kostnadsjämförelsen är inte i närheten, och det är egentligen inte ens en jämförelse, eftersom ena sidan av den är tom.

• Pris — Kimi K3 $3,00 inmatning / $15,00 utmatning per miljon tokens, med cacheläsningar på $0,30, jämfört med Reflection Beam: inget publicerat pris någonstans på Reflections blogg, dokumentation eller modelllista, med plattformskonsolen bakom en registreringsvägg.

• Kontext — 1 048 576 tokens i Kimi K3 mot 256 000 i Beam-beta, med en fotnot i Beams egen dokumentation som lyder "kontextfönstret kan ändras under betan."

• Modalitet — Kimi K3 tar emot text och bilder; Reflection Beam är text in, text ut utan någon bild- eller ljudväg vid lanseringen.

• Tillgänglighet — Kimi K3 är allmänt tillgänglig i dag; Reflection Beam är en betaversion med väntelista, och vikterna utlovas senare i oktober under Apache 2.0.

• Oberoende poäng – K3 har en fullständig rad i Artificial Analysis; Beam har ingen.

• Serving-profil — Kimi K3 är en stor, ganska tät frontier-modell med 46,8 utdata-tokens per sekund i vår egen playground-mätning under den senaste veckan; Beams 23B aktiva parametrar är ett genuint arkitektoniskt argument för lägre latens och lägre kostnad per token, men det finns ingen endpoint som är öppen för allmänheten att mäta den på.

Effektivitetsanspråket förtjänar ännu en mening av eftertanke, eftersom det är lanseringens rubrik och det gör mer arbete än det kan bära. Reflections "3 till 4× mindre inferensberäkning" kommer från ett diagram som approximerar FLOPs som två gånger antalet aktiva parametrar gånger det genomsnittliga antalet genererade tokens. Den formeln utesluter medvetet prompt-prefill, attention-kostnad och serveringsoverhead — de delar av notan som dominerar agentiskt arbete med lång kontext. Det är en överslagsberäkning av en beräkningskvot, inte en mätning, inte ett dollarbelopp, och den byggdes av leverantören. Behandla den som en hypotes som vikterna kommer att göra det möjligt för någon annan att testa.

Var OrcaRouter passar in i detta

Kimi K3 är en av våra rutter. Den listas till 3,00 $ för indata och 15,00 $ för utdata per miljon tokens med cacheläsningar till 0,30 $, vilket är Moonshots leverantörspris som förs vidare utan något påslag — så om Moonshot ändrar sin prislista ändras siffran på vår sida samma dag i stället för närhelst en återförsäljare uppdaterar. Den kan anropas från en OpenAI-kompatibel nyckel tillsammans med över 200 andra modeller, vilket spelar roll här av en specifik anledning: det ärliga svaret på "Beam eller K3?" är att ett team som hedgar inte bör välja. Eftersom automatisk failover är en del av routningen snarare än något du bygger, är en modell som Beam — beta, utan pris, utan betyg från någon tredje part — exakt det man lägger på en andel av trafiken snarare än på sin kritiska väg. Du routar arbetet till K3 som standard, skickar Beam en andel när din inbjudan från väntelistan kommer, och låter routningen falla tillbaka till K3 vid fel. Det är ett beslut du kan fatta om en obeprövad modell. Att satsa en produktionsväg på en sådan är det inte.

A screenshot of the OrcaRouter model page for kimi/kimi-k3, showing the model name, a 1,048,576-token context, text and image input, tool and reasoning support, and pricing of $3.00 input and $15.00 output per million tokens with an 8.63 s median time to first token.

Vad skulle ändra denna dom?

Tre saker, i fallande ordning efter hur mycket de betyder.

Ett pris. Att Beam hamnar under K3-nivån skulle göra effektivitetsargumentet konkret i stället för teoretiskt. För det andra: vikterna. Apache 2.0 plus en teknisk rapport skulle låta vem som helst med ett par noder mäta tokens per sekund per GPU vid en fast kvalitetsribba – testet som faktiskt avgör ett påstående om beräkningskraft. För det tredje: en körning i ett testramverk från tredje part. Reflection har gett Artificial Analysis tillgång, och en poäng förväntas komma ut av det; tills den siffran publiceras går varje Beam-mot-K3-siffra som cirkulerar tillbaka till ett dokument skrivet av en av de två leverantörerna.

Två frågor värda att besvara direkt

Är Reflection Beam bättre än Kimi K3?

Utifrån den evidens som finns i dag: nej – och ingen har publicerat bevis för att så är fallet. Reflections egen tabell har K3 före på alla tio gemensamma rader ovan, flera av dem med marginaler (SWE Atlas 34,6 mot 68,0, DeepSearchQA 80,1 mot 95,0) som inte är små. Beams argument är kostnad per enhet kapacitet, och det argumentet är ett diagram som leverantören har ritat tills vikterna och ett pris finns.

Bör jag vänta på Beams vikter innan jag bygger vidare på K3?

Endast om självhostning är ett krav snarare än en preferens, eftersom det är den enda axeln där de två inte är substitut – K3 är endast API medan Beam utlovar Apache 2.0-vikter. Om du anropar ett API är K3 tillgängligt, poängsatt och prissatt, och Beam är en väntelista. Det finns ingen version av det beslutet som är värd att fördröja ett projekt för.

A screenshot of the OrcaRouter models index page, showing the filter rail for input modality, context length, input price, status and series alongside a model grid headed '207 models, 16 providers, one API key, one bill' and a three-step panel explaining how to call any model through the OpenAI-compatible endpoint.

Reflection har gett oss ett datum och ett diagram, och ett datum är inte en modell. Det enda lanseringen verkligen fastställer är att en 501B-modell som aktiverar 23B parametrar kan tränas till att ligga inom några punkter från den öppna frontlinjen – vilket, om vikterna kommer och siffrorna håller, är ett betydelsefullt resultat om effektivitet. Det är ännu inte ett skäl att flytta arbete bort från en modell som en tredje part faktiskt har mätt.