
Reflection Beam vs Kimi K3: 같은 벤치마크 이름, 서로 다른 두 가지 하네스
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 98 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 248 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Reflection Beam은 Terminal-Bench 2.1에서 80.1점을 기록했다. Kimi K3는 88.3점을 기록했다. 이번 주 대부분의 보도가 그랬듯 이 두 수치를 나란히 놓으면, Beam이 이 분야 최고의 오픈 모델에 약 8점 뒤진다고 결론 내리게 된다. 하지만 그 두 숫자는 같은 방에서 나온 것이 아니다. Beam의 80.1은 벤더가 보고한 수치로, Reflection 자체 출시 게시물의 표에서 가져온 것이다. Kimi K3의 88.3도 벤더가 보고한 수치인데, 이번에는 Moonshot 자체 표에서 나온 것이다. 그리고 벤더의 표는 경쟁사의 점수를, 벤더 자체의 하네스에서, 벤더 자체의 프롬프트 세트로, 벤더 자체의 에포트 설정에서 실행한 경우에만 기재한다. 제3자인 Artificial Analysis는 이후 동일한 이름의 벤치마크에서 Kimi K3를 실행해 85.0을 공개했다. 이는 8.2점이 아니라 4.9점 차이다. 그리고 그 정정의 방향은 전적으로 예측 가능한데, 깎여 나가는 숫자는 언제나 뭔가를 입증해야 하는 연구소에서 나온 숫자이기 때문이다.
이것이 바로 이 글의 제목이 약속하는 비교가 안고 있는 문제의 전부이며, 이 글의 전반부가 점수가 아니라 출처 검증에 할애되는 이유이기도 합니다. Reflection Beam은 토큰당 230억 개의 매개변수가 활성화되는 5,010억 개 매개변수의 희소 전문가 혼합(sparse mixture-of-experts) 모델로, 2026년 10월 5일 Reflection AI가 발표했고 같은 날 베타 OpenAI 호환 엔드포인트가 공개되었습니다. Kimi K3는 Moonshot AI의 플래그십 오픈 모델로, 우리 자체 카탈로그에 2026년 7월 15일 출시일로 등재되어 있으며 Artificial Analysis가 독립적으로 평가한 모델입니다. 둘 중 하나는 요금표와 제3자 하네스 실행 결과를 갖춘 출시 제품이고, 다른 하나는 가중치도, 기술 보고서도, 가격도 아직 존재하지 않는 대기자 명단 방식의 베타입니다. 이 둘을 비교하는 것은 대칭적인 작업이 아니며, 그렇지 않은 척하면 정확해 보이지만 틀린 페이지가 나올 뿐입니다.
30초 버전
• Beam은 이론상 FLOP당 더 빠르지만, 실제로는 가격이 책정되지 않았고, 재현된 사례도 없다. Kimi K3는 제3자가 평가하며, 백만 토큰당 입력 $3.00, 출력 $15.00로 가격이 책정되어 있고, 일반적으로 이용 가능하다.
• 양쪽 모두 실행해 본 유일한 벤치마크인 Terminal-Bench 2.1에서, 각 측의 수치가 중립적인 하네스에서 나온 것이라면 정직한 격차는 8점이 아니라 약 5점이다.
• Beam의 진짜 이점은 수치가 아니라 구조에 있다: 23B 활성 파라미터 서빙 프로파일과 Apache 2.0 라이선스 약속이다. 둘 다 현재로선 쓸 수 없다.
• 이번 주에 모델이 필요하다면, 이건 동전 던지기가 아닙니다. 하나는 이미 배포된 모델이고, 다른 하나는 대기자 명단입니다.
Reflection이 실제로 게시한 것, 그리고 그것이 누구를 겨냥한 것인지
Reflection의 출시 게시물은 하나의 스코어카드를 다른 일곱 모델과 대조합니다: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8 Max, DeepSeek V4.1 Flash. 표의 모든 수치는 벤더가 보고한 것이며, 어느 것도 독립적으로 재현된 적이 없고, Reflection Beam에 대한 Artificial Analysis 페이지도 없습니다 — 2026년 10월 6일 현재 해당 사이트에서 모델 페이지는 404입니다. 원문의 여러 셀은 해당 모델이 실행되지 않았기 때문에 NR로 표시되어 있습니다.
다음은 해당 표에서 Beam 대 K3 부분 전체를 차원별로 한 줄씩 정리한 것입니다:
• Terminal-Bench 2.1 — Beam 80.1 vs Kimi K3 88.3
• SWE-Bench Pro v2-Hard — Beam 77.2 vs Kimi K3 88.2
• DeepSWE v1.1 — Beam 44.4 대 Kimi K3 68.0
• SWE Atlas 코드베이스 QnA — Beam 34.6 vs Kimi K3 68.0
• HLE, 도구 미사용 — Beam 36.2 vs Kimi K3 46.9
• GPQA Diamond — Beam 90.5 대 Kimi K 93.5
• SciCode — Beam 49.7 대 Kimi K3 58.7
• MCP Atlas — Beam 78.7 vs Kimi K3 82.3
• 컨텍스트 관리를 적용한 BrowseComp — Beam 77.4 vs Kimi K3 91.2
• 컨텍스트 관리를 적용한 DeepSearchQA — Beam 80.1 vs Kimi K3 95.0
그 목록을 정직하게 읽어 보면 출시의 윤곽이 드러난다. Reflection은 어디에서도 K3를 이겼다고 주장하지 않는다. 그것은 비슷한 추론 점수에서 GLM 5.2보다 3~4배 적은 추론 컴퓨팅을 쓰면서 한 티어의 최상위권에 안착했다고 주장하는 것이다 — 그리고 두 모델이 근접한 유일한 행인 Terminal-Bench 2.1은 비교가 가장 신뢰하기 어려운 행이다.
왜 하네스가 점수보다 더 중요한가
벤치마크 이름은 라벨이지 명세가 아니다. Terminal-Bench 2.1은 특정 에이전트 스캐폴드 아래에서 특정 재시도 정책, 특정 토큰 예산, 특정 추론 강도 설정으로 실행되는 특정 작업 집합을 의미한다. 두 연구소가 둘 다 정직하게 "Terminal-Bench 2.1" 수치를 보고하면서도 서로 비교할 수 없는 숫자를 산출할 수 있다. 스캐폴드와 강도 설정에 분산의 대부분이 존재하기 때문이다. Artificial Analysis가 조직으로 존재하는 것은 바로 이 때문이다: 여러 모델에 걸쳐 하나의 하네스를 하나의 구성으로 실행하여, 그 수치들을 서로 빼서 비교할 수 있게 한다.
그래서 Reflection이 Beam에 대해 출력하는 80.1은 벤더 하네스에서 나온 벤더 수치이고, K3에 대해 출력하는 88.3은 역시 벤더 수치입니다 — 그 벤더는 Reflection이며, 자기 경쟁자를 측정하고 있는 것입니다. 그 두 번째 수치는 이 행에서 가장 신뢰할 수 없는 수치입니다. 경쟁자의 가중치를 자체 스캐폴드에서 실행하는 연구실은 그것들을 경쟁자의 최적 구성으로 실행할 유인도 없고, 자신이 선택한 구성을 공개할 의무도 없습니다. 그 안에 부정직한 점은 없습니다. 그것은 단지 그 출처가 보도가 부여한 비중을 뒷받침하지 못하는 수치일 뿐입니다.
Artificial Analysis의 자체 실행에서 Kimi K3는 Terminal-Bench 2.1에서 85.02를, 더 다르고 더 어려운 테스트인 Terminal-Bench v4.0에서는 12.6을 기록했으며, AA Coding Index 76.2(보드에 있는 모델 중 9위), Intelligence Index 43.6, GPQA Diamond 93.5, HLE 46.9, SciCode 59.5, tau-banking 45.98, Long-Context Recall 88.7을 기록했습니다. 이것들은 우리 자체 시스템의 K3 카탈로그 카드에서 읽어낸 수치로, 출처는 artificialanalysis.ai이며, 평가 스냅샷 날짜는 2026년 7월 15일입니다. Beam은 그 목록의 범위 안에서 숫자 하나를 갖고 있는데, 그것은 Reflection에서 나온 것입니다. 그 부재는 영구적이라기보다 일시적이어야 합니다. Artificial Analysis는 Reflection이 자사에 접근 권한을 주었고 자사가 그 모델을 벤치마킹하고 있다고 말했으며, 자체 초기 표현 — Beam이 "해당 지능 수준에서 우리가 본 가장 토큰 효율적인 오픈 모델 중 하나가 될 것" — 은 결과를 보고하는 것이 아니라 기대를 알리는 벤치마크 기관의 신호입니다. 그 점수가 찍히기 전까지는 이 기사의 수치들을 빼놓고 계산할 수 없으며, 우리는 그렇지 않은 척하지 않겠습니다.

각각 얼마인지, 그리고 각각 무엇인지
비용 비교는 격차가 크고, 사실 비교라고 할 수도 없습니다. 한쪽이 비어 있으니까요.
• 가격 — Kimi K3는 백만 토큰당 입력 $3.00 / 출력 $15.00이고 캐시 읽기는 $0.30인 반면, Reflection Beam은 Reflection의 블로그, 문서, 모델 목록 어디에도 공개된 가격이 없으며 플랫폼 콘솔은 가입 장벽 뒤에 가려져 있습니다.
• 컨텍스트 — Kimi K3의 1,048,576개 토큰 대 Beam 베타의 256,000개이며, Beam 자체 문서에는 "베타 기간 동안 컨텍스트 창이 변경될 수 있습니다"라는 각주가 달려 있습니다.
• 모달리티 — Kimi K3는 텍스트와 이미지를 입력받으며, Reflection Beam은 텍스트 입력·텍스트 출력 방식으로 출시 시점에는 이미지나 오디오 경로가 없습니다.
• 가용성 — Kimi K3는 오늘부터 일반 제공되며, Reflection Beam은 대기자 명단 방식의 베타로, 모델 가중치는 10월 말 Apache 2.0 라이선스로 공개될 예정입니다.
• 독립적인 점수 — K3에는 완전한 Artificial Analysis 행이 있지만, Beam에는 없습니다.
• 서빙 프로필 — Kimi K3는 지난 한 주 동안 우리 자체 플레이그라운드 측정에서 초당 출력 토큰 46.8개를 기록한, 대규모의 다소 dense한 프런티어 모델입니다. Beam의 23B 활성 파라미터는 더 낮은 지연 시간과 더 낮은 토큰당 비용을 뒷받침하는 진정한 아키텍처적 근거이지만, 이를 측정할 수 있는 공개 엔드포인트는 없습니다.
효율성 주장에는 한 문장만큼 더 신중한 주의가 필요하다. 그것은 이번 출시의 헤드라인이며, 감당할 수 있는 것보다 더 많은 일을 하고 있기 때문이다. Reflection의 "추론 연산 3~4배 절감"은 FLOPs를 활성 파라미터 수의 두 배에 평균 생성 토큰 수를 곱한 값으로 근사한 차트에서 나온 것이다. 그 공식은 프롬프트 프리필, 어텐션 비용, 서빙 오버헤드, 즉 장문 컨텍스트 에이전트 작업에서 청구서의 대부분을 차지하는 부분들을 의도적으로 제외한다.연산 비율에 대한 대략적인 어림짐작일 뿐, 측정값도 아니고 달러 금액도 아니며, 판매사가 직접 만든 것이다. 이는 가중치를 통해 다른 누군가가 검증할 수 있는 가설로 취급하라.
이 안에서 OrcaRouter가 차지하는 위치
Kimi K3는 우리 라우트 중 하나입니다. 입력 100만 토큰당 $3.00, 출력 100만 토큰당 $15.00로 등록되어 있으며 캐시 읽기는 $0.30인데, 이는 Moonshot의 공급자 요율을 아무것도 덧붙이지 않고 그대로 전달한 것이므로 Moonshot이 요율표를 바꾸면 재판매업체가 갱신하는 시점이 아니라 같은 날 우리 페이지의 수치도 바뀝니다. 이 모델은 200개가 넘는 다른 모델과 함께 하나의 OpenAI 호환 키로 호출할 수 있습니다. 이 점이 여기서 특정한 이유로 중요합니다. "Beam이냐 K3냐?"에 대한 정직한 답은, 위험을 분산하려는 팀이라면 선택해서는 안 된다는 것입니다. 왜냐하면 자동 페일오버는 직접 구축하는 것이 아니라 라우팅의 일부이기 때문에, Beam처럼 베타이고 가격도 책정되지 않았으며 어떤 제3자도 평가하지 않은 모델은 바로 여러분의 핵심 경로가 아니라 트래픽의 일부에 올려두어야 할 대상입니다. 기본적으로 작업을 K3로 라우팅하고, 대기자 명단 초대가 도착하면 Beam에 일부를 보내며, 오류가 나면 라우팅이 K3로 폴백하도록 두면 됩니다. 그것은 검증되지 않은 모델에 대해 내릴 수 있는 결정입니다. 하나에 프로덕션 경로를 걸어버리는 것은 그런 결정이 아닙니다.

이 평결을 바꿀 수 있는 것은 무엇인가요
세 가지, 중요한 순서대로.
가격. Beam이 K3 티어 아래로 책정된다면, 효율성 논거는 이론이 아니라 구체적인 것이 될 것이다. 둘째, 가중치. Apache 2.0과 기술 보고서가 더해지면, 노드 몇 개만 가진 사람도 고정된 품질 기준에서 GPU당 초당 토큰 수를 측정할 수 있을 것이다 — 이는 연산 주장을 실제로 판가름하는 시험이다. 셋째, 제3자 하네스 실행. Reflection은 Artificial Analysis에 접근 권한을 제공했고, 그로부터 점수가 나올 것으로 예상된다. 그 숫자가 공개되기 전까지, 유통되는 모든 Beam 대 K3 수치는 두 벤더 중 한 곳이 작성한 문서로 거슬러 올라간다.
직접 답할 가치가 있는 두 가지 질문
Reflection Beam이 Kimi K3보다 더 좋은가요?
오늘날 입수 가능한 증거로 볼 때, 아니다 — 그리고 그것이 그렇다는 증거를 공개한 사람은 아무도 없다. Reflection 자체 표에서는 K3가 위의 공통된 열 개 행 모두에서 앞서 있으며, 그중 몇몇은 격차가 결코 작지 않다(SWE Atlas 34.6 대 68.0, DeepSearchQA 80.1 대 95.0). Beam의 논거는 역량 단위당 비용이며, 그 논거는 가중치와 가격이 존재하기 전까지는 공급업체가 그린 차트에 불과하다.
K3 위에 구축하기 전에 Beam의 가중치를 기다려야 할까요?
자체 호스팅이 선호가 아니라 필수 요건일 때만 그렇습니다. 두 가지가 서로 대체재가 아닌 유일한 축이 바로 그것이기 때문입니다 — K3는 API 전용인 반면, Beam은 Apache 2.0 가중치를 약속합니다. API를 호출하는 경우라면 K3는 이용 가능하고, 평가와 가격이 책정되어 있으며, Beam은 대기자 명단입니다. 그 결정 때문에 프로젝트를 지연할 가치가 있는 경우는 없습니다.

Reflection은 우리에게 날짜와 차트를 내놓았지만, 날짜는 모델이 아니다. 이번 출시가 진정으로 입증하는 단 한 가지는 23B 파라미터를 활성화하는 501B 모델이 오픈 프런티어와 몇 점 차이 안에 머물도록 훈련될 수 있다는 점이며, 가중치가 도착하고 수치가 유지된다면 이는 효율성에 관한 의미 있는 결과다. 하지만 그것은 제3자가 실제로 측정한 모델에서 작업을 옮겨야 할 이유는 아직 아니다.
