제목이 'Reflection Beam: 501B 파라미터, 23B 활성'이고 부제가 'Sparse MoE / 23.8T 사전 학습 토큰 / 256K 토큰 API 컨텍스트 / 이번 달 가중치 공개 예정 / 모든 수치는 벤더 보고'인 생성된 히어로 카드입니다. 텍스트 아래에는 세 개의 플랫 라인 아이콘이 있습니다: 대부분의 레이어가 흐리게 처리되고 하나가 강조된 적층 레이어 다이어그램, 아홉 개의 서버 브릭으로 구성된 랙, 그리고 작은 자물쇠가 있는 문서 개요입니다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있습니다.
Guides & Insights

Reflection Beam, 해설: 501B 파라미터, 23B 활성, 그리고 아직 공개되지 않은 가중치

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 10월 5일 Reflection은 다음을 발표했다:Reflection Beam, 총 5010억 개의 매개변수를 갖춘 희소 전문가 혼합 언어 모델로, 토큰당 230억 개를 활성화하며, 같은 날 그 모델을 위한 베타 OpenAI 호환 엔드포인트를 내놓았다. 이는 어느 순간이든 모델의 4.6퍼센트가 깨어 있다는 뜻이다 — 현재 오픈 웨이트 분야의 기준으로 봐도 공격적인 비율이다 — 그리고 이번 출시 전체가 이 수치에 달려 있다. Reflection은 전체 가중치, 기술 보고서, 모델 카드가 이달 말 Apache 2.0 라이선스로 공개될 예정이라고 말한다. 오늘 기준으로 그것들은 아직 나오지 않았고, Reflection 자사 채널 어디에도 가격은 공개되지 않았으며, Artificial Analysis에는 이 모델에 대한 항목이 없다. 그래서 이번 출시에 대한 솔직한 요약은 이렇다: 모델을 훈련한 연구소가 효율성에 관해 내놓은 매우 구체적인 주장이며, 이를 뒷받침하는 모든 수치도 그 연구소가 제공한 것이다.

Reflection의 자체 비교 표는 Reflection Beam을 Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen3.8 Max 및 DeepSeek V4.1 Flash와 비교하는데, 이는 Beam이 겨냥하는 계층을 공정하게 보여준다: 강력하지만 최전선급은 아닌 오픈 및 세미 오픈 모델들이며, 그중 몇몇은 Beam 크기의 일부에 불과하다. Beam은 순수 성능에서 그 모델군을 앞지르지 못하며, 어디에서 밀리는지 정확히 보여주겠다. Beam이 주장하는 것은 비슷한 추론 점수에서 GLM 5.2보다 추론 연산을 대략 3~4배 적게 쓰면서 그 상위권에 가까이 자리한다는 것이다. 그 주장이 바로 이 글의 내용이다.

오늘날 실제로 존재하는 것

이 섹션의 모든 내용은 2026년 10월 6일에 확인한 Reflection 자체 문서에서 가져온 것입니다. API는 대기자 명단을 통해 베타로 제공 중이며, 가중치는 아직 공개되지 않았습니다.

• 모델 ID — Beam-501B-A23B, 2026년 10월 5일 생성.

• 인터페이스 — api.reflection.ai/openai/v1에 있는 OpenAI 호환 인터페이스로, Chat Completions와 Models 목록만 노출하며 그 외에는 아무것도 없습니다. Completions도, 임베딩도, 배치도 없습니다.

• 컨텍스트 — 256,000 토큰, 해당 수치 자체에 각주가 붙어 있음: "컨텍스트 윈도우는 베타 기간 동안 변경될 수 있습니다." 최대 출력은 128,000 토큰입니다.

• 추론 — low, medium, high, xhigh, max의 다섯 가지 값을 가지는 reasoning_effort 매개변수입니다. 기본값은 medium이며, 설정에 관계없이 모델은 항상 추론합니다 — 끄는 스위치는 없습니다.

• 모달리티 — 텍스트 입력, 텍스트 출력. 출시 시점에는 이미지나 오디오 입력이 없으며, 이는 Mira Murati의 Thinking Machines가 7월에 출시한 멀티모달리티 우선 모델 Inkling과는 실질적인 차이점이다.

• 지식 컷오프 — 2026년 6월 30일.

• 가격 — 공개되지 않음. Reflection의 블로그 게시물, 문서, 모델 목록 모두 이를 누락하고 있으며, 플랫폼 콘솔은 가입 장벽 뒤에 있다.

그 마지막 문장은 보기보다 더 중요합니다. Beam의 비교군에 있는 다른 모든 모델에는 오늘 당장 스프레드시트에 입력할 수 있는 공개 정가가 있습니다. Beam은 그렇지 않은데, 이는 지금 Beam에 관한 어떤 비용 논의든 달러가 아니라 컴퓨팅 자원에 관한 논의라는 뜻입니다.

A single-column infographic titled 'Reflection Beam - the scoreboard' with six rows reading 'Total / active parameters: 501B / 23B', 'Pre-training: 23.8T tokens on 6,144 GB300', 'API context: 256,000 tokens (beta footnote)', 'Reasoning effort: five levels, default medium', 'Price: not published anywhere' and 'Independent scores: none - no Artificial Analysis row'. A footer reads 'Vendor-reported; no independent reproduction. Weight release promised for later this month.' The OrcaRouter logo is composited in the bottom-right corner.

501 대 23의 비율이 바로 그 논거다.

희소성은 새로운 것이 아니다. 문제는 한 연구소가 이를 얼마나 멀리까지 밀어붙일 의향이 있느냐이다. GLM 5.2는 전체가 약 7,440억 개로 보고된 가운데 약 400억 개의 활성 파라미터를 구동한다 — 약 5.4퍼센트다. Reflection Beam은 5,010억 개 중 4.6퍼센트에 머문다. 이론상으로는 그것은 소폭 한 걸음 더 나아간 것이며, Reflection은 그것에 대해 내세우는 주장에 신중하다.

출시 게시물의 효율 수치는 Artificial Analysis와 DataCurve 데이터를 바탕으로 만든 차트에서 나온 것으로, 추론 점수를 추정 추론 FLOPs에 대해 플롯한 것입니다. 여기서 FLOPs는 활성 파라미터 수의 두 배에 평균 생성 토큰 수를 곱한 값으로 근사됩니다. 이 공식은 프롬프트 프리필, 어텐션 비용, 서빙 오버헤드를 의도적으로 제외합니다. 이는 측정값이 아니라 간이 계산 모델이며, Reflection도 이를 측정값으로 제시하지 않습니다. 하지만 이는 "동일한 점수에서 3~4배 더 저렴하다"는 주장을 뒷받침하는 유일한 정량적 근거이기도 하며, 판매사가 작성한 것입니다. 가중치가 공개되면 다른 사람이 검증할 수 있는 가설로 취급하세요.

이 아키텍처가 실제로 확보하는 것은 서빙 프로파일입니다. 230억 개의 활성 파라미터는 비교적 적은 수의 GPU에서 인터랙티브 지연 시간으로 실행할 수 있는 모델이며, 이는 카드에 적힌 파라미터 수는 같더라도 5,010억 파라미터 덴스 모델과는 다른 제품입니다. 바로 이 점이 Reflection이 데이터센터 규모의 배포를 이야기하지 않고도 프런티어에 근접한 추론을 이야기할 수 있는 이유입니다.

사전 학습에 4주도 채 걸리지 않았고, 공개된 내용은 이례적으로 구체적이다

훈련 관련 설명은 이번 발표에서 정말로 유익하게 읽히는 부분이다. Reflection이 대부분의 연구소가 내부에만 두는 수치를 공개했기 때문이다.

• 사전 학습 — NVL72 랙의 6,144개 GB300 칩에서 23.8조 토큰을 처리했고, 보고된 굿풋 92.3퍼센트로 4주 만에 완료했으며, 그 과정에서 체크포인트로부터 아홉 번의 되감기를 수행했다.

• 강화 학습 — 4주 동안 GB300 칩 10,500개, 1억 회 이상의 롤아웃, 최대 256,000토큰의 롤아웃 컨텍스트, 약 13억 개의 샌드박스와 약 100만 개의 서로 다른 환경, 평균 110,000개의 롤아웃이 동시에 실행됨.

• 중간 학습 — 모델의 유효 컨텍스트를 100만 토큰으로 확장합니다.

• 안정성 — 일 단위 지연에서도 안정을 유지하는 비동기 정책 그래디언트, 그리고 재학습 없이 추론 길이를 조정할 수 있게 하는 제어 가능한 길이 페널티.

사전 학습과 RL 관련 내용을 함께 읽으면 주장의 윤곽이 드러난다. 효율성에 관한 이야기는 추론 시의 활성 파라미터만을 말하는 것이 아니다. 모델이 얼마나 빨리 학습되었는지, 그리고 전체 컴퓨트 중 얼마나 많은 부분이 더 많은 토큰이 아니라 환경에 묶인 RL에 투입되었는지도 말한다. 백만 개의 환경과 13억 개의 샌드박스는 도구 사용 및 에이전트형 학습 인프라에 관한 진술이며, 이는 Reflection이 앞세우기로 선택한 벤치마크와 맞아떨어진다.

숫자 하나는 따로 표시해 둘 만하다. 블로그에서는 미드트레이닝이 실효 컨텍스트를 100만 토큰으로 확장한다고 말한다; API 문서에는 베타 각주가 달린 256,000토큰 서빙 한도가 적혀 있다. 이는 훈련 측 역량과 서빙 측 한도이지 모순은 아니다 — 하지만 그 격차는 아무도 두 번째 문서를 읽지 않으면 "1M 컨텍스트" 헤드라인이 되기 딱 좋은 종류의 것이며, 다음 주에 Beam에 대해 쓰는 사람이라면 누구든 두 번째 문서를 읽어야 한다.

A screenshot of the Artificial Analysis language-model leaderboard, showing the ranked Intelligence Index table with per-model scores. No Reflection Beam row is present - the model is absent from the board, which is the point of the capture.

벤치마크: Reflection Beam이 승리하는 경우와 그렇지 않은 경우

아래의 모든 수치는 Reflection의 출시 게시물에 있는 표에서 가져온 벤더 보고 수치이며, 그중 어느 것도 독립적으로 재현되지 않았습니다. 비교 열은 Reflection이 다른 모델들에 대해 공개한 것과 동일한 수치입니다. 원본에서 셀에 "NR"이 표시된 경우, 해당 모델은 실행되지 않았습니다. Beam에 대한 Artificial Analysis 행은 없으므로, 여기 있는 어떤 것도 제3자 하네스를 거치지 않았습니다.

에이전틱 코딩

• Terminal-Bench v2.1 — Beam 80.1 대 GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen3.8 Max 86.6, DeepSeek V4.1 Flash 90.6, Inkling 63.8, Nemotron 3 Ultra 56.4.

• SWE-Bench Pro v1 — Beam 65.5 대 Qwen3.8 Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.

• SWE-Bench Pro v2-Hard — Beam 77.2 대 Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9.

• SWE-Bench Verified — Beam 80.9 대 Inkling 77.6, Nemotron 3 Ultra 70.7.

• SWE-Bench Multilingual — Beam 78.0 대 Nemotron 3 Ultra 67.7.

• DeepSWE v1.1 — Beam 44.4 대 DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.3 61.0, Qwen3.8 Max 51.0, GLM 5.2 44.0.

• SWE Atlas 코드베이스 QnA — Beam 34.6 vs Kimi K3 68.0, GLM 5.3 61.0.

마지막 행은 곱씹어 볼 만한 부분이다. 장기 호라이즌 저장소 질의응답은 모델이 긴 상호작용 내내 코드베이스를 머릿속에 담고 있어야 하는 영역인데, 34.6 대 68.0은 반올림 차이가 아니다. DeepSWE도 비슷한 이야기를 들려준다. 44.4는 Beam을 GLM 5.2와 같은 수준에 놓고, DeepSeek V4.1 Flash보다는 훨씬 뒤처지게 한다.

추론

• AIME 2026 — Beam 97.8 대 GLM 5.2 99.2, Inkling 97.1.

• HLE, 도구 없음 — Beam 36.2 vs Kimi K3 46.9, Qwen3.8 Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7.

• GPQA Diamond — Beam 90.5 대 Kimi K3 93.5, Qwen3.8 Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9, Inkling 87.2, Nemotron 3 Ultra 87.

• SciCode — Beam 49.7 대비 GLM 5.3 59.0, Kimi K3 58.7, Qwen3.8 Max 52.1, DeepSeek V4.1 Flash 52.0, Inkling 46.1, Nemotron 3 Ultra 44.6.

• CriPT AA — Beam 16.3 대 Kimi K3 23.4, GLM 5.2 20.9, Qwen3.8 Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.

Beam의 추론 프로필은 중간권이고 패턴은 일관적이다: Reflection의 목록에 있는 이전 세대 두 모델보다 여유 있게 앞서며, 현재 모델보다는 뒤처진다. 90.5점의 GPQA Diamond는 다른 네 모델이 능가하는 탄탄한 점수다.

• MCP Atlas — Beam 78.7 대 Qwen3.8 Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8, Inkling 76.0, Nemotron 3 Ultra 63.1.

• AutomationBench, 공개 스플릿 — Beam 37.0 vs DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen3.8 Max 39.8, GLM 5.2 26.2.

• tau3 banking — Beam 38.0 대 Qwen3.8 Max 55.2, GLM 5.2 37.1, Kimi K3 37.1, Inkling 25.0, Nemotron 3 Ultra 22.6.

• 컨텍스트 관리를 적용한 BrowseComp — Beam 77.4 vs Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.

• 컨텍스트 관리 기능이 포함된 DeepSearchQA — Beam 80.1 vs Kimi K3 95.0.

Reflection은 또한 게시물에서 두 가지 역량 데모를 보여주었다: "Land or Water" 퍼즐에서 95.5퍼센트의 해결률, 16,200개 지점이 있는 180x90 격자로 큰 보드 상태를 유지해야 하는 과제 — 이 수치는 같은 과제에서 Reflection이 Opus 5와 Fable 5에 부여한 92.5퍼센트와 97.8퍼센트 사이에 위치한다 — 그리고 가장 작은 Gemma-4를 Text2SQL로 파인튜닝해 홀드아웃 정확도를 66.5퍼센트로 끌어올린 것이다. 데모는 선별된 것이다; 이는 모델이 어떤 일을 할 수 있음을 보여줄 뿐, 얼마나 자주 할 수 있는지는 보여주지 않는다.

오늘 그것으로 할 수 있는 일과, 그것을 전제로 계획해서는 안 되는 일

오늘날 일반적으로 가능한 일은 정확히 하나입니다: 베타 액세스를 요청하고, OpenAI 형태의 클라이언트로 Reflection 자체 엔드포인트를 통해 Beam-501B-A23B를 호출하는 것입니다. 공개된 가격이 없으므로, 해당 모델에서 워크로드 비용을 모델링할 방법이 없습니다. 가중치가 없으므로, 자체 호스팅도, 양자화도, 파인튜닝도, 제3자 재현성도 없습니다. 독립적인 벤치마크 행이 없으므로, 위의 전체 성능 그림은 한 연구소의 표에 의존합니다.

Reflection Beam은 저희 라우트 중 하나가 아닙니다. 그렇지 않은 것처럼 암시하지도 않을 것이고, 그것을 보유하고 있을지도 모르는 리셀러로 안내하지도 않겠습니다. 저희가 말씀드릴 수 있는 것은 비교 대상 모델들의 가격입니다. 저희가 그중 네 개 모델을 라우팅하고 있고, 아래 수치는 오늘 아침 저희 자체 카탈로그에서 실시간으로 읽어온 것이기 때문입니다: GLM 5.2는 백만 토큰당 입력 $1.40, 출력 $4.40, GLM 5.3은 $1.26, $3.96, Qwen3.8 Max는 $2.00, $6.00, DeepSeek V4.1 Flash는 $0.15, $0.60입니다. 이는 상당한 격차입니다 — DeepSeek V4.1 Flash는 입력 기준으로 GLM 5.2보다 거의 열 배 저렴합니다 — 그리고 이것이 가격이 없는 베타 모델을 의사결정에 끼워 넣기 어려운 이유입니다. OrcaRouter는 이들 모델과 200개 이상의 다른 모델 전반에 하나의 OpenAI 호환 키를 공급자 정가를 그대로 전달하고 아무것도 더하지 않은 채로 운영합니다. 즉, 벤더 가격이 바뀌면 리셀러가 갱신할 때가 아니라 같은 날 저희 쪽에서 바로 반영됩니다. 그리고 자동 페일오버가 직접 구축해야 하는 것이 아니라 라우팅의 일부이기 때문에, 새롭고 검증되지 않은 모델은 핵심 경로가 아니라 트래픽의 일부에 올려둘 수 있는 대상입니다. 아직 아무도 벤치마크를 재현하지 못한 무언가를 사용하는 유일하게 책임 있는 방법이죠.

A screenshot of the OrcaRouter model page for z-ai/glm-5.2, showing the model name, the pass-through list price of $1.40 per million input tokens and $4.40 per million output tokens, the 1,000,000-token context window and the release date 2026-06-16.

효율성 주장을 진지하게 받아들이기 전에 주목할 점

세 가지가 그 문제를 해결해 줄 텐데, 그중 두 가지는 이달 안에 약속되어 있다.

첫째는 가중치입니다. Apache 2.0과 기술 보고서가 있다면, 노드 두어 개만 가진 사람이라도 실제로 중요한 것 — 고정된 품질 기준에서 GPU당 초당 토큰 수, 그리고 230억 개의 활성 매개변수가 정말로 차트가 암시하는 FLOP당 점수를 내는지 — 을 측정할 수 있게 됩니다. 그때까지는 효율성 주장은 냅킨에 적은 산수에 불과합니다.

두 번째는 가격이다. 정가가 없는 모델은 비용 비교에서 설 자리가 없다. 그리고 Beam이 GLM과 DeepSeek 티어보다 높게 책정되면, 예산이 있는 사람이라면 누구든 컴퓨팅 이야기는 더 이상 중요하지 않게 된다. 그보다 낮게 책정되면 상황은 빠르게 달라진다.

세 번째는 해당 스위트를 실행하는 제3자입니다. 위의 모든 수치는 같은 문서에서 나온 것이며, 자사 모델이 16개 행 중 7개에서 뒤처지게 만든 벤더 보고 표는 그 랩의 정직성에 관한 좋은 신호입니다 — 하지만 그것은 여전히 하나의 랩, 하나의 하네스, 하나의 프롬프트 세트일 뿐입니다.

오늘 당장 유능한 에이전트형 코더가 필요하고 그 비용이 얼마인지 알아야 한다면, 답은 아직 Reflection Beam이 아닙니다. 3주 뒤에는 될 수도 있습니다. 효율성 주장에 걸어볼 만한 모델은 가중치를 직접 내려받을 수 있고 FLOPs를 직접 셀 수 있는 모델입니다 — 그리고 그 기준에서 Reflection은 우리에게 모델이 아니라 날짜를 준 셈입니다.

이 글에서 비교한 모델4

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트