
Reflection Beam, 베타 API 출시… 가중치는 아직 2주 남았다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 222 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Reflection의 첫 모델은 Reflection Beam이라고 합니다. 오늘 아침 이 모델에서 흥미로운 점은 그것이 존재한다는 것이 아니라, 그 절반만 존재한다는 점입니다. 회사는 2026년 10월 5일 Beam을 총 5,010억 개의 파라미터와 토큰당 230억 개의 활성 파라미터를 갖춘 희소 전문가 혼합 모델로 발표했고, 같은 날 베타 OpenAI 호환 엔드포인트를 공개했습니다. 가중치는 이달 말 Apache 2.0에 따라 기술 보고서, 모델 카드, 서빙 스택과 함께 공개하겠다고 예고했습니다. 그것들이 나오기 전까지 Beam-501B-A23B를 실행할 수 있는 사람은 Reflection이 대기 명단 키를 건네주는 사람들뿐이며, 유통되는 모든 성능 수치는 한 연구소 자체 표에서 나온 것입니다.
출시가 멈춰 선 지점치고는 이상한 곳이다. 그리고 우리가 가진 것이 어느 절반인지 정확히 따져볼 만하다. Reflection은 가입할 수 있는 프리뷰와 아무도 재현하지 못한 일련의 벤치마크 표를 내놓았다. 헤드라인에서 "open-weight"가 가리키는 그것은 아직 내놓지 않았다.
오늘 아침에 실제로 라이브인 건 뭐예요?
이 섹션의 모든 내용은 2026년 10월 6일에 읽은 Reflection 자체의 블로그 게시물과 문서에서 가져온 것입니다.
• 모델 ID — Beam-501B-A23B, 2026년 10월 5일에 생성됨, api.reflection.ai/openai/v1에서 Chat Completions와 Models 목록만 제공했으며 그 외에는 아무것도 없었습니다.
• 구조 — 총 5,010억 개의 파라미터, 토큰당 230억 개가 활성화되어 활성화 비율이 약 4.6%다. 규모를 비교하자면, GLM 5.2는 약 5.4%에 가깝다.
• 컨텍스트 — API에서 256,000토큰이며, 해당 수치 자체에 베타 기간 중 이 윈도가 변경될 수 있다는 경고를 담은 각주가 붙어 있습니다. 최대 출력은 128,000토큰입니다.
• 추론 — reasoning_effort 매개변수에는 low, medium, high, xhigh, max의 다섯 가지 설정이 있습니다. Medium이 기본값이며, 모델은 항상 추론합니다. 끄기 스위치나 비추론 모드는 없습니다.
• 모달리티 — 텍스트 입력, 텍스트 출력. 출시 시점에는 이미지, 오디오, 비디오 입력이 없습니다.
• 가격 — 미공개. 블로그 게시물에도 가격이 없고, 문서에도 없으며, 플랫폼 콘솔은 회원가입 장벽 뒤에 있다.
• 액세스 — 대기 명단입니다. 셀프서브 경로가 없고 가중치도 없으므로, 다운로드도, 양자화도, 파인튜닝도 없습니다.
가격 행은 다른 모든 것을 읽는 방식을 바꾸는 항목이다. Reflection 자체 표에서 Beam이 비교 대상으로 삼는 일곱 모델 중 네 개는 오늘 당장 스프레드시트에 넣을 수 있는 공개 정가가 있다. Beam은 그렇지 않다. 따라서 지금 Beam에 관한 어떤 비용 주장도 달러가 아니라 컴퓨트에 관한 주장이다.

출시가 달려 있는 숫자
Reflection이 내세우는 핵심은 추론 효율성이며, 그것이 의미하는 바를 이례적으로 구체적으로 밝힌다. 고급 추론 벤치마크에서 Beam은 추론 연산을 3~4배 덜 사용하면서도 GLM 5.2와 비슷한 성적을 낸다. 그 이점은 2조 파라미터 계열, 즉 Qwen 3.8-Max가 속한 모델들과 비교할 때 훨씬 더 크다고 설명된다.
그 주장 뒤에 있는 차트는 주의 깊게 읽어볼 가치가 있다. 왜냐하면 그것이 글 전체에서 핵심을 떠받치는 근거이기 때문이다. 이 차트는 DeepSWE, Humanity's Last Exam, Terminal-Bench 2.1 전반에 걸쳐 추론 점수를 추정 추론 FLOPs에 대비해 그리며, FLOPs를 대략 활성 파라미터의 두 배에 시도당 평균 생성 토큰 수를 곱한 값으로 추정한다. 그 공식은 프롬프트 프리필, 문맥 의존적 어텐션 연산, 서빙 오버헤드를 의도적으로 제외한다 — Reflection이 캡션에서 그렇게 말한다. 이는 누구의 청구서를 측정한 것이라기보다 모델 간의 일관된 비교이며, 또한 효율성 주장에 대한 유일한 정량적 뒷받침이기도 한데, 이는 모델을 만든 연구소가 작성한 것이다. 가중치를 통해 다른 누군가가 시험해 볼 수 있는 가설로 취급하라.
이 아키텍처가 실제로 제공하는 이점은 서빙 프로필이다. 230억 개의 활성 파라미터는 상대적으로 적은 수의 GPU에서 인터랙티브 수준의 지연으로 실행하는 것이 충분히 가능한 모델이며, 이는 카드에 적힌 숫자가 같더라도 5010억 개 파라미터의 덴스 모델과는 다른 제품이다. 그렇기 때문에 Reflection은 데이터센터 규모의 배포를 이야기하지 않고도 프런티어에 근접한 추론을 이야기할 수 있으며, 결국 이루어질 가중치 공개가 베타 키보다 더 중요한 사건인 이유이기도 하다.
Beam이 Reflection 자체 테이블에서 자리 잡는 위치
아래의 모든 수치는 Reflection의 출시 게시물에 있는 표에서 가져온 공급업체 보고 수치이며, 그중 어느 것도 독립적으로 재현되지 않았습니다. Reflection이 어떤 모델에 대해 수치를 공개하지 않은 경우, 원문에서 해당 셀은 NR로 표기되어 있습니다. 비교 열은 Reflection의 것으로, 우리 것이나 제3자의 것이 아닙니다.
코딩 및 터미널 작업
• Terminal-Bench v2.1 — Reflection Beam 80.1 대 GLM 5.2 81.0, GLM 5.3 88.2, Kimi K3 88.3, Qwen 3.8-Max 86.6, DeepSeek V4.1 Flash 90.6. Beam은 그들 모두보다 아래에 있습니다.
• SWE-Bench Verified — Reflection Beam 80.9 대 Inkling 77.6, Nemotron 3 Ultra 70.7. Beam이 가장 강해 보이는 부분은 바로 여기지만, 이 벤치마크에는 목록에서 가장 약한 두 모델만 실행되었다는 점에 유의하세요.
• SWE-Bench Pro v1 — Reflection Beam 65.5 대 Qwen 3.8-Max 67.7, GLM 5.2 62.1, Inkling 54.3, Nemotron 3 Ultra 46.4.
• SWE-Bench Pro v2-Hard — Reflection Beam 77.2 대 Kimi K3 88.2, GLM 5.3 84.3, Inkling 56.9. 표 최상위와의 격차는 10점이다.
• DeepSWE v1.1 — Reflection Beam 44.4, DeepSeek V4.1 Flash 74.2, Kimi K3 68.0, GLM 5.0 61.0, Qwen 3.8-Max 51.0, GLM 5.2 44.0 대비. Beam은 이전 세대와 같은 수준에 머물렀고 선두보다 30점 뒤처졌다.
• SWE Atlas Codebase QnA — Reflection Beam 34.6 대 Kimi K3 68.0, GLM 5.3 61.0. 긴 상호작용 전반에 걸쳐 대규모 저장소를 머릿속에 유지하는 것은 이 목록에서 가장 어려운 일이며, Beam의 34.6은 반올림 차이가 아닙니다.
추론과 과학
• AIME 2026: Reflection Beam 97.2, GLM 5.2 98.1 및 Inkling 96.3 대비
• 도구 없이 — Reflection Beam 36.2 대 Kimi K3 46.9, Qwen 3.8-Max 43.6, GLM 5.3 42.3, GLM 5.2 40.5, DeepSeek V4.1 Flash 39.1, Inkling 29.7, Nemotron 3 Ultra 26.7. 중위권이며, 이전 세대 모델 두 개만 앞선다.
• GPQA Diamond — Reflection Beam 90.5 대 Kimi K3 93.5, Qwen 3.8-Max 92.6, GLM 5.3 91.7, GLM 5.2 91.2, DeepSeek V4.1 Flash 90.9.
• SciCode — Reflection Beam 49.7 대비 GLM 5.3 59.0, Kimi K3 58.7, Qwen 3.8-Max 52.1, DeepSeek V4.1 Flash 52.0.
• CriPT AA — Reflection Beam 16.3 대 Kimi K3 23.4, GLM 5.2 20.9, Qwen 3.8-Max 20.0, GLM 5.3 19.1, DeepSeek V4.1 Flash 14.3, Inkling 5.4, Nemotron 3 Ultra 3.1.
도구, 검색 및 긴 컨텍스트
• MCP Atlas — Reflection Beam 78.7 대 Qwen 3.8-Max 84.5, GLM 5.3 84.2, Kimi K3 82.3, GLM 5.2 77.8.
• AutomationBench, 공개 스플릿 — Reflection Beam 37.0 대비 DeepSeek V4.1 Flash 54.8, GLM 5.3 48.2, Kimi K3 46.7, Qwen 3.8-Max 39.8, GLM 5.2 26.2.
• tau3 banking — Reflection Beam 38.0 대 Qwen 3.8-Max 55.2, GLM 5.2 37.1, Kimi K3 37.1.
• 컨텍스트 관리를 적용한 BrowseComp — Reflection Beam 77.4 대 Kimi K3 91.2, Inkling 77.1, Nemotron 3 Ultra 44.4.
• 컨텍스트 관리를 적용한 DeepSearchQA — Reflection Beam 80.1 대 Kimi K3 95.0.
• AA-LCR — Reflection Beam 79.3 대 Kimi K3 88.7, DeepSeek V4.1 Flash 84.0, Qwen 3.8-Max 80.3, GLM 5.3 79.7, Nemotron 3 Ultra 79.3, GLM 5.2 78.3, Inkling 77.3. 긴 문맥 회상은 Beam이 중간권이 아니라 진정으로 경쟁력을 갖는 유일한 일반 능력 항목이다.
네 개의 표를 함께 읽으면 일관된 양상이 드러난다. Beam은 Reflection의 목록에서 이전 세대 모델 두 개를 앞서고 현재 모델에는 거의 모든 행에서 뒤지는데, 그 격차는 작은 것부터 실격 수준에 이르기까지 다양하다. 자사 모델을 그렇게 많은 행에서 뒤처지게 하는 표를 공개하는 벤더라는 점은 그 연구소의 정직성에 관한 좋은 신호다. 그것이 그 모델이 최전선에 있다는 신호는 아니다.

지금까지 단 하나뿐인 독립적인 목소리, 그리고 그것이 말하지 않는 것
공식적으로 확인된 유일한 제3자 평가는 Artificial Analysis이며, 이 회사는 10월 5일 Reflection이 자사에 접근 권한을 제공했고 자체적으로 Beam을 벤치마킹하고 있다고 밝혔으며, 초기 지표에 따르면 Beam이 해당 지능 수준에서 지금까지 본 것 중 가장 토큰 효율적인 오픈 모델 중 하나가 될 것임을 시사한다고 덧붙였다.
그것은 대부분의 구매자가 실제로 읽는 지수를 보유한 조직이 한 의미 있는 발언이며, 동시에 숫자가 하나도 들어 있지 않은 발언이기도 하다. 오늘 아침 현재 Artificial Analysis의 리더보드에는 Beam 행이 없다 — 모델 페이지는 404를 반환하고 리더보드 페이로드에는 Beam 항목이 들어 있지 않다 — 따라서 토큰 효율성 주장은 현재로선 제3자가 무언가를 공개하겠다는 약속에 불과하다. 지수에서 Beam에 대해 재계산된 항목은 아직 아무것도 없다.
훈련 관련 공개는 이번 릴리스에서 가장 강력한 부분이다
Reflection의 게시물에서 엔지니어링 섹션은 대부분의 연구소가 내부에만 보관하는 수치를 담고 있으며, 그 수치는 한 달 뒤에도 여전히 흥미로울 릴리스의 일부이기에 기록해 둘 가치가 있다.
• 사전 학습 — NVL72 랙에 장착된 6,144개의 NVIDIA GB300 칩에서 23.8조 개의 정제된 토큰을 처리했으며, 4주 이내에 처음부터 끝까지 완료되었고, 보고된 굿풋(goodput)은 92.3%였습니다. 그 과정에서 그래디언트 노름 급등이나 의심되는 사일런트 데이터 손상(silent data corruption)에 기인한 9번의 반자동 리와인드가 있었습니다.
• 강화 학습 — 4주 동안 10,500개의 GB300 칩, 1억 회 이상의 롤아웃, 최대 256,000 토큰의 롤아웃 컨텍스트, 약 13억 개의 샌드박스와 코딩, 에이전트형 및 STEM 작업을 위해 확보된 약 100만 개의 서로 다른 환경.
• 서빙 — 새 가중치가 추론 플릿에 도달하는 데 걸린 시간은 중앙값 약 12초였으며, 계층적 배포로 랙 간 트래픽을 75퍼센트 줄이고 모든 레플리카가 가중치를 직접 가져오는 방식보다 플릿 전체 적용을 2.2× 더 빠르게 만들었습니다.
• 안정성 — 하루 지난 상호작용으로부터 학습할 때도 수치적으로 안정성을 유지하는 완전 비동기 정책 그래디언트, 그리고 재학습 없이 추론 길이와 점수 사이의 균형을 맞출 수 있게 하는 제어 가능한 길이 페널티.
• 데이터 — 파싱, 중복 제거, 큐레이션을 통해 원시 인터넷 토큰의 약 95퍼센트가 제거되었으며, 기존 필터라면 Reflection이 보유한 토큰 중 약 1.8조 개를 놓쳤을 것이라는 주장이 있습니다. 여기에는 Reflection이 큐레이션한 웹-코드 토큰의 87퍼센트가 포함됩니다.
두 문장은 따로 표시해 둘 만하다. 게시글은 미드트레이닝이 Beam의 유효 컨텍스트를 100만 토큰으로 확장한다고 말하지만, API 문서에는 베타 각주와 함께 256,000토큰의 서빙 한도가 적혀 있다. 이는 모순이라기보다 훈련 측 역량과 서빙 측 한도이지만, 두 번째 문서를 아무도 읽지 않으면 바로 그 간극이 "1M 컨텍스트" 헤드라인이 된다. 그리고 1억 회가 넘는 롤아웃이라는 RL 수치는 오픈랩이 수행한 그런 실행 중 가장 큰 규모 중 하나로 제시되는데, 이는 규모에 관한 주장이지 그 규모가 무엇을 얻어냈는지에 관한 주장이 아니다 — 점수 대 롤아웃 곡선은 공급업체 자체의 것이며, 공급업체가 그래프 그리기를 멈춘 지점에서 끝난다.

오늘 Reflection Beam으로 할 수 있는 것
한 가지: 대기자 명단에 등록하고, 키를 받으면 OpenAI 형태의 클라이언트로 Reflection 자체 엔드포인트를 통해 Beam-501B-A23B를 호출하세요. 공개된 가격이 없으므로, 이에 대한 워크로드 비용을 모델링할 방법이 없습니다. 가중치가 없으므로 자체 호스팅도, 양자화도, 제3자 재현도 없습니다. 독립적인 벤치마크 행이 없으므로, 위의 전체 성능상은 단일 연구소의 표에만 의존합니다.
Reflection Beam은 우리의 라우트 중 하나가 아니며, 그렇다고 그것인 것처럼 암시하지도 않겠습니다. 우리가 드릴 수 있는 것은 그것이 진입하려는 분야의 가격입니다. 오늘 아침 우리 자체 카탈로그에서 실시간으로 읽어온 값으로, GLM 5.2는 백만 토큰당 입력 $1.40, 출력 $4.40이고, GLM 5.3은 $1.26와 $3.96, Qwen 3.8-Max는 $2.00와 $6.00, DeepSeek V4.1 Flash는 $0.15와 $0.60입니다. 이는 입력만 놓고 봐도 가장 저렴한 것과 가장 비싼 것 사이에 9배 이상의 격차입니다 — 그리고 이것이 가격표가 없는 베타 모델을, 효율성 차트가 아무리 좋아 보여도, 의사결정에 끼워 넣기 정말 어려운 이유입니다.
OrcaRouter는 하나의 OpenAI 호환 키로 그 네 가지와 200개 이상의 다른 모델을 실행하며, 공급자의 정가를 아무것도 더하지 않고 그대로 전달하므로, 공급업체의 가격 변경은 리셀러가 표를 새로 고칠 때가 아니라 같은 날 우리 쪽에 바로 반영됩니다. 자동 페일오버는 각 공급자별로 따로 구축해야 하는 무언가가 아니라 라우팅의 일부입니다. 즉, 재현 결과도, 독립적인 점수도, 가격도 없는 검증되지 않은 모델은 핵심 경로가 아니라 트래픽의 일부에 배치하는 바로 그런 대상입니다.
주장이 검증 가능해질 때
이 일을 결정짓는 세 가지가 있는데, Reflection은 그중 두 가지를 이달 안에 넣어 두었다.
첫 번째는 가중치다. Apache 2.0과 기술 보고서가 있으면, 노드 몇 개만 가진 사람이라도 중요한 것을 측정할 수 있다 — 고정된 품질 기준에서 GPU당 초당 토큰 수, 그리고 230억 개의 활성 파라미터가 정말로 그 차트가 시사하는 FLOP당 점수를 내는지. 그때까지는 효율성 논변이 냅킨 위의 산수에 불과하며, 그것을 되풀이하는 모든 사람은 Reflection의 캡션을 되풀이하는 것이다.
두 번째는 가격이다. 정가가 없는 모델은 비용 비교에서 설 자리가 없다. Beam이 GLM과 DeepSeek 등급보다 높게 책정되면, 예산이 있는 누구에게나 컴퓨팅 이야기는 더 이상 중요하지 않게 된다. 그보다 낮게 책정되면 상황은 빠르게 바뀐다.
세 번째는 지수다. Artificial Analysis는 Beam을 벤치마킹하고 있다고 밝혔으며 아무 수치도 공개하지 않았다. 그 행이 등장하면, 그것은 이 이야기에서 Reflection이 계산하지 않은 첫 번째 수치가 될 것이다.
오늘 당장 유능한 에이전트형 코더가 필요하고 그 비용을 알아야 한다면, 답은 아직 Reflection Beam이 아니다. 3주 뒤에는 그럴지도 모른다. 효율성 주장에 걸어볼 만한 모델은 가중치를 직접 내려받을 수 있고 FLOPs를 직접 셀 수 있는 모델이다 — 그리고 그 테스트에서 Reflection은 우리에게 모델이 아니라 날짜와 대기자 명단을 내놓았다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
