
Reflection Beam vs Claude Opus 5.5: 오늘 바로 쓸 수 있는 것, 기다려야 하는 것
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Reflection Beam과 Claude Opus 5.5는 아직 진정한 경쟁자가 아니며, 그 이유는 기술적이라기보다 행정적인 데 있다. 리플렉션의 첫 모델인 Beam은 2026년 10월 5일에 발표되었으며, 5,010억 개의 파라미터를 갖춘 희소 전문가 혼합(sparse mixture-of-experts) 모델로 토큰당 230억 개의 파라미터를 활성화하지만, 대기자 명단을 통해서만 접근할 수 있고, 가중치는 이번 달 말 Apache 2.0 라이선스로 공개하겠다고 약속했을 뿐이며, 가격은 어디에도 공개되지 않았다. Opus 5.5는 2026년 9월 22일 Anthropic의 플래그십으로 출시되었다. 100만 토큰 컨텍스트 창, 텍스트·이미지·파일 입력을 지원하며, 정가는 입력 100만 토큰당 4.00달러, 출력 100만 토큰당 20.00달러다. 따라서 이 비교의 솔직한 결론은 이렇다. 이 모델들 중 하나는 비용을 미리 알고도 오늘 오후에 곧바로 프로덕션에 투입할 수 있고, 다른 하나는 그럴 수 없다. 그리고 여기서 다루는 나머지 모든 내용은 가중치가 풀렸을 때 벌어질 일에 대한 예측에 불과하다.
짧은 대답
이번 주에 어떤 모델을 기반으로 구축할지가 문제라면, 별다른 이견 없이 Opus 5.5다. 그것은 일반 제공되고, 독립적으로 평가되며, 멀티모달이고, 가격이 책정되어 있으며, 5분 안에 호출할 수 있는 API를 통해 제공된다. Beam의 사례는 Opus 5.5를 능가한다는 데 있지 않다 — Reflection 자체 자료 어디에도 그렇다고 주장하지 않는다. 그것은 훨씬 더 좁은 명제에 기댄다. 즉, 주어진 추론 점수에서 Beam은 추론 연산량의 약 4분의 1만 소모한다는 것이다. Reflection 외부의 누군가가 이를 측정했을 때 그것이 유지된다면, Beam은 답이 좋아야 하지만 최고일 필요는 없는 대량 작업에서 흥미로워진다. 그렇지 않다면, Beam은 대기자 명단이 있는 중위권 오픈 모델이다.
다음 내용은 이 맞대결에서 오늘 현재 사실인 부분과 베팅에 해당하는 부분을 구분합니다.
각 모델이 정확히 무엇인지
Opus 5.5는 Claude Opus 5의 폐쇄형 호스팅 후속 모델로, Anthropic이 대규모 코드베이스 전반의 다단계 변경, 코드 리뷰, 장시간 자율 세션용으로 포지셔닝한 모델입니다. 텍스트, 이미지, 파일을 입력으로 받고 텍스트를 반환하며, 1,000,000토큰 컨텍스트 창을 제공하고 출력 토큰은 최대 128,000개이며, 구성 가능한 추론 강도를 갖춘 확장 사고를 지원합니다. 오픈 웨이트가 아니며, 그 지식은 사용자가 통제하는 그 무엇이 아니라 Anthropic의 학습 컷오프에 의해 제한됩니다.
Reflection Beam은 반대되는 구조다. 총 파라미터가 5,010억 개이고 그중 230억 개가 활성화된다. 토큰당 모델의 약 4.6퍼센트만 깨어 있는 셈으로, GLM 5.2의 약 5.4퍼센트와 비교해도 공격적인 비율이며, 학습 비용보다 서빙 비용을 낮추는 데 초점을 맞춰 만들어졌다. 텍스트 전용이다. API 컨텍스트는 256,000 토큰이고, 베타 기간 중 이 수치가 바뀔 수 있다는 각주가 붙어 있으며, 최대 출력은 128,000 토큰이다. 엔드포인트는 api.reflection.ai/openai/v1에서 OpenAI 호환 방식으로 제공되며, Chat Completions와 Models 목록 외에는 아무것도 노출하지 않는다. reasoning_effort 파라미터는 다섯 가지 값을 받고 기본값은 medium이며, 끌 수 없다.
• 가격 — Claude Opus 5.5는 백만 토큰당 입력 $4.00, 출력 $20.00이며, 캐시 읽기는 $0.20, 캐시 쓰기는 $5.00입니다. 반면 Reflection Beam은 블로그 게시물, 문서 또는 모델 목록에 공개되지 않았습니다.
• 제공 현황 — Opus 5.5는 오늘부터 일반 제공되며, Beam은 베타 대기자 명단 형태로, 가중치와 기술 보고서, 모델 카드는 이달 말에 공개될 예정입니다.
• 모달리티 — Opus 5.5는 텍스트, 이미지, 파일을 지원하고, Beam은 텍스트만 지원합니다.
• 컨텍스트 — 256,000 대비 1,000,000 토큰, Beam의 수치에는 베타 관련 유의사항이 따름.
• 오픈 웨이트 — Opus 5.5는 아니며, Beam의 경우 Apache 2.0 하에 약속되었으나 아직 공개되지 않음.
• 독립 점수 — Opus 5.5에는 있지만 Beam에는 없습니다.

가격은 비교되지 않는 부분입니다.
Opus 5.5의 $4.00와 $20.00은 공급자의 정가이며, 우리 카탈로그에서는 아무것도 추가하지 않고 그대로 반영됩니다. 캐시 읽기 $0.20과 캐시 쓰기 $5.00은 Opus 5.5가 판매되는 워크로드에서 대단히 중요합니다. 동일한 200,000토큰 코드베이스를 턴마다 다시 읽는 긴 에이전트 세션은 그 대부분에 대해 입력 요율이 아니라 캐시 요율을 지불합니다. 이는 실재하며 종종 과소평가되는 지렛대이고, 프런티어 모델이 예산 밖이라고 결론 내리기 전에 모델링해 볼 가치가 있습니다.
Beam에는 비교할 수 있는 숫자가 없습니다. 대조할 정가도 없고, 모델링할 캐시 등급도 없으며, 베타에 대해 공개된 요금도 없습니다. Reflection은 Beam이 토큰당 판매될지, 좌석당 과금될지, 아니면 가중치와 함께 무료로 제공될지 말하지 않았습니다. 오늘 Beam의 백만당 비용을 인용하는 사람은 그것을 지어내는 것입니다.
실질적인 결과: 가격 비교는 "Opus 5.5는 비싸고 Beam은 더 저렴하다"가 아니다. 그것은 "이들 중 하나는 가격이 있고 다른 하나는 날짜가 있다"이다. 오늘 결정을 내리는 팀에게 그 비대칭성은 벤치마크보다 더 많은 것을 좌우한다.
벤치마크: 겹치는 두 숫자, 그리고 그것들이 여전히 비교되지 않는 이유
Reflection의 출시 표에는 Opus 5.5나 어떤 프런티어 폐쇄형 모델도 포함되지 않는다. 비교 대상은 전부 오픈 또는 세미 오픈 모델이다: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max, DeepSeek V4.1 Flash. 따라서 Beam 대 Opus 표는 어떤 것이든 수작업으로 구성해야 하며, 그것을 정직하게 구성한다는 것은 하네스 차이를 매끄럽게 넘기기보다 차이를 명시하는 것을 의미한다.
두 모델 모두 공개된 수치가 있는 벤치마크는 정확히 두 개뿐이며, 어느 조합도 통제되지 않았습니다.
• Humanity's Last Exam — Reflection은 Beam이 도구 없이 36.2를 기록했다고 보고하고, Artificial Analysis는 Opus 5.5를 61.4로 기록한다. 서로 다른 두 하네스, 서로 다른 두 구성 — Opus 5.5의 수치는 '도구 없음'으로 표시되지 않았다 — 그리고 25점 격차는 모델보다는 설정에 대해 더 많이 말해준다.
• SciCode — Reflection은 Beam을 49.7로 보고하고, Artificial Analysis는 Opus 5.5를 66.9로 기록합니다. 같은 벤치마크, 같은 문제: 한 숫자는 벤더 자체 실행 결과이고, 다른 숫자는 제3자 하네스 측정치입니다.
나머지는 전혀 겹치지 않습니다. Beam의 표는 Terminal-Bench v2.1을 기준으로 만들어졌지만, 현재 Artificial Analysis 지수는 Terminal-Bench 4.0을 사용합니다. 같은 제품군의 다른 버전이기 때문에, 그 보드에서 Beam의 80.1과 Opus 5.5의 59.6은 비교 대상이 아니며 결코 나란히 표기되어서는 안 됩니다. 지수 자체에서 Artificial Analysis는 Opus 5.5를 Max / Default Fallback 구성에서 57.6으로 책정했으며, 해당 실행에 포함된 147개 모델 중 4위입니다. Beam은 지수 행이 없습니다. 모델 페이지는 404를 반환하고, 오늘 아침 기준으로 리더보드에 Beam 항목이 실려 있지 않습니다.
Beam에 관해 공식적으로 남겨진, 진정으로 독립적인 유일한 발언은 Artificial Analysis가 10월 5일에 한 말이다. Reflection이 자사에 접근 권한을 주었고, 자사가 그 모델을 독립적으로 벤치마킹하고 있으며, 초기 지표에 따르면 Beam이 자사가 그 지능 수준에서 본 오픈 모델 중 토큰 효율이 가장 높은 모델 중 하나가 될 것이라는 말이다. 이는 적절한 출처에서 나온 강력한 문장이지만, 여전히 숫자가 없는 문장이다. 이 맞대결을 결정할 것은 바로 그 숫자다.

효율성 주장이 실제로 효과를 발휘하는 지점
Reflection의 주장은 Beam이 프런티어 모델보다 더 똑똑하다는 것이 아니다. Beam이 추론 컴퓨팅을 3~4배 덜 사용하면서도 GLM 5.2와 비슷한 점수를 낸다는 것, 그리고 Qwen 3.8-Max가 속한 2조 매개변수 계열의 모델들을 상대로는 그 격차가 더 벌어진다는 것이다. 이를 뒷받침하는 차트는 생성 FLOPs를 활성 매개변수 수의 두 배에 시도당 평균 생성 토큰 수를 곱한 값으로 추정하며, 그 자체의 캡션에서도 이 계산이 프롬프트 프리필, 어텐션, 서빙 오버헤드를 제외한다는 점을 인정한다.
그것을 액면 그대로 받아들이면, 흥미로운 타깃은 전혀 Opus 5.5가 아니라 시장의 중간이다. Opus 5.5는 작업당 능력으로 경쟁하며 판단이 필요한 작업에서 승리한다: 다단계 리팩터링, 코드 리뷰, 잘못된 답변이 토큰보다 더 많은 비용을 초래하는 작업. 토큰당 4.6퍼센트만 깨어 있는 모델은 작업당 비용으로 경쟁하며 볼륨이 지배하고 품질 기준이 "충분히 좋고 다운스트림에서 검증됨"인 곳에서 승리한다. 이들은 서로 다른 제품이며, Beam을 Opus 5.5와 단일 스코어보드에서 비교하는 것은 잘못된 것을 측정하는 것이다.
이름 붙일 만한 2차 효과가 하나 있다. Beam의 효율성 주장이 유효하다면, Beam이 자연스럽게 자리할 곳은 그렇지 않으면 프런티어 모델의 토큰을 그 모델이 감당하기에 과분한 작업에 써야 하는 종류의 워크로드다. 이것은 모델 선택이 아니라 라우팅 결정이며, 여기서 벤치마크 질문보다 가격 질문이 더 중요한 이유이기도 하다: 비용이 없는 모델로는 비용을 기준으로 라우팅할 수 없다.
Beam을 호출할 수 있을 때 둘을 나란히 실행해 보면
Opus 5.5는 오늘 저희 카탈로그에 백만 토큰당 $4.00 및 $20.00에 올라와 있으며, 아무것도 더하지 않고 정가 그대로 전달되며, api.orcarouter.ai/v1에서 단일 OpenAI 호환 키 뒤에 200개가 넘는 다른 모델들과 나란히 자리합니다. 프런티어 모델과 저렴한 오픈 모델 사이에서 워크로드를 A/B 테스트해 보고 싶었다면, 바로 그것이 이 구성의 형태입니다: 두 개의 모델 ID, 하나의 키, 두 번째 계약도 없고 코드 변경도 없습니다 — 그리고 라우팅의 자동 페일오버 덕분에 한 제공업체가 안 좋은 오후를 보내더라도 여러분의 파이프라인이 함께 무너지지 않습니다.
Beam은 아직 그 일부가 될 수 없으며, 우리는 그렇지 않은 척하지 않겠습니다. Reflection Beam은 우리의 경로 중 하나가 아니며, 그것을 재판매할지도 모르는 누군가를 여러분에게 안내하지도 않겠습니다. 가중치가 Apache 2.0으로 공개되면 직접 호스팅하고 자신의 엔드포인트로 라우팅할 수 있게 됩니다. 그때까지는 유일한 경로는 Reflection의 대기자 명단뿐입니다.
프론티어 모델이 진정으로 필요한 워크로드라면, 비교해야 할 대상은 Beam이 아니다. 그것은 카탈로그에 있는 다른 모든 것, 즉 $1.26와 $3.96의 GLM 5.3, $2.00와 $6.00의 Qwen 3.8-Max, $0.15와 $0.60의 DeepSeek V4.1 Flash와의 비교이며, 이는 모두 오늘 아침 실시간으로 확인한 가격이다. Beam이 경쟁력 있는 가격을 책정한다면 진입하게 될 등급이 바로 여기이고, 이는 출시 차트가 시사하는 것보다 훨씬 더 어려운 경쟁 구도다.

이 평결을 바꿀 수 있는 것은 무엇인가요
세 가지, 중요한 순서대로.
Beam에 대한 Artificial Analysis 행. 하나가 나온다는 발표가 아니라 — 그 행. 지수가 Opus 5.5의 57.6 근처에 안착하면서 토큰 효율성 주장이 제3자 하네스와의 접촉에서도 살아남는다면, 시장 중간층은 정말로 불편해지고 Beam은 많은 대량 작업의 기본값이 된다. 40대 초반의 오픈 웨이트 군집에 더 가깝게 안착한다면, Beam은 견고한 저렴한 모델일 뿐 그 이상은 아니다.
가격. 정가가 없는 모델은 비용 논쟁에서 이길 수 없습니다. 비교할 대상이 없기 때문입니다. Beam이 GLM 5.3 티어보다 낮게 나온다면, 효율성 이야기는 순식간에 예산 이야기가 됩니다. Beam이 DeepSeek V4.1 Flash의 $0.15 및 $0.60보다 높게 나오면서 성능 우위도 없다면, 애초에 그것이 만들어진 대량 작업을 확보하는 데 어려움을 겪을 것입니다.
가중치. 그것이 존재하기 전까지 "오픈 웨이트"는 아직 부여되지 않은 라이선스에 관한 선언일 뿐이며, 아무도 실제로 실행할 수 있는 모델을 기준으로 점수당 FLOPs 계산을 검증할 수 없다. 그것이 바로 Reflection이 요청했으면서도 아직 가능하게 하지 않은 검증이다.
적어도 그중 하나가 실현되기 전까지는, 실용적인 선택은 고민할 여지가 없다. Opus 5.5는 따져보고, 비용을 산정하고, 실제로 출시할 수 있는 모델이다. Beam은 지켜보게 되는 모델이다.
이 글에서 비교한 모델3
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
