
Reflection Beam vs Gemini 3.1 Pro Preview: 하나는 영상을 읽고, 하나는 텍스트를 읽는다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 150 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 127 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1202 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 202 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 229 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 대결에서 어떤 벤치마크 표도 언급하지 않는 비대칭성부터 시작하자. Reflection Beam은 2026년 10월 5일에 발표된 5010억 파라미터 규모의 희소 전문가 혼합(mixture-of-experts) 모델로, 토큰당 활성 파라미터는 230억 개이며, 텍스트를 입력받아 텍스트를 출력한다. 그게 전부다. Gemini 3.1 Pro Preview는 2026년 2월 19일 이후로 이 업체의 최전선 멀티모달 모델로서 텍스트, 이미지, 영상, 오디오, 파일을 받아들이며, "내가 묻고 싶은 그것을 볼 수 있는가"라는 질문의 답이 양쪽에서 서로 달라지는 이 비교의 유일한 모델이다. 나머지 전부 — 희소성 비율, 컨텍스트 윈도, 가격 등급 — 는 논쟁거리다. 저것은 사양이다.
이는 또한 이것이 집합에서 가장 비대칭적인 쌍이며, 가장 유용하다는 것을 의미합니다. 왜냐하면 그것은 모델 비교가 실제로 무엇을 위한 것인지를 드러내기 때문입니다. 워크로드가 텍스트라면, Beam과 Gemini 3.1 Pro는 저렴하지만 측정되지 않은 것부터 비싸지만 철저히 점수화된 것까지 이어지는 스펙트럼 위의 두 가지 옵션입니다. 워크로드에 비디오 프레임이 포함되어 있다면, 비교할 것이 없습니다.
각 모델이 무엇인지
Gemini 3.1 Pro Preview는 Google의 프리뷰 등급 플래그십입니다: 1,048,576 토큰의 컨텍스트, 최대 65,536 토큰의 출력, 다섯 가지 입력 모달리티, 그리고 정액 요금이 아닌 가격 사다리를 통해 도달하는 100만 토큰 윈도우를 갖추고 있습니다. Google은 이를 향상된 소프트웨어 엔지니어링, 개선된 에이전틱 안정성, 복잡한 워크플로에서의 보다 효율적인 토큰 사용을 위해 포지셔닝하고 있습니다. 이는 오픈 웨이트가 아닙니다. 이름에는 여전히 "Preview"가 붙어 있는데, 이는 Google이 2월부터 이 모델에 대해 유지해 온 상태입니다.
Reflection Beam은 Reflection의 첫 모델이자 오픈 웨이트 시리즈의 시작입니다. 총 5,010억 개 파라미터에 활성 230억 개 — 토큰당 모델의 약 4.6퍼센트만 깨어 있는 셈입니다. 4주가 채 안 되는 기간에 6,144개의 GB300 칩으로 23조 8천억 개의 사전 학습 토큰을 처리한 뒤, 4주 동안 10,500개의 GB300 칩으로 약 100만 개 환경에서 1억 회 이상의 롤아웃을 포함한 강화 학습 캠페인을 진행했습니다. API는 api.reflection.ai/openai/v1에서 OpenAI 호환이며 Chat Completions와 Models 목록을 제공하고, 컨텍스트는 256,000 토큰에 베타 각주가 붙어 있으며, reasoning_effort 파라미터는 5단계로 되어 있고 끄는 스위치는 없습니다. 가중치는 이달 말 Apache 2.0 라이선스로 공개될 예정입니다.
• 모달리티 — Gemini 3.1 Pro Preview는 텍스트, 이미지, 비디오, 오디오, 파일을 입력으로 받으며, Reflection Beam은 텍스트만 받습니다.
• 컨텍스트 및 출력 — Gemini의 경우 입력 1,048,576 토큰, 출력 65,536 토큰이며, Beam의 경우 입력 256,000 토큰, 출력 128,000 토큰입니다.
• 가격 — Gemini 3.1 Pro Preview는 최대 200,000토큰까지 백만 토큰당 입력 $2.00, 출력 $12.00이며, 이를 초과하면 $4.00와 $18.00로 인상되고, 캐시 읽기는 $0.20입니다. Reflection Beam은 공개된 가격이 없습니다.
• 툴링 지원 범위 — Google 측: 네이티브 툴 호출, 구조화된 출력 및 검색 그라운딩; Beam 측: 툴 호출 및 구조화된 출력, 엔드포인트는 Chat Completions로 제한됨.
• 가중치 — Gemini는 독점적, Beam은 Apache 2.0 약속했으나 아직 공개되지 않음.
• 독립 점수 — Gemini 3.1 Pro Preview는 Artificial Analysis 지수를 보유하고 있지만, Beam은 해당 순위표에 아무런 항목이 없습니다.
모달리티 격차가 논쟁의 전부다
“멀티모달”을 막연히 언급하기보다 구체적으로 말하는 편이 낫습니다. 실질적인 결과가 구체적이기 때문입니다.
화면 녹화, 제품 사진, 스캔한 계약서 또는 콜센터 오디오 파일을 입력으로 처리하는 워크로드는 어떤 가격을 지불하더라도, 어떤 프롬프트를 사용하더라도, 어떤 요금제에서도 Beam이 처리할 수 없습니다. API 계층에서의 우회 방법도 없습니다. Beam 문서에는 입력 모달리티 하나와 출력 모달리티 하나만 설명되어 있으며, 이미지나 오디오 경로는 나열되어 있지 않습니다. Gemini 3.1 Pro Preview는 다섯 가지를 모두 처리하므로, 입력이 이미 텍스트가 아닌 워크플로에 바로 투입할 수 있는 여기서 유일한 모델입니다.
반대의 경우도 언급할 가치가 있다. 왜냐하면 바로 그 부분을 사람들이 틀리기 때문이다. 입력이 텍스트이고 앞으로도 텍스트로 남을 것이라면, Gemini의 다섯 가지 모달리티는 아무런 이득도 주지 않으며, 텍스트 작업을 돌리면서 멀티모달 모델의 가격을 치르는 셈이다. 그것은 Beam을 위한 논거가 아니다 — 오히려 모달리티에 대한 질문이 벤치마크 질문보다 먼저 답해져야 한다는 논거다. 왜냐하면 그것이 어떤 점수 비교보다도 더 저렴하고 더 안정적으로 선택지를 제거해 주기 때문이다.
두 개의 미리보기, 두 가지 다른 의미
두 모델 이름 모두 단서를 달고 있는데, 그 단서들이 서로 같지 않다는 점이 이 조합에서 가장 흥미로운 부분이다.
Gemini 3.1 Pro의 "Preview"는 2월부터 일반적으로 호출 가능했던 모델에 붙은 명명 관례로, 독립적인 점수, 문서화된 장문맥 등급을 포함한 공개 요금표, 그리고 완전한 도구 표면을 갖추고 있습니다. 실제로 여기서 "preview"는 Google이 이를 대체할 권리를 보유한다는 뜻이지, 접근하기 어렵거나 점수가 매겨지지 않았다는 뜻은 아닙니다.
Beam의 베타는 진짜 관문이다. 접근은 대기자 명단이고, 모델 ID는 2026년 10월 5일에 생성되었으며, 요금표도, 제3자 점수도 없고, 핵심 주장을 누구나 검증할 수 있게 해 줄 산출물—가중치, 기술 보고서, 모델 카드—은 제공된 것이 아니라 약속된 상태다. 컨텍스트 수치에는 베타 기간 중 변경될 수 있다는 경고 각주가 붙어 있는데, 이는 일반 제공 모델이라면 필요로 하지 않을 안전장치다.
그 결과는 조달에서 중요한 의미를 갖는 방식으로 비대칭적이다. Gemini 3.1 Pro Preview를 도입하는 팀은 모델 교체 위험을 감수하는 것이다. 오늘 Beam을 도입하는 팀은 알 수 없는 가격, 알 수 없는 독립 점수, 그리고 모델을 자체적으로 실행할 수 없다는 점을 감수하는 것이다. 이는 서로 다른 범주의 위험이며, 가장 자주 결정을 좌우하는 것은 가격이다.

벤치마크, 그리고 인용 문제
Reflection의 출시 표에는 Gemini 3.1 Pro Preview나 어떤 Google 모델도 포함되어 있지 않습니다. 비교 대상은 오픈 및 세미 오픈 모델뿐입니다: Inkling, Nemotron 3 Ultra, GLM 5.2, GLM 5.3, Kimi K3, Qwen 3.8-Max, DeepSeek V4.1 Flash. 따라서 두 모델은 공개된 표에서 서로 겨뤄본 적이 없으며, 아래 수치는 양쪽 모두 서로 다른 하네스에서 나온 것입니다.
• Artificial Analysis Intelligence Index — Gemini 3.1 Pro Preview는 29.7을 기록하며 해당 실행에서 147개 중 58위에 올랐습니다. Beam은 인덱스 행이 전혀 없습니다.
• GPQA Diamond — Artificial Analysis 기준 Gemini 3.1 Pro Preview는 94.1로, Beam이 자체 보고한 90.5와 대비된다.
• SciCode — Gemini의 58.7 대 Beam이 자체 보고한 49.7.
• Humanity's Last Exam — Gemini는 47.0, Beam의 벤더 보고 수치는 36.2이며, 후자는 명시적으로 도구 없이 측정된 것이다.
• Terminal-Bench v2.1 — Artificial Analysis에 따르면 Gemini의 73.8은 Beam이 공급업체를 통해 보고한 80.1과 대비됩니다. 이는 Beam의 가장 강력한 항목이며, 2월부터 시장에 출시된 모델을 상대로 한 결실입니다.
• 장문맥 회상 — AA-LCR에서 Gemini가 82.0으로, Beam이 벤더 측에 보고한 79.3을 앞섰습니다.
• tau-squared Bench — Gemini는 95.6, Beam은 MCP Atlas에서 78.7, tau3 banking에서 38.0입니다. 이는 에이전트형 도구 사용에 관한 관련 평가들이며, 동일한 평가가 아니고 명칭 차이가 중요합니다.
이 표의 Gemini 쪽에는 별도의 문장을 할애할 만한 별개의 정직성 문제가 있다. Gemini 3.1 Pro Preview의 독립 지수 점수는 출처에 따라 30, 46, 47.7, 57로 인용되어 왔으며, Artificial Analysis는 같은 시점에도 모델 페이지마다 서로 다른 지수 개정판을 제공한다. 위의 29.7 수치는 2026년 10월 6일에 우리가 읽은 페이지에 있는 수치이며, 우리가 인용할 유일한 수치다. 하지만 어떤 기사든 단일 Gemini 지수 숫자를 경쟁사 옆에 놓으면서 그것이 어느 스냅샷에서 나온 것인지 밝히지 않는다면, 떠다니는 숫자를 고정된 숫자인 것처럼 제시하는 것이다. 같은 주의점은 거꾸로 Beam에도 적용되는데, Beam에는 스냅샷이 전혀 없다.
가격, 그리고 아무도 대비하지 않는 등급
Gemini 3.1 Pro Preview는 200,000토큰까지 백만 토큰당 입력 $2.00, 출력 $12.00이고, 그 이상은 $4.00와 $18.00입니다. 캐시 읽기는 백만 토큰당 $0.20, 캐시 쓰기는 $0.375입니다. 구간 경계는 미리 계획을 세울 만한 부분입니다. 이 모델의 대표적인 셀링 포인트는 1,048,576토큰 창인데, 요청이 200,000토큰을 넘는 순간 입력 요금은 두 배가 되고 출력 요금은 50% 오릅니다. 따라서 백만 토큰 창을 염두에 두고 설계된 워크로드는 트래픽 대부분이 첫 번째가 아닌 두 번째 구간의 가격으로 청구되는 워크로드입니다.
Beam에는 요금표가 없으므로 모델링할 등급도, 비교할 대상도 없습니다. 그 부재는 중립적이지 않습니다. 즉 Beam의 비용에 관해 가장 방어 가능한 최소한의 진술은 그것이 알 수 없다는 것이며, 효율성 포지셔닝을 뒷받침하는 유일한 정량적 근거는 Reflection 자체의 차트뿐입니다. 이 차트는 DeepSWE, HLE, Terminal-Bench 2.1 전반에서 시도당 평균 생성 토큰 수에 활성 파라미터 수의 두 배를 곱한 값으로 생성된 FLOPs를 추정하며, 캡션에서는 프롬프트 프리필, 어텐션, 서빙 오버헤드가 제외된다는 점을 인정합니다. 백만 토큰 컨텍스트가 중요한 워크로드에서 프리필은 반올림 오차가 아니며, 바로 그 항이 이 공식에서 빠져 있는 항입니다.

도구 사용, 검색, 그리고 두 설계가 서로 다른 점
Gemini 3.1 Pro Preview가 내세우는 강점은 소프트웨어 엔지니어링, 에이전트 신뢰성, 토큰 효율성이며, 공개된 도구 표면에는 함수 호출, 구조화된 출력, 검색 그라운딩이 포함됩니다. 에이전트 스택을 비교하는 사람이라면 마지막 항목에 주목할 필요가 있습니다. 그라운딩된 검색은 Google 측의 자사 기능이며, 외부 검색 서비스를 연동하지 않고도 도구를 사용하는 에이전트가 할 수 있는 일을 바꿔 놓습니다.
Beam의 도구 이야기는 스펙 한 줄이 시사하는 것보다 더 흥미롭고 평가하기는 더 어렵다. Reflection은 MCP Atlas 78.7, AutomationBench 공개 37.0, tau3 banking 38.0, 컨텍스트 관리를 적용한 BrowseComp 77.4, 컨텍스트 관리를 적용한 DeepSearchQA 80.1을 보고하며, 강화 학습 중에 모델이 훈련 혼합물에 브라우징 작업이 없었음에도 불구하고 웹 접근이 주어졌을 때 다른 언어 모델에 질의하고 OCR API를 호출하는 것을 유기적으로 학습했다고 언급한다. 그 일반화가 성립한다면, 이는 에이전트 전이에 관한 진짜 신호다. 또한 이는 현 시점에서 독립적인 검증이 없는, 훈련 실행에서 나온 벤더의 관찰이다.
도구 사용 항목 중 양쪽 모두 수치를 제시한 행에서는 일방적이라기보다 혼재된 양상이다. Beam의 벤더 표에서는 MCP Atlas에서 GLM 5.2보다 앞서고, tau3 banking에서는 GLM 5.2 및 Kimi K3와 동률로 나온다. 반면 Gemini의 tau-squared Bench 수치 95.6은 양측이 공개한 에이전트 관련 수치 중 가장 높다. 서로 다른 스위트, 서로 다른 하네스, 그리고 공유된 평가의 부재 — 이것이 이 비교에서 되풀이되는 문제다.
선택하기, 그리고 헤지하는 방법
위에서 도출되는 결정 규칙은 한 줄로 말할 수 있을 만큼 간단하다: 입력 중 텍스트가 아닌 것이 하나라도 있으면 Beam은 선택지가 아니며 비교는 끝난다. 모든 입력이 텍스트라면, 문제는 Beam의 출처가 불분명한 효율성 주장이 알 수 없는 가격과 독립적인 점수 없음을 감수할 가치가 있는지, 문서화된 요금 단계와 완전한 도구 표면을 갖춘 $2.00 및 $12.00 비용의 모델과 맞세워 볼 때 어떤지가 된다.
Gemini 3.1 Pro Preview가 저희 카탈로그에 있습니다. 공급자의 리스트 요율을 그대로 적용하고 아무것도 더하지 않은 채, api.orcarouter.ai/v1에서 하나의 OpenAI 호환 키 뒤에서 200개 이상의 다른 모델과 나란히 제공됩니다 — 그리고 같은 키가 Beam이 가격으로 경쟁하는 모델들, 즉 GLM 5.3의 $1.26 및 $3.96부터 DeepSeek V4.1 Flash의 $0.15 및 $0.60까지를 제공하며, 오늘 아침 실시간으로 확인한 가격입니다. 200,000 토큰의 티어 경계는 모델 문제가 아니라 라우팅 문제이므로, 라우팅 DSL을 사용하면 이를 직접 표현할 수 있습니다: 짧은 요청은 저렴한 티어에 유지하고, 정말 긴 요청은 해당 모델을 선택한 이유가 바로 그 윈도우인 곳에 고정하세요. 애플리케이션 코드가 아니라 한 번의 호출로 말입니다.
Reflection Beam은 우리의 경로 중 하나가 아니며, 그것을 가지고 있다고 주장하는 누구에게도 당신을 안내하지 않을 것입니다. 약속대로 이번 달에 Apache 2.0 가중치가 도착한다면, 자체 호스팅은 텍스트 전용 작업을 위한 세 번째 옵션이 되고 효율성 주장은 당신의 자체 하드웨어에서 검증 가능해집니다.

답을 바꾸는 것은 무엇인가?
Gemini에 맞선 Beam의 근거는 모든 Beam 비교가 기대는 동일한 두 가지 항목에 달려 있으며, 이번 맞대결은 세 번째 항목을 더한다.
가격. 가격이 없으면 효율성 논거는 예산 결정으로 전환될 수 없고, 모델은 요금표가 아니라 도표로 경쟁하게 된다.
독립적인 점수. Artificial Analysis는 10월 5일 Reflection이 자사에 접근 권한을 제공했으며 자사가 Beam을 벤치마킹하고 있다고 밝혔고, 초기 지표는 Beam이 해당 지능 수준에서 자사가 본 가장 토큰 효율적인 오픈 모델 중 하나가 될 것임을 시사한다고 설명했다. 그것은 올바른 출처가 올바른 말을 하는 것이다, 그런데도 보드에는 여전히 Beam 행이 없다 — 모델 페이지들은 404를 반환하고, 오늘 아침 기준으로 리더보드에는 Beam 항목이 없다.
그리고 변하지 않는 것이 하나 있다: Beam은 텍스트 전용이라는 점이다. 어떤 가중치 공개도, 어떤 가격 인하도, 어떤 지수 점수도 그것을 바꾸지 못한다. 즉, 특정 부류의 워크로드 전체에서 이 비교는 결코 비교 자체가 되지 못한다는 뜻이다. 당신의 파이프라인에 영상이 하나라도 들어 있다면, 첫 번째 벤치마크가 로드되기도 전에 답은 이미 Gemini 3.1 Pro Preview였다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
