
Realtime-Venus vs Grok Voice Think Fast 2.0: 이 중 가격이 있는 건 단 하나뿐
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Put Realtime-Venus and Grok Voice Think Fast 2.0 next to each other and the first difference is not a benchmark, it is a purchase order. Grok Voice Think Fast 2.0 is a hosted speech-to-speech model that went on sale on 29 July 2026 at $0.08 per audio minute with a published time-to-first-audio of 0.70 seconds and benchmark scores from a third party. Realtime-Venus is a 9B full-duplex system from Ant Group's Venus Team and Tsinghua University that exists as Apache-2.0 weights, a technical report dated 12 September 2026, and nothing you can call. One of these you can wire into a phone line before the end of the week. The other one you can read. That asymmetry turns out to be a much more useful comparison than a scoreboard would be, because the two models made almost the same architectural bet and then diverged completely on what to do with it.
짧은 대답
지금 실제 운영 환경에서 작동하는 음성 에이전트가 필요하고, 예산에 바로 반영할 수 있는 요금표와 테스트 가능한 지연 시간 보장이 필요하다면 Grok Voice Think Fast 2.0을 선택하세요. 스택을 직접 소유해야 한다면 — 데이터가 자사 인프라를 벗어날 수 없거나, 프런트 엔드를 미세 조정해야 하거나, 제품을 출시하기보다 아키텍처를 평가하는 중이라면 Realtime-Venus를 선택하세요. 둘이 경쟁하는 세 번째 경우는 없습니다. 하나는 API가 있고 다른 하나는 없기 때문입니다.
그들은 어려운 문제에 대해 의견이 일치한다
흥미로운 점은 진단이 얼마나 비슷한가입니다. 두 모델 모두 같은 모순 때문에 존재합니다: 대화 제어는 1초 미만의 단위로 실행되어야 하는데, 추론은 몇 초가 걸립니다. 생각하느라 멈추는 모델은 더 이상 현존감을 느끼게 하지 못합니다.
Grok Voice Think Fast 2.0은 말하면서 추론함으로써 이를 해결합니다. Think Fast 라인은 모델이 먼저 추론하고 그다음 음성을 생성해서는 안 된다는 아이디어를 기반으로 구축되었습니다. 대신 음성을 스트리밍하면서 동시에 사고하여, 에이전트가 첫 문장을 끝내기 전에 도구 호출이 발생할 수 있습니다. xAI는 버전 2.0이 이전 버전보다 추론 토큰을 약 0.4배 사용한다고 보고하며, 이는 품질 개선보다는 비용 및 지연 개선으로 제시됩니다.
Realtime-Venus는 프런트엔드에서 전혀 해결하지 않음으로써 그것을 해결합니다. 이중 루프 런타임은 1초짜리 상호작용 루프 — 지각, 턴 제어, 음성 생성 — 를 계속 실행하고, 비용이 많이 드는 작업은 모델 자체의 숨겨진 시퀀스에서 방출되는 비동기 위임 마커를 통해 Realtime-Venus-Harness라는 별도 구성 요소에 넘깁니다. 포그라운드 대화는 결코 멈추지 않습니다. 백그라운드 결과는 도착하는 대로 다시 통합됩니다.
그것들은 같은 질문에 대한 서로 다른 엔지니어링 해법이며, 실패 모드도 서로 다르다. 말하면서 추론하기는 두 스레드를 모두 일관되게 유지하라는 부담을 모델에 지운다. 위임은 두 루프가 서로를 오염시키지 않게 하라는 부담을 런타임에 지운다. 그래서 Realtime-Venus 논문의 인과적 태스크 캡처, 즉 위임된 작업마다의 격리된 상태 스냅샷이야말로 이 설계를 떠받치는 세부 사항이다.
둘 모두를 측정할 수 있는 단 하나의 지표
전이중 벤치마크는 이 둘이 겹치는 유일한 지점이며, 그것들은 깔끔하게 겹치지 않는다.
• 인터럽션 처리 — Realtime-Venus는 Full-Duplex-Bench v1.5에서 사용자 인터럽션의 75%에 응답한다고 보고합니다. Grok Voice Think Fast 2.0은 Artificial Analysis에 따르면 Full Duplex Bench에서 95.1%를 기록했으며, 이는 버전 1.0의 77.8%에서 상승한 수치입니다.
• 중첩 상황에서의 지속 — Realtime-Venus는 백채널에서 97%, 타인 대상 발화에서 88%, 배경 발화에서 86%의 지속률을 보고하며, 세 가지 모두에서 Gemini 3.1 Live와 GPT-4o를 능가한다고 밝힌다.
• 서로 다른 측정 도구, 서로 다른 주체 — Realtime-Venus의 수치는 외부 재현 없이 자체 기술 보고서에서 나온 것이다. Grok의 수치는 해당 모델을 실행한 제3자로부터 나온 것이다. 자기 보고 수치를 독립적으로 측정된 수치와 비교하는 것은 비교가 아니며, 위에 제시된 격차는 실제 차이만큼이나 방법론적 차이일 가능성이 크다.
솔직한 해석: 입수 가능한 증거에 비추어 볼 때, Grok Voice Think Fast 2.0은 둘 중 결과에 아무런 이해관계가 없는 사람이 풀 듀플렉스 동작을 측정한 유일한 제품이다.
독립적인 수치들이 Grok Voice Think Fast 2.0을 어디에 두는가
현재 가장 명확한 지표는 Artificial Analysis의 Speech Agent Arena에서 나오는데, 이는 치과 예약과 테이크아웃 주문 같은 과제에서 실시간 음성 대화 전반에 걸친 블라인드 선호도를 기준으로 모델에 점수를 매긴다. 2026년 9월 18일 기준으로 Grok Voice Think Fast 2.0 High는 552개 샘플에서 Elo 1,011로 20개가 넘는 항목 중 7위에 올라 있다. 이는 1,096을 기록한 Google의 Gemini 3.1 Flash Live Minimal, 1,083의 Gemini 3.8 Live, 1,053의 GPT-Live-1 뒤이며, 908을 기록한 자사의 이전 모델인 Grok Voice Think Fast 1.0보다는 훨씬 앞선다.
Elo 옆의 열이 더 흥미롭다. 작업 성공률에서 Grok Voice Think Fast 2.0은 94.6%를 기록해, 눈에 보이는 상위 20위 안 어디에서도 가장 높은 수치다. Gemini 3.8 Live의 93.2%, GPT-Realtime-2.1 High의 91.5%, GPT-Live-1의 90.9%보다 높다. 선호도에서는 7위, 작업 완료율에서는 1위라는 것은 이례적이고 꽤 구체적인 프로필이다. 청취자들은 그 음성을 사랑하지는 않지만, 일은 끝내는 것이다. 여러분의 제품이 대화보다는 실제로 일을 처리한다면, 결과를 예측해 주는 것은 바로 그 열이며, 그것은 이 두 모델 중 어느 쪽이든 가진 가장 강력한 독립적 증거다.

xAI가 출시 당시 공개한 수치는 별개의 측정 도구에 해당하므로 따로 읽어야 합니다: Artificial Analysis의 음성 대 음성 품질 지수에서 82.9%, τ-Voice 에이전틱 벤치마크에서 56.5%로 1위, Big Bench Audio에서 97.2%, Full Duplex Bench에서 95.1%입니다. 이는 2026년 7월 말 모델이 출시되었을 당시의 순위였고, 이 범주의 순위표는 매달 바뀝니다. 바로 그렇기 때문에 오늘 기준으로 읽은 위의 아레나 표가 출시 당시 수치보다 더 가치가 있습니다.

그 법안, 그리고 그중 법안에 포함되지 않은 부분들
Grok Voice Think Fast 2.0 costs $0.08 per minute of audio, roughly $4.80 an hour, plus $0.004 for each text input message. That is a 60% increase over the $0.05 per minute the 1.0 version charged at launch, and xAI moved the rolling grok-voice-latest alias onto 2.0 automatically on 5 August 2026, so teams that wanted to stay on the old price had to pin an explicit version before that date. The per-minute model also means efficiency improvements accrue to the vendor: if the model gets better at finishing calls faster, your bill per call falls, but your cost per minute does not.
Realtime-Venus에는 청구서가 없다. 서비스가 없기 때문이다. 대신 있는 것은 하드웨어 하한선이다. BF16의 9B 체크포인트 두 개는 활성화 메모리를 제외하고도 각각 약 18기가바이트의 가중치를 차지하며, 이 카드에는 지속적으로 실행되어야 하는 초당 스트리밍 루프가 명시되어 있다. 이를 가능하게 하는 GPU 노드에는 월 비용이 들고, 이는 고정 비용이다 — 누가 호출하든 하지 않든 지불해야 한다. 트래픽이 꾸준한 제품이라면 이는 시간당 $4.80보다 저렴하다. 트래픽이 간헐적인 제품이라면 이는 훨씬 더 비싸며, 여기서 중요한 유일한 재무적 질문은 교차점이다.
가중치, 제어, 그리고 각 항목으로 변경할 수 있는 사항
여기서부터 두 모델은 더 이상 비교할 수 없게 됩니다.
• 미세 조정 — Realtime-Venus는 가중치를 제공합니다. 이를 미세 조정하고, 양자화하고, 에어갭 환경에서 실행하며, 모든 레이어를 검사할 수 있습니다. Grok Voice Think Fast 2.0은 폐쇄형 호스팅 모델입니다. 변경할 수 있는 것은 프롬프트, 음성 선택, 등록하는 도구입니다.
• 음성 — Grok Voice Think Fast 2.0은 프리셋 음성을 제공하며 약 1분 분량의 음성으로 사용자 지정 음성 복제를 지원합니다. Realtime-Venus는 레퍼런스 음성과 번들로 제공되는 토큰-파형 디코더를 제공하며, 그 이상은 알아서 해결해야 합니다.
• 지원 범위 — Grok Voice Think Fast 2.0은 25개 이상의 언어를 지원하며, 기본적으로 24kHz에서 PCM16으로, 전화 통신용으로는 μ-law로 말하고, OpenAI Realtime과 호환되는 WebSocket 세션을 통해 동작합니다. 이 호환성은 실질적인 마이그레이션 자산입니다. 대부분의 기존 실시간 음성 코드는 기본 URL과 키만 변경하면 됩니다. Realtime-Venus는 영어와 중국어 문서를 제공합니다.
• 비디오 — Realtime-Venus-Omni는 스트리밍 비디오와 이미지를 SigLIP2 인코더를 통해 처리하며 지속적인 시각 인식을 수행합니다. Grok Voice Think Fast 2.0은 오디오 및 텍스트 기반이며, 카메라 경로가 없습니다.
• 긴 컨텍스트 — Realtime-Venus는 40,960 토큰 컨텍스트와 40분 창에서 활성화할 수 있는, 학습이 필요 없는 장시간 비디오 메모리를 갖추고 있습니다. Grok Voice Think Fast 2.0은 이에 필적하는 메모리 기능이 공개된 바 없는 세션 모델입니다.

각각 어디서 망가지는가
계획할 가치가 있는 실패는 정반대입니다. Grok Voice Think Fast 2.0이 노출된 위험은 공급업체 집중과 검증 불가능한 마케팅입니다. xAI의 Starlink A/B 결과, 전사 정확도 배수, 속도 관련 프레이밍은 모두 회사가 보고한 것이며 기반 데이터는 공개되지 않았고, 버전 간에 가격을 60% 바꾸는 분당 과금 모델은 가격을 바꿀 것임을 입증했습니다. 버전을 고정하고 자체 오디오로 직접 평가를 실행하세요.
Realtime-Venus의 취약점은 아무도 그것을 실행해 본 적이 없다는 점이다. 그 벤치마크는 자기 보고식이고, 그 하네스는 중요성에 비해 문서화가 되어 있지 않으며, 실제 배포에서의 지연 시간은 알려지지 않았다 — 보고서는 1초의 상호작용 케이던스를 설명하는데, 이는 설계 매개변수이지 측정된 첫 오디오까지의 시간이 아니다. API도 없고 재현도 없는 모델은 실적이 없으며, 오직 사양만 있을 뿐이다.
분명히 짚고 넘어갈 만한 중간 경로가 있습니다. 대부분의 팀이 실제로 택할 방식이기 때문입니다. 위임 기반 시스템을 구축한다면 — 프런트 엔드는 직접 고르고, 비용이 큰 작업은 텍스트 모델에 맡기는 방식 — 프런트 엔드와 추론 구간이 같은 곳에서 나올 필요는 없습니다. OrcaRouter는 Realtime-Venus도 Grok Voice Think Fast 2.0도 취급하지 않습니다. 두 음성 레이어 모두 저희가 제공하는 범위 밖에 있으며, 그렇게 암시하는 대신 분명히 밝힙니다. 위임된 구간은 이야기가 다릅니다. 약 200개의 텍스트 모델이 하나의 키 뒤에서 제공사 정가 그대로, 마크업 없이 이용 가능하며, 자동 페일오버가 지원되어 업스트림 장애가 진행 중인 통화를 끊어뜨리지 않습니다. 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL과, 하나 이상의 의견이 필요한 결정을 위한 모델 퓨전도 있습니다. 이것이 바로 교체 가능성이 이점이 되는 음성 에이전트의 절반이며, 대화를 이어가는 모델을 건드리지 않고도 바꿀 수 있는 절반입니다.
어느 걸 고를까?
이번 분기에는 Grok Voice Think Fast 2.0을 선택하세요. 사용 가능하고, 독립적으로 벤치마킹되었으며, 여러분의 에이전트가 유용한 일을 할 수 있는지 예측하는 에이전트 평가에서 1위이고, 첫 오디오까지 0.70초라는 수치는 사용자 경험을 설계할 수 있는 근거가 됩니다. 1.0 대비 60% 가격 인상을 예산에 반영하고 모델 버전을 고정하세요.
제약 조건이 소유권일 때만 Realtime-Venus를 선택하세요. 배포 환경에서 외부 API를 호출할 수 없거나, 대화형 프런트 엔드를 미세 조정해야 하거나, 카메라가 필요한 경우 — 이 세 가지 경우가 전부이며, 해당될 때는 강력한 근거가 됩니다.
결정을 내려서는 안 되는 것은 벤치마크 표다. 그 양쪽은 서로 다른 사람들이 서로 다른 조건에서 산출한 것이기 때문이다. Grok Voice Think Fast 2.0의 수치는 다른 누군가가 측정했다. Realtime-Venus의 수치는 그렇지 않았다. 그것이 바뀌기 전까지, 실제로 이용 가능한 비교는 제품과 논문 사이의 비교다.
이 글에서 비교한 모델2
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
