
Grok Voice Think Fast 2.0: xAI의 가장 빠르고 가장 비싼 음성 에이전트, 설명
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100만 토큰당 · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150지능69코딩
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당 · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2150지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1651지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1557지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0951지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0955지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0959지능77코딩
- grokxAI: Grok 4.52026-07-0854지능72코딩
- tencentTencent: Hy32026-07-0641지능59코딩
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232지능42코딩
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226지능39코딩
- anthropicAnthropic: Claude Sonnet 52026-06-3053지능72코딩
- klingKling: Kling 3.0 Turbo2026-06-1757지능52코딩57수학
- z-aiZ.ai: GLM 5.22026-06-1651지능69코딩60수학
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242지능61코딩61수학
xAI는 Grok Voice Think Fast 2.0을(를) 2026년 7월 29일에 출시했습니다. 자체적으로 "가장 강력한 음성-음성(speech-to-speech) 음성 모델"이라고 설명되는 이 모델은 음성 에이전트 라인의 새로운 플래그십입니다. 상위 5개 경쟁사 중 가장 빠르게 응답하며(첫 오디오까지 0.70초), 에이전틱 음성 벤치마크에서 1위를 차지했고, 이전 세대보다 더 정확하게 전사합니다. 또한 분당 요금이 대체하는 모델보다 60% 더 비싸고, 분당 과금 체계로 제공되어 청구 금액을 은근히 올리며, 일주일 안에 자동으로 전환되는 버전 별칭(version-alias) 스위치가 함께 제공됩니다. 이 가이드에서는 Think Fast 2.0이 실제로 무엇인지, xAI가 내부적으로 무엇을 변경했는지, 벤치마크 스토리가 독립 점수와 공급업체 보고 주장으로 어떻게 나뉘는지, 계산해 보면 실제 비용이 얼마인지, 그리고 호출 방법을 설명합니다. 또한 프로덕션 콜 플로우를 이 모델로 라우팅하기 전에 꼭 읽어두어야 할 주의사항도 함께 다룹니다.
정확성 참고: 출시 세부 정보, 가격, 헤드라인 정확성 및 비즈니스 주장은 xAI의 발표 및 문서(2026-07-29)에서 비롯되었습니다. Artificial Analysis 종합 점수는 독립적이고 제3자 측정 결과입니다. xAI가 보고한 주장(Starlink A/B 결과, 전사 배율, "추론 토큰 60% 감소", "거의 5배 빠름"이라는 표현)은 근거 데이터가 공개되지 않았습니다. 이는 방향성 있는 공급업체 수치로 취급하고 자체 평가를 실행하세요. 사양, 가격 및 별칭 동작은 변경될 수 있으므로 구축 전에 확인하세요.
TL;DR. Grok Voice Think Fast 2.0은 음성 에이전트를 위한 xAI의 엔드투엔드(end-to-end) 음성-대-음성 모델이다. WebSocket으로 오디오를 입력받고 오디오를 출력하며, 별도의 ASR→LLM→TTS 파이프라인이 없다. 실제로 빠르고(최초 오디오 도달 시간 0.70초, 상위 5개 모델 중 유일하게 1초 미만) 에이전트형 음성 작업에서도 확실히 강력하다. Artificial Analysis의 τ-Voice 에이전트 벤치마크에서 1위(56.5%)를 차지했으며, 음성-대-음성 품질 지수(82.9%)에서는 Qwen Audio 3.0 Realtime Plus(84.1%)에 이어 전체 2위다. 말하면서 추론하여 중앙값 기준 추론 토큰 사용량을 이전 모델의 약 40%로 줄였고, 가격은 분당 $0.05에서 $0.08로 인상됐다. 문제는 과금 방식이다. 음성은 실제 경과 시간(wall-clock) 기준 오디오 분당으로 청구되므로, 서비스 비용이 더 저렴한 모델의 60% 가격 인상이 청구서에 그대로 반영된다. 그리고 8월 5일부터 grok-voice-latest 별칭이 자동으로 2.0으로 라우팅되므로, 이전 버전을 사용하는 팀은 그 전에 명시적으로 버전을 고정(pin)해야 한다.
주요 시사점
• 네이티브 음성-음성: 마이크에서 스피커까지 하나의 모델, ASR→LLM→TTS 체인 불필요 — 그래서 첫 오디오가 0.70초 만에 출력됩니다.
• 에이전트 리더: Artificial Analysis의 τ-Voice 에이전트 벤치마크에서 1위(56.5%)를 차지하며, GPT-Realtime-2.1(45.7%) 및 Gemini 3.1 Flash(37.7%)를 크게 앞섰습니다.
• 전반적인 선두는 아님: 음성-음성 품질 지수에서 2위(82.9%), Qwen Audio 3.0 Realtime Plus(84.1%)에 뒤처짐; OpenAI는 여전히 대화 역학에서 우위(95.7% 대 95.1%).
• 60% 더 비쌈: Think Fast 1.0의 분당 $0.05 대비 분당 $0.08(시간당 약 $4.80) — 모델이 추론 토큰을 약 60% 더 적게 사용한다고 알려졌음에도 불구하고.
• 8월 5일 별칭 전환: grok-voice-latest는 자동으로 2.0으로 라우팅됩니다. 그 전에 grok-voice-think-fast-1.0을 고정하면 더 저렴한 버전을 유지할 수 있습니다.
• 모든 주장에 라벨을 붙이십시오: Artificial Analysis 점수는 독립적입니다; Starlink A/B, 전사 배율, 속도 프레이밍은 xAI가 보고한 것으로 미공개입니다.
Grok Voice Think Fast 2.0이란 무엇인가
Grok Voice는 xAI의 실시간 음성 간(음성-음성) 모델 제품군입니다. "Think Fast"는 빠른 응답 라인으로, 원래 2026년 4월 Voice Agent Builder와 함께 출시되었습니다. Think Fast 2.0은 해당 라인의 2세대 모델로, 2026년 7월 29일에 출시되었습니다. 이 모델은 종단 간(end-to-end) 방식입니다. 음성 인식 모델이 텍스트 LLM에 입력되고 다시 텍스트-음성 모델로 이어지는 파이프라인을 실행하는 대신, 원시 오디오를 소비하고 추론한 뒤 오디오를 직접 출력합니다. 이러한 아키텍처 선택이 지연 시간(latency) 측면에서의 우위의 근원입니다. 직렬 홉(serial hop)이 없고 중간 텍스트도 없기 때문에, 모델은 여전히 듣는 중에도 응답을 시작할 수 있습니다.
xAI는 이를 음성 AI 에이전트를 위해 명시적으로 포지셔닝합니다: 고객 지원 라인, 전화 판매, 리셉션, 전화 통신, 그리고 시스템이 실시간으로 사람과 대화하면서 실제로 일을 처리해야 하는 애플리케이션 — 통화 예약, 리드 자격 평가, 기록 업데이트, 웹 검색 — 단순한 채팅이 아니라요. 이번 출시가 겨냥한 전장은 원시 전사나 합성이 아니라 에이전틱(agentic) 강조점입니다.
새로워진 점 vs Think Fast 1.0
1.0에서의 업그레이드는 단순한 숫자 변경 이상입니다. xAI는 세 가지 구조적 변화를 설명합니다:
• 병렬 음성 추론. 모델이 먼저 생각한 후 말하는 대신, 말하면서 쿼리를 추론합니다. 실질적으로, 도구 호출이 에이전트가 첫 문장을 마치기 전에 실행될 수 있습니다. 이는 지연 시간에 민감한 음성 흐름에 매우 중요한 요소입니다.
• 추론 토큰이 훨씬 줄었다. xAI는 중앙값 기준 추론 토큰 사용량이 이전 모델의 약 0.4배(약 60% 감소)로 떨어졌다고 밝혔으며, 이는 가격이 올랐음에도 모델 서비스 비용이 더 저렴하다고 회사가 말하는 이유 중 하나다.
• 강화 학습으로 습득된 대화 스타일. RL은 말투를 바꿨습니다. 더 짧은 문장, 한 번에 하나의 질문, 군더더기 없는 — 장황한 말이 분을(그리고 분당 과금에서는 돈을) 낭비하는 전화 업무에 적합한, 간결하고 더 '인간적인' 통화 스타일입니다.
{{1}}측정 가능한 속도 측면에서 첫 오디오 도달 시간(time-to-first-audio)은 1.0에서 1.25초에서 2.0에서 0.70초로 단축되었습니다.{{/1}} {{2}}전사(transcription) 측면에서 xAI는 24개 언어에 걸쳐 약 1.4배 개선을 보고했습니다(벤더 제공 수치, 아래 참조).{{/2}}

벤치마크들, 벤치마크별로
이번 출시는 독립적인 제3자 벤치마크 기관인 Artificial Analysis에 기반을 두고 있습니다. 그것이 중요한 이유는, 발표에 포함된 다른 수치들과 달리 이 수치들은 중립적인 기관이 측정한 것이며, 동등한 조건에서 비교할 가치가 있는 수치이기 때문입니다. 복합적인 그림이 단일 헤드라인보다 더 낫습니다.
음성-대-음성 품질 지수: 82.9% (2위). 이것은 Think Fast 1.0의 75.7%에서 상승한 전체 음성-대-음성 종합 지수입니다. GPT-Realtime-2.1(79.1%)과 Gemini 3.1 Flash(69.5%)를 능가하지만 1위는 아닙니다. Qwen Audio 3.0 Realtime Plus가 84.1%로 선두입니다. 따라서 "최고의 음성 모델"이라는 표현은 데이터가 뒷받침하지 않는 과장이며, "최상위 계층에서 가장 빠른 에이전트형 음성 모델"이라는 표현이 정확합니다.
τ-Voice 에이전트 벤치마크: 56.5% (1위). 이것은 xAI가 가장 중요하게 여기는 지표이며, 그 순위는 실제 결과입니다: 56.5%는 Think Fast 1.0(52.1%), GPT-Realtime-2.1(45.7%), Gemini 3.1 Flash(37.7%)를 능가합니다. τ-Voice는 에이전트형 음성 성능, 즉 모델이 음성 채널을 통해 대화 중 도구 사용을 포함하여 작업을 얼마나 잘 수행하는지를 측정합니다. 좁은 의미의 "작업을 해낼 수 있는가"라는 측면에서 Grok이 선두입니다. 머스크는 바로 이 순위를 홍보했습니다.
Big Bench Audio: 97.2%. 음성 추론 벤치마크로, 강력한 성적을 보였지만 Qwen은 기록적인 99.2%를 달성했다.
Full Duplex Bench: 95.1%. 대화 역학 — 끼어들기 처리, 턴 테이킹, 바지인. 이는 1.0의 77.8%에서 큰 도약이지만, OpenAI는 여전히 95.7%로 근소하게 앞서고, Qwen은 98.4%로 선두를 이끌고 있습니다.
첫 번째 오디오까지의 시간: 0.70s. 실제 음성 제품에서 가장 중요한 수치입니다. 1.25s에서 감소했으며, 상위 5개 모델 중 유일한 1초 미만 수치입니다. 독립적인 테스트에서도 대체로 1초 미만 응답이 입증됩니다. 스트리밍 TTS의 첫 토큰 지연 시간은 약 285ms입니다. 전화 및 실시간 사용에서 지연 시간은 사용자가 매 턴마다 체감하는 지표이며, 바로 이 부분에서 2.0이 결정적으로 가장 뛰어납니다.
행을 가로질러 읽으면, 그 프로필은 구체적입니다: 가장 빨리 말하고, 작업 완료에 가장 능숙하며, 전체적으로 두 번째이고, 대화 솜씨에서는 세 번째입니다. 그것은 훌륭한 음성 에이전트 모델이자, 평범한 "최고의 챗봇 음성"이라는 주장입니다. 맨 위 행이 해당하는 작업에는 그것을 선택하세요.
전사 정확도
대화를 넘어서, xAI는 상당히 더 나은 전사 성능을 주장합니다. 24개 언어와 수천 개의 구문에 걸친 내부 평가에서는 Think Fast 1.0 대비 약 1.4배의 정확도를 보였으며, Deepgram Nova 3 및 ElevenLabs Scribe v2 같은 전용 전사 모델보다는 1.5~2배의 정확도를 보였다고 합니다. 배경 소음, 전화 통신 압축, 저대역폭 통화와 같은 시끄러운 실제 환경에서는 전용 STT 모델 대비 보고된 정확도 격차가 약 10배로 벌어집니다.
이것들은 정확히 주의를 기울여야 할 주장들입니다. 이들은 xAI가 보고한 것이며, 평가 하네스, 문구 세트, 노이즈 프로파일은 공개되지 않았습니다. 2.0의 잡음 전화 통화 전사를 Deepgram이나 ElevenLabs와 비교하는 독립적인 테스트는 가치가 있을 것이며, 이 글을 쓰는 시점 기준으로 아직 공개되지 않았습니다. 방향성 측면에서, 훈련 시 더 많은 전화 통화 데이터를 흡수하는 엔드투엔드 모델은 그럴듯한 실질적 개선입니다 — 그러나 "10x"는 사실로 반복해서 말할 것이 아니라 검증되어야 합니다.
가격: 분당 $0.08 및 60% 질문
여기서 출시가 논란에 휩싸인다. Think Fast 2.0은 오디오 분당 $0.08(시간당 약 $4.80)에 텍스트 입력 메시지당 $0.004가 추가된다. Think Fast 1.0은 분당 $0.05(시간당 $3.00)였다. 이는 60% 인상이며, OpenAI가 GPT-5.6 Luna 가격을 80%, Terra를 20% 인하한 것과 같은 달에 발생했다. OpenAI는 xAI가 이 모델에 대해 주장하는 것과 동일한 서빙 비용 하락을 근거로 들었다.
미터가 곧 전부다. 텍스트 모델은 토큰 단위로 과금되므로, 모델이 더 효율적이 되면 고객의 청구 금액은 자동으로 줄어든다. 음성 모델은 실제 소요 시간(wall-clock) 기준 오디오 분 단위로 과금되며, 대화의 길이는 모델이 아니라 말하는 사람이 결정한다. 분 단위 과금 상품에서 효율성 개선의 이득은 구매자가 아니라 공급업체에게 돌아간다. 그렇기에 추론 토큰을 약 60% 덜 사용하는 것으로 알려진 모델 — 즉 xAI가 서비스하기에 더 저렴한 모델 — 의 임대 비용이 60% 더 비싼 이유가 바로 그것이다.
실제 통화 흐름에 대해 계산해 보자. 1.0 기준 4분 통화 비용은 $0.20이고, 2.0 기준 같은 통화는 $0.32이다. 한 달에 그러한 통화가 1만 건이면 40,000분이다: 1.0 기준 월 $2,000 대 2.0 기준 월 $3,200 — 즉 월 $1,200, 대략 연간 $14,400의 차이가 발생한다. 이 차이는 통화량이 아니라 라우팅 변경만으로 생긴다. 아무리 후한 속도 개선 효과를 감안해도 그 차이는 거의 줄어들지 않는다: 모든 통화에서 10초를 완전히 단축하면 약 $0.013을 절약할 수 있지만, 가격 인상은 $0.12를 추가하므로 — 인상분의 약 9분의 1만 회복할 뿐이다. 2.0을 더 저렴한 모델로 내세우는 사업 논리는 "더 빠름"과 "더 저렴함"을 혼동한 것이다.
맥락상, 2.0은 시간당 약 $10.75로 GPT-Realtime-2.1 High보다 여전히 약 2.2배 저렴합니다. 따라서 절대적인 기준으로는 비싼 것이 아닙니다. 즉, 자체 이전 버전과 그 달에 다른 모든 모델 공급업체들이 움직이던 방향에 비추어 보면 비싼 것입니다.
8월 5일 마이그레이션 함정
마감일이 정해져 있습니다. 2026년 8월 5일에 grok-voice-latest 별칭은 자동으로 Think Fast 2.0으로 라우팅되기 시작합니다. 해당 별칭을 통해 Think Fast 1.0을 사용 중이라면, "아무것도 하지 않는 것"은 그 날짜에 새 버전으로 — 그리고 청구서도 — 업그레이드된다는 뜻입니다. 1.0을 유지하려면 8월 5일 이전에 grok-voice-think-fast-1.0 모델 ID를 명시적으로 고정해야 합니다.
방어 가능한 두 가지 입장 모두 기한 전에 조치를 취해야 합니다. 즉, 스크립트된 플로우가 시간당 3.00달러에서 문제없이 작동했으므로 의도적으로 1.0을 확정하거나, 비용 절감이 아닌 품질을 근거로 시간당 4.80달러로 다시 예측하며 의도적으로 2.0으로 전환하는 것입니다. 정말 변명의 여지가 없는 것은 9월 인보이스에서 변경 사항을 발견하는 일입니다. 좋은 규칙이 하나 있습니다: "latest"로 끝나는 모든 별칭은 공급업체가 다음에 제공하는 것(가격 포함)을 그대로 수락하라는 상시 지침으로 취급하십시오.
접근 및 사용 방법
Think Fast 2.0은 xAI의 Speech-to-Speech API를 통해 모델 ID grok-voice-think-fast-2.0으로 제공되며, grok-voice-latest가 롤링 별칭으로 사용됩니다. 이 모델은 WebSocket을 통한 실시간 전이중(Full-duplex) 모델입니다: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, 핸드셰이크 시 Authorization: Bearer 헤더로 인증됩니다. 브라우저 앱의 경우, realtime sessions 엔드포인트를 통해 서버 측에서 임시 토큰을 발급하여 상위 API 키가 클라이언트에 노출되지 않도록 하세요.
이 API는 OpenAI Realtime과 호환되므로 기존 실시간 음성 코드는 일반적으로 base URL과 키 교체만 필요합니다. 세션 설정은 session.update 이벤트를 통해 이루어집니다: 프리셋 음성(eve, ara, rex, sal, leo) 중 하나를 선택하고, 입력 및 출력 오디오 형식(기본값은 24kHz PCM16, 전화 통신용 μ-law)을 설정하고, 서버 측 음성 활동 감지를 활성화하고, 내장 웹 검색 도구를 포함한 도구를 등록하여 에이전트가 대화 중간에 행동할 수 있게 합니다. 이벤트 흐름은 표준 패턴을 따릅니다: 클라이언트가 오디오 버퍼 프레임을 추가하고, 서버가 응답 오디오 델타를 스트리밍하며, 모델이 행동하기로 결정하면 도구 호출 인수 이벤트가 발생하고, 결과는 함수 호출 출력으로 다시 푸시됩니다. 이 모델은 25개 이상의 언어와 약 1분 분량의 음성으로 커스텀 음성 복제를 지원합니다.
이것이 무엇이 아닌지 주목하세요: 이것은 음성-대-음성 에이전트 모델이지, 일반적인 전사 또는 번역 서비스가 아닙니다. 제품의 핵심 작업이 오디오를 저렴하게 텍스트로 변환하는 것이라면, 전용 STT 모델이 더 적합한 도구입니다. 그리고 분당 요금제로는 전체 대화에 대해 비용을 지불하므로, 전사 전용 작업은 비용이 빠르게 늘어납니다.

음성 에이전트 스택에 어떻게 들어맞는지
Think Fast 2.0은 xAI 전용 API를 통해 접근하는 특수 실시간 음성 모델로, 모델 라우터가 호스팅하는 범용 LLM이 아닙니다. 음성 경로는 xAI의 WebSocket에서 직접 실행되며, 바로 그곳에서 1초 미만의 지연 시간이 구현됩니다. 중간 홉을 거치면 그 지연 시간은 유지되지 않습니다.
음성 제품을 둘러싼 그 밖의 모든 요소 — 시간에 민감하지 않은 자연어 로직, 대화가 대본에서 벗어날 때의 폴백 추론, 요약, 분석, 에이전트가 통화 후 트리거하는 이메일 후속 조치 — 는 범용 텍스트 및 멀티모달 작업입니다. 이 부분에는 OrcaRouter와 같은 벤더 중립적 엔드포인트를 사용하면 다양한 LLM에 걸쳐 하나의 OpenAI 호환 API를 제공받을 수 있어, 실시간 음성 경로가 필요 없는 스택 부분에서 특정 벤더에 종속되지 않습니다. 깔끔한 분리는 이렇습니다: 스트리밍 음성 자체에는 xAI의 전용 API를, 그 주변의 텍스트 및 멀티모달 추론에는 OrcaRouter(또는 유사한 솔루션)를 사용하는 것입니다.
경쟁: 에이전트 속도 vs 순수 지능
Think Fast 2.0은 현재 AI에서 가장 경쟁이 치열한 시장인 실시간 음성 에이전트 시장의 한가운데에 등장했으며, 벤치마크 표는 그 트레이드오프를 유난히 또렷하게 보여준다.
Qwen Audio 3.0 Realtime Plus는 지능 지표에서 선두입니다: 음성 간 품질 지수에서 84.1%(1위), Big Bench Audio에서 기록적인 99.2%, 풀 듀플렉스에서 98.4%를 기록했습니다. 하지만 평균 첫 오디오 도달 시간은 약 4.02초로, Grok의 0.70초보다 약 5.7배 느립니다. 차량 내, 웨어러블, 전화 대화에서 이 차이는 '빠름 vs 느림'이 아니라 '사용 가능 vs 사용 불가'의 문제입니다. Qwen은 또한 다양한 시나리오에 맞춰 Plus 티어(품질)와 Flash 티어(약 300ms 첫 패킷)로 나뉘는데, 이는 동일한 긴장감에 대한 사려 깊은 해답입니다.
GPT-Realtime-2.1은 대부분의 지표에서 중간에 위치하며(품질 79.1%, 에이전틱 45.7%), 대화 역학(95.7%)에서 가장 뛰어납니다. High 티어는 Grok 시간당 가격의 약 2.2배입니다. 이미 OpenAI 생태계에 깊이 속해 있는 팀에게는 여전히 마찰이 가장 적은 기본 선택지입니다.
Gemini 3.1 Flash는 품질 및 에이전틱 복합 지표(69.5%, 37.7%)에서는 뒤처지지만, 많은 팀이 다른 이유로 선호하는 더 넓은 Gemini 음성 스택과 Google 생태계의 일부입니다.
실무적으로는 워크로드에 따라 선택하면 됩니다. 음성 에이전트가 즉각적인 반응을 보여야 하고 지원·자격 심사·예약 같은 도구 기반 작업을 안정적으로 완료해야 한다면, Think Fast 2.0이 현재 측정 결과상 가장 강력한 선택지입니다. 가장 깊이 있는 추론이 최우선이고 수 초의 지연 시간을 감수할 수 있다면 Qwen Plus가 승리합니다. 대화의 매끄러움과 에코시스템 적합성이 가장 중요하다면, GPT-Realtime-2.1이 여전히 넘어서야 할 기존의 강자입니다.

적합한 세 가지 시나리오
1. 전화 지원 및 전화 통신
{{1}}가장 중요한 조합은 1초 미만의 첫 음성, 시끄러운 전화 환경에서의 강력한 전사 성능(벤더 보고 기준), 그리고 전이중 인터럽트 처리입니다.{{/1}} 상담원이 거의 즉시 말을 시작하고 대화 중간에 계정 정보를 찾아낼 수 있는 지원 라인은 바로 {{2}}2.0{{/2}}이(가) 최적화된 용도입니다. 한 번에 한 가지 질문씩만 하는 간결한 RL 말하기 방식은 분 단위로 과금되는 전화 통신에도 잘 맞습니다 — 어느 벤더의 과금 기준으로든 마찬가지입니다.
2. 리드 자격 평가 및 통화 후 후속 조치
에이전틱 보이스는 2.0이 진정으로 처음인 분야이며, 리드 자격 평가는 표준적인 에이전틱 보이스 작업입니다. 의도가 신선할 때 자격을 평가하고, 라우팅하고, 후속 조치를 트리거합니다. 도구 호출은 첫 문장이 끝나기 전에 실행될 수 있으므로, 에이전트는 잠재 고객과 대화하는 동안 CRM 레코드를 생성할 수 있습니다. 세션 수준 기여도 분석과 엄격한 도구 권한을 계획하세요. 음성 에이전트는 실시간으로 오류를 범할 수 있으며, 정리는 사용자의 몫입니다.
3. 활발히 개발 중인 음성 에이전트 제품
자체 음성 에이전트를 배포하는 빌더들에게 — xAI가 인용한 Tradecraft 및 GrokTerm 통합이 바로 그런 형태입니다 — 2.0의 속도와 OpenAI 호환 API는 GPT-Realtime 코드에 마찰 없이 바로 적용할 수 있는 드롭인 역할을 합니다. 버전을 고정하고, 명확한 성공 조건(예: "가격 페이지 방문자 자격 확인 및 라우팅")을 갖춘 좁은 범위의 파일럿을 실행한 다음, 분당 비용이 아니라 완료된 결과당 비용을 측정하세요.
제한 사항 및 주의 사항
Think Fast 2.0은 이 글이 작성되는 시점에 출시된 지 5일밖에 안 되었으며, 그 점이 주의사항에 그대로 드러납니다. Starlink A/B 테스트 결과(전환율 상승 및 지원 차단 효과)는 xAI가 주장한 것으로 공개된 수치가 없습니다. 전사 배율과 "거의 5배 빠른"이라는 표현 역시 독립적인 벤치마크가 아닌 공급업체 주장입니다. "성능 회귀 및 조작된 테스트 보고서"를 언급하는 기사가 하나 보일 텐데, 그것도 바로 이 검증 불가능성 때문입니다. xAI가 공개한 수치는 독립적으로 재현된 적이 없으며, 신뢰성에 민감한 음성 커뮤니티에서 미공개 벤더 메트릭을 의심하는 것은 당연합니다. 또한 벤치마크는 최악의 통화 상황을 측정하지 못합니다. 에이전트가 리드를 잘못된 팀에 자신 있게 라우팅한다면 0.70초 응답은 무용지물입니다. 음성 과금은 분당 기준이며 이미 가격 인상이 반영되어 있어 비용 노출도 현실적입니다. 그리고 새로운 실시간 모델이 늘 그렇듯 API 변경이 예상됩니다. 정확성 주장을 자체 오디오로 검증하고, 프로덕션에서 버전을 고정하며, 첫 실시간 통화 전에 에스컬레이션과 녹음 체계를 갖추십시오.
자주 묻는 질문
Grok Voice Think Fast 2.0이란 무엇인가?
2026년 7월 29일에 출시된 xAI의 음성 에이전트용 플래그십 음성-음성 모델: WebSocket을 통한 네이티브 엔드투엔드 오디오-투-오디오를 지원하며, 0.70초의 time-to-first-audio와 τ-Voice 에이전트 벤치마크 1위를 달성했습니다.
Grok Voice Think Fast 2.0의 가격은 얼마인가요?
오디오 분당 $0.08(시간당 약 $4.80)에 텍스트 입력 메시지당 $0.004가 더해지며, 이는 Think Fast 1.0의 분당 $0.05보다 60% 인상된 가격입니다.
Think Fast 2.0이 최고의 음성 모델인가요?
에이전트 작업에서 가장 빠르고 뛰어나며(56.5% τ-Voice, 1위), 음성-음성 품질 지수(82.9%)에서는 Qwen Audio 3.0 Realtime Plus(84.1%)에 이어 전체 2위입니다. '최고'는 작업 부하에 따라 달라집니다.
Think Fast 1.0에서 무엇이 바뀌었나요?
병렬 음성 추론(말하면서 생각하는 방식), 약 60% 적은 추론 토큰, RL로 튜닝된 더 짧은 대화 스타일, 1.4배 전사 개선(공급업체 보고), 그리고 첫 오디오까지의 시간이 1.25초에서 0.70초로 단축되었습니다.
내 Think Fast 1.0 트래픽 스위치가 자동으로 전환될까요?
네, 2026년 8월 5일에 grok-voice-latest 별칭을 사용한다면 그렇습니다. 그 전에 grok-voice-think-fast-1.0을 고정하여 1.0에 유지하거나, 의도적으로 2.0을 채택하고 비용을 다시 예측하세요.
Grok Voice Think Fast 2.0을 어떻게 호출하나요?
xAI의 Speech-to-Speech API를 통해 — OpenAI Realtime API와 호환되는 실시간 WebSocket(wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0)으로, 사전 설정된 음성, 서버 VAD, 도구 호출을 제공합니다.
어떤 음성 모델과 경쟁하나요?
Qwen Audio 3.0 Realtime Plus (더 지능적이지만 첫 오디오까지 4.02초로 훨씬 느림), GPT-Realtime-2.1 (대화 흐름이 더 자연스러우며 High 티어에서 약 2.2배 더 비쌈), Gemini 3.1 Flash.
벤치마크 주장이 신뢰할 수 있나요?
Artificial Analysis 점수는 독립적이고 신뢰할 만합니다. Starlink A/B 결과, 전사 배율, 속도 프레이밍은 공개된 데이터 없이 xAI가 보고한 것이므로 방향성 참고용으로 간주하고 직접 오디오로 확인하세요.
Grok Voice는 전사에 좋은가요?
대화 중에 전사하며, xAI는 소음 환경에서 전용 STT 모델보다 큰 성능 향상을 주장합니다 — 하지만 대화 분당 과금되므로, 전용 전사 워크로드에는 전용 STT 모델이 더 적합합니다.
결론
Grok Voice Think Fast 2.0은 지금까지 측정된 가장 강력한 에이전틱 음성 모델이며, 최상위 계층에서 압도적인 격차로 가장 빠릅니다. 첫 오디오까지 0.70초는 진정하고 독립적으로 검증된 사용자 체감 성과이고, τ-Voice 1위는 실질적인 순위입니다. 정직한 요약은 구체적입니다. 실시간 도구 기반 음성 에이전트용으로는 이 클래스에서 최고의 도구이지만, 모든 지표에서 최고의 음성 모델은 아닙니다. 지능에서는 Qwen이, 대화의 세련됨에서는 OpenAI가 앞섭니다. 논란은 속도가 아니라 과금(미터)에 관한 것입니다. xAI가 서비스 비용이 더 저렴하다고 말하는 모델의 가격을 60% 인상한 점, 기한이 엄격한 자동 별칭(alias) 마이그레이션, 그리고 공개되지 않은 벤더 수치에 의존하는 헤드라인 주장이 그것입니다. 에이전틱 속도를 위해 사용하되 버전을 고정하고, 벤더 주장임을 표시하고, 자체 호출로 정확성을 검증하세요. 또한 음성 제품 주변의 범용 텍스트와 추론은 OrcaRouter와 같은 벤더 중립 엔드포인트에 유지하십시오.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
