
Grok Voice Think Fast 2.0: Tác nhân giọng nói nhanh nhất, đắt nhất của xAI, được giải thích
- qwenMỚIQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 trên 1 triệu token · 56 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4 Flash 07312026-07-3150Trí tuệ69Lập trình
- qwenMỚIQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token · 201 tok/s
- orcaMỚIOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicMỚIAnthropic: Claude Opus 52026-07-2461Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2150Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Trí tuệ49Lập trình
- metaMeta: Muse Spark 1.12026-07-1651Trí tuệ71Lập trình
- kimiMoonshotAI: Kimi K32026-07-1557Trí tuệ76Lập trình
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Trí tuệ71Lập trình
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Trí tuệ77Lập trình
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Trí tuệ77Lập trình
- grokxAI: Grok 4.52026-07-0854Trí tuệ72Lập trình
- tencentTencent: Hy32026-07-0641Trí tuệ59Lập trình
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Trí tuệ42Lập trình
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Trí tuệ39Lập trình
- anthropicAnthropic: Claude Sonnet 52026-06-3053Trí tuệ72Lập trình
- klingKling: Kling 3.0 Turbo2026-06-1757Trí tuệ52Lập trình57Toán
- z-aiZ.ai: GLM 5.22026-06-1651Trí tuệ69Lập trình60Toán
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Trí tuệ61Lập trình61Toán
xAI đã phát hành Grok Voice Think Fast 2.0 vào ngày 29 tháng 7 năm 2026 — mô hình được họ tự mô tả là “mô hình giọng nói speech-to-speech mạnh mẽ nhất” và là sản phẩm chủ lực mới trong dòng trợ lý giọng nói của họ. Nó phản hồi nhanh hơn bất kỳ đối thủ nào trong top năm (0,70 giây để có âm thanh đầu tiên), dẫn đầu chuẩn đánh giá giọng nói agentic, và phiên âm chính xác hơn thế hệ trước. Nó cũng đắt hơn 60% mỗi phút so với mô hình mà nó thay thế, được cung cấp theo cơ chế tính phí theo phút, âm thầm làm tăng hóa đơn của bạn, và đi kèm với một cơ chế chuyển bí danh phiên bản sẽ tự động kích hoạt sau một tuần. Hướng dẫn này giải thích Think Fast 2.0 thực sự là gì, xAI đã thay đổi những gì bên trong, cách câu chuyện điểm chuẩn được tách thành các điểm số độc lập và các tuyên bố do nhà cung cấp đưa ra, chi phí thực sự là bao nhiêu sau khi tính toán, và cách gọi nó — cùng với những lưu ý mà bạn nên đọc trước khi định tuyến một luồng cuộc gọi sản xuất qua nó.
Lưu ý về độ chính xác: thông tin ra mắt, giá cả, độ chính xác của tiêu đề và các tuyên bố kinh doanh đến từ thông báo và tài liệu của xAI (2026-07-29). Điểm tổng hợp của Artificial Analysis được đo lường độc lập bởi bên thứ ba. Các tuyên bố do xAI công bố — kết quả A/B của Starlink, hệ số nhân phiên âm, "giảm 60% token suy luận" và cách diễn đạt "nhanh gần 5 lần" — chưa công bố dữ liệu nền tảng; hãy coi chúng là số liệu định hướng từ nhà cung cấp và tự chạy đánh giá của riêng bạn. Thông số kỹ thuật, giá cả và hành vi alias có thể thay đổi; hãy xác minh trước khi xây dựng.
TL;DR. Grok Voice Think Fast 2.0 là mô hình speech-to-speech end-to-end của xAI dành cho các tác nhân thoại (voice agents): âm thanh vào, âm thanh ra qua WebSocket, không có quy trình ASR→LLM→TTS riêng biệt. Mô hình này thực sự nhanh (thời gian đến âm thanh đầu tiên là 0,70 giây — mô hình duy nhất trong top 5 đạt dưới một giây) và thực sự mạnh trong các tác vụ agentic voice, đứng đầu benchmark τ-Voice agent của Artificial Analysis (56,5%), đồng thời xếp thứ hai tổng thể về chỉ số chất lượng speech-to-speech (82,9%), sau Qwen Audio 3.0 Realtime Plus (84,1%). Mô hình suy luận ngay trong lúc nói — cắt giảm mức sử dụng token suy luận trung vị xuống còn khoảng 40% so với mô hình cũ — và có giá 0,08 USD/phút, tăng từ 0,05 USD. Điểm trừ nằm ở cách tính cước: thoại bị tính phí theo từng phút âm thanh thời gian thực (wall-clock), nên mức tăng giá 60% trên một mô hình có chi phí vận hành rẻ hơn sẽ được tính thẳng vào hóa đơn của bạn. Và vào ngày 5 tháng 8, bí danh grok-voice-latest sẽ bắt đầu tự động trỏ sang phiên bản 2.0, vì vậy các nhóm đang dùng phiên bản cũ cần chủ động khóa (pin) nó trước thời điểm đó.
Những điểm chính rút ra
• Speech-to-speech nguyên bản: một mô hình duy nhất từ micrô đến loa, không qua chuỗi ASR→LLM→TTS — đó là lý do âm thanh đầu tiên phát ra chỉ trong 0,70 giây.
• Dẫn đầu về tác nhân AI: #1 trên benchmark τ-Voice của Artificial Analysis (56,5%), vượt xa GPT-Realtime-2.1 (45,7%) và Gemini 3.1 Flash (37,7%).
• Không phải là người dẫn đầu tổng thể: hạng 2 về chỉ số chất lượng lời nói-lời nói (82,9%), sau Qwen Audio 3.0 Realtime Plus (84,1%); OpenAI vẫn thắng về động thái hội thoại (95,7% so với 95,1%).
• Đắt hơn 60%: $0.08/phút (~$4.80/giờ) so với $0.05/phút của Think Fast 1.0 — mặc dù mô hình được báo cáo sử dụng ít hơn khoảng 60% token suy luận.
• Chuyển đổi alias vào ngày 5 tháng 8: grok-voice-latest tự động chuyển đến 2.0; hãy ghim grok-voice-think-fast-1.0 trước thời điểm đó để giữ ở phiên bản rẻ hơn.
• Ghi nhãn mọi tuyên bố: điểm số Artificial Analysis là độc lập; A/B của Starlink, hệ số nhân phiên âm, và cách định khung tốc độ là do xAI báo cáo và chưa được công bố.
Grok Voice Think Fast 2.0 là gì
Grok Voice là họ mô hình thời gian thực, chuyển lời nói thành lời nói của xAI. "Think Fast" là dòng phản hồi nhanh, ban đầu được ra mắt cùng với Voice Agent Builder vào tháng 4 năm 2026; Think Fast 2.0 là thế hệ thứ hai của dòng này, được phát hành vào ngày 29 tháng 7 năm 2026. Mô hình này mang tính end-to-end (từ đầu đến cuối): nó tiếp nhận âm thanh thô, suy luận và phát ra âm thanh trực tiếp, thay vì vận hành một chuỗi xử lý gồm mô hình nhận dạng giọng nói cung cấp đầu vào cho một LLM văn bản, rồi LLM này cung cấp đầu vào cho mô hình chuyển văn bản thành giọng nói. Lựa chọn kiến trúc đó chính là gốc rễ của lợi thế về độ trễ — không có các bước tuần tự nối tiếp và không có văn bản trung gian, nên mô hình có thể bắt đầu phản hồi trong khi vẫn đang lắng nghe.
xAI định vị nó một cách rõ ràng cho các tác tử AI giọng nói: đường dây hỗ trợ khách hàng, bán hàng qua điện thoại, lễ tân, điện thoại, và các ứng dụng khác nơi một hệ thống trò chuyện với con người theo thời gian thực và cần thực sự hoàn thành công việc — đặt lịch cuộc gọi, sàng lọc khách hàng tiềm năng, cập nhật hồ sơ, tìm kiếm web — thay vì chỉ trò chuyện. Sự nhấn mạnh vào tính tác tử, chứ không phải phiên âm hay tổng hợp thô, là chiến trường mà sự ra mắt này hướng tới.
Có gì mới so với Think Fast 1.0
Việc nâng cấp từ 1.0 không chỉ đơn thuần là thay đổi số phiên bản; xAI mô tả ba thay đổi về cấu trúc:
• Suy luận song song với lời nói. Mô hình suy luận về một truy vấn trong khi đang nói, thay vì suy nghĩ trước rồi mới nói sau. Về mặt thực tế, các lời gọi công cụ có thể được kích hoạt trước khi agent nói xong câu đầu tiên — điều này rất quan trọng đối với các luồng thoại nhạy cảm về độ trễ.
• Ít token suy luận hơn hẳn. xAI báo cáo mức sử dụng token suy luận trung vị đã giảm xuống còn khoảng 0,4 lần so với phiên bản tiền nhiệm (tức giảm khoảng 60%), một phần lý do khiến họ nói rằng mô hình này rẻ hơn để phục vụ dù giá đã tăng.
• Phong cách hội thoại học tăng cường. RL đã định hình lại cách nó trò chuyện: câu ngắn hơn, mỗi lần một câu hỏi, không có từ đệm — kiểu gọi điện gọn gàng, mang chất "người" hơn, phù hợp với công việc qua điện thoại, nơi nói dài dòng đốt từng phút (và, tính theo từng phút, đốt tiền).
Về tốc độ đo lường được, thời gian đến âm thanh đầu tiên đã giảm từ 1,25 giây trong bản 1.0 xuống 0,70 giây trong bản 2.0. Về phiên âm, xAI báo cáo mức cải thiện khoảng 1,4 lần trên 24 ngôn ngữ (do nhà cung cấp báo cáo, bên dưới).

Các điểm chuẩn, từng điểm chuẩn một
Sự ra mắt được neo vào Artificial Analysis, một tổ chức đánh giá điểm chuẩn độc lập thuộc bên thứ ba. Điều đó quan trọng: không giống như hầu hết các con số khác trong thông báo, những con số này được đo lường bởi một bên trung lập, và chúng là những con số đáng để so sánh một cách tương đương. Bức tranh tổng hợp tốt hơn một tiêu đề duy nhất.
Chỉ số chất lượng Speech-to-Speech: 82.9% (vị trí thứ hai). Đây là chỉ số tổng hợp speech-to-speech chung, tăng từ mức 75.7% của Think Fast 1.0. Nó vượt qua GPT-Realtime-2.1 (79.1%) và Gemini 3.1 Flash (69.5%) — nhưng không đứng đầu. Qwen Audio 3.0 Realtime Plus dẫn đầu với 84.1%. Vì vậy, "mô hình giọng nói tổng thể tốt nhất" là một nhận định quá đà mà dữ liệu không ủng hộ; "mô hình giọng nói agentic nhanh nhất trong nhóm hàng đầu" là chính xác.
Chuẩn đánh giá tác tử τ-Voice: 56,5% (hạng nhất). Đây là chỉ số mà xAI quan tâm nhất, và bảng xếp hạng này là thật: 56,5% vượt qua Think Fast 1.0 (52,1%), GPT-Realtime-2.1 (45,7%) và Gemini 3.1 Flash (37,7%). τ-Voice đo lường hiệu suất tác tử thoại — mô hình hoàn thành nhiệm vụ tốt đến đâu qua kênh thoại, bao gồm cả việc sử dụng công cụ ngay giữa cuộc trò chuyện. Xét trên tiêu chí hẹp "có làm được việc không", Grok dẫn đầu. Musk đã quảng bá đúng bảng xếp hạng này.
Big Bench Audio: 97,2%. Một benchmark suy luận giọng nói; kết quả ấn tượng, dù Qwen đã lập kỷ lục 99,2%.
Full Duplex Bench: 95,1%. Động thái hội thoại — xử lý ngắt lời, chuyển lượt, chen ngang. Đây là một bước nhảy vọt so với mức 77,8% của phiên bản 1.0, nhưng OpenAI vẫn nhỉnh hơn với 95,7%, và Qwen dẫn đầu với 98,4%.
Thời gian phát âm thanh đầu tiên: 0.70s. Con số quan trọng nhất đối với các sản phẩm giọng nói thực tế. Con số này đã giảm từ 1.25s và là con số duy nhất dưới một giây trong số năm mô hình được xếp hạng hàng đầu; các thử nghiệm độc lập nhìn chung xác nhận phản hồi dưới một giây. Độ trễ token đầu tiên của TTS phát trực tuyến là khoảng 285ms. Đối với sử dụng qua điện thoại và thời gian thực, độ trễ là chỉ số người dùng cảm nhận ở mỗi lượt tương tác, và đây chính là điểm mà 2.0 vượt trội một cách rõ rệt.
Đọc qua các hàng, hồ sơ rất cụ thể: nói nhanh nhất, hoàn thành nhiệm vụ tốt nhất, tổng thể đứng thứ hai, thứ ba về sự tinh tế trong hội thoại. Đó là một mô hình đại lý giọng nói xuất sắc, và một tuyên bố "giọng nói chatbot tốt nhất" tầm thường. Hãy chọn nó cho những công việc mà hàng trên cùng phù hợp.
Độ chính xác phiên âm
Vượt ra ngoài hội thoại, xAI tuyên bố khả năng phiên âm tốt hơn đáng kể. Đánh giá nội bộ của họ trên 24 ngôn ngữ và hàng nghìn cụm từ được báo cáo cho thấy độ chính xác gấp khoảng 1,4 lần Think Fast 1.0, và gấp 1,5–2 lần độ chính xác của các mô hình phiên âm chuyên dụng như Deepgram Nova 3 và ElevenLabs Scribe v2. Trong điều kiện thực tế ồn ào — tiếng ồn nền, nén thoại, cuộc gọi băng thông thấp — khoảng cách độ chính xác được báo cáo so với các mô hình STT chuyên dụng tăng lên đến khoảng 10 lần.
Đây chính là những tuyên bố cần xem xét cẩn trọng. Chúng do xAI báo cáo; bộ khung đánh giá, các tập cụm từ và cấu hình nhiễu chưa được công bố. Một bài kiểm tra độc lập về khả năng phiên âm điện thoại nhiễu của 2.0 so với Deepgram hoặc ElevenLabs sẽ có giá trị và, tính đến thời điểm viết bài này, vẫn chưa được công bố. Về mặt định hướng, các mô hình end-to-end hấp thụ nhiều dữ liệu điện thoại hơn trong quá trình huấn luyện là một sự cải thiện thực tế hợp lý — nhưng "10x" cần được kiểm chứng, không nên được lặp lại như một sự thật.
Định giá: $0.08 một phút và câu hỏi 60%
Đây là điểm gây tranh cãi trong đợt ra mắt. Think Fast 2.0 có giá $0,08 cho mỗi phút âm thanh — khoảng $4,80 mỗi giờ — cộng thêm $0,004 cho mỗi tin nhắn văn bản đầu vào. Think Fast 1.0 có giá $0,05 mỗi phút ($3,00/giờ). Đó là mức tăng 60%, và nó đến cùng tháng mà OpenAI đã cắt giảm giá trên GPT-5.6 Luna xuống 80% và Terra xuống 20%, với lý do chi phí phục vụ giảm tương tự mà xAI tuyên bố cho mô hình này.
Đồng hồ đo chính là toàn bộ câu chuyện. Các mô hình văn bản tính phí theo token, vì vậy khi một mô hình hiệu quả hơn, hóa đơn của khách hàng tự động giảm. Các mô hình giọng nói tính phí theo phút âm thanh thời gian thực, và độ dài của cuộc trò chuyện do người nói quyết định, không phải do mô hình. Lợi ích từ hiệu quả trong một sản phẩm tính phí theo phút thuộc về nhà cung cấp, không phải người mua. Đó là lý do vì sao một mô hình được cho là sử dụng ít hơn khoảng 60% token suy luận — và do đó rẻ hơn để xAI vận hành — lại có giá thuê đắt hơn 60%.
Thực hiện phép tính trên một luồng cuộc gọi thực tế. Một cuộc gọi 4 phút với gói 1.0 tốn 0,20 đô la; cuộc gọi tương tự với gói 2.0 tốn 0,32 đô la. Mười nghìn cuộc gọi như vậy mỗi tháng là 40.000 phút: 2.000 đô la/tháng với 1.0 so với 3.200 đô la/tháng với 2.0 — chênh lệch 1.200 đô la/tháng, tức khoảng 14.400 đô la/năm, đến từ việc thay đổi định tuyến chứ không phải từ lưu lượng cuộc gọi. Ngay cả một cải thiện tốc độ đáng kể cũng khó lòng bù đắp được: cắt giảm trọn 10 giây trong mỗi cuộc gọi tiết kiệm khoảng 0,013 đô la trong khi giá tăng thêm 0,12 đô la — bạn thu hồi được khoảng một phần chín mức tăng đó. Bất kỳ đề xuất kinh doanh nào quảng bá 2.0 là mô hình rẻ hơn đều đã nhầm lẫn giữa "nhanh hơn" với "rẻ hơn".
Để có bối cảnh, 2.0 vẫn rẻ hơn khoảng 2,2 lần so với GPT-Realtime-2.1 High, ở mức khoảng 10,75 USD/giờ. Vì vậy, xét về mặt tuyệt đối, nó không đắt — nó đắt một cách tương đối so với phiên bản tiền nhiệm của chính nó và so với hướng đi mà mọi nhà cung cấp mô hình khác đang theo đuổi trong tháng đó.
Cái bẫy di trú ngày 5 tháng 8
Có một thời hạn kèm theo. Vào ngày 5 tháng 8 năm 2026, bí danh {{1}}grok-voice-latest{{/1}} sẽ tự động bắt đầu định tuyến đến {{2}}Think Fast 2.0{{/2}}. Nếu bạn đang sử dụng {{3}}Think Fast 1.0{{/3}} qua bí danh đó, {{4}}"không làm gì"{{/4}} sẽ nâng cấp bạn — và hóa đơn của bạn — lên phiên bản mới vào ngày đó. Để tiếp tục dùng bản 1.0, bạn phải ghim rõ ràng ID mô hình {{5}}grok-voice-think-fast-1.0{{/5}} trước ngày 5 tháng 8.
Hai lập trường có thể bảo vệ được đều đòi hỏi hành động trước hạn chót: hoặc cố tình chốt bản 1.0 vì các luồng kịch bản của bạn hoạt động tốt ở mức $3.00/giờ, hoặc cố tình chuyển sang bản 2.0 và dự báo lại ở mức $4.80/giờ, biện minh dựa trên chất lượng thay vì tiết kiệm. Điều không thể bào chữa là phát hiện ra sự thay đổi trong một hóa đơn tháng Chín. Một nguyên tắc hay: coi bất kỳ bí danh nào kết thúc bằng "latest" là chỉ thị thường trực chấp nhận bất cứ thứ gì nhà cung cấp giao ra tiếp theo — kể cả giá của nó.
Cách truy cập và sử dụng nó
Think Fast 2.0 có sẵn qua API Speech-to-Speech của xAI với mã mô hình grok-voice-think-fast-2.0, trong đó grok-voice-latest là bí danh động. Đây là mô hình thời gian thực, song công toàn phần (full-duplex) chạy qua WebSocket: wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0, xác thực bằng tiêu đề Authorization: Bearer trong quá trình bắt tay. Đối với ứng dụng trình duyệt, hãy tạo token tạm thời ở phía máy chủ thông qua endpoint realtime sessions để khóa API cha không bao giờ lộ ra máy khách.
API này tương thích với OpenAI Realtime, nên mã realtime-voice hiện có thường chỉ cần đổi base URL và key. Việc thiết lập phiên diễn ra qua sự kiện session.update: chọn giọng nói định sẵn (eve, ara, rex, sal, leo), đặt định dạng âm thanh đầu vào và đầu ra (PCM16 ở 24kHz theo mặc định; μ-law cho viễn thông), bật phát hiện hoạt động giọng nói phía máy chủ, và đăng ký các công cụ — bao gồm công cụ tìm kiếm web tích hợp — để agent có thể hành động giữa cuộc hội thoại. Luồng sự kiện tuân theo mẫu chuẩn: client nối thêm các frame vào audio buffer, server truyền phát các delta âm thanh phản hồi, và các sự kiện đối số tool-call được kích hoạt khi mô hình quyết định hành động, với kết quả được đẩy ngược lại dưới dạng đầu ra function-call. Mô hình hỗ trợ 25+ ngôn ngữ và nhân bản giọng nói tùy chỉnh từ khoảng một phút giọng nói.
Lưu ý điều nó không phải: đây là mô hình agent chuyển giọng nói sang giọng nói, không phải dịch vụ phiên âm hay dịch thuật thông thường. Nếu nhiệm vụ cốt lõi của sản phẩm bạn là chuyển âm thanh thành văn bản với chi phí thấp, mô hình STT chuyên dụng là một công cụ khác — và với mức tính phí theo phút, bạn phải trả tiền cho toàn bộ cuộc hội thoại, nên các tác vụ chỉ phiên âm sẽ nhanh chóng trở nên tốn kém.

Cách nó phù hợp với một stack agent thoại
Think Fast 2.0 là mô hình giọng nói thời gian thực chuyên dụng được truy cập qua API riêng của xAI, không phải là một LLM đa năng do bộ định tuyến mô hình lưu trữ. Kênh thoại chạy trực tiếp trên WebSocket của xAI — đó là nơi có độ trễ dưới một giây, và nó không tồn tại qua được bước nhảy trung gian.
Mọi thứ khác xung quanh một sản phẩm thoại — logic ngôn ngữ tự nhiên {{1}}không nhạy cảm về thời gian{{/1}}, suy luận dự phòng {{2}}khi cuộc trò chuyện đi chệch kịch bản{{/2}}, tóm tắt, phân tích, email theo dõi mà agent kích hoạt {{3}}sau cuộc gọi{{/3}} — là công việc văn bản và đa phương thức đa dụng. Đối với phần đó, một endpoint trung lập về nhà cung cấp như OrcaRouter cung cấp cho bạn một API tương thích OpenAI trên nhiều LLM, để bạn không bị ràng buộc vào một nhà cung cấp duy nhất {{4}}cho các phần của stack không cần luồng thoại thời gian thực{{/4}}. Sự phân tách rõ ràng: API chuyên dụng của xAI cho chính phần thoại streaming, OrcaRouter (hoặc tương tự) cho phần suy luận văn bản và đa phương thức xung quanh nó.
Cuộc cạnh tranh: tốc độ tác nhân so với trí thông minh thô
Think Fast 2.0 ra mắt giữa thị trường cạnh tranh nhất trong lĩnh vực AI hiện nay — các agent giọng nói thời gian thực — và bảng benchmark khiến những sự đánh đổi trở nên rõ ràng đến bất thường.
Qwen Audio 3.0 Realtime Plus là mô hình dẫn đầu về trí tuệ: 84.1% trên chỉ số chất lượng chuyển đổi giọng nói (đứng đầu), kỷ lục 99.2% trên Big Bench Audio, và 98.4% về song công toàn phần. Nhưng thời gian trung bình để có âm thanh đầu tiên của nó khoảng 4.02 giây — chậm hơn khoảng 5.7 lần so với 0.70s của Grok. Đối với các cuộc trò chuyện trên ô tô, thiết bị đeo và điện thoại, sự khác biệt đó không phải là "nhanh so với chậm", mà là dùng được so với không dùng được. Qwen cũng tách thành bậc Plus (chất lượng) và bậc Flash (gói tin đầu tiên khoảng 300ms) cho các tình huống khác nhau, một lời giải đáp thấu đáo cho cùng một sự căng thẳng đó.
GPT-Realtime-2.1 xếp giữa trên hầu hết các hàng (79.1% chất lượng, 45.7% agentic) và thắng về tương tác hội thoại (95.7%). Bậc High của nó có giá theo giờ gấp khoảng 2,2 lần Grok. Với các đội ngũ đã đầu tư sâu vào hệ sinh thái OpenAI, đây vẫn là lựa chọn mặc định ít rào cản nhất.
Gemini 3.1 Flash xếp sau về các chỉ số tổng hợp chất lượng và tác nhân (69.5%, 37.7%) nhưng là một phần của hệ thống giọng nói Gemini rộng hơn và hệ sinh thái Google mà nhiều nhóm ưa thích vì những lý do khác.
Kết luận thực tế: hãy chọn theo khối lượng công việc. Nếu trợ lý thoại của bạn cần phản hồi tức thì và phải hoàn thành các tác vụ có hỗ trợ công cụ một cách đáng tin cậy (hỗ trợ khách hàng, sàng lọc, đặt chỗ), thì {{1}}Think Fast 2.0{{/1}} là lựa chọn mạnh nhất theo số liệu đo lường hiện nay. Nếu ưu tiên của bạn là khả năng suy luận sâu nhất và bạn có thể chấp nhận độ trễ nhiều giây, thì {{2}}Qwen Plus{{/2}} thắng. Nếu độ mượt trong hội thoại và sự phù hợp với hệ sinh thái là quan trọng nhất, thì {{3}}GPT-Realtime-2.1{{/3}} vẫn là đương kim số một cần phải đánh bại.

Ba tình huống phù hợp
1. Hỗ trợ qua điện thoại và dịch vụ thoại
Sự kết hợp quan trọng nhất: âm thanh đầu tiên trong chưa đầy một giây, khả năng phiên âm tốt trên điện thoại nhiều tạp âm (theo báo cáo của nhà cung cấp) và xử lý ngắt lời song công toàn phần. Một đường dây hỗ trợ nơi tác nhân bắt đầu nói gần như ngay lập tức và có thể truy xuất thông tin tài khoản ngay giữa lượt thoại chính là thứ mà 2.0 được tinh chỉnh để phục vụ. Phong cách nói ngắn gọn, mỗi lần một câu hỏi của RL cũng rất khớp với môi trường điện thoại, nơi phút là đơn vị tính cước — dù trên đồng hồ của nhà cung cấp nào.
2. Đánh giá khách hàng tiềm năng và theo dõi sau cuộc gọi
Giọng nói tác nhân là lĩnh vực mà 2.0 thực sự dẫn đầu, và đánh giá khách hàng tiềm năng là nhiệm vụ tiêu biểu của tác nhân thoại: đánh giá, định tuyến và kích hoạt theo dõi trong khi ý định của khách vẫn còn mới. Tính năng gọi công cụ của nó có thể kích hoạt trước khi câu đầu tiên kết thúc, nhờ vậy tác nhân có thể tạo bản ghi CRM ngay khi vẫn đang trò chuyện với khách hàng tiềm năng. Hãy lên kế hoạch cho việc quy kết ở cấp phiên và quyền hạn công cụ nghiêm ngặt — tác nhân thoại có thể sai sót trong thời gian thực, và việc khắc phục là trách nhiệm của bạn.
3. Các sản phẩm voice-agent đang được phát triển tích cực
Đối với các nhà phát triển triển khai tác nhân thoại của riêng họ — các tích hợp Tradecraft và GrokTerm mà xAI trích dẫn đúng là dạng này — tốc độ của 2.0 và API tương thích OpenAI khiến nó trở thành giải pháp thay thế trực tiếp dễ dàng cho mã GPT-Realtime. Cố định phiên bản, chạy một thử nghiệm quy mô hẹp với điều kiện thành công rõ ràng (ví dụ: "xác định đủ điều kiện và điều hướng khách truy cập trang giá"), và đo chi phí trên mỗi kết quả hoàn thành, không phải chi phí trên mỗi phút.
Hạn chế và lưu ý
Think Fast 2.0 mới được năm ngày tuổi tính đến thời điểm viết bài, và điều đó thể hiện rõ ở các lưu ý. Kết quả A/B của Starlink (chuyển đổi cao hơn và kiểm soát hỗ trợ tốt hơn) do xAI báo cáo mà không có số liệu công bố; các hệ số nhân phiên âm và cách nói "nhanh gần gấp 5 lần" cũng chỉ là tuyên bố của nhà cung cấp, không phải điểm chuẩn độc lập. Bài viết duy nhất bạn sẽ thấy cáo buộc "suy giảm hiệu suất và báo cáo thử nghiệm bịa đặt" cũng đề cập đến chính sự không thể kiểm chứng này — các con số xAI công bố chưa được tái lập độc lập, và cộng đồng voice nhạy cảm với độ tin cậy nghi ngờ các số liệu chưa được công bố của nhà cung cấp là điều dễ hiểu. Điểm chuẩn cũng không thể đo được tình huống xấu nhất của bạn: phản hồi 0,70 giây vô nghĩa nếu agent tự tin chuyển khách hàng tiềm năng đến sai bộ phận. Cước voice tính theo phút với mức tăng giá đã được tính sẵn, nên rủi ro chi phí là có thật. Và cũng như mọi mô hình thời gian thực mới toanh, hãy chuẩn bị cho sự biến động API. Hãy tự kiểm chứng các tuyên bố về độ chính xác trên audio của chính bạn, cố định phiên bản trong môi trường production, và thiết lập quy trình leo thang cùng ghi âm trước cuộc gọi trực tiếp đầu tiên.
Câu hỏi thường gặp
Grok Voice Think Fast 2.0 là gì?
Mô hình chuyển giọng nói thành giọng nói chủ lực của xAI dành cho các tác tử thoại, phát hành ngày 29 tháng 7 năm 2026: âm thanh sang âm thanh nguyên bản end-to-end qua WebSocket, với thời gian đến âm thanh đầu tiên là 0,70 giây và đạt vị trí đầu tiên trên benchmark tác tử τ-Voice.
Grok Voice Think Fast 2.0 giá bao nhiêu?
{{1}}0,08 USD mỗi phút âm thanh (khoảng 4,80 USD/giờ) cộng với 0,004 USD cho mỗi tin nhắn văn bản đầu vào{{/1}} — tăng 60% so với mức 0,05 USD/phút của Think Fast 1.0.
Think Fast 2.0 có phải là mô hình giọng nói tốt nhất không?
Nó nhanh nhất và tốt nhất ở các tác vụ agentic (56.5% τ-Voice, hạng nhất) và đứng thứ hai tổng thể về chỉ số chất lượng speech-to-speech (82.9%), sau Qwen Audio 3.0 Realtime Plus (84.1%). "Tốt nhất" phụ thuộc vào khối lượng công việc.
Điều gì đã thay đổi so với Think Fast 1.0?
Suy luận giọng nói song song (nó suy nghĩ trong khi nói), giảm khoảng 60% token suy luận, phong cách hội thoại ngắn gọn hơn được tinh chỉnh bằng RL, cải thiện phiên âm 1,4 lần (theo báo cáo của nhà cung cấp), và thời gian đến âm thanh đầu tiên giảm từ 1,25 giây xuống 0,70 giây.
Công tắc lưu lượng Think Fast 1.0 của tôi có tự động chuyển mạch không?
Vâng, vào ngày 5 tháng 8 năm 2026, nếu bạn đang sử dụng bí danh grok-voice-latest. Hãy ghim grok-voice-think-fast-1.0 trước thời điểm đó để giữ ở phiên bản 1.0, hoặc chủ động chuyển sang 2.0 và dự báo lại chi phí.
Làm cách nào để tôi gọi Grok Voice Think Fast 2.0?
Thông qua API Speech-to-Speech của xAI — một WebSocket thời gian thực (wss://api.x.ai/v1/realtime?model=grok-voice-think-fast-2.0) tương thích với OpenAI Realtime API, với các giọng nói cài sẵn, VAD phía máy chủ và gọi công cụ.
Nó cạnh tranh với những mô hình giọng nói nào?
Qwen Audio 3.0 Realtime Plus (thông minh hơn, chậm hơn nhiều với 4,02 giây cho âm thanh đầu tiên), GPT-Realtime-2.1 (tương tác hội thoại tốt hơn, đắt hơn khoảng 2,2 lần ở gói High), và Gemini 3.1 Flash.
Các tuyên bố về điểm chuẩn có đáng tin cậy không?
Các điểm số Artificial Analysis là độc lập và đáng tin cậy. Các kết quả A/B của Starlink, hệ số phiên âm và khung tốc độ đều do xAI báo cáo mà không có dữ liệu công bố — hãy coi chúng chỉ mang tính định hướng và tự kiểm chứng trên audio của riêng bạn.
Grok Voice có tốt cho việc phiên âm không?
Nó phiên âm trong một cuộc trò chuyện, và xAI tuyên bố đạt được lợi thế lớn so với các mô hình STT chuyên dụng trong môi trường nhiễu — nhưng chi phí được tính theo phút hội thoại, vì vậy các tác vụ phiên âm chuyên dụng sẽ được phục vụ tốt hơn bởi một mô hình STT chuyên dụng.
Kết luận
Grok Voice Think Fast 2.0 là mô hình giọng nói tác nhân mạnh nhất từng được đo lường cho đến nay, và nhanh nhất trong nhóm hàng đầu với cách biệt lớn — chỉ 0,70 giây để cho ra âm thanh đầu tiên là một chiến thắng thực chất, độc lập và hướng đến người dùng, cùng vị trí dẫn đầu trên τ-Voice là một thứ hạng thực sự. Tóm lại một cách trung thực và cụ thể: đây là công cụ tốt nhất trong phân khúc dành cho các tác nhân giọng nói thời gian thực có hỗ trợ công cụ, chứ không phải mô hình giọng nói tốt nhất ở mọi hạng mục — Qwen dẫn đầu về trí thông minh, còn OpenAI dẫn đầu về độ tinh tế trong hội thoại. Các tranh cãi không nằm ở tốc độ, mà nằm ở thước đo: mức tăng giá 60% đối với một mô hình mà xAI khẳng định là rẻ hơn để vận hành, việc tự động di chuyển bí danh với thời hạn cứng, và những tuyên bố nổi bật dựa trên số liệu nhà cung cấp chưa được công bố. Hãy dùng nó khi cần tốc độ tác nhân, cố định phiên bản của bạn, gắn nhãn các tuyên bố của nhà cung cấp, và tự kiểm chứng độ chính xác trên các cuộc gọi của riêng bạn — đồng thời giữ phần văn bản đa dụng và suy luận xung quanh sản phẩm giọng nói của bạn trên một điểm cuối trung lập với nhà cung cấp như OrcaRouter.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
