Thẻ tiêu đề hero cho 'Realtime-Venus vs Grok Voice Think Fast 2.0', với phụ đề 'Một cái có thể mua được ngay chiều nay. Một cái là bản tải xuống.', với ba thẻ ghi 'Grok Voice Think Fast 2.0: $0.08 mỗi phút âm thanh, 0.70 giây đến âm thanh đầu tiên', 'Realtime-Venus: trọng số Apache-2.0, không có API, không có bảng giá', và 'Canh bạc chung: suy luận trong khi nói, không phải trước khi nói', phía trên một dải chân trang ghi 'Số liệu Grok theo Artificial Analysis và tài liệu xAI; số liệu Realtime-Venus từ báo cáo kỹ thuật của nó, chưa được tái lập.' Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Realtime-Venus vs Grok Voice Think Fast 2.0: Chỉ một trong số này có giá.

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Realtime-Venus và Grok Voice Think Fast 2.0 cạnh nhau và sự khác biệt đầu tiên không phải là một benchmark, mà là một đơn đặt hàng. Grok Voice Think Fast 2.0 là một mô hình speech-to-speech được lưu trữ đã được bán ra vào ngày 29 tháng 7 năm 2026 với giá $0.08 mỗi phút âm thanh, với thời gian tới âm thanh đầu tiên được công bố là 0.70 giây và điểm benchmark từ một bên thứ ba. Realtime-Venus là một hệ thống full-duplex 9B từ Venus Team của Ant Group và Đại học Thanh Hoa, tồn tại dưới dạng trọng số Apache-2.0, một báo cáo kỹ thuật ngày 12 tháng 9 năm 2026, và không có gì bạn có thể gọi. Một trong số này bạn có thể kết nối vào một đường dây điện thoại trước cuối tuần. Cái còn lại bạn có thể đọc. Sự bất đối xứng đó hóa ra là một so sánh hữu ích hơn nhiều so với một bảng điểm, bởi vì hai mô hình đã đặt cược gần như cùng một kiến trúc và sau đó phân kỳ hoàn toàn về những gì cần làm với nó.

Câu trả lời ngắn gọn

Chọn Grok Voice Think Fast 2.0 nếu bạn cần một voice agent hoạt động được ngay, trong môi trường production, với bảng giá bạn có thể đưa vào ngân sách và cam kết độ trễ bạn có thể kiểm chứng. Chọn Realtime-Venus nếu bạn cần sở hữu toàn bộ stack — nếu dữ liệu của bạn không thể rời khỏi hạ tầng của bạn, nếu bạn cần tinh chỉnh front end, hoặc nếu bạn đang đánh giá kiến trúc thay vì tung ra sản phẩm. Không có trường hợp thứ ba nào mà chúng cạnh tranh với nhau, vì một bên có API còn bên kia thì không.

Họ đồng ý về vấn đề khó.

Điều thú vị là cách chẩn đoán vấn đề giống nhau đến vậy. Cả hai mô hình đều tồn tại vì cùng một mâu thuẫn: việc điều khiển hội thoại phải chạy ở độ chi tiết dưới một giây, còn suy luận thì mất hàng giây. Một mô hình dừng lại để suy nghĩ sẽ không còn cảm giác hiện diện.

Grok Voice Think Fast 2.0 giải quyết vấn đề này bằng cách suy luận ngay trong khi nói. Dòng Think Fast được xây dựng dựa trên ý tưởng rằng mô hình không nên suy luận trước rồi mới tạo giọng nói; thay vào đó, nó truyền phát giọng nói và suy nghĩ song song, nhờ đó một lệnh gọi công cụ có thể được kích hoạt trước khi tác nhân nói xong câu đầu tiên. xAI báo cáo rằng phiên bản 2.0 sử dụng lượng token suy luận chỉ khoảng 0,4 lần so với phiên bản tiền nhiệm, điều này được trình bày như một cải thiện về chi phí và độ trễ chứ không phải về chất lượng.

Realtime-Venus giải quyết vấn đề bằng cách không giải quyết nó ở frontend chút nào. Runtime hai vòng lặp của nó duy trì một vòng tương tác một giây — nhận thức, điều khiển lượt, tạo giọng nói — và giao mọi thứ tốn kém cho một thành phần riêng gọi là Realtime-Venus-Harness thông qua các điểm đánh dấu ủy thác bất đồng bộ được phát ra trong chính chuỗi ẩn của mô hình. Cuộc hội thoại ở tiền cảnh không bao giờ tạm dừng. Kết quả chạy nền được tái tích hợp khi chúng đến.

Đó là những câu trả lời kỹ thuật khác nhau cho cùng một câu hỏi, và chúng có những kiểu thất bại khác nhau. Suy luận trong lúc nói đặt gánh nặng lên mô hình trong việc giữ cho cả hai luồng đều mạch lạc. Ủy thác đặt gánh nặng lên runtime trong việc giữ cho hai vòng lặp không làm hỏng lẫn nhau — đó là lý do vì sao việc ghi nhận tác vụ nhân quả của bài báo Realtime-Venus, một ảnh chụp trạng thái biệt lập cho mỗi tác vụ được ủy thác, chính là chi tiết trụ cột của thiết kế.

Chỉ số duy nhất mà cả hai đều có thể được đo lường dựa trên

Các phép đo chuẩn full-duplex là nơi duy nhất hai thứ này giao nhau, và chúng không giao nhau một cách rõ ràng.

• Xử lý ngắt lời — Realtime-Venus báo cáo phản hồi 75% các lần ngắt lời của người dùng trên Full-Duplex-Bench v1.5. Grok Voice Think Fast 2.0 đạt 95,1% trên Full Duplex Bench theo Artificial Analysis, tăng từ 77,8% ở phiên bản 1.0.

• Tiếp tục khi có chồng chéo — Realtime-Venus báo cáo tỷ lệ tiếp tục 97% dưới các tín hiệu phản hồi, 88% dưới lời nói hướng đến người khác, và 86% dưới lời nói nền, và tuyên bố vượt qua Gemini 3.1 Live và GPT-4o trên cả ba.

• Công cụ khác nhau, tác giả khác nhau — các số liệu của Realtime-Venus đến từ báo cáo kỹ thuật của chính nó và không có tái lập từ bên ngoài. Các số liệu của Grok đến từ một bên thứ ba đã chạy mô hình. So sánh một con số tự báo cáo với một con số được đo độc lập thì không phải là so sánh, và khoảng cách nêu trên có khả năng do phương pháp luận cũng cao không kém gì việc phản ánh sự khác biệt thực tế.

Cách hiểu trung thực: dựa trên bằng chứng hiện có, Grok Voice Think Fast 2.0 là sản phẩm duy nhất trong hai sản phẩm mà hành vi full-duplex của nó đã được đo lường bởi một người không có lợi ích gì trong kết quả.

Các con số độc lập đặt Grok Voice Think Fast 2.0 ở đâu

Thước đo rõ ràng nhất hiện nay đến từ Speech Agent Arena của Artificial Analysis, nơi chấm điểm các mô hình dựa trên đánh giá ưu tiên mù qua các cuộc trò chuyện thoại trực tiếp ở những tác vụ như đặt lịch hẹn nha khoa và gọi đồ ăn mang về. Tính đến ngày 18 tháng 9 năm 2026, Grok Voice Think Fast 2.0 High đứng thứ bảy trong hơn hai mươi mục với Elo 1.011 trên 552 mẫu — xếp sau Gemini 3.1 Flash Live Minimal của Google ở mức 1.096, Gemini 3.8 Live ở mức 1.083 và GPT-Live-1 ở mức 1.053, đồng thời bỏ xa người tiền nhiệm của chính nó, Grok Voice Think Fast 1.0, ở mức 908.

Cột bên cạnh Elo là cột thú vị hơn. Về tỷ lệ thành công tác vụ, Grok Voice Think Fast 2.0 ghi nhận 94.6%, con số cao nhất ở bất kỳ đâu trong top 20 hiển thị — cao hơn 93.2% của Gemini 3.8 Live, 91.5% của GPT-Realtime-2.1 High và 90.9% của GPT-Live-1. Đứng thứ bảy về mức độ ưa thích, thứ nhất về hoàn thành tác vụ, đây là một hồ sơ khác thường và khá đặc thù: người nghe không yêu thích giọng nói, nhưng nó hoàn thành công việc. Nếu sản phẩm của bạn làm việc thay vì trò chuyện, thì đó là cột dự báo kết quả của bạn, và đó là bằng chứng độc lập mạnh nhất mà mỗi mô hình trong hai mô hình này có.

A screenshot of the Artificial Analysis Speech Agent Arena Leaderboard captured 18 September 2026. The table reads, in rank order: Gemini 3.1 Flash Live Minimal Elo 1,096 with a 74.6% task success rate; Gemini 3.8 Live Elo 1,083 and 93.2%; Gemini 3.1 Flash Live High Elo 1,063 and 71.8%; GPT-Live-1 (Sol, low) Elo 1,053 and 90.9%; GPT-Live-1 (Astra, medium) Elo 1,048 and 87.4%; Cartesia Line Elo 1,027 and 77.5%; Grok Voice Think Fast 2.0 High Elo 1,011, 552 samples and 94.6%; GPT-Realtime-1.5 Elo 1,000 and 85.1%; and further down Grok Voice Think Fast 1.0 at Elo 908 with 80.7%.

Các số liệu xAI công bố khi ra mắt là một thước đo khác và nên được đọc riêng: 82,9% trên chỉ số chất lượng speech-to-speech của Artificial Analysis, vị trí thứ nhất trên benchmark agentic τ-Voice với 56,5%, 97,2% trên Big Bench Audio và 95,1% trên Full Duplex Bench. Đó là thứ hạng vào thời điểm mô hình được phát hành vào cuối tháng 7 năm 2026, và các bảng xếp hạng trong hạng mục này thay đổi hàng tháng — chính vì thế bảng arena ở trên, đọc vào hôm nay, có giá trị hơn các con số khi ra mắt.

A two-column comparison scoreboard titled 'Realtime-Venus vs Grok Voice Think Fast 2.0 — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no API', 'Price: none published', 'Modality: audio, video and text', 'Interruption response: 75% reported', 'Continuation under overlap: 97 / 88 / 86% reported', 'Independent scores: none'. The right column, labelled Grok Voice Think Fast 2.0, reads 'Availability: hosted API since 29 July 2026', 'Price: $0.08 per audio minute', 'Modality: audio and text', 'Interruption handling: 95.1% Full Duplex Bench at launch', 'Time to first audio: 0.70 s', 'Independent scores: Elo 1,011 and 94.6% task success on the Speech Agent Arena'. The footer reads 'Realtime-Venus figures from its technical report, unreproduced; Grok figures per Artificial Analysis and xAI documentation.'

Hóa đơn, và những phần của nó không nằm trên hóa đơn

Grok Voice Think Fast 2.0 có giá 0,08 đô la cho mỗi phút âm thanh, tương đương khoảng 4,80 đô la một giờ, cộng thêm 0,004 đô la cho mỗi tin nhắn đầu vào dạng văn bản. Đó là mức tăng 60% so với mức 0,05 đô la mỗi phút mà phiên bản 1.0 tính phí khi ra mắt, và xAI đã tự động chuyển bí danh luân chuyển grok-voice-latest sang 2.0 vào ngày 5 tháng 8 năm 2026, nên những nhóm muốn giữ mức giá cũ đã phải ghim một phiên bản cụ thể trước ngày đó. Cách tính phí theo phút cũng đồng nghĩa rằng những cải thiện về hiệu quả đều thuộc về nhà cung cấp: nếu mô hình trở nên giỏi hơn trong việc kết thúc cuộc gọi nhanh hơn, hóa đơn mỗi cuộc gọi của bạn sẽ giảm, nhưng chi phí mỗi phút thì không.

Realtime-Venus không có hóa đơn, vì nó không có dịch vụ. Thay vào đó, thứ nó có là một mức sàn phần cứng. Hai checkpoint 9B ở BF16 nặng khoảng mười tám gigabyte trọng số mỗi cái trước khi tính đến bộ nhớ kích hoạt, và tài liệu sản phẩm ghi rõ một vòng lặp truyền phát theo từng giây phải chạy liên tục. Một node GPU đủ khả năng đáp ứng điều đó có chi phí hàng tháng, và đó là chi phí cố định — bạn trả dù có ai gọi hay không. Với một sản phẩm có lưu lượng ổn định, mức đó rẻ hơn $4.80 một giờ. Với một sản phẩm có lưu lượng không liên tục, nó đắt hơn hẳn, và điểm giao nhau là câu hỏi tài chính duy nhất đáng quan tâm ở đây.

Trọng số, điều khiển và mỗi thứ cho phép bạn thay đổi điều gì

Đây là điểm mà hai mô hình hoàn toàn không còn so sánh được với nhau nữa.

• Tinh chỉnh — Realtime-Venus đi kèm trọng số. Bạn có thể tinh chỉnh, lượng tử hóa, chạy chúng trong môi trường cách ly mạng hoàn toàn và kiểm tra từng lớp. Grok Voice Think Fast 2.0 là một mô hình đóng được lưu trữ trên máy chủ; điều bạn có thể thay đổi là prompt, lựa chọn giọng nói và các công cụ bạn đăng ký.

• Giọng nói — Grok Voice Think Fast 2.0 cung cấp sẵn các giọng đọc dựng sẵn và hỗ trợ nhân bản giọng nói tùy chỉnh chỉ từ khoảng một phút giọng nói. Realtime-Venus cung cấp một giọng tham chiếu và một bộ giải mã token-sang-dạng sóng đi kèm, còn mọi thứ ngoài phạm vi đó là việc của bạn.

Phạm vi — Grok Voice Think Fast 2.0 hỗ trợ hơn 25 ngôn ngữ và mặc định truyền PCM16 ở 24 kHz với μ-law cho điện thoại, qua một phiên WebSocket tương thích với OpenAI Realtime. Khả năng tương thích đó là một lợi thế di trú thực sự: hầu hết mã thoại thời gian thực hiện có chỉ cần thay đổi URL cơ sở và khóa. Realtime-Venus có tài liệu bằng tiếng Anh và tiếng Trung.

• Video — Realtime-Venus-Omni nhận video dạng luồng và hình ảnh thông qua bộ mã hóa SigLIP2, đồng thời thực hiện nhận thức thị giác liên tục. Grok Voice Think Fast 2.0 chỉ xử lý âm thanh và văn bản; không có luồng camera.

• Ngữ cảnh dài — Realtime-Venus sở hữu ngữ cảnh 40.960 token cùng bộ nhớ video dài không cần huấn luyện, có thể kích hoạt trên cửa sổ bốn mươi phút. Grok Voice Think Fast 2.0 là một mô hình phiên, không có tính năng bộ nhớ tương đương nào được công bố.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Any-to-Any, Transformers, Safetensors, audio, video, speech, streaming and full-duplex tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, and a side panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

Nơi mỗi thứ bị hỏng

Những thất bại đáng để lên kế hoạch đối phó lại nằm ở phía ngược lại. Rủi ro phơi nhiễm của Grok Voice Think Fast 2.0 là tập trung nhà cung cấp và marketing không thể kiểm chứng: các kết quả A/B Starlink của xAI, các hệ số nhân độ chính xác phiên âm và cách định vị tốc độ của nó đều do công ty tự báo cáo mà không công bố dữ liệu cơ sở, và một mô hình tính theo phút thay đổi giá 60% giữa các phiên bản đã chứng minh rằng nó sẽ thay đổi giá. Hãy ghim phiên bản của bạn và tự chạy đánh giá trên âm thanh của chính bạn.

Điểm yếu dễ thấy của Realtime-Venus là chưa có ai từng chạy thử nó. Các benchmark của nó là tự công bố, khung kiểm thử của nó không được ghi chép tài liệu tương xứng với tầm quan trọng của nó, và độ trễ của nó khi triển khai thực tế thì vẫn chưa được biết — báo cáo mô tả nhịp tương tác một giây, mà đó là một tham số thiết kế, chứ không phải thời gian tới âm thanh đầu tiên được đo đạc. Một mô hình không có API và không thể tái lập thì không có thành tích nào để nói tới, chỉ có một bản đặc tả.

Có một con đường ở giữa đáng để nói thẳng, bởi vì đó chính là điều mà hầu hết các đội ngũ sẽ thực sự làm. Nếu bạn đang xây dựng một hệ thống dựa trên uỷ thác — tự chọn front end của riêng mình, giao phần việc tốn kém cho một mô hình văn bản — thì front end và nhánh suy luận không nhất thiết phải đến từ cùng một nơi. OrcaRouter không cung cấp Realtime-Venus lẫn Grok Voice Think Fast 2.0; cả hai lớp thoại đều nằm ngoài phạm vi dịch vụ của chúng tôi, và chúng tôi nói rõ điều đó thay vì ngụ ý ngược lại. Nhánh được uỷ thác lại là chuyện khác. Gần 200 mô hình văn bản nằm sau một khoá duy nhất với giá niêm yết của nhà cung cấp, không phụ thu, với tự động chuyển đổi dự phòng để sự cố ngừng hoạt động ở phía thượng nguồn không làm rớt một cuộc gọi đang diễn ra, một DSL định tuyến để kết hợp nhiều mô hình vào một cuộc gọi, và tính năng hợp nhất mô hình cho những quyết định xứng đáng có nhiều hơn một ý kiến. Đó là nửa phần của một tác nhân thoại được hưởng lợi từ việc có thể hoán đổi, và cũng chính là nửa mà bạn có thể thay đổi mà không cần chạm vào mô hình đang giữ cuộc hội thoại.

Chọn cái nào?

Chọn Grok Voice Think Fast 2.0 trong quý này. Nó đã có sẵn, đã được benchmark độc lập, đứng đầu trong bài đánh giá agentic dự đoán liệu tác nhân của bạn có thể làm được điều gì đó hữu ích hay không, và 0,70 giây để có âm thanh đầu tiên là một con số mà bạn có thể xây dựng trải nghiệm người dùng xoay quanh. Hãy dự trù ngân sách cho mức tăng giá 60% so với 1.0 và ghim phiên bản mô hình của bạn.

Chỉ chọn Realtime-Venus nếu ràng buộc là quyền sở hữu. Nếu triển khai của bạn không thể gọi API bên ngoài, nếu bạn cần tinh chỉnh front end hội thoại, hoặc nếu bạn cần camera — ba trường hợp đó chính là toàn bộ lý do, và chúng là những lý do mạnh mẽ khi áp dụng.

Thứ không nên quyết định điều đó là bảng benchmark, bởi vì hai phía của nó được tạo ra bởi những người khác nhau trong những điều kiện khác nhau. Những con số của Grok Voice Think Fast 2.0 được đo bởi người khác. Còn của Realtime-Venus thì không. Cho đến khi điều đó thay đổi, phép so sánh thực sự hiện có là giữa một sản phẩm và một bài báo.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày