
Gemini 3.8 Live vs GPT-Live-1: Song công toàn phần so với mô hình vừa nói vừa suy nghĩ
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Trong khoảng hai tháng, cuộc tranh cãi đã được định đoạt bằng kiến trúc. GPT-Live-1thực sự là song công toàn phần — nó vừa nghe vừa nói, phát ra những tín hiệu đáp lời như "mhmm" và "got it", đồng thời quyết định vài lần mỗi giây xem nên nói hay nhường lượt. Gemini 3.8 Live, được công bố ngày 15 tháng 9 năm 2026, là một mô hình theo lượt. Theo cách hiểu cũ, điều đó khiến việc so sánh trở nên dễ dàng, nhưng giờ đây đó lại là cách đọc sai lầm.
Điều đã thay đổi không phải là việc Google bắt kịp full-duplex. Mà là việc Google đã tung ra thứ mà người ta đang dùng full-duplex để bù đắp: một mô hình giọng nói có thể duy trì cuộc trò chuyện trong khi một tác vụ nhiều bước chạy ở chế độ nền, và một biến thể thứ hai suy luận thành tiếng trong khi nó làm việc. Sự khác biệt về kiến trúc là có thật. Chỉ là nó không còn là trục quyết định việc mua nữa.
Hai cách để giữ cho cuộc trò chuyện luôn tiếp diễn
Canh bạc song công toàn phần nằm ở chỗ chất lượng hội thoại chính là sản phẩm. GPT-Live-1 xử lý âm thanh đầu vào và đầu ra một cách liên tục và đồng bộ bên trong một mô hình duy nhất, thay vì nối tiếp chuyển giọng nói thành văn bản vào một mô hình ngôn ngữ rồi đến chuyển văn bản thành giọng nói. Điều đó loại bỏ sự mất mát thông tin giữa các giai đoạn, và nó tạo ra hành vi mà mọi người thực sự nhận thấy: bạn có thể ngắt lời giữa câu trả lời và nó thích ứng; nó không nhầm một khoảng dừng hay tiếng ồn nền là kết thúc lượt nói của bạn; nó vẫn im lặng cho đến khi được gọi.
Canh bạc theo lượt mà Gemini 3.8 Live đưa ra là cuộc trò chuyện chỉ là giàn giáo cho công việc. Các tính năng của nó nhằm giữ cho phiên làm việc hiệu quả thay vì giữ nhịp điệu tự nhiên: xử lý đầu vào hình ảnh gần như theo thời gian thực, tự động chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay giữa cuộc trò chuyện, và thực thi công cụ và API chạy nền, vốn xác nhận yêu cầu và tiếp tục nói trong khi cuộc gọi hoàn tất.
Cả hai mô hình đều không chịu cúp máy khi đang suy nghĩ. Chúng chỉ từ chối theo cách khác nhau thôi. GPT-Live-1 làm điều đó bằng cách không bao giờ dừng luồng âm thanh. Google thì làm điều đó bằng cách nói đè lên phần việc đang xử lý.

Chỉ mục thực sự nói lên điều gì
Artificial Analysis duy trì một Speech to Speech Index — một chỉ số tổng hợp có trọng số bao gồm suy luận trong giọng nói, hiệu suất tác tử, mức độ ưu tiên tại đấu trường và tỷ lệ hoàn thành tác vụ. Hãy đọc kỹ bảng được ghi lại vào ngày 16 tháng 9 năm 2026, bởi vì tiêu đề đã che giấu cấu trúc:
• Gemini 3.8 Live Extended Thinking — 82.6 (đầu tiên)
• GPT-Live-1 (backend Astra, mức nỗ lực trung bình) — 81.5
• Grok Voice Think Fast 2.0 High — 81.3
• GPT-Live-1 (backend Sol, nỗ lực thấp) — 80.1
• Gemini 3.8 Live — 76.0
• GPT-Realtime-2.1 High — 73.9
• Gemini 3.1 Flash Live High — 71.5
Ba điều rút ra từ thứ tự đó. Thứ nhất, Google giữ vị trí dẫn đầu, nhưng giữ nó với biến thể đắt tiền, không phải phiên bản mà hầu hết mọi người sẽ triển khai. Thứ hai, GPT-Live-1 xuất hiện hai lần, vì Artificial Analysis đánh giá toàn bộ hệ thống chứ không chỉ phần front-end giọng nói — và khoảng cách 1,4 điểm giữa hai cấu hình của nó lớn gấp bảy lần khoảng cách 0,2 điểm giữa vị trí thứ nhất và thứ hai. Thứ ba, mô hình trong tiêu đề của cặp so tài này, Gemini 3.8 Live, đứng thứ năm, dưới cả hai cấu hình GPT-Live-1.
Nếu bạn đang so sánh tương đương — gói tiêu chuẩn với gói tiêu chuẩn — thì GPT-Live-1 thắng cuộc đối đầu này trên chỉ số tổng hợp, và khoảng cách không hề nhỏ. Con số 82.6 thuộc về Gemini 3.8 Live Extended Thinking, một sản phẩm khác ở mức giá khác với lộ trình triển khai khác.

Ở đâu GPT-Live-1 vẫn dẫn đầu
Full-duplex không phải là một sự khác biệt mang tính tiếp thị, và sự phân tách trong benchmark cho thấy nơi nó chuyển hóa thành lợi thế thực sự:
• Hiệu năng agentic — GPT-Live-1 dẫn đầu một cách dứt khoát trên τ-Voice với 67,9% so với 56,5% của Grok. Google chưa công bố con số τ-Voice tương đương cho Gemini 3.8 Live, mà chỉ có 68,6% cho biến thể Extended Thinking.
• Động lực hội thoại — luân phiên lượt nói song công vẫn là thước đo chuẩn mực về độ tự nhiên, và các mô hình theo lượt từ trước đến nay vẫn tụt lại phía sau ở điểm này.
• Độ sâu ủy quyền — GPT-Live-1 chuyển các truy vấn khó cho một mô hình văn bản tiên tiến, với cả GPT-5.5 và GPT-6 Astra đều được tài liệu hóa là backend, và cung cấp các bộ chọn nỗ lực suy luận.
• Tìm nguồn — bản chép lời thoại từ ChatGPT có kèm các liên kết trích dẫn, điều này vẫn ít phổ biến trong các tương tác thoại nói chung.
Điểm đối trọng là GPT-Live-1 kém hơn ở khả năng suy luận giọng nói thô: 90,1% trên Big Bench Audio so với 97,2% của Grok. Còn con số độ trễ được nhấn mạnh là 0,798 giây trên Full Duplex Bench lại là một phép đo khác với thời gian tới âm thanh đầu tiên của API, vốn dao động từ 1,24 đến 1,34 giây.
Những điểm Gemini 3.8 Live vượt trội
Lợi thế của Google ít nằm ở khả năng trò chuyện mà nhiều hơn ở những gì phiên có thể làm:
• Hình ảnh, hiện tại — Gemini đã hỗ trợ đầu vào từ camera và chia sẻ màn hình từ lâu. GPT-Live-1 ra mắt mà không có video hay chia sẻ màn hình, OpenAI cho biết những tính năng này đang được phát triển và chỉ ra Advanced Voice Mode cũ hơn như một giải pháp tạm thời. Gemini 3.8 Live bổ sung thêm khả năng xử lý đầu vào hình ảnh gần như theo thời gian thực.
• Phạm vi ngôn ngữ — 97 ngôn ngữ được hỗ trợ với khả năng tự động chuyển đổi ngay giữa cuộc trò chuyện, so với một phạm vi hẹp hơn nhiều ở phía OpenAI.
• Chi phí — mức giá được công bố là 0,005 USD mỗi phút âm thanh đầu vào và 0,018 USD mỗi phút âm thanh đầu ra. GPT-Live-1 được tính 0,05 USD mỗi phút thoại chỉ riêng cho phần front-end, với chi phí đo lường tính gộp vào khoảng 4,47–5,83 USD mỗi giờ khi đã tính cả token phía backend.
• Một tầng thứ hai suy luận thành tiếng — Gemini 3.8 Live Extended Thinking thuật lại tiến trình bằng những tín hiệu như "Để tôi kiểm tra nhé…", một cách giải quyết vấn đề im lặng khác với full-duplex.
So sánh chi phí mới là điều quan trọng
Mức giá niêm yết ban đầu trông chẳng khác nào một trận thắng áp đảo — 0,018 đô la so với 0,05 đô la mỗi phút — và những con số tính theo giờ còn chênh lệch rõ rệt hơn nữa. Biểu đồ chi phí mỗi giờ cho âm thanh đầu vào của Artificial Analysis đặt Gemini 3.8 Live ở mức 1,50 đô la mỗi giờ, so với 4,14 đô la cho GPT-Realtime-2 High và 10,75 đô la cho GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 ở mức 4,80 đô la.
Vấn đề là không con số nào trong hai con số đó là hóa đơn thật. Mức $0.05 mỗi phút của GPT-Live-1 chỉ bao gồm phần giao diện giọng nói; mô hình văn bản phía sau thực hiện suy luận thực sự được tính phí riêng, đó là cách một mức giá tiêu đề $0.05 trở thành $4.47–$5.83 một giờ khi tính tất cả. Gemini 3.8 Live có cùng cấu trúc như vậy — việc thực thi công cụ chạy nền là công việc của mô hình văn bản — và Google chưa công bố chi phí cho việc đó là bao nhiêu.
Vậy cách đọc trung thực là Gemini 3.8 Live rẻ hơn ngay từ đầu với khoảng cách lớn, còn so sánh tổng thể thì cả hai đều chưa rõ cho đến khi bạn đo lường khối lượng công việc của riêng mình. Đó không phải là một cách né tránh; đó là tình trạng thực tế của thông tin.
Lớp mà cả hai đều ủy thác cho
Đây là sự thật mang tính cấu trúc khiến cuộc so kè này không hẳn là một quyết định khóa cứng như vẻ ngoài của nó. Cả hai mô hình đều ủy thác. GPT-Live-1 theo thiết kế chuyển các truy vấn khó cho một mô hình văn bản ở backend, còn việc thực thi công cụ chạy nền ở phía Gemini thì quy về những lệnh gọi mô hình thông thường. Trong cả hai trường hợp, giao diện thoại phía trước chỉ là một lớp mỏng nằm trên một mô hình văn bản đảm nhiệm việc suy luận — và chính lớp văn bản đó là nơi mức biến động chi phí của bạn nằm, đồng thời là nơi việc chuyển đổi trở nên rẻ.
OrcaRouter mang 190 mô hình đằng sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phí, nên khi nhà cung cấp cắt giảm giá, phía chúng tôi nhận được ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Với một ngăn xếp thoại, hai đặc tính quan trọng là đích ủy quyền có thể được hoán đổi ngay trên lưu lượng trực tiếp mà không cần chạm vào tích hợp thoại, và cơ chế chuyển đổi dự phòng tự động giữ cho cuộc gọi không bị ngắt khi một backend gặp lỗi hoặc hết thời gian chờ. Một điểm cần làm rõ, vì rất dễ khiến người ta hiểu theo hướng ngược lại: chúng tôi không tự vận hành các endpoint thoại Gemini 3.8 Live hay GPT-Live-1 — chúng đến từ API của chính các nhà cung cấp. Các mô hình văn bản mà chúng giao việc cho nói chung đều nằm trên router.

Cách chọn
Hãy chọn GPT-Live-1 nếu chất lượng hội thoại chính là sản phẩm — khả năng xử lý ngắt lời tự nhiên, các tín hiệu hưởng ứng (backchannel), và cảm giác rằng bạn đang trò chuyện với một thứ gì đó thay vì vận hành nó — và nếu bạn có thể gánh được toàn bộ chi phí trọn gói, vốn cao hơn đáng kể so với mức giá niêm yết gợi ý. Lưu ý rằng API của nó chỉ mới có mặt vào tháng 9 năm 2026, nên các công cụ bên thứ ba xoay quanh nó vẫn còn non trẻ.
Hãy chọn Gemini 3.8 Livenếu bạn cần khả năng thị giác ngay bây giờ, nếu bạn cần nhiều hơn vài chục ngôn ngữ, hoặc nếu yếu tố kinh tế theo phút chi phối mô hình của bạn. Hãy chấp nhận rằng bạn đang mua gói tiêu chuẩn, gói này xếp thứ năm trên chỉ số tổng hợp chứ không phải thứ nhất, và rằng con số 82.6 mà ai cũng sẽ trích dẫn thuộc về biến thể Extended Thinking.
Hãy chọn Gemini 3.8 Live Extended Thinkingnếu khả năng suy luận là điểm mấu chốt và bạn muốn mô hình đang dẫn đầu bảng xếp hạng hiện tại — nhưng hãy kiểm tra lộ trình triển khai của nó trước, vì đường phân phối của nó qua Gemini Live, Docs, Gmail và Keep rộng hơn so với mô hình tiêu chuẩn, và tình trạng khả dụng cho doanh nghiệp của nó vẫn đang ở giai đoạn xem trước riêng tư.
Điều cần chú ý trong quý tới là liệu chế độ song công toàn phần có còn là một hào bảo vệ hay không. Các mô hình theo lượt đang thu hẹp khoảng cách hội thoại bằng một con đường khác — giữ luồng âm thanh luôn bận rộn với phần tường thuật trong khi công việc diễn ra — và nếu điều đó vẫn trụ vững dưới lưu lượng thực tế, thì sự khác biệt về kiến trúc đã định hình nên hạng mục này suốt một năm sẽ không còn là điều mà người mua hỏi đến nữa.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
