Thẻ tiêu đề hero cho Gemini 3.8 Live so với GPT-Live-1 với dòng nhãn 'OrcaRouter · ra-đa mô hình — đối đầu trực tiếp' và phụ đề 'Song công toàn phần so với theo lượt - lập luận kiến trúc, đọc lại.' Hai thẻ ghi 'Gemini 3.8 Live — theo lượt, thị giác ngay hôm nay, 97 ngôn ngữ, phút rẻ hơn' và 'GPT-Live-1 — song công toàn phần, tín hiệu hồi đáp, chuyển giao cho backend tiên phong', cùng các chip cho Index 76.0 so với 81.5, $0.018 so với $0.05 mỗi phút, và video sắp ra mắt trên OpenAI. Logo OrcaRouter được ghép vào góc dưới bên phải.
Guides & Insights

Gemini 3.8 Live vs GPT-Live-1: Song công toàn phần so với mô hình vừa nói vừa suy nghĩ

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trong khoảng hai tháng, cuộc tranh cãi đã được định đoạt bằng kiến trúc. GPT-Live-1thực sự là song công toàn phần — nó vừa nghe vừa nói, phát ra những tín hiệu đáp lời như "mhmm" và "got it", đồng thời quyết định vài lần mỗi giây xem nên nói hay nhường lượt. Gemini 3.8 Live, được công bố ngày 15 tháng 9 năm 2026, là một mô hình theo lượt. Theo cách hiểu cũ, điều đó khiến việc so sánh trở nên dễ dàng, nhưng giờ đây đó lại là cách đọc sai lầm.

Điều đã thay đổi không phải là việc Google bắt kịp full-duplex. Mà là việc Google đã tung ra thứ mà người ta đang dùng full-duplex để bù đắp: một mô hình giọng nói có thể duy trì cuộc trò chuyện trong khi một tác vụ nhiều bước chạy ở chế độ nền, và một biến thể thứ hai suy luận thành tiếng trong khi nó làm việc. Sự khác biệt về kiến trúc là có thật. Chỉ là nó không còn là trục quyết định việc mua nữa.

Hai cách để giữ cho cuộc trò chuyện luôn tiếp diễn

Canh bạc song công toàn phần nằm ở chỗ chất lượng hội thoại chính là sản phẩm. GPT-Live-1 xử lý âm thanh đầu vào và đầu ra một cách liên tục và đồng bộ bên trong một mô hình duy nhất, thay vì nối tiếp chuyển giọng nói thành văn bản vào một mô hình ngôn ngữ rồi đến chuyển văn bản thành giọng nói. Điều đó loại bỏ sự mất mát thông tin giữa các giai đoạn, và nó tạo ra hành vi mà mọi người thực sự nhận thấy: bạn có thể ngắt lời giữa câu trả lời và nó thích ứng; nó không nhầm một khoảng dừng hay tiếng ồn nền là kết thúc lượt nói của bạn; nó vẫn im lặng cho đến khi được gọi.

Canh bạc theo lượt mà Gemini 3.8 Live đưa ra là cuộc trò chuyện chỉ là giàn giáo cho công việc. Các tính năng của nó nhằm giữ cho phiên làm việc hiệu quả thay vì giữ nhịp điệu tự nhiên: xử lý đầu vào hình ảnh gần như theo thời gian thực, tự động chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay giữa cuộc trò chuyện, và thực thi công cụ và API chạy nền, vốn xác nhận yêu cầu và tiếp tục nói trong khi cuộc gọi hoàn tất.

Cả hai mô hình đều không chịu cúp máy khi đang suy nghĩ. Chúng chỉ từ chối theo cách khác nhau thôi. GPT-Live-1 làm điều đó bằng cách không bao giờ dừng luồng âm thanh. Google thì làm điều đó bằng cách nói đè lên phần việc đang xử lý.

A two-column scoreboard comparing Gemini 3.8 Live and GPT-Live-1. Index score 76.0 vs 81.5; architecture turn-based vs full-duplex; video and screen available today vs not at launch; agentic tau-Voice not published vs 67.9%; languages 97 vs a narrower set; voice price $0.005 in and $0.018 out per minute vs $0.05 per minute plus backend tokens. Footer reads 'Index figures per Artificial Analysis, Sep 16 2026; GPT-Live-1 all-in measured at $4.47-$5.83 per hour.' The OrcaRouter logo is composited in the bottom-right corner.

Chỉ mục thực sự nói lên điều gì

Artificial Analysis duy trì một Speech to Speech Index — một chỉ số tổng hợp có trọng số bao gồm suy luận trong giọng nói, hiệu suất tác tử, mức độ ưu tiên tại đấu trường và tỷ lệ hoàn thành tác vụ. Hãy đọc kỹ bảng được ghi lại vào ngày 16 tháng 9 năm 2026, bởi vì tiêu đề đã che giấu cấu trúc:

Gemini 3.8 Live Extended Thinking — 82.6 (đầu tiên)

• GPT-Live-1 (backend Astra, mức nỗ lực trung bình) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, nỗ lực thấp) — 80.1

Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Ba điều rút ra từ thứ tự đó. Thứ nhất, Google giữ vị trí dẫn đầu, nhưng giữ nó với biến thể đắt tiền, không phải phiên bản mà hầu hết mọi người sẽ triển khai. Thứ hai, GPT-Live-1 xuất hiện hai lần, vì Artificial Analysis đánh giá toàn bộ hệ thống chứ không chỉ phần front-end giọng nói — và khoảng cách 1,4 điểm giữa hai cấu hình của nó lớn gấp bảy lần khoảng cách 0,2 điểm giữa vị trí thứ nhất và thứ hai. Thứ ba, mô hình trong tiêu đề của cặp so tài này, Gemini 3.8 Live, đứng thứ năm, dưới cả hai cấu hình GPT-Live-1.

Nếu bạn đang so sánh tương đương — gói tiêu chuẩn với gói tiêu chuẩn — thì GPT-Live-1 thắng cuộc đối đầu này trên chỉ số tổng hợp, và khoảng cách không hề nhỏ. Con số 82.6 thuộc về Gemini 3.8 Live Extended Thinking, một sản phẩm khác ở mức giá khác với lộ trình triển khai khác.

Screenshot of the Artificial Analysis Speech to Speech leaderboard page, captured September 16, 2026. The AA-Speech to Speech Index bar chart shows Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 (Astra) at 81.5, Grok Voice Think Fast 2.0 at 81.3, GPT-Live-1 (Sol) at 80.1 and Gemini 3.8 Live at 76.0, alongside speed and cost-per-hour-of-input-audio panels.

Ở đâu GPT-Live-1 vẫn dẫn đầu

Full-duplex không phải là một sự khác biệt mang tính tiếp thị, và sự phân tách trong benchmark cho thấy nơi nó chuyển hóa thành lợi thế thực sự:

Hiệu năng agentic — GPT-Live-1 dẫn đầu một cách dứt khoát trên τ-Voice với 67,9% so với 56,5% của Grok. Google chưa công bố con số τ-Voice tương đương cho Gemini 3.8 Live, mà chỉ có 68,6% cho biến thể Extended Thinking.

Động lực hội thoại — luân phiên lượt nói song công vẫn là thước đo chuẩn mực về độ tự nhiên, và các mô hình theo lượt từ trước đến nay vẫn tụt lại phía sau ở điểm này.

Độ sâu ủy quyền — GPT-Live-1 chuyển các truy vấn khó cho một mô hình văn bản tiên tiến, với cả GPT-5.5GPT-6 Astra đều được tài liệu hóa là backend, và cung cấp các bộ chọn nỗ lực suy luận.

Tìm nguồn — bản chép lời thoại từ ChatGPT có kèm các liên kết trích dẫn, điều này vẫn ít phổ biến trong các tương tác thoại nói chung.

Điểm đối trọng là GPT-Live-1 kém hơn ở khả năng suy luận giọng nói thô: 90,1% trên Big Bench Audio so với 97,2% của Grok. Còn con số độ trễ được nhấn mạnh là 0,798 giây trên Full Duplex Bench lại là một phép đo khác với thời gian tới âm thanh đầu tiên của API, vốn dao động từ 1,24 đến 1,34 giây.

Những điểm Gemini 3.8 Live vượt trội

Lợi thế của Google ít nằm ở khả năng trò chuyện mà nhiều hơn ở những gì phiên có thể làm:

Hình ảnh, hiện tại — Gemini đã hỗ trợ đầu vào từ camera và chia sẻ màn hình từ lâu. GPT-Live-1 ra mắt mà không có video hay chia sẻ màn hình, OpenAI cho biết những tính năng này đang được phát triển và chỉ ra Advanced Voice Mode cũ hơn như một giải pháp tạm thời. Gemini 3.8 Live bổ sung thêm khả năng xử lý đầu vào hình ảnh gần như theo thời gian thực.

Phạm vi ngôn ngữ — 97 ngôn ngữ được hỗ trợ với khả năng tự động chuyển đổi ngay giữa cuộc trò chuyện, so với một phạm vi hẹp hơn nhiều ở phía OpenAI.

Chi phí — mức giá được công bố là 0,005 USD mỗi phút âm thanh đầu vào và 0,018 USD mỗi phút âm thanh đầu ra. GPT-Live-1 được tính 0,05 USD mỗi phút thoại chỉ riêng cho phần front-end, với chi phí đo lường tính gộp vào khoảng 4,47–5,83 USD mỗi giờ khi đã tính cả token phía backend.

Một tầng thứ hai suy luận thành tiếng — Gemini 3.8 Live Extended Thinking thuật lại tiến trình bằng những tín hiệu như "Để tôi kiểm tra nhé…", một cách giải quyết vấn đề im lặng khác với full-duplex.

So sánh chi phí mới là điều quan trọng

Mức giá niêm yết ban đầu trông chẳng khác nào một trận thắng áp đảo — 0,018 đô la so với 0,05 đô la mỗi phút — và những con số tính theo giờ còn chênh lệch rõ rệt hơn nữa. Biểu đồ chi phí mỗi giờ cho âm thanh đầu vào của Artificial Analysis đặt Gemini 3.8 Live ở mức 1,50 đô la mỗi giờ, so với 4,14 đô la cho GPT-Realtime-2 High và 10,75 đô la cho GPT-Realtime-2.1 High. Grok Voice Think Fast 2.0 ở mức 4,80 đô la.

Vấn đề là không con số nào trong hai con số đó là hóa đơn thật. Mức $0.05 mỗi phút của GPT-Live-1 chỉ bao gồm phần giao diện giọng nói; mô hình văn bản phía sau thực hiện suy luận thực sự được tính phí riêng, đó là cách một mức giá tiêu đề $0.05 trở thành $4.47–$5.83 một giờ khi tính tất cả. Gemini 3.8 Live có cùng cấu trúc như vậy — việc thực thi công cụ chạy nền là công việc của mô hình văn bản — và Google chưa công bố chi phí cho việc đó là bao nhiêu.

Vậy cách đọc trung thực là Gemini 3.8 Live rẻ hơn ngay từ đầu với khoảng cách lớn, còn so sánh tổng thể thì cả hai đều chưa rõ cho đến khi bạn đo lường khối lượng công việc của riêng mình. Đó không phải là một cách né tránh; đó là tình trạng thực tế của thông tin.

Lớp mà cả hai đều ủy thác cho

Đây là sự thật mang tính cấu trúc khiến cuộc so kè này không hẳn là một quyết định khóa cứng như vẻ ngoài của nó. Cả hai mô hình đều ủy thác. GPT-Live-1 theo thiết kế chuyển các truy vấn khó cho một mô hình văn bản ở backend, còn việc thực thi công cụ chạy nền ở phía Gemini thì quy về những lệnh gọi mô hình thông thường. Trong cả hai trường hợp, giao diện thoại phía trước chỉ là một lớp mỏng nằm trên một mô hình văn bản đảm nhiệm việc suy luận — và chính lớp văn bản đó là nơi mức biến động chi phí của bạn nằm, đồng thời là nơi việc chuyển đổi trở nên rẻ.

OrcaRouter mang 190 mô hình đằng sau một khóa duy nhất với giá niêm yết của nhà cung cấp, không cộng thêm phí, nên khi nhà cung cấp cắt giảm giá, phía chúng tôi nhận được ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Với một ngăn xếp thoại, hai đặc tính quan trọng là đích ủy quyền có thể được hoán đổi ngay trên lưu lượng trực tiếp mà không cần chạm vào tích hợp thoại, và cơ chế chuyển đổi dự phòng tự động giữ cho cuộc gọi không bị ngắt khi một backend gặp lỗi hoặc hết thời gian chờ. Một điểm cần làm rõ, vì rất dễ khiến người ta hiểu theo hướng ngược lại: chúng tôi không tự vận hành các endpoint thoại Gemini 3.8 Live hay GPT-Live-1 — chúng đến từ API của chính các nhà cung cấp. Các mô hình văn bản mà chúng giao việc cho nói chung đều nằm trên router.

Screenshot of the OrcaRouter model page for google/gemini-3.8-flash, showing the 1M-token context window, 65K max output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and p50 time to first token of 3.35 seconds.

Cách chọn

Hãy chọn GPT-Live-1 nếu chất lượng hội thoại chính là sản phẩm — khả năng xử lý ngắt lời tự nhiên, các tín hiệu hưởng ứng (backchannel), và cảm giác rằng bạn đang trò chuyện với một thứ gì đó thay vì vận hành nó — và nếu bạn có thể gánh được toàn bộ chi phí trọn gói, vốn cao hơn đáng kể so với mức giá niêm yết gợi ý. Lưu ý rằng API của nó chỉ mới có mặt vào tháng 9 năm 2026, nên các công cụ bên thứ ba xoay quanh nó vẫn còn non trẻ.

Hãy chọn Gemini 3.8 Livenếu bạn cần khả năng thị giác ngay bây giờ, nếu bạn cần nhiều hơn vài chục ngôn ngữ, hoặc nếu yếu tố kinh tế theo phút chi phối mô hình của bạn. Hãy chấp nhận rằng bạn đang mua gói tiêu chuẩn, gói này xếp thứ năm trên chỉ số tổng hợp chứ không phải thứ nhất, và rằng con số 82.6 mà ai cũng sẽ trích dẫn thuộc về biến thể Extended Thinking.

Hãy chọn Gemini 3.8 Live Extended Thinkingnếu khả năng suy luận là điểm mấu chốt và bạn muốn mô hình đang dẫn đầu bảng xếp hạng hiện tại — nhưng hãy kiểm tra lộ trình triển khai của nó trước, vì đường phân phối của nó qua Gemini Live, Docs, Gmail và Keep rộng hơn so với mô hình tiêu chuẩn, và tình trạng khả dụng cho doanh nghiệp của nó vẫn đang ở giai đoạn xem trước riêng tư.

Điều cần chú ý trong quý tới là liệu chế độ song công toàn phần có còn là một hào bảo vệ hay không. Các mô hình theo lượt đang thu hẹp khoảng cách hội thoại bằng một con đường khác — giữ luồng âm thanh luôn bận rộn với phần tường thuật trong khi công việc diễn ra — và nếu điều đó vẫn trụ vững dưới lưu lượng thực tế, thì sự khác biệt về kiến trúc đã định hình nên hạng mục này suốt một năm sẽ không còn là điều mà người mua hỏi đến nữa.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày