Thẻ tiêu đề chính cho Gemini 3.8 Live Extended Thinking so với GPT-Live-1, hiển thị hai mô hình giọng nói cách nhau 1,1 điểm chỉ số với các mô hình tính phí khác nhau.
Guides & Insights

Gemini 3.8 Live Extended Thinking so với GPT-Live-1: Hòa 1,1 điểm và hai hóa đơn khác nhau

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Trên điểm tổng hợp, đây là một thế hòa. Gemini 3.8 Live Extended Thinking đạt 82,6 trên Chỉ số Speech to Speech của Artificial Analysis; GPT-Live-1, trong backend Astra của nó ở mức nỗ lực suy luận trung bình, đạt 81,5. Ở thành phần agentic bên dưới — hoàn thành tác vụ τ-Voice — khoảng cách là 0,7 điểm, 68,6% so với 67,9%. Ở thành phần suy luận, khoảng cách rộng hơn và đi theo chiều ngược lại: 97,7% trên Big Bench Audio đối với mô hình Gemini, 90,1% đối với GPT-Live-1. Không có gì trong khoảng chênh lệch đó trụ nổi qua lần chạy benchmark thứ hai, và không điều nào trong đó là thứ bạn nên dựa vào để quyết định.

Điều phân biệt hai sản phẩm này không phải là chất lượng. Mà là chúng bất đồng về việc một voice agent là gì, ai là người suy nghĩ, và — phần đụng đến ngân sách trước tiên — phiên chạy được tính tiền như thế nào. Gemini 3.8 Live Extended Thinking tính tiền theo audio token và suy luận ngay trong cùng mô hình đảm nhiệm việc nói. GPT-Live-1 tính một mức giá cố định theo đồng hồ phiên, bất kể có ai đang nói hay không, và giao phần suy nghĩ thực sự cho một mô hình văn bản riêng mà bạn tự chọn và tự trả tiền. Đó là hai sản phẩm khác nhau cùng khoác một điểm benchmark, và cái nào phù hợp lại phụ thuộc vào một câu hỏi mà bảng xếp hạng chẳng bao giờ hỏi: một cuộc gọi trung bình trên đường dây của bạn trông như thế nào?

Mối ràng buộc 1,1 điểm, và nơi nó thực sự đứt gãy

Hãy bắt đầu với những con số, bởi vì độ mỏng của tiêu đề chính là điểm mấu chốt:

Chỉ số Speech to Speech — Gemini 3.8 Live Extended Thinking (Cao) 82.6 so với GPT-Live-1 (backend Astra, mức nỗ lực trung bình) 81.5

Hiệu suất agentic (hoàn thành tác vụ τ-Voice) — 68,6% so với 67,9%, với GPT-Live-1 đạt 59,3% khi chạy trên backend Sol ở chế độ nỗ lực thấp

Suy luận giọng nói (Big Bench Audio) — 97,7% so với 90,1%, thành phần duy nhất mà khoảng cách không phải là nhiễu

Quy trình ngân hàng phức tạp (Sierra τ³-Banking, do nhà cung cấp báo cáo) — 35,1% so với 32,0%

Thời gian đến âm thanh đầu tiên — 1,35 giây so với 1,24–1,34 giây qua API

Chi phí đo được mỗi giờ — 3,50 USD so với 5,83 USD cho cấu hình Astra, cả hai đều dựa trên phép đo âm thanh đầu vào của Artificial Analysis

Cách hiểu trung thực là hai mô hình không thể phân biệt trên điểm tổng hợp, có thể phân biệt ở suy luận lời nói, nơi mô hình Gemini dẫn trước gần tám điểm, và có thể phân biệt về chi phí, nơi nó dẫn trước khoảng 40%. Chỗ GPT-Live-1 vượt lên là ở những phần của trải nghiệm mà một benchmark khó chấm điểm: nó thực sự song công toàn phần, vừa nghe vừa nói, phát ra các tín hiệu đáp lời, quyết định nhiều lần mỗi giây xem nên nói hay nhường lượt. Gemini 3.8 Live Extended Thinking hoạt động theo lượt. Nó giải quyết cùng vấn đề nền tảng — người gọi bị bỏ mặc trong im lặng trong khi tác nhân làm việc — bằng cách tường thuật thay vào đó, vừa suy luận vừa nói cùng lúc với những tín hiệu như “Để tôi kiểm tra nhé…” trong khi tác vụ chạy.

Cả hai cách tiếp cận đều giữ cho dòng này tồn tại. Chúng mang lại cảm giác khác nhau. Chỉ một trong số chúng xuất hiện trên một chỉ mục.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and GPT-Live-1 across six dimensions: Speech to Speech Index 82.6 vs 81.5, agentic performance on tau-Voice 68.6 percent vs 67.9 percent, speech reasoning on Big Bench Audio 97.7 percent vs 90.1 percent, billing model per audio token vs per session minute, reasoning location in-model vs delegated to a backend text model, and cost per hour $3.50 vs $5.83.

Hai mô hình tính phí và vì sao bảng giá gây hiểu nhầm

Đây là phần quyết định hầu hết các lần triển khai, và cũng chính là phần mà độ bao phủ bỏ qua.

Gemini 3.8 Live Extended Thinking được tính phí theo cách một mô hình token được tính phí. Thông qua Live API, mức giá được công bố là 3,00 USD cho mỗi triệu token đầu vào âm thanh — khoảng 0,005 USD mỗi phút âm thanh đầu vào — và 12,00 USD cho mỗi triệu token đầu ra âm thanh, khoảng 0,018 USD mỗi phút, với các token suy luận được tính trong phần đầu ra đó. Bạn trả tiền cho âm thanh được truyền đi. Người gọi tạm dừng, suy nghĩ hoặc bị giữ máy sẽ không tốn của bạn đồng nào trong lúc họ im lặng.

GPT-Live-1 được tính phí giống như cách tính phí một đường dây điện thoại. Đó là mức phí cố định $0.05 mỗi phút thời gian phiên, tính theo từng giây, bất kể ai đang nói hay có ai đang nói hay không. Backend suy luận không được bao gồm: mô hình văn bản đảm nhiệm việc suy nghĩ, cùng mọi công cụ mà nó gọi, được tính phí riêng cộng thêm. Đó là cách một mức giá quảng cáo $0.05 trở thành con số tổng thể khoảng $4.47 mỗi giờ trên backend Sol và $5.83 mỗi giờ trên Astra medium, theo đo lường của Artificial Analysis.

Đặt chúng cạnh nhau và phép so sánh ngây thơ — $0,018 so với $0,05 mỗi phút, khoảng cách 2,8× — sai theo cả hai hướng. Những con số đo được theo giờ cho thấy khoảng cách thực là $3,50 so với $5,83, gần với 1,7× hơn. Nhưng mô hình đồng hồ phiên cũng thay đổi hình dạng hóa đơn của bạn chứ không chỉ mức của nó: trên GPT-Live-1, chi phí của bạn bám theo thời lượng cuộc gọi, nên một đường dây có những cuộc gọi dài, im lặng, ít nội dung — một hàng chờ hỗ trợ, một bước xác minh, một lần chuyển tiếp IVR — trả tiền y như một đường dây đặc nội dung. Về phía Gemini, chi phí bám theo âm thanh, nên im lặng là miễn phí còn nói nhiều thì không. Hãy tính toán trên độ dài cuộc gọi trung bình của chính bạn trước khi tính trên mức giá mỗi phút, vì đó mới là con số quyết định cái nào trong số này rẻ hơn cho bạn, và câu trả lời không giống nhau đối với một đường dây đặt chỗ và một đường dây phân loại.

Nơi tư duy diễn ra

Sự khác biệt về cấu trúc thứ hai là delegation, và chính nó quyết định bạn thực sự có thể hoán đổi được bao nhiêu trong stack này.

GPT-Live-1 là một front-end. Nó xử lý âm thanh song công, và khi một truy vấn cần suy luận thực sự, nó chuyển công việc cho một mô hình backend riêng — GPT-5.5GPT-6 Astra đều được tài liệu ghi nhận là backend — với các bộ chọn mức nỗ lực suy luận cho phép bạn chọn mua bao nhiêu phần của backend đó. Đây là lý do bảng xếp hạng liệt kê GPT-Live-1 hai lần với các điểm số khác nhau: 81,5 trên Astra ở mức nỗ lực trung bình, 80,1 trên Sol ở mức thấp. Khoảng cách 1,4 điểm giữa hai cấu hình của chính nó lớn hơn khoảng cách 1,1 điểm giữa hai mô hình trong cặp đối đầu này, điều đó cho bạn thấy rằng ở phía OpenAI, cấu hình bạn chọn quan trọng hơn nhà cung cấp bạn chọn.

Gemini 3.8 Live Extended Thinkingsuy luận trong cùng một mô hình đang nói. Không có backend riêng để chọn và không có hóa đơn riêng cho nó; đánh đổi là bạn điều chỉnh độ sâu bằng các mức suy nghĩ — thấp, trung bình và cao — trên cùng một mô hình, và các con số 82,6 và 68,6 là cấu hình (Cao). Công cụ nền và thực thi API chạy không đồng bộ ở cả hai phía, nên không mô hình nào bị treo trong khi xử lý.

Một hệ quả thực tế: vì trí tuệ của GPT-Live-1 là một mô hình văn bản mua sẵn đằng sau một giao diện giọng nói, trần chất lượng của nó thay đổi khi OpenAI phát hành một mô hình văn bản, chứ không phải khi họ phát hành một mô hình giọng nói. Trần của Gemini 3.8 Live Extended Thinking thay đổi khi Google huấn luyện lại mô hình âm thanh. Nếu bạn đang đặt cược hai năm vào một nền tảng giọng nói, sự khác biệt về nhịp độ nâng cấp đó đáng để suy nghĩ hơn là 1,1 điểm chỉ số.

Chi phí chuyển đổi là bao nhiêu, dù bạn chọn hướng nào

Cả hai đều không phải là việc chỉ đổi ID mô hình, và những đội nhóm coi đó là như vậy sẽ phát hiện ra điều đó trong môi trường production. Việc chuyển sang Gemini 3.8 Live Extended Thinking nghĩa là chấp nhận một turn contract khác: các lệnh gọi hàm luôn bất đồng bộ, nên một khai báo công cụ dạng blocking sẽ trả về lỗi cứng thay vì xếp hàng đợi, và phía client phải đọc trường interaction_statusIN_PROGRESS khi vẫn đang suy luận hoặc một công cụ vẫn đang chạy, IDLE chỉ khi toàn bộ tác vụ hoàn tất — thay vì tin rằng turnComplete có nghĩa là công việc đã xong. Việc chuyển sang GPT-Live-1 nghĩa là phải áp dụng hệ thống chọn backend của nó và một bề mặt tính phí thứ hai, cùng việc sống chung với một API chỉ mới được cung cấp rộng rãi cho nhà phát triển vào ngày 10 tháng 9 năm 2026, sau khi ra mắt trong ChatGPT vào ngày 8 tháng 7 — nên các công cụ bên thứ ba, SDK và khả năng quan sát xung quanh nó mới chỉ có vài tháng, chứ không phải vài năm. Dù bạn chuyển theo hướng nào, hãy dự trù công việc tích hợp bên cạnh hóa đơn token. Trên một voice stack đã trưởng thành, phần tái cấu trúc thường là khoản lớn hơn trong hai khoản.

Làm cách nào để thực hiện một so sánh như thế này mà không đặt cược vào nó

Cách hợp lý để giải quyết một câu hỏi 1,1 điểm là chạy cả hai trên lưu lượng của chính bạn, và phần khó xử là việc làm như vậy thường đồng nghĩa với hai tích hợp, hai hợp đồng và hai bộ thông tin xác thực. Điều đó không nhất thiết phải có nghĩa là hai kiến trúc. Trong cả hai hệ thống này, front-end giọng nói chỉ là một lớp mỏng bên trên các lệnh gọi mô hình văn bản thông thường — với GPT-Live-1 thì điều đó là tường minh, còn ở phía Gemini, việc thực thi công cụ chạy nền cũng được giải quyết theo cùng cách — và chính lớp văn bản đó là nơi phát sinh sự biến động chi phí của bạn và là nơi việc chuyển đổi thực sự rẻ.

OrcaRouter cung cấp 190 mô hình chỉ từ một khóa duy nhất với mức giá niêm yết của nhà cung cấp, không cộng thêm phí, nhờ đó khi giá phía thượng nguồn thay đổi thì bên chúng tôi cập nhật ngay trong cùng ngày, thay vì phải đợi đến kỳ gia hạn hợp đồng tiếp theo. Đối với một voice stack, hai đặc tính quan trọng là mục tiêu ủy quyền có thể được hoán đổi trên lưu lượng đang chạy mà không cần chạm vào phần tích hợp thoại, và cơ chế chuyển đổi dự phòng tự động giữ cho cuộc gọi không bị ngắt khi backend gặp lỗi hoặc hết thời gian chờ — chính điều này cho phép bạn thử nghiệm một cấu hình chưa được kiểm chứng trên lưu lượng thật mà không cần đặt một đường dây production phía sau nó. Nói cho chính xác về những gì chúng tôi có và không lưu trữ: cả endpoint Gemini 3.8 Live Extended Thinking lẫn endpoint GPT-Live-1 đều không nằm trên router của chúng tôi — những endpoint đó đến từ API riêng của Google và OpenAI. Còn các mô hình văn bản mà chúng ủy quyền tới thì rất thường có mặt trên router, trong đó có Gemini 3.8 Flash.

Đỉnh của bảng, và việc nó ít khi ổn định đến nhường nào.

Ảnh chụp bên dưới được chụp vào ngày 16 tháng 9 năm 2026:

Gemini 3.8 Live Extended Thinking (High) — 82.6, vị trí thứ nhất

GPT-Live-1 (phần phụ trợ Astra, mức trung bình) — 81.5

Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, nỗ lực thấp) — 80.1

• Gemini 3.8 Live — 76.0

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Ba điều đáng lưu ý. Thứ nhất, vị trí thứ nhất và thứ ba cách nhau 1,3 điểm, còn thứ nhất và thứ năm cách nhau 6,6 điểm, nên nhóm dẫn đầu của bảng này là một mớ chen chúc hỗn loạn, chứ không phải một bảng thứ hạng. Thứ hai, mô hình trong tiêu đề của màn đối đầu này không phải là mục Gemini ở vị trí thứ năm — đó là Gemini 3.8 Live tiêu chuẩn, một sản phẩm khác và rẻ hơn nhiều, không nên nhầm với biến thể suy luận đang được so sánh ở đây. Thứ ba, đã có tiền lệ cho việc coi bất kỳ con số chỉ số đơn lẻ nào là tạm thời: xAI báo cáo 82,9 cho Grok Voice Think Fast 2.0 vào tháng Bảy, và mô hình đó hiển thị 81,3 trên bảng này. Điểm chỉ số do nhà cung cấp báo cáo không phải lúc nào cũng trụ được khi chạm mặt một bảng xếp hạng trực tiếp. Các con số τ-Voice 68,6% và 67,9% giờ nằm trên một bảng công khai được vận hành dưới chính bộ khung đánh giá của Artificial Analysis, nên chúng đã được kiểm chứng chứ không chỉ là lời tuyên bố — nhưng mức chênh 0,7 điểm giữa hai mô hình trên cùng một bộ khung thì không phải là một khác biệt. Hãy kiểm chứng trên lưu lượng của bạn hoặc bỏ qua.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6, GPT-Live-1 at 81.5 and 80.1, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Một con số nữa đáng được tính đến trong quyết định, vì đây là con số khó nghe nhất trong phép so sánh này: Google báo cáo 35,1% cho Gemini 3.8 Live Extended Thinking trên bảng xếp hạng τ³-Banking của Sierra, so với 32,0% cho GPT-Live-1 Astra. Đó là những số liệu do nhà cung cấp báo cáo, chưa được tái lập, và chúng mô tả một thế giới mà ở đó tác nhân thoại hàng đầu trên bảng xếp hạng ấy thất bại khoảng hai trong mỗi ba lần thử tác vụ ngân hàng thực tế. Nếu tác nhân của bạn phải hoàn thành công việc nhiều bước, chịu sự điều chỉnh của quy định, thì cả hai mô hình này đều chưa hoàn thiện — và một lợi thế 3,1 điểm trên phép đánh giá chuẩn đó không phải là lý do để chọn một nhà cung cấp, mà là lý do để duy trì con người trong vòng lặp.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Vậy thì: nếu độ tự nhiên của hội thoại chính là sản phẩm, và các cuộc gọi của bạn ngắn và dày đặc, hành vi song công toàn phần của GPT-Live-1 là một lợi thế thực sự mà chỉ số không thể nhìn thấy, và cách tính phí theo đồng hồ phiên là chấp nhận được ở độ dài cuộc gọi đó. Nếu cuộc gọi dài, im lặng hoặc thay đổi thất thường, hoặc nếu suy luận lời nói và chi phí mỗi giờ chiếm ưu thế, thì Gemini 3.8 Live Extended Thinking vượt trội ở những thành phần quan trọng và rẻ hơn khoảng 40% mỗi giờ trong khi làm điều đó — với lưu ý rằng nó hoạt động theo lượt, vẫn đang ở giai đoạn xem trước cho doanh nghiệp, và cần tái cấu trúc phía máy khách trước khi nó có thể chạy các công cụ của bạn. Điều mà không có gì trong số này biện minh được là việc chọn một trong hai dựa trên ưu thế 1,1 điểm chỉ số. Dựa trên bằng chứng hiện có, lý do trung thực để chọn giữa hai lựa chọn này là mô hình tính phí và kiến trúc bên dưới nó, và cả hai đều là những thứ bạn có thể đo lường trên lưu lượng của chính mình trong tuần này.

Trên OrcaRouter, chuyển đổi dự phòng tự động giữ cho cuộc gọi vẫn hoạt động khi một backend gặp lỗi hoặc quá thời gian chờ.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày