Thẻ tiêu đề chính cho Gemini 3.8 Live Extended Thinking so với Gemini 3.8 Live, cho thấy hai mô hình chênh lệch nhau gấp 4 lần về chi phí âm thanh theo giờ, $3.50 so với $0.84.
Guides & Insights

Gemini 3.8 Live Extended Thinking so với Gemini 3.8 Live: Trả gấp 4 lần cho 38 điểm thực sự quan trọng

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình, một đợt ra mắt, một bảng giá, và một quyết định mà phần lớn các bài viết đều hiểu sai theo cùng một hướng. Gemini 3.8 Live Extended ThinkingGemini 3.8 Live ra mắt cùng nhau vào ngày 15 tháng 9 năm 2026, cả hai đều được xây dựng trên Gemini 3 Pro, cả hai đều xử lý 97 ngôn ngữ với khả năng chuyển đổi tự động ngay giữa cuộc trò chuyện, cả hai đều nhận đầu vào hình ảnh gần như theo thời gian thực, cả hai đều gắn dấu bản quyền SynthID lên âm thanh được tạo ra. Trên Chỉ số Speech to Speech tổng hợp do Artificial Analysis công bố, chúng cách nhau 6,6 điểm — 82,6 so với 76,0. Trên chi phí âm thanh theo giờ mà cùng bảng đó đo lường, chúng cách nhau chỉ hơn bốn lần một chút.

Không con số nào trong hai con số đó là con số nên quyết định kiến trúc của bạn. Con số nên quyết định là 38: khoảng cách giữa hai con số trên τ-Voice, thành phần hoàn thành tác vụ agentic, nơi biến thể suy luận giải quyết 68,6% các tình huống dịch vụ khách hàng mô phỏng và biến thể tiêu chuẩn giải quyết 30,1%. Bạn không đang chọn giữa một mô hình tốt và một mô hình tốt hơn. Bạn đang chọn giữa một giao diện đối thoại và một hệ thống suy luận mà tình cờ biết nói, và mức chênh lệch giá là điều ít thú vị nhất trong lựa chọn đó.

Phân nhánh giá, theo đúng đơn vị mà bạn thực sự được tính phí

Bắt đầu với hóa đơn, vì đó là phần mà người ta hiểu đúng rồi lại đánh giá quá cao. Cả hai mô hình đều có cùng mức giá công bố qua Live API: 0,005 đô-la mỗi phút âm thanh đầu vào và 0,018 đô-la mỗi phút âm thanh đầu ra, và ở phía Extended Thinking, số token đầu ra đó bao gồm cả phần suy luận. Cùng một bảng giá, cùng mức giá, không có hạng cao cấp riêng cho việc suy luận.

Sự khác biệt lộ rõ khi bạn đo khối lượng công việc thay vì số phút. Cột chi phí cho mỗi giờ âm thanh đầu vào của Artificial Analysis — chi phí hoàn thành một tập con Big Bench Audio cố định gồm 40 câu hỏi, được chuẩn hoá thành một con số theo giờ — đặt hai mô hình vào những nhóm hoàn toàn khác nhau:

Gemini 3.8 Live Extended Thinking (High) — 3,50 USD mỗi giờ âm thanh đầu vào, theo đo lường của chính Artificial Analysis

Gemini 3.8 Live — $0.84 mỗi giờ, mức trả thấp nhất trên bảng đó

• GPT-Live-1 (backend Astra, mức nỗ lực trung bình) — 5,83 USD mỗi giờ, vì vậy biến thể suy luận vẫn rẻ hơn mô hình mà nó đánh bại khoảng 40%

Grok Voice Think Fast 2.0 High — 4,80 USD mỗi giờ

• GPT-Realtime-2.1 High — 10,75 USD mỗi giờ

Đó chính là điểm rẽ nhánh: chi phí âm thanh theo giờ cao gấp bốn lần, trên cùng mức giá công bố theo phút, bởi vì biến thể suy luận tiêu tốn nhiều token hơn để thực hiện cùng một khối lượng nghe. Mức $0,84 của mô hình tiêu chuẩn không phải là một khoản giảm giá, mà là mức sàn của toàn bộ bảng.

38 điểm mua được gì

Tách rời composite ra thì hai mô hình không còn trông giống một cặp nữa:

Chỉ số Speech to Speech — Gemini 3.8 Live Extended Thinking (High) 82,6 so với Gemini 3.8 Live 76,0

Hiệu suất dạng tác tử (hoàn thành tác vụ τ-Voice) — 68.6% so với 30.1%

Suy luận giọng nói (Big Bench Audio) — 98% so với 92%

Động thái hội thoại — 91.9% so với 96.1%

Ưu tiên Arena (Elo) — 990 so với 1083

Tỷ lệ hoàn thành nhiệm vụ — 89,1% so với 93,2%

Thời gian đến âm thanh đầu tiên — 1,35 giây so với 1,18 giây

Chi phí mỗi giờ âm thanh đầu vào — $3.50 so với $0.84

Đọc điều đó một cách trung thực và mô hình rẻ hơn thắng bốn trong tám dòng. Nó nhanh hơn về thời điểm có âm thanh đầu tiên, được arena ưa thích hơn, có nhiều khả năng hoàn thành một tác vụ nông hơn, và được đánh giá tốt hơn về động thái hội thoại — điều cuối cùng trong số đó không phải là một giải an ủi, bởi vì động thái hội thoại là thứ mà người gọi nhận thấy. Điều nó không thể làm là hoàn thành một công việc có các bước. Ba mươi phẩy một phần trăm so với 68,6% là khoảng cách đơn lẻ lớn nhất ở bất kỳ đâu trong bản phát hành này, và nó nằm đúng trên trục duy nhất phân tách một agent khỏi một giao diện.

Hai lưu ý về các hàng đó. Chỉ số ưu tiên đấu trường bên trong bảng xếp hạng được đóng băng tại thời điểm một mô hình đủ điều kiện được công bố, nên đó là ảnh chụp nhanh chứ không phải Elo cập nhật liên tục — hãy đọc nó như một điểm đánh giá tại một thời điểm, chứ không phải biểu đồ Speech Agent Arena trực tiếp. Và đỉnh của bảng τ-Voice rất sít sao: biến thể reasoning đạt 68,6% dẫn trước GPT-Live-1 ở 67,9% (backend Astra, mức effort trung bình) với cách biệt 0,7 điểm, trong khi GPT-Live-1 (Sol, effort thấp) ở 59,3% và Grok Voice Think Fast 2.0 High ở 56,5% phía sau. Mức dẫn trước 0,7 điểm so với GPT-Live-1 nằm trong ngưỡng nhiễu. Khoảng cách 38 điểm trong cặp này thì không.

A two-column scoreboard comparing Gemini 3.8 Live Extended Thinking and Gemini 3.8 Live across six dimensions: Speech to Speech Index 82.6 vs 76.0, agentic performance on tau-Voice 68.6 percent vs 30.1 percent, speech reasoning on Big Bench Audio 98 percent vs 92 percent, arena preference Elo 990 vs 1083, time to first audio 1.35 seconds vs 1.18 seconds, and cost per hour of input audio $3.50 vs $0.84.

4x còn lại: tier reasoning khiến bạn phải trả giá gì trong code

Bản phát hành này có một nhánh rẽ thứ hai, và nó không xuất hiện trên bất kỳ bảng xếp hạng nào. Hai mô hình không thể thay thế trực tiếp cho nhau, bởi vì biến thể suy luận thay đổi hợp đồng mà ứng dụng khách của bạn phải tuân thủ.

Trên mô hình tiêu chuẩn, Gemini 3.8 Livehoạt động theo cách mà một ứng dụng khách Live API mong đợi: các lệnh gọi công cụ và API chạy nền trong khi mô hình vẫn tiếp tục trò chuyện, và turnComplete: true vẫn đánh dấu kết thúc một lượt. Không có cài đặt mức độ suy nghĩ nào để chọn, vì không có gì riêng biệt để cấu hình — mô hình trả lời, và khi đã trả lời xong, lượt đó kết thúc.

Trên Gemini 3.8 Live Extended Thinking, có ba điều thay đổi cùng một lúc:

Các lệnh gọi hàm luôn là bất đồng bộ. Khai báo công cụ dạng chặn không xếp hàng một cách lịch sự — nó trả về một lỗi cứng. Mọi lược đồ công cụ bạn đã viết cho mô hình tiêu chuẩn đều phải được khai báo lại thành không chặn.

Một trường trạng thái mới mang trạng thái thực sự. Client phải đọc interaction_status thay vì tin vào turnComplete: trường này hiển thị IN_PROGRESS trong khi mô hình vẫn đang suy luận hoặc một công cụ vẫn đang chạy, và chỉ chuyển về IDLE khi toàn bộ tác vụ đã hoàn tất. Một lượt có thể kết thúc trong khi tác vụ thì chưa.

Độ sâu suy luận là một nút điều chỉnh. Mô hình cung cấp các mức suy luận có thể cấu hình — thấp, trung bình và cao — và các con số 82,6 và 68,6 trên bảng là cấu hình (Cao). Chuyển xuống mức thấp sẽ thay đổi cả chất lượng lẫn chi phí token, và không có gì trên chỉ số cho bạn biết mức thấp khiến bạn phải trả giá bao nhiêu về khả năng hoàn thành tác vụ.

Điểm thứ ba đó chính là cái bẫy chuyển đổi. Bởi vì Extended Thinking trả lời trên đường truyền giống hệt mô hình tiêu chuẩn cho đến khi có một lệnh gọi công cụ tham gia, một nhóm có thể hoán đổi ID mô hình, thấy một bản demo chạy được, và chỉ phát hiện ra hợp đồng bất đồng bộ khi lên production lúc một công cụ đặt chỗ trả về lỗi thay vì kết quả. Hãy dự trù ngân sách cho việc tái cấu trúc phía client song song với mức giá audio gấp 4 lần; trên một tích hợp đã trưởng thành, nó là chi phí lớn hơn trong hai chi phí.

Cái nào mà khối lượng công việc của bạn thực sự đang yêu cầu

Cách quyết định rõ ràng là hỏi xem phiên dùng để làm gì, chứ không phải bạn muốn nó thông minh đến mức nào.

Hãy dùng Gemini 3.8 Live khi cuộc hội thoại chính là sản phẩm bàn giao. Trả lời, giữ mạch hội thoại, ghi lời nhắn, sàng lọc người gọi, vui vẻ, nhanh và rẻ. Với 0,84 đô la mỗi giờ âm thanh đầu vào, đây là mô hình giọng nói đủ năng lực rẻ nhất mà bất kỳ ai hiện đang công bố, nó được arena ưa chuộng, đáng tin cậy hơn với các tác vụ đơn giản, và nhanh hơn 170 mili giây để tạo ra âm thanh đầu tiên — một khác biệt mà người gọi cảm nhận được. Điều duy nhất phải chấp nhận là giới hạn trần: 30,1% ở khả năng hoàn thành tác vụ nhiều bước nghĩa là nó sẽ không hoàn thành công việc có các bước, và không lượng kỹ thuật gợi ý nào có thể thay đổi con số đó.

Hãy chọn Gemini 3.8 Live Extended Thinkingkhi phiên làm việc có một nhiệm vụ cụ thể. Đặt chỗ, thay đổi, hủy, giải quyết vấn đề tài khoản, hướng dẫn người gọi qua một quy trình nhiều bước trong khi họ chờ. Đó là ngưỡng 38 điểm, và nó đáng giá 3,50 đô la một giờ — lưu ý, vẫn rẻ hơn cả hai mô hình mà nó có điểm cao hơn trên chỉ số tổng hợp. Bạn cũng nhận được hành vi tường thuật giúp việc chờ đợi trở nên dễ chịu: mô hình này vừa lý luận vừa nói cùng lúc, nên thay vì im lặng trong lúc tra cứu thông tin, người gọi sẽ nghe "Để tôi kiểm tra…" và tiến độ khi nó thực hiện. Đó cũng chính là vấn đề mà các kiến trúc song công hoàn toàn giải quyết bằng cách không bao giờ dừng âm thanh; câu trả lời của Google là tiếp tục nói trong suốt quá trình làm việc.

Hai hàng nữa đáng để cân nhắc. Google cũng báo cáo 35,1% cho mô hình Extended Thinking trên bảng xếp hạng τ³-Banking của Sierra, so với 32,0% cho GPT-Live-1 Astra — một con số do nhà cung cấp báo cáo, không có đánh giá độc lập nào đằng sau nó, và là một con số đáng lo ngại xét về giá trị tuyệt đối, vì 35,1% nghĩa là mô hình tốt nhất trên bảng đó thất bại khoảng hai trong mỗi ba lần thử nhiệm vụ ngân hàng thực tế. Và vị trí thứ hai của mô hình tiêu chuẩn trong Speech Agent Arena, mà Google trích dẫn trong tài liệu của chính mình, là một kết quả thật trên một bảng khác đo lường sở thích thay vì hoàn thành nhiệm vụ. Cả hai nhận định đều đúng. Gộp lại, chúng cho thấy mô hình rẻ rất giỏi trong việc được trò chuyện cùng, còn mô hình đắt tiền là mô hình duy nhất trong hai mô hình có thể được giao việc.

Chạy cả hai, không cần hai tích hợp

Phản đối thực tế đối với tất cả những điều này là việc chọn theo từng khối lượng công việc đồng nghĩa với việc phải duy trì hai đường xử lý. Điều đó không nhất thiết phải như vậy. Cả hai biến thể đều nằm trước cùng một loại backend — việc thực thi công cụ chạy nền và lập kế hoạch nhiều bước đều quy về các lệnh gọi mô hình văn bản thông thường — và lớp đó chính là nơi phát sinh chênh lệch chi phí của bạn và cũng là nơi việc chuyển đổi trở nên rẻ.

OrcaRouter cung cấp190 mô hình từ một khóa duy nhất với giá niêm yết của nhà cung cấp, không đánh thêm phí, nên khi nhà cung cấp thay đổi giá thì bên chúng tôi cập nhật ngay trong cùng ngày, thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo. Với một hệ thống định tuyến giữa tầng hội thoại giá rẻ và tầng suy luận đắt đỏ, hai đặc tính quan trọng là mục tiêu ủy quyền có thể được hoán đổi ngay trên lưu lượng đang chạy mà không cần đụng đến tích hợp thoại, và cơ chế chuyển đổi dự phòng tự động giữ cho phiên làm việc không bị ngắt khi một backend gặp lỗi hoặc hết thời gian chờ. Nói rõ về những gì chúng tôi có vận hành và không vận hành: các endpoint Gemini 3.8 Live và Gemini 3.8 Live Extended Thinking không nằm trên router của chúng tôi — chúng đến từ API riêng của Google, trong Gemini API, Live API và Google AI Studio. Các mô hình văn bản mà những agent này chuyển công việc sang thường chính là chúng, trong đó có Gemini 3.8 Flash.

Vị trí của mỗi mô hình trên bảng

Ảnh chụp bên dưới được thực hiện vào ngày 16 tháng 9 năm 2026, và phần đầu của Speech to Speech Index có nội dung như sau:

Gemini 3.8 Live Extended Thinking (High) — 82.6, vị trí thứ nhất

• GPT-Live-1 (backend Astra, mức nỗ lực trung bình) — 81.5

• Grok Voice Think Fast 2.0 High — 81.3

• GPT-Live-1 (backend Sol, nỗ lực thấp) — 80.1

Gemini 3.8 Live — 76.0, vị trí thứ năm

• GPT-Realtime-2.1 High — 73.9

• Gemini 3.1 Flash Live High — 71.5

Một lưu ý về cách đặt tên khi bạn đọc danh sách đó: hậu tố (High) gắn với model này trong phần đưa tin chỉ là nhãn cấu hình mức độ suy luận (reasoning-effort), không phải một bản phát hành riêng. Đây cũng chính là quy ước mà ban điều hành dùng cho Grok Voice Think Fast 2.0 High và GPT-Realtime-2.1 High.

Screenshot of the Artificial Analysis Speech to Speech leaderboard captured September 16, 2026, showing Gemini 3.8 Live Extended Thinking at 82.6 in first place, GPT-Live-1 at 81.5, Grok Voice Think Fast 2.0 at 81.3, and Gemini 3.8 Live at 76.0.

Còn gì vẫn chưa được commit?

Có một điều về cặp này dễ bị hiểu sai, nên cần nói rõ: không mô hình nào trong hai mô hình thực sự được cung cấp rộng rãi theo nghĩa hợp đồng, dù cả hai đều đã được định giá và có tài liệu.

Nhà phát triển có Gemini 3.8 Live trong Gemini API, Live API và Google AI Studio với ID gemini-3.8-live; doanh nghiệp được dùng bản xem trước riêng tư trong Gemini Enterprise, với Gemini Enterprise for Customer Experience được liệt kê là sắp ra mắt; người dùng phổ thông có được tính năng này trong Search Live. Gemini 3.8 Live Extended Thinking có cùng bề mặt dành cho nhà phát triển với gemini-3.8-live-extended-thinking, cùng với nhiều lựa chọn hơn cho người dùng phổ thông — Gemini Live, Docs Live dành cho người đăng ký Google AI Pro và Ultra, và Gmail Live cùng Keep Live dành cho tất cả người đăng ký Google AI. Khách hàng doanh nghiệp Workspace được liệt kê là sắp ra mắt.

Điều còn thiếu chính là những gì một doanh nghiệp cần trước khi đưa dòng doanh thu vào đây: cam kết khả dụng chung, một con số thời gian hoạt động được công bố, và một mức giá mà Google đã cam kết giữ nguyên. Giá đã được công bố, và giá bản xem trước thường có xu hướng thay đổi. Hãy tạo nguyên mẫu ngay bây giờ, lập kế hoạch cho việc di chuyển, và đừng ký vào một mục tiêu khả dụng mà bạn chưa được cung cấp.

Screenshot of an OrcaRouter model page for google/gemini-3.8-flash, showing a 1M-token context window, 65K maximum output, vision, audio and tool support, input pricing of $0.75 and output pricing of $3.75 per million tokens, and a p50 time to first token of 3.35 seconds.

Quyết định mà cặp mô hình này thực sự đặt ra hẹp hơn nhiều so với vẻ ngoài mà chỉ số tạo ra, và đó không phải là một thang bậc chất lượng. Nếu công việc của agent là trò chuyện, mô hình rẻ không phải là một sự thỏa hiệp — nó là sản phẩm tốt hơn với mức giá thấp hơn, và mức giá rẻ hơn bốn lần là phần thưởng thêm chứ không phải lý lẽ chính. Nếu công việc của agent là hoàn thành một việc gì đó, biến thể suy luận là lựa chọn duy nhất trong hai có thể được giao nhiệm vụ đó ngay từ đầu, và $3.50 mỗi giờ chỉ là sai số làm tròn so với một lượt đặt chỗ mà nếu không sẽ thất bại. Sai lầm cần tránh là dung hòa: trả tiền cho chiều sâu suy luận trên một khối lượng công việc vốn chỉ cần một cuộc trò chuyện tốt, đó là điều xảy ra khi một nhóm đọc khoảng cách tổng hợp 6,6 điểm và không bao giờ cuộn xuống đến 38.