
Gemini 3.8 Live vs GLM-4-Voice: 21 tháng của AI giọng nói thực sự đã mang lại điều gì
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 459 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 183 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 119 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
GLM-4-Voice ra mắt vào ngày 3 tháng 12 năm 2024. Gemini 3.8 Live được công bố vào ngày 15 tháng 9 năm 2026. Đó là 21 tháng, và đây là sự thật quan trọng nhất trong so sánh này — quan trọng hơn bất kỳ thang điểm chuẩn nào, bởi vì nó quyết định loại câu hỏi mà bạn thực sự đang đặt ra.
Hai mô hình này không phải là đối thủ của nhau. Không ai triển khai giọng nói ở quy mô lớn vào năm 2026 lại lựa chọn giữa chúng dựa trên chất lượng. Câu hỏi thực sự là câu mà GLM-4-Voice đặt ra và Gemini 3.8 Live không thể trả lời: cần gì để sở hữu thứ này thay vì thuê nó? Câu hỏi đó có một câu trả lời thực chất, và nó đã thay đổi ít hơn trong 21 tháng so với mức bạn có thể tưởng.
Những gì Google đã ra mắt, và những gì Zhipu đã ra mắt
Gemini 3.8 Live là một mô hình đối thoại trực tiếp được lưu trữ, trọng số đóng. Nó xử lý đầu vào hình ảnh gần như theo thời gian thực, tự động phát hiện và chuyển đổi giữa 97 ngôn ngữ được hỗ trợ ngay giữa cuộc trò chuyện, đồng thời thực thi các công cụ và lệnh gọi API ở chế độ nền trong khi cuộc trò chuyện vẫn tiếp tục. Mô hình này có sẵn cho các nhà phát triển thông qua Gemini API và Google AI Studio, ở chế độ xem trước riêng tư trong Gemini Enterprise và trong Search Live. Mức giá đã công bố là 0,005 USD mỗi phút âm thanh đầu vào và 0,018 USD mỗi phút âm thanh đầu ra thông qua Live API; biểu đồ chi phí mỗi giờ âm thanh đầu vào của Artificial Analysis đưa ra con số độc lập là 1,50 USD mỗi giờ. Mô hình anh em của nó, Gemini 3.8 Live Extended Thinking, hiện đang đứng đầu cùng chỉ số đó ở mức 82,6, trong khi bản thân Gemini 3.8 Live ở mức 76,0.
GLM-4-Voice là mô hình giọng nói end-to-end đầu tiên của Zhipu AI, và đây là một checkpoint có thể tải xuống. Nó là một tổ hợp gồm ba phần: một tokenizer giọng nói được xây dựng trên encoder Whisper-large-v3 với nút thắt lượng tử hóa vector ở khoảng 0,4B tham số, một mô hình ngôn ngữ tự hồi quy (GLM-4-Voice-9B, được khởi tạo từ GLM-4-9B) với khoảng 9B tham số, và một bộ giải mã flow-matching được huấn luyện lại từ CosyVoice. Nó nói được tiếng Trung và tiếng Anh, hỗ trợ cảm xúc, giọng điệu, tốc độ nói và phương ngữ do chỉ dẫn điều khiển — trong đó có tiếng Quảng Đông, tiếng Quan Thoại Trùng Khánh, giọng nói Bắc Kinh — và token hóa giọng nói ở 12,5 Hz thành một luồng codebook duy nhất với tốc độ khoảng 175 bps, thấp hơn một bậc độ lớn so với các codec âm thanh nơ-ron thông thường.
Các kích thước, đặt cạnh nhau:
• Phát hành — Gemini 3.8 Live: 15 tháng 9, 2026. GLM-4-Voice: 3 tháng 12, 2024.
• Trọng số — đóng, chỉ lưu trữ trực tuyến so với có thể tải xuống, mã Apache-2.0 với giấy phép trọng số tùy chỉnh.
• Ngôn ngữ — 97 với khả năng chuyển đổi ngay trong cuộc trò chuyện so với tiếng Trung và tiếng Anh.
• Thị giác — đầu vào hình ảnh gần thời gian thực so với không có.
• Gọi công cụ — thực thi công cụ và API chạy nền giữa cuộc trò chuyện so với việc không có kênh công cụ nào cả.
• Ngữ cảnh — không được Google công bố so với ngữ cảnh 8K, đầu ra tối đa 4K.
• Mức tối thiểu để tự vận hành — không áp dụng so với 32 GB RAM cùng GPU CUDA theo thông số chính thức; khoảng 12 GB VRAM ở int4.
• Gắn watermark — SynthID trên tất cả âm thanh được tạo so với không có gì được mô tả.

21 tháng đã mang lại năng lực, không chỉ là chất lượng
Cách hiểu đơn giản là một mô hình tiên phong năm 2026 đánh bại một checkpoint mở năm 2024. Đúng là như vậy, và khoảng cách rất lớn — nhưng quan sát hữu ích hơn là phạm trù này đã thay đổi hình dạng chứ không phải dịch chuyển dọc theo một trục.
Trong báo cáo kỹ thuật của chính Zhipu, GLM-4-Voice đạt độ chính xác chuyển giọng nói thành văn bản là 93.6% trên Topic-StoryCloze, 82.9% giọng nói sang giọng nói, độ tự nhiên UTMOS là 4.45, và QA nói là 5.40/10 tổng quát và 5.20/10 kiến thức — tất cả đều do tự báo cáo và chưa được tái lập. Đánh giá độc lập khan hiếm hơn và kém tích cực hơn: trên VoiceBench, nó ghi nhận tổng thể là 56.48, xếp khoảng thứ 29 trong 42 ở một bảng tổng hợp và thứ 30 trong 40 ở một bảng khác, với khả năng hiểu đa lượt được mô tả là yếu ở cả hai ngôn ngữ. Trên benchmark hiểu hội thoại đa lượt C³, nó đạt 11.09% tiếng Trung và 33.22% tiếng Anh. VCB Bench nhận thấy nó dẫn đầu về kiểm soát cảm xúc với 93.0 ở chỉ số con SIF tiếng Trung, và căn chỉnh văn bản–giọng nói mạnh mẽ, nhưng xử lý phương ngữ TELEVAL chỉ đạt 4.57% khi không có hướng dẫn rõ ràng.
Những con số đó mô tả một mô hình giỏi về biểu đạt giọng nói nhưng kém về khả năng hiểu duy trì. Đó là mô hình giọng nói năm 2024 trong một câu.
Điểm 76,0 của Gemini 3.8 Live trên Chỉ số Speech to Speech của Artificial Analysis là điểm tổng hợp từ khả năng suy luận trong giọng nói, hiệu suất tác tử, mức độ ưa thích trên đấu trường và tỷ lệ thành công nhiệm vụ. Không phải mô hình mới hơn giỏi hơn ở cùng một nhiệm vụ với hệ số lớn hơn nhiều lần. Mà là điểm tổng hợp giờ đây đã bao gồm cả hiệu suất tác tử và thành công nhiệm vụ — những hạng mục mà GLM-4-Voice không thể cạnh tranh vì nó không có kênh công cụ. Mô hình 2024 đang được chấm điểm trong một cuộc chơi mà nó chưa từng được tạo ra để tham gia.

Giấy phép là phần mọi người thường bỏ qua.
Nếu bạn đang xem GLM-4-Voice vì nó mở, hãy đọc các điều khoản trước khi trọng số tải xong. Sự phân tách là có thật và rất dễ bị hiểu sai:
• Mã — Apache-2.0. Thực sự thông thoáng.
• Trọng số — một giấy phép tùy chỉnh yêu cầu ghi công và đăng ký với Zhipu cho mục đích thương mại.
"Trọng số mở" và "Apache-2.0" không phải là cùng một tuyên bố, và rất nhiều bài đưa tin thứ cấp về mô hình này đánh đồng hai điều đó. Nếu bạn định tung ra một sản phẩm thương mại dựa trên GLM-4-Voice, yêu cầu đăng ký là một bước pháp lý, không phải một thủ tục hình thức, và nó nên nằm trên đường găng (critical path). Một tracker còn đi xa hơn và mô tả mô hình này là độc quyền với việc sử dụng thương mại có điều kiện. Dù thế nào đi nữa, việc không có hóa đơn tính theo phút không đồng nghĩa với việc không có quan hệ thương mại.
Phép tính chi phí, được thực hiện một cách trung thực
Lập luận ủng hộ việc tự vận hành là ở quy mô lớn, chi phí cố định hàng tháng sẽ thắng chi phí tính theo phút. Lập luận đó là có thật, và nó nhỏ hơn vẻ ngoài một khi bạn tính đến những gì mình phải vận hành.
GLM-4-Voice chính thức yêu cầu 32 GB RAM và một GPU CUDA. Các bản lượng tử hóa int4 do cộng đồng thực hiện chạy trong khoảng 12 GB VRAM, thực tế khoảng 10–11 GB, tức thuộc phân khúc RTX 3060, với giới hạn thực tế khoảng 30 giây giọng nói mỗi lượt. Một A10 trên cloud với giá khoảng $0.50–$1.00 mỗi giờ tương đương khoảng $350 đến $700 mỗi tháng cho một instance chạy liên tục — trước cả khi bạn phục vụ được một người dùng nào, và không có failover, không có khả năng xử lý đột biến, và không có ai để gọi khi decoder sinh ra tạp âm lúc 3 giờ sáng.
Đối lại, Gemini 3.8 Live với $1.50 mỗi giờ âm thanh đầu vào có nghĩa là $350 mua được khoảng 233 giờ thoại. Điều đó không hẳn là tệ hơn, và nó đi kèm với năng lực mà bạn chưa cấp phát. Điểm giao cắt tồn tại; nó cao hơn so với ấn tượng mà so sánh tiêu đề gợi ra, và nó thay đổi tùy theo việc lưu lượng của bạn ổn định hay tăng vọt. Lưu lượng tăng vọt là trường hợp mà tính giá theo phút thắng rõ rệt, vì GPU nhàn rỗi vẫn bị tính phí y hệt GPU bận.
Ngoài ra còn có sự khác biệt về những gì bạn nhận được tương xứng với số tiền bỏ ra. Các báo cáo cộng đồng về những triển khai GLM-4-Voice được lượng tử hóa cho thấy độ trễ đối thoại liên tục ở mức 38–120 ms, mặc dù những con số đó đến từ các bài viết chứ không phải từ Zhipu. Độ trễ của Gemini 3.8 Live hoàn toàn chưa được Google công bố. Nếu độ trễ thấp là yêu cầu khắt khe của bạn, thì cả hai đều không có con số nào bạn có thể dựa vào để lập kế hoạch — một cái có số đo từ cộng đồng bên thứ ba, cái còn lại có lời chứng thực từ đối tác và không có con số nào.

Phương án ở giữa: sở hữu logic, thuê năng lực
Việc đóng khung vấn đề này thành tự lưu trữ so với thuê dịch vụ bỏ sót cách bố trí mà hầu hết các đội thực tế rốt cuộc vẫn áp dụng. GLM-4-Voice không có kênh công cụ, nên bất kỳ sản phẩm nào xây dựng trên nó đều cần một mô hình văn bản riêng để thực hiện việc tra cứu — nghĩa là mô hình giọng nói tự lưu trữ nằm trước một mô hình văn bản thuê dịch vụ dù theo cách nào đi nữa. Quyết định triển khai và quyết định về năng lực là có thể tách rời.
Sự tách lớp đó chính là nơi router thực sự làm việc. OrcaRouter mang 190 mô hình đằng sau một khóa duy nhất với mức giá niêm yết của nhà cung cấp, không cộng thêm phí, nhờ vậy mục tiêu ủy quyền phía sau giao diện giọng nói của bạn có thể được hoán đổi ngay trên lưu lượng trực tiếp mà không cần xây dựng lại bất cứ thứ gì, và một đợt giảm giá từ thượng nguồn sẽ đến với bạn ngay trong cùng ngày thay vì phải chờ tới kỳ gia hạn tiếp theo. Chuyển đổi dự phòng tự động còn quan trọng hơn mức thông thường trong một thiết lập tự lưu trữ, bởi khi chính instance GPU của bạn là thứ đã đổ vỡ, mô hình backend vẫn còn truy cập được và phiên làm việc không phải chết theo nó. Xin làm rõ hai điểm, vì sự so sánh này dễ gây nhầm lẫn: chúng tôi không tự host GLM-4-Voice, và các endpoint Gemini 3.8 Live cũng không nằm trên router của chúng tôi — chúng đến từ nhà cung cấp của họ. Thứ có trên router chính là tầng văn bản mà cả hai đều chuyển công việc cho.
Quyết định, và bài học nằm bên dưới nó
Chọn GLM-4-Voice nếu bạn cần mô hình trên phần cứng của riêng mình, nếu lưu lượng của bạn thực sự ổn định ở khối lượng cao, nếu bạn chỉ xây dựng bằng tiếng Trung hoặc tiếng Anh, và nếu bạn cần sửa đổi mô hình thay vì chỉ gọi nó. Hãy coi việc đăng ký giấy phép như một tác vụ thực sự, và hãy chuẩn bị tinh thần tự mình giải quyết khả năng hiểu hội thoại nhiều lượt — đó là điểm yếu đã được ghi nhận của mô hình và không lượng tinh chỉnh nào quanh mức trần đầu ra 4K có thể che giấu hoàn toàn điều đó.
Chọn Gemini 3.8 Live nếu yêu cầu của bạn bao gồm thị giác, gọi công cụ, hơn hai ngôn ngữ, hoặc bất kỳ mẫu lưu lượng truy cập nào mà bạn mô tả là tăng vọt. Đây là một mô hình xem trước với các số liệu về ngữ cảnh và độ trễ chưa được công bố, điều này là một rủi ro thực sự trong việc lập kế hoạch, nhưng nó cũng là mô hình duy nhất trong hai mô hình có thể tra cứu thông tin giữa câu.
Bài học chung đáng giá hơn cả hai phán quyết. Hai mươi mốt tháng của AI giọng nói đã tạo ra một mô hình mà xét cho cùng không phải chủ yếu là một mô hình giọng nói tốt hơn — nó là một giao diện giọng nói cho một agent. Nếu lý do bạn muốn trọng số mở là chi phí, thì phép tính sát sao hơn so với cách đóng khung "miễn giấy phép" gợi ra. Nếu lý do của bạn là kiểm soát, thì điều đó hoàn toàn chưa bị hàng hoá hoá, và GLM-4-Voice vẫn là một câu trả lời chính đáng cho một câu hỏi mà Gemini 3.8 Live không giải quyết.
