
GPT-Live-1 vs Gemini 3.5 Live Translate: Một sản phẩm đa năng đã phát hành đối đầu với một chuyên gia bản xem trước
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 trên 1 triệu token
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Hai mô hình này thường bị đem ra so sánh vì cả hai đều đưa giọng nói thời gian thực vào một API, và sự so sánh đó sụp đổ ngay khi bạn đọc model card. GPT-Live-1 là mô hình giọng nói song công đa dụng mà OpenAI đã đưa vào API dành cho nhà phát triển vào ngày 10 tháng 9 năm 2026, ba tháng sau khi nó ra mắt bên trong ChatGPT vào ngày 8 tháng 7. Gemini 3.5 Live Translate là mô hình dịch âm thanh sang âm thanh chuyên dụng mà Google DeepMind phát hành vào ngày 9 tháng 6 năm 2026, và ID mô hình của nó vẫn mang chữ preview. Một trong hai cái này bạn có thể đặt trước mặt khách hàng trả tiền ngay hôm nay theo một mức giá đã công bố. Cái còn lại thì Google có thể thay đổi dưới chân bạn mà không cần thông báo ngừng hỗ trợ. Chính sự bất đối xứng đó, chứ không phải bảng điểm chuẩn, mới là thứ nên quyết định lựa chọn.
Hai cỗ máy khác nhau cùng mang một nhãn
Thật đáng để nói thẳng rằng những thứ này chồng lấn với nhau ít đến mức nào. Gemini 3.5 Live Translate thực hiện dịch thuật. Nó nhận âm thanh streaming ở một ngôn ngữ và trả về âm thanh streaming ở một ngôn ngữ khác, giữ nguyên giọng nói và tông giọng của người nói, trên hơn 70 ngôn ngữ và hơn 2.000 cặp ngôn ngữ, với khả năng tự động phát hiện ngôn ngữ và hoạt động hai chiều. Nó không trò chuyện, không gọi hàm, cũng không trả lời câu hỏi. Nó là một cỗ máy phiên dịch đồng thời.
GPT-Live-1 có hình dạng ngược lại. Nó là một mô hình hội thoại: nó vừa lắng nghe vừa nói cùng lúc, quyết định nhiều lần mỗi giây xem nên tiếp tục lắng nghe, tạm dừng, ngắt lời hay gọi một công cụ, và giao những công việc nặng — tìm kiếm web, suy luận sâu hơn, các tác vụ agentic — cho một mô hình suy luận riêng biệt thông qua Responses API trong khi cuộc hội thoại vẫn tiếp diễn. Ví dụ WebRTC do chính OpenAI công bố kết nối việc ủy thác đó với GPT-5.6 Terra. Dịch thuật là một trong những thứ nó có thể làm; đó không phải là một tính năng mà mô hình của Google có bất kỳ tương đương nào theo chiều ngược lại.
Vậy nên câu hỏi thực tế hẹp hơn so với cuộc đối đầu mà tiêu đề gợi ý: nếu thứ bạn đang xây dựng là phiên dịch, mô hình của Google được thiết kế chuyên dụng còn của OpenAI là đa dụng. Nếu thứ bạn đang xây dựng là một tác nhân thoại đôi khi dịch, GPT-Live-1 là sản phẩm duy nhất trong hai sản phẩm thậm chí còn thuộc đúng loại sản phẩm.
Chi phí của mỗi cái là bao nhiêu cho mỗi phút âm thanh
Đây là lúc chuyên gia chứng tỏ giá trị của mình, và bài toán này thực sự nan giải đối với OpenAI.
• GPT-Live-1 — 0,05 đô la mỗi phút thoại, được tính phí theo từng giây thay vì làm tròn lên phút nguyên tiếp theo. Các suy luận và lệnh gọi công cụ do backend được ủy quyền thực hiện sẽ được tính phí riêng theo mức giá thông thường của mô hình đó.
• Gemini 3.5 Live Translate — $3,50 mỗi triệu token đầu vào âm thanh và $21,00 mỗi triệu token đầu ra âm thanh, với chi phí được tính ở mức 25 token mỗi giây âm thanh. Tính gộp lại, con số này rơi vào khoảng $0,037 mỗi phút âm thanh được dịch.
Xét về số phút dịch thuần túy, Google rẻ hơn khoảng một phần tư. Đó không phải là khác biệt do làm tròn ở quy mô lớn: 10.000 phút phiên dịch mỗi tháng tốn khoảng 500 USD cho lớp giọng nói của GPT-Live-1, so với khoảng 368 USD trên Gemini 3.5 Live Translate. Và khoảng cách này là thật chứ không phải hệ quả của việc thay đổi cách tính phí, bởi vì hai mô hình tính phí theo những đơn vị thực sự khác nhau.
Có một cái bẫy ở chiều ngược lại. Mức giá quảng cáo $0.05 cho GPT-Live-1 chỉ là giá của lớp giọng nói. Nếu agent của bạn vừa dịch vừa tra cứu thông tin gì đó, hoặc chuyển một câu khó lên mô hình suy luận, thì bạn còn phải trả thêm cho việc ủy thác đó — và mô hình được ủy thác tính giá theo token như bất kỳ mô hình tiên tiến nào khác. Khối lượng công việc chỉ dịch thì không bao giờ kích hoạt điều đó. Khối lượng công việc dịch cộng thêm bất cứ thứ gì thì có, và bên thắng trong so sánh theo phút không còn rõ ràng nữa.

Nhãn xem trước là rủi ro mà không ai định giá vào
Model ID của Gemini 3.5 Live Translate là gemini-3.5-live-translate-preview. Nó đã ra mắt tới Gemini Live API và Google AI Studio dưới dạng bản xem trước công khai, đồng thời có mặt trong ứng dụng Google Translate trên Android và iOS cùng một bản xem trước riêng tư trong Google Meet dành cho một số khách hàng Workspace được chọn. Bản xem trước mang đúng ý nghĩa mà nó vẫn luôn mang tại Google: không đảm bảo tính ổn định, không có khoảng thời gian ngừng hỗ trợ nào được công bố, không cam kết rằng mức giá bạn đang trả sẽ còn tồn tại qua bản phát hành tiếp theo.
Đối với một ứng dụng dành cho người tiêu dùng thì điều đó không sao. Còn với các khối lượng công việc mà mô hình này thực sự nhắm tới — phiên dịch trực tiếp trong tổng đài, một sản phẩm họp, một sản phẩm du lịch — thì đó là rủi ro tích hợp lớn nhất trong ngăn xếp. Bạn đang xây dựng một phụ thuộc sản xuất vào một mô hình mà Google đã tuyên bố rõ ràng là không cam kết.
GPT-Live-1 mắc vấn đề ngược lại, và nó nhỏ hơn nhưng không phải bằng không. Nó được cung cấp rộng rãi, với mức giá được công bố, cùng một endpoint đã được ghi tài liệu, và nó sẽ không biến mất. Nhưng bề mặt API của nó hẹp theo cách khiến các đội ngũ bất ngờ khi họ cho rằng nó có thể cắm thẳng vào một tích hợp OpenAI hiện có: chỉ có đúng một model ID, một endpoint, và không có đường nào qua Chat Completions, Responses, Realtime, Batch, Assistants hay fine-tuning. Cách duy nhất để vào là endpoint Live Sessions tại v1/live/sessions qua WebRTC, với việc xử lý sự kiện trên một data channel. Đó là một tích hợp mới, chứ không phải một thay đổi tham số.

Ngôn ngữ, và những điểm mà người tổng quát thật sự yếu hơn
Con số của Google là hơn 70 ngôn ngữ với khả năng bảo toàn giọng nói và sắc thái. Tài liệu của chính OpenAI tỏ ra kém tự tin hơn hẳn về phạm vi bao phủ của mình: tài liệu ra mắt lưu ý rằng với một số ngôn ngữ, mô hình có thể mang giọng không phải bản ngữ hoặc có những lỗ hổng về độ lưu loát, và hãng không công bố số lượng ngôn ngữ có thể cạnh tranh với Google.
Đó không phải là nhà cung cấp đang nói vòng vo — mà là hình ảnh một mô hình hội thoại đa dụng bên cạnh một chuyên gia được huấn luyện cho chính bài toán đó. Nếu tuyên bố giá trị của sản phẩm bạn là "chúng tôi diễn giải tốt 40 ngôn ngữ", thì chuyên gia là lựa chọn trung thực, còn mô hình đa dụng sẽ khiến bạn bẽ mặt ở phần đuôi dài. Nếu sản phẩm của bạn là một tác nhân thoại cho thị trường nói tiếng Anh với một tính năng dịch gắn thêm, thì những lỗ hổng ngôn ngữ của mô hình đa dụng sẽ không bao giờ lộ ra.
Cả hai mô hình đều đóng dấu thủy vân cho âm thanh được tạo bằng SynthID, điều này quan trọng nếu bạn thuộc một khu vực pháp lý hoặc hợp đồng khách hàng yêu cầu truy xuất nguồn gốc đối với giọng nói tổng hợp. Điểm đó thì hòa.

Nơi kiến trúc uỷ quyền thay đổi bản dựng
Sự khác biệt về cấu trúc giữa hai thứ này là GPT-Live-1 thực chất là hai mô hình với một mối nối ở giữa. Lớp thoại giữ cho cuộc trò chuyện diễn ra liên tục; một mô hình suy luận riêng đảm nhiệm việc tư duy. Mối nối đó chính là nơi nỗ lực kỹ thuật của bạn đổ vào, và cũng là nơi mô hình chi phí trở nên phức tạp.
Điều đáng biết là nửa được giao phó ấy chỉ là một mô hình văn bản thông thường mà bạn có thể định tuyến như bất kỳ mô hình nào khác. GPT-5.6 Terra, backend trong chính ví dụ của OpenAI, được cung cấp qua OrcaRouter với 2,00 USD cho mỗi triệu token đầu vào và 12,00 USD cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 1M token và cả /v1/chat/completions lẫn /v1/responses đều được mở. Nếu bạn muốn thay bộ não suy luận đằng sau một tác nhân thoại — sang một mô hình rẻ hơn cho các cuộc gọi đơn giản, hay một mô hình mạnh hơn cho các tình huống leo thang — thì nửa đó của ngăn xếp vẫn có nhiều lựa chọn, bởi vì nó chỉ là một lệnh gọi API thông thường nằm bên cạnh khoảng 190 mô hình khác trên cùng một khóa.
Phần giọng nói thì không. GPT-Live-1 không có trên OrcaRouter, và Gemini 3.5 Live Translate cũng vậy; cả hai chỉ có sẵn từ nhà cung cấp đã tạo ra chúng. Trong một kiến trúc như thế này, chỗ mà một router khẳng định được vị trí của mình chính là mọi thứ ở hạ nguồn của âm thanh: các mô hình văn bản đảm nhiệm truy xuất, tóm tắt, ghi ngược vào CRM và chuyển cấp, tức là nửa phần hóa đơn mà bạn thực sự có thể hợp nhất vào một khóa và một hóa đơn.
Thực sự nên chọn gì
• Chọn Gemini 3.5 Live Translate nếu dịch thuật chính là sản phẩm, giá mỗi phút quan trọng hơn sự ổn định của hợp đồng, và bạn có thể chịu được việc một mô hình xem trước thay đổi ngay bên dưới bạn. Dự trù ngân sách khoảng 0,037 USD một phút và duy trì một lớp trừu tượng phía trên cuộc gọi để một mô hình GA có thể thay thế nó mà không cần viết lại.
• Chọn GPT-Live-1 nếu bạn cần một tác nhân đàm thoại mà tình cờ có thể dịch, nếu bạn cần gọi hàm và dùng công cụ ngay trong vòng lặp thoại, hoặc nếu một đội thu mua sẽ hỏi điều gì xảy ra khi mô hình bị ngừng cung cấp và bạn cần một câu trả lời tốt hơn "không có gì, chắc vậy."
• Đừng chọn bên nào chỉ vì nó thắng một benchmark. Các benchmark của cả hai bên không thể so sánh với nhau — các số liệu full-duplex của OpenAI là của riêng họ, chưa được bất kỳ bên thứ ba nào tái lập, còn những tuyên bố về ngôn ngữ của Google thì chưa được kiểm chứng trước một mô hình tổng quát trên cùng một tập âm thanh.
Một lưu ý hướng tới tương lai: hai bề mặt này đang hội tụ chứ không phải va chạm nhau. Mô hình dịch của Google vốn đã nằm bên trong Gemini Live, và lớp giọng nói của GPT-Live-1 được thiết kế rõ ràng để có thể đưa các mô hình tiên phong mới vào phía sau nó. Kỳ vọng hợp lý là chỉ trong vài chu kỳ phát hành, khả năng dịch của mô hình đa dụng sẽ tốt lên và câu chuyện tích hợp của mô hình chuyên biệt sẽ bớt may rủi hơn. Nếu bạn đang xây dựng ngay hôm nay và quyết định đang sít sao, thì đó là lý lẽ ủng hộ phương án rẻ hơn, dễ thay thế hơn, và ủng hộ việc giữ đường âm thanh tách biệt sau một giao diện, dù chọn hướng nào.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
