Thẻ tiêu đề hero ghi 'GPT-Live-1 vs Gemini 3.5 Live Translate' với phụ đề 'Một mô hình tổng quát đã phát hành đối đầu với một mô hình chuyên biệt bản xem trước' và dòng 'GA ở mức $0,05 một phút so với bản xem trước ở mức khoảng $0,037 một phút', phía trên hai bảng: bên trái hiển thị dạng sóng âm thanh song công toàn phần với các mũi tên uốn cong theo cả hai hướng và huy hiệu 'GA' đặc, bên phải hiển thị một quả địa cầu với hai bong bóng hội thoại và huy hiệu 'PREVIEW' có viền, với logo OrcaRouter được ghép ở góc.
Guides & Insights

GPT-Live-1 vs Gemini 3.5 Live Translate: Một sản phẩm đa năng đã phát hành đối đầu với một chuyên gia bản xem trước

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình này thường bị đem ra so sánh vì cả hai đều đưa giọng nói thời gian thực vào một API, và sự so sánh đó sụp đổ ngay khi bạn đọc model card. GPT-Live-1 là mô hình giọng nói song công đa dụng mà OpenAI đã đưa vào API dành cho nhà phát triển vào ngày 10 tháng 9 năm 2026, ba tháng sau khi nó ra mắt bên trong ChatGPT vào ngày 8 tháng 7. Gemini 3.5 Live Translate là mô hình dịch âm thanh sang âm thanh chuyên dụng mà Google DeepMind phát hành vào ngày 9 tháng 6 năm 2026, và ID mô hình của nó vẫn mang chữ preview. Một trong hai cái này bạn có thể đặt trước mặt khách hàng trả tiền ngay hôm nay theo một mức giá đã công bố. Cái còn lại thì Google có thể thay đổi dưới chân bạn mà không cần thông báo ngừng hỗ trợ. Chính sự bất đối xứng đó, chứ không phải bảng điểm chuẩn, mới là thứ nên quyết định lựa chọn.

Hai cỗ máy khác nhau cùng mang một nhãn

Thật đáng để nói thẳng rằng những thứ này chồng lấn với nhau ít đến mức nào. Gem​ini 3.5 Live Translate thực hiện dịch thuật. Nó nhận âm thanh streaming ở một ngôn ngữ và trả về âm thanh streaming ở một ngôn ngữ khác, giữ nguyên giọng nói và tông giọng của người nói, trên hơn 70 ngôn ngữ và hơn 2.000 cặp ngôn ngữ, với khả năng tự động phát hiện ngôn ngữ và hoạt động hai chiều. Nó không trò chuyện, không gọi hàm, cũng không trả lời câu hỏi. Nó là một cỗ máy phiên dịch đồng thời.

GPT-Live-1 có hình dạng ngược lại. Nó là một mô hình hội thoại: nó vừa lắng nghe vừa nói cùng lúc, quyết định nhiều lần mỗi giây xem nên tiếp tục lắng nghe, tạm dừng, ngắt lời hay gọi một công cụ, và giao những công việc nặng — tìm kiếm web, suy luận sâu hơn, các tác vụ agentic — cho một mô hình suy luận riêng biệt thông qua Responses API trong khi cuộc hội thoại vẫn tiếp diễn. Ví dụ WebRTC do chính OpenAI công bố kết nối việc ủy thác đó với GPT-5.6 Terra. Dịch thuật là một trong những thứ nó có thể làm; đó không phải là một tính năng mà mô hình của Google có bất kỳ tương đương nào theo chiều ngược lại.

Vậy nên câu hỏi thực tế hẹp hơn so với cuộc đối đầu mà tiêu đề gợi ý: nếu thứ bạn đang xây dựng là phiên dịch, mô hình của Goo​gle được thiết kế chuyên dụng còn của Ope​nAI là đa dụng. Nếu thứ bạn đang xây dựng là một tác nhân thoại đôi khi dịch, GPT-Live-1 là sản phẩm duy nhất trong hai sản phẩm thậm chí còn thuộc đúng loại sản phẩm.

Chi phí của mỗi cái là bao nhiêu cho mỗi phút âm thanh

Đây là lúc chuyên gia chứng tỏ giá trị của mình, và bài toán này thực sự nan giải đối với OpenAI.

• GPT-Live-1 — 0,05 đô la mỗi phút thoại, được tính phí theo từng giây thay vì làm tròn lên phút nguyên tiếp theo. Các suy luận và lệnh gọi công cụ do backend được ủy quyền thực hiện sẽ được tính phí riêng theo mức giá thông thường của mô hình đó.

• Gem​ini 3.5 Live Translate — $3,50 mỗi triệu token đầu vào âm thanh và $21,00 mỗi triệu token đầu ra âm thanh, với chi phí được tính ở mức 25 token mỗi giây âm thanh. Tính gộp lại, con số này rơi vào khoảng $0,037 mỗi phút âm thanh được dịch.

Xét về số phút dịch thuần túy, Google rẻ hơn khoảng một phần tư. Đó không phải là khác biệt do làm tròn ở quy mô lớn: 10.000 phút phiên dịch mỗi tháng tốn khoảng 500 USD cho lớp giọng nói của GPT-Live-1, so với khoảng 368 USD trên Gemini 3.5 Live Translate. Và khoảng cách này là thật chứ không phải hệ quả của việc thay đổi cách tính phí, bởi vì hai mô hình tính phí theo những đơn vị thực sự khác nhau.

Có một cái bẫy ở chiều ngược lại. Mức giá quảng cáo $0.05 cho GPT-Live-1 chỉ là giá của lớp giọng nói. Nếu agent của bạn vừa dịch vừa tra cứu thông tin gì đó, hoặc chuyển một câu khó lên mô hình suy luận, thì bạn còn phải trả thêm cho việc ủy thác đó — và mô hình được ủy thác tính giá theo token như bất kỳ mô hình tiên tiến nào khác. Khối lượng công việc chỉ dịch thì không bao giờ kích hoạt điều đó. Khối lượng công việc dịch cộng thêm bất cứ thứ gì thì có, và bên thắng trong so sánh theo phút không còn rõ ràng nữa.

A two-column comparison scoreboard titled 'GPT-Live-1 vs Gemini 3.5 Live Translate - the scoreboard'. The GPT-Live-1 column lists Status GA, Sept 10; Price $0.05 / minute; Scope conversational agent; Languages limited, vendor-flagged gaps; Tool calling yes, delegated; Tone preservation no. The Gemini 3.5 Live Translate column lists Status preview; Price about $0.037 / minute; Scope translation only; Languages 70+; Tool calling no; Tone preservation yes. A footer reads 'GPT-Live-1 figures per OpenAI; Gemini figures per Google. Different models, different jobs.'

Nhãn xem trước là rủi ro mà không ai định giá vào

Model ID của Gemini 3.5 Live Translate là gemini-3.5-live-translate-preview. Nó đã ra mắt tới Gemini Live API và Google AI Studio dưới dạng bản xem trước công khai, đồng thời có mặt trong ứng dụng Google Translate trên Android và iOS cùng một bản xem trước riêng tư trong Google Meet dành cho một số khách hàng Workspace được chọn. Bản xem trước mang đúng ý nghĩa mà nó vẫn luôn mang tại Google: không đảm bảo tính ổn định, không có khoảng thời gian ngừng hỗ trợ nào được công bố, không cam kết rằng mức giá bạn đang trả sẽ còn tồn tại qua bản phát hành tiếp theo.

Đối với một ứng dụng dành cho người tiêu dùng thì điều đó không sao. Còn với các khối lượng công việc mà mô hình này thực sự nhắm tới — phiên dịch trực tiếp trong tổng đài, một sản phẩm họp, một sản phẩm du lịch — thì đó là rủi ro tích hợp lớn nhất trong ngăn xếp. Bạn đang xây dựng một phụ thuộc sản xuất vào một mô hình mà Google đã tuyên bố rõ ràng là không cam kết.

GPT-Live-1 mắc vấn đề ngược lại, và nó nhỏ hơn nhưng không phải bằng không. Nó được cung cấp rộng rãi, với mức giá được công bố, cùng một endpoint đã được ghi tài liệu, và nó sẽ không biến mất. Nhưng bề mặt API của nó hẹp theo cách khiến các đội ngũ bất ngờ khi họ cho rằng nó có thể cắm thẳng vào một tích hợp OpenAI hiện có: chỉ có đúng một model ID, một endpoint, và không có đường nào qua Chat Completions, Responses, Realtime, Batch, Assistants hay fine-tuning. Cách duy nhất để vào là endpoint Live Sessions tại v1/live/sessions qua WebRTC, với việc xử lý sự kiện trên một data channel. Đó là một tích hợp mới, chứ không phải một thay đổi tham số.

A screenshot of OpenAI's official GPT-Live 1 API model documentation page, showing the model name 'GPT-Live 1', the price '$0.05 per minute', the note that 'Session duration is not rounded up to the next whole minute' and that 'Backend Responses calls use the normal pricing for the configured model and tools', text and audio shown as input and output with image and video marked 'Not supported', and the endpoint list showing only 'Live v1/live/sessions' active while Chat Completions, Responses and Realtime are struck through.

Ngôn ngữ, và những điểm mà người tổng quát thật sự yếu hơn

Con số của Google là hơn 70 ngôn ngữ với khả năng bảo toàn giọng nói và sắc thái. Tài liệu của chính OpenAI tỏ ra kém tự tin hơn hẳn về phạm vi bao phủ của mình: tài liệu ra mắt lưu ý rằng với một số ngôn ngữ, mô hình có thể mang giọng không phải bản ngữ hoặc có những lỗ hổng về độ lưu loát, và hãng không công bố số lượng ngôn ngữ có thể cạnh tranh với Google.

Đó không phải là nhà cung cấp đang nói vòng vo — mà là hình ảnh một mô hình hội thoại đa dụng bên cạnh một chuyên gia được huấn luyện cho chính bài toán đó. Nếu tuyên bố giá trị của sản phẩm bạn là "chúng tôi diễn giải tốt 40 ngôn ngữ", thì chuyên gia là lựa chọn trung thực, còn mô hình đa dụng sẽ khiến bạn bẽ mặt ở phần đuôi dài. Nếu sản phẩm của bạn là một tác nhân thoại cho thị trường nói tiếng Anh với một tính năng dịch gắn thêm, thì những lỗ hổng ngôn ngữ của mô hình đa dụng sẽ không bao giờ lộ ra.

Cả hai mô hình đều đóng dấu thủy vân cho âm thanh được tạo bằng SynthID, điều này quan trọng nếu bạn thuộc một khu vực pháp lý hoặc hợp đồng khách hàng yêu cầu truy xuất nguồn gốc đối với giọng nói tổng hợp. Điểm đó thì hòa.

A screenshot of Google's Gemini Live API overview documentation page, showing the banner 'Preview: The Live API is in Preview', the description that the Live API enables low-latency real-time voice and vision interactions by processing continuous streams of audio, images and text, an architecture diagram in which an app exchanges text, audio and video with the Live API over a WebSocket, and a left navigation listing Live translate under Live.

Nơi kiến trúc uỷ quyền thay đổi bản dựng

Sự khác biệt về cấu trúc giữa hai thứ này là GPT-Live-1 thực chất là hai mô hình với một mối nối ở giữa. Lớp thoại giữ cho cuộc trò chuyện diễn ra liên tục; một mô hình suy luận riêng đảm nhiệm việc tư duy. Mối nối đó chính là nơi nỗ lực kỹ thuật của bạn đổ vào, và cũng là nơi mô hình chi phí trở nên phức tạp.

Điều đáng biết là nửa được giao phó ấy chỉ là một mô hình văn bản thông thường mà bạn có thể định tuyến như bất kỳ mô hình nào khác. GPT-5.6 Terra, backend trong chính ví dụ của Ope​nAI, được cung cấp qua OrcaRouter với 2,00 USD cho mỗi triệu token đầu vào và 12,00 USD cho mỗi triệu token đầu ra, cùng cửa sổ ngữ cảnh 1M token và cả /v1/chat/completions lẫn /v1/responses đều được mở. Nếu bạn muốn thay bộ não suy luận đằng sau một tác nhân thoại — sang một mô hình rẻ hơn cho các cuộc gọi đơn giản, hay một mô hình mạnh hơn cho các tình huống leo thang — thì nửa đó của ngăn xếp vẫn có nhiều lựa chọn, bởi vì nó chỉ là một lệnh gọi API thông thường nằm bên cạnh khoảng 190 mô hình khác trên cùng một khóa.

Phần giọng nói thì không. GPT-Live-1 không có trên OrcaRouter, và Gem​ini 3.5 Live Translate cũng vậy; cả hai chỉ có sẵn từ nhà cung cấp đã tạo ra chúng. Trong một kiến trúc như thế này, chỗ mà một router khẳng định được vị trí của mình chính là mọi thứ ở hạ nguồn của âm thanh: các mô hình văn bản đảm nhiệm truy xuất, tóm tắt, ghi ngược vào CRM và chuyển cấp, tức là nửa phần hóa đơn mà bạn thực sự có thể hợp nhất vào một khóa và một hóa đơn.

Thực sự nên chọn gì

• Chọn Gem​ini 3.5 Live Translate nếu dịch thuật chính là sản phẩm, giá mỗi phút quan trọng hơn sự ổn định của hợp đồng, và bạn có thể chịu được việc một mô hình xem trước thay đổi ngay bên dưới bạn. Dự trù ngân sách khoảng 0,037 USD một phút và duy trì một lớp trừu tượng phía trên cuộc gọi để một mô hình GA có thể thay thế nó mà không cần viết lại.

• Chọn GPT-Live-1 nếu bạn cần một tác nhân đàm thoại mà tình cờ có thể dịch, nếu bạn cần gọi hàm và dùng công cụ ngay trong vòng lặp thoại, hoặc nếu một đội thu mua sẽ hỏi điều gì xảy ra khi mô hình bị ngừng cung cấp và bạn cần một câu trả lời tốt hơn "không có gì, chắc vậy."

• Đừng chọn bên nào chỉ vì nó thắng một benchmark. Các benchmark của cả hai bên không thể so sánh với nhau — các số liệu full-duplex của OpenAI là của riêng họ, chưa được bất kỳ bên thứ ba nào tái lập, còn những tuyên bố về ngôn ngữ của Google thì chưa được kiểm chứng trước một mô hình tổng quát trên cùng một tập âm thanh.

Một lưu ý hướng tới tương lai: hai bề mặt này đang hội tụ chứ không phải va chạm nhau. Mô hình dịch của Google vốn đã nằm bên trong Gemini Live, và lớp giọng nói của GPT-Live-1 được thiết kế rõ ràng để có thể đưa các mô hình tiên phong mới vào phía sau nó. Kỳ vọng hợp lý là chỉ trong vài chu kỳ phát hành, khả năng dịch của mô hình đa dụng sẽ tốt lên và câu chuyện tích hợp của mô hình chuyên biệt sẽ bớt may rủi hơn. Nếu bạn đang xây dựng ngay hôm nay và quyết định đang sít sao, thì đó là lý lẽ ủng hộ phương án rẻ hơn, dễ thay thế hơn, và ủng hộ việc giữ đường âm thanh tách biệt sau một giao diện, dù chọn hướng nào.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày