
GPT-Live-1 vs Breeze TTS 2: Kẻ dẫn đầu giọng nói trọng số mở mà bạn không thể phát hành
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Breeze TTS 2 là mô hình chuyển văn bản thành giọng nói với trọng số mở được đánh giá cao nhất trên Provider Voices Speech Arena của Artificial Analysis, giữ 1.205 Elo và đứng thứ bảy chung cuộc trong số hơn một trăm hệ thống được đánh giá — xếp trên mọi engine được cấp phép thương mại có công bố trọng số. Trọng số của nó đã có thể tải xuống kể từ ngày 25 tháng 8 năm 2026. Đồng thời, theo giấy phép đi kèm với những trọng số đó, nó không thể dùng được trong một sản phẩm. GPT-Live-1 là sự đánh đổi ngược lại ở mọi khía cạnh: đóng, được lưu trữ, tính phí $0.05 mỗi phút thoại kể từ khi nó có mặt trên API dành cho nhà phát triển của OpenAI vào ngày 10 tháng 9 năm 2026, và là mô hình duy nhất trong hai mô hình có thể nghe thấy người gọi ngắt lời nó.
Đặt hai câu đó cạnh nhau và sự so sánh sẽ ngã ngũ nhanh hơn hầu hết các màn đối đầu giữa các mô hình. Đây không phải là cuộc chiến xem ai tổng hợp giọng nói tốt hơn. Đó là cuộc chiến xem bạn đang mua một giọng nói hay một cuộc trò chuyện, và liệu “mở” có nghĩa là điều bạn vẫn tưởng hay không.
Chúng không phải cùng một loại thứ, và đó chính là ý nghĩa
Breeze TTS 2, đến từ một startup với khoảng mười lăm người có tên BreezeBlue, là một mô hình chuyển văn bản thành giọng nói 3 tỷ tham số. Văn bản đi vào, âm thanh phát ra. Nó không nghe thấy gì cả. Nó không có ý kiến gì về thời điểm một lượt nên kết thúc, bởi vì nó không có khái niệm về lượt. Khi được truyền trực tuyến qua WebSocket, nó sẽ bắt đầu tạo âm thanh trước khi văn bản của bạn được tạo xong, điều này thực sự hữu ích để giữ nhịp độ của tác nhân thoại được chặt chẽ — nhưng quyết định nói khi nào là do thứ đã viết văn bản đưa ra.
GPT-Live-1 là một mô hình giọng nói sang giọng nói song công hoàn toàn. Âm thanh và văn bản đi vào; âm thanh và văn bản đi ra; và mô hình quyết định nhiều lần mỗi giây xem nên tiếp tục lắng nghe, tạm dừng, giành lượt nói, hay nhường lượt. Những con số của Full Duplex Bench v1.5 do chính OpenAI công bố cùng bản phát hành và không được tái tạo bên ngoài công ty, cho thấy mức độ tương tác của nó đạt 80,1% so với 45,4% của GPT-Realtime-2.1, với độ trễ chuyển lượt là 0,798 giây so với 1,41.
Sự bất đối xứng đó không phải là lời chê Breeze TTS 2. Đó là lời cảnh báo về việc mỗi thứ thuộc về đâu trong một ngăn xếp. Nếu bạn đang xây dựng một chuỗi xếp tầng — nhận dạng giọng nói đưa vào mô hình ngôn ngữ, rồi mô hình ngôn ngữ đưa vào bộ tổng hợp — thì Breeze TTS 2 là ứng viên cho một phần ba cuối của chuỗi đó. Nếu bạn mua GPT-Live-1, bạn đang mua toàn bộ vòng lặp và giao luôn logic luân phiên lượt nói cùng với nó.
Từng chiều một
• Mô hình tương tác — GPT-Live-1: song công toàn phần, ngắt lời tích hợp sẵn, nghe trong khi nói so với Breeze TTS 2: chuyển văn bản thành giọng nói dạng truyền phát, hoàn toàn không có đầu vào âm thanh
• Trọng số — GPT-Live-1: đóng, chỉ có bản chạy trên dịch vụ lưu trữ, một ID mô hình duy nhất và không có snapshot gắn ngày, so với Breeze TTS 2: 3B tham số trên Hugging Face kể từ ngày 25 tháng 8 năm 2026, mã suy luận PyTorch theo Apache-2.0
• Giấy phép — GPT-Live-1: các điều khoản thương mại thông qua API của OpenAI, không có gì phải xem xét so với Breeze TTS 2: giấy phép nghiên cứu và phi thương mại bao trùm các trọng số, bản tinh chỉnh, LoRA, bản hợp nhất, bản lượng tử hóa và các đầu ra tự lưu trữ
• Đơn vị tính giá — GPT-Live-1: $0.05 mỗi phút thoại, tính phí theo từng giây, backend reasoning được tính riêng, so với Breeze TTS 2: $34 mỗi triệu ký tự trên hosted endpoint, giảm bậc xuống còn $28 ở gói cao nhất được công bố
• Bằng chứng chất lượng — GPT-Live-1: 70,3% trên Chỉ số Speech to Speech của Artificial Analysis, đồng hạng sáu trong số mười bốn mô hình được chấm điểm, so với Breeze TTS 2: 1.205 Elo trên đấu trường Provider Voices, thứ bảy chung cuộc và đứng đầu trong số các mô hình trọng số mở, theo Artificial Analysis
• Ngôn ngữ — GPT-Live-1: các bài đưa tin về ra mắt đều nhất quán chỉ ra độ trôi chảy không đồng đều bên ngoài các ngôn ngữ chính, so với Breeze TTS 2: 50 ngôn ngữ do nhà cung cấp tuyên bố, với thẻ mô hình được gắn nhãn cho tiếng Anh và tiếng Trung
• Điều khiển giọng nói — GPT-Live-1: mười hai giọng API, tông giọng và tốc độ được điều khiển bằng prompt, hoàn toàn không nhân bản giọng so với Breeze TTS 2: nhân bản từ âm thanh tham chiếu, thiết kế giọng không cần tham chiếu, chỉ dẫn giọng nói và các sự kiện giọng nói nội tuyến
• Thông lượng — GPT-Live-1: được đo đếm theo số phiên đồng thời, giới hạn ở 25 ở gói 1 và 500 ở gói 5, không có gói miễn phí so với Breeze TTS 2: khoảng 45 ký tự mỗi giây theo đo lường của Artificial Analysis, chậm hơn một số đối thủ thương mại và điều này quan trọng đối với công việc dạng dài

Giấy phép đang gánh vác nhiều hơn cả bảng xếp hạng
Thẻ mô hình của chính BreezeBlue nói thẳng thắn một cách bất thường về điều này, và đó là điểm đáng ghi nhận cho công ty. Mã suy luận là Apache-2.0. Các trọng số và bất kỳ đầu ra nào bạn tạo ra bằng cách tự lưu trữ chúng đều dành cho mục đích nghiên cứu, và việc triển khai thương mại yêu cầu hoặc một thuê bao dịch vụ lưu trữ trả phí hoặc sự cho phép bằng văn bản. Hạn chế đó mở rộng một cách rõ ràng đến các mô hình phái sinh, LoRA, hợp nhất và lượng tử hóa — điều này bịt kín lỗ hổng mà mọi người thường tìm đến.
Vậy nên cách định vị “kẻ dẫn đầu về trọng số mở” cần một yếu tố hạn định mà các tiêu đề hiếm khi mang theo. Breeze TTS 2 là mở theo nghĩa bạn có thể tải nó về, kiểm tra nó, chạy kiểm thử hiệu năng cho nó và chạy nó trên phần cứng của riêng bạn để đánh giá. Nó không mở theo nghĩa cho phép một startup xây dựng sản phẩm dựa trên nó mà không phải trả tiền cho BreezeBlue hoặc mua dịch vụ rà soát pháp lý. Hai trong ba điều người ta hàm ý khi nói về trọng số mở — khả năng kiểm chứng và chi phí — thì bạn có. Điều thứ ba — quyền tự do phát hành — thì bạn không có.
Đó là một sự khác biệt thực sự so với một mô hình như GPT-Live-1, nơi câu hỏi về giấy phép không phải là "tôi có được phép không" mà là "bao nhiêu". Cả hai đều kết thúc bằng một hóa đơn. Chỉ một trong số chúng kết thúc bằng ý kiến của luật sư trước tiên.

Hai đơn vị giá không so sánh được với nhau, nên đây là phép tính.
$0.05 một phút và $34 mỗi triệu ký tự trông như thể chúng thuộc về những vũ trụ khác nhau — vì thực tế là vậy. Để so sánh chúng, bạn phải quy đổi. Lời nói chạy ở tốc độ khoảng 150 từ một phút, và tiếng Anh trung bình khoảng năm phẩy năm ký tự mỗi từ khi tính cả dấu cách, nên một phút đầu ra dạng nói tương đương khoảng 800 đến 900 ký tự. Với mức $34 mỗi triệu của Breeze TTS 2, đó là khoảng ba xu tổng hợp cho mỗi phút — rẻ hơn mức năm xu của GPT-Live-1, tính trên phần lời nói thô.
Phép so sánh lập tức sụp đổ ngay sau đó, bởi vì năm xu của GPT-Live-1 bao gồm cả việc nghe. Nó cũng đang phiên âm người gọi, quyết định khi nào lượt nói kết thúc và quản lý việc ngắt lời — công việc mà một cascade phải mua từ nơi khác: một mô hình nhận dạng giọng nói, một mô hình phát hiện lượt nói và một mô hình ngôn ngữ để tạo ra văn bản mà Breeze TTS 2 sẽ đọc. Cộng thêm những thứ đó, ba xu tiền tổng hợp của cascade nằm dưới một hóa đơn thường lớn hơn hóa đơn của mô hình end-to-end.
Tóm tắt trung thực là giọng nói rẻ hơn là Breeze TTS 2 và cuộc trò chuyện rẻ hơn là GPT-Live-1, và sự khác biệt giữa hai tuyên bố đó chính là toàn bộ chi phí thực tế của một tác nhân thoại.

Nơi mà họ thực sự sẽ gặp nhau
Một đội ngũ đang xây dựng một agent điện thoại ngày nay và không muốn cam kết với stack đầu-cuối của một nhà cung cấp sẽ lắp ghép chính xác chuỗi tầng này: Breeze TTS 2 hoặc một engine tương đương cho miệng, một thứ khác cho tai, và một mô hình ngôn ngữ được định tuyến cho phần suy nghĩ. Phần cuối cùng trong ba phần đó là phần thay đổi thường xuyên nhất — đó là nơi chất lượng cải thiện nhanh nhất, nơi chi phí biến động nhiều nhất, và nơi mô hình thắng trong quý này hiếm khi là mô hình thắng trong quý sau.
Lớp đó là một lệnh gọi API thông thường, và đây là phần duy nhất của ngăn xếp này đáng để giữ ở dạng có thể di chuyển linh hoạt. Khoảng 190 mô hình từ mười một nhà cung cấp thượng nguồn nằm sau một khóa OrcaRouter duy nhất với mức giá niêm yết của nhà cung cấp và không phụ thu, nên việc hoán đổi mô hình suy luận đằng sau một tác nhân thoại chỉ là một thay đổi cấu hình chứ không phải một dự án tích hợp, đồng thời cơ chế chuyển đổi dự phòng tự động giữ cho một backend bị hết thời gian chờ không làm rớt cuộc gọi. Cả điểm cuối Live Sessions của GPT-Live-1 lẫn API lưu trữ của Breeze TTS 2 đều không thể truy cập theo cách đó — các lớp thoại trong so sánh này nằm ngoài tầm với của một lớp định tuyến, và cần nói rõ điều đó thay vì ngụ ý ngược lại.
Chọn cái nào?
Hãy chọn GPT-Live-1 nếu cuộc hội thoại chính là sản phẩm và bạn có thể chấp nhận một giao diện người dùng đóng, được host. Tổng đài đặt chỗ, hỗ trợ tuyến đầu, bất kỳ trường hợp nào mà việc người gọi nói chồng lên agent là chuyện bình thường chứ không phải ngoại lệ. Bạn đang mua khả năng xử lý ngắt lời, và bạn đang mua nó với mức giá theo phút luôn dễ dự đoán, trong khi phần suy luận đằng sau nó là phần bạn tinh chỉnh.
Chọn Breeze TTS 2 nếu bạn cần một giọng nói mà bạn có thể kiểm tra, nếu bạn đang xây dựng một sản phẩm mà trong đó tổng hợp giọng nói chỉ là một thành phần trong nhiều thành phần, hoặc nếu bạn cần nhân bản giọng nói và thiết kế giọng nói mà GPT-Live-1 hoàn toàn không cung cấp. Hãy bắt đầu với hiểu biết rằng các trọng số là để nghiên cứu, rằng tuyên bố 50 ngôn ngữ là tuyên bố của nhà cung cấp đối chiếu với một thẻ được gắn nhãn cho hai ngôn ngữ, và rằng các số liệu độ trễ là đo lường của chính BreezeBlue trên một đường dẫn nhanh đã được làm nóng, chứ không phải là một cuộc kiểm toán độc lập.
Bản năng coi đây là một cuộc thi chất lượng là bản năng sai lầm. Breeze TTS 2 đang ở gần đỉnh của bảng mà nó cạnh tranh, còn GPT-Live-1 cạnh tranh trên một bảng hoàn toàn khác. Quyết định thực sự tốn tiền là quyết định nằm bên dưới cả hai: mô hình nào đảm nhiệm việc suy nghĩ, và liệu bạn có thể đổi ý về điều đó trong một buổi chiều hay không.
