
Breeze TTS 2: Tân thủ lĩnh TTS trọng số mở mới với 1.215 Elo
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 523 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 187 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
Breeze TTS 2 hiện là mô hình chuyển văn bản thành giọng nói có trọng số mở được xếp hạng cao nhất trên Provider Voices Speech Arena của Artificial Analysis, giữ 1.215 Elo — vượt 90 điểm so với người dẫn đầu trọng số mở trước đó là Fish Audio S2 Pro, và xếp thứ 6 tổng thể trong số hơn 100 hệ thống được đánh giá. Bảng xếp hạng này là sự xác nhận độc lập đầu tiên cho điều mà BreezeBlue đã tuyên bố kể từ khi ra mắt mô hình vào giữa tháng 8 năm 2026: rằng một mô hình giọng nói mới chỉ hai tuần tuổi từ một công ty khởi nghiệp khoảng 15 người có thể sánh vai với các mô hình chuyển văn bản thành giọng nói thương mại tiên tiến. Các trọng số mở đã được đăng tải trên Hugging Face vào ngày 25 tháng 8 năm 2026; kết quả trên đấu trường xuất hiện trong vòng một ngày. Dù sau này Breeze TTS 2 có trở thành gì đi nữa, nó không còn là lời hứa của nhà cung cấp — nó có một chỉ số Elo khẳng định điều đó.
Điều gì thực sự đã xảy ra, theo thứ tự
Thời gian (dòng thời gian) quan trọng ở đây, vì nó giải thích tại sao một bài đăng về "bảng xếp hạng trọng số mở" lại đến từ một công ty mà ba tuần trước hầu hết mọi người chưa từng nghe đến. BreezeBlue được thành lập bởi Yang Bin, cựu đồng sáng lập kỹ thuật của một trong những phòng thí nghiệm AI hàng đầu Trung Quốc, với vòng hạt giống 6 triệu USD do Yuanjing Capital và Redpoint China dẫn đầu. Mô hình đã trải qua ba cột mốc rõ ràng:
• Ngày 7 tháng 8 năm 2026 — BreezeBlue đã công bố bộ tiêu chuẩn đánh giá chuyển văn bản thành giọng nói của riêng mình cho thiết kế giọng nói, định hướng giọng nói và đánh giá độ trễ trên Hugging Face.
• Ngày 16–17 tháng 8 năm 2026 — công ty chính thức công bố Breeze TTS 2 như một mô hình giọng nói hàng đầu theo thời gian thực cho phương tiện tương tác, đồng thời mở một API lưu trữ với mức phí 34 đô la mỗi 1 triệu ký tự.
• Ngày 25 tháng 8 năm 2026 — trọng số và mã suy luận PyTorch đã được mã nguồn mở trên Hugging Face với tên BreezeBlue/Breeze-TTS-2, một mô hình 3B tham số theo giấy phép nghiên cứu và phi thương mại.
Bảng xếp hạng Artificial Analysis Provider Voices đã được công bố chỉ vài ngày sau khi bản open-weights ra mắt. Vì đấu trường chấm điểm các mô hình dựa trên việc nghe so sánh mù song song, mức Elo 1.215 không phải là một benchmark mà BreezeBlue tự chạy trên chính mình — đó là sự đánh giá tích lũy từ những người nghe so sánh các mẫu thực tế, điều mà một mô hình non trẻ như thế này còn thiếu nhất.
Bảng tỷ số

• Xếp hạng Arena — #6 tổng thể trên Provider Voices; #1 trong số tất cả các mô hình open-weights, xếp trên Fish Audio S2 Pro (1.125 Elo).
• Elo — 1.215, với khoảng tin cậy 95% xấp xỉ ±17 (Artificial Analysis, tính đến cuối tháng 8 năm 2026).
• Ngôn ngữ — 50, theo BreezeBlue; thẻ mô hình được gắn nhãn tiếng Anh và tiếng Trung.
• Giá — $34 cho mỗi 1 triệu ký tự trên endpoint lưu trữ của BreezeBlue; các trọng số mở có thể tải xuống miễn phí nhưng đi kèm giấy phép phi thương mại.
• Tốc độ — khoảng 45 ký tự mỗi giây theo đo lường của Artificial Analysis — chậm hơn một số đối thủ, điều này quan trọng đối với các tác vụ dài.
• Độ trễ — độ trễ phát trực tuyến dưới 40ms, theo BreezeBlue (do nhà cung cấp công bố, chưa được đo lường độc lập).

Điều mà Breeze TTS 2 thực sự làm khác biệt
Elo là điểm nhấn, nhưng tuyên bố về sản phẩm thú vị hơn điểm số. Breeze TTS 2 được xây dựng xoay quanh hai ý tưởng mà hầu hết các mô hình chuyển văn bản thành giọng nói chỉ xem như thứ yếu: thiết kế giọng nói và định hướng giọng nói. Thiết kế giọng nói là zero-shot và không cần mẫu tham chiếu — bạn mô tả một giọng nói bằng ngôn ngữ tự nhiên ("một người dẫn truyện ấm áp, khoảng giữa tuổi 40, giọng hơi luyến láy miền Nam và hóm hỉnh khô khan") và mô hình sẽ tạo ra giọng nói đó mà không cần bản ghi âm phòng thu hay clip tham chiếu. Định hướng giọng nói tách biệt âm sắc của người nói khỏi ý định truyền tải, để bạn có thể khiến một câu thoại nghe có vẻ châm biếm, thì thầm hoặc gấp gáp mà mô hình không lệch sang một nhân vật khác. BreezeBlue cho biết danh tính người nói vẫn được giữ nguyên khi thay đổi, và chuẩn đánh giá định hướng giọng nói của họ báo cáo độ tương đồng người nói là 0.67 SPK_SIM (theo công bố của nhà cung cấp).
Hai khả năng đó chỉ ra thị trường mục tiêu mà Breeze TTS 2 nhắm tới. Các tài liệu báo chí nêu rõ: nhân vật trò chơi điện tử, bạn đồng hành kỹ thuật số, kể chuyện theo cốt truyện, kịch truyền hình phát sóng và streamer ảo — âm thanh dài hơi, theo vai diễn, đa nhân vật, chứ không chỉ là một API tường thuật thông thường. Công ty cung cấp một thư viện giọng nói đi kèm có tên Voice Galaxy với hơn 15.000 giọng nhân vật do cộng đồng và phòng thu tạo ra, và cuộn băng demo của BreezeBlue là một vở kịch radio nghiệp dư đa nhân vật kéo dài hơn mười phút. Trong các điểm chuẩn tự công bố (do hãng báo cáo, chưa được tái lập), Breeze TTS 2 tuyên bố giữ vị trí số 1 trên điểm chuẩn Voice Design cho chuyển văn bản thành giọng nói với điểm Role Fit là 78,02 so với 72,78 của MiMo-V2.5-TTS, và điểm tổng hợp Voice Direction là 4,25.
Dấu hoa thị của giấy phép
Trước khi cụm từ "open weights" được dùng quá nhiều cho mục đích tiếp thị, hãy đọc thẻ mô hình. Breeze TTS 2 có 3B tham số, định dạng safetensors, F32/BF16, và mã nguồn là Apache 2.0 — nhưng các trọng số, mô hình phái sinh và đầu ra tự lưu trữ chỉ được cấp phép cho nghiên cứu và sử dụng phi thương mại, theo giấy phép breezeblue-research-and-non-commercial-license. Điều đó có nghĩa "open weights" ở đây không phải là "miễn phí cho sản phẩm của bạn". Việc tự lưu trữ vì mục đích thương mại không được phép theo đúng văn bản giấy phép; con đường thương mại là API được lưu trữ với giá $34 cho mỗi 1 triệu ký tự. Đây là hình thức tương tự như một số bản phát hành mở khác năm 2026 — có thể kiểm tra và tự lưu trữ cho nghiên cứu, nhưng việc sử dụng tạo doanh thu được dành riêng cho endpoint của chính nhà cung cấp.
Tại sao một bộ định tuyến lại quan trọng với một người mẫu trẻ như vậy
Rủi ro thực sự với Breeze TTS 2 hiện tại không phải là chất lượng — mà là độ tuổi của mô hình. Mô hình đã hoạt động được mười ngày, còn bộ trọng số mới có hai ngày. Không một đội ngũ sản xuất nào nên đặt cược một đường ống xử lý giọng nói vào một mô hình non trẻ như vậy mà không có phương án rút lui, và đó chính xác là kiểu thất bại mà một tầng định tuyến tồn tại để hấp thụ. Nếu bạn đánh giá Breeze TTS 2 thông qua một cổng gateway coi endpoint của nhà cung cấp chỉ là một tuyến trong nhiều tuyến, bạn sẽ có được mô hình dẫn đầu Elo hôm nay, khả năng tự động chuyển đổi dự phòng sang nhà cung cấp thay thế khi API bị suy giảm, và chỉ cần thay đổi một dòng mã nếu một mô hình mới một tuần có dấu hiệu suy thoái. Đó chính là kỷ luật mà DSL định tuyến áp dụng cho mọi mô hình: kết hợp nó với các lựa chọn thay thế, giữ giao diện ổn định, và để mô hình tự chứng minh trước khi bạn cho nó gánh vác trọng trách. Chưa có mô hình nào trong chuỗi này được định tuyến trên chính OrcaRouter, vì vậy lời khuyên thật lòng là hãy kết nối Breeze TTS 2 vào bất kỳ gateway nào bạn đang vận hành — và giữ nhà cung cấp hiện tại hoạt động song song trong khi chỉ số Elo trở nên cũ hơn và đáng tin cậy hơn.
Xem gì tiếp theo
Vị trí #1-open-weights trên đấu trường Provider Voices đang là câu chuyện của ngày hôm nay, nhưng đây lại là đấu trường yếu hơn trong hai đấu trường của mô hình này. Trên đấu trường Controlled Voice của Artificial Analysis — nơi mọi mô hình được so sánh trên cùng một bộ giọng tham chiếu cố định — Breeze TTS 2 xếp #3 trong nhóm open-weights với 1.002 Elo, sau Voxtral của Mistral ở mức 1.010, và #16 toàn bảng trong tổng số 39 mô hình. Khoảng cách giữa điểm provider-voice (1.215, #1 open) và điểm controlled-voice (1.002, #3 open) đáng để theo dõi: nó cho thấy lợi thế của Breeze TTS 2 tập trung ở những giọng nói mà mô hình tự thiết kế cho riêng mình — đúng như tuyên bố của sản phẩm, và cũng chính là tuyên bố mà một chuẩn so sánh độc lập cần liên tục gây áp lực. Hãy để ý xem Elo controlled-voice có thu hẹp khoảng cách tiến về con số provider-voice hay không, giấy phép thương mại bị siết chặt hay nới lỏng, và — trên hết — liệu có ai tái tạo các bài benchmark thiết kế giọng nói và định hướng giọng nói bên ngoài bộ thử nghiệm của riêng BreezeBlue hay không.
Chưa đầy một tháng kể từ khi ra mắt, Breeze TTS 2 đã đạt được thứ hữu ích nhất mà một mô hình chuyển văn bản thành giọng nói có thể có: điểm số độc lập khớp với những gì nhà sản xuất quảng cáo. Liệu nó có trở thành giọng đọc mặc định cho các sản phẩm tương tác hay không phụ thuộc ít vào bản cập nhật Elo tiếp theo mà nhiều hơn vào cách giấy phép và câu chuyện tự lưu trữ phát triển — nhưng tính đến tuần này, mô hình chuyển văn bản thành giọng nói mã mở đã có một người dẫn đầu mới, và nó mới chỉ hai tuần tuổi.

