Breeze TTS 2 — ผู้นำ TTS โอเพนเวตคนใหม่ที่ 1,215 Elo ภาพประกอบที่สร้างใหม่
Guides & Insights

Breeze TTS 2: ผู้นำ TTS โอเพนเวตตัวใหม่ที่ 1,215 Elo

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Breeze TTS 2 ขณะนี้เป็นโมเดลข้อความเป็นคำพูดแบบเปิดน้ำหนัก (open-weights) ที่ได้รับการจัดอันดับสูงสุดบน Provider Voices Speech Arena ของ Artificial Analysis โดยครอง 1,215 Elo — ห่างจากผู้นำโมเดลเปิดน้ำหนักคนก่อนอย่าง Fish Audio S2 Pro ถึง 90 คะแนน และอยู่อันดับ #6 โดยรวมจากระบบที่ได้รับการจัดอันดับมากกว่า 100 ระบบ การจัดอันดับนี้คือการยืนยันอย่างเป็นอิสระครั้งแรกต่อสิ่งที่ BreezeBlue อ้างไว้ตั้งแต่เปิดตัวโมเดลในกลางเดือนสิงหาคม 2026 นั่นคือ โมเดลเสียงที่มีอายุเพียงสองสัปดาห์จากสตาร์ทอัพขนาดประมาณ 15 คน สามารถเทียบเคียงได้กับแนวหน้าของเทคโนโลยีข้อความเป็นคำพูดเชิงพาณิชย์ น้ำหนักแบบเปิดถูกเผยแพร่บน Hugging Face เมื่อวันที่ 25 สิงหาคม 2026 และผลอารีน่าก็ตามมาในวันถัดมา ไม่ว่า Breeze TTS 2 จะกลายเป็นอะไรในท้ายที่สุด มันไม่ใช่เพียงคำมั่นสัญญาจากผู้ผลิตอีกต่อไป — มันมีค่า Elo ที่ยืนยันได้แล้ว

สิ่งที่เกิดขึ้นจริงตามลำดับ

ลำดับเวลามีความสำคัญในที่นี้ เพราะมันอธิบายว่าทำไมโพสต์เกี่ยวกับ "open weights leaderboard" ถึงมาจากบริษัทที่คนส่วนใหญ่ไม่เคยได้ยินชื่อเมื่อสามสัปดาห์ก่อน BreezeBlue ก่อตั้งโดย Yang Bin อดีตผู้ร่วมก่อตั้งฝ่ายเทคนิคของหนึ่งในห้องแล็บ AI ชั้นนำของจีน ด้วยเงินทุนรอบ Seed มูลค่า 6 ล้านดอลลาร์ นำโดย Yuanjing Capital และ Redpoint China โมเดลดังกล่าวผ่านเหตุการณ์สำคัญที่มองเห็นได้สามขั้นตอน:

• 7 สิงหาคม 2026 — BreezeBlue เผยแพร่ชุดเกณฑ์มาตรฐานข้อความเป็นเสียงพูดของตัวเองสำหรับการออกแบบเสียง การกำหนดทิศทางเสียง และการประเมินความหน่วงบน Hugging Face

• 16–17 สิงหาคม 2026 — บริษัทได้ประกาศอย่างเป็นทางการว่า Breeze TTS 2 เป็นโมเดลเสียงระดับเรือธงแบบเรียลไทม์สำหรับสื่อเชิงโต้ตอบ และเปิดให้บริการ API แบบโฮสต์ในราคา $34 ต่อ 1 ล้านตัวอักษร

วันที่ 25 สิงหาคม 2026 — น้ำหนักโมเดลและโค้ดการอนุมาน PyTorch ถูกเปิดเป็นโอเพนซอร์สบน Hugging Face ในชื่อ BreezeBlue/Breeze-TTS-2 ซึ่งเป็นโมเดลขนาด 3B พารามิเตอร์ภายใต้ใบอนุญาตสำหรับการวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์

การจัดอันดับ Artificial Analysis Provider Voices เปิดให้ใช้งานภายในไม่กี่วันนับจากที่เปิดตัว open-weights เนื่องจากเวทีนี้ให้คะแนนโมเดลด้วยการฟังแบบปกปิดเปรียบเทียบเคียงข้างกัน ค่า Elo 1,215 จึงไม่ใช่เกณฑ์วัดที่ BreezeBlue ใช้ประเมินตัวเอง แต่เป็นดุลยพินิจสะสมของผู้ฟังที่เปรียบเทียบตัวอย่างเสียงจริง ซึ่งเป็นสิ่งที่โมเดลอายุน้อยเช่นนี้ขาดมากที่สุด

กระดานคะแนน

A single-column scoreboard titled 'Breeze TTS 2 — the scoreboard' showing arena rank #6 overall and #1 open weights, Elo 1,215, 50 languages, price $34 per 1M characters, speed ~45 chars/s, and sub-40ms streaming latency (vendor-stated), with a footer noting Elo is per Artificial Analysis.

• อันดับ Arena — อันดับ #6 โดยรวมบน Provider Voices; #1 ในบรรดาโมเดล open-weights ทั้งหมด เหนือกว่า Fish Audio S2 Pro (1,125 Elo)

• Elo — 1,215 โดยมีช่วงความเชื่อมั่น 95% อยู่ที่ประมาณ ±17 (Artificial Analysis ณ ปลายเดือนสิงหาคม 2026)

• ภาษา — 50 ตาม BreezeBlue; การ์ดโมเดลถูกแท็กเป็นภาษาอังกฤษและภาษาจีน

• ราคา — $34 ต่อ 1M ตัวอักษรบน hosted endpoint ของ BreezeBlue; open weights ดาวน์โหลดได้ฟรีแต่มีใบอนุญาตแบบไม่ใช่เชิงพาณิชย์

• ความเร็ว — ~45 ตัวอักษรต่อวินาทีตามการวัดของ Artificial Analysis — ช้ากว่าคู่แข่งหลายราย ซึ่งสำคัญสำหรับงานแบบยาว.

• เวลาแฝง — ความหน่วงในการสตรีมต่ำกว่า 40 มิลลิวินาที ตามที่ BreezeBlue ระบุ (จากผู้ผลิต ไม่ได้วัดโดยอิสระ)

A screenshot of the Artificial Analysis Provider Voices Speech Arena leaderboard (captured August 26 2026) showing BreezeBlue Breeze TTS 2 ranked #6 at 1,215 Elo with an Open Weights tag, behind Cartesia Sonic 3.6 (1,283) and Qwen-Audio-3.0-TTS-Plus (1,238), with ElevenLabs Eleven v3 further down at 1,177, each row listing provider API price per 1M characters.

จริงๆ แล้ว Breeze TTS 2 ทำสิ่งที่แตกต่างออกไปอย่างไร

ค่า Elo ถูกยกให้เป็นหัวข้อข่าว แต่ข้อกล่าวอ้างของผลิตภัณฑ์น่าสนใจกว่าคะแนนเสียอีก Breeze TTS 2 สร้างขึ้นจากแนวคิดสองประการที่โมเดลข้อความเป็นเสียงส่วนใหญ่ถือเป็นเรื่องรอง: การออกแบบเสียง และ การกำหนดทิศทางเสียง. การออกแบบเสียงเป็นแบบ zero-shot และไม่ต้องใช้เสียงอ้างอิง — คุณอธิบายเสียงด้วยภาษาธรรมชาติ ("ผู้บรรยายวัย 40 กลางๆ น้ำเสียงอบอุ่น มีสำเนียงใต้เล็กน้อยและมุกแห้ง") และโมเดลจะสร้างเสียงนั้นขึ้นมาโดยไม่ต้องมีการบันทึกในสตูดิโอหรือคลิปอ้างอิง การกำหนดทิศทางเสียงแยกสีเสียงของผู้พูดออกจากเจตนาการถ่ายทอด จึงทำให้คุณปรับบทพูดให้ฟังดูประชด กระซิบ หรือเร่งรีบได้ โดยที่โมเดลไม่เปลี่ยนไปเป็นตัวละครอื่น BreezeBlue ระบุว่าอัตลักษณ์ของผู้พูดคนเดียวกันยังคงอยู่แม้จะเปลี่ยนโทนการส่งเสียง และเกณฑ์ชี้วัดการกำหนดทิศทางเสียงของบริษัทเองรายงานค่าความคล้ายคลึงของผู้พูดที่ 0.67 SPK_SIM (รายงานโดยผู้ผลิต)

ความสามารถสองอย่างนี้ชี้ไปที่ตลาดเป้าหมายของ Breeze TTS 2 เอกสารประชาสัมพันธ์ระบุชัดเจน: ตัวละครในวิดีโอเกม เพื่อนดิจิทัล การเล่าเรื่อง ละครออกอากาศ และสตรีมเมอร์เสมือนจริง — เสียงแบบยาวที่ขับเคลื่อนด้วยบทบาทและมีหลายตัวละคร ไม่ใช่แค่ API การบรรยายอีกตัวหนึ่ง บริษัทมีไลบรารีเสียงคู่หูที่เรียกว่า Voice Galaxy ซึ่งมีเสียงตัวละครที่สร้างโดยชุมชนและสตูดิโอกว่า 15,000 เสียง และรีลสาธิตของ BreezeBlue เป็นละครวิทยุหลายตัวละครที่สร้างโดยแฟนๆ ซึ่งมีความยาวกว่าสิบนาที บนเกณฑ์มาตรฐานที่เผยแพร่โดยบริษัทเอง (รายงานโดยผู้ขาย ยังไม่ผ่านการตรวจสอบซ้ำ) Breeze TTS 2 อ้างตำแหน่งที่ 1 บนเกณฑ์มาตรฐาน Voice Design สำหรับข้อความเป็นเสียง ด้วยคะแนน Role Fit 78.02 เทียบกับ 72.78 ของ MiMo-V2.5-TTS และคะแนนรวม Voice Direction 4.25

เครื่องหมายดอกจันของใบอนุญาต

ก่อนที่คำว่า "open weights" จะทำหน้าที่ทางการตลาดมากเกินไป ขอให้อ่านโมเดลการ์ดก่อน Breeze TTS 2 มี 3B พารามิเตอร์, safetensors, F32/BF16 และซอร์สโค้ดเป็น Apache 2.0 — แต่ weights, โมเดลดัดแปลง และเอาต์พุตที่โฮสต์เองได้รับอนุญาตให้ใช้สำหรับการวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์เท่านั้น ภายใต้ breezeblue-research-and-non-commercial-license นั่นหมายความว่า "open weights" ในที่นี้ไม่ใช่ "ฟรีสำหรับผลิตภัณฑ์ของคุณ" การโฮสต์เองในเชิงพาณิชย์ไม่ได้รับอนุญาตตามไลเซนส์ที่เขียนไว้ เส้นทางเชิงพาณิชย์คือ hosted API ในราคา $34 ต่อ 1M ตัวอักษร นี่เป็นรูปแบบเดียวกับการเปิดตัวแบบโอเพนอื่นๆ หลายรายการในปี 2026 — ตรวจสอบได้และโฮสต์เองได้เพื่อการวิจัย แต่การใช้งานที่ก่อให้เกิดรายได้สงวนไว้สำหรับเอนด์พอยต์ของผู้ให้บริการเอง

ทำไมเราเตอร์จึงสำคัญสำหรับโมเดลที่อายุยังน้อยขนาดนี้

ความเสี่ยงที่ตรงไปตรงมาของ Breeze TTS 2 ในตอนนี้ไม่ใช่คุณภาพ — แต่อายุของมัน โมเดลเปิดให้ใช้งานมาแล้วสิบวัน ส่วนน้ำหนัก (weights) เพิ่งเผยแพร่มาได้สองวัน ทีมโปรดักชันไม่ควรวางสายงานเสียง (voice pipeline) บนโมเดลที่อายุน้อยขนาดนี้โดยไม่มีหนทางย้ายออก และนั่นคือโหมดความล้มเหลวที่เลเยอร์การจัดเส้นทาง (routing layer) ถูกสร้างขึ้นมารองรับโดยเฉพาะ หากคุณประเมิน Breeze TTS 2 ผ่านเกตเวย์ที่มองเอนด์พอยต์ของผู้จำหน่ายเป็นเพียงหนึ่งเส้นทางในหลายเส้นทาง คุณจะได้จ่าฝูง Elo ในวันนี้ การเฟลโอเวอร์อัตโนมัติไปยังผู้ให้บริการสำรองเมื่อ API เสื่อมประสิทธิภาพ และการเปลี่ยนแปลงเพียงหนึ่งบรรทัดหากโมเดลอายุหนึ่งสัปดาห์แสดงการถดถอย นี่คือวินัยเดียวกับที่ routing DSL ใช้กับทุกโมเดล: ประกอบมันเข้ากับทางเลือกอื่น รักษาอินเทอร์เฟซให้เสถียร และปล่อยให้โมเดลพิสูจน์ตัวเองก่อนที่คุณจะปล่อยให้มันรับภาระหลัก ยังไม่มีโมเดลใดในซีรีส์นี้ที่ถูกจัดเส้นทางบน OrcaRouter เอง ดังนั้นคำแนะนำที่ตรงไปตรงมาคือเชื่อม Breeze TTS 2 เข้ากับเกตเวย์ใดก็ตามที่คุณรันอยู่แล้ว — และเก็บผู้ให้บริการปัจจุบันของคุณให้ทำงานคู่กันไปในขณะที่ Elo ยิ่งเก่าลงและน่าเชื่อถือมากขึ้น

สิ่งที่ควรดูต่อไป

ตำแหน่ง Provider Voices #1 ในกลุ่ม open-weights คือเรื่องราวของวันนี้ แต่เป็นเวทีที่อ่อนแอกว่าในสองเวทีสำหรับโมเดลนี้ บนสนามประลอง Controlled Voice ของ Artificial Analysis ซึ่งโมเดลทั้งหมดถูกเปรียบเทียบด้วยเสียงอ้างอิงคงที่ชุดเดียวกัน Breeze TTS 2 ครองอันดับ #3 ในกลุ่มโมเดล open-weights ด้วยคะแนน Elo 1,002 ตามหลัง Voxtral ของ Mistral ที่ 1,010 — และอันดับ #16 โดยรวมจากทั้งหมด 39 โมเดล ช่องว่างระหว่างคะแนน provider-voice (1,215, #1 ในกลุ่ม open) และคะแนน controlled-voice (1,002, #3 ในกลุ่ม open) เป็นสิ่งที่ควรจับตามอง: มันบ่งชี้ว่าจุดแข็งของ Breeze TTS 2 นั้นกระจุกตัวอยู่ในเสียงที่มันออกแบบสำหรับตัวเอง ซึ่งตรงกับข้ออ้างของผลิตภัณฑ์พอดี และเป็นข้ออ้างที่เกณฑ์มาตรฐานอิสระควรกดดันต่อไป จับตาดูว่าคะแนน Elo ในสนาม controlled-voice จะขยับเข้าใกล้ตัวเลขของ provider-voice หรือไม่ ใบอนุญาตเชิงพาณิชย์จะเข้มงวดขึ้นหรือผ่อนคลายลง และ — ที่สำคัญที่สุด — จะมีใครทำการทดสอบซ้ำเกณฑ์มาตรฐานด้านการออกแบบเสียงและการกำหนดทิศทางเสียงนอกเหนือจากชุดทดสอบของ BreezeBlue เองหรือไม่

สำหรับโมเดลที่เพิ่งเกิดขึ้นเมื่อเดือนที่แล้ว Breeze TTS 2 ได้รับสิ่งที่มีประโยชน์ที่สุดที่โมเดลข้อความเป็นเสียงจะได้รับ นั่นคือคะแนนอิสระที่สอดคล้องกับคำโฆษณา ไม่ว่ามันจะกลายเป็นเสียงเริ่มต้นสำหรับผลิตภัณฑ์โต้ตอบหรือไม่นั้นขึ้นอยู่กับการอัปเดต Elo ครั้งถัดไปน้อยกว่าขึ้นอยู่กับว่าไลเซนส์และเรื่องการโฮสต์ด้วยตัวเองจะพัฒนาไปอย่างไร — แต่ในสัปดาห์นี้ text-to-speech แบบ open-weights มีผู้นำคนใหม่ และมันอายุแค่สองสัปดาห์เท่านั้น

A screenshot of the Hugging Face model card for BreezeBlue/Breeze-TTS-2 (captured August 26 2026) showing a 3B-parameter text-to-speech model tagged English and Chinese, the breezeblue-research-and-non-commercial license, and news entries for the August 25 2026 open-source release of the weights and inference code.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube