
Breeze TTS 2: ผู้นำ TTS โอเพนเวตตัวใหม่ที่ 1,215 Elo
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 523 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 187 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Breeze TTS 2 ขณะนี้เป็นโมเดลข้อความเป็นคำพูดแบบเปิดน้ำหนัก (open-weights) ที่ได้รับการจัดอันดับสูงสุดบน Provider Voices Speech Arena ของ Artificial Analysis โดยครอง 1,215 Elo — ห่างจากผู้นำโมเดลเปิดน้ำหนักคนก่อนอย่าง Fish Audio S2 Pro ถึง 90 คะแนน และอยู่อันดับ #6 โดยรวมจากระบบที่ได้รับการจัดอันดับมากกว่า 100 ระบบ การจัดอันดับนี้คือการยืนยันอย่างเป็นอิสระครั้งแรกต่อสิ่งที่ BreezeBlue อ้างไว้ตั้งแต่เปิดตัวโมเดลในกลางเดือนสิงหาคม 2026 นั่นคือ โมเดลเสียงที่มีอายุเพียงสองสัปดาห์จากสตาร์ทอัพขนาดประมาณ 15 คน สามารถเทียบเคียงได้กับแนวหน้าของเทคโนโลยีข้อความเป็นคำพูดเชิงพาณิชย์ น้ำหนักแบบเปิดถูกเผยแพร่บน Hugging Face เมื่อวันที่ 25 สิงหาคม 2026 และผลอารีน่าก็ตามมาในวันถัดมา ไม่ว่า Breeze TTS 2 จะกลายเป็นอะไรในท้ายที่สุด มันไม่ใช่เพียงคำมั่นสัญญาจากผู้ผลิตอีกต่อไป — มันมีค่า Elo ที่ยืนยันได้แล้ว
สิ่งที่เกิดขึ้นจริงตามลำดับ
ลำดับเวลามีความสำคัญในที่นี้ เพราะมันอธิบายว่าทำไมโพสต์เกี่ยวกับ "open weights leaderboard" ถึงมาจากบริษัทที่คนส่วนใหญ่ไม่เคยได้ยินชื่อเมื่อสามสัปดาห์ก่อน BreezeBlue ก่อตั้งโดย Yang Bin อดีตผู้ร่วมก่อตั้งฝ่ายเทคนิคของหนึ่งในห้องแล็บ AI ชั้นนำของจีน ด้วยเงินทุนรอบ Seed มูลค่า 6 ล้านดอลลาร์ นำโดย Yuanjing Capital และ Redpoint China โมเดลดังกล่าวผ่านเหตุการณ์สำคัญที่มองเห็นได้สามขั้นตอน:
• 7 สิงหาคม 2026 — BreezeBlue เผยแพร่ชุดเกณฑ์มาตรฐานข้อความเป็นเสียงพูดของตัวเองสำหรับการออกแบบเสียง การกำหนดทิศทางเสียง และการประเมินความหน่วงบน Hugging Face
• 16–17 สิงหาคม 2026 — บริษัทได้ประกาศอย่างเป็นทางการว่า Breeze TTS 2 เป็นโมเดลเสียงระดับเรือธงแบบเรียลไทม์สำหรับสื่อเชิงโต้ตอบ และเปิดให้บริการ API แบบโฮสต์ในราคา $34 ต่อ 1 ล้านตัวอักษร
วันที่ 25 สิงหาคม 2026 — น้ำหนักโมเดลและโค้ดการอนุมาน PyTorch ถูกเปิดเป็นโอเพนซอร์สบน Hugging Face ในชื่อ BreezeBlue/Breeze-TTS-2 ซึ่งเป็นโมเดลขนาด 3B พารามิเตอร์ภายใต้ใบอนุญาตสำหรับการวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์
การจัดอันดับ Artificial Analysis Provider Voices เปิดให้ใช้งานภายในไม่กี่วันนับจากที่เปิดตัว open-weights เนื่องจากเวทีนี้ให้คะแนนโมเดลด้วยการฟังแบบปกปิดเปรียบเทียบเคียงข้างกัน ค่า Elo 1,215 จึงไม่ใช่เกณฑ์วัดที่ BreezeBlue ใช้ประเมินตัวเอง แต่เป็นดุลยพินิจสะสมของผู้ฟังที่เปรียบเทียบตัวอย่างเสียงจริง ซึ่งเป็นสิ่งที่โมเดลอายุน้อยเช่นนี้ขาดมากที่สุด
กระดานคะแนน

• อันดับ Arena — อันดับ #6 โดยรวมบน Provider Voices; #1 ในบรรดาโมเดล open-weights ทั้งหมด เหนือกว่า Fish Audio S2 Pro (1,125 Elo)
• Elo — 1,215 โดยมีช่วงความเชื่อมั่น 95% อยู่ที่ประมาณ ±17 (Artificial Analysis ณ ปลายเดือนสิงหาคม 2026)
• ภาษา — 50 ตาม BreezeBlue; การ์ดโมเดลถูกแท็กเป็นภาษาอังกฤษและภาษาจีน
• ราคา — $34 ต่อ 1M ตัวอักษรบน hosted endpoint ของ BreezeBlue; open weights ดาวน์โหลดได้ฟรีแต่มีใบอนุญาตแบบไม่ใช่เชิงพาณิชย์
• ความเร็ว — ~45 ตัวอักษรต่อวินาทีตามการวัดของ Artificial Analysis — ช้ากว่าคู่แข่งหลายราย ซึ่งสำคัญสำหรับงานแบบยาว.
• เวลาแฝง — ความหน่วงในการสตรีมต่ำกว่า 40 มิลลิวินาที ตามที่ BreezeBlue ระบุ (จากผู้ผลิต ไม่ได้วัดโดยอิสระ)

จริงๆ แล้ว Breeze TTS 2 ทำสิ่งที่แตกต่างออกไปอย่างไร
ค่า Elo ถูกยกให้เป็นหัวข้อข่าว แต่ข้อกล่าวอ้างของผลิตภัณฑ์น่าสนใจกว่าคะแนนเสียอีก Breeze TTS 2 สร้างขึ้นจากแนวคิดสองประการที่โมเดลข้อความเป็นเสียงส่วนใหญ่ถือเป็นเรื่องรอง: การออกแบบเสียง และ การกำหนดทิศทางเสียง. การออกแบบเสียงเป็นแบบ zero-shot และไม่ต้องใช้เสียงอ้างอิง — คุณอธิบายเสียงด้วยภาษาธรรมชาติ ("ผู้บรรยายวัย 40 กลางๆ น้ำเสียงอบอุ่น มีสำเนียงใต้เล็กน้อยและมุกแห้ง") และโมเดลจะสร้างเสียงนั้นขึ้นมาโดยไม่ต้องมีการบันทึกในสตูดิโอหรือคลิปอ้างอิง การกำหนดทิศทางเสียงแยกสีเสียงของผู้พูดออกจากเจตนาการถ่ายทอด จึงทำให้คุณปรับบทพูดให้ฟังดูประชด กระซิบ หรือเร่งรีบได้ โดยที่โมเดลไม่เปลี่ยนไปเป็นตัวละครอื่น BreezeBlue ระบุว่าอัตลักษณ์ของผู้พูดคนเดียวกันยังคงอยู่แม้จะเปลี่ยนโทนการส่งเสียง และเกณฑ์ชี้วัดการกำหนดทิศทางเสียงของบริษัทเองรายงานค่าความคล้ายคลึงของผู้พูดที่ 0.67 SPK_SIM (รายงานโดยผู้ผลิต)
ความสามารถสองอย่างนี้ชี้ไปที่ตลาดเป้าหมายของ Breeze TTS 2 เอกสารประชาสัมพันธ์ระบุชัดเจน: ตัวละครในวิดีโอเกม เพื่อนดิจิทัล การเล่าเรื่อง ละครออกอากาศ และสตรีมเมอร์เสมือนจริง — เสียงแบบยาวที่ขับเคลื่อนด้วยบทบาทและมีหลายตัวละคร ไม่ใช่แค่ API การบรรยายอีกตัวหนึ่ง บริษัทมีไลบรารีเสียงคู่หูที่เรียกว่า Voice Galaxy ซึ่งมีเสียงตัวละครที่สร้างโดยชุมชนและสตูดิโอกว่า 15,000 เสียง และรีลสาธิตของ BreezeBlue เป็นละครวิทยุหลายตัวละครที่สร้างโดยแฟนๆ ซึ่งมีความยาวกว่าสิบนาที บนเกณฑ์มาตรฐานที่เผยแพร่โดยบริษัทเอง (รายงานโดยผู้ขาย ยังไม่ผ่านการตรวจสอบซ้ำ) Breeze TTS 2 อ้างตำแหน่งที่ 1 บนเกณฑ์มาตรฐาน Voice Design สำหรับข้อความเป็นเสียง ด้วยคะแนน Role Fit 78.02 เทียบกับ 72.78 ของ MiMo-V2.5-TTS และคะแนนรวม Voice Direction 4.25
เครื่องหมายดอกจันของใบอนุญาต
ก่อนที่คำว่า "open weights" จะทำหน้าที่ทางการตลาดมากเกินไป ขอให้อ่านโมเดลการ์ดก่อน Breeze TTS 2 มี 3B พารามิเตอร์, safetensors, F32/BF16 และซอร์สโค้ดเป็น Apache 2.0 — แต่ weights, โมเดลดัดแปลง และเอาต์พุตที่โฮสต์เองได้รับอนุญาตให้ใช้สำหรับการวิจัยและการใช้งานที่ไม่ใช่เชิงพาณิชย์เท่านั้น ภายใต้ breezeblue-research-and-non-commercial-license นั่นหมายความว่า "open weights" ในที่นี้ไม่ใช่ "ฟรีสำหรับผลิตภัณฑ์ของคุณ" การโฮสต์เองในเชิงพาณิชย์ไม่ได้รับอนุญาตตามไลเซนส์ที่เขียนไว้ เส้นทางเชิงพาณิชย์คือ hosted API ในราคา $34 ต่อ 1M ตัวอักษร นี่เป็นรูปแบบเดียวกับการเปิดตัวแบบโอเพนอื่นๆ หลายรายการในปี 2026 — ตรวจสอบได้และโฮสต์เองได้เพื่อการวิจัย แต่การใช้งานที่ก่อให้เกิดรายได้สงวนไว้สำหรับเอนด์พอยต์ของผู้ให้บริการเอง
ทำไมเราเตอร์จึงสำคัญสำหรับโมเดลที่อายุยังน้อยขนาดนี้
ความเสี่ยงที่ตรงไปตรงมาของ Breeze TTS 2 ในตอนนี้ไม่ใช่คุณภาพ — แต่อายุของมัน โมเดลเปิดให้ใช้งานมาแล้วสิบวัน ส่วนน้ำหนัก (weights) เพิ่งเผยแพร่มาได้สองวัน ทีมโปรดักชันไม่ควรวางสายงานเสียง (voice pipeline) บนโมเดลที่อายุน้อยขนาดนี้โดยไม่มีหนทางย้ายออก และนั่นคือโหมดความล้มเหลวที่เลเยอร์การจัดเส้นทาง (routing layer) ถูกสร้างขึ้นมารองรับโดยเฉพาะ หากคุณประเมิน Breeze TTS 2 ผ่านเกตเวย์ที่มองเอนด์พอยต์ของผู้จำหน่ายเป็นเพียงหนึ่งเส้นทางในหลายเส้นทาง คุณจะได้จ่าฝูง Elo ในวันนี้ การเฟลโอเวอร์อัตโนมัติไปยังผู้ให้บริการสำรองเมื่อ API เสื่อมประสิทธิภาพ และการเปลี่ยนแปลงเพียงหนึ่งบรรทัดหากโมเดลอายุหนึ่งสัปดาห์แสดงการถดถอย นี่คือวินัยเดียวกับที่ routing DSL ใช้กับทุกโมเดล: ประกอบมันเข้ากับทางเลือกอื่น รักษาอินเทอร์เฟซให้เสถียร และปล่อยให้โมเดลพิสูจน์ตัวเองก่อนที่คุณจะปล่อยให้มันรับภาระหลัก ยังไม่มีโมเดลใดในซีรีส์นี้ที่ถูกจัดเส้นทางบน OrcaRouter เอง ดังนั้นคำแนะนำที่ตรงไปตรงมาคือเชื่อม Breeze TTS 2 เข้ากับเกตเวย์ใดก็ตามที่คุณรันอยู่แล้ว — และเก็บผู้ให้บริการปัจจุบันของคุณให้ทำงานคู่กันไปในขณะที่ Elo ยิ่งเก่าลงและน่าเชื่อถือมากขึ้น
สิ่งที่ควรดูต่อไป
ตำแหน่ง Provider Voices #1 ในกลุ่ม open-weights คือเรื่องราวของวันนี้ แต่เป็นเวทีที่อ่อนแอกว่าในสองเวทีสำหรับโมเดลนี้ บนสนามประลอง Controlled Voice ของ Artificial Analysis ซึ่งโมเดลทั้งหมดถูกเปรียบเทียบด้วยเสียงอ้างอิงคงที่ชุดเดียวกัน Breeze TTS 2 ครองอันดับ #3 ในกลุ่มโมเดล open-weights ด้วยคะแนน Elo 1,002 ตามหลัง Voxtral ของ Mistral ที่ 1,010 — และอันดับ #16 โดยรวมจากทั้งหมด 39 โมเดล ช่องว่างระหว่างคะแนน provider-voice (1,215, #1 ในกลุ่ม open) และคะแนน controlled-voice (1,002, #3 ในกลุ่ม open) เป็นสิ่งที่ควรจับตามอง: มันบ่งชี้ว่าจุดแข็งของ Breeze TTS 2 นั้นกระจุกตัวอยู่ในเสียงที่มันออกแบบสำหรับตัวเอง ซึ่งตรงกับข้ออ้างของผลิตภัณฑ์พอดี และเป็นข้ออ้างที่เกณฑ์มาตรฐานอิสระควรกดดันต่อไป จับตาดูว่าคะแนน Elo ในสนาม controlled-voice จะขยับเข้าใกล้ตัวเลขของ provider-voice หรือไม่ ใบอนุญาตเชิงพาณิชย์จะเข้มงวดขึ้นหรือผ่อนคลายลง และ — ที่สำคัญที่สุด — จะมีใครทำการทดสอบซ้ำเกณฑ์มาตรฐานด้านการออกแบบเสียงและการกำหนดทิศทางเสียงนอกเหนือจากชุดทดสอบของ BreezeBlue เองหรือไม่
สำหรับโมเดลที่เพิ่งเกิดขึ้นเมื่อเดือนที่แล้ว Breeze TTS 2 ได้รับสิ่งที่มีประโยชน์ที่สุดที่โมเดลข้อความเป็นเสียงจะได้รับ นั่นคือคะแนนอิสระที่สอดคล้องกับคำโฆษณา ไม่ว่ามันจะกลายเป็นเสียงเริ่มต้นสำหรับผลิตภัณฑ์โต้ตอบหรือไม่นั้นขึ้นอยู่กับการอัปเดต Elo ครั้งถัดไปน้อยกว่าขึ้นอยู่กับว่าไลเซนส์และเรื่องการโฮสต์ด้วยตัวเองจะพัฒนาไปอย่างไร — แต่ในสัปดาห์นี้ text-to-speech แบบ open-weights มีผู้นำคนใหม่ และมันอายุแค่สองสัปดาห์เท่านั้น

