
StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: หนึ่งในสองตัวนี้มี Arena Score และไม่ใช่ตัวใหม่
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
นี่คือการเปรียบเทียบทั้งหมดในบรรทัดเดียว Qwen-Audio-3.0-TTSอยู่ใน Text-to-Speech Arena ด้วย Elo 1,234 สำหรับระดับ Plus — คะแนนที่ได้จากการลงคะแนนฟังแบบไม่เปิดเผยจำนวน 2,502 เสียง StepAudio 3 TTSซึ่ง StepFun เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ไม่ได้อยู่ในบอร์ดนั้นเลย ส่วนรุ่นก่อนหน้าของมันอยู่บนบอร์ดนั้น: StepAudio 2.5 TTS มี Elo 1,209 จาก 1,306 เสียง
ดังนั้นคำถามที่ตรงไปตรงมาจึงไม่ใช่ "แบบไหนฟังดูดีกว่า" แต่คือว่า ช่องว่าง Elo 25 คะแนนซึ่งวัดจากรุ่นก่อนหน้า จะยังคงอยู่หรือไม่หลังการเปิดตัวที่ StepFun บอกว่าได้ปรับปรุงจังหวะเสียงและลดราคาลงมากกว่าครึ่งหรือไม่ ยังไม่มีใครจัดโหวตนั้น และทุกสิ่งด้านล่างนี้ถูกเรียบเรียงโดยยึดช่องว่างตรงนั้นในหลักฐาน แทนที่จะแสร้งทำเป็นว่าไม่มีมัน
คณะกรรมการ ตามที่ปรากฏจริงในวันนี้
ควรค่าแก่การดูอันดับที่แท้จริง เพราะบทความที่เผยแพร่กันอยู่หลายชิ้นอ้างอิงอันดับเวอร์ชันเก่าที่ล้าสมัยไปแล้ว สนามทดสอบการฟังแบบไม่เห็นที่มาจัดอันดับโมเดลสังเคราะห์เสียงตามตัวอย่างที่ผู้ลงคะแนนชื่นชอบมากกว่า อ่านไล่ไปตามแถวบนสุดของกระดานเสียงผู้ให้บริการ:
• Cartesia Sonic 3.6 — Elo 1,277, สิงหาคม 2026, 49.0 ดอลลาร์ต่อล้านตัวอักษร
• Inworld Realtime TTS-2 — Elo 1,243, สิงหาคม 2026, 20.8 ดอลลาร์ต่อล้านตัวอักษร
• SpeechifyAI Simba 3.2 — Elo 1,238, กรกฎาคม 2026, $6.6 ต่อล้านตัวอักษร
• Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234, กรกฎาคม 2026, 27.6 ดอลลาร์ต่อล้านตัวอักษร, 8 เสียงจากอารีนา
• VUI Labs Luna TTS — Elo 1,229, มิถุนายน 2026, $80.0 ต่อล้านตัวอักษร
• Inworld Realtime TTS-2 Flash — Elo 1,213, สิงหาคม 2026, $10.4 ต่อล้านตัวอักษร
• StepFun StepAudio 2.5 TTS — Elo 1,209, สิงหาคม 2026, $85.0 ต่อล้านตัวอักษร, 8 เสียงอารีน่า
• Google Gemini 3.1 Flash TTS — Elo 1,204, เมษายน 2026, $18.3 ต่อล้านตัวอักษร

มีสองสิ่งจากรายการนั้นที่เห็นได้ทันที ประการแรกคือ แพ็กเกจ Plus ของ Qwen ไม่ใช่ผู้นำ — แต่อยู่อันดับที่สี่ ตามหลัง Cartesia, Inworld และ Speechify และตัวเลข 1,234 ที่ถูกยกอ้างราวกับเป็นมงกุฎนั้นเป็นคะแนนระดับกลางตารางบนกระดานที่เปลี่ยนไปแล้วนับตั้งแต่นั้น ประการที่สองคือ StepAudio 2.5 TTS ถูกทดสอบซ้ำในเดือนสิงหาคม 2026 และอยู่อันดับที่เจ็ด ตามหลัง Qwen 25 Elo ด้วยราคาที่สูงกว่าสามเท่า
และเรื่องที่สามที่สำคัญยิ่งกว่าทุกเรื่องที่กล่าวมา: ลองดูช่วงความเชื่อมั่นสิ ระดับ Plus ของ Qwen ระบุไว้ที่ −14/+14 จาก 2,502 ตัวอย่าง ส่วน StepAudio 2.5 TTS ระบุไว้ที่ −16/+16 จาก 1,306 ตัวอย่าง ช่วงเหล่านี้ทับซ้อนกัน ช่องว่าง 25 จุดระหว่างสองโมเดลที่มีช่วงความคลาดเคลื่อนกว้าง 14 และ 16 จุดในแต่ละทิศทาง ไม่ใช่ความแตกต่างด้านคุณภาพที่พิสูจน์ได้ — มันคือสองโมเดลที่อารีนายังไม่สามารถแยกออกจากกันได้ในตอนนี้ ซึ่งถูกจัดอันดับในลำดับที่คะแนนเสียงเพิ่มอีกไม่กี่ร้อยเสียงก็อาจพลิกกลับได้

จุดข้อมูลที่ขาดหายไปทำให้คุณต้องเสียอะไรไปบ้าง
StepAudio 3 TTS เป็นโมเดลที่ StepFun แทน StepAudio 2.5 TTS ด้วย และการเปิดตัวนี้อ้างว่าสามารถควบคุมโทนเสียง ทำนองเสียง จังหวะ และการหยุดหายใจ รวมถึงพฤติกรรมเชิงอวัจนภาษา — การหัวเราะ การลังเล การพูดติดขัด การพูดซ้ำ การแก้ไขคำพูดของตนเอง — ซึ่งส่งมอบผ่านสถาปัตยกรรมสตรีมมิงที่การสร้างเสียงและการเล่นเสียงซ้อนทับกัน
นั่นคือชุดคุณลักษณะที่อารีนาวัดพอดี และนั่นก็เป็นเหตุผลว่าทำไมการไม่มีคะแนนจึงน่าหงุดหงิดมากกว่าจะเป็นเรื่องร้ายแรง: เบนช์มาร์กที่จะตอบคำถามนี้มีอยู่แล้ว ถูกจัดทำแบบสาธารณะ และแค่ยังไม่ถูกนำมารันซ้ำนับตั้งแต่โมเดลใหม่เปิดตัว ใครก็ตามที่บอกคุณว่า StepAudio 3 TTS ฟังดูดีกว่า Qwen-Audio-3.0-TTS กำลังอนุมานจากรุ่นก่อนหน้าที่แพ้ด้วยส่วนต่างซึ่งอยู่ภายในช่วงความคลาดเคลื่อนของตัวมันเอง
ราคาเป็นส่วนที่ได้รับการบันทึกไว้อย่างครบถ้วน และมันเปลี่ยนแปลงไปมาก
StepAudio 3 TTS คิดค่าบริการที่ 2.5 หยวนต่อ 10,000 ตัวอักษรบนแพลตฟอร์มของ StepFun เอง ส่วน StepAudio 2.5 TTS คิดค่าบริการที่ 5.8 ในคอลัมน์ราคาตามจำนวนตัวอักษรของ arena เอง โมเดลรุ่นเก่าอยู่ที่ $85.00 ต่อล้านตัวอักษร; 2.5 หยวนต่อ 10,000 ตัวอักษรคิดเป็นประมาณ $35 ต่อล้าน ณ อัตราแลกเปลี่ยนล่าสุด — ซึ่งเป็นการแปลงสกุลเงินของเราเอง ไม่ใช่ตัวเลขที่เผยแพร่ และควรคำนวณใหม่เทียบกับภูมิภาคและอัตราแลกเปลี่ยน (FX) ของคุณเอง นั่นคือการลดลงเกือบ 60% สำหรับรายการเดียวกัน
ยังคงสูงกว่า Qwen อยู่ Qwen-Audio-3.0-TTS-Plus ระบุราคาไว้ที่ $27.6 ต่อล้านตัวอักษร และระดับ Flash ยังถูกกว่านั้นอีก โดย Alibaba Cloud Model Studio คิดค่าบริการการสังเคราะห์ตามตัวอักษรอินพุต ไม่ใช่ตามเสียงที่สร้างขึ้น — เอาต์พุตไม่ถูกคิดค่าบริการแยกต่างหาก แพลตฟอร์มบุคคลที่สามที่ระบุระดับ Flash เสนอราคาในระดับสิบปลาย ๆ ต่อล้าน แม้ว่าความแตกต่างตามภูมิภาคจะทำให้ตัวเลขพาดหัวตัวเลขเดียวใด ๆ ไม่น่าเชื่อถือ
ดังนั้นภาพรวมของเรื่องนี้คือ: StepFun ลดต้นทุนการสังเคราะห์ลงราวครึ่งหนึ่ง ปิดช่องว่างกับ Qwen ไปได้เกือบหมด และไม่ได้แซงขึ้นไป ถ้าราคาต่ออักขระเป็นข้อจำกัดชี้ขาดของคุณ ข้อโต้แย้งจะแคบลง แต่คำตอบไม่เปลี่ยน ถ้าไม่ใช่ ราคาก็เลิกเป็นเหตุผลในการเลือกโมเดลใดโมเดลหนึ่งไปแล้ว
จำนวนเสียงที่มีและความครอบคลุมของภาษาไม่ใกล้เคียงกัน
นี่คือจุดที่การเปรียบเทียบไม่ใช่เรื่องของการใช้วิจารณญาณอีกต่อไป แต่กลายเป็นคำถามด้านข้อกำหนด
• คลังเสียง — Qwen-Audio-3.0-TTS มีมากกว่า 1,000 เสียงในแต่ละระดับของบริการ เมื่อเทียบกับ StepAudio 3 TTS ที่ไม่มีจำนวนที่เผยแพร่เทียบเคียงได้
• ภาษา — Qwen-Audio-3.0-TTS รองรับ 16 ภาษา และภาษาถิ่นจีนอีก 20 ภาษา โดยรุ่น Flash ได้รับการปรับแต่งสำหรับภาษาที่มีทรัพยากรจำกัดและความสมจริงของภาษาถิ่น เทียบกับ StepAudio 3 TTS ที่เน้นภาษาจีนเป็นหลัก โดยไม่มีข้ออ้างเรื่องความครอบคลุมที่เทียบเท่า
• ขนาดคำขอ — Qwen-Audio-3.0-TTS 20,000 ตัวอักษรต่อคำขอ เทียบกับ StepAudio 3 TTS ที่ไม่เปิดเผย
• ความหน่วง — Qwen-Audio-3.0-TTS Flash ตั้งเป้าความหน่วงของแพ็กเก็ตแรกไว้ภายใน 200 มิลลิวินาที ตามเอกสารของ Alibaba เอง เมื่อเทียบกับ StepAudio 3 TTS แบบสตรีมมิง ซึ่งไม่มีตัวเลขที่เผยแพร่
• การแบ่งระดับ — Qwen-Audio-3.0-TTS Plus สำหรับความสามารถในการถ่ายทอดอารมณ์ และ Flash สำหรับการทำงานแบบเรียลไทม์ เสียงระดับเรือธง 6 เสียงที่ถูกล็อกให้อยู่กับระดับใดระดับหนึ่ง เทียบกับ StepAudio 3 TTS ที่มีระดับเดียว
• ขอบเขตการควบคุม — การกำหนดแนวทางการส่งเสียงด้วยภาษาธรรมชาติของ Qwen-Audio-3.0-TTS พร้อมแท็กแสดงอารมณ์แบบอินไลน์ เช่น [excited], [laughing], [whispers] ที่ฝังอยู่ในข้อความอินพุต เทียบกับท่วงทำนองเสียงที่โมเดล StepAudio 3 TTS อนุมานจากบริบท
• การโคลนเสียง — StepAudio 3 TTS ราคาเหมาจ่าย 9.9 หยวนต่อเสียงที่โคลนในทุกระดับ TTS เทียบกับ Qwen-Audio-3.0-TTS ที่โคลนผ่าน Alibaba Cloud Model Studio
• เอาต์พุต — Qwen-Audio-3.0-TTS อัตราการสุ่มตัวอย่างเริ่มต้น 24 kHz เทียบกับ StepAudio 3 TTS ไม่ได้เผยแพร่
แถวส่วนควบคุมนั้นคือความแตกต่างด้านการออกแบบที่แท้จริง และมันไม่ใช่คำถามเรื่องคุณภาพ แท็กการแสดงออกของ Qwen นั้นชัดแจ้งและซิงโครนัส คุณเขียนอารมณ์ลงไปในข้อความ แล้วโมเดลก็แสดงอารมณ์นั้นออกมา ซึ่งทำให้ทดสอบได้และเหมาะกับการทดสอบรีเกรสชัน ส่วนคำอธิบายของ StepFun นั้นพูดถึงโมเดลที่อนุมานความลังเลหรือเสียงหัวเราะที่เหมาะสมจากบริบท ซึ่งฟังดูดีกว่าเมื่อมันทำถูก และยากกว่ามากที่จะจับให้แน่ชัดเมื่อมันทำผิด เลือกตามว่าคุณอยากกำหนดการแสดงด้วยตัวเองมากกว่าหรืออยากมอบหมายมันให้โมเดลทำ

จะตัดสินใจโดยไม่มีการวัดได้อย่างไร
คุณไม่อาจใช้เหตุผลไล่ไปสู่คำตอบจากตัวเลขที่เผยแพร่ได้ เพราะตัวเลขที่ชี้ขาดไม่มีอยู่จริง สิ่งที่เหลืออยู่คือการทดสอบ และการทดสอบสองสิ่งนี้มีรูปแบบเฉพาะที่ควรค่าแก่การวางแผนรับมือ
ทั้งคู่เป็น API เชิงพาณิชย์ที่ให้บริการแบบโฮสต์เท่านั้น — Qwen-Audio-3.0-TTS ผ่าน Alibaba Cloud Model Studio และ StepAudio 3 TTS ผ่านแพลตฟอร์มเปิดของ StepFun ทั้งคู่ไม่ได้เป็นแบบเปิดเวต (open weights) จึงไม่มีเส้นทางแบบโฮสต์เองให้ประเมินได้ ขอระบุให้ชัดเจนว่า OrcaRouter ครอบคลุมอะไรในส่วนนี้: โมเดลแปลงข้อความเป็นเสียงในแคตตาล็อกของเราวันนี้คือตระกูล OpenAI tts-1, gpt-4o-mini-tts และ Gemini TTS รุ่นพรีวิวของ Google ไม่มีโมเดลใดในบทความนี้ที่อยู่ในแคตตาล็อกนั้น และ Qwen-Audio-3.0-TTS ก็ไม่อยู่เช่นกัน — ไม่มีสิ่งใดในนี้ที่ควรถูกตีความว่าเป็นการอ้างว่าเราให้บริการโมเดลเหล่านั้น
ส่วนที่อยู่บน OrcaRouter จริง ๆ คือครึ่งหนึ่งที่เป็นข้อความของไปป์ไลน์ สคริปต์ที่เลเยอร์การสังเคราะห์ของคุณอ่านนั้นถูกสร้างโดยโมเดลภาษา และนั่นคือองค์ประกอบที่เปลี่ยนแปลงบ่อยที่สุด มีต้นทุนสูงที่สุดในการทำสัญญาใหม่ และง่ายที่สุดที่จะปล่อยไว้โดยไม่ปักหมุด — โมเดลข้อความเกือบ 200 ตัวที่อยู่หลัง API เดียว การสลับไปใช้ตัวสำรองอัตโนมัติ DSL สำหรับการกำหนดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกเดียว และการหลอมรวมโมเดลในกรณีที่การตัดสินของโมเดลเดียวไม่เพียงพอ โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยไม่บวกเพิ่ม หากคุณทำการประเมินแบบปกปิดระหว่างโมเดลการสังเคราะห์สองตัวนี้ ให้สร้างคลังข้อมูลผ่านปลายทางเดียวเพื่อให้ทั้งสองตัวเลือกอ่านข้อมูลนำเข้าเดียวกัน และเก็บเลเยอร์การสังเคราะห์ไว้หลังอินเทอร์เฟซที่คุณสลับเปลี่ยนได้
แล้วเรื่องนี้ทำให้การตัดสินใจอยู่ตรงไหน
เลือก Qwen-Audio-3.0-TTS วันนี้เลยถ้าคุณต้องการความครอบคลุม — เสียงมากกว่าหนึ่งพันเสียง 16 ภาษาและ 20 ถิ่น ข้อจำกัดคำขอที่ระบุไว้ที่ 20,000 ตัวอักษร มีระดับความหน่วงและระดับการแสดงอารมณ์ เป้าหมายแพ็กเก็ตแรกที่ 200 มิลลิวินาที และอัตราค่าบริการที่ต่ำกว่าของ StepFun นี่คือโมเดลที่มีการวัดผลรองรับและมีขอบเขตที่กว้างกว่า และอันดับที่สี่ใน Elo ของมันก็เป็นผลลัพธ์จริง แม้จะไม่ใช่ตำแหน่งสูงสุดอย่างที่ถูกอ้างถึงก็ตาม
เลือก StepAudio 3 TTS หากคุณกำลังสร้างผลิตภัณฑ์ที่ให้ความสำคัญกับภาษาจีนเป็นหลัก ต้องการระดับเดียวแทนที่จะต้องตัดสินใจเลือกระดับ ต้องการการโคลนเสียงในค่าธรรมเนียมคงที่ที่ประกาศไว้ และยอมเป็นผู้ใช้กลุ่มแรก ๆ กับโมเดลที่ยังไม่ผ่านการทดสอบแบบปกปิด คุณกำลังจ่ายแพงขึ้นประมาณ 27% ต่อตัวอักษรเมื่อเทียบกับระดับ Plus ของ Qwen เพื่อแลกกับรุ่นที่อ้างว่ามีการปรับปรุงด้านจังหวะและทำนองเสียงเมื่อเทียบกับโมเดลที่ตามหลังอยู่ 25 Elo และมีช่วงความคลาดเคลื่อนที่ทับซ้อนกัน
สิ่งที่ทำให้เรื่องนี้จบได้คือการรันอารีนาซ้ำอีกครั้งโดยมี StepAudio 3 TTS อยู่ในพูล จนกว่าการโหวตนั้นจะเกิดขึ้น นี่คือการเทียบโมเดลที่ถูกวัดผลแล้วกับโมเดลที่ยังไม่ได้วัดผล และ 25 คะแนนที่แยกรุ่นก่อนหน้าของทั้งสองนั้นอยู่ภายในความคลาดเคลื่อน — ซึ่งไม่ใช่การจัดอันดับ และไม่ควรถูกนำเสนอขายว่าเป็นการจัดอันดับ
