การ์ดชื่อเรื่องหลักที่สร้างขึ้นสำหรับ StepAudio 3 TTS vs Qwen-Audio-3.0-TTS พร้อมคำโปรย 'OrcaRouter · เรดาร์โมเดล — ประจันหน้า' พาดหัว 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS' และคำโปรยย่อย 'ตัวหนึ่งมีคะแนนจากอารีนาฟังแบบไม่เปิดเผยชื่อ อีกตัวเปิดตัวหลังการโหวตครั้งล่าสุดเจ็ดสัปดาห์' โดยอยู่เหนือการ์ดโมเดลทรงโค้งมนสองใบที่ขนาบอยู่คนละด้านของเครื่องหมาย versus
Guides & Insights

StepAudio 3 TTS vs Qwen-Audio-3.0-TTS: หนึ่งในสองตัวนี้มี Arena Score และไม่ใช่ตัวใหม่

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

นี่คือการเปรียบเทียบทั้งหมดในบรรทัดเดียว Qwen-Audio-3.0-TTSอยู่ใน Text-to-Speech Arena ด้วย Elo 1,234 สำหรับระดับ Plus — คะแนนที่ได้จากการลงคะแนนฟังแบบไม่เปิดเผยจำนวน 2,502 เสียง StepAudio 3 TTSซึ่ง StepFun เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ไม่ได้อยู่ในบอร์ดนั้นเลย ส่วนรุ่นก่อนหน้าของมันอยู่บนบอร์ดนั้น: StepAudio 2.5 TTS มี Elo 1,209 จาก 1,306 เสียง

ดังนั้นคำถามที่ตรงไปตรงมาจึงไม่ใช่ "แบบไหนฟังดูดีกว่า" แต่คือว่า ช่องว่าง Elo 25 คะแนนซึ่งวัดจากรุ่นก่อนหน้า จะยังคงอยู่หรือไม่หลังการเปิดตัวที่ StepFun บอกว่าได้ปรับปรุงจังหวะเสียงและลดราคาลงมากกว่าครึ่งหรือไม่ ยังไม่มีใครจัดโหวตนั้น และทุกสิ่งด้านล่างนี้ถูกเรียบเรียงโดยยึดช่องว่างตรงนั้นในหลักฐาน แทนที่จะแสร้งทำเป็นว่าไม่มีมัน

คณะกรรมการ ตามที่ปรากฏจริงในวันนี้

ควรค่าแก่การดูอันดับที่แท้จริง เพราะบทความที่เผยแพร่กันอยู่หลายชิ้นอ้างอิงอันดับเวอร์ชันเก่าที่ล้าสมัยไปแล้ว สนามทดสอบการฟังแบบไม่เห็นที่มาจัดอันดับโมเดลสังเคราะห์เสียงตามตัวอย่างที่ผู้ลงคะแนนชื่นชอบมากกว่า อ่านไล่ไปตามแถวบนสุดของกระดานเสียงผู้ให้บริการ:

• Cartesia Sonic 3.6 — Elo 1,277, สิงหาคม 2026, 49.0 ดอลลาร์ต่อล้านตัวอักษร

• Inworld Realtime TTS-2 — Elo 1,243, สิงหาคม 2026, 20.8 ดอลลาร์ต่อล้านตัวอักษร

• SpeechifyAI Simba 3.2 — Elo 1,238, กรกฎาคม 2026, $6.6 ต่อล้านตัวอักษร

Alibaba Qwen-Audio-3.0-TTS-Plus — Elo 1,234, กรกฎาคม 2026, 27.6 ดอลลาร์ต่อล้านตัวอักษร, 8 เสียงจากอารีนา

• VUI Labs Luna TTS — Elo 1,229, มิถุนายน 2026, $80.0 ต่อล้านตัวอักษร

• Inworld Realtime TTS-2 Flash — Elo 1,213, สิงหาคม 2026, $10.4 ต่อล้านตัวอักษร

• StepFun StepAudio 2.5 TTS — Elo 1,209, สิงหาคม 2026, $85.0 ต่อล้านตัวอักษร, 8 เสียงอารีน่า

Google Gemini 3.1 Flash TTS — Elo 1,204, เมษายน 2026, $18.3 ต่อล้านตัวอักษร

Screenshot of the Artificial Analysis Provider Voice Arena text-to-speech leaderboard, showing Cartesia Sonic 3.6 first at Elo 1,277, Alibaba Qwen-Audio-3.0-TTS-Plus fourth at Elo 1,234 over 2,502 samples at $27.6 per million characters, and StepFun StepAudio 2.5 TTS seventh at Elo 1,209 over 1,306 samples at $85.0 per million characters, with confidence intervals of -14/+14 and -16/+16 respectively.

มีสองสิ่งจากรายการนั้นที่เห็นได้ทันที ประการแรกคือ แพ็กเกจ Plus ของ Qwen ไม่ใช่ผู้นำ — แต่อยู่อันดับที่สี่ ตามหลัง Cartesia, Inworld และ Speechify และตัวเลข 1,234 ที่ถูกยกอ้างราวกับเป็นมงกุฎนั้นเป็นคะแนนระดับกลางตารางบนกระดานที่เปลี่ยนไปแล้วนับตั้งแต่นั้น ประการที่สองคือ StepAudio 2.5 TTS ถูกทดสอบซ้ำในเดือนสิงหาคม 2026 และอยู่อันดับที่เจ็ด ตามหลัง Qwen 25 Elo ด้วยราคาที่สูงกว่าสามเท่า

และเรื่องที่สามที่สำคัญยิ่งกว่าทุกเรื่องที่กล่าวมา: ลองดูช่วงความเชื่อมั่นสิ ระดับ Plus ของ Qwen ระบุไว้ที่ −14/+14 จาก 2,502 ตัวอย่าง ส่วน StepAudio 2.5 TTS ระบุไว้ที่ −16/+16 จาก 1,306 ตัวอย่าง ช่วงเหล่านี้ทับซ้อนกัน ช่องว่าง 25 จุดระหว่างสองโมเดลที่มีช่วงความคลาดเคลื่อนกว้าง 14 และ 16 จุดในแต่ละทิศทาง ไม่ใช่ความแตกต่างด้านคุณภาพที่พิสูจน์ได้ — มันคือสองโมเดลที่อารีนายังไม่สามารถแยกออกจากกันได้ในตอนนี้ ซึ่งถูกจัดอันดับในลำดับที่คะแนนเสียงเพิ่มอีกไม่กี่ร้อยเสียงก็อาจพลิกกลับได้

A generated scoreboard titled 'StepAudio 3 TTS vs Qwen-Audio-3.0-TTS — the scoreboard'. The StepAudio column reads Arena Elo 'not scored yet', Samples 'none', Price '2.5 yuan / 10,000 chars', Voices 'not published', Languages 'Chinese-first', Request size 'not published'. The Qwen column reads Arena Elo '1,234, Plus tier', Samples '2,502', Price '$27.6 / 1M chars', Voices 'over 1,000', Languages '16 + 20 dialects', Request size '20,000 chars'. Footer: 'Qwen figures per the Artificial Analysis text-to-speech arena; StepAudio 3 TTS has no arena score yet.'

จุดข้อมูลที่ขาดหายไปทำให้คุณต้องเสียอะไรไปบ้าง

StepAudio 3 TTS เป็นโมเดลที่ StepFun แทน StepAudio 2.5 TTS ด้วย และการเปิดตัวนี้อ้างว่าสามารถควบคุมโทนเสียง ทำนองเสียง จังหวะ และการหยุดหายใจ รวมถึงพฤติกรรมเชิงอวัจนภาษา — การหัวเราะ การลังเล การพูดติดขัด การพูดซ้ำ การแก้ไขคำพูดของตนเอง — ซึ่งส่งมอบผ่านสถาปัตยกรรมสตรีมมิงที่การสร้างเสียงและการเล่นเสียงซ้อนทับกัน

นั่นคือชุดคุณลักษณะที่อารีนาวัดพอดี และนั่นก็เป็นเหตุผลว่าทำไมการไม่มีคะแนนจึงน่าหงุดหงิดมากกว่าจะเป็นเรื่องร้ายแรง: เบนช์มาร์กที่จะตอบคำถามนี้มีอยู่แล้ว ถูกจัดทำแบบสาธารณะ และแค่ยังไม่ถูกนำมารันซ้ำนับตั้งแต่โมเดลใหม่เปิดตัว ใครก็ตามที่บอกคุณว่า StepAudio 3 TTS ฟังดูดีกว่า Qwen-Audio-3.0-TTS กำลังอนุมานจากรุ่นก่อนหน้าที่แพ้ด้วยส่วนต่างซึ่งอยู่ภายในช่วงความคลาดเคลื่อนของตัวมันเอง

ราคาเป็นส่วนที่ได้รับการบันทึกไว้อย่างครบถ้วน และมันเปลี่ยนแปลงไปมาก

StepAudio 3 TTS คิดค่าบริการที่ 2.5 หยวนต่อ 10,000 ตัวอักษรบนแพลตฟอร์มของ StepFun เอง ส่วน StepAudio 2.5 TTS คิดค่าบริการที่ 5.8 ในคอลัมน์ราคาตามจำนวนตัวอักษรของ arena เอง โมเดลรุ่นเก่าอยู่ที่ $85.00 ต่อล้านตัวอักษร; 2.5 หยวนต่อ 10,000 ตัวอักษรคิดเป็นประมาณ $35 ต่อล้าน ณ อัตราแลกเปลี่ยนล่าสุด — ซึ่งเป็นการแปลงสกุลเงินของเราเอง ไม่ใช่ตัวเลขที่เผยแพร่ และควรคำนวณใหม่เทียบกับภูมิภาคและอัตราแลกเปลี่ยน (FX) ของคุณเอง นั่นคือการลดลงเกือบ 60% สำหรับรายการเดียวกัน

ยังคงสูงกว่า Qwen อยู่ Qwen-Audio-3.0-TTS-Plus ระบุราคาไว้ที่ $27.6 ต่อล้านตัวอักษร และระดับ Flash ยังถูกกว่านั้นอีก โดย Alibaba Cloud Model Studio คิดค่าบริการการสังเคราะห์ตามตัวอักษรอินพุต ไม่ใช่ตามเสียงที่สร้างขึ้น — เอาต์พุตไม่ถูกคิดค่าบริการแยกต่างหาก แพลตฟอร์มบุคคลที่สามที่ระบุระดับ Flash เสนอราคาในระดับสิบปลาย ๆ ต่อล้าน แม้ว่าความแตกต่างตามภูมิภาคจะทำให้ตัวเลขพาดหัวตัวเลขเดียวใด ๆ ไม่น่าเชื่อถือ

ดังนั้นภาพรวมของเรื่องนี้คือ: StepFun ลดต้นทุนการสังเคราะห์ลงราวครึ่งหนึ่ง ปิดช่องว่างกับ Qwen ไปได้เกือบหมด และไม่ได้แซงขึ้นไป ถ้าราคาต่ออักขระเป็นข้อจำกัดชี้ขาดของคุณ ข้อโต้แย้งจะแคบลง แต่คำตอบไม่เปลี่ยน ถ้าไม่ใช่ ราคาก็เลิกเป็นเหตุผลในการเลือกโมเดลใดโมเดลหนึ่งไปแล้ว

จำนวนเสียงที่มีและความครอบคลุมของภาษาไม่ใกล้เคียงกัน

นี่คือจุดที่การเปรียบเทียบไม่ใช่เรื่องของการใช้วิจารณญาณอีกต่อไป แต่กลายเป็นคำถามด้านข้อกำหนด

• คลังเสียง — Qwen-Audio-3.0-TTS มีมากกว่า 1,000 เสียงในแต่ละระดับของบริการ เมื่อเทียบกับ StepAudio 3 TTS ที่ไม่มีจำนวนที่เผยแพร่เทียบเคียงได้

• ภาษา — Qwen-Audio-3.0-TTS รองรับ 16 ภาษา และภาษาถิ่นจีนอีก 20 ภาษา โดยรุ่น Flash ได้รับการปรับแต่งสำหรับภาษาที่มีทรัพยากรจำกัดและความสมจริงของภาษาถิ่น เทียบกับ StepAudio 3 TTS ที่เน้นภาษาจีนเป็นหลัก โดยไม่มีข้ออ้างเรื่องความครอบคลุมที่เทียบเท่า

• ขนาดคำขอ — Qwen-Audio-3.0-TTS 20,000 ตัวอักษรต่อคำขอ เทียบกับ StepAudio 3 TTS ที่ไม่เปิดเผย

• ความหน่วง — Qwen-Audio-3.0-TTS Flash ตั้งเป้าความหน่วงของแพ็กเก็ตแรกไว้ภายใน 200 มิลลิวินาที ตามเอกสารของ Alibaba เอง เมื่อเทียบกับ StepAudio 3 TTS แบบสตรีมมิง ซึ่งไม่มีตัวเลขที่เผยแพร่

• การแบ่งระดับ — Qwen-Audio-3.0-TTS Plus สำหรับความสามารถในการถ่ายทอดอารมณ์ และ Flash สำหรับการทำงานแบบเรียลไทม์ เสียงระดับเรือธง 6 เสียงที่ถูกล็อกให้อยู่กับระดับใดระดับหนึ่ง เทียบกับ StepAudio 3 TTS ที่มีระดับเดียว

• ขอบเขตการควบคุม — การกำหนดแนวทางการส่งเสียงด้วยภาษาธรรมชาติของ Qwen-Audio-3.0-TTS พร้อมแท็กแสดงอารมณ์แบบอินไลน์ เช่น [excited], [laughing], [whispers] ที่ฝังอยู่ในข้อความอินพุต เทียบกับท่วงทำนองเสียงที่โมเดล StepAudio 3 TTS อนุมานจากบริบท

• การโคลนเสียง — StepAudio 3 TTS ราคาเหมาจ่าย 9.9 หยวนต่อเสียงที่โคลนในทุกระดับ TTS เทียบกับ Qwen-Audio-3.0-TTS ที่โคลนผ่าน Alibaba Cloud Model Studio

• เอาต์พุต — Qwen-Audio-3.0-TTS อัตราการสุ่มตัวอย่างเริ่มต้น 24 kHz เทียบกับ StepAudio 3 TTS ไม่ได้เผยแพร่

แถวส่วนควบคุมนั้นคือความแตกต่างด้านการออกแบบที่แท้จริง และมันไม่ใช่คำถามเรื่องคุณภาพ แท็กการแสดงออกของ Qwen นั้นชัดแจ้งและซิงโครนัส คุณเขียนอารมณ์ลงไปในข้อความ แล้วโมเดลก็แสดงอารมณ์นั้นออกมา ซึ่งทำให้ทดสอบได้และเหมาะกับการทดสอบรีเกรสชัน ส่วนคำอธิบายของ StepFun นั้นพูดถึงโมเดลที่อนุมานความลังเลหรือเสียงหัวเราะที่เหมาะสมจากบริบท ซึ่งฟังดูดีกว่าเมื่อมันทำถูก และยากกว่ามากที่จะจับให้แน่ชัดเมื่อมันทำผิด เลือกตามว่าคุณอยากกำหนดการแสดงด้วยตัวเองมากกว่าหรืออยากมอบหมายมันให้โมเดลทำ

Screenshot of Alibaba Cloud Model Studio documentation for qwen-audio-3.0-tts-flash, showing the model capabilities table with text input and audio output, function calling and fine-tuning unsupported, and a note that the Flash version controls first-packet latency within 200 ms.

จะตัดสินใจโดยไม่มีการวัดได้อย่างไร

คุณไม่อาจใช้เหตุผลไล่ไปสู่คำตอบจากตัวเลขที่เผยแพร่ได้ เพราะตัวเลขที่ชี้ขาดไม่มีอยู่จริง สิ่งที่เหลืออยู่คือการทดสอบ และการทดสอบสองสิ่งนี้มีรูปแบบเฉพาะที่ควรค่าแก่การวางแผนรับมือ

ทั้งคู่เป็น API เชิงพาณิชย์ที่ให้บริการแบบโฮสต์เท่านั้น — Qwen-Audio-3.0-TTS ผ่าน Alibaba Cloud Model Studio และ StepAudio 3 TTS ผ่านแพลตฟอร์มเปิดของ StepFun ทั้งคู่ไม่ได้เป็นแบบเปิดเวต (open weights) จึงไม่มีเส้นทางแบบโฮสต์เองให้ประเมินได้ ขอระบุให้ชัดเจนว่า OrcaRouter ครอบคลุมอะไรในส่วนนี้: โมเดลแปลงข้อความเป็นเสียงในแคตตาล็อกของเราวันนี้คือตระกูล OpenAI tts-1, gpt-4o-mini-tts และ Gemini TTS รุ่นพรีวิวของ Google ไม่มีโมเดลใดในบทความนี้ที่อยู่ในแคตตาล็อกนั้น และ Qwen-Audio-3.0-TTS ก็ไม่อยู่เช่นกัน — ไม่มีสิ่งใดในนี้ที่ควรถูกตีความว่าเป็นการอ้างว่าเราให้บริการโมเดลเหล่านั้น

ส่วนที่อยู่บน OrcaRouter จริง ๆ คือครึ่งหนึ่งที่เป็นข้อความของไปป์ไลน์ สคริปต์ที่เลเยอร์การสังเคราะห์ของคุณอ่านนั้นถูกสร้างโดยโมเดลภาษา และนั่นคือองค์ประกอบที่เปลี่ยนแปลงบ่อยที่สุด มีต้นทุนสูงที่สุดในการทำสัญญาใหม่ และง่ายที่สุดที่จะปล่อยไว้โดยไม่ปักหมุด — โมเดลข้อความเกือบ 200 ตัวที่อยู่หลัง API เดียว การสลับไปใช้ตัวสำรองอัตโนมัติ DSL สำหรับการกำหนดเส้นทางที่ประกอบหลายโมเดลเข้าเป็นการเรียกเดียว และการหลอมรวมโมเดลในกรณีที่การตัดสินของโมเดลเดียวไม่เพียงพอ โดยราคาตามรายการของผู้ให้บริการถูกส่งผ่านโดยไม่บวกเพิ่ม หากคุณทำการประเมินแบบปกปิดระหว่างโมเดลการสังเคราะห์สองตัวนี้ ให้สร้างคลังข้อมูลผ่านปลายทางเดียวเพื่อให้ทั้งสองตัวเลือกอ่านข้อมูลนำเข้าเดียวกัน และเก็บเลเยอร์การสังเคราะห์ไว้หลังอินเทอร์เฟซที่คุณสลับเปลี่ยนได้

แล้วเรื่องนี้ทำให้การตัดสินใจอยู่ตรงไหน

เลือก Qwen-Audio-3.0-TTS วันนี้เลยถ้าคุณต้องการความครอบคลุม — เสียงมากกว่าหนึ่งพันเสียง 16 ภาษาและ 20 ถิ่น ข้อจำกัดคำขอที่ระบุไว้ที่ 20,000 ตัวอักษร มีระดับความหน่วงและระดับการแสดงอารมณ์ เป้าหมายแพ็กเก็ตแรกที่ 200 มิลลิวินาที และอัตราค่าบริการที่ต่ำกว่าของ StepFun นี่คือโมเดลที่มีการวัดผลรองรับและมีขอบเขตที่กว้างกว่า และอันดับที่สี่ใน Elo ของมันก็เป็นผลลัพธ์จริง แม้จะไม่ใช่ตำแหน่งสูงสุดอย่างที่ถูกอ้างถึงก็ตาม

เลือก StepAudio 3 TTS หากคุณกำลังสร้างผลิตภัณฑ์ที่ให้ความสำคัญกับภาษาจีนเป็นหลัก ต้องการระดับเดียวแทนที่จะต้องตัดสินใจเลือกระดับ ต้องการการโคลนเสียงในค่าธรรมเนียมคงที่ที่ประกาศไว้ และยอมเป็นผู้ใช้กลุ่มแรก ๆ กับโมเดลที่ยังไม่ผ่านการทดสอบแบบปกปิด คุณกำลังจ่ายแพงขึ้นประมาณ 27% ต่อตัวอักษรเมื่อเทียบกับระดับ Plus ของ Qwen เพื่อแลกกับรุ่นที่อ้างว่ามีการปรับปรุงด้านจังหวะและทำนองเสียงเมื่อเทียบกับโมเดลที่ตามหลังอยู่ 25 Elo และมีช่วงความคลาดเคลื่อนที่ทับซ้อนกัน

สิ่งที่ทำให้เรื่องนี้จบได้คือการรันอารีนาซ้ำอีกครั้งโดยมี StepAudio 3 TTS อยู่ในพูล จนกว่าการโหวตนั้นจะเกิดขึ้น นี่คือการเทียบโมเดลที่ถูกวัดผลแล้วกับโมเดลที่ยังไม่ได้วัดผล และ 25 คะแนนที่แยกรุ่นก่อนหน้าของทั้งสองนั้นอยู่ภายในความคลาดเคลื่อน — ซึ่งไม่ใช่การจัดอันดับ และไม่ควรถูกนำเสนอขายว่าเป็นการจัดอันดับ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube