การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Gemini 3.8 TTS vs Qwen Audio 3.0 TTS' บนพื้นหลังสีขาวพร้อมการไล่ระดับสีน้ำเงินและสีฟ้าแบบนุ่มนวล การ์ดด้านซ้าย 'Qwen-Audio-3.0-TTS-Plus' ระบุ Elo 1,259, 15 เสียงอารีนา, 16 ภาษา + 20 ภาษาถิ่น และ $27.6 ต่อ 1 ล้านตัวอักษร; การ์ดด้านขวา 'Gemini 3.8 Flash TTS' ระบุ Elo 1,260, 8 เสียงอารีนา, 130 ภาษา และ $33.0 ต่อ 1 ล้านตัวอักษร บรรทัดท้ายระบุว่า 'Elo ตาม Artificial Analysis Provider Voice Arena, กันยายน 2026' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Engineering & Research

Gemini 3.8 TTS vs Qwen Audio 3.0 TTS: สองคำตอบที่แตกต่างกันสำหรับ "ทำให้เสียงออกมาถูกต้อง"

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ห่างกันเพียงหนึ่งคะแนน Elo ที่แยกสองโมเดลนี้บน Artificial Analysis Provider Voice Arena และทั้งคู่ไปถึงจุดนั้นด้วยการแก้ปัญหาที่แตกต่างกันโดยสิ้นเชิง Qwen-Audio-3.0-TTS-Plus อยู่อันดับ 3 ด้วย Elo 1,259 จาก 1,447 ตัวอย่างและเสียงในอารีนา 15 เสียง เปิดตัวเดือนกันยายน 2026 และระบุราคาไว้ที่ 27.60 ดอลลาร์ต่อล้านอักขระ Gemini 3.8 Flash TTS อยู่อันดับ 2 ด้วย 1,260 จาก 1,999 ตัวอย่างและเสียงในอารีนา 8 เสียง เปิดตัวเมื่อวันที่ 23 กันยายน 2026 และระบุราคาไว้ที่ 33.00 ดอลลาร์ต่อล้านอักขระ แทบจะแยกไม่ออกทางสถิติ ราคาต่างกันยี่สิบเปอร์เซ็นต์ และสร้างขึ้นบนแนวคิดที่ตรงข้ามกันเกี่ยวกับสิ่งที่ทำให้เสียงสังเคราะห์เป็นเสียงที่ดี

ทฤษฎีคือส่วนที่น่าสนใจ คำตอบของ Qwen คือการควบคุมแบบอินไลน์: แท็กการกำกับน้ำเสียง 86 แท็กที่คุณโปรยไปทั่วข้อความ เพื่อให้โมเดลรู้ว่าควรหายใจตรงไหน เน้นเสียงตรงไหน และเปลี่ยนระดับโทนเสียงเมื่อไหร่ คำตอบของ Google คือเลเยอร์การกำกับ: คำสั่งทีละบรรทัด การจัดลำดับผู้พูดสองคน และชุดสัญญาณอวัจนภาษาจำนวนเล็กน้อย หากคุณสร้างไปป์ไลน์ที่ส่งออกคำอธิบายประกอบคล้าย SSML ไว้แล้ว หนึ่งในสองสิ่งนี้จะเข้ากันได้ ส่วนอีกสิ่งหนึ่งจะไม่ และความเข้ากันได้นั้นสำคัญกว่าคะแนน Elo เพียงหนึ่งคะแนน

ตำแหน่งที่ทั้งสองอยู่จริงบนกระดาน

การอ่าน Provider Voice Arena อย่างตรงไปตรงมาจำเป็นต้องดูที่ช่วงความเชื่อมั่น ไม่ใช่อันดับ

• Qwen-Audio-3.0-TTS-Plus — อันดับ 3, Elo 1,259, 1,447 ตัวอย่าง, 15 เสียงในอารีนา, กันยายน 2026, $27.6 ต่อ 1 ล้านตัวอักษร

• Gemini 3.8 Flash TTS — อันดับ 2, Elo 1,260, 1,999 ตัวอย่าง, 8 เสียงอารีน่า, กันยายน 2026, $33.0 ต่อ 1 ล้านตัวอักษร

• Cartesia Sonic 3.6 — อันดับ 1, Elo 1,273, 1,757 ตัวอย่าง, 8 เสียงในอารีนา, สิงหาคม 2026, $49.0 ต่อ 1 ล้านตัวอักษร

สามอันดับแรกอยู่ในกลุ่มเดียวกัน ช่วงที่เผยแพร่ของสองอันดับแรกทอดออกไป 17 คะแนนในแต่ละด้าน ซึ่งกว้างกว่าส่วนต่างทั้งหมดระหว่างอันดับหนึ่งกับอันดับสาม ดังนั้นการเรียงลำดับในหมู่พวกเขาจึงไม่ใช่หลักฐานที่มั่นคง สิ่งที่ตารางนี้ยืนยันได้ก็คือทั้งสามอยู่ในกลุ่มผู้นำ และไม่มีสิ่งใดที่ต่ำลงมาใกล้เคียง — อันดับ 10 Gemini 3.1 Flash TTS อยู่ที่ 1,199

ความไม่สมมาตรหนึ่งอย่างที่ควรสังเกตคือจำนวนเสียงในอารีนา Qwen มี 15 เสียง ขณะที่ Gemini มี 8 เสียง ดังนั้นคะแนนของ Qwen จึงเป็นค่าเฉลี่ยจากตัวอย่างที่กว้างกว่าของผลิตภัณฑ์ของผู้ขายรายนั้นเอง ซึ่งส่งผลทั้งสองทาง: มันเป็นค่าประมาณที่ยุติธรรมกว่าสำหรับภาพรวมของแคตตาล็อกเสียงของ Qwen และมันเปิดโอกาสให้ Qwen มีโอกาสมากขึ้นที่จะมีเสียงที่อ่อนแอซึ่งฉุดค่าเฉลี่ยลง ไม่ว่ามองแบบไหนก็ไม่เปลี่ยนข้อสรุปที่ว่าทั้งสองเสมอกัน

A generated two-column scoreboard for Qwen-Audio-3.0-TTS-Plus and Gemini 3.8 Flash TTS — Qwen at Arena Elo 1,259, $27.60 per 1M characters, 15 arena voices, 16 languages and inline-tag style control; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 8 arena voices, 130 languages and a direction layer — over the footer 'Per Artificial Analysis Provider Voice Arena, Sept 2026.'

86 แท็กการส่งมอบเทียบกับเลเยอร์ทิศทาง

นี่คือความแตกต่างที่มีนัยสำคัญ และมันเป็นตัวชี้ขาดการผสานรวมส่วนใหญ่

Qwen-Audio-3.0-TTS มาพร้อมแท็กการนำเสนอแบบอินไลน์ 86 แท็ก — คำอธิบายประกอบที่ฝังอยู่ในข้อความซึ่งควบคุมวิธีการพูดของช่วงข้อความหนึ่ง เป็นแนวทางแบบมาร์กอัป: สคริปต์ของคุณเป็นตัวขับเคลื่อนการแสดง สิ่งนี้คุ้นเคยสำหรับใครก็ตามที่เคยทำงานกับ SSML และเข้ากันได้ดีกับเครื่องมือที่สร้างข้อความโดยอัตโนมัติ เพราะจุดควบคุมเป็นเพียงการแปลงสตริงแทนที่จะเป็นการเรียก API

Gemini 3.8 Flash TTS เลือกเดินเส้นทางอีกแบบ คุณกำกับการอ่านประโยคหนึ่งได้เหมือนกับที่คุณกำกับนักแสดง — จังหวะ การเน้นย้ำ น้ำเสียงทางอารมณ์ — โดยเป็นคำสั่งแยกต่างหาก แทนที่จะเป็นมาร์กอัปแบบอินไลน์ ฉากที่มีผู้พูดสองคนสามารถจัดวางได้ในการเรียกครั้งเดียว และชุดสัญญาณอวัจนภาษาจำนวนหนึ่งก็เขียนไว้ในบทเลย: <laughs>, <sigh>, <gasp> เป็นสัญญาณแบบอินไลน์ บวกกับ |mhm| และ |yeah| สำหรับเสียงตอบรับระหว่างบทสนทนา

ดังนั้นทั้งสองโมเดลจึงยอมรับการใส่คำอธิบายประกอบในข้อความ ความแตกต่างอยู่ที่ขนาดของคลังคำศัพท์และตำแหน่งที่ส่วนควบคุมที่เหลืออยู่ ของ Qwen กว้างกว่าและแบนราบกว่า — มี 86 แท็ก ทั้งหมดอยู่ในข้อความ ของ Google แคบกว่าในข้อความและกว้างกว่านอกข้อความ โดยมีทิศทางการนำเสนอและลำดับการจัดวางผู้พูดเป็นพารามิเตอร์ระดับการเรียกใช้ หากคุณกำลังพอร์ตระบบที่สร้างมาร์กอัปแบบอินไลน์ที่สมบูรณ์อยู่แล้ว Qwen จะเป็นตัวเลือกที่พอร์ตสั้นกว่า หากคุณกำลังสร้างตรรกะการกำหนดทิศทางในโค้ดแอปพลิเคชันอยู่แล้ว การแยกส่วนของ Google จะสะอาดกว่า

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

ความครอบคลุมของภาษาเทียบกับความครอบคลุมของภาษาถิ่น

ตัวเลขความครอบคลุมไม่สามารถนำมาเปรียบเทียบกันได้ และการเปรียบเทียบแบบง่ายๆ นั้นถือเป็นความผิดพลาด

Gemini 3.8 Flash TTS รองรับ 130 ภาษา โดยตรวจจับอัตโนมัติจากข้อความ ส่วน Flash-Lite TTS รองรับ 101 ภาษา นั่นคือความกว้างขวางที่ครอบคลุมหลายตระกูลภาษา ซึ่งเป็นสิ่งที่คุณต้องการสำหรับการทำ localisation ที่ต้องเข้าถึงตลาดแบบหางยาว

Qwen-Audio-3.0-TTS ครอบคลุม 16 ภาษา บวกกับ 20 ภูมิภาคภาษาถิ่นของจีน นั่นคือความลึกภายในตระกูลภาษาเดียว ยี่สิบภูมิภาคภาษาถิ่นไม่ใช่จำนวนที่น้อยกว่า 130 ภาษาในแบบที่ดูเหมือน — มันเป็นการกล่าวอ้างคนละแบบ และสำหรับผลิตภัณฑ์ที่ให้บริการผู้ใช้ที่พูดภาษาจีนทั่วภูมิภาคแผ่นดินใหญ่ มันคือสิ่งที่มีประโยชน์มากกว่า โมเดลที่มี 130 ภาษาและเสียงภาษาจีนกลางหนึ่งเสียงไม่ได้ให้บริการผู้ใช้ในเสฉวนในแบบที่โมเดลที่มี 20 ภูมิภาคภาษาถิ่นทำได้

ตัวไหนสำคัญนั้นขึ้นอยู่กับกลุ่มเป้าหมายของคุณทั้งหมด ถ้าสิ่งที่คุณต้องการคือ “อย่างน้อยก็พอใช้ได้ในตลาดยี่สิบแห่ง” ก็ Gemini ถ้าเป็น “ถูกต้องจริง ๆ ในตลาดจีน” ก็ Qwen

ราคา และสิ่งที่ตัวเลขต่ออักขระซ่อนไว้

• Qwen-Audio-3.0-TTS-Plus — 27.60 ดอลลาร์ต่อ 1 ล้านตัวอักษรตามเกณฑ์ที่ปรับมาตรฐานของลีดเดอร์บอร์ด; รุ่น Flash อยู่ที่ประมาณ 15 ดอลลาร์ต่อ 1 ล้านตัวอักษร โดยอ้างว่ามีความหน่วงของแพ็กเก็ตแรกประมาณ 300 มิลลิวินาที

• Gemini 3.8 Flash TTS — $33.00 ต่อ 1 ล้านตัวอักษรที่ปรับมาตรฐานแล้ว; เรียกเก็บโดย Google ในอัตรา $0.50 ต่อล้านโทเค็นข้อความขาเข้า และ $9.00 ต่อล้านโทเค็นเสียงขาออก จนถึงวันที่ 31 ธันวาคม 2026 จากนั้น $1.00 และ $18.00

• Gemini 3.8 Flash-Lite TTS — 22.10 ดอลลาร์ต่อ 1 ล้านอักขระที่ปรับมาตรฐานแล้ว อยู่อันดับ 6 ด้วย Elo 1,235; คิดค่าบริการ 6.00 ดอลลาร์ต่อล้านโทเคนเสียงไปจนถึงวันที่ 31 ธันวาคม 2026

ตัวเลขต่ออักขระทั้งสองเป็นค่าปรับมาตรฐานของ Artificial Analysis ไม่ใช่ราคาตามรายการของผู้จำหน่าย — Qwen คิดค่าบริการผ่าน Alibaba Cloud Model Studio และ Google คิดค่าบริการเป็นโทเคน และทั้งสองเจ้าไม่ได้เผยแพร่อัตราต่ออักขระสำหรับโมเดลเหล่านี้ ให้ใช้ตัวเลขเหล่านี้เพื่อดูอัตราส่วน ซึ่งอยู่ที่ประมาณ 1.2 เท่าในทางที่ได้เปรียบ Qwen และไม่ควรใช้เป็นใบเสนอราคา

ระดับต่างๆ มีรูปแบบที่แตกต่างกัน Qwen แยกออกเป็น Plus และ Flash โดยระดับ Flash ยอมแลกคุณภาพเพื่อการอ้างว่าส่งแพ็กเก็ตแรกได้ใน ~300 ms Google แยกออกเป็น Flash และ Flash-Lite และจากนั้นก็แยกย่อยออกเป็น Standard, Batch และ Flex และ Priority — $4.50, $9.00 และ $16.20 ต่อล้านโทเค็นเสียงบน Flash TTS โมเดลของ Google ให้รางวัลกับการจำแนกประเภทงานของคุณ ส่วนของ Qwen ให้รางวัลกับการเลือกระดับคุณภาพตั้งแต่แรก

ความพร้อมใช้งานคือความแตกต่างที่แท้จริงอีกประการหนึ่ง Gemini 3.8 Flash TTS พร้อมให้บริการทั่วไปบน Gemini Developer API ส่วน Qwen-Audio-3.0-TTS เป็นโมเดลปิดและให้บริการแบบโฮสต์เท่านั้น โดยให้บริการผ่าน Alibaba Cloud Model Studio และไม่มีเวตแบบเปิด หากคุณจำเป็นต้องรันโมเดลด้วยตัวเอง ทั้งสองตัวนี้ก็ไม่ใช่ตัวเลือกสำหรับคุณ แต่ถ้าโครงสร้างพื้นฐานของคุณอยู่บน Alibaba Cloud อยู่แล้ว โมเดล Qwen คือตัวที่ไม่มีเรื่องการส่งข้อมูลออก (egress) ให้ต้องมาคิดจัดการ

คำกล่าวอ้างของผู้ขายทั้งสองฝ่าย

ทั้งสองโมเดลไม่มีเกณฑ์มาตรฐานที่เป็นอิสระนอกเหนือจากอารีนา และผู้จำหน่ายทั้งสองรายต่างก็เผยแพร่คำกล่าวอ้างที่ควรติดป้ายกำกับว่าเป็นเพียงคำกล่าวอ้างเท่านั้น

ของ Google สำหรับ Gemini 3.8 Flash TTS: เป็นอันดับหนึ่งบน Hume AI Voice Design Benchmark ด้วยคะแนน 71.4, เป็นอันดับหนึ่งด้านการสร้างแบบจำลองสำเนียงด้วยคะแนน 60.8, เป็นอันดับหนึ่งและอันดับสองบน Hume Overall Quality Index สำหรับ Flash และ Flash-Lite และอ้างว่าติดอันดับสูงสุดในการจัดอันดับความชอบแบบ blind ในภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนแบบเม็กซิโก และฮินดี การรันเหล่านี้ไม่เปิดเผยต่อสาธารณะ

ของ Alibaba สำหรับ Qwen-Audio-3.0-TTS: ระบบการถ่ายทอดแบบ 86 แท็ก ภูมิภาคภาษาถิ่น 20 แห่ง และตัวเลข ~300 มิลลิวินาทีสำหรับแพ็กเก็ตแรกบนรุ่น Flash ก็ยังไม่สามารถทำซ้ำได้เช่นกัน

Elo ของอารีนาเป็นค่าคุณภาพเดียวที่รวบรวมอย่างเป็นอิสระในบทความนี้ และมันบอกว่าทั้งสองเสมอกันอยู่ที่อันดับสูงสุดของกระดาน

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard, captured in English, showing Cartesia Sonic 3.6 at rank 1 with Elo 1,273, Gemini 3.8 Flash TTS at rank 2 with 1,260 across 1,999 samples, Qwen-Audio-3.0-TTS-Plus at rank 3 with 1,259, 1,447 samples, 15 arena voices and $27.6 per 1M characters, and ElevenLabs Eleven v3 at rank 17 with 1,167.

สิ่งที่ Gemini เพิ่มเข้ามาแต่ Qwen ไม่มี

การสร้างเสียงเป็นช่องว่างที่ชัดเจนที่สุด Gemini 3.8 Flash TTS รองรับการออกแบบเสียงจากคำอธิบายภาษาธรรมชาติและการจำลองเสียงจากตัวอย่าง 30 วินาที พร้อมการยืนยันความยินยอมและลายน้ำ SynthID รวมถึงข้อมูลรับรอง C2PA บนผลลัพธ์ เสียงที่กำหนดเองมีสองรูปแบบ: เสียงแบบมีสถานะ 200 เสียงต่อโปรเจกต์ โดยมีอายุการใช้งานหนึ่งปี หรือเสียงแบบไม่มีสถานะที่ระบุด้วยแฮนเดิล voicekey_... ซึ่งหมดอายุหลังจากเจ็ดวัน การรีมิกซ์เสียงถูกระบุว่าเร็ว ๆ นี้

การควบคุมรูปแบบเอาต์พุตเป็นข้อที่สอง WAV 24 kHz โมโน PCM แบบ signed 16-bit บนเอนด์พอยต์แบบ unary, PCM ที่ไม่มีส่วนหัว (audio/l16) บนเอนด์พอยต์แบบสตรีมมิง รวมถึง audio/mulaw และ audio/alaw และอัตราการสุ่มตัวอย่างที่กำหนดค่าได้ สำหรับงานที่เกี่ยวข้องกับโทรศัพท์ การรองรับ mulaw ช่วยตัดขั้นตอนการแปลงรหัสออกไปหนึ่งขั้นตอน

ควรโทรหาใคร

เลือก Qwen-Audio-3.0-TTS หากผู้ใช้ของคุณเป็นผู้พูดภาษาจีนและความครอบคลุมของภาษาถิ่นคือสิ่งที่คุณต้องการ หากคุณต้องการชุดคำสั่งมาร์กอัปแบบอินไลน์ที่หลากหลายซึ่งตัวสร้างของคุณสามารถส่งออกได้โดยตรง หรือหากคุณใช้งานบน Alibaba Cloud อยู่แล้วและต้องการเส้นทางที่สั้นที่สุดไปสู่ endpoint ที่ใช้งานได้ นอกจากนี้ยังเป็นตัวเลือกที่ถูกกว่าจากทั้งสองตัวเมื่อเทียบบนพื้นฐานมาตรฐาน และเวอร์ชัน Flash ก็ยังถูกกว่าอีกหากคุณยอมรับการรับแพ็กเก็ตแรกที่ ~300 มิลลิวินาทีได้

เลือก Gemini 3.8 Flash TTS หากคุณต้องการความกว้างขวางในหลายภาษา มากกว่าความลึกซึ้งในภาษาเดียว หากคุณต้องการสร้างหรือจำลองเสียงเฉพาะ หากคุณต้องการเอาต์พุตแบบ mulaw หรือ alaw หรือหากข้อกำหนดด้านการจัดซื้อของคุณคือต้อง "พร้อมใช้งานทั่วไปมากกว่าจะเป็นแบบโฮสต์เท่านั้น"

ทั้งสองไม่ใช่ทางเลือกที่แย่ และไม่มีทางเลือกไหนดีกว่าอย่างชัดเจน — นั่นแหละคือประเด็นของช่องว่างเพียงหนึ่งคะแนน Elo การตัดสินใจขึ้นอยู่กับความเข้ากันได้ ไม่ใช่คุณภาพ

นั่นก็เป็นเหตุผลเช่นกันว่าทำไมจึงยังไม่ควรผูกมัดกับตัวใดตัวหนึ่งอย่างจริงจังในตอนนี้ OrcaRouter ให้คุณโมเดลกว่า 200 รายการภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการประกาศไว้ โดยไม่บวกเพิ่มดังนั้นหากห้องแล็บใดห้องแล็บหนึ่งเปลี่ยนราคา ค่าใช้จ่ายของคุณก็จะสะท้อนในวันเดียวกัน ไม่ใช่รอถึงรอบต่ออายุ และการสลับสำรองอัตโนมัติหมายความว่าเอนด์พอยต์สำหรับสังเคราะห์เสียงที่สะดุดเมื่อเจอโหลดสูงจะถูกส่งต่อไปยังอีกเอนด์พอยต์หนึ่งแทนที่จะทิ้งคำขอ เรามิได้โฮสต์ Qwen-Audio-3.0-TTS — ตัวนั้นให้บริการผ่าน Alibaba Cloud Model Studio — และเราไม่ได้โฮสต์เอนด์พอยต์ Gemini 3.8 TTS ซึ่งมาจาก API ของ Google สิ่งที่เราดูแลคือเลเยอร์ข้อความและการจัดเส้นทางที่อยู่เหนือชั้นนั้นขึ้นไป ซึ่งเป็นสิ่งที่ทำให้คุณรันทั้งสองแบบกับทราฟฟิกจริงได้เป็นเวลาหนึ่งเดือนก่อนที่จะตัดสินใจเลือก

ตัวเลขที่ต้องจับตาคือการแก้ไข Arena ครั้งถัดไป ด้วยจำนวนตัวอย่าง 1,447 รายการบน Qwen และ 1,999 รายการบน Gemini ช่วงความเชื่อมั่นทั้งสองยังกว้างพอที่คะแนนโหวตเพียงหนึ่งเดือนจะแยกทั้งสองออกจากกัน — หรือยืนยันว่าการเสมอกันคือคำตอบ

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube