
Gemini 3.8 Live vs Qwen-Audio-3.1-TTS: สองครึ่งของสแต็กเสียง ที่ถูกปรับราคาใหม่ห่างกันแปดวัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Gemini 3.8 Live เป็นโมเดลเสียงเป็นเสียงของ Google ที่เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ในชื่อ gemini-3.8-live และ gemini-3.8-live-extended-thinking บน Live API. Qwen-Audio-3.1-TTS เป็นโมเดลข้อความเป็นเสียงของ Alibaba ที่ประกาศในงาน Apsara Conference ณ เมืองหางโจว เมื่อวันที่ 23 กันยายน 2026 ซึ่งเป็นแปดวันถัดมา พร้อมการลดราคาประมาณ 70% สำหรับการสังเคราะห์เสียงที่แนบมากับการประกาศนี้ ช่องว่างแปดวันนั้นเป็นเหตุผลที่การเปรียบเทียบนี้ควรค่าแก่การอ่านตอนนี้แทนที่จะเป็นเดือนกรกฎาคม ไม่มีอะไรเกี่ยวกับบทบาทของผลิตภัณฑ์ทั้งสองเปลี่ยนไป — ตัวหนึ่งฟังและพูด อีกตัวอ่านข้อความออกเสียง — แต่ทั้งสองส่วนของไปป์ไลน์เสียงสำหรับโปรดักชันถูกสร้างใหม่หรือปรับราคาใหม่ภายในเวลาสองสัปดาห์ และการคำนวณที่เคยใช้ตัดสินการจับคู่นี้ก็เปลี่ยนไปอย่างเงียบ ๆ
สองซีกที่รีเฟรชห่างกันแปดวัน
เริ่มจากสิ่งที่ทำให้การจับคู่นี้ไม่ธรรมดา: สองโมเดลนี้ไม่ได้แข่งขันกัน ผลิตภัณฑ์ด้านเสียงมีปากและมีหู โดยสองตัวนี้เป็นอย่างละหนึ่ง Gemini 3.8 Live ปิดวงจรให้ครบ — รับเสียงและวิดีโอเข้า ส่งเสียงออก จัดการการขัดจังหวะ และมีการเรียกใช้เครื่องมือทำงานอยู่เบื้องหลังบทสนทนา Qwen-Audio-3.1-TTS รับสตริงและเสียงอ้างอิง แล้วส่งคืนผลลัพธ์ออกมาเป็นการแสดง มันเป็นปากที่ทำได้ดีกว่าบทบาทอื่นใด และมันไม่ได้พยายามจะเป็นหู
สิ่งที่ทำให้จังหวะเวลาในเดือนกันยายนน่าสนใจก็คือ การประกาศทั้งสองครั้งเล็งไปที่ปลายคนละด้านของเส้นงบประมาณเส้นเดียวกัน การเปิดตัวของ Google เมื่อวันที่ 15 กันยายนเป็นเรื่องราวของขีดความสามารถ โดยไม่มีการขยับราคาใด ๆ มาด้วย ส่วนการประกาศของ Alibaba เมื่อวันที่ 23 กันยายนกลับเป็นเรื่องราวของอัตรากำไรเป็นหลัก โดยมีขีดความสามารถใหม่ตามมาเป็นของแถม ทีมที่สร้างไปป์ไลน์แบบไฮบริดในเดือนสิงหาคม ภายในเวลาเพียงแปดวันก็ได้รับเหตุผลให้กลับมาทบทวนทั้งสองขา — และมีเพียงขาเดียวเท่านั้นที่ถูกลง
การเปิดตัว 3.1 เปลี่ยนแปลงอะไรไปจริง ๆ ในฝั่งของ Qwen
Alibaba ไม่ได้เปิดตัวโมเดลเดียวในวันที่ 23 กันยายน เจนเนอเรชัน 3.1 ครอบคลุมห้าปลายทาง — Qwen-Audio-3.1-ASR, Qwen-Audio-3.1-ASR-Next, Qwen-Audio-3.1-TTS, Qwen-Audio-3.1-TTS-Next และ Qwen-Audio-3.1-Realtime — และมีเพียงหนึ่งในนั้น คือระดับ TTS ที่ใช้แทนได้ทันทีสำหรับใครก็ตามที่เรียกใช้โมเดล TTS 3.0 อยู่แล้ว
ในระดับนั้น มีสามสิ่งที่เปลี่ยนแปลงไป และหนึ่งในนั้นเป็นต้นทุนการย้ายระบบที่แท้จริง การควบคุมการนำเสนอเปลี่ยนจากคำศัพท์คงที่ของแท็กอินไลน์ 86 แท็กมาเป็นคำสั่งภาษาธรรมชาติ: คุณอธิบายอารมณ์ จังหวะ และสไตล์ที่ต้องการแทนที่จะแทรกวงเล็บที่ถูกต้องในตำแหน่งที่ถูกต้อง การถ่ายโอนคุณภาพเสียงข้ามภาษาเข้ามาแล้ว ทำให้เสียงอ้างอิงหนึ่งเสียงสามารถรักษาเอกลักษณ์ของมันไว้ได้ในภาษาจีนกลาง ภาษากวางตุ้ง ภาษาอังกฤษ และภาษาญี่ปุ่น และตอนนี้โมเดลสามารถทนต่อเสียงอ้างอิงที่มีสัญญาณรบกวนหรือมีเสียงสะท้อนได้โดยตรง โดยไม่ต้องมีขั้นตอนลดสัญญาณรบกวนแยกต่างหาก ความครอบคลุมภาษายังคงไม่เปลี่ยนแปลงที่ 16 ภาษาตามที่ผู้ขายรายงาน บวกกับภูมิภาคภาษาถิ่นจีน 20 แห่ง และ — สิ่งนี้ควรค่าแก่การตั้งข้อสังเกตเพราะมันถูกกลบเกลื่อนไปที่อื่น — เอกสารของ Alibaba เองกล่าวว่าระดับ 3.1 เพิ่มเจ็ดภาษา ซึ่งไม่สอดคล้องกับ 16 ภาษาที่ระบุไว้ในความครอบคลุมที่เผยแพร่ของรุ่นเดือนกรกฎาคม ให้ถือว่าทั้งสองจำนวนเป็นข้อมูลที่ผู้ขายรายงานไว้จนกว่าคุณจะตรวจสอบภาษาที่คุณต้องการกับ Model Studio
ผลิตภัณฑ์ใหม่จริง ๆ ในรีลีสนี้คือ Qwen-Audio-3.1-TTS-Next ซึ่ง Alibaba เรียกว่าโมเดล "Audiogen": การประมวลผลครั้งเดียวที่สร้างทั้งเสียงพูด เอฟเฟกต์เสียง และบรรยากาศพื้นหลังออกมาพร้อมกัน สำหรับบทสนทนาหลายผู้พูด การประกอบพอดแคสต์ และงานด้านฉาก มีราคาอยู่ที่ 0.848 ดอลลาร์ต่อล้านโทเคนอินพุต และ 1.696 ดอลลาร์ต่อล้านโทเคนเอาต์พุตบนโหนดปักกิ่ง จำกัดอินพุตไว้ที่ 3,000 ตัวอักษร เสียงที่สร้างสำหรับพอดแคสต์ 240 วินาที และ 120 วินาทีสำหรับกรณีอื่น ๆ สามคำขอต่อวินาที รองรับคลิปอ้างอิงสูงสุดสามคลิป คลิปละ 30 วินาที รองรับเฉพาะภาษาจีนและภาษาอังกฤษ หากไปป์ไลน์ของคุณเป็นการอ่านบทโดยผู้บรรยายคนเดียว ผลิตภัณฑ์นั้นก็ไม่เกี่ยวข้องกับคุณ หากเป็นพิธีกรสองคนพร้อมเพลงประกอบ นี่คือเหตุผลที่ทำให้ต้องมองการเปิดตัวนี้เลย
ตะเข็บคือสิ่งที่คุณกำลังเลือกจริง ๆ
เนื่องจากโมเดลทั้งสองไม่ได้ทำงานอย่างเดียวกัน การตัดสินใจนี้จึงไม่ใช่การแข่งแบบ bake-off แต่เป็นคำถามว่าคุณวางจุดส่งต่อไว้ตรงไหน และคุณยินดีจ่ายมากแค่ไหนเพื่อให้รอยต่อนั้นกลมกลืนจนมองไม่เห็น
มีสถาปัตยกรรมที่ซื่อสัตย์อยู่สองแบบ แบบแรกคือเครือข่ายเดียว: Gemini 3.8 Live จัดการทั้งรอบการสนทนา ฟังผู้โทร ตัดสินใจว่าจะพูดอะไรและพูดออกไป และคุณยอมรับเสียงที่มันให้คุณ — ซึ่งคุณไม่สามารถโคลนและไม่สามารถสร้างแบรนด์ได้ แบบที่สองคือแคสเคด: การรู้จำ จากนั้นการให้เหตุผล จากนั้น Qwen-Audio-3.1-TTS เป็นปาก ให้เสียงนับพันแก่คุณ รวมถึงเสียงที่บันทึกโดยนักพากย์ของคุณเอง ในราคาของความหน่วงข้ามขอบเขตผู้ขายสองหรือสามราย และทำนองเสียงที่สูญหายไปเมื่อประโยคถูกแยกข้ามการเรียก API
ทีมส่วนใหญ่ลงเอยด้วยการใช้ทั้งสองแบบ และนั่นไม่ใช่เพราะขาดความกล้า ใช้โมเดลเรียลไทม์ในจุดที่สัมผัสได้ถึงความหน่วง — การขัดจังหวะ การตอบรับ เสียง "อืม-ฮึม" ที่บอกผู้โทรว่าคุณยังอยู่ — และใช้โมเดลสังเคราะห์เสียงในจุดที่ได้ยินคุณภาพ: การอ่านทวนนโยบายแบบยาว เลขยืนยันที่อ่านด้วยจังหวะอย่างตั้งใจ เสียงประจำแบรนด์ที่ต้องเหมือนกันในทุกสาย การผสมผสานแบบไฮบริดคือคำตอบที่ถูกต้องสำหรับผลิตภัณฑ์หลายประเภท มันยังเป็นจุดที่โมเดลต้นทุนเริ่มยากขึ้นด้วย เพราะตอนนี้คุณกำลังวัดค่าสองหน่วยที่แตกต่างกัน

คิดราคาต่อชั่วโมงเสียง ซึ่งเป็นหน่วยเดียวที่ทั้งสองเข้ากันได้
Google คิดค่าบริการ Live API ตามนาที ส่วน Alibaba คิดค่าบริการระดับต่าง ๆ ของ Qwen TTS ตามจำนวนตัวอักษรและตามจำนวนโทเคน หากต้องการเปรียบเทียบทั้งสองแบบ คุณต้องเลือกตัวปรับฐานสักตัว และตัวปรับฐานเดียวที่สมเหตุสมผลสำหรับงานเสียงก็คือชั่วโมงของเสียงที่ผลิตเสร็จสมบูรณ์แล้ว
• คิดค่าบริการขาเข้า — Gemini 3.8 Live คิดตามนาทีของเสียง $0.005 ขาเข้าและ $0.018 ขาออก เทียบกับ Qwen-Audio-3.1-TTS ที่คิดตามล้านตัวอักษร โดยระดับ 3.0 Plus อยู่ที่ประมาณ $27.60 และระดับ Flash อยู่ที่ประมาณ $15 ก่อนการปรับลด และระดับ TTS Flash หลังจากนั้นมีราคาอยู่ที่ 1.5 หยวนต่อล้านโทเคนขาเข้าและ 12 หยวนต่อล้านโทเคนขาออก
• คิดค่าบริการขาออก — Gemini 3.8 Live การสนทนาแบบสองทางมีค่าใช้จ่ายประมาณ $1.38 สำหรับการพูดหนึ่งชั่วโมงตามเวลาจริงที่ราคาป้าย ก่อนการแคชใด ๆ เทียบกับ Qwen-Audio-3.1-TTS ซึ่งเป็นสตรีมทางเดียว โดยระดับ 3.1-Next อยู่ที่ $0.848 ต่อล้านโทเคนขาเข้าและ $1.696 ต่อล้านโทเคนขาออกบนโหนดปักกิ่ง
• ได้ยินเสียงผู้โทร — Gemini 3.8 Live ได้ รองรับอินพุตเสียงและวิดีโอแบบเนทีฟ เทียบกับ Qwen-Audio-3.1-TTS ไม่ได้ รับข้อความเข้าและส่งเสียงออก
• เสียงพูด — Gemini 3.8 Live มีเสียงเดียว ไม่สามารถโคลนได้ ไม่สามารถสร้างแบรนด์ได้ เทียบกับ Qwen-Audio-3.1-TTS ที่มีมากกว่าพันเสียงพร้อมการโคลนแบบ zero-shot จากเสียงอ้างอิงที่มีสัญญาณรบกวน
• ภาษา — Gemini 3.8 Live ผู้ขายรายงานว่า 97 ภาษา สลับได้กลางบทสนทนา เทียบกับ Qwen-Audio-3.1-TTS ที่ผู้ขายรายงานว่า 16 ภาษาบวกกับ 20 ภูมิภาคภาษาจีนถิ่น พร้อมการถ่ายโอนลักษณะเสียงข้ามภาษาจีนกลาง กวางตุ้ง อังกฤษ และญี่ปุ่น
• การควบคุมการส่งมอบ — Gemini 3.8 Live ใช้พรอมป์ต์และบริบทของบทสนทนา เทียบกับ Qwen-Audio-3.1-TTS ที่ใช้คำสั่งภาษาธรรมชาติ แทนที่แท็กแบบอินไลน์ 86 แท็กของรุ่น 3.0
• คะแนนอิสระ — Gemini 3.8 Live ได้ 82.6 บน Artificial Analysis Speech to Speech Index สำหรับตัวแปร Extended Thinking และ 76.0 สำหรับรุ่นมาตรฐาน เทียบกับ Qwen-Audio-3.1-TTS ที่ไม่มี คะแนน Qwen ที่ใกล้เคียงที่สุดคือ 1,259 Elo สำหรับระดับ 3.0 Plus รุ่นก่อนหน้าบน Provider Voice Arena ซึ่งเป็นการให้คะแนนของรุ่นก่อนหน้า ไม่ใช่ของโมเดลนี้
เปอร์เซ็นต์ส่วนลดนี้อ้างอิงกับอัตราค่าบริการที่แตกต่างกันไปตามภูมิภาคและระดับแพ็กเกจ ดังนั้นตัวเลข 70% ที่พาดหัวจึงไม่ใช่คำสัญญาเกี่ยวกับปริมาณทราฟฟิกของคุณ และ Alibaba Cloud ยังเปลี่ยนการคิดค่าบริการถอดเสียงแบบเรียลไทม์บนโหนดสิงคโปร์จากการคิดตามระยะเวลาเป็นการคิดตามโทเคน — ซึ่งเป็นเกณฑ์ที่คาดเดาได้ยากกว่า เนื่องจากทั้งช่วงเงียบและบริบทแบบหลายรอบต่างก็ทำให้การใช้โทเคนเพิ่มขึ้น โปรดอ่านตารางอัตราค่าบริการใหม่เทียบกับเสียงของคุณเอง

สิ่งที่การอัปเกรด 3.1 ยังไม่ได้สะสาง
นี่คือส่วนที่เข้าใจผิดได้ง่ายในทั้งสองทิศทาง การปรับปรุงใน 3.1 ไม่ได้ทำให้ Qwen-Audio-3.1-TTS เป็นตัวเลือกสำหรับงานที่ Gemini 3.8 Live ทำ — การควบคุมโดยอิงคำสั่ง การถ่ายโอนทิมเบร และความทนทานต่ออินพุตที่มีเสียงรบกวน ล้วนทำให้มันเป็น "ปาก" ที่ดีกว่า และไม่มีสิ่งใดเลยที่ทำให้มันมี "หู" เช่นเดียวกัน ตำแหน่ง benchmark ของ Gemini 3.8 Live ไม่ได้บอกอะไรคุณเลยว่าเสียงที่เป็นแบรนด์ของคุณจะรอดในหนึ่งประโยคภาษากวางตุ้งหรือไม่
ยังมีช่องโหว่ในหลักฐานที่การลดราคาทำให้ยิ่งน่ามองข้ามมากขึ้น Qwen-Audio-3.1-TTS ไม่มีคะแนนอิสระ คะแนน Elo 1,259 ที่ปรากฏข้างชื่อ Qwen บน Provider Voice Arena เป็นของ Qwen-Audio-3.0-TTS-Plus ซึ่งเป็นโมเดลที่กำลังถูกแทนที่ โดยวัดจากตัวอย่าง 1,447 ตัวอย่าง แถว Arena ของโมเดลรุ่นสืบทอดยังไม่มีอยู่ในขณะนี้ หากกระบวนการลงนามอนุมัติของคุณต้องใช้ตัวเลขจากบุคคลที่สาม — และสำหรับเสียงประจำแบรนด์ก็คงควรเป็นเช่นนั้น — โมเดลที่ใหม่กว่าคือรุ่นที่ไม่มีตัวเลขนั้น และระดับราคาที่ถูกกว่าคือระดับที่คุณยังปกป้องไม่ได้ เหตุการณ์เดียวที่จะยุติเรื่องนี้ได้คือการที่ Qwen-Audio-3.1-TTS ปรากฏบนบอร์ดทดสอบการฟังแบบปิด
ที่คีย์เดียว有帮助และไม่ช่วย
ผลสืบเนื่องประการหนึ่งจากการเปิดตัว 3.1 เป็นสิ่งที่มองข้ามได้ง่าย เพราะมันดูเหมือนรายละเอียดของการออกแบบพรอมป์ต์มากกว่าจะเป็นเรื่องของโครงสร้างพื้นฐาน การแทนที่แท็กฮาร์ดโค้ด 86 แท็กด้วยคำสั่งแบบอิสระทำให้ทิศทางการส่งมอบของคุณกลายเป็นชิ้นงานข้อความ คุณต้องสร้างมันขึ้นมา ทำเวอร์ชัน และตรวจสอบซ้ำทุกชิ้นเทียบกับการตีความของโมเดลใหม่ — และรูปแบบความล้มเหลวที่เกิดขึ้นคือการเลื่อนไหล ไม่ใช่ข้อผิดพลาด เพราะการเขียนวลี "warm but not sentimental" สองแบบจะให้ผลลัพธ์ไม่เหมือนกันเป๊ะ
นั่นคือปัญหาการอนุมานข้อความที่ห่อหุ้มรอบไปป์ไลน์เสียง และนั่นคือจุดที่เรามีประโยชน์ OrcaRouter ไม่ได้กำหนดเส้นทาง Qwen-Audio-3.1-TTS หรือโมเดล Qwen-Audio ใดๆ และเราไม่ได้กำหนดเส้นทางไปยังปลายทาง Gemini 3.8 Live เช่นกัน — ไม่มีส่วนใดของสแต็กนี้ที่สามารถเรียกใช้ผ่านเราได้ และไม่มีสิ่งใดในที่นี้ควรตีความว่าเป็นข้ออ้างว่าเป็นเช่นนั้น สิ่งที่เรามีให้คือเลเยอร์ที่เขียนและตรวจสอบข้อความทิศทาง: qwen/qwen3.8-flash และ google/gemini-3.8-flash ท่ามกลางโมเดลมากกว่า 200 รายการจาก คีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่มีมาร์กอัป ด้วย DSL การกำหนดเส้นทางที่รวมโมเดลหลายตัวเข้าด้วยกันในการเรียกครั้งเดียวและ การสลับไปใช้ระบบสำรองอัตโนมัติ เมื่อต้นทางเสื่อมประสิทธิภาพ เมื่อคุณกำลังจะตรวจสอบพรอมต์การจัดส่งหนึ่งหมื่นรายการอีกครั้งกับโมเดลที่เพิ่งเปลี่ยนวิธีการอ่านพรอมต์เหล่านั้น การสร้างตัวแปรและการให้คะแนนความสอดคล้องเป็นส่วนที่ควรเป็นสัญญาเดียว ไม่ใช่สี่สัญญา
สิ่งที่ควรวัดก่อนตัดสินใจเลือก
การทดลองสามอย่างให้คำตอบได้มากกว่าคณะกรรมการชุดใด ๆ ลองนำเสียงอ้างอิงหนึ่งเสียงและหนึ่งย่อหน้าจากสคริปต์ของคุณเองไปผ่าน Qwen-Audio-3.1-TTS แล้วฟังว่าการควบคุมแบบอิงคำสั่งให้ผลการพูดเหมือนเดิมสองครั้งหรือไม่ — นั่นคือความเสี่ยงในการย้ายระบบ และการวัดมันถูกกว่าการวางแผนรับมือล่วงหน้า ลองนำบันทึกเสียงสนทนาจริงที่มีเสียงรบกวนพื้นหลังของคุณเองไปผ่าน Gemini 3.8 Live แล้วตรวจสอบว่าการผลัดกันพูดยังทำงานได้หรือไม่เมื่อผู้โทรขัดจังหวะกลางคำ — นั่นคือสิ่งที่ดัชนี speech-to-speech พยายามวัดเป็นปริมาณ และมันไม่รอดจากการเจอกับสายโทรศัพท์จริงอย่างน่าเชื่อถือพอที่จะเชื่อโดยไม่ตรวจสอบ และลองคิดคำนวณจากปริมาณการใช้งานของคุณเองเป็นชั่วโมงเสียง แทนที่จะเป็นหน่วยที่ผู้ขายสองรายออกใบแจ้งหนี้ เพราะสำหรับการจับคู่นี้โดยเฉพาะ ส่วนต่างราคาที่คาดไว้ระหว่าง "TTS จีนราคาถูก" กับ "Google flagship" ไม่เคยมากเท่าที่ดูเหมือน และหลังวันที่ 23 กันยายน มันยิ่งน้อยลงไปอีก

การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
