
Gemini 3.8 TTS vs ElevenLabs: จ่ายแพงกว่าสามเท่าแล้วได้อะไร
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ที่ปริมาณการใช้งานเท่ากัน โมเดลสังเคราะห์เสียงเรือธงของ ElevenLabs มีต้นทุนสูงกว่ารุ่นใหม่ของผู้ให้บริการรายนี้ประมาณสามเท่า ElevenLabs Eleven v3 คิดค่าบริการ $0.10 ต่อพันตัวอักษร — $100 ต่อล้านตัวอักษร — และ Gemini 3.8 Flash TTS คิดค่าบริการ $9.00 ต่อล้านโทเคนเสียง ซึ่ง Artificial Analysis ปรับมาตรฐานเป็น $33.00 ต่อล้านตัวอักษร นั่นคือช่องว่าง 3.0 เท่าบนมาตรวัด และเป็นข้อเท็จจริงที่ใหญ่ที่สุดเพียงข้อเดียวในการเปรียบเทียบนี้ คำถามที่น่าสนใจไม่ใช่ว่าช่องว่างนั้นมีอยู่จริงหรือไม่ แต่คือเงินส่วนเกินหกสิบเจ็ดดอลลาร์ต่อล้านตัวอักษรนั้นกำลังซื้ออะไรกันแน่ เพราะคำตอบไม่ใช่ "เสียงพูดที่ดีกว่า"

สามเมตร ไม่ใช่หนึ่ง
สิ่งแรกที่ต้องทำความเข้าใจให้ถูกต้องคือ ผลิตภัณฑ์สองรายการนี้ไม่ได้วัดสิ่งเดียวกัน และเรตการ์ดที่เผยแพร่นั้นปกปิดข้อเท็จจริงข้อนี้ไว้
• ElevenLabs คิดค่าบริการตามจำนวนอักขระ โดย Eleven v3 ราคา $0.10 ต่อ 1,000 อักขระ จำกัดสูงสุด 5,000 อักขระต่อคำขอ ส่วน Eleven v3 Conversational ราคา $0.05 ต่อ 1,000 และโมเดล Flash กับ Turbo ก็ราคา $0.05 ต่อ 1,000 เช่นกัน แต่มีขีดจำกัดคำขอที่ 40,000 อักขระ และมีความหน่วงที่อ้างว่าประมาณ ~75 ms เทียบกับ ~280 ms ของ v3 Conversational
• Google คิดค่าบริการตามจำนวนโทเคน และโทเคนเสียงไม่ใช่โทเคนข้อความ Gemini 3.8 Flash TTS คิดค่าบริการ $0.50 ต่อโทเคนข้อความขาเข้า 1 ล้านโทเคน และ $9.00 ต่อโทเคนเสียงขาออก 1 ล้านโทเคน โดยคิดที่ 25 โทเคนเสียงต่อวินาทีของเสียงที่สร้างขึ้น ไม่มีการเผยแพร่เพดานจำนวนอักขระต่อคำขอ

• Artificial Analysis ไม่ได้เรียกเก็บเงินจากทั้งสองฝ่าย แต่ทำหน้าที่ปรับให้เป็นมาตรฐาน ราคา $100.00 และ $33.00 ต่อล้านตัวอักษรบนกระดานผู้นำ Provider Voice Arena ของบริษัทเป็นตัวหารร่วมที่คำนวณขึ้นมา เพื่อให้กระดานสามารถจัดอันดับตามราคาได้เลย มีประโยชน์สำหรับใช้เทียบเป็นอัตราส่วน ไม่ใช่สำหรับใช้เป็นใบเสนอราคา
ดังนั้นเวอร์ชันที่ซื่อตรงของตัวเลข 3.0x ก็คือ: บนพื้นฐานการเปรียบเทียบแบบเทียบต่อเทียบเท่าที่มีอยู่เพียงแบบเดียว ราคาของ Google อยู่ที่ประมาณหนึ่งในสาม สิ่งที่มันหมายความในสเปรดชีตของคุณเองนั้น ขึ้นอยู่กับว่าภาระงานของคุณมีสตริงสั้นหรือสตริงยาวเป็นส่วนใหญ่ — มาตรวัดเสียงต่อวินาทีและมาตรวัดข้อความต่อตัวอักษรจะแยกออกจากกันอย่างรวดเร็วเมื่อถ้อยคำยาวขึ้น เพราะความเงียบ การหยุดพัก และการเติมจังหวะเสียงตามทำนองพูด ล้วนคิดเป็นโทเคนเสียงแต่ไม่คิดเป็นตัวอักษร
หนึ่งเดือนที่ทำงาน
ลองนึกถึงข้อความหนึ่งล้านตัวอักษร ซึ่งมีความยาวประมาณนวนิยายขนาดกลาง แปลงเป็นเสียงพูดหนึ่งครั้ง
• ElevenLabs Eleven v3 — $100.00 สำหรับการสังเคราะห์ บวกกับระดับแผนใดก็ตามที่คุณต้องใช้เพื่อรันที่ระดับความพร้อมกันของคุณ แผนที่เผยแพร่มี Starter ที่ $6, Creator ที่ $22, Pro ที่ $99, Scale ที่ $299 และ Business ที่ $990 และโควตาตัวอักษรจะถูกรวมอยู่ในแผนเหล่านั้นแทนที่จะเรียกเก็บแยกต่างหาก
• Gemini 3.8 Flash TTS — เทียบเท่า $33.00 หรือประมาณ $16.50 หากงานนี้สามารถประมวลผลแบบแบตช์ได้ เนื่องจากระดับ Batch และ Flex ลดอัตราค่าเสียงลงครึ่งหนึ่งเหลือ $4.50 ต่อล้านโทเค็น บริการแบบ Priority จะเพิ่มเป็น $16.20 ต่อล้าน หรือเทียบเท่าประมาณ $59.40 ซึ่งยังต่ำกว่า ElevenLabs อยู่มาก
• Gemini 3.8 Flash-Lite TTS — $6.00 ต่อล้านโทเค็นเสียง ประมาณเทียบเท่า $22.10 ภายใต้การปรับมาตรฐานแบบเดียวกัน โดยแลกกับการรองรับ 101 ภาษาแทนที่จะเป็น 130 ภาษา
ลองคำนวณหนึ่งล้านตัวอักษรเดียวกันนี้กับราคาโปรโมชันของ Google ดู แล้วช่องว่างจะยิ่งกว้างขึ้นไปอีก เพราะโมเดล Gemini TTS ใหม่ทั้งสองรุ่นคิดราคาเพียงครึ่งเดียวจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นจะเพิ่มเป็นสองเท่า ใครก็ตามที่สร้างกรณีทางธุรกิจจากตัวเลขของเดือนกันยายน กำลังสร้างมันอยู่บนส่วนลดที่มีวันหมดอายุประกาศไว้อย่างชัดเจน

จุดเดียวที่การเปรียบเทียบพลิกกลับคือคำพูดที่สั้นมาก ๆ มาตรวัดแบบคิดตามตัวอักษรแทบไม่คิดเงินเลยสำหรับการยืนยันสามคำ ส่วนมาตรวัดเสียงแบบคิดตามวินาทีจะคิดเงินสำหรับวินาทีที่ใช้พูดคำยืนยันนั้น รวมถึงความเงียบรอบ ๆ ด้วย หากผลิตภัณฑ์ของคุณเป็นอินเทอร์เฟซเสียงที่สร้างจากคำตอบแบบประโยคเดียว การคำนวณจะเอนไปทาง ElevenLabs หากเป็นงานบรรยาย หนังสือเสียง การแปลเนื้อหายาว หรือสิ่งใดก็ตามที่ข้อความยาวและเสียงยาวกว่า การคำนวณจะเอนไปทาง Google อย่างชัดเจน
คำถามเรื่องคุณภาพ อย่างตรงไปตรงมา
บน Artificial Analysis Provider Voice Arena — การลงคะแนนแบบคู่โดยไม่เปิดเผยตัวตนจากเสียงเนทีฟของผู้ให้บริการแต่ละรายเอง — สองโมเดลนี้ไม่ได้สูสีกันเลย และ Google นำอยู่
• Gemini 3.8 Flash TTS — อันดับ 2, Elo 1,260, ช่วงห่าง 17 จุด, 1,999 ตัวอย่าง, 8 เสียงในอารีนา, เปิดตัวเดือนกันยายน 2026
• ElevenLabs Eleven v3 — อันดับ 17, Elo 1,167, ช่วง 11 คะแนน, 4,345 ตัวอย่าง, 8 เสียงในอารีนา, บนบอร์ดระบุเป็นเดือนกุมภาพันธ์ 2026
93 คะแนน Elo แยกทั้งสองออกจากกัน และต่างจากช่องว่างระหว่างสามอันดับแรกบนกระดานนั้น ช่องว่างนี้เป็นของจริง: ช่วงของ Eleven v3 คือ 1,156 ถึง 1,178 และของ Gemini คือ 1,243 ถึง 1,277 โดยไม่ทับซ้อนกัน จำนวนตัวอย่างของ Eleven v3 มากกว่าของ Gemini เกินสองเท่า ดังนั้นการประมาณค่าจึงไม่น้อยเกินไปเช่นกัน
นั่นเป็นผลลัพธ์ที่น่าอึดอัดจริง ๆ สำหรับข้อโต้แย้งเรื่องราคา และมันขัดกับข้อสรุปที่ชัดเจน ElevenLabs คิดค่าบริการแพงกว่าสามเท่า และได้อันดับต่ำกว่าถึงสิบเจ็ดอันดับในการวัดความชอบแบบไม่เปิดเผยแบรนด์ ไม่ว่าเงินที่จ่ายเพิ่มอีกหกสิบเจ็ดดอลลาร์จะซื้ออะไรได้ มันก็ไม่ใช่เสียงที่ฟังดีกว่าในการเปรียบเทียบแบบตัวต่อตัว
จริงๆ แล้ว ElevenLabs ขายอะไร
ElevenLabs ไม่ได้ขาย endpoint สำหรับการสังเคราะห์เสียงเป็นหลัก และการตั้งราคาโดยมองว่าเป็นเช่นนั้นคือจุดที่การเปรียบเทียบส่วนใหญ่ผิดพลาด สิ่งที่เงินจำนวนนั้นซื้อได้คือ:
• คลังเสียง คลังเสียงที่ใช้ร่วมกันของ ElevenLabs มีเสียงหลายร้อยเสียงและเป็นส่วนหนึ่งของผลิตภัณฑ์อย่างแท้จริง สิ่งที่ทำให้ผู้คนมาที่ ElevenLabs มักเป็นเสียงเฉพาะที่พวกเขาได้ยินจากที่ไหนสักแห่ง ไม่ใช่โมเดลที่อยู่เบื้องหลังเสียงนั้น Gemini 3.8 Flash TTS มาพร้อมเสียงสตูดิโอสำเร็จรูป 30 เสียง เส้นทางการออกแบบเสียงซึ่งสร้างเสียงขึ้นจากคำอธิบายภาษาธรรมชาติ และเส้นทางการจำลองเสียงที่โคลนจากตัวอย่างความยาว 30 วินาที พร้อมการตรวจสอบความยินยอม ลายน้ำ SynthID และข้อมูลรับรอง C2PA แนบมาด้วย แคตตาล็อกค่าเริ่มต้นมีขนาดเล็กกว่า แต่ความสามารถในการสร้างเสียงเฉพาะนั้นเทียบเคียงกันได้
• การแบ่งระดับความหน่วงเป็นผลิตภัณฑ์แยกต่างหาก Flash และ Turbo ที่ ~75 ms พร้อมขีดจำกัด 40,000 ตัวอักษร ถือเป็นผลิตภัณฑ์ที่แตกต่างจาก v3 ที่ ~280 ms และ 5,000 ตัวอักษร และทั้งสองมีราคาถูกกว่า v3 หากแอปพลิเคชันของคุณต้องการความหน่วงต่ำกว่า 100 ms ElevenLabs ขายสิ่งนี้อย่างชัดเจน ขณะที่สื่อเปิดตัวของ Google ไม่ได้กล่าวอ้างเรื่องความหน่วงที่เทียบเคียงได้สำหรับโมเดล TTS ใหม่ทั้งสองรุ่น
• ระบบนิเวศหนึ่ง การพากย์เสียง วอยซ์เอเจนต์ เอนด์พอยต์สำหรับการสนทนา โครงสร้างแพ็กเกจที่แนบมาพร้อมคอนเคอร์เรนซี — เหตุผลเดียวกับที่ Cartesia ขายเทเลโฟนี: มันคือสแต็ก ไม่ใช่โมเดล
หากคุณกำลังซื้อสแต็ก ราคา 3.0x คือราคาที่ต้องจ่ายสำหรับการไม่ประกอบมันเอง หากคุณกำลังซื้อการเรียกใช้การสังเคราะห์เสียง คุณกำลังจ่ายสำหรับคลังเสียงและระดับความหน่วง
สิ่งที่ Google กำลังขายอยู่จริง ๆ
ข้อโต้แย้งนั้นแคบกว่าและแข็งแกร่งกว่าคำว่า "ถูกกว่า"
• ความครอบคลุมของภาษา — 130 ภาษาบน Flash TTS และ 101 บน Flash-Lite TTS ตรวจจับอัตโนมัติจากข้อความ เทียบกับกว่า 70 ภาษาที่ ElevenLabs ระบุไว้สำหรับ Eleven v3 สำหรับการแปลเป็นภาษาท้องถิ่น ความแตกต่างนั้นไม่ใช่การเปรียบเทียบคุณสมบัติ แต่เป็นช่องว่างด้านความครอบคลุม
• การกำกับ — การควบคุมการส่งเสียงทีละบรรทัด การจัดฉากผู้พูดสองคนภายในหนึ่งการเรียก และสัญญาณอวัจนภาษาที่เขียนไว้ในสคริปต์เป็น <หัวเราะ>, <ถอนหายใจ>, <อ้าปากค้าง>, |อืม| และ |ใช่|. Google อ้างว่ารุ่น 3.8 ปรับปรุงความสม่ำเสมอในเนื้อหารูปแบบยาวและความสามารถควบคุมผู้พูดสองคนให้ดีกว่า Gemini 3.1 Flash TTS ซึ่งเป็นสิ่งที่ฟีเจอร์เหล่านั้นมีอยู่เพื่อการนี้โดยเฉพาะ คำกล่าวอ้างของผู้ขาย ยังไม่มีการทำซ้ำ
• โมเดลสถานะของเสียง — เสียงกำหนดเองแบบมีสถานะ 200 เสียงต่อโปรเจกต์ โดยมี TTL หนึ่งปี หรือเสียงแบบไร้สถานะที่อ้างอิงผ่าน voicekey_... แฮนเดิลที่หมดอายุในเจ็ดวัน นั่นคือการตัดสินใจด้านโครงสร้างพื้นฐานที่คุณสามารถวางแผนรองรับได้
• การควบคุมเอาต์พุต — WAV 24 kHz โมโน PCM 16-บิตแบบ signed บนปลายทางแบบ unary, PCM ที่ไม่มีเฮดเดอร์ (audio/l16) บนปลายทางแบบสตรีมมิง และ audio/mulaw กับ audio/alaw พร้อมอัตราการสุ่มตัวอย่างที่กำหนดค่าได้
การทดสอบประสิทธิภาพตอนเปิดตัวของ Google นั้นรายงานโดยผู้ขาย และควรอ่านเช่นนั้น: เป็นที่หนึ่งใน Hume AI Voice Design Benchmark ที่ 71.4 และเป็นที่หนึ่งในการสร้างแบบจำลองสำเนียงที่ 60.8 เป็นที่หนึ่งและที่สองใน Hume Overall Quality Index สำหรับ Flash และ Flash-Lite ตามลำดับ และได้รับการจัดอันดับสูงสุดในการทดสอบ blind-preference ที่อ้างในภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนแบบเม็กซิโก และฮินดี ไม่มีผลการทดสอบใดเหล่านี้ที่เปิดเผยต่อสาธารณะ arena Elo ข้างต้นเป็นตัวเลขเดียวที่เก็บรวบรวมอย่างอิสระในบทความนี้ และมันบังเอิญสอดคล้องกับทิศทางของคำกล่าวอ้างของผู้ขาย
แคลคูลัสของสวิตช์
เปลี่ยนมาใช้ถ้าปริมาณงานของคุณเป็นแบบฟอร์มยาว หลายภาษา หรือปริมาณสูงพอที่ 3.0x จะปรากฏเป็นรายการในใบแจ้งหนี้ และถ้าคุณสามารถอยู่กับแคตตาล็อกเสียงเริ่มต้นที่เล็กกว่า และไม่มีระดับ sub-100 ms ที่เปิดเผย นั่นครอบคลุมการบรรยาย การพากย์เสียง การเข้าถึง และเสียงพูดที่ฝังในผลิตภัณฑ์ส่วนใหญ่
อยู่ต่อหากคุณกำลังซื้อสแต็ก — ไลบรารีเสียง, ระดับความหน่วง, ผลิตภัณฑ์พากย์เสียงและเอเจนต์ — หรือหากภาระงานของคุณเต็มไปด้วยคำพูดสั้นมาก ๆ ที่มิเตอร์เสียงแบบคิดตามวินาทีทำให้คุณเสียเปรียบ นอกจากนี้ให้อยู่ต่อหากคุณได้ไฟน์จูนเอกลักษณ์เสียงบน ElevenLabs ที่ผู้ใช้ของคุณจดจำได้แล้ว เพราะความต่อเนื่องของเสียงเป็นฟีเจอร์ของผลิตภัณฑ์ และการสร้างใหม่บนโมเดลใหม่ถือเป็นโปรเจกต์
ไม่ว่าจะทางไหน วิธีที่สมเหตุสมผลคือการรันทั้งสองตัวเป็นเวลาหนึ่งเดือนบนทราฟฟิกจริงก่อนตัดสินใจ และนั่นคือเหตุผลที่ไม่ควรเชื่อมต่อตัวใดตัวหนึ่งเข้ากับโค้ดเบสของคุณโดยตรงโมเดล 200+ ตัวภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการกำหนดโดยไม่บวกราคา ดังนั้นการปรับราคาจากแล็บใดแล็บหนึ่งจะสะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะเป็นตอนต่ออายุ และ การสลับสำรองอัตโนมัติช่วยให้เส้นทางการพูดในระบบโปรดักชันยังทำงานอยู่ เมื่อเอนด์พอยต์ใหม่เอี่ยมทำงานผิดปกติ เราไม่ได้โฮสต์ ElevenLabs — เลเยอร์การสังเคราะห์เสียงและเอเจนต์ของมันเป็นผลิตภัณฑ์ของมันเอง — และเราไม่ได้โฮสต์เอนด์พอยต์ Gemini 3.8 TTS ซึ่งมาจาก API ของ Google สิ่งที่เรามีคือเลเยอร์ข้อความที่อยู่ข้างใต้ และการกำหนดเส้นทางที่อยู่เหนือขึ้นไป
ตัวเลขที่น่าจับตาคือ Elo ของ Eleven v3 ในการปรับปรุงตารางจัดอันดับครั้งถัดไป ช่องว่าง 93 คะแนนถือเป็นความด้อยที่มากสำหรับโมเดลที่คิดราคาแพงกว่าถึงสามเท่า และหากช่วงความเชื่อมั่นแคบลงโดยที่ช่องว่างยังไม่ปิด ข้อโต้แย้งเรื่องราคาก็จะไม่ใช่ข้อแลกเปลี่ยนอีกต่อไป แต่จะกลายเป็นคำตัดสิน
