การ์ด hero ที่สร้างขึ้นสำหรับ 'Gemini 3.8 TTS vs ElevenLabs' บนพื้นหลังสีขาวพร้อมแอ็กเซนต์ไล่ระดับสีฟ้าและสีฟ้าอมเขียวแบบนุ่มนวล การ์ดด้านซ้าย 'ElevenLabs Eleven v3' ระบุราคา $100 ต่อ 1M ตัวอักษร รองรับ 70+ ภาษา Elo 1,167 และอันดับ 17 ส่วนการ์ดด้านขวา 'Gemini 3.8 Flash TTS' ระบุราคา $33 ต่อ 1M ตัวอักษร รองรับ 130 ภาษา Elo 1,260 และอันดับ 2 บรรทัดส่วนท้ายอ่านว่า 'Elo per Artificial Analysis Provider Voice Arena, Sept 2026.' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 TTS vs ElevenLabs: จ่ายแพงกว่าสามเท่าแล้วได้อะไร

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ที่ปริมาณการใช้งานเท่ากัน โมเดลสังเคราะห์เสียงเรือธงของ ElevenLabs มีต้นทุนสูงกว่ารุ่นใหม่ของผู้ให้บริการรายนี้ประมาณสามเท่า ElevenLabs Eleven v3 คิดค่าบริการ $0.10 ต่อพันตัวอักษร — $100 ต่อล้านตัวอักษร — และ Gemini 3.8 Flash TTS คิดค่าบริการ $9.00 ต่อล้านโทเคนเสียง ซึ่ง Artificial Analysis ปรับมาตรฐานเป็น $33.00 ต่อล้านตัวอักษร นั่นคือช่องว่าง 3.0 เท่าบนมาตรวัด และเป็นข้อเท็จจริงที่ใหญ่ที่สุดเพียงข้อเดียวในการเปรียบเทียบนี้ คำถามที่น่าสนใจไม่ใช่ว่าช่องว่างนั้นมีอยู่จริงหรือไม่ แต่คือเงินส่วนเกินหกสิบเจ็ดดอลลาร์ต่อล้านตัวอักษรนั้นกำลังซื้ออะไรกันแน่ เพราะคำตอบไม่ใช่ "เสียงพูดที่ดีกว่า"

A generated two-column scoreboard for ElevenLabs Eleven v3 and Gemini 3.8 Flash TTS — Eleven v3 at Arena Elo 1,167, $100.00 per 1M characters, 70-plus languages, a 280 ms latency claim and 4,345 samples; Gemini 3.8 Flash TTS at Elo 1,260, $33.00 per 1M characters, 130 languages, no latency claim and 1,999 samples — over the footer 'Elo per Artificial Analysis; latency vendor-reported.'

สามเมตร ไม่ใช่หนึ่ง

สิ่งแรกที่ต้องทำความเข้าใจให้ถูกต้องคือ ผลิตภัณฑ์สองรายการนี้ไม่ได้วัดสิ่งเดียวกัน และเรตการ์ดที่เผยแพร่นั้นปกปิดข้อเท็จจริงข้อนี้ไว้

• ElevenLabs คิดค่าบริการตามจำนวนอักขระ โดย Eleven v3 ราคา $0.10 ต่อ 1,000 อักขระ จำกัดสูงสุด 5,000 อักขระต่อคำขอ ส่วน Eleven v3 Conversational ราคา $0.05 ต่อ 1,000 และโมเดล Flash กับ Turbo ก็ราคา $0.05 ต่อ 1,000 เช่นกัน แต่มีขีดจำกัดคำขอที่ 40,000 อักขระ และมีความหน่วงที่อ้างว่าประมาณ ~75 ms เทียบกับ ~280 ms ของ v3 Conversational

Google คิดค่าบริการตามจำนวนโทเคน และโทเคนเสียงไม่ใช่โทเคนข้อความ Gemini 3.8 Flash TTS คิดค่าบริการ $0.50 ต่อโทเคนข้อความขาเข้า 1 ล้านโทเคน และ $9.00 ต่อโทเคนเสียงขาออก 1 ล้านโทเคน โดยคิดที่ 25 โทเคนเสียงต่อวินาทีของเสียงที่สร้างขึ้น ไม่มีการเผยแพร่เพดานจำนวนอักขระต่อคำขอ

A screenshot of Google's Gemini API text-to-speech documentation, captured in English, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts, and a Python sample that passes speech_metadata style annotations and the Kore voice.

• Artificial Analysis ไม่ได้เรียกเก็บเงินจากทั้งสองฝ่าย แต่ทำหน้าที่ปรับให้เป็นมาตรฐาน ราคา $100.00 และ $33.00 ต่อล้านตัวอักษรบนกระดานผู้นำ Provider Voice Arena ของบริษัทเป็นตัวหารร่วมที่คำนวณขึ้นมา เพื่อให้กระดานสามารถจัดอันดับตามราคาได้เลย มีประโยชน์สำหรับใช้เทียบเป็นอัตราส่วน ไม่ใช่สำหรับใช้เป็นใบเสนอราคา

ดังนั้นเวอร์ชันที่ซื่อตรงของตัวเลข 3.0x ก็คือ: บนพื้นฐานการเปรียบเทียบแบบเทียบต่อเทียบเท่าที่มีอยู่เพียงแบบเดียว ราคาของ Google อยู่ที่ประมาณหนึ่งในสาม สิ่งที่มันหมายความในสเปรดชีตของคุณเองนั้น ขึ้นอยู่กับว่าภาระงานของคุณมีสตริงสั้นหรือสตริงยาวเป็นส่วนใหญ่ — มาตรวัดเสียงต่อวินาทีและมาตรวัดข้อความต่อตัวอักษรจะแยกออกจากกันอย่างรวดเร็วเมื่อถ้อยคำยาวขึ้น เพราะความเงียบ การหยุดพัก และการเติมจังหวะเสียงตามทำนองพูด ล้วนคิดเป็นโทเคนเสียงแต่ไม่คิดเป็นตัวอักษร

หนึ่งเดือนที่ทำงาน

ลองนึกถึงข้อความหนึ่งล้านตัวอักษร ซึ่งมีความยาวประมาณนวนิยายขนาดกลาง แปลงเป็นเสียงพูดหนึ่งครั้ง

• ElevenLabs Eleven v3 — $100.00 สำหรับการสังเคราะห์ บวกกับระดับแผนใดก็ตามที่คุณต้องใช้เพื่อรันที่ระดับความพร้อมกันของคุณ แผนที่เผยแพร่มี Starter ที่ $6, Creator ที่ $22, Pro ที่ $99, Scale ที่ $299 และ Business ที่ $990 และโควตาตัวอักษรจะถูกรวมอยู่ในแผนเหล่านั้นแทนที่จะเรียกเก็บแยกต่างหาก

• Gemini 3.8 Flash TTS — เทียบเท่า $33.00 หรือประมาณ $16.50 หากงานนี้สามารถประมวลผลแบบแบตช์ได้ เนื่องจากระดับ Batch และ Flex ลดอัตราค่าเสียงลงครึ่งหนึ่งเหลือ $4.50 ต่อล้านโทเค็น บริการแบบ Priority จะเพิ่มเป็น $16.20 ต่อล้าน หรือเทียบเท่าประมาณ $59.40 ซึ่งยังต่ำกว่า ElevenLabs อยู่มาก

• Gemini 3.8 Flash-Lite TTS — $6.00 ต่อล้านโทเค็นเสียง ประมาณเทียบเท่า $22.10 ภายใต้การปรับมาตรฐานแบบเดียวกัน โดยแลกกับการรองรับ 101 ภาษาแทนที่จะเป็น 130 ภาษา

ลองคำนวณหนึ่งล้านตัวอักษรเดียวกันนี้กับราคาโปรโมชันของ Google ดู แล้วช่องว่างจะยิ่งกว้างขึ้นไปอีก เพราะโมเดล Gemini TTS ใหม่ทั้งสองรุ่นคิดราคาเพียงครึ่งเดียวจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นจะเพิ่มเป็นสองเท่า ใครก็ตามที่สร้างกรณีทางธุรกิจจากตัวเลขของเดือนกันยายน กำลังสร้างมันอยู่บนส่วนลดที่มีวันหมดอายุประกาศไว้อย่างชัดเจน

A screenshot of ElevenLabs' API pricing page, captured in English, showing the Eleven v3 card at $0.10 per 1K characters with a 5,000-character limit, v3 Conversational at $0.05 with a 280 ms latency claim, v2 Multilingual at $0.10 with 29 languages, and Flash/Turbo at $0.05 with a 40,000-character limit.

จุดเดียวที่การเปรียบเทียบพลิกกลับคือคำพูดที่สั้นมาก ๆ มาตรวัดแบบคิดตามตัวอักษรแทบไม่คิดเงินเลยสำหรับการยืนยันสามคำ ส่วนมาตรวัดเสียงแบบคิดตามวินาทีจะคิดเงินสำหรับวินาทีที่ใช้พูดคำยืนยันนั้น รวมถึงความเงียบรอบ ๆ ด้วย หากผลิตภัณฑ์ของคุณเป็นอินเทอร์เฟซเสียงที่สร้างจากคำตอบแบบประโยคเดียว การคำนวณจะเอนไปทาง ElevenLabs หากเป็นงานบรรยาย หนังสือเสียง การแปลเนื้อหายาว หรือสิ่งใดก็ตามที่ข้อความยาวและเสียงยาวกว่า การคำนวณจะเอนไปทาง Google อย่างชัดเจน

คำถามเรื่องคุณภาพ อย่างตรงไปตรงมา

บน Artificial Analysis Provider Voice Arena — การลงคะแนนแบบคู่โดยไม่เปิดเผยตัวตนจากเสียงเนทีฟของผู้ให้บริการแต่ละรายเอง — สองโมเดลนี้ไม่ได้สูสีกันเลย และ Google นำอยู่

• Gemini 3.8 Flash TTS — อันดับ 2, Elo 1,260, ช่วงห่าง 17 จุด, 1,999 ตัวอย่าง, 8 เสียงในอารีนา, เปิดตัวเดือนกันยายน 2026

• ElevenLabs Eleven v3 — อันดับ 17, Elo 1,167, ช่วง 11 คะแนน, 4,345 ตัวอย่าง, 8 เสียงในอารีนา, บนบอร์ดระบุเป็นเดือนกุมภาพันธ์ 2026

93 คะแนน Elo แยกทั้งสองออกจากกัน และต่างจากช่องว่างระหว่างสามอันดับแรกบนกระดานนั้น ช่องว่างนี้เป็นของจริง: ช่วงของ Eleven v3 คือ 1,156 ถึง 1,178 และของ Gemini คือ 1,243 ถึง 1,277 โดยไม่ทับซ้อนกัน จำนวนตัวอย่างของ Eleven v3 มากกว่าของ Gemini เกินสองเท่า ดังนั้นการประมาณค่าจึงไม่น้อยเกินไปเช่นกัน

นั่นเป็นผลลัพธ์ที่น่าอึดอัดจริง ๆ สำหรับข้อโต้แย้งเรื่องราคา และมันขัดกับข้อสรุปที่ชัดเจน ElevenLabs คิดค่าบริการแพงกว่าสามเท่า และได้อันดับต่ำกว่าถึงสิบเจ็ดอันดับในการวัดความชอบแบบไม่เปิดเผยแบรนด์ ไม่ว่าเงินที่จ่ายเพิ่มอีกหกสิบเจ็ดดอลลาร์จะซื้ออะไรได้ มันก็ไม่ใช่เสียงที่ฟังดีกว่าในการเปรียบเทียบแบบตัวต่อตัว

จริงๆ แล้ว ElevenLabs ขายอะไร

ElevenLabs ไม่ได้ขาย endpoint สำหรับการสังเคราะห์เสียงเป็นหลัก และการตั้งราคาโดยมองว่าเป็นเช่นนั้นคือจุดที่การเปรียบเทียบส่วนใหญ่ผิดพลาด สิ่งที่เงินจำนวนนั้นซื้อได้คือ:

• คลังเสียง คลังเสียงที่ใช้ร่วมกันของ ElevenLabs มีเสียงหลายร้อยเสียงและเป็นส่วนหนึ่งของผลิตภัณฑ์อย่างแท้จริง สิ่งที่ทำให้ผู้คนมาที่ ElevenLabs มักเป็นเสียงเฉพาะที่พวกเขาได้ยินจากที่ไหนสักแห่ง ไม่ใช่โมเดลที่อยู่เบื้องหลังเสียงนั้น Gemini 3.8 Flash TTS มาพร้อมเสียงสตูดิโอสำเร็จรูป 30 เสียง เส้นทางการออกแบบเสียงซึ่งสร้างเสียงขึ้นจากคำอธิบายภาษาธรรมชาติ และเส้นทางการจำลองเสียงที่โคลนจากตัวอย่างความยาว 30 วินาที พร้อมการตรวจสอบความยินยอม ลายน้ำ SynthID และข้อมูลรับรอง C2PA แนบมาด้วย แคตตาล็อกค่าเริ่มต้นมีขนาดเล็กกว่า แต่ความสามารถในการสร้างเสียงเฉพาะนั้นเทียบเคียงกันได้

• การแบ่งระดับความหน่วงเป็นผลิตภัณฑ์แยกต่างหาก Flash และ Turbo ที่ ~75 ms พร้อมขีดจำกัด 40,000 ตัวอักษร ถือเป็นผลิตภัณฑ์ที่แตกต่างจาก v3 ที่ ~280 ms และ 5,000 ตัวอักษร และทั้งสองมีราคาถูกกว่า v3 หากแอปพลิเคชันของคุณต้องการความหน่วงต่ำกว่า 100 ms ElevenLabs ขายสิ่งนี้อย่างชัดเจน ขณะที่สื่อเปิดตัวของ Google ไม่ได้กล่าวอ้างเรื่องความหน่วงที่เทียบเคียงได้สำหรับโมเดล TTS ใหม่ทั้งสองรุ่น

• ระบบนิเวศหนึ่ง การพากย์เสียง วอยซ์เอเจนต์ เอนด์พอยต์สำหรับการสนทนา โครงสร้างแพ็กเกจที่แนบมาพร้อมคอนเคอร์เรนซี — เหตุผลเดียวกับที่ Cartesia ขายเทเลโฟนี: มันคือสแต็ก ไม่ใช่โมเดล

หากคุณกำลังซื้อสแต็ก ราคา 3.0x คือราคาที่ต้องจ่ายสำหรับการไม่ประกอบมันเอง หากคุณกำลังซื้อการเรียกใช้การสังเคราะห์เสียง คุณกำลังจ่ายสำหรับคลังเสียงและระดับความหน่วง

สิ่งที่ Google กำลังขายอยู่จริง ๆ

ข้อโต้แย้งนั้นแคบกว่าและแข็งแกร่งกว่าคำว่า "ถูกกว่า"

• ความครอบคลุมของภาษา — 130 ภาษาบน Flash TTS และ 101 บน Flash-Lite TTS ตรวจจับอัตโนมัติจากข้อความ เทียบกับกว่า 70 ภาษาที่ ElevenLabs ระบุไว้สำหรับ Eleven v3 สำหรับการแปลเป็นภาษาท้องถิ่น ความแตกต่างนั้นไม่ใช่การเปรียบเทียบคุณสมบัติ แต่เป็นช่องว่างด้านความครอบคลุม

• การกำกับ — การควบคุมการส่งเสียงทีละบรรทัด การจัดฉากผู้พูดสองคนภายในหนึ่งการเรียก และสัญญาณอวัจนภาษาที่เขียนไว้ในสคริปต์เป็น <หัวเราะ>, <ถอนหายใจ>, <อ้าปากค้าง>, |อืม| และ |ใช่|. Google อ้างว่ารุ่น 3.8 ปรับปรุงความสม่ำเสมอในเนื้อหารูปแบบยาวและความสามารถควบคุมผู้พูดสองคนให้ดีกว่า Gemini 3.1 Flash TTS ซึ่งเป็นสิ่งที่ฟีเจอร์เหล่านั้นมีอยู่เพื่อการนี้โดยเฉพาะ คำกล่าวอ้างของผู้ขาย ยังไม่มีการทำซ้ำ

• โมเดลสถานะของเสียง — เสียงกำหนดเองแบบมีสถานะ 200 เสียงต่อโปรเจกต์ โดยมี TTL หนึ่งปี หรือเสียงแบบไร้สถานะที่อ้างอิงผ่าน voicekey_... แฮนเดิลที่หมดอายุในเจ็ดวัน นั่นคือการตัดสินใจด้านโครงสร้างพื้นฐานที่คุณสามารถวางแผนรองรับได้

• การควบคุมเอาต์พุต — WAV 24 kHz โมโน PCM 16-บิตแบบ signed บนปลายทางแบบ unary, PCM ที่ไม่มีเฮดเดอร์ (audio/l16) บนปลายทางแบบสตรีมมิง และ audio/mulaw กับ audio/alaw พร้อมอัตราการสุ่มตัวอย่างที่กำหนดค่าได้

การทดสอบประสิทธิภาพตอนเปิดตัวของ Google นั้นรายงานโดยผู้ขาย และควรอ่านเช่นนั้น: เป็นที่หนึ่งใน Hume AI Voice Design Benchmark ที่ 71.4 และเป็นที่หนึ่งในการสร้างแบบจำลองสำเนียงที่ 60.8 เป็นที่หนึ่งและที่สองใน Hume Overall Quality Index สำหรับ Flash และ Flash-Lite ตามลำดับ และได้รับการจัดอันดับสูงสุดในการทดสอบ blind-preference ที่อ้างในภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนแบบเม็กซิโก และฮินดี ไม่มีผลการทดสอบใดเหล่านี้ที่เปิดเผยต่อสาธารณะ arena Elo ข้างต้นเป็นตัวเลขเดียวที่เก็บรวบรวมอย่างอิสระในบทความนี้ และมันบังเอิญสอดคล้องกับทิศทางของคำกล่าวอ้างของผู้ขาย

แคลคูลัสของสวิตช์

เปลี่ยนมาใช้ถ้าปริมาณงานของคุณเป็นแบบฟอร์มยาว หลายภาษา หรือปริมาณสูงพอที่ 3.0x จะปรากฏเป็นรายการในใบแจ้งหนี้ และถ้าคุณสามารถอยู่กับแคตตาล็อกเสียงเริ่มต้นที่เล็กกว่า และไม่มีระดับ sub-100 ms ที่เปิดเผย นั่นครอบคลุมการบรรยาย การพากย์เสียง การเข้าถึง และเสียงพูดที่ฝังในผลิตภัณฑ์ส่วนใหญ่

อยู่ต่อหากคุณกำลังซื้อสแต็ก — ไลบรารีเสียง, ระดับความหน่วง, ผลิตภัณฑ์พากย์เสียงและเอเจนต์ — หรือหากภาระงานของคุณเต็มไปด้วยคำพูดสั้นมาก ๆ ที่มิเตอร์เสียงแบบคิดตามวินาทีทำให้คุณเสียเปรียบ นอกจากนี้ให้อยู่ต่อหากคุณได้ไฟน์จูนเอกลักษณ์เสียงบน ElevenLabs ที่ผู้ใช้ของคุณจดจำได้แล้ว เพราะความต่อเนื่องของเสียงเป็นฟีเจอร์ของผลิตภัณฑ์ และการสร้างใหม่บนโมเดลใหม่ถือเป็นโปรเจกต์

ไม่ว่าจะทางไหน วิธีที่สมเหตุสมผลคือการรันทั้งสองตัวเป็นเวลาหนึ่งเดือนบนทราฟฟิกจริงก่อนตัดสินใจ และนั่นคือเหตุผลที่ไม่ควรเชื่อมต่อตัวใดตัวหนึ่งเข้ากับโค้ดเบสของคุณโดยตรงโมเดล 200+ ตัวภายใต้คีย์เดียว ในราคาตามที่ผู้ให้บริการกำหนดโดยไม่บวกราคา ดังนั้นการปรับราคาจากแล็บใดแล็บหนึ่งจะสะท้อนถึงบิลของคุณภายในวันเดียวกัน แทนที่จะเป็นตอนต่ออายุ และ การสลับสำรองอัตโนมัติช่วยให้เส้นทางการพูดในระบบโปรดักชันยังทำงานอยู่ เมื่อเอนด์พอยต์ใหม่เอี่ยมทำงานผิดปกติ เราไม่ได้โฮสต์ ElevenLabs — เลเยอร์การสังเคราะห์เสียงและเอเจนต์ของมันเป็นผลิตภัณฑ์ของมันเอง — และเราไม่ได้โฮสต์เอนด์พอยต์ Gemini 3.8 TTS ซึ่งมาจาก API ของ Google สิ่งที่เรามีคือเลเยอร์ข้อความที่อยู่ข้างใต้ และการกำหนดเส้นทางที่อยู่เหนือขึ้นไป

ตัวเลขที่น่าจับตาคือ Elo ของ Eleven v3 ในการปรับปรุงตารางจัดอันดับครั้งถัดไป ช่องว่าง 93 คะแนนถือเป็นความด้อยที่มากสำหรับโมเดลที่คิดราคาแพงกว่าถึงสามเท่า และหากช่วงความเชื่อมั่นแคบลงโดยที่ช่องว่างยังไม่ปิด ข้อโต้แย้งเรื่องราคาก็จะไม่ใช่ข้อแลกเปลี่ยนอีกต่อไป แต่จะกลายเป็นคำตัดสิน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube