การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Gemini 3.8 TTS vs VoxCPM2' บนพื้นหลังสีขาวพร้อมเน้นไล่ระดับสีฟ้าและสีฟ้าอมเขียวแบบนุ่มนวล การ์ดด้านซ้าย 'Gemini 3.8 Flash TTS' แสดงรายการปลายทาง API, Elo 1,260 ที่อันดับ 2, และ $16.50 ต่อ 1 ล้านตัวอักษรที่ปรับมาตรฐาน; การ์ดด้านขวา 'VoxCPM2' แสดงรายการ Apache 2.0, พารามิเตอร์ 2B, ต้องใช้ VRAM ประมาณ 8 GB ในการรัน, ปัจจัยเวลาจริง 0.30 ใน PyTorch ธรรมดา และไม่มีปลายทางโฮสต์ บรรทัดส่วนท้ายอ่านว่า 'Elo ตาม Artificial Analysis Provider Voice Arena, กันยายน 2026; ตัวเลขของ VoxCPM2 ตามการ์ดโมเดลของมัน' โลโก้ OrcaRouter ถูกประกอบไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 TTS vs VoxCPM2: เช่าเสียง หรือรันเอง ด้วยตัวเลขจริง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ไม่มีแถวในตารางอันดับใดที่วาง Gemini 3.8 Flash TTS กับ VoxCPM2 ไว้เคียงข้างกัน และการที่มันไม่มีอยู่จริงคือข้อเท็จจริงที่มีประโยชน์ที่สุดในการเปรียบเทียบครั้งนี้ Gemini 3.8 Flash TTS เป็นปลายทางแบบโฮสต์ที่มี Elo 1,260 อยู่ในอันดับ 2 บน Artificial Analysis Provider Voice Arena และมีตารางราคาที่ประกาศไว้เป็นโทเคน ส่วน VoxCPM2 เป็นเช็กพอยต์ของ OpenBMB — 2 พันล้านพารามิเตอร์ Apache 2.0 เปิดตัวในเดือนเมษายน 2026 — ที่ไม่มีผู้ให้บริการอินเฟอเรนซ์รายใดโฮสต์ไว้ คุณเช่ามันไม่ได้ คุณต้องรันมันเอง

ดังนั้น คำถามไม่ใช่ว่าโมเดลไหนฟังดูดีกว่า แต่เป็นว่างานของคุณจะได้รับประโยชน์มากกว่าจากการจ่ายตามจำนวนตัวอักษรเพื่อใช้ GPU ของคนอื่น หรือจากการเป็นเจ้าของ GPU เองแล้วต้องจ่ายไม่ว่ามันจะทำงานหรือไม่ นั่นเป็นโจทย์เลขคณิต และต่างจากการเปรียบเทียบโมเดลส่วนใหญ่ ตรงที่มันมีคำตอบที่คุณคำนวณได้ก่อนจะตัดสินใจ

A generated comparison scoreboard for Gemini 3.8 Flash TTS and VoxCPM2, showing access (a hosted API against self-hosted only), size (undisclosed against 2B parameters), licence (vendor terms against Apache 2.0), price ($16.50 per 1M characters against a GPU-hour cost), throughput (not applicable against a real-time factor of 0.13 to 0.30) and independent Elo (1,260 against none).

หนึ่งในสิ่งเหล่านี้คุณเช่า อีกสิ่งหนึ่งคุณใช้งาน

เริ่มต้นจากสิ่งที่แต่ละอันมอบให้คุณจริง ๆ

• การเข้าถึง — Gemini 3.8 Flash TTS ใช้ได้ผ่าน API เท่านั้น โดยเรียกใช้งานผ่าน Gemini API และช่องทางต่าง ๆ ของ Google ที่ระบุชื่อไว้ในประกาศเมื่อวันที่ 23 กันยายน 2026 ส่วน VoxCPM2 ไม่มี endpoint ของบริษัทเองที่ใช้งานจริงในโปรดักชัน และไม่มีผู้ให้บริการ inference รายใดให้บริการมัน checkpoint จึงเป็นตัวผลิตภัณฑ์

• สัญญาอนุญาต — VoxCPM2 เผยแพร่ภายใต้ Apache 2.0 ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ได้โดยไม่ต้องมีข้อตกลงแยกต่างหาก นี่เป็นสัญญาอนุญาตที่เปิดกว้างอย่างแท้จริง และไม่ใช่ค่าเริ่มต้นสำหรับเวตโมเดลเสียงพูดแบบเปิด ซึ่งหลายตัวเผยแพร่ภายใต้เงื่อนไขสำหรับการวิจัยเท่านั้น ทำให้การใช้เชิงพาณิชย์ต้องดำเนินการผ่าน API ที่โฮสต์ไว้

• ขนาด — VoxCPM2 มี 2B พารามิเตอร์ และใช้ VRAM ประมาณ 8 GB ที่ความแม่นยำลดลงสำหรับการพัฒนา โดยมีค่าสูงสุดขณะให้บริการราว 22 GB บนการ์ด 24 GB Google ไม่ได้เปิดเผยจำนวนพารามิเตอร์สำหรับโมเดล Gemini 3.8 TTS ทั้งสองรุ่น

• การสร้างเสียง — Gemini 3.8 Flash TTS ออกแบบเสียงจากคำบรรยายที่เป็นข้อความ ทำการเลียนแบบเสียงจากตัวอย่างความยาว 30 วินาที และสร้างบทสนทนาสองผู้พูดได้ในหนึ่งครั้งการเรียกใช้ VoxCPM2 เป็นโมเดลแปลงข้อความเป็นเสียงแบบเสียงเดียว; บทสนทนาหนึ่งบทจะเป็นการรันสองครั้งที่นำมาต่อกัน

• คะแนนอิสระ — Flash TTS มีอยู่ ส่วน VoxCPM2 ไม่ปรากฏอยู่ในแถวที่จัดอันดับบน Provider Voice Arena ที่บันทึกไว้เมื่อวันที่ 24 กันยายน 2026 การไม่ปรากฏบนบอร์ดไม่ใช่คำตัดสินเรื่องคุณภาพ — โดยปกติแล้วหมายความว่าไม่มีใครส่งโมเดลนี้เข้าร่วม — แต่มันก็หมายความว่าไม่มีตัวเลขความชื่นชอบจากบุคคลที่สามให้นำมาชั่งน้ำหนักได้

A screenshot of the Hugging Face model card for OpenBMB/VoxCPM2, showing the Apache 2.0 licence, the 2 billion parameter checkpoint size, the 30-language coverage, 48 kHz output and the 2 million hours of training audio recorded on the card.

ประเด็นสุดท้ายนั้นใช้ได้ทั้งสองทาง และควรพูดให้ตรงไปตรงมามากกว่าจะกลบเกลื่อน: หากคุณต้องการสัญญาณคุณภาพที่เป็นอิสระก่อนตัดสินใจเลือก มีเพียงหนึ่งในสองอย่างนี้เท่านั้นที่ให้สัญญาณนั้นได้

ตัวเลขชี้ขาด: ปัจจัยเวลาจริง

การโฮสต์โมเดลเสียงพูดด้วยตนเองจะเปลี่ยนบิลต่ออักขระให้เป็นบิลต่อชั่วโมง GPU และอัตราแลกเปลี่ยนระหว่างสองหน่วยนั้นคือปัจจัยเวลาจริง (real-time factor) ของโมเดล — ต้องใช้เวลาประมวลผลกี่วินาทีในการสร้างเสียงหนึ่งวินาที

ตัวเลขที่เผยแพร่ของ VoxCPM2 อยู่ที่ 0.30 ใน PyTorch ธรรมดา และ 0.13 ภายใต้ Nano-VLLM ให้อ่านค่าเหล่านี้เป็น throughput มากกว่า latency: ที่ 0.13 เวลาจริงของ GPU หนึ่งชั่วโมงให้ผลลัพธ์ประมาณ 7.7 ชั่วโมงของเสียงที่เสร็จสมบูรณ์ ที่ 0.30 GPU หนึ่งชั่วโมงเดียวกันให้ผลใกล้เคียง 3.3 ชั่วโมง สิ่งเหล่านี้เป็นตัวเลขจาก model card ของโมเดลเอง ซึ่งวัดโดย OpenBMB และเป็นข้อมูลนำเข้าที่สำคัญที่สุดเพียงหนึ่งเดียวสำหรับการตัดสินใจสร้างเองหรือซื้อในกรณีนี้

มีสามสิ่งที่ตามมาจากสิ่งเหล่านั้น

• สแต็กการให้บริการสำคัญกว่าโมเดล การเปลี่ยนจาก PyTorch ธรรมดาเป็น Nano-VLLM ช่วยเพิ่มทรูพุตมากกว่าสองเท่าบนฮาร์ดแวร์เดียวกัน โมเดลต้นทุนใด ๆ ที่อิงจากตัวเลข 0.30 จะประเมินต้นทุนการโฮสต์เองสูงเกินไปประมาณ 2.3 เท่า

• อัตราการใช้งานคือหัวใจทั้งหมด GPU ที่เช่ามาแล้วว่างงาน 90% ของเวลา ไม่ได้ถูกกว่าการใช้ API ไม่ว่าราคาจะเป็นเท่าไร จุดคุ้มทุนจะเกิดขึ้นก็ต่อเมื่อคุณทำให้การ์ดทำงานอยู่ตลอด

• การประมวลผลแบบเป็นชุด (batching) เปลี่ยนการคำนวณทางคณิตศาสตร์อีกครั้ง ปัจจัยเวลาจริง (real-time factor) ถูกวัดต่อสตรีม; เซิร์ฟเวอร์ที่จัดการคำขอพร้อมกันจะเฉลี่ยต้นทุนคงที่ไปยังคำขอเหล่านั้น ซึ่งเป็นสภาวะที่การโฮสต์เองเริ่มได้เปรียบพอดี

เสียงหนึ่งชั่วโมงมีค่าใช้จ่ายเท่าไร ทั้งสองทาง

วางโมเดลการคิดค่าบริการทั้งสองแบบไว้บนแกนเดียวกัน ออดิโอที่เสร็จสมบูรณ์หนึ่งชั่วโมงคือผลลัพธ์ 3,600 วินาที

ในฝั่งบริการเช่า Google คิดค่าบริการเป็นโทเคนแทนตัวอักษร: 0.50 ดอลลาร์ต่อล้านโทเคนข้อความขาเข้า และ 9.00 ดอลลาร์ต่อล้านโทเคนเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น 18.00 ดอลลาร์; Flash-Lite TTS อยู่ที่ 0.50 และ 6.00 ดอลลาร์ จากนั้นเป็น 12.00 ดอลลาร์ Batch และ Flex อยู่ที่ 0.25 และ 4.50 ดอลลาร์สำหรับ Flash TTS เทียบกับ 0.25 และ 3.00 ดอลลาร์สำหรับ Flash-Lite TTS และ Priority อยู่ที่ 0.90 และ 16.00 ดอลลาร์ Artificial Analysis ปรับอัตรามาตรฐานให้เป็น 16.50 และ 11.00 ดอลลาร์ต่อล้านตัวอักษร ซึ่งเป็นการแปลงของบอร์ด ไม่ใช่ราคาที่ Google แจ้ง และเป็นตัวเลขที่ควรใช้เมื่อเปรียบเทียบกับโมเดลที่คิดค่าบริการเป็นตัวอักษร

ในฝั่งที่เป็นเจ้าของเองนั้นไม่มีอัตราคิดค่าต่อตัวอักษรเลย ค่าใช้จ่ายคือชั่วโมง GPU คูณด้วยจำนวนชั่วโมงที่คุณต้องการที่ปริมาณงานตามข้างต้น บวกกับสแต็กการให้บริการ บวกกับบุคลากรที่คอยดูแลให้มันทำงาน ข้อได้เปรียบของ VoxCPM2 คือต้นทุนส่วนเพิ่มของชั่วโมงที่หนึ่งพันนั้นเท่ากับชั่วโมงแรก — และข้อเสียของมันคือต้นทุนส่วนเพิ่มของชั่วโมงแรกคือ GPU หนึ่งตัว

ซึ่งเป็นเหตุผลที่การตัดสินใจครั้งนี้ไม่обычноชัดเจน:

• เมื่อปริมาณต่ำกว่าระดับหนึ่ง API จะชนะแบบไม่ต้องลุ้นเลย คุณจ่ายเงินเพียงหลักเดียวต่อชั่วโมงเสียง เมื่อเทียบกับต้นทุนด้านทุน และอัตราโปรโมชันของ Google ทำให้ช่องว่างนั้นกว้างขึ้นไปจนถึงวันที่ 1 มกราคม 2027

• เมื่อปริมาณสูงกว่านั้น บนฮาร์ดแวร์ที่คุณมีอยู่แล้วและใช้งานให้ไม่ว่างได้ เช็กพอยต์ที่ใช้สัญญาอนุญาต Apache 2.0 จะชนะอย่างเด็ดขาด — และต่างจากเช็กพอยต์ที่ใช้สัญญาอนุญาตเพื่อการวิจัย ไม่มีอะไรในสัญญาอนุญาตที่จะหยุดคุณจากการนำมันออกใช้จริง

• ในระหว่างนั้น คำตอบที่ตรงไปตรงมาคือคุณกำลังซื้อทางเลือกมากกว่าการประหยัด การโฮสต์เองช่วยให้คุณปักหมุดเวอร์ชันได้ เก็บเสียงไว้บนโครงสร้างพื้นฐานของคุณเอง และเลิกสนใจการเปลี่ยนแปลงอัตราค่าบริการของผู้ให้บริการ

โดยที่แต่ละรายการคือคำตอบที่ถูกต้อง

เลือก Gemini 3.8 Flash TTS เมื่อคุณต้องการผลิตภัณฑ์ที่มีเอกสารประกอบที่ดีกว่า มีคะแนนอิสระ ราคาที่ประกาศไว้ บทสนทนาสองผู้พูดในการเรียกครั้งเดียว การออกแบบและการจำลองเสียง และไม่มีพื้นผิวการดำเนินงานใด ๆ นอกเหนือจากคีย์ API Flash-Lite TTS ในตระกูลเดียวกันให้จุดราคาที่สองภายในอินเทอร์เฟซเดียวกันในราคามาตรฐาน $11.00 ต่อล้านตัวอักษร สิ่งที่คุณยอมรับเป็นการแลกเปลี่ยนคืออัตราที่จะเพิ่มเป็นสองเท่าในวันที่ 1 มกราคม 2027 และไม่สามารถรันโมเดลได้ที่ไหนเลย

เลือก VoxCPM2 เมื่องานด้านปฏิบัติการคือประเด็นสำคัญ Apache 2.0 หมายความว่าการใช้งานเชิงพาณิชย์ได้รับอนุญาตโดยตรง ขนาด 2B หมายความว่าใช้ตัวเร่งเพียงตัวเดียวก็เพียงพอ และปัจจัยเวลาจริง 0.13 ภายใต้ Nano-VLLM หมายความว่าการ์ดระดับปานกลางสามารถสร้างเสียงได้หลายชั่วโมงต่อเวลาจริงหนึ่งชั่วโมง สิ่งที่คุณยอมรับคือจะไม่มีใครมารันมันให้คุณ ไม่มี endpoint แบบโฮสต์ ไม่มีแถวใน arena ไม่มีตารางราคาจากผู้ขาย และการรับประกันคุณภาพทุกอย่างที่คุณได้มาคือสิ่งที่คุณต้องสร้างและวัดด้วยตัวเอง

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and 8 arena voices, with Gemini 3.8 Flash-Lite TTS at rank 6 and no VoxCPM2 row on the board.

ไม่มีโมเดลใดที่ OrcaRouter เป็นผู้โฮสต์ และเรื่องนี้ควรพูดกันตรง ๆ มากกว่าจะปล่อยให้เข้าใจเป็นอย่างอื่น จุดที่คุณจะเรียกใช้ Gemini 3.8 Flash TTS คือ API ของ Google เองและพื้นผิวต่าง ๆ ที่ Google ระบุชื่อไว้ ส่วน VoxCPM2 นั้นเป็นเช็กพอยต์ที่คุณนำไปดีพลอยเอง สิ่งที่ OrcaRouter ครอบคลุมคือเลเยอร์ที่อยู่เหนือการตัดสินใจตรงนั้น — โมเดลมากกว่า 200 รายการ อยู่เบื้องหลังคีย์เดียวในราคาตามรายการของผู้ให้บริการ โดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ขายปรับราคา ฝั่งเราจะอัปเดตทันทีในวันเดียวกัน ไม่ต้องรอรอบบิลถัดไป การสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้โมเดลที่อยู่ระหว่างการประเมินไม่ต้องกลายเป็น dependency ของงานโปรดักชัน และมี routing DSL ที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียวในกรณีที่เสียงเดียวแบกงานทั้งหมดไม่ไหว

สิ่งที่ควรดูต่อไป

สองสิ่งที่จะเปลี่ยนแปลงการเปรียบเทียบนี้อย่างมีนัยสำคัญ และยังไม่มีสิ่งใดเกิดขึ้นเลย

อย่างแรกคือมีใครสักคนโฮสต์ VoxCPM2 การที่มันยังไม่มีอยู่ในตลาด inference คือเหตุผลหลักที่ทำให้สองโมเดลนี้ถูกนำมาเปรียบเทียบกันในเชิงเศรษฐศาสตร์มากกว่าด้านคุณภาพ — หากมีผู้ให้บริการรายใดรับมันไปใช้ การคำนวณระหว่างการเช่ากับการเป็นเจ้าของเองก็จะเลิกเป็นปัจจัยชี้ขาด และแถวที่ขาดหายไปในอารีนาจะกลายเป็นสิ่งที่คุณอยากให้มีคนมาเติมให้เต็ม

อย่างที่สองคือการเปลี่ยนแปลงอัตราค่าบริการในเดือนมกราคมของฝั่ง Google ในอัตราโปรโมชัน API ถูกพอที่งานส่วนใหญ่ไม่ควรโฮสต์เองเลย เมื่อเข้าสู่อัตราหลังโปรโมชัน ช่องว่างแคบลงถึงจุดที่ทีมที่มีขีดความสามารถ GPU อยู่แล้วและมีปริมาณงานสม่ำเสมอ ควรคำนวณตัวเลขอีกครั้ง แทนที่จะสมมติว่า API ยังชนะอยู่

จนกว่าหนึ่งในนั้นจะขยับ ปัจจัยที่ชี้ขาดไม่ใช่ตารางอันดับ แต่คือจำนวนชั่วโมงเสียงที่คุณผลิตต่อเดือน และการ์ดนั้นยุ่งอยู่หรือไม่

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube