
Gemini 3.8 TTS vs VoxCPM2: เช่าเสียง หรือรันเอง ด้วยตัวเลขจริง
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ไม่มีแถวในตารางอันดับใดที่วาง Gemini 3.8 Flash TTS กับ VoxCPM2 ไว้เคียงข้างกัน และการที่มันไม่มีอยู่จริงคือข้อเท็จจริงที่มีประโยชน์ที่สุดในการเปรียบเทียบครั้งนี้ Gemini 3.8 Flash TTS เป็นปลายทางแบบโฮสต์ที่มี Elo 1,260 อยู่ในอันดับ 2 บน Artificial Analysis Provider Voice Arena และมีตารางราคาที่ประกาศไว้เป็นโทเคน ส่วน VoxCPM2 เป็นเช็กพอยต์ของ OpenBMB — 2 พันล้านพารามิเตอร์ Apache 2.0 เปิดตัวในเดือนเมษายน 2026 — ที่ไม่มีผู้ให้บริการอินเฟอเรนซ์รายใดโฮสต์ไว้ คุณเช่ามันไม่ได้ คุณต้องรันมันเอง
ดังนั้น คำถามไม่ใช่ว่าโมเดลไหนฟังดูดีกว่า แต่เป็นว่างานของคุณจะได้รับประโยชน์มากกว่าจากการจ่ายตามจำนวนตัวอักษรเพื่อใช้ GPU ของคนอื่น หรือจากการเป็นเจ้าของ GPU เองแล้วต้องจ่ายไม่ว่ามันจะทำงานหรือไม่ นั่นเป็นโจทย์เลขคณิต และต่างจากการเปรียบเทียบโมเดลส่วนใหญ่ ตรงที่มันมีคำตอบที่คุณคำนวณได้ก่อนจะตัดสินใจ

หนึ่งในสิ่งเหล่านี้คุณเช่า อีกสิ่งหนึ่งคุณใช้งาน
เริ่มต้นจากสิ่งที่แต่ละอันมอบให้คุณจริง ๆ
• การเข้าถึง — Gemini 3.8 Flash TTS ใช้ได้ผ่าน API เท่านั้น โดยเรียกใช้งานผ่าน Gemini API และช่องทางต่าง ๆ ของ Google ที่ระบุชื่อไว้ในประกาศเมื่อวันที่ 23 กันยายน 2026 ส่วน VoxCPM2 ไม่มี endpoint ของบริษัทเองที่ใช้งานจริงในโปรดักชัน และไม่มีผู้ให้บริการ inference รายใดให้บริการมัน checkpoint จึงเป็นตัวผลิตภัณฑ์
• สัญญาอนุญาต — VoxCPM2 เผยแพร่ภายใต้ Apache 2.0 ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ได้โดยไม่ต้องมีข้อตกลงแยกต่างหาก นี่เป็นสัญญาอนุญาตที่เปิดกว้างอย่างแท้จริง และไม่ใช่ค่าเริ่มต้นสำหรับเวตโมเดลเสียงพูดแบบเปิด ซึ่งหลายตัวเผยแพร่ภายใต้เงื่อนไขสำหรับการวิจัยเท่านั้น ทำให้การใช้เชิงพาณิชย์ต้องดำเนินการผ่าน API ที่โฮสต์ไว้
• ขนาด — VoxCPM2 มี 2B พารามิเตอร์ และใช้ VRAM ประมาณ 8 GB ที่ความแม่นยำลดลงสำหรับการพัฒนา โดยมีค่าสูงสุดขณะให้บริการราว 22 GB บนการ์ด 24 GB Google ไม่ได้เปิดเผยจำนวนพารามิเตอร์สำหรับโมเดล Gemini 3.8 TTS ทั้งสองรุ่น
• การสร้างเสียง — Gemini 3.8 Flash TTS ออกแบบเสียงจากคำบรรยายที่เป็นข้อความ ทำการเลียนแบบเสียงจากตัวอย่างความยาว 30 วินาที และสร้างบทสนทนาสองผู้พูดได้ในหนึ่งครั้งการเรียกใช้ VoxCPM2 เป็นโมเดลแปลงข้อความเป็นเสียงแบบเสียงเดียว; บทสนทนาหนึ่งบทจะเป็นการรันสองครั้งที่นำมาต่อกัน
• คะแนนอิสระ — Flash TTS มีอยู่ ส่วน VoxCPM2 ไม่ปรากฏอยู่ในแถวที่จัดอันดับบน Provider Voice Arena ที่บันทึกไว้เมื่อวันที่ 24 กันยายน 2026 การไม่ปรากฏบนบอร์ดไม่ใช่คำตัดสินเรื่องคุณภาพ — โดยปกติแล้วหมายความว่าไม่มีใครส่งโมเดลนี้เข้าร่วม — แต่มันก็หมายความว่าไม่มีตัวเลขความชื่นชอบจากบุคคลที่สามให้นำมาชั่งน้ำหนักได้

ประเด็นสุดท้ายนั้นใช้ได้ทั้งสองทาง และควรพูดให้ตรงไปตรงมามากกว่าจะกลบเกลื่อน: หากคุณต้องการสัญญาณคุณภาพที่เป็นอิสระก่อนตัดสินใจเลือก มีเพียงหนึ่งในสองอย่างนี้เท่านั้นที่ให้สัญญาณนั้นได้
ตัวเลขชี้ขาด: ปัจจัยเวลาจริง
การโฮสต์โมเดลเสียงพูดด้วยตนเองจะเปลี่ยนบิลต่ออักขระให้เป็นบิลต่อชั่วโมง GPU และอัตราแลกเปลี่ยนระหว่างสองหน่วยนั้นคือปัจจัยเวลาจริง (real-time factor) ของโมเดล — ต้องใช้เวลาประมวลผลกี่วินาทีในการสร้างเสียงหนึ่งวินาที
ตัวเลขที่เผยแพร่ของ VoxCPM2 อยู่ที่ 0.30 ใน PyTorch ธรรมดา และ 0.13 ภายใต้ Nano-VLLM ให้อ่านค่าเหล่านี้เป็น throughput มากกว่า latency: ที่ 0.13 เวลาจริงของ GPU หนึ่งชั่วโมงให้ผลลัพธ์ประมาณ 7.7 ชั่วโมงของเสียงที่เสร็จสมบูรณ์ ที่ 0.30 GPU หนึ่งชั่วโมงเดียวกันให้ผลใกล้เคียง 3.3 ชั่วโมง สิ่งเหล่านี้เป็นตัวเลขจาก model card ของโมเดลเอง ซึ่งวัดโดย OpenBMB และเป็นข้อมูลนำเข้าที่สำคัญที่สุดเพียงหนึ่งเดียวสำหรับการตัดสินใจสร้างเองหรือซื้อในกรณีนี้
มีสามสิ่งที่ตามมาจากสิ่งเหล่านั้น
• สแต็กการให้บริการสำคัญกว่าโมเดล การเปลี่ยนจาก PyTorch ธรรมดาเป็น Nano-VLLM ช่วยเพิ่มทรูพุตมากกว่าสองเท่าบนฮาร์ดแวร์เดียวกัน โมเดลต้นทุนใด ๆ ที่อิงจากตัวเลข 0.30 จะประเมินต้นทุนการโฮสต์เองสูงเกินไปประมาณ 2.3 เท่า
• อัตราการใช้งานคือหัวใจทั้งหมด GPU ที่เช่ามาแล้วว่างงาน 90% ของเวลา ไม่ได้ถูกกว่าการใช้ API ไม่ว่าราคาจะเป็นเท่าไร จุดคุ้มทุนจะเกิดขึ้นก็ต่อเมื่อคุณทำให้การ์ดทำงานอยู่ตลอด
• การประมวลผลแบบเป็นชุด (batching) เปลี่ยนการคำนวณทางคณิตศาสตร์อีกครั้ง ปัจจัยเวลาจริง (real-time factor) ถูกวัดต่อสตรีม; เซิร์ฟเวอร์ที่จัดการคำขอพร้อมกันจะเฉลี่ยต้นทุนคงที่ไปยังคำขอเหล่านั้น ซึ่งเป็นสภาวะที่การโฮสต์เองเริ่มได้เปรียบพอดี
เสียงหนึ่งชั่วโมงมีค่าใช้จ่ายเท่าไร ทั้งสองทาง
วางโมเดลการคิดค่าบริการทั้งสองแบบไว้บนแกนเดียวกัน ออดิโอที่เสร็จสมบูรณ์หนึ่งชั่วโมงคือผลลัพธ์ 3,600 วินาที
ในฝั่งบริการเช่า Google คิดค่าบริการเป็นโทเคนแทนตัวอักษร: 0.50 ดอลลาร์ต่อล้านโทเคนข้อความขาเข้า และ 9.00 ดอลลาร์ต่อล้านโทเคนเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น 18.00 ดอลลาร์; Flash-Lite TTS อยู่ที่ 0.50 และ 6.00 ดอลลาร์ จากนั้นเป็น 12.00 ดอลลาร์ Batch และ Flex อยู่ที่ 0.25 และ 4.50 ดอลลาร์สำหรับ Flash TTS เทียบกับ 0.25 และ 3.00 ดอลลาร์สำหรับ Flash-Lite TTS และ Priority อยู่ที่ 0.90 และ 16.00 ดอลลาร์ Artificial Analysis ปรับอัตรามาตรฐานให้เป็น 16.50 และ 11.00 ดอลลาร์ต่อล้านตัวอักษร ซึ่งเป็นการแปลงของบอร์ด ไม่ใช่ราคาที่ Google แจ้ง และเป็นตัวเลขที่ควรใช้เมื่อเปรียบเทียบกับโมเดลที่คิดค่าบริการเป็นตัวอักษร
ในฝั่งที่เป็นเจ้าของเองนั้นไม่มีอัตราคิดค่าต่อตัวอักษรเลย ค่าใช้จ่ายคือชั่วโมง GPU คูณด้วยจำนวนชั่วโมงที่คุณต้องการที่ปริมาณงานตามข้างต้น บวกกับสแต็กการให้บริการ บวกกับบุคลากรที่คอยดูแลให้มันทำงาน ข้อได้เปรียบของ VoxCPM2 คือต้นทุนส่วนเพิ่มของชั่วโมงที่หนึ่งพันนั้นเท่ากับชั่วโมงแรก — และข้อเสียของมันคือต้นทุนส่วนเพิ่มของชั่วโมงแรกคือ GPU หนึ่งตัว
ซึ่งเป็นเหตุผลที่การตัดสินใจครั้งนี้ไม่обычноชัดเจน:
• เมื่อปริมาณต่ำกว่าระดับหนึ่ง API จะชนะแบบไม่ต้องลุ้นเลย คุณจ่ายเงินเพียงหลักเดียวต่อชั่วโมงเสียง เมื่อเทียบกับต้นทุนด้านทุน และอัตราโปรโมชันของ Google ทำให้ช่องว่างนั้นกว้างขึ้นไปจนถึงวันที่ 1 มกราคม 2027
• เมื่อปริมาณสูงกว่านั้น บนฮาร์ดแวร์ที่คุณมีอยู่แล้วและใช้งานให้ไม่ว่างได้ เช็กพอยต์ที่ใช้สัญญาอนุญาต Apache 2.0 จะชนะอย่างเด็ดขาด — และต่างจากเช็กพอยต์ที่ใช้สัญญาอนุญาตเพื่อการวิจัย ไม่มีอะไรในสัญญาอนุญาตที่จะหยุดคุณจากการนำมันออกใช้จริง
• ในระหว่างนั้น คำตอบที่ตรงไปตรงมาคือคุณกำลังซื้อทางเลือกมากกว่าการประหยัด การโฮสต์เองช่วยให้คุณปักหมุดเวอร์ชันได้ เก็บเสียงไว้บนโครงสร้างพื้นฐานของคุณเอง และเลิกสนใจการเปลี่ยนแปลงอัตราค่าบริการของผู้ให้บริการ
โดยที่แต่ละรายการคือคำตอบที่ถูกต้อง
เลือก Gemini 3.8 Flash TTS เมื่อคุณต้องการผลิตภัณฑ์ที่มีเอกสารประกอบที่ดีกว่า มีคะแนนอิสระ ราคาที่ประกาศไว้ บทสนทนาสองผู้พูดในการเรียกครั้งเดียว การออกแบบและการจำลองเสียง และไม่มีพื้นผิวการดำเนินงานใด ๆ นอกเหนือจากคีย์ API Flash-Lite TTS ในตระกูลเดียวกันให้จุดราคาที่สองภายในอินเทอร์เฟซเดียวกันในราคามาตรฐาน $11.00 ต่อล้านตัวอักษร สิ่งที่คุณยอมรับเป็นการแลกเปลี่ยนคืออัตราที่จะเพิ่มเป็นสองเท่าในวันที่ 1 มกราคม 2027 และไม่สามารถรันโมเดลได้ที่ไหนเลย
เลือก VoxCPM2 เมื่องานด้านปฏิบัติการคือประเด็นสำคัญ Apache 2.0 หมายความว่าการใช้งานเชิงพาณิชย์ได้รับอนุญาตโดยตรง ขนาด 2B หมายความว่าใช้ตัวเร่งเพียงตัวเดียวก็เพียงพอ และปัจจัยเวลาจริง 0.13 ภายใต้ Nano-VLLM หมายความว่าการ์ดระดับปานกลางสามารถสร้างเสียงได้หลายชั่วโมงต่อเวลาจริงหนึ่งชั่วโมง สิ่งที่คุณยอมรับคือจะไม่มีใครมารันมันให้คุณ ไม่มี endpoint แบบโฮสต์ ไม่มีแถวใน arena ไม่มีตารางราคาจากผู้ขาย และการรับประกันคุณภาพทุกอย่างที่คุณได้มาคือสิ่งที่คุณต้องสร้างและวัดด้วยตัวเอง

ไม่มีโมเดลใดที่ OrcaRouter เป็นผู้โฮสต์ และเรื่องนี้ควรพูดกันตรง ๆ มากกว่าจะปล่อยให้เข้าใจเป็นอย่างอื่น จุดที่คุณจะเรียกใช้ Gemini 3.8 Flash TTS คือ API ของ Google เองและพื้นผิวต่าง ๆ ที่ Google ระบุชื่อไว้ ส่วน VoxCPM2 นั้นเป็นเช็กพอยต์ที่คุณนำไปดีพลอยเอง สิ่งที่ OrcaRouter ครอบคลุมคือเลเยอร์ที่อยู่เหนือการตัดสินใจตรงนั้น — โมเดลมากกว่า 200 รายการ อยู่เบื้องหลังคีย์เดียวในราคาตามรายการของผู้ให้บริการ โดยไม่บวกเพิ่ม ดังนั้นเมื่อผู้ขายปรับราคา ฝั่งเราจะอัปเดตทันทีในวันเดียวกัน ไม่ต้องรอรอบบิลถัดไป การสลับไปใช้ระบบสำรองอัตโนมัติ เพื่อให้โมเดลที่อยู่ระหว่างการประเมินไม่ต้องกลายเป็น dependency ของงานโปรดักชัน และมี routing DSL ที่ประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียวในกรณีที่เสียงเดียวแบกงานทั้งหมดไม่ไหว
สิ่งที่ควรดูต่อไป
สองสิ่งที่จะเปลี่ยนแปลงการเปรียบเทียบนี้อย่างมีนัยสำคัญ และยังไม่มีสิ่งใดเกิดขึ้นเลย
อย่างแรกคือมีใครสักคนโฮสต์ VoxCPM2 การที่มันยังไม่มีอยู่ในตลาด inference คือเหตุผลหลักที่ทำให้สองโมเดลนี้ถูกนำมาเปรียบเทียบกันในเชิงเศรษฐศาสตร์มากกว่าด้านคุณภาพ — หากมีผู้ให้บริการรายใดรับมันไปใช้ การคำนวณระหว่างการเช่ากับการเป็นเจ้าของเองก็จะเลิกเป็นปัจจัยชี้ขาด และแถวที่ขาดหายไปในอารีนาจะกลายเป็นสิ่งที่คุณอยากให้มีคนมาเติมให้เต็ม
อย่างที่สองคือการเปลี่ยนแปลงอัตราค่าบริการในเดือนมกราคมของฝั่ง Google ในอัตราโปรโมชัน API ถูกพอที่งานส่วนใหญ่ไม่ควรโฮสต์เองเลย เมื่อเข้าสู่อัตราหลังโปรโมชัน ช่องว่างแคบลงถึงจุดที่ทีมที่มีขีดความสามารถ GPU อยู่แล้วและมีปริมาณงานสม่ำเสมอ ควรคำนวณตัวเลขอีกครั้ง แทนที่จะสมมติว่า API ยังชนะอยู่
จนกว่าหนึ่งในนั้นจะขยับ ปัจจัยที่ชี้ขาดไม่ใช่ตารางอันดับ แต่คือจำนวนชั่วโมงเสียงที่คุณผลิตต่อเดือน และการ์ดนั้นยุ่งอยู่หรือไม่
