
Eleven v4 vs VoxCPM2: โมเดลที่ถูกจัดอันดับปะทะเช็คพอยต์ที่คุณไม่สามารถเช่าได้
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 982 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 197 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
ข้อเท็จจริงที่มีประโยชน์ที่สุดในการเปรียบเทียบครั้งนี้ คือแถวข้อมูลที่ไม่มีอยู่จริง ElevenLabs Eleven v4ครองอันดับ 1 บน Provider Voice Arena ของ Artificial Analysis ด้วยคะแนน Elo 1,319 จากการปรากฏตัว 1,674 ครั้ง ในราคา 80.00 ดอลลาร์ต่อล้านตัวอักษร VoxCPM2 ซึ่งเป็นเช็คพอยต์ของ OpenBMB ที่เปิดตัวในเดือนเมษายน 2026 ไม่ปรากฏอยู่ที่ใดเลยบนกระดานจัดอันดับด้านเสียงทั้งสองกระดาน — ไม่ติดอันดับ ไม่ได้อยู่ในกลุ่มที่ไม่ได้จัดอันดับ ไม่มีแม้แต่รายการพรีวิว นั่นไม่ใช่คำตัดสินเรื่องคุณภาพ แต่หมายความว่าตัวเลขใดก็ตามที่คุณหวังจะนำมาเทียบกับ 1,319 นั้น ยังไม่มีใครผลิตออกมา และการเปรียบเทียบจะต้องอาศัยสิ่งอื่นที่ไม่ใช่ความชอบ สิ่งที่เหลืออยู่คือความเป็นเจ้าของ การปรับแต่งโมเดล และคำถามด้านลิขสิทธิ์ที่ปลายทางแบบโฮสต์ไม่เปิดโอกาสให้คุณถาม
สิ่งที่แต่ละฝ่ายมอบให้คุณจริง ๆ
สิ่งเหล่านี้เป็นผลิตภัณฑ์ต่างประเภทกัน และความแตกต่างนี้ไม่ใช่เพียงเรื่องผิวเผิน
• การเข้าถึง — Eleven v4 เป็น endpoint แบบโฮสต์ที่เข้าถึงได้ผ่าน API ของ ElevenLabs เอง โดยคิดค่าบริการตามจำนวนตัวอักษร ส่วน VoxCPM2 เป็น checkpoint บน Hugging Face ภายใต้ openbmb/VoxCPM2 ซึ่งคุณต้องดาวน์โหลดและรันเอง และไม่มี endpoint จากผู้ให้บริการรายแรกให้เรียกใช้
• สัญญาอนุญาต — VoxCPM2 มาพร้อม Apache 2.0 ใช้เชิงพาณิชย์ได้ฟรีอย่างชัดเจน Eleven v4 เป็น API เชิงพาณิชย์ที่มีข้อกำหนดเป็นของ ElevenLabs ความแตกต่างนี้สำคัญหากการตรวจสอบทางกฎหมายของคุณถามว่าคุณสามารถไฟน์จูน แจกจ่ายต่อ หรือส่งมอบเวทได้หรือไม่ เมื่อใช้เช็กพอยต์ คำตอบก็ถูกเขียนไว้เป็นลายลักษณ์อักษรและคงที่
• ขนาดและฮาร์ดแวร์ — VoxCPM2 มี 2B พารามิเตอร์บนโครงสร้างพื้นฐาน MiniCPM-4 และการ์ดระบุว่าใช้ VRAM ประมาณ 8 GB ที่ bfloat16 โดยมีความยาวลำดับสูงสุด 8,192 โทเคน ElevenLabs ไม่ได้เปิดเผยจำนวนพารามิเตอร์สำหรับ Eleven v4 และพื้นที่ฮาร์ดแวร์ของโมเดลที่โฮสต์ไว้ก็ไม่ใช่สิ่งที่คุณต้องดูแลจัดการ
• เชนเอาต์พุต — VoxCPM2 ยอมรับเสียงอ้างอิง 16 kHz และส่งออก 48 kHz ผ่าน super-resolution ในตัวของ AudioVAE V2 โดยไม่มีตัวอัปแซมเปลอร์ภายนอกอยู่ในเส้นทาง ส่วน TTS แบบโฮสต์จะส่งสตรีมให้คุณที่อัตราใดก็ตามที่ผู้ให้บริการเลือก
• คะแนนอิสระ — Eleven v4 มีคะแนน และอยู่ในอันดับหนึ่ง VoxCPM2 ไม่มีเลย การไม่มีไม่ใช่คะแนนต่ำ แต่เป็นโมเดลที่ยังไม่ถูกให้คะแนน และไม่ควรพูดถึงทั้งสองในประโยคเดียวกันราวกับว่าตัวที่สองเป็นตัวเลข

ตัวเลขที่แทนที่ Elo ที่หายไป
ถ้าคุณเปรียบเทียบความชอบไม่ได้ ก็ให้เปรียบเทียบสิ่งที่คุณคำนวณได้ และสำหรับโมเดลที่โฮสต์เอง สิ่งนั้นคือทรูพุต การ์ดของ VoxCPM2 ระบุค่าปัจจัยเวลาจริง (real-time factor) ไว้ที่ประมาณ 0.30 ใน PyTorch มาตรฐานบน RTX 4090 และลดลงเหลือประมาณ 0.13 ภายใต้ Nano-VLLM ค่าปัจจัยเวลาจริงคือจำนวนวินาทีของการประมวลผลต่อเสียงหนึ่งวินาที ดังนั้นตัวเลขสองค่านี้หมายความว่าหนึ่งชั่วโมง GPU ให้เสียงพูดที่เสร็จสมบูรณ์ประมาณ 3.3 ชั่วโมงในกรณีแรก และประมาณ 7.7 ชั่วโมงในกรณีที่สอง

ผลที่ตามมาสองข้อตามมาทันที สแต็กสำหรับให้บริการสำคัญกว่าตัวโมเดล: checkpoint เดียวกันบนการ์ดเดียวกันให้เอาต์พุตมากกว่าสองเท่าเมื่อคุณสลับอินเฟอเรนซ์เอนจิน ดังนั้นโมเดลต้นทุนใด ๆ ที่ใช้ตัวเลข 0.30 กำลังประเมินต้นทุนแบบโฮสต์เองของคุณสูงเกินไปประมาณ 2.3 เท่า และอัตราการใช้งานคือหัวใจทั้งหมด: การ์ดที่ว่างอยู่ไม่ชนะ API คิดตามจำนวนอักขระไม่ว่าราคาใด เพราะค่าใช้จ่ายของ API แปรผันตามสิ่งที่คุณพูด ในขณะที่ค่าใช้จ่ายของการ์ดแปรผันตามเวลาที่คุณซื้อมัน
ซึ่งนั่นคือเหตุผลว่าทำไมเวอร์ชันที่ตรงไปตรงมาของการตัดสินใจนี้จึงไม่ใช่ "อันไหนฟังดูดีกว่า" แต่เป็น "คุณผลิตเสียงกี่ชั่วโมงต่อเดือน และฮาร์ดแวร์ยุ่งอยู่หรือไม่" ต่ำกว่าปริมาณที่การ์ดยังโหลดค้างอยู่ API ชนะแบบไม่ต้องเทียบ เหนือกว่านั้นขึ้นไป บนฮาร์ดแวร์ที่คุณเป็นเจ้าของอยู่แล้ว ต้นทุนส่วนเพิ่มของเช็กพอยต์ต่อหนึ่งในพันชั่วโมงจะเท่ากับต้นทุนต่อชั่วโมงแรกของมัน — และนั่นคือข้อได้เปรียบเชิงโครงสร้างที่ไม่มีตารางราคาใดเทียบได้
ความสามารถที่เอนด์พอยต์แบบโฮสต์จะไม่ขายให้คุณ
นี่คือจุดที่การเปรียบเทียบไม่ใช่ภาพสะท้อนอีกต่อไป เพราะมีสิ่งหนึ่งที่ VoxCPM2 ทำได้แต่ Eleven v4 ทำไม่ได้โดยพื้นฐาน นั่นคือคุณสามารถฝึกมันใหม่ได้ โมเดลการ์ดได้บันทึกทั้ง SFT แบบเต็มและการไฟน์ทูน LoRA ด้วยเสียงเพียงห้าถึงสิบนาที พร้อมสคริปต์การฝึกและการกำหนดค่าที่ให้มาสำหรับแต่ละวิธี
นั่นเปลี่ยนรูปแบบของโปรแกรมเสียงพูด API แบบโฮสต์ให้โมเดลแบบตายตัว บวกกับความสามารถในการโคลนเสียงเท่าที่ผู้ขายเปิดให้ใช้ — ในกรณีของ Eleven v4 คือเสียงอ้างอิงสิบวินาทีสำหรับการโคลนแบบทันที โดยมีระดับโปรอยู่เหนือขึ้นไป เช็กพอยต์ที่ปรับแต่งด้วย LoRA ให้โมเดลที่ไม่เคยเห็นข้อมูลของใครอื่น และคุณสามารถกำหนดพฤติกรรมของมันได้ตามเวอร์ชัน สำหรับเสียงประจำแบรนด์ โดเมนที่มีการกำกับดูแล หรือภาษาที่ทีมนักพากย์ของผู้ขายรองรับได้ไม่ดี นั่นเป็นโซลูชันอีกประเภทหนึ่ง ไม่ใช่แบบที่ถูกกว่า
ข้อแลกเปลี่ยนนี้ชัดเจนและควรกล่าวถึง: เมื่อใช้ VoxCPM2 คุณยอมรับว่าไม่มีบุคคลที่สามรายใดเคยให้คะแนนโมเดลนี้มาก่อน การรับประกันคุณภาพเป็นสิ่งที่คุณต้องสร้างและวัดด้วยตัวเอง และข้อจำกัดลำดับ 8,192 โทเคน พร้อมคำเตือนบนการ์ดของโมเดลเอง — ว่าการออกแบบเสียงและการควบคุมสไตล์แตกต่างกันไปในแต่ละครั้งที่รัน และแนะนำให้สร้างหนึ่งถึงสามครั้ง — ตอนนี้กลายเป็นปัญหาด้าน QA ของคุณแล้ว
สิ่งที่ Eleven v4 มอบให้คุณซึ่ง checkpoint มอบให้ไม่ได้
ในทางกลับกัน ข้อได้เปรียบของโมเดลแบบโฮสต์คือสิ่งที่ปรากฏบนปฏิทินการเปิดตัว มากกว่าที่จะปรากฏบนสเปกชีต
• การจัดอันดับที่ผ่านการวัด — เป็นอันดับหนึ่งบนกระดานที่มีตัวอย่าง 1,674 ตัวอย่างรองรับการประมาณค่า และมีช่วงประมาณ ±19 คะแนนโดยประมาณรอบค่านั้น ไม่ว่ากระดานนั้นจะวัดสิ่งใดก็ตาม มันเป็นอิสระจากผู้จำหน่ายทั้งสองราย และเป็นสัญญาณคุณภาพจากบุคคลที่สามเพียงอย่างเดียวในการเปรียบเทียบนี้
• การกำกับทิศทางการแสดงในข้อความ — แท็กเสียงแบบอินไลน์ เช่น [หัวเราะ], [กระซิบ] และ [พูดด้วยความโกรธในสำเนียงฝรั่งเศส] พร้อมทั้งพรอมป์การแสดงด้วยภาษาธรรมชาติ และการรองรับสัทอักษรสากล (IPA) ที่ดีขึ้น การจะให้โมเดลที่โฮสต์เองเปลี่ยนอารมณ์ได้ ต้องสร้างใหม่หรือทำ fine-tune; แต่ที่นี่ มันเป็นเพียงโทเคนในสคริปต์
• ความครอบคลุมที่คุณไม่ต้องตรวจสอบยืนยัน — มากกว่า 90 ภาษา เทียบกับ 30 ภาษาของ VoxCPM2 โดยมีข้อแม้ว่ารายการของเช็กพอยต์นั้นระบุชัดเจนและมีชื่อ (รวมถึงภาษาถิ่นจีน) ขณะที่ "มากกว่า 90" ของผู้ขายเป็นเพียงจำนวนโดยไม่มีรายการ
• ไม่มีภาระด้านปฏิบัติการ — ไม่มี GPU ไม่มีสแต็กการให้บริการ ไม่มีความคลาดเคลื่อนของเวอร์ชัน และอัตราโปรโมชัน $0.022 ต่อ 1,000 ตัวอักษรจนถึงวันที่ 12 ตุลาคม เทียบกับราคาปกติ $0.08 หลังจากนั้น

ทั้งสองอย่างนี้ไม่ใช่ของเรา และนั่นคือประเด็นของส่วนนี้
OrcaRouter ไม่ได้โฮสต์โมเดลทั้งสองตัวนี้ ไม่มีเอนด์พอยต์ของ ElevenLabs และไม่มีเอนด์พอยต์ของ VoxCPM2 ในแคตตาล็อกของเรา และคำตอบเรื่องการจัดเส้นทางที่ตรงไปตรงมาคือ Eleven v4 นั้นเข้าถึงได้ผ่าน API ของ ElevenLabs เอง ส่วน VoxCPM2 เป็นสิ่งที่คุณต้องนำไปติดตั้งใช้งานบนฮาร์ดแวร์ของคุณเอง เราไม่มีทางบอกเป็นนัยเป็นอย่างอื่นเพียงเพื่อให้การเปรียบเทียบดูเรียบร้อยขึ้น
จุดที่คีย์เดียวช่วยได้จริงคือการตัดสินใจก่อนการตัดสินใจ เหตุผลที่การหารือเรื่องการโฮสต์เองชะงักงันก็คือ ทางเลือกอื่นไม่เคยถูกประเมินเลย API คือการเรียกครั้งเดียว ส่วนเช็กพอยต์คือสแตกสำหรับให้บริการ ดังนั้น API จึงชนะโดยปริยาย แทนที่จะชนะด้วยการคำนวณ สิ่งที่ OrcaRouter มอบให้คือ ครึ่งฝั่งที่โฮสต์ของการเปรียบเทียบนั้นทดสอบได้ในราคาถูก — โมเดลกว่า 200 รายการอยู่เบื้องหลังคีย์ API เดียว โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกเพิ่ม 0% ดังนั้นตัวเลือกแบบโฮสต์จึงถูกประเมินที่อัตราจริง而非อัตราที่กะประมาณไว้ พร้อมกับการสลับไปใช้ระบบสำรองอัตโนมัติหากคุณวางตัวเลือกที่พิจารณาไว้เบื้องหลังเส้นทางที่ใช้งานจริงก่อนที่คุณจะตัดสินใจเสร็จ
วิธีตัดสินใจในรอบเดียว
เลือก Eleven v4 ถ้าเสียงต้องดีตั้งแต่เทคแรกและคุณต้องการให้เสร็จภายในสัปดาห์นี้ คุณจะได้อันดับต้น ๆ ของบอร์ดอิสระ ไวยากรณ์การกำกับที่มีเอกสารประกอบ จำนวนภาษาที่มีเอกสารประกอบกว้างที่สุดในการเปรียบเทียบนี้ และไม่ต้องมีโครงสร้างพื้นฐานเลย คุณจ่าย $0.08 ต่อ 1,000 ตัวอักษรตั้งแต่วันที่ 13 ตุลาคมเป็นต้นไป และคุณยอมรับว่าคุณไม่สามารถฝึกโมเดลใหม่ได้ ปักหมุดเวอร์ชันได้ หรือเก็บไฟล์เสียงไว้บนฮาร์ดแวร์ของคุณเองได้
เลือก VoxCPM2 ถ้าโมเดลต้องเป็นของคุณเอง Apache 2.0 พารามิเตอร์ 2B บน VRAM ประมาณ 8 GB เอาต์พุต 48 kHz โดยไม่มีอัปแซมเปลอร์ในเชน และเส้นทางการ fine-tuning ที่ใช้เสียง 5 ถึง 10 นาที — สิ่งเหล่านี้คือความสามารถที่เอนด์พอยต์แบบโฮสต์ไม่ได้มีให้ไม่ว่าราคาใด และการไม่มีแถวใน arena คือราคาที่ต้องแลกสำหรับสิ่งเหล่านั้น รันตัวเลข throughput บนการ์ดของคุณเองก่อนตัดสินใจ เพราะค่า real-time factor 0.30 และ 0.13 เป็นการวัดของ model card เอง และสแตกการให้บริการของคุณจะไม่ให้ผลตรงกันเป๊ะ
และถ้าคำตอบที่ตรงไปตรงมาคือคุณไม่รู้ปริมาณเสียงรายเดือนของตัวเอง นั่นคือตัวเลขที่คุณต้องไปหามาให้ได้ มันเป็นตัวชี้ขาดการเปรียบเทียบนี้ ไม่มีบอร์ดไหนจะบอกคุณได้
