การ์ดฮีโร่ที่สร้างขึ้นสำหรับ ElevenLabs Eleven v4 เทียบกับ VoxCPM2 พร้อมสองพาเนล: ElevenLabs Eleven v4 เป็นเอนด์พอยต์แบบโฮสต์ที่ Elo 1,319 อันดับ 1 และ $80.00 ต่อ 1 ล้านตัวอักษร; VoxCPM2 เป็นเช็กพอยต์ Apache-2.0 ที่มีพารามิเตอร์ 2B เอาต์พุต 48 kHz และไม่มีแถวในอารีนา ส่วนท้าย: อันดับและราคาของ Eleven v4 อ้างอิงจาก Artificial Analysis กันยายน 2026; ข้อมูลจำเพาะของ VoxCPM2 อ้างอิงจากการ์ดโมเดลของ OpenBMB โลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Eleven v4 vs VoxCPM2: โมเดลที่ถูกจัดอันดับปะทะเช็คพอยต์ที่คุณไม่สามารถเช่าได้

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ข้อเท็จจริงที่มีประโยชน์ที่สุดในการเปรียบเทียบครั้งนี้ คือแถวข้อมูลที่ไม่มีอยู่จริง ElevenLabs Eleven v4ครองอันดับ 1 บน Provider Voice Arena ของ Artificial Analysis ด้วยคะแนน Elo 1,319 จากการปรากฏตัว 1,674 ครั้ง ในราคา 80.00 ดอลลาร์ต่อล้านตัวอักษร VoxCPM2 ซึ่งเป็นเช็คพอยต์ของ OpenBMB ที่เปิดตัวในเดือนเมษายน 2026 ไม่ปรากฏอยู่ที่ใดเลยบนกระดานจัดอันดับด้านเสียงทั้งสองกระดาน — ไม่ติดอันดับ ไม่ได้อยู่ในกลุ่มที่ไม่ได้จัดอันดับ ไม่มีแม้แต่รายการพรีวิว นั่นไม่ใช่คำตัดสินเรื่องคุณภาพ แต่หมายความว่าตัวเลขใดก็ตามที่คุณหวังจะนำมาเทียบกับ 1,319 นั้น ยังไม่มีใครผลิตออกมา และการเปรียบเทียบจะต้องอาศัยสิ่งอื่นที่ไม่ใช่ความชอบ สิ่งที่เหลืออยู่คือความเป็นเจ้าของ การปรับแต่งโมเดล และคำถามด้านลิขสิทธิ์ที่ปลายทางแบบโฮสต์ไม่เปิดโอกาสให้คุณถาม

สิ่งที่แต่ละฝ่ายมอบให้คุณจริง ๆ

สิ่งเหล่านี้เป็นผลิตภัณฑ์ต่างประเภทกัน และความแตกต่างนี้ไม่ใช่เพียงเรื่องผิวเผิน

• การเข้าถึง — Eleven v4 เป็น endpoint แบบโฮสต์ที่เข้าถึงได้ผ่าน API ของ ElevenLabs เอง โดยคิดค่าบริการตามจำนวนตัวอักษร ส่วน VoxCPM2 เป็น checkpoint บน Hugging Face ภายใต้ openbmb/VoxCPM2 ซึ่งคุณต้องดาวน์โหลดและรันเอง และไม่มี endpoint จากผู้ให้บริการรายแรกให้เรียกใช้

• สัญญาอนุญาต — VoxCPM2 มาพร้อม Apache 2.0 ใช้เชิงพาณิชย์ได้ฟรีอย่างชัดเจน Eleven v4 เป็น API เชิงพาณิชย์ที่มีข้อกำหนดเป็นของ ElevenLabs ความแตกต่างนี้สำคัญหากการตรวจสอบทางกฎหมายของคุณถามว่าคุณสามารถไฟน์จูน แจกจ่ายต่อ หรือส่งมอบเวทได้หรือไม่ เมื่อใช้เช็กพอยต์ คำตอบก็ถูกเขียนไว้เป็นลายลักษณ์อักษรและคงที่

• ขนาดและฮาร์ดแวร์ — VoxCPM2 มี 2B พารามิเตอร์บนโครงสร้างพื้นฐาน MiniCPM-4 และการ์ดระบุว่าใช้ VRAM ประมาณ 8 GB ที่ bfloat16 โดยมีความยาวลำดับสูงสุด 8,192 โทเคน ElevenLabs ไม่ได้เปิดเผยจำนวนพารามิเตอร์สำหรับ Eleven v4 และพื้นที่ฮาร์ดแวร์ของโมเดลที่โฮสต์ไว้ก็ไม่ใช่สิ่งที่คุณต้องดูแลจัดการ

• เชนเอาต์พุต — VoxCPM2 ยอมรับเสียงอ้างอิง 16 kHz และส่งออก 48 kHz ผ่าน super-resolution ในตัวของ AudioVAE V2 โดยไม่มีตัวอัปแซมเปลอร์ภายนอกอยู่ในเส้นทาง ส่วน TTS แบบโฮสต์จะส่งสตรีมให้คุณที่อัตราใดก็ตามที่ผู้ให้บริการเลือก

• คะแนนอิสระ — Eleven v4 มีคะแนน และอยู่ในอันดับหนึ่ง VoxCPM2 ไม่มีเลย การไม่มีไม่ใช่คะแนนต่ำ แต่เป็นโมเดลที่ยังไม่ถูกให้คะแนน และไม่ควรพูดถึงทั้งสองในประโยคเดียวกันราวกับว่าตัวที่สองเป็นตัวเลข

A generated scoreboard comparing ElevenLabs Eleven v4 and VoxCPM2 across six dimensions: arena rank (1, Elo 1,319 against not on the board), price ($80.00 per 1M characters against no per-character rate), licence (vendor API terms against Apache 2.0 for commercial use), voice creation (clone from 10 s of audio against voice design and cloning), languages (90-plus against 30) and operations (none, it is hosted, against your own GPU at about 8 GB). Footer: 'Eleven v4 figures per Artificial Analysis and vendor docs; VoxCPM2 figures per the OpenBMB model card.' The OrcaRouter logo sits in the bottom-right corner.

ตัวเลขที่แทนที่ Elo ที่หายไป

ถ้าคุณเปรียบเทียบความชอบไม่ได้ ก็ให้เปรียบเทียบสิ่งที่คุณคำนวณได้ และสำหรับโมเดลที่โฮสต์เอง สิ่งนั้นคือทรูพุต การ์ดของ VoxCPM2 ระบุค่าปัจจัยเวลาจริง (real-time factor) ไว้ที่ประมาณ 0.30 ใน PyTorch มาตรฐานบน RTX 4090 และลดลงเหลือประมาณ 0.13 ภายใต้ Nano-VLLM ค่าปัจจัยเวลาจริงคือจำนวนวินาทีของการประมวลผลต่อเสียงหนึ่งวินาที ดังนั้นตัวเลขสองค่านี้หมายความว่าหนึ่งชั่วโมง GPU ให้เสียงพูดที่เสร็จสมบูรณ์ประมาณ 3.3 ชั่วโมงในกรณีแรก และประมาณ 7.7 ชั่วโมงในกรณีที่สอง

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, tagged Text-to-Speech, VoxCPM, Safetensors, 30 languages, multilingual, voice-cloning, voice-design, diffusion and audio, with License: apache-2.0. The summary reads: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data.' Highlights list 30-language multilingual input with no language tag, voice design from a natural-language description with no reference audio, controllable cloning from a short clip with optional style guidance, 48 kHz studio-quality output via AudioVAE V2's built-in super-resolution, context-aware synthesis, real-time streaming with an RTF as low as about 0.3 on an NVIDIA RTX 4090 and about 0.13 accelerated by Nano-VLLM, and an Apache-2.0 licence free for commercial use. The sidebar shows 341,299 downloads last month, 2B params, BF16, and a note under Inference Providers that the model is not deployed by any inference provider.

ผลที่ตามมาสองข้อตามมาทันที สแต็กสำหรับให้บริการสำคัญกว่าตัวโมเดล: checkpoint เดียวกันบนการ์ดเดียวกันให้เอาต์พุตมากกว่าสองเท่าเมื่อคุณสลับอินเฟอเรนซ์เอนจิน ดังนั้นโมเดลต้นทุนใด ๆ ที่ใช้ตัวเลข 0.30 กำลังประเมินต้นทุนแบบโฮสต์เองของคุณสูงเกินไปประมาณ 2.3 เท่า และอัตราการใช้งานคือหัวใจทั้งหมด: การ์ดที่ว่างอยู่ไม่ชนะ API คิดตามจำนวนอักขระไม่ว่าราคาใด เพราะค่าใช้จ่ายของ API แปรผันตามสิ่งที่คุณพูด ในขณะที่ค่าใช้จ่ายของการ์ดแปรผันตามเวลาที่คุณซื้อมัน

ซึ่งนั่นคือเหตุผลว่าทำไมเวอร์ชันที่ตรงไปตรงมาของการตัดสินใจนี้จึงไม่ใช่ "อันไหนฟังดูดีกว่า" แต่เป็น "คุณผลิตเสียงกี่ชั่วโมงต่อเดือน และฮาร์ดแวร์ยุ่งอยู่หรือไม่" ต่ำกว่าปริมาณที่การ์ดยังโหลดค้างอยู่ API ชนะแบบไม่ต้องเทียบ เหนือกว่านั้นขึ้นไป บนฮาร์ดแวร์ที่คุณเป็นเจ้าของอยู่แล้ว ต้นทุนส่วนเพิ่มของเช็กพอยต์ต่อหนึ่งในพันชั่วโมงจะเท่ากับต้นทุนต่อชั่วโมงแรกของมัน — และนั่นคือข้อได้เปรียบเชิงโครงสร้างที่ไม่มีตารางราคาใดเทียบได้

ความสามารถที่เอนด์พอยต์แบบโฮสต์จะไม่ขายให้คุณ

นี่คือจุดที่การเปรียบเทียบไม่ใช่ภาพสะท้อนอีกต่อไป เพราะมีสิ่งหนึ่งที่ VoxCPM2 ทำได้แต่ Eleven v4 ทำไม่ได้โดยพื้นฐาน นั่นคือคุณสามารถฝึกมันใหม่ได้ โมเดลการ์ดได้บันทึกทั้ง SFT แบบเต็มและการไฟน์ทูน LoRA ด้วยเสียงเพียงห้าถึงสิบนาที พร้อมสคริปต์การฝึกและการกำหนดค่าที่ให้มาสำหรับแต่ละวิธี

นั่นเปลี่ยนรูปแบบของโปรแกรมเสียงพูด API แบบโฮสต์ให้โมเดลแบบตายตัว บวกกับความสามารถในการโคลนเสียงเท่าที่ผู้ขายเปิดให้ใช้ — ในกรณีของ Eleven v4 คือเสียงอ้างอิงสิบวินาทีสำหรับการโคลนแบบทันที โดยมีระดับโปรอยู่เหนือขึ้นไป เช็กพอยต์ที่ปรับแต่งด้วย LoRA ให้โมเดลที่ไม่เคยเห็นข้อมูลของใครอื่น และคุณสามารถกำหนดพฤติกรรมของมันได้ตามเวอร์ชัน สำหรับเสียงประจำแบรนด์ โดเมนที่มีการกำกับดูแล หรือภาษาที่ทีมนักพากย์ของผู้ขายรองรับได้ไม่ดี นั่นเป็นโซลูชันอีกประเภทหนึ่ง ไม่ใช่แบบที่ถูกกว่า

ข้อแลกเปลี่ยนนี้ชัดเจนและควรกล่าวถึง: เมื่อใช้ VoxCPM2 คุณยอมรับว่าไม่มีบุคคลที่สามรายใดเคยให้คะแนนโมเดลนี้มาก่อน การรับประกันคุณภาพเป็นสิ่งที่คุณต้องสร้างและวัดด้วยตัวเอง และข้อจำกัดลำดับ 8,192 โทเคน พร้อมคำเตือนบนการ์ดของโมเดลเอง — ว่าการออกแบบเสียงและการควบคุมสไตล์แตกต่างกันไปในแต่ละครั้งที่รัน และแนะนำให้สร้างหนึ่งถึงสามครั้ง — ตอนนี้กลายเป็นปัญหาด้าน QA ของคุณแล้ว

สิ่งที่ Eleven v4 มอบให้คุณซึ่ง checkpoint มอบให้ไม่ได้

ในทางกลับกัน ข้อได้เปรียบของโมเดลแบบโฮสต์คือสิ่งที่ปรากฏบนปฏิทินการเปิดตัว มากกว่าที่จะปรากฏบนสเปกชีต

• การจัดอันดับที่ผ่านการวัด — เป็นอันดับหนึ่งบนกระดานที่มีตัวอย่าง 1,674 ตัวอย่างรองรับการประมาณค่า และมีช่วงประมาณ ±19 คะแนนโดยประมาณรอบค่านั้น ไม่ว่ากระดานนั้นจะวัดสิ่งใดก็ตาม มันเป็นอิสระจากผู้จำหน่ายทั้งสองราย และเป็นสัญญาณคุณภาพจากบุคคลที่สามเพียงอย่างเดียวในการเปรียบเทียบนี้

• การกำกับทิศทางการแสดงในข้อความ — แท็กเสียงแบบอินไลน์ เช่น [หัวเราะ], [กระซิบ] และ [พูดด้วยความโกรธในสำเนียงฝรั่งเศส] พร้อมทั้งพรอมป์การแสดงด้วยภาษาธรรมชาติ และการรองรับสัทอักษรสากล (IPA) ที่ดีขึ้น การจะให้โมเดลที่โฮสต์เองเปลี่ยนอารมณ์ได้ ต้องสร้างใหม่หรือทำ fine-tune; แต่ที่นี่ มันเป็นเพียงโทเคนในสคริปต์

• ความครอบคลุมที่คุณไม่ต้องตรวจสอบยืนยัน — มากกว่า 90 ภาษา เทียบกับ 30 ภาษาของ VoxCPM2 โดยมีข้อแม้ว่ารายการของเช็กพอยต์นั้นระบุชัดเจนและมีชื่อ (รวมถึงภาษาถิ่นจีน) ขณะที่ "มากกว่า 90" ของผู้ขายเป็นเพียงจำนวนโดยไม่มีรายการ

• ไม่มีภาระด้านปฏิบัติการ — ไม่มี GPU ไม่มีสแต็กการให้บริการ ไม่มีความคลาดเคลื่อนของเวอร์ชัน และอัตราโปรโมชัน $0.022 ต่อ 1,000 ตัวอักษรจนถึงวันที่ 12 ตุลาคม เทียบกับราคาปกติ $0.08 หลังจากนั้น

A screenshot of Artificial Analysis' Eleven v4 model page, titled Eleven v4 Quality Elo, Speed & Price Analysis, credited to ElevenLabs and the ElevenLabs family with an Elo of 1318.77. The page presents Quality, Pricing and 1M Throughput views over the Provider Voice Arena Preference Elo, and the model selector reads '27 of 96 models'.

ทั้งสองอย่างนี้ไม่ใช่ของเรา และนั่นคือประเด็นของส่วนนี้

OrcaRouter ไม่ได้โฮสต์โมเดลทั้งสองตัวนี้ ไม่มีเอนด์พอยต์ของ ElevenLabs และไม่มีเอนด์พอยต์ของ VoxCPM2 ในแคตตาล็อกของเรา และคำตอบเรื่องการจัดเส้นทางที่ตรงไปตรงมาคือ Eleven v4 นั้นเข้าถึงได้ผ่าน API ของ ElevenLabs เอง ส่วน VoxCPM2 เป็นสิ่งที่คุณต้องนำไปติดตั้งใช้งานบนฮาร์ดแวร์ของคุณเอง เราไม่มีทางบอกเป็นนัยเป็นอย่างอื่นเพียงเพื่อให้การเปรียบเทียบดูเรียบร้อยขึ้น

จุดที่คีย์เดียวช่วยได้จริงคือการตัดสินใจก่อนการตัดสินใจ เหตุผลที่การหารือเรื่องการโฮสต์เองชะงักงันก็คือ ทางเลือกอื่นไม่เคยถูกประเมินเลย API คือการเรียกครั้งเดียว ส่วนเช็กพอยต์คือสแตกสำหรับให้บริการ ดังนั้น API จึงชนะโดยปริยาย แทนที่จะชนะด้วยการคำนวณ สิ่งที่ OrcaRouter มอบให้คือ ครึ่งฝั่งที่โฮสต์ของการเปรียบเทียบนั้นทดสอบได้ในราคาถูก — โมเดลกว่า 200 รายการอยู่เบื้องหลังคีย์ API เดียว โดยส่งผ่านราคาตามรายการของผู้ให้บริการที่บวกเพิ่ม 0% ดังนั้นตัวเลือกแบบโฮสต์จึงถูกประเมินที่อัตราจริง而非อัตราที่กะประมาณไว้ พร้อมกับการสลับไปใช้ระบบสำรองอัตโนมัติหากคุณวางตัวเลือกที่พิจารณาไว้เบื้องหลังเส้นทางที่ใช้งานจริงก่อนที่คุณจะตัดสินใจเสร็จ

วิธีตัดสินใจในรอบเดียว

เลือก Eleven v4 ถ้าเสียงต้องดีตั้งแต่เทคแรกและคุณต้องการให้เสร็จภายในสัปดาห์นี้ คุณจะได้อันดับต้น ๆ ของบอร์ดอิสระ ไวยากรณ์การกำกับที่มีเอกสารประกอบ จำนวนภาษาที่มีเอกสารประกอบกว้างที่สุดในการเปรียบเทียบนี้ และไม่ต้องมีโครงสร้างพื้นฐานเลย คุณจ่าย $0.08 ต่อ 1,000 ตัวอักษรตั้งแต่วันที่ 13 ตุลาคมเป็นต้นไป และคุณยอมรับว่าคุณไม่สามารถฝึกโมเดลใหม่ได้ ปักหมุดเวอร์ชันได้ หรือเก็บไฟล์เสียงไว้บนฮาร์ดแวร์ของคุณเองได้

เลือก VoxCPM2 ถ้าโมเดลต้องเป็นของคุณเอง Apache 2.0 พารามิเตอร์ 2B บน VRAM ประมาณ 8 GB เอาต์พุต 48 kHz โดยไม่มีอัปแซมเปลอร์ในเชน และเส้นทางการ fine-tuning ที่ใช้เสียง 5 ถึง 10 นาที — สิ่งเหล่านี้คือความสามารถที่เอนด์พอยต์แบบโฮสต์ไม่ได้มีให้ไม่ว่าราคาใด และการไม่มีแถวใน arena คือราคาที่ต้องแลกสำหรับสิ่งเหล่านั้น รันตัวเลข throughput บนการ์ดของคุณเองก่อนตัดสินใจ เพราะค่า real-time factor 0.30 และ 0.13 เป็นการวัดของ model card เอง และสแตกการให้บริการของคุณจะไม่ให้ผลตรงกันเป๊ะ

และถ้าคำตอบที่ตรงไปตรงมาคือคุณไม่รู้ปริมาณเสียงรายเดือนของตัวเอง นั่นคือตัวเลขที่คุณต้องไปหามาให้ได้ มันเป็นตัวชี้ขาดการเปรียบเทียบนี้ ไม่มีบอร์ดไหนจะบอกคุณได้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube