การ์ดชื่อเรื่องหลักสำหรับ 'GPT-Live-1 vs VoxCPM2' พร้อมคำบรรยายใต้ชื่อว่า 'บทสนทนาที่ต้องเช่าใช้ หรือ GPU ที่คุณเป็นเจ้าของเอง' พร้อมป้ายที่ระบุว่า 'ตัวหนึ่งเป็น full duplex อีกตัวเป็น text-to-speech — คนละหน้าที่กัน' และการ์ดอีกสามใบ: 'GPT-Live-1 — $0.05 ต่อนาทีเสียง ใช้ผ่าน API เท่านั้น ไม่มีอะไรต้องติดตั้ง', 'VoxCPM2 — Apache-2.0, พารามิเตอร์ 2B, VRAM ~8 GB, ไม่มีผู้ให้บริการ inference รายใดนำไป deploy' และ 'ปริมาณงานแบบ self-host — ประมาณ 7.7 ชั่วโมงของเสียงต่อ GPU-ชั่วโมง ที่ RTF 0.13, ดาวน์โหลด 393,079 ครั้งในรอบ 30 วันล่าสุด' เหนือแถบส่วนท้ายที่ระบุว่า 'ผล benchmark ของ VoxCPM2 รายงานโดย OpenBMB; ตัวเลขเสียงของ GPT-Live-1 รายงานโดย OpenAI และยังไม่ได้ทำซ้ำเพื่อยืนยัน' โลโก้ OrcaRouter ถูก composited ไว้มุมขวาล่าง
Engineering & Research

GPT-Live-1 vs VoxCPM2: ตัวหนึ่งราคา $0.05 ต่อนาที อีกตัวต้องแลกด้วย GPU 24 GB

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วิธีที่ตรงที่สุดในการเปรียบเทียบ GPT-Live-1 กับ VoxCPM2 คือการสังเกตว่าทั้งคู่ดูเหมือนเป็นคู่แข่งกันก็ต่อเมื่อคุณยังไม่ใส่ตัวเลขลงไปบนฮาร์ดแวร์ GPT-Live-1 คือโมเดลเสียงแบบฟูลดูเพล็กซ์ของ OpenAI ที่อยู่ใน API ตั้งแต่ 10 กันยายน 2026 ในราคา $0.05 ต่อนาทีของเสียง โดยไม่ต้องติดตั้งอะไรเลย VoxCPM2 คือโมเดลแปลงข้อความเป็นเสียงพูดแบบโอเพนเวตขนาด 2 พันล้านพารามิเตอร์ของ OpenBMB เปิดตัวภายใต้ Apache 2.0 ในเดือนเมษายน 2026 ซึ่งทำงานบน VRAM ประมาณ 8 GB และไม่ถูกนำไปใช้งานโดยผู้ให้บริการอินเฟอเรนซ์รายใด — ดังนั้นถ้าคุณต้องการมัน คุณต้องเป็นเจ้าของเครื่องเอง ตัวหนึ่งคือบทสนทนาที่คุณเช่าเป็นรายวินาที ส่วนอีกตัวคือซินธิไซเซอร์ที่คุณต้องควบคุมเอง คำถามไม่ใช่ว่าตัวไหนดีกว่า แต่คือตัวไหนที่ภาระงานของคุณรองรับได้จริง

A two-column scoreboard titled 'GPT-Live-1 vs VoxCPM2 - the scoreboard'. Left column GPT-Live-1: 'Job: full-duplex conversation', 'Access: hosted API, no weights', 'Price: $0.05 per voice minute', 'Independent score: 69.8% on the AA Speech to Speech Index', 'Hardware you need: none', 'Catch: delegated reasoning bills separately'. Right column VoxCPM2: 'Job: text-to-speech', 'Access: Apache-2.0 weights, self-host only', 'Price: $0 per call plus a GPU', 'Independent score: none, OpenBMB benchmarks only and contested by third-party runs', 'Hardware you need: ~8 GB VRAM, 22 GB peak when serving', 'Catch: no inference provider deploys it'. Footer: 'GPT-Live-1 voice figures OpenAI-reported; VoxCPM2 figures are the model card's own.'

สองโมเดล สองงาน หนึ่งบรรทัดสเปกที่ตรงไปตรงมาสำหรับแต่ละรุ่น

• ฟังก์ชัน — GPT-Live-1 สนทนาได้: มันฟังและพูดพร้อมกันในเวลาเดียวกัน ผลัดกันพูด รับมือกับการขัดจังหวะและเสียงตอบรับสั้น ๆ และส่งคืนข้อความถอดเสียง VoxCPM2 เปลี่ยนข้อความเป็นเสียงพูด มันไม่เคยได้ยินอะไรเลย

• การเข้าถึง — GPT-Live-1 ถูกโฮสต์และเป็นโมเดลปิด โดยมี model ID เดียวอยู่หลัง Live Sessions endpoint พร้อมตัวอย่างการผสานรวมที่เผยแพร่ทำงานผ่าน WebRTC VoxCPM2 เป็น checkpoint ที่ดาวน์โหลดได้บน Hugging Face และ ModelScope, Apache 2.0, ฟรีสำหรับการใช้งานเชิงพาณิชย์

• ราคา — GPT-Live-1 ราคา $0.05 ต่อนาทีเสียง โดยคิดค่าบริการเป็นรายวินาที และแบ็กเอนด์การมอบหมายจะคิดค่าบริการแยกต่างหาก VoxCPM2 ราคา $0 ต่อการเรียกใช้งาน บวกกับ GPU และการโฮสต์แบบโอเพนซอร์สคือรูปแบบต้นทุนทั้งหมด

• การใช้ทรัพยากร — GPT-Live-1 ไม่ต้องใช้ฮาร์ดแวร์ของคุณเองเลย VoxCPM2 ต้องใช้ VRAM ประมาณ 8 GB (6–8 GB ที่ Q4), Python 3.10+, PyTorch 2.5+ และ CUDA 12+

• เกณฑ์มาตรฐาน — ตัวเลขด้านเสียงทุกตัวของ GPT-Live-1 เป็นของ Ope​nAI และยังไม่มีการทำซ้ำ คณะกรรมการอิสระเพียงชุดเดียวที่มีอยู่จัดให้มันอยู่อันดับที่เจ็ดจากทั้งหมดสิบเอ็ด ตัวเลขที่เผยแพร่ของ VoxCPM2 เป็นของ OpenBMB และการวัดอิสระที่มีต่อคำกล่าวอ้างเรื่องหลายภาษาของมันกลับชี้ไปในทางตรงกันข้าม

คำถาม 24 GB พร้อมราคา

ตัวเลขการให้บริการของ VoxCPM2 เป็นสิ่งที่ตัดสินว่าการโฮสต์เองเป็นงานอดิเรกหรือเป็นสถาปัตยกรรม บน RTX 4090 ตัวเดียว โมเดลทำงานที่ real-time factor ประมาณ 0.30 ใน PyTorch ธรรมดา และประมาณ 0.13 ด้วยเส้นทาง Nano-VLLM — หมายความว่าได้เสียงที่สร้างขึ้นประมาณ 7.7 ชั่วโมงต่อชั่วโมงของเวลา GPU บนการตั้งค่าที่เร็วกว่า นั่นเป็นตัวเลขของ model card เอง ไม่ใช่การวัดจากภายนอก; สูตรการให้บริการอิสระที่ตรวจสอบแล้วบน 4090 ด้วย CUDA 12.9 รายงาน real-time factor ในสภาวะคงตัวประมาณ 0.120 สำหรับการสังเคราะห์แบบ zero-shot และ 0.139 สำหรับการโคลน โดยมีหน่วยความจำ GPU สูงสุดใกล้ 22 GB จาก 24 GB ทั้งสองชุดเป็นสภาวะคงตัว ไม่ใช่การเริ่มต้นเย็น — คำขอแรกในโปรเซสใหม่จะช้ากว่ามาก และนั่นคือตัวเลขที่ผู้คนอ้างถึงเมื่อพวกเขาบอกว่าโมเดลนี้ใช้งานไม่ได้

ลองเอาไปวางเทียบกับ API ดูสิ GPT-Live-1 ในราคานาทีละ $0.05 คิดเป็น $3.00 สำหรับการสนทนาต่อเนื่องหนึ่งชั่วโมง การ์ด 24 GB ที่เช่าจากตลาดเสรีมีราคาอยู่ในหลักหน่วยดอลลาร์ช่วงต่ำต่อชั่วโมง และการเป็นเจ้าของหนึ่งใบ เมื่อคิดอัตราการใช้งานแล้ว ค่าเสื่อมราคาก็ตกใกล้เคียงกัน ดังนั้นการเปรียบเทียบจึงลงเอยตรงจุดที่การเปรียบเทียบแบบนี้มักลงเอยกันเสมอ โดยมีความไม่สมมาตรที่ชวนอึดอัดอยู่หนึ่งอย่าง: ค่า GPU จะมาถึงไม่ว่าคุณจะมีคนคุยกับผลิตภัณฑ์ของคุณหรือไม่ ส่วนบิล API จะสเกลลงเหลือศูนย์ในวันที่เงียบสงบ และสเกลขึ้นเป็นห้าหลักในวันที่ยุ่ง การสังเคราะห์แบบแบตช์ของแค็ตตาล็อกคงที่นั้นเข้ากับ GPU อย่างลงตัว สายโทรศัพท์ที่เปิดอยู่ตลอดเวลาเข้ากับมิเตอร์อย่างลงตัว

สิ่งที่ VoxCPM2 ทำได้ซึ่งไม่มีโอเพนซอร์สอื่นใดทำได้

เหตุผลที่ VoxCPM2 สมควรได้รับความสนใจมากขนาดนี้ ไม่ใช่เพราะมันชนะเบนช์มาร์ก — ส่วนใหญ่ก็ไม่ชนะ — แต่เพราะมันออกแบบเสียงจากคำบรรยายข้อความโดยไม่ต้องมีเสียงอ้างอิงเลย นี่เป็นความสามารถใหม่จริง ๆ ในโอเพนเวท และมันเปลี่ยนเวิร์กโฟลว์สำหรับทุกคนที่ต้องการเสียงซึ่งยังไม่มีอยู่: ลองฟังเสียงผ่านคำบรรยาย ปรับวนซ้ำผ่านคำบรรยาย แล้วค่อยตัดสินใจว่าจะโคลนหรือไม่ นอกจากนั้นยังรวม 30 ภาษา บวกกับภาษาถิ่นจีนเก้าภาษา เอาต์พุต 48 kHz ผ่านขั้นตอนซูเปอร์รีโซลูชันในตัว และการไฟน์ทูนด้วยเสียงเพียง 5–10 นาที

ฐานหลักฐานบางกว่ารายการฟีเจอร์ รายงานของ OpenBMB เองระบุอัตราความผิดพลาดระดับคำของภาษาอังกฤษที่ 1.84% และอัตราความผิดพลาดระดับอักขระของภาษาจีนที่ 0.97% และความผิดพลาดเฉลี่ย 1.68% ใน 30 ภาษา ซึ่งวัดบนชุดข้อมูล 500 คำพูดต่อภาษาของตัวเอง และให้คะแนนโดยโมเดลของผู้ขายอีกราย ในกรณีที่มีการทดสอบอิสระ ช่องว่างนั้นใหญ่โต: บนชุดทดสอบหลายภาษาของ MiniMax ที่ให้คะแนนด้วย Whisper-large-v3 ภาษาฮินดีอยู่ที่ 19.70 และภาษาอาหรับอยู่ที่ 13.05 — แย่กว่าตัวเลขที่รายงานเองหลายเท่า OpenBMB ยังเตือนว่าการออกแบบเสียงและการควบคุมสไตล์ให้ผลลัพธ์ที่แปรผันระหว่างการรันแต่ละครั้ง และแนะนำให้สร้างหนึ่งถึงสามครั้งเพื่อให้ได้ผลลัพธ์ที่คุณต้องการ ซึ่งเป็นการพูดแบบอ้อม ๆ ว่า ต้นทุนต่อการเรียกใช้สำหรับผลลัพธ์ที่ใช้งานได้นั้นไม่ใช่แค่การเรียกครั้งเดียว

ภาษีการผสานรวมที่ไม่มีใครใส่ไว้ในการเปรียบเทียบ

รายละเอียดที่ไม่หวือหวาประการหนึ่งเป็นตัวตัดสินว่า VoxCPM2 จะเป็นงานหนึ่งสัปดาห์หรือหนึ่งเดือน รีโพซิทอรี Hugging Face ของมันถูกติดแท็ก voxcpm แทนที่จะเป็น transformers ซึ่งหมายความว่าไลบรารีที่เกือบทุกอย่างอื่นบนไซต์นั้นใช้เป็นตัวโหลดอยู่นั้นไม่สามารถโหลดโมเดลนี้ได้ พูลรีเควสต์เพื่อแก้ไขเรื่องนั้นถูกเปิดเมื่อวันที่ 4 สิงหาคม 2026 และยังไม่ถูกผสานเมื่อเราตรวจสอบครั้งล่าสุด พูลรีเควสต์เพื่อเพิ่มมันเข้าไปในสแตกการให้บริการอื่น ๆ ได้ถูกผสานแล้ว และการนำไปใช้ก็ไม่ใช่เรื่องที่ต้องกังขา: ยอดดาวน์โหลด 393,079 ครั้งในสามสิบวันล่าสุด ณ เวลาที่บันทึกข้อมูลนี้ โดยมีอะแดปเตอร์ 27 รายการ ไฟน์จูน 30 รายการ ควอนไทเซชัน 12 รายการ และ Spaces 100 แห่งที่สร้างขึ้นบนเช็กพอยต์นี้

A screenshot of the Hugging Face model card for openbmb/VoxCPM2, captured September 2026: 'VoxCPM2 is a tokenizer-free, diffusion autoregressive Text-to-Speech model - 2B parameters, 30 languages, 48kHz audio output, trained on over 2 million hours of multilingual speech data', with 1.6k likes, 4.95k followers, 393,079 downloads last month, 2B params in BF16, 27 adapter models, 30 finetunes, 12 quantisations, and an Inference Providers panel reading 'This model isn't deployed by any Inference Provider.'

ภาษีที่เทียบเท่าของ GPT-Live-1 คือการเขียนระบบรับส่งข้อมูลใหม่ เซสชันของมันสร้างขึ้นโดยอิงกับการเชื่อมต่อแบบสดมากกว่าจุดเชื่อมต่อเสียงแบบคำขอ-ตอบกลับ และการคิดค่าบริการแบบสองมาตรวัดหมายความว่าทุกการเรียกใช้การให้เหตุผลที่ถูกมอบหมาย การเรียกใช้เครื่องมือ และการค้นหาเว็บ จะถูกคิดค่าบริการตามอัตราของโมเดลเบื้องหลังเอง นอกเหนือจากค่านาทีเสียง ทีมที่ย้ายมาจากการผสานรวมแบบเรียลไทม์ที่คิดค่าบริการตามโทเค็นควรจัดสรรการย้ายนี้เป็นงานวิศวกรรม ไม่ใช่แค่การสลับ ID ของโมเดล

จุดที่เลเยอร์การกำหนดเส้นทางช่วยได้จริง

OrcaRouter ไม่มีทั้ง GPT-Live-1 และ VoxCPM2 และควรพูดเรื่องนี้ให้ตรงไปตรงมา ดีกว่าปล่อยให้ส่วนที่เหลือของหัวข้อนี้สื่อเป็นนัยเป็นอย่างอื่น เลเยอร์เสียงของ GPT-Live-1 อยู่เบื้องหลังเอนด์พอยต์ของ Ope​nAI เอง; VoxCPM2 ไม่มีผู้ให้บริการโฮสต์เลยแม้แต่รายเดียว ทั้งสองอย่างไม่ใช่สิ่งที่คุณจะเรียกใช้ด้วยคีย์ของเราได้

เหตุผลที่คำถามเรื่องการจัดเส้นทางยังคงถูกหยิบยกขึ้นมาเสมอก็คือ โมเดลทั้งสองตัวต่างตั้งอยู่ที่ขอบของไปป์ไลน์ที่มีข้อความอยู่ตรงกลาง การติดตั้ง VoxCPM2 โดยทั่วไปจะต้องตอบสนองต่อบางสิ่ง — ตัวสร้างสคริปต์ ขั้นตอนการแปล ตัวปรับข้อความให้เป็นมาตรฐาน โมเดลบทสนทนาที่ตัดสินว่าอะไรจะถูกพูดต่อไป — และสิ่งเหล่านั้นคือการเรียกโมเดลแบบธรรมดา ๆ เซสชัน GPT-Live-1 มอบหมายการคิดของตนให้กับโมเดลแบ็กเอนด์ที่ระบุไว้ในคอนฟิกของเซสชัน และในเอกสารของ Ope​nAI เอง แบ็กเอนด์นั้นคือ GPT-5.6 Terra ซึ่งพร้อมใช้งานผ่าน OrcaRouter ในราคาตามที่ Ope​nAI ประกาศ การมอบหมายจากฝั่งไคลเอนต์ไปได้ไกลกว่านั้นอีก โดยให้แอปพลิเคชันของคุณเองจัดหาแบ็กเอนด์ได้ ซึ่งหมายความว่าโมเดลที่อยู่เบื้องหลังเสียงสามารถเป็นเอนด์พอยต์ใดก็ได้ที่คุณควบคุม ประมาณ 190 โมเดลจากผู้ให้บริการต้นทางสิบเอ็ดราย อยู่เบื้องหลัง คีย์เดียวในราคาตามประกาศโดยไม่มีมาร์กอัป — ดังนั้นเมื่อผู้ให้บริการลดราคา การลดราคานั้นก็มีผลที่นี่ในวันเดียวกัน แทนที่จะรอถึงรอบต่ออายุ — พร้อมการสลับสำรองอัตโนมัติข้ามผู้ให้บริการ และ DSL สำหรับการจัดเส้นทางเพื่อประกอบหลายโมเดลเข้าเป็นการเรียกครั้งเดียว ประกันราคาถูก ๆ สำหรับครึ่งหนึ่งของสแตกที่เปลี่ยนแปลงบ่อยที่สุด

คำเตือนหนึ่งข้อควรอยู่ในส่วนนี้มากกว่าจะถูกซ่อนไว้ในนั้น เพราะมันเป็นรายละเอียดที่ทำให้ครึ่งหนึ่งของ GPT-Live-1 ในการเปรียบเทียบนี้ยังไม่นิ่งเท่าที่ผลเบนช์มาร์กของผู้ขายชี้ให้เห็น บนดัชนี Speech to Speech ของ Artificial Analysis ซึ่งเป็นอิสระ GPT-Live-1 ได้คะแนน 69.8% — เป็นอันดับที่เจ็ดจากสิบเอ็ด ตามหลัง GPT-Realtime-2.1 ที่ 73.9% และ Gr​ok Voice Think Fast 2.0 ที่ 79.0% โมเดลนี้เป็นตัวที่ถูกที่สุดบนบอร์ดนั้นต่อชั่วโมงของเสียงขาเข้า โดยอยู่ที่ $4.42 และมันไม่ใช่ตัวที่ดีที่สุด เผื่อความเป็นไปได้ไว้ด้วยว่าเลเยอร์เสียงที่คุณเลือกใช้เป็นมาตรฐานอาจไม่ใช่ตัวที่คุณคงใช้ต่อไป

A screenshot of the Artificial Analysis Speech to Speech Index chart updated September 2026: Grok Voice Think Fast 2.0 79.0%, GPT-Realtime-2.1 73.9%, GPT-Realtime-2 73.6%, Grok Voice Think Fast 72.3%, Gemini 3.1 Flash Live 71.5%, GPT-Live-1 mini 70.3%, GPT-Live-1 69.8%, Qwen-Audio-Omni 66.8%, RealTime Omni 64.2%, Qwen 3.x Omni 63.9%, Gemini 2.5 Flash 52.6%, with a cost chart placing GPT-Live-1 at $4.42 and GPT-Realtime-2.1 at $10.75 per hour of input audio.

อันไหน เพื่ออะไร

ใช้ VoxCPM2 ถ้าข้อความเกิดขึ้นก่อนเสียง การบรรยาย หนังสือเสียง การพากย์เสียง การช่วยการเข้าถึง เสียงพูดในเกม ผลิตภัณฑ์ที่ต้องการเสียงที่ยังไม่มีใครบันทึก — และโดยเฉพาะงานใด ๆ ที่ปริมาณสูง คาดเดาได้ และคุ้มค่ากับต้นทุนคงที่ ยอมรับว่าคุณจะต้องรันมันเอง ว่าเครื่องมือแวดล้อมยังไม่เข้าที่ และคำกล่าวอ้างเรื่องคุณภาพหลายภาษาควรได้รับการทดสอบการฟังด้วยตัวคุณเองก่อนที่มันจะไปถึงมือลูกค้า

เลือกใช้ GPT-Live-1 หากอีกฝั่งเป็นคน วอยซ์เอเจนต์ ระบบสนับสนุนทางโทรศัพท์ กระบวนการรับข้อมูลเข้า หรืออะไรก็ตามที่โมเดลต้องตัดสินใจแบบเรียลไทม์ว่าผู้พูดพูดจบหรือยัง จ่ายค่าบริการรายนาทีเพื่อแลกกับสิทธิ์ที่ไม่ต้องแบกปัญหาไว้เอง และจัดงบสำหรับแบ็กเอนด์ที่มอบหมายออกไปเป็นรายการแยกต่างหาก เพราะนั่นคือจุดที่การโทรจะถูกลงหรือแพงขึ้น

ความผิดพลาดคือการมองว่าพวกมันเป็นทางเลือกที่ต้องมาแข่งกันในศึกเปรียบเทียบ สำหรับทีมส่วนใหญ่ที่จำเป็นต้องใช้ทั้งคู่ พวกมันคือสองชั้นของผลิตภัณฑ์เดียวกัน และคำตอบที่ผิดอย่างแท้จริงเพียงอย่างเดียวคือการเลือกตัวที่โฮสต์เองเพราะสัญญาอนุญาตบอกว่าฟรี โดยไม่คิดต้นทุนของ GPU ที่ทำให้คำว่าฟรีนั้นเป็นจริง

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube