
VibeVoice-ASR-Streaming-7B เทียบกับ GPT-Transcribe: ตรวจสอบสดเทียบกับเอนด์พอยต์ไฟล์ของ OpenAI
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
โมเดลสองตัวบนหน้านี้ไม่ใช่คู่แข่งกันอย่างที่ชื่อของมันบอก — พวกมันถูกสร้างขึ้นสำหรับช่วงเวลาที่แตกต่างกันในวงจรชีวิตของการบันทึกเสียง และการเปรียบเทียบอย่างตรงไปตรงมาคือว่าผลิตภัณฑ์ของคุณกำลังอยู่ตรงช่วงเวลาใด GPT Transcribe คือเอนด์พอยต์การถอดเสียงแบบอะซิงโครนัสของ OpenAI: คุณอัปโหลดไฟล์ที่เสร็จสมบูรณ์ มันประมวลผลเร็วกว่าเวลาจริงประมาณ 34 เท่า และส่งคืนทรานสคริปต์ โดยคิดราคา $0.0045 ต่อนาทีของเสียง พร้อมอัตราคำผิด 3.31% ที่วัดอย่างอิสระบนเกณฑ์มาตรฐาน AA-WER ของ Artificial Analysis VibeVoice-ASR-Streaming-7B มีลักษณะตรงกันข้าม: เช็คพอยต์สำหรับสตรีมมิงของ Microsoft Research ซึ่งถูกอัปโหลดอย่างเงียบ ๆ ไปยัง Hugging Face เมื่อวันที่ 2 กันยายน 2026 ภายใต้ใบอนุญาต MIT ถูกสร้างขึ้นมาเพื่อถอดเสียงในขณะที่เสียงยังคงไหลเข้ามา — เซสชัน WebSocket ที่ส่งข้อความออกมาเป็นส่วนย่อย ๆ ขณะที่การบันทึกเติบโตขึ้น การเปรียบเทียบพวกมันด้วยความแม่นยำเพียงอย่างเดียวจะไร้ความหมาย เพราะฝ่ายหนึ่งมีตัวเลขที่ผ่านการตรวจสอบ แต่อีกฝ่ายไม่ได้เผยแพร่ตัวเลขใด ๆ ในรูปแบบข้อความเลย
ทุกอย่างที่กล่าวถึงด้านล่างนี้มีการระบุไว้อย่างเหมาะสม ตัวเลขของ GPT Transcribe คือราคาที่ OpenAI เผยแพร่และการวัดผลอิสระจาก Artificial Analysis ซึ่งเป็นข้อมูลที่เปิดเผยต่อสาธารณะนับตั้งแต่โมเดลดังกล่าวเปิดตัวเมื่อวันที่ 28 กรกฎาคม 2026 ส่วนในด้าน VibeVoice-ASR-Streaming-7B สิ่งที่ทราบได้คือข้อมูลจาก repository ได้แก่ การกำหนดค่า checkpoint, model card และเอกสารการสตรีมมิ่งของ Microsoft เนื่องจากยังไม่มีบุคคลที่สามทำการวัดประสิทธิภาพ และ Microsoft ยังไม่ได้ระบุอัตราคำผิดสำหรับการสตรีมมิ่งในรูปแบบข้อความที่อ่านได้
สองช่วงเวลาที่แตกต่างในชีวิตของเสียง
GPT Transcribe ถูกออกแบบมาสำหรับการบันทึกเสียงที่เกิดขึ้นไปแล้ว endpoint ของ OpenAI รองรับไฟล์เสียงสูงสุด 25 MB ในรูปแบบทั่วไป ได้แก่ mp3, mp4, mpeg, mpga, m4a, wav, webm และส่งคืนบทถอดเสียงฉบับเต็มหลังการประมวลผล ด้วยความเร็วเร็วกว่าเวลาจริงประมาณ 34 เท่า ดังนั้นการบันทึกเสียงยาวหนึ่งชั่วโมงจะเสร็จภายในไม่กี่นาที นี่คือบริการแบบแบตช์ และ OpenAI ตั้งราคาไว้สอดคล้องกัน: $0.0045 ต่อนาทีเสียง หรือประมาณ $0.27 ต่อชั่วโมงเสียง หากความต้องการของคุณเป็นแบบเรียลไทม์จริง ๆ OpenAI มีโมเดลแยกสำหรับกรณีนั้น — GPT Live Transcribe ในราคา $0.017 ต่อนาที ซึ่งแพงกว่าราคาแบตช์เกือบสี่เท่า — ซึ่งเป็นสิ่งที่ใกล้เคียงที่สุดในฝั่ง OpenAI กับสิ่งที่ VibeVoice-ASR-Streaming-7B ทำ
VibeVoice-ASR-Streaming-7B ทำให้ความแตกต่างนั้นหดหายไปในทิศทางตรงกันข้าม: มันเป็นเช็คพอยต์แบบสตรีมมิงที่จัดการไฟล์ทั้งไฟล์ได้ด้วย คอนฟิกพรีโปรเซสเซอร์ของมันเผยข้อกำหนดแบบสด — เสียงเข้าที่ 24 กิโลเฮิรตซ์ ถูกบีบอัด 3,200 เท่าเป็นสตรีมโทเคน 7.5 เฮิรตซ์ จากนั้นประมวลผลเป็นชิ้น ๆ ละ 22 เฟรม โดยมองล่วงหน้า 4 เฟรม คิดเป็นเสียงประมาณ 2.9 วินาทีต่อชิ้น พร้อมบริบทอนาคตประมาณครึ่งวินาที และจะส่งข้อความออกมาเมื่อแต่ละชิ้นเสร็จสิ้น บริบทเซสชันถูกส่งต่อผ่าน KV cache ดังนั้นเซสชันยาว ๆ จึงไม่ต้องคำนวณใหม่ตั้งแต่ต้น เส้นทางการเสิร์ฟที่ระบุไว้ (ปลั๊กอิน vLLM) เผยเอนด์พอยต์สตรีม WebSocket สำหรับเซสชันสด และเอนด์พอยต์ถอดความไฟล์ทั้งไฟล์ ดังนั้นน้ำหนักชุดเดียวกันจึงรองรับทั้งสองรูปแบบ — แต่เหตุผลที่โมเดลนี้มีไว้คือแบบสด และไม่มีการคิดค่าบริการต่อนาทีเพราะไม่มี hosted API คุณนำ GPU มาเอง

บัญชีหลักฐานเป็นด้านเดียว
GPT Transcribe เป็นหนึ่งใน API การถอดเสียงที่ผ่านการวัดผลอย่างละเอียดที่สุดในระบบการผลิตจริง Artificial Analysis จัดให้มีความผิดพลาดของคำ 3.31% บน AA-WER — อยู่ในอันดับที่เก้าจากระบบที่ติดตามประมาณห้าสิบระบบ — โดยมีจุดอ่อนที่รู้จักกันดีซ่อนอยู่ในคะแนนย่อย: ในชุด Earnings22 ที่ออกแบบมาให้มีเสียงยากโดยเจตนา ค่าความผิดพลาดเพิ่มเป็น 6.10% ตัวเลขเหล่านี้ผ่านการตรวจสอบ ทำซ้ำได้จากกระดานผู้นำที่เป็นกลาง และมีข้อจำกัดที่ถูกบันทึกไว้ด้วยเช่นกัน โมเดลนี้เปิดตัวราคาถูกกว่ารุ่นก่อนหน้า GPT-4o Transcribe ถึง 25% และมีคะแนนดีกว่าประมาณ 0.7 จุดบนเกณฑ์วัดเดียวกัน
VibeVoice-ASR-Streaming-7B ไม่มีตัวเลขที่เทียบเคียงได้ที่ใดเลย โมเดลการ์ดของมันแสดงตัวเลขการประเมินเป็นรูปภาพ และรายงานทางเทคนิคของ Microsoft เป็น PDF แต่ไม่มีตัวเลข WER แบบสตรีมมิ่งหรือเวลาแฝงที่สามารถอ้างอิงได้ในรูปแบบข้อความ และไม่มีอะไรที่สามารถตรวจสอบได้อย่างอิสระ จุดยึดตัวเลขเพียงอย่างเดียวในตระกูล VibeVoice คือตารางที่รายงานโดยผู้จำหน่ายในโมเดลการ์ดของ VibeVoice-ASR แบบแบตช์ — ค่า WER เฉลี่ย 7.77% จากชุดทดสอบภาษาอังกฤษแปดชุด และ 2.20% บน LibriSpeech clean — ซึ่งอธิบายถึงโมเดลแบบไม่สตรีมมิ่ง และไม่ควรนำไปตีความว่าเป็นความแม่นยำของ checkpoint นี้ หากการตัดสินใจซื้อของคุณต้องการตัวเลขที่คุณสามารถปกป้องต่อเพื่อนร่วมงานได้ มีเพียงด้านเดียวของการเปรียบเทียบนี้ที่มีตัวเลข
สิ่งที่แต่ละรายการส่งคืน นอกเหนือไปจากบทถอดเสียงธรรมดา
ทั้งสองโมเดลใช้แนวทางที่แตกต่างกันในเรื่องบริบท และนั่นคือจุดที่การเปรียบเทียบฟีเจอร์น่าสนใจ จุดขายของ GPT Transcribe คือการบอกใบ้บริบท (context hinting): คุณสามารถส่งคำอธิบายแบบอิสระของการบันทึก รายการคำสำคัญและคำนามเฉพาะ และรายการภาษาที่คาดหวัง และ OpenAI รายงานว่าในเบนช์มาร์ก Context-Aware ASR ของพวกเขา ความแม่นยำเชิงความหมายเพิ่มขึ้นจาก 41.6% เมื่อไม่มีบริบทเป็น 45.2% เมื่อมีบริบท มันยังคืนภาษาที่ตรวจพบด้วย สิ่งที่มันไม่ทำคือการแยกผู้พูด (speaker diarization) หรือการประทับเวลาแบบรายคำ — OpenAI ชี้ไปที่โมเดลแยกต่างหากสำหรับงานเหล่านั้น — ดังนั้นการถอดเทปการประชุมจึงออกมาเป็นข้อความก้อนเดียวที่ไม่ได้แยกแยะ เว้นแต่คุณจะสร้างเลเยอร์ผู้พูดขึ้นมาเอง
VibeVoice-ASR-Streaming-7B เลือกเดิมพันในทางตรงกันข้าม โมเดลการ์ดของมันอ้างว่าส่งออกแบบสตรีมมิ่งพร้อมระบุผู้พูด — ใครพูดอะไร โดยปล่อยผลลัพธ์ออกมาเมื่อประมวลผลชิ้นส่วนเสียงนั้นเสร็จ — รวมถึงคำฮ็อตที่ปรับแต่งเองผ่านพรอมต์บริบท (ตัวเลือกบรรทัดคำสั่งคือ --context_info) นี่คือคุณสมบัติที่ GPT Transcribe ตัดออกอย่างชัดเจน และเป็นเหตุผลที่โมเดลทั้งสองไม่สามารถใช้แทนกันได้สำหรับเสียงสดที่มีผู้พูดหลายคน ข้อถ่วงดุลคือการตรวจสอบยืนยัน: ฟีเจอร์ที่ GPT Transcribe ไม่มีคือการตัดสินใจด้านผลิตภัณฑ์ที่ได้รับการบันทึกเป็นเอกสาร ขณะที่การอ้างการระบุผู้พูดของ VibeVoice เป็นเพียงข้อความบนโมเดลการ์ดที่ยังไม่มีการทดสอบอิสระใดยืนยัน ทั้งสองฝั่งยังแตกต่างกันเรื่องการระบุเวลา — ไม่มีฝ่ายใดให้ timestamp ระดับคำในเส้นทางที่กำลังเปรียบเทียบ แม้ว่าโมเดลแบบแบตช์ของตระกูล VibeVoice จะรองรับก็ตาม

รูปทรงของราคากับคำถามเรื่องความเป็นเจ้าของ
โครงสร้างต้นทุนทั้งสองแบบแทบจะแตกต่างกันอย่างสิ้นเชิง และไม่มีแบบใดที่ดีกว่าอีกแบบหนึ่งอย่างชัดเจน GPT Transcribe เป็น API แบบคิดค่าบริการตามการใช้งาน: 0.27 ดอลลาร์ต่อชั่วโมงเสียง ไม่ต้องมีโครงสร้างพื้นฐาน ไม่ต้องใช้ GPU รองรับ 25 MB ต่อคำขอ และมาพร้อมการรับประกันการปฏิบัติงานของ OpenAI — นี่คือราคาของการไม่ต้องรันโมเดลเสียงด้วยตัวเอง ส่วน VibeVoice-ASR-Streaming-7B นั้นน้ำหนักโมเดลให้ใช้งานฟรี แต่ต้องใช้พื้นที่ประมาณ 18 GB ในรูปแบบ bf16 ยังไม่นับ KV cache หมายความว่าต้องใช้ GPU ระดับ 24 GB ต้องใช้โค้ดตัวอย่าง microsoft/VibeVoice หรือปลั๊กอิน vLLM และต้องดูแลระบบมอนิเตอร์และการปรับขนาดด้วยตัวเอง ใบอนุญาต MIT คือความแตกต่างที่ไม่มีราคาต่อนาทีใดจะครอบคลุมได้: น้ำหนักโมเดลเป็นของคุณที่จะเก็บไว้ ปรับแต่ง และรันบนฮาร์ดแวร์ที่คุณควบคุมได้ โดยไม่มีการคิดค่าใช้จ่ายต่อผู้ใช้ และไม่มีขีดจำกัด 25 MB
การครอบคลุมภาษาเป็นจุดที่ทั้งสองฝ่ายมีความคลุมเครือเกินกว่าที่ผู้ซื้อต้องการ VibeVoice-ASR-Streaming-7B ระบุ 10 ภาษาในโมเดลการ์ดของตน ได้แก่ อังกฤษ จีน สเปน โปรตุเกส เยอรมัน ญี่ปุ่น เกาหลี ฝรั่งเศส รัสเซีย อิตาลี — เทียบกับ 50+ ของ batch VibeVoice-ASR OpenAI ไม่ได้เผยแพร่รายการภาษาที่ได้รับการยืนยันเทียบเคียงได้สำหรับ GPT Transcribe; โดยรายงานผลลัพธ์ที่แข็งแกร่งใน 22 ภาษาของ Common Voice ในเอกสารเปิดตัว และจุดอ่อนด้านเสียงที่ได้รับการตรวจสอบแล้วบน Earnings22 เป็นเครื่องเตือนว่า "รองรับ" กับ "จัดการเสียงรบกวนในภาษานั้นได้" เป็นข้อความที่แตกต่างกัน หากความต้องการครอบคลุมของคุณกว้าง รายการทั้งสองก็ไม่ได้ให้คำตอบที่ชัดเจน — ทดสอบภาษาถิ่นจริงของคุณ

ข้อสรุป: เลือกตามเลน ไม่ใช่ตามคะแนน
เลือก GPT Transcribe เมื่อเสียงเป็นไฟล์ที่เสร็จสมบูรณ์ เมื่อคุณต้องการตัวเลขความแม่นยำที่มีการบันทึกไว้พร้อมข้อจำกัดที่ทราบ หรือเมื่อการไม่รันโครงสร้างพื้นฐานการรู้จำเสียงของคุณเองนั้นคุ้มกับ $0.27 ต่อชั่วโมง — และใช้คู่กับ GPT Live Transcribe เฉพาะเมื่อการส่งมอบแบบเรียลไทม์คุ้มกับราคาที่สูงเกือบ 4 เท่า เลือก VibeVoice-ASR-Streaming-7B เมื่องานเป็นแบบสดและมีผู้พูดหลายคน เมื่อคุณต้องการให้บทถอดความมาถึงในขณะที่การสนทนายังดำเนินอยู่ เมื่อเอาต์พุตสตรีมมิ่งที่ระบุผู้พูดเป็นฟีเจอร์ที่คุณต้องการประเมิน หรือเมื่อโอเพนเวตและการควบคุมข้อมูลสำคัญกว่าเกณฑ์มาตรฐานที่วัดได้
ข้อสังเกตเชิงโครงสร้างหนึ่งสำหรับทีมที่สร้างบนหนึ่งในสองทางเลือก: ชั้นการถอดเสียงไม่ใช่สิ่งที่ OrcaRouter กำหนดเส้นทางในปัจจุบัน — ไม่มีโมเดลถอดเสียงเป็นข้อความใดบนหน้านี้อยู่ในแคตตาล็อกของมัน ดังนั้นการเลือก ASR จึงเป็นของคุณทั้งหมด สิ่งที่การกำหนดเส้นทางช่วยให้คุณได้คือชั้นที่อยู่เหนือทรานสคริปต์ ฟีดการถอดเสียงสดจะมีประโยชน์ก็ต่อเมื่อมีบางอย่างดำเนินการกับมัน — ตัวสรุป กฎการแจ้งเตือน ตัววางแผนของเอเจนต์เสียง — และนั่นคือสแตกที่ OrcaRouter ทำหน้าที่เป็นส่วนหน้าด้วย API เดียวครอบคลุมโมเดล 200+ รายการในราคารายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีมาร์กอัป พร้อมการเฟลโอเวอร์อัตโนมัติ รูปแบบที่ทำให้เช็คพอยต์ที่ยังไม่ผ่านการพิสูจน์อย่าง VibeVoice-ASR-Streaming-7B มีต้นทุนต่ำพอจะลองใช้ คือการทำให้เอนด์พอยต์ที่ใช้ทรานสคริปต์ของคุณสลับเปลี่ยนได้ และโมเดลที่ยังไม่มีเกณฑ์ประเมินก็สามารถได้รับหรือสูญเสียทราฟฟิกของคุณจากหลักฐานในเสียงของคุณเอง มากกว่าจากคำกล่าวอ้างในวันเปิดตัว
