
Grok Voice Transcribe 2.0 กับ NVIDIA Parakeet TDT 0.6B: สองลีดเดอร์บอร์ด หนึ่งการเปรียบเทียบที่ชวนให้เข้าใจผิด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
NVIDIA Parakeet TDT 0.6B เป็นทรานสดิวเซอร์ FastConformer-TDT ที่มีพารามิเตอร์ 600 ล้านตัว เปิดตัวเมื่อวันที่ 14 สิงหาคม 2025 ภายใต้สัญญาอนุญาต CC-BY-4.0 และมันเป็นคำแนะนำเริ่มต้นสำหรับใครก็ตามที่ต้องการรันการถอดเสียงด้วยตนเองมานานกว่าหนึ่งปี Grok Voice Transcribe 2.0 เป็นโมเดลแปลงเสียงเป็นข้อความแบบ managed ของ SpaceXAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 ราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ 0.20 ดอลลาร์ต่อชั่วโมงสำหรับแบบสตรีมมิง โดยมีอัตราความผิดพลาดระดับคำ (WER) ขั้นสุดท้าย 2.7% บนกระดานจัดอันดับสตรีมมิงของ Artificial Analysis ถ้าคุณค้นหาการเปรียบเทียบระหว่างสองตัวนี้ คุณจะพบว่า Parakeet ถูกอ้างถึงที่ WER 13.7% และ Grok Voice Transcribe 2.0 ที่ 2.7% ซึ่งทำให้โมเดลแบบ managed ดูแม่นยำกว่าถึงห้าเท่า และเป็นสิ่งที่อ่านแล้วทำให้เข้าใจผิดอย่างแท้จริง ตัวเลขสองตัวนั้นมาจากดัชนี Artificial Analysis คนละชุด สร้างขึ้นจากชุดข้อมูลคนละชุด เผยแพร่ห่างกันหลายปี และหนึ่งในนั้นถูกแทนที่ด้วยการวัดใหม่กว่าของผู้ขายเอง การเปรียบเทียบที่แท้จริงน่าสนใจกว่า และมันเกี่ยวกับสิ่งที่น้ำหนักโมเดล 600 เมกะไบต์มอบให้คุณ ซึ่ง API ไม่สามารถให้ได้
ตัวเลข 13.7% และเหตุผลที่คุณไม่ควรใช้มัน
รายงาน State of AI ประจำไตรมาส 3 ปี 2025 ของ Artificial Analysis จัดให้ NVIDIA Parakeet TDT อยู่อันดับที่สามบนดัชนี AA-WER ของตนด้วยค่า 13.7% เป็นรอง Chirp 2 ของ Google ที่ 11.6% และ Canary Qwen ของ NVIDIA เองที่ 13.2% ดัชนีนั้นเป็นค่าเฉลี่ยถ่วงน้ำหนักตามระยะเวลาเสียงจากข้อมูลชุดละประมาณสองชั่วโมงของ VoxPopuli, Earnings-22 และ AMI-SDM — ซึ่งเป็นเสียงพูดในโลกจริงที่มีสำเนียงหลากหลาย คำศัพท์เฉพาะโดเมน และสภาวะช่องสัญญาณที่ยาก นี่จึงเป็นเหตุผลที่ทุกตัวเลขในดัชนีนี้สูง ค่า WER 13.7% บน AMI-SDM ซึ่งเป็นเสียงประชุมระยะไกลที่บันทึกในห้องที่มีเสียงก้อง ไม่ใช่ผลลัพธ์ที่แย่ แต่เป็นการทดสอบที่ยาก
ดัชนีนั้นไม่มีอยู่ในรูปแบบนั้นอีกต่อไป Artificial Analysis สร้างมันใหม่เป็น AA-WER v2 โดยถ่วงน้ำหนัก AA-AgentTalk ที่ 50% และ VoxPopuli-Cleaned-AA กับ Earnings22-Cleaned-AA ที่ 25% อย่างละส่วน เสียงประมาณแปดชั่วโมง และการทำความสะอาดข้อมูลและการถ่วงน้ำหนักใหม่ทำให้ตัวเลขของทุกโมเดลขยับอย่างมีนัยสำคัญ บนบอร์ดแบบไม่สตรีมมิ่งปัจจุบัน Parakeet TDT 0.6B V3 อยู่ในช่วงเลขหลักเดียวระดับต่ำ — แถบเดียวกับผู้นำ open-weight รายอื่น — ไม่ใช่ใกล้เคียง 13.7% เลย และคะแนนสูงสุดของบอร์ดลดลงอยู่ที่ราว 2% ใครก็ตามที่ยังอ้าง 13.7% สำหรับ Parakeet กำลังอ้างการวัดที่เลิกใช้แล้ว และถ้าพวกเขาเปรียบเทียบกับตัวเลขสตรีมมิ่งปี 2026 พวกเขาก็กำลังเปรียบเทียบข้ามสองบอร์ดที่แตกต่างกัน
สิ่งที่นำมาเทียบเคียงกันได้อย่างตรงไปตรงมานั้นแคบกว่า การประเมินของ NVIDIA เองบน Open ASR Leaderboard ซึ่งเป็นชุดข้อมูลภาษาอังกฤษแบบสั้นสาธารณะมาตรฐานที่รันผ่านเครื่องมือของบอร์ดนั้น รายงานค่า WER เฉลี่ย 6.32% สำหรับ Parakeet TDT 0.6B V3 โดยมี RTFx 3,332.74 และค่าเฉลี่ย 6.05% สำหรับ v2 ที่รองรับเฉพาะภาษาอังกฤษ ส่วน 2.7% ของ Grok Voice Transcribe 2.0 เป็นตัวเลขจากทรานสคริปต์ฉบับสุดท้ายบนบอร์ดสตรีมมิง ซึ่งวัดหลังสิ้นสุดการพูด บนเสียงสนทนาภาษาอังกฤษแบบ agent-weighted ชุดข้อมูลต่างกัน บอร์ดต่างกัน โหมดต่างกัน โมเดลแบบ managed มีแนวโน้มสูงมากว่าจะแม่นยำกว่าบนเสียงที่ทั้งสองบอร์ดใช้ร่วมกัน ขนาดของความได้เปรียบนั้นไม่ใช่ 5 เท่า และยังไม่มีใครเผยแพร่ผลการวัดที่จะชี้ขาดเรื่องนี้ได้
รูปร่างที่แท้จริงของโมเดลทั้งสองเป็นอย่างไร
ความแตกต่างทางสถาปัตยกรรมอธิบายความแตกต่างในทางปฏิบัติได้เป็นส่วนใหญ่ Parakeet TDT 0.6B เป็นตัวเข้ารหัส FastConformer ที่มีตัวถอดรหัสแบบ token-and-duration transducer — โดยทำนายทั้งโทเคนและจำนวนเฟรมที่จะเลื่อนไป ซึ่งทำให้สามารถข้ามได้แทนที่จะปล่อย blank และนั่นคือแหล่งที่มาหลักของประสิทธิภาพของมัน มันมาพร้อมการตรวจจับภาษาอัตโนมัติครอบคลุม 25 ภาษายุโรป การประทับเวลาในระดับคำและระดับเซกเมนต์ เครื่องหมายวรรคตอนและการใช้ตัวพิมพ์ใหญ่ และรองรับเสียงยาว — สูงสุด 24 นาทีเมื่อใช้ full attention หรือประมาณสามชั่วโมงเมื่อใช้ local attention มันให้บริการผ่าน NeMo 2.2 มีเส้นทาง MLX สำหรับ Apple Silicon และมีบิลด์ ONNX INT8 ที่ทำงานบน CPU ทั่วไป
Grok Voice Transcribe 2.0 เป็นบริการแบบ managed ดังนั้นการเปรียบเทียบจึงอยู่ระหว่างโมเดลกับผลิตภัณฑ์ สิ่งที่ผลิตภัณฑ์รวมไว้ในราคาตามรายการ:
• การสตรีม — Grok Voice Transcribe 2.0 แบบเนทีฟผ่าน WebSocket, partial แรกที่ 0.49 วินาที เทียบกับวิธีแบบ chunked หรือ buffered ของ Parakeet TDT 0.6B โดยไม่มีอินเทอร์เฟซ partial-transcript แบบ first-class
• การให้น้ำหนักคำสำคัญ — สูงสุด 100 คำสำคัญต่อคำขอ เทียบกับที่ไม่ใช่คุณสมบัติของ Parakeet
• ไดอะไรเซชัน — รวมอยู่ในราคาที่ขอไป เทียบกับระบบแยกต่างหากที่คุณเพิ่มเอง
• ช่องสัญญาณ — สูงสุดแปดช่องสัญญาณเสียงในคำขอเดียว เทียบกับหนึ่งสตรีมต่อรอบ
• การแปลงข้อความให้เป็นรูปแบบปกติแบบผกผัน — มีให้ใช้ใน 25 ภาษา เทียบกับเฉพาะเครื่องหมายวรรคตอนและการใช้ตัวพิมพ์ใหญ่เท่านั้น
• การปรับใช้ — เอนด์พอยต์แบบมีการจัดการใน us-east-1 เทียบกับเวตที่คุณดาวน์โหลด รัน และดำเนินการได้ทุกที่
• สัญญาอนุญาต — ข้อกำหนด API เชิงพาณิชย์ เทียบกับ CC-BY-4.0 พร้อมระบุแหล่งที่มา
• ขนาดโมเดล — ไม่เปิดเผย เทียบกับประมาณ 600 ล้านพารามิเตอร์ ประมาณ 2.4 GB ใน fp32 หรือ 1.2 GB ใน fp16
แถวสุดท้ายคือแถวที่ชี้ขาดการนำไปใช้งานจริงหลาย ๆ กรณี Parakeet TDT 0.6B ใช้พื้นที่เพียงไม่กี่กิกะไบต์ ทำงานได้ในระดับที่ยอมรับได้บน CPU ของแล็ปท็อปผ่านเส้นทาง INT8 ONNX และใส่ได้อย่างสบายบน GPU สำหรับผู้บริโภคทั่วไป นั่นไม่ใช่เวอร์ชันที่เล็กลงของสิ่งที่ API ทำ — มันเป็นความสามารถคนละแบบ เพราะมันคือความแตกต่างระหว่างฟีเจอร์ถอดเสียงที่ทำงานแบบออฟไลน์ บนอุปกรณ์ โดยไม่ต้องใช้เครือข่ายและไม่มีค่าใช้จ่ายรายชั่วโมง กับอีกแบบหนึ่งที่ทำแบบนั้นไม่ได้

การคำนวณต้นทุนที่ไม่มีใครทำอย่างถูกต้อง
การเปรียบเทียบที่ถูกเผยแพร่ออกไปคือ “$0.10 ต่อชั่วโมง เทียบกับฟรี” และมันผิดทั้งสองทาง — API ไม่ใช่สิ่งเดียวที่คุณต้องจ่าย และ weights ไม่ใช่สิ่งเดียวที่คุณประหยัดได้
• การถอดเสียงแบบกลุ่ม — Grok Voice Transcribe 2.0 ในราคา $0.10 ต่อชั่วโมงเสียง ประมาณ $1.67 ต่อ 1,000 นาที เทียบกับ Parakeet TDT 0.6B ที่ไม่มีค่าใบอนุญาต บวกกับเวลาใช้งาน GPU หรือ CPU
• สตรีมมิ่ง — $0.20 ต่อชั่วโมงเสียง ประมาณ $3.33 ต่อ 1,000 นาที เมื่อเทียบกับการโฮสต์เอง ซึ่งข้อจำกัดคือเพดานการทำงานพร้อมกันของคุณเอง ไม่ใช่อัตราที่ประกาศไว้
• ขีดจำกัดของบริการ — 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งพร้อมกันต่อทีม เทียบกับสิ่งที่ฮาร์ดแวร์ของคุณรองรับ โดยไม่มีขีดจำกัดอัตราและไม่มีเพดานจำนวนการทำงานพร้อมกัน
• ค่าใช้จ่ายที่ไม่ได้อยู่ในทั้งสองชีต — ไม่มีงานวิศวกรรม ไม่มีสแตกการให้บริการ ไม่มีการสเกลอัตโนมัติเมื่อเทียบกับการหมุนเวียนเข้าเวร on-call ตรรกะการลองใหม่ การอัปเดตโมเดล และ GPU ที่คุณอุ่นเครื่องไว้สำหรับช่วงพีค
ที่ปริมาณน้อย ฝั่ง managed แทบจะถูกกว่าเสมอ เพราะต้นทุนคงที่ของเส้นทาง self-hosted คือคนหนึ่งคน ที่ปริมาณมากและสม่ำเสมอ ฝั่ง self-hosted ชนะอย่างเด็ดขาด และจุดเปลี่ยนผ่านเป็นฟังก์ชันของอัตราการใช้งาน (utilisation) มากกว่าปริมาณเสียง: GPU ที่คุณใช้งานให้ยุ่งอยู่เสมอมีต้นทุนต่อชั่วโมงเสียงที่ถูกมาก แต่ GPU ที่คุณอุ่นไว้รอทราฟฟิกช่วงพีกกลับไม่ใช่ ทีมที่ประมวลผล 20,000 ชั่วโมงต่อเดือนจ่าย $2,000 สำหรับเส้นทาง batch แบบ managed และประมาณหนึ่งเดือนของ GPU ระดับกลางบวกเวลางานวิศวกรรมสำหรับเส้นทาง self-hosted ซึ่งไม่ใกล้เคียงกันเลย
เหตุที่การคิดเลขนี้มักถูกทำได้แย่ก็คือ ฝั่งที่โฮสต์เองมักถูกนำมาเทียบที่ศูนย์ และฝั่งที่มีผู้ให้บริการจัดการมักถูกนำมาเทียบที่ราคาตามรายการ ทั้งสองอย่างไม่ใช่ตัวเลขจริง สิ่งที่เป็นจริงคือ 3,332 RTFx ของ Parakeet TDT 0.6B — ตัวเลขของ NVIDIA ซึ่งวัดแบบแบตช์ บนฮาร์ดแวร์ศูนย์ข้อมูล และเป็นค่าที่ควรถือเป็นขอบเขตบนมากกว่าคำสัญญา — หมายความว่า GPU ระดับธรรมดาเพียงตัวเดียวสามารถประมวลผลเสียงได้มากกว่าที่องค์กรส่วนใหญ่สร้างขึ้น
จุดที่ Parakeet ไม่ใช่คำตอบที่ถูกต้องอีกต่อไป
มีสามสิ่งผลักดันให้ทีมออกจากโมเดลแบบเปิดไปสู่โมเดลแบบมีผู้ให้บริการจัดการ และไม่มีสิ่งใดเลยที่เป็นเรื่องความแม่นยำ
ประการแรกคือการให้น้ำหนักกับคำสำคัญ หากทรานสคริปต์ของคุณเต็มไปด้วยชื่อผลิตภัณฑ์ นามสกุล สัญลักษณ์หุ้น หรือศัพท์เฉพาะทาง โมเดลที่ไม่มีกลไกการให้น้ำหนักกับคำสำคัญจะถอดคำเหล่านั้นออกมาผิด โดยไม่มีทางแก้ไขใด ๆ นอกจากการปรับแต่งโมเดล Grok Voice Transcribe 2.0 รองรับคำสำคัญได้สูงสุด 100 คำต่อคำขอ ส่วน Parakeet TDT 0.6B ไม่มีฟีเจอร์นี้ สำหรับศูนย์ติดต่อ บริการด้านสุขภาพ และงานด้านกฎหมาย ช่องว่างเพียงข้อเดียวนี้ก็เพียงพอที่จะทำให้ถูกตัดสิทธิ์ ไม่ว่ากระดานจัดอันดับใดจะพูดอย่างไรก็ตาม
อย่างที่สองคือการแยกแยะผู้พูด Parakeet ให้คำพร้อมเวลากำกับ แต่ไม่ได้บอกว่าใครเป็นคนพูด การถอดเสียงแบบผู้พูดหลายคนหมายถึงการรันโมเดลแยกแยะผู้พูดแยกต่างหาก แล้วจัดตำแหน่งเอาต์พุต ซึ่งเป็นงานระดับโปรเจกต์มากกว่าจะเป็นตัวเลือกในการตั้งค่า โมเดลแบบ managed จะคืนข้อความที่ระบุผู้พูดในคำขอเดียวกัน
อย่างที่สามคืออินเทอร์เฟซแบบสตรีมมิ่งเอง Parakeet เร็วพอที่ผู้คนจะสร้างระบบเรียลไทม์บนมันได้ — แบ่งเสียงออกเป็นชิ้น ๆ รันโมเดลบนแต่ละชิ้น แล้วเชื่อมผลลัพธ์เข้าด้วยกัน — แต่พฤติกรรมของบทถอดเสียงบางส่วน การตรวจจับจุดสิ้นสุดการพูด และความหมายของการยืนยันผล ล้วนเป็นสิ่งที่คุณต้องเขียนและดูแลรักษาเอง Grok Voice Transcribe 2.0 คืนผลลัพธ์บางส่วนชุดแรกภายใน 0.49 วินาทีหลังจากคุณหยุดพูด ในฐานะฟีเจอร์ของผลิตภัณฑ์
ยังมีรายละเอียดด้านไลเซนส์อีกจุดหนึ่งที่บางครั้งทำให้ทีมประหลาดใจ: Parakeet TDT 0.6B V3 ใช้ CC-BY-4.0 ซึ่งอนุญาตให้ใช้เชิงพาณิชย์ได้ แต่ต้องระบุที่มา และโมเดลเสียงพูดบางรุ่นของ NVIDIA ได้เปลี่ยนไปใช้ Open Model License ของผู้ขายเองแทนแล้ว หากการระบุที่มาเป็นปัญหาสำหรับผลิตภัณฑ์ของคุณ ให้อ่านการ์ดของเช็กพอยต์นั้น ๆ แทนที่จะสันนิษฐานว่าเงื่อนไขของตระกูลโมเดลนั้นใช้ได้

ทำไม API ถึงมักจะชนะอยู่ดี และเมื่อใดที่มันไม่ควรชนะ
รูปแบบในช่วงหนึ่งปีที่ผ่านมาสอดคล้องกันเสมอ: ทีมต่างๆ เริ่มต้นจากโมเดลเปิดอย่าง Parakeet TDT 0.6B เพราะมันฟรีและควบคุมได้ ปล่อยฟีเจอร์ออกไป แล้วจึงค้นพบว่าต้นทุนต่อเนื่องไม่ใช่ GPU แต่คือการบำรุงรักษา และย้ายไปยังเอนด์พอยต์แบบมีการจัดการ การย้ายกลับทางก็เกิดขึ้นเช่นกัน โดยมักเกิดเมื่อปริมาณการใช้งานข้ามเกณฑ์หนึ่ง ซึ่งค่าบริการรายชั่วโมงเริ่มดูเหมือนค่าเช่าสิ่งที่คุณสามารถเป็นเจ้าของได้เอง
การดำเนินการทั้งสองทิศทางมีค่าใช้จ่ายสูงหากเชื่อมโมเดลเข้ากับแอปพลิเคชันของคุณโดยตรง ซึ่งเป็นเหตุผลที่ควรทำให้จุดเรียกใช้งานนั้นเรียบง่ายไม่น่าตื่นเต้น OrcaRouter เปิดให้เข้าถึงโมเดลกว่า 200 รายการผ่านคีย์เดียวที่เข้ากันได้กับ OpenAI พร้อมการสลับไปใช้ผู้ให้บริการรายอื่นอัตโนมัติเมื่อเกิดข้อขัดข้อง และบวกกำไร 0% จากราคาที่ผู้ให้บริการประกาศไว้ ดังนั้นการติดตั้งแบบโฮสต์เองและการใช้บริการแบบจัดการจึงอยู่เบื้องหลังอินเทอร์เฟซเดียวกันและสลับกันได้ด้วยสตริงชื่อโมเดล เรื่องนี้สำคัญกว่าปกติในงานเสียง ซึ่งตารางอันดับเปลี่ยนมือทุกไม่กี่สัปดาห์ และบริการแบบจัดการในภูมิภาคเดียวก็คือเหตุขัดข้องในภูมิภาคเดียว — เส้นทางการสลับสำรองคือสิ่งที่ทำให้ฟีเจอร์ถอดเสียงไม่กลายเป็นเหตุถอดเสียงล่ม
สำหรับทีมที่ต้องการอัตราการประมวลผลของโมเดลแบบเปิดโดยไม่ต้องมีสแต็กสำหรับให้บริการ นี่ก็คือรูปแบบของการตัดสินใจเช่นกัน: ทดสอบวัดประสิทธิภาพ Parakeet TDT 0.6B กับเสียงของคุณเอง ทดสอบวัดประสิทธิภาพ Grok Voice Transcribe 2.0 กับเสียงเดียวกัน แล้วให้ตัวที่ชนะรับทราฟฟิกต่อไป ส่วนคุณก็ไม่ต้องสนใจอีกว่ามีโลโก้ของผู้จำหน่ายรายใดอยู่บนนั้น

ถ้าคุณอยากได้เวอร์ชันบรรทัดเดียว: Parakeet TDT 0.6B ยังคงเป็นคำตอบที่ดีที่สุดสำหรับ "ถอดเสียงอะไรก็ได้ ทุกที่ โดยไม่มีค่าใช้จ่ายรายชั่วโมง บนฮาร์ดแวร์ที่ฉันมีอยู่แล้ว" และ Grok Voice Transcribe 2.0 คือคำตอบสำหรับ "ถอดเสียงได้อย่างแม่นยำพร้อมป้ายกำกับผู้พูดและคำศัพท์ของฉันเอง โดยไม่ต้องรันอะไรเลย" ตัวเลข 13.7% ที่ทำให้ช่องว่างดูมหาศาลนั้นเป็นการวัดที่เลิกใช้แล้ว และช่องว่างที่แท้จริง — ประมาณหนึ่งถึงสามจุดของ WER ในเสียงที่ทับซ้อนกัน — น้อยพอที่คำถามด้านการปฏิบัติงานควรเป็นตัวตัดสิน
