การ์ดฮีโร่ของบทความแสดงข้อความ 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำบรรยายใต้ภาพ 'สิ่งที่เบสไลน์ฟรียังทำได้ดีกว่า' พร้อมชิปที่แสดงข้อความ 2.7% เทียบกับ 4.07% WER, $0.20 ต่อชั่วโมง เทียบกับน้ำหนัก MIT, 0.49 วินาที เทียบกับ 1-5 วินาที สำหรับแบบโฮสต์เอง และแบบจัดการ เทียบกับแบบเป็นเจ้าของ บนพื้นหลังไล่เฉดสีขาวไปน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo: สิ่งที่เบสไลน์ฟรียังทำได้ดีกว่า

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Whisper Large v3 Turbo เป็นคำตอบเริ่มต้นสำหรับ “เราต้องการถอดเสียง” นับตั้งแต่เปิดตัวภายใต้ใบอนุญาต MIT เมื่อวันที่ 1 ตุลาคม 2024 และไม่มีอะไรเกี่ยวกับ Grok Voice Transcribe 2.0 ที่เปลี่ยนเหตุผลนั้น โมเดลใหม่ของ SpaceXAI ซึ่งเปิดตัวเมื่อวันที่ 18 กันยายน 2026 เป็นเครื่องถอดเสียงที่ดีกว่าอย่างแท้จริงและทิ้งห่างไม่ใกล้เคียง — อัตราความผิดพลาดระดับคำ 2.7% สำหรับบทถอดเสียงฉบับสมบูรณ์ และ 3.4% สำหรับ partial แรก บนกระดาน AA-WER Streaming ของ Artificial Analysis เทียบกับตัวเลขของตระกูล Whisper ที่ 4.07% บนกระดานแบบไม่สตรีม โดยที่ Turbo เองมักตามหลัง Large v3 ตัวเต็มที่มันถูกกลั่นมาจากอยู่ราวไม่กี่ในสิบของจุดเปอร์เซ็นต์ นอกจากนี้ยังมีราคา $0.10 ต่อชั่วโมงเสียงสำหรับแบบแบตช์ และ $0.20 ต่อชั่วโมงสำหรับแบบสตรีม Whisper Large v3 Turbo เป็นไฟล์ขนาด 1.6 GB ที่มี 809 ล้านพารามิเตอร์ ซึ่งรันบนฮาร์ดแวร์ของคุณเอง ไม่วัดการใช้งานใด ๆ ไม่ส่งเสียงไปที่ใด และไม่มีขีดจำกัดอัตรา ไม่มีเพดานการทำงานพร้อมกัน และไม่มีกำหนดเลิกใช้ การเปรียบเทียบนี้ไม่ใช่ระหว่างโมเดลที่ดีกว่ากับโมเดลที่แย่กว่า แต่เป็นระหว่างการเช่าความแม่นยำกับการเป็นเจ้าของส่วนประกอบ

หน้าต่างเวลา 32 วินาทีคือสถาปัตยกรรมทั้งหมด

Whisper Large v3 Turbo สืบทอดโครงสร้างของโมเดล Whisper ทุกตัว: เสียงถูกประมวลผลเป็นหน้าต่างขนาด 30 วินาทีแบบคงที่ เอนโคเดอร์ทำงานหนึ่งครั้งต่อหนึ่งหน้าต่าง และดีโคเดอร์ส่งออกข้อความสำหรับชังก์นั้น Turbo ทำให้มันถูกลง — ใช้ชั้นดีโคเดอร์สี่ชั้นแทนสามสิบสองชั้น เร็วขึ้นประมาณ 8 เท่าเมื่อเทียบกับ Large v3 ใช้ VRAM ราว 6 GB แทน 10 GB — แต่ก็ไม่ได้เปลี่ยนรูปร่างของมัน ภายในโมเดลไม่มีความคิดเรื่อง "ประโยคจนถึงตอนนี้" เพราะไม่มีสถานะถาวรข้ามหน้าต่าง

ข้อเท็จจริงด้านการออกแบบเพียงข้อเดียวนั้นอธิบายทุกสิ่งปลายน้ำได้ทั้งหมด ไม่มีการสตรีมแบบเนทีฟ เพราะการสตรีมต้องยอมส่งผลลัพธ์บางส่วนออกไปกลางบทพูด และโมเดลไม่มีกลไกสำหรับเรื่องนั้น การปรับใช้ Whisper แบบเรียลไทม์มีอยู่จริง แต่ก็คือการแบ่งเป็นชิ้นบวกกับการตรวจจับกิจกรรมเสียงบวกกับเลเยอร์เย็บต่อที่ใครบางคนเขียนขึ้นและตอนนี้ต้องคอยดูแล และความหน่วงที่ตกออกมาจากไปป์ไลน์นั้นวัดกันเป็นวินาที ไม่ใช่ครึ่งวินาทีอย่างที่ Grok Voice Transcribe 2.0 ทำได้ ไม่มีการแยกผู้พูด เพราะการแยกผู้พูดเป็นปัญหาคนละเรื่อง ว่าใครกำลังพูด ไม่ใช่ว่าพูดอะไร และรุ่น Turbo โดยเฉพาะนั้นคืนค่าเป็นข้อความล้วน ๆ — ไม่มีเวลาประทับ ไม่มีคะแนนความมั่นใจ ไม่มีการทำข้อความให้เป็นมาตรฐานผกผันที่เปลี่ยนตัวเลขและที่อยู่อีเมลที่พูดออกมาให้อยู่ในรูปแบบเขียน

Grok Voice Transcribe 2.0 ถูกสร้างขึ้นในทางกลับกัน การสตรีมเป็นช่องทางหลัก ส่วนแบบแบตช์ใช้น้ำหนักโมเดลเดียวกันที่อยู่เบื้องหลัง REST endpoint และรายการฟีเจอร์ก็อ่านแล้วเหมือนรายการสิ่งที่ Whisper ปล่อยให้แอปพลิเคชันจัดการเอง ทั้งการประทับเวลาระดับคำพร้อมค่าความเชื่อมั่นต่อคำ การแยกผู้พูดที่รวมมาให้โดยไม่มีค่าใช้จ่ายเพิ่ม การถอดเสียงหลายช่องสัญญาณสูงสุด 8 ช่องสัญญาณอิสระ การปรับเอียงคำสำคัญสูงสุด 100 คำศัพท์เฉพาะโดเมนต่อคำขอ การแปลงข้อความผกผันใน 25 ภาษา การลบคำเติม และการตรวจจับจุดสิ้นสุดการพูดด้วย Smart Turn สำหรับเอเจนต์เสียง หากคุณเคยดูแลไปป์ไลน์การแบ่งชิ้นและเย็บต่อรอบ ๆ Whisper รายการนั้นก็คือคำอธิบายของโค้ดที่คุณเขียน

ช่องว่างด้านความแม่นยำ และเหตุใดมันจึงเล็กกว่าที่เห็น

• ความแม่นยำของข้อความถอดเสียงขั้นสุดท้าย (สตรีมมิง) — Grok Voice Transcribe 2.0 อยู่ที่ 2.7% WER บน AA-WER Streaming เมื่อเทียบกับกรณีที่ไม่มีรายการ Whisper Large v3 Turbo เนื่องจากโมเดลไม่สามารถสตรีมแบบเนทีฟได้

• ความแม่นยำแบบแบตช์ — Grok Voice Transcribe 2.0 อยู่ที่ 2.29% AA-WER เทียบกับ Whisper Large v3 ที่ 4.07% บนบอร์ดแบบไม่สตรีมมิ่งของ Artificial Analysis โดย Turbo มักตามหลัง Large v3 ฉบับเต็มอยู่ราว 0.4 ถึง 0.6 จุดในการทดสอบอิสระ

• เสียงภาษาอังกฤษที่สะอาด — Whisper Large v3 Turbo ทำค่า WER ได้ประมาณ 2.1% บน LibriSpeech test-clean และประมาณ 4.2% บน test-other ดังนั้นกับเสียงคุณภาพระดับสตูดิโอ ช่องว่างเมื่อเทียบกับ API ชั้นแนวหน้าจึงแคบลงจนแทบไม่เหลือ

• เสียงในสภาพจริง — เกณฑ์มาตรฐานอิสระชุดเดียวกันวัดว่า Turbo อยู่ที่ประมาณ 4.6% ในสายสนทนาธุรกิจที่มีผู้พูดสองคน และ 8–12% ในเสียงที่มีสัญญาณรบกวน ซึ่งเป็นจุดที่ส่วนต่างของโมเดลระดับแนวหน้าเปิดกว้างขึ้น

• ปริมาณงานประมวลผลแบบกลุ่ม — Grok Voice Transcribe 2.0 ที่ประมาณ 162× เวลาจริง เทียบกับ Whisper Large v3 Turbo ที่ประมาณ 80× บน GPU สำหรับผู้บริโภคระดับกลางเพียงตัวเดียว โดยฮาร์ดแวร์ที่ให้บริการเร็วกว่าสามารถทำได้หลายเท่าของจำนวนนั้น

• ความหน่วงในการสตรีม — 0.49 วินาทีถึงผลลัพธ์บางส่วนแรกบน Grok Voice Transcribe 2.0 เทียบกับ 1–5 วินาทีสำหรับไปป์ไลน์สตรีมมิ่ง Whisper ที่โฮสต์เอง ซึ่งเป็นโค้ดเชื่อมต่อบวก VAD มากกว่าความสามารถของโมเดล

การอ่านรายการนั้นอย่างตรงไปตรงมาคือ ข้อโต้แย้งเรื่องความแม่นยำสำหรับการจ่ายเงินนั้นมีอยู่จริง แต่เป็นแบบมีเงื่อนไข ในภาษาอังกฤษที่สะอาด มีผู้พูดคนเดียว และบันทึกได้ดี Whisper Large v3 Turbo นั้นใกล้เคียงพอจนความแตกต่างแทบไม่เปลี่ยนผลลัพธ์ แต่ในโทรศัพท์ 8 kHz เสียงคอลเซ็นเตอร์ที่มีเสียงรบกวน คำพูดที่มีสำเนียง และวลีสั้นเฉพาะทาง — ซึ่งเป็นชุดข้อมูลชุดเดียวกับที่ SpaceXAI ใช้ปรับจูน 2.0 โดยตัวเลขที่บริษัทรายงานเองขยับจาก 10.6% เป็น 7.1% ในงานโทรศัพท์ และจาก 20.6% เป็น 6.8% ในคำสั่งสั้นหลายภาษา — ช่องว่างนั้นกลายเป็นความต่างระหว่างทรานสคริปต์ที่คุณใช้กำหนดเส้นทางได้ กับทรานสคริปต์ที่คุณต้องอ่านเอง นั่นเป็นตัวเลขที่บริษัทรายงานจากเสียงของบริษัทเอง ซึ่งไม่มีใครนอก SpaceXAI ทำซ้ำได้ และทิศทางที่ตัวเลขเหล่านั้นชี้ไปก็สอดคล้องกับการทดสอบ Whisper แบบอิสระทุกครั้งบนเสียงที่เสื่อมคุณภาพ

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Whisper Large v3 Turbo — the scoreboard': the left column gives Grok Voice Transcribe 2.0 native streaming with a 0.49s partial, 2.29% batch WER, included diarization, word timestamps with confidence scores, $0.20 per streaming hour and a vendor API data path; the right column gives Whisper Large v3 Turbo self-built chunking only, 4.07% for full v3, no diarization, no timestamps in Turbo, MIT weights where you pay compute, and a data path that stays on your own hardware.

การเปรียบเทียบต้นทุนไม่ใช่ $0.10 กับ $0

ใบอนุญาตของ Whisper ไม่มีค่าใช้จ่าย; การรันมันไม่ได้ฟรี อินสแตนซ์ GPU ที่เก็บโมเดลขนาด 1.6 GB ไว้ใน VRAM 6 GB และถอดเสียงได้เร็วประมาณ 80 เท่าของเวลาจริง คือรายการค่าใช้จ่ายจริง และในอัตรา GPU บนคลาวด์ทั่วไป มันอยู่ในอันดับขนาดเดียวกันกับ API ที่โฮสต์ไว้สำหรับงานต่อเนื่อง — ด้วยข้อยกเว้นสำคัญที่ว่า คุณกำลังจ่ายค่าความจุไม่ว่าออดิโอจะไหลหรือไม่ เอนด์พอยต์ Whisper ที่โฮสต์ไว้มีอยู่ในช่วงราคาที่กว้าง ตั้งแต่ต่ำกว่า $1.20 ต่อ 1,000 นาทีในราคาถูกสุด ไปจนถึงไม่กี่ดอลลาร์ และความแปรปรวนนี้เป็นเครื่องเตือนใจที่มีประโยชน์ว่า "Whisper" เป็นโมเดล ไม่ใช่ระดับบริการ กระดานราคาที่ปรับมาตรฐานของ Artificial Analysis ระบุว่าเอนด์พอยต์ Whisper Large v3 ที่โฮสต์ไว้ที่ถูกที่สุดอยู่ที่ $0.50 และ $1.15 ต่อ 1,000 นาที ซึ่งทั้งคู่ต่ำกว่าอัตราแบบแบตช์ของ Grok Voice Transcribe 2.0 ที่ $1.67 — แต่ไม่มีเอนด์พอยต์ใดในนั้นที่เป็นของคุณ และทั้งคู่มาพร้อมกับขีดจำกัดอัตราและนโยบายการเก็บรักษาของคนอื่นติดมาด้วย

จุดที่ self-hosting ชนะขาดก็คือปริมาณงานที่มีลักษณะกระจุกตัวเป็นช่วง ๆ คลังสื่อขนาดหนึ่งหมื่นชั่วโมงมีค่าใช้จ่ายเท่ากันบน GPU ของคุณเองไม่ว่าคุณจะประมวลผลภายในสัปดาห์เดียวหรือหนึ่งปี และไม่มีมิเตอร์คิดรายชั่วโมงเดินอยู่ระหว่างที่คุณตัดสินใจ ส่วนไปป์ไลน์ด้าน compliance ที่ต้องไม่ส่งเสียงออกนอกเครือข่ายเลยนั้นไม่มีทางเลือกแบบ hosted ให้ใช้ไม่ว่าจะราคาเท่าใด เพราะข้อกำหนดนี้เป็นเรื่องสถาปัตยกรรม ไม่ใช่เรื่องการเงิน และการ fine-tuning จะเป็นไปได้สำหรับคุณก็ต่อเมื่อคุณถือ weights ไว้เอง สัญญาอนุญาต MIT ของ Whisper ทำให้คุณนำโมเดลขนาด 809M พารามิเตอร์ไปปรับใช้กับผู้พูดคนเดียว สำเนียงเดียว หรือคำศัพท์เฉพาะโดเมนแคบ ๆ ได้ ซึ่งเป็นความสามารถที่ไม่มี API ใดเปิดให้ใช้ไม่ว่าจะราคาเท่าใด

ภาพกลับด้านก็คือ ราคาของโมเดลแบบโฮสต์อาจเปลี่ยนแปลงไปได้ในขณะที่คุณยังใช้งานอยู่ SpaceXAI คงอัตราเดิมไว้เมื่อย้ายจาก 1.0 ไปเป็น 2.0 — การปรับปรุงโมเดลในราคาคงที่ — และ MAI-Transcribe-2 ของ Microsoft เปิดตัวที่ราคาเดียวกันคือ $0.10 ต่อชั่วโมงเสียง ซึ่งบอกคุณว่าราคาพื้นสุดของแนวหน้าอยู่ตรงไหน หากคุณกำหนดเส้นทางผ่าน OrcaRouter ราคาตามรายการเหล่านั้นจะถูกส่งผ่านโดยไม่มีการบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายลดราคา การลดนั้นจะไปถึงบิลของคุณในวันที่เกิดขึ้น ไม่ใช่หลังรอบการปรับราคา นั่นเป็นข้อได้เปรียบที่แท้จริงของฝั่งเช่าใช้ในการเปรียบเทียบนี้ และควรค่าแก่การนำมาชั่งน้ำหนักกับข้อเท็จจริงที่ว่าฝั่งฟรีไม่เคยส่งใบแจ้งหนี้ให้คุณเลย

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard showing Whisper Large v3 at 4.07% AA-WER and 118.9x real time at $1.15 per 1,000 minutes, alongside the cheaper hosted Whisper endpoints and the frontier rows for comparison.

แต่ละอย่างจริงๆ แล้วใช้ทำอะไร

ใช้ Whisper Large v3 Turbo ต่อไปเมื่อเสียงเป็นไฟล์อยู่แล้ว ปริมาณสูงหรือไม่สม่ำเสมอ การบันทึกค่อนข้างสะอาด และไม่ว่าข้อมูลจะออกจากเครือข่ายของคุณไม่ได้ หรืองบประมาณจะรับค่าบริการรายชั่วโมงไม่ไหว มันยังคงเป็นตัวเลือกที่ถูกต้องสำหรับคลังเก็บออฟไลน์ การถอดความที่ edge และบนอุปกรณ์ ซึ่งโมเดลขนาด 1.6 GB ถูกควอนไทซ์ให้เล็กลงจนพอดี ไปป์ไลน์แบบแบตช์ที่ปริมาณงานเป็นข้อจำกัดมากกว่าความหน่วง และโปรเจกต์ใดก็ตามที่การไฟน์ทูนบนเสียงของคุณเองเป็นเส้นทางสู่ความแม่นยำที่คุณต้องการ เครื่องมือรอบๆ มัน — whisper.cpp สำหรับ edge, faster-whisper สำหรับโปรดักชัน, บิลด์ GGUF สำหรับหน่วยความจำที่จำกัด — มีการเสริมความแข็งแรงโดยชุมชนมาสองปี ซึ่งเป็นรูปแบบหนึ่งของความน่าเชื่อถือที่ API อายุสองวันไม่มี

ย้ายไปที่ Grok Voice Transcribe 2.0 เมื่อเสียงยังคงมาถึง เมื่อการบันทึกเสื่อมคุณภาพ เมื่อคุณจำเป็นต้องรู้ว่าใครพูดและเมื่อใด เมื่อคำศัพท์เฉพาะทางต้องถูกปรับเอียงแทนที่จะปรับละเอียด หรือเมื่อแอปพลิเคชันดำเนินการกับข้อความถอดเสียงบางส่วนก่อนที่ผู้พูดจะพูดจบ เส้นทางการอัปเกรดคือพารามิเตอร์เดียวบนการผสานรวมที่มีอยู่ และการปักกลับไปที่ 1.0 หากเกิดข้อผิดพลาด ซึ่งทำให้การทดลองมีค่าใช้จ่ายต่ำ น่าสังเกตว่าการย้ายกลับไม่ใช่เรื่องถูก: โค้ดที่เขียนขึ้นสำหรับ API แบบสตรีมมิ่งที่มีการแยกผู้พูดและการตรวจจับการเปลี่ยนรอบไม่ได้ลดระดับลงอย่างราบรื่นเป็นโมเดลแบบแบตช์ที่ส่งคืนข้อความธรรมดา ซึ่งเป็นข้อโต้แย้งในการพิสูจน์เส้นทางที่โฮสต์ไว้บนตัวอย่างเสียงจริงของคุณก่อนที่จะมอบไปป์ไลน์ให้กับมัน

Screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models, showing the browsable list of routed models and vendors that sit behind a single OrcaRouter API key.

ที่ซึ่งการตัดสินใจเกิดขึ้นจริง

ทีมส่วนใหญ่ที่รัน Whisper ในทุกระดับไม่ได้เลือกอย่างใดอย่างหนึ่งระหว่างสองโมเดลนี้ แต่ใช้แบบไฮบริด: Whisper สำหรับงานจัดเก็บ เพราะฟรีและดีพอสำหรับเสียงที่สะอาด, API ของโมเดลระดับแนวหน้าสำหรับเส้นทางสด เพราะไม่มีอย่างอื่นที่สตรีมได้ที่ partial WER 3.4%, และโมเดลที่สามในปลายทางที่สรุป จัดหมวดหมู่ หรือลงมือทำกับข้อความใดก็ตามที่ได้ออกมา ขั้นตอนที่สามนี้คือจุดที่ความพะรุงพะรังมักเกิดขึ้น — สัญญาผู้ให้บริการรายที่สองสำหรับโมเดลให้เหตุผล ชุดข้อมูลรับรองชุดที่สอง ขีดจำกัดอัตราการเรียกใช้งานชุดที่สองที่ต้องคอยเฝ้าดู OrcaRouter ยุบรวมเลเยอร์นั้น: คีย์เดียวใช้ได้กับ 200+ โมเดล, การสลับไปใช้ตัวสำรองอัตโนมัติเมื่อผู้ให้บริการมีประสิทธิภาพลดลง, และ routing DSL หากคุณต้องการส่งถอดความเดียวกันผ่านหลายโมเดลแล้วเปรียบเทียบก่อนเลือก การเรียกถอดเสียงเองยังคงไปยังผู้ให้บริการที่คุณเลือก; สิ่งที่หยุดเพิ่มจำนวนคือทุกอย่างหลังจากนั้น

สิ่งที่ต้องจับตาฝั่ง Whisper ไม่ใช่ checkpoint ใหม่ — ตระกูลนี้ไม่มีการขยับเลยตั้งแต่ Turbo และความสนใจของ OpenAI ก็หันไปที่สาย GPT Transcribe แล้ว สิ่งที่ต้องจับตาคือเลเยอร์การให้บริการ (serving layer) ทุกปีเครื่องมือแบบ self-hosted จะเร็วขึ้นและฮาร์ดแวร์ที่ต้องใช้ก็เล็กลง และทุกการปรับปรุงตรงนั้นยิ่งทำให้เหตุผลในการจ่ายรายชั่วโมงแคบลง สิ่งที่ต้องจับตาฝั่ง SpaceXAI คือการสลับค่าเริ่มต้น: เมื่อ 2.0 กลายเป็นค่าเริ่มต้นและ 1.0 ถูกเลิกใช้ ทุกการผสานรวมที่ไม่ได้ระบุชื่อโมเดลไว้จะย้ายพร้อมกันในทันที รวมถึง latency ด้วย ไม่มีพัฒนาการใดในสองเรื่องนี้ที่เปลี่ยนความแตกแยกพื้นฐาน โมเดลหนึ่งที่คุณเป็นเจ้าของและปรับแต่งเอง กับอีกโมเดลหนึ่งที่คุณเช่าและเรียกใช้ และคำตอบที่ตรงไปตรงมาคือสแตกโปรดักชันส่วนใหญ่สุดท้ายก็รันทั้งสองแบบ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube