การ์ดหลักของบทความที่ระบุว่า 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2' พร้อมป้าย 'MODEL COMPARISON' และคำบรรยายย่อย 'Two lanes, not two rivals' โดยมีชิปที่ระบุว่า 3.4% กับไม่มี SKU แบบสตรีมมิ่ง, 2.29% กับ 2.04% WER แบบแบตช์, 162x กับ 333x เรียลไทม์ และ 1.67 ดอลลาร์ต่อ 1,000 นาทีต่อรายการ บนพื้นหลังไล่ระดับสีขาวไปน้ำเงินพร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Grok Voice Transcribe 2.0 กับ MAI Transcribe 2: สองเส้นทาง ไม่ใช่สองคู่แข่ง

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

โมเดลทั้งสองนี้เปิดตัวห่างกัน 15 วัน และตั้งราคาเท่ากันทุกเซนต์ แต่แทบจะไม่มีทางที่ทั้งคู่จะอยู่ในกระบวนการตัดสินใจจัดซื้อเดียวกัน Grok Voice Transcribe 2.0 ซึ่ง SpaceXAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 คือโมเดลที่คุณเรียกใช้เมื่อเสียงยังคงสตรีมเข้ามา — มันสตรีมผ่าน WebSocket ส่งผลลัพธ์ชั่วคราวประมาณทุก ๆ 500 มิลลิวินาที และครองอันดับสูงสุดบนกระดาน AA-WER Streaming ของ Artificial Analysis ด้วยอัตราความผิดพลาดระดับคำ 2.7% สำหรับข้อความถอดเสียงขั้นสุดท้าย และ 3.4% สำหรับผลลัพธ์บางส่วนครั้งแรก MAI-Transcribe-2 ซึ่ง Microsoft AI เปิดตัวเมื่อวันที่ 3 กันยายน 2026 คือโมเดลที่คุณเรียกใช้เมื่อเสียงกลายเป็นไฟล์แล้ว — มันรองรับเฉพาะแบบแบตช์ และบนกระดานแบบไม่สตรีมของ Artificial Analysis มันเป็นโมเดล managed ที่แม่นยำที่สุดที่วัดได้ที่ 2.04% AA-WER เหนือกว่า Grok Voice Transcribe 2.0 ที่ 2.29% และเร็วกว่าในด้านอัตราการประมวลผลประมาณ 2 เท่า ทั้งคู่มีราคาตามประกาศที่ $0.10 ต่อชั่วโมงเสียง หรือประมาณ $1.67 ต่อ 1,000 นาที หากความต้องการของคุณคือแบบเรียลไทม์ ก็ไม่มีการเปรียบเทียบใด ๆ ที่ต้องทำ หากความต้องการของคุณคือไฟล์ ก็ต้องเปรียบเทียบ

เส้นที่ไม่มีผู้ขายรายใดจะขีดให้คุณ

การรองรับสตรีมมิ่งไม่ใช่เพียงฟีเจอร์ที่เปิดปิดได้ Grok Voice Transcribe 2.0 ให้บริการโมเดลเดียวกันผ่าน REST สำหรับไฟล์ที่บันทึกไว้ และผ่าน `wss://api.x.ai/v1/stt` สำหรับเสียงสด ดังนั้นความแม่นยำที่คุณวัดได้จากคลังไฟล์ของคุณก็คือความแม่นยำที่คุณจะได้ในการสนทนาสด MAI-Transcribe-2 ไม่มี SKU สำหรับสตรีมมิ่งเลยแม้แต่ตัวเดียว สื่อเปิดตัวของไมโครซอฟต์วางตำแหน่งโมเดลนี้ไว้อย่างชัดเจนสำหรับเสียงแบบยาวและแบบแบตช์ และแม้ว่าโมเดลการ์ดจะระบุการใส่คำบรรยายแบบเรียลไทม์ไว้ในบรรดาสถานการณ์การใช้งาน แต่เส้นทางที่จะไปถึงจุดนั้นคือการแบ่งเสียงออกเป็นเซกเมนต์แล้วป้อนแต่ละเซกเมนต์ผ่าน API แบบแบตช์ ซึ่งเป็นไปป์ไลน์ที่คุณต้องสร้างและดูแลเอง ไม่ใช่การรับประกันความหน่วงที่คุณซื้อได้ อัตราทรูพุตที่ไมโครซอฟต์ยกเป็นจุดขายที่ราว 411 เท่าของเวลาจริงนั้นเป็นตัวเลขความเร็วในการประมวลผล ไม่ใช่ตัวเลขเวลาตอบสนอง และสองสิ่งนี้มักถูกนำมาปนกันอยู่เสมอในการรายงานข่าวเกี่ยวกับการเปิดตัวครั้งนี้

ผลในทางปฏิบัติ: หากคุณกำลังสร้างวอยซ์เอเจนต์ที่ผลัดกันพูด คำบรรยายสด หรือสิ่งใดก็ตามที่มนุษย์หรือโมเดลตอบสนองต่อคำพูดที่กำลังดำเนินอยู่ MAI-Transcribe-2 ก็ไม่ใช่ตัวเลือก ไม่ว่าความแม่นยำของมันจะดีแค่ไหนก็ตาม หากคุณกำลังถอดเสียงการประชุมย้อนหลัง บันทึกจากศูนย์บริการลูกค้าข้ามคืน คลังสื่อ หรืองานค้างด้านการปฏิบัติตามกฎระเบียบ การสตรีมมิ่งถือเป็นภาระที่ไม่มีประโยชน์ และตัวเลขแบบแบตช์คือเรื่องทั้งหมด

จุดที่ MAI-Transcribe-2 เหนือกว่าอย่างแท้จริง

ความแม่นยำบนไฟล์ก่อน ช่องว่างระหว่าง 2.04% กับ 2.29% วัดบนชุดทดสอบอิสระเดียวกัน คือ AA-WER v2 ของ Artificial Analysis ซึ่งประกอบด้วย AA-AgentTalk 50% และ VoxPopuli กับ Earnings22 อย่างละ 25% จึงทำให้เป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบนี้ มันเป็นความต่าง 0.25 จุด หรือข้อผิดพลาดน้อยลงประมาณ 2.5 ครั้งต่อ 1,000 คำ ว่าเรื่องนี้จะสำคัญหรือไม่นั้น ขึ้นอยู่กับว่าคุณใช้บทถอดเสียงทำอะไร สำหรับคลังเอกสารที่ค้นหาได้ มันไม่สำคัญ และสำหรับบันทึกทางกฎหมายหรือทางการแพทย์ มันอาจสำคัญ

ปริมาณงาน ประการที่สอง และมากกว่าช่องว่างด้านความแม่นยำ: 333× เวลาจริง เทียบกับ 162× ของ Grok Voice Transcribe 2.0 ทั้งสองตัวเลขเป็นผลการวัดของ Artificial Analysis จากวินาทีของเสียงอินพุตที่ถอดเป็นข้อความได้ต่อวินาที ไม่ใช่คำกล่าวอ้างของผู้ขาย ด้วยอัตรานั้น คลังเก็บเสียงหนึ่งพันชั่วโมงจะประมวลผลเสร็จในเวลาคอมพิวต์ประมาณสามชั่วโมงบนโมเดลของ Microsoft และประมาณหกชั่วโมงบนโมเดลของ SpaceXAI สำหรับการโยกย้ายแบบครั้งเดียว สิ่งนี้ไม่สำคัญ แต่สำหรับไปป์ไลน์ที่รับข้อมูลเข้าอย่างต่อเนื่อง เวลานาฬิกาที่ลดลงครึ่งหนึ่งถือเป็นความแตกต่างด้านความจุที่แท้จริง

ความครอบคลุมภาษา เป็นข้อที่สาม Microsoft ระบุ 60 ภาษาที่มีการตรวจจับอัตโนมัติ การสลับรหัสภายในบันทึกเสียงเดียวกัน และอัตราคำผิดพลาดเฉลี่ย 5.2% สำหรับภาษาเหล่านั้นบน FLEURS — เป็นตัวเลขที่ผู้ขายรายงาน ไม่ได้ถูกทำซ้ำโดยอิสระ แต่อย่างน้อยก็อธิบายกรณีหลายภาษาภายในรายการภาษาที่ระบุไว้ SpaceXAI ระบุหลายสิบภาษา โดยมีการสลับกลางบันทึกเสียงและการจัดรูปแบบรูปเขียนครอบคลุม 25 ภาษา หากเสียงของคุณอยู่นอกชุดภาษาที่ครอบคลุมดีอย่างภาษาอังกฤษและภาษายุโรปหลัก ตัวเลข FLEURS ให้ข้อมูลมากกว่าลีดเดอร์บอร์ดที่ถ่วงน้ำหนักไปทางภาษาอังกฤษและเต็มไปด้วยเสียงพูดของเอเจนต์

ความแตกต่างอีกสองประการที่มีนัยสำคัญในเชิงปฏิบัติการ MAI-Transcribe-2 มีรูปแบบการถอดเสียงที่กำหนดค่าได้ ได้แก่ แบบคำต่อคำ (verbatim) ซึ่งคงความไม่ราบรื่นของคำพูดไว้ เทียบกับแบบสะอาด (clean) ซึ่งตัดสิ่งเหล่านั้นออก ในขณะที่ Grok Voice Transcribe 2.0 จัดการปัญหาเดียวกันด้วยแฟล็กการลบคำเติม และโมเดลของ Microsoft อยู่ในช่วงพับลิกพรีวิวบน Microsoft Foundry ซึ่งหมายความว่าไม่มี SLA และมีคำแนะนำที่ยังคงมีผลให้หลีกเลี่ยงการใช้งานในโปรดักชันจนกว่าจะพร้อมใช้งานทั่วไป (GA) ส่วนโมเดลของ SpaceXAI พร้อมใช้งานทั่วไปแล้ว โดยมีขีดจำกัดอัตราที่เผยแพร่ไว้ที่ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งพร้อมกันต่อทีม

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs MAI Transcribe 2 — the scoreboard': the left column gives Grok Voice Transcribe 2.0 WebSocket streaming with 500ms interim results, 2.29% batch WER, 162x real time throughput, $1.67 per 1,000 minutes, included diarization and general availability; the right column gives MAI Transcribe 2 no announced streaming, 2.04%, 333x, a $1.67 launch offer, included diarization and public preview with no SLA.

จุดที่ Grok Voice Transcribe 2.0 เหนือกว่าอย่างแท้จริง

• การสตรีมแบบเรียลไทม์ — ปลายทาง WebSocket ที่มีผลลัพธ์ชั่วคราวทุก ๆ ~500 มิลลิวินาที เทียบกับแบบแบตช์เท่านั้นที่ไม่มีการประกาศ SKU แบบเรียลไทม์

• ความแม่นยำของทรานสคริปต์บางส่วนครั้งแรก — WER 3.4% ที่ 0.49 วินาที บน AA-WER Streaming ซึ่งเป็นหมวดหมู่ที่ MAI-Transcribe-2 ไม่ได้ลงแข่งขัน

• ความแม่นยำแบบแบตช์บนเสียงพูดคุยของเอเจนต์ — โดยรวม 2.29% แต่บนชุดย่อย AA-AgentTalk ของบอร์ดแบบไม่สตรีมมิง การจัดอันดับนั้นเบียดกันแน่นกว่าที่พาดหัวบ่งชี้ และบนมิกซ์ที่เน้นเอเจนต์ของบอร์ดสตรีมมิง Grok นำอย่างชัดเจน

• โครงสร้างพื้นฐานของ voice agent — การตรวจจับการสิ้นสุดช่วงคำพูด (end-of-turn) ด้วย Smart Turn และการตัดคำฟุ่มเฟือย มาพร้อมอยู่ในโมเดล ขณะที่ MAI-Transcribe-2 ปล่อยตรรกะการจัดการช่วงคำพูดให้ผู้เรียกเป็นผู้จัดการเอง

• เสียงหลายช่องสัญญาณ — ถอดเสียงได้สูงสุด 8 ช่องสัญญาณอิสระในครั้งเดียว ซึ่งสำคัญสำหรับการบันทึกเสียงแบบสเตอริโอหรือการสนทนาที่มีหลายช่วง

• ความเชื่อมั่นระดับคำ — การประทับเวลามีคะแนนความเชื่อมั่นต่อคำ ดังนั้นช่วงที่มีความเชื่อมั่นต่ำจึงสามารถถูกทำเครื่องหมายได้ แทนที่จะถูกเชื่อถือเท่ากัน

• ข้อกำหนดด้านความพร้อมใช้งาน — พร้อมใช้งานทั่วไปโดยมีขีดจำกัดการทำงานพร้อมกันที่เผยแพร่แล้ว เทียบกับพับลิกพรีวิวที่ไม่มี SLA

• ความคงทนของราคา — $0.10 ต่อชั่วโมงเป็นอัตราคงที่สำหรับทั้งแบบแบตช์และเป็นฐานสำหรับระดับสตรีมมิ่งที่ $0.20 โดยที่ราคา $0.10 ที่เหมือนกันของ Microsoft เป็นข้อเสนอเปิดตัวแบบจำกัดเวลาซึ่งไม่มีอัตรามาตรฐานที่ประกาศไว้สำหรับปี 2027

ประเด็นสุดท้ายนี้คือสิ่งที่การเปรียบเทียบส่วนใหญ่ข้ามไป โมเดลทั้งสองมีค่าใช้จ่ายเท่ากันในวันนี้ และราคาหนึ่งในนั้นมีวันหมดอายุ แต่อีกราคาไม่มี Microsoft ยังไม่เปิดเผยอัตราค่าบริการหลังโปรโมชัน และการรายงานข่าวก็ขัดแย้งกันว่าข้อเสนอนี้ใช้ไปจนถึงสิ้นปี 2026 หรือไม่มีกำหนดสิ้นสุดที่ระบุไว้เลย หากคุณกำลังสร้างแบบจำลองงบประมาณการถอดเสียงสำหรับสามปีจากราคา $1.67 ต่อ 1,000 นาทีของ Microsoft คุณกำลังสร้างแบบจำลองจากตัวเลขที่ผู้ขายยังไม่ได้ให้คำมั่นไว้

Screenshot of the Artificial Analysis non-streaming speech-to-text leaderboard, showing MAI-Transcribe-2 at 2.04% AA-WER and 333x real time, Grok Voice Transcribe 2.0 at 2.29% and 161.77x, Gemini 3.5 Transcribe at 2.60%, GPT Transcribe at 3.31% and Whisper Large v3 at 4.07%.

ความทับซ้อนนั้นมีอยู่จริง และมันคือส่วนใหญ่ของรายการฟีเจอร์

หากไม่พิจารณาคำถามเรื่องสตรีมมิ่ง ผลิตภัณฑ์ทั้งสองก็มีความคล้ายคลึงกันอย่างมาก ทั้งคู่ทำการแยกแยะผู้พูด ทั้งคู่ส่งคืนการประทับเวลาระดับคำ ทั้งคู่จัดการการปรับข้อความผกผัน — ตัวเลข วันที่ สกุลเงิน รายละเอียดการติดต่อที่แสดงในรูปแบบเขียน ทั้งคู่รองรับคำศัพท์เฉพาะทาง โดย Grok Voice Transcribe 2.0 รองรับคำสำคัญสูงสุด 100 คำต่อคำขอ และ MAI-Transcribe-2 รองรับรายการคำศัพท์เฉพาะทางและคำย่อ ทั้งคู่ตรวจจับภาษาโดยอัตโนมัติและติดตามผู้พูดที่สลับภาษาระหว่างการบันทึก ทั้งคู่จัดการเสียงโทรศัพท์ 8 kHz ซึ่งเป็นกรณีที่โมเดลถอดเสียงส่วนใหญ่ล้มเหลวแบบเงียบ ๆ และเป็นจุดที่ SpaceXAI ปรับแต่งอย่างหนักที่สุด — ชุดข้อมูลโทรศัพท์ภายในของบริษัทลดลงจาก 10.6% เป็น 7.1% WER ระหว่างเวอร์ชัน ซึ่งเป็นตัวเลขที่บริษัทรายงานจากเสียงของบริษัทเอง

ทั้งคู่ยังมีขีดจำกัดด้านอินพุตที่กำหนดรูปแบบสถาปัตยกรรม มากกว่าจะเป็นเพียงเรื่องของงบประมาณ Grok Voice Transcribe 2.0 รองรับไฟล์ขนาดไม่เกิน 500 MB ครอบคลุม 12 รูปแบบเสียง โดยมีอัตราสุ่มตัวอย่างตั้งแต่ 8 kHz ถึง 48 kHz ขีดจำกัดของ MAI-Transcribe-2 ถูกกำหนดโดยเส้นทาง Foundry มากกว่าตัวโมเดล และทีมต่าง ๆ ควรอ่านเอกสารของ Microsoft เองสำหรับเพดานปัจจุบัน แทนที่จะสันนิษฐานว่าทัดเทียมกับบริการ STT เฉพาะทาง

ความหมายของการลู่เข้าแบบนั้นก็คือ การตัดสินใจลดลงเหลือสามคำถามตามลำดับ: จำเป็นต้องใช้งานแบบสดหรือไม่ คุณมีภาษาจำนวนเท่าไรจริง ๆ และช่องว่างด้านความแม่นยำทำให้คุณต้องเสียต้นทุนมากแค่ไหน คำถามแรกเป็นแบบสองทางเลือกและตัดตัวเลือกหนึ่งออกไปเลย คำถามที่สองมักตอบได้จากตัวอย่างเสียงของคุณเอง คำถามที่สามเล็กพอที่สำหรับงานที่อิงไฟล์ส่วนใหญ่แล้วมันจะไม่ได้เป็นตัวตัดสินอะไร — ช่องว่าง 0.25 จุดนั้นมีจริง แต่ข้อเท็จจริงที่ว่าโมเดลทั้งสองอยู่ในระยะห่างครึ่งจุดจากตัวเลขที่ดีที่สุดที่ใคร ๆ เคยวัดได้ก็มีจริงเช่นกัน

Screenshot of the Microsoft learn.microsoft.com MAI-Transcribe-2 model page, showing the September 3 2026 launch, the 60-language list with automatic detection and code-switching, the 5.2% FLEURS word error rate, the configurable verbatim and clean transcription styles, and the public-preview availability on Microsoft Foundry.

จะทำอะไรกับสิ่งนี้ดี

มองสองสิ่งนี้เป็นสแต็กแบบสองเลน มากกว่าจะเป็นการดวลแบบตัวต่อตัว ศูนย์ติดต่อที่เดินระบบช่วยเหลือเอเจนต์แบบเรียลไทม์และคลังเก็บข้อมูลด้านการปฏิบัติตามข้อกำหนดข้ามคืน ไม่ได้กำลังเลือกระหว่าง Grok Voice Transcribe 2.0 กับ MAI-Transcribe-2 — แต่กำลังใช้ทั้งสองตัว และคำถามเดียวคือการทำเช่นนั้นทำให้ต้องแลกกับความสัมพันธ์กับผู้ขายสองราย ชุดข้อมูลรับรองสองชุด ใบแจ้งหนี้สองใบ และขีดจำกัดอัตราการเรียกใช้งานสองชุดหรือไม่ วันนี้ไม่มีโมเดลใดอยู่ในแค็ตตาล็อกของ OrcaRouter ดังนั้นการเรียกถอดเสียงจึงไปที่ API ของผู้ขายแต่ละรายเอง สิ่งที่คีย์ OrcaRouter หนึ่งคีย์ครอบคลุมคือทุกอย่างที่ปลายน้ำ: ตัวสรุป ตัวจำแนกประเภท เอเจนต์ที่ใช้เหตุผลเหนือข้อความถอดเสียง และงานประเมินผลที่เปรียบเทียบเอาต์พุตของผู้ขายสองรายบนบันทึกเสียงเดียวกัน ตัวสุดท้ายนี่แหละคือเหตุผลที่ต้องให้ความสำคัญ — คุณตัดสินใจเลือกระหว่างโมเดลเหล่านี้จากลีดเดอร์บอร์ดไม่ได้ เพราะลีดเดอร์บอร์ดคือบทสนทนาของเอเจนต์ภาษาอังกฤษแปดชั่วโมง และเสียงของคุณไม่ใช่แบบนั้น

จับตาสองเรื่อง เรื่องแรกคือ Microsoft จะกำหนดราคามาตรฐานให้ MAI-Transcribe-2 หรือไม่เมื่อข้อเสนอเปิดตัวสิ้นสุดลง หากราคาคงที่ $1.67 ต่อ 1,000 นาที ก็จะทำให้มันเป็นตัวเลือกเริ่มต้นสำหรับงานแบบแบตช์ด้วยเหตุผลด้านต้นทุนเพียงอย่างเดียว และหากกลับไปสู่ราคา $0.36 ต่อชั่วโมงของ MAI-Transcribe-1 บทสนทนานี้ก็จะสั้นลงมาก เรื่องที่สองคือ Microsoft จะออก SKU สำหรับสตรีมมิงหรือไม่ การ์ดโมเดลระบุถึงการสร้างคำบรรยายแบบเรียลไทม์เป็นสถานการณ์เป้าหมายอยู่แล้ว และสิ่งเดียวที่กั้นระหว่าง MAI-Transcribe-2 กับช่องทางสตรีมมิงก็คือ endpoint — ถ้าสิ่งนั้นลงตัว สองสิ่งนี้จะเลิกเป็นช่องทางแยกกันและเริ่มเป็นคู่แข่งกัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube