
Grok Voice Transcribe 2.0 กับ MAI Transcribe 2: สองเส้นทาง ไม่ใช่สองคู่แข่ง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
โมเดลทั้งสองนี้เปิดตัวห่างกัน 15 วัน และตั้งราคาเท่ากันทุกเซนต์ แต่แทบจะไม่มีทางที่ทั้งคู่จะอยู่ในกระบวนการตัดสินใจจัดซื้อเดียวกัน Grok Voice Transcribe 2.0 ซึ่ง SpaceXAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 คือโมเดลที่คุณเรียกใช้เมื่อเสียงยังคงสตรีมเข้ามา — มันสตรีมผ่าน WebSocket ส่งผลลัพธ์ชั่วคราวประมาณทุก ๆ 500 มิลลิวินาที และครองอันดับสูงสุดบนกระดาน AA-WER Streaming ของ Artificial Analysis ด้วยอัตราความผิดพลาดระดับคำ 2.7% สำหรับข้อความถอดเสียงขั้นสุดท้าย และ 3.4% สำหรับผลลัพธ์บางส่วนครั้งแรก MAI-Transcribe-2 ซึ่ง Microsoft AI เปิดตัวเมื่อวันที่ 3 กันยายน 2026 คือโมเดลที่คุณเรียกใช้เมื่อเสียงกลายเป็นไฟล์แล้ว — มันรองรับเฉพาะแบบแบตช์ และบนกระดานแบบไม่สตรีมของ Artificial Analysis มันเป็นโมเดล managed ที่แม่นยำที่สุดที่วัดได้ที่ 2.04% AA-WER เหนือกว่า Grok Voice Transcribe 2.0 ที่ 2.29% และเร็วกว่าในด้านอัตราการประมวลผลประมาณ 2 เท่า ทั้งคู่มีราคาตามประกาศที่ $0.10 ต่อชั่วโมงเสียง หรือประมาณ $1.67 ต่อ 1,000 นาที หากความต้องการของคุณคือแบบเรียลไทม์ ก็ไม่มีการเปรียบเทียบใด ๆ ที่ต้องทำ หากความต้องการของคุณคือไฟล์ ก็ต้องเปรียบเทียบ
เส้นที่ไม่มีผู้ขายรายใดจะขีดให้คุณ
การรองรับสตรีมมิ่งไม่ใช่เพียงฟีเจอร์ที่เปิดปิดได้ Grok Voice Transcribe 2.0 ให้บริการโมเดลเดียวกันผ่าน REST สำหรับไฟล์ที่บันทึกไว้ และผ่าน `wss://api.x.ai/v1/stt` สำหรับเสียงสด ดังนั้นความแม่นยำที่คุณวัดได้จากคลังไฟล์ของคุณก็คือความแม่นยำที่คุณจะได้ในการสนทนาสด MAI-Transcribe-2 ไม่มี SKU สำหรับสตรีมมิ่งเลยแม้แต่ตัวเดียว สื่อเปิดตัวของไมโครซอฟต์วางตำแหน่งโมเดลนี้ไว้อย่างชัดเจนสำหรับเสียงแบบยาวและแบบแบตช์ และแม้ว่าโมเดลการ์ดจะระบุการใส่คำบรรยายแบบเรียลไทม์ไว้ในบรรดาสถานการณ์การใช้งาน แต่เส้นทางที่จะไปถึงจุดนั้นคือการแบ่งเสียงออกเป็นเซกเมนต์แล้วป้อนแต่ละเซกเมนต์ผ่าน API แบบแบตช์ ซึ่งเป็นไปป์ไลน์ที่คุณต้องสร้างและดูแลเอง ไม่ใช่การรับประกันความหน่วงที่คุณซื้อได้ อัตราทรูพุตที่ไมโครซอฟต์ยกเป็นจุดขายที่ราว 411 เท่าของเวลาจริงนั้นเป็นตัวเลขความเร็วในการประมวลผล ไม่ใช่ตัวเลขเวลาตอบสนอง และสองสิ่งนี้มักถูกนำมาปนกันอยู่เสมอในการรายงานข่าวเกี่ยวกับการเปิดตัวครั้งนี้
ผลในทางปฏิบัติ: หากคุณกำลังสร้างวอยซ์เอเจนต์ที่ผลัดกันพูด คำบรรยายสด หรือสิ่งใดก็ตามที่มนุษย์หรือโมเดลตอบสนองต่อคำพูดที่กำลังดำเนินอยู่ MAI-Transcribe-2 ก็ไม่ใช่ตัวเลือก ไม่ว่าความแม่นยำของมันจะดีแค่ไหนก็ตาม หากคุณกำลังถอดเสียงการประชุมย้อนหลัง บันทึกจากศูนย์บริการลูกค้าข้ามคืน คลังสื่อ หรืองานค้างด้านการปฏิบัติตามกฎระเบียบ การสตรีมมิ่งถือเป็นภาระที่ไม่มีประโยชน์ และตัวเลขแบบแบตช์คือเรื่องทั้งหมด
จุดที่ MAI-Transcribe-2 เหนือกว่าอย่างแท้จริง
ความแม่นยำบนไฟล์ก่อน ช่องว่างระหว่าง 2.04% กับ 2.29% วัดบนชุดทดสอบอิสระเดียวกัน คือ AA-WER v2 ของ Artificial Analysis ซึ่งประกอบด้วย AA-AgentTalk 50% และ VoxPopuli กับ Earnings22 อย่างละ 25% จึงทำให้เป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบนี้ มันเป็นความต่าง 0.25 จุด หรือข้อผิดพลาดน้อยลงประมาณ 2.5 ครั้งต่อ 1,000 คำ ว่าเรื่องนี้จะสำคัญหรือไม่นั้น ขึ้นอยู่กับว่าคุณใช้บทถอดเสียงทำอะไร สำหรับคลังเอกสารที่ค้นหาได้ มันไม่สำคัญ และสำหรับบันทึกทางกฎหมายหรือทางการแพทย์ มันอาจสำคัญ
ปริมาณงาน ประการที่สอง และมากกว่าช่องว่างด้านความแม่นยำ: 333× เวลาจริง เทียบกับ 162× ของ Grok Voice Transcribe 2.0 ทั้งสองตัวเลขเป็นผลการวัดของ Artificial Analysis จากวินาทีของเสียงอินพุตที่ถอดเป็นข้อความได้ต่อวินาที ไม่ใช่คำกล่าวอ้างของผู้ขาย ด้วยอัตรานั้น คลังเก็บเสียงหนึ่งพันชั่วโมงจะประมวลผลเสร็จในเวลาคอมพิวต์ประมาณสามชั่วโมงบนโมเดลของ Microsoft และประมาณหกชั่วโมงบนโมเดลของ SpaceXAI สำหรับการโยกย้ายแบบครั้งเดียว สิ่งนี้ไม่สำคัญ แต่สำหรับไปป์ไลน์ที่รับข้อมูลเข้าอย่างต่อเนื่อง เวลานาฬิกาที่ลดลงครึ่งหนึ่งถือเป็นความแตกต่างด้านความจุที่แท้จริง
ความครอบคลุมภาษา เป็นข้อที่สาม Microsoft ระบุ 60 ภาษาที่มีการตรวจจับอัตโนมัติ การสลับรหัสภายในบันทึกเสียงเดียวกัน และอัตราคำผิดพลาดเฉลี่ย 5.2% สำหรับภาษาเหล่านั้นบน FLEURS — เป็นตัวเลขที่ผู้ขายรายงาน ไม่ได้ถูกทำซ้ำโดยอิสระ แต่อย่างน้อยก็อธิบายกรณีหลายภาษาภายในรายการภาษาที่ระบุไว้ SpaceXAI ระบุหลายสิบภาษา โดยมีการสลับกลางบันทึกเสียงและการจัดรูปแบบรูปเขียนครอบคลุม 25 ภาษา หากเสียงของคุณอยู่นอกชุดภาษาที่ครอบคลุมดีอย่างภาษาอังกฤษและภาษายุโรปหลัก ตัวเลข FLEURS ให้ข้อมูลมากกว่าลีดเดอร์บอร์ดที่ถ่วงน้ำหนักไปทางภาษาอังกฤษและเต็มไปด้วยเสียงพูดของเอเจนต์
ความแตกต่างอีกสองประการที่มีนัยสำคัญในเชิงปฏิบัติการ MAI-Transcribe-2 มีรูปแบบการถอดเสียงที่กำหนดค่าได้ ได้แก่ แบบคำต่อคำ (verbatim) ซึ่งคงความไม่ราบรื่นของคำพูดไว้ เทียบกับแบบสะอาด (clean) ซึ่งตัดสิ่งเหล่านั้นออก ในขณะที่ Grok Voice Transcribe 2.0 จัดการปัญหาเดียวกันด้วยแฟล็กการลบคำเติม และโมเดลของ Microsoft อยู่ในช่วงพับลิกพรีวิวบน Microsoft Foundry ซึ่งหมายความว่าไม่มี SLA และมีคำแนะนำที่ยังคงมีผลให้หลีกเลี่ยงการใช้งานในโปรดักชันจนกว่าจะพร้อมใช้งานทั่วไป (GA) ส่วนโมเดลของ SpaceXAI พร้อมใช้งานทั่วไปแล้ว โดยมีขีดจำกัดอัตราที่เผยแพร่ไว้ที่ 10 คำขอต่อวินาที และ 100 เซสชันสตรีมมิ่งพร้อมกันต่อทีม

จุดที่ Grok Voice Transcribe 2.0 เหนือกว่าอย่างแท้จริง
• การสตรีมแบบเรียลไทม์ — ปลายทาง WebSocket ที่มีผลลัพธ์ชั่วคราวทุก ๆ ~500 มิลลิวินาที เทียบกับแบบแบตช์เท่านั้นที่ไม่มีการประกาศ SKU แบบเรียลไทม์
• ความแม่นยำของทรานสคริปต์บางส่วนครั้งแรก — WER 3.4% ที่ 0.49 วินาที บน AA-WER Streaming ซึ่งเป็นหมวดหมู่ที่ MAI-Transcribe-2 ไม่ได้ลงแข่งขัน
• ความแม่นยำแบบแบตช์บนเสียงพูดคุยของเอเจนต์ — โดยรวม 2.29% แต่บนชุดย่อย AA-AgentTalk ของบอร์ดแบบไม่สตรีมมิง การจัดอันดับนั้นเบียดกันแน่นกว่าที่พาดหัวบ่งชี้ และบนมิกซ์ที่เน้นเอเจนต์ของบอร์ดสตรีมมิง Grok นำอย่างชัดเจน
• โครงสร้างพื้นฐานของ voice agent — การตรวจจับการสิ้นสุดช่วงคำพูด (end-of-turn) ด้วย Smart Turn และการตัดคำฟุ่มเฟือย มาพร้อมอยู่ในโมเดล ขณะที่ MAI-Transcribe-2 ปล่อยตรรกะการจัดการช่วงคำพูดให้ผู้เรียกเป็นผู้จัดการเอง
• เสียงหลายช่องสัญญาณ — ถอดเสียงได้สูงสุด 8 ช่องสัญญาณอิสระในครั้งเดียว ซึ่งสำคัญสำหรับการบันทึกเสียงแบบสเตอริโอหรือการสนทนาที่มีหลายช่วง
• ความเชื่อมั่นระดับคำ — การประทับเวลามีคะแนนความเชื่อมั่นต่อคำ ดังนั้นช่วงที่มีความเชื่อมั่นต่ำจึงสามารถถูกทำเครื่องหมายได้ แทนที่จะถูกเชื่อถือเท่ากัน
• ข้อกำหนดด้านความพร้อมใช้งาน — พร้อมใช้งานทั่วไปโดยมีขีดจำกัดการทำงานพร้อมกันที่เผยแพร่แล้ว เทียบกับพับลิกพรีวิวที่ไม่มี SLA
• ความคงทนของราคา — $0.10 ต่อชั่วโมงเป็นอัตราคงที่สำหรับทั้งแบบแบตช์และเป็นฐานสำหรับระดับสตรีมมิ่งที่ $0.20 โดยที่ราคา $0.10 ที่เหมือนกันของ Microsoft เป็นข้อเสนอเปิดตัวแบบจำกัดเวลาซึ่งไม่มีอัตรามาตรฐานที่ประกาศไว้สำหรับปี 2027
ประเด็นสุดท้ายนี้คือสิ่งที่การเปรียบเทียบส่วนใหญ่ข้ามไป โมเดลทั้งสองมีค่าใช้จ่ายเท่ากันในวันนี้ และราคาหนึ่งในนั้นมีวันหมดอายุ แต่อีกราคาไม่มี Microsoft ยังไม่เปิดเผยอัตราค่าบริการหลังโปรโมชัน และการรายงานข่าวก็ขัดแย้งกันว่าข้อเสนอนี้ใช้ไปจนถึงสิ้นปี 2026 หรือไม่มีกำหนดสิ้นสุดที่ระบุไว้เลย หากคุณกำลังสร้างแบบจำลองงบประมาณการถอดเสียงสำหรับสามปีจากราคา $1.67 ต่อ 1,000 นาทีของ Microsoft คุณกำลังสร้างแบบจำลองจากตัวเลขที่ผู้ขายยังไม่ได้ให้คำมั่นไว้

ความทับซ้อนนั้นมีอยู่จริง และมันคือส่วนใหญ่ของรายการฟีเจอร์
หากไม่พิจารณาคำถามเรื่องสตรีมมิ่ง ผลิตภัณฑ์ทั้งสองก็มีความคล้ายคลึงกันอย่างมาก ทั้งคู่ทำการแยกแยะผู้พูด ทั้งคู่ส่งคืนการประทับเวลาระดับคำ ทั้งคู่จัดการการปรับข้อความผกผัน — ตัวเลข วันที่ สกุลเงิน รายละเอียดการติดต่อที่แสดงในรูปแบบเขียน ทั้งคู่รองรับคำศัพท์เฉพาะทาง โดย Grok Voice Transcribe 2.0 รองรับคำสำคัญสูงสุด 100 คำต่อคำขอ และ MAI-Transcribe-2 รองรับรายการคำศัพท์เฉพาะทางและคำย่อ ทั้งคู่ตรวจจับภาษาโดยอัตโนมัติและติดตามผู้พูดที่สลับภาษาระหว่างการบันทึก ทั้งคู่จัดการเสียงโทรศัพท์ 8 kHz ซึ่งเป็นกรณีที่โมเดลถอดเสียงส่วนใหญ่ล้มเหลวแบบเงียบ ๆ และเป็นจุดที่ SpaceXAI ปรับแต่งอย่างหนักที่สุด — ชุดข้อมูลโทรศัพท์ภายในของบริษัทลดลงจาก 10.6% เป็น 7.1% WER ระหว่างเวอร์ชัน ซึ่งเป็นตัวเลขที่บริษัทรายงานจากเสียงของบริษัทเอง
ทั้งคู่ยังมีขีดจำกัดด้านอินพุตที่กำหนดรูปแบบสถาปัตยกรรม มากกว่าจะเป็นเพียงเรื่องของงบประมาณ Grok Voice Transcribe 2.0 รองรับไฟล์ขนาดไม่เกิน 500 MB ครอบคลุม 12 รูปแบบเสียง โดยมีอัตราสุ่มตัวอย่างตั้งแต่ 8 kHz ถึง 48 kHz ขีดจำกัดของ MAI-Transcribe-2 ถูกกำหนดโดยเส้นทาง Foundry มากกว่าตัวโมเดล และทีมต่าง ๆ ควรอ่านเอกสารของ Microsoft เองสำหรับเพดานปัจจุบัน แทนที่จะสันนิษฐานว่าทัดเทียมกับบริการ STT เฉพาะทาง
ความหมายของการลู่เข้าแบบนั้นก็คือ การตัดสินใจลดลงเหลือสามคำถามตามลำดับ: จำเป็นต้องใช้งานแบบสดหรือไม่ คุณมีภาษาจำนวนเท่าไรจริง ๆ และช่องว่างด้านความแม่นยำทำให้คุณต้องเสียต้นทุนมากแค่ไหน คำถามแรกเป็นแบบสองทางเลือกและตัดตัวเลือกหนึ่งออกไปเลย คำถามที่สองมักตอบได้จากตัวอย่างเสียงของคุณเอง คำถามที่สามเล็กพอที่สำหรับงานที่อิงไฟล์ส่วนใหญ่แล้วมันจะไม่ได้เป็นตัวตัดสินอะไร — ช่องว่าง 0.25 จุดนั้นมีจริง แต่ข้อเท็จจริงที่ว่าโมเดลทั้งสองอยู่ในระยะห่างครึ่งจุดจากตัวเลขที่ดีที่สุดที่ใคร ๆ เคยวัดได้ก็มีจริงเช่นกัน

จะทำอะไรกับสิ่งนี้ดี
มองสองสิ่งนี้เป็นสแต็กแบบสองเลน มากกว่าจะเป็นการดวลแบบตัวต่อตัว ศูนย์ติดต่อที่เดินระบบช่วยเหลือเอเจนต์แบบเรียลไทม์และคลังเก็บข้อมูลด้านการปฏิบัติตามข้อกำหนดข้ามคืน ไม่ได้กำลังเลือกระหว่าง Grok Voice Transcribe 2.0 กับ MAI-Transcribe-2 — แต่กำลังใช้ทั้งสองตัว และคำถามเดียวคือการทำเช่นนั้นทำให้ต้องแลกกับความสัมพันธ์กับผู้ขายสองราย ชุดข้อมูลรับรองสองชุด ใบแจ้งหนี้สองใบ และขีดจำกัดอัตราการเรียกใช้งานสองชุดหรือไม่ วันนี้ไม่มีโมเดลใดอยู่ในแค็ตตาล็อกของ OrcaRouter ดังนั้นการเรียกถอดเสียงจึงไปที่ API ของผู้ขายแต่ละรายเอง สิ่งที่คีย์ OrcaRouter หนึ่งคีย์ครอบคลุมคือทุกอย่างที่ปลายน้ำ: ตัวสรุป ตัวจำแนกประเภท เอเจนต์ที่ใช้เหตุผลเหนือข้อความถอดเสียง และงานประเมินผลที่เปรียบเทียบเอาต์พุตของผู้ขายสองรายบนบันทึกเสียงเดียวกัน ตัวสุดท้ายนี่แหละคือเหตุผลที่ต้องให้ความสำคัญ — คุณตัดสินใจเลือกระหว่างโมเดลเหล่านี้จากลีดเดอร์บอร์ดไม่ได้ เพราะลีดเดอร์บอร์ดคือบทสนทนาของเอเจนต์ภาษาอังกฤษแปดชั่วโมง และเสียงของคุณไม่ใช่แบบนั้น
จับตาสองเรื่อง เรื่องแรกคือ Microsoft จะกำหนดราคามาตรฐานให้ MAI-Transcribe-2 หรือไม่เมื่อข้อเสนอเปิดตัวสิ้นสุดลง หากราคาคงที่ $1.67 ต่อ 1,000 นาที ก็จะทำให้มันเป็นตัวเลือกเริ่มต้นสำหรับงานแบบแบตช์ด้วยเหตุผลด้านต้นทุนเพียงอย่างเดียว และหากกลับไปสู่ราคา $0.36 ต่อชั่วโมงของ MAI-Transcribe-1 บทสนทนานี้ก็จะสั้นลงมาก เรื่องที่สองคือ Microsoft จะออก SKU สำหรับสตรีมมิงหรือไม่ การ์ดโมเดลระบุถึงการสร้างคำบรรยายแบบเรียลไทม์เป็นสถานการณ์เป้าหมายอยู่แล้ว และสิ่งเดียวที่กั้นระหว่าง MAI-Transcribe-2 กับช่องทางสตรีมมิงก็คือ endpoint — ถ้าสิ่งนั้นลงตัว สองสิ่งนี้จะเลิกเป็นช่องทางแยกกันและเริ่มเป็นคู่แข่งกัน
