การ์ดฮีโร่บทความที่อ่านว่า 'MAI-Transcribe-2 vs Muse Voice Transcribe' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำโปรย 'ในสัปดาห์เดียวกัน สองการเดิมพันที่ตรงข้ามกันเรื่องเสียง' พร้อมชิปเปรียบเทียบระหว่างแบบแบตช์ที่ 2.0% AA-WER กับสตรีมมิงที่ 3.1%, $1.67 กับ $3.00 ต่อ 1,000 นาที และ 60 ภาษาต่อแบตช์ กับผู้พูด 20+ รายแบบเรียลไทม์ บนพื้นไล่เฉดสีขาวถึงน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MAI-Transcribe-2 ปะทะ Muse Voice Transcribe: สัปดาห์เดียวกัน สองเดิมพันที่สวนทางกันเรื่องเสียง

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สัปดาห์ของวันที่ 1 กันยายน 2026 เกิดโมเดลเสียงพูดสองตัวจากห้องแล็บชั้นแนวหน้าสองแห่ง และ MAI-Transcribe-2 กับ Muse Voice Transcribe ควรทำความเข้าใจว่าเป็นคำตอบที่ตรงข้ามกันของคำถามที่ว่าปัญญาประมวลผลเสียงควรอยู่ตรงไหน Muse Voice Transcribe เปิดตัวโดย Meta Superintelligence Labs ในวันที่ 1 กันยายน เป็นโมเดลการรับรู้เสียงแบบเรียลไทม์: มันถอดเสียง แยกแยะผู้พูดมากกว่า 20 คน และตรวจจับเมื่อผู้พูดพูดจบ ทั้งหมดในรอบการประมวลผลแบบสตรีมมิ่งเพียงครั้งเดียวบนชิ้นส่วนเสียงสดขนาด 80 มิลลิวินาที และมันครองอันดับหนึ่งบนกระดานจัดอันดับการแปลงเสียงพูดเป็นข้อความแบบสตรีมมิ่งที่มันถูกวัดผล MAI-Transcribe-2 เปิดตัวโดย Microsoft ในอีกสองวันต่อมา คือวันที่ 3 กันยายน เป็นการเดิมพันที่ตรงกันข้าม: เอนจินแบบแบตช์ที่ไม่ไล่ตามความหน่วงแบบเรียลไทม์เลย แต่ทุ่มทุกอย่างไปที่การถอดไฟล์ที่บันทึกไว้ล่วงหน้าด้วยอัตราคำผิดที่ดีที่สุดบนกระดานจัดอันดับอิสระแบบไม่สตรีมมิ่ง ที่ความเร็วประมาณ 411 เท่าของเวลาจริง ในราคาประมาณ 1.67 ดอลลาร์ต่อ 1,000 นาที การเปรียบเทียบแบบตัวต่อตัวในฐานะ "โมเดลถอดเสียง" ปิดบังการตัดสินใจที่แท้จริง ซึ่งเกี่ยวกับช่วงเวลาในชีวิตของเสียงที่คุณต้องการคำพูด: ขณะที่มันกำลังเกิดขึ้น หรือหลังจากที่มันจบลงแล้ว

ผลิตภัณฑ์สองรายการชี้ไปยังช่วงเวลาที่ต่างกัน

Muse Voice Transcribe ถูกสร้างขึ้นมาสำหรับช่วงเวลาที่เสียงยังคงดำเนินอยู่ โดยเป็นโมเดล multimodal แบบ autoregressive ในตระกูล Muse ของ Meta ซึ่งรวมงานสามอย่างเข้าไว้ในการประมวลผลเพียงครั้งเดียว ได้แก่ การรู้จำเสียงพูดอัตโนมัติ การระบุผู้พูด (speaker diarization) สำหรับผู้พูดมากกว่า 20 คน และ endpointing ซึ่งก็คือการตรวจจับว่าผู้พูดหยุดพูดแล้วเพื่อให้ระบบสามารถตอบสนองได้ Meta รายงานว่าทรานสคริปต์ฉบับสุดท้ายจะถูกสร้างเสร็จภายในเวลาประมาณ 0.16 วินาทีหลังผู้พูดหยุดพูด โดยมีอัตราคำผิด 3.1% สำหรับทรานสคริปต์ฉบับสุดท้าย และ 3.6% สำหรับผลลัพธ์บางส่วนครั้งแรก (first partials) ซึ่งเป็นตัวเลขที่ Meta เผยแพร่ในวันเปิดตัว โดยอ้างอิงจากลีดเดอร์บอร์ดสตรีมมิงของ Artificial Analysis และยังไม่มีการตรวจสอบซ้ำอย่างอิสระ ณ เวลาที่เขียนบทความนี้ โมเดลนี้รองรับเสียงยาวเกินหนึ่งชั่วโมงในสตรีมเดียว สลับภาษากลางประโยคได้ และถูกฝึกด้วยภาษามากกว่า 70 ภาษา โดยมี 25 ภาษาที่ผ่านการตรวจสอบอย่างละเอียดถี่ถ้วนในวันเปิดตัว ราคาอยู่ที่ 3.00 ดอลลาร์สหรัฐต่อเสียง 1,000 นาที หรือประมาณ 0.18 ดอลลาร์สหรัฐต่อชั่วโมง ผ่าน Meta Model API Meta ยืนยันแล้วว่าจะไม่เปิดน้ำหนัก (weights) ของโมเดล

MAI-Transcribe-2 ถูกสร้างขึ้นสำหรับสถานการณ์ที่ไฟล์เสียงมีอยู่แล้ว โมเดลของ Microsoft ได้คะแนน AA-WER 2.0% บนลีดเดอร์บอร์ดแบบไม่สตรีมของ Artificial Analysis — รั้งอันดับสอง และเป็นตัวเลขที่ดีที่สุดในหมู่ managed batch APIs — และทำงานด้วยความเร็วประมาณ 411 เท่าของเวลาจริง ซึ่งเป็นค่าปริมาณงาน ไม่ใช่คำมั่นเรื่องความหน่วงแฝง โมเดลนี้ถอดเสียงได้ใน 60 ภาษาพร้อมการระบุภาษาอัตโนมัติ มาพร้อมการแยกผู้พูด การประทับเวลาในระดับคำ การปรับน้ำหนักคีย์เวิร์ด และรูปแบบคำต่อคำหรือแบบสะอาด รองรับการสลับภาษาเช่นฮิงลิชและสแปงลิช โดยเปิดให้ใช้ผ่าน Microsoft Foundry ในช่วงพรีวิวสาธารณะและ MAI Playground ในราคา 0.10 ดอลลาร์ต่อชั่วโมงเสียง เป็นข้อเสนอเปิดตัวระยะเวลาจำกัดจนถึงสิ้นปี ยังไม่มีการประกาศผลิตภัณฑ์แบบสตรีม โพสต์เปิดตัวของ Microsoft ระบุชัดเจนว่าผลิตภัณฑ์นี้เหมาะกับเสียงแบบยาวและแบบแบตช์ ซึ่งเป็นงานที่ความหน่วงต่ำของโมเดลสตรีมไร้ค่า แต่ต้นทุนต่อนาทีของมันกลับไม่ไร้ค่า

A two-column scoreboard titled 'MAI-Transcribe-2 vs Muse Voice Transcribe — the scoreboard': left column MAI-Transcribe-2 lists batch pre-recorded type, 2.0% AA-WER (non-streaming), ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages and bundled diarization with unpublished rate; right column Muse Voice Transcribe lists streaming real-time type, 3.1% streaming WER (Meta-reported), final latency ~0.16s, $3.00 per 1,000 minutes, 25 verified of 70+ languages and 20+ speaker in-stream diarization; footer notes the WER figures are not comparable and Muse figures are Meta-reported.

ทำไมค่าความแม่นยำสองค่านี้จึงไม่ขัดแย้งกัน

สัญชาตญาณตามธรรมชาติคือการเปรียบเทียบ 2.0% กับ 3.1% แล้วประกาศผู้ชนะ ซึ่งจะผิดสองต่อ ประการแรก ตัวเลขเหล่านี้วัดงานคนละประเภท: 2.0% ของ MAI-Transcribe-2 คือความแม่นยำแบบไม่สตรีมมิ่งสำหรับเสียงที่บันทึกไว้ล่วงหน้า โดยโมเดลสามารถดูไฟล์ทั้งไฟล์ได้ ส่วน 3.1% ของ Muse Voice Transcribe คือความแม่นยำแบบสตรีมมิ่งสำหรับทรานสคริปต์ฉบับสุดท้าย ซึ่งถูกผลิตขึ้นภายใต้ข้อจำกัดที่ต้องถอดเสียงไปพร้อมกับที่เสียงเข้ามา การสตรีมมิ่งเป็นปัญหาที่ยากกว่า ซึ่งเป็นเหตุว่าทำไมลีดเดอร์บอร์ดแบบสตรีมมิ่งและแบบไม่สตรีมมิ่งจึงแยกกันเป็นกระดานคนละกระดานพร้อมคะแนนคนละชุด ประการที่สอง ป้ายกำกับมีน้ำหนักต่างกัน: ตัวเลขของ MAI-Transcribe-2 เป็นค่าที่ Artificial Analysis วัดจากตัวโมเดล ขณะที่ตัวเลขของ Muse Voice Transcribe เป็นรายงานของ Meta ในวันเปิดตัวที่อ้างถึงสิ่งที่ Artificial Analysis วัดได้ — เป็นข้อมูลที่ผู้ผลิตเป็นผู้รายงานและยังไม่ผ่านการตรวจสอบซ้ำ คำกล่าวที่ตรงไปตรงมาคือ ทั้งสองโมเดลเป็นข้ออ้างที่น่าเชื่อถือในอันดับต้นของลีดเดอร์บอร์ดของแต่ละฝ่าย และตัวเลขทั้งสองไม่ได้บอกอะไรคุณเกี่ยวกับอีกสายหนึ่งเลย

การแยกผู้พูดคือจุดที่การเปรียบเทียบที่แท้จริงเกิดขึ้น เพราะมันเป็นฟีเจอร์เดียวที่ทั้งสองผลิตภัณฑ์มี และเป็นจุดที่ความทะเยอทะยานของทั้งคู่แตกต่างกันอย่างเห็นได้ชัด Muse Voice Transcribe แยกผู้พูดได้มากกว่ายี่สิบคนในฐานะความสามารถหลักแบบสตรีมมิ่ง โดย Meta รายงานอัตราความผิดพลาดเฉลี่ยในการแยกผู้พูดที่ 17.5% เทียบกับช่วงของคู่แข่งที่อ้างถึงที่ 21.1% ถึง 28.6% — ซึ่งอ้างโดย Meta อีกครั้งและไม่ได้รับการตรวจสอบ MAI-Transcribe-2 ก็รวมการแยกผู้พูดไว้ด้วยเช่นกัน แต่ Microsoft ไม่ได้เผยแพร่ขีดจำกัดจำนวนผู้พูด หรืออัตราความผิดพลาดในการแยกผู้พูดเลยแม้แต่อย่างเดียว สำหรับการโทรระหว่างสองฝ่าย ผลิตภัณฑ์ทั้งสองก็ใช้งานได้ดี และความแตกต่างนั้นไม่มีความสำคัญ สำหรับการสนทนากลุ่มที่มีคนสิบสองคนหรือการบันทึกเสียงแบบแพนেল Muse Voice Transcribe เป็นเพียงหนึ่งในสองตัวที่ระบุขีดจำกัดจำนวนผู้พูดหลายคนไว้ชัดเจน และการแยกผู้พูดที่ไม่ได้วัดผลของ MAI-Transcribe-2 คือเหตุผลสำคัญที่สุดประการเดียวที่จะต้องทดสอบมันก่อนจะวางใจให้มันจัดการกับไฟล์เสียงที่ยากกว่าของคุณ

การเปรียบเทียบราคาที่สมเหตุสมผล

ในด้านราคา ทั้งคู่ใกล้เคียงกันมากกว่าที่กรอบคิดแบบแบตช์เทียบกับสตรีมมิงชี้ให้เห็น เพราะราคา 1.67 ดอลลาร์ต่อ 1,000 นาที (MAI-Transcribe-2 ราคา Early-bird) และ 3.00 ดอลลาร์ต่อ 1,000 นาที (Muse Voice Transcribe) ต่างก็อยู่ในช่วงราคาถูกของบริการสปีชแบบมีการจัดการ การเปรียบเทียบเช่นนี้จะมีความหมายก็ต่อเมื่ออยู่ในเลนเดียวกันเท่านั้น สำหรับการถอดเสียงแบบแบตช์จากไฟล์ที่บันทึกไว้ล่วงหน้า MAI-Transcribe-2 มีราคาต่ำกว่าครึ่งหนึ่งของโมเดลที่ออกแบบมาสำหรับสตรีมมิง ขณะที่ให้ค่า WER แบบไม่สตรีมมิงที่ดีกว่า — แต่คุณจะส่งไฟล์บันทึกเสียงไปยัง Muse Voice Transcribe ก็ต่อเมื่อต้องการไปป์ไลน์สตรีมมิงของมันโดยเฉพาะ ซึ่งไม่ใช่วิธีที่มีประสิทธิภาพในการประมวลผลคลังข้อมูล สำหรับเสียงการประชุมสด Muse Voice Transcribe เป็นผลิตภัณฑ์เดียวในบทความนี้ที่ใช้งานได้จริง และอัตรา 3.00 ดอลลาร์ของมันยังต่ำกว่า API ถอดเสียงแบบเรียลไทม์อื่น ๆ ที่มันเปิดตัวแข่งด้วย — Gemini 3.5 Transcribe Live ที่ประมาณ 9 ดอลลาร์ต่อ 1,000 นาที และ GPT Live Transcribe ที่ 17 ดอลลาร์ — พร้อมเพิ่มการแยกผู้พูดมากกว่ายี่สิบคน ซึ่งผลิตภัณฑ์เหล่านั้นเทียบไม่ติด ข้อเท็จจริงด้านราคาที่ตรงไปตรงมาคือ Meta ตั้งราคาสตรีมมิงไว้ต่ำ และ Microsoft ตั้งราคาแบตช์ให้ต่ำยิ่งกว่า และตัวเลขทั้งสองเป็นราคาช่วงโปรโมชันที่จะปรับเปลี่ยนไปเมื่อผู้ให้บริการแต่ละรายประกาศอัตรามาตรฐานของตน

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

อันไหนสำหรับเสียงไหน

หากเสียงของคุณเป็นแบบสด — การประชุมที่ถอดความแบบเรียลไทม์ เอเจนต์เสียง ระบบคำบรรยายสด หรืออะไรก็ตามที่ต้องใช้คำพูดในขณะที่กำลังพูด — Muse Voice Transcribe คือตัวเลือก และไม่ได้ใกล้เคียงด้วยซ้ำ มันเป็นโมเดลสตรีมมิ่งเพียงตัวเดียวที่นี่ แยกผู้พูดได้มากกว่ายี่สิบคนในรอบเดียวกัน และตั้งราคามาเพื่อชนะในกลุ่มนั้นตั้งแต่วันแรก จุดอ่อนของมันคือสิ่งที่ต้องนำไปทดลองใช้: ตัวเลขความแม่นยำและการแยกผู้พูดเป็นข้อมูลที่ Meta รายงาน และโมเดลสตรีมมิ่งอายุหนึ่งสัปดาห์ยังไม่ได้แสดงให้เห็นว่ามันรับมือกับเสียงที่ messy นอกเหนือจากเกณฑ์มาตรฐานการเปิดตัวได้อย่างไร

หากเสียงของคุณเป็นไฟล์อยู่แล้ว — คลังเก็บ บันทึกการโทร คลังสื่อ หรืออะไรก็ตามที่ประมวลผลเป็นชุด — MAI-Transcribe-2 ให้ตัวเลขที่ดีกว่าในทุกมิติที่สำคัญ: ค่า WER ที่วัดได้ต่ำกว่า, ปริมาณงานมากกว่าประมาณสิบเท่า, และราคาต่อ 1,000 นาทีต่ำกว่าของโมเดลสตรีมมิง ความเสี่ยงของมันคือด้านตรงข้ามกับของ Muse: เพิ่งเปิดตัวสี่วัน, ไม่มี SKU สตรีมมิง, คุณภาพไดอะไรเซชันยังไม่ถูกวัด, และอัตรา early-bird ที่มีราคามาตรฐานที่ไม่ได้เปิดเผยซ่อนอยู่เบื้องหลัง

หน้าเปิดตัวของ Microsoft ที่แนะนำ MAI-Transcribe-2 แสดงรายการฟีเจอร์ที่ Microsoft รวมกลุ่มไว้ ซึ่งคู่แข่งสตรีมมิ่งไม่ได้นำเสนอในคราวเดียวกัน และเป็นเอกสารที่ควรอ้างอิงเมื่อคุณต้องตัดสินใจว่าข้ออ้างใดเป็นส่วนหนึ่งของผลิตภัณฑ์จริง และข้อใดยังเป็นเพียงคำสัญญาจากการเทียบวัดประสิทธิภาพ

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

และหากทรานสคริปต์เป็นเพียงครึ่งแรกของไปป์ไลน์ของคุณ การเลือกระหว่างสองตัวนี้ก็มีความสำคัญน้อยกว่าการเลือกที่คุณทำเหนือขึ้นไป เสียงการประชุมแบบเรียลไทม์ที่ถอดเสียงโดย Muse Voice Transcribe ยังคงต้องผ่านการสรุปใจความ การดึงรายการที่ต้องดำเนินการ และการร่างข้อความติดตามผลก่อนจึงจะมีประโยชน์ ส่วนสายที่ถูกบันทึกไว้ซึ่งถอดเสียงโดย MAI-Transcribe-2 ยังต้องถูกค้นหา ถูกปกปิดข้อมูล หรือถูกส่งต่อไปยังระบบปลายทางที่ถูกต้อง นั่นคือชั้นที่แพลตฟอร์มแบบหลายโมเดลแสดงคุณค่าของมัน — API เดียวของ OrcaRouter ที่ครอบคลุมโมเดลกว่า 200 รายการ โดยส่งผ่านราคารายการของผู้ให้บริการที่มาร์กอัป 0% ช่วยให้งานปลายทางนั้นเรียกใช้โมเดลที่แตกต่างกันตามปริมาณงานแต่ละประเภทผ่านการผสานรวมเพียงครั้งเดียว ดังนั้นไม่ว่าโมเดลเสียงพูดตัวใดจะชนะในไพล็อตของคุณ สแต็กที่อยู่เหนือทรานสคริปต์ก็ไม่จำเป็นต้องสร้างใหม่เพื่อสลับไปใช้ตัวอื่น ปัจจุบัน Muse Voice Transcribe และ MAI-Transcribe-2 ต่างก็ไม่ได้อยู่ในรายชื่อนั้น ทั้งคู่อยู่บน API ของผู้ขายเอง การเดิมพันในสัปดาห์นี้ที่ตัดสินได้จริงนั้นแคบกว่าและมีประโยชน์มากกว่า: การถอดเสียงแบบเรียลไทม์และแบบแบตช์เพิ่งมีต้นทุนต่ำพอที่ตัวสร้างความแตกต่างจะไม่ใช่คำพูดอีกต่อไป — แต่เป็นสิ่งที่คุณทำกับคำพูดเหล่านั้น

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube