การ์ดฮีโร่ของบทความแสดงข้อความ 'MAI-Transcribe-2 vs GPT Transcribe' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำบรรยาย 'Microsoft ตัดราคาบริการถอดเสียงของ OpenAI ในทุกตัวเลข' โดยมีชิปเปรียบเทียบ 2.0% เทียบกับ 3.31% AA-WER, $1.67 เทียบกับ $4.50 ต่อ 1,000 นาที และ ~411x เทียบกับ ~34x ของเวลาจริง บนพื้นหลังไล่เฉดสีขาวถึงน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MAI-Transcribe-2 เทียบกับ GPT Transcribe: Microsoft เหนือกว่าทรานสคริปต์ของ OpenAI ในทุกตัวเลข

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ตัวเลขสามตัวแยก MAI-Transcribe-2 ออกจาก GPT Transcribe และทุกตัวชี้ไปในทิศทางเดียวกัน บนกระดานผู้นำอัตราคำผิดแบบไม่สตรีมของ Artificial Analysis นั้น MAI-Transcribe-2 ซึ่งไมโครซอฟท์เผยแพร่เมื่อวันที่ 3 กันยายน 2026 มีค่า AA-WER 2.0% เทียบกับ 3.31% ของ GPT Transcribe ซึ่งเป็น API ถอดเสียงไฟล์บันทึกของ OpenAI ที่เปิดตัวก่อนหน้านั้นห้าสัปดาห์ในวันที่ 28 กรกฎาคม 2026 ในด้านตัวคูณความเร็วบนกระดานเดียวกัน MAI-Transcribe-2 ทำงานได้ประมาณ 411 เท่าของเวลาจริง เทียบกับประมาณ 34 เท่าของ GPT Transcribe และในด้านราคา MAI-Transcribe-2 คิดค่าบริการ 0.10 ดอลลาร์ต่อชั่วโมงเสียง — ประมาณ 1.67 ดอลลาร์ต่อ 1,000 นาทีในข้อเสนอเปิดตัวแบบจำกัดเวลา — เทียบกับ 4.50 ดอลลาร์ต่อ 1,000 นาทีของ GPT Transcribe ช่องว่างสุดท้ายนี้ลดราคาลง 63% และมันกระทบผลิตภัณฑ์ที่ OpenAI ลดราคาลง 25% เมื่อไม่กี่สัปดาห์ก่อน นี่คือสิ่งที่ตลาดสินค้าโภคภัณฑ์มีหน้าตาในวินาทีที่ห้องแล็บชายแดนแห่งที่สองตัดสินใจแข่งด้านราคา

ช่องว่าง ทีละหนึ่งหมายเลข

ความแม่นยำต้องมาก่อน เพราะเป็นตัวเลขที่ไม่มีผู้จำหน่ายรายใดใช้คำกล่าวอ้างทางการตลาดมาบดบังได้ ค่า 2.0% และ 3.31% มาจากชุดทดสอบอิสระเดียวกันคือ Artificial Analysis ซึ่งรันกับโมเดลทั้งสองตัว ทำให้ส่วนต่าง 1.3 จุดเป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบทั้งหมดนี้ กล่าวคือมีข้อผิดพลาดน้อยลงประมาณ 13 ครั้งต่อหนึ่งพันคำที่เส้น WER เดียวกัน ตัวเลข 3.31% ของ GPT Transcribe เองก็เป็นการพัฒนาขึ้นจากรุ่นก่อนหน้าอย่าง GPT-4o Transcribe ราว 0.7 จุด และการทดสอบหลายภาษาของ OpenAI เองแสดงให้เห็นว่ามันช่วยลดอัตราความผิดพลาดในยุค Whisper ลงได้ราวครึ่งหนึ่ง ไมโครซอฟต์ได้ยึดอันดับสองบนกระดานเดียวกันนี้ได้อย่างไม่ต้องสงสัย และในการทดสอบ FLEURS หลายภาษา ทางบริษัทรายงานค่า WER เฉลี่ย 5.2% จาก 60 ภาษา — ตัวเลขดังกล่าวมาจากโพสต์เปิดตัวของไมโครซอฟต์ ยังไม่มีการคำนวณซ้ำอย่างเป็นอิสระแยกตามภาษา

ความเร็วถัดไป อัตราประมาณ 34 เท่าของเวลาจริงของ GPT Transcribe ถือเป็นค่ามาตรฐานสำหรับเอนด์พอยต์ถอดเสียงแบบอะซิงโครนัส: ไฟล์หนึ่งชั่วโมงใช้เวลาคำนวณประมาณสองนาที ในขณะที่อัตราประมาณ 411 เท่าของเวลาจริงของ MAI-Transcribe-2 ถอดเสียงชั่วโมงเดียวกันเสร็จในเวลาไม่ถึงเก้าวินาทีของคอมพิวต์ จากตัวเลขของ Artificial Analysis ช่องว่างที่แท้จริงใกล้เคียง 12 เท่า; ไมโครซอฟท์ทำการตลาดว่า "เร็วกว่า GPT-Transcribe ของ OpenAI 10 เท่า" ซึ่งเป็นการที่ผู้จำหน่ายปัดตัวเลขความได้เปรียบของตนเองลงแทนที่จะปัดขึ้น — เป็นสิ่งบอกเหตุที่ผิดปกติ คำเตือนอย่างตรงไปตรงมาคือตัวเลขของ MAI-Transcribe-2 มีอายุสี่วันและเป็นปริมาณงานแฟ้มแบบแบตช์ ไม่ใช่ความหน่วงแบบสด ขณะที่ตัวเลขของ GPT Transcribe มีการใช้งานจริงในโปรดักชันถึงห้าสัปดาห์แล้ว แต่สถาปัตยกรรมของผลิตภัณฑ์ทั้งสองไม่มีอะไรบ่งชี้ว่าช่องว่างความเร็วจะปิดลง; พวกมันถูกสร้างขึ้นสำหรับงานแบตช์เดียวกันโดยมีประสิทธิภาพต่างกันมาก

ราคาไว้ท้ายสุด เพราะมันคือตัวเลขที่เปลี่ยนการตัดสินใจ GPT Transcribe กำหนดราคาอยู่ที่ 0.0045 ดอลลาร์ต่อนาที — คิดเป็น 4.50 ดอลลาร์ต่อ 1,000 นาที หรือประมาณ 0.27 ดอลลาร์ต่อชั่วโมงเสียง — หลังจาก OpenAI ปรับลดราคาในเดือนกรกฎาคมจากเดิม 0.006 ดอลลาร์ของ GPT-4o Transcribe ส่วน MAI-Transcribe-2 ตั้งราคาไว้ที่ 0.10 ดอลลาร์ต่อชั่วโมงเสียงจนถึงสิ้นปี โดยไม่มีการเปิดเผยราคามาตรฐานสำหรับช่วงหลังโปรโมชัน สำหรับไฟล์เสียง 1,000 ชั่วโมงต่อเดือน ส่วนต่างอยู่ที่ประมาณ 170 ดอลลาร์: ราว 100 ดอลลาร์ตามอัตราเปิดตัวของ MAI-Transcribe-2 เทียบกับราว 270 ดอลลาร์ตามราคาเต็มของ GPT Transcribe การลดราคา 25% ของ OpenAI ในเดือนกรกฎาคมเคยดูจริงจัง แต่การตัดราคา 63% ของ Microsoft เมื่อเทียบกับราคาหลังการลดครั้งนั้นเป็นการเคลื่อนไหวคนละระดับ และนั่นคือเหตุผลทั้งหมดที่ทำให้การเปรียบเทียบนี้เกิดขึ้น

A two-column scoreboard titled 'MAI-Transcribe-2 vs GPT Transcribe — the scoreboard': left column MAI-Transcribe-2 lists 2.0% AA-WER, ~411x real time, $1.67 early-bird per 1,000 minutes, 60 languages, bundled diarization and verbatim/clean styles; right column GPT Transcribe lists 3.31% AA-WER, ~34x real time, $4.50 per 1,000 minutes, languages not published, no diarization and caller-side post-processing; footer notes AA-WER and speed per Artificial Analysis and vendor list prices.

เหตุใดตัวเลขของ OpenAI จึงเป็นตัวเลขที่น่าเชื่อถือ

มีเหตุผลที่ AA-WER 3.31% ของ GPT Transcribe มีน้ำหนักมากกว่าตัวเลขเปิดตัวส่วนใหญ่ นั่นคือมันได้รับการตรวจสอบอย่างเป็นอิสระ และการตรวจสอบนั้นรอดพ้นจากการปะทะกับเสียงที่ยากลำบากมาได้ การรัน Artificial Analysis ชุดเดียวกันที่ให้ตัวเลขพาดหัวดังกล่าวยังเผยจุดอ่อนของ GPT Transcribe ด้วย นั่นคือ WER 6.10% บนชุดคำพูดจากการประชุมรายได้ Earnings22 ซึ่งเป็นเบนช์มาร์กสาธารณะที่ยากที่สุดในหมวดนี้ ซึ่งบอกผู้ซื้อได้ชัดเจนว่าควรหลีกเลี่ยงการใช้งานกับอะไร ตามมาด้วยปริมาณการใช้งานจริงห้าสัปดาห์ และการลดราคาของ OpenAI แสดงให้เห็นว่ามันแข่งขันด้วยต้นทุน มากกว่าจะปกป้องอัตรากำไรเชิงรับ GPT Transcribe ยังสืบทอดข้อจำกัดเชิงปฏิบัติของ API ของมันด้วย กล่าวคือเป็นผลิตภัณฑ์ที่รองรับเฉพาะการประมวลผลแบบแบตช์ ไฟล์สูงสุด 25 MB ต่อคำขอ ไม่มีระดับบริการสตรีมมิงที่ราคา $4.50 ไม่มีการแบ่งแยกผู้พูด ไม่มีการปรับน้ำหนักคำศัพท์ และครอบคลุมเฉพาะภาษาที่ OpenAI ยังไม่ได้ประกาศเท่านั้น มันแค่ถอดเสียง ส่วนทุกอย่างที่สูงกว่าระดับตัวคำนั้นเป็นหน้าที่ของผู้เรียกใช้

ความชัดเจนเช่นนี้เองที่ทำให้ GPT Transcribe ง่ายต่อการไว้วางใจ และมันคือความชัดเจนแบบเดียวกับที่โมเดลอายุสี่วันยังไม่ได้รับสิทธิ์นั้น ไมโครซอฟท์ไม่ได้เผยแพร่อัตราความผิดพลาดในการแยกผู้พูด (diarization error rate) สำหรับ MAI-Transcribe-2 ไม่มีตารางความแม่นยำจำแนกรายภาษาที่อยู่เบื้องหลังค่าเฉลี่ย FLEURS 60 ภาษา และไม่มี SKU แบบสตรีมมิง การละเว้นเหล่านั้นไม่มีข้อใดหมายความว่าโมเดลอ่อนแอ — การรวมฟีเจอร์แยกผู้พูดและการรองรับ 60 ภาษาคือพื้นที่ผลิตภัณฑ์จริงที่ GPT Transcribe ไม่มีด้วยซ้ำ — แต่แต่ละจุดคือสถานที่ที่การรันซ้ำโดยอิสระอาจเปลี่ยนเรื่องราวไปได้ ตัวเลขความแม่นยำวัดด้วยวิธี AA และเป็นจริง; ตัวผลิตภัณฑ์โดยรอบยังไม่ได้รับการพิสูจน์ในแบบที่การใช้งานจริงในระบบผลิตเท่านั้นที่จะเปิดเผยได้

ชุดฟีเจอร์มีรูปร่างไม่เหมือนกัน

• การแยกผู้พูด (Diarization) — MAI-Transcribe-2 รวมการระบุผู้พูดไว้ด้วย โดยไม่มีอัตราความผิดพลาดที่เผยแพร่; GPT Transcribe ไม่มีฟีเจอร์นี้เลย ดังนั้นทรานสคริปต์จึงออกมาเป็นกระแสข้อมูลเดียวที่ไม่มีการแบ่งแยก

• การควบคุม — MAI-Transcribe-2 รองรับการปรับน้ำหนักคำสำคัญ (keyword biasing) สำหรับชื่อและศัพท์เฉพาะ รวมถึงรูปแบบการถอดเสียงแบบคำต่อคำ (verbatim) และแบบสะอาด (clean) ส่วน GPT Transcribe ไม่มีทั้งสองอย่าง โดยส่งกลับข้อความดิบที่ไม่มีเครื่องหมายวรรคตอนให้ผู้เรียกใช้งานนำไปประมวลผลภายหลัง

• ไทม์สแตมป์ — ทั้งคู่ให้ผลลัพธ์ที่ตรงตามเวลา โดยของ MAI-Transcribe-2 เป็นแบบระดับคำได้ทันทีที่ใช้งาน

• ภาษา — MAI-Transcribe-2 เผยแพร่ 60 ภาษาพร้อมการระบุอัตโนมัติ ส่วน GPT Transcribe ไม่ได้เผยแพร่รายการภาษาของตน ซึ่งถือเป็นปัญหาในการวางแผนสำหรับงานที่ต้องใช้หลายภาษา

• สตรีมมิง — ระดับราคา $4.50 ของ GPT Transcribe รองรับเฉพาะการประมวลผลแบบแบตช์เท่านั้น ส่วนผลิตภัณฑ์สตรีมมิงในตระกูลเดียวกันคือ GPT Live Transcribe เป็นผลิตภัณฑ์แยกต่างหากในราคา $17 ต่อ 1,000 นาที ส่วน MAI-Transcribe-2 ไม่มีผลิตภัณฑ์สตรีมมิงเลย ไม่ว่าจะประกาศหรือสาธิตแล้วก็ตาม

• Shape — ทั้งคู่เป็น managed APIs สำหรับไฟล์ที่บันทึกไว้ล่วงหน้า ซึ่งเป็นเหตุผลว่าทำไมการเปรียบเทียบนี้จึงยุติธรรม; ความแตกต่างคือ Microsoft ใส่ post-processing ที่มีประโยชน์มากกว่าไว้ในผลิตภัณฑ์พื้นฐานในราคาหนึ่งในสาม

Screenshot of the Artificial Analysis Speech-to-Text leaderboard summary table showing Word Error Rate and Median Speed Factor columns for models including MAI-Transcribe-2 and MAI-Transcribe-1.5 under Microsoft AI, alongside rows for ElevenLabs Scribe v2 and Gemini 3.5 Transcribe.

ใครควรย้าย และเมื่อไร

หากคุณถอดเสียงไฟล์เสียงแบบแบตช์ปริมาณมาก และอัตราพิเศษช่วงเปิดตัวยังคงใช้ได้จริงเมื่อได้ทดลองกับไฟล์ของคุณเอง MAI-Transcribe-2 ถือเป็นตัวเลือกตั้งต้นที่สมเหตุสมผลที่สุดในตอนนี้: ค่า WER ที่วัดได้ดีกว่า ปริมาณงานสูงกว่าราวสิบสองเท่า และราคาต่อ 1,000 นาทีต่ำลง 63% สำหรับผลิตภัณฑ์ที่มาพร้อมฟีเจอร์แยกผู้พูด (diarization) และควบคุมสไตล์ ซึ่ง OpenAI ไม่คิดค่าใช้จ่ายเพิ่มเติม — เพราะมันไม่มีฟีเจอร์เหล่านี้ให้เลย การเปลี่ยนมาใช้แทบไม่เสียหาย: แค่ทดสอบกับตัวอย่างเสียงที่ยากที่สุดของคุณสักส่วนหนึ่งก็ช่วยขจัดความไม่แน่นอนได้เกือบทั้งหมด และอัตรา $1.67 ทำให้การทดลองนี้แทบไม่มีค่าใช้จ่ายไปจนถึงสิ้นปี

หากภาระงานของคุณสำคัญต่อระบบการผลิต อยู่ภายใต้กฎระเบียบ หรือผูกติดกับ OpenAI อยู่แล้ว การได้เริ่มต้นก่อนถึงห้าสัปดาห์และจุดอ่อนที่ถูกเปิดเผยใน Earnings22 นั้นมีค่ามากกว่าส่วนต่างด้านราคา GPT Transcribe คือโมเดลที่คุณสามารถระบุโหมดความล้มเหลวของมันได้ ส่วนโหมดความล้มเหลวของ MAI-Transcribe-2 ยังคงถูกค้นพบอยู่ รูปแบบที่รอบคอบคือรูปแบบที่เลเยอร์การจัดเส้นทางมีไว้รองรับ: ให้โมเดลที่ผ่านการพิสูจน์แล้วเป็นค่าเริ่มต้น และส่งทราฟฟิกในสัดส่วนที่วัดได้ไปยังโมเดลผู้ท้าชิง พร้อมเปรียบเทียบทรานสคริปต์บนข้อมูลของคุณเองก่อนที่จะเลื่อนสถานะใด ๆ วินัยแบบลองก่อนเลื่อนสถานะเช่นนี้คือหัวใจของระบบ failover อัตโนมัติและ routing DSL ของ OrcaRouter — โมเดลใหม่จะได้รับทราฟฟิกการผลิตเป็นเปอร์เซ็นต์ ไม่ใช่โดยคำสั่ง และการตั้งค่าแบบคีย์เดียวเดียวกันที่เข้าถึงโมเดลมากกว่า 200 รายการ ทำให้สแต็กส่วนที่เหลือเหนือชั้นทรานสคริปต์ไม่ผูกติดกับผู้ให้บริการ ขณะที่การแข่งขัน STT ยังคงดำเนินต่อไป

โพสต์เปิดตัวที่อยู่เบื้องหลังตัวเลขของ MAI-Transcribe-2 วางกรอบทุกอย่างเป็นการเทียบเคียงกับคู่แข่งที่เอ่ยชื่อ มากกว่าจะเป็นตัวเลขสัมบูรณ์ — ซึ่งถือเป็นการตรวจสอบอย่างมีวินัยที่มีประโยชน์สำหรับใครก็ตามที่อ่าน: นำข้อกล่าวอ้างเชิงเปรียบเทียบไปหาตัวเลขสัมบูรณ์จากกระดานอิสระ แล้วติดป้ายกำกับส่วนที่เหลือว่าเป็นกรอบการนำเสนอของบรรดาผู้จำหน่าย

Screenshot of the top of the Microsoft AI announcement for MAI-Transcribe-2 (dated September 3, 2026), showing the headline 'MAI-Transcribe-2 is the fastest, most accurate and cheapest speech recognition model in the world' and the opening paragraph naming new features — diarization, configurable transcription styles, word-level timestamps — and comparisons against Gemini 3.5 Transcribe, GPT-Transcribe, Whisper V3-Large and Scribe V2.

อัตรา $1.67 มีวันหมดอายุ และ 2.0% มีชื่อเสียงสี่วัน และ OpenAI จะตอบทั้งสองในที่สุด แต่รูปร่างของตลาดนี้เพิ่งเปลี่ยนไป: เป็นครั้งแรกที่ API การถอดเสียงแบบมีการจัดการที่มีความแม่นยำสูงและถูกที่สุด ก็ยังแม่นยำที่สุดและเร็วที่สุด และไม่ใช่ของ OpenAI ถึงแม้ว่าราคามาตรฐานของ MAI-Transcribe-2 จะสูงกว่าข้อเสนอเปิดตัวมาก มาตรฐานความแม่นยำต่อดอลลาร์ในการถอดเสียงแบบมีการจัดการได้ขยับแล้ว — และมันขยับตามเงื่อนไขของ Microsoft

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube