
MAI-Transcribe-2 เทียบกับ GPT Transcribe: Microsoft เหนือกว่าทรานสคริปต์ของ OpenAI ในทุกตัวเลข
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ตัวเลขสามตัวแยก MAI-Transcribe-2 ออกจาก GPT Transcribe และทุกตัวชี้ไปในทิศทางเดียวกัน บนกระดานผู้นำอัตราคำผิดแบบไม่สตรีมของ Artificial Analysis นั้น MAI-Transcribe-2 ซึ่งไมโครซอฟท์เผยแพร่เมื่อวันที่ 3 กันยายน 2026 มีค่า AA-WER 2.0% เทียบกับ 3.31% ของ GPT Transcribe ซึ่งเป็น API ถอดเสียงไฟล์บันทึกของ OpenAI ที่เปิดตัวก่อนหน้านั้นห้าสัปดาห์ในวันที่ 28 กรกฎาคม 2026 ในด้านตัวคูณความเร็วบนกระดานเดียวกัน MAI-Transcribe-2 ทำงานได้ประมาณ 411 เท่าของเวลาจริง เทียบกับประมาณ 34 เท่าของ GPT Transcribe และในด้านราคา MAI-Transcribe-2 คิดค่าบริการ 0.10 ดอลลาร์ต่อชั่วโมงเสียง — ประมาณ 1.67 ดอลลาร์ต่อ 1,000 นาทีในข้อเสนอเปิดตัวแบบจำกัดเวลา — เทียบกับ 4.50 ดอลลาร์ต่อ 1,000 นาทีของ GPT Transcribe ช่องว่างสุดท้ายนี้ลดราคาลง 63% และมันกระทบผลิตภัณฑ์ที่ OpenAI ลดราคาลง 25% เมื่อไม่กี่สัปดาห์ก่อน นี่คือสิ่งที่ตลาดสินค้าโภคภัณฑ์มีหน้าตาในวินาทีที่ห้องแล็บชายแดนแห่งที่สองตัดสินใจแข่งด้านราคา
ช่องว่าง ทีละหนึ่งหมายเลข
ความแม่นยำต้องมาก่อน เพราะเป็นตัวเลขที่ไม่มีผู้จำหน่ายรายใดใช้คำกล่าวอ้างทางการตลาดมาบดบังได้ ค่า 2.0% และ 3.31% มาจากชุดทดสอบอิสระเดียวกันคือ Artificial Analysis ซึ่งรันกับโมเดลทั้งสองตัว ทำให้ส่วนต่าง 1.3 จุดเป็นข้อเท็จจริงที่ชัดเจนที่สุดในการเปรียบเทียบทั้งหมดนี้ กล่าวคือมีข้อผิดพลาดน้อยลงประมาณ 13 ครั้งต่อหนึ่งพันคำที่เส้น WER เดียวกัน ตัวเลข 3.31% ของ GPT Transcribe เองก็เป็นการพัฒนาขึ้นจากรุ่นก่อนหน้าอย่าง GPT-4o Transcribe ราว 0.7 จุด และการทดสอบหลายภาษาของ OpenAI เองแสดงให้เห็นว่ามันช่วยลดอัตราความผิดพลาดในยุค Whisper ลงได้ราวครึ่งหนึ่ง ไมโครซอฟต์ได้ยึดอันดับสองบนกระดานเดียวกันนี้ได้อย่างไม่ต้องสงสัย และในการทดสอบ FLEURS หลายภาษา ทางบริษัทรายงานค่า WER เฉลี่ย 5.2% จาก 60 ภาษา — ตัวเลขดังกล่าวมาจากโพสต์เปิดตัวของไมโครซอฟต์ ยังไม่มีการคำนวณซ้ำอย่างเป็นอิสระแยกตามภาษา
ความเร็วถัดไป อัตราประมาณ 34 เท่าของเวลาจริงของ GPT Transcribe ถือเป็นค่ามาตรฐานสำหรับเอนด์พอยต์ถอดเสียงแบบอะซิงโครนัส: ไฟล์หนึ่งชั่วโมงใช้เวลาคำนวณประมาณสองนาที ในขณะที่อัตราประมาณ 411 เท่าของเวลาจริงของ MAI-Transcribe-2 ถอดเสียงชั่วโมงเดียวกันเสร็จในเวลาไม่ถึงเก้าวินาทีของคอมพิวต์ จากตัวเลขของ Artificial Analysis ช่องว่างที่แท้จริงใกล้เคียง 12 เท่า; ไมโครซอฟท์ทำการตลาดว่า "เร็วกว่า GPT-Transcribe ของ OpenAI 10 เท่า" ซึ่งเป็นการที่ผู้จำหน่ายปัดตัวเลขความได้เปรียบของตนเองลงแทนที่จะปัดขึ้น — เป็นสิ่งบอกเหตุที่ผิดปกติ คำเตือนอย่างตรงไปตรงมาคือตัวเลขของ MAI-Transcribe-2 มีอายุสี่วันและเป็นปริมาณงานแฟ้มแบบแบตช์ ไม่ใช่ความหน่วงแบบสด ขณะที่ตัวเลขของ GPT Transcribe มีการใช้งานจริงในโปรดักชันถึงห้าสัปดาห์แล้ว แต่สถาปัตยกรรมของผลิตภัณฑ์ทั้งสองไม่มีอะไรบ่งชี้ว่าช่องว่างความเร็วจะปิดลง; พวกมันถูกสร้างขึ้นสำหรับงานแบตช์เดียวกันโดยมีประสิทธิภาพต่างกันมาก
ราคาไว้ท้ายสุด เพราะมันคือตัวเลขที่เปลี่ยนการตัดสินใจ GPT Transcribe กำหนดราคาอยู่ที่ 0.0045 ดอลลาร์ต่อนาที — คิดเป็น 4.50 ดอลลาร์ต่อ 1,000 นาที หรือประมาณ 0.27 ดอลลาร์ต่อชั่วโมงเสียง — หลังจาก OpenAI ปรับลดราคาในเดือนกรกฎาคมจากเดิม 0.006 ดอลลาร์ของ GPT-4o Transcribe ส่วน MAI-Transcribe-2 ตั้งราคาไว้ที่ 0.10 ดอลลาร์ต่อชั่วโมงเสียงจนถึงสิ้นปี โดยไม่มีการเปิดเผยราคามาตรฐานสำหรับช่วงหลังโปรโมชัน สำหรับไฟล์เสียง 1,000 ชั่วโมงต่อเดือน ส่วนต่างอยู่ที่ประมาณ 170 ดอลลาร์: ราว 100 ดอลลาร์ตามอัตราเปิดตัวของ MAI-Transcribe-2 เทียบกับราว 270 ดอลลาร์ตามราคาเต็มของ GPT Transcribe การลดราคา 25% ของ OpenAI ในเดือนกรกฎาคมเคยดูจริงจัง แต่การตัดราคา 63% ของ Microsoft เมื่อเทียบกับราคาหลังการลดครั้งนั้นเป็นการเคลื่อนไหวคนละระดับ และนั่นคือเหตุผลทั้งหมดที่ทำให้การเปรียบเทียบนี้เกิดขึ้น

เหตุใดตัวเลขของ OpenAI จึงเป็นตัวเลขที่น่าเชื่อถือ
มีเหตุผลที่ AA-WER 3.31% ของ GPT Transcribe มีน้ำหนักมากกว่าตัวเลขเปิดตัวส่วนใหญ่ นั่นคือมันได้รับการตรวจสอบอย่างเป็นอิสระ และการตรวจสอบนั้นรอดพ้นจากการปะทะกับเสียงที่ยากลำบากมาได้ การรัน Artificial Analysis ชุดเดียวกันที่ให้ตัวเลขพาดหัวดังกล่าวยังเผยจุดอ่อนของ GPT Transcribe ด้วย นั่นคือ WER 6.10% บนชุดคำพูดจากการประชุมรายได้ Earnings22 ซึ่งเป็นเบนช์มาร์กสาธารณะที่ยากที่สุดในหมวดนี้ ซึ่งบอกผู้ซื้อได้ชัดเจนว่าควรหลีกเลี่ยงการใช้งานกับอะไร ตามมาด้วยปริมาณการใช้งานจริงห้าสัปดาห์ และการลดราคาของ OpenAI แสดงให้เห็นว่ามันแข่งขันด้วยต้นทุน มากกว่าจะปกป้องอัตรากำไรเชิงรับ GPT Transcribe ยังสืบทอดข้อจำกัดเชิงปฏิบัติของ API ของมันด้วย กล่าวคือเป็นผลิตภัณฑ์ที่รองรับเฉพาะการประมวลผลแบบแบตช์ ไฟล์สูงสุด 25 MB ต่อคำขอ ไม่มีระดับบริการสตรีมมิงที่ราคา $4.50 ไม่มีการแบ่งแยกผู้พูด ไม่มีการปรับน้ำหนักคำศัพท์ และครอบคลุมเฉพาะภาษาที่ OpenAI ยังไม่ได้ประกาศเท่านั้น มันแค่ถอดเสียง ส่วนทุกอย่างที่สูงกว่าระดับตัวคำนั้นเป็นหน้าที่ของผู้เรียกใช้
ความชัดเจนเช่นนี้เองที่ทำให้ GPT Transcribe ง่ายต่อการไว้วางใจ และมันคือความชัดเจนแบบเดียวกับที่โมเดลอายุสี่วันยังไม่ได้รับสิทธิ์นั้น ไมโครซอฟท์ไม่ได้เผยแพร่อัตราความผิดพลาดในการแยกผู้พูด (diarization error rate) สำหรับ MAI-Transcribe-2 ไม่มีตารางความแม่นยำจำแนกรายภาษาที่อยู่เบื้องหลังค่าเฉลี่ย FLEURS 60 ภาษา และไม่มี SKU แบบสตรีมมิง การละเว้นเหล่านั้นไม่มีข้อใดหมายความว่าโมเดลอ่อนแอ — การรวมฟีเจอร์แยกผู้พูดและการรองรับ 60 ภาษาคือพื้นที่ผลิตภัณฑ์จริงที่ GPT Transcribe ไม่มีด้วยซ้ำ — แต่แต่ละจุดคือสถานที่ที่การรันซ้ำโดยอิสระอาจเปลี่ยนเรื่องราวไปได้ ตัวเลขความแม่นยำวัดด้วยวิธี AA และเป็นจริง; ตัวผลิตภัณฑ์โดยรอบยังไม่ได้รับการพิสูจน์ในแบบที่การใช้งานจริงในระบบผลิตเท่านั้นที่จะเปิดเผยได้
ชุดฟีเจอร์มีรูปร่างไม่เหมือนกัน
• การแยกผู้พูด (Diarization) — MAI-Transcribe-2 รวมการระบุผู้พูดไว้ด้วย โดยไม่มีอัตราความผิดพลาดที่เผยแพร่; GPT Transcribe ไม่มีฟีเจอร์นี้เลย ดังนั้นทรานสคริปต์จึงออกมาเป็นกระแสข้อมูลเดียวที่ไม่มีการแบ่งแยก
• การควบคุม — MAI-Transcribe-2 รองรับการปรับน้ำหนักคำสำคัญ (keyword biasing) สำหรับชื่อและศัพท์เฉพาะ รวมถึงรูปแบบการถอดเสียงแบบคำต่อคำ (verbatim) และแบบสะอาด (clean) ส่วน GPT Transcribe ไม่มีทั้งสองอย่าง โดยส่งกลับข้อความดิบที่ไม่มีเครื่องหมายวรรคตอนให้ผู้เรียกใช้งานนำไปประมวลผลภายหลัง
• ไทม์สแตมป์ — ทั้งคู่ให้ผลลัพธ์ที่ตรงตามเวลา โดยของ MAI-Transcribe-2 เป็นแบบระดับคำได้ทันทีที่ใช้งาน
• ภาษา — MAI-Transcribe-2 เผยแพร่ 60 ภาษาพร้อมการระบุอัตโนมัติ ส่วน GPT Transcribe ไม่ได้เผยแพร่รายการภาษาของตน ซึ่งถือเป็นปัญหาในการวางแผนสำหรับงานที่ต้องใช้หลายภาษา
• สตรีมมิง — ระดับราคา $4.50 ของ GPT Transcribe รองรับเฉพาะการประมวลผลแบบแบตช์เท่านั้น ส่วนผลิตภัณฑ์สตรีมมิงในตระกูลเดียวกันคือ GPT Live Transcribe เป็นผลิตภัณฑ์แยกต่างหากในราคา $17 ต่อ 1,000 นาที ส่วน MAI-Transcribe-2 ไม่มีผลิตภัณฑ์สตรีมมิงเลย ไม่ว่าจะประกาศหรือสาธิตแล้วก็ตาม
• Shape — ทั้งคู่เป็น managed APIs สำหรับไฟล์ที่บันทึกไว้ล่วงหน้า ซึ่งเป็นเหตุผลว่าทำไมการเปรียบเทียบนี้จึงยุติธรรม; ความแตกต่างคือ Microsoft ใส่ post-processing ที่มีประโยชน์มากกว่าไว้ในผลิตภัณฑ์พื้นฐานในราคาหนึ่งในสาม

ใครควรย้าย และเมื่อไร
หากคุณถอดเสียงไฟล์เสียงแบบแบตช์ปริมาณมาก และอัตราพิเศษช่วงเปิดตัวยังคงใช้ได้จริงเมื่อได้ทดลองกับไฟล์ของคุณเอง MAI-Transcribe-2 ถือเป็นตัวเลือกตั้งต้นที่สมเหตุสมผลที่สุดในตอนนี้: ค่า WER ที่วัดได้ดีกว่า ปริมาณงานสูงกว่าราวสิบสองเท่า และราคาต่อ 1,000 นาทีต่ำลง 63% สำหรับผลิตภัณฑ์ที่มาพร้อมฟีเจอร์แยกผู้พูด (diarization) และควบคุมสไตล์ ซึ่ง OpenAI ไม่คิดค่าใช้จ่ายเพิ่มเติม — เพราะมันไม่มีฟีเจอร์เหล่านี้ให้เลย การเปลี่ยนมาใช้แทบไม่เสียหาย: แค่ทดสอบกับตัวอย่างเสียงที่ยากที่สุดของคุณสักส่วนหนึ่งก็ช่วยขจัดความไม่แน่นอนได้เกือบทั้งหมด และอัตรา $1.67 ทำให้การทดลองนี้แทบไม่มีค่าใช้จ่ายไปจนถึงสิ้นปี
หากภาระงานของคุณสำคัญต่อระบบการผลิต อยู่ภายใต้กฎระเบียบ หรือผูกติดกับ OpenAI อยู่แล้ว การได้เริ่มต้นก่อนถึงห้าสัปดาห์และจุดอ่อนที่ถูกเปิดเผยใน Earnings22 นั้นมีค่ามากกว่าส่วนต่างด้านราคา GPT Transcribe คือโมเดลที่คุณสามารถระบุโหมดความล้มเหลวของมันได้ ส่วนโหมดความล้มเหลวของ MAI-Transcribe-2 ยังคงถูกค้นพบอยู่ รูปแบบที่รอบคอบคือรูปแบบที่เลเยอร์การจัดเส้นทางมีไว้รองรับ: ให้โมเดลที่ผ่านการพิสูจน์แล้วเป็นค่าเริ่มต้น และส่งทราฟฟิกในสัดส่วนที่วัดได้ไปยังโมเดลผู้ท้าชิง พร้อมเปรียบเทียบทรานสคริปต์บนข้อมูลของคุณเองก่อนที่จะเลื่อนสถานะใด ๆ วินัยแบบลองก่อนเลื่อนสถานะเช่นนี้คือหัวใจของระบบ failover อัตโนมัติและ routing DSL ของ OrcaRouter — โมเดลใหม่จะได้รับทราฟฟิกการผลิตเป็นเปอร์เซ็นต์ ไม่ใช่โดยคำสั่ง และการตั้งค่าแบบคีย์เดียวเดียวกันที่เข้าถึงโมเดลมากกว่า 200 รายการ ทำให้สแต็กส่วนที่เหลือเหนือชั้นทรานสคริปต์ไม่ผูกติดกับผู้ให้บริการ ขณะที่การแข่งขัน STT ยังคงดำเนินต่อไป
โพสต์เปิดตัวที่อยู่เบื้องหลังตัวเลขของ MAI-Transcribe-2 วางกรอบทุกอย่างเป็นการเทียบเคียงกับคู่แข่งที่เอ่ยชื่อ มากกว่าจะเป็นตัวเลขสัมบูรณ์ — ซึ่งถือเป็นการตรวจสอบอย่างมีวินัยที่มีประโยชน์สำหรับใครก็ตามที่อ่าน: นำข้อกล่าวอ้างเชิงเปรียบเทียบไปหาตัวเลขสัมบูรณ์จากกระดานอิสระ แล้วติดป้ายกำกับส่วนที่เหลือว่าเป็นกรอบการนำเสนอของบรรดาผู้จำหน่าย

อัตรา $1.67 มีวันหมดอายุ และ 2.0% มีชื่อเสียงสี่วัน และ OpenAI จะตอบทั้งสองในที่สุด แต่รูปร่างของตลาดนี้เพิ่งเปลี่ยนไป: เป็นครั้งแรกที่ API การถอดเสียงแบบมีการจัดการที่มีความแม่นยำสูงและถูกที่สุด ก็ยังแม่นยำที่สุดและเร็วที่สุด และไม่ใช่ของ OpenAI ถึงแม้ว่าราคามาตรฐานของ MAI-Transcribe-2 จะสูงกว่าข้อเสนอเปิดตัวมาก มาตรฐานความแม่นยำต่อดอลลาร์ในการถอดเสียงแบบมีการจัดการได้ขยับแล้ว — และมันขยับตามเงื่อนไขของ Microsoft
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
