การ์ดฮีโร่บทความที่อ่านว่า 'MAI-Transcribe-2-Streaming กับ Gemini 3.5 Transcribe Live' พร้อมป้าย 'เทียบกันตรงๆ · การถอดเสียงพูดแบบสตรีมมิ่ง' และคำโปรย '9 ดอลลาร์เท่ากัน แต่การแลกเปลี่ยนต่างกัน' โดยมีชิปที่แสดง 2.5% ที่อ้าง เทียบกับ 4.00% ที่ตรวจสอบแล้ว, 0.13 วินาที เทียบกับ 0.40 วินาที ถึงผลสุดท้าย, 60 ภาษา เทียบกับ 85+, และไม่มีข้อมูลการแยกผู้พูดที่เผยแพร่บนทั้งสอง บนพื้นหลังไล่ระดับสีขาวถึงน้ำเงิน โดยมีโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

MAI-Transcribe-2-Streaming เทียบกับ Gemini 3.5 Transcribe Live: ราคา 9 ดอลลาร์เท่ากัน แต่ได้สิ่งที่แลกมาคนละแบบ

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

MAI-Transcribe-2-Streaming และ Gemini 3.5 Transcribe Live มีค่าใช้จ่ายเท่ากัน และถูกสร้างขึ้นบนแนวคิดที่ตรงกันข้ามเกี่ยวกับจุดประสงค์ของเครื่องถอดเสียงแบบสตรีมมิ่ง ทั้งคู่อยู่ที่ประมาณ $9.00 ต่อเสียงที่สตรีม 1,000 นาที โมเดลของ Microsoft ซึ่งเปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 เป็นเครื่องมือที่มีความแม่นยำ: อัตราความผิดพลาดระดับคำสำหรับการสตรีมที่อ้างว่า 2.5% โดยใช้เวลา 0.13 วินาทีถึงบทถอดเสียงฉบับสุดท้าย อยู่ในอันดับหนึ่งด้านความแม่นยำทั้งบทถอดเสียงฉบับสมบูรณ์และฉบับบางส่วน ตามข้อมูลของ Microsoft เอง วัดด้วยระเบียบวิธีสตรีมมิ่งของ Artificial Analysis แต่ยังไม่ถูกนำมาพล็อตเป็นแถวบนบอร์ดนั้น อีกโมเดลหนึ่ง ซึ่งเปิดให้ทดลองใช้สาธารณะตั้งแต่ 26 สิงหาคม 2026 และให้บริการผ่าน Live API เป็นเครื่องมือด้านความครอบคลุม: มากกว่า 85 ภาษา พร้อมการสลับกลางสตรีม มีระดับใช้งานฟรี และอัตราความผิดพลาดระดับคำสำหรับการสตรีม 4.00% ที่ 0.40 วินาที ซึ่งเป็นตัวเลขที่ Artificial Analysis วัดได้สำหรับโมเดลนี้ ไม่มีตัวไหนเป็นตัวเลือกที่ชัดเจน และเหตุผลก็คือพวกมันไม่ได้แข่งขันกันในภาระงานเดียวกันจริง ๆ

นี่คือการเปรียบเทียบแบบตัวต่อตัวตามที่ตัวเลขชี้จริง — ตัวเลขที่ผู้ขายรายงานโดยระบุไว้ ตัวเลขจากตัวติดตามที่อ้างอิงที่มา และส่วนที่โมเดลหนึ่งชนะในมิติที่อีกโมเดลไม่ได้แข่งด้วยเลย

เวอร์ชันบรรทัดเดียว

• ความแม่นยำและความหน่วง — MAI-Transcribe-2-Streaming จากตัวเลขที่เผยแพร่ Microsoft อ้างว่า WER แบบสตรีมมิ่ง 2.5% ที่ 0.13 วินาทีสู่ทรานสคริปต์ฉบับสมบูรณ์ เป็นที่หนึ่งด้านความแม่นยำทั้งทรานสคริปต์ฉบับสมบูรณ์และบางส่วน และ 2.5% สำหรับบางส่วนแรกที่ 0.12 วินาที ในทางกลับกัน Artificial Analysis มี Gemini 3.5 Transcribe Live อยู่ที่ 4.00% ที่ 0.40 วินาที ข้อได้เปรียบที่ Microsoft อ้างคือ 1.5 จุด และเร็วกว่าในการสรุปผลประมาณสามเท่า ข้อแม้คือตัวติดตามยังไม่ได้พล็อต MAI-Transcribe-2-Streaming เอง — ผู้นำปัจจุบันบนกระดานคือ Grok Voice Transcribe 2.0 ที่ 2.73% และ 0.49 วินาที โดยมี Muse Voice Transcribe ที่ 3.06% และ 0.16 วินาที — ดังนั้น 2.5% จึงเป็นตัวเลขจากผู้ขายที่อ่านเทียบกับกลุ่มที่ตัวติดตามวัดจริง ไม่ใช่การตัดสินที่สูสีบนแกนที่ทั้งสองโมเดลเผยแพร่ แต่มีเพียงด้านเดียวเท่านั้นที่ได้รับการเผยแพร่อย่างอิสระ

• ความกว้างของภาษา — Gemini 3.5 Transcribe Live รองรับ 85+ ภาษา พร้อมการตรวจจับอัตโนมัติและความสามารถในการสลับภาษาระหว่างสตรีมโดยไม่ต้องเริ่มเซสชันใหม่ ซึ่งเป็นคำกล่าวอ้างหลักของ Google สำหรับ Live API ส่วน MAI-Transcribe-2-Streaming รองรับ 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ พื้นของ Microsoft สูงกว่า เพดานของ Google กว้างกว่า และช่องว่าง 25 ภาษาส่วนใหญ่อยู่ในภาษาที่โมเดลสตรีมมิ่งแบบภาษาเดียวไม่สามารถใช้งานได้เลย

• รูปแบบเซสชัน — Gemini 3.5 Transcribe Live และอันนี้มีทั้งข้อดีและข้อเสีย The Live API เป็นเซสชัน WebSocket ที่จำกัดไว้ที่ 10 นาที ซึ่งเหมาะสำหรับเทิร์นของเอเจนต์เสียง และไม่สะดวกสำหรับการประชุมยาวหนึ่งชั่วโมง; Microsoft ไม่ได้เผยแพร่เพดานเซสชันที่เทียบเท่ากันสำหรับโมเดลสตรีมมิ่งของตน ซึ่งสำคัญถ้าหน่วยงานของคุณคือการโทรหนึ่งครั้ง ไม่ใช่เทิร์นการสนทนา

• ค่าใช้จ่ายเริ่มต้น — Gemini 3.5 Transcribe Live มีแพ็กเกจฟรี และอัตราแบบผสมของ Google คิดออกมาอยู่ที่ประมาณ $0.009 ต่อนาที ภายใต้การคิดราคาตามโทเคน อัตรา $0.54 ต่อชั่วโมงเสียงของ Microsoft เป็นราคาเปิดตัวที่ Microsoft ระบุว่าใช้ถึงสิ้นปี โดยไม่เปิดเผยราคามาตรฐาน — โครงสร้างเดียวกับที่ใช้ในการเปิดตัวแบบแบตช์เมื่อเดือนกันยายนของบริษัท

Screenshot of the Artificial Analysis Speech-to-Text leaderboard page showing the AA-WER Streaming Index chart, which plots final-transcript word error rate against time to final transcription after end of speech across the streaming field; MAI-Transcribe-2-Streaming does not appear on the chart.

ทำไมช่องว่างความแม่นยำจึงใหญ่กว่าที่เห็น

ช่องว่างอัตราความผิดพลาดระดับคำ 1.5 จุดฟังดูเหมือนความต่างจากการปัดเศษ จนกว่าคุณจะคิดเป็นตัวเลขต้นทุน ที่ WER แบบสตรีมมิ่ง 4.00% Gemini 3.5 Transcribe Live ถอดคำผิดประมาณ 40 คำต่อ 1,000 คำ ส่วนที่ 2.5% ตามที่ Microsoft อ้าง MAI-Transcribe-2-Streaming จะผิด 25 คำ ด้วยปริมาณที่ไปป์ไลน์เรียลไทม์ผลิตออกมา — องค์กรฝ่ายสนับสนุนที่รับสาย 5,000 ชั่วโมงต่อเดือน คิดเป็น 300,000 นาที หรือมากกว่า 45 ล้านคำในอัตราการสนทนา — ช่องว่างนั้นคือคำผิดหลายล้านคำต่อปี ซึ่งกระจุกตัวอยู่ในเอนทิตีที่ระบบปลายทางต้องพึ่งพา ได้แก่ ชื่อบัญชี หมายเลขตั๋ว ขนาดยา และที่อยู่

ความแตกต่างด้านความหน่วงเป็นเรื่องที่ขายยากกว่า 0.13 วินาที เทียบกับ 0.40 วินาทีหลังสิ้นสุดการพูดนั้นรับรู้ได้ในสตรีมคำบรรยายสด — ต่ำกว่าประมาณ 0.2 วินาทีจะรู้สึกเหมือนเกิดขึ้นพร้อมกัน และหนึ่งในสามของวินาทีจะรู้สึกเหมือนบทถอดความกำลังไล่ตามผู้พูด — แต่รับรู้ไม่ได้ในแผงช่วยเหลือเอเจนต์ที่รีเฟรชตามกรอบเวลาของมนุษย์ ถ้าผู้ใช้ปลายทางของคุณคือคนที่อ่านตามไปด้วย ความได้เปรียบด้านความหน่วงของ Microsoft ก็คือตัวผลิตภัณฑ์ ถ้าผู้ใช้ปลายทางของคุณคือโมเดลที่ได้รับบทถอดความฉบับสุดท้ายเมื่อจบเทิร์น มันก็เป็นเพียงตัวเลข

ตัวเลขทั้งสองมีข้อควรระวังเดียวกัน และควรกล่าวไว้เพียงครั้งเดียวว่า นี่เป็นตัวเลขจากการรันครั้งเดียวจากกระดานติดตามที่มีโมเดลอยู่ถึง 37 ตัว และช่องว่างระหว่างอันดับหนึ่งกับอันดับสามบนกระดานนั้นต่ำกว่าหนึ่งจุด การรันซ้ำอาจสับเปลี่ยนตำแหน่งหัวตารางของลีดเดอร์บอร์ดแบบสตรีมมิงได้ในแบบที่ช่องว่างสองจุดบนกระดานแบบแบตช์ทำไม่ได้ และ 2.5% ของ Microsoft ก็ยังไม่ปรากฏบนกระดานนั้นเลยด้วยซ้ำ — มันเป็นคำกล่าวอ้างของผู้ขายที่วัดตามวิธีการของตัวติดตาม ซึ่งเป็นคนละเรื่องกับแถวข้อมูลที่ตัวติดตามเผยแพร่

ขีดจำกัดคือจุดที่การตัดสินใจอยู่จริง

ข้อจำกัดด้านฟีเจอร์แยกสองสิ่งนี้ออกจากกันได้เร็วกว่าที่ benchmark ทำได้ และทั้งสองก็ไปในทิศทางที่ตรงข้ามกัน

Gemini 3.5 Transcribe Live มีข้อจำกัดที่ระบุไว้ในเอกสารสามประการ: เพดานเซสชัน 10 นาทีบน Live API, ไม่มีการแยกผู้พูด, และไม่มีเวลาประทับระดับคำ ข้อจำกัดแรกเป็นเรื่องสถาปัตยกรรม — การสตรีมผ่านเซสชัน WebSocket มีเพดานโดยการออกแบบ — และหมายความว่าการถอดเสียงแบบสดรูปแบบยาวจะต้องถูกเย็บข้ามเซสชัน โดยการจัดการรอยต่อนั้นปล่อยให้เป็นหน้าที่ของคุณ สองข้อหลังเป็นเด็ดขาด: หากผลิตภัณฑ์ของคุณต้องการระบุว่าเสียงพูดเป็นของผู้พูดคนใด หรือต้องการวางคำที่เวลาประทับสำหรับการค้นหาหรือซิงค์คำบรรยาย Gemini 3.5 Transcribe Live ไม่ทำสิ่งนั้นไม่ว่าในราคาใด

ข้อจำกัดของ MAI-Transcribe-2-Streaming มีเอกสารประกอบน้อยกว่า ซึ่งตัวมันเองก็เป็นข้อมูลอย่างหนึ่ง Microsoft ไม่ได้อ้างถึงความสามารถในการแยกผู้พูด (diarization) สำหรับโมเดลสตรีมมิ่ง และไม่ได้อ้างถึงการประทับเวลาแบบรายคำเช่นกัน ส่วน MAI-Transcribe-2 แบบแบตช์นั้นรวมความสามารถในการแยกผู้พูดและส่งคืนการประทับเวลาในระดับคำ แต่นั่นคือผลิตภัณฑ์แบบแบตช์ และการสันนิษฐานว่า SKU แบบสตรีมมิ่งสืบทอดความสามารถเหล่านี้มา ถือเป็นการอนุมานแบบเดียวกับที่เอกสารเปิดตัวมีไว้เพื่อป้องกันพอดี สิ่งที่ Microsoft อ้างคือ 60 ภาษา พร้อมการตรวจจับภาษาต่อเนื่อง และการวางตำแหน่งบนพาเรโตฟรอนเทียร์ในด้านความแม่นยำเทียบกับความหน่วง — ทั้งสองอย่างเป็นถ้อยแถลงของผู้ขายที่ข้อมูลของเทรกเกอร์สอดคล้องด้วย

ดังนั้นการอ่านคุณสมบัติตามจริงก็คือ: โมเดลสตรีมมิ่งทั้งสองไม่เปิดเผยการแยกผู้พูดหรือการประทับเวลาเป็นคำ Gemini 3.5 Transcribe Live มีขีดจำกัดเซสชันที่เปิดเผยและมีระดับฟรี ส่วน MAI-Transcribe-2-Streaming มีจำนวนภาษาที่เปิดเผยและไม่มีขีดจำกัดที่เปิดเผย หากความต้องการของคุณรวมถึงการแยกผู้พูด ทั้งสองตัวนี้ไม่ใช่คำตอบ และคุณกำลังดูการถอดเสียงแบบแบตช์ที่มีเลเยอร์สตรีมมิ่งติดตั้งไว้ด้านหน้า

สิ่งที่ความเท่าเทียมกันของราคากำลังบอกคุณจริง ๆ

ผู้ขายสองรายที่มาถึงจุดเดียวกันที่ $9 ต่อ 1,000 นาทีจากทิศทางตรงกันข้าม ถือเป็นข้อเท็จจริงที่น่าสนใจที่สุดในการเปรียบเทียบนี้ Google ไปถึงจุดนั้นผ่านการคิดราคาตามโทเค็นในเซสชัน Live API: เสียงขาเข้าที่ $3.50 ต่อล้านโทเค็น ข้อความขาออกที่ $21 ต่อล้าน และการใช้ประมาณ 175 โทเค็นข้อความต่อนาที ซึ่งผสมกันแล้วอยู่ที่ประมาณ $0.009 ต่อนาที Microsoft ไปถึงจุดนั้นโดยการเสนอราคาคงที่ $0.54 ต่อชั่วโมงเสียงสำหรับโมเดลในตระกูลหนึ่ง ซึ่งโมเดลพี่น้องแบบแบตช์คิดที่ $0.10 อันหนึ่งเป็นเซสชันเรียลไทม์ที่คิดตามปริมาณการใช้งาน ส่วนอีกอันเป็นอัตราคงที่ต่อนาทีพร้อมส่วนลดช่วงแนะนำ

โครงสร้างเหล่านั้นมีพฤติกรรมที่แตกต่างกันเมื่อคุณขยายขนาด อัตราคงที่นั้นคาดการณ์ได้และง่ายต่อการจัดงบประมาณ ส่วนเซสชันที่คิดตามโทเค็นจะแปรผันตามปริมาณการตอบกลับของโมเดลและระยะเวลาที่เซสชันเปิดค้างไว้ สำหรับไปป์ไลน์ที่มีปริมาณสูง อัตราคงที่คือใบแจ้งหนี้ที่เป็นมิตรกว่า สำหรับต้นแบบหรือฟีเจอร์ปริมาณต่ำ ระดับฟรีและการคิดค่าบริการตามโทเค็นคือทางเข้าที่เป็นมิตรกว่า

A generated bar-comparison card titled 'Two routes to $9.00 per 1,000 minutes' showing MAI-Transcribe-2-Streaming at a flat $0.54 per audio-hour introductory rate and Gemini 3.5 Transcribe Live at roughly $0.009 per minute blended from token pricing, both at $9.00, with MAI-Transcribe-2 (batch sibling) at $1.67, and a note that neither streaming rate has an announced post-promotional successor and that Gemini's blended figure uses $3.50 per million audio-in and $21 per million text-out at about 175 text tokens per minute, with the OrcaRouter logo bottom right.

สิ่งที่การเปลี่ยนแปลงโครงสร้างทั้งสองแบบไม่ได้แตะต้องก็คือเลเยอร์ที่อยู่เหนือทรานสคริปต์ขึ้นไป ไม่ว่าโมเดลใดจะเป็นตัวสร้างมัน ทรานสคริปต์แบบเรียลไทม์ก็เป็นอินพุตสำหรับการสรุป การจำแนกประเภท การปกปิดข้อมูล และการกำหนดเส้นทาง และขั้นตอนเหล่านั้นก็มีเส้นต้นทุนและคุณภาพของตัวเอง ซึ่งปกติมักรันผ่านหลายโมเดลแทนที่จะเป็นโมเดลเดียว นั่นคือเลเยอร์ที่ OrcaRouter ครอบคลุมอยู่: API เดียวที่ใช้ได้กับโมเดล 200+ ตัว ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่บวกเพิ่ม 0% การสลับไปใช้ระบบสำรองอัตโนมัติ และ DSL สำหรับกำหนดเส้นทางที่สามารถส่งทรานสคริปต์ไปยังโมเดลที่ต่างกันตามเวิร์กโหลดได้ ทั้ง MAI-Transcribe-2-Streaming และ Gemini 3.5 Transcribe Live ต่างก็ไม่อยู่ในรายชื่อนั้น — ทั้งสองให้บริการผ่านสแต็กเสียงพูดของ Microsoft และ Google ตามลำดับ — และประเด็นไม่ใช่การกำหนดเส้นทางให้它們 แต่เป็นการทำให้ทุกอย่างที่อยู่ปลายน้ำจาก它们พอร์ตได้

A generated three-axis comparison card titled 'Streaming speech-to-text, on three axes' contrasting MAI-Transcribe-2-Streaming (2.5% streaming WER as a claim, 0.13s to final, 60 languages with automatic detection, no published session cap, diarization not published, word timestamps not published, $9.00 per 1,000 minutes introductory) with Gemini 3.5 Transcribe Live (4.00% streaming WER per Artificial Analysis, 0.40s to final, 85+ languages with mid-stream switching, a 10-minute session cap on the Live API, no diarization, no word timestamps, no session cap published), with the OrcaRouter logo bottom right.

เลือกอันไหนดี

เลือก MAI-Transcribe-2-Streaming เมื่อความแม่นยำและเวลาในการสรุปผลคือผลิตภัณฑ์: คำบรรยายสดที่มนุษย์อ่าน การให้คะแนนด้านการปฏิบัติตามข้อกำหนดหรือคุณภาพแบบเรียลไทม์ซึ่งเอนทิตีที่ได้ยินผิดมีต้นทุน หรือเซสชันยาวที่เพดาน 10 นาทีของ Gemini จะบังคับให้คุณต้องต่อเข้าด้วยกัน เลือก Gemini 3.5 Transcribe Live เมื่อความครอบคลุมคือผลิตภัณฑ์: การปรับใช้ทั่วโลกในหลากหลายภาษาที่คุณไม่สามารถแจกแจงล่วงหน้าได้ การสลับภาษาระหว่างสตรีม หรือต้นแบบที่ระดับฟรีและการคิดค่าบริการต่อโทเค็นขจัดความผูกมัด ทีมที่ต้องการทั้งสองอย่างไม่ติดขัด — ทั้งสองเป็น API ที่แตกต่างกันโดยมีโมเดลเซสชันที่ต่างกัน และสถาปัตยกรรมที่ตรงไปตรงมาคือการกำหนดเส้นทางตามปริมาณงานแทนที่จะสร้างมาตรฐานบนเพียงหนึ่งเดียว

ข้อสรุปที่ควรได้จากการเปรียบเทียบนี้ไม่ใช่ Microsoft ชนะ แต่คือตอนนี้การถอดเสียงแบบสตรีมมิ่งมีตัวเลือกแนวหน้าสองเจ้าที่น่าเชื่อถือและตั้งราคาเท่ากัน ซึ่งหมายความว่าการตัดสินใจได้เปลี่ยนจาก "มีอะไรให้ใช้" ไปเป็น "งานเฉพาะนี้ต้องการอะไร" นั่นเป็นปัญหาที่ดีกว่าที่จะต้องมี

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube