
MAI-Transcribe-2-Streaming เทียบกับ Gemini 3.5 Transcribe Live: ราคา 9 ดอลลาร์เท่ากัน แต่ได้สิ่งที่แลกมาคนละแบบ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 221 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 106 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
MAI-Transcribe-2-Streaming และ Gemini 3.5 Transcribe Live มีค่าใช้จ่ายเท่ากัน และถูกสร้างขึ้นบนแนวคิดที่ตรงกันข้ามเกี่ยวกับจุดประสงค์ของเครื่องถอดเสียงแบบสตรีมมิ่ง ทั้งคู่อยู่ที่ประมาณ $9.00 ต่อเสียงที่สตรีม 1,000 นาที โมเดลของ Microsoft ซึ่งเปิดตัวเมื่อวันที่ 1 ตุลาคม 2026 เป็นเครื่องมือที่มีความแม่นยำ: อัตราความผิดพลาดระดับคำสำหรับการสตรีมที่อ้างว่า 2.5% โดยใช้เวลา 0.13 วินาทีถึงบทถอดเสียงฉบับสุดท้าย อยู่ในอันดับหนึ่งด้านความแม่นยำทั้งบทถอดเสียงฉบับสมบูรณ์และฉบับบางส่วน ตามข้อมูลของ Microsoft เอง วัดด้วยระเบียบวิธีสตรีมมิ่งของ Artificial Analysis แต่ยังไม่ถูกนำมาพล็อตเป็นแถวบนบอร์ดนั้น อีกโมเดลหนึ่ง ซึ่งเปิดให้ทดลองใช้สาธารณะตั้งแต่ 26 สิงหาคม 2026 และให้บริการผ่าน Live API เป็นเครื่องมือด้านความครอบคลุม: มากกว่า 85 ภาษา พร้อมการสลับกลางสตรีม มีระดับใช้งานฟรี และอัตราความผิดพลาดระดับคำสำหรับการสตรีม 4.00% ที่ 0.40 วินาที ซึ่งเป็นตัวเลขที่ Artificial Analysis วัดได้สำหรับโมเดลนี้ ไม่มีตัวไหนเป็นตัวเลือกที่ชัดเจน และเหตุผลก็คือพวกมันไม่ได้แข่งขันกันในภาระงานเดียวกันจริง ๆ
นี่คือการเปรียบเทียบแบบตัวต่อตัวตามที่ตัวเลขชี้จริง — ตัวเลขที่ผู้ขายรายงานโดยระบุไว้ ตัวเลขจากตัวติดตามที่อ้างอิงที่มา และส่วนที่โมเดลหนึ่งชนะในมิติที่อีกโมเดลไม่ได้แข่งด้วยเลย
เวอร์ชันบรรทัดเดียว
• ความแม่นยำและความหน่วง — MAI-Transcribe-2-Streaming จากตัวเลขที่เผยแพร่ Microsoft อ้างว่า WER แบบสตรีมมิ่ง 2.5% ที่ 0.13 วินาทีสู่ทรานสคริปต์ฉบับสมบูรณ์ เป็นที่หนึ่งด้านความแม่นยำทั้งทรานสคริปต์ฉบับสมบูรณ์และบางส่วน และ 2.5% สำหรับบางส่วนแรกที่ 0.12 วินาที ในทางกลับกัน Artificial Analysis มี Gemini 3.5 Transcribe Live อยู่ที่ 4.00% ที่ 0.40 วินาที ข้อได้เปรียบที่ Microsoft อ้างคือ 1.5 จุด และเร็วกว่าในการสรุปผลประมาณสามเท่า ข้อแม้คือตัวติดตามยังไม่ได้พล็อต MAI-Transcribe-2-Streaming เอง — ผู้นำปัจจุบันบนกระดานคือ Grok Voice Transcribe 2.0 ที่ 2.73% และ 0.49 วินาที โดยมี Muse Voice Transcribe ที่ 3.06% และ 0.16 วินาที — ดังนั้น 2.5% จึงเป็นตัวเลขจากผู้ขายที่อ่านเทียบกับกลุ่มที่ตัวติดตามวัดจริง ไม่ใช่การตัดสินที่สูสีบนแกนที่ทั้งสองโมเดลเผยแพร่ แต่มีเพียงด้านเดียวเท่านั้นที่ได้รับการเผยแพร่อย่างอิสระ
• ความกว้างของภาษา — Gemini 3.5 Transcribe Live รองรับ 85+ ภาษา พร้อมการตรวจจับอัตโนมัติและความสามารถในการสลับภาษาระหว่างสตรีมโดยไม่ต้องเริ่มเซสชันใหม่ ซึ่งเป็นคำกล่าวอ้างหลักของ Google สำหรับ Live API ส่วน MAI-Transcribe-2-Streaming รองรับ 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ พื้นของ Microsoft สูงกว่า เพดานของ Google กว้างกว่า และช่องว่าง 25 ภาษาส่วนใหญ่อยู่ในภาษาที่โมเดลสตรีมมิ่งแบบภาษาเดียวไม่สามารถใช้งานได้เลย
• รูปแบบเซสชัน — Gemini 3.5 Transcribe Live และอันนี้มีทั้งข้อดีและข้อเสีย The Live API เป็นเซสชัน WebSocket ที่จำกัดไว้ที่ 10 นาที ซึ่งเหมาะสำหรับเทิร์นของเอเจนต์เสียง และไม่สะดวกสำหรับการประชุมยาวหนึ่งชั่วโมง; Microsoft ไม่ได้เผยแพร่เพดานเซสชันที่เทียบเท่ากันสำหรับโมเดลสตรีมมิ่งของตน ซึ่งสำคัญถ้าหน่วยงานของคุณคือการโทรหนึ่งครั้ง ไม่ใช่เทิร์นการสนทนา
• ค่าใช้จ่ายเริ่มต้น — Gemini 3.5 Transcribe Live มีแพ็กเกจฟรี และอัตราแบบผสมของ Google คิดออกมาอยู่ที่ประมาณ $0.009 ต่อนาที ภายใต้การคิดราคาตามโทเคน อัตรา $0.54 ต่อชั่วโมงเสียงของ Microsoft เป็นราคาเปิดตัวที่ Microsoft ระบุว่าใช้ถึงสิ้นปี โดยไม่เปิดเผยราคามาตรฐาน — โครงสร้างเดียวกับที่ใช้ในการเปิดตัวแบบแบตช์เมื่อเดือนกันยายนของบริษัท

ทำไมช่องว่างความแม่นยำจึงใหญ่กว่าที่เห็น
ช่องว่างอัตราความผิดพลาดระดับคำ 1.5 จุดฟังดูเหมือนความต่างจากการปัดเศษ จนกว่าคุณจะคิดเป็นตัวเลขต้นทุน ที่ WER แบบสตรีมมิ่ง 4.00% Gemini 3.5 Transcribe Live ถอดคำผิดประมาณ 40 คำต่อ 1,000 คำ ส่วนที่ 2.5% ตามที่ Microsoft อ้าง MAI-Transcribe-2-Streaming จะผิด 25 คำ ด้วยปริมาณที่ไปป์ไลน์เรียลไทม์ผลิตออกมา — องค์กรฝ่ายสนับสนุนที่รับสาย 5,000 ชั่วโมงต่อเดือน คิดเป็น 300,000 นาที หรือมากกว่า 45 ล้านคำในอัตราการสนทนา — ช่องว่างนั้นคือคำผิดหลายล้านคำต่อปี ซึ่งกระจุกตัวอยู่ในเอนทิตีที่ระบบปลายทางต้องพึ่งพา ได้แก่ ชื่อบัญชี หมายเลขตั๋ว ขนาดยา และที่อยู่
ความแตกต่างด้านความหน่วงเป็นเรื่องที่ขายยากกว่า 0.13 วินาที เทียบกับ 0.40 วินาทีหลังสิ้นสุดการพูดนั้นรับรู้ได้ในสตรีมคำบรรยายสด — ต่ำกว่าประมาณ 0.2 วินาทีจะรู้สึกเหมือนเกิดขึ้นพร้อมกัน และหนึ่งในสามของวินาทีจะรู้สึกเหมือนบทถอดความกำลังไล่ตามผู้พูด — แต่รับรู้ไม่ได้ในแผงช่วยเหลือเอเจนต์ที่รีเฟรชตามกรอบเวลาของมนุษย์ ถ้าผู้ใช้ปลายทางของคุณคือคนที่อ่านตามไปด้วย ความได้เปรียบด้านความหน่วงของ Microsoft ก็คือตัวผลิตภัณฑ์ ถ้าผู้ใช้ปลายทางของคุณคือโมเดลที่ได้รับบทถอดความฉบับสุดท้ายเมื่อจบเทิร์น มันก็เป็นเพียงตัวเลข
ตัวเลขทั้งสองมีข้อควรระวังเดียวกัน และควรกล่าวไว้เพียงครั้งเดียวว่า นี่เป็นตัวเลขจากการรันครั้งเดียวจากกระดานติดตามที่มีโมเดลอยู่ถึง 37 ตัว และช่องว่างระหว่างอันดับหนึ่งกับอันดับสามบนกระดานนั้นต่ำกว่าหนึ่งจุด การรันซ้ำอาจสับเปลี่ยนตำแหน่งหัวตารางของลีดเดอร์บอร์ดแบบสตรีมมิงได้ในแบบที่ช่องว่างสองจุดบนกระดานแบบแบตช์ทำไม่ได้ และ 2.5% ของ Microsoft ก็ยังไม่ปรากฏบนกระดานนั้นเลยด้วยซ้ำ — มันเป็นคำกล่าวอ้างของผู้ขายที่วัดตามวิธีการของตัวติดตาม ซึ่งเป็นคนละเรื่องกับแถวข้อมูลที่ตัวติดตามเผยแพร่
ขีดจำกัดคือจุดที่การตัดสินใจอยู่จริง
ข้อจำกัดด้านฟีเจอร์แยกสองสิ่งนี้ออกจากกันได้เร็วกว่าที่ benchmark ทำได้ และทั้งสองก็ไปในทิศทางที่ตรงข้ามกัน
Gemini 3.5 Transcribe Live มีข้อจำกัดที่ระบุไว้ในเอกสารสามประการ: เพดานเซสชัน 10 นาทีบน Live API, ไม่มีการแยกผู้พูด, และไม่มีเวลาประทับระดับคำ ข้อจำกัดแรกเป็นเรื่องสถาปัตยกรรม — การสตรีมผ่านเซสชัน WebSocket มีเพดานโดยการออกแบบ — และหมายความว่าการถอดเสียงแบบสดรูปแบบยาวจะต้องถูกเย็บข้ามเซสชัน โดยการจัดการรอยต่อนั้นปล่อยให้เป็นหน้าที่ของคุณ สองข้อหลังเป็นเด็ดขาด: หากผลิตภัณฑ์ของคุณต้องการระบุว่าเสียงพูดเป็นของผู้พูดคนใด หรือต้องการวางคำที่เวลาประทับสำหรับการค้นหาหรือซิงค์คำบรรยาย Gemini 3.5 Transcribe Live ไม่ทำสิ่งนั้นไม่ว่าในราคาใด
ข้อจำกัดของ MAI-Transcribe-2-Streaming มีเอกสารประกอบน้อยกว่า ซึ่งตัวมันเองก็เป็นข้อมูลอย่างหนึ่ง Microsoft ไม่ได้อ้างถึงความสามารถในการแยกผู้พูด (diarization) สำหรับโมเดลสตรีมมิ่ง และไม่ได้อ้างถึงการประทับเวลาแบบรายคำเช่นกัน ส่วน MAI-Transcribe-2 แบบแบตช์นั้นรวมความสามารถในการแยกผู้พูดและส่งคืนการประทับเวลาในระดับคำ แต่นั่นคือผลิตภัณฑ์แบบแบตช์ และการสันนิษฐานว่า SKU แบบสตรีมมิ่งสืบทอดความสามารถเหล่านี้มา ถือเป็นการอนุมานแบบเดียวกับที่เอกสารเปิดตัวมีไว้เพื่อป้องกันพอดี สิ่งที่ Microsoft อ้างคือ 60 ภาษา พร้อมการตรวจจับภาษาต่อเนื่อง และการวางตำแหน่งบนพาเรโตฟรอนเทียร์ในด้านความแม่นยำเทียบกับความหน่วง — ทั้งสองอย่างเป็นถ้อยแถลงของผู้ขายที่ข้อมูลของเทรกเกอร์สอดคล้องด้วย
ดังนั้นการอ่านคุณสมบัติตามจริงก็คือ: โมเดลสตรีมมิ่งทั้งสองไม่เปิดเผยการแยกผู้พูดหรือการประทับเวลาเป็นคำ Gemini 3.5 Transcribe Live มีขีดจำกัดเซสชันที่เปิดเผยและมีระดับฟรี ส่วน MAI-Transcribe-2-Streaming มีจำนวนภาษาที่เปิดเผยและไม่มีขีดจำกัดที่เปิดเผย หากความต้องการของคุณรวมถึงการแยกผู้พูด ทั้งสองตัวนี้ไม่ใช่คำตอบ และคุณกำลังดูการถอดเสียงแบบแบตช์ที่มีเลเยอร์สตรีมมิ่งติดตั้งไว้ด้านหน้า
สิ่งที่ความเท่าเทียมกันของราคากำลังบอกคุณจริง ๆ
ผู้ขายสองรายที่มาถึงจุดเดียวกันที่ $9 ต่อ 1,000 นาทีจากทิศทางตรงกันข้าม ถือเป็นข้อเท็จจริงที่น่าสนใจที่สุดในการเปรียบเทียบนี้ Google ไปถึงจุดนั้นผ่านการคิดราคาตามโทเค็นในเซสชัน Live API: เสียงขาเข้าที่ $3.50 ต่อล้านโทเค็น ข้อความขาออกที่ $21 ต่อล้าน และการใช้ประมาณ 175 โทเค็นข้อความต่อนาที ซึ่งผสมกันแล้วอยู่ที่ประมาณ $0.009 ต่อนาที Microsoft ไปถึงจุดนั้นโดยการเสนอราคาคงที่ $0.54 ต่อชั่วโมงเสียงสำหรับโมเดลในตระกูลหนึ่ง ซึ่งโมเดลพี่น้องแบบแบตช์คิดที่ $0.10 อันหนึ่งเป็นเซสชันเรียลไทม์ที่คิดตามปริมาณการใช้งาน ส่วนอีกอันเป็นอัตราคงที่ต่อนาทีพร้อมส่วนลดช่วงแนะนำ
โครงสร้างเหล่านั้นมีพฤติกรรมที่แตกต่างกันเมื่อคุณขยายขนาด อัตราคงที่นั้นคาดการณ์ได้และง่ายต่อการจัดงบประมาณ ส่วนเซสชันที่คิดตามโทเค็นจะแปรผันตามปริมาณการตอบกลับของโมเดลและระยะเวลาที่เซสชันเปิดค้างไว้ สำหรับไปป์ไลน์ที่มีปริมาณสูง อัตราคงที่คือใบแจ้งหนี้ที่เป็นมิตรกว่า สำหรับต้นแบบหรือฟีเจอร์ปริมาณต่ำ ระดับฟรีและการคิดค่าบริการตามโทเค็นคือทางเข้าที่เป็นมิตรกว่า

สิ่งที่การเปลี่ยนแปลงโครงสร้างทั้งสองแบบไม่ได้แตะต้องก็คือเลเยอร์ที่อยู่เหนือทรานสคริปต์ขึ้นไป ไม่ว่าโมเดลใดจะเป็นตัวสร้างมัน ทรานสคริปต์แบบเรียลไทม์ก็เป็นอินพุตสำหรับการสรุป การจำแนกประเภท การปกปิดข้อมูล และการกำหนดเส้นทาง และขั้นตอนเหล่านั้นก็มีเส้นต้นทุนและคุณภาพของตัวเอง ซึ่งปกติมักรันผ่านหลายโมเดลแทนที่จะเป็นโมเดลเดียว นั่นคือเลเยอร์ที่ OrcaRouter ครอบคลุมอยู่: API เดียวที่ใช้ได้กับโมเดล 200+ ตัว ราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่บวกเพิ่ม 0% การสลับไปใช้ระบบสำรองอัตโนมัติ และ DSL สำหรับกำหนดเส้นทางที่สามารถส่งทรานสคริปต์ไปยังโมเดลที่ต่างกันตามเวิร์กโหลดได้ ทั้ง MAI-Transcribe-2-Streaming และ Gemini 3.5 Transcribe Live ต่างก็ไม่อยู่ในรายชื่อนั้น — ทั้งสองให้บริการผ่านสแต็กเสียงพูดของ Microsoft และ Google ตามลำดับ — และประเด็นไม่ใช่การกำหนดเส้นทางให้它們 แต่เป็นการทำให้ทุกอย่างที่อยู่ปลายน้ำจาก它们พอร์ตได้

เลือกอันไหนดี
เลือก MAI-Transcribe-2-Streaming เมื่อความแม่นยำและเวลาในการสรุปผลคือผลิตภัณฑ์: คำบรรยายสดที่มนุษย์อ่าน การให้คะแนนด้านการปฏิบัติตามข้อกำหนดหรือคุณภาพแบบเรียลไทม์ซึ่งเอนทิตีที่ได้ยินผิดมีต้นทุน หรือเซสชันยาวที่เพดาน 10 นาทีของ Gemini จะบังคับให้คุณต้องต่อเข้าด้วยกัน เลือก Gemini 3.5 Transcribe Live เมื่อความครอบคลุมคือผลิตภัณฑ์: การปรับใช้ทั่วโลกในหลากหลายภาษาที่คุณไม่สามารถแจกแจงล่วงหน้าได้ การสลับภาษาระหว่างสตรีม หรือต้นแบบที่ระดับฟรีและการคิดค่าบริการต่อโทเค็นขจัดความผูกมัด ทีมที่ต้องการทั้งสองอย่างไม่ติดขัด — ทั้งสองเป็น API ที่แตกต่างกันโดยมีโมเดลเซสชันที่ต่างกัน และสถาปัตยกรรมที่ตรงไปตรงมาคือการกำหนดเส้นทางตามปริมาณงานแทนที่จะสร้างมาตรฐานบนเพียงหนึ่งเดียว
ข้อสรุปที่ควรได้จากการเปรียบเทียบนี้ไม่ใช่ Microsoft ชนะ แต่คือตอนนี้การถอดเสียงแบบสตรีมมิ่งมีตัวเลือกแนวหน้าสองเจ้าที่น่าเชื่อถือและตั้งราคาเท่ากัน ซึ่งหมายความว่าการตัดสินใจได้เปลี่ยนจาก "มีอะไรให้ใช้" ไปเป็น "งานเฉพาะนี้ต้องการอะไร" นั่นเป็นปัญหาที่ดีกว่าที่จะต้องมี
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
