การ์ดชื่อเรื่องฮีโร่ที่สร้างขึ้นสำหรับการเปรียบเทียบ Voxtral Mini 4B Realtime Arabic และ MAI-Transcribe-2-Streaming โดยมีคำบรรยายย่อยว่า 'สองสิ่งที่มาถึงในเดือนตุลาคม สองปัญหาเรื่องหลักฐาน' มีป้ายกำกับว่า 'ตุลาคม 2026 ทั้งคู่รายงานโดยผู้ขาย' พร้อมชิปสถิติสามชิปที่แสดงอัตราความผิดพลาดระดับตัวอักษรภาษาอาหรับ 8.82% ที่ 480ms เทียบกับอัตราความผิดพลาดระดับคำ 2.5% ที่ 0.13s, 16 ภาษาถิ่นเทียบกับ 60 ภาษา, และน้ำหนัก Apache 2.0 เทียบกับ Azure preview ที่ $0.54 ต่อชั่วโมงเสียง และโลโก้ OrcaRouter ที่คอมโพสิตในแถบสีขาวที่มุมล่างขวา
Guides & Insights

Voxtral Mini 4B Realtime Arabic เทียบกับ MAI-Transcribe-2-Streaming: การมาถึงสองรายการในเดือนตุลาคม ปัญหาด้านหลักฐานสองประการ

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เจ็ดวันคั่นกลางระหว่างโมเดลเสียงแบบเรียลไทม์สองตัวนี้ และมันมาถึงในวิธีที่ตรงกันข้าม MAI-Transcribe-2-Streaming เป็นโมเดลถอดเสียงแบบสตรีมมิ่งตัวแรกของ Microsoft AI ประกาศเมื่อวันที่ 1 ตุลาคม 2026 พร้อมโพสต์เปิดตัว รายการพรีวิวบน Azure ราคา $0.54 ต่อชั่วโมงเสียงในช่วงแนะนำจนถึงสิ้นปี และคำกล่าวอ้างว่าเป็นที่หนึ่งบนกระดานสตรีมมิ่งของ Artificial Analysis ทั้งด้านความแม่นยำของทรานสคริปต์ฉบับสมบูรณ์และฉบับบางส่วน ด้วยอัตราความผิดพลาดระดับคำ 2.5% โดยข้อความฉบับสมบูรณ์พร้อมภายใน 0.13 วินาทีหลังสิ้นสุดการพูด Voxtral Mini 4B Realtime Arabic เป็นโมเดลสตรีมมิ่งภาษาอาหรับถิ่นของ Mistral AI เผยแพร่บน Hugging Face เมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีการประกาศใด ๆ เลย — ไม่มีโพสต์บล็อก ไม่มีราคา ไม่มีบริการ มีเพียงน้ำหนักโมเดลภายใต้ Apache 2.0 และการ์ดโมเดลที่รายงานค่าเฉลี่ย Character Error Rate 8.82% จากเกณฑ์วัดภาษาอาหรับเจ็ดรายการที่ความหน่วง 480 มิลลิวินาที โมเดลของ Microsoft เป็นผลิตภัณฑ์ที่เสร็จสมบูรณ์พร้อมพาดหัวที่ตรวจสอบไม่ได้ โมเดลของ Mistral เป็นชิ้นงานที่ตรวจสอบได้โดยไม่มีผลิตภัณฑ์อยู่รอบ ๆ ทั้งคู่ควรค่าแก่การทำความเข้าใจ precisely เพราะทั้งคู่ต่างทิ้งคำถามหลัก — ว่าโมเดลนี้รับมือกับภาษาอาหรับได้ดีเพียงใด — ให้มีเพียงผู้ขายเท่านั้นที่ให้คำตอบ

การเปรียบเทียบนี้ก็ยังคุ้มค่าที่จะทำ เพราะโมเดลทั้งสองวางกรอบการตัดสินใจทางวิศวกรรมเดียวกันจากคนละสุดทางกัน Microsoft ขายความกว้างและบริการแบบจัดการ: 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ทำงานภายใน Azure AI Speech คิดราคาต่อชั่วโมง และอยู่ในช่วงพรีวิว Mistral ปล่อยความลึกให้ฟรี: ภาษาถิ่นอาหรับที่มีชื่อเรียก 16 ชนิด เล็กพอที่จะรันบนตัวเร่งความเร็วตัวเดียว พร้อมสคริปต์ปรับมาตรฐานเพื่อให้คุณตรวจสอบการให้คะแนนได้ด้วยตัวเอง หากคุณกำลังตั้งระบบไปป์ไลน์ถอดเสียงภาษาอาหรับเดือนนี้ คุณกำลังเลือกระหว่างสองจุดยืนนั้น และการเลือกขึ้นอยู่กับหลักฐานที่คุณยังไม่มีในทั้งสองกรณี

สิ่งที่ผู้ขายแต่ละรายกล่าวไว้จริง ๆ และสิ่งที่คณะกรรมการกล่าว

ช่องว่างทางหลักฐานเป็นลักษณะที่สำคัญที่สุดของการจับคู่นี้ จึงต้องกล่าวถึงเป็นอันดับแรก

• MAI-Transcribe-2-Streaming — อัตราความผิดพลาดระดับคำของบทถอดเสียงฉบับสมบูรณ์ที่ 2.5% ณ 0.13 วินาทีหลังจากสิ้นสุดการพูด และ 2.5% เดียวกันบนผลลัพธ์บางส่วนชุดแรกที่ 0.12 วินาที โดยทั้งคู่ถูกนำเสนอเป็นอันดับหนึ่งด้านความแม่นยำตามระเบียบวิธี AA-WER Streaming ของ Artificial Analysis เป็นกรอบการนำเสนอของ Microsoft เอง ณ เวลาที่ร่างบทความนี้ กระดานสตรีมมิ่งของแทร็กเกอร์ยังไม่ได้พล็อตแถวสำหรับโมเดลนี้ ดังนั้นข้อกล่าวอ้างจึงตั้งอยู่บนระเบียบวิธีของแทร็กเกอร์ โดยไม่มีตัวเลขที่แทร็กเกอร์เผยแพร่รองรับอยู่เบื้องหลัง

• Voxtral Mini 4B Realtime Arabic — อัตราความผิดพลาดระดับอักขระเฉลี่ย 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับเจ็ดรายการ ที่ความหน่วงที่ตั้งค่าไว้ 480 มิลลิวินาที การ์ดของ Mistral เอง พร้อมโค้ดการประเมินผลที่ให้มาด้วย ยังไม่มีบุคคลที่สามรายใดทำซ้ำผลลัพธ์นี้ได้ และโมเดลนี้มีอายุเพียงสองวัน

ตัวเลขพาดหัวสองตัวในบทความนี้ ตามลำดับ คือ คำกล่าวอ้างของผู้ขายบนไม้บรรทัดของคนอื่น และคำกล่าวอ้างของผู้ขายที่แนบไม้บรรทัดของตัวเองมาด้วย ไม่มีตัวใดเป็นการวัดที่เป็นอิสระ สิ่งที่ต่างกันคือ ตัวเลขของ Mistral มาพร้อมสคริปต์นอร์มัลไลเซชันที่คุณต้องใช้เพื่อคำนวณค่านั้นใหม่ ส่วนของ Microsoft มาพร้อมบอร์ดที่ยังไม่ได้นำมันขึ้นชาร์ต หากคุณกำลังตัดสินใจเรื่องการจัดซื้อ ความแตกต่างนั้นสำคัญกว่าส่วนต่างระหว่าง 2.5 กับ 8.82 ซึ่งไม่มีความหมายอยู่แล้ว — อัตราความผิดพลาดระดับคำและอัตราความผิดพลาดระดับตัวอักษรไม่สามารถแปลงหากันได้ และอักขรวิธีอาหรับทำให้ช่องว่างระหว่างสองค่านี้กว้างขึ้นอย่างมาก

การเปรียบเทียบเพียงหนึ่งเดียวในโมเดลการ์ดของ Mistral ที่ได้ผลจริง คือการเปรียบเทียบกับรุ่นพี่น้องออฟไลน์ของตัวเอง: Voxtral Transcribe Arabic ที่ 7.91% CER บนเจ็ดเบนช์มาร์กชุดเดียวกันโดยใช้การนอร์มัลไลซ์แบบเดียวกัน ดังนั้นสตรีมมิงทำให้โมเดลนี้เสีย 0.91 จุดเปอร์เซ็นต์ Microsoft เผยแพร่ตัวเลขเทียบเท่าสำหรับตระกูลของตัวเองเมื่อเปิดตัว MAI-Transcribe-2 แบบแบตช์เมื่อวันที่ 3 กันยายน 2026 ที่อัตราความผิดพลาดระดับคำ 2.0% — รุ่นสตรีมมิงยอมเสียครึ่งจุดเมื่อเทียบกับโมเดลแบบแบตช์ ขณะที่เพิ่มการส่งมอบแบบเรียลไทม์ เมื่ออ่านส่วนต่างภายในผู้ขายสองรายนั้นวางเทียบกัน คุณจะได้ข้อความเปรียบเทียบที่เทียบกันได้ตรงๆ เพียงข้อเดียวในบทความนี้: บนเบนช์มาร์กของตัวเอง SKU สตรีมมิงของแต่ละแล็บตามหลังรุ่นพี่น้องแบบแบตช์ของตน ราวหนึ่งจุดในกรณีหนึ่ง และครึ่งจุดในอีกกรณี และทั้งสองกำลังวัดภาษาที่ต่างกัน

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

ความครอบคลุมภาษา: 60 เทียบกับ 16 และช่องว่างที่ไม่มีชื่อเดียวกันในทั้งสองฝ่าย

• MAI-Transcribe-2-Streaming — รองรับ 60 ภาษา พร้อมการตรวจจับภาษาแบบต่อเนื่องอัตโนมัติ ดังนั้นเซสชันที่สลับภาษาไปมาระหว่างสตรีมจึงไม่จำเป็นต้องระบุภาษาล่วงหน้า เอกสารเปิดตัวของ Microsoft ให้เฉพาะจำนวน แต่ไม่ได้ให้รายการ ส่วนเอกสารประกอบการสนับสนุนภาษาของ Azure สำหรับตระกูล MAI-Transcribe คือที่ที่มีการแจกแจงความครอบคลุมไว้เป็นรายการ และได้ระบุภาษาอาหรับไว้ในบรรดาภาษาที่รองรับสำหรับตระกูลนี้

• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 สายพันธุ์ โดยระบุชื่อแต่ละสายพันธุ์ดังนี้: ภาษาอาหรับมาตรฐานสมัยใหม่, อาหรับโมร็อกโก, อาหรับลิเบีย, อาหรับตูนิเซีย, อาหรับแอลจีเรียและฮัสซานียา, อาหรับอ่าว, อาหรับนัจดี, อาหรับโอมานและซานานี, อาหรับอียิปต์และซูดาน, อาหรับเมโสโปเตเมีย และอาหรับลิแวนต์ใต้กับลิแวนต์เหนือ, และอาหรับชาด นอกเหนือจากชุดนี้ เอกสารระบุว่าโมเดลอยู่นอกขอบเขต พร้อมตัวชี้ไปยัง Voxtral Mini 4B Realtime ทั่วไป

ตัวเลขทั้งสองไม่ได้บอกสิ่งที่คุณจำเป็นต้องรู้ 60 ของ Microsoft เป็นการนับตามความกว้างซึ่งรวมภาษาอาหรับไว้ โดยไม่ได้อธิบายประสิทธิภาพของภาษาอาหรับ โพสต์เปิดตัวระบุจำนวนภาษาทั้งหมดเพียงครั้งเดียวแล้วผ่านไป 16 ของ Mistral เป็นการแจกแจงเป้าหมายการฝึกพร้อมอัตราความผิดพลาดรวมเพียงค่าเดียวจากเจ็ดชุดเบนช์มาร์ก ซึ่งหมายความว่ารายละเอียดแยกตามภาษาถิ่น — สิ่งที่จริง ๆ แล้วเป็นตัวกำหนดว่าเสียงสายสนทนาภาษาโมร็อกโกของคุณจะถอดความเป็นข้อความได้หรือไม่ — ก็ไม่ได้ถูกเผยแพร่เช่นกัน สองโมเดล สองผู้ขาย และในทั้งสองกรณี คำตอบที่ซื่อตรงต่อคำถามที่ว่า "มันเก่งแค่ไหนกับภาษาอาหรับอ่าวโดยเฉพาะ" คือ: ไม่ได้ระบุไว้

สิ่งที่การแจกแจงรายการให้กับคุณก็คือไพรเออร์ โมเดลที่ระบุให้ภาษาอาหรับชาดและภาษาอาหรับฮัสซานียาเป็นเป้าหมายนั้นถูกปรับแต่งให้สอดคล้องกับการกระจายข้อมูลของแอฟริกาเหนือ Mistral ร่วมพัฒนากับ Ministère de la Transition Numérique et de la Réforme Administrative ของโมร็อกโก และสร้างสองในเจ็ดเบนช์มาร์กร่วมกับกระทรวงนั้น ได้แก่ ISMA และ Darija in the Wild โดยเฉพาะเพื่อวัดกรณีที่ยาก โมเดลทั่วไปที่มี 60 ภาษาจะพัฒนาปรับปรุงภาษาอาหรับมาตรฐานสมัยใหม่ก่อน เพราะนั่นคือที่ที่ปริมาณสัญญาณการฝึกอยู่ ถ้าเสียงของคุณเป็นดาริจาหรืออาหรับโกล์ฟ นั่นเป็นปัญหาที่ต่างออกไป และมีเพียงหนึ่งในสองผู้ให้บริการรายนี้เท่านั้นที่ให้ตัวเลขไว้กับภาษาใดภาษาหนึ่ง

ความหน่วงและรูปร่างของความล่าช้า

• MAI-Transcribe-2-Streaming — 0.13 วินาทีจากจุดสิ้นสุดของคำพูดถึงทรานสคริปต์ฉบับสมบูรณ์ และพาร์เชียลแรกที่ 0.12 วินาที ซึ่งเร็วพอจนพาร์เชียลและฉบับสมบูรณ์มีเวลาหน่วงเท่ากันในทางปฏิบัติ นี่คือข้อกล่าวอ้างของ Microsoft ที่วัดตามวิธีการของ tracker

• Voxtral Mini 4B Realtime Arabic — ความหน่วงที่กำหนดค่าไว้ 480 มิลลิวินาที ณ จุดความแม่นยำที่เผยแพร่ โดยสามารถปรับความหน่วงได้ ซึ่งคิดเป็นประมาณสามเท่าครึ่งของตัวเลขจาก Microsoft และเป็นพารามิเตอร์ที่ผู้ดำเนินการเลือก ไม่ใช่คุณสมบัติแบบตายตัว

สามในสิบของวินาทีเป็นความแตกต่างจริงสำหรับ voice agent ที่ต้องตอบสนองกลางถ้อยคำ และแทบมองไม่เห็นสำหรับมนุษย์ที่อ่านคำบรรยาย มันยังเป็นความแตกต่างระหว่างปุ่มหมุนกับตัวเลขด้วย พารามิเตอร์ delay ของ Mistral หมายความว่าคุณสามารถปรับให้แน่นขึ้นและยอมรับข้อผิดพลาดมากขึ้น หรือผ่อนลงและได้ความแม่นยำกลับคืนมา — โมเดลฐานที่ checkpoint นี้ถูก fine-tune มาจากโมเดลนั้นโฆษณาช่วงตั้งแต่ 240 มิลลิวินาทีถึง 2.4 วินาที — ในขณะที่ operating point ของ Microsoft คือสิ่งที่ Azure ปล่อยให้ใช้ นั่นทำให้ตัวเลขของ Microsoft เข้าใจเชิงเหตุผลได้ง่ายกว่า และของ Mistral ปรับแต่งได้ง่ายกว่า และหมายความว่าการเปรียบเทียบตัวเลขความแม่นยำสองตัวใด ๆ แท้จริงแล้วเป็นการเปรียบเทียบจุดที่เลือกไว้สองจุดบนเส้นโค้งหนึ่ง กับจุดคงที่หนึ่งจุดบนอีกเส้นโค้งหนึ่ง

ขอบเขตของคุณลักษณะก็แตกต่างกันอย่างชัดเจนไม่แพ้กัน และควรค่าแก่การตรวจสอบเทียบกับข้อกำหนดไปป์ไลน์ของคุณก่อนที่การอภิปรายเรื่องความแม่นยำจะเริ่มน่าสนใจ

• MAI-Transcribe-2-Streaming — ให้บริการผ่าน Azure AI Speech พร้อมชุดคุณลักษณะที่ระบุไว้ในเอกสารของตระกูลนี้: การแยกผู้พูด (diarization), การประทับเวลาระดับคำ, การให้น้ำหนักคำสำคัญและวลี, รูปแบบเอาต์พุตแบบคำต่อคำเทียบกับแบบเรียบเรียง และการระบุภาษาอัตโนมัติ เอกสารของ SKU แบบสตรีมมิ่งเองสำหรับการแยกผู้พูดและการประทับเวลามีรายละเอียดน้อยกว่าเอกสารของโมเดลแบบแบตช์ ดังนั้นโปรดยืนยันสิ่งเหล่านั้นในแต่ละ endpoint แทนที่จะสันนิษฐานว่ามีความเท่าเทียมกัน

Screenshot of the Microsoft Learn documentation page 'Use a MAI-Transcribe model' in Azure AI Speech, captured 10 October 2026, showing the public preview notice that the feature is provided without a service-level agreement and is not recommended for production workloads, alongside the statement that MAI-Transcribe is a next-generation speech-to-text model built in-house by the Microsoft AI team covering 60 languages.

• Voxtral Mini 4B Realtime Arabic — การ์ดนี้บันทึกการถอดเสียงด้วยตัวเข้ารหัสเสียงเชิงสาเหตุ, การให้บริการ vLLM ผ่าน WebSocket ที่ /v1/realtime, การรองรับ Transformers แบบเนทีฟตั้งแต่เวอร์ชัน 5.2.0 และโมดูลการทำให้เป็นมาตรฐาน ไม่ได้ระบุการแยกผู้พูดหรือการประทับเวลาในระดับคำสำหรับเช็คพอยต์นี้

รูปแบบการให้บริการ: บริการพรีวิวเทียบกับน้ำหนักที่ดาวน์โหลดได้

• MAI-Transcribe-2-Streaming — Azure พรีวิว ซึ่งหมายความว่าไม่มี SLA และมีคำแนะนำจากผู้ขายให้หลีกเลี่ยงการพึ่งพาในการใช้งานโปรดักชัน ราคาอยู่ที่ $0.54 ต่อชั่วโมงเสียงเป็นอัตราเปิดตัวที่มีผลจนถึงสิ้นปี 2026 โดยยังไม่มีการเผยแพร่อัตรามาตรฐาน; MAI-Transcribe-2 แบบแบตช์เปิดตัวที่ราคา $0.10 ต่อชั่วโมงเสียงภายใต้เงื่อนไขเวลาจำกัดเดียวกัน ค่าบริการสตรีมมิ่งคิดเป็น 5.4 เท่าของอัตราแบตช์

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, พารามิเตอร์ประมาณ 4.4 พันล้านตัวใน BF16, ดาวน์โหลดได้, ปรับจูนละเอียดได้ และให้บริการได้บนตัวเร่งความเร็วเพียงตัวเดียว ไม่มีราคา ไม่มี SLA และไม่มีข้อผูกพันด้านการสนับสนุน เพราะไม่มีบริการใดอยู่เบื้องหลังมัน

การตัดสินใจอยู่ในสองประโยคนั้น บริการพรีวิวที่มีเรตเปิดตัวและราคามาตรฐานที่ยังไม่เปิดเผยคือคำมั่นที่มีวันหมดอายุ; ค่าพรีเมียมสตรีมมิ่ง 5.4 เท่า และช่วงเวลาถึงปี 2026 ต่างเป็นสิ่งที่ Microsoft เปลี่ยนแปลงได้เอง และอัตราส่วนแบตช์ต่อสตรีมมิ่งคือตัวเลขที่ต้องจับตาดูเมื่อเรตมาตรฐานมีผล เวต Apache 2.0 ที่ไม่มีการประกาศใด ๆ กลับตรงกันข้าม: เป็นสิ่งที่ไม่มีใครเรียกคืนได้ ผูกติดกับความสัมพันธ์กับผู้ขายที่ไม่มีใครอธิบายไว้ ไม่สามารถรู้ได้ว่าเช็กพอยต์จะได้รับการดูแลต่อหรือไม่ แต่ไฟล์ที่คุณมีอยู่ในวันนี้ยังใช้งานได้ต่อไปไม่ว่าอะไรจะเกิดขึ้น

ข้อจำกัดเฉพาะอุตสาหกรรมคือสิ่งที่มักตัดสินคำถามเหล่านี้ในทางปฏิบัติ การติดตั้งใช้งานคอลเซ็นเตอร์ภาษาอาหรับภายในสถาบันที่อยู่ภายใต้การกำกับดูแลอาจไม่สามารถส่งเสียงไปยังปลายทางคลาวด์แบบพรีวิวได้เลย ส่วนทีมที่กำหนดมาตรฐานบน Azure AI Speech ไว้แล้วอาจไม่ต้องการสแต็กภายในองค์กรชุดที่สองสำหรับภาษาเพียงตระกูลเดียว ข้อจำกัดทั้งสองข้อล้วนสมเหตุสมผล และไม่มีข้อใดเกี่ยวข้องกับตัวเลข 2.5% และ 8.82% ที่เป็นพาดหัวของการเปิดตัวทั้งสอง

เหนือชั้นการถอดเสียงขึ้นไป ประเด็นเดียวกันนี้ใช้กับทั้งสองเช่นกัน OrcaRouter ไม่ได้ route โมเดลเสียงพูดทั้งสองนี้ — นี่คือการเปรียบเทียบระบบสองระบบที่เราไม่ได้ให้บริการ — แต่ตัวสรุป ตัวจำแนกประเภท หรือเอเจนต์ที่นำข้อความถอดเสียงไปใช้ สามารถ route ได้: โมเดลมากกว่า 200 รายการบนคีย์ API เดียว ในราคาตามที่ผู้ให้บริการกำหนด โดยมีมาร์กอัป 0% ดังนั้นหากผู้ขายเปลี่ยนราคา ฝั่งเราจะได้รับข้อมูลภายในวันเดียวกัน และมี failover อัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง จุดที่สิ่งนี้ช่วยได้เป็นพิเศษในกรณีนี้คือช่วงทดลองใช้: การกำหนดให้ตัวเลือกถอดเสียงทั้งสองชี้ไปที่ไปป์ไลน์ปลายทางเดียว โดยใช้คีย์เดียว คือวิธีที่คุณทดสอบแบบเทียบกันโดยตรงโดยไม่ต้องตั้งค่าการเชื่อมต่อถึงสองชุด

การทดสอบที่จะชี้ขาดเรื่องนี้

ยังไม่มีผู้จำหน่ายรายใดเผยแพร่ประสิทธิภาพเฉพาะสำหรับภาษาอาหรับ และไม่มีรายใดได้รับการประเมินอย่างเป็นอิสระบนเสียงภาษาถิ่น ดังนั้นการเปรียบเทียบจึงเหลือเพียงข้อเท็จจริงสามข้อและข้อเสนอแนะหนึ่งข้อ

ข้อเท็จจริง: โมเดลสตรีมมิงของ Microsoft เร็วกว่า โดยใช้เวลา 0.13 วินาที และอ้างว่ามีความแม่นยำรวมดีกว่าบนบอร์ดที่ยังไม่ได้พล็อตค่านี้; โมเดลของ Mistral เผยแพร่รายการภาษาเฉพาะถิ่น อัตราความผิดพลาดภาษาอาหรับ และโค้ดนอร์มัลไลเซชันสำหรับคำนวณค่านั้นขึ้นมาใหม่ โดยใช้เวลา 480 มิลลิวินาที; และตัวเลขความแม่นยำทั้งสองนั้นเปรียบเทียบกันไม่ได้ เพราะตัวหนึ่งเป็นอัตราความผิดพลาดระดับคำ (word error rate) และอีกตัวเป็นอัตราความผิดพลาดระดับอักขระ (character error rate) บนคลังข้อมูลที่ต่างกัน

คำแนะนำ: ใครก็ตามที่เป็นคนตัดสินใจเรื่องนี้ควรทดลองทั้งสองแบบกับเสียงของตัวเอง เพราะนั่นคือการวัดผลเพียงอย่างเดียวที่ผู้จำหน่ายทั้งสองรายยังไม่ได้ปิดไว้ จงสร้างชุดประเมินจากบันทึกเสียงจริง — การผสมสำเนียงที่คุณได้รับจริง โคเดกที่คุณใช้จริง และคำศัพท์เฉพาะทางที่คุณต้องการจริง — แล้วให้คะแนนทั้งสองด้วยการทำนอร์มัลไลเซชันของ Mistral เทียบกับข้อมูลอ้างอิงที่คุณเชื่อถือ การทดสอบสองชั่วโมงกับบันทึกเสียงของคุณเองจะบอกคุณได้มากกว่าโพสต์เปิดตัวทั้งสองชิ้นรวมกัน และเป็นวิธีเดียวที่จะรู้ว่าข้อได้เปรียบ 0.13 วินาทีนั้นคุ้มค่ากับการพึ่งพาเวอร์ชันพรีวิวและค่าพรีเมียมสตรีมมิ่ง 5.4× หรือไม่ หรือว่าโมเดล 4.4B ที่ดาวน์โหลดได้ซึ่งใช้เวลา 480 มิลลิวินาทีก็เพียงพอสำหรับงานนี้แล้ว

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and MAI-Transcribe-2-Streaming across six shared rows: price none published and self-host only against $0.54 per audio-hour introductory through the end of 2026; accuracy 8.82% Arabic character error rate at 480ms against a claimed 2.5% final word error rate at 0.13s; board status none because the model is days old against claimed first but not yet plotted; languages 16 named Arabic varieties against 60 with the list unpublished; delivery Apache 2.0 self-hosted weights against Azure preview with no SLA; and diarization and timestamps not documented against family documentation that requires per-SKU confirmation. A footer reads that both accuracy figures are vendor-reported and that no independent Arabic evaluation of either model exists. The OrcaRouter logo sits in a white strip at the bottom right.

OrcaRouter ไม่ได้ให้บริการโมเดลเสียงพูดทั้งสองนี้ และบทความนี้ก็ไม่ได้สื่อเป็นอย่างอื่น — สิ่งที่บทความนี้ครอบคลุมคือชั้นภาษาที่อ่านข้อความถอดเสียง: มากกว่า 200 โมเดลภายใต้คีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายปรับราคาของโมเดลปลายทาง คุณจะได้รับทราบในวันที่ประกาศเลย

การสลับไปยังระบบสำรองอัตโนมัติช่วยให้ตัวเลือกการถอดเสียงทั้งสองป้อนเข้าสู่ไปป์ไลน์ปลายทางเดียว แทนที่จะเป็นสองการเชื่อมต่อ ซึ่งยังเป็นวิธีที่ประหยัดที่สุดในการรันการเปรียบเทียบแบบตัวต่อตัว

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube