
Voxtral Mini 4B Realtime Arabic เทียบกับ MAI-Transcribe-2-Streaming: การมาถึงสองรายการในเดือนตุลาคม ปัญหาด้านหลักฐานสองประการ
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
เจ็ดวันคั่นกลางระหว่างโมเดลเสียงแบบเรียลไทม์สองตัวนี้ และมันมาถึงในวิธีที่ตรงกันข้าม MAI-Transcribe-2-Streaming เป็นโมเดลถอดเสียงแบบสตรีมมิ่งตัวแรกของ Microsoft AI ประกาศเมื่อวันที่ 1 ตุลาคม 2026 พร้อมโพสต์เปิดตัว รายการพรีวิวบน Azure ราคา $0.54 ต่อชั่วโมงเสียงในช่วงแนะนำจนถึงสิ้นปี และคำกล่าวอ้างว่าเป็นที่หนึ่งบนกระดานสตรีมมิ่งของ Artificial Analysis ทั้งด้านความแม่นยำของทรานสคริปต์ฉบับสมบูรณ์และฉบับบางส่วน ด้วยอัตราความผิดพลาดระดับคำ 2.5% โดยข้อความฉบับสมบูรณ์พร้อมภายใน 0.13 วินาทีหลังสิ้นสุดการพูด Voxtral Mini 4B Realtime Arabic เป็นโมเดลสตรีมมิ่งภาษาอาหรับถิ่นของ Mistral AI เผยแพร่บน Hugging Face เมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีการประกาศใด ๆ เลย — ไม่มีโพสต์บล็อก ไม่มีราคา ไม่มีบริการ มีเพียงน้ำหนักโมเดลภายใต้ Apache 2.0 และการ์ดโมเดลที่รายงานค่าเฉลี่ย Character Error Rate 8.82% จากเกณฑ์วัดภาษาอาหรับเจ็ดรายการที่ความหน่วง 480 มิลลิวินาที โมเดลของ Microsoft เป็นผลิตภัณฑ์ที่เสร็จสมบูรณ์พร้อมพาดหัวที่ตรวจสอบไม่ได้ โมเดลของ Mistral เป็นชิ้นงานที่ตรวจสอบได้โดยไม่มีผลิตภัณฑ์อยู่รอบ ๆ ทั้งคู่ควรค่าแก่การทำความเข้าใจ precisely เพราะทั้งคู่ต่างทิ้งคำถามหลัก — ว่าโมเดลนี้รับมือกับภาษาอาหรับได้ดีเพียงใด — ให้มีเพียงผู้ขายเท่านั้นที่ให้คำตอบ
การเปรียบเทียบนี้ก็ยังคุ้มค่าที่จะทำ เพราะโมเดลทั้งสองวางกรอบการตัดสินใจทางวิศวกรรมเดียวกันจากคนละสุดทางกัน Microsoft ขายความกว้างและบริการแบบจัดการ: 60 ภาษาพร้อมการตรวจจับภาษาต่อเนื่องอัตโนมัติ ทำงานภายใน Azure AI Speech คิดราคาต่อชั่วโมง และอยู่ในช่วงพรีวิว Mistral ปล่อยความลึกให้ฟรี: ภาษาถิ่นอาหรับที่มีชื่อเรียก 16 ชนิด เล็กพอที่จะรันบนตัวเร่งความเร็วตัวเดียว พร้อมสคริปต์ปรับมาตรฐานเพื่อให้คุณตรวจสอบการให้คะแนนได้ด้วยตัวเอง หากคุณกำลังตั้งระบบไปป์ไลน์ถอดเสียงภาษาอาหรับเดือนนี้ คุณกำลังเลือกระหว่างสองจุดยืนนั้น และการเลือกขึ้นอยู่กับหลักฐานที่คุณยังไม่มีในทั้งสองกรณี
สิ่งที่ผู้ขายแต่ละรายกล่าวไว้จริง ๆ และสิ่งที่คณะกรรมการกล่าว
ช่องว่างทางหลักฐานเป็นลักษณะที่สำคัญที่สุดของการจับคู่นี้ จึงต้องกล่าวถึงเป็นอันดับแรก
• MAI-Transcribe-2-Streaming — อัตราความผิดพลาดระดับคำของบทถอดเสียงฉบับสมบูรณ์ที่ 2.5% ณ 0.13 วินาทีหลังจากสิ้นสุดการพูด และ 2.5% เดียวกันบนผลลัพธ์บางส่วนชุดแรกที่ 0.12 วินาที โดยทั้งคู่ถูกนำเสนอเป็นอันดับหนึ่งด้านความแม่นยำตามระเบียบวิธี AA-WER Streaming ของ Artificial Analysis เป็นกรอบการนำเสนอของ Microsoft เอง ณ เวลาที่ร่างบทความนี้ กระดานสตรีมมิ่งของแทร็กเกอร์ยังไม่ได้พล็อตแถวสำหรับโมเดลนี้ ดังนั้นข้อกล่าวอ้างจึงตั้งอยู่บนระเบียบวิธีของแทร็กเกอร์ โดยไม่มีตัวเลขที่แทร็กเกอร์เผยแพร่รองรับอยู่เบื้องหลัง
• Voxtral Mini 4B Realtime Arabic — อัตราความผิดพลาดระดับอักขระเฉลี่ย 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับเจ็ดรายการ ที่ความหน่วงที่ตั้งค่าไว้ 480 มิลลิวินาที การ์ดของ Mistral เอง พร้อมโค้ดการประเมินผลที่ให้มาด้วย ยังไม่มีบุคคลที่สามรายใดทำซ้ำผลลัพธ์นี้ได้ และโมเดลนี้มีอายุเพียงสองวัน
ตัวเลขพาดหัวสองตัวในบทความนี้ ตามลำดับ คือ คำกล่าวอ้างของผู้ขายบนไม้บรรทัดของคนอื่น และคำกล่าวอ้างของผู้ขายที่แนบไม้บรรทัดของตัวเองมาด้วย ไม่มีตัวใดเป็นการวัดที่เป็นอิสระ สิ่งที่ต่างกันคือ ตัวเลขของ Mistral มาพร้อมสคริปต์นอร์มัลไลเซชันที่คุณต้องใช้เพื่อคำนวณค่านั้นใหม่ ส่วนของ Microsoft มาพร้อมบอร์ดที่ยังไม่ได้นำมันขึ้นชาร์ต หากคุณกำลังตัดสินใจเรื่องการจัดซื้อ ความแตกต่างนั้นสำคัญกว่าส่วนต่างระหว่าง 2.5 กับ 8.82 ซึ่งไม่มีความหมายอยู่แล้ว — อัตราความผิดพลาดระดับคำและอัตราความผิดพลาดระดับตัวอักษรไม่สามารถแปลงหากันได้ และอักขรวิธีอาหรับทำให้ช่องว่างระหว่างสองค่านี้กว้างขึ้นอย่างมาก
การเปรียบเทียบเพียงหนึ่งเดียวในโมเดลการ์ดของ Mistral ที่ได้ผลจริง คือการเปรียบเทียบกับรุ่นพี่น้องออฟไลน์ของตัวเอง: Voxtral Transcribe Arabic ที่ 7.91% CER บนเจ็ดเบนช์มาร์กชุดเดียวกันโดยใช้การนอร์มัลไลซ์แบบเดียวกัน ดังนั้นสตรีมมิงทำให้โมเดลนี้เสีย 0.91 จุดเปอร์เซ็นต์ Microsoft เผยแพร่ตัวเลขเทียบเท่าสำหรับตระกูลของตัวเองเมื่อเปิดตัว MAI-Transcribe-2 แบบแบตช์เมื่อวันที่ 3 กันยายน 2026 ที่อัตราความผิดพลาดระดับคำ 2.0% — รุ่นสตรีมมิงยอมเสียครึ่งจุดเมื่อเทียบกับโมเดลแบบแบตช์ ขณะที่เพิ่มการส่งมอบแบบเรียลไทม์ เมื่ออ่านส่วนต่างภายในผู้ขายสองรายนั้นวางเทียบกัน คุณจะได้ข้อความเปรียบเทียบที่เทียบกันได้ตรงๆ เพียงข้อเดียวในบทความนี้: บนเบนช์มาร์กของตัวเอง SKU สตรีมมิงของแต่ละแล็บตามหลังรุ่นพี่น้องแบบแบตช์ของตน ราวหนึ่งจุดในกรณีหนึ่ง และครึ่งจุดในอีกกรณี และทั้งสองกำลังวัดภาษาที่ต่างกัน

ความครอบคลุมภาษา: 60 เทียบกับ 16 และช่องว่างที่ไม่มีชื่อเดียวกันในทั้งสองฝ่าย
• MAI-Transcribe-2-Streaming — รองรับ 60 ภาษา พร้อมการตรวจจับภาษาแบบต่อเนื่องอัตโนมัติ ดังนั้นเซสชันที่สลับภาษาไปมาระหว่างสตรีมจึงไม่จำเป็นต้องระบุภาษาล่วงหน้า เอกสารเปิดตัวของ Microsoft ให้เฉพาะจำนวน แต่ไม่ได้ให้รายการ ส่วนเอกสารประกอบการสนับสนุนภาษาของ Azure สำหรับตระกูล MAI-Transcribe คือที่ที่มีการแจกแจงความครอบคลุมไว้เป็นรายการ และได้ระบุภาษาอาหรับไว้ในบรรดาภาษาที่รองรับสำหรับตระกูลนี้
• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 สายพันธุ์ โดยระบุชื่อแต่ละสายพันธุ์ดังนี้: ภาษาอาหรับมาตรฐานสมัยใหม่, อาหรับโมร็อกโก, อาหรับลิเบีย, อาหรับตูนิเซีย, อาหรับแอลจีเรียและฮัสซานียา, อาหรับอ่าว, อาหรับนัจดี, อาหรับโอมานและซานานี, อาหรับอียิปต์และซูดาน, อาหรับเมโสโปเตเมีย และอาหรับลิแวนต์ใต้กับลิแวนต์เหนือ, และอาหรับชาด นอกเหนือจากชุดนี้ เอกสารระบุว่าโมเดลอยู่นอกขอบเขต พร้อมตัวชี้ไปยัง Voxtral Mini 4B Realtime ทั่วไป
ตัวเลขทั้งสองไม่ได้บอกสิ่งที่คุณจำเป็นต้องรู้ 60 ของ Microsoft เป็นการนับตามความกว้างซึ่งรวมภาษาอาหรับไว้ โดยไม่ได้อธิบายประสิทธิภาพของภาษาอาหรับ โพสต์เปิดตัวระบุจำนวนภาษาทั้งหมดเพียงครั้งเดียวแล้วผ่านไป 16 ของ Mistral เป็นการแจกแจงเป้าหมายการฝึกพร้อมอัตราความผิดพลาดรวมเพียงค่าเดียวจากเจ็ดชุดเบนช์มาร์ก ซึ่งหมายความว่ารายละเอียดแยกตามภาษาถิ่น — สิ่งที่จริง ๆ แล้วเป็นตัวกำหนดว่าเสียงสายสนทนาภาษาโมร็อกโกของคุณจะถอดความเป็นข้อความได้หรือไม่ — ก็ไม่ได้ถูกเผยแพร่เช่นกัน สองโมเดล สองผู้ขาย และในทั้งสองกรณี คำตอบที่ซื่อตรงต่อคำถามที่ว่า "มันเก่งแค่ไหนกับภาษาอาหรับอ่าวโดยเฉพาะ" คือ: ไม่ได้ระบุไว้
สิ่งที่การแจกแจงรายการให้กับคุณก็คือไพรเออร์ โมเดลที่ระบุให้ภาษาอาหรับชาดและภาษาอาหรับฮัสซานียาเป็นเป้าหมายนั้นถูกปรับแต่งให้สอดคล้องกับการกระจายข้อมูลของแอฟริกาเหนือ Mistral ร่วมพัฒนากับ Ministère de la Transition Numérique et de la Réforme Administrative ของโมร็อกโก และสร้างสองในเจ็ดเบนช์มาร์กร่วมกับกระทรวงนั้น ได้แก่ ISMA และ Darija in the Wild โดยเฉพาะเพื่อวัดกรณีที่ยาก โมเดลทั่วไปที่มี 60 ภาษาจะพัฒนาปรับปรุงภาษาอาหรับมาตรฐานสมัยใหม่ก่อน เพราะนั่นคือที่ที่ปริมาณสัญญาณการฝึกอยู่ ถ้าเสียงของคุณเป็นดาริจาหรืออาหรับโกล์ฟ นั่นเป็นปัญหาที่ต่างออกไป และมีเพียงหนึ่งในสองผู้ให้บริการรายนี้เท่านั้นที่ให้ตัวเลขไว้กับภาษาใดภาษาหนึ่ง
ความหน่วงและรูปร่างของความล่าช้า
• MAI-Transcribe-2-Streaming — 0.13 วินาทีจากจุดสิ้นสุดของคำพูดถึงทรานสคริปต์ฉบับสมบูรณ์ และพาร์เชียลแรกที่ 0.12 วินาที ซึ่งเร็วพอจนพาร์เชียลและฉบับสมบูรณ์มีเวลาหน่วงเท่ากันในทางปฏิบัติ นี่คือข้อกล่าวอ้างของ Microsoft ที่วัดตามวิธีการของ tracker
• Voxtral Mini 4B Realtime Arabic — ความหน่วงที่กำหนดค่าไว้ 480 มิลลิวินาที ณ จุดความแม่นยำที่เผยแพร่ โดยสามารถปรับความหน่วงได้ ซึ่งคิดเป็นประมาณสามเท่าครึ่งของตัวเลขจาก Microsoft และเป็นพารามิเตอร์ที่ผู้ดำเนินการเลือก ไม่ใช่คุณสมบัติแบบตายตัว
สามในสิบของวินาทีเป็นความแตกต่างจริงสำหรับ voice agent ที่ต้องตอบสนองกลางถ้อยคำ และแทบมองไม่เห็นสำหรับมนุษย์ที่อ่านคำบรรยาย มันยังเป็นความแตกต่างระหว่างปุ่มหมุนกับตัวเลขด้วย พารามิเตอร์ delay ของ Mistral หมายความว่าคุณสามารถปรับให้แน่นขึ้นและยอมรับข้อผิดพลาดมากขึ้น หรือผ่อนลงและได้ความแม่นยำกลับคืนมา — โมเดลฐานที่ checkpoint นี้ถูก fine-tune มาจากโมเดลนั้นโฆษณาช่วงตั้งแต่ 240 มิลลิวินาทีถึง 2.4 วินาที — ในขณะที่ operating point ของ Microsoft คือสิ่งที่ Azure ปล่อยให้ใช้ นั่นทำให้ตัวเลขของ Microsoft เข้าใจเชิงเหตุผลได้ง่ายกว่า และของ Mistral ปรับแต่งได้ง่ายกว่า และหมายความว่าการเปรียบเทียบตัวเลขความแม่นยำสองตัวใด ๆ แท้จริงแล้วเป็นการเปรียบเทียบจุดที่เลือกไว้สองจุดบนเส้นโค้งหนึ่ง กับจุดคงที่หนึ่งจุดบนอีกเส้นโค้งหนึ่ง
ขอบเขตของคุณลักษณะก็แตกต่างกันอย่างชัดเจนไม่แพ้กัน และควรค่าแก่การตรวจสอบเทียบกับข้อกำหนดไปป์ไลน์ของคุณก่อนที่การอภิปรายเรื่องความแม่นยำจะเริ่มน่าสนใจ
• MAI-Transcribe-2-Streaming — ให้บริการผ่าน Azure AI Speech พร้อมชุดคุณลักษณะที่ระบุไว้ในเอกสารของตระกูลนี้: การแยกผู้พูด (diarization), การประทับเวลาระดับคำ, การให้น้ำหนักคำสำคัญและวลี, รูปแบบเอาต์พุตแบบคำต่อคำเทียบกับแบบเรียบเรียง และการระบุภาษาอัตโนมัติ เอกสารของ SKU แบบสตรีมมิ่งเองสำหรับการแยกผู้พูดและการประทับเวลามีรายละเอียดน้อยกว่าเอกสารของโมเดลแบบแบตช์ ดังนั้นโปรดยืนยันสิ่งเหล่านั้นในแต่ละ endpoint แทนที่จะสันนิษฐานว่ามีความเท่าเทียมกัน

• Voxtral Mini 4B Realtime Arabic — การ์ดนี้บันทึกการถอดเสียงด้วยตัวเข้ารหัสเสียงเชิงสาเหตุ, การให้บริการ vLLM ผ่าน WebSocket ที่ /v1/realtime, การรองรับ Transformers แบบเนทีฟตั้งแต่เวอร์ชัน 5.2.0 และโมดูลการทำให้เป็นมาตรฐาน ไม่ได้ระบุการแยกผู้พูดหรือการประทับเวลาในระดับคำสำหรับเช็คพอยต์นี้
รูปแบบการให้บริการ: บริการพรีวิวเทียบกับน้ำหนักที่ดาวน์โหลดได้
• MAI-Transcribe-2-Streaming — Azure พรีวิว ซึ่งหมายความว่าไม่มี SLA และมีคำแนะนำจากผู้ขายให้หลีกเลี่ยงการพึ่งพาในการใช้งานโปรดักชัน ราคาอยู่ที่ $0.54 ต่อชั่วโมงเสียงเป็นอัตราเปิดตัวที่มีผลจนถึงสิ้นปี 2026 โดยยังไม่มีการเผยแพร่อัตรามาตรฐาน; MAI-Transcribe-2 แบบแบตช์เปิดตัวที่ราคา $0.10 ต่อชั่วโมงเสียงภายใต้เงื่อนไขเวลาจำกัดเดียวกัน ค่าบริการสตรีมมิ่งคิดเป็น 5.4 เท่าของอัตราแบตช์
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, พารามิเตอร์ประมาณ 4.4 พันล้านตัวใน BF16, ดาวน์โหลดได้, ปรับจูนละเอียดได้ และให้บริการได้บนตัวเร่งความเร็วเพียงตัวเดียว ไม่มีราคา ไม่มี SLA และไม่มีข้อผูกพันด้านการสนับสนุน เพราะไม่มีบริการใดอยู่เบื้องหลังมัน
การตัดสินใจอยู่ในสองประโยคนั้น บริการพรีวิวที่มีเรตเปิดตัวและราคามาตรฐานที่ยังไม่เปิดเผยคือคำมั่นที่มีวันหมดอายุ; ค่าพรีเมียมสตรีมมิ่ง 5.4 เท่า และช่วงเวลาถึงปี 2026 ต่างเป็นสิ่งที่ Microsoft เปลี่ยนแปลงได้เอง และอัตราส่วนแบตช์ต่อสตรีมมิ่งคือตัวเลขที่ต้องจับตาดูเมื่อเรตมาตรฐานมีผล เวต Apache 2.0 ที่ไม่มีการประกาศใด ๆ กลับตรงกันข้าม: เป็นสิ่งที่ไม่มีใครเรียกคืนได้ ผูกติดกับความสัมพันธ์กับผู้ขายที่ไม่มีใครอธิบายไว้ ไม่สามารถรู้ได้ว่าเช็กพอยต์จะได้รับการดูแลต่อหรือไม่ แต่ไฟล์ที่คุณมีอยู่ในวันนี้ยังใช้งานได้ต่อไปไม่ว่าอะไรจะเกิดขึ้น
ข้อจำกัดเฉพาะอุตสาหกรรมคือสิ่งที่มักตัดสินคำถามเหล่านี้ในทางปฏิบัติ การติดตั้งใช้งานคอลเซ็นเตอร์ภาษาอาหรับภายในสถาบันที่อยู่ภายใต้การกำกับดูแลอาจไม่สามารถส่งเสียงไปยังปลายทางคลาวด์แบบพรีวิวได้เลย ส่วนทีมที่กำหนดมาตรฐานบน Azure AI Speech ไว้แล้วอาจไม่ต้องการสแต็กภายในองค์กรชุดที่สองสำหรับภาษาเพียงตระกูลเดียว ข้อจำกัดทั้งสองข้อล้วนสมเหตุสมผล และไม่มีข้อใดเกี่ยวข้องกับตัวเลข 2.5% และ 8.82% ที่เป็นพาดหัวของการเปิดตัวทั้งสอง
เหนือชั้นการถอดเสียงขึ้นไป ประเด็นเดียวกันนี้ใช้กับทั้งสองเช่นกัน OrcaRouter ไม่ได้ route โมเดลเสียงพูดทั้งสองนี้ — นี่คือการเปรียบเทียบระบบสองระบบที่เราไม่ได้ให้บริการ — แต่ตัวสรุป ตัวจำแนกประเภท หรือเอเจนต์ที่นำข้อความถอดเสียงไปใช้ สามารถ route ได้: โมเดลมากกว่า 200 รายการบนคีย์ API เดียว ในราคาตามที่ผู้ให้บริการกำหนด โดยมีมาร์กอัป 0% ดังนั้นหากผู้ขายเปลี่ยนราคา ฝั่งเราจะได้รับข้อมูลภายในวันเดียวกัน และมี failover อัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง จุดที่สิ่งนี้ช่วยได้เป็นพิเศษในกรณีนี้คือช่วงทดลองใช้: การกำหนดให้ตัวเลือกถอดเสียงทั้งสองชี้ไปที่ไปป์ไลน์ปลายทางเดียว โดยใช้คีย์เดียว คือวิธีที่คุณทดสอบแบบเทียบกันโดยตรงโดยไม่ต้องตั้งค่าการเชื่อมต่อถึงสองชุด
การทดสอบที่จะชี้ขาดเรื่องนี้
ยังไม่มีผู้จำหน่ายรายใดเผยแพร่ประสิทธิภาพเฉพาะสำหรับภาษาอาหรับ และไม่มีรายใดได้รับการประเมินอย่างเป็นอิสระบนเสียงภาษาถิ่น ดังนั้นการเปรียบเทียบจึงเหลือเพียงข้อเท็จจริงสามข้อและข้อเสนอแนะหนึ่งข้อ
ข้อเท็จจริง: โมเดลสตรีมมิงของ Microsoft เร็วกว่า โดยใช้เวลา 0.13 วินาที และอ้างว่ามีความแม่นยำรวมดีกว่าบนบอร์ดที่ยังไม่ได้พล็อตค่านี้; โมเดลของ Mistral เผยแพร่รายการภาษาเฉพาะถิ่น อัตราความผิดพลาดภาษาอาหรับ และโค้ดนอร์มัลไลเซชันสำหรับคำนวณค่านั้นขึ้นมาใหม่ โดยใช้เวลา 480 มิลลิวินาที; และตัวเลขความแม่นยำทั้งสองนั้นเปรียบเทียบกันไม่ได้ เพราะตัวหนึ่งเป็นอัตราความผิดพลาดระดับคำ (word error rate) และอีกตัวเป็นอัตราความผิดพลาดระดับอักขระ (character error rate) บนคลังข้อมูลที่ต่างกัน
คำแนะนำ: ใครก็ตามที่เป็นคนตัดสินใจเรื่องนี้ควรทดลองทั้งสองแบบกับเสียงของตัวเอง เพราะนั่นคือการวัดผลเพียงอย่างเดียวที่ผู้จำหน่ายทั้งสองรายยังไม่ได้ปิดไว้ จงสร้างชุดประเมินจากบันทึกเสียงจริง — การผสมสำเนียงที่คุณได้รับจริง โคเดกที่คุณใช้จริง และคำศัพท์เฉพาะทางที่คุณต้องการจริง — แล้วให้คะแนนทั้งสองด้วยการทำนอร์มัลไลเซชันของ Mistral เทียบกับข้อมูลอ้างอิงที่คุณเชื่อถือ การทดสอบสองชั่วโมงกับบันทึกเสียงของคุณเองจะบอกคุณได้มากกว่าโพสต์เปิดตัวทั้งสองชิ้นรวมกัน และเป็นวิธีเดียวที่จะรู้ว่าข้อได้เปรียบ 0.13 วินาทีนั้นคุ้มค่ากับการพึ่งพาเวอร์ชันพรีวิวและค่าพรีเมียมสตรีมมิ่ง 5.4× หรือไม่ หรือว่าโมเดล 4.4B ที่ดาวน์โหลดได้ซึ่งใช้เวลา 480 มิลลิวินาทีก็เพียงพอสำหรับงานนี้แล้ว

OrcaRouter ไม่ได้ให้บริการโมเดลเสียงพูดทั้งสองนี้ และบทความนี้ก็ไม่ได้สื่อเป็นอย่างอื่น — สิ่งที่บทความนี้ครอบคลุมคือชั้นภาษาที่อ่านข้อความถอดเสียง: มากกว่า 200 โมเดลภายใต้คีย์เดียว ในราคาตามรายการของผู้ให้บริการโดยบวกเพิ่ม 0% ดังนั้นเมื่อผู้ขายปรับราคาของโมเดลปลายทาง คุณจะได้รับทราบในวันที่ประกาศเลย
การสลับไปยังระบบสำรองอัตโนมัติช่วยให้ตัวเลือกการถอดเสียงทั้งสองป้อนเข้าสู่ไปป์ไลน์ปลายทางเดียว แทนที่จะเป็นสองการเชื่อมต่อ ซึ่งยังเป็นวิธีที่ประหยัดที่สุดในการรันการเปรียบเทียบแบบตัวต่อตัว
