การ์ดฮีโร่ของบทความที่อ่านว่า 'Voxtral Mini 4B Realtime Arabic vs Gemini 3.5 Transcribe Live' พร้อมคำบรรยายย่อย '15 ภาษาถิ่นอาหรับบนน้ำหนักเปิด เทียบกับ 85+ โลแคลบน API ปิด' ป้ายที่ระบุว่าโมเดล Mistral เป็นการปล่อยรีโพซิทอรีแบบไม่ประกาศ ซึ่งลงวันที่ 8 ตุลาคม 2026 และชิปสถิติสามอัน: 16 ตัวแปรภาษาอาหรับ เทียบกับ 85+ โลแคล; อัตราความผิดพลาดระดับตัวอักษร 8.82% ที่ 480ms เทียบกับอัตราความผิดพลาดระดับคำแบบสตรีมมิ่ง 4.0% ที่ 0.40s; น้ำหนักเปิด Apache 2.0 เทียบกับ API เท่านั้น โลโก้ OrcaRouter อยู่ในแถบสีขาวที่มุมขวาล่าง
Guides & Insights

Voxtral Mini 4B Realtime Arabic เทียบกับ Gemini 3.5 Transcribe Live: ภาษาถิ่นเทียบกับความกว้างขวาง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สองโมเดลถอดเสียงพูดแบบสตรีมมิ่ง สองเดิมพันที่แตกต่างกันอย่างสิ้นเชิงว่าส่วนที่ยากของการถอดเสียงคืออะไร Voxtral Mini 4B Realtime Arabic เป็นโมเดล fine-tune ขนาด 4.4 พันล้านพารามิเตอร์ที่ Mistral AI ผลักขึ้น repository สาธารณะเมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีโพสต์เปิดตัว ไม่มีบทความบล็อก หรือแม้แต่บรรทัดในดัชนีข่าวของบริษัท ฝึกมาโดยเฉพาะกับ Modern Standard Arabic และภาษาถิ่นสิบห้าแบบ เผยแพร่ภายใต้ Apache 2.0 พร้อมน้ำหนัก BF16 ที่ดาวน์โหลดได้ ส่วน Gemini 3.5 Transcribe Live คือ endpoint แบบสตรีมมิ่งของ Gemini 3.5 Transcribe จาก Google ซึ่งประกาศในเดือนสิงหาคม 2026 พร้อมกลไกครบชุดของการเปิดตัวแพลตฟอร์ม รองรับกว่า 85 โลเคล และเป็นแบบปิด — พรีวิว API ที่ไม่มีน้ำหนักโมเดลและจำกัดเซสชันไว้ที่สิบนาที โมเดลหนึ่งเจาะลึกในตระกูลภาษาเดียวและบอกเช่นนั้นในส่วนข้อจำกัดของตัวเอง ส่วนอีกโมเดลเลือกทางกว้างและปล่อยให้การรับประกันในระดับสำเนียงไม่ถูกระบุไว้ คุณจะเลือกอันไหนขึ้นอยู่กับแกนที่การตลาดของผู้ขายทั้งสองไม่ได้ให้ความสำคัญเป็นอันดับแรก: เสียงของคุณฟังดูเป็นอย่างไรจริง ๆ

นี่ไม่ใช่การเปรียบเทียบที่สมมาตร และเป็นการดีกว่าที่จะพูดไว้ตั้งแต่ต้นแทนที่จะฝังมันไว้ โมเดล Mistral มีอายุ 48 ชั่วโมงในเวลาที่เขียน ไม่มีประกาศจากผู้ขาย ไม่มีการประเมินอิสระ และไม่มีราคาที่เผยแพร่ โมเดลของ Google อยู่ในช่วงตัวอย่างสาธารณะตั้งแต่ปลายเดือนสิงหาคม และถูกวัดบนแทร็กเกอร์ของบุคคลที่สาม มองฝั่ง Mistral ว่าเป็นชุดข้ออ้างจากโมเดลการ์ด และฝั่ง Google ว่าเป็นชุดการวัดบวกกับชุดข้ออ้าง แล้วการเปรียบเทียบจะยังคงซื่อสัตย์

โมเดลแต่ละตัวคืออะไร ก่อนจะพูดถึงตัวเลข

• Voxtral Mini 4B Realtime Arabic — โมเดล ASR แบบสตรีมมิ่งที่ปรับแต่ง (fine-tune) มาจาก Voxtral-Mini-4B-Realtime-2602 มีพารามิเตอร์ประมาณ 4.4B ใน BF16 รับสัญญาณเสียง 16 kHz ผ่านตัวเข้ารหัสเสียงแบบ causal และตัวถอดรหัสภาษา จะปล่อยข้อความออกมาในขณะที่เสียงเข้ามา โดยมีความหน่วงในการถอดข้อความที่กำหนดค่าได้ และใช้สัญญาอนุญาต Apache 2.0 โดยมีเวตของโมเดลอยู่บน Hugging Face Mistral ร่วมพัฒนาโมเดลนี้กับกระทรวงการเปลี่ยนผ่านดิจิทัลและการปฏิรูประบบราชการของโมร็อกโก (Ministère de la Transition Numérique et de la Réforme Administrative) ภายใต้ความร่วมมือที่ลงนามในเดือนมกราคม 2026 และอธิบายว่าโมเดลนี้เป็นสินทรัพย์ AI อธิปไตย

• Gemini 3.5 Transcribe Live — ครึ่งหนึ่งแบบสตรีมมิ่งของการเปิดตัวแบบสองโมเดล ปลายทาง Live API ส่งผ่านเสียงไมโครโฟนแบบต่อเนื่องผ่าน WebSocket ส่งคืนบทถอดความบางส่วนในขณะที่ผู้พูดยังพูดอยู่ และจะได้บทถอดความฉบับสมบูรณ์ไม่นานหลังจากแต่ละประโยคจบลง โมเดลพี่น้องแบบแบตช์ gemini-3.5-transcribe ให้บริการไฟล์ที่บันทึกไว้ล่วงหน้าสูงสุดหนึ่งชั่วโมง ทั้งคู่อยู่ในช่วงพรีวิวสาธารณะ ทั้งคู่เป็นแบบ API-only และทั้งคู่ยังไม่เผยแพร่เวต

ความแตกต่างเชิงโครงสร้างประการแรกไม่ใช่เรื่องความแม่นยำ หากแต่ว่าสิ่งหนึ่งในสองนี้เป็นไฟล์ที่คุณดาวน์โหลดได้ภายในคืนนี้ ส่วนอีกสิ่งหนึ่งเป็นบริการที่คุณต้องได้รับการอนุมัติก่อนจึงจะใช้งานได้

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

ความครอบคลุมของภาษา: 16 เทียบกับ 85 ภาษาขึ้นไป และช่องว่างไม่ใช่ประเด็นสำคัญ

การนับจำนวนภาษาทำให้โมเดล Mistral ดูมีขอบเขตจำกัด และทำให้โมเดล Google ดูใหญ่โตมหาศาล การนับเหล่านี้วัดคนละสิ่ง และการนำตัวเลขมาอ่านเทียบกันแบบวางเคียงข้างโดยไม่มีข้อควรระวังนั้น คือความผิดพลาดที่พบบ่อยที่สุดที่การเปรียบเทียบนี้ชักนำให้เกิด

• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 ชนิด แต่ละชนิดระบุชื่อไว้บนการ์ดโมเดลตามกลุ่มสำเนียง ได้แก่ ภาษาอาหรับมาตรฐานสมัยใหม่ (Modern Standard Arabic) รวมถึงภาษาอาหรับโมร็อกโก ลิเบีย ตูนิเซีย แอลจีเรีย และฮัสซานียะฮ์จากมักริบ; ภาษาอาหรับอ่าว นัจญ์ดี โอมาน และซานานีจากอ่าว; ภาษาอาหรับอียิปต์และซูดานจากลุ่มน้ำไนล์; ภาษาอาหรับเมโสโปเตเมีย และทั้งลิแวนไทน์ใต้และเหนือ; และภาษาอาหรับชาด กรอบของโมเดลการ์ดเองระบุว่าโมเดลนี้มุ่งเป้าไปที่การถอดเสียงภาษาอาหรับ และการสลับภาษา — ผู้พูดสลับภาษากลางบทสนทนา — เป็นความสามารถที่สร้างขึ้นมาเพื่อให้ทำได้อย่างถูกต้อง ไม่ใช่ผลข้างเคียง

• Gemini 3.5 Transcribe Live — การตรวจจับภาษาอัตโนมัติครอบคลุมมากกว่า 85 โลแคล รองรับการสลับภาษาทั้งภายในประโยคและระหว่างประโยค เอกสารของ Google ระบุว่าภาษาอาหรับอยู่ในชุดดังกล่าว ตารางโลแคลระบุ Arabic (Egypt) เป็นรายการสำหรับภาษาอาหรับ และความครอบคลุมของโลแคลภาษาอาหรับในวงกว้างไม่ได้ถูกแจกแจงไว้ในเอกสารของโมเดลเอง

อ่านสิ่งนั้นอย่างตรงไปตรงมา แล้วรูปร่างของข้อแลกเปลี่ยนก็จะปรากฏขึ้น ค่า 85+ ของ Google เป็นข้ออ้างเชิงความกว้าง: ถ้าเสียงของคุณเป็นภาษาที่ไม่ใช่อาหรับ เอนด์พอยต์ของ Google รองรับมัน และโมเดล Mistral จะปฏิเสธมัน — การ์ดบอกตรง ๆ ว่าสำหรับภาษาอื่น คุณควรใช้ Voxtral Mini 4B Realtime ต้นฉบับ ไม่ใช่เช็กพอยต์นี้ ค่า 16 ของ Mistral เป็นข้ออ้างเชิงความลึก มันไม่ได้อ้างว่าถอดเสียงภาษาอาหรับ แต่กำลังอ้างว่าถอดเสียง Moroccan Darija, Gulf Arabic, Egyptian Arabic และ Chadian Arabic เป็นเป้าหมายที่แยกจากกัน ซึ่งเป็นปัญหาที่ยากกว่าอย่างมีนัยสำคัญกว่าการถอดเสียง Modern Standard Arabic แล้วหวังว่าภาษาถิ่นจะหลุดออกมาเอง เบนช์มาร์กที่ให้น้ำหนักกับภาษาอังกฤษและเน้นความกว้างก่อนจะไม่มีทางแสดงความแตกต่างนั้นให้คุณเห็น เพราะชุดภาษาถิ่นไม่ได้รวมอยู่ในนั้น

สำหรับคอลเซ็นเตอร์ในโมร็อกโกหรือสายสนับสนุนลูกค้าในกลุ่มประเทศอ่าว โมเดลที่รองรับ 16 ภาษาถิ่นและไม่มีอย่างอื่นเลยอาจเอาชนะโมเดลที่รองรับ 85 โลแคลที่ความแม่นยำต่อภาษาถิ่นซึ่งไม่ได้ระบุไว้ได้ สำหรับบริษัทในยุโรปที่ถอดเสียงการประชุมในห้าภาษา สมการจะกลับด้านทันที ไม่มีผู้ขายรายใดผิด พวกเขาเลือกกลุ่มลูกค้าที่ต่างกัน

Screenshot of Google's Gemini API model documentation for Gemini 3.5 Transcribe, captured 10 October 2026, showing the model code gemini-3.5-transcribe, audio input up to one hour per request dropping to 30 minutes when speaker diarization or word-level timestamps are enabled, and the supported capability list including speaker diarization, word-level timestamps, Smart transcription and custom vocabulary.

ตัวเลขที่คุณเปรียบเทียบได้ และตัวเลขที่คุณเปรียบเทียบไม่ได้

นี่คือจุดที่ความไม่สมมาตรกัดกิน โมเดลทั้งสองรายงานหน่วยที่ต่างกัน บนคลังข้อมูลที่ต่างกัน ด้วยหลักฐานที่รองรับต่างกัน และไม่มีบุคคลที่สามใดนำทั้งสองมาเปรียบเทียบกัน

• Voxtral Mini 4B Realtime Arabic — ค่าเฉลี่ยอัตราความผิดพลาดระดับตัวอักษร (Character Error Rate) 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับทั้งเจ็ด ที่ความหน่วงในการถอดเสียงซึ่งกำหนดค่าไว้ 480 มิลลิวินาที ตามการ์ดโมเดลของ Mistral เอง และไม่ได้รับการทำซ้ำโดยอิสระ

• โมเดลที่มันกำลังไล่ตาม — Voxtral Transcribe Arabic ที่ 7.91% CER บนเกณฑ์มาตรฐานเจ็ดชุดเดียวกัน ด้วยการวัดแบบเดียวกัน ดังนั้นโมเดลเรียลไทม์จึงตามหลังโมเดลภาษาออฟไลน์จากผู้ขายรายเดียวกันอยู่ 0.91 จุดเปอร์เซ็นต์ ช่องว่างนี้คือการเปรียบเทียบของ Mistral เอง ซึ่งทำให้ข้อมูลนี้มีประโยชน์อย่างยิ่ง: ผู้ขายกำลังบอกคุณว่าการสตรีมมีต้นทุนด้านความแม่นยำเท่าใดในตระกูลภาษานี้

• Gemini 3.5 Transcribe Live — อัตราความผิดพลาดระดับคำแบบสตรีมมิ่ง 4.0% วัดโดย Artificial Analysis และถูกอ้างอิงโดย Google โดยข้อความถอดความฉบับสุดท้ายมาถึง 0.40 วินาทีหลังสิ้นสุดการพูด นอกจากนี้ยังวัดได้: 2.6% บนบอร์ดแบบไม่สตรีมมิ่งของตัวติดตามเดียวกัน และ 5.50% แบบสตรีมมิ่งบน FLEURS ตามรายงานของ Google เอง

อย่าเอา 8.82% CER ไปวางข้าง 4.0% WER แล้วสรุปผลใด ๆ อัตราความผิดพลาดระดับอักขระกับอัตราความผิดพลาดระดับคำมีตัวส่วนที่ต่างกัน — อักขรวิธีอาหรับทำให้ช่องว่างระหว่างสองค่านี้กว้างกว่าที่เป็นในภาษาที่ใช้ตัวอักษรละติน — และคลังข้อมูลก็ไม่ใช่ชุดเดียวกัน การปรับมาตรฐานก็ไม่เหมือนกัน และตัวเลขหนึ่งมาพร้อมสคริปต์ที่ทำซ้ำได้ ส่วนอีกตัวเลขหนึ่งมาจากส่วนผสมคงที่ของแทร็กเกอร์ที่ถ่วงน้ำหนักไปทางการพูดของเอเจนต์ภาษาอังกฤษ

การเปรียบเทียบที่มีประโยชน์กว่าคือการเปรียบเทียบที่อยู่ในเอกสารสเปกของ Mistral เอง: 8.82% สำหรับแบบสตรีมมิ่ง เทียบกับ 7.91% สำหรับแบบออฟไลน์ บนชุดทดสอบเดียวกันและการปรับมาตรฐานแบบเดียวกัน นั่นคือการวัดที่ชัดเจนว่าความหน่วงต่ำให้อะไรและแลกมาด้วยอะไรในภาษาจาเพาะอย่างอาหรับ และมีค่ามากกว่าอัตราส่วนเปอร์เซ็นต์ข้ามผู้จำหน่ายใด ๆ สิ่งที่ยังไม่มีใครเผยแพร่คือการทดสอบภาษาอาหรับแบบเทียบเคียงกันตรง ๆ ของโมเดล Google และ Mistral บนไฟล์เสียงเดียวกัน ตราบใดที่ยังไม่มีใครทำ คำถามที่ว่า "ตัวไหนแม่นยำกว่าในภาษาอาหรับ" จึงยังเป็นคำถามที่ยังไม่มีคำตอบ และคำตอบเดียวที่ปกป้องได้คือ: ลองทั้งสองตัวกับไฟล์บันทึกเสียงของคุณเอง

มีรายละเอียดหนึ่งในการ์ดของ Mistral ที่ควรค่าแก่การกล่าวถึง เพราะมันสวนทางกับผลประโยชน์ของผู้ขายเอง โดยระบุว่าตัวกรองความปลอดภัยของ Gemini บล็อกการถอดเสียงตัวอย่างเสียง FLEURS บางส่วน นั่นเป็นข้อสังเกตที่จริงและตรวจสอบได้เกี่ยวกับไปป์ไลน์ของคู่แข่ง และยังเป็นสิ่งประเภทที่ไม่เคยปรากฏบนลีดเดอร์บอร์ด — โมเดลที่ปฏิเสธจะถอดเสียงตัวอย่างจะได้คะแนนเป็นความล้มเหลวหรือเป็นไม่มีข้อมูล และไม่ว่าตีความแบบไหนก็ไม่ยุติธรรม หากเสียงของคุณมีเนื้อหาที่ตัวกรองเนื้อหาอาจตรวจจับได้ นั่นคือความเสี่ยงด้านการนำไปใช้จริงที่ไม่มีตัวเลข WER ใดจะเปิดเผยให้เห็น

ความหน่วง: ตัวปรับหมุนเทียบกับตัวเลขคงที่

โมเดลสตรีมมิ่งมักถูกเปรียบเทียบกันด้วยค่าความหน่วงเพียงค่าเดียว แต่สองตัวนี้ไม่มีค่าดังกล่าวร่วมกัน

• Voxtral Mini 4B Realtime Arabic — ความหน่วงในการถอดเสียงที่กำหนดค่าได้ ตัวเลข CER 8.82% ถูกอ้างอิงที่ 480 มิลลิวินาที และความหน่วงสามารถปรับได้ ซึ่งหมายความว่าตัวเลขความแม่นยำเป็นเพียงจุดหนึ่งบนเส้นโค้งที่ผู้ปฏิบัติงานเลือก ไม่ใช่คุณสมบัติของโมเดล โมเดลฐานของมันโฆษณาช่วงตั้งแต่ 240 มิลลิวินาทีไปจนถึง 2.4 วินาที

• Gemini 3.5 Transcribe Live — 0.40 วินาทีจากจุดสิ้นสุดของคำพูดถึงทรานสคริปต์สุดท้าย วัดโดย Artificial Analysis โดยมีผลลัพธ์บางส่วนทยอยเข้ามาอย่างต่อเนื่องระหว่างการพูด Google อ้างแยกต่างหากว่าเวลาในการถอดเสียงเป็นข้อความสุดท้ายดีขึ้น 70% เมื่อเทียบกับ Chirp 3 ซึ่งเป็นตัวเลขจากผู้ขายและยังไม่มีการทำซ้ำ

ทั้งคู่อยู่ในย่านเดียวกัน — ประมาณครึ่งวินาที — แต่ความหมายเชิงวิศวกรรมนั้นต่างกัน โมเดล Mistral มอบการแลกเปลี่ยนระหว่างความหน่วงและความแม่นยำให้คุณในรูปของพารามิเตอร์ ดังนั้นคุณจึงรันที่ 240 ms ได้เมื่อคำบรรยายแบบต่ำกว่าหนึ่งวินาทีสำคัญกว่าคะแนนความแม่นยำไม่กี่จุดสุดท้าย และดันความหน่วงให้ยาวออกไปเมื่อไม่จำเป็นต้องเป็นเช่นนั้น เอนด์พอยต์ของ Google นำเสนอจุดทำงานแบบตายตัว พร้อมแนบพฤติกรรมการกรองเนื้อหาของ Google เองมาด้วย สำหรับเอเจนต์เสียง การมีปุ่มปรับมีค่ามากกว่าตัวเลขคงที่ที่ดีกว่าเล็กน้อย เพราะการตั้งค่าที่เหมาะสมขึ้นอยู่กับเสียงของคุณและผู้ใช้ของคุณ และไม่มีผู้จำหน่ายรายใดเลือกแทนคุณได้

เส้นแบ่งที่แท้จริง: น้ำหนักแบบเปิดกับเอนด์พอยต์พรีวิว

ความแตกต่างด้านสัญญาอนุญาตและการเผยแพร่นั้นใหญ่กว่าช่องว่างของ benchmark ใด ๆ ในการเปรียบเทียบนี้ และมันเป็นตัวตัดสินการนำไปใช้งานจริงส่วนใหญ่ก่อนที่จะมีการพูดถึงความแม่นยำ

• Voxtral Mini 4B Realtime Arabic — Apache 2.0, น้ำหนัก BF16 บน Hugging Face, สามารถให้บริการด้วย vLLM ผ่าน WebSocket ที่ /v1/realtime และรองรับโดยตรงใน Transformers ตั้งแต่เวอร์ชัน 5.2.0 การ์ดนี้มาพร้อมตัวอย่าง Python และโมดูลการทำให้เป็นมาตรฐาน เพื่อให้คุณสามารถคำนวณ Arabic CER ได้ด้วยตนเอง ไม่มีส่วนใดของไปป์ไลน์ที่ต้องใช้เซิร์ฟเวอร์ของ Mistral และโมเดลมีขนาดเล็กพอที่คำถามด้านการดำเนินงานคือจะใช้ GPU ตัวไหน ไม่ใช่คุณจะจ่ายไหวหรือไม่

• Gemini 3.5 Transcribe Live — ใช้ได้เฉพาะ API, พรีวิวสาธารณะ, ไม่มีข้อผูกมัดเรื่องราคาที่ประกาศไว้นอกเหนือจากอัตราตามรายการ, และจำกัดเซสชันไว้ที่สิบนาที ซึ่งหมายความว่าหากนานกว่านั้นจะต้องถูกแบ่งเป็นช่วง, เชื่อมต่อใหม่, และเย็บต่อด้วยโค้ดของคุณเอง ข้อจำกัดสามประการที่ถูกรายงานพร้อมกับการเปิดตัวมีความสำคัญโดยเฉพาะสำหรับการปรับใช้ภาษาอาหรับ: endpoint แบบสตรีมมิ่งไม่ส่งคืนการแยกผู้พูดและไม่ส่งคืนการประทับเวลาระดับคำ ซึ่งทั้งสองอย่างมีอยู่ใน endpoint แบบแบตช์แต่ไม่มีในอันนี้ หากทรานสคริปต์ภาษาอาหรับของคุณจำเป็นต้องรู้ว่าใครพูดอะไร หรือจำเป็นต้องจัดเวลาให้ตรงกับเสียง, endpoint แบบ Live ไม่สามารถสร้างสิ่งนั้นได้ไม่ว่าภาษาใด

ข้อจำกัดสองข้อนั้นเป็นเหตุผลที่หนักแน่นที่สุดสำหรับโมเดลขนาดเล็กแบบเปิดในการนำไปใช้กับภาษาอาหรับจริง และมันไม่เกี่ยวข้องกับความแม่นยำเลย ไปป์ไลน์ของคอลเซ็นเตอร์ต้องการการระบุผู้พูด ไปป์ไลน์ด้านการปฏิบัติตามข้อกำหนดต้องการการประทับเวลา และโมเดลภาษาอาหรับแบบออฟไลน์ที่มีสคริปต์ปรับมาตรฐานซึ่งคุณควบคุมเองจะให้คุณได้ทั้งสองอย่างโดยไม่ต้องโต้เถียงกับสัญญาของ endpoint การ์ดโมเดลของ Mistral ยังระบุเรื่องนั้นเป็นข้อจำกัดมากกว่าคุณสมบัติ — มันมุ่งเป้าไปที่การถอดเสียง มันเป็นการฟাইনจูนของโมเดลเรียลไทม์ทั่วไป และมันซื่อสัตย์ว่ามีโมเดลที่กว้างกว่าอยู่ต้นทางหากคุณต้องการ

แต่ละอย่างมีค่าใช้จ่ายเท่าไร และอะไรที่ยังไม่ทราบ

• Gemini 3.5 Transcribe Live — ประมาณ $0.009 ต่อนาทีของเสียงแบบเฉลี่ยรวม ซึ่งคำนวณจากราคาตามรายการที่ $3.50 ต่อล้านโทเคนอินพุต และ $21 ต่อล้านโทเคนเอาต์พุต โดยประเมินเสียงที่ 25 โทเคนต่อวินาที และข้อความถอดเสียงที่ประมาณ 175 โทเคนต่อนาที เอนด์พอยต์แบบแบตช์อยู่ที่ประมาณ $0.005 ต่อนาที ตัวเลขทั้งสองเป็นค่าประมาณจากการแปลงเป็นโทเคนที่ Google สันนิษฐานไว้ ดังนั้นจึงเปลี่ยนแปลงได้หากการคิดบัญชีเปลี่ยนไป ปัจจุบันมีแพ็กเกจฟรี

• {{1}}Voxtral Mini 4B Realtime Arabic{{/1}} — ไม่มีราคาที่ประกาศไว้ เพราะยังไม่มีบริการที่เปิดให้ใช้ ต้นทุนจึงขึ้นอยู่กับค่าฮาร์ดแวร์ของคุณ โมเดลขนาด 4.4 พันล้านพารามิเตอร์ในรูปแบบ BF16 ทำงานได้บนตัวเร่งความเร็วสมัยใหม่เพียงตัวเดียว ดังนั้นต้นทุนส่วนเพิ่มต่อชั่วโมงเสียงจึงมีแค่ค่าไฟฟ้าและการใช้งาน ส่วนต้นทุนคงที่คือตัวเครื่อง เมื่อใช้งานในปริมาณมาก วิธีนี้ถูกกว่า API ที่คิดราคาต่อนาทีแบบใดก็ตาม และเมื่อไม่มีปริมาณการใช้งานเลย ก็แพงกว่า API ที่คิดราคาต่อนาทีแบบใดก็ตาม ซึ่งเป็นรูปแบบปกติของการค้าแบบเปิดน้ำหนัก

สิ่งที่ไม่ทราบที่สำคัญที่สุดในฝั่ง Mistral ไม่ใช่ราคา แต่คือว่ารีโพซิทอรีนี้เป็นจุดเริ่มต้นของสายผลิตภัณฑ์ หรือเป็นเพียงงานส่งมอบแบบครั้งเดียวภายใต้ความร่วมมือกับโมร็อกโก โมเดลที่เปิดตัวเงียบ ๆ โดยไม่มีการประกาศ ไม่มีราคา และไม่มีบริการ คือโมเดลที่ไม่มีพันธะสัญญาการสนับสนุนรองรับอยู่เบื้องหลัง Apache 2.0 หมายความว่าสัญญาอนุญาตไม่สามารถถอนคืนสำหรับเวตที่คุณมีอยู่แล้วได้ แต่ไม่ได้บอกอะไรเกี่ยวกับว่าเช็กพอยต์จะได้รับการดูแลรักษาหรือไม่ และตัวชี้โมเดลฐานในการ์ดของโมเดลเองก็ชี้ให้เห็นว่าโมเดลเรียลไทม์ทั่วไปยังคงเป็นสายที่ได้รับการสนับสนุนอยู่

สำหรับเลเยอร์ที่อยู่เหนือข้อความถอดเสียงขึ้นไป เลเยอร์การจัดเส้นทางจะคุ้มค่าก็ในแบบที่ไม่เกี่ยวกับการถอดเสียงเลย โมเดลทั้งสองนี้ไม่ใช่บริการ speech-to-text ที่เราโฮสต์ — OrcaRouter ไม่ได้จัดเส้นทางให้เอนด์พอยต์ใดในสองอันนี้ — แต่ตัวสรุป ตัวจำแนกเจตนา หรือเอเจนต์ที่บริโภคสตรีมนั้นเป็นโมเดลที่คุณจัดเส้นทางได้: API key เดียวใช้ได้กับโมเดลมากกว่า 200 รุ่นในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% ดังนั้นการลดราคาของผู้ขายจึงส่งผลถึงฝั่งเราในวันเดียวกัน พร้อมการสลับไปใช้ระบบสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง หากคุณกำลังต่อผู้ให้บริการเสียงพูดสองรายเข้าด้วยกันเพื่อรองรับความหลากหลายของสำเนียงอยู่แล้ว การวางโมเดลภาษาปลายทางไว้หลังคีย์เดียวแทนที่จะเป็นสองสัญญา คือครึ่งที่ประหยัดกว่าของการผสานระบบ

ควรสร้างต่อจากอันไหน

ถ้าเสียงของคุณเป็นภาษาอาหรับ — ไม่ว่าจะเป็นสำเนียงเดียว หลายสำเนียง หรือสลับภาษาระหว่างภาษาอาหรับกับภาษาอื่น — โมเดล Mistral ถือเป็นตัวเลือกที่จริงจังกว่า และเหตุผลนั้นเป็นเชิงโครงสร้างมากกว่าเชิงตัวเลข มันระบุชื่อสำเนียงที่มันถูกสร้างขึ้นมาเพื่อ มันเล็กพอที่จะรันบนฮาร์ดแวร์ของคุณเอง มันส่งคืนข้อความดิบที่คุณสามารถประมวลผลภายหลังได้ด้วยการปรับมาตรฐานของคุณเอง และมันไม่ได้อยู่หลังเพดานเซสชันสิบนาทีหรือตัวกรองเนื้อหาที่คุณตรวจสอบไม่ได้ ข้อเสียคือมันรองรับเพียงตระกูลภาษาเดียวและปฏิเสธตระกูลภาษาอื่น และยังไม่มีใครเผยแพร่การประเมินที่เป็นอิสระของมัน

หากเสียงของคุณครอบคลุมหลายภาษา หรือหากคุณต้องการบริการที่มีช่องทางสนับสนุนและตารางราคาที่เปิดเผยตั้งแต่วันนี้ Gemini 3.5 Transcribe Live สามารถเรียกใช้งานได้แล้ว ถูกวัดผลบนตัวติดตามของบุคคลที่สาม และครอบคลุมภาษาที่เช็กพอยต์ของ Mistral จะปฏิเสธ ต้นทุนที่ต้องแลกมาคือเพดานเซสชัน การขาดการแยกผู้พูด (diarization) และการประทับเวลา (timestamps) บน endpoint แบบสตรีมมิ่ง และข้อเท็จจริงที่ว่าความแม่นยำเฉพาะภาษาอาหรับเป็นคำกล่าวอ้างที่คุณต้องทดสอบด้วยตัวเอง — รายการ locale ระบุชื่ออียิปต์ และประสิทธิภาพตามภาษาถิ่นไม่ได้แจกแจงไว้

สิ่งที่ต้องจับตาดูไม่ใช่ benchmark แต่คือว่า Mistral จะประกาศโมเดลนี้หรือไม่ และถ้าประกาศ จะประกาศด้วยราคาเท่าไรและแผนเส้นทางภาษาศาสตร์แบบไหน repository ที่เงียบ ๆ พร้อมสัญญาอนุญาต Apache 2.0 เป็นชิ้นงานที่มีประโยชน์แต่เป็นคำมั่นที่อ่อน ถ้ามี roadmap ภาษาถิ่นอาหรับตามมา — Levantine, Gulf, Egyptian เป็น checkpoint แยกกัน — เส้นทางโมเดลขนาดเล็กจะกลายเป็นคำตอบที่สมบูรณ์จริง ๆ สำหรับภูมิภาคนี้ และข้อโต้แย้งเรื่องความกว้างก็จะยิ่งยากขึ้นมากที่จะยกขึ้นมาพูด

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Gemini 3.5 Transcribe Live across six shared rows: coverage 16 named Arabic varieties against 85+ locales that list Arabic as Egypt only; reported accuracy 8.82% Arabic character error rate at 480ms against 4.0% streaming word error rate at 0.40s; evidence vendor card unreproduced against Artificial Analysis cited by Google; delay configurable with 480ms quoted against 0.40s fixed to final transcript; weights Apache 2.0 and downloadable against API only in public preview; and diarization and timestamps not documented against absent on the Live endpoint. A footer reads that Mistral figures are vendor-reported while Gemini figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

ทั้งสองอย่างนี้ไม่ใช่โมเดลเสียงพูดที่เราโฮสต์ไว้ แต่เลเยอร์ที่อยู่เหนือทรานสคริปต์นั้นสามารถเลือกเส้นทางได้ - กว่า 200 โมเดลภายใต้คีย์ API เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม 0% ดังนั้นหากผู้ขายลดราคาโมเดลการให้เหตุผลที่อยู่ปลายน้ำของทรานสคริปต์ของคุณ การลดราคาจะมีผลในวันเดียวกัน

การสลับไปใช้ระบบสำรองอัตโนมัติหมายความว่าไปป์ไลน์เสียงพูดที่ประกอบรวมกันมีโดเมนความล้มเหลวน้อยลงหนึ่งโดเมน เพราะตัวสรุปหรือตัวจำแนกเจตนาที่ใช้ข้อความถอดเสียงสามารถเปลี่ยนเส้นทางได้ แทนที่จะล่มไปพร้อมกับผู้ให้บริการ

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube