
Voxtral Mini 4B Realtime Arabic เทียบกับ Gemini 3.5 Transcribe Live: ภาษาถิ่นเทียบกับความกว้างขวาง
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
สองโมเดลถอดเสียงพูดแบบสตรีมมิ่ง สองเดิมพันที่แตกต่างกันอย่างสิ้นเชิงว่าส่วนที่ยากของการถอดเสียงคืออะไร Voxtral Mini 4B Realtime Arabic เป็นโมเดล fine-tune ขนาด 4.4 พันล้านพารามิเตอร์ที่ Mistral AI ผลักขึ้น repository สาธารณะเมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีโพสต์เปิดตัว ไม่มีบทความบล็อก หรือแม้แต่บรรทัดในดัชนีข่าวของบริษัท ฝึกมาโดยเฉพาะกับ Modern Standard Arabic และภาษาถิ่นสิบห้าแบบ เผยแพร่ภายใต้ Apache 2.0 พร้อมน้ำหนัก BF16 ที่ดาวน์โหลดได้ ส่วน Gemini 3.5 Transcribe Live คือ endpoint แบบสตรีมมิ่งของ Gemini 3.5 Transcribe จาก Google ซึ่งประกาศในเดือนสิงหาคม 2026 พร้อมกลไกครบชุดของการเปิดตัวแพลตฟอร์ม รองรับกว่า 85 โลเคล และเป็นแบบปิด — พรีวิว API ที่ไม่มีน้ำหนักโมเดลและจำกัดเซสชันไว้ที่สิบนาที โมเดลหนึ่งเจาะลึกในตระกูลภาษาเดียวและบอกเช่นนั้นในส่วนข้อจำกัดของตัวเอง ส่วนอีกโมเดลเลือกทางกว้างและปล่อยให้การรับประกันในระดับสำเนียงไม่ถูกระบุไว้ คุณจะเลือกอันไหนขึ้นอยู่กับแกนที่การตลาดของผู้ขายทั้งสองไม่ได้ให้ความสำคัญเป็นอันดับแรก: เสียงของคุณฟังดูเป็นอย่างไรจริง ๆ
นี่ไม่ใช่การเปรียบเทียบที่สมมาตร และเป็นการดีกว่าที่จะพูดไว้ตั้งแต่ต้นแทนที่จะฝังมันไว้ โมเดล Mistral มีอายุ 48 ชั่วโมงในเวลาที่เขียน ไม่มีประกาศจากผู้ขาย ไม่มีการประเมินอิสระ และไม่มีราคาที่เผยแพร่ โมเดลของ Google อยู่ในช่วงตัวอย่างสาธารณะตั้งแต่ปลายเดือนสิงหาคม และถูกวัดบนแทร็กเกอร์ของบุคคลที่สาม มองฝั่ง Mistral ว่าเป็นชุดข้ออ้างจากโมเดลการ์ด และฝั่ง Google ว่าเป็นชุดการวัดบวกกับชุดข้ออ้าง แล้วการเปรียบเทียบจะยังคงซื่อสัตย์
โมเดลแต่ละตัวคืออะไร ก่อนจะพูดถึงตัวเลข
• Voxtral Mini 4B Realtime Arabic — โมเดล ASR แบบสตรีมมิ่งที่ปรับแต่ง (fine-tune) มาจาก Voxtral-Mini-4B-Realtime-2602 มีพารามิเตอร์ประมาณ 4.4B ใน BF16 รับสัญญาณเสียง 16 kHz ผ่านตัวเข้ารหัสเสียงแบบ causal และตัวถอดรหัสภาษา จะปล่อยข้อความออกมาในขณะที่เสียงเข้ามา โดยมีความหน่วงในการถอดข้อความที่กำหนดค่าได้ และใช้สัญญาอนุญาต Apache 2.0 โดยมีเวตของโมเดลอยู่บน Hugging Face Mistral ร่วมพัฒนาโมเดลนี้กับกระทรวงการเปลี่ยนผ่านดิจิทัลและการปฏิรูประบบราชการของโมร็อกโก (Ministère de la Transition Numérique et de la Réforme Administrative) ภายใต้ความร่วมมือที่ลงนามในเดือนมกราคม 2026 และอธิบายว่าโมเดลนี้เป็นสินทรัพย์ AI อธิปไตย
• Gemini 3.5 Transcribe Live — ครึ่งหนึ่งแบบสตรีมมิ่งของการเปิดตัวแบบสองโมเดล ปลายทาง Live API ส่งผ่านเสียงไมโครโฟนแบบต่อเนื่องผ่าน WebSocket ส่งคืนบทถอดความบางส่วนในขณะที่ผู้พูดยังพูดอยู่ และจะได้บทถอดความฉบับสมบูรณ์ไม่นานหลังจากแต่ละประโยคจบลง โมเดลพี่น้องแบบแบตช์ gemini-3.5-transcribe ให้บริการไฟล์ที่บันทึกไว้ล่วงหน้าสูงสุดหนึ่งชั่วโมง ทั้งคู่อยู่ในช่วงพรีวิวสาธารณะ ทั้งคู่เป็นแบบ API-only และทั้งคู่ยังไม่เผยแพร่เวต
ความแตกต่างเชิงโครงสร้างประการแรกไม่ใช่เรื่องความแม่นยำ หากแต่ว่าสิ่งหนึ่งในสองนี้เป็นไฟล์ที่คุณดาวน์โหลดได้ภายในคืนนี้ ส่วนอีกสิ่งหนึ่งเป็นบริการที่คุณต้องได้รับการอนุมัติก่อนจึงจะใช้งานได้

ความครอบคลุมของภาษา: 16 เทียบกับ 85 ภาษาขึ้นไป และช่องว่างไม่ใช่ประเด็นสำคัญ
การนับจำนวนภาษาทำให้โมเดล Mistral ดูมีขอบเขตจำกัด และทำให้โมเดล Google ดูใหญ่โตมหาศาล การนับเหล่านี้วัดคนละสิ่ง และการนำตัวเลขมาอ่านเทียบกันแบบวางเคียงข้างโดยไม่มีข้อควรระวังนั้น คือความผิดพลาดที่พบบ่อยที่สุดที่การเปรียบเทียบนี้ชักนำให้เกิด
• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 ชนิด แต่ละชนิดระบุชื่อไว้บนการ์ดโมเดลตามกลุ่มสำเนียง ได้แก่ ภาษาอาหรับมาตรฐานสมัยใหม่ (Modern Standard Arabic) รวมถึงภาษาอาหรับโมร็อกโก ลิเบีย ตูนิเซีย แอลจีเรีย และฮัสซานียะฮ์จากมักริบ; ภาษาอาหรับอ่าว นัจญ์ดี โอมาน และซานานีจากอ่าว; ภาษาอาหรับอียิปต์และซูดานจากลุ่มน้ำไนล์; ภาษาอาหรับเมโสโปเตเมีย และทั้งลิแวนไทน์ใต้และเหนือ; และภาษาอาหรับชาด กรอบของโมเดลการ์ดเองระบุว่าโมเดลนี้มุ่งเป้าไปที่การถอดเสียงภาษาอาหรับ และการสลับภาษา — ผู้พูดสลับภาษากลางบทสนทนา — เป็นความสามารถที่สร้างขึ้นมาเพื่อให้ทำได้อย่างถูกต้อง ไม่ใช่ผลข้างเคียง
• Gemini 3.5 Transcribe Live — การตรวจจับภาษาอัตโนมัติครอบคลุมมากกว่า 85 โลแคล รองรับการสลับภาษาทั้งภายในประโยคและระหว่างประโยค เอกสารของ Google ระบุว่าภาษาอาหรับอยู่ในชุดดังกล่าว ตารางโลแคลระบุ Arabic (Egypt) เป็นรายการสำหรับภาษาอาหรับ และความครอบคลุมของโลแคลภาษาอาหรับในวงกว้างไม่ได้ถูกแจกแจงไว้ในเอกสารของโมเดลเอง
อ่านสิ่งนั้นอย่างตรงไปตรงมา แล้วรูปร่างของข้อแลกเปลี่ยนก็จะปรากฏขึ้น ค่า 85+ ของ Google เป็นข้ออ้างเชิงความกว้าง: ถ้าเสียงของคุณเป็นภาษาที่ไม่ใช่อาหรับ เอนด์พอยต์ของ Google รองรับมัน และโมเดล Mistral จะปฏิเสธมัน — การ์ดบอกตรง ๆ ว่าสำหรับภาษาอื่น คุณควรใช้ Voxtral Mini 4B Realtime ต้นฉบับ ไม่ใช่เช็กพอยต์นี้ ค่า 16 ของ Mistral เป็นข้ออ้างเชิงความลึก มันไม่ได้อ้างว่าถอดเสียงภาษาอาหรับ แต่กำลังอ้างว่าถอดเสียง Moroccan Darija, Gulf Arabic, Egyptian Arabic และ Chadian Arabic เป็นเป้าหมายที่แยกจากกัน ซึ่งเป็นปัญหาที่ยากกว่าอย่างมีนัยสำคัญกว่าการถอดเสียง Modern Standard Arabic แล้วหวังว่าภาษาถิ่นจะหลุดออกมาเอง เบนช์มาร์กที่ให้น้ำหนักกับภาษาอังกฤษและเน้นความกว้างก่อนจะไม่มีทางแสดงความแตกต่างนั้นให้คุณเห็น เพราะชุดภาษาถิ่นไม่ได้รวมอยู่ในนั้น
สำหรับคอลเซ็นเตอร์ในโมร็อกโกหรือสายสนับสนุนลูกค้าในกลุ่มประเทศอ่าว โมเดลที่รองรับ 16 ภาษาถิ่นและไม่มีอย่างอื่นเลยอาจเอาชนะโมเดลที่รองรับ 85 โลแคลที่ความแม่นยำต่อภาษาถิ่นซึ่งไม่ได้ระบุไว้ได้ สำหรับบริษัทในยุโรปที่ถอดเสียงการประชุมในห้าภาษา สมการจะกลับด้านทันที ไม่มีผู้ขายรายใดผิด พวกเขาเลือกกลุ่มลูกค้าที่ต่างกัน

ตัวเลขที่คุณเปรียบเทียบได้ และตัวเลขที่คุณเปรียบเทียบไม่ได้
นี่คือจุดที่ความไม่สมมาตรกัดกิน โมเดลทั้งสองรายงานหน่วยที่ต่างกัน บนคลังข้อมูลที่ต่างกัน ด้วยหลักฐานที่รองรับต่างกัน และไม่มีบุคคลที่สามใดนำทั้งสองมาเปรียบเทียบกัน
• Voxtral Mini 4B Realtime Arabic — ค่าเฉลี่ยอัตราความผิดพลาดระดับตัวอักษร (Character Error Rate) 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับทั้งเจ็ด ที่ความหน่วงในการถอดเสียงซึ่งกำหนดค่าไว้ 480 มิลลิวินาที ตามการ์ดโมเดลของ Mistral เอง และไม่ได้รับการทำซ้ำโดยอิสระ
• โมเดลที่มันกำลังไล่ตาม — Voxtral Transcribe Arabic ที่ 7.91% CER บนเกณฑ์มาตรฐานเจ็ดชุดเดียวกัน ด้วยการวัดแบบเดียวกัน ดังนั้นโมเดลเรียลไทม์จึงตามหลังโมเดลภาษาออฟไลน์จากผู้ขายรายเดียวกันอยู่ 0.91 จุดเปอร์เซ็นต์ ช่องว่างนี้คือการเปรียบเทียบของ Mistral เอง ซึ่งทำให้ข้อมูลนี้มีประโยชน์อย่างยิ่ง: ผู้ขายกำลังบอกคุณว่าการสตรีมมีต้นทุนด้านความแม่นยำเท่าใดในตระกูลภาษานี้
• Gemini 3.5 Transcribe Live — อัตราความผิดพลาดระดับคำแบบสตรีมมิ่ง 4.0% วัดโดย Artificial Analysis และถูกอ้างอิงโดย Google โดยข้อความถอดความฉบับสุดท้ายมาถึง 0.40 วินาทีหลังสิ้นสุดการพูด นอกจากนี้ยังวัดได้: 2.6% บนบอร์ดแบบไม่สตรีมมิ่งของตัวติดตามเดียวกัน และ 5.50% แบบสตรีมมิ่งบน FLEURS ตามรายงานของ Google เอง
อย่าเอา 8.82% CER ไปวางข้าง 4.0% WER แล้วสรุปผลใด ๆ อัตราความผิดพลาดระดับอักขระกับอัตราความผิดพลาดระดับคำมีตัวส่วนที่ต่างกัน — อักขรวิธีอาหรับทำให้ช่องว่างระหว่างสองค่านี้กว้างกว่าที่เป็นในภาษาที่ใช้ตัวอักษรละติน — และคลังข้อมูลก็ไม่ใช่ชุดเดียวกัน การปรับมาตรฐานก็ไม่เหมือนกัน และตัวเลขหนึ่งมาพร้อมสคริปต์ที่ทำซ้ำได้ ส่วนอีกตัวเลขหนึ่งมาจากส่วนผสมคงที่ของแทร็กเกอร์ที่ถ่วงน้ำหนักไปทางการพูดของเอเจนต์ภาษาอังกฤษ
การเปรียบเทียบที่มีประโยชน์กว่าคือการเปรียบเทียบที่อยู่ในเอกสารสเปกของ Mistral เอง: 8.82% สำหรับแบบสตรีมมิ่ง เทียบกับ 7.91% สำหรับแบบออฟไลน์ บนชุดทดสอบเดียวกันและการปรับมาตรฐานแบบเดียวกัน นั่นคือการวัดที่ชัดเจนว่าความหน่วงต่ำให้อะไรและแลกมาด้วยอะไรในภาษาจาเพาะอย่างอาหรับ และมีค่ามากกว่าอัตราส่วนเปอร์เซ็นต์ข้ามผู้จำหน่ายใด ๆ สิ่งที่ยังไม่มีใครเผยแพร่คือการทดสอบภาษาอาหรับแบบเทียบเคียงกันตรง ๆ ของโมเดล Google และ Mistral บนไฟล์เสียงเดียวกัน ตราบใดที่ยังไม่มีใครทำ คำถามที่ว่า "ตัวไหนแม่นยำกว่าในภาษาอาหรับ" จึงยังเป็นคำถามที่ยังไม่มีคำตอบ และคำตอบเดียวที่ปกป้องได้คือ: ลองทั้งสองตัวกับไฟล์บันทึกเสียงของคุณเอง
มีรายละเอียดหนึ่งในการ์ดของ Mistral ที่ควรค่าแก่การกล่าวถึง เพราะมันสวนทางกับผลประโยชน์ของผู้ขายเอง โดยระบุว่าตัวกรองความปลอดภัยของ Gemini บล็อกการถอดเสียงตัวอย่างเสียง FLEURS บางส่วน นั่นเป็นข้อสังเกตที่จริงและตรวจสอบได้เกี่ยวกับไปป์ไลน์ของคู่แข่ง และยังเป็นสิ่งประเภทที่ไม่เคยปรากฏบนลีดเดอร์บอร์ด — โมเดลที่ปฏิเสธจะถอดเสียงตัวอย่างจะได้คะแนนเป็นความล้มเหลวหรือเป็นไม่มีข้อมูล และไม่ว่าตีความแบบไหนก็ไม่ยุติธรรม หากเสียงของคุณมีเนื้อหาที่ตัวกรองเนื้อหาอาจตรวจจับได้ นั่นคือความเสี่ยงด้านการนำไปใช้จริงที่ไม่มีตัวเลข WER ใดจะเปิดเผยให้เห็น
ความหน่วง: ตัวปรับหมุนเทียบกับตัวเลขคงที่
โมเดลสตรีมมิ่งมักถูกเปรียบเทียบกันด้วยค่าความหน่วงเพียงค่าเดียว แต่สองตัวนี้ไม่มีค่าดังกล่าวร่วมกัน
• Voxtral Mini 4B Realtime Arabic — ความหน่วงในการถอดเสียงที่กำหนดค่าได้ ตัวเลข CER 8.82% ถูกอ้างอิงที่ 480 มิลลิวินาที และความหน่วงสามารถปรับได้ ซึ่งหมายความว่าตัวเลขความแม่นยำเป็นเพียงจุดหนึ่งบนเส้นโค้งที่ผู้ปฏิบัติงานเลือก ไม่ใช่คุณสมบัติของโมเดล โมเดลฐานของมันโฆษณาช่วงตั้งแต่ 240 มิลลิวินาทีไปจนถึง 2.4 วินาที
• Gemini 3.5 Transcribe Live — 0.40 วินาทีจากจุดสิ้นสุดของคำพูดถึงทรานสคริปต์สุดท้าย วัดโดย Artificial Analysis โดยมีผลลัพธ์บางส่วนทยอยเข้ามาอย่างต่อเนื่องระหว่างการพูด Google อ้างแยกต่างหากว่าเวลาในการถอดเสียงเป็นข้อความสุดท้ายดีขึ้น 70% เมื่อเทียบกับ Chirp 3 ซึ่งเป็นตัวเลขจากผู้ขายและยังไม่มีการทำซ้ำ
ทั้งคู่อยู่ในย่านเดียวกัน — ประมาณครึ่งวินาที — แต่ความหมายเชิงวิศวกรรมนั้นต่างกัน โมเดล Mistral มอบการแลกเปลี่ยนระหว่างความหน่วงและความแม่นยำให้คุณในรูปของพารามิเตอร์ ดังนั้นคุณจึงรันที่ 240 ms ได้เมื่อคำบรรยายแบบต่ำกว่าหนึ่งวินาทีสำคัญกว่าคะแนนความแม่นยำไม่กี่จุดสุดท้าย และดันความหน่วงให้ยาวออกไปเมื่อไม่จำเป็นต้องเป็นเช่นนั้น เอนด์พอยต์ของ Google นำเสนอจุดทำงานแบบตายตัว พร้อมแนบพฤติกรรมการกรองเนื้อหาของ Google เองมาด้วย สำหรับเอเจนต์เสียง การมีปุ่มปรับมีค่ามากกว่าตัวเลขคงที่ที่ดีกว่าเล็กน้อย เพราะการตั้งค่าที่เหมาะสมขึ้นอยู่กับเสียงของคุณและผู้ใช้ของคุณ และไม่มีผู้จำหน่ายรายใดเลือกแทนคุณได้
เส้นแบ่งที่แท้จริง: น้ำหนักแบบเปิดกับเอนด์พอยต์พรีวิว
ความแตกต่างด้านสัญญาอนุญาตและการเผยแพร่นั้นใหญ่กว่าช่องว่างของ benchmark ใด ๆ ในการเปรียบเทียบนี้ และมันเป็นตัวตัดสินการนำไปใช้งานจริงส่วนใหญ่ก่อนที่จะมีการพูดถึงความแม่นยำ
• Voxtral Mini 4B Realtime Arabic — Apache 2.0, น้ำหนัก BF16 บน Hugging Face, สามารถให้บริการด้วย vLLM ผ่าน WebSocket ที่ /v1/realtime และรองรับโดยตรงใน Transformers ตั้งแต่เวอร์ชัน 5.2.0 การ์ดนี้มาพร้อมตัวอย่าง Python และโมดูลการทำให้เป็นมาตรฐาน เพื่อให้คุณสามารถคำนวณ Arabic CER ได้ด้วยตนเอง ไม่มีส่วนใดของไปป์ไลน์ที่ต้องใช้เซิร์ฟเวอร์ของ Mistral และโมเดลมีขนาดเล็กพอที่คำถามด้านการดำเนินงานคือจะใช้ GPU ตัวไหน ไม่ใช่คุณจะจ่ายไหวหรือไม่
• Gemini 3.5 Transcribe Live — ใช้ได้เฉพาะ API, พรีวิวสาธารณะ, ไม่มีข้อผูกมัดเรื่องราคาที่ประกาศไว้นอกเหนือจากอัตราตามรายการ, และจำกัดเซสชันไว้ที่สิบนาที ซึ่งหมายความว่าหากนานกว่านั้นจะต้องถูกแบ่งเป็นช่วง, เชื่อมต่อใหม่, และเย็บต่อด้วยโค้ดของคุณเอง ข้อจำกัดสามประการที่ถูกรายงานพร้อมกับการเปิดตัวมีความสำคัญโดยเฉพาะสำหรับการปรับใช้ภาษาอาหรับ: endpoint แบบสตรีมมิ่งไม่ส่งคืนการแยกผู้พูดและไม่ส่งคืนการประทับเวลาระดับคำ ซึ่งทั้งสองอย่างมีอยู่ใน endpoint แบบแบตช์แต่ไม่มีในอันนี้ หากทรานสคริปต์ภาษาอาหรับของคุณจำเป็นต้องรู้ว่าใครพูดอะไร หรือจำเป็นต้องจัดเวลาให้ตรงกับเสียง, endpoint แบบ Live ไม่สามารถสร้างสิ่งนั้นได้ไม่ว่าภาษาใด
ข้อจำกัดสองข้อนั้นเป็นเหตุผลที่หนักแน่นที่สุดสำหรับโมเดลขนาดเล็กแบบเปิดในการนำไปใช้กับภาษาอาหรับจริง และมันไม่เกี่ยวข้องกับความแม่นยำเลย ไปป์ไลน์ของคอลเซ็นเตอร์ต้องการการระบุผู้พูด ไปป์ไลน์ด้านการปฏิบัติตามข้อกำหนดต้องการการประทับเวลา และโมเดลภาษาอาหรับแบบออฟไลน์ที่มีสคริปต์ปรับมาตรฐานซึ่งคุณควบคุมเองจะให้คุณได้ทั้งสองอย่างโดยไม่ต้องโต้เถียงกับสัญญาของ endpoint การ์ดโมเดลของ Mistral ยังระบุเรื่องนั้นเป็นข้อจำกัดมากกว่าคุณสมบัติ — มันมุ่งเป้าไปที่การถอดเสียง มันเป็นการฟাইনจูนของโมเดลเรียลไทม์ทั่วไป และมันซื่อสัตย์ว่ามีโมเดลที่กว้างกว่าอยู่ต้นทางหากคุณต้องการ
แต่ละอย่างมีค่าใช้จ่ายเท่าไร และอะไรที่ยังไม่ทราบ
• Gemini 3.5 Transcribe Live — ประมาณ $0.009 ต่อนาทีของเสียงแบบเฉลี่ยรวม ซึ่งคำนวณจากราคาตามรายการที่ $3.50 ต่อล้านโทเคนอินพุต และ $21 ต่อล้านโทเคนเอาต์พุต โดยประเมินเสียงที่ 25 โทเคนต่อวินาที และข้อความถอดเสียงที่ประมาณ 175 โทเคนต่อนาที เอนด์พอยต์แบบแบตช์อยู่ที่ประมาณ $0.005 ต่อนาที ตัวเลขทั้งสองเป็นค่าประมาณจากการแปลงเป็นโทเคนที่ Google สันนิษฐานไว้ ดังนั้นจึงเปลี่ยนแปลงได้หากการคิดบัญชีเปลี่ยนไป ปัจจุบันมีแพ็กเกจฟรี
• {{1}}Voxtral Mini 4B Realtime Arabic{{/1}} — ไม่มีราคาที่ประกาศไว้ เพราะยังไม่มีบริการที่เปิดให้ใช้ ต้นทุนจึงขึ้นอยู่กับค่าฮาร์ดแวร์ของคุณ โมเดลขนาด 4.4 พันล้านพารามิเตอร์ในรูปแบบ BF16 ทำงานได้บนตัวเร่งความเร็วสมัยใหม่เพียงตัวเดียว ดังนั้นต้นทุนส่วนเพิ่มต่อชั่วโมงเสียงจึงมีแค่ค่าไฟฟ้าและการใช้งาน ส่วนต้นทุนคงที่คือตัวเครื่อง เมื่อใช้งานในปริมาณมาก วิธีนี้ถูกกว่า API ที่คิดราคาต่อนาทีแบบใดก็ตาม และเมื่อไม่มีปริมาณการใช้งานเลย ก็แพงกว่า API ที่คิดราคาต่อนาทีแบบใดก็ตาม ซึ่งเป็นรูปแบบปกติของการค้าแบบเปิดน้ำหนัก
สิ่งที่ไม่ทราบที่สำคัญที่สุดในฝั่ง Mistral ไม่ใช่ราคา แต่คือว่ารีโพซิทอรีนี้เป็นจุดเริ่มต้นของสายผลิตภัณฑ์ หรือเป็นเพียงงานส่งมอบแบบครั้งเดียวภายใต้ความร่วมมือกับโมร็อกโก โมเดลที่เปิดตัวเงียบ ๆ โดยไม่มีการประกาศ ไม่มีราคา และไม่มีบริการ คือโมเดลที่ไม่มีพันธะสัญญาการสนับสนุนรองรับอยู่เบื้องหลัง Apache 2.0 หมายความว่าสัญญาอนุญาตไม่สามารถถอนคืนสำหรับเวตที่คุณมีอยู่แล้วได้ แต่ไม่ได้บอกอะไรเกี่ยวกับว่าเช็กพอยต์จะได้รับการดูแลรักษาหรือไม่ และตัวชี้โมเดลฐานในการ์ดของโมเดลเองก็ชี้ให้เห็นว่าโมเดลเรียลไทม์ทั่วไปยังคงเป็นสายที่ได้รับการสนับสนุนอยู่
สำหรับเลเยอร์ที่อยู่เหนือข้อความถอดเสียงขึ้นไป เลเยอร์การจัดเส้นทางจะคุ้มค่าก็ในแบบที่ไม่เกี่ยวกับการถอดเสียงเลย โมเดลทั้งสองนี้ไม่ใช่บริการ speech-to-text ที่เราโฮสต์ — OrcaRouter ไม่ได้จัดเส้นทางให้เอนด์พอยต์ใดในสองอันนี้ — แต่ตัวสรุป ตัวจำแนกเจตนา หรือเอเจนต์ที่บริโภคสตรีมนั้นเป็นโมเดลที่คุณจัดเส้นทางได้: API key เดียวใช้ได้กับโมเดลมากกว่า 200 รุ่นในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% ดังนั้นการลดราคาของผู้ขายจึงส่งผลถึงฝั่งเราในวันเดียวกัน พร้อมการสลับไปใช้ระบบสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง หากคุณกำลังต่อผู้ให้บริการเสียงพูดสองรายเข้าด้วยกันเพื่อรองรับความหลากหลายของสำเนียงอยู่แล้ว การวางโมเดลภาษาปลายทางไว้หลังคีย์เดียวแทนที่จะเป็นสองสัญญา คือครึ่งที่ประหยัดกว่าของการผสานระบบ
ควรสร้างต่อจากอันไหน
ถ้าเสียงของคุณเป็นภาษาอาหรับ — ไม่ว่าจะเป็นสำเนียงเดียว หลายสำเนียง หรือสลับภาษาระหว่างภาษาอาหรับกับภาษาอื่น — โมเดล Mistral ถือเป็นตัวเลือกที่จริงจังกว่า และเหตุผลนั้นเป็นเชิงโครงสร้างมากกว่าเชิงตัวเลข มันระบุชื่อสำเนียงที่มันถูกสร้างขึ้นมาเพื่อ มันเล็กพอที่จะรันบนฮาร์ดแวร์ของคุณเอง มันส่งคืนข้อความดิบที่คุณสามารถประมวลผลภายหลังได้ด้วยการปรับมาตรฐานของคุณเอง และมันไม่ได้อยู่หลังเพดานเซสชันสิบนาทีหรือตัวกรองเนื้อหาที่คุณตรวจสอบไม่ได้ ข้อเสียคือมันรองรับเพียงตระกูลภาษาเดียวและปฏิเสธตระกูลภาษาอื่น และยังไม่มีใครเผยแพร่การประเมินที่เป็นอิสระของมัน
หากเสียงของคุณครอบคลุมหลายภาษา หรือหากคุณต้องการบริการที่มีช่องทางสนับสนุนและตารางราคาที่เปิดเผยตั้งแต่วันนี้ Gemini 3.5 Transcribe Live สามารถเรียกใช้งานได้แล้ว ถูกวัดผลบนตัวติดตามของบุคคลที่สาม และครอบคลุมภาษาที่เช็กพอยต์ของ Mistral จะปฏิเสธ ต้นทุนที่ต้องแลกมาคือเพดานเซสชัน การขาดการแยกผู้พูด (diarization) และการประทับเวลา (timestamps) บน endpoint แบบสตรีมมิ่ง และข้อเท็จจริงที่ว่าความแม่นยำเฉพาะภาษาอาหรับเป็นคำกล่าวอ้างที่คุณต้องทดสอบด้วยตัวเอง — รายการ locale ระบุชื่ออียิปต์ และประสิทธิภาพตามภาษาถิ่นไม่ได้แจกแจงไว้
สิ่งที่ต้องจับตาดูไม่ใช่ benchmark แต่คือว่า Mistral จะประกาศโมเดลนี้หรือไม่ และถ้าประกาศ จะประกาศด้วยราคาเท่าไรและแผนเส้นทางภาษาศาสตร์แบบไหน repository ที่เงียบ ๆ พร้อมสัญญาอนุญาต Apache 2.0 เป็นชิ้นงานที่มีประโยชน์แต่เป็นคำมั่นที่อ่อน ถ้ามี roadmap ภาษาถิ่นอาหรับตามมา — Levantine, Gulf, Egyptian เป็น checkpoint แยกกัน — เส้นทางโมเดลขนาดเล็กจะกลายเป็นคำตอบที่สมบูรณ์จริง ๆ สำหรับภูมิภาคนี้ และข้อโต้แย้งเรื่องความกว้างก็จะยิ่งยากขึ้นมากที่จะยกขึ้นมาพูด

ทั้งสองอย่างนี้ไม่ใช่โมเดลเสียงพูดที่เราโฮสต์ไว้ แต่เลเยอร์ที่อยู่เหนือทรานสคริปต์นั้นสามารถเลือกเส้นทางได้ - กว่า 200 โมเดลภายใต้คีย์ API เดียว ในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม 0% ดังนั้นหากผู้ขายลดราคาโมเดลการให้เหตุผลที่อยู่ปลายน้ำของทรานสคริปต์ของคุณ การลดราคาจะมีผลในวันเดียวกัน
การสลับไปใช้ระบบสำรองอัตโนมัติหมายความว่าไปป์ไลน์เสียงพูดที่ประกอบรวมกันมีโดเมนความล้มเหลวน้อยลงหนึ่งโดเมน เพราะตัวสรุปหรือตัวจำแนกเจตนาที่ใช้ข้อความถอดเสียงสามารถเปลี่ยนเส้นทางได้ แทนที่จะล่มไปพร้อมกับผู้ให้บริการ
