สร้างการ์ดชื่อเรื่องหลักสำหรับการเปรียบเทียบระหว่าง Voxtral Mini 4B Realtime Arabic และ Grok Voice Transcribe 2.0 โดยมีคำบรรยายว่า 'ผู้นำลีดเดอร์บอร์ดป้ายกำกับพบกับผู้เชี่ยวชาญภาษาอาหรับ 16 ภาษาถิ่น' ติดป้ายว่า 'รีโพซิทอรีของ Mistral, 8 ตุลาคม 2026' พร้อมชิปสถิติสามอันที่ระบุอัตราความผิดพลาดระดับอักขระภาษาอาหรับ 8.82% ที่ 480ms เทียบกับอัตราความผิดพลาดระดับคำ 2.7% ที่ 0.49s, ภาษาถิ่นที่มีชื่อ 16 ภาษา เทียบกับ 38+ ภาษาที่ไม่มีเอกสารบันทึก และน้ำหนักโมเดล Apache 2.0 เทียบกับ $0.20 ต่อชั่วโมงเสียง และโลโก้ OrcaRouter ที่คอมโพสิตในแถบสีขาวบริเวณมุมขวาล่าง
Guides & Insights

Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: ผู้นำตารางคะแนนพบผู้เชี่ยวชาญด้านภาษาถิ่น

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

จุดเริ่มต้นที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ Voxtral Mini 4B Realtime Arabic และ G​rok Voice Transcribe 2.0 ไม่ได้แข่งขันกันในงานเดียวกัน และวิธีที่เร็วที่สุดที่จะเห็นได้คือการดูว่าผู้ขายแต่ละรายยินดีเผยแพร่อะไร Mistral AI วาง Voxtral Mini 4B Realtime Arabic บน Hugging Face เมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีการประกาศ — น้ำหนัก Apache 2.0, การ์ดโมเดลที่ระบุภาษาอาหรับ 16 ชนิด และตัวเลขความแม่นยำเพียงตัวเดียวที่ 8.82% อัตราความผิดพลาดของตัวอักษรเฉลี่ยจากเกณฑ์มาตรฐานภาษาอาหรับเจ็ดรายการที่ความหน่วง 480 มิลลิวินาที G​rok Voice Transcribe 2.0 ของ x​AI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 พร้อมโพสต์เปิดตัว ราคา และผลลัพธ์จากกระดานผู้นำของบุคคลที่สาม: อัตราความผิดพลาดของคำ 2.7% ในบทถอดความสุดท้าย โดยข้อความจะเสร็จสิ้น 0.49 วินาทีหลังจากผู้พูดหยุด เป็นอันดับหนึ่งในกระดานสตรีมมิ่งเสียงเป็นข้อความของ Artificial Analysis เมื่อเปิดตัว โมเดลหนึ่งบอกคุณอย่างชัดเจนว่าจัดการภาษาถิ่นใดและปฏิเสธที่จะคาดเดานอกเหนือจากนั้น อีกโมเดลบอกคุณว่าครอบคลุม 38 ภาษาขึ้นไปและไม่ได้แจกแจงแม้แต่ภาษาเดียว

ความไม่สมมาตรนั้นคือสาระของการเปรียบเทียบทั้งหมด หากคุณกำลังซื้อความจุในการถอดเสียงแบบจำนวนมากสำหรับเสียงที่ใช้หลายภาษา โมเดลของ xAI ก็เป็นผลิตภัณฑ์ที่สมบูรณ์กว่าอย่างมาก หากเสียงของคุณเป็นภาษาอาหรับ — และโดยเฉพาะอย่างยิ่งหากเป็นภาษาอาหรับถิ่น ไม่ใช่ภาษาอาหรับมาตรฐานสมัยใหม่แบบที่ใช้ในงานกระจายเสียง — เช็กพอยต์ของ Mistral มุ่งเป้าไปที่ปัญหาที่ลีดเดอร์บอร์ดซึ่งโมเดลของ xAI ครองอันดับสูงสุดไม่ได้วัด และการที่มันอยู่อันดับสองบนบอร์ดนั้นแทนที่จะเป็นอันดับหนึ่ง ก็ถือเป็นความผิดพลาดถ้าจะตีความว่าเป็นคำตัดสิน

{{1}}การคำนวณราคา{{/1}} {{2}}เพราะมันเรียบง่ายผิดปกติตรงนี้{{/2}}

xAI เผยแพร่อัตรา Mistral เผยแพร่การดาวน์โหลด ความแตกต่างนี้เป็นตัวกำหนดทุกอย่างที่ตามมา ดังนั้นจงเริ่มจากตัวเลขที่มีอยู่จริง

• Grok Voice Transcribe 2.0 — $0.10 ต่อชั่วโมงเสียงผ่าน REST สำหรับไฟล์ที่บันทึกไว้, $0.20 ต่อชั่วโมงเสียงผ่าน WebSocket แบบสตรีมมิง คิดเป็นประมาณ $1.67 ต่อหนึ่งพันนาทีสำหรับแบบแบตช์ และ $3.33 ต่อหนึ่งพันนาทีสำหรับแบบสตรีมมิง ซึ่งไม่เปลี่ยนแปลงจาก Grok Voice Transcribe 1.0 ณ จุดราคาเดียวกัน

• Voxtral Mini 4B Realtime Arabic — ไม่มีราคาที่เผยแพร่ เพราะไม่มีบริการที่เผยแพร่ น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 และมีพารามิเตอร์ประมาณ 4.4 พันล้านตัวใน BF16 ซึ่งหมายความว่าต้นทุนคือ GPU ที่คุณนำมาใช้กับมัน และอัตราการใช้งานที่คุณทำได้จากมัน ที่ปริมาณการใช้งานต่อเนื่องถือว่าถูก แต่ที่ปริมาณเป็นศูนย์ นี่คือตัวเลือกที่แพงที่สุดในบทความนี้ เพราะคุณกำลังจ่ายสำหรับฮาร์ดแวร์ที่ไม่ได้ใช้งาน

จุดคุ้มทุนไม่ใช่เรื่องซับซ้อน อัตราการสตรีมที่ $0.0 ต่อชั่วโมงคิดเป็นประมาณหนึ่งในสามของเซนต์ต่อนาที เครื่องใดก็ตามที่คุณจะใช้รัน 4.4B มีค่าใช้จ่ายต่อชั่วโมงสูงกว่านั้น เว้นแต่คุณจะดันทราฟฟิกให้ไหลผ่านมันอย่างต่อเนื่อง ซึ่งหมายความว่าเส้นทาง open-weights จะชนะเรื่องต้นทุนก็ต่อเมื่อคุณมีปริมาณภาษาอาหรับมากพอที่จะทำให้เครื่องหนึ่งเครื่องทำงานเต็มที่ — และจะแพ้ในทุกมิติอื่นระหว่างที่คุณกำลังไปถึงจุดนั้น เพราะ API ไม่มี capex ไม่ต้องวางแผนความจุ และไม่มีภาระด้านปฏิบัติการ

Screenshot of the Hugging Face model card for mistralai/Voxtral-Mini-4B-Realtime-Arabic, captured 10 October 2026, showing the model name, the mistralai organisation with 199k followers, the Automatic Speech Recognition pipeline tag, three likes, and the repository file listing that includes model.safetensors and normalization.py.

จุดเดียวที่การคำนวณพลิกตั้งแต่ต้นคือการปฏิบัติตามข้อกำหนด เช็กพอยต์ Mistral ประมวลผลเสียงบนฮาร์ดแวร์ที่คุณควบคุม จึงไม่มีอะไรออกจากเครือข่ายของคุณ และการ์ดนี้มาพร้อมโมดูลการทำให้เป็นมาตรฐาน ดังนั้นไปป์ไลน์การให้คะแนนภาษาอาหรับจึงอยู่ในมือคุณที่จะตรวจสอบ Grok Voice Transcribe 2.0 ทำงานในภูมิภาคของ xAI และตามเอกสารของมัน ประมวลผลเสียงแบบเรียลไทม์โดยไม่เก็บไว้หรือนำไปใช้ฝึก โดยได้รับการรับรอง SOC 2 Type II และมีคุณสมบัติตาม HIPAA ทั้งสองเรื่องต่างก็ป้องกันได้ แต่มีเพียงเรื่องเดียวเท่านั้นที่เปิดให้หน่วยงานกำกับดูแลตรวจสอบเส้นทางโค้ดได้

สิ่งที่ $0.20 ต่อชั่วโมงซื้อได้จริง และโมเดล Mistral ยังไม่เปิดตัว

ช่องว่างด้านฟีเจอร์ตรงนี้ใหญ่กว่าช่องว่างด้านความแม่นยำ และถูกพูดถึงน้อยกว่ามาก Grok Voice Transcribe 2.0 เป็นผลิตภัณฑ์ที่มีอินเทอร์เฟซ ส่วน Voxtral Mini 4B Realtime Arabic เป็นเช็กพอยต์ที่ส่งข้อความออกมา

• การแยกผู้พูด (Speaker diarization) — รวมอยู่ใน Grok Voice Transcribe 2.0 พร้อมการถอดเสียงแบบหลายช่องสัญญาณสูงสุดแปดช่องสัญญาณอิสระ การ์ดของ Mistral ไม่ได้ระบุถึงความสามารถด้านการแยกผู้พูด โมเดลนี้สร้างบทถอดความ แต่ไม่ได้ระบุว่าใครเป็นผู้พูด

• การประทับเวลาในระดับคำ — Grok แนบมาพร้อมคะแนนความเชื่อมั่น จึงทำให้คุณตั้งเกณฑ์ตัดช่วงที่มีความเชื่อมั่นต่ำได้ แทนที่จะเชื่อถือบทถอดเสียงทั้งหมดเท่ากันทุกส่วน การ์ดของ Mistral ไม่ได้อ้างว่ามีการประทับเวลาสำหรับเช็กพอยต์นี้

• การไบแอสคำสำคัญ — รองรับคำศัพท์เฉพาะโดเมนได้ถึง 100 คำต่อคำขอบนเอนด์พอยต์ Grok ซึ่งเป็นวิธีที่ทำให้โมเดลระบุชื่อผลิตภัณฑ์ รหัสบัญชี และชื่อสถานที่ได้อย่างถูกต้องโดยไม่ต้อง fine-tuning ส่วนเส้นทางของ Mistral ที่ให้ผลลัพธ์เดียวกันคือการ fine-tuning ด้วยข้อมูลของคุณเอง ซึ่ง Apache 2.0 อนุญาต แต่เอนด์พอยต์แบบโฮสต์ไม่อนุญาต

• การนอร์มัลไลเซชันข้อความแบบผกผัน — Grok จัดรูปแบบตัวเลข วันที่ สกุลเงิน หมายเลขโทรศัพท์ และที่อยู่อีเมลให้อยู่ในรูปแบบลายลักษณ์อักษรใน 25 ภาษา การ์ดของ Mistral มีสคริปต์นอร์มัลไลเซชันรวมอยู่ด้วย แต่จุดประสงค์ที่ระบุไว้คือการให้คะแนนเบนช์มาร์กภาษาอาหรับ ไม่ใช่การจัดรูปแบบเอาต์พุตเพื่อการแสดงผล

• ขอบเขตอินเทอร์เฟซ — REST สำหรับไฟล์ขนาดสูงสุด 500 MB, การสตรีมผ่าน WebSocket ที่ wss://api.x.ai/v1/stt พร้อมผลลัพธ์ชั่วคราวประมาณทุก ๆ 500 ms, เอกสารระบุ 10 คำขอต่อวินาทีและ 100 เซสชันสตรีมมิ่งพร้อมกัน และมีเพียงภูมิภาคเดียวในตอนนี้ ทางฝั่ง Mistral นั้น vLLM ให้บริการด้วย WebSocket ที่ /v1/realtime หรือใช้ Transformers แบบเนทีฟตั้งแต่เวอร์ชัน 5.2.0 โดยไม่มีข้อจำกัดอัตรานอกเหนือจากฮาร์ดแวร์ของคุณ

ถ้าคุณต้องการการแยกเสียงผู้พูด (diarization) และการประทับเวลา การเปรียบเทียบก็จบไปตั้งแต่ก่อนที่ความแม่นยำจะเข้ามาเกี่ยวข้องด้วยซ้ำ นั่นไม่ใช่การตำหนิโมเดล Mistral — ผู้เชี่ยวชาญภาษาอาหรับขนาด 4B ที่ได้รับการฝึกมาเพื่อสร้างข้อความภาษาถิ่นได้อย่างแม่นยำนั้นเป็นเป้าหมายทางวิศวกรรมที่แตกต่างจากบริการถอดเสียงทั่วไป — แต่มันหมายความว่าทั้งสองจะใช้แทนกันได้ก็ต่อเมื่อไปป์ไลน์ของคุณปฏิบัติกับมันเป็นวัตถุดิบสำหรับงานหลังการประมวลผลของคุณเอง

ปัญหารายการภาษา

ผู้จำหน่ายทั้งสองรายอธิบายการรองรับภาษาในลักษณะที่ทิ้งคำถามเดียวกันไว้โดยไม่มีคำตอบ จากทิศทางที่ตรงกันข้ามกัน

• Grok Voice Transcribe 2.0 — มากกว่า 38 ภาษา ตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาระหว่างการบันทึกในรอบเดียว ครอบคลุม 12 รูปแบบเสียงตั้งแต่ 8 kHz ถึง 48 kHz เอกสารระบุจำนวนแต่ไม่ได้ระบุรายการ ภาษาอาหรับไม่ได้ถูกเอ่ยชื่อเป็นรายบุคคลที่ใดในเนื้อหา ซึ่งหมายความว่าการรองรับภาษาอาหรับเป็นเพียงการอนุมานจากจำนวน ไม่ได้รับการยืนยันจากผู้ขาย

• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 วิธภาษาที่ระบุชื่อไว้อย่างชัดเจน: ภาษาอาหรับมาตรฐานสมัยใหม่; โมร็อกโก ลิเบีย ตูนิเซีย แอลจีเรีย และฮัสซานียะห์จากมาเกร็บ; อ่าว นัจญ์ดี โอมาน และซานานีจากอ่าว; อียิปต์และซูดานจากหุบเขานิล; เมโสโปเตเมีย และทั้งลิแวนต์ใต้และเหนือ; และอาหรับชาด ทุกอย่างนอกชุดนี้อยู่นอกขอบเขต และการ์ดระบุให้ใช้โมเดลเรียลไทม์ทั่วไปแทน

ดังนั้น คำถามที่ว่า "ตัวไหนจัดการกับภาษาอาหรับได้ดีกว่ากัน" มีโครงสร้างที่แปลกประหลาด โมเดล Mistral เป็นผู้เชี่ยวชาญด้านภาษาอาหรับที่มีเอกสารยืนยัน โดยมีอัตราความผิดพลาดภาษาอาหรับที่เผยแพร่แล้ว และไม่มีการตรวจสอบอย่างอิสระ โมเดล xAI เป็นผู้นำบนลีดเดอร์บอร์ดที่มีการบันทึกไว้ ซึ่งผู้ขายยังไม่ได้ยืนยันว่าภาษาอาหรับอยู่ในขอบเขตเลยด้วยซ้ำ การนับจำนวน 38 ภาษาที่รวมภาษาอาหรับ และรายการภาษาถิ่น 16 รายการที่รวมเฉพาะภาษาอาหรับ ต่างก็ตอบคำถามว่า "มันรองรับภาษาอาหรับไหม" — แต่มีเพียงหนึ่งเดียวเท่านั้นที่กำลังตอบว่า "มันรองรับดาริจาไหม"

Screenshot of the xAI documentation page for the grok-voice-transcribe-2.0 model, captured 10 October 2026, showing the Speech to Text entry in the Voice documentation navigation, the model page slug grok-voice-transcribe-2.0, its audio-to-text modality, and the us-east-1 region listing with rate-limit sections.

ลีดเดอร์บอร์ดไม่ได้ช่วยในกรณีนี้ การประเมินการแปลงเสียงเป็นข้อความของ Artificial Analysis เป็นส่วนผสมคงที่ที่ถ่วงน้ำหนักไปทางบทสนทนาแบบเอเจนต์ภาษาอังกฤษ ซึ่งเป็นดีไซน์ที่เหมาะสมสำหรับการจัดอันดับการถอดความทั่วไป แต่ไม่เหมาะสำหรับการทำให้เห็นจุดแข็งของภาษาอาหรับถิ่น โมเดลหนึ่งอาจทำได้ดีกว่าจริง ๆ กับภาษาอาหรับอ่าวและภาษาอาหรับโมร็อกโก แต่กลับปรากฏว่าอยู่ในระดับแค่ดีบนบอร์ดนั้น นี่ไม่ใช่การวิจารณ์บอร์ด แต่เป็นเหตุผลว่าทำไมจึงไม่ควรใช้มันเป็นข้อมูลนำเข้าเพียงอย่างเดียวสำหรับการนำไปใช้งานในระดับภูมิภาค

ความแม่นยำ ในหน่วยที่ไม่แปลงค่า

• Grok Voice Transcribe 2.0 — อัตราความผิดพลาดระดับคำของบทถอดเสียงฉบับสมบูรณ์ 2.7% โดยใช้เวลา 0.49 วินาทีถึงฉบับสมบูรณ์ และ 3.4% สำหรับผลลัพธ์บางส่วนครั้งแรก ทั้งสองค่าวัดจากดัชนี AA-WER v2 ของ Artificial Analysis ซึ่งผสมชุดข้อมูล agent-talk แบบส่วนตัวเข้ากับ VoxPopuli และ Earnings22 ตัวเลขผลลัพธ์บางส่วนครั้งแรกเป็นค่าน่าสนใจ: ลดลงจาก 18.3% ใน Grok Voice Transcribe 1.0 ซึ่งเป็นความแตกต่างระหว่างบทถอดเสียงบางส่วนที่คุณใช้จัดเส้นทางได้ กับบทถอดเสียงบางส่วนที่คุณทำได้เพียงแสดงผล

• Voxtral Mini 4B Realtime Arabic — อัตราความผิดพลาดระดับตัวอักษรเฉลี่ย 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับ 7 รายการ ที่ความหน่วง 480 มิลลิวินาที ในการประเมินของผู้จำหน่ายเองด้วยสคริปต์การปรับมาตรฐานที่จัดมาให้พร้อมกัน Mistral รายงานว่าผลลัพธ์นี้มีส่วนต่างไม่เกิน 0.91 จุดเปอร์เซ็นต์จาก Voxtral Transcribe Arabic ที่ค่า CER 7.91% ซึ่งเป็นโมเดลภาษาอาหรับแบบออฟไลน์จากห้องแล็บเดียวกัน — การเปรียบเทียบนี้มีค่ามากกว่าการเปรียบเทียบข้ามผู้จำหน่าย เพราะเกณฑ์มาตรฐาน การปรับมาตรฐาน และการวัดเหมือนกันทั้งสองฝ่าย

การนำ 2.7% มาวางข้าง ๆ 8.82% ไม่ใช่การเปรียบเทียบ แต่เป็นข้อผิดพลาดเชิงหมวดหมู่ อัตราความผิดพลาดระดับคำนับคำที่ผิดเทียบกับข้อความอ้างอิง อัตราความผิดพลาดระดับตัวอักษรนับตัวอักษรที่ผิด และอักขรวิธีภาษาอาหรับ — ซึ่งคำเดียวกันยอมรับการสะกดที่ถูกต้องได้หลายแบบ และคำวิภัติเกาะติดได้อย่างอิสระ — ทำให้ช่องว่างระหว่างตัวชี้วัดทั้งสองกว้างขึ้นมากกว่าที่ภาษาที่ใช้อักษรละตินแสดงให้เห็น คลังข้อมูลแตกต่างกัน การปรับมาตรฐานแตกต่างกัน และมีเพียงตัวเลขเดียวเท่านั้นที่มาจากบุคคลที่สาม สิ่งที่ตัวเลขทั้งสองสามารถบอกคุณได้อย่างชอบธรรมก็คือ โมเดล xAI เป็นตัวถอดความทั่วไปที่ผ่านการวัดและมีอันดับดี และโมเดล Mistral เป็นโมเดลเฉพาะภาษาอาหรับที่อ้างไว้ พวกมันไม่สามารถบอกคุณได้ว่าโมเดลไหนถอดเสียงของคุณได้ดีกว่ากัน

การเปรียบเทียบที่โน้มน้าวได้จริงคือการเปรียบเทียบในการ์ดของ Mistral เอง: สตรีมมิ่ง 8.82% เทียบกับออฟไลน์ 7.91% โดยใช้เกณฑ์วัดเจ็ดรายการเดียวกัน การปรับมาตรฐานเดียวกัน และแล็บเดียวกัน สตรีมมิ่งแลกมาด้วยความแม่นยำประมาณหนึ่งจุดในภาษาอาหรับเมื่อเทียบกับโมเดลแบบแบตช์ จะคุ้มค่าที่จะแลกหรือไม่นั้นขึ้นอยู่กับคุณ และตอนนี้เป็นการตัดสินใจที่มีข้อมูลประกอบแล้ว

จุดที่โมเดลขนาดเล็กชนะ และมันไม่ใช่บนกระดานคะแนน

สามสิ่งเกี่ยวกับเช็กพอยต์ของ Mistral นั้นมีค่ามากกว่าที่ตัวเลขชี้ให้เห็น และไม่มีสักข้อที่ปรากฏอยู่บนลีดเดอร์บอร์ดใดเลย

สิ่งแรกคืออนุกรมวิธานของภาษาถิ่นเอง การกำหนดให้สิบหกสายพันธุ์เป็นเป้าหมายการฝึกที่แตกต่างกัน รวมถึงฮัสซานียาและอาหรับชาด เป็นการระบุว่าได้วัดข้อผิดพลาดของโมเดลที่ใด โมเดลหลายภาษาทั่วไปที่รวมภาษาอาหรับไว้เป็นหนึ่งใน 38 ภาษา จะพัฒนาบนภาษาอาหรับมาตรฐานสมัยใหม่ก่อน เพราะนั่นคือที่ที่สัญญาณการฝึกและน้ำหนักของเกณฑ์มาตรฐานส่วนใหญ่ตกอยู่ โมเดลที่สร้างขึ้นสำหรับความร่วมมือกับโมร็อกโกควบคู่กับกระทรวงในแอฟริกาเหนือกำลังปรับให้เหมาะสมกับการกระจายที่แตกต่างออกไป และได้รับการพัฒนาร่วมกับเกณฑ์มาตรฐานสองรายการ — ISMA และ Darija in the Wild — ซึ่งสร้างขึ้นโดยเฉพาะเพื่อวัดสิ่งนั้น

อย่างที่สองคือความหน่วงที่ปรับแต่งได้ ค่า 8.82% ถูกอ้างอิงที่ 480 มิลลิวินาที และความหน่วงนั้นปรับได้แทนที่จะคงที่ ซึ่งเปลี่ยนตัวเลขความแม่นยำให้กลายเป็นจุดหนึ่งบนเส้นโค้งที่ผู้ปฏิบัติงานเลือก สำหรับงานคำบรรยายสด คุณสามารถย่อความหน่วงให้สั้นลงและยอมรับข้อผิดพลาดที่มากขึ้น; สำหรับไปป์ไลน์บันทึกการโทร คุณสามารถขยายให้ยาวขึ้นและได้ความแม่นยำกลับคืนมา Grok Voice Transcribe 2.0 นำเสนอจุดทำงานแบบคงที่ และเส้นทางการอัปเกรดของผู้ขายเองแสดงให้เห็นว่าทำไมสิ่งนี้จึงมีผลตามมา — การย้ายจาก 1.0 ไปเป็น 2.0 มีต้นทุนประมาณหนึ่งในสามของวินาทีทั้งในความหน่วงของ partial แรกและความหน่วงของ final และวิธีแก้ที่มีให้คุณคือการปักหมุดโมเดลเก่าไว้ ไม่ใช่การปรับปุ่มหมุน

ข้อที่สามคือ การให้สิทธิ์ภายใต้ Apache 2.0 นั้นไม่มีเงื่อนไขสำหรับเวตที่คุณมี ไม่ว่าเช็กพอยต์ต้นทางจะเกิดอะไรขึ้นก็ตาม — ไม่ว่าจะมีการประกาศ ตั้งราคา ปลดระวาง หรือไม่ถูกกล่าวถึงอีกเลย — อาร์ติแฟกต์ยังคงดาวน์โหลดได้ ไฟน์จูนได้ และพร้อมนำไปใช้ในผลิตภัณฑ์ของคุณเอง ตารางราคาของเอนด์พอยต์แบบโฮสต์และกำหนดการปลดระวางโมเดลเป็นสิ่งที่ผู้ขายสามารถเปลี่ยนแปลงได้ทั้งคู่ และ xAI ได้ส่งสัญญาณเจตนาที่จะทำให้ Grok Voice Transcribe 2.0 เป็นค่าเริ่มต้นและปลดระวาง 1.0 ซึ่งจะย้ายทุกการผสานรวมที่ไม่เคยส่งพารามิเตอร์โมเดลไปสู่โปรไฟล์ความหน่วงใหม่พร้อมกันในทันที

ในชั้นการกำหนดเส้นทางที่อยู่เหนือข้อความถอดเสียง มีข้อควรทราบในทางปฏิบัติข้อหนึ่ง: ไม่มีโมเดลใดเป็นระบบแปลงเสียงเป็นข้อความที่เราโฮสต์ และบทความนี้ไม่ได้อ้างว่าเป็นเช่นนั้น สิ่งที่ OrcaRouter ครอบคลุมคือชั้นโมเดลภาษาที่ประมวลผลสตรีม — ตัวสรุป ตัวจำแนก และเอเจนต์ — ซึ่งอยู่ภายใต้คีย์ API เดียว ครอบคลุมโมเดลมากกว่า 200 โมเดลในราคาตามรายการของผู้ให้บริการโดยคิดมาร์กอัป 0% ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจึงมาถึงที่นี่ในวันเดียวกัน ทีมที่ใช้ผู้ให้บริการเสียงพูดสองรายเพื่อครอบคลุมภาษา กำลังแบกสัญญาสองฉบับและเส้นทางการยืนยันตัวตนสองเส้นทางอยู่แล้ว การยุบครึ่งปลายน้ำให้เหลือคีย์เดียวคือชัยชนะที่ได้มาด้วยต้นทุนต่ำ

จะทำอะไรกับสิ่งนี้ดี

ให้ใช้ Grok Voice Transcribe 2.0 เป็นฐาน หากเสียงของคุณมีหลายภาษา หากคุณต้องการการแยกผู้พูด (diarization) การประทับเวลา (timestamps) หรือการให้น้ำหนักคำสำคัญ (key-term biasing) แบบใช้ได้ทันที หรือหากคุณต้องการบริการที่มีอัตราค่าบริการประกาศไว้และมีช่องทางสนับสนุนตั้งแต่วันนี้ มันเป็นผลิตภัณฑ์ที่สมบูรณ์กว่า ได้รับการวัดประเมินโดยบุคคลที่สาม และอัตราการสตรีมที่ $0.20 ต่อชั่วโมงเสียงนั้นต่ำพอจนข้อโต้แย้งเรื่องต้นทุนของ open-weights ไม่มีน้ำหนัก จนกว่าคุณจะรันปริมาณมากจริง ๆ

ต่อยอดจาก Voxtral Mini 4B Realtime Arabic หากเสียงของคุณเป็นภาษาอาหรับและเป็นภาษาถิ่นโดยเฉพาะ หากคุณต้องการให้โมเดลอยู่ภายในเครือข่ายของคุณเองด้วยเหตุผลด้านการปฏิบัติตามข้อกำหนด หรือหากคุณตั้งใจจะปรับแต่งละเอียด (fine-tune) — เพราะมีเพียงหนึ่งในสิ่งเหล่านี้เท่านั้นที่อนุญาตให้ทำได้ ยอมรับสามสิ่งก่อน: ไม่มีการแยกผู้พูด (diarization) ไม่มีการประทับเวลา (timestamps) และไม่มีการประเมินอิสระที่เผยแพร่โดยใครเลย สองวันหลังจากที่เวตส์ปรากฏขึ้น สิ่งสุดท้ายนั้นไม่ใช่สัญญาณอันตราย; มันเป็นเพียงสถานะของหลักฐานที่มีอยู่เท่านั้น

สิ่งที่ทำให้การเปรียบเทียบนี้เปลี่ยนแปลงเร็วที่สุดคือการประเมินเฉพาะภาษาอาหรับบนเสียงภาษาถิ่นจริง ที่ดำเนินการโดยหน่วยงานภายนอกที่ไม่ใช่ผู้ขายทั้งสองราย โดยใช้การปรับมาตรฐานแบบเดียวกันกับทั้งสองระบบ จนกว่าจะมีสิ่งนั้น การตัดสินใจก็ต้องอาศัยรายการภาษาถิ่นที่ผู้ขายรายหนึ่งระบุเอง เทียบกับรายการที่ผู้ขายอีกรายไม่ได้ระบุไว้ และการทดสอบที่เชื่อถือได้เพียงอย่างเดียวคือไฟล์บันทึกเสียงของคุณ

Generated two-column comparison scoreboard for Voxtral Mini 4B Realtime Arabic and Grok Voice Transcribe 2.0 across six shared rows: price none published and self-host only against $0.10 per audio-hour over REST and $0.20 streaming; accuracy 8.82% Arabic character error rate vendor-reported against 2.7% final word error rate per Artificial Analysis; delay configurable with 480ms quoted against 0.49s to final and 0.49s to first partial; languages 16 named Arabic varieties against 38+ with none itemised by the vendor; diarization and timestamps not documented against included with confidence scores; and distribution Apache 2.0 weights on Hugging Face against API only. A footer reads that Mistral figures are vendor-reported and unverified while Grok figures are per Artificial Analysis, and that character error rate and word error rate are not comparable. The OrcaRouter logo sits in a white strip at the bottom right.

ไม่มีเอนด์พอยต์ใดเป็นสิ่งที่เราให้บริการ — นี่คือการเปรียบเทียบระบบสองระบบที่อยู่นอกแคตตาล็อกของเรา — แต่โมเดลที่นำทรานสคริปต์ไปใช้นั้นสามารถกำหนดเส้นทางได้: โมเดลกว่า 200 รายการบน API key เพียงหนึ่งคีย์ ในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% ดังนั้นหากอัตราค่าบริการของตัวสรุปความหรือตัวจำแนกประเภทมีการเปลี่ยนแปลง ก็จะมีผลในวันเดียวกับที่ประกาศ

การสลับไปใช้ระบบสำรองอัตโนมัติ คือสิ่งที่ช่วยไม่ให้การตั้งค่าระบบเสียงแบบสองผู้ขายนำจุดล้มเหลวจุดเดียวสองจุดเข้าสู่เลเยอร์ภาษาที่พึ่งพามัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube