
Voxtral Mini 4B Realtime Arabic vs Grok Voice Transcribe 2.0: ผู้นำตารางคะแนนพบผู้เชี่ยวชาญด้านภาษาถิ่น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
จุดเริ่มต้นที่ตรงไปตรงมาสำหรับการเปรียบเทียบนี้คือ Voxtral Mini 4B Realtime Arabic และ Grok Voice Transcribe 2.0 ไม่ได้แข่งขันกันในงานเดียวกัน และวิธีที่เร็วที่สุดที่จะเห็นได้คือการดูว่าผู้ขายแต่ละรายยินดีเผยแพร่อะไร Mistral AI วาง Voxtral Mini 4B Realtime Arabic บน Hugging Face เมื่อวันที่ 8 ตุลาคม 2026 โดยไม่มีการประกาศ — น้ำหนัก Apache 2.0, การ์ดโมเดลที่ระบุภาษาอาหรับ 16 ชนิด และตัวเลขความแม่นยำเพียงตัวเดียวที่ 8.82% อัตราความผิดพลาดของตัวอักษรเฉลี่ยจากเกณฑ์มาตรฐานภาษาอาหรับเจ็ดรายการที่ความหน่วง 480 มิลลิวินาที Grok Voice Transcribe 2.0 ของ xAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 พร้อมโพสต์เปิดตัว ราคา และผลลัพธ์จากกระดานผู้นำของบุคคลที่สาม: อัตราความผิดพลาดของคำ 2.7% ในบทถอดความสุดท้าย โดยข้อความจะเสร็จสิ้น 0.49 วินาทีหลังจากผู้พูดหยุด เป็นอันดับหนึ่งในกระดานสตรีมมิ่งเสียงเป็นข้อความของ Artificial Analysis เมื่อเปิดตัว โมเดลหนึ่งบอกคุณอย่างชัดเจนว่าจัดการภาษาถิ่นใดและปฏิเสธที่จะคาดเดานอกเหนือจากนั้น อีกโมเดลบอกคุณว่าครอบคลุม 38 ภาษาขึ้นไปและไม่ได้แจกแจงแม้แต่ภาษาเดียว
ความไม่สมมาตรนั้นคือสาระของการเปรียบเทียบทั้งหมด หากคุณกำลังซื้อความจุในการถอดเสียงแบบจำนวนมากสำหรับเสียงที่ใช้หลายภาษา โมเดลของ xAI ก็เป็นผลิตภัณฑ์ที่สมบูรณ์กว่าอย่างมาก หากเสียงของคุณเป็นภาษาอาหรับ — และโดยเฉพาะอย่างยิ่งหากเป็นภาษาอาหรับถิ่น ไม่ใช่ภาษาอาหรับมาตรฐานสมัยใหม่แบบที่ใช้ในงานกระจายเสียง — เช็กพอยต์ของ Mistral มุ่งเป้าไปที่ปัญหาที่ลีดเดอร์บอร์ดซึ่งโมเดลของ xAI ครองอันดับสูงสุดไม่ได้วัด และการที่มันอยู่อันดับสองบนบอร์ดนั้นแทนที่จะเป็นอันดับหนึ่ง ก็ถือเป็นความผิดพลาดถ้าจะตีความว่าเป็นคำตัดสิน
{{1}}การคำนวณราคา{{/1}} {{2}}เพราะมันเรียบง่ายผิดปกติตรงนี้{{/2}}
xAI เผยแพร่อัตรา Mistral เผยแพร่การดาวน์โหลด ความแตกต่างนี้เป็นตัวกำหนดทุกอย่างที่ตามมา ดังนั้นจงเริ่มจากตัวเลขที่มีอยู่จริง
• Grok Voice Transcribe 2.0 — $0.10 ต่อชั่วโมงเสียงผ่าน REST สำหรับไฟล์ที่บันทึกไว้, $0.20 ต่อชั่วโมงเสียงผ่าน WebSocket แบบสตรีมมิง คิดเป็นประมาณ $1.67 ต่อหนึ่งพันนาทีสำหรับแบบแบตช์ และ $3.33 ต่อหนึ่งพันนาทีสำหรับแบบสตรีมมิง ซึ่งไม่เปลี่ยนแปลงจาก Grok Voice Transcribe 1.0 ณ จุดราคาเดียวกัน
• Voxtral Mini 4B Realtime Arabic — ไม่มีราคาที่เผยแพร่ เพราะไม่มีบริการที่เผยแพร่ น้ำหนักโมเดลอยู่ภายใต้ Apache 2.0 และมีพารามิเตอร์ประมาณ 4.4 พันล้านตัวใน BF16 ซึ่งหมายความว่าต้นทุนคือ GPU ที่คุณนำมาใช้กับมัน และอัตราการใช้งานที่คุณทำได้จากมัน ที่ปริมาณการใช้งานต่อเนื่องถือว่าถูก แต่ที่ปริมาณเป็นศูนย์ นี่คือตัวเลือกที่แพงที่สุดในบทความนี้ เพราะคุณกำลังจ่ายสำหรับฮาร์ดแวร์ที่ไม่ได้ใช้งาน
จุดคุ้มทุนไม่ใช่เรื่องซับซ้อน อัตราการสตรีมที่ $0.0 ต่อชั่วโมงคิดเป็นประมาณหนึ่งในสามของเซนต์ต่อนาที เครื่องใดก็ตามที่คุณจะใช้รัน 4.4B มีค่าใช้จ่ายต่อชั่วโมงสูงกว่านั้น เว้นแต่คุณจะดันทราฟฟิกให้ไหลผ่านมันอย่างต่อเนื่อง ซึ่งหมายความว่าเส้นทาง open-weights จะชนะเรื่องต้นทุนก็ต่อเมื่อคุณมีปริมาณภาษาอาหรับมากพอที่จะทำให้เครื่องหนึ่งเครื่องทำงานเต็มที่ — และจะแพ้ในทุกมิติอื่นระหว่างที่คุณกำลังไปถึงจุดนั้น เพราะ API ไม่มี capex ไม่ต้องวางแผนความจุ และไม่มีภาระด้านปฏิบัติการ

จุดเดียวที่การคำนวณพลิกตั้งแต่ต้นคือการปฏิบัติตามข้อกำหนด เช็กพอยต์ Mistral ประมวลผลเสียงบนฮาร์ดแวร์ที่คุณควบคุม จึงไม่มีอะไรออกจากเครือข่ายของคุณ และการ์ดนี้มาพร้อมโมดูลการทำให้เป็นมาตรฐาน ดังนั้นไปป์ไลน์การให้คะแนนภาษาอาหรับจึงอยู่ในมือคุณที่จะตรวจสอบ Grok Voice Transcribe 2.0 ทำงานในภูมิภาคของ xAI และตามเอกสารของมัน ประมวลผลเสียงแบบเรียลไทม์โดยไม่เก็บไว้หรือนำไปใช้ฝึก โดยได้รับการรับรอง SOC 2 Type II และมีคุณสมบัติตาม HIPAA ทั้งสองเรื่องต่างก็ป้องกันได้ แต่มีเพียงเรื่องเดียวเท่านั้นที่เปิดให้หน่วยงานกำกับดูแลตรวจสอบเส้นทางโค้ดได้
สิ่งที่ $0.20 ต่อชั่วโมงซื้อได้จริง และโมเดล Mistral ยังไม่เปิดตัว
ช่องว่างด้านฟีเจอร์ตรงนี้ใหญ่กว่าช่องว่างด้านความแม่นยำ และถูกพูดถึงน้อยกว่ามาก Grok Voice Transcribe 2.0 เป็นผลิตภัณฑ์ที่มีอินเทอร์เฟซ ส่วน Voxtral Mini 4B Realtime Arabic เป็นเช็กพอยต์ที่ส่งข้อความออกมา
• การแยกผู้พูด (Speaker diarization) — รวมอยู่ใน Grok Voice Transcribe 2.0 พร้อมการถอดเสียงแบบหลายช่องสัญญาณสูงสุดแปดช่องสัญญาณอิสระ การ์ดของ Mistral ไม่ได้ระบุถึงความสามารถด้านการแยกผู้พูด โมเดลนี้สร้างบทถอดความ แต่ไม่ได้ระบุว่าใครเป็นผู้พูด
• การประทับเวลาในระดับคำ — Grok แนบมาพร้อมคะแนนความเชื่อมั่น จึงทำให้คุณตั้งเกณฑ์ตัดช่วงที่มีความเชื่อมั่นต่ำได้ แทนที่จะเชื่อถือบทถอดเสียงทั้งหมดเท่ากันทุกส่วน การ์ดของ Mistral ไม่ได้อ้างว่ามีการประทับเวลาสำหรับเช็กพอยต์นี้
• การไบแอสคำสำคัญ — รองรับคำศัพท์เฉพาะโดเมนได้ถึง 100 คำต่อคำขอบนเอนด์พอยต์ Grok ซึ่งเป็นวิธีที่ทำให้โมเดลระบุชื่อผลิตภัณฑ์ รหัสบัญชี และชื่อสถานที่ได้อย่างถูกต้องโดยไม่ต้อง fine-tuning ส่วนเส้นทางของ Mistral ที่ให้ผลลัพธ์เดียวกันคือการ fine-tuning ด้วยข้อมูลของคุณเอง ซึ่ง Apache 2.0 อนุญาต แต่เอนด์พอยต์แบบโฮสต์ไม่อนุญาต
• การนอร์มัลไลเซชันข้อความแบบผกผัน — Grok จัดรูปแบบตัวเลข วันที่ สกุลเงิน หมายเลขโทรศัพท์ และที่อยู่อีเมลให้อยู่ในรูปแบบลายลักษณ์อักษรใน 25 ภาษา การ์ดของ Mistral มีสคริปต์นอร์มัลไลเซชันรวมอยู่ด้วย แต่จุดประสงค์ที่ระบุไว้คือการให้คะแนนเบนช์มาร์กภาษาอาหรับ ไม่ใช่การจัดรูปแบบเอาต์พุตเพื่อการแสดงผล
• ขอบเขตอินเทอร์เฟซ — REST สำหรับไฟล์ขนาดสูงสุด 500 MB, การสตรีมผ่าน WebSocket ที่ wss://api.x.ai/v1/stt พร้อมผลลัพธ์ชั่วคราวประมาณทุก ๆ 500 ms, เอกสารระบุ 10 คำขอต่อวินาทีและ 100 เซสชันสตรีมมิ่งพร้อมกัน และมีเพียงภูมิภาคเดียวในตอนนี้ ทางฝั่ง Mistral นั้น vLLM ให้บริการด้วย WebSocket ที่ /v1/realtime หรือใช้ Transformers แบบเนทีฟตั้งแต่เวอร์ชัน 5.2.0 โดยไม่มีข้อจำกัดอัตรานอกเหนือจากฮาร์ดแวร์ของคุณ
ถ้าคุณต้องการการแยกเสียงผู้พูด (diarization) และการประทับเวลา การเปรียบเทียบก็จบไปตั้งแต่ก่อนที่ความแม่นยำจะเข้ามาเกี่ยวข้องด้วยซ้ำ นั่นไม่ใช่การตำหนิโมเดล Mistral — ผู้เชี่ยวชาญภาษาอาหรับขนาด 4B ที่ได้รับการฝึกมาเพื่อสร้างข้อความภาษาถิ่นได้อย่างแม่นยำนั้นเป็นเป้าหมายทางวิศวกรรมที่แตกต่างจากบริการถอดเสียงทั่วไป — แต่มันหมายความว่าทั้งสองจะใช้แทนกันได้ก็ต่อเมื่อไปป์ไลน์ของคุณปฏิบัติกับมันเป็นวัตถุดิบสำหรับงานหลังการประมวลผลของคุณเอง
ปัญหารายการภาษา
ผู้จำหน่ายทั้งสองรายอธิบายการรองรับภาษาในลักษณะที่ทิ้งคำถามเดียวกันไว้โดยไม่มีคำตอบ จากทิศทางที่ตรงกันข้ามกัน
• Grok Voice Transcribe 2.0 — มากกว่า 38 ภาษา ตรวจจับภาษาอัตโนมัติพร้อมสลับภาษาระหว่างการบันทึกในรอบเดียว ครอบคลุม 12 รูปแบบเสียงตั้งแต่ 8 kHz ถึง 48 kHz เอกสารระบุจำนวนแต่ไม่ได้ระบุรายการ ภาษาอาหรับไม่ได้ถูกเอ่ยชื่อเป็นรายบุคคลที่ใดในเนื้อหา ซึ่งหมายความว่าการรองรับภาษาอาหรับเป็นเพียงการอนุมานจากจำนวน ไม่ได้รับการยืนยันจากผู้ขาย
• Voxtral Mini 4B Realtime Arabic — ภาษาอาหรับ 16 วิธภาษาที่ระบุชื่อไว้อย่างชัดเจน: ภาษาอาหรับมาตรฐานสมัยใหม่; โมร็อกโก ลิเบีย ตูนิเซีย แอลจีเรีย และฮัสซานียะห์จากมาเกร็บ; อ่าว นัจญ์ดี โอมาน และซานานีจากอ่าว; อียิปต์และซูดานจากหุบเขานิล; เมโสโปเตเมีย และทั้งลิแวนต์ใต้และเหนือ; และอาหรับชาด ทุกอย่างนอกชุดนี้อยู่นอกขอบเขต และการ์ดระบุให้ใช้โมเดลเรียลไทม์ทั่วไปแทน
ดังนั้น คำถามที่ว่า "ตัวไหนจัดการกับภาษาอาหรับได้ดีกว่ากัน" มีโครงสร้างที่แปลกประหลาด โมเดล Mistral เป็นผู้เชี่ยวชาญด้านภาษาอาหรับที่มีเอกสารยืนยัน โดยมีอัตราความผิดพลาดภาษาอาหรับที่เผยแพร่แล้ว และไม่มีการตรวจสอบอย่างอิสระ โมเดล xAI เป็นผู้นำบนลีดเดอร์บอร์ดที่มีการบันทึกไว้ ซึ่งผู้ขายยังไม่ได้ยืนยันว่าภาษาอาหรับอยู่ในขอบเขตเลยด้วยซ้ำ การนับจำนวน 38 ภาษาที่รวมภาษาอาหรับ และรายการภาษาถิ่น 16 รายการที่รวมเฉพาะภาษาอาหรับ ต่างก็ตอบคำถามว่า "มันรองรับภาษาอาหรับไหม" — แต่มีเพียงหนึ่งเดียวเท่านั้นที่กำลังตอบว่า "มันรองรับดาริจาไหม"

ลีดเดอร์บอร์ดไม่ได้ช่วยในกรณีนี้ การประเมินการแปลงเสียงเป็นข้อความของ Artificial Analysis เป็นส่วนผสมคงที่ที่ถ่วงน้ำหนักไปทางบทสนทนาแบบเอเจนต์ภาษาอังกฤษ ซึ่งเป็นดีไซน์ที่เหมาะสมสำหรับการจัดอันดับการถอดความทั่วไป แต่ไม่เหมาะสำหรับการทำให้เห็นจุดแข็งของภาษาอาหรับถิ่น โมเดลหนึ่งอาจทำได้ดีกว่าจริง ๆ กับภาษาอาหรับอ่าวและภาษาอาหรับโมร็อกโก แต่กลับปรากฏว่าอยู่ในระดับแค่ดีบนบอร์ดนั้น นี่ไม่ใช่การวิจารณ์บอร์ด แต่เป็นเหตุผลว่าทำไมจึงไม่ควรใช้มันเป็นข้อมูลนำเข้าเพียงอย่างเดียวสำหรับการนำไปใช้งานในระดับภูมิภาค
ความแม่นยำ ในหน่วยที่ไม่แปลงค่า
• Grok Voice Transcribe 2.0 — อัตราความผิดพลาดระดับคำของบทถอดเสียงฉบับสมบูรณ์ 2.7% โดยใช้เวลา 0.49 วินาทีถึงฉบับสมบูรณ์ และ 3.4% สำหรับผลลัพธ์บางส่วนครั้งแรก ทั้งสองค่าวัดจากดัชนี AA-WER v2 ของ Artificial Analysis ซึ่งผสมชุดข้อมูล agent-talk แบบส่วนตัวเข้ากับ VoxPopuli และ Earnings22 ตัวเลขผลลัพธ์บางส่วนครั้งแรกเป็นค่าน่าสนใจ: ลดลงจาก 18.3% ใน Grok Voice Transcribe 1.0 ซึ่งเป็นความแตกต่างระหว่างบทถอดเสียงบางส่วนที่คุณใช้จัดเส้นทางได้ กับบทถอดเสียงบางส่วนที่คุณทำได้เพียงแสดงผล
• Voxtral Mini 4B Realtime Arabic — อัตราความผิดพลาดระดับตัวอักษรเฉลี่ย 8.82% จากเกณฑ์มาตรฐานภาษาอาหรับ 7 รายการ ที่ความหน่วง 480 มิลลิวินาที ในการประเมินของผู้จำหน่ายเองด้วยสคริปต์การปรับมาตรฐานที่จัดมาให้พร้อมกัน Mistral รายงานว่าผลลัพธ์นี้มีส่วนต่างไม่เกิน 0.91 จุดเปอร์เซ็นต์จาก Voxtral Transcribe Arabic ที่ค่า CER 7.91% ซึ่งเป็นโมเดลภาษาอาหรับแบบออฟไลน์จากห้องแล็บเดียวกัน — การเปรียบเทียบนี้มีค่ามากกว่าการเปรียบเทียบข้ามผู้จำหน่าย เพราะเกณฑ์มาตรฐาน การปรับมาตรฐาน และการวัดเหมือนกันทั้งสองฝ่าย
การนำ 2.7% มาวางข้าง ๆ 8.82% ไม่ใช่การเปรียบเทียบ แต่เป็นข้อผิดพลาดเชิงหมวดหมู่ อัตราความผิดพลาดระดับคำนับคำที่ผิดเทียบกับข้อความอ้างอิง อัตราความผิดพลาดระดับตัวอักษรนับตัวอักษรที่ผิด และอักขรวิธีภาษาอาหรับ — ซึ่งคำเดียวกันยอมรับการสะกดที่ถูกต้องได้หลายแบบ และคำวิภัติเกาะติดได้อย่างอิสระ — ทำให้ช่องว่างระหว่างตัวชี้วัดทั้งสองกว้างขึ้นมากกว่าที่ภาษาที่ใช้อักษรละตินแสดงให้เห็น คลังข้อมูลแตกต่างกัน การปรับมาตรฐานแตกต่างกัน และมีเพียงตัวเลขเดียวเท่านั้นที่มาจากบุคคลที่สาม สิ่งที่ตัวเลขทั้งสองสามารถบอกคุณได้อย่างชอบธรรมก็คือ โมเดล xAI เป็นตัวถอดความทั่วไปที่ผ่านการวัดและมีอันดับดี และโมเดล Mistral เป็นโมเดลเฉพาะภาษาอาหรับที่อ้างไว้ พวกมันไม่สามารถบอกคุณได้ว่าโมเดลไหนถอดเสียงของคุณได้ดีกว่ากัน
การเปรียบเทียบที่โน้มน้าวได้จริงคือการเปรียบเทียบในการ์ดของ Mistral เอง: สตรีมมิ่ง 8.82% เทียบกับออฟไลน์ 7.91% โดยใช้เกณฑ์วัดเจ็ดรายการเดียวกัน การปรับมาตรฐานเดียวกัน และแล็บเดียวกัน สตรีมมิ่งแลกมาด้วยความแม่นยำประมาณหนึ่งจุดในภาษาอาหรับเมื่อเทียบกับโมเดลแบบแบตช์ จะคุ้มค่าที่จะแลกหรือไม่นั้นขึ้นอยู่กับคุณ และตอนนี้เป็นการตัดสินใจที่มีข้อมูลประกอบแล้ว
จุดที่โมเดลขนาดเล็กชนะ และมันไม่ใช่บนกระดานคะแนน
สามสิ่งเกี่ยวกับเช็กพอยต์ของ Mistral นั้นมีค่ามากกว่าที่ตัวเลขชี้ให้เห็น และไม่มีสักข้อที่ปรากฏอยู่บนลีดเดอร์บอร์ดใดเลย
สิ่งแรกคืออนุกรมวิธานของภาษาถิ่นเอง การกำหนดให้สิบหกสายพันธุ์เป็นเป้าหมายการฝึกที่แตกต่างกัน รวมถึงฮัสซานียาและอาหรับชาด เป็นการระบุว่าได้วัดข้อผิดพลาดของโมเดลที่ใด โมเดลหลายภาษาทั่วไปที่รวมภาษาอาหรับไว้เป็นหนึ่งใน 38 ภาษา จะพัฒนาบนภาษาอาหรับมาตรฐานสมัยใหม่ก่อน เพราะนั่นคือที่ที่สัญญาณการฝึกและน้ำหนักของเกณฑ์มาตรฐานส่วนใหญ่ตกอยู่ โมเดลที่สร้างขึ้นสำหรับความร่วมมือกับโมร็อกโกควบคู่กับกระทรวงในแอฟริกาเหนือกำลังปรับให้เหมาะสมกับการกระจายที่แตกต่างออกไป และได้รับการพัฒนาร่วมกับเกณฑ์มาตรฐานสองรายการ — ISMA และ Darija in the Wild — ซึ่งสร้างขึ้นโดยเฉพาะเพื่อวัดสิ่งนั้น
อย่างที่สองคือความหน่วงที่ปรับแต่งได้ ค่า 8.82% ถูกอ้างอิงที่ 480 มิลลิวินาที และความหน่วงนั้นปรับได้แทนที่จะคงที่ ซึ่งเปลี่ยนตัวเลขความแม่นยำให้กลายเป็นจุดหนึ่งบนเส้นโค้งที่ผู้ปฏิบัติงานเลือก สำหรับงานคำบรรยายสด คุณสามารถย่อความหน่วงให้สั้นลงและยอมรับข้อผิดพลาดที่มากขึ้น; สำหรับไปป์ไลน์บันทึกการโทร คุณสามารถขยายให้ยาวขึ้นและได้ความแม่นยำกลับคืนมา Grok Voice Transcribe 2.0 นำเสนอจุดทำงานแบบคงที่ และเส้นทางการอัปเกรดของผู้ขายเองแสดงให้เห็นว่าทำไมสิ่งนี้จึงมีผลตามมา — การย้ายจาก 1.0 ไปเป็น 2.0 มีต้นทุนประมาณหนึ่งในสามของวินาทีทั้งในความหน่วงของ partial แรกและความหน่วงของ final และวิธีแก้ที่มีให้คุณคือการปักหมุดโมเดลเก่าไว้ ไม่ใช่การปรับปุ่มหมุน
ข้อที่สามคือ การให้สิทธิ์ภายใต้ Apache 2.0 นั้นไม่มีเงื่อนไขสำหรับเวตที่คุณมี ไม่ว่าเช็กพอยต์ต้นทางจะเกิดอะไรขึ้นก็ตาม — ไม่ว่าจะมีการประกาศ ตั้งราคา ปลดระวาง หรือไม่ถูกกล่าวถึงอีกเลย — อาร์ติแฟกต์ยังคงดาวน์โหลดได้ ไฟน์จูนได้ และพร้อมนำไปใช้ในผลิตภัณฑ์ของคุณเอง ตารางราคาของเอนด์พอยต์แบบโฮสต์และกำหนดการปลดระวางโมเดลเป็นสิ่งที่ผู้ขายสามารถเปลี่ยนแปลงได้ทั้งคู่ และ xAI ได้ส่งสัญญาณเจตนาที่จะทำให้ Grok Voice Transcribe 2.0 เป็นค่าเริ่มต้นและปลดระวาง 1.0 ซึ่งจะย้ายทุกการผสานรวมที่ไม่เคยส่งพารามิเตอร์โมเดลไปสู่โปรไฟล์ความหน่วงใหม่พร้อมกันในทันที
ในชั้นการกำหนดเส้นทางที่อยู่เหนือข้อความถอดเสียง มีข้อควรทราบในทางปฏิบัติข้อหนึ่ง: ไม่มีโมเดลใดเป็นระบบแปลงเสียงเป็นข้อความที่เราโฮสต์ และบทความนี้ไม่ได้อ้างว่าเป็นเช่นนั้น สิ่งที่ OrcaRouter ครอบคลุมคือชั้นโมเดลภาษาที่ประมวลผลสตรีม — ตัวสรุป ตัวจำแนก และเอเจนต์ — ซึ่งอยู่ภายใต้คีย์ API เดียว ครอบคลุมโมเดลมากกว่า 200 โมเดลในราคาตามรายการของผู้ให้บริการโดยคิดมาร์กอัป 0% ดังนั้นการเปลี่ยนแปลงราคาจากผู้ขายจึงมาถึงที่นี่ในวันเดียวกัน ทีมที่ใช้ผู้ให้บริการเสียงพูดสองรายเพื่อครอบคลุมภาษา กำลังแบกสัญญาสองฉบับและเส้นทางการยืนยันตัวตนสองเส้นทางอยู่แล้ว การยุบครึ่งปลายน้ำให้เหลือคีย์เดียวคือชัยชนะที่ได้มาด้วยต้นทุนต่ำ
จะทำอะไรกับสิ่งนี้ดี
ให้ใช้ Grok Voice Transcribe 2.0 เป็นฐาน หากเสียงของคุณมีหลายภาษา หากคุณต้องการการแยกผู้พูด (diarization) การประทับเวลา (timestamps) หรือการให้น้ำหนักคำสำคัญ (key-term biasing) แบบใช้ได้ทันที หรือหากคุณต้องการบริการที่มีอัตราค่าบริการประกาศไว้และมีช่องทางสนับสนุนตั้งแต่วันนี้ มันเป็นผลิตภัณฑ์ที่สมบูรณ์กว่า ได้รับการวัดประเมินโดยบุคคลที่สาม และอัตราการสตรีมที่ $0.20 ต่อชั่วโมงเสียงนั้นต่ำพอจนข้อโต้แย้งเรื่องต้นทุนของ open-weights ไม่มีน้ำหนัก จนกว่าคุณจะรันปริมาณมากจริง ๆ
ต่อยอดจาก Voxtral Mini 4B Realtime Arabic หากเสียงของคุณเป็นภาษาอาหรับและเป็นภาษาถิ่นโดยเฉพาะ หากคุณต้องการให้โมเดลอยู่ภายในเครือข่ายของคุณเองด้วยเหตุผลด้านการปฏิบัติตามข้อกำหนด หรือหากคุณตั้งใจจะปรับแต่งละเอียด (fine-tune) — เพราะมีเพียงหนึ่งในสิ่งเหล่านี้เท่านั้นที่อนุญาตให้ทำได้ ยอมรับสามสิ่งก่อน: ไม่มีการแยกผู้พูด (diarization) ไม่มีการประทับเวลา (timestamps) และไม่มีการประเมินอิสระที่เผยแพร่โดยใครเลย สองวันหลังจากที่เวตส์ปรากฏขึ้น สิ่งสุดท้ายนั้นไม่ใช่สัญญาณอันตราย; มันเป็นเพียงสถานะของหลักฐานที่มีอยู่เท่านั้น
สิ่งที่ทำให้การเปรียบเทียบนี้เปลี่ยนแปลงเร็วที่สุดคือการประเมินเฉพาะภาษาอาหรับบนเสียงภาษาถิ่นจริง ที่ดำเนินการโดยหน่วยงานภายนอกที่ไม่ใช่ผู้ขายทั้งสองราย โดยใช้การปรับมาตรฐานแบบเดียวกันกับทั้งสองระบบ จนกว่าจะมีสิ่งนั้น การตัดสินใจก็ต้องอาศัยรายการภาษาถิ่นที่ผู้ขายรายหนึ่งระบุเอง เทียบกับรายการที่ผู้ขายอีกรายไม่ได้ระบุไว้ และการทดสอบที่เชื่อถือได้เพียงอย่างเดียวคือไฟล์บันทึกเสียงของคุณ

ไม่มีเอนด์พอยต์ใดเป็นสิ่งที่เราให้บริการ — นี่คือการเปรียบเทียบระบบสองระบบที่อยู่นอกแคตตาล็อกของเรา — แต่โมเดลที่นำทรานสคริปต์ไปใช้นั้นสามารถกำหนดเส้นทางได้: โมเดลกว่า 200 รายการบน API key เพียงหนึ่งคีย์ ในราคาตามรายการของผู้ให้บริการ โดยบวกเพิ่ม 0% ดังนั้นหากอัตราค่าบริการของตัวสรุปความหรือตัวจำแนกประเภทมีการเปลี่ยนแปลง ก็จะมีผลในวันเดียวกับที่ประกาศ
การสลับไปใช้ระบบสำรองอัตโนมัติ คือสิ่งที่ช่วยไม่ให้การตั้งค่าระบบเสียงแบบสองผู้ขายนำจุดล้มเหลวจุดเดียวสองจุดเข้าสู่เลเยอร์ภาษาที่พึ่งพามัน
