
Grok Voice Transcribe 2.0 คว้าอันดับ 1 ด้านความแม่นยำการถอดเสียงแบบสตรีมมิ่งในราคาที่ไม่เปลี่ยนแปลง
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 คือโมเดลแปลงเสียงพูดเป็นข้อความที่ SpaceXAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 และตัวเลขเดียวที่สำคัญเกี่ยวกับโมเดลนี้ไม่ใช่ตัวเลขที่โพสต์เปิดตัวยกขึ้นมาเป็นประเด็นหลัก มันคือสิ่งนี้: first partial transcript — ข้อความที่ voice agent ได้ลงมือทำจริงขณะที่ผู้โทรยังถูกพูดทับอยู่ — ลดลงจากอัตราความผิดพลาดระดับคำ (word error rate) 18.3% ใน Grok Voice Transcribe 1.0 เหลือ 3.4% นั่นคือการวัดบนบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งตอนนี้โมเดลใหม่อยู่อันดับหนึ่งทั้งในอันดับ Final Transcript (WER 2.7%, 0.49 วินาทีหลังสิ้นสุดการพูด) และอันดับ First Partial Transcript (3.4%, 0.49 วินาที) ความแม่นยำของ final transcript ก็ดีขึ้นเช่นกัน จาก 3.9% เป็น 2.7% ซึ่งเป็นเรื่องจริงแต่ไม่มากนัก การก้าวกระโดดของ partial transcript ต่างหากที่เปลี่ยนสิ่งที่คุณสร้างได้
จริง ๆ แล้วอะไรเปลี่ยนไปบ้างระหว่าง 1.0 กับ 2.0
ทั้งสองเวอร์ชันเป็นผลิตภัณฑ์เดียวกันใน API เดียวกัน และ SpaceXAI ไม่ได้เปลี่ยนแปลงอินเทอร์เฟซ: Grok Voice Transcribe 2.0 ถูกเลือกโดยการส่ง grok-voice-transcribe-2.0 ไปยัง /v1/stt แทน grok-voice-transcribe-1.0 หรือโดยการเลือกเมื่อสร้างการเชื่อมต่อ WebSocket สำหรับการสตรีม การผสานรวมที่มีอยู่ซึ่งละเว้นพารามิเตอร์ model จะยังคงได้รับ 1.0 ไปจนกว่า SpaceXAI จะสลับค่าเริ่มต้น ซึ่งบริษัทกล่าวว่าจะเกิดขึ้นในอีกไม่กี่สัปดาห์ข้างหน้า ควบคู่ไปกับการเลิกใช้เวอร์ชันเก่า จนถึงตอนนั้น 2.0 เป็นแบบเลือกใช้ (opt-in) และ 1.0 สามารถปักหมุดไว้ได้อย่างตั้งใจ ซึ่งเป็นรูปแบบที่เหมาะสมสำหรับการเปลี่ยนแปลงเช่นนี้: คุณสามารถทดสอบ A/B กับเสียงของคุณเองก่อนที่มันจะกลายเป็นค่าเริ่มต้นในโปรดักชันของคุณ ไม่ว่าคุณจะขอหรือไม่ก็ตาม
ตัวเลขของ Artificial Analysis เมื่อนำมาอ่านเทียบกันแล้ว เล่าเรื่องราวที่เจาะจงมากกว่าคำว่า "แม่นยำเป็นสองเท่า":
• ความแม่นยำของทรานสคริปต์ฉบับสุดท้าย — Grok Voice Transcribe 2.0 ที่ WER 2.7% เทียบกับ Grok Voice Transcribe 1.0 ที่ 3.9% บน AA-WER Streaming โดยทั้งคู่วัดหลังสิ้นสุดการพูด
• ความแม่นยำของบทถอดความบางส่วนครั้งแรก — WER 3.4% เทียบกับ 18.3% ซึ่งเป็นช่องว่างเดี่ยวที่ใหญ่ที่สุดระหว่างสองเวอร์ชัน
• เวลาจนถึงทรานสคริปต์ฉบับสุดท้าย — 0.49 วินาที เทียบกับ 0.37 วินาที ดังนั้นโมเดลใหม่จึงยืนยันผลลัพธ์สุดท้ายได้ช้ากว่าโมเดลที่มันเข้าแทนที่
• เวลาถึง partial แรก — 0.49s เทียบกับ 0.25s ก็ช้ากว่าเช่นกัน
• ความแม่นยำแบบ Batch (ไม่สตรีมมิง) — 2.3% AA-WER บนบอร์ดแบบไม่สตรีมมิงของ Artificial Analysis เทียบกับ 4.07% สำหรับ Whisper Large v3 และ 3.31% สำหรับ GPT Transcribe
• ปริมาณงานประมวลผลแบบเป็นชุด — ประมาณ 162× ของเวลาจริงบนบอร์ดเดียวกัน เป็นรอง 333× ของ MAI-Transcribe-2 และนำหน้า 88× ของ Gemini 3.5 Transcribe
บรรทัดที่สี่และห้านั้นคือข้อแม้อย่างตรงไปตรงมาในรีลีสนี้ SpaceXAI แลกความแม่นยำมาด้วยความหน่วง โมเดลใหม่ใช้เวลาช้ากว่า 1.0 ประมาณหนึ่งในสามวินาทีในการคืนผลบางส่วนแรกและทรานสคริปต์สุดท้าย บนกระดานที่ Deepgram Flux คืนผลบางส่วนภายใน 0.02 วินาที และ Soniox v5 ภายใน 0.05 วินาที Grok Voice Transcribe 2.0 ไม่ได้แข่งกันที่ความเร็วเลย — มันแข่งกันที่ความถูกต้อง และมันชนะการแลกเปลี่ยนนั้นด้วยส่วนต่างที่ห่างไกล ไม่ว่าการแลกเปลี่ยนนี้จะถูกต้องหรือไม่นั้น ขึ้นอยู่ทั้งหมดกับว่าแอปพลิเคชันของคุณเป็น voice agent แบบเรียลไทม์ที่ต้องเริ่มพูดตอบกลับ หรือเป็นไปป์ไลน์ถอดเสียงที่ครึ่งวินาทีนั้นมองไม่เห็น

คำกล่าวอ้าง “แม่นยำเป็นสองเท่า” เมื่อตรวจสอบแล้ว
พาดหัวของ SpaceXAI ระบุว่า 2.0 แม่นยำเป็นสองเท่าของ 1.0 ในราคาเดียวกัน และตารางการประเมินของบริษัทเองก็สนับสนุนเรื่องนี้บนชุดข้อมูลที่บริษัทเลือก ในสายสนทนาบริการลูกค้าภาษาอังกฤษที่ 8 kHz อัตราความผิดพลาดระดับคำลดลงจาก 10.6% เหลือ 7.1% ในการสนทนากับ Grok จาก 8.7% เหลือ 3.3% กับข้อมูลรับรองที่พูดออกมา — รหัสบัญชี หมายเลขโทรศัพท์ ที่อยู่อีเมล — จาก 7.2% เหลือ 3.2% ในคำสั่งสั้น ๆ ใน 19 ภาษา จาก 20.6% เหลือ 6.8% ซึ่งเป็นการลดข้อผิดพลาดลงประมาณสองในสาม ชุดข้อมูลทั้งสี่นี้ดึงมาจากทราฟฟิกการใช้งานจริงของ SpaceXAI และการเปรียบเทียบเป็นของ SpaceXAI เอง ไม่มีใครนอกบริษัททำซ้ำผลลัพธ์เหล่านี้ได้ ให้มองตารางนี้เป็นแผนที่ว่าจุดใดที่โมเดลถูกปรับแต่ง ไม่ใช่การรับประกันความแม่นยำโดยทั่วไป
ผลลัพธ์ของ Artificial Analysis คือส่วนที่ไม่ได้มาจากการรายงานของผู้ขายเอง: ชุดทดสอบอิสระที่รันกับเสียงราวแปดชั่วโมง โดยถ่วงน้ำหนัก 50% ให้กับชุด AA-AgentTalk แบบส่วนตัว และ 25% ต่อชุดให้กับ VoxPopuli และ Earnings22 ผลนี้สนับสนุนข้อกล่าวอ้างที่แคบกว่าและมีประโยชน์มากกว่า “แม่นยำเป็นสองเท่า” — นั่นคือ บนส่วนผสมเฉพาะนั้น โมเดลนี้เป็นตัวถอดเสียงแบบสตรีมมิ่งที่แม่นยำที่สุดเท่าที่มีการวัดมา มีจุดยิบย่อยหนึ่งที่น่าพูดถึง: โพสต์ของ SpaceXAI ระบุว่าได้ที่หนึ่ง “ในบรรดาโมเดลสตรีมมิ่ง 32 ตัว” ขณะที่หน้าตารางอันดับเองแสดง 27 จาก 33 โมเดล อันดับนั้นเป็นของจริง; ขนาดกลุ่มผู้เข้าแข่งในข้อความการตลาดเป็นจำนวนนับของบริษัท ไม่ใช่ของตารางอันดับ
นอกจากนี้ยังควรระบุให้ชัดเจนว่าการได้อันดับหนึ่งบน AA-WER Streaming ครอบคลุมสิ่งใดและไม่ครอบคลุมสิ่งใด บอร์ดนี้ให้น้ำหนักกับภาษาอังกฤษและเต็มไปด้วยบทสนทนาแบบเอเจนต์ จึงไม่ได้วัดสำเนียงของคุณ โคเดกของคุณ คำศัพท์เฉพาะโดเมนของคุณ หรือเสียงคอลเซ็นเตอร์แบบแปดช่องสัญญาณของคุณ โมเดลที่ขึ้นอันดับหนึ่งบนบอร์ดนี้ยังอาจแพ้ยับบนไฟล์บันทึกเสียงของคุณได้ และนั่นคือเหตุผลว่าทำไมช่วงเวลา opt-in จึงสำคัญ

ราคาไม่เปลี่ยนแปลง และนั่นคือข้อเท็จจริงที่สำคัญเป็นอันดับสองในเรื่องนี้
Grok Voice Transcribe 2.0 มีค่าใช้จ่ายเท่ากับเวอร์ชัน 1.0 นั่นคือ 0.10 ดอลลาร์ต่อชั่วโมงเสียงสำหรับไฟล์แบบแบตช์และไฟล์ที่บันทึกผ่าน REST endpoint และ 0.20 ดอลลาร์ต่อชั่วโมงเสียงสำหรับการสตรีมผ่าน WebSocket บนตารางราคาของ Artificial Analysis นั้น SKU สำหรับการสตรีมอยู่ที่ 3.33 ดอลลาร์ต่อ 1,000 นาที และ SKU แบบแบตช์อยู่ที่ 1.67 ดอลลาร์ ซึ่งเป็นอัตราแบบแบตช์เดียวกับที่ Microsoft เรียกเก็บสำหรับ MAI-Transcribe-2 และคิดเป็นประมาณหนึ่งในสามของค่าใช้จ่ายต่อนาทีสตรีมมิ่งของ ElevenLabs Scribe v2 Realtime
การแยกผู้พูด การประทับเวลาระดับคำพร้อมคะแนนความเชื่อมั่น และการให้น้ำหนักคำสำคัญ ล้วนรวมอยู่ในอัตรานั้นแทนที่จะคิดค่าบริการแยกต่างหาก ซึ่งไม่ใช่เรื่องปกติในตลาดนี้ Gemini 3.5 Transcribe Live คิดค่าบริการตามโทเค็นทั้งสำหรับอินพุตเสียงและเอาต์พุตข้อความ ดังนั้นค่าใช้จ่ายของคุณจะแปรผันตามปริมาณที่โมเดลพูด ไม่ใช่แค่ระยะเวลาที่เสียงดำเนินไป อัตราคงที่ต่อชั่วโมงนั้นคาดการณ์ได้ง่ายกว่าและเปรียบเทียบระหว่างผู้ให้บริการได้ง่ายกว่า — และเนื่องจาก OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่มีส่วนต่างกำไร 0% การเปลี่ยนแปลงอัตราดังกล่าวจากฝั่งผู้ให้บริการจะปรากฏบนฝั่งเราในวันเดียวกัน แทนที่จะเป็นหลังรอบการปรับราคา
สิ่งที่ API มอบให้คุณจริง ๆ
รายการความสามารถนั้นกว้าง และส่วนใหญ่เป็นสิ่งที่สืบทอดมามากกว่าเป็นของใหม่ ซึ่งน่ารู้ไว้หากคุณกำลังประเมินการอัปเกรดจากคุณสมบัติเพียงอย่างเดียว:
• แบตช์และสตรีมมิ่งในโมเดลเดียว — REST สำหรับไฟล์ที่บันทึกไว้ขนาดไม่เกิน 500 MB, WebSocket ที่ wss://api.x.ai/v1/stt โดยมีผลลัพธ์ชั่วคราวส่งออกมาประมาณทุก ๆ 500 ms
• รวมการแยกผู้พูดไว้ด้วย พร้อมการถอดเสียงแบบหลายช่องสัญญาณจากช่องสัญญาณอิสระสูงสุด 8 ช่อง
• การประทับเวลาระดับคำพร้อมคะแนนความเชื่อมั่น เพื่อให้คุณกำหนดเกณฑ์ช่วงที่มีความเชื่อมั่นต่ำได้ แทนที่จะเชื่อถือบทถอดเสียงทั้งหมดเท่า ๆ กัน
• การให้น้ำหนักคำสำคัญได้สูงสุด 100 คำศัพท์เฉพาะโดเมนต่อคำขอ โดยแต่ละคำยาวสูงสุด 50 ตัวอักษร
• การปรับข้อความให้เป็นมาตรฐานย้อนกลับสำหรับตัวเลข วันที่ สกุลเงิน หมายเลขโทรศัพท์ และที่อยู่อีเมล พร้อมการจัดรูปแบบข้อความแบบเขียนที่รองรับ 25 ภาษา
• การลบคำฟุ่มเฟือย และการตรวจจับจุดสิ้นสุดของเทิร์นด้วย Smart Turn ซึ่งมุ่งเป้าไปที่เอเจนต์เสียงโดยตรง
• การตรวจจับภาษาอัตโนมัติพร้อมการสลับภาษาระหว่างการบันทึกในรอบเดียว ครอบคลุมรูปแบบเสียง 12 รูปแบบและอัตราการสุ่มตัวอย่างตั้งแต่ 8 kHz ถึง 48 kHz
• ขีดจำกัดของบริการที่ 10 คำขอต่อวินาทีสำหรับทั้ง REST และสตรีมมิง และ 100 เซสชันการสตรีมพร้อมกันต่อทีม ซึ่งโฮสต์อยู่ใน us-east-1
บันทึกการใช้งานจริงหนึ่งข้อที่ไม่อยู่ในรายการฟีเจอร์: บริการนี้ทำงานในภูมิภาคเดียว หากเสียงของคุณมาจากนอกสหรัฐอเมริกา เส้นทางเครือข่ายกลายเป็นส่วนหนึ่งของงบประมาณความหน่วงของคุณ และ AA-WER Streaming รวมความหน่วงจากเครือข่ายเข้าไปในการจับเวลาโดยตรง SpaceXAI เสนอเงื่อนไขการไม่เก็บข้อมูล (zero-data-retention) และอ้างอิง SOC 2 Type II, BAAs และตัวเลือกการจัดเก็บข้อมูลใน EU ดังนั้นเรื่องการปฏิบัติตามข้อกำหนดจึงได้รับการพัฒนามากกว่าเรื่องที่ตั้งทางภูมิศาสตร์

ใครควรย้าย และสิ่งที่ต้องจับตา
ถ้าคุณใช้ Grok Voice Transcribe 1.0 อยู่แล้ว และแอปพลิเคชันของคุณทำงานโดยอิงกับข้อความถอดเสียงบางส่วน — การตรวจจับการเปลี่ยนรอบสนทนา การพูดแทรก และการตอบกลับของเอเจนต์แบบเรียลไทม์ — ช่องว่างความแม่นยำของข้อความบางส่วนจาก 18.3% เป็น 3.4% นั้นมากพอที่การทดสอบ 2.0 จะไม่ใช่เรื่องเลือกได้ ตัวเลขที่เปลี่ยนจาก "มักผิด" เป็น "มักถูก" คือความแตกต่างระหว่างข้อความถอดเสียงบางส่วนที่คุณนำไปกำหนดเส้นทางต่อได้ กับข้อความที่คุณทำได้เพียงแสดงผล ถ้าแอปพลิเคชันของคุณรอข้อความถอดเสียงฉบับสมบูรณ์บนไฟล์ที่บันทึกไว้ การปรับปรุงนั้นมีจริงแต่เล็กกว่า และความหน่วงในการคอมมิตที่เพิ่มขึ้น 0.12 วินาทีก็คือต้นทุนของมัน
หากคุณใช้ผู้ให้บริการรายอื่นโดยสิ้นเชิง เหตุผลที่ควรดูรีลีสนี้ไม่ใช่อันดับบนลีดเดอร์บอร์ด — แต่เป็นเพราะห้องแล็บระดับแนวหน้าเพิ่งปรับปรุงโมเดลถอดเสียงของตนให้ดีขึ้นอย่างมาก โดยไม่ขึ้นราคา ซึ่งนั่นคือหน้าตาของตลาดเมื่อความแม่นยำไม่ใช่สิ่งที่คุณเรียกเก็บเงินอีกต่อไป เส้นทางการอัปเกรดก็เป็นแบบที่ถูกที่สุดเช่นกัน: พารามิเตอร์เดียว ไม่ต้องแก้โค้ด ไม่ต้องทำสัญญาใหม่ และมี pin ให้ใช้หากเกิดปัญหา
สิ่งที่ต้องจับตาต่อไปคือการสลับค่าเริ่มต้น เมื่อ SpaceXAI ตั้งให้ 2.0 เป็นค่าเริ่มต้นและเริ่มเลิกใช้ 1.0 ทุกอินทิเกรชันที่ไม่เคยส่งพารามิเตอร์โมเดลจะย้ายไปใช้โมเดลใหม่พร้อมกันทั้งหมด รวมถึงการเปลี่ยนแปลงด้านความหน่วงด้วย ทีมที่พึ่งพาจังหวะ partial 0.25 วินาทีแบบเดิมควรล็อกเวอร์ชันตอนนี้ ดีกว่ามาค้นพบการเปลี่ยนแปลงในโปรดักชัน สิ่งที่สองที่ต้องจับตาคือการทำซ้ำโดยอิสระ: รายการของ Artificial Analysis เป็นการวัดจริง แต่เป็นเพียงบอร์ดเดียวบนมิกซ์เสียงหนึ่งชุด และยังไม่มีบุคคลที่สามรายใดเผยแพร่การรัน 1.0 เทียบกับ 2.0 แบบเทียบเคียงกันบนเสียงโปรดักชัน
