การ์ดฮีโร่บทความที่อ่านว่า 'Grok Voice Transcribe 2.0' พร้อมป้าย 'ข่าว' และคำบรรยายย่อย 'อันดับ 1 ด้านความแม่นยำสตรีมมิ่ง ในราคาที่ไม่เปลี่ยนแปลง' พร้อมชิปที่อ่านว่า WER บทถอดเสียงสุดท้าย 2.7%, บางส่วนแรก 3.4%, 0.49 วินาทีหลังสิ้นสุดคำพูด และ $0.20 ต่อชั่วโมงสตรีมมิ่ง บนพื้นหลังไล่เฉดสีขาวถึงน้ำเงินโดยมีโลโก้ OrcaRouter ที่มุมขวาล่าง
Engineering & Research

Grok Voice Transcribe 2.0 คว้าอันดับ 1 ด้านความแม่นยำการถอดเสียงแบบสตรีมมิ่งในราคาที่ไม่เปลี่ยนแปลง

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Grok Voice Transcribe 2.0 คือโมเดลแปลงเสียงพูดเป็นข้อความที่ SpaceXAI เปิดตัวเมื่อวันที่ 18 กันยายน 2026 และตัวเลขเดียวที่สำคัญเกี่ยวกับโมเดลนี้ไม่ใช่ตัวเลขที่โพสต์เปิดตัวยกขึ้นมาเป็นประเด็นหลัก มันคือสิ่งนี้: first partial transcript — ข้อความที่ voice agent ได้ลงมือทำจริงขณะที่ผู้โทรยังถูกพูดทับอยู่ — ลดลงจากอัตราความผิดพลาดระดับคำ (word error rate) 18.3% ใน Grok Voice Transcribe 1.0 เหลือ 3.4% นั่นคือการวัดบนบอร์ด AA-WER Streaming ของ Artificial Analysis ซึ่งตอนนี้โมเดลใหม่อยู่อันดับหนึ่งทั้งในอันดับ Final Transcript (WER 2.7%, 0.49 วินาทีหลังสิ้นสุดการพูด) และอันดับ First Partial Transcript (3.4%, 0.49 วินาที) ความแม่นยำของ final transcript ก็ดีขึ้นเช่นกัน จาก 3.9% เป็น 2.7% ซึ่งเป็นเรื่องจริงแต่ไม่มากนัก การก้าวกระโดดของ partial transcript ต่างหากที่เปลี่ยนสิ่งที่คุณสร้างได้

จริง ๆ แล้วอะไรเปลี่ยนไปบ้างระหว่าง 1.0 กับ 2.0

ทั้งสองเวอร์ชันเป็นผลิตภัณฑ์เดียวกันใน API เดียวกัน และ SpaceXAI ไม่ได้เปลี่ยนแปลงอินเทอร์เฟซ: Grok Voice Transcribe 2.0 ถูกเลือกโดยการส่ง grok-voice-transcribe-2.0 ไปยัง /v1/stt แทน grok-voice-transcribe-1.0 หรือโดยการเลือกเมื่อสร้างการเชื่อมต่อ WebSocket สำหรับการสตรีม การผสานรวมที่มีอยู่ซึ่งละเว้นพารามิเตอร์ model จะยังคงได้รับ 1.0 ไปจนกว่า SpaceXAI จะสลับค่าเริ่มต้น ซึ่งบริษัทกล่าวว่าจะเกิดขึ้นในอีกไม่กี่สัปดาห์ข้างหน้า ควบคู่ไปกับการเลิกใช้เวอร์ชันเก่า จนถึงตอนนั้น 2.0 เป็นแบบเลือกใช้ (opt-in) และ 1.0 สามารถปักหมุดไว้ได้อย่างตั้งใจ ซึ่งเป็นรูปแบบที่เหมาะสมสำหรับการเปลี่ยนแปลงเช่นนี้: คุณสามารถทดสอบ A/B กับเสียงของคุณเองก่อนที่มันจะกลายเป็นค่าเริ่มต้นในโปรดักชันของคุณ ไม่ว่าคุณจะขอหรือไม่ก็ตาม

ตัวเลขของ Artificial Analysis เมื่อนำมาอ่านเทียบกันแล้ว เล่าเรื่องราวที่เจาะจงมากกว่าคำว่า "แม่นยำเป็นสองเท่า":

• ความแม่นยำของทรานสคริปต์ฉบับสุดท้าย — Grok Voice Transcribe 2.0 ที่ WER 2.7% เทียบกับ Grok Voice Transcribe 1.0 ที่ 3.9% บน AA-WER Streaming โดยทั้งคู่วัดหลังสิ้นสุดการพูด

• ความแม่นยำของบทถอดความบางส่วนครั้งแรก — WER 3.4% เทียบกับ 18.3% ซึ่งเป็นช่องว่างเดี่ยวที่ใหญ่ที่สุดระหว่างสองเวอร์ชัน

• เวลาจนถึงทรานสคริปต์ฉบับสุดท้าย — 0.49 วินาที เทียบกับ 0.37 วินาที ดังนั้นโมเดลใหม่จึงยืนยันผลลัพธ์สุดท้ายได้ช้ากว่าโมเดลที่มันเข้าแทนที่

• เวลาถึง partial แรก — 0.49s เทียบกับ 0.25s ก็ช้ากว่าเช่นกัน

• ความแม่นยำแบบ Batch (ไม่สตรีมมิง) — 2.3% AA-WER บนบอร์ดแบบไม่สตรีมมิงของ Artificial Analysis เทียบกับ 4.07% สำหรับ Whisper Large v3 และ 3.31% สำหรับ GPT Transcribe

• ปริมาณงานประมวลผลแบบเป็นชุด — ประมาณ 162× ของเวลาจริงบนบอร์ดเดียวกัน เป็นรอง 333× ของ MAI-Transcribe-2 และนำหน้า 88× ของ Gemini 3.5 Transcribe

บรรทัดที่สี่และห้านั้นคือข้อแม้อย่างตรงไปตรงมาในรีลีสนี้ SpaceXAI แลกความแม่นยำมาด้วยความหน่วง โมเดลใหม่ใช้เวลาช้ากว่า 1.0 ประมาณหนึ่งในสามวินาทีในการคืนผลบางส่วนแรกและทรานสคริปต์สุดท้าย บนกระดานที่ Deepgram Flux คืนผลบางส่วนภายใน 0.02 วินาที และ Soniox v5 ภายใน 0.05 วินาที Grok Voice Transcribe 2.0 ไม่ได้แข่งกันที่ความเร็วเลย — มันแข่งกันที่ความถูกต้อง และมันชนะการแลกเปลี่ยนนั้นด้วยส่วนต่างที่ห่างไกล ไม่ว่าการแลกเปลี่ยนนี้จะถูกต้องหรือไม่นั้น ขึ้นอยู่ทั้งหมดกับว่าแอปพลิเคชันของคุณเป็น voice agent แบบเรียลไทม์ที่ต้องเริ่มพูดตอบกลับ หรือเป็นไปป์ไลน์ถอดเสียงที่ครึ่งวินาทีนั้นมองไม่เห็น

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs Grok Voice Transcribe 1.0 — the numbers': the left column gives Grok Voice Transcribe 2.0 a 2.7% final transcript WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives Grok Voice Transcribe 1.0 3.9%, 18.3%, 0.37s and the same two prices, with throughput not measured; the footer credits both columns to Artificial Analysis.

คำกล่าวอ้าง “แม่นยำเป็นสองเท่า” เมื่อตรวจสอบแล้ว

พาดหัวของ SpaceXAI ระบุว่า 2.0 แม่นยำเป็นสองเท่าของ 1.0 ในราคาเดียวกัน และตารางการประเมินของบริษัทเองก็สนับสนุนเรื่องนี้บนชุดข้อมูลที่บริษัทเลือก ในสายสนทนาบริการลูกค้าภาษาอังกฤษที่ 8 kHz อัตราความผิดพลาดระดับคำลดลงจาก 10.6% เหลือ 7.1% ในการสนทนากับ Grok จาก 8.7% เหลือ 3.3% กับข้อมูลรับรองที่พูดออกมา — รหัสบัญชี หมายเลขโทรศัพท์ ที่อยู่อีเมล — จาก 7.2% เหลือ 3.2% ในคำสั่งสั้น ๆ ใน 19 ภาษา จาก 20.6% เหลือ 6.8% ซึ่งเป็นการลดข้อผิดพลาดลงประมาณสองในสาม ชุดข้อมูลทั้งสี่นี้ดึงมาจากทราฟฟิกการใช้งานจริงของ SpaceXAI และการเปรียบเทียบเป็นของ SpaceXAI เอง ไม่มีใครนอกบริษัททำซ้ำผลลัพธ์เหล่านี้ได้ ให้มองตารางนี้เป็นแผนที่ว่าจุดใดที่โมเดลถูกปรับแต่ง ไม่ใช่การรับประกันความแม่นยำโดยทั่วไป

ผลลัพธ์ของ Artificial Analysis คือส่วนที่ไม่ได้มาจากการรายงานของผู้ขายเอง: ชุดทดสอบอิสระที่รันกับเสียงราวแปดชั่วโมง โดยถ่วงน้ำหนัก 50% ให้กับชุด AA-AgentTalk แบบส่วนตัว และ 25% ต่อชุดให้กับ VoxPopuli และ Earnings22 ผลนี้สนับสนุนข้อกล่าวอ้างที่แคบกว่าและมีประโยชน์มากกว่า “แม่นยำเป็นสองเท่า” — นั่นคือ บนส่วนผสมเฉพาะนั้น โมเดลนี้เป็นตัวถอดเสียงแบบสตรีมมิ่งที่แม่นยำที่สุดเท่าที่มีการวัดมา มีจุดยิบย่อยหนึ่งที่น่าพูดถึง: โพสต์ของ SpaceXAI ระบุว่าได้ที่หนึ่ง “ในบรรดาโมเดลสตรีมมิ่ง 32 ตัว” ขณะที่หน้าตารางอันดับเองแสดง 27 จาก 33 โมเดล อันดับนั้นเป็นของจริง; ขนาดกลุ่มผู้เข้าแข่งในข้อความการตลาดเป็นจำนวนนับของบริษัท ไม่ใช่ของตารางอันดับ

นอกจากนี้ยังควรระบุให้ชัดเจนว่าการได้อันดับหนึ่งบน AA-WER Streaming ครอบคลุมสิ่งใดและไม่ครอบคลุมสิ่งใด บอร์ดนี้ให้น้ำหนักกับภาษาอังกฤษและเต็มไปด้วยบทสนทนาแบบเอเจนต์ จึงไม่ได้วัดสำเนียงของคุณ โคเดกของคุณ คำศัพท์เฉพาะโดเมนของคุณ หรือเสียงคอลเซ็นเตอร์แบบแปดช่องสัญญาณของคุณ โมเดลที่ขึ้นอันดับหนึ่งบนบอร์ดนี้ยังอาจแพ้ยับบนไฟล์บันทึกเสียงของคุณได้ และนั่นคือเหตุผลว่าทำไมช่วงเวลา opt-in จึงสำคัญ

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard, showing Grok Voice Transcribe 2.0 first on both the Final Transcription ranking at 2.728% word error rate and 0.490s and the First Partial Transcription ranking at 3.359% and 0.489s, with Grok Voice Transcribe 1.0 further down at 18.275% on partials.

ราคาไม่เปลี่ยนแปลง และนั่นคือข้อเท็จจริงที่สำคัญเป็นอันดับสองในเรื่องนี้

Grok Voice Transcribe 2.0 มีค่าใช้จ่ายเท่ากับเวอร์ชัน 1.0 นั่นคือ 0.10 ดอลลาร์ต่อชั่วโมงเสียงสำหรับไฟล์แบบแบตช์และไฟล์ที่บันทึกผ่าน REST endpoint และ 0.20 ดอลลาร์ต่อชั่วโมงเสียงสำหรับการสตรีมผ่าน WebSocket บนตารางราคาของ Artificial Analysis นั้น SKU สำหรับการสตรีมอยู่ที่ 3.33 ดอลลาร์ต่อ 1,000 นาที และ SKU แบบแบตช์อยู่ที่ 1.67 ดอลลาร์ ซึ่งเป็นอัตราแบบแบตช์เดียวกับที่ Microsoft เรียกเก็บสำหรับ MAI-Transcribe-2 และคิดเป็นประมาณหนึ่งในสามของค่าใช้จ่ายต่อนาทีสตรีมมิ่งของ ElevenLabs Scribe v2 Realtime

การแยกผู้พูด การประทับเวลาระดับคำพร้อมคะแนนความเชื่อมั่น และการให้น้ำหนักคำสำคัญ ล้วนรวมอยู่ในอัตรานั้นแทนที่จะคิดค่าบริการแยกต่างหาก ซึ่งไม่ใช่เรื่องปกติในตลาดนี้ Gemini 3.5 Transcribe Live คิดค่าบริการตามโทเค็นทั้งสำหรับอินพุตเสียงและเอาต์พุตข้อความ ดังนั้นค่าใช้จ่ายของคุณจะแปรผันตามปริมาณที่โมเดลพูด ไม่ใช่แค่ระยะเวลาที่เสียงดำเนินไป อัตราคงที่ต่อชั่วโมงนั้นคาดการณ์ได้ง่ายกว่าและเปรียบเทียบระหว่างผู้ให้บริการได้ง่ายกว่า — และเนื่องจาก OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่มีส่วนต่างกำไร 0% การเปลี่ยนแปลงอัตราดังกล่าวจากฝั่งผู้ให้บริการจะปรากฏบนฝั่งเราในวันเดียวกัน แทนที่จะเป็นหลังรอบการปรับราคา

สิ่งที่ API มอบให้คุณจริง ๆ

รายการความสามารถนั้นกว้าง และส่วนใหญ่เป็นสิ่งที่สืบทอดมามากกว่าเป็นของใหม่ ซึ่งน่ารู้ไว้หากคุณกำลังประเมินการอัปเกรดจากคุณสมบัติเพียงอย่างเดียว:

• แบตช์และสตรีมมิ่งในโมเดลเดียว — REST สำหรับไฟล์ที่บันทึกไว้ขนาดไม่เกิน 500 MB, WebSocket ที่ wss://api.x.ai/v1/stt โดยมีผลลัพธ์ชั่วคราวส่งออกมาประมาณทุก ๆ 500 ms

• รวมการแยกผู้พูดไว้ด้วย พร้อมการถอดเสียงแบบหลายช่องสัญญาณจากช่องสัญญาณอิสระสูงสุด 8 ช่อง

• การประทับเวลาระดับคำพร้อมคะแนนความเชื่อมั่น เพื่อให้คุณกำหนดเกณฑ์ช่วงที่มีความเชื่อมั่นต่ำได้ แทนที่จะเชื่อถือบทถอดเสียงทั้งหมดเท่า ๆ กัน

• การให้น้ำหนักคำสำคัญได้สูงสุด 100 คำศัพท์เฉพาะโดเมนต่อคำขอ โดยแต่ละคำยาวสูงสุด 50 ตัวอักษร

• การปรับข้อความให้เป็นมาตรฐานย้อนกลับสำหรับตัวเลข วันที่ สกุลเงิน หมายเลขโทรศัพท์ และที่อยู่อีเมล พร้อมการจัดรูปแบบข้อความแบบเขียนที่รองรับ 25 ภาษา

• การลบคำฟุ่มเฟือย และการตรวจจับจุดสิ้นสุดของเทิร์นด้วย Smart Turn ซึ่งมุ่งเป้าไปที่เอเจนต์เสียงโดยตรง

• การตรวจจับภาษาอัตโนมัติพร้อมการสลับภาษาระหว่างการบันทึกในรอบเดียว ครอบคลุมรูปแบบเสียง 12 รูปแบบและอัตราการสุ่มตัวอย่างตั้งแต่ 8 kHz ถึง 48 kHz

• ขีดจำกัดของบริการที่ 10 คำขอต่อวินาทีสำหรับทั้ง REST และสตรีมมิง และ 100 เซสชันการสตรีมพร้อมกันต่อทีม ซึ่งโฮสต์อยู่ใน us-east-1

บันทึกการใช้งานจริงหนึ่งข้อที่ไม่อยู่ในรายการฟีเจอร์: บริการนี้ทำงานในภูมิภาคเดียว หากเสียงของคุณมาจากนอกสหรัฐอเมริกา เส้นทางเครือข่ายกลายเป็นส่วนหนึ่งของงบประมาณความหน่วงของคุณ และ AA-WER Streaming รวมความหน่วงจากเครือข่ายเข้าไปในการจับเวลาโดยตรง SpaceXAI เสนอเงื่อนไขการไม่เก็บข้อมูล (zero-data-retention) และอ้างอิง SOC 2 Type II, BAAs และตัวเลือกการจัดเก็บข้อมูลใน EU ดังนั้นเรื่องการปฏิบัติตามข้อกำหนดจึงได้รับการพัฒนามากกว่าเรื่องที่ตั้งทางภูมิศาสตร์

Screenshot of the SpaceXAI docs.x.ai Speech-to-Text page listing the Grok Voice Transcribe 2.0 REST and WebSocket endpoints, the grok-voice-transcribe-2.0 model parameter, the 500 MB file limit, key-term biasing and the published rate limits.

ใครควรย้าย และสิ่งที่ต้องจับตา

ถ้าคุณใช้ Grok Voice Transcribe 1.0 อยู่แล้ว และแอปพลิเคชันของคุณทำงานโดยอิงกับข้อความถอดเสียงบางส่วน — การตรวจจับการเปลี่ยนรอบสนทนา การพูดแทรก และการตอบกลับของเอเจนต์แบบเรียลไทม์ — ช่องว่างความแม่นยำของข้อความบางส่วนจาก 18.3% เป็น 3.4% นั้นมากพอที่การทดสอบ 2.0 จะไม่ใช่เรื่องเลือกได้ ตัวเลขที่เปลี่ยนจาก "มักผิด" เป็น "มักถูก" คือความแตกต่างระหว่างข้อความถอดเสียงบางส่วนที่คุณนำไปกำหนดเส้นทางต่อได้ กับข้อความที่คุณทำได้เพียงแสดงผล ถ้าแอปพลิเคชันของคุณรอข้อความถอดเสียงฉบับสมบูรณ์บนไฟล์ที่บันทึกไว้ การปรับปรุงนั้นมีจริงแต่เล็กกว่า และความหน่วงในการคอมมิตที่เพิ่มขึ้น 0.12 วินาทีก็คือต้นทุนของมัน

หากคุณใช้ผู้ให้บริการรายอื่นโดยสิ้นเชิง เหตุผลที่ควรดูรีลีสนี้ไม่ใช่อันดับบนลีดเดอร์บอร์ด — แต่เป็นเพราะห้องแล็บระดับแนวหน้าเพิ่งปรับปรุงโมเดลถอดเสียงของตนให้ดีขึ้นอย่างมาก โดยไม่ขึ้นราคา ซึ่งนั่นคือหน้าตาของตลาดเมื่อความแม่นยำไม่ใช่สิ่งที่คุณเรียกเก็บเงินอีกต่อไป เส้นทางการอัปเกรดก็เป็นแบบที่ถูกที่สุดเช่นกัน: พารามิเตอร์เดียว ไม่ต้องแก้โค้ด ไม่ต้องทำสัญญาใหม่ และมี pin ให้ใช้หากเกิดปัญหา

สิ่งที่ต้องจับตาต่อไปคือการสลับค่าเริ่มต้น เมื่อ SpaceXAI ตั้งให้ 2.0 เป็นค่าเริ่มต้นและเริ่มเลิกใช้ 1.0 ทุกอินทิเกรชันที่ไม่เคยส่งพารามิเตอร์โมเดลจะย้ายไปใช้โมเดลใหม่พร้อมกันทั้งหมด รวมถึงการเปลี่ยนแปลงด้านความหน่วงด้วย ทีมที่พึ่งพาจังหวะ partial 0.25 วินาทีแบบเดิมควรล็อกเวอร์ชันตอนนี้ ดีกว่ามาค้นพบการเปลี่ยนแปลงในโปรดักชัน สิ่งที่สองที่ต้องจับตาคือการทำซ้ำโดยอิสระ: รายการของ Artificial Analysis เป็นการวัดจริง แต่เป็นเพียงบอร์ดเดียวบนมิกซ์เสียงหนึ่งชุด และยังไม่มีบุคคลที่สามรายใดเผยแพร่การรัน 1.0 เทียบกับ 2.0 แบบเทียบเคียงกันบนเสียงโปรดักชัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube