การ์ดฮีโร่ของบทความที่แสดงข้อความ 'Grok Voice Transcribe 2.0 vs GPT Transcribe' พร้อมป้าย 'การเปรียบเทียบโมเดล' และคำบรรยายย่อย 'ราคาสตรีมมิ่งเท่ากัน แต่ความแม่นยำต่างกัน' โดยมีชิปที่ระบุว่า WER แบบสตรีมมิ่ง 2.7% vs 3.9%, partial แรก 3.4% vs 6.3%, $1.67 vs $4.50 ต่อ 1,000 นาที และ 162x vs 41x เรียลไทม์ บนพื้นหลังไล่เฉดสีขาวไปน้ำเงิน พร้อมโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Grok Voice Transcribe 2.0 vs GPT Transcribe: ราคาสตรีมมิ่งเท่ากัน แต่ความแม่นยำต่างกัน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

ความบังเอิญนี้เกือบจะดูเนียนเกินไป บนบอร์ด AA-WER Streaming ของ Artificial Analysis ทั้ง Grok Voice Transcribe 2.0 และ GPT Live Transcribe — ปลายทางการถอดเสียงแบบสตรีมมิ่ง — ต่างระบุราคาเท่ากันที่ $3.33 ต่อ 1,000 นาทีของเสียง Grok Voice Transcribe 2.0 ของ SpaceXAI ซึ่งเปิดตัวเมื่อวันที่ 18 กันยายน 2026 ให้บทถอดเสียงสุดท้ายที่อัตราความผิดพลาดระดับคำ 2.7% ภายใน 0.49 วินาทีหลังสิ้นสุดการพูด และผลลัพธ์บางส่วนครั้งแรกที่ 3.4% ส่วน GPT Live Transcribe ซึ่งเปิดตัวพร้อมกับ GPT Transcribe เมื่อวันที่ 28 กรกฎาคม 2026 ให้บทถอดเสียงสุดท้ายที่ 3.9% และผลลัพธ์บางส่วนครั้งแรกที่ 6.3% ราคาเดียวกัน และความแม่นยำของบทถอดเสียงสุดท้ายประมาณ 1.2 จุด บวกกับความแม่นยำของบทถอดเสียงบางส่วนอีก 2.9 จุด เป็นผลดีต่อ SpaceXAI ด้านแบตช์ของการเปรียบเทียบเดียวกันไม่ใช่ความบังเอิญเลย: GPT Transcribe มีค่าใช้จ่าย $4.50 ต่อ 1,000 นาที เทียบกับ $1.67 ของ Grok Voice Transcribe 2.0 ซึ่งเป็นช่องว่าง 63% บนเส้นทางไฟล์บันทึกเสียง

สองเดิมพันที่แตกต่างกันเกี่ยวกับวิธีที่การถอดเสียงจะดีขึ้น

คำตอบของ OpenAI ต่อความแม่นยำคือบริบท ทั้ง GPT Transcribe และ GPT Live Transcribe ต่างรับพรอมป์ต์แบบอิสระ รายการคีย์เวิร์ด และรายการภาษาที่คาดไว้ และในเซสชัน Realtime เทิร์นที่ถอดความก่อนหน้านี้จะถูกป้อนกลับเข้าไปเป็นบริบทสำหรับเทิร์นถัดไป บนเกณฑ์มาตรฐาน Context Aware ASR ของ OpenAI เอง การปรับเงื่อนไขนั้นช่วยยกระดับความแม่นยำเชิงความหมายของ GPT Live Transcribe จาก 38.5% เป็น 44.6% — เป็นตัวเลขที่ผู้ขายรายงาน และเป็นตัวเลขที่วัดว่าความหมายยังคงอยู่หรือไม่ มากกว่าจะวัดว่าถ้อยคำถูกต้องหรือไม่ ข้อแลกเปลี่ยนที่ OpenAI เสนอเป็นสิ่งที่ชัดเจน: ให้ข้อมูลแก่โมเดลเกี่ยวกับสิ่งที่มันกำลังจะได้ยิน แล้วมันจะถอดความโดเมนของคุณได้ดีกว่าโมเดลทั่วไปที่มีความแม่นยำดิบในระดับเดียวกัน

คำตอบของ SpaceXAI ก็คือตัวโมเดลนั่นเอง Grok Voice Transcribe 2.0 มีกลไกไบแอสจริง — คำสำคัญได้ถึง 100 คำต่อคำขอ โดยแต่ละคำยาวได้ถึง 50 ตัวอักษร — แต่มันเป็นรายการคำศัพท์ ไม่ใช่พรอมป์ต์ คุณบอกมันได้ว่า "OrcaRouter" และ "Kubernetes" เป็นคำจริง; คุณไม่สามารถยื่นย่อหน้าให้มันเพื่ออธิบายว่านี่คือสายซัพพอร์ตเกี่ยวกับการคืนเงินได้ การปรับปรุงความแม่นยำใน 2.0 กลับมาจากการฝึกใหม่แทน: บนชุดประเมินที่ได้จากระบบจริงของ SpaceXAI เอง อัตราความผิดพลาดระดับคำลดลงจาก 8.7% เหลือ 3.3% สำหรับเสียงสนทนา, 10.6% เหลือ 7.1% สำหรับโทรศัพท์ 8 kHz, 7.2% เหลือ 3.2% สำหรับข้อมูลรับรองที่พูดออกเสียง, และ 20.6% เหลือ 6.8% สำหรับคำสั่งสั้น ๆ ใน 19 ภาษา นั่นคือตัวเลขของบริษัทบนเสียงของบริษัทเอง โดยไม่มีใครภายนอกทำซ้ำได้ และตัวเลขเหล่านี้อธิบายโมเดลที่เก่งขึ้นในปัญหาด้านเสียง มากกว่าโมเดลที่เก่งขึ้นเมื่อถูกบอกว่าควรคาดหวังอะไร

ความแตกต่างในทางปฏิบัติจะปรากฏให้เห็นในชั่วโมงที่สองของการทำงาน โมเดลที่ปรับตามบริบทสามารถทำได้ดีกว่าที่ผลการวัดประสิทธิภาพดิบของมันบ่งชี้อย่างมาก เพราะคุณเป็นผู้ป้อนคำศัพท์และโดเมนให้ มันยังอาจสร้างคำสำคัญที่คุณป้อนขึ้นมาเองแบบหลอนได้ด้วย: ลองใส่ "OrcaRouter" ลงในพรอมป์ต์ โมเดลที่ไม่ได้ยินคำนั้นอย่างชัดเจนก็อาจสร้างคำนั้นออกมาอยู่ดี โมเดลที่ให้น้ำหนักกับคำสำคัญจะเสื่อมประสิทธิภาพลงอย่างนุ่มนวลกว่า เพราะการให้น้ำหนักจะเลื่อนความน่าจะเป็นของคำหนึ่งๆ แทนที่จะยืนยันว่าคำนั้นปรากฏอยู่ ไม่มีโหมดความล้มเหลวแบบใดปรากฏบนลีดเดอร์บอร์ด และทั้งสองแบบจะปรากฏในบันทึกของคุณ

ตัวเลขที่วางเรียงเคียงข้างกัน

• ความแม่นยำของข้อความถอดเสียงฉบับสุดท้าย (สตรีมมิ่ง) — Grok Voice Transcribe 2.0 อยู่ที่ WER 2.7% เทียบกับ GPT Live Transcribe ที่ 3.9% บน AA-WER Streaming ทั้งคู่ตามข้อมูลจาก Artificial Analysis

• ความแม่นยำบางส่วนครั้งแรก (สตรีมมิ่ง) — 3.4% เทียบกับ 6.3% ซึ่งเป็นช่องว่างที่กว้างที่สุดในการเปรียบเทียบ และเป็นปัจจัยที่กำหนดพฤติกรรมของ voice-agent

• ระยะเวลาถึงข้อความถอดเสียงฉบับสุดท้าย — 0.49 วินาที เทียบกับ 0.81 วินาทีหลังจากสิ้นสุดการพูด ดังนั้นโมเดลที่แม่นยำกว่าจึงเป็นตัวที่ยืนยันผลลัพธ์สุดท้ายได้เร็วกว่าด้วย

• เวลาถึงผลลัพธ์บางส่วนครั้งแรก — 0.49 วินาที เทียบกับ 0.26 วินาที เป็นคอลัมน์ความหน่วงหนึ่งเดียวที่ OpenAI ชนะขาด

• ราคาสตรีมมิ่ง — 3.33 ดอลลาร์ต่อ 1,000 นาทีสำหรับทั้งคู่ ซึ่งปรับให้เป็นมาตรฐานโดย Artificial Analysis จากราคา 0.20 ดอลลาร์ต่อชั่วโมงของ Grok และ 0.017 ดอลลาร์ต่อนาทีของ OpenAI

• ความแม่นยำแบบประมวลผลเป็นชุด (ไม่ใช่สตรีมมิ่ง) — Grok Voice Transcribe 2.0 อยู่ที่ 2.3% AA-WER เทียบกับ GPT Transcribe ที่ 3.31%

• ราคาแบบชุด — $1.67 ต่อ 1,000 นาที เทียบกับ $4.50 ต่อ 1,000 นาที จาก $0.10/ชั่วโมง เทียบกับ $0.0045/นาที

• อัตราการประมวลผลแบบกลุ่ม — ประมาณ 162 เท่าของเวลาจริง เทียบกับประมาณ 41 เท่าบนบอร์ดเดียวกัน

อ่านรายการนั้นเป็นสองคอลัมน์แทนที่จะเป็นคำตัดสินเดียว OpenAI ชนะด้านเวลาแฝงของ first-partial อย่างชัดเจน และมีกลไก context ที่ Grok ไม่มี SpaceXAI ชนะด้านความแม่นยำสุดท้ายในทั้งสองโหมด ความแม่นยำแบบ partial ในการสตรีม ทรูพุต และราคาแบบแบตช์อย่างมาก ไม่มีคอลัมน์ใดที่ GPT Live Transcribe เร็วกว่าและแม่นยำกว่า Grok Voice Transcribe 2.0 พร้อมกัน; มีอยู่หนึ่งคอลัมน์ที่มันเร็วกว่า และนั่นคือคอลัมน์แรกสุด

A two-column scoreboard titled 'Grok Voice Transcribe 2.0 vs GPT Transcribe — the scoreboard': the left column gives Grok Voice Transcribe 2.0 a 2.7% streaming final WER, 3.4% first partial WER, 0.49s to final transcript, $1.67 per 1,000 minutes batch, $3.33 per 1,000 minutes streaming and 162x real time throughput; the right column gives GPT Transcribe 3.9%, 6.3%, 0.81s, $4.50, $3.33 and 41x real time.

คุณกำลังอยู่บนเส้นทาง batch ไหนจริง ๆ

ช่องว่างระหว่าง $1.67 กับ $4.50 เป็นตัวเลขที่กำกวมน้อยที่สุดในที่นี้ และควรอธิบายให้ชัดเจนว่าทำไมมันจึงมีอยู่ OpenAI ปรับราคาสายผลิตภัณฑ์นี้ลง 25% เมื่อเปิดตัว GPT Transcribe จากยุค GPT-4o Transcribe และผลลัพธ์คือ $0.0045 ต่อนาที SpaceXAI คงอัตราแบบแบตช์ไว้ที่ $0.10 ต่อชั่วโมงเมื่อย้ายจากเวอร์ชัน 1.0 ไปเป็น 2.0 — บริษัทปรับปรุงโมเดลและคิดราคาเท่าเดิม ซึ่งเป็นสิ่งที่ทำได้ยากกว่าและเป็นสัญญาณที่ดีกว่าว่าตลาดกำลังมุ่งไปทางใด MAI-Transcribe-2 ของ Microsoft เปิดตัวที่ $0.10 ต่อชั่วโมงเท่ากันในฐานะข้อเสนอจำกัดเวลา ดังนั้นจุดที่ $1.67 ต่อ 1,000 นาทีจึงกลายเป็นราคาพื้นของแล็บแนวหน้าสำหรับการถอดเสียงแบบแบตช์ แทนที่จะเป็นตัวเลขโปรโมชันของเจ้าของรายใดรายหนึ่ง

ที่ปริมาณเสียงหนึ่งหมื่นชั่วโมงต่อเดือน ช่องว่างนั้นอยู่ที่ประมาณ $2,830 เทียบกับ $450 สำหรับคลังพอดแคสต์ งานค้างบันทึกเสียงการโทร หรือไลบรารีสื่อที่กำลังถูกถอดเสียงย้อนหลัง ความต่างด้านราคามากกว่าความต่างด้านความแม่นยำระหว่าง WER 2.3% กับ 3.31% จนเทียบกันไม่ได้ สำหรับเอเจนต์สตรีมมิ่ง ซึ่งผลิตภัณฑ์ทั้งสองมีค่าใช้จ่ายเท่ากัน ความแม่นยำและความหน่วงคือสิ่งเดียวที่เหลือให้ถกกัน

มีความแตกต่างเชิงโครงสร้างเบื้องหลังอัตราเหล่านั้นที่ควรค่าแก่การกล่าวถึง: Grok Voice Transcribe 2.0 คิดอัตราแบบเหมาจ่ายต่อชั่วโมงเสียง และ GPT Live Transcribe คิดค่าบริการเป็นรายนาที แต่ Gemini 3.5 Transcribe Live คิดค่าบริการเป็นรายโทเค็นทั้งสำหรับอินพุตเสียงและเอาต์พุตข้อความ มีเพียงหนึ่งในสามรายการนี้ที่ทำให้บิลของคุณเป็นฟังก์ชันของสิ่งที่โมเดลเลือกจะพูด หากปริมาณการใช้งานของคุณมากพอที่การคาดการณ์จะมีความสำคัญ อัตราแบบเหมาจ่ายจะชี้แจงได้ง่ายกว่าต่อผู้ที่ลงนามในใบแจ้งหนี้ — และเนื่องจาก OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่คิดกำไรเพิ่ม 0% การลดราคาจากฝั่งผู้ขายเช่น 25% ของ OpenAI จะมีผลในฝั่งเราทันทีในวันที่ประกาศ ไม่ใช่ในการต่ออายุครั้งถัดไป

Screenshot of the Artificial Analysis AA-WER Streaming leaderboard showing the identical $3.33 per 1,000 minutes streaming price for Grok Voice Transcribe 2.0 and GPT Live Transcribe, next to their 2.728% versus 3.918% final-transcript word error rates and 0.490s versus 0.812s times to final transcript.

สิ่งที่ทั้งสองโมเดลไม่ได้เป็น

GPT Transcribe และ GPT Live Transcribe เป็นผลิตภัณฑ์สองตัว ไม่ใช่ผลิตภัณฑ์เดียวที่มีสวิตช์สลับ โมเดลแบบแบตช์จัดการไฟล์ที่เสร็จสมบูรณ์ ทรานสคริปต์ไฟล์ที่สตรีม และเทิร์นที่คอมมิตแล้วในเซสชัน Realtime และประมวลผลเสียงได้เร็วกว่าเวลาจริงประมาณ 34 เท่าตามตัวเลขของ OpenAI เอง — Artificial Analysis วัดได้ 41× บนชุดทดสอบของตน โมเดลแบบสตรีมมิ่งเป็นตัวที่แพงกว่าที่ $0.017 ต่อนาที และเป็นตัวที่มีอัตราความผิดพลาดบนผลลัพธ์บางส่วนสูงกว่า 10 เท่า การเลือก OpenAI หมายถึงการเลือกว่าปัญหาสองข้อนั้นคุณมีข้อไหน เพราะเอนด์พอยต์ที่ถูกกว่าไม่สามารถทำงานของอีกตัวได้

Grok Voice Transcribe 2.0 เป็นโมเดลเดียวที่มีช่องทางรับส่งสองแบบ: น้ำหนักชุดเดียวกันให้บริการ /v1/stt ผ่าน REST สำหรับไฟล์ขนาดสูงสุด 500 MB และ wss://api.x.ai/v1/stt ผ่าน WebSocket สำหรับเสียงสด โดยมีผลลัพธ์ชั่วคราวส่งออกประมาณทุก ๆ 500 ms อัตราการสตรีมเป็นสองเท่าของอัตราแบบแบตช์พอดี ไม่ใช่ผลิตภัณฑ์ที่ออกแบบแยกต่างหาก ซึ่งหมายความว่าความแม่นยำที่คุณวัดจากเสียงที่เก็บถาวรคือความแม่นยำที่คุณควรคาดหวังแบบสด ๆ และยังหมายความว่าไม่มีโมเดลที่สองให้ประเมิน — ชุดพรอมต์ชุดเดียว ชุดคำสำคัญชุดเดียว ชุดความคาดหวังชุดเดียว

ความเท่าเทียมของฟีเจอร์นั้นใกล้เคียงกันแต่ไม่เหมือนกันทั้งหมด ทั้งคู่คืนค่าประทับเวลาระดับคำ Grok Voice Transcribe 2.0 แนบคะแนนความเชื่อมั่นให้กับแต่ละคำ ซึ่งช่วยให้คุณตั้งเกณฑ์ช่วงที่มีความเชื่อมั่นต่ำแทนที่จะเชื่อถือทั้งบทถอดเสียงเท่ากันทั้งหมด ทั้งคู่ทำ speaker diarization และของ Grok รวมมาให้โดยไม่มีค่าใช้จ่ายเพิ่มเติม ทั้งคู่จัดการ inverse text normalization สำหรับตัวเลข วันที่ สกุลเงิน และรายละเอียดการติดต่อ Grok Voice Transcribe 2.0 เพิ่มการถอดเสียงแบบหลายช่องสัญญาณสูงสุด 8 ช่องสัญญาณอิสระ การลบคำฟุ่มเฟือย และการตรวจจับการสิ้นสุดเทิร์น Smart Turn สิ่งที่เพิ่มเข้ามาเป็นเอกลักษณ์ของ GPT Transcribe คือการปรับสภาพบริบทในระดับพรอมต์ และในฝั่ง Realtime คือการส่งต่อเทิร์นก่อนหน้าอัตโนมัติ OpenAI ยังไม่ได้เผยแพร่จำนวนภาษาที่รองรับสำหรับทั้งสองโมเดล Grok Voice Transcribe 2.0 มีเอกสารระบุภาษาหลายสิบภาษาพร้อมการสลับระหว่างการบันทึกและการจัดรูปแบบรูปเขียนใน 25 ภาษา

Screenshot of the OpenAI developers.openai.com GPT Transcribe model page describing the batch and streaming transcription endpoints, the $0.0045 per minute batch and $0.017 per minute streaming rates, the prompt and keyword context conditioning, and the Context Aware ASR accuracy figures.

จะตัดสินใจอย่างไร และจะทดสอบมันอย่างไร

หากคุณกำลังสร้าง voice agent ที่ต้องตอบก่อนที่ผู้โทรจะพูดจบ คอลัมน์ partial-transcript นั้นคือตัวแปรการตัดสินใจของคุณ และมันแยกสองโมเดลออกจากกันได้อย่างชัดเจน: Grok Voice Transcribe 2.0 แม่นยำกว่า 2.9 จุดบน partial แต่ใช้เวลานานกว่า 0.23 วินาทีในการสร้างมันขึ้นมา เลือก SpaceXAI หาก partial ที่ผิดแย่กว่า partial ที่มาช้า — การจัดเส้นทาง การยกระดับเรื่อง และการตอบสนองที่ถูกกระตุ้นด้วยข้อกำหนดด้าน compliance เลือก OpenAI หาก partial ที่มาช้าแย่กว่า partial ที่ผิด และหากคุณมีคำศัพท์เฉพาะทางในโดเมนที่จะป้อนให้กลไก context เพื่อให้ช่องว่างความแม่นยำแคบลง จากนั้นวัดทั้งสองอย่าง เพราะพฤติกรรม partial-transcript ของผู้ขายทั้งสองรายบนเสียงพูดภาษาอังกฤษของ agent แปดชั่วโมงไม่ได้ทำนายว่าทั้งสองจะทำอย่างไรกับสำเนียงของคุณ codec ของคุณ และศัพท์เฉพาะทางของคุณ

หากคุณกำลังถอดเสียงไฟล์ การตัดสินใจจะง่ายขึ้นมาก: $1.67 เทียบกับ $4.50 ต่อ 1,000 นาที และ 2.3% เทียบกับ 3.31% WER โดยทั้งคู่ชี้ไปในทางเดียวกัน เหตุผลเดียวที่จะคงใช้ GPT Transcribe สำหรับงานแบบแบตช์ก็คือ หากกลไกการปรับตามบริบทกำลังทำอะไรบางอย่างกับเสียงของคุณที่ช่องว่างความแม่นยำแบบดิบไม่สามารถชดเชยได้ — ซึ่งเป็นไปได้จริงกับบันทึกเสียงที่มีความเฉพาะทางสูง และเป็นสิ่งที่ทดสอบได้

โมเดลถอดเสียงทั้งสองตัวยังไม่อยู่ในแคตตาล็อกของ OrcaRouter ในตอนนี้ ดังนั้นตัวการเรียกใช้งานจึงไปที่ API ของผู้ให้บริการเจ้านั้นเอง สิ่งที่อยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียวคือทุกอย่างที่ข้อความถอดเสียงป้อนเข้าไป ไม่ว่าจะเป็นโมเดลเอเจนต์ ตัวสรุป ตัวจำแนกประเภท และโค้ดที่ตัดสินใจว่าจะทำอย่างไรกับข้อความนั้น นั่นคือจุดที่สัญญาฉบับที่สองมักปรากฏขึ้น — ผู้ให้บริการรายหนึ่งสำหรับเสียง อีกรายหนึ่งสำหรับโมเดลที่ใช้เหตุผลเหนือข้อความนั้น — แต่ก็ไม่จำเป็นต้องเป็นเช่นนั้น คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว มีการสลับไปใช้ตัวสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง และมี routing DSL หากคุณต้องการส่งคำขอผ่านหลายโมเดลแล้วเปรียบเทียบก่อนตัดสินใจ เป็นคำกล่าวอ้างที่เล็กกว่าคำว่า "เราจัดเส้นทางให้การถอดเสียงของคุณ" และมันคือคำกล่าวอ้างที่เป็นจริง

สิ่งที่ต้องจับตาคือ OpenAI จะตอบโจทย์ด้วยความแม่นยำแทนที่จะเป็นบริบทหรือไม่ บริษัทได้เปิดตัวระบบถอดเสียงสองเจเนอเรชันในหนึ่งปี และลดราคาไปแล้วครั้งหนึ่ง กลไกบริบทสร้างความแตกต่างได้จริง แต่บนกระดานที่วัดการถอดเสียงแบบดิบ ปัจจุบันตามหลังทั้ง SpaceXAI และ Microsoft หาก GPT Transcribe 2 มาถึงโดยที่กลไกบริทยังสมบูรณ์และอัตราความผิดพลาดลดลงมาอยู่ในช่วง 2% การเปรียบเทียบนี้จะพลิกในฝั่ง batch ในชั่วข้ามคืน — และราคาแบบสตรีมมิ่งที่เท่ากันอยู่แล้วก็ทำให้มันเป็นศึกที่ควรจับตา

การเปรียบเทียบในบทความนี้2

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube