
Grok Voice Transcribe 2.0 vs GPT Transcribe: ราคาสตรีมมิ่งเท่ากัน แต่ความแม่นยำต่างกัน
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
ความบังเอิญนี้เกือบจะดูเนียนเกินไป บนบอร์ด AA-WER Streaming ของ Artificial Analysis ทั้ง Grok Voice Transcribe 2.0 และ GPT Live Transcribe — ปลายทางการถอดเสียงแบบสตรีมมิ่ง — ต่างระบุราคาเท่ากันที่ $3.33 ต่อ 1,000 นาทีของเสียง Grok Voice Transcribe 2.0 ของ SpaceXAI ซึ่งเปิดตัวเมื่อวันที่ 18 กันยายน 2026 ให้บทถอดเสียงสุดท้ายที่อัตราความผิดพลาดระดับคำ 2.7% ภายใน 0.49 วินาทีหลังสิ้นสุดการพูด และผลลัพธ์บางส่วนครั้งแรกที่ 3.4% ส่วน GPT Live Transcribe ซึ่งเปิดตัวพร้อมกับ GPT Transcribe เมื่อวันที่ 28 กรกฎาคม 2026 ให้บทถอดเสียงสุดท้ายที่ 3.9% และผลลัพธ์บางส่วนครั้งแรกที่ 6.3% ราคาเดียวกัน และความแม่นยำของบทถอดเสียงสุดท้ายประมาณ 1.2 จุด บวกกับความแม่นยำของบทถอดเสียงบางส่วนอีก 2.9 จุด เป็นผลดีต่อ SpaceXAI ด้านแบตช์ของการเปรียบเทียบเดียวกันไม่ใช่ความบังเอิญเลย: GPT Transcribe มีค่าใช้จ่าย $4.50 ต่อ 1,000 นาที เทียบกับ $1.67 ของ Grok Voice Transcribe 2.0 ซึ่งเป็นช่องว่าง 63% บนเส้นทางไฟล์บันทึกเสียง
สองเดิมพันที่แตกต่างกันเกี่ยวกับวิธีที่การถอดเสียงจะดีขึ้น
คำตอบของ OpenAI ต่อความแม่นยำคือบริบท ทั้ง GPT Transcribe และ GPT Live Transcribe ต่างรับพรอมป์ต์แบบอิสระ รายการคีย์เวิร์ด และรายการภาษาที่คาดไว้ และในเซสชัน Realtime เทิร์นที่ถอดความก่อนหน้านี้จะถูกป้อนกลับเข้าไปเป็นบริบทสำหรับเทิร์นถัดไป บนเกณฑ์มาตรฐาน Context Aware ASR ของ OpenAI เอง การปรับเงื่อนไขนั้นช่วยยกระดับความแม่นยำเชิงความหมายของ GPT Live Transcribe จาก 38.5% เป็น 44.6% — เป็นตัวเลขที่ผู้ขายรายงาน และเป็นตัวเลขที่วัดว่าความหมายยังคงอยู่หรือไม่ มากกว่าจะวัดว่าถ้อยคำถูกต้องหรือไม่ ข้อแลกเปลี่ยนที่ OpenAI เสนอเป็นสิ่งที่ชัดเจน: ให้ข้อมูลแก่โมเดลเกี่ยวกับสิ่งที่มันกำลังจะได้ยิน แล้วมันจะถอดความโดเมนของคุณได้ดีกว่าโมเดลทั่วไปที่มีความแม่นยำดิบในระดับเดียวกัน
คำตอบของ SpaceXAI ก็คือตัวโมเดลนั่นเอง Grok Voice Transcribe 2.0 มีกลไกไบแอสจริง — คำสำคัญได้ถึง 100 คำต่อคำขอ โดยแต่ละคำยาวได้ถึง 50 ตัวอักษร — แต่มันเป็นรายการคำศัพท์ ไม่ใช่พรอมป์ต์ คุณบอกมันได้ว่า "OrcaRouter" และ "Kubernetes" เป็นคำจริง; คุณไม่สามารถยื่นย่อหน้าให้มันเพื่ออธิบายว่านี่คือสายซัพพอร์ตเกี่ยวกับการคืนเงินได้ การปรับปรุงความแม่นยำใน 2.0 กลับมาจากการฝึกใหม่แทน: บนชุดประเมินที่ได้จากระบบจริงของ SpaceXAI เอง อัตราความผิดพลาดระดับคำลดลงจาก 8.7% เหลือ 3.3% สำหรับเสียงสนทนา, 10.6% เหลือ 7.1% สำหรับโทรศัพท์ 8 kHz, 7.2% เหลือ 3.2% สำหรับข้อมูลรับรองที่พูดออกเสียง, และ 20.6% เหลือ 6.8% สำหรับคำสั่งสั้น ๆ ใน 19 ภาษา นั่นคือตัวเลขของบริษัทบนเสียงของบริษัทเอง โดยไม่มีใครภายนอกทำซ้ำได้ และตัวเลขเหล่านี้อธิบายโมเดลที่เก่งขึ้นในปัญหาด้านเสียง มากกว่าโมเดลที่เก่งขึ้นเมื่อถูกบอกว่าควรคาดหวังอะไร
ความแตกต่างในทางปฏิบัติจะปรากฏให้เห็นในชั่วโมงที่สองของการทำงาน โมเดลที่ปรับตามบริบทสามารถทำได้ดีกว่าที่ผลการวัดประสิทธิภาพดิบของมันบ่งชี้อย่างมาก เพราะคุณเป็นผู้ป้อนคำศัพท์และโดเมนให้ มันยังอาจสร้างคำสำคัญที่คุณป้อนขึ้นมาเองแบบหลอนได้ด้วย: ลองใส่ "OrcaRouter" ลงในพรอมป์ต์ โมเดลที่ไม่ได้ยินคำนั้นอย่างชัดเจนก็อาจสร้างคำนั้นออกมาอยู่ดี โมเดลที่ให้น้ำหนักกับคำสำคัญจะเสื่อมประสิทธิภาพลงอย่างนุ่มนวลกว่า เพราะการให้น้ำหนักจะเลื่อนความน่าจะเป็นของคำหนึ่งๆ แทนที่จะยืนยันว่าคำนั้นปรากฏอยู่ ไม่มีโหมดความล้มเหลวแบบใดปรากฏบนลีดเดอร์บอร์ด และทั้งสองแบบจะปรากฏในบันทึกของคุณ
ตัวเลขที่วางเรียงเคียงข้างกัน
• ความแม่นยำของข้อความถอดเสียงฉบับสุดท้าย (สตรีมมิ่ง) — Grok Voice Transcribe 2.0 อยู่ที่ WER 2.7% เทียบกับ GPT Live Transcribe ที่ 3.9% บน AA-WER Streaming ทั้งคู่ตามข้อมูลจาก Artificial Analysis
• ความแม่นยำบางส่วนครั้งแรก (สตรีมมิ่ง) — 3.4% เทียบกับ 6.3% ซึ่งเป็นช่องว่างที่กว้างที่สุดในการเปรียบเทียบ และเป็นปัจจัยที่กำหนดพฤติกรรมของ voice-agent
• ระยะเวลาถึงข้อความถอดเสียงฉบับสุดท้าย — 0.49 วินาที เทียบกับ 0.81 วินาทีหลังจากสิ้นสุดการพูด ดังนั้นโมเดลที่แม่นยำกว่าจึงเป็นตัวที่ยืนยันผลลัพธ์สุดท้ายได้เร็วกว่าด้วย
• เวลาถึงผลลัพธ์บางส่วนครั้งแรก — 0.49 วินาที เทียบกับ 0.26 วินาที เป็นคอลัมน์ความหน่วงหนึ่งเดียวที่ OpenAI ชนะขาด
• ราคาสตรีมมิ่ง — 3.33 ดอลลาร์ต่อ 1,000 นาทีสำหรับทั้งคู่ ซึ่งปรับให้เป็นมาตรฐานโดย Artificial Analysis จากราคา 0.20 ดอลลาร์ต่อชั่วโมงของ Grok และ 0.017 ดอลลาร์ต่อนาทีของ OpenAI
• ความแม่นยำแบบประมวลผลเป็นชุด (ไม่ใช่สตรีมมิ่ง) — Grok Voice Transcribe 2.0 อยู่ที่ 2.3% AA-WER เทียบกับ GPT Transcribe ที่ 3.31%
• ราคาแบบชุด — $1.67 ต่อ 1,000 นาที เทียบกับ $4.50 ต่อ 1,000 นาที จาก $0.10/ชั่วโมง เทียบกับ $0.0045/นาที
• อัตราการประมวลผลแบบกลุ่ม — ประมาณ 162 เท่าของเวลาจริง เทียบกับประมาณ 41 เท่าบนบอร์ดเดียวกัน
อ่านรายการนั้นเป็นสองคอลัมน์แทนที่จะเป็นคำตัดสินเดียว OpenAI ชนะด้านเวลาแฝงของ first-partial อย่างชัดเจน และมีกลไก context ที่ Grok ไม่มี SpaceXAI ชนะด้านความแม่นยำสุดท้ายในทั้งสองโหมด ความแม่นยำแบบ partial ในการสตรีม ทรูพุต และราคาแบบแบตช์อย่างมาก ไม่มีคอลัมน์ใดที่ GPT Live Transcribe เร็วกว่าและแม่นยำกว่า Grok Voice Transcribe 2.0 พร้อมกัน; มีอยู่หนึ่งคอลัมน์ที่มันเร็วกว่า และนั่นคือคอลัมน์แรกสุด

คุณกำลังอยู่บนเส้นทาง batch ไหนจริง ๆ
ช่องว่างระหว่าง $1.67 กับ $4.50 เป็นตัวเลขที่กำกวมน้อยที่สุดในที่นี้ และควรอธิบายให้ชัดเจนว่าทำไมมันจึงมีอยู่ OpenAI ปรับราคาสายผลิตภัณฑ์นี้ลง 25% เมื่อเปิดตัว GPT Transcribe จากยุค GPT-4o Transcribe และผลลัพธ์คือ $0.0045 ต่อนาที SpaceXAI คงอัตราแบบแบตช์ไว้ที่ $0.10 ต่อชั่วโมงเมื่อย้ายจากเวอร์ชัน 1.0 ไปเป็น 2.0 — บริษัทปรับปรุงโมเดลและคิดราคาเท่าเดิม ซึ่งเป็นสิ่งที่ทำได้ยากกว่าและเป็นสัญญาณที่ดีกว่าว่าตลาดกำลังมุ่งไปทางใด MAI-Transcribe-2 ของ Microsoft เปิดตัวที่ $0.10 ต่อชั่วโมงเท่ากันในฐานะข้อเสนอจำกัดเวลา ดังนั้นจุดที่ $1.67 ต่อ 1,000 นาทีจึงกลายเป็นราคาพื้นของแล็บแนวหน้าสำหรับการถอดเสียงแบบแบตช์ แทนที่จะเป็นตัวเลขโปรโมชันของเจ้าของรายใดรายหนึ่ง
ที่ปริมาณเสียงหนึ่งหมื่นชั่วโมงต่อเดือน ช่องว่างนั้นอยู่ที่ประมาณ $2,830 เทียบกับ $450 สำหรับคลังพอดแคสต์ งานค้างบันทึกเสียงการโทร หรือไลบรารีสื่อที่กำลังถูกถอดเสียงย้อนหลัง ความต่างด้านราคามากกว่าความต่างด้านความแม่นยำระหว่าง WER 2.3% กับ 3.31% จนเทียบกันไม่ได้ สำหรับเอเจนต์สตรีมมิ่ง ซึ่งผลิตภัณฑ์ทั้งสองมีค่าใช้จ่ายเท่ากัน ความแม่นยำและความหน่วงคือสิ่งเดียวที่เหลือให้ถกกัน
มีความแตกต่างเชิงโครงสร้างเบื้องหลังอัตราเหล่านั้นที่ควรค่าแก่การกล่าวถึง: Grok Voice Transcribe 2.0 คิดอัตราแบบเหมาจ่ายต่อชั่วโมงเสียง และ GPT Live Transcribe คิดค่าบริการเป็นรายนาที แต่ Gemini 3.5 Transcribe Live คิดค่าบริการเป็นรายโทเค็นทั้งสำหรับอินพุตเสียงและเอาต์พุตข้อความ มีเพียงหนึ่งในสามรายการนี้ที่ทำให้บิลของคุณเป็นฟังก์ชันของสิ่งที่โมเดลเลือกจะพูด หากปริมาณการใช้งานของคุณมากพอที่การคาดการณ์จะมีความสำคัญ อัตราแบบเหมาจ่ายจะชี้แจงได้ง่ายกว่าต่อผู้ที่ลงนามในใบแจ้งหนี้ — และเนื่องจาก OrcaRouter ส่งผ่านราคาตามรายการของผู้ให้บริการโดยไม่คิดกำไรเพิ่ม 0% การลดราคาจากฝั่งผู้ขายเช่น 25% ของ OpenAI จะมีผลในฝั่งเราทันทีในวันที่ประกาศ ไม่ใช่ในการต่ออายุครั้งถัดไป

สิ่งที่ทั้งสองโมเดลไม่ได้เป็น
GPT Transcribe และ GPT Live Transcribe เป็นผลิตภัณฑ์สองตัว ไม่ใช่ผลิตภัณฑ์เดียวที่มีสวิตช์สลับ โมเดลแบบแบตช์จัดการไฟล์ที่เสร็จสมบูรณ์ ทรานสคริปต์ไฟล์ที่สตรีม และเทิร์นที่คอมมิตแล้วในเซสชัน Realtime และประมวลผลเสียงได้เร็วกว่าเวลาจริงประมาณ 34 เท่าตามตัวเลขของ OpenAI เอง — Artificial Analysis วัดได้ 41× บนชุดทดสอบของตน โมเดลแบบสตรีมมิ่งเป็นตัวที่แพงกว่าที่ $0.017 ต่อนาที และเป็นตัวที่มีอัตราความผิดพลาดบนผลลัพธ์บางส่วนสูงกว่า 10 เท่า การเลือก OpenAI หมายถึงการเลือกว่าปัญหาสองข้อนั้นคุณมีข้อไหน เพราะเอนด์พอยต์ที่ถูกกว่าไม่สามารถทำงานของอีกตัวได้
Grok Voice Transcribe 2.0 เป็นโมเดลเดียวที่มีช่องทางรับส่งสองแบบ: น้ำหนักชุดเดียวกันให้บริการ /v1/stt ผ่าน REST สำหรับไฟล์ขนาดสูงสุด 500 MB และ wss://api.x.ai/v1/stt ผ่าน WebSocket สำหรับเสียงสด โดยมีผลลัพธ์ชั่วคราวส่งออกประมาณทุก ๆ 500 ms อัตราการสตรีมเป็นสองเท่าของอัตราแบบแบตช์พอดี ไม่ใช่ผลิตภัณฑ์ที่ออกแบบแยกต่างหาก ซึ่งหมายความว่าความแม่นยำที่คุณวัดจากเสียงที่เก็บถาวรคือความแม่นยำที่คุณควรคาดหวังแบบสด ๆ และยังหมายความว่าไม่มีโมเดลที่สองให้ประเมิน — ชุดพรอมต์ชุดเดียว ชุดคำสำคัญชุดเดียว ชุดความคาดหวังชุดเดียว
ความเท่าเทียมของฟีเจอร์นั้นใกล้เคียงกันแต่ไม่เหมือนกันทั้งหมด ทั้งคู่คืนค่าประทับเวลาระดับคำ Grok Voice Transcribe 2.0 แนบคะแนนความเชื่อมั่นให้กับแต่ละคำ ซึ่งช่วยให้คุณตั้งเกณฑ์ช่วงที่มีความเชื่อมั่นต่ำแทนที่จะเชื่อถือทั้งบทถอดเสียงเท่ากันทั้งหมด ทั้งคู่ทำ speaker diarization และของ Grok รวมมาให้โดยไม่มีค่าใช้จ่ายเพิ่มเติม ทั้งคู่จัดการ inverse text normalization สำหรับตัวเลข วันที่ สกุลเงิน และรายละเอียดการติดต่อ Grok Voice Transcribe 2.0 เพิ่มการถอดเสียงแบบหลายช่องสัญญาณสูงสุด 8 ช่องสัญญาณอิสระ การลบคำฟุ่มเฟือย และการตรวจจับการสิ้นสุดเทิร์น Smart Turn สิ่งที่เพิ่มเข้ามาเป็นเอกลักษณ์ของ GPT Transcribe คือการปรับสภาพบริบทในระดับพรอมต์ และในฝั่ง Realtime คือการส่งต่อเทิร์นก่อนหน้าอัตโนมัติ OpenAI ยังไม่ได้เผยแพร่จำนวนภาษาที่รองรับสำหรับทั้งสองโมเดล Grok Voice Transcribe 2.0 มีเอกสารระบุภาษาหลายสิบภาษาพร้อมการสลับระหว่างการบันทึกและการจัดรูปแบบรูปเขียนใน 25 ภาษา

จะตัดสินใจอย่างไร และจะทดสอบมันอย่างไร
หากคุณกำลังสร้าง voice agent ที่ต้องตอบก่อนที่ผู้โทรจะพูดจบ คอลัมน์ partial-transcript นั้นคือตัวแปรการตัดสินใจของคุณ และมันแยกสองโมเดลออกจากกันได้อย่างชัดเจน: Grok Voice Transcribe 2.0 แม่นยำกว่า 2.9 จุดบน partial แต่ใช้เวลานานกว่า 0.23 วินาทีในการสร้างมันขึ้นมา เลือก SpaceXAI หาก partial ที่ผิดแย่กว่า partial ที่มาช้า — การจัดเส้นทาง การยกระดับเรื่อง และการตอบสนองที่ถูกกระตุ้นด้วยข้อกำหนดด้าน compliance เลือก OpenAI หาก partial ที่มาช้าแย่กว่า partial ที่ผิด และหากคุณมีคำศัพท์เฉพาะทางในโดเมนที่จะป้อนให้กลไก context เพื่อให้ช่องว่างความแม่นยำแคบลง จากนั้นวัดทั้งสองอย่าง เพราะพฤติกรรม partial-transcript ของผู้ขายทั้งสองรายบนเสียงพูดภาษาอังกฤษของ agent แปดชั่วโมงไม่ได้ทำนายว่าทั้งสองจะทำอย่างไรกับสำเนียงของคุณ codec ของคุณ และศัพท์เฉพาะทางของคุณ
หากคุณกำลังถอดเสียงไฟล์ การตัดสินใจจะง่ายขึ้นมาก: $1.67 เทียบกับ $4.50 ต่อ 1,000 นาที และ 2.3% เทียบกับ 3.31% WER โดยทั้งคู่ชี้ไปในทางเดียวกัน เหตุผลเดียวที่จะคงใช้ GPT Transcribe สำหรับงานแบบแบตช์ก็คือ หากกลไกการปรับตามบริบทกำลังทำอะไรบางอย่างกับเสียงของคุณที่ช่องว่างความแม่นยำแบบดิบไม่สามารถชดเชยได้ — ซึ่งเป็นไปได้จริงกับบันทึกเสียงที่มีความเฉพาะทางสูง และเป็นสิ่งที่ทดสอบได้
โมเดลถอดเสียงทั้งสองตัวยังไม่อยู่ในแคตตาล็อกของ OrcaRouter ในตอนนี้ ดังนั้นตัวการเรียกใช้งานจึงไปที่ API ของผู้ให้บริการเจ้านั้นเอง สิ่งที่อยู่เบื้องหลังคีย์ OrcaRouter เพียงคีย์เดียวคือทุกอย่างที่ข้อความถอดเสียงป้อนเข้าไป ไม่ว่าจะเป็นโมเดลเอเจนต์ ตัวสรุป ตัวจำแนกประเภท และโค้ดที่ตัดสินใจว่าจะทำอย่างไรกับข้อความนั้น นั่นคือจุดที่สัญญาฉบับที่สองมักปรากฏขึ้น — ผู้ให้บริการรายหนึ่งสำหรับเสียง อีกรายหนึ่งสำหรับโมเดลที่ใช้เหตุผลเหนือข้อความนั้น — แต่ก็ไม่จำเป็นต้องเป็นเช่นนั้น คีย์เดียวใช้ได้กับโมเดลกว่า 200 ตัว มีการสลับไปใช้ตัวสำรองอัตโนมัติหากผู้ให้บริการมีประสิทธิภาพลดลง และมี routing DSL หากคุณต้องการส่งคำขอผ่านหลายโมเดลแล้วเปรียบเทียบก่อนตัดสินใจ เป็นคำกล่าวอ้างที่เล็กกว่าคำว่า "เราจัดเส้นทางให้การถอดเสียงของคุณ" และมันคือคำกล่าวอ้างที่เป็นจริง
สิ่งที่ต้องจับตาคือ OpenAI จะตอบโจทย์ด้วยความแม่นยำแทนที่จะเป็นบริบทหรือไม่ บริษัทได้เปิดตัวระบบถอดเสียงสองเจเนอเรชันในหนึ่งปี และลดราคาไปแล้วครั้งหนึ่ง กลไกบริบทสร้างความแตกต่างได้จริง แต่บนกระดานที่วัดการถอดเสียงแบบดิบ ปัจจุบันตามหลังทั้ง SpaceXAI และ Microsoft หาก GPT Transcribe 2 มาถึงโดยที่กลไกบริทยังสมบูรณ์และอัตราความผิดพลาดลดลงมาอยู่ในช่วง 2% การเปรียบเทียบนี้จะพลิกในฝั่ง batch ในชั่วข้ามคืน — และราคาแบบสตรีมมิ่งที่เท่ากันอยู่แล้วก็ทำให้มันเป็นศึกที่ควรจับตา
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
