
Grok Voice Transcribe 2.0 กับ Gemini 3.5 Transcribe: เลนสตรีมมิ่งเป็นของหนึ่งในนั้น
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Grok Voice Transcribe 2.0 และ Gemini 3.5 Transcribe เป็นโมเดลแปลงเสียงพูดเป็นข้อความระดับแนวหน้าที่ใหม่ที่สุดสองตัวจากห้องแล็บคู่แข่ง และวิธีเปรียบเทียบกันอย่างตรงไปตรงมาคือต้องยอมรับตั้งแต่ต้นว่าทั้งสองตัวไม่ได้ถูกสร้างมาสำหรับงานเดียวกัน Grok Voice Transcribe 2.0 ของ SpaceXAI ที่เปิดตัวเมื่อวันที่ 18 กันยายน 2026 เป็นโมเดลที่ให้ความสำคัญกับการสตรีมเป็นอันดับแรกโดยมีโหมดแบตช์แนบมาด้วย โดยครองอันดับหนึ่งบนกระดาน AA-WER Streaming ด้วยอัตราความผิดพลาดระดับคำ 2.7% สำหรับบทถอดความฉบับสมบูรณ์ และ 3.4% สำหรับ partial แรก โดยทั้งสองมาถึงภายใน 0.49 วินาทีหลังสิ้นสุดการพูด ส่วน Gemini 3.5 Transcribe ที่เปิดตัวเมื่อวันที่ 26 สิงหาคม 2026 เป็นโมเดลที่ให้ความสำคัญกับแบตช์เป็นอันดับแรกโดยมี SKU สำหรับสตรีมมิ่งแนบมาด้วย และครึ่งทั้งสองของมันทำงานแตกต่างกันมาก — เส้นทางไฟล์บันทึกไว้ล่วงหน้าวัดได้ 2.6% AA-WER บนกระดานแบบไม่สตรีมของ Artificial Analysis ขณะที่เอนด์พอยต์ gemini-3.5-transcribe-live แยกต่างหากวัดได้ 4.0% บนกระดานสตรีมมิ่งที่ 0.40 วินาที เมื่อวางตัวเลขสี่ตัวนั้นไว้ข้างกัน รูปร่างของการจับคู่นี้ก็ชัดเจน ทั้งสองใกล้กันในด้านความแม่นยำตรงจุดที่ Gemini 3.5 Transcribe แข็งแกร่ง และทั้งสองไม่ได้ใกล้กันในจุดที่ Grok Voice Transcribe 2.0 เป็นต่อ
เลนเดียวที่พวกเขาทั้งคู่ต่อสู้กัน
ทั้งสองโมเดลสามารถถอดเสียงสดได้ ดังนั้นสตรีมมิ่งจึงเป็นสนามเดียวที่การเปรียบเทียบตรง ๆ มีความหมาย ในด้านนั้น Grok Voice Transcribe 2.0 นำ Gemini 3.5 Transcribe Live อยู่ 1.3 จุดในความแม่นยำของบทถอดเสียงฉบับสุดท้าย — WER 2.7% เทียบกับ 4.0% บนชุดทดสอบเดียวกัน เสียงประมาณแปดชั่วโมงเดียวกัน และการถ่วงน้ำหนัก 50/25/25 แบบเดียวกันใน AA-AgentTalk, VoxPopuli และ Earnings22 นั่นไม่ใช่ความต่างเพียงเล็กน้อยจากการปัดเศษ; ที่อัตราความผิดพลาดระดับนั้น มันเทียบเท่ากับคำผิดเพิ่มประมาณหนึ่งคำในทุก ๆ เจ็ดสิบห้าคำที่โมเดลของ Google ถอดออกมา สำหรับบทถอดเสียงบางส่วนครั้งแรก ช่องว่างยังกว้างกว่าเดิม คือ 3.4% เทียบกับ 5.8% และบทถอดเสียงบางส่วนคือสิ่งที่เอเจนต์เสียงสดต้องนำไปดำเนินการก่อนที่ผู้พูดจะพูดจบ
ความหน่วงให้ผลตรงกันข้าม และนี่คือส่วนของการเปรียบเทียบที่มักถูกละเลย Gemini 3.5 Transcribe Live ส่งคืนข้อความถอดเสียงฉบับสุดท้ายภายใน 0.40 วินาทีหลังสิ้นสุดการพูด เทียบกับ 0.49 ของ Grok และส่งผลลัพธ์บางส่วนครั้งแรกใน 0.25 วินาที เทียบกับ 0.49 ของ Grok — เร็วกว่าเกือบสองเท่าในการได้คำแรกที่ใช้งานได้ ไม่มีโมเดลใดในสองตัวนี้ที่แข่งกับกลุ่มที่เร็วจริง ๆ ของตารางนี้ ซึ่ง Deepgram Flux ทำได้ 0.02 วินาที และ Soniox v5 0.05 วินาที แต่ระหว่างสองตัวนี้ การแลกเปลี่ยนชัดเจน: Google พูดได้เร็วกว่า SpaceXAI มีแนวโน้มจะถูกต้องมากกว่าเมื่อพูดออกมา สำหรับเอเจนต์ที่ต้องผลัดกันพูดซึ่งต้องไม่พูดทับผู้โทร ความหน่วงของผลลัพธ์บางส่วนที่เพิ่มขึ้น 0.24 วินาทีเป็นต้นทุนจริงที่ชัยชนะด้านความแม่นยำต้องพิสูจน์ให้ได้ว่าคุ้มค่า

จุดที่ Gemini 3.5 Transcribe ชนะจริง ๆ
ความครอบคลุมด้านภาษาเป็นจุดที่ชัดเจนที่สุด และไม่ได้ใกล้เคียงกันเลย โมเดลของ Google รองรับภาษามากกว่า 85 ภาษา ส่วน Grok Voice Transcribe 2.0 รองรับหลายสิบภาษา พร้อมการจัดรูปแบบเป็นรูปเขียน ซึ่งก็คือการปรับข้อความให้เป็นปกติย้อนทาง (inverse text normalization) ที่เปลี่ยนตัวเลข วันที่ สกุลเงิน และที่อยู่อีเมลที่พูดออกมาให้กลายเป็นรูปเขียน โดยมีเอกสารกำกับไว้ 25 ภาษา หากไฟล์เสียงของคุณเป็นภาษาโปรตุเกส ภาษาเวียดนาม หรือเป็นการสลับภาษาผสมกันสองภาษาในประโยคเดียว คำถามที่ว่าโมเดลใดแม่นยำกว่าบนบอร์ดของ Artificial Analysis ก็แทบกลายเป็นเรื่องทางวิชาการไปแล้ว เพราะบอร์ดนั้นให้น้ำหนักกับภาษาอังกฤษและเน้นบทสนทนาแบบเอเจนต์เป็นหลัก Google รายงานค่า WER ที่ 5.50% สำหรับแบบสตรีมมิ่ง และ 5.04% สำหรับแบบไม่สตรีมมิ่งบน FLEURS ในชุดทดสอบหลายภาษาของตนเอง ตัวเลขเหล่านี้เป็นตัวเลขที่ผู้ขายรายงานเองและไม่มีการทำซ้ำโดยอิสระ แต่อย่างน้อยก็อธิบายกรณีหลายภาษาได้บ้าง
ข้อได้เปรียบที่สองคือระดับฟรี Gemini 3.5 Transcribe มีโทเค็นอินพุตและเอาต์พุตฟรีบน API ของ Google โดยมีข้อแม้ว่าเนื้อหาในระดับฟรีจะถูกนำไปใช้ปรับปรุงผลิตภัณฑ์ของ Google ส่วนเนื้อหาระดับเสียเงินจะไม่ถูกนำไปใช้ สำหรับต้นแบบ โปรเจกต์เสริม หรือเครื่องมือภายในที่ประมวลผลเสียงซึ่งคุณคงไม่จ่ายเพื่อถอดเสียงอยู่แล้ว นั่นคือตัวเลือกจริงที่ผู้ให้บริการคิดราคาต่อชั่วโมงรายใดก็เทียบไม่ติด Grok Voice Transcribe 2.0 เป็นบริการแบบเสียเงินตั้งแต่ชั่วโมงเสียงแรก
และประการที่สามคือ Gemini 3.5 Transcribe เป็นโมเดลมัลติโมดัลทั่วไปที่มีโหมดถอดเสียง ไม่ใช่บริการ ASR ที่สร้างขึ้นโดยเฉพาะ มันสามารถรับพรอมต์ได้ สามารถรับข้อความเป็นบริบทได้ และอยู่ในพื้นผิว API เดียวกันกับทุกสิ่งอื่นที่ Google ให้บริการ หากการถอดเสียงเป็นเพียงขั้นตอนหนึ่งในไปป์ไลน์ที่ยังต้องมีการให้เหตุผลเหนือบทถอดเสียง การเก็บทั้งสองอย่างไว้ในการเรียกโมเดลครั้งเดียวก็มีคุณค่าบางอย่างที่อัตราความผิดพลาดต่อคำไม่สามารถสะท้อนได้
การคำนวณราคา ต่อหนึ่งพันนาที
Artificial Analysis ทำให้โมเดลทั้งสองเป็นมาตรฐานเป็นต้นทุนต่อเสียง 1,000 นาที ซึ่งเป็นวิธีเดียวที่จะเปรียบเทียบอัตราคงที่รายชั่วโมงกับการคิดค่าบริการแบบโทเคน:
• แบตช์, บันทึกไว้ล่วงหน้า — Grok Voice Transcribe 2.0 ที่ $1.67 ต่อ 1,000 นาที ($0.10/ชั่วโมง) เทียบกับ Gemini 3.5 Transcribe ที่ $5.00 ต่อ 1,000 นาที ($0.30/ชั่วโมง, เริ่มต้นที่ $2.00 ต่อ 1M โทเค็นอินพุต และ $12.00 ต่อ 1M โทเค็นเอาต์พุต)
• สตรีมมิ่ง — Grok Voice Transcribe 2.0 ราคา $3.33 ต่อ 1,000 นาที ($0.20/ชั่วโมง) เทียบกับ Gemini 3.5 Transcribe Live ราคาประมาณ $5.40 ต่อ 1,000 นาที คำนวณแบบผสมจาก $3.50 ต่อ 1M โทเคนอินพุตเสียง และ $21.00 ต่อ 1M โทเคนเอาต์พุตข้อความ
• ปริมาณงานแบบเป็นชุด — Grok Voice Transcribe 2.0 อยู่ที่ประมาณ 162 เท่าของเวลาจริง เทียบกับ Gemini 3.5 Transcribe ที่ประมาณ 88 เท่า บนบอร์ดเดียวกัน ดังนั้นโมเดลที่ราคาถูกกว่าจึงเป็นตัวที่เร็วกว่าเช่นกันสำหรับงานไฟล์
• ขีดจำกัดเซสชันสด — Grok Voice Transcribe 2.0 สตรีมผ่าน WebSocket โดยไม่มีเพดานเซสชันที่ประกาศไว้ นอกเหนือจาก 100 เซสชันพร้อมกันต่อทีม เทียบกับ Gemini 3.5 Transcribe Live ที่ถูกจำกัดที่ 10 นาทีต่อเซสชัน
บรรทัดสุดท้ายนั้นคือรายละเอียดเชิงปฏิบัติการที่ตัดสินสถาปัตยกรรมได้มากกว่าตัวเลขความแม่นยำเสียอีก เพดาน 10 นาทีต่อเซสชันสดหมายความว่าการโทรยาว การประชุมยาว และสตรีมยาวต้องถูกตัดแบ่งและสร้างใหม่ และทุกครั้งที่สร้างใหม่ก็คือรอยต่อที่บริบทสูญหาย เอนด์พอยต์สตรีมมิ่งของ Grok มีเพดานขนาดไฟล์ 500 MB บนเส้นทางแบบแบตช์ และขีดจำกัดการทำงานพร้อมกัน 100 เซสชันต่อทีมบนเส้นทางสตรีมมิ่ง ซึ่งเป็นข้อจำกัดอีกแบบหนึ่ง — ทรูพุตมากกว่าระยะเวลา
การคิดค่าบริการตามโทเคนเป็นเรื่องที่คุ้มค่าจะทำความเข้าใจก่อนที่คุณจะตัดสินใจใช้บริการฝั่ง Google เพราะมันทำให้บิลของคุณกลายเป็นฟังก์ชันของตัวแปรสองตัวแทนที่จะเป็นตัวแปรเดียว Gemini คิดค่าบริการสำหรับอินพุตเสียงและเอาต์พุตข้อความแยกจากกัน ดังนั้นโมเดลที่สร้างรูปแบบที่เยิ่นเย้อหรือพูดซ้ำตัวเองจะมีค่าใช้จ่ายสูงกว่าโมเดลที่ไม่ทำเช่นนั้น และภาษาที่มีคำยาวกว่าจะมีค่าใช้จ่ายสูงกว่าภาษาที่มีคำสั้นกว่า อัตราเหมาจ่ายต่อชั่วโมงของ Grok ไม่ขยับไปตามสิ่งเหล่านั้นเลย สำหรับปริมาณงานสูง อัตราเหมาจ่ายคาดการณ์ได้ง่ายกว่า และเนื่องจาก OrcaRouter ส่งต่อราคาตามรายการของผู้ให้บริการโดยมีมาร์กอัป 0% การเปลี่ยนแปลงใด ๆ จากฝั่งผู้ขายรายใดรายหนึ่งจะไปถึงบิลของคุณในวันที่เกิดขึ้นจริง แทนที่จะเป็นตอนต่อสัญญาครั้งถัดไป

รูปทรงของฟีเจอร์: สิ่งที่แต่ละอย่างปฏิเสธที่จะทำ
รายการขีดความสามารถนั้นแตกต่างกันมากกว่าที่ตัวเลขความแม่นยำบ่งชี้ และช่องว่างเหล่านั้นอยู่ในจุดที่มีความสำคัญต่อการใช้งานเฉพาะด้าน:
• การแยกผู้พูด (Speaker diarization) — รวมให้โดยไม่มีค่าใช้จ่ายเพิ่มเติมบน Grok Voice Transcribe 2.0; ไม่รองรับบน Gemini 3.5 Transcribe Live ดังนั้นทรานสคริปต์สดที่ระบุผู้พูดจึงไม่มีให้ใช้งานบนเอนด์พอยต์นั้นเลย
• การประทับเวลาระดับคำ — Grok Voice Transcribe 2.0 ส่งคืนพร้อมคะแนนความเชื่อมั่นรายคำ; Gemini 3.5 Transcribe Live ไม่ส่งคืนค่าใดเลย ซึ่งตัดความเป็นไปได้ในการใช้เกณฑ์ความเชื่อมั่นและการจัดแนวคำบรรยายที่แม่นยำ
• เสียงหลายช่องสัญญาณ — Grok Voice Transcribe 2.0 ถอดเสียงได้ถึง 8 ช่องสัญญาณอิสระในครั้งเดียว; Gemini 3.5 Transcribe Live ไม่มีความสามารถเทียบเท่า ดังนั้นการบันทึกเสียงการโทรแบบหลายช่องสัญญาณจึงต้องใช้เซสชันแยกตามช่องสัญญาณ
• การให้น้ำหนักคำสำคัญ — Grok Voice Transcribe 2.0 รับคำเฉพาะโดเมนได้สูงสุด 100 คำต่อคำขอ; Gemini 3.5 Transcribe รับคำศัพท์ที่กำหนดเองและคำแนะนำภาษาแบบไม่บังคับ
• ระบบพื้นฐานของ voice agent — Grok Voice Transcribe 2.0 มาพร้อมการตัดคำฟุ่มเฟือยและ Smart Turn ที่ตรวจจับการจบเทิร์น ส่วน Gemini 3.5 Transcribe Live รองรับกรณีการสตรีม แต่ปล่อยตรรกะการผลัดเทิร์นให้แอปพลิเคชันจัดการเอง
• การจัดการอินพุต — Grok Voice Transcribe 2.0 รองรับการอัปโหลดไฟล์โดยตรงสูงสุด 500 MB ครอบคลุม 12 รูปแบบเสียง; ส่วนเส้นทางไฟล์ที่บันทึกไว้ล่วงหน้าของ Gemini 3.5 Transcribe ต้องใช้ URL HTTPS แบบสาธารณะ โดยมีขีดจำกัด 15 นาทีและ 300 MB และไม่สามารถใช้โหมด Smart formatting ร่วมกับการประทับเวลาแบบคำหรือป้ายกำกับผู้พูดได้
รูปแบบในรายการนั้นคือ SpaceXAI สร้างผลิตภัณฑ์ถอดเสียง และ Google สร้างความสามารถในการถอดเสียง การแยกผู้พูด (Diarization) การประทับเวลา (timestamps) การแยกช่องสัญญาณ (channel splitting) และการตรวจจับการผลัดเปลี่ยน (turn detection) เป็นคุณสมบัติที่คุณต้องการเมื่อการถอดเสียงเป็นแอปพลิเคชันทั้งหมด; ความสามารถในการป้อนคำสั่ง (promptability) ความกว้างของภาษา (language breadth) และ API เดียวสำหรับทุกอย่าง (one-API-for-everything) คือสิ่งที่คุณต้องการเมื่อการถอดเสียงเป็นเพียงขั้นตอนหนึ่งภายในแอปพลิเคชันที่ใหญ่กว่า ไม่มีรายการใดดีกว่าโดยนามธรรม และทีมที่เลือกบนพื้นฐานของความแม่นยำเพียงอย่างเดียวจะพลาดชุดคุณสมบัติที่ไม่จำเป็นสำหรับพวกเขา

การเลือกระหว่างสองสิ่งนั้น และสิ่งที่ทำให้คำตอบเปลี่ยนไป
เลือกใช้ Grok Voice Transcribe 2.0 เมื่อต้องได้ข้อความถอดเสียงที่ถูกต้องในขณะที่เสียงยังเล่นอยู่: การสลับบทพูดของเจ้าหน้าที่แบบเรียลไทม์, คำบรรยายแบบเรียลไทม์ที่ผิดไม่ได้, สตรีมของศูนย์ติดต่อซึ่งการระบุผู้พูดและการแยกช่องสัญญาณเป็นส่วนหนึ่งของข้อกำหนด หรือไปป์ไลน์แบบแบตช์ใด ๆ ที่ทั้งราคา $1.67 ต่อ 1,000 นาทีและปริมาณงาน 162× ต่างก็สำคัญ เลือกใช้ Gemini 3.5 Transcribe เมื่อเสียงเป็นแบบหลายภาษาในภาษาที่อยู่นอกชุดภาษาที่ Grok ระบุไว้ เมื่อข้อความถอดเสียงป้อนเข้าสู่โมเดลที่ต้องใช้เหตุผลกับมันด้วย เมื่อคุณต้องการแพ็กเกจฟรีสำหรับสร้างต้นแบบ หรือเมื่อเส้นทางแบบแบตช์มี AA-WER 2.6% ซึ่งเพียงพอแล้วสำหรับสิ่งที่คุณทำอยู่ และความครอบคลุมภาษาที่เพิ่มขึ้นนั้นคุ้มค่ามากกว่าส่วนต่างราคา
สิ่งที่ทีมส่วนใหญ่ทำจริง ๆ ในจุดนี้ไม่ใช่การเลือกเพียงอย่างใดอย่างหนึ่ง โมเดลทั้งสองเข้าถึงได้ผ่านคีย์ OrcaRouter API เพียงคีย์เดียว พร้อมกับโมเดลอื่นอีกกว่า 200 โมเดล ซึ่งหมายความว่าคุณสามารถส่งทราฟฟิกของเอเจนต์แบบเรียลไทม์ไปที่ Grok Voice Transcribe 2.0 และส่งคลังข้อมูลหลายภาษาขนาดใหญ่ไปที่ Gemini 3.5 Transcribe ได้ โดยไม่ต้องดูแลสัญญากับผู้ขายสองราย ความสัมพันธ์ด้านการเรียกเก็บเงินสองชุด และชุดข้อมูลรับรองสองชุด นั่นก็เป็นวิธีที่คุณจะตอบคำถามเรื่องความแม่นยำสำหรับไฟล์เสียงของคุณเองด้วย: รันทั้งสองโมเดลกับไฟล์บันทึกเดียวกัน เปรียบเทียบทรานสคริปต์ที่คุณได้มาจริง ๆ แล้วให้ routing DSL ส่งทราฟฟิกไปในที่ที่เหมาะสม ลีดเดอร์บอร์ดบอกคุณได้แค่ว่าโมเดลไหนชนะบนเสียงสนทนาของเอเจนต์ภาษาอังกฤษแปดชั่วโมงของคนอื่น มีเพียงไฟล์เสียงของคุณเองเท่านั้นที่บอกได้ว่าโมเดลไหนชนะบนเสียงของคุณ
คำถามที่ยังไม่มีคำตอบคือจะเกิดอะไรขึ้นกับช่องว่างด้านสตรีมมิ่งนั้นเมื่อ Google ปรับปรุง Live endpoint ครั้งถัดไป Gemini 3.5 Transcribe Live เปิดตัวใน public preview และตัวเลข 4.0% ของมันถูกวัดประมาณหนึ่งวันหลังจากที่สามารถเรียกใช้งานได้ — เป็นสัญญาณเริ่มต้นที่แข็งแกร่ง แต่มีเวลาให้นิ่งน้อยกว่าตัวเลข Grok ที่ตอนนี้มันตามอยู่ หาก Google ปิดช่องว่างสตรีมมิ่ง 1.3 จุด ขณะที่ยังรักษาความหน่วงของ partial ไว้ที่ 0.25 วินาที การแลกเปลี่ยนก็จะไม่ใช่การแลกเปลี่ยนอีกต่อไป และข้อได้เปรียบของ Grok จะแคบลงเหลือแค่ราคาและฟีเจอร์ จนกว่าจะถึงตอนนั้น การแบ่งแยกยังชัดเจน: partial ที่เร็วที่สุดเป็นของ Google, partial ที่แม่นยำที่สุดเป็นของ SpaceXAI, และไม่มีโมเดลใดบนบอร์ดที่เป็นทั้งสองอย่าง
การเปรียบเทียบในบทความนี้2
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
