
Gemini 3.5 Transcribe เทียบกับ Whisper Large v3 Turbo: จำเป็นต้องเปลี่ยน baseline หรือไม่?
- Alibabaใหม่Qwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.3 Flash2026-08-2658ความฉลาด72การเขียนโค้ด
- DeepSeekใหม่DeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 ต่อ 1 ล้านโทเค็น
- z-aiใหม่Z.ai: GLM 5.32026-08-1860ความฉลาด75การเขียนโค้ด
- obsidianใหม่Qwen3.8 27B2026-08-1552ความฉลาด68การเขียนโค้ด
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1261ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0557ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0358ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2152ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1653ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1560ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0952ความฉลาด71การเขียนโค้ด
Whisper Large v3 Turbo คือโมเดลที่วลี "speech-to-text" หมายถึงโดยค่าเริ่มต้นสำหรับอุตสาหกรรมส่วนใหญ่ และ Gemini 3.5 Transcribe เป็นโมเดลถอดเสียงรุ่นแรกของ Google ที่ถูกวางจำหน่ายอย่างชัดเจนในฐานะผู้ท้าชิงเส้นฐานดังกล่าว แทนที่จะเป็น API คำพูดทั่วไป Gemini 3.5 Transcribe ซึ่งเปิดให้ทดลองใช้สาธารณะตั้งแต่วันที่ 26 สิงหาคม 2026 ได้ปรับกรอบการถอดเสียงให้เป็นงานเชิงเหตุผล — โดยจัดการกับการแก้ไขตัวเอง จัดรูปแบบผลลัพธ์ ระบุผู้พูด และเรียกใช้โมเดล Gemini อื่น ๆ ด้วยตัวเอง Whisper Large v3 Turbo คือรุ่นกลั่นความรู้จาก Whisper Large-v3 ของ OpenAI ซึ่งมีพารามิเตอร์ 809 ล้านตัว อยู่ภายใต้สัญญาอนุญาต MIT รองรับการติดตั้งเอง รองรับ 99 ภาษา และเร็วกว่าโมเดลต้นทางประมาณสี่ถึงแปดเท่า ขึ้นอยู่กับฮาร์ดแวร์ หนึ่งคือชั้นอัจฉริยะที่ได้รับการจัดการเหนือเสียง อีกหนึ่งคือคอมโพเนนต์ฟรีที่เข้าใจกันดีซึ่งคุณสามารถเรียกใช้ได้ทุกที่ที่ต้องการ คำถามที่หน้านี้มีไว้ตอบนั้นแคบกว่าและมีประโยชน์มากกว่า "อันไหนดีกว่า": เมื่อใดที่เส้นฐานจะหยุดดีพอ?
เส้นฐาน เผื่อคุณลืมไปว่ามันดีแค่ไหน
Whisper Large v3 Turbo สมควรได้รับสถานะค่าเริ่มต้น ดังนั้นเหตุผลประกอบจึงมาก่อน:
• ทำงานได้ทุกที่ — สัญญาอนุญาต MIT, open weights, ติดตั้งได้บนแล็ปท็อป, GPU ตัวเดียว หรือฟังก์ชันแบบ serverless ไม่ผูกติดกับผู้จำหน่าย ไม่มีการคิดค่าตามปริมาณการใช้งาน ไม่มีข้อมูลออกจากเครือข่ายของคุณ
• มันเร็ว — ตัวถอดรหัสแบบกลั่น (32 เลเยอร์ตัวเข้ารหัส, 4 เลเยอร์ตัวถอดรหัส, ลดลงจาก 32) ทำให้เร็วขึ้นประมาณสี่เท่าเมื่อเทียบกับ Whisper Large-v3 บนฮาร์ดแวร์ทั่วไป บางระบบก็มากกว่านั้น ในขณะที่ยังคงความแม่นยำส่วนใหญ่ไว้ ตัวเลขของ OpenAI เองคือประมาณแปดเท่าบน A100
• ครอบคลุม 99 ภาษาสำหรับการถอดเสียง ซึ่งเป็นรายการที่กว้างกว่า 85+ ของ Gemini 3.5 Transcribe
• ความแม่นยำของมันได้รับการบันทึกไว้อย่างดี: 2.1% WER บน LibriSpeech test-clean, 4.2% บน test-other, 9.1% บน Common Voice English — ตัวเลขที่ได้รับการยืนยันซ้ำทั่วทั้งคอมมูนิตี้เป็นเวลาหลายปี
ระบบนิเวศมีขนาดมหาศาล — faster-whisper, whisper.cpp, ONNX exports และทุกเฟรมเวิร์กสำหรับ inference ที่คุณใช้อยู่แล้ว ถ้าคุณรันโมเดลตัวไหนได้ คุณก็รันตัวนี้ได้เช่นกัน

สำหรับการถอดเสียงแบบกลุ่มปริมาณมากสำหรับภาษาอังกฤษและภาษาที่ใกล้เคียงภาษาอังกฤษ Whisper Large v3 Turbo ยังคงเป็นตัวเลือกหลักด้วยเหตุผลเชิงโครงสร้างที่ไม่มีช่องว่างด้าน benchmark ใดจะพลิกสถานะได้โดยง่าย นั่นคือ มันฟรี เป็นของคุณ และมีอยู่ทุกที่

สิ่งที่ Gemini 3.5 Transcribe เพิ่มเข้ามา
คุณค่าของ managed challenger ไม่ได้อยู่ที่การเอาชนะ baseline ในภาษาอังกฤษที่สะอาด — นั่นคือการต่อสู้ที่ตัวเลขยังไม่สามารถตัดสินได้อย่างชัดเจนด้วยซ้ำ คุณค่าของมันอยู่ที่งานที่เกิดขึ้นเหนือคำพูด ซึ่ง Whisper ไม่ได้ทำโดยชัดแจ้ง
• การระบุผู้พูด — รองรับผู้พูดสูงสุดสามคนพร้อมการประทับเวลาในระดับคำ ในโมเดลพื้นฐาน Whisper ถอดเสียงจากสตรีมเสียงเพียงสตรีมเดียว ไม่มีแนวคิดว่าใครพูดอะไร
• การจัดรูปแบบอัจฉริยะ — ขจัดคำพูดติดขัด แก้ไขการพูดแก้ตัว ใส่เครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่/เล็ก Whisper จะคืนคำตามที่พูด รวมถึงคำว่า “อืม” ด้วย
• คำศัพท์เฉพาะ — เน้นไปทางศัพท์เฉพาะทางและการสะกดที่ผิดปกติ Whisper ไม่มีกลไกดังกล่าว คุณต้องประมวลผลภายหลังหรือปรับแต่งเพิ่มเติม
• การเรียกใช้ฟังก์ชัน — ทรานสคริปต์สามารถส่งต่อให้โมเดล Gemini อื่นๆ ได้ ทำให้การถอดความเป็นขั้นตอนหนึ่งในไปป์ไลน์ของเอเจนต์ แทนที่จะเป็นเอาต์พุตปลายทาง
• เซสชันที่ยาว — ประมาณหนึ่งชั่วโมงของเสียงในครั้งเดียว (บริบท 96K ตามรายงานของสื่อ) เทียบกับความจำเป็นในทางปฏิบัติของ Whisper ที่ต้องแบ่งส่วนและต่อไฟล์ยาว
นั่นเป็นผลิตภัณฑ์ที่แตกต่างออกไป มันคือสิ่งที่ Google หมายถึงโดย "การถอดเสียงอัจฉริยะ" และมันเป็นส่วนของการเปรียบเทียบที่ไม่ขึ้นอยู่กับการคำนวณเกณฑ์มาตรฐาน
คำถามเรื่องความแม่นยำที่ยังไม่มีใครสามารถตอบได้อย่างชัดเจน
ตัวเลขหลักของทั้งสองโมเดลไม่ได้เผชิญหน้ากันจริง ๆ ค่า WER แบบไม่สตรีมมิ่ง 2.6% ของ Gemini 3.5 Transcribe เป็นค่าที่วัดโดย Artificial Analysis และถูกอ้างอิงโดย Google ซึ่งคำนวณจากภาษามากกว่า 85 ภาษา ส่วนค่า 2.1% ของ Whisper Large v3 Turbo ในการทดสอบ LibriSpeech test-clean เป็น benchmark ภาษาอังกฤษจากกระดาษ distillation ของ OpenAI เอง ซึ่งถูกทำซ้ำและใช้อย่างแพร่หลาย ชุดข้อมูลต่างกัน ภาษาที่ครอบคลุมต่างกัน ผู้ผลิตต่างกัน สิ่งที่พูดได้อย่างตรงไปตรงมาคือ: ในภาษาอังกฤษที่สะอาด โมเดลพื้นฐานแบบเปิดและผู้ท้าชิงแบบบริหารจัดการน่าจะอยู่ในระดับใกล้เคียงกัน และจุดเด่นของโมเดลแบบบริหารจัดการคือคุณสมบัติหลายภาษาและเชิงโครงสร้าง มากกว่าชัยชนะด้าน WER ภาษาอังกฤษที่พิสูจน์ได้ เอกสารเปิดตัวของ Google ไม่มีการเปรียบเทียบแบบตัวต่อตัวกับโมเดลตระกูล Whisper และการเปรียบเทียบเชิง adversarial อย่างอิสระก็ยังไม่มี เพราะ Gemini 3.5 Transcribe เพิ่งเปิดตัวต่อสาธารณะได้เพียงวันเดียว จนกว่าจะมีสิ่งนั้นปรากฏ มงกุฎแห่งความแม่นยำก็ยังไม่มีผู้ครอง และบทความใด ๆ — รวมถึงบทความนี้ — ที่ประกาศผู้ชนะ WER จากตัวเลขสองจำนวนนี้ถือว่าพูดเกินจริง

ค่าใช้จ่าย: ฟรี เมื่อเทียบกับ $0.005 ต่อนาที
Whisper Large v3 Turbo มีต้นทุนด้านฮาร์ดแวร์และไม่มีมิเตอร์ หากรันบน GPU ที่คุณมีอยู่แล้ว ต้นทุนส่วนเพิ่มต่อนาทีที่ถอดเสียงจะใกล้ศูนย์ แต่ถ้าเช่า GPU ก็จะคิดตามต้นทุนของอินสแตนซ์ระหว่างที่ทำงาน Gemini 3.5 Transcribe คิดเงินประมาณ $0.005 ต่อนาทีของเสียงแบบผสม โดย SKU แบบสดอยู่ที่ประมาณ $0.009 ต่อนาที และมีระดับฟรี ที่เสียงหนึ่งพันชั่วโมง นั่นคือประมาณ $300 เมื่อเทียบกับมิเตอร์ของ Gemini กับเวลา GPU ไม่กี่ดอลลาร์บนเบสไลน์แบบเปิด ช่องว่างนั้นคือเรื่องจริงของต้นทุนในการเปรียบเทียบครั้งนี้ และเป็นเหตุผลที่เบสไลน์จะยังคงสถานะเริ่มต้นสำหรับงานประมวลผลภาษาอังกฤษปริมาณมากไปอีกนาน เศรษฐศาสตร์ของโมเดลที่มีการจัดการจะปิดลงก็ต่อเมื่อคุณสมบัติที่รวมมา — diarization, การจัดรูปแบบ, การควบคุมคำศัพท์ — จะทำให้คุณเสียเวลาทางวิศวกรรมในการประกอบเข้าด้วยกันบน Whisper
ภาษาและการสตรีมมิ่ง
Whisper Large v3 Turbo ระบุรายชื่อ 99 ภาษา เทียบกับ Gemini ที่มี 85+ แต่เรื่องจริงของการใช้งานหลายภาษานั้นต่างกัน: Whisper ถอดความทั้ง 99 ภาษาในรอบเดียวโดยไม่มีการตรวจจับอัตโนมัติ และความแม่นยำจะลดลงมากที่สุดในภาษาที่มีทรัพยากรน้อยและภาษาที่มีเสียงรบกวน — นี่คือข้อแลกเปลี่ยนของโมเดลแบบกลั่น (distilled model) Gemini ตรวจจับอัตโนมัติใน 85+ ภาษาของตน และ Google เน้นสำเนียงและภาษาถิ่นในภูมิภาค สำหรับการสตรีมมิง Whisper ไม่มีโมเดลเรียลไทม์ในตัว การใช้งานแบบเรียลไทม์จะใช้ faster-whisper และเฟรมเวิร์กที่คล้ายกันบนฮาร์ดแวร์ของคุณเอง ขณะที่ Gemini 3.5 Transcribe มีเอนด์พอยต์สดที่สร้างมาโดยเฉพาะ โดยอ้างความหน่วงต่ำกว่า 1 วินาทีและราคาที่สูงตาม หากปริมาณงานของคุณเป็นแบบสดและหลายภาษา เอนด์พอยต์แบบจัดการ (managed endpoint) จะใช้งานง่ายกว่า แต่ถ้าเป็นแบบแบตช์และเป็นภาษาอังกฤษ โมเดลเปิดพื้นฐานจะถูกกว่า
คำตัดสิน เท่าที่มันเป็น
Whisper Large v3 Turbo ยังคงเป็นตัวเลือกเริ่มต้นที่เหมาะสมสำหรับการถอดเสียงภาษาอังกฤษแบบกลุ่มในระดับใหญ่ สำหรับทุกสิ่งที่ต้องทำงานบนโครงสร้างพื้นฐานของคุณเอง และสำหรับทีมที่ต้องการผลลัพธ์ที่คงที่และตรวจสอบได้ Gemini 3.5 Transcribe เป็นทางเลือกที่ถูกต้องเมื่อบทถอดเสียงต้องมีมากกว่าแค่คำพูด ไม่ว่าจะเป็นป้ายระบุผู้พูด การจัดรูปแบบที่สะอาด คำศัพท์เฉพาะโดเมน การรองรับหลายภาษา หรือจุดเชื่อมต่อเอเจนต์ และเมื่อคุณยอมจ่ายตามการใช้งานสำหรับฟีเจอร์เหล่านั้น ทั้งสองทำงานร่วมกันได้ และรูปแบบที่ทำให้การอยู่ร่วมกันนี้มีต้นทุนต่ำคือขอบเขตการจัดเส้นทาง (routing boundary) นั่นคือ ตัวถอดเสียงที่เหมาะกับไฟล์เสียง จากนั้นชั้น LLM ที่ตัดสินใจว่าจะจัดการกับข้อความอย่างไร ชั้นนั้นคือสิ่งที่ OrcaRouter ดำเนินการ — API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รุ่น การสลับไปใช้บริการสำรองอัตโนมัติข้ามผู้ให้บริการ และ DSL สำหรับจัดเส้นทางเพื่อประกอบโมเดลหลายตัวในการเรียกใช้ครั้งเดียว โมเดลเสียงพูดทั้งสองตัวไม่ได้โฮสต์อยู่ฝั่งเรา ทางเลือกในการถอดเสียงจึงอยู่ระหว่าง GPU ของคุณกับมิเตอร์ของ Google และทั้งคู่จะยังอยู่ต่อไปอีกนาน
