การ์ดชื่อเรื่องหลักสำหรับ 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo' พร้อมคำบรรยายใต้ชื่อว่า 'baseline จำเป็นต้องเปลี่ยนหรือไม่?' โดยแสดงการ์ด API ที่จัดการแล้วทางซ้ายติดป้ายว่า Gemini 3.5 Transcribe ที่ 2.6% WER แบบไม่สตรีมมิ่ง และการ์ด open-weight ทางขวาติดป้ายว่า Whisper Large v3 Turbo ที่ 2.1% บน LibriSpeech clean พร้อมป้าย MIT และแท็ก 809M และโลโก้ OrcaRouter ที่มุมขวาล่าง
Guides & Insights

Gemini 3.5 Transcribe เทียบกับ Whisper Large v3 Turbo: จำเป็นต้องเปลี่ยน baseline หรือไม่?

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Whisper Large v3 Turbo คือโมเดลที่วลี "speech-to-text" หมายถึงโดยค่าเริ่มต้นสำหรับอุตสาหกรรมส่วนใหญ่ และ Gemini 3.​5 Transcribe เป็นโมเดลถอดเสียงรุ่นแรกของ Go​ogle ที่ถูกวางจำหน่ายอย่างชัดเจนในฐานะผู้ท้าชิงเส้นฐานดังกล่าว แทนที่จะเป็น API คำพูดทั่วไป Gemini 3.​5 Transcribe ซึ่งเปิดให้ทดลองใช้สาธารณะตั้งแต่วันที่ 26 สิงหาคม 2026 ได้ปรับกรอบการถอดเสียงให้เป็นงานเชิงเหตุผล — โดยจัดการกับการแก้ไขตัวเอง จัดรูปแบบผลลัพธ์ ระบุผู้พูด และเรียกใช้โมเดล G​emini อื่น ๆ ด้วยตัวเอง Whisper Large v3 Turbo คือรุ่นกลั่นความรู้จาก Whisper Large-v3 ของ Ope​nAI ซึ่งมีพารามิเตอร์ 809 ล้านตัว อยู่ภายใต้สัญญาอนุญาต MIT รองรับการติดตั้งเอง รองรับ 99 ภาษา และเร็วกว่าโมเดลต้นทางประมาณสี่ถึงแปดเท่า ขึ้นอยู่กับฮาร์ดแวร์ หนึ่งคือชั้นอัจฉริยะที่ได้รับการจัดการเหนือเสียง อีกหนึ่งคือคอมโพเนนต์ฟรีที่เข้าใจกันดีซึ่งคุณสามารถเรียกใช้ได้ทุกที่ที่ต้องการ คำถามที่หน้านี้มีไว้ตอบนั้นแคบกว่าและมีประโยชน์มากกว่า "อันไหนดีกว่า": เมื่อใดที่เส้นฐานจะหยุดดีพอ?

เส้นฐาน เผื่อคุณลืมไปว่ามันดีแค่ไหน

Whisper Large v3 Turbo สมควรได้รับสถานะค่าเริ่มต้น ดังนั้นเหตุผลประกอบจึงมาก่อน:

• ทำงานได้ทุกที่ — สัญญาอนุญาต MIT, open weights, ติดตั้งได้บนแล็ปท็อป, GPU ตัวเดียว หรือฟังก์ชันแบบ serverless ไม่ผูกติดกับผู้จำหน่าย ไม่มีการคิดค่าตามปริมาณการใช้งาน ไม่มีข้อมูลออกจากเครือข่ายของคุณ

• มันเร็ว — ตัวถอดรหัสแบบกลั่น (32 เลเยอร์ตัวเข้ารหัส, 4 เลเยอร์ตัวถอดรหัส, ลดลงจาก 32) ทำให้เร็วขึ้นประมาณสี่เท่าเมื่อเทียบกับ Whisper Large-v3 บนฮาร์ดแวร์ทั่วไป บางระบบก็มากกว่านั้น ในขณะที่ยังคงความแม่นยำส่วนใหญ่ไว้ ตัวเลขของ Ope​nAI เองคือประมาณแปดเท่าบน A100

• ครอบคลุม 99 ภาษาสำหรับการถอดเสียง ซึ่งเป็นรายการที่กว้างกว่า 85+ ของ Gemini 3.5 Transcribe

• ความแม่นยำของมันได้รับการบันทึกไว้อย่างดี: 2.1% WER บน LibriSpeech test-clean, 4.2% บน test-other, 9.1% บน Common Voice English — ตัวเลขที่ได้รับการยืนยันซ้ำทั่วทั้งคอมมูนิตี้เป็นเวลาหลายปี

ระบบนิเวศมีขนาดมหาศาล — faster-whisper, whisper.cpp, ONNX exports และทุกเฟรมเวิร์กสำหรับ inference ที่คุณใช้อยู่แล้ว ถ้าคุณรันโมเดลตัวไหนได้ คุณก็รันตัวนี้ได้เช่นกัน

A screenshot of the Hugging Face model page for openai/whisper-large-v3-turbo, showing the MIT license tag, the automatic-speech-recognition pipeline tag, the Transformers and Safetensors tags, the 99-languages tag, and the model card for the 809 million parameter distilled version of Whisper Large-v3, captured August 27 2026.

สำหรับการถอดเสียงแบบกลุ่มปริมาณมากสำหรับภาษาอังกฤษและภาษาที่ใกล้เคียงภาษาอังกฤษ Whisper Large v3 Turbo ยังคงเป็นตัวเลือกหลักด้วยเหตุผลเชิงโครงสร้างที่ไม่มีช่องว่างด้าน benchmark ใดจะพลิกสถานะได้โดยง่าย นั่นคือ มันฟรี เป็นของคุณ และมีอยู่ทุกที่

A generated two-column scoreboard titled 'Gemini 3.5 Transcribe vs Whisper Large v3 Turbo - the scoreboard'. Left column Gemini 3.5 Transcribe: Deployment managed API, Languages 85+, WER 2.6% non-streaming, Speaker ID built in, Formatting intelligent, Price ~$0.005/min. Right column Whisper Large v3 Turbo: Deployment anywhere self-host, Languages 99, WER 2.1% LibriSpeech clean, Speaker ID none, Formatting plain, Price free to run. Footer reads 'Gemini WER per Artificial Analysis, cited by Google; Whisper WER on LibriSpeech - a different set, see text.'

สิ่งที่ Gemini 3.5 Transcribe เพิ่มเข้ามา

คุณค่าของ managed challenger ไม่ได้อยู่ที่การเอาชนะ baseline ในภาษาอังกฤษที่สะอาด — นั่นคือการต่อสู้ที่ตัวเลขยังไม่สามารถตัดสินได้อย่างชัดเจนด้วยซ้ำ คุณค่าของมันอยู่ที่งานที่เกิดขึ้นเหนือคำพูด ซึ่ง Whisper ไม่ได้ทำโดยชัดแจ้ง

• การระบุผู้พูด — รองรับผู้พูดสูงสุดสามคนพร้อมการประทับเวลาในระดับคำ ในโมเดลพื้นฐาน Whisper ถอดเสียงจากสตรีมเสียงเพียงสตรีมเดียว ไม่มีแนวคิดว่าใครพูดอะไร

• การจัดรูปแบบอัจฉริยะ — ขจัดคำพูดติดขัด แก้ไขการพูดแก้ตัว ใส่เครื่องหมายวรรคตอนและตัวพิมพ์ใหญ่/เล็ก Whisper จะคืนคำตามที่พูด รวมถึงคำว่า “อืม” ด้วย

• คำศัพท์เฉพาะ — เน้นไปทางศัพท์เฉพาะทางและการสะกดที่ผิดปกติ Whisper ไม่มีกลไกดังกล่าว คุณต้องประมวลผลภายหลังหรือปรับแต่งเพิ่มเติม

• การเรียกใช้ฟังก์ชัน — ทรานสคริปต์สามารถส่งต่อให้โมเดล Gemini อื่นๆ ได้ ทำให้การถอดความเป็นขั้นตอนหนึ่งในไปป์ไลน์ของเอเจนต์ แทนที่จะเป็นเอาต์พุตปลายทาง

• เซสชันที่ยาว — ประมาณหนึ่งชั่วโมงของเสียงในครั้งเดียว (บริบท 96K ตามรายงานของสื่อ) เทียบกับความจำเป็นในทางปฏิบัติของ Whisper ที่ต้องแบ่งส่วนและต่อไฟล์ยาว

นั่นเป็นผลิตภัณฑ์ที่แตกต่างออกไป มันคือสิ่งที่ Go​ogle หมายถึงโดย "การถอดเสียงอัจฉริยะ" และมันเป็นส่วนของการเปรียบเทียบที่ไม่ขึ้นอยู่กับการคำนวณเกณฑ์มาตรฐาน

คำถามเรื่องความแม่นยำที่ยังไม่มีใครสามารถตอบได้อย่างชัดเจน

ตัวเลขหลักของทั้งสองโมเดลไม่ได้เผชิญหน้ากันจริง ๆ ค่า WER แบบไม่สตรีมมิ่ง 2.6% ของ Gemini 3.5 Transcribe เป็นค่าที่วัดโดย Artificial Analysis และถูกอ้างอิงโดย Google ซึ่งคำนวณจากภาษามากกว่า 85 ภาษา ส่วนค่า 2.1% ของ Whisper Large v3 Turbo ในการทดสอบ LibriSpeech test-clean เป็น benchmark ภาษาอังกฤษจากกระดาษ distillation ของ OpenAI เอง ซึ่งถูกทำซ้ำและใช้อย่างแพร่หลาย ชุดข้อมูลต่างกัน ภาษาที่ครอบคลุมต่างกัน ผู้ผลิตต่างกัน สิ่งที่พูดได้อย่างตรงไปตรงมาคือ: ในภาษาอังกฤษที่สะอาด โมเดลพื้นฐานแบบเปิดและผู้ท้าชิงแบบบริหารจัดการน่าจะอยู่ในระดับใกล้เคียงกัน และจุดเด่นของโมเดลแบบบริหารจัดการคือคุณสมบัติหลายภาษาและเชิงโครงสร้าง มากกว่าชัยชนะด้าน WER ภาษาอังกฤษที่พิสูจน์ได้ เอกสารเปิดตัวของ Google ไม่มีการเปรียบเทียบแบบตัวต่อตัวกับโมเดลตระกูล Whisper และการเปรียบเทียบเชิง adversarial อย่างอิสระก็ยังไม่มี เพราะ Gemini 3.5 Transcribe เพิ่งเปิดตัวต่อสาธารณะได้เพียงวันเดียว จนกว่าจะมีสิ่งนั้นปรากฏ มงกุฎแห่งความแม่นยำก็ยังไม่มีผู้ครอง และบทความใด ๆ — รวมถึงบทความนี้ — ที่ประกาศผู้ชนะ WER จากตัวเลขสองจำนวนนี้ถือว่าพูดเกินจริง

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

ค่าใช้จ่าย: ฟรี เมื่อเทียบกับ $0.005 ต่อนาที

Whisper Large v3 Turbo มีต้นทุนด้านฮาร์ดแวร์และไม่มีมิเตอร์ หากรันบน GPU ที่คุณมีอยู่แล้ว ต้นทุนส่วนเพิ่มต่อนาทีที่ถอดเสียงจะใกล้ศูนย์ แต่ถ้าเช่า GPU ก็จะคิดตามต้นทุนของอินสแตนซ์ระหว่างที่ทำงาน Gemini 3.​5 Transcribe คิดเงินประมาณ $0.005 ต่อนาทีของเสียงแบบผสม โดย SKU แบบสดอยู่ที่ประมาณ $0.009 ต่อนาที และมีระดับฟรี ที่เสียงหนึ่งพันชั่วโมง นั่นคือประมาณ $300 เมื่อเทียบกับมิเตอร์ของ G​emini กับเวลา GPU ไม่กี่ดอลลาร์บนเบสไลน์แบบเปิด ช่องว่างนั้นคือเรื่องจริงของต้นทุนในการเปรียบเทียบครั้งนี้ และเป็นเหตุผลที่เบสไลน์จะยังคงสถานะเริ่มต้นสำหรับงานประมวลผลภาษาอังกฤษปริมาณมากไปอีกนาน เศรษฐศาสตร์ของโมเดลที่มีการจัดการจะปิดลงก็ต่อเมื่อคุณสมบัติที่รวมมา — diarization, การจัดรูปแบบ, การควบคุมคำศัพท์ — จะทำให้คุณเสียเวลาทางวิศวกรรมในการประกอบเข้าด้วยกันบน Whisper

ภาษาและการสตรีมมิ่ง

Whisper Large v3 Turbo ระบุรายชื่อ 99 ภาษา เทียบกับ G​emini ที่มี 85+ แต่เรื่องจริงของการใช้งานหลายภาษานั้นต่างกัน: Whisper ถอดความทั้ง 99 ภาษาในรอบเดียวโดยไม่มีการตรวจจับอัตโนมัติ และความแม่นยำจะลดลงมากที่สุดในภาษาที่มีทรัพยากรน้อยและภาษาที่มีเสียงรบกวน — นี่คือข้อแลกเปลี่ยนของโมเดลแบบกลั่น (distilled model) G​emini ตรวจจับอัตโนมัติใน 85+ ภาษาของตน และ Go​ogle เน้นสำเนียงและภาษาถิ่นในภูมิภาค สำหรับการสตรีมมิง Whisper ไม่มีโมเดลเรียลไทม์ในตัว การใช้งานแบบเรียลไทม์จะใช้ faster-whisper และเฟรมเวิร์กที่คล้ายกันบนฮาร์ดแวร์ของคุณเอง ขณะที่ Gemini 3.​5 Transcribe มีเอนด์พอยต์สดที่สร้างมาโดยเฉพาะ โดยอ้างความหน่วงต่ำกว่า 1 วินาทีและราคาที่สูงตาม หากปริมาณงานของคุณเป็นแบบสดและหลายภาษา เอนด์พอยต์แบบจัดการ (managed endpoint) จะใช้งานง่ายกว่า แต่ถ้าเป็นแบบแบตช์และเป็นภาษาอังกฤษ โมเดลเปิดพื้นฐานจะถูกกว่า

คำตัดสิน เท่าที่มันเป็น

Whisper Large v3 Turbo ยังคงเป็นตัวเลือกเริ่มต้นที่เหมาะสมสำหรับการถอดเสียงภาษาอังกฤษแบบกลุ่มในระดับใหญ่ สำหรับทุกสิ่งที่ต้องทำงานบนโครงสร้างพื้นฐานของคุณเอง และสำหรับทีมที่ต้องการผลลัพธ์ที่คงที่และตรวจสอบได้ Gemini 3.5 Transcribe เป็นทางเลือกที่ถูกต้องเมื่อบทถอดเสียงต้องมีมากกว่าแค่คำพูด ไม่ว่าจะเป็นป้ายระบุผู้พูด การจัดรูปแบบที่สะอาด คำศัพท์เฉพาะโดเมน การรองรับหลายภาษา หรือจุดเชื่อมต่อเอเจนต์ และเมื่อคุณยอมจ่ายตามการใช้งานสำหรับฟีเจอร์เหล่านั้น ทั้งสองทำงานร่วมกันได้ และรูปแบบที่ทำให้การอยู่ร่วมกันนี้มีต้นทุนต่ำคือขอบเขตการจัดเส้นทาง (routing boundary) นั่นคือ ตัวถอดเสียงที่เหมาะกับไฟล์เสียง จากนั้นชั้น LLM ที่ตัดสินใจว่าจะจัดการกับข้อความอย่างไร ชั้นนั้นคือสิ่งที่ OrcaRouter ดำเนินการ — API เดียวที่ครอบคลุมโมเดลมากกว่า 200 รุ่น การสลับไปใช้บริการสำรองอัตโนมัติข้ามผู้ให้บริการ และ DSL สำหรับจัดเส้นทางเพื่อประกอบโมเดลหลายตัวในการเรียกใช้ครั้งเดียว โมเดลเสียงพูดทั้งสองตัวไม่ได้โฮสต์อยู่ฝั่งเรา ทางเลือกในการถอดเสียงจึงอยู่ระหว่าง GPU ของคุณกับมิเตอร์ของ Google และทั้งคู่จะยังอยู่ต่อไปอีกนาน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube