การ์ดหัวเรื่องหลักสำหรับ 'การถอดเสียงอัจฉริยะด้วย Gemini 3.5 Transcribe' แสดงรูปคลื่นเสียงที่เปลี่ยนเป็นข้อความที่จัดรูปแบบแล้ว ลูกโลกที่ระบุ 85+ ภาษา ชิปกำกับผู้พูด ตัวเลขเด่น ได้แก่ 2.6% WER สำหรับแบบไม่สตรีมมิ่ง และ ~$0.005/นาทีแบบรวม รวมถึงโลโก้ OrcaRouter ที่มุมขวาล่าง
Engineering & Research

การถอดเสียงอัจฉริยะด้วย Gemini 3.5 Transcribe

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Gemini 3.​5 Transcribe เข้าสู่การเปิดให้ทดลองใช้แบบสาธารณะ (public preview) เมื่อวันที่ 26 สิงหาคม 2026 และเป็นโมเดลแปลงคำพูดเป็นข้อความตัวแรกของ Go​ogle ที่ถูกขายในฐานะโมเดล G​emini อย่างแท้จริง: คุณเรียกใช้ผ่าน G​emini API ด้วยรหัสโมเดล ราคาเสียงคิดเป็นโทเคน และ Go​ogle ระบุค่าใช้จ่ายต่อนาทีของเสียงในหน้าตาราคา รายละเอียดข้อสุดท้ายนี้คือสิ่งที่การรายงานข่าวสำหรับผู้บริโภคมองข้าม เรื่องราวในวันเปิดตัวเป็นเรื่องเกี่ยวกับการตัดคำฟุ่มเฟือยและการแก้ไขเสียงใน Gboard แต่สิ่งที่เปลี่ยนไปจริงๆ สำหรับนักพัฒนาคือ การถอดเสียงตอนนี้อยู่บนพื้นผิว API เดียวกันกับไลน์ G​emini ที่เหลือ โดยมีการระบุผู้พูดและการประทับเวลาแบบระดับคำในโมเดลพื้นฐาน แทนที่จะเป็นส่วนเสริมแยกต่างหาก บทความชิ้นนี้อ่านเหมือนเอกสารอ้างอิง API เพราะนั่นคือช่องว่างที่การรายงานข่าวระลอกแรกปล่อยทิ้งไว้

ข้อควรระวังสองประการที่ต้องกล่าวไว้ก่อน เพื่อให้ตัวเลขด้านล่างไม่ทำให้เข้าใจผิด Go​ogle ไม่ได้เรียก Gemini 3.​5 Transcribe ว่า "โมเดลแปลงเสียงพูดเป็นข้อความที่ถูกต้องที่สุดเท่าที่เรามี" — คำกล่าวอ้างคือว่าเป็นโมเดลที่แม่นยำที่สุดสำหรับการโต้ตอบด้วยเสียงอัจฉริยะ ซึ่งเป็นคำกล่าวอ้างคนละอย่าง และความแตกต่างนี้มีความสำคัญเมื่อคุณอ่านตัวเลข WER และทุกอย่างในที่นี้เป็นคำอธิบายเกี่ยวกับรุ่นพรีวิวสาธารณะ: รหัสโมเดลสองรหัส ราคา และตัวเลข benchmark คือสิ่งที่ Go​ogle เปิดตัวในวันนี้ และทั้งหมดนี้อาจเปลี่ยนแปลงได้ก่อนถึง GA

เส้นทาง API ทั้งสองเส้นทาง — และ ID โมเดลที่ต้องจำ

Gemini 3.5 Transcribe มาพร้อมกับสองเอนด์พอยต์ และการเลือกเอนด์พอยต์ที่ถูกต้องคือการตัดสินใจด้านสถาปัตยกรรมแรกที่ทีมต้องทำ:

• gemini-3-5-transcribe — เส้นทางที่บันทึกไว้ล่วงหน้าผ่าน Interactions API ส่งไฟล์แล้วรับทรานสคริปต์กลับมาพร้อมการระบุผู้พูด (สูงสุดสามผู้พูด; สามคนขึ้นไปเป็นฟีเจอร์ทดลอง) และไทม์สแตมป์ระดับคำ นี่คือตัวหลักสำหรับงานแบบแบตช์และแบบอะซิงโครนัส

• gemini-3-5-transcribe-live — เส้นทางแบบเรียลไทม์ผ่าน Live API การสตรีมแบบสองทางที่มีความหน่วงต่ำกว่าหนึ่งวินาที มุ่งเน้นสำหรับการสนทนาสด การสร้างคำบรรยาย และอินเทอร์เฟซที่ขับเคลื่อนด้วยเสียง

การแยกนี้สะท้อนถึงการจัดเรียงของตระกูล G​emini Audio ที่เหลือ และมันสำคัญเพราะ "live" เป็น SKU ที่แยกออกมาโดยมีราคาของตัวเอง การวิเคราะห์เบื้องต้นหลายชิ้นเกี่ยวกับการเปิดตัวครั้งนี้สันนิษฐานว่าโมเดลเดียวทำทั้งสองอย่าง แต่ไม่เป็นเช่นนั้น

A generated two-card infographic titled 'Gemini 3.5 Transcribe - two API paths' showing the pre-recorded Interactions API path on the left labeled gemini-3-5-transcribe with a file-in transcript-out flow and speaker attribution, and the streaming Live API path on the right labeled gemini-3-5-transcribe-live with bidirectional streaming and sub-second latency, a footer reading 'Public preview, August 2026', and the OrcaRouter logo in the bottom-right corner.

"การถอดความอัจฉริยะ" จริง ๆ แล้วหมายถึงอะไร

โพสต์เปิดตัวของ Google นำเสนอสิ่งนี้ว่าเป็นการก้าวข้ามความแม่นยำทางสัทศาสตร์ไปสู่ความเข้าใจ คุณสมบัติที่ต่อเนื่องจากกรอบแนวคิดนั้นคือสิ่งที่ควรประเมิน มากกว่าตัวกรอบแนวคิดเอง:

• การจัดการกับความไม่คล่องแคล่ว — เสียง "ums" และ "ahs" จะถูกละทิ้ง และการแก้ไขคำพูดตนเองจะถูกจัดการ "เจอกันวันอังคาร — ไม่สิ วันพุธ" จะถอดความเป็นวันที่แก้ไขแล้ว ไม่ใช่การถอดความจากจุดเริ่มต้นที่ผิดพลาด นี่คือการตัดสินใจที่โมเดลทำ ซึ่งเป็นความหมายที่ Google เรียกว่าฉลาด

• การจัดรูปแบบอัตโนมัติ — ผลลัพธ์จะถูกส่งกลับเป็นข้อความที่จัดรูปแบบแล้ว: มีการใช้เครื่องหมายวรรคตอน การใช้ตัวพิมพ์ใหญ่และตัวพิมพ์เล็ก และการจัดโครงสร้างย่อหน้า ไม่ใช่สตรีมโทเค็นดิบ

• การระบุผู้พูดหลายคน — รองรับการระบุผู้พูดได้สูงสุดสามคนในเสียงที่บันทึกไว้ล่วงหน้า พร้อมการประทับเวลาในระดับคำ; ผู้พูดตั้งแต่สามคนขึ้นไปยังอยู่ในขั้นทดลอง ฟีเจอร์นี้อยู่ในโมเดลพื้นฐาน แทนที่จะเป็นบริการแยกสำหรับการแบ่งแยกผู้พูด

• คำศัพท์แบบกำหนดเอง — คุณสามารถปรับการรู้จำให้เน้นไปที่ศัพท์เฉพาะ ชื่อผลิตภัณฑ์ และการสะกดที่ผิดปกติได้โดยการจัดหาคำศัพท์ ซึ่งเป็นกลไกสำหรับโดเมนแนวตั้ง

• 85+ ภาษา — ตรวจจับอัตโนมัติ พร้อมระบุสำเนียงและภาษาถิ่นตามภูมิภาคอย่างชัดเจน

• การเรียกใช้ฟังก์ชัน — โมเดลสามารถมอบหมายงาน เช่น การสร้างภาพหรือการวิเคราะห์ไฟล์ ให้กับโมเดล G​emini อื่น ๆ ซึ่งเปลี่ยนการถอดความให้เป็นส่วนประกอบของเอเจนต์ที่ใหญ่กว่า แทนที่จะเป็นขั้นตอนสุดท้าย

• การจับเอนทิตี้ — Go​ogle อ้างว่ามีประสิทธิภาพดีเยี่ยมกับเสียงที่มีสัญญาณรบกวนในโลกจริง และกับเอนทิตี้ที่เป็นตัวอักษรและตัวเลข เช่น รหัสไปรษณีย์และรหัสคำสั่งซื้อ

รายงานข่าวยังกล่าวถึงหน้าต่างบริบทขนาด 96,000 โทเค็น (ประมาณหนึ่งชั่วโมงของเสียงประชุมโดยไม่ต้องแบ่ง) และการตรวจจับอารมณ์ ทั้งสองอย่างสอดคล้องกับกรอบการเปิดตัว แต่การ์ดโมเดลที่ Google เผยแพร่ไม่ได้เน้นคุณสมบัติเหล่านี้ ดังนั้นให้ถือว่าเป็นสิ่งที่ถูกรายงานมากกว่าที่ยืนยัน จนกว่าจะมีเอกสารข้อมูลจำเพาะ GA ออกมา

A generated single-column scoreboard titled 'Gemini 3.5 Transcribe - the scoreboard' with rows Release Aug 26 2026 public preview, Languages 85+ auto-detect, WER 2.6% non-streaming / 4.0% streaming, Price ~$0.005 per minute blended, APIs transcribe plus transcribe-live, and Context ~96K tokens reported, a footer reading 'WER per Artificial Analysis, cited by Google; context window press-reported', and the OrcaRouter logo in the bottom-right corner.

ตัวเลขความแม่นยำที่มีป้ายกำกับ

ตัวเลข WER ที่ Google อ้างอิงมาจาก Artificial Analysis: อัตราความผิดพลาดของคำโดยเฉลี่ย 4.0% สำหรับการถอดความแบบสตรีมมิง และ 2.6% สำหรับการถอดความแบบไม่สตรีมมิง ในการวัดประสิทธิภาพหลายภาษาของ FLEURS นั้น Google รายงาน WER ที่ 5.50% สำหรับการสตรีมมิง และ 5.04% สำหรับการไม่สตรีมมิง Google ยังอ้างว่าการปรับปรุงเวลาจนกว่าจะได้การถอดความครั้งสุดท้ายดีขึ้น 70% เมื่อเทียบกับรุ่นก่อนหน้าอย่าง Chirp 3

การอ่านอย่างตรงไปตรงมา: สิ่งเหล่านี้เป็นการวัดผลแบบอิสระในแง่ที่ว่า Artificial Analysis ไม่ใช่ Go​ogle แต่เป็นการวัดผลที่ Go​ogle คัดเลือกมา เผยแพร่ในการประกาศของ Go​ogle เอง สำหรับโมเดลที่เปิดให้เรียกใช้ได้เพียงหนึ่งวัน ยังไม่มีใครนอกเหนือจาก Go​ogle ที่ได้ทดสอบแบบตัวต่อตัวอย่างแข่งขันกับโมเดลโอเพนเวทที่ทีมส่วนใหญ่ใช้เปรียบเทียบ และเอกสารเปิดตัวไม่มีข้อมูลเปรียบเทียบโดยตรงกับตระกูล Whisper หรือสาย Parakeet ของ NVIDIA ตัวเลขที่ว่าเร็วกว่า Chirp-3 ถึง 70% เป็นเพียงคำกล่าวอ้างของผู้จำหน่ายเท่านั้น จงถือว่า 2.6% และ 4.0% เป็นสัญญาณเริ่มต้นที่แข็งแกร่ง ไม่ใช่ข้อเท็จจริงที่สรุปแล้ว

ค่าใช้จ่ายเท่าไร

หน้าราคาของ Google แสดงแต่ละโมเดลเป็นโทเค็นและเป็นนาทีโดยประมาณของเสียง สำหรับ gemini-3-5-transcribe ค่าประมาณแบบผสมอยู่ที่ประมาณ $0.005 ต่อนาทีของเสียงตามราคารายการ — อินพุตประมาณ $0.003/นาที เอาต์พุตประมาณ $0.002/นาที สำหรับ gemini-3-5-transcribe-live ค่าประมาณแบบผสมอยู่ที่ประมาณ $0.009 ต่อนาที ทั้งสองมีระดับฟรีในปัจจุบัน

ตัวเลขต่อนาทีเหล่านั้นเป็นค่าประมาณที่ได้จากอัตราโทเค็นที่สมมติขึ้น (โทเค็นเสียง 25 ตัวต่อวินาทีขาเข้า, โทเค็นข้อความ 175 ตัวต่อนาทีขาออก) ดังนั้นตัวเลขจึงเปลี่ยนแปลงไปหาก Go​ogle เปลี่ยนการนับโทเค็น สิ่งที่แน่นอนคือหลักการ: ราคาที่ประกาศคือราคาที่ต้องจ่าย นั่นคือหลักการที่เราเตอร์แบบ pass-through เช่น OrcaRouter ใช้ดำเนินการ — ไม่มีมาร์กอัป 0% ส่งผ่านราคาประกาศของผู้ให้บริการ — ดังนั้นหาก Go​ogle ลดราคาการถอดความในช่วงระหว่าง preview ถึง GA การลดราคาจะมีผลฝั่งเราในวันเดียวกัน ไม่ใช่หลังจากที่ตัวแทนจำหน่ายอัปเดตเรตการ์ด

สถานที่ที่กำลังเปิดตัว

สำหรับนักพัฒนา การแสดงตัวอย่างสาธารณะในวันนี้หมายถึงสองด้าน ได้แก่ G​emini API ใน Go​ogle AI Studio และ G​emini Enterprise Agent Platform สำหรับงานระดับองค์กร ในฝั่งผู้บริโภค Gemini 3.​5 Transcribe ขับเคลื่อนฟีเจอร์พิมพ์ตามคำบอก Rambler ใน Gboard บน Android และแอป G​emini บน macOS ถัดไปคือ Chrome — พิมพ์ด้วยเสียงในฟิลด์เว็บใดก็ได้ — ตามด้วย Search Live, G​emini Live, Docs, Keep และ Gmail สำหรับทีมที่กำลังประเมินมัน คำตอบเชิงปฏิบัติก็ง่ายกว่านั้น: มันเรียกใช้ได้จากโค้ดแล้วในตอนนี้ เป็นภาษาอังกฤษ ในภูมิภาคที่ G​emini API พร้อมใช้งาน

A screenshot of the Google blog announcement page for Gemini 3.5 Transcribe, titled 'Intelligent transcription with Gemini 3.5 Transcribe', showing the August 26 2026 date and the authors Diego Melendo Casado and Luke Leonhard, captured August 27 2026.

สิ่งนี้หมายความว่าอย่างไรสำหรับไปป์ไลน์ของคุณ

สิ่งใหม่ที่แท้จริงไม่ใช่ตัวเลข WER แต่คือการที่ Go​ogle กำลังขายบริการถอดเสียงซึ่งมาพร้อมกับฟีเจอร์สองอย่างที่ทีมเคยต้องประกอบขึ้นเอง — ป้ายชื่อผู้พูดและไทม์สแตมป์ระดับคำ — ภายในโมเดลพื้นฐาน บนพื้นผิว API ของ G​emini ที่รองรับการเรียกใช้ฟังก์ชัน ถ้าคุณกำลังสร้างไปป์ไลน์บันทึกการประชุมแบบระบุผู้พูดจากตัวถอดเสียงธรรมดา บวกตัวระบุผู้พูดแยกต่างหาก บวกขั้นตอนจัดรูปแบบ นี่คือโมเดล Go​ogle รุ่นแรกที่ยุบรวมขั้นตอนเหล่านั้นเข้าด้วยกัน คำถามที่ยังเปิดอยู่คือค่า WER แบบไม่สตรีมมิงที่ 2.6% จะยังใช้ได้ดีกับเสียงของคุณเองหรือไม่ และจนกว่าจะมีผลการทดสอบซ้ำโดยอิสระออกมา การตัดสินใจที่รับผิดชอบของทีมโปรดักชันคือการนำเสียงตัวอย่างจริงรันผ่าน API แทนที่จะตั้งงบประมาณโดยอิงกับเกณฑ์วัดที่ Go​ogle เลือกไว้ สำหรับงาน LLM ที่ทำงานบนบทถอดเสียง — การสรุปความ การสกัดข้อมูลแบบมีโครงสร้าง รายการสิ่งที่ต้องทำ — นั่นคือเลเยอร์ที่การจัดเส้นทาง (routing) พิสูจน์คุณค่า และเป็นเลเยอร์ที่ OrcaRouter ครอบคลุม: API เดียวที่ใช้กับโมเดลมากกว่า 200 รุ่น การเฟลโอเวอร์อัตโนมัติระหว่างผู้ให้บริการ และ DSL สำหรับจัดเส้นทางที่รวมโมเดลหลายตัวเข้าด้วยกันในการเรียกครั้งเดียว ตัวขั้นตอนการถอดเสียงเอง คุณควรทดสอบกับเสียงของคุณเองก่อนที่จะเชื่อตัวเลขเด่นๆ ที่ใครประกาศไว้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube