
Gemini 3.8 Flash TTS กล่าวสวัสดี: Google แยกสายผลิตภัณฑ์ด้านเสียงพูดออกเป็นสองส่วนและลดราคา
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
ผู้ให้บริการเปิดตัวโมเดลเสียงพูดสองตัวเมื่อวันที่ 23 กันยายน 2026 และประกาศก็เขียนราวกับว่าพาดหัวข่าวคือคุณภาพเสียง ทั้งที่ไม่ได้เป็นเช่นนั้น Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS เป็นโมเดลแปลงข้อความเป็นเสียงรุ่นแรกที่ผู้ให้บริการนำมาไว้บน Gemini Developer API ในราคาที่ต่ำกว่าโมเดลพรีวิวที่โมเดลเหล่านี้มาแทนที่ — และสำหรับใครก็ตามที่เคยจ่ายตามจำนวนอักขระที่อื่น นั่นคือส่วนที่ทำให้รายการงบประมาณเปลี่ยนไป อัตราเอาต์พุตเสียงบน Gemini 3.8 Flash TTS อยู่ที่ $9.00 ต่อล้านโทเค็นไปจนถึงสิ้นปี 2026 ระบบคิดค่าเสียงที่ 25 โทเค็นต่อวินาที ซึ่งคิดออกมาได้ประมาณ 0.02 เซนต์ต่อวินาทีของเสียงพูดที่สร้างขึ้น โมเดลที่มันมาแทนที่ Gemini 3.1 Flash TTS Preview ซึ่งมีราคาอยู่ที่ $20.00 ต่อล้านโทเค็นเสียง
ครึ่งหลังของเรื่องก็คือตอนนี้มีสองโมเดล ไม่ใช่หนึ่งเดียว Google แยกสายผลิตภัณฑ์ออกเป็น: Flash TTS มีชุดภาษาครบทั้งหมดและอัตราเสียงที่สูงกว่า ส่วน Flash-Lite TTS มีรายการภาษาที่สั้นกว่าและราคาถูกกว่า นั่นเป็นรูปแบบที่แตกต่างจากการจัดวางแบบโมเดลพรีวิวเดียวที่มีอยู่ใน API ตั้งแต่เดือนเมษายน และมันบอกคุณว่า Google มองว่าตลาดมีหน้าตาเป็นอย่างไร — แอปพลิเคชันจำนวนเล็กน้อยที่ต้องการ 130 ภาษาและการโคลนเสียง กับอีกจำนวนที่มากกว่ามากที่ต้องการเพียงเสียงภาษาอังกฤษที่ใช้การได้ดีสำหรับบอตสนับสนุนเท่านั้น ไม่ต้องการอย่างอื่น
อะไรที่ถูกจัดส่งจริงในวันที่ 23 กันยายน
ทั้งสองโมเดลพร้อมใช้งานทั่วไปบน Gemini API และใน AI Studio นับตั้งแต่การประกาศเปิดตัว โดยไม่ได้ถูกจำกัดไว้หลังรายการรอ ชื่อบน API คือ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts
• Flash TTS — 130 ภาษา ตรวจจับภาษาอัตโนมัติจากข้อความ เสียงสตูดิโอที่สร้างไว้ล่วงหน้า 30 เสียง รวมถึง Kore และ Puck
• Flash-Lite TTS — 101 ภาษา หน้าจอการออกแบบเสียงแบบเดียวกัน ถูกจัดวางเป็นระดับปริมาณการใช้งานสูง
• ทั้งสอง — การออกแบบเสียงจากคำอธิบายภาษาธรรมชาติ คำแนะนำการส่งเสียงแบบทีละบรรทัด การจัดวางฉากสำหรับผู้พูดสองคน และสัญญาณอวัจนภาษาที่เขียนลงในสคริปต์โดยตรง
• เอาต์พุต — WAV 24 kHz โมโน PCM แบบมีเครื่องหมาย 16 บิต บนเอนด์พอยต์แบบ unary; PCM แบบไม่มีเฮดเดอร์ (audio/l16) บนเอนด์พอยต์แบบสตรีมมิ่ง; ยอมรับ audio/mulaw และ audio/alaw ได้เช่นกัน โดยมีอัตราการสุ่มตัวอย่างที่กำหนดค่าได้
ตารางราคา ต่อหนึ่งล้านโทเคน คุ้มค่าที่จะอ่านให้ครบทั้งหมด เพราะแต่ละระดับแตกต่างกันมากกว่าตัวเลขที่พาดหัว:
• Flash TTS Standard — $0.50 สำหรับข้อความขาเข้า / $9.00 สำหรับเสียงขาออก และจะปรับขึ้นเป็น $1.00 / $18.00 หลังวันที่ 31 ธันวาคม 2026
• Flash TTS แบบ Batch และ Flex — $0.25 / $4.50
• Flash TTS Priority — $0.90 / $16.20
• Flash-Lite TTS Standard — $0.50 / $6.00 โดยจะเพิ่มขึ้นเป็น $1.00 / $12.00 หลังวันที่ 31 ธันวาคม 2026
• Flash-Lite TTS แบบ Batch และ Flex — $0.25 / $3.00
• Flash-Lite TTS Priority — $0.90 / $10.80
• Gemini 3.1 Flash TTS Preview สำหรับเปรียบเทียบ — $1.00 / $20.00, แบบแบตช์ $0.50 / $10.00
ช่วงเวลาโปรโมชันเป็นสิ่งที่ต้องสังเกต Google ตั้งราคาสินค้าใหม่ทั้งสองรุ่นไว้ที่ครึ่งราคาจนถึงสิ้นปี และเผยแพร่ตัวเลขหลังโปรโมชันไว้ในตารางเดียวกัน ใครก็ตามที่กำลังสร้างแบบจำลองต้นทุนต่อพันนาทีควรใช้ตัวเลขเดือนมกราคม ไม่ใช่ตัวเลขเดือนกันยายน

การออกแบบเสียงคือความสามารถใหม่ที่แท้จริง
เสียงที่สร้างไว้ล่วงหน้าเป็นเพียงสิ่งพื้นฐานที่ต้องมีอยู่แล้ว สิ่งที่ Google เพิ่มเข้ามาในเวอร์ชัน 3.8 คือวิธีอธิบายเสียงด้วยคำพูดแล้วได้เสียงนั้นมาตามต้องการ และวิธีโคลนเสียงจากตัวอย่างสั้น ๆ พร้อมระบบตรวจสอบความยินยอมแนบมาด้วย
Voice design รับพรอมต์ภาษาธรรมชาติ — จังหวะการพูด น้ำเสียง สำเนียง สิ่งที่ปกติคุณต้องใช้เวลาทั้งบ่ายเพื่อลองฟังและคัดเลือก — และให้เสียงที่ใช้งานได้โดยไม่ต้องมีบันทึกเสียงอ้างอิง Voice replication ทำงานตรงกันข้าม: คุณส่งตัวอย่างเสียง 30 วินาที ระบบจะตรวจสอบความยินยอม และเสียงที่ได้จะถูกทำเครื่องหมายด้วยลายน้ำ SynthID และข้อมูลรับรอง C2PA บนเสียงที่สร้างขึ้น Voice remixing ซึ่งให้คุณผสมหรือปรับเปลี่ยนเสียงที่กำหนดเองที่มีอยู่ ถูกระบุว่ากำลังจะมาเร็ว ๆ นี้ แทนที่จะเปิดให้ใช้แล้ว
เสียงกำหนดเองมีอยู่สองรูปแบบ และทั้งสองมีพฤติกรรมที่แตกต่างกันมากพอที่ความแตกต่างนี้จะมีความสำคัญในโปรดักชัน เสียงกำหนดเองแบบมีสถานะจะถูกจัดเก็บไว้กับโปรเจกต์ โดยจำกัดไว้ที่ 200 เสียงต่อโปรเจกต์ และมีอายุการใช้งานหนึ่งปี ส่วนเสียงแบบไม่มีสถานะจะถูกอ้างอิงด้วยแฮนเดิลvoicekey_... และจะหมดอายุภายในเจ็ดวัน หากแอปพลิเคชันของคุณจัดเตรียมเสียงให้กับลูกค้าแต่ละราย เพดานจำนวนและค่า TTL คือตัวเลขสองตัวที่กำหนดว่าคุณจำเป็นต้องมีชั้นจัดเก็บข้อมูลเป็นของตัวเองหรือไม่
ตัวควบคุมการส่งเสียงเป็นอีกครึ่งหนึ่งของความ "ใหม่" คุณสามารถกำกับบทพูดแต่ละบรรทัดได้เหมือนที่คุณกำกับนักแสดง — จังหวะ การเน้น และระดับอารมณ์ — แทนที่จะเพียงเลือกเสียงแล้วหวังเอา ฉากที่มีผู้พูดสองคนสามารถจัดฉากได้ภายในหนึ่งการเรียกใช้งาน และเสียงเปล่งที่ไม่ใช่คำพูดก็เป็นองค์ประกอบของบทที่สำคัญอันดับต้น ๆ: <laughs>, <sigh> และ <gasp> เป็นคิวแบบอินไลน์ พร้อมกับ |mhm| และ |yeah| สำหรับเสียงตอบรับเล็ก ๆ ที่ทำให้บทสนทนาสังเคราะห์ฟังดูเหมือนการสนทนา การอ่านแบบยาวได้รับการกล่าวอ้างว่าคงเอกลักษณ์ของผู้พูดไว้ได้โดยมีความคลาดเคลื่อนน้อยที่สุด ซึ่งเป็นโหมดความล้มเหลวที่ปรากฏก่อนเป็นอันดับแรกเมื่อคุณสร้างบทหนังสือเสียงความยาว 40 นาที
การทดสอบประสิทธิภาพ และใครเป็นผู้ดำเนินการทดสอบ
เนื้อหาการเปิดตัวของ Google อาศัยการประเมินจากภายนอกสองรายการและชุดผลการจัดอันดับในอารีนา ทั้งหมดนี้เป็นข้อมูลที่ผู้ขายรายงานเอง — Google เป็นผู้อ้างอิงข้อมูลเหล่านั้น และการรันเบื้องหลังไม่เปิดเผยต่อสาธารณะ — ดังนั้นให้ถือว่าเป็นข้อกล่าวอ้างมากกว่าผลการวัด

• Hume AI Voice Design Benchmark — Gemini 3.8 Flash TTS อยู่ในอันดับหนึ่งที่ 71.4 และอันดับหนึ่งด้านการจำลองสำเนียงที่ 60.8
• ดัชนีคุณภาพโดยรวมของ Hume — Flash TTS เป็นอันดับหนึ่ง, Flash-Lite TTS เป็นอันดับสอง
• การชื่นชอบโดยไม่รู้ที่มาใน Speech Arena — ตำแหน่งสูงสุดที่ถูกอ้างสิทธิ์ในภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนเม็กซิกัน และฮินดี
• เมื่อเทียบกับ Gemini 3.1 Flash TTS — Google อ้างว่าได้ความก้าวหน้าในด้านความสม่ำเสมอของเนื้อหาความยาวยาวและการควบคุมบทภาพยนตร์แบบผู้พูดสองคน ซึ่งเป็นสองสิ่งที่ฟีเจอร์ด้านการกำกับวิธีการพูดถูกออกแบบมาเพื่อรองรับโดยเฉพาะ
ความคลาดเคลื่อนที่ได้รับการบันทึกไว้อย่างหนึ่งสมควรแก่การกล่าวถึง เพราะมันจะทำให้ใครก็ตามที่เปรียบเทียบแหล่งข้อมูลสับสน บทความบนบล็อกอธิบายถึงไลบรารีที่มีเสียงพร้อมใช้งานจริงมากกว่า 2,000 เสียง เอกสารสำหรับนักพัฒนาอธิบายว่ามีเสียง "หลายร้อย" เสียงใน Extended Voice Library ควบคู่ไปกับเสียงสตูดิโอที่สร้างไว้ล่วงหน้า 30 เสียง การรายงานของบุคคลที่สามได้อ้างอิงตัวเลขที่สูงขึ้นอีกเป็นสิบเท่า สิ่งเหล่านี้ไม่สามารถทำให้สอดคล้องกันได้จากภายนอก — การตีความที่ซื่อตรงคือ ชุดที่สร้างไว้ล่วงหน้าซึ่งคุณได้รับโดยค่าเริ่มต้นนั้นมี 30 เสียง, Extended Voice Library มีขนาดใหญ่กว่าและถูกอธิบายอย่างคลุมเครือ, และตัวเลขจำนวนมากนั้นหมายถึงแค็ตตาล็อกที่รวมเสียงที่ผู้ใช้สร้างขึ้น หากจำนวนเสียงเป็นปัจจัยสำคัญต่อการตัดสินใจของคุณ ให้ทดสอบเสียงเฉพาะที่คุณต้องการแทนที่จะเชื่อถือตัวเลขใด ๆ จากสามตัวเลขนั้น
มันหมายความว่าอย่างไรถ้าคุณกำลังสร้างบนมัน
การเปลี่ยนแปลงในทางปฏิบัติก็คือ text-to-speech ได้ย้ายจากรายการค่าใช้จ่ายเฉพาะทาง มาสู่สิ่งที่คุณจัดเข้าในโมเดลต้นทุนเดียวกับโทเคนภาษาของคุณได้แล้ว ที่ 25 โทเคนต่อวินาที เสียงที่สร้างขึ้นหนึ่งชั่วโมงจะเท่ากับ 90,000 โทเคนเสียง ซึ่งในอัตราโปรโมชันของ Flash-Lite อยู่ที่ประมาณ 54 เซนต์ ราคาถูกพอจนคำถามที่น่าสนใจเลิกเป็นว่า "เราจ่ายไหวสำหรับเสียงสังเคราะห์หรือเปล่า" แล้วกลายเป็น "surface นี้ต้องใช้ระดับไหนจากสองระดับนี้"
การเปลี่ยนแปลงเชิงปฏิบัติประการที่สองคือ โมเดล TTS ใหม่เอี่ยมเป็นสิ่งที่คุณอยากลองโดยไม่ต้องเดิมพันเส้นทางการผลิตกับมัน นั่นคือเหตุผลที่ควรวางโมเดลใหม่ไว้หลังเราเตอร์แทนที่จะต่อตรง ๆ: OrcaRouter เปิดให้เข้าถึงโมเดลมากกว่า 200 รายการผ่านคีย์เดียว ในราคาตามที่ผู้ให้บริการระบุ โดยไม่บวกเพิ่ม และการสลับไปใช้ระบบสำรองอัตโนมัติของมันหมายความว่าปลายทางการพูดใหม่ที่สั่นไหวภายใต้โหลดจะลดระดับไปยังโมเดลที่คุณเชื่อถืออยู่แล้วแทนที่จะตัดสายทิ้ง เราไม่ได้โฮสต์ปลายทาง Gemini 3.8 TTS — สิ่งเหล่านั้นมาจาก API ของ Google เอง — แต่ชั้นข้อความที่อยู่ใต้เสียง และเส้นทางสำรองเมื่อการเรียกสังเคราะห์เสียงล้มเหลว คือส่วนที่เราเตอร์มีไว้เพื่อจัดการจริง ๆ
ยังขาดอะไรอีก
มีสามสิ่งที่หายไปจากการเปิดตัว และแต่ละอย่างล้วนเป็นข้อจำกัดที่แท้จริง ไม่ใช่เรื่องจุกจิกเล็ก ๆ น้อย ๆ
ยังไม่มีการประเมินโดยอิสระที่เผยแพร่ ตัวเลข Hume ของ Google คือการที่ผู้ขายอ้างอิงเบนช์มาร์กของบุคคลที่สาม ซึ่งดีกว่าไม่มีอะไรเลย แต่ก็แย่กว่าการตรวจสอบอิสระ จนกว่า Artificial Analysis หรือสิ่งที่เทียบเท่าจะเผยแพร่ผลการรันของตนเองบนโมเดลเดียวกัน คำกล่าวอ้างด้านคุณภาพทุกข้อในบทความนี้ควรอ่านเป็นเพียงคำกล่าวอ้างเท่านั้น
ไม่มีตัวเลือกแบบ open-weights โมเดลทั้งสองเป็นแบบปิดและมีเฉพาะ API ซึ่งทำให้มันอยู่คนละหมวดกับโมเดลเสียงแบบเปิดที่ทยอยเปิดตัวในสังเวียนเดียวกัน หากการปรับใช้ของคุณต้องรันโมเดลด้วยตัวเอง การเปิดตัวครั้งนี้ไม่ได้ตอบโจทย์คุณ
และราคาโปรโมชั่นก็สิ้นสุดลง อัตราค่าบริการของ Flash TTS ในเดือนมกราคม 2027 เป็นสองเท่าของอัตราในเดือนกันยายน และกรณีทางธุรกิจใด ๆ ที่สร้างจากตัวเลขตอนเปิดตัวจะต้องทำใหม่ในไตรมาสแรก นั่นไม่ใช่คำวิจารณ์ — การเปิดเผยตัวเลขทั้งสองตั้งแต่แรกถือว่าซื่อสัตย์กว่าคนส่วนใหญ่ — แต่มันคือตัวเลขที่ควรอยู่ในสเปรดชีต
Google ยังไม่ระบุว่า Gemini 3.1 Flash TTS Preview จะถูกยกเลิกหรือไม่ เพียงแต่ระบุว่า Flash-Lite TTS ถูกวางตำแหน่งให้เป็นตัวแทนหลักที่ทำหน้าที่แทน ใครก็ตามที่ยังใช้โมเดลพรีวิวนี้อยู่ควรวางแผนย้ายระบบ แทนที่จะรอประกาศปิดให้บริการ

