
สร้างและปรับใช้เสียงแบบกำหนดเองด้วย Gemini 3.8 Flash TTS: การออกแบบเสียง การโคลนเสียง และสองนาฬิกาที่ตัดสิน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 506 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 184 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1285 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 118 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS ต่างก็ให้คุณประดิษฐ์เสียงขึ้นมาจากคำบรรยายเป็นลายลักษณ์อักษร แทนที่จะเลือกจากรายการ และทั้งคู่เปิดให้ใช้งานทั่วไปบน Gemini API เมื่อวันที่ 23 กันยายน 2026 พาดหัวข่าวที่ผู้คนพูดถึงซ้ำ ๆ คือการออกแบบเสียง ส่วนที่คุ้มค่าจะวางแผนรับมือด้วยคือสิ่งที่เกิดขึ้นกับเสียงที่ออกแบบไว้หลังจากนั้น เพราะผู้ให้บริการมีสองวิธีให้คุณเก็บเสียงไว้หนึ่งเสียง และกำหนดอายุการใช้งานที่แตกต่างกันให้แต่ละวิธี ถ้าเลือกผิด เสียงที่ผลิตภัณฑ์ของคุณพึ่งพาอยู่จะหมดอายุภายในหนึ่งสัปดาห์
นั่นคือช่องว่างในการรายงานข่าวการเปิดตัวจนถึงตอนนี้ โพสต์ประกาศอธิบายว่าคุณสามารถพรอมป์ให้เสียงเกิดขึ้นมาได้ และบางโพสต์กล่าวถึงการโคลนจากตัวอย่างความยาว 30 วินาที แต่ไม่มีโพสต์ใดอธิบายโมเดลการจัดเก็บอย่างละเอียด ซึ่งเป็นสิ่งที่ตัดสินว่าไปป์ไลน์เสียงพูดจะทำซ้ำได้จากไฟล์คอนฟิกหรือต้องจัดเตรียมใหม่ตามกำหนดเวลา บทความนี้ครอบคลุมเส้นทางทั้งหมด — ออกแบบ จัดเก็บ เรียกใช้ และจ่ายเงิน — พร้อมราคาและโควตาตามที่ Google เผยแพร่
มีอะไรเปิดตัวเมื่อวันที่ 23 กันยายน
สองโมเดล สคีมา API เดียว ตัวระบุคือ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts และเอกสารของ Google ก็ระบุไว้อย่างชัดเจนว่าทั้งสองใช้ "สคีมา API และรูปแบบการพรอมต์เดียวกันทุกประการ" — การสลับไปมาระหว่างสองตัวนี้จึงเป็นการเปลี่ยนพารามิเตอร์เพียงหนึ่งตัว ไม่ใช่การเขียนใหม่ทั้งหมด
• อินพุต — ข้อความเท่านั้น โมเดลทั้งสองรับข้อความและส่งคืนเสียง พวกมันไม่ใช่มัลติโมดัลและไม่สร้างข้อความกลับมา
• เอาต์พุต — WAV, PCM แบบ signed 16 บิต โมโน 24 kHz บนปลายทางแบบ unary; PCM แบบไม่มีเฮดเดอร์ (audio/l16) บนปลายทางแบบสตรีมมิง; audio/mulaw และ audio/alaw ยอมรับได้พร้อมอัตราการสุ่มตัวอย่างที่กำหนดค่าได้
• ภาษา — 130 ภาษาใน Flash TTS, 101 ภาษาใน Flash-Lite TTS โดยตรวจจับจากข้อความอัตโนมัติแทนการระบุในคำขอ
• เสียง — เสียงสตูดิโอที่คัดสรรมา 30 เสียงซึ่งระบุไว้ในเอกสาร (รวมถึง Kore และ Puck) พร้อม Extended Voice Library ที่มีอีก "หลายร้อย" เสียงซึ่งค้นหาได้ผ่าน voices endpoint บวกกับสองเส้นทางการสร้างด้านล่าง
• การกำกับ — การควบคุมการส่งบทแบบบรรทัดต่อบรรทัด ฉากที่มีผู้พูดสองคนซึ่งจัดวางจากสคริปต์เดียว และสัญญาณที่ไม่ใช่คำพูด เช่น <laughs>, <sigh> และ |mhm| ที่เขียนลงในทรานสคริปต์โดยตรง
สองระดับนี้มีอยู่เพราะลักษณะงานแตกต่างกันออกไป Flash TTS ถูกวางตำแหน่งไว้สำหรับความเที่ยงตรงด้านเสียงสูงสุดและงานการแสดงที่ซับซ้อน ส่วน Flash-Lite TTS นั้น Google เองอธิบายว่าเป็น "ตัวแทนงานหนัก" สำหรับ gemini-3.1-flash-tts-preview โดยมุ่งเป้าไปที่การพากย์เสียงจำนวนมาก ฟีเจอร์อ่านออกเสียง และแคสเคดของเอเจนต์เสียง ทั้งสองรุ่นมาแทนที่โมเดลพรีวิวเพียงตัวเดียวที่อยู่บน API ตั้งแต่เดือนเมษายน 2026 ดังนั้นหากคุณเคยใช้รุ่นพรีวิว การย้ายระบบจึงเป็นการตัดสินใจเลือกระดับ ไม่ใช่แค่การเพิ่มเวอร์ชัน

การออกแบบเสียงคือพรอมต์ และนั่นทำให้ขั้นตอนการตรวจสอบเปลี่ยนไป
ส่วนการสร้างคือสิ่งใหม่จริง ๆ ในเจเนอเรชันนี้ เสียงที่พรอมต์ถูกสร้างจากคำอธิบายภาษาธรรมชาติ — บทบาท สำเนียง ลักษณะเสียง — และให้ตัวระบุที่คุณนำไปใช้ซ้ำ ใน API นี่คือการเรียกสร้างเสียงด้วย store: true และอินพุตแบบพรอมต์; ในตัวอย่างของ Google เอง คำอธิบายมีตั้งแต่ดีเจเมลเบิร์นที่เต็มไปด้วยพลังไปจนถึงมังกรญี่ปุ่น เมื่อสร้างแล้ว เสียงจะถูกอ้างอิงในคำขอเสียงพูดด้วยตัวระบุของมัน และคำสั่งสไตล์ต่อคำขอจะน้อยที่สุดหรือว่างเปล่าได้ เพราะคาแรกเตอร์ถูกฝังอยู่ในเสียงแล้ว
ผลที่เกิดขึ้นจริงคือการเปลี่ยนแปลงขั้นตอนการทำงาน ไม่ใช่แค่ฟีเจอร์ใหม่ การคัดเลือกเสียงในอดีตเคยเป็นการเจรจาสิทธิ์หรือการจองสตูดิโอ ซึ่งหมายความว่าการเลือกเสียงเกิดขึ้นเพียงครั้งเดียว ในช่วงต้น และผ่านการตรวจสอบมาได้ เพราะการเปลี่ยนแปลงมีค่าใช้จ่ายสูง เมื่อเสียงคือย่อหน้าข้อความ การคัดเลือกเสียงก็กลายเป็นโทเค็นการออกแบบ — สิ่งที่ผู้จัดการผลิตภัณฑ์สามารถขอให้สุ่มใหม่ได้ในวันอังคาร ทีมที่ใส่สตริงคำอธิบายไว้ในระบบควบคุมซอร์สโค้ด และถือว่า ID เสียงที่สร้างขึ้นเป็นอาร์ติแฟกต์จากการบิลด์ จะได้ผลลัพธ์ที่สอดคล้องกันในทุกสภาพแวดล้อม ทีมที่สร้างเสียงด้วยตัวเองใน AI Studio จะไม่ได้ผลลัพธ์ที่สอดคล้องกัน และความล้มเหลวจะดูเหมือนความแตกต่างที่อธิบายไม่ได้ระหว่างเสียงใน staging และ production
นาฬิกาสองเรือน
นี่คือส่วนที่โพสต์เปิดตัวมักข้ามไป Google ให้คุณเก็บเสียงที่ออกแบบหรือจำลองไว้ได้ในหนึ่งในสองสถานะ และเสียงเหล่านั้นหมดอายุในอัตราที่แตกต่างกันอย่างมาก
• เสียงที่จัดเก็บไว้ — สร้างขึ้นโดยเปิดใช้การจัดเก็บ เสียงเหล่านี้อยู่ในโปรเจกต์ของคุณ และอยู่ภายใต้โควต้า 200 เสียงต่อโปรเจกต์ โดยมีอายุการใช้งานหนึ่งปี
• คีย์แบบไม่เก็บสถานะ — การทำสำเนาเสียงสามารถคืนค่าคีย์ที่จัดการโดยไคลเอนต์ (รูปแบบ voicekey_…) แทนตัวระบุที่จัดเก็บไว้ และคีย์นั้นมีอายุการใช้งานเจ็ดวัน
เมื่ออ่านคู่กันแล้ว คู่นั้นคือคำแนะนำในการออกแบบ เสียงแบบจัดเก็บไว้คือข้อผูกมัดระยะเวลาหนึ่งปีและเพดานสูงสุดที่ 200 ต่อโปรเจกต์ ซึ่งถือว่าใจกว้างสำหรับผลิตภัณฑ์ที่มีชุดเสียงที่คงที่ และไร้ประโยชน์สำหรับสิ่งใดก็ตามที่สร้างเสียงใหม่สำหรับลูกค้าแต่ละราย คีย์แบบไม่ระบุสถานะ (stateless key) ตรงกันข้าม: ไม่มีแรงกดดันเรื่องโควตา แต่เป็นคีย์ที่คุณต้องสร้างใหม่ทุกสัปดาห์ ซึ่งหมายความว่าแอปพลิเคชันของคุณต้องมีเส้นทางการรีเฟรช และโครงสร้างพื้นฐานของคุณต้องจัดเก็บข้อมูลรับรองที่หมุนเวียน ไม่มีอันใดผิด การเลือกโดยไม่สังเกตว่าคุณเลือกอันไหน คือวิธีที่เอเจนต์เสียงจะเงียบไปในวันที่แปด
คุณสมบัติอีกสองประการที่ติดมากับการทำเสียงจำลอง และเป็นสิ่งที่ควรรู้ก่อนที่คุณจะสัญญาสิ่งใดกับทีมกฎหมาย การสร้างเสียงที่จำลองขึ้นต้องมีบันทึกการให้ความยินยอมด้วยวาจาจากเจ้าของเสียง ซึ่งต้องตรงกับผู้พูดอ้างอิง — เป็นการตรวจสอบด้วยการพูด ไม่ใช่การติ๊กช่องทำเครื่องหมาย และผลลัพธ์มีข้อมูลแสดงที่มา: คลิปทุกชิ้นถูกใส่ลายน้ำด้วย SynthID และเสียงที่จำลองขึ้นยังมีข้อมูลรับรองเนื้อหา C2PA เพิ่มเติมอีกด้วย เส้นทางการออกแบบจงใจให้เป็นเส้นทางที่นำไปใช้ในทางที่ผิดได้ยากกว่า และอุปสรรคทั้งสองเป็นเชิงโครงสร้าง ไม่ใช่ถ้อยแถลงเชิงนโยบาย
หนึ่งความคลาดเคลื่อนที่ควรชี้ให้เห็นมากกว่าจะแก้ไข ตารางโมเดลที่รองรับของ Google ระบุว่าการออกแบบเสียงและการจำลองเสียงพร้อมใช้งานบนโมเดล 3.8 TTS ทั้งสองรุ่น ข่าวการเปิดตัวส่วนใหญ่อธิบายว่าการจำลองเสียงเป็นส่วนหนึ่งของเรื่องราวของ Flash TTS โดยเฉพาะ หากการจำลองเสียงมีผลต่อการตัดสินใจเลือกระหว่างระดับของคุณ ให้ตรวจสอบกับเอกสารของระดับที่คุณตั้งใจจะปล่อยใช้งาน แทนที่จะเชื่อบทสรุปใดบทสรุปหนึ่ง
ค่าใช้จ่ายสำหรับเสียงหนึ่งชั่วโมง
Google คิดค่าบริการเสียงพูดเป็นโทเคน ไม่ใช่ตัวอักษรหรือวินาที และการแปลงอัตรานั้นเผยแพร่ไว้แล้ว: เสียงถูกวัดที่ 25 โทเคนต่อวินาทีของเอาต์พุต ซึ่งเท่ากับ 90,000 โทเคนต่อชั่วโมง สิ่งนี้ทำให้การคำนวณง่ายเป็นพิเศษ และเป็นตัวเลขที่ควรใส่ในงบประมาณแทนอัตราต่อล้าน
• Flash TTS มาตรฐาน — $0.50 ต่อหนึ่งล้านโทเค็นข้อความขาเข้า, $9.00 ต่อหนึ่งล้านโทเค็นเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น $1.00 และ $18.00 โดย Batch และ Flex อยู่ที่ $0.25 และ $4.50; Priority อยู่ที่ $0.90 และ $16.20
• Flash-Lite TTS มาตรฐาน — $0.50 และ $6.00 จนถึงวันเดียวกัน จากนั้น $1.00 และ $12.00. Batch และ Flex $0.25 และ $3.00; Priority $0.90 และ $10.80
• ในหน่วยวินาที — Flash TTS คิดเป็นประมาณ $0.81 ต่อชั่วโมงของเสียงที่สร้างขึ้นในช่วงโปรโมชัน และประมาณ $1.62 หลังจากนั้น; Flash-Lite TTS อยู่ที่ประมาณ $0.54 และจากนั้น $1.08
• เมื่อเทียบกับโมเดลที่ถูกแทนที่ — gemini-3.1-flash-tts-previewมีราคาอยู่ที่ 1.00 ดอลลาร์และ 20.00 ดอลลาร์ต่อล้าน ดังนั้นราคาของเอาต์พุตเสียงจึงลดลง 55 เปอร์เซ็นต์สำหรับ Flash TTS และ 70 เปอร์เซ็นต์สำหรับ Flash-Lite TTS
อย่าวางแผนโดยอิงกับตัวเลขโปรโมชัน Google เผยแพร่ทั้งสองคอลัมน์ในตารางเดียวกัน ซึ่งหมายความว่าอัตราเดือนมกราคมไม่ใช่ข่าวลือที่ต้องรอค้นพบในภายหลัง — มันอยู่ในตารางราคาแล้วตั้งแต่วันนี้ และประมาณการต่อพันนาทีใด ๆ ที่คำนวณจาก $0.81 จะต้องยังใช้ได้แม้ตัวเลขนั้นถูกเพิ่มเป็นสองเท่า
จำนวนอิสระหนึ่งจำนวน และอีกหลายจำนวนที่ไม่ได้เป็นอิสระ
ประกาศของ Google เปิดด้วยผลลัพธ์ benchmark และควรอ่านตามที่มันเป็นจริง ๆ บริษัทระบุว่า Flash TTS คว้าอันดับหนึ่งใน Voice Design Benchmark ของ Hume AI ด้วยคะแนน 71.4 เป็นผู้นำด้านการจำลองสำเนียงด้วยคะแนน 60.8 และ Flash TTS กับ Flash-Lite TTS อยู่ในอันดับหนึ่งและสองใน Overall Quality Index ของ Hume พร้อมอันดับ blind-preference ที่แข็งแกร่งบน Voice Arena สำหรับภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนแบบเม็กซิกัน และฮินดี ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีการเปิดเผยผลการรันใด ๆ ต่อสาธารณะ
มีรายละเอียดหนึ่งในรายการนั้นที่ควรค่าแก่การสังเกต Alan Cowen ผู้ได้รับเครดิตว่าเป็นผู้เขียนประกาศของ Google เป็นผู้ก่อตั้ง Hume AI — แล็บที่ Voice Design Benchmark ของตนเป็นแหล่งที่มาของตัวเลขเด่นนั้น นั่นไม่ได้ทำให้ตัวเลขนั้นผิด และเกณฑ์มาตรฐานของ Hume ก็เป็นของจริง แต่ทั้งสองไม่ได้เป็นอิสระจากกัน และผู้อ่านที่กำลังชั่งน้ำหนัก 71.4 ควรรู้สิ่งนี้ก่อนจะนำไปกล่าวซ้ำว่าเป็นการยืนยันจากบุคคลที่สาม
ตัวเลขที่เก็บรวบรวมอย่างอิสระนี้อยู่บน Provider Voice Arena ของ Artificial Analysis ซึ่งเก็บข้อมูลสำหรับบทความนี้เมื่อวันที่ 24 กันยายน 2026: Gemini 3.8 Flash TTS อยู่อันดับที่สองด้วย Elo 1,260 โดยมีช่วง 17 จุดจากตัวอย่าง 1,999 ตัวอย่าง เป็นรอง Cartesia Sonic 3.6 ที่ 1,273 ส่วน Gemini 3.8 Flash-Lite TTS อยู่อันดับที่หกที่ 1,235 โมเดลที่กำลังถูกแทนที่อย่าง Gemini 3.1 Flash TTS อยู่อันดับที่สิบที่ 1,199 จากตัวอย่าง 3,430 ตัวอย่าง ความชอบของผู้ฟังแบบไม่รู้ชื่อ ไม่ใช่การประเมินของห้องแล็บเอง — และเป็นตัวเลขคุณภาพเพียงตัวเดียวในที่นี้ที่ Google ไม่ได้ว่าจ้างให้จัดทำ

จะรันมันได้ที่ไหน และที่ไหนที่ยังรันไม่ได้
ทั้งสองโมเดลพร้อมใช้งานแล้ววันนี้ใน Gemini API และ Google AI Studio โดยไม่มีรายการรอ ส่วนสำหรับผู้บริโภคและองค์กรยังอยู่ในขั้นเตรียมการมากกว่าที่จะเปิดให้ใช้แล้ว: Flash TTS กำลังจะมาใน Gemini Notebook และ Flash-Lite TTS ใน Google Vids การเข้าถึง Gemini Enterprise ถูกระบุว่ากำลังจะมาเร็ว ๆ นี้ และการรีมิกซ์เสียง — การปรับโทนเสียง ระดับเสียง จังหวะ และสำเนียงบนเสียงที่มีอยู่ — ถูกระบุว่าเป็นคุณสมบัติในอนาคตมากกว่าที่จะเป็นปัจจุบัน หากแผนของคุณขึ้นอยู่กับการรีมิกซ์เสียง มันยังไม่มีอยู่จริง
ในส่วนของเราเอง ต้องพูดตามตรงก่อนว่า เอนด์พอยต์ของ Gemini 3.8 TTS ไม่ได้อยู่ในตาราง routing ของ OrcaRouter ส่วนรุ่นที่มันเข้ามาแทนที่นั้นมีอยู่ — google/gemini-3.1-flash-tts-previewอยู่ในแค็ตตาล็อกในราคาเดียวกันคือ 1.00 ดอลลาร์และ 20.00 ดอลลาร์ต่อล้านโทเคน ตามที่ Google ประกาศไว้ เพราะราคาที่ผู้ให้บริการประกาศไว้ถูกส่งผ่านโดยไม่มีการบวกเพิ่มและมันตอบสนองที่/v1/audio/speechเอนด์พอยต์เดียวกับที่ SDK ที่เข้ากันได้กับ OpenAI ของคุณเรียกใช้งานอยู่แล้ว เรื่องนี้สำคัญกว่าที่ฟังดูสำหรับงานเวิร์กโหลดด้านเสียง เพราะสิ่งที่คุณซื้อจริง ๆ คือเอนด์พอยต์ที่มั่นคงซึ่งแอปพลิเคชันของคุณเรียกใช้ได้ ในขณะที่โมเดลที่อยู่เบื้องหลังเปลี่ยนแปลงไป โค้ดของคุณเก็บสตริงชื่อโมเดล ส่วนแค็ตตาล็อกเก็บการจัดเส้นทาง เมื่อช่วงโปรโมชันของ Google สิ้นสุดลงในวันที่ 31 ธันวาคม และราคา Flash TTS เพิ่มขึ้นเป็นสองเท่า ราคาของโมเดลที่จัดเส้นทางไว้จะเปลี่ยนในวันเดียวกัน แทนที่จะเปลี่ยนตอนต่อสัญญาครั้งถัดไป — และโมเดลที่ล่มจะสลับไปใช้ตัวสำรองแทนที่จะพาคิวการบรรยายของคุณล่มไปด้วย

หากคุณกำลังประเมินเจเนอเรชันนี้ก่อนตัดสินใจ การทดลองราคาถูกคือการทดลองแบบสองระดับ รันสคริปต์เดียวกันผ่าน Flash TTS และ Flash-Lite TTS เนื่องจากสคีมาเหมือนกันและความแตกต่างอยู่ที่พารามิเตอร์ — จากนั้นตัดสินใจด้วยเสียงของคุณเองแทนที่จะดูจากแผนภูมิ benchmark และตรวจสอบบน Artificial Analysis ว่าช่องว่างด้านคุณภาพยังคงมีอยู่แม้พิจารณาช่วงความคลาดเคลื่อนหรือไม่ ก่อนที่คุณจะจ่ายเงินส่วนเพิ่ม สำหรับโปรเจกต์บรรยายขนาดใหญ่ เงินส่วนเพิ่มนั้นเป็นเงินจำนวนมาก แต่สำหรับบอทสนับสนุนที่อ่านหมายเลขโทรศัพท์ออกเสียง มันไม่ได้ให้อะไรที่ผู้ฟังจะได้ยินอย่างชัดเจน
