การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'สร้างและปรับใช้เสียงแบบกำหนดเอง' พร้อมคำโปรย 'Gemini 3.8 Flash TTS' บนพื้นหลังสีขาวพร้อมจุดเน้นไล่เฉดสีฟ้าและสีฟ้าครามแบบนุ่มนวล การ์ดที่มีหมายเลขกำกับสามใบอ่านว่า '1 ออกแบบเสียงจากพรอมต์' '2 จัดเก็บไว้หนึ่งปี หรือถือคีย์เจ็ดวัน' และ '3 เรียก /v1/audio/speech' เหนือบรรทัดส่วนท้ายที่อ่านว่า 'Gemini API, 23 กันยายน 2026 ตัวเลขจากผู้จำหน่าย' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

สร้างและปรับใช้เสียงแบบกำหนดเองด้วย Gemini 3.8 Flash TTS: การออกแบบเสียง การโคลนเสียง และสองนาฬิกาที่ตัดสิน

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Gemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTS ต่างก็ให้คุณประดิษฐ์เสียงขึ้นมาจากคำบรรยายเป็นลายลักษณ์อักษร แทนที่จะเลือกจากรายการ และทั้งคู่เปิดให้ใช้งานทั่วไปบน Gemini API เมื่อวันที่ 23 กันยายน 2026 พาดหัวข่าวที่ผู้คนพูดถึงซ้ำ ๆ คือการออกแบบเสียง ส่วนที่คุ้มค่าจะวางแผนรับมือด้วยคือสิ่งที่เกิดขึ้นกับเสียงที่ออกแบบไว้หลังจากนั้น เพราะผู้ให้บริการมีสองวิธีให้คุณเก็บเสียงไว้หนึ่งเสียง และกำหนดอายุการใช้งานที่แตกต่างกันให้แต่ละวิธี ถ้าเลือกผิด เสียงที่ผลิตภัณฑ์ของคุณพึ่งพาอยู่จะหมดอายุภายในหนึ่งสัปดาห์

นั่นคือช่องว่างในการรายงานข่าวการเปิดตัวจนถึงตอนนี้ โพสต์ประกาศอธิบายว่าคุณสามารถพรอมป์ให้เสียงเกิดขึ้นมาได้ และบางโพสต์กล่าวถึงการโคลนจากตัวอย่างความยาว 30 วินาที แต่ไม่มีโพสต์ใดอธิบายโมเดลการจัดเก็บอย่างละเอียด ซึ่งเป็นสิ่งที่ตัดสินว่าไปป์ไลน์เสียงพูดจะทำซ้ำได้จากไฟล์คอนฟิกหรือต้องจัดเตรียมใหม่ตามกำหนดเวลา บทความนี้ครอบคลุมเส้นทางทั้งหมด — ออกแบบ จัดเก็บ เรียกใช้ และจ่ายเงิน — พร้อมราคาและโควตาตามที่ Google เผยแพร่

มีอะไรเปิดตัวเมื่อวันที่ 23 กันยายน

สองโมเดล สคีมา API เดียว ตัวระบุคือ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts และเอกสารของ Google ก็ระบุไว้อย่างชัดเจนว่าทั้งสองใช้ "สคีมา API และรูปแบบการพรอมต์เดียวกันทุกประการ" — การสลับไปมาระหว่างสองตัวนี้จึงเป็นการเปลี่ยนพารามิเตอร์เพียงหนึ่งตัว ไม่ใช่การเขียนใหม่ทั้งหมด

• อินพุต — ข้อความเท่านั้น โมเดลทั้งสองรับข้อความและส่งคืนเสียง พวกมันไม่ใช่มัลติโมดัลและไม่สร้างข้อความกลับมา

• เอาต์พุต — WAV, PCM แบบ signed 16 บิต โมโน 24 kHz บนปลายทางแบบ unary; PCM แบบไม่มีเฮดเดอร์ (audio/l16) บนปลายทางแบบสตรีมมิง; audio/mulaw และ audio/alaw ยอมรับได้พร้อมอัตราการสุ่มตัวอย่างที่กำหนดค่าได้

• ภาษา — 130 ภาษาใน Flash TTS, 101 ภาษาใน Flash-Lite TTS โดยตรวจจับจากข้อความอัตโนมัติแทนการระบุในคำขอ

• เสียง — เสียงสตูดิโอที่คัดสรรมา 30 เสียงซึ่งระบุไว้ในเอกสาร (รวมถึง Kore และ Puck) พร้อม Extended Voice Library ที่มีอีก "หลายร้อย" เสียงซึ่งค้นหาได้ผ่าน voices endpoint บวกกับสองเส้นทางการสร้างด้านล่าง

• การกำกับ — การควบคุมการส่งบทแบบบรรทัดต่อบรรทัด ฉากที่มีผู้พูดสองคนซึ่งจัดวางจากสคริปต์เดียว และสัญญาณที่ไม่ใช่คำพูด เช่น <laughs>, <sigh> และ |mhm| ที่เขียนลงในทรานสคริปต์โดยตรง

สองระดับนี้มีอยู่เพราะลักษณะงานแตกต่างกันออกไป Flash TTS ถูกวางตำแหน่งไว้สำหรับความเที่ยงตรงด้านเสียงสูงสุดและงานการแสดงที่ซับซ้อน ส่วน Flash-Lite TTS นั้น Google เองอธิบายว่าเป็น "ตัวแทนงานหนัก" สำหรับ gemini-3.1-flash-tts-preview โดยมุ่งเป้าไปที่การพากย์เสียงจำนวนมาก ฟีเจอร์อ่านออกเสียง และแคสเคดของเอเจนต์เสียง ทั้งสองรุ่นมาแทนที่โมเดลพรีวิวเพียงตัวเดียวที่อยู่บน API ตั้งแต่เดือนเมษายน 2026 ดังนั้นหากคุณเคยใช้รุ่นพรีวิว การย้ายระบบจึงเป็นการตัดสินใจเลือกระดับ ไม่ใช่แค่การเพิ่มเวอร์ชัน

A screenshot of Google's Gemini API text-to-speech documentation, captured in English on 24 September 2026, showing the 'Gemini 3.8 Flash is now available' banner, the single-speaker TTS section naming Gemini 3.8 Flash TTS (gemini-3.8-flash-tts) and Gemini 3.8 Flash-Lite TTS (gemini-3.8-flash-lite-tts), and Python sample code that passes a speaker_config with the Kore voice to the interactions endpoint.

การออกแบบเสียงคือพรอมต์ และนั่นทำให้ขั้นตอนการตรวจสอบเปลี่ยนไป

ส่วนการสร้างคือสิ่งใหม่จริง ๆ ในเจเนอเรชันนี้ เสียงที่พรอมต์ถูกสร้างจากคำอธิบายภาษาธรรมชาติ — บทบาท สำเนียง ลักษณะเสียง — และให้ตัวระบุที่คุณนำไปใช้ซ้ำ ใน API นี่คือการเรียกสร้างเสียงด้วย store: true และอินพุตแบบพรอมต์; ในตัวอย่างของ Google เอง คำอธิบายมีตั้งแต่ดีเจเมลเบิร์นที่เต็มไปด้วยพลังไปจนถึงมังกรญี่ปุ่น เมื่อสร้างแล้ว เสียงจะถูกอ้างอิงในคำขอเสียงพูดด้วยตัวระบุของมัน และคำสั่งสไตล์ต่อคำขอจะน้อยที่สุดหรือว่างเปล่าได้ เพราะคาแรกเตอร์ถูกฝังอยู่ในเสียงแล้ว

ผลที่เกิดขึ้นจริงคือการเปลี่ยนแปลงขั้นตอนการทำงาน ไม่ใช่แค่ฟีเจอร์ใหม่ การคัดเลือกเสียงในอดีตเคยเป็นการเจรจาสิทธิ์หรือการจองสตูดิโอ ซึ่งหมายความว่าการเลือกเสียงเกิดขึ้นเพียงครั้งเดียว ในช่วงต้น และผ่านการตรวจสอบมาได้ เพราะการเปลี่ยนแปลงมีค่าใช้จ่ายสูง เมื่อเสียงคือย่อหน้าข้อความ การคัดเลือกเสียงก็กลายเป็นโทเค็นการออกแบบ — สิ่งที่ผู้จัดการผลิตภัณฑ์สามารถขอให้สุ่มใหม่ได้ในวันอังคาร ทีมที่ใส่สตริงคำอธิบายไว้ในระบบควบคุมซอร์สโค้ด และถือว่า ID เสียงที่สร้างขึ้นเป็นอาร์ติแฟกต์จากการบิลด์ จะได้ผลลัพธ์ที่สอดคล้องกันในทุกสภาพแวดล้อม ทีมที่สร้างเสียงด้วยตัวเองใน AI Studio จะไม่ได้ผลลัพธ์ที่สอดคล้องกัน และความล้มเหลวจะดูเหมือนความแตกต่างที่อธิบายไม่ได้ระหว่างเสียงใน staging และ production

นาฬิกาสองเรือน

นี่คือส่วนที่โพสต์เปิดตัวมักข้ามไป Google ให้คุณเก็บเสียงที่ออกแบบหรือจำลองไว้ได้ในหนึ่งในสองสถานะ และเสียงเหล่านั้นหมดอายุในอัตราที่แตกต่างกันอย่างมาก

• เสียงที่จัดเก็บไว้ — สร้างขึ้นโดยเปิดใช้การจัดเก็บ เสียงเหล่านี้อยู่ในโปรเจกต์ของคุณ และอยู่ภายใต้โควต้า 200 เสียงต่อโปรเจกต์ โดยมีอายุการใช้งานหนึ่งปี

• คีย์แบบไม่เก็บสถานะ — การทำสำเนาเสียงสามารถคืนค่าคีย์ที่จัดการโดยไคลเอนต์ (รูปแบบ voicekey_…) แทนตัวระบุที่จัดเก็บไว้ และคีย์นั้นมีอายุการใช้งานเจ็ดวัน

เมื่ออ่านคู่กันแล้ว คู่นั้นคือคำแนะนำในการออกแบบ เสียงแบบจัดเก็บไว้คือข้อผูกมัดระยะเวลาหนึ่งปีและเพดานสูงสุดที่ 200 ต่อโปรเจกต์ ซึ่งถือว่าใจกว้างสำหรับผลิตภัณฑ์ที่มีชุดเสียงที่คงที่ และไร้ประโยชน์สำหรับสิ่งใดก็ตามที่สร้างเสียงใหม่สำหรับลูกค้าแต่ละราย คีย์แบบไม่ระบุสถานะ (stateless key) ตรงกันข้าม: ไม่มีแรงกดดันเรื่องโควตา แต่เป็นคีย์ที่คุณต้องสร้างใหม่ทุกสัปดาห์ ซึ่งหมายความว่าแอปพลิเคชันของคุณต้องมีเส้นทางการรีเฟรช และโครงสร้างพื้นฐานของคุณต้องจัดเก็บข้อมูลรับรองที่หมุนเวียน ไม่มีอันใดผิด การเลือกโดยไม่สังเกตว่าคุณเลือกอันไหน คือวิธีที่เอเจนต์เสียงจะเงียบไปในวันที่แปด

คุณสมบัติอีกสองประการที่ติดมากับการทำเสียงจำลอง และเป็นสิ่งที่ควรรู้ก่อนที่คุณจะสัญญาสิ่งใดกับทีมกฎหมาย การสร้างเสียงที่จำลองขึ้นต้องมีบันทึกการให้ความยินยอมด้วยวาจาจากเจ้าของเสียง ซึ่งต้องตรงกับผู้พูดอ้างอิง — เป็นการตรวจสอบด้วยการพูด ไม่ใช่การติ๊กช่องทำเครื่องหมาย และผลลัพธ์มีข้อมูลแสดงที่มา: คลิปทุกชิ้นถูกใส่ลายน้ำด้วย SynthID และเสียงที่จำลองขึ้นยังมีข้อมูลรับรองเนื้อหา C2PA เพิ่มเติมอีกด้วย เส้นทางการออกแบบจงใจให้เป็นเส้นทางที่นำไปใช้ในทางที่ผิดได้ยากกว่า และอุปสรรคทั้งสองเป็นเชิงโครงสร้าง ไม่ใช่ถ้อยแถลงเชิงนโยบาย

หนึ่งความคลาดเคลื่อนที่ควรชี้ให้เห็นมากกว่าจะแก้ไข ตารางโมเดลที่รองรับของ Google ระบุว่าการออกแบบเสียงและการจำลองเสียงพร้อมใช้งานบนโมเดล 3.8 TTS ทั้งสองรุ่น ข่าวการเปิดตัวส่วนใหญ่อธิบายว่าการจำลองเสียงเป็นส่วนหนึ่งของเรื่องราวของ Flash TTS โดยเฉพาะ หากการจำลองเสียงมีผลต่อการตัดสินใจเลือกระหว่างระดับของคุณ ให้ตรวจสอบกับเอกสารของระดับที่คุณตั้งใจจะปล่อยใช้งาน แทนที่จะเชื่อบทสรุปใดบทสรุปหนึ่ง

ค่าใช้จ่ายสำหรับเสียงหนึ่งชั่วโมง

Google คิดค่าบริการเสียงพูดเป็นโทเคน ไม่ใช่ตัวอักษรหรือวินาที และการแปลงอัตรานั้นเผยแพร่ไว้แล้ว: เสียงถูกวัดที่ 25 โทเคนต่อวินาทีของเอาต์พุต ซึ่งเท่ากับ 90,000 โทเคนต่อชั่วโมง สิ่งนี้ทำให้การคำนวณง่ายเป็นพิเศษ และเป็นตัวเลขที่ควรใส่ในงบประมาณแทนอัตราต่อล้าน

• Flash TTS มาตรฐาน — $0.50 ต่อหนึ่งล้านโทเค็นข้อความขาเข้า, $9.00 ต่อหนึ่งล้านโทเค็นเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น $1.00 และ $18.00 โดย Batch และ Flex อยู่ที่ $0.25 และ $4.50; Priority อยู่ที่ $0.90 และ $16.20

• Flash-Lite TTS มาตรฐาน — $0.50 และ $6.00 จนถึงวันเดียวกัน จากนั้น $1.00 และ $12.00. Batch และ Flex $0.25 และ $3.00; Priority $0.90 และ $10.80

• ในหน่วยวินาที — Flash TTS คิดเป็นประมาณ $0.81 ต่อชั่วโมงของเสียงที่สร้างขึ้นในช่วงโปรโมชัน และประมาณ $1.62 หลังจากนั้น; Flash-Lite TTS อยู่ที่ประมาณ $0.54 และจากนั้น $1.08

• เมื่อเทียบกับโมเดลที่ถูกแทนที่ — gemini-3.1-flash-tts-previewมีราคาอยู่ที่ 1.00 ดอลลาร์และ 20.00 ดอลลาร์ต่อล้าน ดังนั้นราคาของเอาต์พุตเสียงจึงลดลง 55 เปอร์เซ็นต์สำหรับ Flash TTS และ 70 เปอร์เซ็นต์สำหรับ Flash-Lite TTS

อย่าวางแผนโดยอิงกับตัวเลขโปรโมชัน Google เผยแพร่ทั้งสองคอลัมน์ในตารางเดียวกัน ซึ่งหมายความว่าอัตราเดือนมกราคมไม่ใช่ข่าวลือที่ต้องรอค้นพบในภายหลัง — มันอยู่ในตารางราคาแล้วตั้งแต่วันนี้ และประมาณการต่อพันนาทีใด ๆ ที่คำนวณจาก $0.81 จะต้องยังใช้ได้แม้ตัวเลขนั้นถูกเพิ่มเป็นสองเท่า

จำนวนอิสระหนึ่งจำนวน และอีกหลายจำนวนที่ไม่ได้เป็นอิสระ

ประกาศของ Google เปิดด้วยผลลัพธ์ benchmark และควรอ่านตามที่มันเป็นจริง ๆ บริษัทระบุว่า Flash TTS คว้าอันดับหนึ่งใน Voice Design Benchmark ของ Hume AI ด้วยคะแนน 71.4 เป็นผู้นำด้านการจำลองสำเนียงด้วยคะแนน 60.8 และ Flash TTS กับ Flash-Lite TTS อยู่ในอันดับหนึ่งและสองใน Overall Quality Index ของ Hume พร้อมอันดับ blind-preference ที่แข็งแกร่งบน Voice Arena สำหรับภาษาญี่ปุ่น โปรตุเกสแบบบราซิล เวียดนาม อาหรับมาตรฐานสมัยใหม่ สเปนแบบเม็กซิกัน และฮินดี ทั้งหมดเป็นข้อมูลที่ผู้ขายรายงานเอง ไม่มีการเปิดเผยผลการรันใด ๆ ต่อสาธารณะ

มีรายละเอียดหนึ่งในรายการนั้นที่ควรค่าแก่การสังเกต Alan Cowen ผู้ได้รับเครดิตว่าเป็นผู้เขียนประกาศของ Google เป็นผู้ก่อตั้ง Hume AI — แล็บที่ Voice Design Benchmark ของตนเป็นแหล่งที่มาของตัวเลขเด่นนั้น นั่นไม่ได้ทำให้ตัวเลขนั้นผิด และเกณฑ์มาตรฐานของ Hume ก็เป็นของจริง แต่ทั้งสองไม่ได้เป็นอิสระจากกัน และผู้อ่านที่กำลังชั่งน้ำหนัก 71.4 ควรรู้สิ่งนี้ก่อนจะนำไปกล่าวซ้ำว่าเป็นการยืนยันจากบุคคลที่สาม

ตัวเลขที่เก็บรวบรวมอย่างอิสระนี้อยู่บน Provider Voice Arena ของ Artificial Analysis ซึ่งเก็บข้อมูลสำหรับบทความนี้เมื่อวันที่ 24 กันยายน 2026: Gemini 3.8 Flash TTS อยู่อันดับที่สองด้วย Elo 1,260 โดยมีช่วง 17 จุดจากตัวอย่าง 1,999 ตัวอย่าง เป็นรอง Cartesia Sonic 3.6 ที่ 1,273 ส่วน Gemini 3.8 Flash-Lite TTS อยู่อันดับที่หกที่ 1,235 โมเดลที่กำลังถูกแทนที่อย่าง Gemini 3.1 Flash TTS อยู่อันดับที่สิบที่ 1,199 จากตัวอย่าง 3,430 ตัวอย่าง ความชอบของผู้ฟังแบบไม่รู้ชื่อ ไม่ใช่การประเมินของห้องแล็บเอง — และเป็นตัวเลขคุณภาพเพียงตัวเดียวในที่นี้ที่ Google ไม่ได้ว่าจ้างให้จัดทำ

A generated scoreboard card titled 'Gemini 3.8 Flash TTS — the scoreboard' with six rows: Arena Elo 1,260 at rank 2 over 1,999 samples; audio out $9.00 per 1M tokens to 31 December 2026; 130 languages on Flash TTS against 101 on Flash-Lite TTS; 30 studio voices plus prompt-based design; stored voices capped at 200 per project with a one-year lifetime; and a stateless voicekey with a seven-day lifetime. The footer reads 'Elo per Artificial Analysis, 24 Sept 2026; price and quotas per Google. Google's Hume AI results are vendor-reported.'

จะรันมันได้ที่ไหน และที่ไหนที่ยังรันไม่ได้

ทั้งสองโมเดลพร้อมใช้งานแล้ววันนี้ใน Gemini API และ Google AI Studio โดยไม่มีรายการรอ ส่วนสำหรับผู้บริโภคและองค์กรยังอยู่ในขั้นเตรียมการมากกว่าที่จะเปิดให้ใช้แล้ว: Flash TTS กำลังจะมาใน Gemini Notebook และ Flash-Lite TTS ใน Google Vids การเข้าถึง Gemini Enterprise ถูกระบุว่ากำลังจะมาเร็ว ๆ นี้ และการรีมิกซ์เสียง — การปรับโทนเสียง ระดับเสียง จังหวะ และสำเนียงบนเสียงที่มีอยู่ — ถูกระบุว่าเป็นคุณสมบัติในอนาคตมากกว่าที่จะเป็นปัจจุบัน หากแผนของคุณขึ้นอยู่กับการรีมิกซ์เสียง มันยังไม่มีอยู่จริง

ในส่วนของเราเอง ต้องพูดตามตรงก่อนว่า เอนด์พอยต์ของ Gemini 3.8 TTS ไม่ได้อยู่ในตาราง routing ของ OrcaRouter ส่วนรุ่นที่มันเข้ามาแทนที่นั้นมีอยู่ — google/gemini-3.1-flash-tts-previewอยู่ในแค็ตตาล็อกในราคาเดียวกันคือ 1.00 ดอลลาร์และ 20.00 ดอลลาร์ต่อล้านโทเคน ตามที่ Google ประกาศไว้ เพราะราคาที่ผู้ให้บริการประกาศไว้ถูกส่งผ่านโดยไม่มีการบวกเพิ่มและมันตอบสนองที่/v1/audio/speechเอนด์พอยต์เดียวกับที่ SDK ที่เข้ากันได้กับ OpenAI ของคุณเรียกใช้งานอยู่แล้ว เรื่องนี้สำคัญกว่าที่ฟังดูสำหรับงานเวิร์กโหลดด้านเสียง เพราะสิ่งที่คุณซื้อจริง ๆ คือเอนด์พอยต์ที่มั่นคงซึ่งแอปพลิเคชันของคุณเรียกใช้ได้ ในขณะที่โมเดลที่อยู่เบื้องหลังเปลี่ยนแปลงไป โค้ดของคุณเก็บสตริงชื่อโมเดล ส่วนแค็ตตาล็อกเก็บการจัดเส้นทาง เมื่อช่วงโปรโมชันของ Google สิ้นสุดลงในวันที่ 31 ธันวาคม และราคา Flash TTS เพิ่มขึ้นเป็นสองเท่า ราคาของโมเดลที่จัดเส้นทางไว้จะเปลี่ยนในวันเดียวกัน แทนที่จะเปลี่ยนตอนต่อสัญญาครั้งถัดไป — และโมเดลที่ล่มจะสลับไปใช้ตัวสำรองแทนที่จะพาคิวการบรรยายของคุณล่มไปด้วย

A screenshot of the OrcaRouter model page for google/gemini-3.1-flash-tts-preview, captured in English on 24 September 2026, showing the model described as Google's text-to-speech model accessed via OrcaRouter, an input price of $1.00 and output price of $20.00 per 1M tokens, a p50 time-to-first-token of 6.61 seconds and p95 of 10.00 seconds over seven days, an OpenAI-compatible base URL of https://api.orcarouter.ai/v1, and a /v1/audio/speech endpoint.

หากคุณกำลังประเมินเจเนอเรชันนี้ก่อนตัดสินใจ การทดลองราคาถูกคือการทดลองแบบสองระดับ รันสคริปต์เดียวกันผ่าน Flash TTS และ Flash-Lite TTS เนื่องจากสคีมาเหมือนกันและความแตกต่างอยู่ที่พารามิเตอร์ — จากนั้นตัดสินใจด้วยเสียงของคุณเองแทนที่จะดูจากแผนภูมิ benchmark และตรวจสอบบน Artificial Analysis ว่าช่องว่างด้านคุณภาพยังคงมีอยู่แม้พิจารณาช่วงความคลาดเคลื่อนหรือไม่ ก่อนที่คุณจะจ่ายเงินส่วนเพิ่ม สำหรับโปรเจกต์บรรยายขนาดใหญ่ เงินส่วนเพิ่มนั้นเป็นเงินจำนวนมาก แต่สำหรับบอทสนับสนุนที่อ่านหมายเลขโทรศัพท์ออกเสียง มันไม่ได้ให้อะไรที่ผู้ฟังจะได้ยินอย่างชัดเจน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube