การ์ด hero ที่สร้างขึ้นสำหรับ 'Gemini 3.8 TTS: นกกระทุงสองตัว สองโมเดล' บนพื้นหลังสีขาวพร้อมเน้นไล่ระดับสีฟ้าและสีฟ้าครามแบบนุ่มนวล การ์ดสามใบระบุข้อความว่า 'Gemini 3.8 Flash TTS — Elo 1,260, อันดับ 2, 8 เสียงใน arena, $9.00 ต่อ 1 ล้านโทเคนเสียง', 'Gemini 3.8 Flash-Lite TTS — Elo 1,235, อันดับ 6, $6.00 ต่อ 1 ล้านโทเคนเสียง' และ 'บทสนทนาสองผู้พูด — รองรับ, การออกแบบเสียง, การจำลองเสียง 30 วินาที' บรรทัดท้ายระบุว่า 'Elo อ้างอิงจาก Artificial Analysis Provider Voice Arena, กันยายน 2026; ราคาตามที่ Google ประกาศ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 TTS: นกกระทุงสองตัว สองโมเดล และราคาที่เพิ่มเป็นสองเท่าในเดือนมกราคม

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

วิธีที่เร็วที่สุดในการทำความเข้าใจว่าผู้ขายส่งมอบอะไรเมื่อวันที่ 23 กันยายน 2026 คือการดูเดโมที่เผยแพร่กันไปพร้อมกับมัน: นกกระทุงสองตัวกำลังเถียงกันว่าจะย้ายไป Pacifica Pier ดีไหม โดยแต่ละตัวมีเสียงของตัวเอง และมีบทพูดกำหนดไว้ทีละรอบGemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTSเป็นสองโมเดลที่อยู่เบื้องหลังเดโมนั้น ทั้งคู่พร้อมใช้งานทั่วไปบน Gemini API และนกกระทุงก็ไม่ใช่แค่กลเม็ดเล่น ๆ พวกมันเป็นสิ่งแรกในเจนเนอเรชันนี้ที่โมเดลเสียง Gemini รุ่นก่อนทำไม่ได้เลย: ผู้พูดสองคน หนึ่งเจนเนอเรชัน สคริปต์ที่ควบคุมว่าใครพูดอะไร

ราคาเป็นอีกครึ่งหนึ่งของเรื่องราว และเป็นจุดที่สองโมเดลแยกจากกัน Flash TTS คิดค่าบริการที่ $0.50 ต่อหนึ่งล้านโทเค็นข้อความขาเข้า และ $9.00 ต่อหนึ่งล้านโทเค็นเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น $18.00; Flash-Lite TTS คิดค่าบริการที่ $0.50 และ $6.00 ตามกำหนดการเดียวกัน จากนั้นเป็น $12.00 นั่นคืออัตราของ Google เอง เมื่อ Artificial Analysis แปลงเป็นเกณฑ์ต่อหนึ่งล้านตัวอักษร เพื่อให้เทียบอยู่บนกระดานเดียวกับรายอื่น ๆ ได้ คิดออกมาที่ $16.50 และ $11.00 — ถูกกว่าประมาณหนึ่งในสามสำหรับรุ่น Lite และทั้งคู่ต่ำกว่าอัตราที่เจ้าที่อยู่อันดับต้น ๆ ของกระดานนั้นเรียกเก็บอยู่มาก

ดังนั้น คำถามที่น่าสนใจจึงไม่ใช่ว่าโมเดลพวกนี้ดีหรือไม่ แต่คือคุณควรสร้างต่อยอดบนตัวใดในสองตัวนี้ เพราะช่องว่างระหว่างพวกมันไม่ใช่ช่องว่างที่คุณจะเดาได้จากชื่อของมัน

เนื้อหาจริง ๆ ของประกาศเมื่อวันที่ 23 กันยายนคืออะไร

สองโมเดล ไม่ใช่หนึ่ง และ Google ระบุชัดเจนว่าเป็นโมเดลแบบแยกจากกัน ไม่ใช่เวอร์ชันเล็กและเวอร์ชันใหญ่ของสิ่งเดียวกัน ประกาศดังกล่าวระบุห้าจุดที่โมเดลเหล่านี้เปิดให้ใช้งาน ได้แก่ Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook และ Google Vids — และตัวระบุ API ก็ตรงไปตรงมา: gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts

A screenshot of Google's blog post 'Gemini 3.8 text-to-speech says hello', published September 23, 2026 and credited to Leland Rechis and Alan Cowen, showing the launch announcement for Gemini 3.8 Flash TTS and Gemini 3.8 Flash-Lite TTS.

รายการความสามารถยาวกว่าที่พาดหัวข่าวบ่งชี้ จากประกาศของ Google และเอกสารการสร้างเสียงพูดของ Gemini API:

• การออกแบบเสียง — คุณอธิบายเสียงเป็นคำพูดแล้วได้รับ ID เสียงที่กำหนดเองกลับมา แทนที่จะเลือกจากรายการที่กำหนดไว้

• {{1}}การจำลองเสียง{{/1}} — {{2}}ตัวอย่างเสียง 30 วินาที{{/2}}จะสร้าง Voice ID ซึ่งเป็นเส้นทางที่ทีมส่วนใหญ่จะใช้งานจริงสำหรับเสียงแบรนด์หรือผู้บรรยาย

• บทสนทนาของผู้พูดสองคน — กรณีเพลิแกน สคริปต์มีการสลับผู้พูด แทนที่จะเป็นร้อยแก้วก้อนเดียว

• การจัดสไตล์ระดับเทิร์น — เอกสารอธิบาย annotation ชื่อ speech_metadata ที่แนบคำสั่งกำกับเข้ากับเทิร์นที่เฉพาะเจาะจง แทนที่จะแนบกับคำขอทั้งหมด

• เสียงที่สร้างไว้ล่วงหน้า พร้อม Extended Voice Library ที่เข้าถึงได้ที่ GET /v1beta/voices

• การเข้ารหัสเสียง 3 รูปแบบ — ค่าเริ่มต้นคือ WAV โดยมี mulaw และ alaw ให้ใช้สำหรับไปป์ไลน์ที่เน้นงานโทรศัพท์

• รับข้อความเข้าเท่านั้น ส่งเสียงออกเท่านั้น เอกสารระบุไว้ตรง ๆ เกี่ยวกับเรื่องนี้ว่า โมเดล TTS ไม่รับอินพุตในรูปแบบอื่นใด และไม่ให้เอาต์พุตในรูปแบบอื่นใด และยังมีส่วนข้อจำกัด (Limitations) แยกต่างหากที่ระบุข้อจำกัดต่าง ๆ ไว้

สิ่งที่ไม่มีในประกาศคือตัวเลขใด ๆ ที่ผู้วางแผนขีดความสามารถจำเป็นต้องรู้ ขีดจำกัดอัตรา โควตา และอายุการจัดเก็บของเสียงที่ออกแบบไว้ ล้วนอยู่ในเอกสารและหน้าลาค่า ไม่ใช่ในโพสต์เปิดตัว ซึ่งเป็นเหตุผลปกติที่สัปดาห์เปิดตัวจะราบรื่นสำหรับเดโมและย่ำแย่สำหรับโปรดักชัน

A screenshot of the Gemini API speech-generation documentation, showing the two model identifiers gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts alongside the speech generation request and response format.

นกกระทุงคือข่าวจริงๆ

TTS แบบผู้พูดคนเดียวเป็นปัญหาที่แก้ได้ดีพอสมควรแล้วมาตั้งแต่สองปีก่อน สิ่งที่ยังขาดคือโมเดลที่จะแยกสองตัวตนออกจากกันตลอดสคริปต์ยาวโดยไม่เพี้ยน และนั่นคือสิ่งที่เดโมกำลังทดสอบจริง ๆ ไม่ใช่ว่าเสียงฟังดูเหมือนมนุษย์หรือไม่ แต่คือผู้พูด A ยังคงเป็นผู้พูด A อยู่หรือไม่เมื่อผ่านไปสี่นาที

มีสองสิ่งที่ตามมาจากเรื่องนั้น และสิ่งเหล่านี้คือเหตุผลที่เรื่องนี้สำคัญเกินกว่าจะเป็นแค่ของเล่นสำหรับพอดแคสต์

ประการแรกคือหน่วยของงานเปลี่ยนไป ด้วยโมเดลแบบผู้พูดคนเดียว บทสนทนายี่สิบนาทีคือออดิโอ 20 นาทีที่คุณต้องเย็บต่อจากสองรอบการรันที่เป็นอิสระจากกัน และทุกจุดเชื่อมต่อคือจุดที่ท่วงทำนองเสียงรีเซ็ต ด้วยโมเดลแบบสองผู้พูด มันคือการเรียกครั้งเดียว บริบทเดียว และโมเดลสามารถตอบสนองต่อบทพูดก่อนหน้าได้ นั่นคือความแตกต่างเชิงคุณภาพที่คุณไม่สามารถซื้อคืนมาได้ด้วยการประมวลผลภายหลัง

ข้อที่สองคือรูปแบบสคริปต์กลายเป็นอินเทอร์เฟซ หากไปป์ไลน์ของคุณส่งออกสิ่งที่มีลักษณะคล้าย SSML อยู่แล้ว — คำอธิบายประกอบหนึ่งรายการต่อวลี — การสร้างครั้งนี้ก็แทบจะใช้แทนกันได้ทันที หากไปป์ไลน์ของคุณยื่นข้อความยาวเป็นกำแพงให้โมเดลแล้วหวังเอา ตอนนี้คุณมีเหตุผลที่จะปรับโครงสร้างมันใหม่ เพราะการจัดสไตล์ที่เคยเป็นนัยโดยปริยาย ตอนนี้กลายเป็นสิ่งที่คุณต้องพูดออกมาดัง ๆ นั่นคือข้อแลกเปลี่ยนแบบเดียวกับที่ส่วนที่เหลือของวงการกำลังทำในรูปแบบต่าง ๆ และมันคือแกนที่โมเดล Google สองตัวนี้แข่งขันกับทุกสิ่งทุกอย่างบนกระดาน

หนึ่งชั่วโมงของเสียงนกกระทุงสองตัวมีค่าใช้จ่ายเท่าไร

การคำนวณโทเคนคุ้มค่าที่จะทำสักครั้ง เพราะตัวเลขต่อล้านโทเคนเสียงไม่ใช่ตัวเลขต่อชั่วโมง และความแตกต่างนี้ทำให้ผู้คนประหลาดใจ

โทเค็นเสียงถูกสร้างในอัตราคงที่ต่อวินาทีของเอาต์พุต ดังนั้นต้นทุนจึงแปรผันตามความยาวของเสียงที่เสร็จแล้ว ไม่ใช่ความยาวของสคริปต์ ลองดูอัตราของ Google เองสำหรับ Flash TTS — 9.00 ดอลลาร์ต่อโทเค็นเสียงขาออกหนึ่งล้านโทเค็น — และการคำนวณสำหรับชิ้นงานเสียงความยาวหนึ่งชั่วโมงที่เสร็จแล้วจะอยู่ในหลักหน่วยดอลลาร์บนระดับมาตรฐาน โดยโมเดล Lite อยู่ที่สองในสามของจำนวนนั้น ราคาแบบ Batch และ Flex ซึ่งอยู่ที่ 0.25 ดอลลาร์ขาเข้าและ 4.50 ดอลลาร์ขาออกสำหรับ Flash TTS เทียบกับ 0.25 และ 3.00 สำหรับ Flash-Lite TTS ช่วยลดต้นทุนลงอีกสำหรับงานที่ไม่จำเป็นต้องสร้างตามต้องการ ส่วน Priority ซึ่งอยู่ที่ 0.90 และ 16.00 สำหรับงานที่จำเป็นต้องสร้างตามต้องการ

ผลในทางปฏิบัติสามประการ:

• การสร้างย่อหน้าใหม่มีต้นทุนต่ำ แต่การสร้างทั้งซีรีส์ใหม่คือการตัดสินใจ ด้วยอัตราแบบนี้ ส่วนที่แพงที่สุดของไปป์ไลน์เสียงพูดจึงไม่ใช่การอนุมานอีกต่อไป แต่กลับกลายเป็นมนุษย์ที่อนุมัติเทคแทน

• อัตราค่าอินพุตข้อความไม่มีนัยสำคัญ $0.50 ต่อหนึ่งล้านโทเค็นข้อความบนสคริปต์ไม่กี่พันคำเป็นแค่ความคลาดเคลื่อนจากการปัดเศษเมื่อเทียบกับฝั่งเสียง อย่าปรับสคริปต์เพื่อความยาว

• จุดเปลี่ยนแปลงวันที่ 31 ธันวาคมเป็นเรื่องจริง และมันทำให้อัตราค่าเสียงเพิ่มเป็นสองเท่า หากคุณกำลังวางแผนการเปิดตัวในปี 2027 จงตั้งงบด้วยตัวเลขหลังโปรโมชัน ไม่ใช่ตัวเลขตอนเปิดตัว ไม่อย่างนั้นคุณจะต้องกลับมาวางแผนใหม่ในเดือนมกราคม

จำนวนที่เป็นอิสระ และจำนวนที่ไม่ใช่

ตัวเลขหนึ่งในงานเปิดตัวนี้มาจากที่อื่นที่ไม่ใช่ Google บน Artificial Analysis Provider Voice Arena ซึ่งเก็บข้อมูลเมื่อวันที่ 24 กันยายน 2026 Gemini 3.8 Flash TTS อยู่ในอันดับ 2 ด้วยค่า Elo 1,260 จาก 1,999 ตัวอย่างและ 8 เสียงในอารีนา และ Gemini 3.8 Flash-Lite TTS อยู่ในอันดับ 6 ด้วยค่า 1,235 จาก 2,000 ตัวอย่าง ทั้งสองอยู่ในช่วงความเชื่อมั่นของกันและกันที่ ±16 และ ±17 ดังนั้นตารางนี้จึงบอกคุณว่าทั้งสองแยกออกจากกันไม่ได้ทางสถิติในแง่ความชอบ — ซึ่งเป็นผลลัพธ์ที่มีประโยชน์จริง ๆ เพราะหมายความว่ารุ่นที่ถูกกว่าไม่ได้แย่กว่าอย่างวัดได้ในสายตาของผู้ฟัง

ทุกสิ่งทุกอย่างที่เหลือเป็นคำกล่าวอ้างของ Google เอง และควรอ่านในฐานะเช่นนั้น ทั้งเรื่องความสามารถในการแสดงอารมณ์ของภาษา จำนวนภาษาที่รองรับ และคุณภาพของการจำลองแบบ อารีนาให้เพียงการจัดอันดับความชอบเท่านั้น และไม่มีอะไรอื่น มันไม่ได้บอกคุณว่าโมเดลแต่ละตัวจัดการกับบทพูดยาว 40 นาทีโดยไม่เพี้ยนได้อย่างไร มันทำงานอย่างไรกับคำวิสามานยนามที่ไม่เคยเห็นมาก่อน หรือเกิดอะไรขึ้นกับเสียงที่ออกแบบไว้หลังจากผ่านไปหนึ่งสัปดาห์

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard captured September 24, 2026, showing Google Gemini 3.8 Flash TTS at rank 2 with an Elo of 1,260 across 1,999 samples and Gemini 3.8 Flash-Lite TTS at rank 6 with an Elo of 1,235, with Cartesia Sonic 3.6, Qwen-Audio-3.0-TTS-Plus, Inworld Realtime TTS-2 and BreezeBlue Breeze TTS 2 filling the rows between and around them.

โมเดล Lite ยังเป็นข้อโต้แย้งที่ดีกว่าว่าคู่นี้เป็นความแตกต่างจริง ไม่ใช่แค่ระดับการตลาด ช่องว่าง Elo 25 จุดที่อยู่ภายในช่วงความคลาดเคลื่อน เมื่อเทียบกับช่องว่างราคา 33% คือรูปแบบของการตัดสินใจที่ไปป์ไลน์ที่อ่อนไหวต่อราคาควรเลือก Lite แทบทุกครั้ง — และเป็นรูปแบบของการตัดสินใจที่ไปป์ไลน์ที่อ่อนไหวต่อความหน่วงควรทำในทิศทางตรงกันข้าม เนื่องจากทั้งสองแตกต่างกันทั้งในแง่เวลาและค่าใช้จ่าย

จะรันมันที่ไหน และคำตอบแบบตรงไปตรงมาของคำถามข้อนั้น

OrcaRouter ไม่ได้โฮสต์เอนด์พอยต์ของ Gemini 3.8 TTS เรื่องนี้ควรพูดอย่างตรงไปตรงมาแทนที่จะบอกเป็นนัยเป็นอย่างอื่น เพราะสิ่งที่มีประโยชน์ซึ่งเราพูดได้เกี่ยวกับสองโมเดลนี้ ไม่ใช่ว่าเราให้บริการพวกมัน — เราไม่ได้ให้บริการ — แต่คือการที่ผู้ขายลดราคา อย่างการเปลี่ยนแปลงเมื่อวันที่ 31 ธันวาคม เป็นเหตุการณ์แบบที่ทำให้การจัดเส้นทางคุ้มค่าที่จะมีไว้

OrcaRouter วาง โมเดลกว่า 200 รายการไว้เบื้องหลังคีย์ API เพียงคีย์เดียว ในราคา ราคาตามที่ผู้ให้บริการประกาศโดยไม่มีค่าบวกเพิ่ม ดังนั้นอัตราค่าบริการของผู้ให้บริการคือสิ่งที่คุณจ่าย และเมื่อมีการเปลี่ยนแปลง ฝั่งเราจะอัปเดตให้ในวันเดียวกัน ไม่ใช่รอถึงรอบบิลถัดไป สำหรับไปป์ไลน์เสียงที่อยู่ระหว่างการย้ายระบบ เลเยอร์สำรองเมื่อระบบล้มเหลวสำคัญกว่าตัวแค็ตตาล็อก: คุณกำหนดเส้นทางคำขอไปยังโมเดลที่ยังอยู่ระหว่างการประเมินได้ โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับมัน เพราะคำขอที่ล้มเหลวสามารถตกต่อไปยังสิ่งที่พิสูจน์แล้วได้ DSL สำหรับการจัดเส้นทางประกอบโมเดลหลายตัวเข้าเป็นคำขอเดียวสำหรับกรณีที่เสียงเดียวไม่ดีพอ และ model fusion ตอบพรอมป์ต์ด้วยคณะผู้ตอบ สำหรับเมื่อคำตอบสำคัญกว่าความหน่วง

สำหรับตัวโมเดล Gemini 3.8 TTS เอง จุดที่ใช้เรียกใช้งานคือ API ของ Google เอง และเป็นช่องทางต่าง ๆ ที่ Google ระบุชื่อไว้เมื่อวันที่ 23 กันยายน สิ่งที่โมเดลคู่นี้ทำกับสถาปัตยกรรมของคุณ — การเรียกครั้งเดียวสำหรับผู้พูดสองคน การจัดสไตล์เป็นคำอธิบายประกอบ เสียงที่สามารถอธิบายได้แทนที่จะต้องเลือก — คือส่วนที่จะอยู่ยืนยาวกว่าส่วนลดเปิดตัว

สิ่งที่ควรดูต่อไป

สามสิ่งจะตัดสินว่าเจนเนอเรชันนี้จะเป็นการเปลี่ยนแปลงครั้งใหญ่หรือเป็นเพียงฟีเจอร์

ประการแรกคือดริฟต์ ยังไม่มีใครเผยแพร่การประเมินฉบับยาวว่าเส้นทางแบบผู้พูดสองคนรักษาอัตลักษณ์ได้ตลอดหนึ่งชั่วโมงเต็มหรือไม่ และจนกว่าจะมีใครทำได้ pelican demo ก็เป็นเพียงเดโม ประการที่สองคืออายุการใช้งานของเสียง เสียงที่ออกแบบไว้ซึ่งหมดอายุภายในหนึ่งสัปดาห์เป็นเพียงต้นแบบ ส่วนเสียงที่สามารถสร้างขึ้นใหม่ได้จากคอนฟิกที่จัดเก็บไว้คือผลิตภัณฑ์ และคำตอบขึ้นอยู่กับว่าคุณเก็บตัวระบุตัวใดจากสองตัวนั้นไว้ ประการที่สามคือสิ่งที่เกิดขึ้นหลังวันที่ 31 ธันวาคม เมื่ออัตราโปรโมชันสิ้นสุดลง และค่าใช้จ่ายต่อชั่วโมงของไปป์ไลน์เสียงจะเพิ่มเป็นสองเท่าภายในชั่วข้ามคืน

ไม่มีสิ่งใดในนั้นที่มองเห็นได้จากโพสต์เปิดตัว ทั้งสามสิ่งมองเห็นได้จากเอกสาร ซึ่งเป็นจุดที่การรายงานข่าวเปิดตัวหยุดอ่านไว้แค่นั้น

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube