
Gemini 3.8 TTS: นกกระทุงสองตัว สองโมเดล และราคาที่เพิ่มเป็นสองเท่าในเดือนมกราคม
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
วิธีที่เร็วที่สุดในการทำความเข้าใจว่าผู้ขายส่งมอบอะไรเมื่อวันที่ 23 กันยายน 2026 คือการดูเดโมที่เผยแพร่กันไปพร้อมกับมัน: นกกระทุงสองตัวกำลังเถียงกันว่าจะย้ายไป Pacifica Pier ดีไหม โดยแต่ละตัวมีเสียงของตัวเอง และมีบทพูดกำหนดไว้ทีละรอบGemini 3.8 Flash TTS และ Gemini 3.8 Flash-Lite TTSเป็นสองโมเดลที่อยู่เบื้องหลังเดโมนั้น ทั้งคู่พร้อมใช้งานทั่วไปบน Gemini API และนกกระทุงก็ไม่ใช่แค่กลเม็ดเล่น ๆ พวกมันเป็นสิ่งแรกในเจนเนอเรชันนี้ที่โมเดลเสียง Gemini รุ่นก่อนทำไม่ได้เลย: ผู้พูดสองคน หนึ่งเจนเนอเรชัน สคริปต์ที่ควบคุมว่าใครพูดอะไร
ราคาเป็นอีกครึ่งหนึ่งของเรื่องราว และเป็นจุดที่สองโมเดลแยกจากกัน Flash TTS คิดค่าบริการที่ $0.50 ต่อหนึ่งล้านโทเค็นข้อความขาเข้า และ $9.00 ต่อหนึ่งล้านโทเค็นเสียงขาออก ไปจนถึงวันที่ 31 ธันวาคม 2026 จากนั้นเป็น $18.00; Flash-Lite TTS คิดค่าบริการที่ $0.50 และ $6.00 ตามกำหนดการเดียวกัน จากนั้นเป็น $12.00 นั่นคืออัตราของ Google เอง เมื่อ Artificial Analysis แปลงเป็นเกณฑ์ต่อหนึ่งล้านตัวอักษร เพื่อให้เทียบอยู่บนกระดานเดียวกับรายอื่น ๆ ได้ คิดออกมาที่ $16.50 และ $11.00 — ถูกกว่าประมาณหนึ่งในสามสำหรับรุ่น Lite และทั้งคู่ต่ำกว่าอัตราที่เจ้าที่อยู่อันดับต้น ๆ ของกระดานนั้นเรียกเก็บอยู่มาก
ดังนั้น คำถามที่น่าสนใจจึงไม่ใช่ว่าโมเดลพวกนี้ดีหรือไม่ แต่คือคุณควรสร้างต่อยอดบนตัวใดในสองตัวนี้ เพราะช่องว่างระหว่างพวกมันไม่ใช่ช่องว่างที่คุณจะเดาได้จากชื่อของมัน
เนื้อหาจริง ๆ ของประกาศเมื่อวันที่ 23 กันยายนคืออะไร
สองโมเดล ไม่ใช่หนึ่ง และ Google ระบุชัดเจนว่าเป็นโมเดลแบบแยกจากกัน ไม่ใช่เวอร์ชันเล็กและเวอร์ชันใหญ่ของสิ่งเดียวกัน ประกาศดังกล่าวระบุห้าจุดที่โมเดลเหล่านี้เปิดให้ใช้งาน ได้แก่ Google AI Studio, Gemini API, Gemini Enterprise, Gemini Notebook และ Google Vids — และตัวระบุ API ก็ตรงไปตรงมา: gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts

รายการความสามารถยาวกว่าที่พาดหัวข่าวบ่งชี้ จากประกาศของ Google และเอกสารการสร้างเสียงพูดของ Gemini API:
• การออกแบบเสียง — คุณอธิบายเสียงเป็นคำพูดแล้วได้รับ ID เสียงที่กำหนดเองกลับมา แทนที่จะเลือกจากรายการที่กำหนดไว้
• {{1}}การจำลองเสียง{{/1}} — {{2}}ตัวอย่างเสียง 30 วินาที{{/2}}จะสร้าง Voice ID ซึ่งเป็นเส้นทางที่ทีมส่วนใหญ่จะใช้งานจริงสำหรับเสียงแบรนด์หรือผู้บรรยาย
• บทสนทนาของผู้พูดสองคน — กรณีเพลิแกน สคริปต์มีการสลับผู้พูด แทนที่จะเป็นร้อยแก้วก้อนเดียว
• การจัดสไตล์ระดับเทิร์น — เอกสารอธิบาย annotation ชื่อ speech_metadata ที่แนบคำสั่งกำกับเข้ากับเทิร์นที่เฉพาะเจาะจง แทนที่จะแนบกับคำขอทั้งหมด
• เสียงที่สร้างไว้ล่วงหน้า พร้อม Extended Voice Library ที่เข้าถึงได้ที่ GET /v1beta/voices
• การเข้ารหัสเสียง 3 รูปแบบ — ค่าเริ่มต้นคือ WAV โดยมี mulaw และ alaw ให้ใช้สำหรับไปป์ไลน์ที่เน้นงานโทรศัพท์
• รับข้อความเข้าเท่านั้น ส่งเสียงออกเท่านั้น เอกสารระบุไว้ตรง ๆ เกี่ยวกับเรื่องนี้ว่า โมเดล TTS ไม่รับอินพุตในรูปแบบอื่นใด และไม่ให้เอาต์พุตในรูปแบบอื่นใด และยังมีส่วนข้อจำกัด (Limitations) แยกต่างหากที่ระบุข้อจำกัดต่าง ๆ ไว้
สิ่งที่ไม่มีในประกาศคือตัวเลขใด ๆ ที่ผู้วางแผนขีดความสามารถจำเป็นต้องรู้ ขีดจำกัดอัตรา โควตา และอายุการจัดเก็บของเสียงที่ออกแบบไว้ ล้วนอยู่ในเอกสารและหน้าลาค่า ไม่ใช่ในโพสต์เปิดตัว ซึ่งเป็นเหตุผลปกติที่สัปดาห์เปิดตัวจะราบรื่นสำหรับเดโมและย่ำแย่สำหรับโปรดักชัน

นกกระทุงคือข่าวจริงๆ
TTS แบบผู้พูดคนเดียวเป็นปัญหาที่แก้ได้ดีพอสมควรแล้วมาตั้งแต่สองปีก่อน สิ่งที่ยังขาดคือโมเดลที่จะแยกสองตัวตนออกจากกันตลอดสคริปต์ยาวโดยไม่เพี้ยน และนั่นคือสิ่งที่เดโมกำลังทดสอบจริง ๆ ไม่ใช่ว่าเสียงฟังดูเหมือนมนุษย์หรือไม่ แต่คือผู้พูด A ยังคงเป็นผู้พูด A อยู่หรือไม่เมื่อผ่านไปสี่นาที
มีสองสิ่งที่ตามมาจากเรื่องนั้น และสิ่งเหล่านี้คือเหตุผลที่เรื่องนี้สำคัญเกินกว่าจะเป็นแค่ของเล่นสำหรับพอดแคสต์
ประการแรกคือหน่วยของงานเปลี่ยนไป ด้วยโมเดลแบบผู้พูดคนเดียว บทสนทนายี่สิบนาทีคือออดิโอ 20 นาทีที่คุณต้องเย็บต่อจากสองรอบการรันที่เป็นอิสระจากกัน และทุกจุดเชื่อมต่อคือจุดที่ท่วงทำนองเสียงรีเซ็ต ด้วยโมเดลแบบสองผู้พูด มันคือการเรียกครั้งเดียว บริบทเดียว และโมเดลสามารถตอบสนองต่อบทพูดก่อนหน้าได้ นั่นคือความแตกต่างเชิงคุณภาพที่คุณไม่สามารถซื้อคืนมาได้ด้วยการประมวลผลภายหลัง
ข้อที่สองคือรูปแบบสคริปต์กลายเป็นอินเทอร์เฟซ หากไปป์ไลน์ของคุณส่งออกสิ่งที่มีลักษณะคล้าย SSML อยู่แล้ว — คำอธิบายประกอบหนึ่งรายการต่อวลี — การสร้างครั้งนี้ก็แทบจะใช้แทนกันได้ทันที หากไปป์ไลน์ของคุณยื่นข้อความยาวเป็นกำแพงให้โมเดลแล้วหวังเอา ตอนนี้คุณมีเหตุผลที่จะปรับโครงสร้างมันใหม่ เพราะการจัดสไตล์ที่เคยเป็นนัยโดยปริยาย ตอนนี้กลายเป็นสิ่งที่คุณต้องพูดออกมาดัง ๆ นั่นคือข้อแลกเปลี่ยนแบบเดียวกับที่ส่วนที่เหลือของวงการกำลังทำในรูปแบบต่าง ๆ และมันคือแกนที่โมเดล Google สองตัวนี้แข่งขันกับทุกสิ่งทุกอย่างบนกระดาน
หนึ่งชั่วโมงของเสียงนกกระทุงสองตัวมีค่าใช้จ่ายเท่าไร
การคำนวณโทเคนคุ้มค่าที่จะทำสักครั้ง เพราะตัวเลขต่อล้านโทเคนเสียงไม่ใช่ตัวเลขต่อชั่วโมง และความแตกต่างนี้ทำให้ผู้คนประหลาดใจ
โทเค็นเสียงถูกสร้างในอัตราคงที่ต่อวินาทีของเอาต์พุต ดังนั้นต้นทุนจึงแปรผันตามความยาวของเสียงที่เสร็จแล้ว ไม่ใช่ความยาวของสคริปต์ ลองดูอัตราของ Google เองสำหรับ Flash TTS — 9.00 ดอลลาร์ต่อโทเค็นเสียงขาออกหนึ่งล้านโทเค็น — และการคำนวณสำหรับชิ้นงานเสียงความยาวหนึ่งชั่วโมงที่เสร็จแล้วจะอยู่ในหลักหน่วยดอลลาร์บนระดับมาตรฐาน โดยโมเดล Lite อยู่ที่สองในสามของจำนวนนั้น ราคาแบบ Batch และ Flex ซึ่งอยู่ที่ 0.25 ดอลลาร์ขาเข้าและ 4.50 ดอลลาร์ขาออกสำหรับ Flash TTS เทียบกับ 0.25 และ 3.00 สำหรับ Flash-Lite TTS ช่วยลดต้นทุนลงอีกสำหรับงานที่ไม่จำเป็นต้องสร้างตามต้องการ ส่วน Priority ซึ่งอยู่ที่ 0.90 และ 16.00 สำหรับงานที่จำเป็นต้องสร้างตามต้องการ
ผลในทางปฏิบัติสามประการ:
• การสร้างย่อหน้าใหม่มีต้นทุนต่ำ แต่การสร้างทั้งซีรีส์ใหม่คือการตัดสินใจ ด้วยอัตราแบบนี้ ส่วนที่แพงที่สุดของไปป์ไลน์เสียงพูดจึงไม่ใช่การอนุมานอีกต่อไป แต่กลับกลายเป็นมนุษย์ที่อนุมัติเทคแทน
• อัตราค่าอินพุตข้อความไม่มีนัยสำคัญ $0.50 ต่อหนึ่งล้านโทเค็นข้อความบนสคริปต์ไม่กี่พันคำเป็นแค่ความคลาดเคลื่อนจากการปัดเศษเมื่อเทียบกับฝั่งเสียง อย่าปรับสคริปต์เพื่อความยาว
• จุดเปลี่ยนแปลงวันที่ 31 ธันวาคมเป็นเรื่องจริง และมันทำให้อัตราค่าเสียงเพิ่มเป็นสองเท่า หากคุณกำลังวางแผนการเปิดตัวในปี 2027 จงตั้งงบด้วยตัวเลขหลังโปรโมชัน ไม่ใช่ตัวเลขตอนเปิดตัว ไม่อย่างนั้นคุณจะต้องกลับมาวางแผนใหม่ในเดือนมกราคม
จำนวนที่เป็นอิสระ และจำนวนที่ไม่ใช่
ตัวเลขหนึ่งในงานเปิดตัวนี้มาจากที่อื่นที่ไม่ใช่ Google บน Artificial Analysis Provider Voice Arena ซึ่งเก็บข้อมูลเมื่อวันที่ 24 กันยายน 2026 Gemini 3.8 Flash TTS อยู่ในอันดับ 2 ด้วยค่า Elo 1,260 จาก 1,999 ตัวอย่างและ 8 เสียงในอารีนา และ Gemini 3.8 Flash-Lite TTS อยู่ในอันดับ 6 ด้วยค่า 1,235 จาก 2,000 ตัวอย่าง ทั้งสองอยู่ในช่วงความเชื่อมั่นของกันและกันที่ ±16 และ ±17 ดังนั้นตารางนี้จึงบอกคุณว่าทั้งสองแยกออกจากกันไม่ได้ทางสถิติในแง่ความชอบ — ซึ่งเป็นผลลัพธ์ที่มีประโยชน์จริง ๆ เพราะหมายความว่ารุ่นที่ถูกกว่าไม่ได้แย่กว่าอย่างวัดได้ในสายตาของผู้ฟัง
ทุกสิ่งทุกอย่างที่เหลือเป็นคำกล่าวอ้างของ Google เอง และควรอ่านในฐานะเช่นนั้น ทั้งเรื่องความสามารถในการแสดงอารมณ์ของภาษา จำนวนภาษาที่รองรับ และคุณภาพของการจำลองแบบ อารีนาให้เพียงการจัดอันดับความชอบเท่านั้น และไม่มีอะไรอื่น มันไม่ได้บอกคุณว่าโมเดลแต่ละตัวจัดการกับบทพูดยาว 40 นาทีโดยไม่เพี้ยนได้อย่างไร มันทำงานอย่างไรกับคำวิสามานยนามที่ไม่เคยเห็นมาก่อน หรือเกิดอะไรขึ้นกับเสียงที่ออกแบบไว้หลังจากผ่านไปหนึ่งสัปดาห์

โมเดล Lite ยังเป็นข้อโต้แย้งที่ดีกว่าว่าคู่นี้เป็นความแตกต่างจริง ไม่ใช่แค่ระดับการตลาด ช่องว่าง Elo 25 จุดที่อยู่ภายในช่วงความคลาดเคลื่อน เมื่อเทียบกับช่องว่างราคา 33% คือรูปแบบของการตัดสินใจที่ไปป์ไลน์ที่อ่อนไหวต่อราคาควรเลือก Lite แทบทุกครั้ง — และเป็นรูปแบบของการตัดสินใจที่ไปป์ไลน์ที่อ่อนไหวต่อความหน่วงควรทำในทิศทางตรงกันข้าม เนื่องจากทั้งสองแตกต่างกันทั้งในแง่เวลาและค่าใช้จ่าย
จะรันมันที่ไหน และคำตอบแบบตรงไปตรงมาของคำถามข้อนั้น
OrcaRouter ไม่ได้โฮสต์เอนด์พอยต์ของ Gemini 3.8 TTS เรื่องนี้ควรพูดอย่างตรงไปตรงมาแทนที่จะบอกเป็นนัยเป็นอย่างอื่น เพราะสิ่งที่มีประโยชน์ซึ่งเราพูดได้เกี่ยวกับสองโมเดลนี้ ไม่ใช่ว่าเราให้บริการพวกมัน — เราไม่ได้ให้บริการ — แต่คือการที่ผู้ขายลดราคา อย่างการเปลี่ยนแปลงเมื่อวันที่ 31 ธันวาคม เป็นเหตุการณ์แบบที่ทำให้การจัดเส้นทางคุ้มค่าที่จะมีไว้
OrcaRouter วาง โมเดลกว่า 200 รายการไว้เบื้องหลังคีย์ API เพียงคีย์เดียว ในราคา ราคาตามที่ผู้ให้บริการประกาศโดยไม่มีค่าบวกเพิ่ม ดังนั้นอัตราค่าบริการของผู้ให้บริการคือสิ่งที่คุณจ่าย และเมื่อมีการเปลี่ยนแปลง ฝั่งเราจะอัปเดตให้ในวันเดียวกัน ไม่ใช่รอถึงรอบบิลถัดไป สำหรับไปป์ไลน์เสียงที่อยู่ระหว่างการย้ายระบบ เลเยอร์สำรองเมื่อระบบล้มเหลวสำคัญกว่าตัวแค็ตตาล็อก: คุณกำหนดเส้นทางคำขอไปยังโมเดลที่ยังอยู่ระหว่างการประเมินได้ โดยไม่ต้องเดิมพันเส้นทางโปรดักชันกับมัน เพราะคำขอที่ล้มเหลวสามารถตกต่อไปยังสิ่งที่พิสูจน์แล้วได้ DSL สำหรับการจัดเส้นทางประกอบโมเดลหลายตัวเข้าเป็นคำขอเดียวสำหรับกรณีที่เสียงเดียวไม่ดีพอ และ model fusion ตอบพรอมป์ต์ด้วยคณะผู้ตอบ สำหรับเมื่อคำตอบสำคัญกว่าความหน่วง
สำหรับตัวโมเดล Gemini 3.8 TTS เอง จุดที่ใช้เรียกใช้งานคือ API ของ Google เอง และเป็นช่องทางต่าง ๆ ที่ Google ระบุชื่อไว้เมื่อวันที่ 23 กันยายน สิ่งที่โมเดลคู่นี้ทำกับสถาปัตยกรรมของคุณ — การเรียกครั้งเดียวสำหรับผู้พูดสองคน การจัดสไตล์เป็นคำอธิบายประกอบ เสียงที่สามารถอธิบายได้แทนที่จะต้องเลือก — คือส่วนที่จะอยู่ยืนยาวกว่าส่วนลดเปิดตัว
สิ่งที่ควรดูต่อไป
สามสิ่งจะตัดสินว่าเจนเนอเรชันนี้จะเป็นการเปลี่ยนแปลงครั้งใหญ่หรือเป็นเพียงฟีเจอร์
ประการแรกคือดริฟต์ ยังไม่มีใครเผยแพร่การประเมินฉบับยาวว่าเส้นทางแบบผู้พูดสองคนรักษาอัตลักษณ์ได้ตลอดหนึ่งชั่วโมงเต็มหรือไม่ และจนกว่าจะมีใครทำได้ pelican demo ก็เป็นเพียงเดโม ประการที่สองคืออายุการใช้งานของเสียง เสียงที่ออกแบบไว้ซึ่งหมดอายุภายในหนึ่งสัปดาห์เป็นเพียงต้นแบบ ส่วนเสียงที่สามารถสร้างขึ้นใหม่ได้จากคอนฟิกที่จัดเก็บไว้คือผลิตภัณฑ์ และคำตอบขึ้นอยู่กับว่าคุณเก็บตัวระบุตัวใดจากสองตัวนั้นไว้ ประการที่สามคือสิ่งที่เกิดขึ้นหลังวันที่ 31 ธันวาคม เมื่ออัตราโปรโมชันสิ้นสุดลง และค่าใช้จ่ายต่อชั่วโมงของไปป์ไลน์เสียงจะเพิ่มเป็นสองเท่าภายในชั่วข้ามคืน
ไม่มีสิ่งใดในนั้นที่มองเห็นได้จากโพสต์เปิดตัว ทั้งสามสิ่งมองเห็นได้จากเอกสาร ซึ่งเป็นจุดที่การรายงานข่าวเปิดตัวหยุดอ่านไว้แค่นั้น
