
Gemini 3.8 Live vs Gemini 3.8 TTS: ลูปการสนทนาและเสียงอ่านใช้ชื่อเจเนอเรชันร่วมกัน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Gemini 3.8 Live เป็นโมเดล speech-to-speech ที่เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ในชื่อ gemini-3.8-live และ gemini-3.8-live-extended-thinking "Gemini 3.8 TTS" ไม่ใช่โมเดลเลย — มันเป็นคำที่ใช้เรียกแบบครอบคลุมซึ่งการรายงานข่าวการเปิดตัว รวมถึงชื่อโพสต์ของ Google เอง ใช้กับคู่ปลายทาง text-to-speech ที่มาถึงเมื่อวันที่ 23 กันยายน 2026 ในชื่อ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts ดังนั้นนี่ไม่ใช่หน้าเปรียบเทียบแบบปกติ ที่ผลิตภัณฑ์สองตัวแย่งงานเดียวกัน มันเป็นหน้าเกี่ยวกับงานสองอย่างที่ใช้เลขรุ่นร่วมกัน และเกี่ยวกับข้อผิดพลาดเฉพาะอย่างที่ผู้คนทำเมื่อพวกเขามองคำว่า "Live" และ "TTS" เป็นสองรูปแบบของสิ่งเดียวกัน
fork ที่หมายเลขเจเนอเรชันที่ใช้ร่วมกันซ่อนไว้
เอกสารประกอบด้านการสร้างเสียงพูดของ Google ได้ขีดเส้นแบ่งไว้เอง และประโยคนี้ก็เป็นประโยคที่อ่านข้ามผ่านได้ง่ายมาก: "ความสามารถ TTS แตกต่างจากการสร้างเสียงพูดที่ให้บริการผ่าน Live API" ข้อความตอนเดียวกันนี้อธิบายเหตุผลไว้ และเหตุผลนั้นเป็นเรื่องเชิงโครงสร้างมากกว่าจะเป็นเรื่องของคุณภาพ Live API ถูกสร้างขึ้นสำหรับ "เสียงแบบโต้ตอบที่ไม่มีโครงสร้าง และอินพุตและเอาต์พุตแบบหลายรูปแบบ" ส่วน TTS ผ่าน Gemini API "ถูกปรับให้เหมาะกับสถานการณ์ที่ต้องการการอ่านข้อความแบบคำต่อคำอย่างแม่นยำ พร้อมการควบคุมอย่างละเอียด" บันทึกในภายหลังระบุรูปแบบอินพุตไว้อย่างชัดเจน: โมเดล TTS รับเฉพาะข้อความและส่งคืนเฉพาะเสียง
ข้อจำกัดเดียวนั้น — ข้อความเข้า เสียงออก ไม่มีเสียงเข้า — คือการเปรียบเทียบทั้งหมด โมเดล Gemini 3.8 Live ได้ยินคนที่พูดกับมัน โมเดล Gemini 3.8 Flash TTS หรือ Flash-Lite TTS ไม่เคยได้ยินใครเลย มันอ่านสตริงแล้วแสดงออกมา ทุกสิ่งอื่นตามมาจากตรงนั้น: เบนช์มาร์กที่มีอยู่สำหรับแบบหนึ่งไม่มีความหมายสำหรับอีกแบบหนึ่ง การคิดราคาวัดด้วยหน่วยที่ต่างกัน และรูปแบบความล้มเหลวก็เทียบเคียงกันไม่ได้เลย
เรื่องนี้สำคัญเพราะกรณีการใช้งานทั้งสองดูเหมือนกันทุกประการจากภายนอก วอยซ์เอเจนต์และไปป์ไลน์การบรรยายต่างก็ส่งเสียงพูดที่ฟังดูเหมือนมนุษย์ออกมาเหมือนกัน มีเพียงอย่างเดียวเท่านั้นที่ถูกขัดจังหวะได้
ที่ "Gemini 3.8 TTS" จริงๆ แล้ว
เปิดตารางโมเดลที่รองรับสำหรับการสร้างเสียงพูดของ Gemini API แล้วคุณจะพบรายการ TTS สี่รายการ และไม่มีรายการที่ชื่อ Gemini 3.8 TTS สองรายการเป็นรุ่นนี้: Gemini 3.8 Flash TTS รหัสโมเดล gemini-3.8-flash-tts รองรับ 130 ภาษา และ Gemini 3.8 Flash-Lite TTS รหัสโมเดล gemini-3.8-flash-lite-tts รองรับ 101 ภาษา ส่วนอีกสองรายการ — Gemini 3.1 Flash TTS Preview และ Gemini 2.5 Pro Preview TTS — เป็นรุ่นพรีวิวที่ Flash-Lite เข้ามาแทนที่
ดังนั้น เมื่อมีคนพูดว่า "Gemini 3.8 TTS" พวกเขามักหมายถึงระดับ Flash เพราะนั่นคือรุ่นที่โพสต์เปิดตัวยกขึ้นมาก่อน และเป็นรุ่นที่บอร์ด Arena จัดอันดับสูงสุด แต่เมื่อพวกเขาพูดถึงมันในบริบทของเอเจนต์เสียงแบบเรียลไทม์ พวกเขากลับไม่ได้หมายถึงสิ่งใดเลย เพราะสิ่งที่พวกเขาต้องการนั้นอยู่บนเอนด์พอยต์อีกอันหนึ่งที่มีชื่อต่างกัน และมีสัญญาข้อมูลนำเข้าที่แตกต่างกัน
ยังมีความขัดแย้งประการที่สามที่ควรค่าแก่การเอ่ยถึง เพราะมันก่อให้เกิดคำแนะนำที่แย่ที่สุด Gemini 3.8 Live ไม่ใช่โมเดลแปลงข้อความเป็นเสียงพูดที่มีฟีเจอร์เสริม มันเป็นโมเดลเสียงพูดเป็นเสียงพูด และเหตุผลที่มันมีค่าใช้จ่ายต่อหน่วยสูงกว่าก็คือมันทำงานต่อหน่วยมากกว่า: ฟัง ใช้เหตุผลระหว่างการพูด จัดการการขัดจังหวะ และในตัวแปร Extended Thinking ก็พิจารณาไตร่ตรองก่อนที่จะตอบ
ตัวเลขเดียวที่เปรียบเทียบได้อย่างแท้จริง
คะแนนคุณภาพไม่สามารถโอนย้ายระหว่างสองกลุ่มนี้ได้; ไม่มีบอร์ดใดที่ให้คะแนนผู้บรรยายและผู้สนทนาบนแกนเดียวกัน เงินสามารถโอนย้ายได้ เมื่อคุณเลือกหน่วยอย่างซื่อสัตย์ และหน่วยที่ซื่อสัตย์สำหรับงานเสียงใดๆ คือชั่วโมงเสียง
• คิดค่าบริการขาเข้า — Gemini 3.8 Live คิดค่าบริการตามนาทีของเสียง $0.005 ต่อนาทีขาเข้า และ $0.018 ต่อนาทีขาออก เทียบกับ Gemini 3.8 Flash TTS ที่คิดค่าบริการต่อล้านโทเค็นเสียง $9.00 ถึงวันที่ 31 ธันวาคม 2026 และ $18.00 หลังจากนั้น
• คิดค่าบริการขาออก — เสียงแบบสองทางของ Gemini 3.8 Live อยู่ที่ประมาณ $1.38 สำหรับหนึ่งชั่วโมงของการป้อนเข้าและส่งออกพร้อมกันในราคาปกติ ก่อนการแคชพรอมป์ต์ใด ๆ เทียบกับ Gemini 3.8 Flash TTS ที่เป็นสตรีมทางเดียว และงานบรรยายที่เสร็จสมบูรณ์หนึ่งล้านตัวอักษรคิดเป็น $16.5 ตามการปรับมาตรฐานของ Artificial Analysis
• อินพุตข้อความ — Gemini 3.8 Live คิดค่าบริการข้อความและเสียงในรายการแยกกัน $0.75 ต่อล้านโทเค็นข้อความขาเข้า และ $4.50 ขาออก เทียบกับปลายทาง TTS ที่คิดค่าบริการอินพุตข้อความที่ $0.50 ต่อล้านโทเค็น
• ระดับ Flash-Lite — Gemini 3.8 Live ไม่มีรุ่นพี่น้องที่ถูกกว่า ทางเลือกคือ Live หรือ Extended Thinking เทียบกับ Gemini 3.8 Flash-Lite TTS ที่ตั้งราคาไว้ที่ $6.00 แล้วจึงเป็น $12.00 ต่อล้านโทเค็นเสียง โดย Artificial Analysis อยู่ที่ $11.0 ต่อล้านตัวอักษร
• รูปแบบอินพุต — Gemini 3.8 Live รับเสียง วิดีโอ และข้อความเข้า ส่งเสียงออก เทียบกับปลายทาง TTS ที่รับข้อความเข้า ส่งเสียงออก
ตัวเลข Live เป็นการคำนวณของเราจากอัตราต่อนาทีที่ Google เผยแพร่ ไม่ใช่ตัวเลขต่อชั่วโมงที่ Google เผยแพร่ ตัวเลขต่อตัวอักษรเป็นการปรับมาตรฐานของ Artificial Analysis และเป็นตัวเลขที่ควรอ้างอิงเมื่อคุณเปรียบเทียบระดับการสังเคราะห์ โปรดทราบว่าบอร์ด Speech to Speech ของ Artificial Analysis เองมีคอลัมน์ต้นทุนต่อชั่วโมงของเสียงอินพุตแยกต่างหากสำหรับโมเดล Live — ประมาณ $3.50 สำหรับ Gemini 3.8 Live และ $0.84 สำหรับเวอร์ชัน Extended Thinking — ซึ่งเป็นการปรับมาตรฐานที่แตกต่างออกไปอีก และไม่ควรนำมาเทียบเคียงกับตารางอัตราค่าใช้จ่ายต่อนาทีราวกับว่าทั้งสองเป็นการวัดเดียวกัน

อะไรจะพังเมื่อคุณเลือกอันที่ผิด
รูปแบบความล้มเหลวเหล่านี้ให้บทเรียน เพราะมันแตกต่างกันอย่างมาก
เรียกใช้ปลายทาง TTS เมื่อคุณต้องการลูปการสนทนาและไม่มีข้อผิดพลาดใดๆ คำขอส่งคืนเสียงที่ถูกต้อง คุณจะได้รับการตอบกลับที่คล่องแคล่วและอ่านออกเสียงได้ดีต่อสตริงคงที่ จากนั้นก็เงียบ — เพราะไม่เคยมีอะไรคอยฟังอยู่เลย ทีมต่างๆ ค้นพบสิ่งนี้เมื่อพวกเขาสร้างการทดสอบการพูดแทรกครั้งแรก และพบว่า "ผู้ใช้" ต้องรอให้คลิปเต็มเล่นจบก่อนที่เทิร์นถัดไปจะเริ่มได้ การนำการสนทนาไปติดตั้งเพิ่มบนปลายทางการสังเคราะห์เสียงหมายถึงการเพิ่มการรู้จำเสียงพูด นโยบายการผลัดกันพูด และกลไกการขัดจังหวะเข้าไปรอบๆ ณ จุดนั้นคุณได้สร้างแคสเคดขึ้นมาใหม่ และคุณกำลังจ่ายค่าสองโมเดลแทนที่จะเป็นหนึ่ง
เรียกใช้เอนด์พอยต์ Live เมื่อคุณต้องการเสียงบรรยาย และคุณต้องจ่ายสำหรับความสามารถที่คุณไม่ได้ใช้ โมเดล Live ถูกคิดค่าบริการทั้งสองทิศทาง เพราะมันคาดหวังทั้งสองทิศทาง สำหรับหนังสือเสียงหรือการพากย์เสียงวิดีโอฝึกอบรม ฝั่งอินพุตเป็นสคริปต์ที่ไม่เปลี่ยนแปลง และโมเดลไม่จำเป็นต้องได้ยินอะไรเลย คุณกำลังซื้อลูปการสนทนาเพื่ออ่านเอกสารออกเสียง
กรณีเดียวที่การเลือกยากจริง ๆ คือแบบคาสเคด: การรู้จำเสียง จากนั้นการให้เหตุผล แล้วจึงการสังเคราะห์เสียง สถาปัตยกรรมนั้นยังไม่ล้าสมัย และสำหรับระบบโปรดักชันจำนวนมาก มันยังเป็นตัวเลือกที่ถูกต้อง เพราะมันทำให้คุณสลับแต่ละขั้นตอนได้อย่างอิสระ และเลือกผู้ให้บริการรายอื่นสำหรับแต่ละขั้นตอนได้ มันแลกมาด้วยความหน่วง และแลกมาด้วยจังหวะทำนองเสียงที่โมเดลแบบ end-to-end ตัวเดียวรักษาไว้ได้ข้ามขอบเขตการผลัดกันพูด การแลกเปลี่ยนนี้เป็นของจริงทั้งสองทิศทาง
ในกรณีที่มีเส้นทางอยู่แล้ว
OrcaRouter ไม่มีเอนด์พอยต์ Gemini 3.8 Live หรือเอนด์พอยต์ 3.8 TTS และเรื่องนี้ถือว่าควรพูดก่อนสิ่งอื่นใดเกี่ยวกับการกำหนดเส้นทาง เพราะกับแคตตาล็อกที่กว้างขนาดนี้ เป็นเรื่องง่ายที่จะเข้าใจไปในทางตรงกันข้าม สิ่งที่แคตตาล็อกมีคือส่วนที่เหลือของตระกูลนี้ — google/gemini-3.8-flash ในบรรดาโมเดล Google 28 โมเดล และโมเดลทั้งหมดมากกว่า 200 โมเดล จากคีย์เดียวในราคาตามที่ผู้ให้บริการกำหนด โดยไม่บวกเพิ่ม
เรื่องนี้สำคัญเป็นพิเศษสำหรับแคสเคด หากสถาปัตยกรรมของคุณคือการรู้จำ ตามด้วยการให้เหตุผล แล้วจึงเป็นการสังเคราะห์ ขั้นตอนการให้เหตุผลคือขั้นตอนที่คีย์เดียวซึ่งใช้ได้กับผู้ให้บริการหลายรายจะคุ้มค่า เพราะเป็นขั้นตอนที่คุณสลับเปลี่ยนบ่อยที่สุด และเป็นขั้นตอนที่การลดราคาของผู้ให้บริการควรมาถึงบิลของคุณภายในวันเดียวกัน แทนที่จะรอถึงการต่ออายุสัญญาครั้งถัดไป และยังเป็นขั้นตอนที่ การสลับไปยังระบบสำรองอัตโนมัติ คุ้มค่าที่จะติดตั้งไว้: แคสเคดมีจุดที่ล้มเหลวได้สามจุด และจุดตรงกลางเป็นจุดที่ทำให้มีระบบสำรองได้ถูกที่สุด

กฎการตัดสินใจสั้น ๆ
หากโมเดลต้องตอบสนองต่อสิ่งที่ยังไม่มีอยู่ในรูปแบบข้อความอยู่แล้ว คุณจะต้องใช้ Gemini 3.8 Live และควรตั้งงบประมาณตามอัตราค่าเสียงต่อนาทีของ Google และคาดว่าจะต้องคิดว่าคุณต้องการตัวเลือกใดจากสองแบบนี้ หากข้อความถูกเขียนไว้แล้วและงานคือการนำไปแสดงเป็นเสียง คุณจะต้องใช้ Gemini 3.8 Flash TTS หรือ Flash-Lite TTS และควรตั้งงบประมาณต่อล้านตัวอักษร และเลือกระดับตามความครอบคลุมของภาษาและตามว่าช่องว่างของคุณภาพคุ้มกับช่องว่างของราคาหรือไม่
และถ้าคุณถูกขอให้เปรียบเทียบ "Gemini 3.8 Live และ Gemini 3.8 TTS" ราวกับว่ามันเป็นผลิตภัณฑ์สองตัว สิ่งที่มีประโยชน์อย่างแรกที่คุณทำได้คือถามว่าเป็นเอนด์พอยต์ไหน ชื่อในบรีฟไม่ได้ชี้ไปที่เอนด์พอยต์ใดเพียงหนึ่ง และคำตอบนั้นเปลี่ยนสถาปัตยกรรม ไม่ใช่แค่เรื่องใบแจ้งหนี้

