การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Gemini 3.8 Live vs Gemini 3.8 TTS' บนพื้นหลังสีขาวพร้อมองค์ประกอบเน้นไล่ระดับสีฟ้าและสีฟ้าไซแอนแบบนุ่มนวล คอลัมน์ซ้ายที่มีหัวข้อ 'พร้อมใช้งานบน Live API' แสดงรายการ 'gemini-3.8-live', 'ได้ยินและพูดได้', 'เสียงเข้า, เสียงออก'; คอลัมน์ขวาที่มีหัวข้อ 'พร้อมใช้งานบนเอนด์พอยต์ TTS' แสดงรายการ 'gemini-3.8-flash-tts', 'อ่านข้อความที่เขียนไว้', 'ข้อความเข้า, เสียงออก' บรรทัดส่วนท้ายระบุว่า 'ทั้งสองไม่ได้ชื่อ Gemini 3.8 TTS.' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 Live vs Gemini 3.8 TTS: ลูปการสนทนาและเสียงอ่านใช้ชื่อเจเนอเรชันร่วมกัน

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Gemini 3.8 Live เป็นโมเดล speech-to-speech ที่เปิดตัวเมื่อวันที่ 15 กันยายน 2026 ในชื่อ gemini-3.8-live และ gemini-3.8-live-extended-thinking "Gemini 3.8 TTS" ไม่ใช่โมเดลเลย — มันเป็นคำที่ใช้เรียกแบบครอบคลุมซึ่งการรายงานข่าวการเปิดตัว รวมถึงชื่อโพสต์ของ Google เอง ใช้กับคู่ปลายทาง text-to-speech ที่มาถึงเมื่อวันที่ 23 กันยายน 2026 ในชื่อ gemini-3.8-flash-tts และ gemini-3.8-flash-lite-tts ดังนั้นนี่ไม่ใช่หน้าเปรียบเทียบแบบปกติ ที่ผลิตภัณฑ์สองตัวแย่งงานเดียวกัน มันเป็นหน้าเกี่ยวกับงานสองอย่างที่ใช้เลขรุ่นร่วมกัน และเกี่ยวกับข้อผิดพลาดเฉพาะอย่างที่ผู้คนทำเมื่อพวกเขามองคำว่า "Live" และ "TTS" เป็นสองรูปแบบของสิ่งเดียวกัน

fork ที่หมายเลขเจเนอเรชันที่ใช้ร่วมกันซ่อนไว้

เอกสารประกอบด้านการสร้างเสียงพูดของ Google ได้ขีดเส้นแบ่งไว้เอง และประโยคนี้ก็เป็นประโยคที่อ่านข้ามผ่านได้ง่ายมาก: "ความสามารถ TTS แตกต่างจากการสร้างเสียงพูดที่ให้บริการผ่าน Live API" ข้อความตอนเดียวกันนี้อธิบายเหตุผลไว้ และเหตุผลนั้นเป็นเรื่องเชิงโครงสร้างมากกว่าจะเป็นเรื่องของคุณภาพ Live API ถูกสร้างขึ้นสำหรับ "เสียงแบบโต้ตอบที่ไม่มีโครงสร้าง และอินพุตและเอาต์พุตแบบหลายรูปแบบ" ส่วน TTS ผ่าน Gemini API "ถูกปรับให้เหมาะกับสถานการณ์ที่ต้องการการอ่านข้อความแบบคำต่อคำอย่างแม่นยำ พร้อมการควบคุมอย่างละเอียด" บันทึกในภายหลังระบุรูปแบบอินพุตไว้อย่างชัดเจน: โมเดล TTS รับเฉพาะข้อความและส่งคืนเฉพาะเสียง

ข้อจำกัดเดียวนั้น — ข้อความเข้า เสียงออก ไม่มีเสียงเข้า — คือการเปรียบเทียบทั้งหมด โมเดล Gemini 3.8 Live ได้ยินคนที่พูดกับมัน โมเดล Gemini 3.8 Flash TTS หรือ Flash-Lite TTS ไม่เคยได้ยินใครเลย มันอ่านสตริงแล้วแสดงออกมา ทุกสิ่งอื่นตามมาจากตรงนั้น: เบนช์มาร์กที่มีอยู่สำหรับแบบหนึ่งไม่มีความหมายสำหรับอีกแบบหนึ่ง การคิดราคาวัดด้วยหน่วยที่ต่างกัน และรูปแบบความล้มเหลวก็เทียบเคียงกันไม่ได้เลย

เรื่องนี้สำคัญเพราะกรณีการใช้งานทั้งสองดูเหมือนกันทุกประการจากภายนอก วอยซ์เอเจนต์และไปป์ไลน์การบรรยายต่างก็ส่งเสียงพูดที่ฟังดูเหมือนมนุษย์ออกมาเหมือนกัน มีเพียงอย่างเดียวเท่านั้นที่ถูกขัดจังหวะได้

ที่ "Gemini 3.8 TTS" จริงๆ แล้ว

เปิดตารางโมเดลที่รองรับสำหรับการสร้างเสียงพูดของ Gemini API แล้วคุณจะพบรายการ TTS สี่รายการ และไม่มีรายการที่ชื่อ Gemini 3.8 TTS สองรายการเป็นรุ่นนี้: Gemini 3.8 Flash TTS รหัสโมเดล gemini-3.8-flash-tts รองรับ 130 ภาษา และ Gemini 3.8 Flash-Lite TTS รหัสโมเดล gemini-3.8-flash-lite-tts รองรับ 101 ภาษา ส่วนอีกสองรายการ — Gemini 3.1 Flash TTS Preview และ Gemini 2.5 Pro Preview TTS — เป็นรุ่นพรีวิวที่ Flash-Lite เข้ามาแทนที่

ดังนั้น เมื่อมีคนพูดว่า "Gemini 3.8 TTS" พวกเขามักหมายถึงระดับ Flash เพราะนั่นคือรุ่นที่โพสต์เปิดตัวยกขึ้นมาก่อน และเป็นรุ่นที่บอร์ด Arena จัดอันดับสูงสุด แต่เมื่อพวกเขาพูดถึงมันในบริบทของเอเจนต์เสียงแบบเรียลไทม์ พวกเขากลับไม่ได้หมายถึงสิ่งใดเลย เพราะสิ่งที่พวกเขาต้องการนั้นอยู่บนเอนด์พอยต์อีกอันหนึ่งที่มีชื่อต่างกัน และมีสัญญาข้อมูลนำเข้าที่แตกต่างกัน

ยังมีความขัดแย้งประการที่สามที่ควรค่าแก่การเอ่ยถึง เพราะมันก่อให้เกิดคำแนะนำที่แย่ที่สุด Gemini 3.8 Live ไม่ใช่โมเดลแปลงข้อความเป็นเสียงพูดที่มีฟีเจอร์เสริม มันเป็นโมเดลเสียงพูดเป็นเสียงพูด และเหตุผลที่มันมีค่าใช้จ่ายต่อหน่วยสูงกว่าก็คือมันทำงานต่อหน่วยมากกว่า: ฟัง ใช้เหตุผลระหว่างการพูด จัดการการขัดจังหวะ และในตัวแปร Extended Thinking ก็พิจารณาไตร่ตรองก่อนที่จะตอบ

ตัวเลขเดียวที่เปรียบเทียบได้อย่างแท้จริง

คะแนนคุณภาพไม่สามารถโอนย้ายระหว่างสองกลุ่มนี้ได้; ไม่มีบอร์ดใดที่ให้คะแนนผู้บรรยายและผู้สนทนาบนแกนเดียวกัน เงินสามารถโอนย้ายได้ เมื่อคุณเลือกหน่วยอย่างซื่อสัตย์ และหน่วยที่ซื่อสัตย์สำหรับงานเสียงใดๆ คือชั่วโมงเสียง

• คิดค่าบริการขาเข้า — Gemini 3.8 Live คิดค่าบริการตามนาทีของเสียง $0.005 ต่อนาทีขาเข้า และ $0.018 ต่อนาทีขาออก เทียบกับ Gemini 3.8 Flash TTS ที่คิดค่าบริการต่อล้านโทเค็นเสียง $9.00 ถึงวันที่ 31 ธันวาคม 2026 และ $18.00 หลังจากนั้น
• คิดค่าบริการขาออก — เสียงแบบสองทางของ Gemini 3.8 Live อยู่ที่ประมาณ $1.38 สำหรับหนึ่งชั่วโมงของการป้อนเข้าและส่งออกพร้อมกันในราคาปกติ ก่อนการแคชพรอมป์ต์ใด ๆ เทียบกับ Gemini 3.8 Flash TTS ที่เป็นสตรีมทางเดียว และงานบรรยายที่เสร็จสมบูรณ์หนึ่งล้านตัวอักษรคิดเป็น $16.5 ตามการปรับมาตรฐานของ Artificial Analysis
• อินพุตข้อความ — Gemini 3.8 Live คิดค่าบริการข้อความและเสียงในรายการแยกกัน $0.75 ต่อล้านโทเค็นข้อความขาเข้า และ $4.50 ขาออก เทียบกับปลายทาง TTS ที่คิดค่าบริการอินพุตข้อความที่ $0.50 ต่อล้านโทเค็น
• ระดับ Flash-Lite — Gemini 3.8 Live ไม่มีรุ่นพี่น้องที่ถูกกว่า ทางเลือกคือ Live หรือ Extended Thinking เทียบกับ Gemini 3.8 Flash-Lite TTS ที่ตั้งราคาไว้ที่ $6.00 แล้วจึงเป็น $12.00 ต่อล้านโทเค็นเสียง โดย Artificial Analysis อยู่ที่ $11.0 ต่อล้านตัวอักษร
• รูปแบบอินพุต — Gemini 3.8 Live รับเสียง วิดีโอ และข้อความเข้า ส่งเสียงออก เทียบกับปลายทาง TTS ที่รับข้อความเข้า ส่งเสียงออก

ตัวเลข Live เป็นการคำนวณของเราจากอัตราต่อนาทีที่ Google เผยแพร่ ไม่ใช่ตัวเลขต่อชั่วโมงที่ Google เผยแพร่ ตัวเลขต่อตัวอักษรเป็นการปรับมาตรฐานของ Artificial Analysis และเป็นตัวเลขที่ควรอ้างอิงเมื่อคุณเปรียบเทียบระดับการสังเคราะห์ โปรดทราบว่าบอร์ด Speech to Speech ของ Artificial Analysis เองมีคอลัมน์ต้นทุนต่อชั่วโมงของเสียงอินพุตแยกต่างหากสำหรับโมเดล Live — ประมาณ $3.50 สำหรับ Gemini 3.8 Live และ $0.84 สำหรับเวอร์ชัน Extended Thinking — ซึ่งเป็นการปรับมาตรฐานที่แตกต่างออกไปอีก และไม่ควรนำมาเทียบเคียงกับตารางอัตราค่าใช้จ่ายต่อนาทีราวกับว่าทั้งสองเป็นการวัดเดียวกัน

A screenshot of Google's Gemini API pricing documentation in English, captured 25 September 2026, showing the speech-generation model index — a limited-access group listing Gemini 3.8 Live, Gemini 3.8 Live Extended Thinking and Gemini 3.1 Flash Live Preview, alongside Gemini 3.8 Flash TTS, Gemini 3.8 Flash-Lite TTS and Gemini 3.1 Flash TTS Preview — above the Gemini 3.8 Flash per-million-token rates: $0.75 input through 31 December 2026 rising to $1.50, $3.75 output including thinking rising to $7.50, $0.075 context caching rising to $0.15, and storage at $0.50 rising to $1.00 per million tokens per hour, with search requests and prompts billed at $14 per 1,000 beyond the monthly free allowance. The page carries no rate-card line for a model named Gemini 3.8 TTS.

อะไรจะพังเมื่อคุณเลือกอันที่ผิด

รูปแบบความล้มเหลวเหล่านี้ให้บทเรียน เพราะมันแตกต่างกันอย่างมาก

เรียกใช้ปลายทาง TTS เมื่อคุณต้องการลูปการสนทนาและไม่มีข้อผิดพลาดใดๆ คำขอส่งคืนเสียงที่ถูกต้อง คุณจะได้รับการตอบกลับที่คล่องแคล่วและอ่านออกเสียงได้ดีต่อสตริงคงที่ จากนั้นก็เงียบ — เพราะไม่เคยมีอะไรคอยฟังอยู่เลย ทีมต่างๆ ค้นพบสิ่งนี้เมื่อพวกเขาสร้างการทดสอบการพูดแทรกครั้งแรก และพบว่า "ผู้ใช้" ต้องรอให้คลิปเต็มเล่นจบก่อนที่เทิร์นถัดไปจะเริ่มได้ การนำการสนทนาไปติดตั้งเพิ่มบนปลายทางการสังเคราะห์เสียงหมายถึงการเพิ่มการรู้จำเสียงพูด นโยบายการผลัดกันพูด และกลไกการขัดจังหวะเข้าไปรอบๆ ณ จุดนั้นคุณได้สร้างแคสเคดขึ้นมาใหม่ และคุณกำลังจ่ายค่าสองโมเดลแทนที่จะเป็นหนึ่ง

เรียกใช้เอนด์พอยต์ Live เมื่อคุณต้องการเสียงบรรยาย และคุณต้องจ่ายสำหรับความสามารถที่คุณไม่ได้ใช้ โมเดล Live ถูกคิดค่าบริการทั้งสองทิศทาง เพราะมันคาดหวังทั้งสองทิศทาง สำหรับหนังสือเสียงหรือการพากย์เสียงวิดีโอฝึกอบรม ฝั่งอินพุตเป็นสคริปต์ที่ไม่เปลี่ยนแปลง และโมเดลไม่จำเป็นต้องได้ยินอะไรเลย คุณกำลังซื้อลูปการสนทนาเพื่ออ่านเอกสารออกเสียง

กรณีเดียวที่การเลือกยากจริง ๆ คือแบบคาสเคด: การรู้จำเสียง จากนั้นการให้เหตุผล แล้วจึงการสังเคราะห์เสียง สถาปัตยกรรมนั้นยังไม่ล้าสมัย และสำหรับระบบโปรดักชันจำนวนมาก มันยังเป็นตัวเลือกที่ถูกต้อง เพราะมันทำให้คุณสลับแต่ละขั้นตอนได้อย่างอิสระ และเลือกผู้ให้บริการรายอื่นสำหรับแต่ละขั้นตอนได้ มันแลกมาด้วยความหน่วง และแลกมาด้วยจังหวะทำนองเสียงที่โมเดลแบบ end-to-end ตัวเดียวรักษาไว้ได้ข้ามขอบเขตการผลัดกันพูด การแลกเปลี่ยนนี้เป็นของจริงทั้งสองทิศทาง

ในกรณีที่มีเส้นทางอยู่แล้ว

OrcaRouter ไม่มีเอนด์พอยต์ Gemini 3.8 Live หรือเอนด์พอยต์ 3.8 TTS และเรื่องนี้ถือว่าควรพูดก่อนสิ่งอื่นใดเกี่ยวกับการกำหนดเส้นทาง เพราะกับแคตตาล็อกที่กว้างขนาดนี้ เป็นเรื่องง่ายที่จะเข้าใจไปในทางตรงกันข้าม สิ่งที่แคตตาล็อกมีคือส่วนที่เหลือของตระกูลนี้ — google/gemini-3.8-flash ในบรรดาโมเดล Google 28 โมเดล และโมเดลทั้งหมดมากกว่า 200 โมเดล จากคีย์เดียวในราคาตามที่ผู้ให้บริการกำหนด โดยไม่บวกเพิ่ม

เรื่องนี้สำคัญเป็นพิเศษสำหรับแคสเคด หากสถาปัตยกรรมของคุณคือการรู้จำ ตามด้วยการให้เหตุผล แล้วจึงเป็นการสังเคราะห์ ขั้นตอนการให้เหตุผลคือขั้นตอนที่คีย์เดียวซึ่งใช้ได้กับผู้ให้บริการหลายรายจะคุ้มค่า เพราะเป็นขั้นตอนที่คุณสลับเปลี่ยนบ่อยที่สุด และเป็นขั้นตอนที่การลดราคาของผู้ให้บริการควรมาถึงบิลของคุณภายในวันเดียวกัน แทนที่จะรอถึงการต่ออายุสัญญาครั้งถัดไป และยังเป็นขั้นตอนที่ การสลับไปยังระบบสำรองอัตโนมัติ คุ้มค่าที่จะติดตั้งไว้: แคสเคดมีจุดที่ล้มเหลวได้สามจุด และจุดตรงกลางเป็นจุดที่ทำให้มีระบบสำรองได้ถูกที่สุด

A screenshot of the Artificial Analysis Provider Voice Arena leaderboard in English, captured 25 September 2026, showing Cartesia Sonic 3.6 first at Elo 1,273, Google Gemini 3.8 Flash TTS second at 1,260 on 1,999 samples and priced at $16.5 per million characters, Alibaba Qwen-Audio-3.0-TTS-Plus third at 1,259, and Google Gemini 3.8 Flash-Lite TTS sixth at 1,235 on 2,000 samples at $11.0 per million characters. The board lists no model named Gemini 3.8 TTS.

กฎการตัดสินใจสั้น ๆ

หากโมเดลต้องตอบสนองต่อสิ่งที่ยังไม่มีอยู่ในรูปแบบข้อความอยู่แล้ว คุณจะต้องใช้ Gemini 3.8 Live และควรตั้งงบประมาณตามอัตราค่าเสียงต่อนาทีของ Google และคาดว่าจะต้องคิดว่าคุณต้องการตัวเลือกใดจากสองแบบนี้ หากข้อความถูกเขียนไว้แล้วและงานคือการนำไปแสดงเป็นเสียง คุณจะต้องใช้ Gemini 3.8 Flash TTS หรือ Flash-Lite TTS และควรตั้งงบประมาณต่อล้านตัวอักษร และเลือกระดับตามความครอบคลุมของภาษาและตามว่าช่องว่างของคุณภาพคุ้มกับช่องว่างของราคาหรือไม่

และถ้าคุณถูกขอให้เปรียบเทียบ "Gemini 3.8 Live และ Gemini 3.8 TTS" ราวกับว่ามันเป็นผลิตภัณฑ์สองตัว สิ่งที่มีประโยชน์อย่างแรกที่คุณทำได้คือถามว่าเป็นเอนด์พอยต์ไหน ชื่อในบรีฟไม่ได้ชี้ไปที่เอนด์พอยต์ใดเพียงหนึ่ง และคำตอบนั้นเปลี่ยนสถาปัตยกรรม ไม่ใช่แค่เรื่องใบแจ้งหนี้

A generated summary card for Gemini 3.8 Live vs Gemini 3.8 TTS on a white background with soft blue-and-cyan gradient accents. Five rows read 'Gemini 3.8 Live — gemini-3.8-live on the Live API, shipped 15 September 2026', 'Gemini 3.8 TTS — not a model ID; resolves to gemini-3.8-flash-tts and gemini-3.8-flash-lite-tts', 'Input contract: Live hears audio and video; TTS reads text only', 'The one shared unit: the hour of finished audio, not the benchmark', and 'Verdict: two jobs, one generation number — ask which endpoint'. A footer line reads 'Prices and language counts are vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube