การ์ดฮีโร่ที่สร้างขึ้นสำหรับ 'Gemini 3.8 Live with Live Avatar' บนพื้นหลังสีขาวพร้อมเน้นไล่เฉดสีฟ้าและสีฟ้าอมเขียวแบบนุ่มนวล การ์ดสามใบซ้อนกันระบุว่า '15 ก.ย. 2026 — Gemini 3.8 Live และ 3.8 Live Extended Thinking เปิดตัวบน Live API', '24 ก.ย. 2026 — ประกาศเปิดตัว Live Avatar, Gemini Enterprise' และ 'วันนี้ — avatar เป็นความสามารถระดับองค์กร ไม่ใช่ ID ของโมเดล' บรรทัดส่วนท้ายระบุว่า 'วันที่อ้างอิงตาม Google DeepMind' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Gemini 3.8 Live พร้อม Live Avatar: Google มอบใบหน้าให้โมเดลเสียงของตน

ผู้เขียน

Alistair Wren

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เปิดตัวเมื่อวันที่ 15 กันยายน 2026 — เอนด์พอยต์บทสนทนาแบบสดโดยตรงสองรายการที่ Google เปิดให้ใช้บน API ของผู้ให้บริการ โดยตัวหนึ่งปรับให้เหมาะกับความหน่วงต่ำ และอีกตัวปรับให้เหมาะกับการพิจารณาไตร่ตรองอย่างรอบคอบ เมื่อวันที่ 24 กันยายน บริษัทได้ประกาศ Gemini 3.8 Live with Live Avatar ซึ่งจับคู่การสร้างวิดีโอแบบเกือบเรียลไทม์เข้ากับวงจรการพูดเดียวกัน เพื่อให้โมเดลมีใบหน้าขณะพูด ไม่มีอะไรเกี่ยวกับรหัสโมเดลทั้งสองเปลี่ยนไป สิ่งที่เปลี่ยนคือลักษณะที่บทสนทนาถูกอนุญาตให้เป็น และ — ที่สำคัญยิ่งกว่า — สิ่งที่โมเดลถูกอนุญาตให้ทำกับบทสนทนาขณะที่มันยังดำเนินอยู่

สิ่งที่จัดส่งจริงเมื่อวันที่ 24 กันยายนคืออะไร

โพสต์ของ DeepMind นั้นสั้นและเจาะจง และคุ้มค่าที่จะแยกสิ่งที่โพสต์กล่าวอ้างออกจากสิ่งที่มันหมายถึง Live Avatar ในคำพูดของ Google เอง “นำการปรากฏตัวทางภาพแบบเกือบเรียลไทม์มาสู่ AI สนทนาของ Gemini” โดยจับคู่การสร้างวิดีโอแบบเรียลไทม์เข้ากับสแต็กเสียงที่มีอยู่ บริษัทอธิบายถึงการซิงก์ริมฝีปากที่แม่นยำ สีหน้าท่าทางที่เป็นธรรมชาติ และการผลัดกันพูดที่ลื่นไหล พร้อมยกตัวอย่างการนำไปใช้งานสองกรณี: การบริการลูกค้าและการแนะนำแบบโต้ตอบ จากนั้นจึงกล่าวประโยคที่สำคัญที่สุดสำหรับใครก็ตามที่วางแผนจะสร้าง — “เริ่มตั้งแต่วันนี้ Gemini 3.8 Live with Live Avatar พร้อมใช้งานใน Gemini Enterprise”

นั่นคือเรื่องราวความพร้อมใช้งานทั้งหมด Live Avatar ไม่ใช่รหัสโมเดลของ Gemini API รายการโมเดลเสียงของ API ยังคงมี gemini-3.8-liveและ gemini-3.8-live-extended-thinkingโดยไม่มีแถวของ avatar และตารางราคาก็ไม่มีรายการค่าบริการสำหรับ avatar ฟีเจอร์นี้ถูกวางไว้ภายใน Gemini Enterprise ซึ่งหมายความว่ากลุ่มเป้าหมายของการประกาศครั้งนี้คือผู้ซื้อระดับองค์กรและนักพัฒนาที่ผสานการทำงานแทนพวกเขา ไม่ใช่นักพัฒนารายบุคคลที่เรียกใช้ Live API ด้วยคีย์ในวันนี้

คำกล่าวอ้างสองข้อของโพสต์นี้น่าจะยกมาอ้างแบบคำต่อคำ เพราะทั้งสองข้อล้วนแรงกว่าถ้อยคำเปิดตัวตามปกติ ข้อแรก: Live Avatar "มีความสามารถด้านการซิงโครไนซ์เสียงพูดเป็นเสียงพูดแบบหลายภาษาแบบเนทีฟ" และ "สามารถเปลี่ยนผ่านระหว่าง 97 ภาษาได้อย่างราบรื่นโดยไม่ทำให้ความเที่ยงตรงของวิดีโอลดลงหรือเกิดการคลาดเคลื่อนของภาพ" ตัวเลข 97 นี้เป็นจำนวนภาษาเดียวกับที่การเปิดตัวเมื่อวันที่ 15 กันยายนอ้างไว้สำหรับโมเดล live-dialogue ที่อยู่เบื้องหลัง ดังนั้นนี่จึงเป็นข้ออ้างเรื่องหลายภาษาที่มีอยู่เดิมซึ่งถูกกล่าวซ้ำโดยมีข้อจำกัดใหม่แนบมาด้วย — การซิงค์ริมฝีปากและแอนิเมชันใบหน้าจะต้องตามทันเมื่อภาษามีการเปลี่ยนกลางประโยค ข้อที่สอง: เอาต์พุตทั้งหมดมีลายน้ำ SynthID "ที่ถักทอโดยตรงเข้าไปในเอาต์พุตเสียงและวิดีโอ" ทั้งสองแทร็ก ไม่ใช่แค่เสียงพูด

ความสามารถที่เป็นของใหม่จริง ๆ คืออันที่อยู่ตรงกลาง

อ่านข้ามส่วนภาพไป แล้วย่อหน้าที่น่าสนใจที่สุดก็คือย่อหน้าเกี่ยวกับการเรียกใช้เครื่องมือ Google กล่าวว่า Live Avatar ขับเคลื่อนด้วย "การเรียกใช้เครื่องมือแบบอะซิงโครนัส" ซึ่งสามารถ "กระตุ้นการเรียกใช้เครื่องมือและดึงข้อมูลในเบื้องหลังในระหว่างที่บทสนทนายังดำเนินอยู่ รับมือกับงานที่ซับซ้อนพร้อมทั้งทำให้การสนทนาไหลลื่นอย่างไม่สะดุด" ตัวอย่างที่ยกมาคือการเช็กอินของแขกโรงแรม โดยโมเดลจะเรียกใช้เครื่องมือในเบื้องหลังและพูดคุยต่อไป

นั่นเป็นความแตกต่างเชิงสถาปัตยกรรมที่แท้จริงจากรูปแบบคำขอ-ตอบสนองที่การผสานรวมเสียงส่วนใหญ่สร้างขึ้นโดยยึดเป็นพื้นฐาน และมันเป็นส่วนที่มาพร้อมต้นทุนที่ต้องจ่าย การทำงานแบบอะซิงโครนัสหมายความว่าโมเดลกำลังทำงานที่ทรานสคริปต์ไม่ได้แสดง ในไปป์ไลน์ข้อความ คุณจะเห็นการเรียกใช้เครื่องมือเป็นเทิร์นหนึ่ง แต่ในที่นี้มันเกิดขึ้นภายใต้บทสนทนาที่ยังดำเนินอยู่ ซึ่งก่อให้เกิดคำถามแบบเดียวกับที่การทำงานแบบพร้อมกันใด ๆ ก่อให้เกิด: จะเกิดอะไรขึ้นหากการเรียกใช้เครื่องมือล้มเหลวอย่างเงียบ ๆ กลางประโยค และผู้เรียกจะรู้ได้อย่างไร โพสต์ของ Google ไม่ได้ระบุไว้ และการ์ดโมเดลคือที่ที่ควรดูเรื่องนี้ ให้ถือว่าข้อกล่าวอ้างเรื่อง "การไหลของบทสนทนาที่ไม่สะดุด" เป็นข้อมูลที่ผู้ขายรายงานเอง และยังไม่ได้รับการทดสอบโดยบุคคลที่สามรายใดที่เราหาเจอได้

พรีเซ็ตอวตาร และรายการที่อนุญาตซึ่งจำกัดครึ่งที่น่าสนใจ

เรื่องราวการปรับแต่งมีสองระดับ และมีเพียงระดับเดียวเท่านั้นที่พร้อมใช้งานทั่วไป ทุกการติดตั้งใช้งานระดับองค์กรจะได้รับ "คลังอวาตาร์สำเร็จรูปที่หลากหลาย" ส่วนอวาตาร์แบบกำหนดเอง — ซึ่งสร้าง "จากภาพอ้างอิงคุณภาพสูง" โดย "คงความเหมือนของภาพอ้างอิง สไตล์แบรนด์ หรืออัตลักษณ์ของตัวละคร" — ถูกกั้นไว้ และ Google ระบุอย่างตรงไปตรงมาว่า "การสร้างอวาตาร์แบบกำหนดเองในปัจจุบันมีให้ใช้เฉพาะผ่านการอนุญาตแบบองค์กร (enterprise allowlisting) เท่านั้น"

ดังนั้นความสามารถที่ทีมส่วนใหญ่จะต้องการจริง ๆ ซึ่งเป็นความสามารถที่ทำให้อวตารตรงกับแบรนด์หรือตัวละครที่มีชื่อ คือความสามารถที่คุณไม่สามารถให้บริการด้วยตนเองได้ หากแผนของคุณต้องพึ่งพาพิธีกรสังเคราะห์ที่ดูเหมือนมาสคอตของคุณ คุณกำลังรอการตัดสินใจเรื่อง allowlist ไม่ใช่การเปิดตัวโมเดล นั่นเป็นข้อเท็จจริงด้านการจัดซื้อจัดจ้าง ไม่ใช่ข้อเท็จจริงด้านเทคนิค และเป็นประเภทของสิ่งที่เลื่อนหลุดไปหนึ่งไตรมาสอย่างเงียบ ๆ

A screenshot of the Google DeepMind blog post 'Introducing Gemini 3.8 Live with Live Avatar', captured in English on 25 September 2026, showing the 24 September 2026 date, the authors listed as Shuo-yiin Chang and CJ Zheng on behalf of the Gemini Audio Team, the lede 'Building on the momentum of last week's Gemini 3.8 Live launch', the sentence 'Starting today, Gemini 3.8 Live with Live Avatar is available in Gemini Enterprise', and the section heading 'More natural and multimodal conversations'.

ตำแหน่งที่มันวางอยู่เมื่อเทียบกับส่วนที่เหลือของบรรทัด

Live Avatar ไม่ได้เกิดขึ้นในกลุ่มผลิตภัณฑ์ที่ว่างเปล่า และตำแหน่งที่มันครองอยู่นั้นเห็นได้ชัดเจนที่สุดเมื่อเทียบกับผลิตภัณฑ์พี่น้องที่วางจำหน่ายในช่วงสองสัปดาห์เดียวกัน

• มีให้ใช้งานเป็น — Gemini 3.8 Live พร้อม Live Avatar เป็นความสามารถระดับองค์กรภายใน Gemini Enterprise เทียบกับ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งเป็น endpoint ของ Gemini API ที่มี model ID และอัตราค่าบริการต่อนาทีที่ประกาศไว้
• นักพัฒนาสามารถเรียกใช้งานได้ — Live Avatar ไม่ได้ ไม่มี model ID และไม่มีบรรทัดใน rate card เทียบกับ Live endpoint สองตัวที่ได้ คือ gemini-3.8-live และ gemini-3.8-live-extended-thinking
• เอาต์พุต — Live Avatar ให้เสียงพร้อมวิดีโอที่ซิงโครไนซ์ เทียบกับ Live endpoint ให้เฉพาะเสียง
• การกล่าวอ้างด้านภาษา — Live Avatar 97 ภาษาพร้อมลิปซิงค์และความต่อเนื่องของการแสดงออก เทียบกับ Live endpoint 97 ภาษาพร้อมการสลับกลางบทสนทนาโดยอัตโนมัติ
• ลายน้ำ — Live Avatar ใช้ SynthID ทั้งบนแทร็กเสียงและแทร็กวิดีโอ เทียบกับ Live endpoint ใช้ SynthID บนเสียงที่สร้างขึ้น

ตัว endpoint แบบ Live ทั้งสองนั้นเป็นคู่ที่ได้รับการบันทึกไว้อย่างละเอียดแล้ว การวัดผลโดยอิสระพบว่าทั้งสองห่างกันมากในบางแกน และใกล้กันในแกนอื่น ๆ บนดัชนี Speech to Speech ของ Artificial Analysis นั้น Gemini 3.8 Live Extended Thinking (High) อยู่ที่ 82.6 เทียบกับ Gemini 3.8 Live ที่ 76.0 ซึ่งช่องว่างนี้เกิดจากคุณภาพการให้เหตุผลเป็นหลัก มากกว่าพลวัตของการสนทนา โดยในด้านหลังนี้ลำดับกลับกัน ส่วนตัวเลขของ Google เองระบุว่าทั้งสองอยู่ที่ 68.6% และ 30.1% ในการทำภารกิจให้สำเร็จบน τ-Voice และ 98% กับ 92% บน Big Bench Audio Live Avatar จะสืบทอดคุณสมบัติจากตัวใดก็ตามที่คุณเรียกใช้อยู่ข้างใต้ และสืบทอดราคาของตัวนั้นด้วย เพราะ avatar เป็นเพียงชั้นการนำเสนอที่วางทับอยู่บนลูปการสนทนาเดียวกัน

A screenshot of the Artificial Analysis Speech to Speech leaderboard, captured in English on 25 September 2026, showing the AA Speech to Speech Index speed and cost-per-hour-of-input-audio panel. The top index values read 82.6, 81.5, 81.3, 80.1, 76.0, 73.9 and 71.5, with a cost axis running to roughly $10.75 per hour. The bar labels are set vertically and are not legible at capture size.

สิ่งที่สิ่งนี้ไม่เปลี่ยนแปลง

มันไม่ได้ทำให้โมเดลดีขึ้น Live Avatar เป็นเลเยอร์การนำเสนอและการประสานงาน: ตัวเลขคุณภาพของ Gemini 3.8 Live ยังคงเท่ากับเมื่อวันที่ 15 กันยายน และใครก็ตามที่ต้องการเวอร์ชันที่แข็งแกร่งกว่าในสองเวอร์ชันนี้ยังต้องเลือก Extended Thinking และยอมรับความหน่วงของมัน มันไม่ได้ใส่วิดีโอเข้าไปใน API และไม่ได้เปลี่ยนราคาของการสนทนากับโมเดล ซึ่งยังคงคิดค่าบริการตามอัตราเสียงรายนาทีของ Live API — $0.005 ต่อนาทีสำหรับเสียงขาเข้า และ $0.018 ต่อนาทีสำหรับเสียงขาออก — โดยการสร้างวิดีโอของอวาตาร์ยังไม่มีราคาเปิดเผยต่อสาธารณะเนื่องจากไม่ได้ขายแยกต่างหาก

สิ่งที่มันเปลี่ยนไปคือชุดผลิตภัณฑ์ที่สามารถสร้างได้โดยไม่ต้องมีเลเยอร์การเรนเดอร์แยกต่างหาก ตัวแทนสนับสนุนที่เมื่อก่อนพูดแล้วทิ้งแผงเปล่าไว้บนหน้าจอ ตอนนี้สามารถแสดงใบหน้าได้ในขณะที่ทำงาน และงานที่มันทำอยู่เบื้องหลังก็ไม่ปรากฏเป็นความเงียบว่างเปล่าอีกต่อไป นั่นเป็นการเปลี่ยนแปลงที่มีความหมายต่อรูปทรงของอินเทอร์เฟซ และเป็นการเปลี่ยนแปลงเพียงเล็กน้อยต่อโมเดลพื้นฐาน ทั้งสองอย่างนั้นเป็นจริงพร้อมกันได้

A generated summary card for Gemini 3.8 Live with Live Avatar on a white background with soft blue-and-cyan gradient accents. Four rows read 'Announced: 24 September 2026', 'Underlying models: gemini-3.8-live and gemini-3.8-live-extended-thinking, unchanged', 'Availability: Gemini Enterprise; custom avatars by enterprise allowlist', and 'Watermark: SynthID on audio and video'. A footer line reads 'Per Google DeepMind, 24 September 2026; vendor-reported and not independently benchmarked.' The OrcaRouter logo is composited in the bottom-right corner.

สิ่งที่ควรจับตา และหมายเหตุเกี่ยวกับการกำหนดเส้นทางหนึ่งข้อ

สามสิ่งจะเปลี่ยนเรื่องนี้จากประกาศให้กลายเป็นการตัดสินใจลงมือสร้าง Custom avatar allowlisting จะต้องเปิดกว้างขึ้น เพราะ preset avatars เป็นเพียงเดโม ส่วน custom avatars คือผลิตภัณฑ์จริง video track จะต้องมีราคา เพราะไม่มีใครจำลอง unit economics จากเอาต์พุตที่ยังไม่ตั้งราคาได้ และ avatar endpoint จะต้องปรากฏในรายการโมเดลของ API เพราะนั่นคือความต่างระหว่างฟีเจอร์ระดับองค์กรกับสิ่งที่นักพัฒนาสามารถเรียกใช้ได้คืนนี้

ในฝั่งของเรา มีสิ่งหนึ่งที่ควรกล่าวไว้ให้ชัดเจน เพราะเป็นเรื่องที่อาจเข้าใจกันไปเป็นอย่างอื่นได้ง่าย นั่นคือ OrcaRouter ไม่ได้จัดเส้นทางไปยัง Gemini 3.8 Live endpoints หรือ Live Avatar และไม่ควรตีความสิ่งใดในที่นี้ว่าเป็นการอ้างว่าเราทำเช่นนั้น สิ่งที่เรามีให้บริการคือส่วนที่เหลือของสายผลิตภัณฑ์ 3.8 ของ Goog​le — google/gemini-3.8-flashรวมอยู่ด้วย — พร้อมกับแคตตาล็อกโมเดลมากกว่า 200 รายการจากคีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม หาก Live Avatar พาสถาปัตยกรรมของคุณไปสู่อเจนต์ที่ต้องใช้เหตุผลวิเคราะห์ว่าลูกค้าพูดอะไร ส่วนที่เป็นการวิเคราะห์เหตุผลของสแต็กนั้นก็คือส่วนที่คุณสามารถรวมให้เป็นหนึ่งเดียวได้ตั้งแต่วันนี้

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube