
Gemini 3.8 Live พร้อม Live Avatar: Google มอบใบหน้าให้โมเดลเสียงของตน
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 36 tok/s
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 181 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking เปิดตัวเมื่อวันที่ 15 กันยายน 2026 — เอนด์พอยต์บทสนทนาแบบสดโดยตรงสองรายการที่ Google เปิดให้ใช้บน API ของผู้ให้บริการ โดยตัวหนึ่งปรับให้เหมาะกับความหน่วงต่ำ และอีกตัวปรับให้เหมาะกับการพิจารณาไตร่ตรองอย่างรอบคอบ เมื่อวันที่ 24 กันยายน บริษัทได้ประกาศ Gemini 3.8 Live with Live Avatar ซึ่งจับคู่การสร้างวิดีโอแบบเกือบเรียลไทม์เข้ากับวงจรการพูดเดียวกัน เพื่อให้โมเดลมีใบหน้าขณะพูด ไม่มีอะไรเกี่ยวกับรหัสโมเดลทั้งสองเปลี่ยนไป สิ่งที่เปลี่ยนคือลักษณะที่บทสนทนาถูกอนุญาตให้เป็น และ — ที่สำคัญยิ่งกว่า — สิ่งที่โมเดลถูกอนุญาตให้ทำกับบทสนทนาขณะที่มันยังดำเนินอยู่
สิ่งที่จัดส่งจริงเมื่อวันที่ 24 กันยายนคืออะไร
โพสต์ของ DeepMind นั้นสั้นและเจาะจง และคุ้มค่าที่จะแยกสิ่งที่โพสต์กล่าวอ้างออกจากสิ่งที่มันหมายถึง Live Avatar ในคำพูดของ Google เอง “นำการปรากฏตัวทางภาพแบบเกือบเรียลไทม์มาสู่ AI สนทนาของ Gemini” โดยจับคู่การสร้างวิดีโอแบบเรียลไทม์เข้ากับสแต็กเสียงที่มีอยู่ บริษัทอธิบายถึงการซิงก์ริมฝีปากที่แม่นยำ สีหน้าท่าทางที่เป็นธรรมชาติ และการผลัดกันพูดที่ลื่นไหล พร้อมยกตัวอย่างการนำไปใช้งานสองกรณี: การบริการลูกค้าและการแนะนำแบบโต้ตอบ จากนั้นจึงกล่าวประโยคที่สำคัญที่สุดสำหรับใครก็ตามที่วางแผนจะสร้าง — “เริ่มตั้งแต่วันนี้ Gemini 3.8 Live with Live Avatar พร้อมใช้งานใน Gemini Enterprise”
นั่นคือเรื่องราวความพร้อมใช้งานทั้งหมด Live Avatar ไม่ใช่รหัสโมเดลของ Gemini API รายการโมเดลเสียงของ API ยังคงมี gemini-3.8-liveและ gemini-3.8-live-extended-thinkingโดยไม่มีแถวของ avatar และตารางราคาก็ไม่มีรายการค่าบริการสำหรับ avatar ฟีเจอร์นี้ถูกวางไว้ภายใน Gemini Enterprise ซึ่งหมายความว่ากลุ่มเป้าหมายของการประกาศครั้งนี้คือผู้ซื้อระดับองค์กรและนักพัฒนาที่ผสานการทำงานแทนพวกเขา ไม่ใช่นักพัฒนารายบุคคลที่เรียกใช้ Live API ด้วยคีย์ในวันนี้
คำกล่าวอ้างสองข้อของโพสต์นี้น่าจะยกมาอ้างแบบคำต่อคำ เพราะทั้งสองข้อล้วนแรงกว่าถ้อยคำเปิดตัวตามปกติ ข้อแรก: Live Avatar "มีความสามารถด้านการซิงโครไนซ์เสียงพูดเป็นเสียงพูดแบบหลายภาษาแบบเนทีฟ" และ "สามารถเปลี่ยนผ่านระหว่าง 97 ภาษาได้อย่างราบรื่นโดยไม่ทำให้ความเที่ยงตรงของวิดีโอลดลงหรือเกิดการคลาดเคลื่อนของภาพ" ตัวเลข 97 นี้เป็นจำนวนภาษาเดียวกับที่การเปิดตัวเมื่อวันที่ 15 กันยายนอ้างไว้สำหรับโมเดล live-dialogue ที่อยู่เบื้องหลัง ดังนั้นนี่จึงเป็นข้ออ้างเรื่องหลายภาษาที่มีอยู่เดิมซึ่งถูกกล่าวซ้ำโดยมีข้อจำกัดใหม่แนบมาด้วย — การซิงค์ริมฝีปากและแอนิเมชันใบหน้าจะต้องตามทันเมื่อภาษามีการเปลี่ยนกลางประโยค ข้อที่สอง: เอาต์พุตทั้งหมดมีลายน้ำ SynthID "ที่ถักทอโดยตรงเข้าไปในเอาต์พุตเสียงและวิดีโอ" ทั้งสองแทร็ก ไม่ใช่แค่เสียงพูด
ความสามารถที่เป็นของใหม่จริง ๆ คืออันที่อยู่ตรงกลาง
อ่านข้ามส่วนภาพไป แล้วย่อหน้าที่น่าสนใจที่สุดก็คือย่อหน้าเกี่ยวกับการเรียกใช้เครื่องมือ Google กล่าวว่า Live Avatar ขับเคลื่อนด้วย "การเรียกใช้เครื่องมือแบบอะซิงโครนัส" ซึ่งสามารถ "กระตุ้นการเรียกใช้เครื่องมือและดึงข้อมูลในเบื้องหลังในระหว่างที่บทสนทนายังดำเนินอยู่ รับมือกับงานที่ซับซ้อนพร้อมทั้งทำให้การสนทนาไหลลื่นอย่างไม่สะดุด" ตัวอย่างที่ยกมาคือการเช็กอินของแขกโรงแรม โดยโมเดลจะเรียกใช้เครื่องมือในเบื้องหลังและพูดคุยต่อไป
นั่นเป็นความแตกต่างเชิงสถาปัตยกรรมที่แท้จริงจากรูปแบบคำขอ-ตอบสนองที่การผสานรวมเสียงส่วนใหญ่สร้างขึ้นโดยยึดเป็นพื้นฐาน และมันเป็นส่วนที่มาพร้อมต้นทุนที่ต้องจ่าย การทำงานแบบอะซิงโครนัสหมายความว่าโมเดลกำลังทำงานที่ทรานสคริปต์ไม่ได้แสดง ในไปป์ไลน์ข้อความ คุณจะเห็นการเรียกใช้เครื่องมือเป็นเทิร์นหนึ่ง แต่ในที่นี้มันเกิดขึ้นภายใต้บทสนทนาที่ยังดำเนินอยู่ ซึ่งก่อให้เกิดคำถามแบบเดียวกับที่การทำงานแบบพร้อมกันใด ๆ ก่อให้เกิด: จะเกิดอะไรขึ้นหากการเรียกใช้เครื่องมือล้มเหลวอย่างเงียบ ๆ กลางประโยค และผู้เรียกจะรู้ได้อย่างไร โพสต์ของ Google ไม่ได้ระบุไว้ และการ์ดโมเดลคือที่ที่ควรดูเรื่องนี้ ให้ถือว่าข้อกล่าวอ้างเรื่อง "การไหลของบทสนทนาที่ไม่สะดุด" เป็นข้อมูลที่ผู้ขายรายงานเอง และยังไม่ได้รับการทดสอบโดยบุคคลที่สามรายใดที่เราหาเจอได้
พรีเซ็ตอวตาร และรายการที่อนุญาตซึ่งจำกัดครึ่งที่น่าสนใจ
เรื่องราวการปรับแต่งมีสองระดับ และมีเพียงระดับเดียวเท่านั้นที่พร้อมใช้งานทั่วไป ทุกการติดตั้งใช้งานระดับองค์กรจะได้รับ "คลังอวาตาร์สำเร็จรูปที่หลากหลาย" ส่วนอวาตาร์แบบกำหนดเอง — ซึ่งสร้าง "จากภาพอ้างอิงคุณภาพสูง" โดย "คงความเหมือนของภาพอ้างอิง สไตล์แบรนด์ หรืออัตลักษณ์ของตัวละคร" — ถูกกั้นไว้ และ Google ระบุอย่างตรงไปตรงมาว่า "การสร้างอวาตาร์แบบกำหนดเองในปัจจุบันมีให้ใช้เฉพาะผ่านการอนุญาตแบบองค์กร (enterprise allowlisting) เท่านั้น"
ดังนั้นความสามารถที่ทีมส่วนใหญ่จะต้องการจริง ๆ ซึ่งเป็นความสามารถที่ทำให้อวตารตรงกับแบรนด์หรือตัวละครที่มีชื่อ คือความสามารถที่คุณไม่สามารถให้บริการด้วยตนเองได้ หากแผนของคุณต้องพึ่งพาพิธีกรสังเคราะห์ที่ดูเหมือนมาสคอตของคุณ คุณกำลังรอการตัดสินใจเรื่อง allowlist ไม่ใช่การเปิดตัวโมเดล นั่นเป็นข้อเท็จจริงด้านการจัดซื้อจัดจ้าง ไม่ใช่ข้อเท็จจริงด้านเทคนิค และเป็นประเภทของสิ่งที่เลื่อนหลุดไปหนึ่งไตรมาสอย่างเงียบ ๆ

ตำแหน่งที่มันวางอยู่เมื่อเทียบกับส่วนที่เหลือของบรรทัด
Live Avatar ไม่ได้เกิดขึ้นในกลุ่มผลิตภัณฑ์ที่ว่างเปล่า และตำแหน่งที่มันครองอยู่นั้นเห็นได้ชัดเจนที่สุดเมื่อเทียบกับผลิตภัณฑ์พี่น้องที่วางจำหน่ายในช่วงสองสัปดาห์เดียวกัน
• มีให้ใช้งานเป็น — Gemini 3.8 Live พร้อม Live Avatar เป็นความสามารถระดับองค์กรภายใน Gemini Enterprise เทียบกับ Gemini 3.8 Live และ Gemini 3.8 Live Extended Thinking ซึ่งเป็น endpoint ของ Gemini API ที่มี model ID และอัตราค่าบริการต่อนาทีที่ประกาศไว้
• นักพัฒนาสามารถเรียกใช้งานได้ — Live Avatar ไม่ได้ ไม่มี model ID และไม่มีบรรทัดใน rate card เทียบกับ Live endpoint สองตัวที่ได้ คือ gemini-3.8-live และ gemini-3.8-live-extended-thinking
• เอาต์พุต — Live Avatar ให้เสียงพร้อมวิดีโอที่ซิงโครไนซ์ เทียบกับ Live endpoint ให้เฉพาะเสียง
• การกล่าวอ้างด้านภาษา — Live Avatar 97 ภาษาพร้อมลิปซิงค์และความต่อเนื่องของการแสดงออก เทียบกับ Live endpoint 97 ภาษาพร้อมการสลับกลางบทสนทนาโดยอัตโนมัติ
• ลายน้ำ — Live Avatar ใช้ SynthID ทั้งบนแทร็กเสียงและแทร็กวิดีโอ เทียบกับ Live endpoint ใช้ SynthID บนเสียงที่สร้างขึ้น
ตัว endpoint แบบ Live ทั้งสองนั้นเป็นคู่ที่ได้รับการบันทึกไว้อย่างละเอียดแล้ว การวัดผลโดยอิสระพบว่าทั้งสองห่างกันมากในบางแกน และใกล้กันในแกนอื่น ๆ บนดัชนี Speech to Speech ของ Artificial Analysis นั้น Gemini 3.8 Live Extended Thinking (High) อยู่ที่ 82.6 เทียบกับ Gemini 3.8 Live ที่ 76.0 ซึ่งช่องว่างนี้เกิดจากคุณภาพการให้เหตุผลเป็นหลัก มากกว่าพลวัตของการสนทนา โดยในด้านหลังนี้ลำดับกลับกัน ส่วนตัวเลขของ Google เองระบุว่าทั้งสองอยู่ที่ 68.6% และ 30.1% ในการทำภารกิจให้สำเร็จบน τ-Voice และ 98% กับ 92% บน Big Bench Audio Live Avatar จะสืบทอดคุณสมบัติจากตัวใดก็ตามที่คุณเรียกใช้อยู่ข้างใต้ และสืบทอดราคาของตัวนั้นด้วย เพราะ avatar เป็นเพียงชั้นการนำเสนอที่วางทับอยู่บนลูปการสนทนาเดียวกัน

สิ่งที่สิ่งนี้ไม่เปลี่ยนแปลง
มันไม่ได้ทำให้โมเดลดีขึ้น Live Avatar เป็นเลเยอร์การนำเสนอและการประสานงาน: ตัวเลขคุณภาพของ Gemini 3.8 Live ยังคงเท่ากับเมื่อวันที่ 15 กันยายน และใครก็ตามที่ต้องการเวอร์ชันที่แข็งแกร่งกว่าในสองเวอร์ชันนี้ยังต้องเลือก Extended Thinking และยอมรับความหน่วงของมัน มันไม่ได้ใส่วิดีโอเข้าไปใน API และไม่ได้เปลี่ยนราคาของการสนทนากับโมเดล ซึ่งยังคงคิดค่าบริการตามอัตราเสียงรายนาทีของ Live API — $0.005 ต่อนาทีสำหรับเสียงขาเข้า และ $0.018 ต่อนาทีสำหรับเสียงขาออก — โดยการสร้างวิดีโอของอวาตาร์ยังไม่มีราคาเปิดเผยต่อสาธารณะเนื่องจากไม่ได้ขายแยกต่างหาก
สิ่งที่มันเปลี่ยนไปคือชุดผลิตภัณฑ์ที่สามารถสร้างได้โดยไม่ต้องมีเลเยอร์การเรนเดอร์แยกต่างหาก ตัวแทนสนับสนุนที่เมื่อก่อนพูดแล้วทิ้งแผงเปล่าไว้บนหน้าจอ ตอนนี้สามารถแสดงใบหน้าได้ในขณะที่ทำงาน และงานที่มันทำอยู่เบื้องหลังก็ไม่ปรากฏเป็นความเงียบว่างเปล่าอีกต่อไป นั่นเป็นการเปลี่ยนแปลงที่มีความหมายต่อรูปทรงของอินเทอร์เฟซ และเป็นการเปลี่ยนแปลงเพียงเล็กน้อยต่อโมเดลพื้นฐาน ทั้งสองอย่างนั้นเป็นจริงพร้อมกันได้

สิ่งที่ควรจับตา และหมายเหตุเกี่ยวกับการกำหนดเส้นทางหนึ่งข้อ
สามสิ่งจะเปลี่ยนเรื่องนี้จากประกาศให้กลายเป็นการตัดสินใจลงมือสร้าง Custom avatar allowlisting จะต้องเปิดกว้างขึ้น เพราะ preset avatars เป็นเพียงเดโม ส่วน custom avatars คือผลิตภัณฑ์จริง video track จะต้องมีราคา เพราะไม่มีใครจำลอง unit economics จากเอาต์พุตที่ยังไม่ตั้งราคาได้ และ avatar endpoint จะต้องปรากฏในรายการโมเดลของ API เพราะนั่นคือความต่างระหว่างฟีเจอร์ระดับองค์กรกับสิ่งที่นักพัฒนาสามารถเรียกใช้ได้คืนนี้
ในฝั่งของเรา มีสิ่งหนึ่งที่ควรกล่าวไว้ให้ชัดเจน เพราะเป็นเรื่องที่อาจเข้าใจกันไปเป็นอย่างอื่นได้ง่าย นั่นคือ OrcaRouter ไม่ได้จัดเส้นทางไปยัง Gemini 3.8 Live endpoints หรือ Live Avatar และไม่ควรตีความสิ่งใดในที่นี้ว่าเป็นการอ้างว่าเราทำเช่นนั้น สิ่งที่เรามีให้บริการคือส่วนที่เหลือของสายผลิตภัณฑ์ 3.8 ของ Google — google/gemini-3.8-flashรวมอยู่ด้วย — พร้อมกับแคตตาล็อกโมเดลมากกว่า 200 รายการจากคีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่ม หาก Live Avatar พาสถาปัตยกรรมของคุณไปสู่อเจนต์ที่ต้องใช้เหตุผลวิเคราะห์ว่าลูกค้าพูดอะไร ส่วนที่เป็นการวิเคราะห์เหตุผลของสแต็กนั้นก็คือส่วนที่คุณสามารถรวมให้เป็นหนึ่งเดียวได้ตั้งแต่วันนี้
