
Muse Realtime Avatar กับ GPT-Live-1: การมีตัวตนปะทะการสนทนา
- openaiใหม่OpenAI: GPT-6 Luna2026-09-2237ความฉลาด
- openaiใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- grokใหม่Grok 4.72026-09-2146ความฉลาด
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น · 180 tok/s
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1277 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 110 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
หน่วยเรียกเก็บเงินบอกคุณว่าแต่ละบริษัทคิดว่าตนกำลังขายอะไร GPT-Live-1 โมเดลเสียงแบบ full-duplex ของ OpenAI คิดค่าบริการเหมาจ่าย $0.05 ต่อนาทีของเสียง โดยคิดเป็นรายวินาที และขีดจำกัดอัตราของมันนับเป็นเซสชันพร้อมกัน — 25 ใน Tier 1 เพิ่มขึ้นเป็น 500 ที่ Tier 5 นั่นคือหน่วยของสายโทรศัพท์ Muse Realtime Avatar ที่ Meta ประกาศเมื่อวันที่ 23 กันยายน 2026 ไม่มีหน่วยเรียกเก็บเงิน เพราะไม่มีอะไรให้เรียกเก็บ: ไม่มี API ไม่มี endpoint ไม่มีราคา ไม่มีวันที่ หน่วยที่เปิดเผยของมันเป็นตัวเลขฮาร์ดแวร์แทน — 12 เซสชันเรียลไทม์พร้อมกันบน NVIDIA GB200 หนึ่งตัว บริษัทหนึ่งกำลังขายบทสนทนาเป็นรายนาที อีกบริษัทกำลังแสดงให้คุณเห็นว่าการเรนเดอร์ใบหน้าหนึ่งหน้ามีต้นทุนเท่าไร และยังไม่ได้ตัดสินใจจะขายมัน
โมเดลทั้งสองค่อนข้างใหม่ และไม่มีอันใดเป็นการเปิดตัวในความหมายที่คำนี้มักจะสื่อ GPT-Live-1 เปิดตัวภายใน ChatGPT เมื่อวันที่ 8 กรกฎาคม 2026 และเพิ่งเข้าถึง developer API เมื่อวันที่ 10 กันยายน — สองเดือนที่มันเป็นเสียงเริ่มต้นของผลิตภัณฑ์สำหรับผู้บริโภค และไม่พร้อมให้บริการสำหรับผู้ที่ต้องการพัฒนา Muse Realtime Avatar ถูกประกาศเมื่อวันที่ 23 กันยายน 2026 ที่ Meta Connect ถูกสาธิตในโพสต์วิจัยของ Meta เอง และยังคงเป็นความสามารถของ Muse agent มากกว่าที่จะเป็นผลิตภัณฑ์ การเปรียบเทียบทั้งสองคือการเปรียบเทียบสองขั้นตอนที่แตกต่างกันของแนวคิดเดียวกัน: เกิดอะไรขึ้นเมื่อโมเดลสนทนาดีพอจนคำถามถัดไปคือสิ่งที่ผู้ใช้กำลังมองดูอยู่ในขณะที่มันพูด
สิ่งที่ OpenAI สร้างขึ้น: บทสนทนาที่ไม่เคยหยุดชะงัก
GPT-Live-1 เป็นฟูลดูเพล็กซ์ในความหมายที่สำคัญในเชิงการใช้งานจริง — มันไม่ได้รอให้คุณพูดจบก่อนจึงจะเริ่มทำงาน มันเข้าถึง developer API ผ่าน endpoint เพียงหนึ่งเดียวเท่านั้น คือ Live Sessions endpoint ภายใต้ model ID เพียงหนึ่งเดียว gpt-live-1 โดยไม่มี dated snapshot ให้ปักหมุด และไม่มี endpoint แบบพี่น้องที่เปิดใช้งานอยู่ ไม่มี Chat Completions ไม่มี Responses ไม่มี Realtime ไม่มี fine-tuning ไม่มี endpoint สำหรับการถอดเสียงหรือเสียงพูด อินพุตรูปภาพและวิดีโอไม่ได้รับการสนับสนุนอย่างชัดเจน
การตัดสินใจออกแบบที่กำหนดทุกอย่างที่ตามมาคือการมอบหมายงานให้ตัวอื่นทำงานแทน GPT-Live-1 ไม่ได้คิดงานหนักด้วยตัวเอง เอกสารของ OpenAI จับคู่เลเยอร์เสียงกับแบ็กเอนด์การให้เหตุผลแยกต่างหาก และในตัวอย่าง WebRTC ที่เผยแพร่ แบ็กเอนด์นั้นคือ GPT-5.6 Terra ดังนั้นเซสชัน GPT-Live-1 จึงมีมิเตอร์สองตัวทำงานพร้อมกัน: นาทีละ $0.05 สำหรับเสียง บวกกับอัตราคิดค่าตามโทเคนปกติของโมเดลแบ็กเอนด์สำหรับทุกการเรียกใช้เครื่องมือ การค้นหา และขั้นตอนการให้เหตุผลที่มันส่งต่อไป ใน Speech to Speech Index บุคลิกที่แยกออกมานั้นปรากฏเป็นการที่โมเดลเดียวกันได้คะแนนสองครั้ง — 81.5 โดยมี GPT-6 Astra เป็นตัวคิดที่ความพยายามระดับปานกลาง, 80.1 โดยมี GPT-5.6 Sol ที่ความพยายามต่ำ ช่องว่าง 1.4 จุดระหว่างสองการกำหนดค่านี้กว้างกว่าส่วนต่าง 0.2 จุดที่ทำให้การกำหนดค่าที่ดีที่สุดของ GPT-Live-1 อยู่ในอันดับหนึ่ง
นั่นคือภาพที่แท้จริงของโมเดล ฟรอนต์เอนด์ด้านเสียงนั้นคงที่ ส่วนความฉลาดเป็นพารามิเตอร์ที่คุณตั้งค่า และมันขยับคะแนนได้มากกว่าโมเดลคู่แข่งใด ๆ
สิ่งที่ Meta สร้าง: ใบหน้าที่เคลื่อนไหวตามเสียง
Muse Realtime Avatar จัดการกับปัญหาที่ GPT-Live-1 ไม่มี — การทำให้วิดีโอที่สร้างขึ้นเดินคู่พร้อมกับเสียงพูดที่สร้างขึ้นอย่างแม่นยำแบบล็อกสเต็ป คำตอบของ Meta คือทำให้ทั้งสองกลายเป็นสตรีมเดียวกัน: Muse Realtime Voice ปล่อยโทเคนเสียงพูดที่บรรจุทั้งเนื้อหาและจังหวะเสียง และอวตารเป็น Diffusion Transformer ที่ขับเคลื่อนด้วยเสียงซึ่งใช้โทเคนชุดเดียวกันนั้น โดยมีเงื่อนไขจากภาพอ้างอิงและหน้าต่างเลื่อนของเลเทนต์วิดีโอล่าสุด ไม่มีการซิงค์ริมฝีปากในภายหลัง เพราะไม่มี "ภายหลัง" ให้ทำ — เสียง ปาก และสีหน้า ล้วนออกมาจากกระบวนการเดียว
ตัวเลขที่เผยแพร่เป็นของ Meta เอง วัดเทียบกับค่าพื้นฐานที่ Meta เลือก และไม่มีตัวเลขใดถูกทำซ้ำนอกบริษัท 870 มิลลิวินาทีจากจุดสิ้นสุดเทิร์นของคุณถึงไบต์แรกของการตอบกลับด้วยเสียงและวิดีโอที่ซิงโครไนซ์กัน วิดีโอแนวตั้ง 448×768 ที่ 25 เฟรมต่อวินาที มีลายน้ำแบบโอเวอร์เลย์โปร่งใสเพื่อให้ผู้ชมทราบว่ามันไม่ใช่กล้อง สิบสองเซสชันพร้อมกันบน GB200 หนึ่งตัว เพิ่มความจุ 8 เท่าเหนือค่าพื้นฐาน BF16 แบบสองขั้นตอนของ Meta เอง จากการฝึกที่คำนึงถึงการควอนไทซ์สี่บิต แคช KV แบบถาวร และการแบตช์แบบไดนามิกที่คำนึงถึงความหน่วง และผลลัพธ์ด้านความชอบที่ Meta รายงานว่าเพิ่มจาก 45% เป็น 55% เหนือค่าพื้นฐานนั้น โดยมีชัยชนะที่เปิดเผยสองครั้งต่อระบบอวตารเชิงพาณิชย์ — บวกกับการเปิดเผยว่าในด้านกิริยาท่าทาง ผลลัพธ์กับหนึ่งในนั้นไม่สามารถแยกความแตกต่างทางสถิติจากความเท่าเทียมได้
ไม่มีอะไรในรายการนั้นที่เป็นอัตรา, เอ็นด์พอยต์ หรือวันที่

บิลสองเมตร และจุดที่การจัดเส้นทางพิสูจน์คุณค่าของตัวเอง
โครงสร้างต้นทุนของ GPT-Live-1 ไม่ใช่ตัวเลขเดียว และการมองมันเป็นตัวเลขเดียวคือวิธีที่โมเดลเสียงที่ฟังดูถูกทำให้เกิดค่าใช้จ่ายระดับแพงทั้งเดือน เสียงคิดราคา $0.05 ต่อนาที คิดตามวินาทีโดยไม่ปัดขึ้น และ 15 วินาทีแรกของเซสชันจะถูกเรียกเก็บล่วงหน้า แต่จะถูกหักลบกับระยะเวลาที่ตามมา แทนที่จะบวกซ้อนเพิ่มเข้าไป ทุกสิ่งที่เซสชันมอบหมายงานให้ทำ — การให้เหตุผล การเรียกใช้เครื่องมือ การค้นหาใด ๆ — จะถูกคิดราคาแยกต่างหากในอัตราของโมเดลเบ็กเอนด์เอง ชี้การมอบหมายงานไปที่ตัวให้เหตุผลระดับแนวหน้าและปล่อยให้มันค้นหาในทุกเทิร์น แล้วคุณก็จะได้สายเปิดที่ราคา $3 ต่อชั่วโมงโดยมีโมเดลระดับพรีเมียมอยู่เบื้องหลัง
มิเตอร์ตัวที่สองคือครึ่งที่กำหนดเส้นทางได้ บน OrcaRouter แบ็กเอนด์ของเซสชัน GPT-Live-1 ก็เป็นเพียงการเรียกโมเดลอีกครั้ง: 196 โมเดลจาก 15 ผู้ให้บริการภายใต้คีย์เดียว ในราคาตามรายการของผู้ให้บริการที่ส่งผ่านโดยไม่มีมาร์กอัปใด ๆ พร้อมการสลับไปใช้ตัวสำรองอัตโนมัติเมื่อโมเดลที่คุณเลือกเกิดข้อผิดพลาดหรือหมดเวลา คุณไม่สามารถกำหนดเส้นทางเลเยอร์เสียงได้ — Live Sessions เป็นเพียงเอนด์พอยต์ของ OpenAI เท่านั้น — แต่ทุกสิ่งที่เลเยอร์เสียงส่งต่อไปนั้นอยู่บนคีย์เดียว ซึ่งหมายความว่าส่วนของบิลที่ขยายตามความหนักหน่วงที่ผู้โทรของคุณใช้คิด ก็เป็นส่วนที่คุณเปลี่ยนได้โดยไม่ต้องมีสัญญา
ในทางตรงกันข้าม Muse Realtime Avatar ไม่มีมิเตอร์ให้จัดเส้นทาง มันเป็นฟีเจอร์หนึ่งของแอป

สองเดิมพันว่าจุดประสงค์ของ voice agent คืออะไร
ถ้าตัดสเปกออก สองบริษัทนี้ก็เห็นไม่ตรงกันว่าอะไรคือตัวผลิตภัณฑ์ เดิมพันของ OpenAI คือบทสนทนาคือตัวผลิตภัณฑ์ — ว่าวอยซ์เอเจนต์ก็คือสายโทรศัพท์สายหนึ่ง และงานที่ต้องทำคือทำให้มันรู้สึกอย่างนั้น: ไม่ปล่อยให้เงียบค้าง มอบการคิดหนัก ๆ ให้โมเดลที่อยู่เบื้องหลัง คิดค่าบริการเป็นนาที สเกลตามจำนวนสายที่เรียกพร้อมกัน ทุกทางเลือกบนพื้นผิว API ของ GPT-Live-1 ล้วนตามมาจากแนวคิดนี้ ลิมิตเรตแบบอิงคอนเคอร์เรนซี ขนส่งผ่าน WebRTC เท่านั้น ปลายทางเดียวที่จงใจจำกัดให้แคบ ไม่มีวิดีโอทั้งขาเข้าและขาออก
การเดิมพันของ Meta คือการมีตัวตนคือตัวผลิตภัณฑ์ — ผู้ใช้ที่มองเห็นเอเจนต์ได้คือผู้ใช้ที่ยังคงอยู่ในบทสนทนา และงานวิศวกรรมที่น่าสนใจนั้นไม่ใช่การผลัดกันพูด แต่คือการทำให้ตัวละครที่เรนเดอร์ออกมามีความสอดคล้อง连贯ตลอดความยาวของการสนทนา ทางเลือกเหล่านั้นก่อให้เกิดระบบที่ปรับให้เหมาะกับอัตราเฟรมและความหนาแน่นของเซสชันบน GPU โดยไม่มีพื้นผิวเชิงพาณิชย์ใด ๆ เลย
มีความเป็นไปได้จริงที่ทั้งสองจะถูกต้อง และทั้งสองจะถูกนำมาประกอบเข้าด้วยกัน ผลิตภัณฑ์หนึ่งอาจรันบทสนทนาของตนบนโมเดลเสียงแบบฟูลดูเพล็กซ์ และรันชั้นภาพบนตัวเรนเดอร์อวตาร์ และสิ่งเดียวที่ขัดขวางไม่ให้เกิดสิ่งนั้นในวันนี้คือ ตัวเรนเดอร์อวตาร์ยังไม่มีเอนด์พอยต์ สิ่งที่ไม่สมเหตุสมผลคือการมองว่าทั้งสองเป็นสองเวอร์ชันของการซื้อเดียวกัน
ใครควรลงมือ และใครควรรอ
ถ้าคุณกำลังสร้างผลิตภัณฑ์เสียงตอนนี้ GPT-Live-1 เรียกใช้งานได้ แต่ Muse Realtime Avatar ยังเรียกใช้ไม่ได้ และนั่นก็จบการตัดสินใจ ทางเลือกที่น่าสนใจภายใน GPT-Live-1 คือแบ็กเอนด์ที่คุณมอบหมายงานให้ เพราะนั่นคือจุดที่ทั้งคะแนนและบิลขยับจริง ๆ — และมันเป็นส่วนเดียวของสแตกที่คุณสามารถจัดเส้นทาง สลับ และสลับไปใช้ระบบสำรองได้โดยไม่ต้องแตะการผสานรวมเสียง
ถ้าสิ่งที่คุณต้องการคืออวตาร การรอไม่ใช่การอยู่เฉย สิ่งที่ควรจับตาดูนั้นเจาะจงชัดเจน: ว่า Meta จะเผยแพร่ตารางราคาและเอนด์พอยต์หรือไม่ ว่าจะมีวันที่ระบุไว้ปรากฏขึ้นหรือไม่ และว่า 870 ms จะยังรอดเมื่อต้องเจอกับโทรศัพท์ที่เชื่อมต่อผ่านเครือข่ายเซลลูลาร์ แทนที่จะเป็นเดโมในงาน Connect หรือไม่ โพสต์ของ Meta เองระบุว่าเดโมของตนไม่ได้สะท้อนอวตารทั้งหมดที่มีในแอป Muse ซึ่งเป็นประโยคที่ควรยึดไว้
จนกว่าหนึ่งในสิ่งเหล่านั้นจะเปลี่ยนไป การเปรียบเทียบนี้มีคำตอบสั้นเพียงบรรทัดเดียว GPT-Live-1 คือสายโทรศัพท์ที่มีสมองซึ่งคุณเลือกเอง ส่วน Muse Realtime Avatar คือใบหน้าที่ไม่มีหมายเลขโทรศัพท์

