
Tavus Griffin กับ Muse Realtime Avatar: สองโฉมหน้าแห่งปี 2026 สองปัญหาที่แตกต่างกัน
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeใหม่TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 223 tok/s
- OpenAIใหม่OpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIใหม่OpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- Anthropicใหม่Anthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIใหม่Grok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 129 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
ทั้ง Tavus Griffin Realtime Avatar และ Muse Realtime Avatar ต่างมีอยู่เพื่อแก้ปัญหาเดียวกันที่น่าอาย — โมเดลภาษาที่พูดได้แต่ไม่มีใบหน้า — และทั้งสองเข้าแก้ปัญหานั้นจากคนละทาง Griffin เป็น Human Realtime Avatar แบบวิดีโอต่อวิดีโอ ที่ดูผู้เข้าร่วมผ่านกล้องและสร้างอีกฝั่งของการสนทนาขึ้นมาแบบเรียลไทม์ และถูกประกาศโดย Tavus ในเดือนตุลาคม 2026 ในฐานะตัวอย่างงานวิจัยสำหรับผู้ทดสอบที่ได้รับเลือก Muse Realtime Avatar เป็นชั้นการทำให้เป็นร่างกายของ Meta สำหรับเอเจนต์ Muse ของตน ประกาศที่ Meta Connect เมื่อวันที่ 23 กันยายน 2026 และมันรับเสียงแล้วเปลี่ยนเป็นภาพเหมือนที่พูดได้อย่างซิงโครไนซ์ ทั้งสองยังไม่สามารถซื้อได้ ความแตกต่างอยู่ที่ว่าทั้งสองกำลังพยายามทำอะไรให้ถูกต้อง และมันจะปรากฏทันทีเมื่อคุณถามว่าแต่ละโมเดลได้รับอะไรเป็นอินพุตจริง ๆ
เวอร์ชันสั้น
• อินพุตของ Griffin คือบุคคลที่อยู่อีกฝั่ง — วิดีโอและเสียงของผู้เข้าร่วมแบบสด ซึ่งมันต้องอ่าน ต้องตอบสนอง และต้องถูกขัดจังหวะได้
• อินพุตของ Muse Realtime Avatar คือเสียงพูดของเอเจนต์เอง — สตรีมโทเคนจาก Muse Realtime Voice ที่มันแปลงให้เป็นใบหน้าที่สอดคล้องกัน
• Tavus วัดผล Griffin จากว่าผู้คนเชื่อมันหรือไม่ และเผยแพร่ตัวเลข 48% จากการโทรวิดีโอความยาวหนึ่งนาที
• Meta วัดว่า Muse Realtime Avatar ตามทันหรือไม่ และเผยแพร่ค่า 870 มิลลิวินาทีจากจุดสิ้นสุดของเทิร์นถึงไบต์แรก
• ทั้งคู่ยังไม่มี API สาธารณะ ไม่มีราคาที่ประกาศเผยแพร่ และไม่มีกำหนดวันวางจำหน่ายทั่วไป
อ่านสี่แถวนั้นรวมกันแล้วรูปร่างของความขัดแย้งก็ชัดเจน Tavus กำลังปรับให้เหมาะกับความเชื่อของอีกฝ่าย Meta กำลังปรับให้เหมาะกับเวลา

Griffin: โมเดลที่ต้องได้รับการเชื่อถือ
กรอบแนวคิดของ Tavus คือ Griffin เป็น Human Interaction Model ตัวแรก และสถาปัตยกรรมที่รองรับข้อกล่าวอ้างนี้เป็นระบบสองส่วนที่รวม Continuous Conversational Modeling เข้ากับ Audio-Visual Generation ส่วนแรกเป็นด้านพฤติกรรม: มันตัดสินใจว่าบุคลิกควรทำอะไรในแต่ละช่วงเวลาถัดไป โดยใช้สิ่งที่มองเห็นและได้ยิน ส่วนที่สองคือการเรนเดอร์ และ Tavus แยกส่วนนี้ออกอีกเป็น การสร้างเสียงพูดแบบสตรีมมิง และการสร้างวิดีโอแบบสตรีมมิง
ตัวเลขที่ Tavus ยกมาเป็นจุดขายไม่ใช่ตัวเลขด้านปริมาณงาน (throughput) ในการศึกษาที่บริษัทจัดทำร่วมกับ Queen Mary University of London ผู้เข้าร่วม 26 จาก 54 คน — 48% — เชื่อว่า Griffin เป็นคนจริงหลังการสนทนาวิดีโอหนึ่งนาที เทียบกับ 1 จาก 41 คน (2.4%) สำหรับชุดเทคโนโลยีเดิมของบริษัทซึ่งประกอบด้วยการสร้างใบหน้า Phoenix-4.5, การจัดการจังหวะสนทนา Sparrow-2 และการมองเห็น Raven-1 ผู้เข้าร่วมที่ไม่ได้ถูกหลอกมักเริ่มสงสัยภายใน 20 วินาทีแรก บน benchmark VideoFDB ของ NVIDIA ซึ่งให้คะแนนเมื่อเดือนกันยายน 2026 Tavus รายงานว่า Griffin ครองอันดับหนึ่งด้าน AI แบบเห็นหน้าค่าตากัน ด้วยคะแนนการสร้าง 3.83 เทียบกับ 2.80 ซึ่งเป็น baseline ที่สูงที่สุดที่มีรายงาน และ 3.92 ซึ่งเป็นค่าอ้างอิงของมนุษย์ และคะแนนการรับรู้ 3.73 เทียบกับ 3.44 สำหรับ baseline ที่ดีที่สุดที่มีรายงาน และ 4.20 ซึ่งเป็นค่าอ้างอิงของมนุษย์ ตัวเลขเหล่านั้นเป็นตัวเลขที่ผู้ขายรายงานเองและเฉพาะกับ benchmark นั้น แต่จุดเปรียบเทียบกับมนุษย์นั่นแหละที่น่าสนใจ
วิศวกรรมเบื้องหลังตัวเลขเหล่านั้นคือโคเดกที่ชื่อ Tavec และออโตเรเกรสซีฟดิฟฟิวชันทรานส์ฟอร์เมอร์ Tavec ทำงานที่ 48 kHz ด้วย 40 ค่าต่อเฟรมที่ 100 เฟรมต่อวินาที โดยไม่มีโค้ดบุ๊ก มีตัวถอดรหัสแบบคอซัลเต็มรูปแบบ และแพ็กเก็ตที่มีขนาดเล็กถึง 10 มิลลิวินาที — ออกแบบมาเพื่อให้ใบหน้าเริ่มขยับได้ก่อนที่ประโยคจะจบ เส้นทางวิดีโอส่งข้อมูล 720p เป็นชิ้นส่วนละ 320 มิลลิวินาที โดยที่หนึ่งเลเทนต์เท่ากับแปดเฟรมที่ 25 fps สามขั้นตอนดิฟฟิวชันต่อเลเทนต์ และการบีบอัดเชิงเวลา 8× ใน VAE กระบวนการกลั่นแบบสามขั้นตอน (การจับคู่การแจกแจง จากนั้นออโตเรเกรสซีฟแบบบังคับด้วยครู จากนั้นการบังคับตนเอง) คือสิ่งที่ทำให้สามารถรันสามขั้นตอนเหล่านั้นแบบเรียลไทม์ได้จริง ข้ออ้างเรื่องความหน่วงหลักคือค่าเฉลี่ย 0.43 วินาทีจากเสียงไปยังวิดีโอบน H100s ซึ่ง Tavus กล่าวว่าเป็นประมาณครึ่งหนึ่งของวิธีที่เร็วเป็นอันดับถัดไปที่วัดได้ การโคลนเสียงใช้ตัวอย่างประมาณ 10 วินาที
ราคาที่ต้องแลกกับทั้งหมดนี้ก็คือ Tavus ไม่สามารถเปิดตัวมันได้ Griffin-Lite ซึ่งเป็นพรีวิวเชิงวิจัยนั้นเปิดให้ใช้เฉพาะกลุ่มผู้ทดสอบช่วงแรกที่คัดเลือกมาเท่านั้น ในข้อความเกี่ยวกับการเปิดตัว บริษัทระบุอย่างตรงไปตรงมาว่า Griffin-Lite จะยังไม่พร้อมให้ลูกค้าใช้งานในขณะนี้ และคาดว่าจะเปิดตัว Griffin ในไม่ช้าหลังจากมีการจัดการข้อกังวลด้านความปลอดภัยบางประการแล้ว Griffin ยังไม่มีอยู่บนแพลตฟอร์มของ Tavus และจะไปอยู่ที่นั่น "เมื่อเราหาแนวทางที่จะเปิดตัวมันอย่างปลอดภัยได้แล้ว" โมเดลที่ทำให้คนเชื่อได้ 48% ของเวลาในการโทรหนึ่งนาที จากมุมมองด้านการนำไปใช้งาน ก็คือโมเดลที่ทำให้คนเชื่อได้ 48% ของเวลาในการโทรหนึ่งนาที

Muse Realtime Avatar: โมเดลที่ต้องตามให้ทัน
Muse Realtime Avatar ถูกประกาศเมื่อวันที่ 23 กันยายน 2026 ที่งาน Meta Connect และได้รับการเขียนถึงในวันเดียวกันโดย Meta Superintelligence Labs ภายใต้ชื่อเรื่อง “ปลุก Muse ของคุณให้มีชีวิต” การวางกรอบของ Meta นั้นแคบกว่าและเป็นเชิงกลไกมากกว่าของ Tavus: เอเจนต์ Muse มีเสียงอยู่แล้ว โดยได้เสียงมาจาก Muse Realtime Voice และอวตารคือชั้นที่มอบร่างกายให้กับเสียงนั้น
ตัวเลขที่เผยแพร่คือ 870 มิลลิวินาทีจากจุดสิ้นสุดของเทิร์นจนถึงไบต์แรก — นั่นคือ จากช่วงเวลาที่ผู้ใช้หยุดพูดจนถึงช่วงเวลาที่ไบต์วิดีโอแรกของอวตารพร้อมใช้งาน อวตารเรนเดอร์ภาพบุคคล 448×768 ที่ 25 เฟรมต่อวินาที Meta กล่าวว่าระบบทำการประเมินต่อชังก์น้อยกว่าเบสไลน์ของตนประมาณ 60 เท่า และ NVIDIA GB200 เพียงตัวเดียวสามารถรองรับเซสชันเรียลไทม์พร้อมกันได้ 12 เซสชัน โดยมีความจุเพิ่มขึ้น 8 เท่าเมื่อเทียบกับการนำไปใช้แบบ BF16 สองขั้นตอน
ความแตกต่างทางสถาปัตยกรรมจาก Griffin อยู่ที่ว่าข้อมูลมาจากไหน Muse Realtime Avatar ต่อยอดมาจาก Muse Realtime Voice และใช้สตรีมโทเคนเสียงร่วมกัน — การแทนค่า VQ แบบเดียวกับที่โมเดลเสียงสร้างขึ้นคือสิ่งที่ขับเคลื่อนใบหน้า แทนที่จะเป็นการทำความเข้าใจภาพของผู้เข้าร่วมแบบแยกต่างหาก นั่นทำให้มันเป็นเลเยอร์การมีตัวตนแบบ DiT ที่ขับเคลื่อนด้วยเสียง ซึ่งมีประสิทธิภาพ ผูกติดแน่นกับโมเดลเสียงของตัวเอง และไม่ได้พยายามอ่านมนุษย์ที่อยู่อีกปลายสายเลยแม้แต่น้อย มันเป็นปากและใบหน้าของเอเจนต์ ไม่ใช่คู่สนทนาที่คอยจับตาดูคุณ
Meta ยังไม่ได้เผยแพร่ API ไม่ได้ประกาศราคา และไม่ระบุวันวางจำหน่ายสำหรับ Muse Realtime Avatar โพสต์งานวิจัยเป็นบันทึกสาธารณะทั้งหมดที่มีอยู่
ตรงจุดที่การออกแบบทั้งสองแตกต่างกันอย่างแท้จริง
วิธีที่ชัดเจนที่สุดในการมองเห็นการแยกออกจากกัน คือการถามว่าเกิดอะไรขึ้นเมื่อผู้ใช้ขัดจังหวะ
Griffin เป็นฟูลดูเพล็กซ์และออกแบบมาให้ถูกขัดจังหวะกลางการพูดได้ — มันสามารถดูและฟังขณะพูด ซึ่งเป็นเหตุผลที่การตลาดของ Tavus เน้นแนวคิดว่า Griffin เรียนรู้พฤติกรรมการสนทนามากกว่าวิดีโอ นั่นยังเป็นเหตุผลว่าทำไมชุดเบนช์มาร์กของมันจึงสร้างขึ้นรอบการรับรู้และการตอบสนอง และเป็นเหตุผลว่าทำไมการนำอยู่ที่ 37% เหนือระบบที่ดีที่สุดรองลงมาในการตอบสนองในทันทีจึงเป็นคำกล่าวอ้างที่บริษัทเลือกจะหยิบยกขึ้นมา
ตัวเลข 870 มิลลิวินาทีตรงจุดสิ้นสุดเทิร์นของ Muse Realtime Avatar บอกเล่าเรื่องตรงกันข้าม: มันเป็นไปป์ไลน์ที่เทิร์นจบลง โทเคนเสียงถูกประมวลผลจนเสร็จสิ้น แล้วใบหน้าจึงตามมา มันเร็ว — 870 มิลลิวินาทีเป็นตัวเลขที่ดีสำหรับตัวเรนเดอร์ภาพบุคคล — แต่การวัดนั้นเองตั้งสมมติฐานว่ามีขอบเขตของเทิร์นอยู่ ซึ่งเป็นสมมติฐานที่โมเดลดูเพล็กซ์ถูกสร้างขึ้นมาเพื่อทิ้งไปอย่างแม่นยำ
นั่นไม่ใช่การวิจารณ์การออกแบบใดแบบหนึ่ง Meta กำลังสร้างใบหน้าสำหรับเอเจนต์ที่อาศัยอยู่ในพื้นที่ของผู้ช่วยของ Meta เอง ซึ่งขอบเขตการผลัดกันพูดที่ชัดเจนเป็นแบบจำลองที่สมเหตุสมผลของการโต้ตอบ Tavus กำลังสร้างสิ่งที่ต้องผ่านการตัดสินใจของคนแปลกหน้า ภายในยี่สิบวินาที ว่าคนบนหน้าจอเป็นของจริงหรือไม่
ทั้งสองอย่างไม่อยู่ในรายการราคา — และมีเพียงส่วนเดียวของ Muse เท่านั้นที่เรียกได้
ทั้ง Tavus Griffin และ Muse Realtime Avatar ยังไม่สามารถนำไปใช้งานจริงได้ในตอนนี้ Griffin เปิดให้เฉพาะผู้ทดสอบบางรายที่ได้รับเลือกเท่านั้น ส่วน Muse Realtime Avatar ยังไม่มี API ไม่มีราคา และไม่มีกำหนดเวลา หากคุณกำลังวางแผนที่จะสร้าง (build) ข้อเท็จจริงทั้งสองประการนี้ควรอยู่ในแผนด้วย
สิ่งที่ควรค่าแก่การกล่าวถึงคือส่วนของสแต็ก Muse ที่สามารถเข้าถึงได้ ตระกูล Muse ของ Meta ประกอบด้วย Muse Spark และหนึ่งเช็กพอยต์ของมัน — meta/muse-spark-1.2 — เปิดให้ใช้งานบนแค็ตตาล็อกของเราในราคา $1.25 ต่อหนึ่งล้านโทเคนอินพุต และ $4.25 ต่อหนึ่งล้านโทเคนเอาต์พุต โดยไม่บวกเพิ่มจากราคาตั้งของ Meta มันไม่ใช่อวตาร: มันรับอินพุตข้อความ รูปภาพ วิดีโอ เสียง และ PDF แล้วส่งคืนข้อความ โดยมีหน้าต่างบริบท 1M โทเคน และความพยายามในการให้เหตุผลที่กำหนดค่าได้ แต่มันเป็นส่วนของสาย Muse ที่คุณเรียกใช้ได้จริง และถ้าคุณกำลังสร้างเอเจนต์ที่วันหนึ่งจะอยู่เบื้องหลังอวตาร ครึ่งที่เป็นภาษาก็คือครึ่งที่คุณเริ่มต้นได้ OrcaRouter ส่งต่อราคาตั้งของผู้ให้บริการโดยมีมาร์กอัป 0% ดังนั้นการเปลี่ยนแปลงราคาของ Meta จะสะท้อนบนการ์ดของเราในวันเดียวกัน แทนที่จะเป็นรอบบิลถัดไป และคำขอที่ล้มเหลวบนผู้ให้บริการรายหนึ่งจะถูกลองใหม่กับรายที่ทำงานปกติ แทนที่จะปรากฏเป็น timeout

ตรรกะเดียวกันนี้ใช้กับฝั่งวิดีโอของโลกเช่นกัน เราไม่ได้ route Muse Realtime Avatar และเราไม่ได้ route Tavus Griffin และเราจะไม่อ้างเป็นอย่างอื่น สิ่งที่เรา route คือแคตตาล็อกของ โมเดลมากกว่าสองร้อยรายการในโมดาลิตี้เดียวกัน ดังนั้นโปรโตไทป์ที่สลับไปมาระหว่าง text agent, voice model และ video generator จะยังคงใช้คีย์เดียว ขณะที่สองโมเดลในบทความนี้ยังไม่เปิดตัว
อันไหนอยู่ห่างจากการจัดส่งมากกว่ากัน
ตามข้อมูลสาธารณะ Muse Realtime Avatar ยังอยู่ไกลออกไปอีก โดยมีเพียงโพสต์งานวิจัย ไม่มี API ไม่มีราคา และไม่มีกำหนดวันที่ ส่วน Griffin ก็ไม่มี API และไม่มีราคาเช่นกัน แต่มีเจตนาที่ชัดเจนในการเปิดตัว — "เร็ว ๆ นี้หลังจากความกังวลด้านความปลอดภัยเหล่านี้ได้รับการแก้ไขแล้ว" — มีระดับพรีวิวที่มีชื่อเรียกซึ่งมีอยู่จริงในวันนี้สำหรับผู้ทดสอบบางรายที่ได้รับเลือก และมีผลลัพธ์ benchmark ที่เผยแพร่แล้วจำนวนหนึ่งจากชุดทดสอบอิสระ นั่นเป็นสถานะที่ก้าวหน้ากว่า ถึงแม้ว่าจะมาพร้อมกับการยอมรับว่าโมเดลยังไม่ปลอดภัยพอที่จะส่งมอบให้ลูกค้า
กับดักในการนำมาเปรียบเทียบกันคือการมองว่าตัวเลข 870 มิลลิวินาทีนั้นเทียบได้โดยตรงกับตัวเลข 0.43 วินาที ทั้งสองวัดคนละสิ่ง: Meta วัดจากจุดสิ้นสุดของเทิร์นถึงไบต์แรกของภาพพอร์ตเทรต ส่วน Tavus วัดความหน่วงจากเสียงไปเป็นวิดีโอภายในสตรีมดูเพล็กซ์ต่อเนื่องที่เทิร์นไม่ใช่เหตุการณ์ที่แยกขาดจากกัน ตัวเลขทั้งคู่เป็นของจริง และไม่ใช่การวัดเดียวกัน ใครก็ตามที่นำมาแสดงในคอลัมน์เดียวกันกำลังไม่ให้ความเป็นธรรมแก่ผู้อ่าน
ประเด็นสำคัญ
Muse Realtime Avatar เป็นเลเยอร์การแปลงเป็นตัวตน: เสียงเข้า ภาพบุคคลออก 870 มิลลิวินาทีจากจุดสิ้นสุดของเทิร์นถึงไบต์แรก 448×768 ที่ 25 fps ไม่มี API และไม่มีกำหนดเปิดตัว Tavus Griffin เป็นโมเดลปฏิสัมพันธ์ระหว่างมนุษย์แบบดูเพล็กซ์: ผู้เข้าร่วมขาเข้า ใบหน้าที่ตอบสนองขาออก ความหน่วงเฉลี่ยจากเสียงเป็นวิดีโอ 0.43 วินาทีบน H100s และเป็นผู้ขายที่ยินดีเผยแพร่ว่า 48% ของผู้คนคิดว่ามันเป็นมนุษย์ ขณะเดียวกันก็ระบุว่าลูกค้าไม่สามารถใช้งานมันได้ Meta กำลังสร้างสิ่งที่ตามให้ทัน Tavus กำลังสร้างสิ่งที่ผ่านการเป็นมนุษย์ ไม่มีอันใดที่ซื้อได้ ซึ่งหมายความว่าการตัดสินใจเดียวที่ทำได้ในวันนี้คือจะเริ่มจากครึ่งไหนของปัญหา และสำหรับทีมส่วนใหญ่ ครึ่งนั้นคือโมเดลภาษาที่อยู่ข้างใต้
