การ์ด hero ที่สร้างขึ้นสำหรับบทความ 'Muse Realtime Avatar vs Realtime-Venus' แสดงการ์ดขอบมนสองใบขนาบสองข้างของพาดหัว การ์ดใบซ้ายเขียนว่า 'Muse Realtime Avatar' อยู่เหนือไอคอนเฟรมวิดีโอขาออก พร้อมบรรทัดว่า 'สร้างวิดีโอ' และ '448x768 ที่ 25 fps, แบบปิด' ส่วนการ์ดใบขวาเขียนว่า 'Realtime-Venus' อยู่เหนือไอคอนกล้องขาเข้า พร้อมบรรทัดว่า 'อ่านวิดีโอ' และ '2 x 9B, Apache-2.0, ดาวน์โหลดได้' คำบรรยายย่อยเขียนว่า 'ตัวหนึ่งเรนเดอร์ใบหน้า อีกตัวหนึ่งเฝ้ามอง' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Muse Realtime Avatar vs Realtime-Venus: Video Out เทียบกับ Video In

ผู้เขียน

Elias Hawthorne

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

สองระบบที่ถูกประกาศห่างกันเก้าวัน ต่างก็เรียกตัวเองว่าเรียลไทม์ และต่างก็อ้างป้ายกำกับว่าด้านเสียงและภาพเหมือนกัน และทั้งคู่ชี้ไปในทิศทางตรงกันข้ามบนแกนเดียวกัน Muse Realtime Avatar ซึ่งประกาศโดย Meta เมื่อวันที่ 23 กันยายน 2026 รับภาพถ่ายเข้ามาและ สร้าง วิดีโอของภาพนั้นที่กำลังพูด — วิดีโอของมันคือผลลัพธ์ เป็นเฟรมแนวตั้งขนาด 448×768 ที่ 25 เฟรมต่อวินาที ผลิตโดย Diffusion Transformer ที่ขับเคลื่อนด้วยเสียง ซึ่งใช้สตรีมโทเคนร่วมกับ Muse Realtime Voice Realtime-Venus ซึ่งอัปโหลดขึ้น arXiv เมื่อวันที่ 12 กันยายน 2026 โดยทีม Venus จาก Ant Group ร่วมกับมหาวิทยาลัยชิงหัว รับ วิดีโอ: เช็กพอยต์ Realtime-Venus-Omni สตรีมเฟรมจากกล้องผ่านเอนโคเดอร์ SigLIP2 แล้วพูดถึงสิ่งที่มันเห็น ส่วนเช็กพอยต์ Realtime-Venus-Audio คือโครงหลักเดียวกันโดยปิดการมองเห็นตั้งแต่ตอนโหลด ตัวหนึ่งเรนเดอร์ใบหน้าขึ้นมา อีกตัวเฝ้ามองใบหน้าหนึ่ง ทั้งคู่ไม่สามารถเรียกใช้งานได้ และมีเพียงตัวเดียวเท่านั้นที่ดาวน์โหลดได้ — ซึ่งกลายเป็นความแตกต่างที่สำคัญกว่า

การสลับขั้วด้านความพร้อมใช้งานนี้ควรกล่าวอย่างตรงไปตรงมาก่อนสิ่งอื่นใด เพราะมันขัดกับทุกความคาดหวังเกี่ยวกับผลิตภัณฑ์ของ Meta และการเปิดตัวของห้องปฏิบัติการวิจัย ระบบของ Meta เป็นระบบปิด: ประกาศที่ Connect สาธิตในโพสต์งานวิจัย ฝังอยู่ในเอเจนต์ Muse โดยไม่มี API ไม่มีไฟล์น้ำหนักโมเดล ไม่มีราคา และไม่มีกำหนดวัน ระบบของ Ant Group เป็นระบบเปิด: checkpoint 9B สองตัวเป็น BF16 safetensors ภายใต้ Apache-2.0 ที่ inclusionAI/Realtime-Venusบน Hugging Face พร้อมโค้ด Transformers แบบกำหนดเอง ไฟล์ requirements เสียงอ้างอิง หน้าโปรเจกต์ และรีโพซิทอรี GitHub คู่กัน บริษัทที่มีผลิตภัณฑ์สำหรับผู้บริโภคไม่ได้ส่งมอบอะไรที่คุณจับต้องได้ ทีมวิจัยส่งมอบทุกอย่างให้เลย

แต่ละอันทำอะไรกับเฟรม

ทิศทางของวิดีโอคือความแตกต่างเชิงสถาปัตยกรรมทั้งหมด และไม่ใช่เรื่องของการเน้นย้ำ

วิดีโอ — Muse Realtime Avatar สร้างสิ่งนี้ขึ้นมา โดยมีเงื่อนไขจากโทเค็นเสียง ภาพอ้างอิง และหน้าต่างแบบเลื่อนของเลเทนต์วิดีโอช่วงหลัง ๆ; Realtime-Venus-Omni รับรู้สิ่งนี้ ด้วยตัวเข้ารหัสภาพ SigLIP2 ที่สตรีมเฟรมเข้าไปในโมเดลควบคู่ไปกับเสียง

เสียง — Muse Realtime Avatar ขับเคลื่อนการสร้างจากโทเคนเสียงพูดของ Muse Realtime Voice ซึ่งบรรจุทั้งเนื้อหาและทำนองเสียงไว้ด้วยกัน; Realtime-Venus สร้างเสียงพูดเป็นโทเคน S3 แบบไม่ต่อเนื่องซึ่งถอดรหัสด้วยตัวถอดรหัสแบบ flow-matching แบบสตรีมมิ่ง แทนที่จะต่อโมเดลแปลงข้อความเป็นเสียงแยกต่างหากไว้ที่ส่วนท้าย

แบ็กโบน — สถาปัตยกรรมของ Meta เป็น Diffusion Transformer ที่ขับเคลื่อนด้วยเสียงซึ่งไม่เปิดเผยขนาด ส่วน Realtime-Venus สร้างขึ้นบนแบ็กโบนภาษาขนาด Qwen3-8B พร้อมตัวเข้ารหัสเสียง Whisper-Medium และโมเดลการ์ดของมันระบุว่าเช็กพอยต์ Omni ถูกดัดแปลงมาจาก MiniCPM-o 4.5

เวท — Muse Realtime Avatar ไม่ได้ถูกเผยแพร่ และไม่มีสัญญาณว่าจะเผยแพร่ในอนาคต; Realtime-Venus มาพร้อมเช็กพอยต์ 9B จำนวนสองตัว, BF16, คอนเท็กซ์ 40,960 โทเคนบนทั้งสองตัว, ภายใต้ Apache-2.0

การเข้าถึง — Muse Realtime Avatar ไม่มี API และไม่มีกำหนดวันที่ ส่วน Realtime-Venus ก็ไม่มี API เช่นกัน และการ์ดของมันระบุไว้อย่างชัดเจนว่าไม่ได้ถูกนำไปใช้งานโดยผู้ให้บริการ inference รายใดเลย

ทำงานที่ไหน — Muse Realtime Avatar ทำงานอยู่ภายในแอป Muse สำหรับผู้ใช้ที่ Meta ยังไม่ได้ระบุรายชื่อ โดยมีข้อกำหนด 18+ ส่วน Realtime-Venus ทำงานบน GPU ของคุณเองได้ตั้งแต่วันนี้ ถ้าคุณมีฮาร์ดแวร์และมีความอยากที่จะลอง

อ่านสองบรรทัดสุดท้ายรวมกัน แล้วความแตกต่างในทางปฏิบัติก็จะปรากฏขึ้น ไม่มีระบบใดที่เรียกได้ แต่หนึ่งในนั้นสามารถรันได้

การดาวน์โหลด 9B นั้นเป็นเรื่องจริง และสิ่งที่คุณต้องแลกก็เป็นเรื่องจริงเช่นกัน

Realtime-Venus ไม่ใช่คลังเก็บโค้ดแบบโครงเปล่า ไฟล์เวตอยู่ที่นั่น โค้ดโหลดแบบกำหนดเองก็อยู่ที่นั่น และสัญญาอนุญาตที่ระดับบนสุดคือ Apache-2.0 มีสองเรื่องเกี่ยวกับมันที่ควรรู้ก่อนที่คุณจะวางแผนโดยอิงกับมัน

สิ่งแรกคือสิ่งที่ไม่อยู่ในค่าน้ำหนัก รันไทม์แบบ dual-loop ที่ทำให้สถาปัตยกรรมนี้โดดเด่น — ลูปการโต้ตอบหนึ่งวินาที บวกกับตัวจัดตารางเบื้องหลังที่รายงานเรียกว่า Realtime-Venus-Harness ซึ่งรันงานที่ได้รับมอบหมายกับสแนปช็อตที่แยกออกมาของสถานะการสนทนา เพื่อให้งานที่ใช้เวลานานไม่ถูกปนเปื้อนจากการที่บทสนทนาเดินหน้าต่อไป — อยู่ในรีโพซิทอรี GitHub ในฐานะคอมโพเนนต์แยกต่างหาก ส่วนการออกแบบการมอบหมายงาน ซึ่งเป็นแนวคิดใหม่ที่แท้จริงในรายงาน คือส่วนที่คุณต้องประกอบขึ้นและไว้วางใจด้วยตัวคุณเอง

ประการที่สองคือสายสืบทอด การ์ดระบุว่า Omni checkpoint นั้นดัดแปลงมาจาก MiniCPM-o 4.5 โมเดล omni-modal ขนาด 9B ที่ OpenBMB เปิดซอร์สเมื่อต้นปี 2026 นั่นไม่ใช่เชิงอรรถ มันหมายความว่าสิ่งที่ Ant Group มีส่วนร่วมคือการ post-training, รันไทม์ และการออกแบบการมอบหมายงานที่ซ้อนทับอยู่บนแกนหลักสตรีมมิ่งของคนอื่น ซึ่งเป็นการกล่าวอ้างที่แคบกว่าและเฉพาะเจาะจงกว่า "โมเดล omni 9B ตัวใหม่" — และเป็นข้อกล่าวอ้างที่มีประโยชน์มากกว่า เพราะมันบอกคุณว่าควรดูตรงไหนหากมีบางอย่างในตัวเข้ารหัสภาพทำงานผิดพลาด

ตัวเลขเหล่านั้น และแน่ชัดว่าพวกมันเป็นของใคร

นี่คือจุดที่ระบบทั้งสองมาบรรจบกันในทางที่ไม่เป็นประโยชน์: ทั้งคู่ไม่มีการประเมินที่เป็นอิสระเพียงครั้งเดียว ตัวเลขสี่ตัวของ Meta นั้นรายงานโดยบริษัทโดยอ้างอิงเส้นฐานที่ Meta เลือกเอง ส่วนของ Realtime-Venus นั้นรายงานโดยผู้เขียนในรายงานทางเทคนิค โดยไม่มีบุคคลที่สามเผยแพร่การรันและไม่มีรายการในลีดเดอร์บอร์ดให้ตรวจสอบ ไม่มีการวัดผลต่อสาธารณะของระบบใดเลยโดยผู้ที่ไม่ได้สร้างมันขึ้นมา

ตัวเลขสี่ข้อของ Meta ตามที่เผยแพร่: 870 มิลลิวินาทีจากจุดสิ้นสุดของเทิร์นคุณถึงไบต์แรกของการตอบกลับแบบเสียงและวิดีโอที่ซิงโครไนซ์กัน; วิดีโอแนวตั้ง 448×768 ที่ 25 เฟรมต่อวินาที; การประเมินโมเดลน้อยกว่าฐานไลน์ของตัวเอง 60 เท่า; และ 12 เซสชันเรียลไทม์พร้อมกันบน NVIDIA GB200 หนึ่งตัว ซึ่งเป็นความจุที่เพิ่มขึ้น 8 เท่าเมื่อเทียบกับฐานไลน์แบบสองขั้นตอน BF16 ของ Meta Meta ยังเปิดเผยผลลัพธ์ด้านความชอบเมื่อเทียบกับระบบอวตารเชิงพาณิชย์สองระบบ โดยระบุว่าระบบหนึ่งไม่มีความแตกต่างอย่างมีนัยสำคัญทางสถิติจากการเสมอกันในด้านกริยาท่าทาง ซึ่งเป็นการเปิดเผยที่ควรค่าแก่การยกย่อง เพราะเป็นผลลัพธ์ประเภทที่โพสต์เปิดตัวส่วนใหญ่มักไม่กล่าวถึง

ของ Ant Group ตามที่เผยแพร่: ได้คะแนนดีที่สุดใน 6 จาก 8 เกณฑ์มาตรฐานวิดีโอที่รายงานใช้ รวมถึง StreamingBench 70.2, OVO-Bench 64.7 และ Daily-Omni 81.3 สำหรับ Omni checkpoint; และสำหรับ Audio checkpoint, MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8 และคะแนน VoiceBench AlpacaEval 4.81 ซึ่งรายงานระบุว่าตรงกับค่าการเปรียบเทียบที่ดีที่สุด

ความไม่สมมาตรประการหนึ่งในหลักฐานนี้ควรค่าแก่การเอ่ยถึง ตัวเลขของ Ant Group เป็นคะแนน benchmark ที่มีชุดทดสอบซึ่งระบุชื่อไว้ — โดยหลักการแล้วใครก็ตามที่ยินดีดาวน์โหลดเวตและรันชุดทดสอบนั้นก็สามารถทำซ้ำได้ ตัวเลขพาดหัวของ Meta คือการวัดเวลาหน่วงบนสแตกการให้บริการของ Meta เอง ซึ่งไม่มีใครนอก Meta สามารถทำซ้ำได้ เพราะไม่มีใครนอก Meta ที่มีระบบนั้น พูดอีกอย่างก็คือ การเปิดเผยแบบเปิดนั้นก็เป็นสิ่งที่ตรวจสอบได้ง่ายกว่าเช่นกัน

A generated comparison scoreboard titled 'Muse Realtime Avatar vs Realtime-Venus — the scoreboard', with a left column headed 'Muse Realtime Avatar' and a right column headed 'Realtime-Venus'. Rows read: Video — generated output vs perceived input; Weights — not published vs 2 x 9B, BF16, Apache-2.0; Context — undisclosed vs 40,960 tokens; Access — no API, no date vs no API, self-host only; Headline figure — 870 ms to first byte of voice + video vs StreamingBench 70.2 and Daily-Omni 81.3; Independent runs — none vs none. A footer line reads 'Meta and Ant Group figures both author-reported; neither system independently evaluated.'A screenshot of the Hugging Face model card for inclusionAI/Realtime-Venus, showing the repository name, the Apache-2.0 licence and arXiv 2609.13814 tags, the tagline 'A full-duplex interaction system with asynchronous delegation', the Project Page, GitHub, ModelScope and Licence links, the three-panel overview figure covering proactive response, delegated tool work and audio interruption, and an Inference Providers panel stating the model is not deployed by any inference provider.

ทำไมทั้งสองสิ่งนี้จึงเป็นปัญหาการจัดเส้นทางที่แฝงตัวอยู่

ไม่มีระบบใดเป็นเอเจนต์ที่สมบูรณ์ และสิ่งนี้ก็เป็นจริงในแบบเดียวกันกับทั้งสองระบบ Muse Realtime Avatar เป็นเลเยอร์การเรนเดอร์ที่ต่อพ่วงเข้ากับ Muse Realtime Voice ซึ่งเป็นเลเยอร์สนทนาของเอเจนต์ที่การให้เหตุผลทำงานบน Muse Spark Realtime-Venus มอบหมายสิ่งใดก็ตามที่เกินกว่าที่มันทำแบบอินไลน์ได้ — การดึงข้อมูล การเรียกใช้เครื่องมือ การให้เหตุผลที่ยาก — ออกไปยังฮาร์เนสที่ทำงานนั้นในเบื้องหลังโดยอิงกับสแนปช็อตของการสนทนา ในทั้งสองดีไซน์ สิ่งที่ผู้ใช้สนทนาด้วยคือฟรอนต์เอนด์ และการคิดเกิดขึ้นในโมเดลข้อความแยกต่างหาก

โมเดลข้อความแยกต่างหากตัวนั้นคือส่วนที่คุณกำหนดเส้นทางได้ บน OrcaRouter มันเป็นปลายทางเดียวสำหรับ 196 โมเดลจากผู้ให้บริการ 15 ราย ในราคาตามรายการของผู้ให้บริการโดยไม่มีมาร์กอัป พร้อมการสลับสำรองอัตโนมัติเมื่อโมเดลเกิดข้อผิดพลาดหรือหมดเวลา — ซึ่งสำคัญกว่าปกติเมื่อสิ่งที่อยู่อีกฝั่งเป็นเช็กพอยต์ที่โฮสต์เองซึ่งไม่มีใครประเมินอย่างอิสระ เราไม่ได้โฮสต์ Realtime-Venus: มันเป็นไฟล์ดาวน์โหลด และเราไม่ได้ให้บริการมัน เราไม่ได้โฮสต์ Muse Realtime Avatar เช่นกัน เพราะไม่มีใครโฮสต์ สิ่งที่เรามีให้คือเลเยอร์ที่สถาปัตยกรรมทั้งสองส่งงานหนักของตนไปให้ ดังนั้นคอมโพเนนต์ที่ยังไม่ผ่านการพิสูจน์ในฝั่งใดฝั่งหนึ่งของการสนทนาจึงเป็นเพียงหนึ่งบรรทัดของการกำหนดค่า ไม่ใช่การเดิมพันในระดับโปรดักชัน

อันไหนในพวกนี้ที่จริง ๆ แล้วก้าวหน้าไปมากกว่ากัน

โดยสัญชาตญาณแล้ว เราอยากตอบว่าของ Meta เพราะ Meta มีผลิตภัณฑ์และวิดีโอเดโม แต่หลักฐานกลับบอกสิ่งที่น่าสนใจกว่า ระบบของ Meta มีวิศวกรรมระดับโปรดักชันที่ดีกว่า — การรัน 12 เซสชันพร้อมกันบน GB200 ถือเป็นผลลัพธ์ด้านการให้บริการ และการทดสอบความชอบที่เปิดเผยเทียบกับผลิตภัณฑ์อวตารที่วางจำหน่ายแล้วนั้นเป็นตัวเลขเปรียบเทียบโดยตรงชุดเดียวที่ทั้งสองระบบมี ส่วนระบบของ Ant Group ตรวจสอบยืนยันได้ดีกว่า: มีเบนช์มาร์กที่ระบุชื่อ มีการเผยแพร่น้ำหนักโมเดล มีสัญญาอนุญาต Apache-2.0 และมีรายงานที่ใครก็สามารถลองทำซ้ำได้

สิ่งที่ทั้งสองไม่มีคือวิธีจ่ายเงินสำหรับมัน และอันที่ใกล้จะใช้งานได้จริงกว่าไม่ใช่ตัวที่มีแอปสำหรับผู้บริโภค — แต่เป็นตัวที่คุณดาวน์โหลดได้คืนนี้ แล้วหาคำตอบด้วยตัวคุณเอง บนฮาร์ดแวร์ของคุณเอง ด้วยข้อมูลของคุณเอง และไม่ต้องมีประกาศใด ๆ

หากคุณกำลังเลือก คำถามไม่ใช่ว่ารุ่นไหนดีกว่า แต่คือว่าคุณต้องการใบหน้าที่คุณเรียกไม่ได้ หรือกล้องที่คุณควบคุมได้

A screenshot of Meta's research post 'Bringing Your Muse to Life', dated September 23, 2026, showing the headline, the reading time, a vertical portrait video player showing a white furry character, and the opening paragraph introducing Muse Realtime Avatar as embodiment technology that turns Muse Realtime Voice into expressive, interactive avatars.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube