การ์ดชื่อเรื่องหลักสำหรับ 'Realtime-Venus vs SeedRealtime' โดยมีคำบรรยายย่อยว่า 'อันหนึ่งให้บริการผู้คนหลายร้อยล้านคน อีกอันยังไม่มีใครใช้' พร้อมการ์ดสามใบที่อ่านว่า 'SeedRealtime: เปิดใช้งานใน Doubao ตั้งแต่วันที่ 5 สิงหาคม 2026, ไม่มี API, ไม่มีราคา' 'Realtime-Venus: เวท Apache-2.0, ไม่มีการดีพลอย' และ 'ทั้งคู่: ไม่มีเบนช์มาร์กที่ได้รับการทำซ้ำโดยอิสระเลย' เหนือแถบส่วนท้ายที่อ่านว่า 'ตัวเลขทั้งสองชุดเป็นข้อมูลที่ผู้ขายรายงาน; ไม่มีชุดใดที่ได้รับการทำซ้ำโดยอิสระ' โลโก้ OrcaRouter ถูกคอมโพสิตไว้ที่มุมขวาล่าง
Guides & Insights

Realtime-Venus vs SeedRealtime: สองวิธีที่ตรงกันข้ามในการไม่พร้อมใช้งาน

ผู้เขียน

Rowan Sterling

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Realtime-Venus และ SeedRealtime เป็นสองครึ่งของเรื่องราวปี 2026 เรื่องเดียวกัน และทั้งคู่ล้มเหลวในการทดสอบที่ตรงกันข้ามกัน SeedRealtime เป็นโมเดลฟูลดูเพล็กซ์ที่รองรับเสียงและภาพโดยกำเนิดของ ByteDance เปิดใช้งานภายในแอป Doubao เมื่อวันที่ 5 สิงหาคม 2026 โดยไม่เสียค่าใช้จ่าย เข้าถึงผู้ชมที่ผู้สร้างอธิบายว่าอยู่ในระดับหลายร้อยล้าน — โดยไม่มี API ไม่มีตัวระบุโมเดล ไม่มีราคา และไม่มีเป้าหมายเวลาหน่วง Realtime-Venus คือเช็กพอยต์ 9B จำนวนสองตัวจากทีม Venus ของ Ant Group และมหาวิทยาลัย Tsinghua เผยแพร่เมื่อวันที่ 12 กันยายน 2026 ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคและไม่มีการประกาศ ตั้งอยู่ในรีโพซิทอรีที่วิศวกรคนใดก็ดาวน์โหลดได้ และแทบไม่มีใครนำไปใช้งานจริงได้ ตัวหนึ่งคุณเรียกใช้งานไม่ได้ ส่วนอีกตัวคุณดาวน์โหลดได้ แล้วก็พบว่าคุณไม่มีอะไรให้เรียกใช้งานมัน ทั้งสองอยู่ที่แนวหน้าของความสามารถเดียวกันอย่างแท้จริง และไม่มีตัวใดมีเบนช์มาร์กที่ใครก็ตามนอกเหนือจากผู้เขียนของตัวเองได้ทำซ้ำ

สองรูปแบบของ "คุณไม่ได้มัน"

คุ้มค่าที่จะพูดให้ชัดเจน เพราะวลี "ไม่พร้อมใช้งาน" ซ่อนความแตกต่างที่แท้จริงไว้

SeedRealtime ไม่พร้อมใช้งานในแบบที่ผลิตภัณฑ์สำหรับผู้บริโภคไม่พร้อมใช้งาน กล่าวคือ มันมีอยู่จริง ทำงานได้ มีผู้ใช้ และประตูก็ปิดสำหรับนักพัฒนาเฉยๆ ไม่มี API ไม่มีตารางราคา ไม่มีพอร์ทัลเอกสาร และไม่มีกำหนดเวลาที่แน่นอนว่าจะมีขึ้นเมื่อใด เส้นทางสู่ตลาดของ ByteDance คือแอป และแอปก็เพียงพอแล้ว สิ่งที่คุณได้รับในฐานะนักสร้างคือเดโมที่คุณสัมผัสได้แต่ผสานรวมไม่ได้

Realtime-Venus ไม่พร้อมใช้งานในแบบที่ชิ้นงานวิจัยไม่พร้อมใช้งาน: น้ำหนักโมเดลเป็นสาธารณะ สัญญาอนุญาตเป็นแบบเปิดกว้าง โค้ดอยู่ที่นั่น และไม่มีใครรันมันอยู่ รีโพซิทอรีไม่ได้ถูกนำไปดีพลอยโดยผู้ให้บริการ inference รายใด และการดาวน์โหลดไม่ได้ถูกติดตามเลย จึงไม่มีสัญญาณสาธารณะเกี่ยวกับการนำไปใช้ไม่ว่าจะทางใด มันพร้อมใช้งานในความหมายที่สำคัญต่อนักวิจัย และไม่พร้อมใช้งานในความหมายที่สำคัญต่อผู้จัดการผลิตภัณฑ์

เมื่อนำมารวมกัน สิ่งเหล่านี้ก็วางกรอบคำถามที่ทั้งหมวดหมู่นี้กำลังติดอยู่กับมันในขณะนี้ นั่นคือ โมเดลที่ใช้งานได้จริงนั้นอยู่เบื้องหลังแอปสำหรับผู้บริโภค ส่วนโมเดลที่คุณรันเองได้กลับไม่ได้ถูกนำไปใช้งานจริงในการผลิตที่ไหนเลย

ทั้งคู่อยู่ในระดับที่ทำให้ปี 2026 แตกต่างอย่างแท้จริง

วิธีที่มีประโยชน์ในการมองวงการเรียลไทม์คือการแบ่งเป็นสามระดับ ระดับแรกคือเสียงแบบฮาล์ฟดูเพล็กซ์ที่เติมความสามารถในการมองเห็นเข้าไป — ผู้ช่วยแบบผลัดกันที่มองเห็นได้แต่ยังต้องผลัดกัน ระดับที่สองคือเสียงแบบฟูลดูเพล็กซ์ ที่ฟังและพูดพร้อมกันโดยไม่มีกล้อง: Seeduplex ของ ByteDance เอง, GPT-Live ของ OpenAI, Grok Voice Think Fast 2.0 ของ xAI ระดับที่สามคือฟูลดูเพล็กซ์แบบเสียงและภาพ ที่การรับรู้และการแสดงออกครอบคลุมทั้งวิดีโอและเสียงอย่างต่อเนื่อง

SeedRealtime เป็นโมเดลแรกในระดับที่สามที่สามารถนำไปใช้งานเชิงพาณิชย์ในวงกว้างได้สำเร็จ Realtime-Venus เป็นผู้เข้ามาใหม่แบบเปิดน้ำหนักในระดับเดียวกัน — วิดีโอผ่านตัวเข้ารหัส SigLIP2 เสียงผ่าน Whisper-Medium โครงหลัก Qwen3-8B และลูปการโต้ตอบหนึ่งวินาทีที่ไม่หยุดรับรู้เลย การ์ดโมเดลระบุว่ามันดัดแปลงมาจาก MiniCPM-o 4.5 โมเดลโอมนิโหมดัลของ OpenBMB ที่เปิดตัวเมื่อต้นปี 2026 ซึ่งทำให้ส่วนสนับสนุนของ Ant Group อยู่ที่การปรับแต่งหลังการฝึกและระบบรันไทม์ มากกว่าสถาปัตยกรรมพื้นฐาน

สิ่งที่ทั้งสองมีร่วมกัน และสิ่งที่ทำให้พวกมันอยู่เหนือระบบที่ใช้เสียงเพียงอย่างเดียวขึ้นไปหนึ่งระดับ คือไม่มีตัวไหนหยุดเพื่อมอง การรับรู้ภาพอย่างต่อเนื่องขณะพูดเป็นความสามารถที่แตกต่างอย่างแท้จริงจากการบรรยายภาพเพียงเฟรมเดียว และทั้งสองโมเดลถูกสร้างขึ้นโดยยึดความสามารถนี้เป็นแกนหลัก

ตัวเลขของแต่ละอันมีค่าเท่าไร

A screenshot of the ByteDance Seed page for SeedRealtime, captured 18 September 2026, showing the page language toggle set to EN, the heading 'SeedRealtime: An Audio-Visual Full-Duplex LLM' dated August 5, 2026, and the opening overview text stating that the model natively unifies audio, video and text in a single architecture and that end-to-end human evaluations show it halves conversational pacing issues compared with cascaded models.

ไม่มีโมเดลใดมีเกณฑ์มาตรฐานจากบุคคลที่สาม อย่างไรก็ตาม หลักฐานไม่ได้เทียบเท่ากัน และความแตกต่างนี้สำคัญ

• SeedRealtime ไม่ได้เผยแพร่ผลทดสอบมาตรฐานใด ๆ เลย สิ่งที่ ByteDance นำเสนอคือข้ออ้างว่า ปัญหาจังหวะการสนทนา — การพูดขัดผู้ใช้ การตอบช้า การถูกกระตุ้นโดยเสียงรบกวนของคนแปลกหน้า — ลดลงประมาณครึ่งหนึ่งเมื่อเทียบกับระบบแบบแคสเคด จากการประเมินโดยมนุษย์แบบปลายทางถึงปลายทาง ข้อมูลเบื้องหลังไม่ได้ถูกเผยแพร่

• ตัวเลขของรุ่นก่อนหน้ามีรูปแบบเดียวกัน Seeduplex ซึ่งเป็นโมเดลที่ประมวลผลเฉพาะเสียงที่ ByteDance เปิดตัวใน Doubao เมื่อเดือนเมษายน 2026 มีรายงานว่าลดอัตราการตอบผิดพลาดและการขัดจังหวะผิดพลาดลงครึ่งหนึ่ง ลดความหน่วง ณ จุดสิ้นสุดการพูดลงประมาณ 250 มิลลิวินาที ลดการตอบก่อนเวลาลง 40% และเพิ่มความพึงพอใจในการสนทนาทางโทรศัพท์ขึ้น 8.34 คะแนน ในการทดสอบ A/B ขนาดใหญ่ ทั้งหมดนี้เป็นข้อมูลที่ผู้พัฒนารายงานเอง

• Realtime-Venus เผยแพร่ตาราง รายงานของมันอ้างว่าทำคะแนนดีที่สุดในหกจากแปด benchmark วิดีโอ รวมถึง StreamingBench 70.2, OVO-Bench 64.7 และ Daily-Omni 81.3 และนำใน MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8 และ Speech CMMLU 67.8 สำหรับ checkpoint เสียง

• ทั้งสองอย่างยังไม่มีการทำซ้ำ ตารางที่ตีพิมพ์ซึ่งไม่มีใครตรวจสอบ กับการทดสอบ A/B ที่ยังไม่เผยแพร่ซึ่งไม่มีใครตรวจสอบได้ ล้วนเป็นความไม่ยืนยันคนละแบบกัน ทั้งสองอย่างไม่ใช่หลักฐานที่คุณจะใช้ตัดสินใจจัดซื้อได้

การเปรียบเทียบหนึ่งเดียวที่ควรทำภายในตัวเลขของ Realtime-Venus คือการเทียบกับฐานของมันเอง MiniCPM-o 4.5 รายงาน 80.2 บน Daily-Omni; Realtime-Venus-Omni รายงาน 81.3 การได้เพิ่มขึ้นหนึ่งจุดเมื่อเทียบกับโมเดลที่มันถูกดัดแปลงมา บนเบนช์มาร์กที่โมเดลนั้นจัดการได้อยู่แล้ว ถือเป็นผลลัพธ์ที่สมเหตุสมผลสำหรับความพยายามด้านหลังการฝึกและการรันไทม์ — และเป็นข้อกล่าวอ้างที่เล็กกว่าคำว่า "ดีที่สุดในหกจากแปด" เมื่ออ่านโดยลำพังมาก

A two-column comparison scoreboard titled 'Realtime-Venus vs SeedRealtime — the scoreboard'. The left column, labelled Realtime-Venus, reads 'Availability: Apache-2.0 weights, no deployment', 'Where it runs: nowhere in production', 'Modality: audio, video and text', 'Benchmarks: self-reported table', 'Context: 40,960 tokens', 'Base model: adapted from MiniCPM-o 4.5'. The right column, labelled SeedRealtime, reads 'Availability: Doubao app only, no API', 'Where it runs: consumer scale since 5 August 2026', 'Modality: audio, video and text', 'Benchmarks: none published, vendor A/B claims', 'Context: not published', 'Base model: not disclosed'. The footer reads 'All figures vendor-reported; neither model has an independently reproduced benchmark.'

ปัญหาการผลัดกันพูด ซึ่งเป็นจุดที่ full-duplex เข้ามาเกี่ยวข้อง

ฟูลดูเพล็กซ์ไม่ใช่คุณสมบัติด้านความหน่วง แต่เป็นชุดของพฤติกรรม: การรู้ว่าการหยุดชั่วครู่หนึ่งหมายถึง "ฉันกำลังคิด" ไม่ใช่ "ฉันพูดจบแล้ว", การแยกแยะบทสนทนาของคนข้างเคียงออกจากคนที่กำลังพูดกับคุณ, และการเงียบไว้ตลอดเสียงตอบรับสั้น ๆ แทนที่จะมองว่า "อืม-ฮึม" เป็นการขัดจังหวะ

แนวทางของ SeedRealtime คือการจำลองสถานะการสนทนาโดยธรรมชาติ และตัดตัวตรวจจับกิจกรรมเสียงจากภายนอกออกไปทั้งหมด ดังนั้นการผลัดกันพูดจึงเป็นพฤติกรรมที่เรียนรู้ได้ภายในเครือข่าย แทนที่จะเป็นเกณฑ์ที่ใช้กับสตรีมเสียง นั่นคือความมุ่งมั่นทางสถาปัตยกรรมแบบเดียวกับที่ Realtime-Venus ทำ และทั้งคู่ถูกวางตำแหน่งไว้ตรงข้ามกับระบบแบบคาสเคดที่ต้องมีองค์ประกอบแยกต่างหากเพื่อตัดสินว่าใครพูด

จุดที่หลักฐานแตกต่างกันอยู่ที่ คำกล่าวอ้างของ SeedRealtime นั้นเกี่ยวกับการนำไปใช้งานในวงกว้าง — ผู้ใช้หลายร้อยล้านคน ห้องจริง เสียงรบกวนจริง — ในขณะที่ของ Realtime-Venus นั้นเกี่ยวกับ benchmark ผลลัพธ์ Full-Duplex-Bench v1.5 สำหรับ Realtime-Venus-Audio — การตอบสนองต่อการขัดจังหวะ 75% การต่อเนื่อง 97% ภายใต้ backchannels, 88% ภายใต้คำพูดที่มุ่งไปยังผู้อื่น และ 86% ภายใต้คำพูดพื้นหลัง ซึ่งสูงกว่า Gemini 3.1 Live และ GPT-4o ในด้านการต่อเนื่อง — เป็นตัวเลขที่เกี่ยวข้องโดยตรงมากที่สุดที่โมเดลทั้งสองได้เผยแพร่สำหรับปัญหานี้ พวกมันยังเป็นข้อมูลที่รายงานเองทั้งหมด และการต่อเนื่อง 97% ภายใต้ backchannels เป็นตัวเลขที่น่าทึ่งซึ่งสมควรมีผู้ตรวจทานคนที่สองก่อนที่ใครจะนำไปอ้างเป็นข้อเท็จจริง

ที่ซึ่งแต่ละคนทิ้งช่างก่อสร้างไว้

ช่องว่างในทางปฏิบัติไม่ใช่คุณภาพ แต่คือรูปร่างของข้อเสนอ

• SeedRealtime — คุณสามารถทดลองใช้ได้ฟรีใน Doubao แต่กลับนำไปผสานรวมไม่ได้เลย ไม่มีเส้นทางจาก "สิ่งนี้น่าประทับใจ" ไปสู่ "สิ่งนี้อยู่ในผลิตภัณฑ์ของฉัน"

• Realtime-Venus — คุณสามารถดาวน์โหลดไปใช้ ปรับจูน (fine-tune) รันแบบ air-gapped และตรวจสอบทุกเลเยอร์ได้ ต้นทุนอยู่ที่เช็กพอยต์ขนาด 9B สองตัวในรูปแบบ BF16 ซึ่งมีน้ำหนักราวสิบแปดกิกะไบต์ต่อตัว บวกกับลูปสตรีมมิ่งต่อเนื่องรายวินาที นั่นหมายความว่าต้องมีโหนด GPU ที่เรียกเก็บเงินไม่ว่าจะมีใครเรียกใช้งานหรือไม่

• ทั้งสองไม่มีตัวเลือกแบบโฮสต์ ทั้งคู่ไม่สามารถลองใช้งานได้ด้วยคีย์และเวลาช่วงบ่ายเพียงช่วงเดียว

ประเด็นสุดท้ายนั้นคือเหตุผลที่โมเดลทั้งสองมีประโยชน์มากกว่าเมื่อใช้เป็นคู่ มากกว่าเมื่อเป็นคู่ต่อสู้กัน เมื่อรวมกันแล้ว พวกมันแสดงให้เห็นว่าทั้งสองครึ่งของปัญหาได้รับการแก้แล้ว — ความสามารถนั้นใช้งานได้ และน้ำหนักโมเดลก็เปิดเผยได้ — พร้อมทั้งชี้ให้เห็นว่ายังไม่มีใครนำสองส่วนนี้มารวมกันเป็นสิ่งที่นักพัฒนาสามารถเรียกใช้ได้จริง

มีวิธีเลี่ยงที่ทีมจำนวนมากจะเลือกใช้ และเป็นการดีที่จะชี้ให้ชัดว่ามันครอบคลุมอะไรและไม่ครอบคลุมอะไร หากคุณไม่สามารถได้เลเยอร์เสียง คุณก็ยังสร้างส่วนที่คิดได้อยู่ดี Realtime-Venus มอบหมายงานที่มีค่าใช้จ่ายสูงของมัน — การดึงข้อมูล การให้เหตุผลที่ยาก การเรียก API ทางธุรกิจ — ไปยัง background harness ผ่านเครื่องหมายการมอบหมายแบบอะซิงโครนัส และขาที่ถูกมอบหมายนั้นเป็นการอนุมานข้อความธรรมดา OrcaRouter ไม่มีทั้ง Realtime-Venus และ SeedRealtime เลเยอร์ดูเพล็กซ์ทั้งสองอยู่outsideสิ่งที่เราให้บริการ และเราไม่ได้โฮสต์ทั้งสองอย่างโมเดลข้อความเกือบ 200 โมเดลภายใต้คีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มคือครึ่งหนึ่งของสถาปัตยกรรมที่เราครอบคลุมจริง พร้อมการสลับสำรองอัตโนมัติเพื่อให้งานเบื้องหลังไม่ล้มเหลวเพียงเพราะมี upstream รายหนึ่งเจอวันแย่ ๆDSL สำหรับการกำหนดเส้นทางเพื่อประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียวและการหลอมรวมโมเดลในกรณีที่การตัดสินของโมเดลเดียวไม่เพียงพอ มันไม่ใช่ส่วนที่ยากของระบบเหล่านี้ มันเป็นส่วนที่ซื้อได้จริง

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the Apache-2.0 licence badge, the arXiv 2609.13814 badge, the model card heading 'A full-duplex interaction system with asynchronous delegation', and a side panel stating 'This model isn't deployed by any Inference Provider.'

อะไรจะเปลี่ยนการเปรียบเทียบนี้

สามความคืบหน้าจะช่วยให้เรื่องนี้ได้ข้อยุติ และยังไม่มีสักอย่างที่เกิดขึ้นเลย การวัดประสิทธิภาพแบบอิสระของ Realtime-Venus เพราะตารางที่ไม่มีผู้อ่านคนที่สองเป็นเพียงคำกล่าวอ้าง ไม่ใช่ผลลัพธ์ API สำหรับ SeedRealtime เพราะโมเดลที่มีหลักฐานการนำไปใช้งานแข็งแกร่งที่สุดในตอนนี้กลับเป็นตัวที่ไม่มีใครใช้ได้ และตัวเลขความหน่วงที่เผยแพร่จากโมเดลใดโมเดลหนึ่ง — time-to-first-audio คือเมตริกที่หมวดนี้ใช้ตัดสินใจซื้อ และ ณ เวลาที่เขียนนี้ ไม่มีโมเดลใดระบุตัวเลขนี้เลย

จนถึงตอนนั้น สรุปตามตรงก็คือ SeedRealtime เป็นหลักฐานว่าระบบ full-duplex แบบเสียง-ภาพทำงานได้ในระดับผู้บริโภค และ Realtime-Venus เป็นหลักฐานว่าเวตของโมเดลสามารถเปิดได้ และไม่มีข้อเท็จจริงใดในสองข้อนั้นที่พานักพัฒนาให้ใกล้การส่งมอบผลิตภัณฑ์ขึ้นเลย นั่นไม่ใช่การวิจารณ์ห้องแล็บใดห้องแล็บหนึ่ง แต่เป็นคำอธิบายของหมวดหมู่หนึ่งที่แก้ปัญหาด้านการวิจัยได้แล้ว แต่ยังไม่ได้แก้ปัญหาด้านการกระจาย

การเปรียบเทียบในบทความนี้1

ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube