
Realtime-Venus vs SeedRealtime: สองวิธีที่ตรงกันข้ามในการไม่พร้อมใช้งาน
- Orcaใหม่Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 ต่อ 1 ล้านโทเค็น
- orcaใหม่Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- anthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0345ความฉลาด76การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus และ SeedRealtime เป็นสองครึ่งของเรื่องราวปี 2026 เรื่องเดียวกัน และทั้งคู่ล้มเหลวในการทดสอบที่ตรงกันข้ามกัน SeedRealtime เป็นโมเดลฟูลดูเพล็กซ์ที่รองรับเสียงและภาพโดยกำเนิดของ ByteDance เปิดใช้งานภายในแอป Doubao เมื่อวันที่ 5 สิงหาคม 2026 โดยไม่เสียค่าใช้จ่าย เข้าถึงผู้ชมที่ผู้สร้างอธิบายว่าอยู่ในระดับหลายร้อยล้าน — โดยไม่มี API ไม่มีตัวระบุโมเดล ไม่มีราคา และไม่มีเป้าหมายเวลาหน่วง Realtime-Venus คือเช็กพอยต์ 9B จำนวนสองตัวจากทีม Venus ของ Ant Group และมหาวิทยาลัย Tsinghua เผยแพร่เมื่อวันที่ 12 กันยายน 2026 ภายใต้ Apache-2.0 พร้อมรายงานทางเทคนิคและไม่มีการประกาศ ตั้งอยู่ในรีโพซิทอรีที่วิศวกรคนใดก็ดาวน์โหลดได้ และแทบไม่มีใครนำไปใช้งานจริงได้ ตัวหนึ่งคุณเรียกใช้งานไม่ได้ ส่วนอีกตัวคุณดาวน์โหลดได้ แล้วก็พบว่าคุณไม่มีอะไรให้เรียกใช้งานมัน ทั้งสองอยู่ที่แนวหน้าของความสามารถเดียวกันอย่างแท้จริง และไม่มีตัวใดมีเบนช์มาร์กที่ใครก็ตามนอกเหนือจากผู้เขียนของตัวเองได้ทำซ้ำ
สองรูปแบบของ "คุณไม่ได้มัน"
คุ้มค่าที่จะพูดให้ชัดเจน เพราะวลี "ไม่พร้อมใช้งาน" ซ่อนความแตกต่างที่แท้จริงไว้
SeedRealtime ไม่พร้อมใช้งานในแบบที่ผลิตภัณฑ์สำหรับผู้บริโภคไม่พร้อมใช้งาน กล่าวคือ มันมีอยู่จริง ทำงานได้ มีผู้ใช้ และประตูก็ปิดสำหรับนักพัฒนาเฉยๆ ไม่มี API ไม่มีตารางราคา ไม่มีพอร์ทัลเอกสาร และไม่มีกำหนดเวลาที่แน่นอนว่าจะมีขึ้นเมื่อใด เส้นทางสู่ตลาดของ ByteDance คือแอป และแอปก็เพียงพอแล้ว สิ่งที่คุณได้รับในฐานะนักสร้างคือเดโมที่คุณสัมผัสได้แต่ผสานรวมไม่ได้
Realtime-Venus ไม่พร้อมใช้งานในแบบที่ชิ้นงานวิจัยไม่พร้อมใช้งาน: น้ำหนักโมเดลเป็นสาธารณะ สัญญาอนุญาตเป็นแบบเปิดกว้าง โค้ดอยู่ที่นั่น และไม่มีใครรันมันอยู่ รีโพซิทอรีไม่ได้ถูกนำไปดีพลอยโดยผู้ให้บริการ inference รายใด และการดาวน์โหลดไม่ได้ถูกติดตามเลย จึงไม่มีสัญญาณสาธารณะเกี่ยวกับการนำไปใช้ไม่ว่าจะทางใด มันพร้อมใช้งานในความหมายที่สำคัญต่อนักวิจัย และไม่พร้อมใช้งานในความหมายที่สำคัญต่อผู้จัดการผลิตภัณฑ์
เมื่อนำมารวมกัน สิ่งเหล่านี้ก็วางกรอบคำถามที่ทั้งหมวดหมู่นี้กำลังติดอยู่กับมันในขณะนี้ นั่นคือ โมเดลที่ใช้งานได้จริงนั้นอยู่เบื้องหลังแอปสำหรับผู้บริโภค ส่วนโมเดลที่คุณรันเองได้กลับไม่ได้ถูกนำไปใช้งานจริงในการผลิตที่ไหนเลย
ทั้งคู่อยู่ในระดับที่ทำให้ปี 2026 แตกต่างอย่างแท้จริง
วิธีที่มีประโยชน์ในการมองวงการเรียลไทม์คือการแบ่งเป็นสามระดับ ระดับแรกคือเสียงแบบฮาล์ฟดูเพล็กซ์ที่เติมความสามารถในการมองเห็นเข้าไป — ผู้ช่วยแบบผลัดกันที่มองเห็นได้แต่ยังต้องผลัดกัน ระดับที่สองคือเสียงแบบฟูลดูเพล็กซ์ ที่ฟังและพูดพร้อมกันโดยไม่มีกล้อง: Seeduplex ของ ByteDance เอง, GPT-Live ของ OpenAI, Grok Voice Think Fast 2.0 ของ xAI ระดับที่สามคือฟูลดูเพล็กซ์แบบเสียงและภาพ ที่การรับรู้และการแสดงออกครอบคลุมทั้งวิดีโอและเสียงอย่างต่อเนื่อง
SeedRealtime เป็นโมเดลแรกในระดับที่สามที่สามารถนำไปใช้งานเชิงพาณิชย์ในวงกว้างได้สำเร็จ Realtime-Venus เป็นผู้เข้ามาใหม่แบบเปิดน้ำหนักในระดับเดียวกัน — วิดีโอผ่านตัวเข้ารหัส SigLIP2 เสียงผ่าน Whisper-Medium โครงหลัก Qwen3-8B และลูปการโต้ตอบหนึ่งวินาทีที่ไม่หยุดรับรู้เลย การ์ดโมเดลระบุว่ามันดัดแปลงมาจาก MiniCPM-o 4.5 โมเดลโอมนิโหมดัลของ OpenBMB ที่เปิดตัวเมื่อต้นปี 2026 ซึ่งทำให้ส่วนสนับสนุนของ Ant Group อยู่ที่การปรับแต่งหลังการฝึกและระบบรันไทม์ มากกว่าสถาปัตยกรรมพื้นฐาน
สิ่งที่ทั้งสองมีร่วมกัน และสิ่งที่ทำให้พวกมันอยู่เหนือระบบที่ใช้เสียงเพียงอย่างเดียวขึ้นไปหนึ่งระดับ คือไม่มีตัวไหนหยุดเพื่อมอง การรับรู้ภาพอย่างต่อเนื่องขณะพูดเป็นความสามารถที่แตกต่างอย่างแท้จริงจากการบรรยายภาพเพียงเฟรมเดียว และทั้งสองโมเดลถูกสร้างขึ้นโดยยึดความสามารถนี้เป็นแกนหลัก
ตัวเลขของแต่ละอันมีค่าเท่าไร

ไม่มีโมเดลใดมีเกณฑ์มาตรฐานจากบุคคลที่สาม อย่างไรก็ตาม หลักฐานไม่ได้เทียบเท่ากัน และความแตกต่างนี้สำคัญ
• SeedRealtime ไม่ได้เผยแพร่ผลทดสอบมาตรฐานใด ๆ เลย สิ่งที่ ByteDance นำเสนอคือข้ออ้างว่า ปัญหาจังหวะการสนทนา — การพูดขัดผู้ใช้ การตอบช้า การถูกกระตุ้นโดยเสียงรบกวนของคนแปลกหน้า — ลดลงประมาณครึ่งหนึ่งเมื่อเทียบกับระบบแบบแคสเคด จากการประเมินโดยมนุษย์แบบปลายทางถึงปลายทาง ข้อมูลเบื้องหลังไม่ได้ถูกเผยแพร่
• ตัวเลขของรุ่นก่อนหน้ามีรูปแบบเดียวกัน Seeduplex ซึ่งเป็นโมเดลที่ประมวลผลเฉพาะเสียงที่ ByteDance เปิดตัวใน Doubao เมื่อเดือนเมษายน 2026 มีรายงานว่าลดอัตราการตอบผิดพลาดและการขัดจังหวะผิดพลาดลงครึ่งหนึ่ง ลดความหน่วง ณ จุดสิ้นสุดการพูดลงประมาณ 250 มิลลิวินาที ลดการตอบก่อนเวลาลง 40% และเพิ่มความพึงพอใจในการสนทนาทางโทรศัพท์ขึ้น 8.34 คะแนน ในการทดสอบ A/B ขนาดใหญ่ ทั้งหมดนี้เป็นข้อมูลที่ผู้พัฒนารายงานเอง
• Realtime-Venus เผยแพร่ตาราง รายงานของมันอ้างว่าทำคะแนนดีที่สุดในหกจากแปด benchmark วิดีโอ รวมถึง StreamingBench 70.2, OVO-Bench 64.7 และ Daily-Omni 81.3 และนำใน MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8 และ Speech CMMLU 67.8 สำหรับ checkpoint เสียง
• ทั้งสองอย่างยังไม่มีการทำซ้ำ ตารางที่ตีพิมพ์ซึ่งไม่มีใครตรวจสอบ กับการทดสอบ A/B ที่ยังไม่เผยแพร่ซึ่งไม่มีใครตรวจสอบได้ ล้วนเป็นความไม่ยืนยันคนละแบบกัน ทั้งสองอย่างไม่ใช่หลักฐานที่คุณจะใช้ตัดสินใจจัดซื้อได้
การเปรียบเทียบหนึ่งเดียวที่ควรทำภายในตัวเลขของ Realtime-Venus คือการเทียบกับฐานของมันเอง MiniCPM-o 4.5 รายงาน 80.2 บน Daily-Omni; Realtime-Venus-Omni รายงาน 81.3 การได้เพิ่มขึ้นหนึ่งจุดเมื่อเทียบกับโมเดลที่มันถูกดัดแปลงมา บนเบนช์มาร์กที่โมเดลนั้นจัดการได้อยู่แล้ว ถือเป็นผลลัพธ์ที่สมเหตุสมผลสำหรับความพยายามด้านหลังการฝึกและการรันไทม์ — และเป็นข้อกล่าวอ้างที่เล็กกว่าคำว่า "ดีที่สุดในหกจากแปด" เมื่ออ่านโดยลำพังมาก

ปัญหาการผลัดกันพูด ซึ่งเป็นจุดที่ full-duplex เข้ามาเกี่ยวข้อง
ฟูลดูเพล็กซ์ไม่ใช่คุณสมบัติด้านความหน่วง แต่เป็นชุดของพฤติกรรม: การรู้ว่าการหยุดชั่วครู่หนึ่งหมายถึง "ฉันกำลังคิด" ไม่ใช่ "ฉันพูดจบแล้ว", การแยกแยะบทสนทนาของคนข้างเคียงออกจากคนที่กำลังพูดกับคุณ, และการเงียบไว้ตลอดเสียงตอบรับสั้น ๆ แทนที่จะมองว่า "อืม-ฮึม" เป็นการขัดจังหวะ
แนวทางของ SeedRealtime คือการจำลองสถานะการสนทนาโดยธรรมชาติ และตัดตัวตรวจจับกิจกรรมเสียงจากภายนอกออกไปทั้งหมด ดังนั้นการผลัดกันพูดจึงเป็นพฤติกรรมที่เรียนรู้ได้ภายในเครือข่าย แทนที่จะเป็นเกณฑ์ที่ใช้กับสตรีมเสียง นั่นคือความมุ่งมั่นทางสถาปัตยกรรมแบบเดียวกับที่ Realtime-Venus ทำ และทั้งคู่ถูกวางตำแหน่งไว้ตรงข้ามกับระบบแบบคาสเคดที่ต้องมีองค์ประกอบแยกต่างหากเพื่อตัดสินว่าใครพูด
จุดที่หลักฐานแตกต่างกันอยู่ที่ คำกล่าวอ้างของ SeedRealtime นั้นเกี่ยวกับการนำไปใช้งานในวงกว้าง — ผู้ใช้หลายร้อยล้านคน ห้องจริง เสียงรบกวนจริง — ในขณะที่ของ Realtime-Venus นั้นเกี่ยวกับ benchmark ผลลัพธ์ Full-Duplex-Bench v1.5 สำหรับ Realtime-Venus-Audio — การตอบสนองต่อการขัดจังหวะ 75% การต่อเนื่อง 97% ภายใต้ backchannels, 88% ภายใต้คำพูดที่มุ่งไปยังผู้อื่น และ 86% ภายใต้คำพูดพื้นหลัง ซึ่งสูงกว่า Gemini 3.1 Live และ GPT-4o ในด้านการต่อเนื่อง — เป็นตัวเลขที่เกี่ยวข้องโดยตรงมากที่สุดที่โมเดลทั้งสองได้เผยแพร่สำหรับปัญหานี้ พวกมันยังเป็นข้อมูลที่รายงานเองทั้งหมด และการต่อเนื่อง 97% ภายใต้ backchannels เป็นตัวเลขที่น่าทึ่งซึ่งสมควรมีผู้ตรวจทานคนที่สองก่อนที่ใครจะนำไปอ้างเป็นข้อเท็จจริง
ที่ซึ่งแต่ละคนทิ้งช่างก่อสร้างไว้
ช่องว่างในทางปฏิบัติไม่ใช่คุณภาพ แต่คือรูปร่างของข้อเสนอ
• SeedRealtime — คุณสามารถทดลองใช้ได้ฟรีใน Doubao แต่กลับนำไปผสานรวมไม่ได้เลย ไม่มีเส้นทางจาก "สิ่งนี้น่าประทับใจ" ไปสู่ "สิ่งนี้อยู่ในผลิตภัณฑ์ของฉัน"
• Realtime-Venus — คุณสามารถดาวน์โหลดไปใช้ ปรับจูน (fine-tune) รันแบบ air-gapped และตรวจสอบทุกเลเยอร์ได้ ต้นทุนอยู่ที่เช็กพอยต์ขนาด 9B สองตัวในรูปแบบ BF16 ซึ่งมีน้ำหนักราวสิบแปดกิกะไบต์ต่อตัว บวกกับลูปสตรีมมิ่งต่อเนื่องรายวินาที นั่นหมายความว่าต้องมีโหนด GPU ที่เรียกเก็บเงินไม่ว่าจะมีใครเรียกใช้งานหรือไม่
• ทั้งสองไม่มีตัวเลือกแบบโฮสต์ ทั้งคู่ไม่สามารถลองใช้งานได้ด้วยคีย์และเวลาช่วงบ่ายเพียงช่วงเดียว
ประเด็นสุดท้ายนั้นคือเหตุผลที่โมเดลทั้งสองมีประโยชน์มากกว่าเมื่อใช้เป็นคู่ มากกว่าเมื่อเป็นคู่ต่อสู้กัน เมื่อรวมกันแล้ว พวกมันแสดงให้เห็นว่าทั้งสองครึ่งของปัญหาได้รับการแก้แล้ว — ความสามารถนั้นใช้งานได้ และน้ำหนักโมเดลก็เปิดเผยได้ — พร้อมทั้งชี้ให้เห็นว่ายังไม่มีใครนำสองส่วนนี้มารวมกันเป็นสิ่งที่นักพัฒนาสามารถเรียกใช้ได้จริง
มีวิธีเลี่ยงที่ทีมจำนวนมากจะเลือกใช้ และเป็นการดีที่จะชี้ให้ชัดว่ามันครอบคลุมอะไรและไม่ครอบคลุมอะไร หากคุณไม่สามารถได้เลเยอร์เสียง คุณก็ยังสร้างส่วนที่คิดได้อยู่ดี Realtime-Venus มอบหมายงานที่มีค่าใช้จ่ายสูงของมัน — การดึงข้อมูล การให้เหตุผลที่ยาก การเรียก API ทางธุรกิจ — ไปยัง background harness ผ่านเครื่องหมายการมอบหมายแบบอะซิงโครนัส และขาที่ถูกมอบหมายนั้นเป็นการอนุมานข้อความธรรมดา OrcaRouter ไม่มีทั้ง Realtime-Venus และ SeedRealtime เลเยอร์ดูเพล็กซ์ทั้งสองอยู่outsideสิ่งที่เราให้บริการ และเราไม่ได้โฮสต์ทั้งสองอย่างโมเดลข้อความเกือบ 200 โมเดลภายใต้คีย์เดียวในราคาตามรายการของผู้ให้บริการโดยไม่บวกเพิ่มคือครึ่งหนึ่งของสถาปัตยกรรมที่เราครอบคลุมจริง พร้อมการสลับสำรองอัตโนมัติเพื่อให้งานเบื้องหลังไม่ล้มเหลวเพียงเพราะมี upstream รายหนึ่งเจอวันแย่ ๆDSL สำหรับการกำหนดเส้นทางเพื่อประกอบโมเดลหลายตัวเข้าเป็นการเรียกครั้งเดียวและการหลอมรวมโมเดลในกรณีที่การตัดสินของโมเดลเดียวไม่เพียงพอ มันไม่ใช่ส่วนที่ยากของระบบเหล่านี้ มันเป็นส่วนที่ซื้อได้จริง

อะไรจะเปลี่ยนการเปรียบเทียบนี้
สามความคืบหน้าจะช่วยให้เรื่องนี้ได้ข้อยุติ และยังไม่มีสักอย่างที่เกิดขึ้นเลย การวัดประสิทธิภาพแบบอิสระของ Realtime-Venus เพราะตารางที่ไม่มีผู้อ่านคนที่สองเป็นเพียงคำกล่าวอ้าง ไม่ใช่ผลลัพธ์ API สำหรับ SeedRealtime เพราะโมเดลที่มีหลักฐานการนำไปใช้งานแข็งแกร่งที่สุดในตอนนี้กลับเป็นตัวที่ไม่มีใครใช้ได้ และตัวเลขความหน่วงที่เผยแพร่จากโมเดลใดโมเดลหนึ่ง — time-to-first-audio คือเมตริกที่หมวดนี้ใช้ตัดสินใจซื้อ และ ณ เวลาที่เขียนนี้ ไม่มีโมเดลใดระบุตัวเลขนี้เลย
จนถึงตอนนั้น สรุปตามตรงก็คือ SeedRealtime เป็นหลักฐานว่าระบบ full-duplex แบบเสียง-ภาพทำงานได้ในระดับผู้บริโภค และ Realtime-Venus เป็นหลักฐานว่าเวตของโมเดลสามารถเปิดได้ และไม่มีข้อเท็จจริงใดในสองข้อนั้นที่พานักพัฒนาให้ใกล้การส่งมอบผลิตภัณฑ์ขึ้นเลย นั่นไม่ใช่การวิจารณ์ห้องแล็บใดห้องแล็บหนึ่ง แต่เป็นคำอธิบายของหมวดหมู่หนึ่งที่แก้ปัญหาด้านการวิจัยได้แล้ว แต่ยังไม่ได้แก้ปัญหาด้านการกระจาย
การเปรียบเทียบในบทความนี้1
ตรวจพบจากบทความนี้ · เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
