
Realtime-Venus vs SeedRealtime: 사용할 수 없게 되는 두 가지 정반대 방식
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-Venus와 SeedRealtime은 같은 2026년 이야기의 두 반쪽이며, 서로 정반대되는 시험에서 실패한다. SeedRealtime은 ByteDance의 네이티브 오디오·비주얼 풀듀플렉스 모델로, 2026년 8월 5일 Doubao 앱 안에서 무료로 켜져 제작자가 수억 명이라고 묘사하는 사용자층에 도달했다 — API도, 모델 식별자도, 가격도, 지연 시간 목표도 없이. Realtime-Venus는 Ant Group의 Venus Team과 Tsinghua University가 내놓은 한 쌍의 9B 체크포인트로, 2026년 9월 12일 Apache-2.0 라이선스로 기술 보고서와 함께 공개되었고 별도 발표는 없었으며, 어떤 엔지니어든 다운로드할 수 있지만 현실적으로 배포할 수 있는 사람은 거의 없는 저장소에 놓여 있다. 그중 하나는 호출할 수 없다. 다른 하나는 다운로드한 뒤, 그것을 호출할 대상이 없다는 사실을 알게 된다. 둘 다 분명 같은 능력의 최전선에 있지만, 어느 쪽도 자기 저자 외의 누군가가 재현한 벤치마크를 갖고 있지 않다.
‘넌 가질 수 없어’의 두 가지 버전
정확히 짚고 넘어갈 필요가 있다. "사용할 수 없음"이라는 표현이 실제 차이를 감추고 있기 때문이다.
SeedRealtime을 사용할 수 없다는 것은 소비자 제품을 사용할 수 없는 방식과 같다. 그것은 존재하고, 작동하며, 사용자도 있지만, 개발자에게는 문이 그냥 닫혀 있을 뿐이다. API도, 요금표도, 문서 포털도 없고, 그 어느 것에 대한 일정도 제시되지 않는다. ByteDance의 시장 진출 경로는 앱이었고, 앱만으로 충분했다. 빌더로서 당신이 얻는 것은 체험할 수는 있지만 통합할 수는 없는 데모뿐이다.
Realtime-Venus는 연구 산출물이 사용 불가능한 방식으로 사용 불가능하다: 가중치는 공개되어 있고, 라이선스는 허용적이며, 코드도 존재하지만, 아무도 그것을 실행하지 않는다. 그 저장소는 어떤 추론 제공자에 의해서도 배포되지 않았고, 다운로드도 전혀 추적되지 않으므로, 채택 여부에 대한 공개적 신호가 어느 쪽으로도 없다. 그것은 연구자에게 중요한 의미에서는 사용 가능하고, 제품 관리자에게 중요한 의미에서는 사용 불가능하다.
종합해 보면, 이것들은 이 카테고리 전체가 현재 붙잡혀 있는 질문을 규정한다: 작동하는 모델들은 소비자용 앱 뒤에 있고, 당신이 실행할 수 있는 모델들은 어디에서도 프로덕션에 있지 않다.
둘 다 2026을 실제로 차별화하는 티어에 있다
실시간 분야를 이해하는 유용한 방법은 세 가지 레벨로 나누어 보는 것이다. 첫 번째는 비전을 덧붙인 반이중 음성, 즉 볼 수는 있지만 여전히 차례를 지켜야 하는 턴 기반 어시스턴트다. 두 번째는 카메라 없이 동시에 듣고 말하는 오디오 전이중으로, ByteDance 자체의 Seeduplex, OpenAI의 GPT-Live, xAI의 Grok Voice Think Fast 2.0이 여기에 해당한다. 세 번째는 지각과 표현이 비디오와 오디오를 가로질러 연속적으로 이루어지는 시청각 전이중이다.
SeedRealtime는 세 번째 계층에서 대규모 상용 배포에 도달한 첫 모델이다. Realtime-Venus는 같은 계층의 오픈 웨이트 진입 모델로, 비디오는 SigLIP2 인코더를, 오디오는 Whisper-Medium을, 백본은 Qwen3-8B를 사용하며, 인식을 멈추지 않는 1초 상호작용 루프를 갖춘다. 모델 카드에는 2026년 초에 공개된 OpenBMB의 옴니모달 모델인 MiniCPM-o 4.5에서 파생되었다고 명시되어 있으며, 이는 Ant Group의 기여가 기본 아키텍처보다는 후속 학습과 런타임에 있음을 뜻한다.
두 모델의 공통점이자 오디오 전용 시스템보다 한 단계 위에 놓이게 하는 점은, 둘 다 보기 위해 잠시 멈추지 않는다는 것이다. 말하는 동안의 연속적인 시각적 인식은 단일 프레임을 묘사하는 것과는 진정으로 다른 능력이며, 두 모델 모두 이를 중심으로 구축되었다.
각각의 숫자가 얼마만큼의 가치가 있는지

두 모델 중 어느 쪽도 제3자 벤치마크를 가지고 있지 않습니다. 그러나 그 증거는 동등하지 않으며, 그 차이는 중요합니다.
• SeedRealtime은 벤치마크를 전혀 공개하지 않는다. ByteDance가 제시하는 것은 대화 리듬 문제 — 사용자의 말을 덮고 말하기, 늦게 응답하기, 낯선 사람의 소음에 반응하기 — 가 캐스케이드 시스템과 비교해 대략 절반으로 줄어든다는 주장이며, 이는 종단 간 인간 평가에서 비롯된 것이다. 그 근거가 되는 데이터는 공개되지 않았다.
• 전작의 수치도 같은 양상이다. 2026년 4월 바이트댄스가 도우바오에 탑재해 출시한 오디오 전용 모델 시듀플렉스는 대규모 A/B 테스트에서 오반응 및 잘못된 끼어들기 비율을 절반으로 줄이고, 엔드포인트 지연 시간을 약 250밀리초 단축하며, 조기 응답을 40% 감소시키고, 통화 만족도를 8.34점 높인 것으로 보고되었다. 모두 벤더 측 보고다.
• Realtime-Venus가 표를 게시한다. 해당 보고서는 8개 비디오 벤치마크 중 6개에서 최고 점수를 주장하며, 여기에는 StreamingBench 70.2, OVO-Bench 64.7, Daily-Omni 81.3이 포함된다. 또한 오디오 체크포인트의 경우 MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8에서 앞선다고 주장한다.
• 둘 다 재현되지 않았습니다. 아무도 확인하지 않은 공개된 표와 아무도 확인할 수 없는 비공개 A/B는 서로 다른 종류의 미검증입니다. 어느 것도 조달 결정을 내릴 근거가 될 수 없습니다.
Realtime-Venus 수치 안에서 할 가치가 있는 단 하나의 비교는 자체 베이스 모델과의 비교다. MiniCPM-o 4.5는 Daily-Omni에서 80.2를 기록하고, Realtime-Venus-Omni는 81.3을 기록한다. 이미 그 모델이 처리했던 벤치마크에서, 적응의 바탕이 된 모델 대비 1점 상승은 포스트트레이닝 및 런타임 작업의 결과로 그럴듯하며, "여덟 개 중 여섯 개에서 최고"라는 표현이 그 자체로 읽히는 것보다 훨씬 작은 주장이다.

턴테이킹 문제, 바로 풀듀플렉스가 자리한 곳
전이중은 지연 시간 기능이 아니다. 그것은 일련의 행동 방식이다: 어떤 멈춤이 '이제 다 끝났다'가 아니라 '생각 중이다'라는 뜻인지 아는 것, 곁에 있는 사람의 대화와 자신에게 말을 거는 사람을 구별하는 것, 그리고 'mm-hm'을 끼어들기로 취급하지 않고 맞장구가 나와도 조용히 있는 것이다.
SeedRealtime의 접근 방식은 대화 상태를 네이티브로 모델링하고 외부 음성 활동 감지기를 완전히 제거하는 것입니다. 따라서 발화 순서 교대는 오디오 스트림에 적용되는 임계값이 아니라 네트워크 내부에서 학습된 행동입니다. 이는 Realtime-Venus가 취하는 것과 동일한 아키텍처적 약속이며, 둘 다 누가 말하는지 결정하기 위해 별도 구성 요소가 필요한 캐스케이드 시스템에 맞서 위치합니다.
증거가 갈리는 지점은 SeedRealtime의 주장은 대규모 배포, 즉 수억 명의 사용자, 실제 방, 실제 소음을 전제로 한 것인 반면, Realtime-Venus의 주장은 벤치마크에 관한 것이라는 점이다. Realtime-Venus-Audio의 Full-Duplex-Bench v1.5 결과 — 끼어들기에 75% 응답, 맞장구 상황에서 97% 지속, 타인 대상 발화에서 88%, 배경 발화에서 86% 지속으로, 지속 측면에서 Gemini 3.1 Live와 GPT-4o를 능가 — 는 두 모델 중 어느 쪽이든 이 문제에 관해 공개한 수치 가운데 가장 직접적으로 관련된 수치다. 그것들은 또한 전적으로 자체 보고된 것이며, 맞장구 상황에서의 97% 지속률은 누구든 이를 사실로 인용하기 전에 제2의 검토자를 거칠 만한 눈에 띄는 수치다.
각각이 빌더를 남기는 곳
실질적인 격차는 품질이 아니라 제안의 형태에 있습니다.
• SeedRealtime — Doubao에서 무료로 체험할 수 있지만, 통합은 결코 할 수 없습니다. "이건 인상적이다"에서 "이건 내 제품에 있다"로 가는 경로는 없습니다.
• Realtime-Venus — 다운로드하고, 미세 조정하고, 에어갭 환경에서 실행하고, 모든 레이어를 검사할 수 있습니다. 그 대가는 각각 약 18기가바이트의 가중치에 달하는 BF16 형식의 9B 체크포인트 두 개와, 초당 연속 스트리밍 루프입니다. 이는 누군가 호출하든 하지 않든 요금이 청구되는 GPU 노드를 의미합니다.
• 어느 쪽도 호스팅 옵션이 없습니다. 어느 쪽도 키 하나와 반나절만으로 시험해 볼 수 없습니다.
마지막 요점은 두 모델이 서로 경쟁자일 때보다 한 쌍일 때 더 유용한 이유다. 두 모델은 문제의 양쪽 절반이 모두 해결되었음을 보여준다 — 즉 그 능력은 작동하고, 가중치는 공개할 수 있다 — 동시에 아직 누구도 그것들을 합쳐 개발자가 실제로 호출할 수 있는 무언가로 만들지 못했음을 보여준다.
많은 팀이 곧바로 손을 뻗는 우회 방법이 있는데, 그것이 무엇을 해결하고 무엇을 해결하지 못하는지는 분명히 해둘 가치가 있습니다. 음성 계층을 확보하지 못하더라도, 생각하는 부분은 여전히 만들 수 있습니다. Realtime-Venus는 비용이 많이 드는 작업, 즉 검색, 고난도 추론, 비즈니스 API 호출을 비동기 위임 마커를 통해 백그라운드 하네스로 넘기는데, 그 위임된 구간은 평범한 텍스트 추론입니다. OrcaRouter는 Realtime-Venus도 SeedRealtime도 제공하지 않습니다. 두 듀플렉스 계층 모두 우리가 제공하는 범위 밖이며, 우리는 어느 쪽도 호스팅하지 않습니다. 공급자 정가 그대로, 마진 없이 하나의 키 뒤에 거의 200개의 텍스트 모델이 우리가 실제로 담당하는 아키텍처의 절반이며, 자동 페일오버가 있어 업스트림 하나가 안 좋은 하루를 보냈다고 해서 백그라운드 작업이 실패하지 않습니다. 여러 모델을 하나의 호출로 조합하기 위한 라우팅 DSL, 그리고 단일 모델의 판단만으로는 충분하지 않을 때를 위한 모델 퓨전도 있습니다. 그것은 이 시스템들에서 어려운 부분이 아닙니다. 그것은 실제로 구매 가능한 부분입니다.

이 비교를 바꾸는 것은 무엇일까?
세 가지 개발이 그것을 매듭지을 텐데, 아직 그중 어느 것도 일어나지 않았다. Realtime-Venus에 대한 독립적인 벤치마크, 왜냐하면 두 번째 독자가 없는 표는 결과가 아니라 주장일 뿐이기 때문이다. SeedRealtime을 위한 API, 왜냐하면 가장 강력한 배포 증거를 가진 모델이 현재 아무도 쓸 수 없는 모델이기 때문이다. 그리고 둘 중 어느 쪽에서든 공개된 지연 수치 — 첫 오디오까지의 시간은 이 범주가 구매되는 기준이며, 이 글을 쓰는 시점에 두 모델 모두 그 수치를 밝히지 않았다.
그때까지는, 솔직한 요약은 이렇다. SeedRealtime은 오디오-비주얼 전이중이 소비자 규모에서 작동한다는 증거이고, Realtime-Venus는 가중치를 공개할 수 있다는 증거다. 그리고 그 어느 사실도 빌더를 제품 출시에 더 가까이 데려다주지는 않는다. 이는 두 연구소 중 어느 한 곳에 대한 비판이 아니다. 연구 문제는 해결했지만 배포 문제는 아직 해결하지 못한 한 범주에 대한 설명이다.
이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
