'Realtime-Venus'의 히어로 타이틀 카드. 부제는 '논문 한 편, 체크포인트 두 개, 그리고 아무런 발표도 없음'. 세 장의 카드에는 각각 'Realtime-Venus-Omni: 9B, 오디오-비주얼, Apache-2.0', 'Realtime-Venus-Audio: 9B, 음성 상호작용', '아직 없는 것: API, 가격, 출시 글, 독립 벤치마크'라고 적혀 있고, 그 아래 푸터 스트립에는 '모든 벤치마크 수치는 기술 보고서에서 가져온 것이며, 독립적으로 재현된 것은 하나도 없음.'이라고 적혀 있다. OrcaRouter 로고는 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

Realtime-Venus: 앤트 그룹의 풀듀플렉스 9B, 출시 발표 없이 배포되다

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

2026년 9월 12일, arXiv에 Realtime-Venus를 설명하는 기술 보고서가 올라왔습니다. 이 시스템은 별도로 훈련된 두 개의 9B 모델로 구축된 전이중 상호작용 시스템으로, 시청각 상호작용을 위한 Realtime-Venus-Omni와 음성 상호작용을 위한 Realtime-Venus-Audio로 이루어져 있으며, Ant Group의 Venus Team이 칭화대학교와 협력한 것으로 명시되어 있습니다. 며칠 안에 inclusionAI/Realtime-Venus 아래에 있는 Hugging Face의 Apache-2.0 저장소에는 두 체크포인트가 다운로드 가능한 BF16 safetensors로 들어 있었고, 프로젝트 페이지와 동반 GitHub 저장소도 있었습니다. 나타나지 않은 것이 바로 주목할 만한 부분입니다: 출시 게시물도, 제품 페이지도, API도, 가격표도 없었고, Ant Group 자체 플랫폼에서도 그것이 존재한다고 알리는 내용은 전혀 없었습니다. 이것은 발표만 빼고 모든 것을 내놓은 릴리스이므로, 확립된 사실과 주장을 분리하는 것이 일의 전부가 됩니다.

디스크에 실제로 무엇이 있나요

이 저장소는 스텁이 아닙니다. 각각 샤딩된 safetensors 가중치, 구성 파일, 그리고 카드에서 trust_remote_code=True로 로드하라고 안내하는 사용자 지정 Hugging Face Transformers 코드를 갖춘 두 개의 모델 디렉터리를 담고 있습니다. 최상위에는 requirements 파일, 토큰-파형 리소스와 참조 음성을 담은 assets 폴더, Apache-2.0 라이선스가 있습니다. 카드에는 CUDA와 FFmpeg를 사용하는 Python 3.10 설치 방법과 ModelScope 미러 및 Hugging Face 다운로드 경로가 모두 문서화되어 있습니다. 가중치는 실제이고 코드도 갖춰져 있으니, 오늘 바로 다운로드하는 것을 막을 것은 없습니다.

A screenshot of the Hugging Face model page for inclusionAI/Realtime-Venus, captured 18 September 2026, showing the header with the Any-to-Any, Transformers, ONNX, Safetensors, English, Chinese, multimodal, audio, video, speech, streaming, full-duplex, long-video and custom-code tags, an Apache-2.0 licence badge, an arXiv 2609.13814 badge, the model card title reading 'A full-duplex interaction system with asynchronous delegation', rows for project page, ModelScope, arXiv, GitHub and licence, and a right-hand panel reading 'Downloads last month: -' and 'This model isn't deployed by any Inference Provider.'

두 가지 부재는 내용만큼이나 많은 정보를 준다. 첫째는 이 저장소가 어떤 추론 제공자에 의해서도 배포되지 않는다고 분명히 밝히고 있다는 점이다 — 호스팅된 엔드포인트도, 서버리스 옵션도, 이를 제공하는 제3자 플랫폼도 없다. 둘째는 다운로드가 전혀 추적되지 않는다는 점이며, 이는 얼마나 많은 사람들이 이를 내려받았는지에 대한 공개된 신호가 없다는 뜻이다. 모델은 Hugging Face에서 채택된 것처럼도, 무시된 것처럼도 보일 수 있다; 이 모델은 그런 식으로는 알 수 없다.

두 체크포인트, 그리고 그 둘을 구분하는 것

둘 다 9B이고, 둘 다 스트리밍 백본을 공유하며, 둘 사이의 차이는 무엇을 인식할 수 있는가에 있습니다.

• Realtime-Venus-Omni — 오디오-비주얼 체크포인트. 스트리밍 프레임을 위한 SigLIP2 비주얼 인코더, Whisper-Medium 오디오 인코더, Qwen3-8B 언어 백본. 비디오 또는 이미지, 오디오, 텍스트를 입력받고, 텍스트와 선택적으로 음성 파형을 반환합니다.

• Realtime-Venus-Audio — 로드 시점에 비전을 꺼 둔 동일한 백본입니다. 오디오와 텍스트를 입력받고 텍스트와 음성을 출력합니다. 카메라가 무관하고 더 작은 메모리 사용량과 더 단순한 경로를 원하는 경우를 위해 존재합니다.

• 공통 사양 — 양쪽 모두 40,960토큰 컨텍스트, 양쪽 모두 BF16 가중치, 음성은 끝에 덧붙인 별도의 텍스트 음성 변환 모델이 아니라 스트리밍 플로우 매칭 디코더로 디코딩되는 이산 S3 토큰으로 생성됩니다.

• 계보 — 모델 카드에는 Omni 체크포인트가 OpenBMB가 2026년 초에 오픈소스로 공개한 9B 옴니모달 모델인 MiniCPM-o 4.5를 기반으로 적응된 것이라고 명시되어 있습니다. 이는 각주가 아닙니다. 이는 Ant Group의 기여가 다른 누군가의 스트리밍 백본 위에 얹힌 포스트트레이닝, 런타임, 그리고 위임 설계라는 뜻이며, 이는 "새로운 9B 옴니 모델"이라는 주장과는 다르고 더 구체적인 주장입니다.

단 하나의 진정으로 새로운 아이디어: 일급 스트림 이벤트로서의 위임

2026년의 모든 전이중 시스템은 같은 모순을 해결해야 한다. 대화 제어는 밀리초에서 1초 단위의 세분성으로 작동한다. 도구 호출, 검색, 그리고 고난도의 추론은 수 초에서 수십 초가 걸린다. 생각하기 위해 멈추는 모델은 더 이상 전이중이 아니게 되고, 결코 멈추지 않는 모델은 도구를 사용할 수 없다.

Realtime-Venus는 이중 루프 런타임으로 응답한다. 상호작용 루프는 1초 단위의 고정 청크로 실행되며, 오디오와 비디오 특징을 지속적으로 수집하고, 대화 상태를 갱신하며, 들을지 말할지 결정하는 동시에 텍스트와 정렬된 음성을 스트리밍한다. 배경 작업이 진행 중일 때도 멈추지 않는다. 두 번째 루프는 논문에서 Realtime-Venus-Harness라고 부르는 스케줄러이다. 프런트엔드가 어떤 작업이 인라인으로 처리할 수 있는 범위를 넘는다고 판단하면, 자체 은닉 시퀀스에 내장된 전용 마커를 통해 비동기 위임을 내보내고, 하네스는 그 작업을 배경에서 실행한 뒤 결과를 진행 중인 대화에 다시 통합한다.

이것을 단순한 다이어그램 이상으로 만들어 주는 세부 사항은 논문이 ‘인과적 작업 캡처(causal task capture)’라고 부르는 것입니다 — 위임된 작업은 대화 상태의 격리된 스냅샷에 대해 실행되므로, 오래 실행되는 백그라운드 작업이 실행되는 동안 대화가 계속 진행되어도 그 작업이 손상될 수 없습니다. 이것이 대부분의 “위임하고 계속 대화하기” 설계가 실제로 무너지는 실패 모드이며, 보고서에서 가장 흥미로운 부분입니다.

하네스는 가중치 안에 있지 않습니다. 그것은 GitHub 저장소에 별도 구성 요소로 존재합니다. 즉, 이 아키텍처를 독특하게 만드는 부분은 여러분이 직접 조립하고 신뢰해야 하는 부분이라는 뜻입니다.

그 숫자들, 그리고 그것이 정확히 누구의 것인지

아래의 모든 수치는 기술 보고서와 모델 카드에서 나온 것입니다. 그중 어느 것도 저자 외부의 누구에 의해서도 재현되지 않았고, 제3자가 평가를 발표한 적도 없으며, 그것과 대조해 확인할 수 있는 리더보드 항목도 없습니다. 이를 저자 자신의 측정값으로 읽으십시오.

• 비디오 벤치마크, Realtime-Venus-Omni — 보고서가 사용하는 8개 벤치마크 중 6개에서 최고 점수를 기록했으며, StreamingBench 70.2, OVO-Bench 64.7, Daily-Omni 81.3이 포함됩니다.

• 오디오 벤치마크, Realtime-Venus-Audio — MMAU 78.0, MMAU-Pro 63.2, Llama Questions 83.8, Speech CMMLU 67.8, 그리고 보고서에서 최고의 비교 수치와 일치한다고 설명한 VoiceBench AlpacaEval 점수 4.81.

• Full-Duplex-Bench v1.5 — 사용자 끼어들기의 75%에 응답했으며, 맞장구에서 97%, 타인 대상 발화에서 88%, 배경 발화에서 86%의 대화 지속률을 보였다. 보고서에 따르면 이는 세 가지 지속성 지표 모두에서 Gemini 3.1 Live와 GPT-4o를 능가한다.

Daily-Omni의 수치는 잠시 짚고 넘어갈 만하다. 이 체크포인트가 적응된 모델인 MiniCPM-o 4.5는 같은 벤치마크에서 80.2를 보고한다. Realtime-Venus-Omni는 81.3을 보고한다. 두 수치가 모두 사실이라면, 대규모 후속 학습과 런타임 작업을 통해 얻은 개선은 기반 모델이 이미 강했던 벤치마크에서 대략 1점 정도다. 이는 이런 종류의 작업에서 현실적인 결과이며, "8개 중 6개에서 최고"라는 헤드라인보다 훨씬 덜 극적인 이야기다.

A generated scoreboard for 'Realtime-Venus — the scoreboard' showing a single centered card with six rows: Params 9B, Context 40,960 tokens, Licence Apache-2.0, Weight format BF16, Daily-Omni 81.3, Full-Duplex-Bench continuation 97 / 88 / 86, with the footer 'Vendor-reported from the technical report; no independent scores yet.'

무엇이 확립되지 않았는가

미해결 질문 목록은 해결된 질문 목록보다 길다. 그리고 그것이 출시된 지 엿새 된 모델의 솔직한 현주소다.

• 독립적인 평가는 존재하지 않습니다. 아레나 순위도, 제3자 재현도, 수치를 공개한 단 하나의 외부 그룹도 없습니다.

• 밀리초 단위의 지연 시간 수치가 없습니다. 보고서는 1초 단위의 상호작용 주기를 설명하고, 카드에는 초당 스트리밍 호출이 문서화되어 있지만, 첫 오디오까지 걸리는 시간(time-to-first-audio) 수치는 공개되어 있지 않습니다. 이는 이 범주가 실제로 구매되는 기준이 되는 지표입니다.

• API도 없고 가격도 없으며, 둘 중 어느 하나라도 나올 것이라는 언급도 없다. 이것이 출시를 기다리는 제품인지, 아니면 다운로드 가능한 상태로 남을 연구 결과물인지는 정말로 알 수 없다.

• 공급업체가 밝힌 의도는 없음. 발표가 없다는 사실은 조용한 출시 전략의 증거가 아니다. 그것은 논문을 위해 공개된 저장소, 그 이상도 이하도 아니라는 해석과도 부합한다.

• 하네스에 대한 프로덕션 검증 근거가 없습니다. 하네스는 이 아키텍처에서 핵심을 떠받치는 구성 요소이면서 가장 문서화가 부족한 부분입니다.

왜 조용한 경로가 계속 발생하는가

올해 Ant Group의 모델 관련 작업이 출시가 아니라 저장소를 통해 대중에 공개된 것은 이번이 두 번째다. 이 연구소의 GUI 에이전트인 UI-Venus-2-9B는 2026년 8월 말 논문도, 프로젝트 페이지도, 발표도 없이 Hugging Face에 나타났으며 이후 보고서가 뒤따랐다. Realtime-Venus는 반대 순서로 등장했다. 보고서가 먼저, 저장소는 그와 함께, 발표는 여전히 보류된 상태다.

이 패턴은 Ant Group만의 것이 아니다. 특히 중국 연구소들은 연구 산출물과 소비자 대상 배포를 세상에 내놓으면서 개발자 대상 발표는 나중으로 미루거나 아예 건너뛰어 왔다. 이 분야를 추적하는 사람에게 이는 불편하다. 왜냐하면 통상적인 신호 — 출시 게시물, 요금표, 문서 사이트 — 가 바로 빠져 있는 부분이기 때문이다. 이제 산출물이 곧 발표이며, 무엇이 출시되었는지 알려면 그것을 주의 깊게 읽는 수밖에 없다.

실행하고 싶다면

이 카드는 이렇게 새로운 릴리스치고는 이례적으로 실용적입니다. 로딩은 표준입니다: AutoModel.from_pretrained를 원격 코드를 신뢰하고 SDPA 어텐션과 bfloat16을 사용하여 로컬 체크포인트 디렉터리에서 실행합니다. 전이중 스트리밍은 모델을 듀플렉스 모드로 전환하는 단일 호출로 진입하며, 그 후 문서화된 루프는 1초의 streaming_prefill에 이어 streaming_generate를 반복합니다. 장시간 비디오 메모리는 40으로 설정된 memory-minutes 매개변수로 활성화되며, 보통 미세 조정이 필요한 기능이라는 점에서 주목할 만하게도 학습이 필요 없는 것으로 설명됩니다. 두 가지 주의사항은 발견된 것이 아니라 문서화되어 있습니다: 유틸리티를 가져오기 전에 상수를 올리지 않으면 긴 비디오를 조용히 잘라내는 프레임 상한, 그리고 듀플렉스 비디오에 렌더링되는 비라틴 자막을 위한 CJK 폰트 요구사항입니다.

이 카드가 제공하지 않는 것은 하드웨어 최소 기준이다. BF16의 9B 모델은 활성화 메모리를 고려하기 전에도 가중치만 약 18기가바이트에 달하며, 이는 실시간 양방향 추론을 고성능 GPU에서나 가능하게 하고, 이 모델이 파생된 MiniCPM-o 제품군이 부분적으로 겨냥해 설계되었던 노트북 배포의 범위 밖으로 밀어낸다.

여기에는 이름 붙일 만한 이음새가 있습니다. 라우터가 실제로 들어맞는 지점이기 때문입니다. Realtime-Venus는 검색, 복잡한 추론, 비즈니스 API 호출 같은 힘든 작업을 백그라운드 모델로 위임합니다. 위임된 그 구간은 평범한 텍스트 추론이며, 대화형 프런트 엔드가 유용할지 아니면 그저 유창할지를 결정하는 구간입니다. OrcaRouter는 Realtime-Venus를 전혀 포함하지 않습니다. 여기의 양방향 계층은 자체 호스팅 다운로드이며 우리는 그것을 제공하지 않습니다. 그것이 넘겨주는 추론이 바로 우리가 담당하는 부분입니다: 하나의 키로 마크업 없이 제공업체 정가에 거의 200개 모델, 업스트림이 좋지 않은 오후를 보낼 때 자동 장애 조치, 여러 모델을 하나의 호출로 구성하는 라우팅 DSL, 그리고 한 모델의 판단만으로 충분하지 않은 경우를 위한 모델 융합. 위임 표시는 프런트엔드의 결정입니다. 어떤 모델이 응답할지는 구성 선택이며, 그 선택을 가중치 밖에 두는 것이 바로 아무것도 재학습하지 않고도 그것을 바꿀 수 있게 해줍니다.

A screenshot of the GitHub repository inclusionAI/Realtime-Venus, captured 18 September 2026, showing the repository header, the file and folder listing for the Realtime-Venus-Omni and Realtime-Venus-Audio checkpoints and the harness, and the opening section of the README describing the full-duplex interaction system.

무엇이 그것을 해결할까요?

세 가지가 더해지면 Realtime-Venus는 가중치가 함께 제공되는 논문에서 누구나 평가할 수 있는 모델로 거듭날 것입니다. 독립적인 그룹이 Full-Duplex-Bench continuation 수치를 재현하는 것 — 백채널 상황에서 97%는 놀라운 수치이고, 놀라운 수치에는 제2의 독자가 필요하기 때문입니다. 공개된 지연 시간 수치 — 전이중 시스템은 첫 오디오까지의 시간(time-to-first-audio)에 따라 성패가 갈리는데, 이 시스템은 목표치를 제시하지 않았기 때문입니다. 그리고 하네스 문서 — 비동기 위임 설계는 이번 릴리스에서 정말로 새로운 유일한 부분인데, 지금은 읽을 수는 있어도 쉽게 도입하기는 어려운 부분이기 때문입니다.

그때까지 정확한 설명은 협소하고 흥미롭지 않으며, 바로 그렇기에 기록해 둘 가치가 있다: 오픈 백본 위에 구축된 두 개의 9B 풀듀플렉스 체크포인트의 실제 Apache-2.0 릴리스, 강력하지만 자기 보고에 불과한 벤치마크, 독립적 검증 없음, API 없음, 발표 없음. 그 선 위의 모든 것은 추론이다.

이 글에서 비교한 모델1

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트