
Realtime-Venus vs SeedRealtime:利用不可になる2つの正反対の方法
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100万トークンあたり
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- anthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0345知能76コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Realtime-VenusとSeedRealtimeは同じ2026年の物語の二つの半分であり、正反対のテストで失敗する。SeedRealtimeはByteDanceのネイティブな音声視覚全二重モデルで、2026年8月5日にDoubaoアプリ内で無料で有効化され、その製作者が数億人と表現するオーディエンスに到達した——APIもモデル識別子も価格もレイテンシ目標もないまま。Realtime-VenusはAnt GroupのVenus Teamと清華大学による9Bチェックポイントのペアで、2026年9月12日にApache-2.0の下で公開され、技術報告書はあるが発表はなく、どのエンジニアでもダウンロードでき、現実的にデプロイできる者はほとんどいないリポジトリにある。一方は呼び出せない。もう一方はダウンロードできて、それから呼び出す先が何もないことに気づく。どちらも同じ能力の最前線に確かに位置しており、どちらにも、著者自身以外の誰かが再現したベンチマークは存在しない。
「手に入らない」の2つの味わい
正確に述べておく価値がある。なぜなら「利用不可」という言葉は、実際の違いを覆い隠してしまうからだ。
SeedRealtimeは、消費者向け製品が利用できないのとは別の意味で利用できない。それは存在し、動作し、ユーザーもいるが、開発者には扉が閉ざされているだけだ。APIも料金表もドキュメントポータルもなく、その提供時期についての明言もない。ByteDanceの市場投入手段はアプリであり、アプリで十分だった。開発者として得られるのは、体験はできるが統合はできないデモだ。
Realtime-Venusは、研究用成果物が利用できないのと同じ意味で利用できない。重みは公開され、ライセンスは寛容で、コードもそこにあり、しかも誰も動かしていない。リポジトリはどの推論プロバイダーにもデプロイされておらず、ダウンロードも一切追跡されていないため、採用されているかどうかを示す公開シグナルはどちらにせよ存在しない。研究者にとって重要な意味では利用可能であり、プロダクトマネージャーにとって重要な意味では利用不可である。
総合すると、それらはこのカテゴリー全体が現在行き詰まっている問いを形作っている。つまり、うまく機能するモデルは消費者向けアプリの背後にあり、自分で実行できるモデルはどこでも本番環境で使われていない。
どちらも、2026年を真に特徴づけるティアにある。
リアルタイム分野を読むための有用な方法は、3つのレベルで捉えることだ。第1は、視覚を後付けした半二重音声——見ることはできるが、依然として順番に交代するターン制アシスタントだ。第2は、音声の全二重で、カメラなしに同時に聞きながら話す:ByteDance自身のSeeduplex、OpenAIのGPT-Live、xAIのGrok Voice Think Fast 2.0。第3は、音声視覚の全二重で、知覚と表現が映像と音声にまたがって継続する。
SeedRealtimeは、第3ティアで大規模商用展開に到達した最初のモデルである。Realtime-Venusは同じティアに参入したオープンウェイトのモデルだ——映像はSigLIP2エンコーダー経由、音声はWhisper-Medium経由、Qwen3-8Bをバックボーンとし、知覚し続ける1秒間のインタラクションループを備える。そのモデルカードには、2026年初めに公開されたOpenBMBのオムニモーダルモデルであるMiniCPM-o 4.5から適応されたと記載されている。これは、Ant Groupの貢献がベースアーキテクチャではなく、ポストトレーニングとランタイムにあることを意味する。
彼らに共通し、音声のみのシステムより一段上に置くのは、どちらも見るために立ち止まらないことだ。話しながらの継続的な視覚知覚は、単一のフレームを記述することとは本当に異なる能力であり、どちらのモデルもそれを中心に構築されている。
それぞれの数字がどれだけの価値を持つか

どちらのモデルにもサードパーティのベンチマークはない。とはいえ、その証拠は同等ではなく、違いは重要だ。
• SeedRealtimeはベンチマークを一切公開していない。ByteDanceが示しているのは、対話のリズムに関する問題——ユーザーの話に被せて話す、応答が遅れる、他人の雑音で誤作動する——がカスケードシステムと比べておよそ半分に減るという主張であり、それはエンドツーエンドの人間評価に基づくものだ。根拠となるデータは公開されていない。
• 前身の数値も同じ傾向を示している。ByteDanceが2026年4月にDoubaoへ投入した音声専用モデル、Seeduplexは、大規模A/Bテストで、誤応答率と誤中断率を半減させ、エンドポイント遅延を約250ミリ秒削減し、早すぎる応答を40%減らし、通話満足度を8.34ポイント高めたと報告されている。いずれもベンダー報告である。
• Realtime-Venus は表を公開している。そのレポートでは、8つの動画ベンチマークのうち6つで最高スコアを主張しており、StreamingBench 70.2、OVO-Bench 64.7、Daily-Omni 81.3 を含み、音声チェックポイントでは MMAU 78.0、MMAU-Pro 63.2、Llama Questions 83.8、Speech CMMLU 67.8 で首位に立つとしている。
• どちらも再現されていない。誰も検証していない公開表と、誰も確認できない未公開のA/Bは、異なる種類の未検証だ。どちらも、調達判断を下す根拠にできる証拠ではない。
Realtime-Venus の数値の中で唯一行う価値のある比較は、そのモデル自身のベースとの比較だ。MiniCPM-o 4.5 は Daily-Omni で 80.2 を報告しており、Realtime-Venus-Omni は 81.3 を報告している。適応元のモデルに対する1ポイントの向上は、そのモデルがすでに対応していたベンチマークにおいて、ポストトレーニングとランタイムの取り組みとしてはもっともらしい結果であり、「8つのうち6つで最高」という表現が単独で読ませる主張よりはるかに小さい主張だ。

ターンテイキングの問題——まさにそこが全二重の生きる場所だ
全二重はレイテンシの機能ではない。それは一連の振る舞いだ。沈黙が「考え中」なのか「話し終えた」なのかを見極めること、傍観者の会話と自分に話しかけている相手を聞き分けること、そして「mm-hm」を割り込みと見なさず、あいづちの間は静かにしていること。
SeedRealtimeのアプローチは、会話状態をネイティブにモデル化し、外部の音声活動検出器を完全に排除することにある。そのため、話者交替は音声ストリームに適用されるしきい値ではなく、ネットワーク内部で学習される振る舞いとなる。これはRealtime-Venusが取るのと同じアーキテクチャ上のコミットメントであり、両者は、誰が話すかを決めるために別個のコンポーネントを必要とするカスケードシステムに対置されている。
証拠が異なる点は、SeedRealtime の主張が大規模展開——数億人のユーザー、実際の部屋、実際の雑音——についてである一方、Realtime-Venus の主張はベンチマークについてだという点にある。Realtime-Venus-Audio の Full-Duplex-Bench v1.5 の結果——割り込みへの応答率 75%、あいづち下での継続率 97%、他者指向発話下で 88%、背景発話下で 86%、継続性において Gemini 3.1 Live と GPT-4o を上回る——は、この問題についてどちらのモデルが公表した中で最も直接的に関連する数値である。さらに、それらは完全に自己申告であり、あいづち下での 97% という継続率は、誰かが事実として引用する前に、もう一人の読み手による確認に値する際立った数字である。
それぞれがビルダーを残す場所
実務上のギャップは品質ではなく、オファーの形にある。
• SeedRealtime — Doubaoで無料で体験はできるが、統合は永遠にできない。「これはすごい」から「これを自分の製品に」へ至る道は存在しない。
• Realtime-Venus — ダウンロードして、ファインチューニングして、エアギャップ環境で実行して、あらゆるレイヤーを検査できる。その代償は、BF16 の 9B チェックポイント 2 つ分、それぞれ約 18 ギガバイトの重みに加えて、毎秒継続的に回り続けるストリーミングループ、つまり誰が呼び出そうとそうでなかろうと課金される GPU ノードだ。
• どちらにもホステッド版はない。どちらも、キーと半日があれば試せるというものではない。
その最後の点こそ、この2つのモデルが競合相手としてよりもペアとして有用である理由だ。両者を合わせることで、問題の両半分が解決済みであること——能力は機能し、重みは公開可能であること——を示す一方で、誰もまだそれらを組み合わせて、開発者が実際に呼び出せるものにはしていないことも示している。
多くのチームがすがりつく回避策があり、それが何をカバーし、何をカバーしないのかは明確にしておく価値があります。音声レイヤーが手に入らなくても、考える部分を構築することはできます。Realtime-Venusは、その高コストな処理——検索、難度の高い推論、ビジネスAPI呼び出し——を、非同期委譲マーカーを通じてバックグラウンドハーネスに委譲しており、その委譲される側は通常のテキスト推論です。OrcaRouterはRealtime-VenusもSeedRealtimeも扱っていません。どちらの双方向レイヤーも当社が提供する範囲外であり、当社はいずれもホストしていません。 1つのキーの背後に約200のテキストモデルを、プロバイダー定価のままマークアップなしで揃えることは、当社がカバーするアーキテクチャの半分です。自動フェイルオーバーを備えているため、あるアップストリームの一時的な不調でバックグラウンドタスクが失敗することはありません。複数のモデルを1回の呼び出しにまとめるためのルーティングDSL、そして単一モデルの判断では足りない場面で用いるモデル融合も含まれます。それはこうしたシステムの難しい部分ではありません。実際に購入できるのはそちらの部分なのです。

この比較を変えるものは何でしょうか?
それを決着させる3つの進展があり、そのいずれもまだ実現していない。Realtime-Venusの独立したベンチマークだ。第二の読み手のいない表は結果ではなく主張にすぎないからだ。SeedRealtimeのAPIだ。最も強い導入実績の証拠を持つモデルが、現時点では誰も使えないものになっているからだ。そしてどちらかからの公表されたレイテンシ値——time-to-first-audioはこのカテゴリが購入される際の決め手となる指標であり、本稿執筆時点でどちらのモデルもそれを示していない。
それまでは、正直にまとめれば、SeedRealtime は音声と映像の全二重通信が消費者規模で機能することの証拠であり、Realtime-Venus は重みをオープンにできることの証拠だが、どちらの事実もビルダーを製品の出荷に近づけるものではない。これはどちらのラボへの批判ではない。研究課題は解決したが、流通課題はまだ解決していないカテゴリーについての説明である。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
