
Visko Orbis 1.0: 生成途中で方向転換できるリアルタイム4K動画生成
- AlibabaNEWQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiNEWZ.ai: GLM 5.3 Flash2026-08-2658知能72コーディング
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1860知能75コーディング
- obsidianQwen3.8 27B2026-08-1552知能68コーディング
- qwenQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1253知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1261知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
Visko Orbis 1.0は、ビデオを完成させてファイルを渡すような製品ではありません。プロンプトを与えた瞬間にシーンのストリーミングを開始し、生成を続けます。そして新しいプロンプトを入力すると、ストリームの途中で周囲のシーンが変化します。再起動もローディングバーもありません。その背景にあるサニーベールのスタートアップViskoは、この新しい種類のシステムを「ライブモデル」と呼んでおり、Orbisはその最初の製品です。同社は2026年9月1日に、visko.aiでの一般公開、arXivへのテクニカルレポート掲載、Llama Venturesが主導する1000万ドルのプレシードラウンドを同時に発表してデビューしました。Orbisは登場から1日しか経っていないため、以下のベンチマーク数値は、独立した誰かが実行するまではVisko自身によるものです。
注目すべき理由は、Orbisがすでに呼び出せるビデオモデルより優れているからではない。それを証明した者はまだいない。Orbisは別のカテゴリーに属するからだ。現在出荷されている主要なビデオ生成ツールは、OpenAIのSora 2 ProからGoogleのVeo 3.1、Kling 3.0に至るまで、すべてViskoが「クエリモデル」と呼ぶものだ。つまり、プロンプトを送り、レンダリングを待ち、完成したクリップを得る。Orbisはレンダリングするのではなく、実行する。ビデオを常に進行中のものとして扱い、その進行中に話しかけることを可能にする。
「live」が実際に意味するもの
Viskoの考え方では、クエリモデルには内部クロックもメモリもないため、生成シーケンスが長く続くほど、アーティファクト、壊れた物理演算、色ずれなどが発生して崩れていく。Orbisは世界を維持するために構築されている。ストリーム全体にわたって永続的な内部状態を保持するので、被写体、シーン、スタイルがチャンクからチャンクへと安定して保たれる。Viskoのテストによれば、長い拡散ロールアウトで知られる品質や色の劣化なしに、1時間以上シーンを一貫して維持できるという。
その設計から、2つの機能が導き出される。1つ目は、生成途中のプロンプト編集だ。生成の実行中にプロンプトを追加、変更、切り替えることができ、Viskoによれば、出力は平均1秒未満で変更を反映するという。つまり、再起動するのではなく、その周囲の世界が更新される。2つ目は、連続性だ。モデルはチャンクやセッションをまたいで被写体、シーン、スタイルを保持するため、長編形式の生成がそもそも可能になる。
今すぐそれでできること
Orbisは4つの公開モードを備えて登場する。そのリストを見れば、クリップ生成ツールとの違いは一目瞭然だ。「Choose What Happens Next」は、ストーリーの途中で分岐の選択肢を提示する。「Speak It, See It」は、読み上げたナレーションを取り込み、読み進めるのに合わせてシーンをリアルタイムで描画する。「Train and Test Robots」は、生成された世界にロボットを投入し、本番の前に練習させる。「Freeform Playground」は、テキスト、または画像とテキストの説明から、ワールドをゼロから生成する。その下には、バーチャルバンド、カンフーの庭、軌道上で作業する宇宙飛行士、ライブ配信モードなど、さらに長いサンプルワールドの列が続く。それぞれが、レンダリング済みのファイルではなく、操作しながら展開する実行中のシーンだ。
• 出力 — 4Kビデオ、24 FPS、リアルタイムストリーミング(ベンダー報告)。
• 所要時間 — 時間スケールでの生成が主張されており、明らかな品質や色のドリフトはない(ベンダー報告による)。
• 入力 — 長文テキストからの動画生成、画像からの動画生成、動画の継続;多言語プロンプト;生成途中でのプロンプト切り替え。
• インタラクティブ性 — いつでも再プロンプトが可能。Viskoは平均1秒未満で更新を報告します。
• メモリ — 制限付きマルチスケールメモリが、チャンクをまたいで被写体・シーン・スタイルを保持します。
• 物理 — 潜在世界モデルが推論時に候補となる未来をスコアリングし、出力を物理的に妥当な動きへと導く。
仕組み
Orbisは、ニューラル確率微分方程式(Neural SDEs)を基盤として構築されています。これは、モデルが単一の個別クリップを処理するのではなく、出力を時間の経過とともに連続的に進化させるアーキテクチャです。知覚、記憶、物理トークンから成る統合潜在空間の中で、内部の「ワールドクロック」に基づいて動作します。つまり、モデルが現在何を見ているか、何を記憶しているか、そして物理法則が次に何を起こすべきかという、進行中の記録です。
生成はストリーミング方式で行われ、拡散モデルのデノイジングというよりは、LLMの次トークン予測に近い。モデルは最初のフレームを完成させるとそれを送り出し、それまでに生成されたすべてを条件として次のフレームを生成する。蒸留されたチャンク単位のストリーミング生成器がベースストリームを処理し、ストリーミング動画アップスケーラーがそれを4Kに引き上げる。これらはすべて、Viskoによればリアルタイムで追従し続ける最適化済みGPUサービングエンジンによって処理される。
その背後にいるのは誰か
公開からわずか1日というモデルにとって、チームは重要だ。Viskoは2025年、スタンフォード大学で計算数学と力学の博士号を取得し、Appleで3年間研究者として過ごしたQing (Will) Yinによって設立された。16人のチームはApple、Google DeepMind、Meta、Amazon、Tesla出身者で構成され、諮問委員会はUCバークレーのMichael I. Jordanが委員長を務めている。その経歴は発表の背後にある真の信用力だ——そしてそれでも、独立した評価の代わりにはならない。
これまでの数字 ―― そして、それらをどの程度信頼できるか
Viskoの技術報告書『Visko Orbis 1.0: A Live Model for Real-Time Interactive Long Video Generation』(arXiv: 2607.26694)は、具体的な一連の主張を行っている。美的品質と技術的品質を評価する確立された指標であるDOVERでは、Orbis 1.0は比較対象となったリアルタイムおよび長時間動画システムの中で首位に立つ。視覚品質とモーション品質の指標であるVideoAlignでも、第1位となっている。さらに、8つのシステムを対象とした長時間動画の人間選好Arenaスタディにおいて、Viskoは、同モデルが全体的な選好と時間的安定性の評価で最高評価を得たと報告している。比較対象にはOdysseyのOdyssey-2が含まれており、ViskoはOrbisがこれらのベンチマークでOdyssey-2を上回ると述べている。

来歴を正しく押さえておこう。それらの数字はすべてVisko自身のもので、モデル発表と同日に公表された。独立した研究所や中立的なリーダーボードは、まだOrbisを評価したことがない。報告書の長所として、Orbisが他のシステムに劣る側面も開示している点は評価できる——大多数の発表当日レポートより踏み込んでいる——だが、自己評価は出発点であって、スコアではない。今日の時点で、OrbisのLMArenaやArtificial Analysisのエントリーは存在しない。これは昨日発表されたモデルとしては正常なことであり、今のところ「有望だが、実証されていない」というのが公正な評価である理由もまさにそこにある。

上記のレポートは、Orbisの主要な主張に対する証拠記録の全体です。ベンチマーク数値はその文書内に存在し、その文書はベンダー自身のものです。
アクセス、コスト、そして正直な未知数
Orbisは本日から2つの方法で試せます。Viskoはvisko.aiで一般公開を開始しました。モデルページではサンプルワールドのキューを備えたライブデモが実行され、Freeform Playgroundではテキストまたは画像+テキストの入力を受け付けます。レポートの配布ノートによると、OrbisはViskoのパートナーであるReactorからも利用可能で、ReactorはサンドボックスとAPIを備えたダイナミック版と安定版の両方を提供しています。開発者が注目するのはそのAPIです。モデルをただ眺めるだけでなく、その上に構築するための最初の本格的な手段となるからです。

上記のモデルページが、現時点で公開されているすべてです。デモカードとプレイグラウンドがあり、価格表示はどこにもありません。
まだ存在しないのは価格だ。ViskoはOrbisについて、秒単位・分単位・サブスクリプション型のいずれの料金も発表しておらず、自社サイトにも販売パートナーのサイトにも記載がない。アナリストの反応もまさにこの点を指摘している。Constellation ResearchのHolger Mueller氏はViskoの取り組みを「非常に有望」と評価する一方で、継続的なダイナミック生成は「安くはならないだろう」と述べた。その裏付けとなるのがコンピューティングコストの現実だ。24FPSの4Kを無期限にストリーミングし続ける場合と、10秒のクリップを一度だけレンダリングする場合とでは、コスト曲線が根本的に異なる。
公開されたばかりで価格も独立した評価数値もないモデルを試す賢明な方法は、実績のないモデル全般と同様、本番パスではなくテストトラフィックを使うことです。プロバイダーがOrbisをリストしたなら、まさにそれがルーティング層の役割です。プロンプトをOrbisに向け、同じエンドポイントに実績のあるフォールバックを維持し、新しいモデルが停止したり逸脱したりした場合は、自動フェイルオーバーで信頼できるモデルに切り替えます。OrcaRouterは、200以上のモデルを単一のAPIで運用し、プロバイダーのリスト価格を0%マークアップでそのまま通します。そのため、いずれかのモデルの値下げは、ベンダーが発表した当日にこちらでも反映されます。ちなみに、OrcaRouterはまだVisko Orbis 1.0をホストもルーティングもしていません。これはVisko自身のサイトと販売パートナー経由で提供されます。そして上記のパススルー方式が、プロバイダーがリストした瞬間に適用される計算です。
誰が気にするべきか
Orbisを視聴する正当な理由があるのは、3つの視聴者層だ。まず、ロボティクスとシミュレーションのチーム。デモ一覧には、生成されたワールド内でのロボットのトレーニングとテストが含まれており、ViskoはOrbisを、実際にセットアップするには危険または費用がかかるトレーニング映像を生成する手段として売り込む——すなわち、自動運転車や人型ロボットのコーナーケースだ。これは、世界モデルを手がける新興スタートアップの波が同様に行っている売り込みであり、Orbisはまだ初期段階だが、そのために構築されている。次に、ゲームおよびインタラクティブメディアの開発者だ。なぜなら、生成され続け、リアルタイムで入力に反応するワールドは、クリップツールではなく、レンダリングバックエンドだからだ。三番目は、ユーザーの前でライブAI映像を運用するすべての人——ライブコマース、バーチャルインフルエンサー、教育など——だ。そこでは、ストリームをライブで操ることが製品そのものとなる。
そして待つべき対象とは、「クリップをレンダリングし、編集し、納品する」というワークフローを持つ人々です。Orbisのストリーミングパラダイムは、バッチ動画生成とは異なる問題を解決します。そして、価格とAPIの条件が公開されるまで、常時稼働するストリームのコストは未知数であり、あなたがそれを負担すべきではありません。
次に見るもの
このデビュー作を、計画を立てる際の基準となるモデルにするには、三つのことが必要になる。まず、独立した評価を得ることだ。つまり、LMArenaやArtificial Analysisに掲載されるか、DOVERとVideoAlignの主張を第三者が再現するかである。次に、価格設定が公表されること。これにより、「レンダリングではなく実行する」という製品が、研究チームや資金提供を受けたスタートアップ以外にも手が届くものになるかが決まる。最後に、スケールでの実証である。Visko自身の報告書も、メモリ構造の設計、トレーニングデータ内の詳細なアクション記述、スケーリングは未解決の作業であると明言している。したがって、その1時間規模の主張は、売り手ではない誰かが検証すべきものなのである。
現時点でVisko Orbis 1.0は、まだ公平に評価できないビデオモデルとして最も興味深い——真に新しいアーキテクチャであり、公の歴史はわずか1日、そして第三者による検証を待つ、印象的な自己申告の数値群を備えている。
