
HiDream-O1-Video-1.0、Artificial Analysisで6位に初登場 — そしてその公開APIはローンチ版よりはるかに小さい
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100万トークンあたり · 73 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952知能
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856知能
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100万トークンあたり · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238知能
- OpenAIOpenAI: GPT-6 Sol2026-09-2248知能
- AnthropicAnthropic: Claude Opus 5.52026-09-2258知能
- xAIGrok 4.72026-09-2146知能
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100万トークンあたり · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100万トークンあたり · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040知能
- OpenAIOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245知能76コーディング
- AnthropicAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100万トークンあたり · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり · 359 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100万トークンあたり · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
HiDream-O1-Video-1.0は、Artificial AnalysisのImage-to-Videoリーダーボードで6位にあり、生成動画1分あたり$5.80で、3,231票におけるEloは1,175です。これは開発元が発表した順位です——ただし、2026年9月17日付のHiDream.aiのローンチリリースでは4位とされていました。どちらの数字も正しく、それぞれ異なる事柄を表しています。リリースは発表当日にモデルが獲得していた順位を引用しており、その後ボードは変動しています。2026年10月10日にオーディオフィルターをオンにして確認すると、HiDream V1はMiniMax H3 Max、MiniMax H3、Vidu Q4 Preview、Omni Flash、Dreamina Seedance 2.0 720pの後ろに、この順で位置しています。
より興味深いのは順位ではない。HiDream-O1-Video-1.0 は、テキスト、画像、動画を入力として受け取り、5~20秒の1080p映像をネイティブに同期した音声付きで返すモデルとして発表された——そして、今日実際に呼び出せるのは、たった1枚の参照画像と任意のテキストプロンプトだけを取り、それ以外には何も取らない。これらの記述はどちらも文書化されている。両者の間のギャップこそ、このモデルを基盤に構築する前に知っておく価値があるものだ。
取締役会を正しく読み解く
Artificial Analysisは動画リーダーボードをティア別に運営しており、各ティアには独自のEloスケールと独自の投票プールがあるため、スコアはティア間で移行できません。音声を残したAA-Video-I2V v1.0では、上位6モデルは20 Eloポイント差で分かれており、信頼区間の幅は7~10ポイントです。2026年10月10日時点のその上位6は次のとおりです:
• MiniMax H3 Max — 5,894サンプルで1,195 ±9、2026年8月、$4.80/分
• MiniMax H3 — 7,284サンプルで1,181 ±8、2026年7月、$7.80/分
• Vidu Q4 Preview — 5,543サンプルで1,179 ±10、2026年10月、$5.04/分
• Gemini Omni Flash — 12,327件のサンプルで1,178 ±7、2026年5月、$6.00/分
• Dreamina Seedance 2.0 720p — 15,721サンプルで1,176 ±7、2026年3月、$9.07
• HiDream-O1-Video-1.0 — 3,231サンプルで1,175 ±10、2026年8月、$5.80/分
これらの区間をひとまとまりとして読めば、正直な要約はこうだ。1位から6位は統計的には、同点の非常に長い裾を伴う一つの争いにすぎない。問題のギャップはない——ノイズの内側には。本当のギャップはHiDream V1とその他の集団との間にこそある。7位、アリババのWan 3.0は1,164で、6位より11ポイント、区間まるごと一つ分低く、それより300票近く先行している。HiDream自身のサンプル数はそのトップ6の中で最小であり、つまりその区間は最も広い部類に入り、その順位も最も確定していない。

Artificial Analysis がボード自体について述べている2つの点は、引き継いでおく価値がある。過去30日間に追加されたモデルとして記録されているのは1つだけで、AA-Video-I2V v2.0 が登場予定であり、AA-Video-T2V v2.0 の分類体系に沿って、全体を通して1080pになると述べている。これは、1080p とテキストおよび動画の条件付けに関するローンチ時の主張を持つモデルにとって重要だ。それが初登場するボードは明示的に過渡的なものであり、後継版は測定対象を変える。
モデルがそうでないところ
HiDream-O1-Video-1.0 は、Artificial Analysis の動画ボードのうちちょうど 1 つにのみ掲載されています。テキストから動画のボードである AA-Video-T2V v2.0 にも、動画編集のボードにも掲載されていません。2026 年 10 月 10 日に両方を確認しました — Wan 3.0 はテキストから動画で 1,156、動画編集で 1,157 と首位、FLUX 3 はテキストから動画で 1,128 の 6 位、HiDream はどちらのランキングにも一切登場しません。
その不在は失格ではなくシグナルである。参照画像を消費するだけのモデルはテキストから動画への投票には参加できず、アニメーション化しかできないモデルは編集の比較には参加できない。実務上の帰結として、HiDream V1がテキストから動画へ、あるいは動画編集を行っている様子を独立に測定したものは存在せず、これはまさにそのローンチリリースが宣伝する3つの入力モードのうち2つなのである。
2つの日付、そしてその間の90日間
これらの数字を引用する人は誰でも慎重に扱うべき、日付にまつわる厄介な点がある。Artificial Analysisは、HiDream-O1-Video-1.0のリリース日を2026年8月28日、ボードに導入された日を2026年9月10日として記録している。HiDream自身のローンチ発表は9月17日付だ。その後登場した第三者によるモデル参照では、9月15日に公開され、9月17日に検証されたと記述されている。
そのパターンが示しているのは、プレスリリースより先に評価パイプラインに到達したモデルだ——十分ありふれたことであり、つまり掲載ボード上のリリース日は二つのうち早い方なのであって、誤りではない。それは、3月のモデルが8月に再発表されるという事態を指しているのではない。このブログが以前に痛い目を見た失敗パターンはそちらである。HiDream-O1-Video-1.0 は本当に新しい。リーダーボードの基盤自体が、その登場をここ二か月以内と記録している。
ローンチが主張していること、そしてそう述べているのは誰か
アーキテクチャに関する説明はHiDreamによるもので、独立した再現は行われていません。ベンダーによると:HiDream-O1-Video-1.0 — HiDream V1、またはHD-V1 — は、映像を生成して後から音を加えるのではなく、テキスト、映像、音声を1つの生成プロセス内で共同モデリングするため、唇の動き、環境音、身体的動作が同じタイムラインを共有します。尺は固定ではなく計画され、モデルは記述された出来事に応じて5秒から20秒の間で長さを選びます。物理的挙動 — 重力、衝突、慣性、変形、光の減衰 — は生成制約として訓練に組み込まれています。ポストトレーニングでは、人間の知覚に整合したマルチモーダル報酬モデルに対して拡散強化学習を用います。生成は3段階で実行され、同社は「第1に計画、第2に共同生成、第3にアラインメント」と説明しています。
HiDreamは、このモデルを、共有された統合トランスフォーマー基盤上に構築された4ファミリーのポートフォリオの中に位置づけている。すなわち、HiDream-O1-Image、HiDream-O1-Video、HiDream-O1-World、HiDream-O1-Embodiedであり、同ファミリーの兄弟モデルについて過去のベンチマーク順位も挙げている。たとえば、HiDream-O1-Image 1.5がArtificial Analysisのテキストtoイメージリーダーボードで世界2位、HiDream-O1-WorldがWBenchで1位である。これらはファミリー内の他のモデルに関するベンダーの数値であり、ここでは独立した確認なしに述べられている。同社の企業資料はまた、「2,000億を超える」パラメータの基盤モデル技術スタックについても述べているが、それはプラットフォームレベルの記述であり、HiDream-O1-Video-1.0の仕様ではなく、このチェックポイントのパラメータ数を公表している情報源はない。これについてオープンウェイトは公開されていない。

実際に何と呼べるか
ここではドキュメントは異例なほど明確で、発表内容より範囲が狭い。HiDream は自社の MaaS プラットフォームである HiHarness を通じてこのモデルを提供している。動画エンドポイントは/api/maas/gw/v1/videos/generations への POST で、モデル識別子はHiDream-O1-Video-1.0。必須入力は参照画像ちょうど1枚で、公開 URL、または data-URL プレフィックスなしの Base64、サイズは 40 KB から 20 MB まで。テキストプロンプトは任意で、デフォルトは空。生成は非同期である。送信すると、task_id を受け取り、/api/maas/gw/v1/videos/generations/results をresult.status が 1 を示すまでポーリングする。
そのスキーマにおける3つの省略は、明示的に名指しする価値がある。というのも、それぞれがローンチリリースの宣伝している機能だからだ。
• 参照動画 — 発表ではモデルの入力の一つとして動画が挙げられているが、ドキュメント化されたリクエストにはそのためのフィールドがない。
• 明示的な解像度 — 発表では1080pと謳われていますが、ドキュメントに記載された仕様には解像度の選択肢がなく、代わりに結果は参照画像のアスペクト比を保持します。
• 音声制御 — 発表ではネイティブの同期オーディオを謳っているが、文書化されたリクエストには音声入力や音声生成のパラメータが一切公開されていない。
スキーマが公開しているのはforce_10s、デフォルトが false のブール値です。false のままにすると、モデルが継続時間を選びます。true に設定すると、10 秒になります。数値の継続時間フィールドは存在しないため、宣伝されている 5~20 秒の範囲はモデルレベルの主張であり、公開リクエストサーフェスでは 2 つのモードのいずれかを選ぶ以外に操作できません。

そのレスポンス契約には、他の動画APIをパターンマッチングで書かれた統合を痛い目に合わせる実装上の詳細が1つあります。result.status = 1 は、すべてのサブタスクが終端状態に達したことを意味するのであって、生成が成功したという意味ではありません。まだ sub_task_results[].task_status を読む必要があり、そこでは 1 が成功、3 が生成失敗、4 が安全審査の失敗です。終端状態を成功とみなすクライアントには、存在しない動画URLが渡されることになります。
文脈における価格
Artificial Analysisの記録では1分あたり$5.80で、HiDream V1はその価格帯では安いというより中価格帯だ。リーダーボードのトップ6以内では、MiniMax H3($7.80)とDreamina Seedance 2.0($9.07)より安く、MiniMax H3 MaxとVidu Q4 Previewより高い。最も頻繁に比較されるモデルと比べると、その差はさらに大きい:Google Veo 3.1は1分あたり$24.00、Kling 3.0 1080p Proは$20.16、Alibaba Wan 2.7は$9.00、Wan 3.0は$12.00で、一方Grok Imagine Video 1.5は$8.40である。
それらの分単位の料金は、そのまま比較できるものではありません。というのも、出力1分がどの解像度で、どの音声を伴うものなのかという点こそ、このモデルについてAPIドキュメントが明示していない、まさにその点だからです。この数値は料金表としてではなく、自分で計算するための出発点として扱ってください。
未証明の道を、パイプラインをそれに賭けることなく試す
ここで慎重になるべき理由は、モデルが悪いからではありません。そうではなく、プレビュー期の配信サーフェス——入力タイプが1つ、durationの切り替えが1つ、2状態のターミナルフラグ——は、本番パスをハードコードする場所としてはふさわしくない、ということです。HiDream-O1-Video-1.0 は現在 OrcaRouter が提供しているモデルではないため、以下はそれをホスティングすることについての主張ではありません。当社の製品が本当に役立つのは意思決定の反対側、つまり新しい動画ルートを既存のルートと比較してテストし、いつでもそこから離脱できるようにしたい場面です。200以上のモデルに対応する1つのOpenAI互換エンドポイント、静かに失敗し始めたルートをそのまま出荷せずに済む自動フェイルオーバー、プロバイダーの定価をマークアップなしでそのまま通す仕組み、そして2つの統合ではなく1つのリクエスト内で2つのモデルを比較できるルーティングDSL。そのどれも、HiDreamのモデルに固有のものではありません。
何がこのピースを変えるでしょうか?
三つの進展が事態を動かすだろう。可能性の高い順に挙げると。
まず、より広いサービング契約です。HiHarnessが参照動画フィールド、解像度セレクター、または文書化されたオーディオコントロールを追加すれば、発表とAPIの間のギャップは埋まり、1080pおよびtext-to-videoの主張は検証可能になります。それはモデルの変更ではなくドキュメントの変更であり、どの週にでも実装され得ます。
次に、AA-Video-I2V v2.0 ボードです。Artificial Analysis はそれが登場すると述べており、T2V v2.0 の分類体系に沿い、全体を通して 1080p です。1080p 専用のボードは、HiDream V1 の解像度に関する主張が意味を持つ最初の独立した環境となるでしょう——そして、もしそのモデルが新しい分類体系の下でもテキストから動画へのボードに依然として登録できないのであれば、そこでの不在は、旧来のカテゴリの産物ではなく、実質的な発見となります。
第三に、サンプル数。3,231票は実際の測定値であり、しかも新しいもので、上位6つの中では最も薄い。区間は現在±10で、有権者がどちらへ押し動かすにせよ、今後狭まっていく。「6位」を確定した事実として引用する人は、それを読んだ日付を添えるべきだ。なぜなら6位は、6者同率のうちの1つにすぎないからだ。
残しておく価値のある問いは、HiDream-O1-Video-1.0 が競争力を持つかどうかではない — 測定できる唯一のボード上では、それは明らかに競争力を持ち、しかも正当化できる1分あたりの価格にある。問いは、最終的に広く使われる API に到達するモデルが、発表された当のモデルなのかどうかである。現在のドキュメントを見る限り、それらは依然として2つの異なる製品だ。
HiDream-O1-Video-1.0は現在当社が提供しているルートの一つではありませんが、同種の機能は200以上のモデルの背後にあり、プロバイダーの定価がそのまま適用され、上乗せは一切ありません。
