
GPT-Live-1 vs SeedRealtime:SeedRealtimeはより野心的なモデルであり、購入することはできない
- deepseekNEWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 100万トークンあたり
- openaiNEWOpenAI: GPT-6 Astra2026-09-0453知能77コーディング
- googleNEWGoogle: Gemini 3.8 Flash2026-09-0241知能76コーディング
- qwenNEWQwen: Qwen3.8 Max (0902)2026-09-0240知能72コーディング
- anthropicNEWAnthropic: Claude Fable 5.12026-09-0153知能82コーディング
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100万トークンあたり
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642知能72コーディング
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 100万トークンあたり
- z-aiZ.ai: GLM 5.32026-08-1845知能75コーディング
- obsidianQwen3.8 27B2026-08-1534知能68コーディング
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236知能69コーディング
- grokSpaceXAI: Grok 4.62026-08-1244知能77コーディング
- metaMeta: Muse Spark 1.22026-08-0540知能72コーディング
- qwenQwen: Qwen3.8 Max2026-08-0340知能72コーディング
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135知能69コーディング
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2134知能69コーディング
GPT-Live-1とSeedRealtimeを能力面で比較すると、居心地の悪い答えが出る。なぜなら、この2つのモデルは同じ条件で競っているわけではないからだ。GPT-Live-1はOpenAIの全二重音声モデルで、2026年7月8日にChatGPT内で提供開始され、2026年9月10日にLive Sessions APIを通じて開発者に開放された。12種類の音声、公表された分単位の料金を備える一方、重大な穴が1つある。画像と動画の入力は明示的に対応していないのだ。ByteDanceのSeedチームが2026年8月5日にリリースしたSeedRealtimeは、まさにその穴を中心に作られている。見て、聞いて、話すことを単一のエンドツーエンドアーキテクチャで行うネイティブな音声視覚全二重モデルであり、利用できるのはDoubao消費者向けアプリ内のみで、公開APIもオープンウェイトも技術レポートも、公表されたパラメータ数もない。
それぞれが実際に知覚できるもの
そのギャップを最も明快に確かめる方法は、各モデルが自分が置かれている部屋について何を知っているかを尋ねることだ。
GPT-Live-1は聞き取る。それが入力面のすべてだ。音声とテキストが入り、音声とテキストが出てくる。そしてOpenAIのドキュメントでは、画像と動画は非対応とされている。「聞く」という行為に伴う会話の機微を極めて巧みに処理する——聞き続けるか、間を置くか、遮るか、ツールを呼び出すかを1秒に何度も判断し、全二重を維持するので、話している間も入ってくる音声を処理し続ける。さらに、音声と一緒に音声認識の文字起こしも返してくれる。これは統合作業を1週間節約してくれる類の、地味ながらありがたい細部だ。
SeedRealtimeは、パイプラインではなく単一のモデルで音声を聞き、映像を見る。ByteDanceは、音声・映像・テキストを一体として扱う統合アーキテクチャを説明している。これは視覚的な文脈によって曖昧さを解消する——同音異義語を区別し、場面、身振り、視線、直前の行動から「これ」が何を指すのかを理解し——知覚、理解、意思決定、表現を逐次的ではなく並列に実行する。ByteDanceが公開したデモには、モデルが声を人物のアイデンティティに結び付けなければならない騒がしいグループディナー、美術館の見学、エスプレッソのワークフローの修正、空港での妨害を抑制しながら画面外の記憶を保持しオンライン検索を行う例が含まれている。
• 入力 — GPT-Live-1 は音声とテキストのみで、画像と動画は明示的に非対応。一方、SeedRealtime は音声・動画・テキストを1つのモデルに融合
• ターンテイキング — GPT-Live-1 は毎秒何度も内部的に判断するのに対し、SeedRealtime はターンテイキングをモデル内部に移し、外部の音声活動検出器を完全に排除します
・主体的な振る舞い — GPT-Live-1 は応答・委任・ツール呼び出しを行うのに対し、SeedRealtime は対象オブジェクトが視界に入ると促されずとも自ら発言すると説明されている
• 可用性 — GPT-Live-1 は OpenAI の API で一般提供されており、1分あたり $0.05 であるのに対し、SeedRealtime は Doubao 内で無料で利用でき、API はなく、提供時期の予定もない

証拠の質は意欲とは逆方向に進む
ここから先は、その比較もByteDanceにとって好都合ではなくなる。
OpenAIは数値を公表している。それは自社独自のもので、競合他社とではなくGPT-Live-1をGPT-Realtime-2.1と比較したものであり、独立系の研究所による再現は行われていない——全二重インタラクティブ性は45.4%に対して80.1%、発話交代のレイテンシは1.4秒から0.8秒に短縮、ツール呼び出し精度は60%から87%へ。ベンダーが実施し再現されていないというのは確かな留保事項であり、少なくとも数値に紐づけられる留保事項ではある。
ByteDanceはほとんど何も公表していない。SeedRealtimeに関する中心的な主張は、ASR+視覚+TTSをカスケード接続したシステムと比べて、音声視覚的な会話テンポの問題を半減させるというエンドツーエンドの人間評価だ——文中で途切れることがより少なく、ポーズ後の返答が遅いことがより少なく、背景の雑談による誤作動がより少ない。サンプルサイズも、方法論も、改善幅の正確な数値も、レイテンシの数値すら一切ない。パラメータ数も技術レポートもない。
その結果、より興味深いアーキテクチャを持つモデルほど、最も評価しにくいものになる。それは、性能が劣っていると言うのと同じではない——デモは本当に際立っており、チャンク化された音声視覚入力とストリーミング生成に関する技術解説は、デモではなく実際のシステムであることをうかがわせる——しかし、それはつまり、この2つを品質で比較することは現時点では、文書化されたモデルと印象的な動画との比較だということだ。
APIギャップが些細なことではない理由
SeedRealtimeは、2026年8月5日以降、Doubao内で音声とビデオの両方において無料で完全に展開されている。Volcano EngineやBytePlusのエンドポイントはなく、有料プランも、公開されたクォータも、開発者アクセスを開放する時期についての明言もない。ByteDanceのロードマップでは、低遅延、より精度の高い話者追跡、ツール連携タスクに言及しているが、日付には言及していない。
さらに事態を悪化させるアクセス上の制約がある。Doubao は中国本土優先の製品で、登録には通常中国本土の携帯番号が必要であり、ローカライズされた英語版も発表されていない。中国国外のチームにとって、SeedRealtime は単に API として未ローンチなだけでなく、製品としても利用できない。
それを GPT-Live-1 自身の統合負担と突き合わせると、トレードオフが具体的になる。OpenAI の API は、人が驚くほど狭い。モデル ID が 1 つ、エンドポイントが v1/live/sessions の 1 つ、WebRTC トランスポートでデータチャネル上のイベント処理、そして Chat Completions、Responses、Realtime、Batch、ファインチューニングの各エンドポイントを経由する道はない。レート制限はリクエスト毎分ではなく、同時セッション数で表される — Tier 1 で 25、50、200、300、500 と増えていく — そして Free ティアではモデルを一切呼び出せない。それは新しい統合であり、それでも今日の午後から始められる統合だ。

同じ委任問題に対する2つの答え
どちらのモデルも、音声認識、言語モデル、音声合成が順に動作し、ターン間に約1.7秒の無音が生じる旧来のカスケード設計を拒否している。しかし、その拒否の仕方は異なり、その違いを見れば、どちらが電話通話向けに作られ、どちらが部屋向けに作られているかがわかる。
GPT-Live-1 は作業を垂直方向に分割する。高速な音声レイヤーが会話を担い、より重いもの——ウェブ検索、より深い推論、エージェント的な作業——は、会話が続く間に Responses API を通じて別の推論モデルへ引き渡される。OpenAI が公開した WebRTC の例では、そのバックエンドを GPT-5.6 Terra に接続している。その結果、思考を担う半分はトークン単位で課金される通常のテキストモデル呼び出しとなり、したがって音声レイヤーとは独立に選択し、交換し、ルーティングできるものになる。サポート窓口にとって、それは正しい形だ。音声がインターフェースであり、推論がプロダクトなのである。
SeedRealtimeはすべてをひとつのネットワークに収めている。だからこそ、ジェスチャーが文の途中にある最中にそれを参照できる。そして同じ理由で、これを分解することは不可能だ——推論を担う半分を差し替えることはできない。そんな半分は存在しないからだ。どこか別の場所で動かすこともできない。動かす場所がどこにもないからだ。
今日ボイスエージェントを構築しているなら、その違いが判断のすべてです。この2つのうち、アーキテクチャに組み込めるコンポーネントは片方だけです。OpenAIの委任の例におけるバックエンドであるGPT-5.6 Terraは、OrcaRouter経由で入力トークン100万あたり$2.00、出力トークン100万あたり$12.00で提供され、100万トークンのコンテキストと /v1/chat/completions および /v1/responses の両方が公開されています — さらに1つのキーで約190の他のモデルも利用できるため、ボイスエージェントの背後にある推論層を、音声パスに触れることなく分割し、価格を設定し、フェイルオーバーさせることができます。GPT-Live-1もSeedRealtimeもOrcaRouterでは提供されていません。これらは各ベンダーからの単一ソースであり、どのルーターもそれを変えることはできません。

何が答えを変えるだろうか
3つのこと、可能性の高い順に。
• ByteDanceの開発者向けAPI。SeedRealtimeがVolcano EngineまたはBytePlus上に公開料金付きで登場すれば、それはケーススタディではなくなり、真に差別化された製品になる——西側にはホスト型の競合が存在しない、音声・映像の全二重。それが注視すべきシグナルであり、まだ現れていない。
• ホスト型音声APIにビジョンが到来する。GPT-Live-1のドキュメントは、画像と動画がサポート対象外であることを明言しており、それは見落としというより、意図的な初回リリースの境界のように読める。もしOpenAIがChatGPTの別の場所で披露してきた動画サーフェスを提供すれば、SeedRealtimeを面白くしている能力ギャップは大幅に縮まる。
• SeedRealtimeに関するいかなる独立した測定。第三者のレイテンシ値やパラメータ数があれば、野心以外の何かで両者を比較できるようになる。
今すぐ構築する人にとっての実用的な結論は短い。GPT-Live-1 は、この2つのうちデプロイできる唯一のもので、秒単位で課金される1分あたり $0.05、12種類の音声、文書化されたエンドポイントを備えているため、会話音声の妥当なデフォルトだ。SeedRealtime はより興味深いモデルであり、より高性能である可能性も十分にある。ただし現時点では、顧客の前に出せる製品というよりも、音声と視覚が統合されたアーキテクチャがどのようなものかを示すデモンストレーションだ。これは「注視すべきもの」に分類し、「その上に構築すべきもの」には入れないこと。
