2026年9月2日付のQwen3.8 Maxのスナップショット。Alibabaのフラッグシップ・マルチモーダル推論モデル:テキスト+画像+動画の入力、テキスト出力、100万トークンのコンテキスト。機能と価格はベースモデルと同じです。再現性のある動作のためにピン留めしてください。
Qwen3.8 Max(0902)は、プロバイダーqwenによるOrcaRouter上のモデルエントリであり、モデルID qwen/qwen3.8-max-0902で公開されています。リスト表示では0902という表記が示されていますが、提供された情報では、これがリリース日、チェックポイント、またはリビジョンラベルのいずれを意味するのかは説明されていません。これは長文脈マルチモーダルモデルであり、テ…
このモデルは、1,000,000トークンのコンテキストウィンドウをサポートしています。これは、モデルが1回のリクエストで参照できる入力の総量であり、プロンプト内のテキスト、画像、ビデオコンテンツを含みます。事実情報にはこれ以上の制限は記載されていないため、実際の制限は、OrcaRouterとプロバイダーがトークン化とリクエストタイムアウトをどのように適用するかによって異なります。長いテキストの場合、1,000,000トークンあれば、多数の大きなドキュメントを単一のプロンプトに含めることができ、モデルを呼び出す前にチャンク分割や要約を行う必要性が減ります。ビデオについては、事実情報には1秒あたり、1フレームあたり、またはビデオファイルごとに消費されるトークン数は記載されていないため、メタデータやテスト呼び出しから推定する必要があります。また、コンテキストウィンドウのサイズは、1,000,000トークンのプロンプトに対するモデルの正確性を示すものではないことも覚えておくことが重要です。ベンチマークデータは提供されていません。アプリケーションが正確な長コンテキスト品質を必要とする場合は、本番環境に移行する前に、独自のドキュメントのサンプルで評価してください。
テキスト、画像、動画を入力として受け付けるこのモデルは、同じリクエスト内でこれらのタイプを組み合わせたソース資料に対して推論を行うよう求められます。例としては、テキストで指示を読み、画像を調べ、回答を生成する際に動画を参照するといったケースが挙げられます。プロバイダーのファクトシートには、OCR、物体検出、時間的な動画推論などのタスク固有の能力は記載されていないため、そうした動作を想定すべきではありません。モデルに期待できることは主にその学習済みの能力に依存しますが、提供された事実には文書化されていません。安全な設計は、マルチモーダルのプロンプトからテキスト出力を求め、画像や動画を入力トークンとして保存するコストを許容できるタスクに使用することです。ワークロードがテキストのみの場合は、画像や動画の入力を持たない別のモデルの方がよりシンプルかもしれません。タスクが正確なタイムスタンプレベルの動画操作を必要とする場合、モデルカードにはそうした動作が信頼できるかどうかの根拠は示されていません。
タスクがこのモデルの特徴を必要としない場合、より安価なモデルを選ぶのが合理的です。短いテキストの質問に、1,000,000トークンのコンテキストや131,072トークンの出力上限は不要です。テキストのみのワークフローには、画像や動画の入力も不要です。OrcaRouterはこのモデルを、入力1,000,000トークンごとに$2.00、出力1,000,000トークンごとに$6.00で課金します。より安価な代替モデルがトークン単価が低く、コンテキスト長とモダリティ対応が十分であれば、コストを削減できます。提供された事実には品質や速度のベンチマークがないため、測定された精度でこのモデルを他のモデルより選ぶことは正当化できません。正当化できるのは、明示的な製品要件がある場合、つまり大きなコンテキスト、テキスト・画像・動画の混在入力、または1回の生成での長い出力が必要な場合です。入力価格はコンテキスト内のすべてのトークンに適用されるので、ユーザーの質問が短くても、コンテキストが非常に大きい呼び出しは小さな呼び出しよりもコストが高くなることがあります。プロンプトにパディングを追加しないようにしてください。
提供されているQwen3.8 Max (0902)のモデル情報には、ベンチマークスコア、評価セット、精度の数値は含まれていません。そのため、モデルの品質に関するいかなる記述も推測に過ぎず、OrcaRouterは推定スコアを公開していません。候補を比較するための数値が必要な場合は、送信を予定している画像や動画のケースを含む代表的な入力を用いて、ご自身でテストを実行してください。公開知識テストなどのベンチマークでは、特定の1,000,000トークンの動画プロンプトをモデルがどの程度うまく処理できるかはわかりません。Maxのようなモデル名はラベルに過ぎず、品質の証拠ではないことに留意してください。このリストで測定可能な項目は、コンテキストウィンドウ、最大出力長、入力モダリティ、価格です。これらの属性はワークロードが適合するかどうかに影響しますが、精度、推論の深さ、指示追従、安全性の動作を説明するものではありません。評価を実施しない限り、これらの領域における能力は未検証として扱ってください。
モデルのファクトには、1秒あたりのトークン数、最初のトークンまでの時間、リクエストのタイムアウトに関するガイダンス、その他のパフォーマンス測定値は含まれていません。OrcaRouterは、このプロバイダーモデルについてレイテンシーの数値を主張していません。速度は、プロバイダーのサーバーインフラストラクチャ、入力のサイズ、および要求された出力の量に依存します。1,000,000トークンの入力と131,072トークンの出力は、短いリクエストよりも時間がかかる可能性がありますが、リストには正確な関係は示されていません。ビデオ入力は、モデルが処理する前にトークンに変換する必要があるため、レイテンシーを悪化させることもあります。ファクトはそのステップを定量化していません。レビューアーは、トークンあたりの低価格が高速なデコードを意味すると想定すべきではありません。ファクトによってサポートされる速度関連の唯一の決定は、想定される負荷の下で代表的なリクエストサイズをテストすることです。コンテキストウィンドウのサイズやモデル名からリアルタイム適合性を推測しないでください。
提示された強みは構造的なものです。このモデルは、1,000,000トークンのコンテキストウィンドウ、高い131,072トークンの最大出力を備え、テキスト、画像、ビデオの入力を受け付けます。これらは、長い応答を書く前に、1回のモデル呼び出しで大量または混合された資料を観察する必要があるアプリケーションに役立ちます。制限事項も、強みよりも事実から述べる方が容易です。公開された品質ベンチマークがないため、精度、推論、安全性は文書化されていません。0902ラベルの背後にあるトレーニングデータ、リリースノート、または更新方法論の個別のリストはありません。画像およびビデオ入力は、正確な視覚的または時間的理解を保証するものではありません。コンテキストと出力の制限は最大値であり、推奨される使用法ではありません。非常に大きな出力は、1,000,000出力トークンあたり$6.00で高額になる可能性があります。1,000,000トークンのコンテキストを埋めるリクエストは、出力が生成される前に$2.00の入力トークンを消費することになり、これは無視できない運用コストです。
記載のユニット料金は、入力トークン100万件ごとに2.00ドル、出力トークン100万件ごとに6.00ドルです。OrcaRouterは、プロバイダー料金をマークアップなしでモデルに請求します。つまり、表示された価格はプロバイダー料金がそのまま適用されたものです。入力トークンには、プロンプトで送信されるテキスト、画像、およびビデオの各トークンが含まれます。出力トークンは、生成された応答トークンです。この料金では、入力トークン100万件あたり2.00ドル、出力トークン100万件あたり6.00ドルかかります。より小規模なリクエストでは、それに比例してコストが下がります。たとえば、入力トークン10万件なら0.20ドル、出力トークン10万件なら0.60ドルです(これらの数量がプロバイダーによって測定された場合)。モデルカードには、キャッシュされた入力、バッチリクエスト、またはインタラクティブティア向けの個別料金は記載されていないため、そのような価格を想定しないでください。請求される正確なトークン数は、各コールのOrcaRouterの使用状況レスポンスまたはログで確認してください。
OrcaRouterが、あるモデルがプロバイダー料金で請求され、マークアップがゼロであると示す場合、それはOrcaRouterがこのリスティングについて、プロバイダー料金に独自のトークン単位の手数料を上乗せしていないことを意味します。したがって、トークン使用量に対する最終的な金額は、記載されている100万トークンあたりの入力価格$2.00、出力価格$6.00に基づくべきです。これは必ずしも最終的な請求書に他の料金が発生しないことを意味するわけではなく、契約条件によっては税金やアカウントレベルの手数料が適用される可能性がありますが、これらの事実にはそのような手数料は記載されていません。また、モデルの提供が無料であることを意味するものでもなく、トークン単位の料金は依然として適用されます。プロバイダーを比較する際、OrcaRouterがこのモデルについて表示する価格は、このリスティングと同じ単位を表しているはずです。別のゲートウェイが異なる価格を提示した場合、その差は請求体系の違いであり、モデルのコンテキストウィンドウが変わったことを示すものではありません。
コスト管理はプロンプトの長さから始めるべきです。入力は100万トークンあたり2.00ドルなので、トークンが1つ増えるごとに入力料金が加算され、リクエストで送信される画像や動画は、このリストには記載されていないルールでトークンに変換されます。関連性のないソース資料を削ればコストを削減できます。出力は入力単価の3倍であるため、要求する出力長を制限することもコスト管理につながります。131,072トークンの出力制限を持つモデルは、費用のかかるレスポンスを生成できます。100万トークンあたり6.00ドルで計算すると、131,072出力トークンは出力トークンだけで約0.79ドルになります。それだけのトークンを生成するのは自動ではなく、プロンプトがレスポンスのサイズを制御します。このモデルにはキャッシュ価格が公開されていないため、繰り返しのコンテキストが割引されるとは想定しないでください。事実にキャッシュやバッチ価格が記載されていないことは、そのようなオプションが存在しない証拠ではなく、単にこのリストに含まれていないことを意味します。
Qwen3.8 Max (0902) は、OrcaRouter の OpenAI 互換 API を通じて公開されています。クライアントのベース URL を https://api.orcarouter.ai/v1 に設定し、モデル ID は正確に qwen/qwen3.8-max-0902 を使用してください。OpenAI 互換の SDK を使用する場合、リクエスト構造は通常の chat-completions 呼び出しと基本的に同じです。OrcaRouter 用の API キー、上記のベース URL、およびモデル ID をボディに渡します。Qwen3.8 Max や qwen3.8 のような一般的な名前は使用しないでください。リストには qwen/qwen3.8-max-0902 が必要です。同じモデル ID をベース URL への直接の HTTP リクエストでも使用する必要があります。その場合、パスとペイロードは OrcaRouter によって公開されている OpenAI 互換の契約に従います。OpenAI 互換であるため、OpenAI の chat completions 用に書かれた既存のコードは、通常、base_url と model パラメータを変更するだけで移行できます。ただし、認証の詳細は OrcaRouter の要件に一致させる必要があります。
OpenAI互換のチャット完了において、モデル、メッセージ、出力トークン上限などのパラメータは、他の互換モデルと同様に処理されます。ファクトによると最大出力は131,072トークンであるため、出力上限を設定する場合は131,072以下にする必要があります。デフォルトの出力上限はファクトに記載されていません。温度、top-p、stop、その他のサンプリングパラメータは提供されたモデルファクトに文書化されていないため、OrcaRouterのAPIドキュメントと標準的なOpenAIパラメータのセマンティクスに従ってください。画像および動画入力には、OrcaRouterのAPIが期待するマルチモーダルコンテンツ形式を使用してください。ファクトにはサンプルは提供されていません。APIがサポートされていないパラメータ名に関するエラーを返した場合は、SDKがレガシーパラメータを送信していないか確認してください。コンテキストウィンドウは1,000,000トークンであるため、プロンプトは画像トークンと動画トークンを含むすべての入力トークンをその制限未満に保つ必要があります。応答は、131,072トークンの最大値に対して別途カウントされます。
OrcaRouter は OpenAI 互換の API を https://api.orcarouter.ai/v1 で提供しているため、移行はほとんど設定変更だけで済みます。ベース URL を https://api.orcarouter.ai/v1 に置き換え、API キーフィールドを OrcaRouter キーに置き換え、モデルを qwen/qwen3.8-max-0902 に設定します。コードが OpenAI 互換のクライアントライブラリを使用している場合は、クライアントの base_url と api_key を更新し、マルチモーダル形式がこのモデルと一致することを前提として、ほとんどのメッセージ構造はそのまま維持します。このモデルが OpenAI 固有のすべてのパラメータをサポートしているかどうかは事実情報に記載されていないため、移行前にアプリケーションが送信するパラメータを確認してください。また、コンテキスト上限は 1,000,000、最大出力は 131,072 であるため、リクエストの切り詰めロジックをこれらの上限に合わせて調整してください。異なる最大コンテキスト長をハードコードしている既存のコードがある場合は、更新が必要になる可能性があります。最後に、アプリケーションのデータ処理に関する想定が OrcaRouter の利用規約と一致していることを確認してください。モデルの事実情報自体にはデータ保持に関する記載がないためです。
比較の主な基準は入力契約です。Qwen3.8 Max (0902) はテキスト・画像・動画を受け入れるため、テキストのみの代替モデルを選ぶとそれらのモダリティは排除されます。実際のワークロードがテキストのみの場合、十分に大きなコンテキストを持つテキスト専用モデルの方が直接的な適合であり、料金が異なる可能性があります。モデルの事実には他のモデルに対する精度や速度の比較は含まれていないため、公表されている品質スコアに基づいて選択することはできません。構造的な属性を比較することは可能です。テキスト専用の代替モデルは、コンテキストが小さかったり、出力上限が短かったり、入力価格が低かったりする場合があります。OrcaRouter はこのモデルを、100万トークンあたり入力 $2.00・出力 $6.00 で請求します。画像および動画の入力があるという事実は、それらの入力が使用される場合にのみ有用です。それらの入力が使用されない場合、タスクに無関係なマルチモーダル容量に対して支払いを行っている可能性があります。
タスクプロファイルが記載された特徴に一致する場合に、Qwen3.8 Max (0902) を選択してください。まず、ソース素材をより小さいウィンドウに収まるように短縮できないため、1,000,000トークンのコンテキストが必要です。次に、同じプロンプト内で画像と動画の入力を必要とするか、将来のリクエストでそれらのモダリティを想定している必要があります。第三に、最大131,072トークンまでの出力を希望する場合です。ワークロードがこれらの要件のいずれも満たさない場合、このリスティングの利点の多くは活用されません。Maxという名前が強そうに見えるからといって選択しないでください。このリスティングにはベンチマークの証拠は含まれていません。OrcaRouterはOpenAI互換のAPIを通じてモデルを公開しているため、モデルIDの交換は簡単で、独自のタスクでこのモデルを別の候補と比較テストできます。ただ、入力と出力の価格が異なること、そしてこのモデルにはキャッシュ価格が指定されていないことに注意してください。
コストを比較する際は、まず同じトークン基準に正規化してください。このモデルは、入力トークン100万件あたり2.00ドル、出力トークン100万件あたり6.00ドルで、プロバイダーからマークアップなしでそのまま渡されます。トークンあたりの入力価格が低い競合モデルは、フルコンテキストのリクエストでは実際には安くなる可能性がありますが、コンテキストウィンドウと最大出力も考慮する必要があります。たとえば、100万トークンのリクエストは、このモデルでは1回の呼び出しでフルコンテキストを使用できますが、コンテキストが20万トークンのモデルでは複数回の呼び出しが必要になり、追加の出力や要約パスによって合計価格が変わることがあります。提供された事実には、客観的な精度や遅延の値が含まれていないため、正解あたりのコスト比較は、ご自身のテストに基づいて行う必要があります。また、競合モデルが画像や動画のトークンに対して別途料金を課すかどうかも確認してください。これらはここでは説明されていません。不明な場合は、OrcaRouterで典型的なワークロードを実行し、リスト価格だけに頼らずに、測定されたトークン使用量と応答品質を比較してください。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| 入力 / 1M tokens | $2.00 |
| 出力 / 1M tokens | $6.00 |
| キャッシュ読み取り / 1M | $0.250 |
| キャッシュ書き込み / 1M | $2.50 |
| 通貨 | USD |
表示価格に基づく概算
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
今週の開発者の声
@misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902