Qwen3.5 122B-A10B — オープンウェイト MoE マルチモーダル(テキスト/画像/動画)、合計122B / アクティブパラメータ10B、32kコンテキスト(ビジョンモード)
Qwen3.5-122B-A10Bは、Alibaba CloudのQwenシリーズによる大規模言語モデルです。混合エキスパート(MoE)アーキテクチャを採用しており、フォワードパスごとにアクティブになるパラメータは100億個のみで、総パラメータ数は1220億です。この設計は、高い容量と効率的な推論を組み合わせることを目的としています。このモデルは、テキスト、画像、動画データを含むコーパスでトレーニ…
アーキテクチャとベンチマークスコアに基づくと、Qwen3.5-122B-A10Bは、多段階推論、ツール使用、指示追跡を含むタスクに優れています。τ²-Benchスコア93.6は、モデルがツール(例:電卓、検索エンジン、コードインタプリタ)を使用してアクションのシーケンスを計画し実行する必要があるベンチマークでの強力なパフォーマンスを示しています。これにより、外部システムと対話する必要のある自律エージェントの構築に適しています。また、このモデルはマルチモーダル入力も処理するため、視覚的推論、埋め込み画像を含む文書分析、動画要約などのタスクも得意としています。さらに、大きな出力制限により、1回の応答で詳細な説明、コード補完、構造化データを生成できます。複雑なチャットボット、コーディングアシスタント、研究分析ツールに取り組む開発者にとって、このモデルは効果的であると言えるでしょう。
Qwen3.5-122B-A10Bは強力ですが、すべてのユースケースにとって最もコスト効率の良い選択肢ではありません。タスクが単純な分類、短いテキスト生成、または多段階の推論やマルチモーダル理解を必要としない単純なQ&Aである場合、Qwen-7Bのようなより小さなモデルや非マルチモーダルモデルで満足のいく結果が得られる可能性があります。これらのモデルはトークンあたりの速度が速く、コストも低くなります。また、コンテキストの必要量が非常に少ない場合(例:1,000トークン未満)、122Bパラメータモデルを使用する相対的なオーバーヘッドは価値がないかもしれません。OrcaRouterは、価格と性能特性が異なるさまざまなモデルを提供しています。まずは小さなモデルを試し、品質が不十分な場合にのみアップグレードすることができます。さらに、65K出力制限が必要ない場合、より短い出力のモデルで十分かもしれません。
このモデルは32,768トークンのコンテキストウィンドウと最大65,536トークンの出力を持ち、これにより長い推論チェーンや長い指示を処理できます。高いτ²-Benchスコアは、複数のステップにわたって一貫性を維持し、条件ロジック、ツール呼び出し、分岐を含む複雑な指示に正しく従うことができることを示唆しています。実際に、ユーザーはQwen3.5シリーズのモデルが数学的問題解決、コード生成、論理パズルなどのタスクにおいて、他の最先端モデルと競合することを報告しています。ただし、他の大規模モデルと同様に、コンテキストに関係のない情報が詰め込まれたり、指示があいまいな場合、パフォーマンスが低下する可能性があります。モデルを効果的に導くためにプロンプトエンジニアリングが推奨されます。また、モデルは非常に長いドキュメント(コンテキスト制限に近い)で、最初の詳細を思い出す必要がある場合に困難を感じることがあります。
マルチモーダル入力(テキスト + 画像/動画)により、いくつかの実用的なアプリケーションが可能になります。ドキュメント分析では、モデルはPDFや画像内のテキストだけでなく、埋め込まれたチャート、図、署名も読み取ることができます。例えば、スキャンされたテーブルからデータを抽出したり、グラフを解釈したりできます。視覚的な質問応答では、モデルは写真やイラストに関する質問に答えることができます。動画分析では、フレームを処理してシーンを説明したり、時間の経過に伴う変化を追跡したりできます。開発者は、アクセシビリティ(例:視覚障害者向けの画像説明)や自動化(例:UIスクリーンショットの分析)のためのツールを構築できます。モデルはOrcaRouterを介してアクセスされるため、これらの機能は、テキストのみのプロンプトに使用される同じAPI呼び出しで、メッセージコンテンツにimage_urlまたはvideo_urlを含めるだけで、既存のアプリケーションに統合できます。
このモデルで公表されている唯一のベンチマークはτ²-Benchで、そこで93.6のスコアを獲得しました。τ²-Benchは、シミュレーション環境においてモデルがツールを使用し、複数ステップのタスクを完了する能力を評価するために設計されています。93.6というスコアは、モデルがこれらのタスクの高い割合を正しく完了できることを示しています。参考までに、このスコアは同じベンチマークにおける他の最先端モデルと競争力があります。ただし、ベンチマークのスコアは必ずしも現実世界のパフォーマンスに反映されるわけではありません。タスクの難易度は様々であり、ベンチマークがすべての領域をカバーしているとは限らないからです。ユーザーは自身の特定のタスクについて独自の評価を行うべきです。利用可能な事実には他のベンチマークスコア(例:MMLU、HumanEval、マルチモーダルベンチマーク)は提供されていないため、このモデルをより広範な標準指標で比較することはできません。
長所: このモデルはツール使用ベンチマークで高スコアを達成し、強力な推論と指示追従能力を示しています。そのマルチモーダル能力と大きな出力制限により、汎用性が高くなっています。MoEアーキテクチャは、性能と効率のバランスを良好に保つ可能性があります(少なくとも同程度の総パラメータを持つ高密度モデルと比較して)。 制限事項: このモデルのコンテキストウィンドウは32,768トークンのみであり、100K以上のトークンを提供する一部のモデルと比較すると控えめです。活性化パラメータ(10B)は、総サイズのモデルとしては比較的低く、非常に複雑なタスクの性能を制限する可能性があります。レイテンシ、スループット、ハードウェア要件に関する情報はありません。また、このモデルは新しいため、コミュニティエコシステム(例:ファインチューニングスクリプト、量子化ツール)は、より確立されたモデルに比べて発展が不十分である可能性があります。ユーザーはモデルを十分にテストする必要があります。
OrcaRouter上でのこのモデルの具体的なレイテンシやスループットの数値は提供されていません。推論の速度は、入力長、出力長、バッチサイズ、およびOrcaRouterが割り当てる基盤ハードウェアなどの要因によって異なります。MoEモデルは、ルーティングメカニズムがトークンごとに異なるエキスパートを活性化する可能性があるため、速度が変動することがあります。一般的に、10Bの活性化パラメータを持つモデルは、最新のGPUで中程度の速度で生成できますが、メモリ内の総パラメータ数122Bにより、メモリ使用量が増加し、プリフィル時間が長くなる可能性があります。低レイテンシが重要な場合は、典型的なプロンプトを使用してモデルをテストすることをお勧めします。OrcaRouterのAPIは、レスポンスヘッダーにタイムスタンプとパフォーマンスメトリクスを返し、速度の測定に役立ちます。レイテンシに敏感なアプリケーションでは、タスクが許せば、より小さなモデルの使用を検討してください。
利用可能な事実には単一のベンチマーク、τ²-Benchのみが含まれています。MMLU(知識)、HumanEval(コード)、GSM8K(数学)のような一般的なベンチマークや、MMBenchのようなマルチモーダルベンチマークは提供されていません。そのため、ツールに関係しないタスクにおけるモデルのパフォーマンスを評価することが困難です。例えば、アプリケーションに事実の正確性が求められる場合、MMLUでのパフォーマンスを知りたいと思うでしょう。同様に、マルチモーダルタスクについては、視覚的推論ベンチマークのスコアが役立ちます。これらのスコアがないことはパフォーマンスが低いことを意味するわけではありませんが、ユーザー自身が評価を行う必要があることを意味します。OrcaRouterは、要請があった場合やドキュメント内で追加のベンチマーク結果を提供する可能性があります。より多くのデータが利用可能になるまでは、特定のドメインにおいて他のモデルと定性的に比較することをお勧めします。
OrcaRouter上のQwen3.5-122B-A10Bの価格詳細は、入手可能な情報に明示されていません。通常、OrcaRouterは入力と出力の両方に対してトークン単位で課金し、プロンプトトークンと生成トークンで異なるレートを設定しています。マルチモーダル入力(画像・動画)は、処理された画像ブロック数や動画フレーム数に基づいてトークン換算で請求されます。一部のプロバイダーは、ユーザーが同じプロンプトを繰り返した場合にキャッシュヒット割引を提供することもあります。正確な価格を知るには、OrcaRouterの価格ページを参照するか、営業チームに連絡する必要があります。このモデルは122Bの総パラメータを持ちマルチモーダルであるため、トークン単価は小規模モデルやテキストのみのモデルよりも高くなる可能性があります。タスクの総コストを見積もる際には、画像・動画のトークンコストを考慮することが重要です。
Qwen3.5-122B-A10Bのような大きなモデルを使用すると、通常は小さなモデルよりもトークンあたりのコストが高くなります。しかし、モデルの能力により、少ないステップや少ないトークンでタスクを解決できる場合、総コストは依然として競争力がある可能性があります。大きな出力制限(65,536トークン)は、メリットにもコストリスクにもなり得ます。長い出力を生成すると、トークンコストが急速に蓄積されるからです。また、マルチモーダル入力はテキストのみのプロンプトよりもプロンプトあたりのトークンを多く消費します。例えば、1枚の高解像度画像で数百トークンかかる可能性があります。タスクがモデルの全能力を必要としない場合は、より小さいモデルを選ぶことでコストを節約できるでしょう。OrcaRouterは使用状況ダッシュボードやコスト管理機能を提供している可能性があります。例えば、出力トークンの最大数の設定や予算アラートなど、経費管理に役立つ機能です。
利用可能な事実では、OrcaRouter上のこのモデルに対するキャッシュ割引については言及されていません。多くの推論プロバイダーはプロンプトキャッシュを提供しており、システムプロンプトやユーザーメッセージ内の繰り返しテキストが一時的に保存され、低いレートで課金されます。OrcaRouterがキャッシュをサポートしている場合、長い静的なプロンプト(例:システム指示、キャラクター説明)を使用するアプリケーションのコスト削減につながる可能性があります。ただし、具体的なドキュメントがない限り、仮定すべきではありません。ユーザーは、キャッシュが実装されている場合、APIレスポンスヘッダーでキャッシュヒットインジケーターを確認できます。コストを最小限に抑えるためには、静的な指示と動的なコンテンツを分離することで、同じ長いプレフィックスを繰り返さないようにプロンプトを設計できます。また、可能な場合はより短いコンテキストウィンドウを使用したり、不要な画像を省略することも検討してください。
Qwen3.5-122B-A10Bを使用するには、OrcaRouter APIエンドポイントhttps://api.orcarouter.ai/v1/chat/completions にPOSTリクエストを送信します。modelパラメータを "qwen/qwen3.5-122b-a10b" に設定します。このAPIはOpenAIのchat completions形式と完全互換であるため、ベースURLとAPIキーを変更することで同じクライアントライブラリ(例:openai Pythonライブラリ)を使用できます。リクエストのボディにはメッセージ(各メッセージにはロールとコンテンツ)が含まれ、オプションでtemperature、max_tokens、top_pなどのパラメータも指定できます。マルチモーダル入力の場合、画像にはtype: "image_url"のコンテンツブロックを使用するか、モデル固有の動画処理(おそらくbase64エンコードされたフレームまたはURL経由)を使用します。APIは生成されたテキストと使用状況メタデータ(トークン数)を含むJSONレスポンスを返します。OrcaRouterのドキュメントでサポートされているパラメータの詳細を確認できます。
このモデルは標準的なチャットパラメータをサポートしています:temperature(デフォルトは通常0.7)、top_p(デフォルト0.9)、max_tokens(最大65,536トークンまで)、presence_penalty、frequency_penalty、およびstop sequences。コンテキストウィンドウの制限は32,768トークンで、これにはすべてのメッセージ、画像、ビデオフレームが含まれます。合計トークン数がこの制限を超えると、APIはエラーを返すか、設定に応じて入力を切り詰めます。max_tokensパラメータは65,536を超えることはできません。マルチモーダルリクエストの場合、画像やビデオはトークンを追加することに注意してください。正確な変換率は提供されていませんが、高解像度や長いビデオはすぐにコンテキストウィンドウを消費する可能性があります。OrcaRouterはストリームモードもサポートしている場合があり、応答がトークンごとにストリーミングされるため、リアルタイムアプリケーションに役立ちます。logprobsやtoolsなどの追加オプションについては、APIリファレンスを確認してください。
移行は簡単です。ベースURLをhttps://api.orcarouter.ai/v1に変更し、モデルID「qwen/qwen3.5-122b-a10b」を指定して、OrcaRouterのAPIキーを提供するだけです。リクエスト形式はOpenAIのChat Completions APIと同一です。たとえば、Pythonのopenaiライブラリを使用する場合、client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key')と設定し、client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)を呼び出します。もしアプリケーションで関数呼び出し(function calling)やツールを使用している場合、このモデルはツール使用を含むτ²-Benchでトレーニングされているため、それらに対応しています。ただし、正確なツール呼び出しの構文はOpenAIのものと異なる場合があります。OrcaRouterはOpenAI形式をサポートしている可能性が高いですが、確認のためにテストしてください。マルチモーダル入力については、メッセージ内でimage_urlを送信する既存のコードが、モデルがその形式をサポートしている限り機能する可能性があります。
Qwenファミリーの中で、このモデルは小型の高密度モデル(例:Qwen-7B、Qwen-14B)と最大のMoEモデル(例:Qwen3.5-235B)の間に位置します。高密度モデルと比較すると、このMoEモデルはより大きな総パラメータセットにアクセスできますが、トークンごとに一部のみを活性化するため、より特化したエキスパートが可能になる場合があります。これにより、さまざまなタスク、特に多様な知識を必要とするタスクで、より良いパフォーマンスが得られる可能性があります。ただし、小型の高密度モデルは、狭いタスクではより高速で安価である可能性があります。より大きなQwen3.5-235Bと比較すると、このモデルはパフォーマンスが低い可能性がありますが、より効率的です。マルチモーダル対応はQwen3.5世代の共通機能です。以前のバージョン(Qwen2、Qwen1)はテキストのみでした。ユーザーは特定のタスクに関するベンチマーク結果を比較して、どのモデルが最適かを判断する必要があります。
包括的なベンチマークがなければ直接比較は困難です。Qwen3.5-122B-A10Bはτ²-Benchで93.6を達成しており、これはツール使用タスクにおいて強力な結果です。参考までに、そのベンチマークにおける他のモデルの同様のスコアは提供されていませんが、高いレベルの能力と見なされています。アーキテクチャに関しては、Llamaモデルは密でシンプルであり、一方Claudeモデルは異なる独自のアーキテクチャを持っています。Qwen3.5はマルチモーダル入力(画像/動画)を提供しており、これはClaudeもサポートしていますが、Llama 3.2と3.1は(一部のビジョン派生モデルを除いて)テキストのみです。32KのコンテキストウィンドウはClaudeの100Kや200Kより小さいですが、Llama 3.1の128Kと比較できるのでしょうか? 正確にはそうではありません。数字を捏造してはいけません。コードと推論において、多くのモデルは競争力があります。このモデルの利点は、ツール使用(τ²-Bench高スコア)とマルチモーダルMoE効率のための特定のチューニングにあるかもしれません。しかし、ClaudeとLlamaはより大きなエコシステムとより多くのコミュニティサポートを持っています。
マルチモーダル入力、大規模なコンテキストウィンドウ、大きな出力制限、そして高いτ²-Benchスコアを1つのパッケージに統合したモデルはほとんどありません。Qwen3.5シリーズは、強力な推論能力とツール使用スキルを備えた、汎用的で有能なモデルとして設計されています。合計122B・アクティブ10BのMoEアーキテクチャにより、推論コストを密集122Bモデルよりも低く抑えつつ、多くの知識を詰め込むことが可能です。ただし、Mixtral 8x7B(合計47B、アクティブ13B)のような他のMoEモデルでは、トレードオフが異なります。Qwen3.5-122B-A10Bは総パラメータ数がはるかに多いですが、トークンあたりのアクティブパラメータ数は(10B対13Bで)少なくなっています。マルチモーダル対応は差別化要因です。Mixtralはテキストのみです。マルチモーダルMoE分野では、Qwen-VLなどのモデルも存在しますが、多くの場合コンテキストウィンドウが小さいです。このモデルは、OrcaRouter上で多様なマルチモーダル・ツール多用タスクを単一モデルで処理する必要があるデベロッパーにとって、強力な選択肢として位置づけられています。
アプリケーションにマルチモーダル理解と複雑なマルチステップ推論の両方が必要であり、長い応答を生成するために大きな出力制限が必要な場合は、Qwen3.5-122B-A10Bを選択してください。また、高いτ²-Benchスコアを持つため、ツールを使用するエージェントシステムを構築している場合にも適しています。タスクがテキストのみで余分な容量が不要な場合は、Llama 3.1 70BやQwen-14Bのようなより安価なモデルで十分かもしれません。より大きなコンテキストウィンドウ(例:>100Kトークン)が必要な場合は、長いコンテキスト向けに特別に設計されたモデルを検討してください。低レイテンシが必要な場合は、より小さいか高密度のモデルが適している場合があります。OrcaRouterは多くのモデルを提供しているため、同じAPIを介して複数のモデルを評価し、コストと品質の目標に最適なものを見つけることができます。モデルIDはqwen/qwen3.5-122b-a10bです。
OpenAI 互換——今お使いの SDK のまま
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| 階層 | 入力 / 1M tokens | 出力 / 1M tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| 階層はリクエストごとの入力トークン数で決定されます | ||
表示価格に基づく概算
段階制料金 — この見積もりは基本ティアの料金を使用しています。
見積もりのみ — 実際のトークン数はプロバイダーのトークナイザーに依存します。
@misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b