Nex-N2.5 Pro vs Claude Opus 5 のヒーローは、「Nex-N2.5 Pro vs Claude Opus 5」と書かれた生成タイトルカードで、サブタイトルは「無料でオープンなコンピューター操作プレビュー vs 今日ルーティングできるベンチマークリーダー」、オーバーラインは「Anthropic vs Nex-AGI — 2026年9月」です。
Guides & Insights

Nex-N2.5 Pro vs Claude Opus 5:Nex-AGIは物差しを選び、物差しが勝った

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Nex-AGIは物差しを選んだが、物差しが勝った。上海を拠点とするオープンモデル連合が2026年9月8日にNex-N2.5 Proを発表したとき、モデルカードのコンピュータ操作の比較表では、比較対象の欄にClaude Opus 5を、挑戦者欄にNex-N2.5 Proを置いていた。OSWorld-2ではClaude Opus 5が68.3、Nex-N2.5 Proが56.4で、どちらの数値もNex-AGIが自社カードに記載したものと正確に一致している。その後の独立系リーダーボードは、その差を縮めるどころか広げている。BenchLMによる8月29日時点のOSWorld 2.0スナップショットでは、掲載された15モデルのうち、Claude Opus 5が70.6で首位に立つ。自ら公開を選んだベンチマークで、その分野のトップに12ポイントの差を許すのは、通常の発表演出ではない。だからこそ、Nex-N2.5 ProとClaude Opus 5の比較で興味深いのは、スコアではない。興味深いのは、そのスコアの両側にあるものの実体だ。すなわち、アライアンス外部の誰もまだ実行も検証もできていない3970億パラメータのオープンなコンピュータ操作モデルと、ベンチマークで首位に立ち、7月下旬以来本番トラフィックを支えてきたクローズドなAnthropicのフラッグシップである。

正直な要約を先に述べる:これは、測定された2つの量の間の競争ではない。なぜなら、その片側だけが、作り手以外の誰によっても測定されていないからだ。Nex-N2.5 Proはスパースな混合専門家モデルで、総パラメータ397Bのうち約170億のアクティブパラメータを持ち、Qwen3.5系から事後トレーニングされ、視覚的フィードバックループを備えた長期的なコンピュータおよびブラウザ操作を正面から狙っている。現在は、モデルカードからリンクされた無料のホスト型エンドポイントNex-AGIを通じて提供されている一方、そのファミリーの前提となっているApache-2.0ウェイトは「近日公開」と表示されたまま、日付はない。Claude Opus 5は、要求の厳しい推論、コーディング、エージェント業務向けのAnthropicの本番フラッグシップである。1Mトークンのコンテキスト、適応的思考ダイヤル、文書化された価格、そして数週間分の公開リーダーボードエントリと本番トラフィックを背後に持つクローズドモデルだ。この対戦におけるすべての利点は、次の2つの事実のいずれかに属する:一方のモデルは実行可能で検証可能であり、もう一方はそのどちらでもない。

双方が合意するベンチマーク

コンピュータ操作ベンチマークが評価するのは、これらのモデルが販売用に構築されているのと同じ行動、すなわち、画面を見て、行動を決定し、それを実行し、変化した画面を読み取って、その行動が機能したかを確認するエージェントだ。Nex-N2.5 Proはまさにそのループを中心に設計されている。視覚は後付けの入力モダリティではなく、エージェントが検証に用いるフィードバックチャネルなのである。Claude Opus 5は同じループを数あるワークロードの1つとして扱っているが、たまたまそれが非常に得意であり、だからこそNex-AGIは当初からこれを基準として採用したのだ。

この2つの数値は、厳密には同じハーネス(評価基盤)に由来するものではありません。Nex-AGIはOSWorld-2の数値を自社のNexCUA評価ハーネスを通じて算出しましたが、同社はこれをオープンソース化すると述べているものの、まだ公開していません。また、Nex-N2.5 Proの56.4という数値は、再現されていないベンダー発表の出力です。BenchLMにおけるClaude Opus 5の70.6は、2026年8月29日付のOSWorld 2.0の第三者によるスナップショットであり、Nex-AGI自身がリーダーボードの情報として引用している68.3と整合的です。ハーネスが異なり、ベンチマークのバージョンもわずかに異なるため、正確な差——Nex-AGI自身のカードでは12ポイント、BenchLMでは14ポイントに近い——は方向性を示すものとして解釈すべきです。しかし、Nex-N2.5 Proが、いずれの側でも入手可能な最良の数値において、現在の最先端のコンピューター操作エージェントを下回っていることは、議論の余地がありません。

A two-column scoreboard titled 'Nex-N2.5 Pro vs Claude Opus 5 — the scoreboard'. Left column Nex-N2.5 Pro: Announced Sep 8 2026; Params 397B total / ~17B active; Focus computer use; OSWorld 2.0 56.4 vendor-reported; Weights Apache-2.0 pending; Price free hosted / no list price. Right column Claude Opus 5: Released Jul 24 2026; Params undisclosed; Focus general plus computer use; OSWorld 2.0 70.6 per BenchLM; Weights closed; Price $5.00 / $25.00 per 1M. Footer: 'Nex figures vendor-reported via NexCUA harness; Opus OSWorld per BenchLM Aug 29.'

「今日実行できるか」に対する2つの答え

Screenshot of the Nex-N2.5-Pro model card on Hugging Face showing the banner 'Nex-N2.5-Pro weights are coming soon' above the family introduction text.

実働チームの勝敗を実際に決めるのはこの分岐点であり、それは新規参入者に有利には働かない。Nex-N2.5 Pro の Hugging Face カードには、Apache-2.0 ライセンスでウェイトが近日公開予定であるというバナーが今も掲示されているが、リリース日は添付されていない。実際に動作しているビルドは、カードから Nex-AGI がリンクしている無料のホステッドエンドポイントだけだ。これらは呼び出し可能だが、他者が所有しており、定価もなく、チームが計画を立てられるようなサービス条件もなく、自前のハードウェアでひとつのベンチマーク数値さえ再現する方法もない。ウェイトが実際に公開された際の文書化されたサービング構成は、カスタマイズされた SGLang イメージ上で H100 を 8 基使うシングルノードである。これは 397B MoE としては現実的だが標準的な規模であり、17B アクティブ設計が興味深いまさにその理由だ。それが実現するまで、Nex-N2.5 Pro は照会できるプレビューであり、その上に構築できるモデルではない。

Claude Opus 5は、これらすべての点で正反対だ。7月24日以降、AnthropicのAPIとルーティングされたプラットフォームを通じて提供されてきた。価格は公開され安定しており、ウェイトはクローズドで今後もそのままだ。そして、あらゆる数値は今日実行すれば確認できる。周辺エコシステム — Claude Code、MCPツール、そして6週間にわたって叩き続けてきた本番エージェントの群れ — は、まさに、できたばかりのモデルが主張できない、蓄積された実績なのだ。「モデルが次の四半期も機能しなければならない」ことを要件とするチームにとって、その実績がすべてだ。

仕様書、あるにはあるが。

2つの封筒を並べて置いてください:

リリース — Nex-N2.5 Pro:2026年9月8日(ホステッドエンドポイント稼働中、重み付けは公開待ち)。Claude Opus 5:2026年7月24日、一般提供開始。

規模 — Nex-N2.5 Pro:総パラメータ397B / アクティブパラメータ約17B(MoE)。Claude Opus 5:パラメータ数は非公開。

モダリティ — Nex-N2.5 Pro: テキストと画像を入力しテキストを出力。コンピューター操作ループの中心は視覚。Claude Opus 5: テキストと画像を入力しテキストを出力。強力な視覚分析を備える。

コンテキスト/出力Nex-N2.5 Pro: 262,144トークンのコンテキスト(文書化された提供長)。Claude Opus 5: 100万トークンのコンテキスト、128Kトークンの出力上限。

推論制御 — Nex-N2.5 Pro:reasoning_effort スイッチ(none / medium(アダプティブ、デフォルト)/ high)。Claude Opus 5:デフォルトでアダプティブ思考、明示的な low-to-max 努力量ダイヤル付き。

重み — Nex-N2.5 Pro: Apache-2.0、近日公開予定、日付未定。Claude Opus 5: 非公開。

1Mトークンあたりの価格 — Nex-N2.5 Pro: 無料ホスト層、リスト価格は未公表。Claude Opus 5: 入力 $5.00 / 出力 $25.00、キャッシュ読み取り $0.50、キャッシュ書き込み $6.25。

両モデルの性能スペックは十分に異なり、スペックシートが実際に役割を果たしている。Opus 5は100万トークンのウィンドウと128Kの出力上限を、長時間のエージェントセッション向けに備える。一方、Nex-N2.5 Proの262Kコンテキストと無料枠は、より小規模で画面駆動の自動化に適している。どちらの仕様も他方を不要にするものではない。両モデルは、エージェントがコンテキストを何に使うのかについて、前提が異なっているのだ。

Nex-AGI自身のスコアボードを正直に読む

カードの残りの部分も、同じフィルターで読む価値がある。Nex-N2.5 Pro の他のコンピューター使用の行 — OSWorld-G 87.4、OSWorld-Verified 82.2、WebArena-Verified 67.6、WebTest 52.8、Vision2Web 68.2 — と、コーディングの行 — Terminal-Bench 2.1 が82.7、SWE-Bench Pro が61.2、BrowseComp が89.7 — はすべて、アライアンス独自のハーネスによるベンダー計測値であり、最初の48時間では第三者による再現は行われていない。中立な読者がこのカードから引き出せる唯一の結論は、Nex-AGI は Nex-N2.5 Pro が、最も重要視すべき行ではフロンティアエージェントに及ばないものの、強力なミッドティアのコンピューター使用モデルであると見なしている、ということだ。それは397Bのオープンモデルとしては、首尾一貫した、いや慎重ですらあるポジショニングである。同時にそれは、第二の研究室での検証を待つ主張でもある。

片方に価格がない場合のお金

{{1}}ここで正直な価格比較を行うことは不可能です。なぜなら、価格が存在するのは片側だけだからです。{{/1}} {{2}}Nex-N2.5 Proの無料ホスティングティアは、このモデルの価値について何も教えてくれません。無料のプレビューエンドポイントは、ベンダーがトラフィックとフィードバックを集めるための手段であり、Nex-AGIはこのファミリーに対する有料のトークン単価を一切公表していないからです。{{/2}} {{3}}Claude Opus 5は、Anthropicの定価で、入力100万トークンあたり5.00ドル、出力100万トークンあたり25.00ドル、キャッシュ読み取りは0.50ドルであり、予算が負担しなければならないのはこの数字です。{{/3}} {{4}}現在、コンピューター利用エージェントのためにその請求を支払っていて、17Bアクティブのオープンモデルが同じ仕事をより安くこなせるかどうか知りたいのであれば、答えは「可能性はある」です。ただし、ウェイトが公開され、独立した誰かがそれを実行するまで、それを知ることはできません。{{/4}} {{5}}価格比較は先送りされたのであって、決着したわけではありません。無料エンドポイントを安さの証拠として扱うのは、カテゴリーエラーでしょう。{{/5}}

Screenshot of the OrcaRouter model page for Claude Opus 5 (anthropic/claude-opus-5) showing the header stats $5.00 input and $25.00 output per million tokens and the byline 'by Anthropic - 2026-07-24'.

今日できることは、それが可能になる日のためにA/Bを設定しておくことです。Claude Opus 5は、OrcaRouter上でAnthropicのリスト価格のまま利用できます——同じ$5.00/$25.00がマークアップなしでそのまま通るので、こちら側の請求はAnthropicのものと一致し、価格が動く日もAnthropicと同じ日になります。1つのAPIキーで200以上の他のモデルと同じエンドポイントの背後に配置され、プロバイダーに障害があれば自動フェイルオーバーし、Opusを難しい処理に使い、日常的な処理にはより安価なモデルを使いたい場合はルーティングDSLも利用できます。Nex-N2.5 ProはOrcaRouterにはありません——執筆前にモデルディレクトリを確認しましたが、nex-agiモデルはまだ1つも掲載されていません。プロバイダーがリスト価格で提供した瞬間、同じ日にここに表示されます。そして、この記事ではまだ実行できない正直な比較は、移行ではなくルーティングルールになります。

誰が行動すべきで、誰が待つべきか

もしあなたのチームが現在、本番環境でコンピューター操作やエージェント型コーディングのワークロードを実行しており、既知の価格、既知の障害プロファイル、独立した実績を備えたモデルを必要としているなら、{{1}}この直接対決で合理的な選択はClaude Opus 5であり、Nex-N2.5 Proの最初の48時間に起きた何ものも、その結論を覆すものではない{{/1}}。もしあなたのチームが将来の構築に向けてオープンなコンピューター操作モデルを評価しているなら、{{2}}Nex-N2.5 Proはウォッチリストに載せる価値がある——無理のないセルフホスティング規模と、説得力のあるミッドティアのベンチマーク成績を備えた397BパラメータのマルチモーダルMoEは、まさにコストカーブを塗り替えるタイプのオープンモデルだ{{/2}}。ただし、それはウェイトが実際に公開され、モデルカードの数値が独立した評価に耐えた場合の話である。合理的な立場は、その両方を同時に取ることだ。実績のあるリーダーをクリティカルパスに置き続け、新参者がトライアルに値するかどうかは、ウェイトが公開されるその日に判断すればよい。それがこの直接対決でまだ行われていない唯一の比較であり、実際に重要になるのは、まさにその比較なのである。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新