「Apodex 1.1」というタイトルのヒーロータイトルカード。サブタイトルは「知能指数44 - エージェント強度、高い冗長性、知識に関する注意点」。ピルバッジには「AA Index 44」「#11 of 177」「256K context」と表示され、フッターには「2026年8月24日リリース - Artificial Analysis初のApodexモデル」という一文が記載されている。右下隅にはOrcaRouterのロゴが配置されている。
Guides & Insights

Apodex 1.1、解説:インテリジェンス指数44、真のエージェント力——そして知識信頼性の落とし穴

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Apodex 1.1は登場から1週間の新しいプロプライエタリモデルであり、今週までは主に研究室の珍品に過ぎなかった。そこへArtificial Analysisが同モデルに関する初の独立評価を発表した——Apodexにとってはこのプラットフォーム初の評価となる——そしてスコアボードは異例の動きを見せた。Apodex 1.1はArtificial Analysis Intelligence Indexで44を獲得し、177モデル中11位にランクイン。さらに、エージェント型ワークのスコアでは、同じインテリジェンス層の全モデル(DeepSeek V4 ProQwen3.7 MaxKimi K2.6を含む)を上回った。同じレポートは、もう1つの見苦しい数字も浮き彫りにした。知識信頼性の記録が弱く、実際の業務に使うかどうかの判断を変えるほどだった。オープンウェイト版の兄弟モデルであるApodex 1.1 Miniは、大半の人が実際に実行できるモデルだ。この評価が語ること、語らないこと、そして誰が注目すべきか——ここにその詳細を示す。

陳天橋氏が設立したAI企業Apodexは、2026年8月24日、70名の著者によるarXiv論文『Apodex 1.1: Scaling Agentic Intelligence for Complex Work』(2608.23283)とともに、モデルファミリーをリリースした。フラッグシップはプロプライエタリで、ベンダーの報告によれば約397Bパラメータ。エージェントにとっての真のボトルネックは生の知能ではなく、実行環境であるというテーゼを中心に構築されている。Apodex 1.1はそのため、ファイル、検索、コードを長期的なホライズンで直接操作するよう訓練され、最大150の並列サブエージェントを調整し、すべてのステップの来歴記録を保持する共有実行ハーネス(「AgentOS」)を備えている。オープンな部分は姉妹モデルである。AlibabaQwen3.5-35B-A3Bをファインチューニングした35BクラスのMoE、Apodex 1.1 Miniで、Apache-2.0ライセンスでリリースされ、FrontierAgentと呼ばれるコンパニオンエージェントハーネスを同梱している。フルモデルはApodexのAPIとオンラインワークベンチ経由でのみ利用でき、Miniはセルフホスティングのみとなる。

知能指数44が意味するもの

Artificial Analysis Intelligence Index は、プラットフォームのベンチマーク群を加重合成した指標で、GDPval-AA v2 や Terminal-Bench などのエージェント型評価に加え、推論、数学、知識の各コンポーネントを含みます。スコア44により、Apodex 1.1 は177モデル中11位となり、中央値の18を大きく上回ります。また、このスコアは同モデルを、混雑した興味深い層に位置づけます。Kimi K2.6(45)、MiniMax-M3(45)、Inkling(42)はすべて3ポイント差以内にあり、Apodex 1.1 はそのグループの中で、1週間前にはほとんどのAIユーザーに名前が知られていなかった唯一のモデルです。Artificial Analysis は、このページが同モデルの推論版を対象としており、非推論版も存在する可能性があると述べています。

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

このモデルが興味深いのは、ヘッドライン指標スコアそのものではない。興味深いのは、そのスコアに対する強みと弱みの位置関係であり、ティア比較がそれを具体的に示している。

格上に食い込む点:エージェント型およびナレッジワークの評価

現実世界のエージェント業務を測定する2つのIndex構成要素において、Apodex 1.1は44ポイント差の近隣モデルを上回る性能を発揮しています。実際のオフィス風タスクをエンドツーエンドで完了するエージェントの能力を評価するベンチマークであるGDPval-AA v2では、Apodex 1.1はElo 1348を記録し、DeepSeek V4 Pro (1333)、Qwen3.7 Max (1308)、Kimi K2.6 (1202)を上回りました。ターミナルで作業するエージェントをテストするTerminalBench v2.1では、70%のスコアを達成し、Kimi K2.6 (66%)を上回り、Qwen3.7 Max (75%)に僅かに次ぐ結果となりました。これらはArtificial Analysisが実施した独立した数値であり、環境ファーストのトレーニングが機能していることを示す、レポート内で最も有力な証拠です。

ベンダー自身のベンチマーク主張はさらに踏み込んでおり、第三者が再現するまではベンダー報告値として読むべきである:APEX-Agents 38.5、GDPVal 78.8、SWE-bench Verified 77.7%、Terminal-Bench 2.1 70.8%、ツール使用時のHumanity's Last Exam 56.1%、DeepSearchQA 92.4%、FrontierFinance 54.3、FrontierScience-Research 63.3。このエージェント型プロファイルが誇大広告ではなく信頼に足るものとしているのは、その背後にあるアーキテクチャである:環境スケーリング(トレーニングで使用する実行可能ファイル・検索・コード環境の多様性を拡大すること)と、エージェント連携スケーリング(長期的なタスクを分解し、並行作業を委任し、非同期の結果を統合して再計画するようモデルを訓練すること)だ。「Agent Team」モードは、検索および統合タスクにおいて最大150のサブエージェントを起動し、組み込みの検証ステップ(「Statement Review」)が結論を届ける前にそれをチェックする。言い換えれば、これは誤りを犯し、自己検証し、修正するように設計されたモデルであり、記憶から事実を暗唱するためのものではない。

その主体性がもたらす隠れたコスト:冗長さ

その設計は、Artificial Analysisのコスト効率表では、知識に次いでモデルにとって最も明確な弱点として挙げられている。つまり、非常に冗長であるということだ。完全なIntelligence Indexの実行には1億8000万の出力トークン(中央値は6700万)を消費し、ベンチマークタスクごとに約17,000の出力トークンを使用した。一方、Qwen3.7 Maxは約9,400、MiniMax-M3は8,100である。合計では、完全な評価のAPI支出は618.41ドルで、Artificial Analysisによるとのことだ。

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

その請求額を生み出す価格設定は、入力トークン100万件あたり0.30ドル、出力トークン100万件あたり3.00ドル。キャッシュ済み入力のキャッシュヒット価格は0.03ドルで、90%の割引です。これは、一般的な7:2:1のキャッシュ/入力/出力の混合では、100万件あたり約0.38ドルに相当します。両トークン単価はプラットフォームの中央値(入力0.25ドル、出力0.90ドル)を上回っています。それでも、Artificial Analysisのタスクあたりコスト見積もりでは、Apodex 1.1はベンチマークタスクあたり約0.05ドルと、Qwen3.7 Max(約0.07ドル)やKimi K2.6(約0.06ドル)よりも安価です。この整合性は予算編成に重要です。トークンが十分に安いため、冗長性が高くてもタスクあたりの競争力を維持できます。コストリスクはレートではなくボリュームにあります。長期稼働するエージェントをそれに載せた場合、請求額はどれだけ喋るかで決まります。そして、それは非常に多く喋るのです。

予算を組む前に1つ価格に関する注意点:$0.30/$3.00はベンダー自身のリスト価格です。プロバイダーのリスト価格を0%のマークアップでそのまま通すルーティングプラットフォームは、まさにその金額を請求します。また、将来Apodexが値下げした場合、発表された当日に反映されます。

落とし穴:知識の信頼性に関する実績が弱い

ローンチ時の報道のほとんどが見逃している数字がこれだ。Artificial Analysisの知識信頼性プローブであるAA-Omniscienceで、Apodex 1.1は-21.9を記録した。質問を拒否せず87%に回答を試みるが、正答率はわずか32%で、幻覚率は78.4%だ。ヘビーデューティーなソルバーとして位置づけられているモデルにとって、これは深刻な二重人格である。エージェント的実行には強いが、根拠のある知識には弱い。

この二つの事実は、矛盾しているのではなく、関連している。エージェント型ベンチマークは、環境内で行動すること、つまりツール呼び出しを行い、反復し、回復することを評価する。そのため、モデルは、環境が記憶を担っているおかげで、想起(リコール)が乏しくても高いスコアを獲得できる。その設計はそれを前提としている。Statement Review は出力を検証するために存在し、ワークベンチはモデルが記憶から正しく答えられることではなく、検証を中心に構築されている。実際的な解釈は率直である。Apodex 1.1 を、自身の重みから事実を取得することに依存するタスクに向けるべきではない。その代わり、ファイルやコード、ソースと照合して作業内容を確認できる長期的なタスクに向け、成果物を検証すべきである。

オープン版の兄弟機:Apodex 1.1 Mini と FrontierAgent

フラッグシップの閉ざされたドアが問題なら、ファミリーの開かれた半分がそのカウンターウェイトとなる。Apodex 1.1 Miniは、Qwen3.5-35B-A3B(2026年2月にAlibabaがオープンソース化したベースモデル)からファインチューニングされた、総パラメータ約35B/アクティブ約3BのMoEモデルだ。Apache-2.0ライセンスで公開され、262Kのコンテキストウィンドウと、FP8・FP4・GPTQ-Int4の各バリアントがHugging Faceで提供されている。ベンダー公表の目玉スコアは、FrontierFinanceで50.2(Apodex独自の比較で首位)、Agent Teamハーネスを有効にしたAPEX-Agentsで27.7である。そして、同梱のオープンソースランタイムであるFrontierAgentこそが、実に興味深い成果物だ。ReActモードとAgent Teamモードを備えたターミナルベースのハーネスで、サンドボックス化されたファイル操作、承認ゲート、チェックポイント、トレースを備え、あらゆるOpenAI互換エンドポイントとやり取りできる。

セルフホストする前に知っておくべきことが2つあります。まず、Miniはフロンティアモデルではなく、ファインチューンです。そのベンチマーク数値は、フラッグシップのベンダー表を読むときと同じように読んでください。つまり、再現されておらず、ハーネス込みで、ベンダーが選んだ比較です。次に、その振る舞いはベースモデルを受け継いでいます。基になるQwen3.5-35B-A3Bがすでにあなたのタスクを実行できるかどうかを試したいなら、それを確かめるのにGPUやサービングスタックは必要ありません。ベースモデルはAPIコール1回で試せます。

今日、Apodex 1.1を誰が使うべきか

フラッグシップモデルは現時点ではまだ初期段階でクローズドな状態であり、ベンダー自身のAPIとオンラインワークベンチでのみ利用可能です。Apodexによると、主要プラットフォームを通じてより広範なAPI提供が予定されていますが、ウェイトは公開されていません。このため、今週のスコアボードで試せるのは、Apodexワークベンチを既に利用しているチームか、ファーストパーティのAPIキーの取得に同意できるチームに限られます。Miniの方がアクセスしやすい道ですが、セルフホスティングが必要です。

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

このモデルが真に価値を発揮するのは、出力が後段で検証される長期的なエージェント型パイプライン——研究用ワークベンチ、複数ステップのファイル・ツールタスク、ターミナル作業——であり、1タスクあたり約0.05ドルというコスト特性が冗長さに耐えられる場面です。まだ適していないのは、モデル自身の知識が信頼できることに依存するもの、あるいは登場から7日しか経っていない未検証のモデルの誤動作を許容できない本番パスです。まさにそのような状況には、ルーティングレイヤーが適切なラッパーとなります。200以上のモデルに対応する単一APIとは、ベースのQwen3.5-35B-A3Bがすでに定価で呼び出し可能であり、セルフホストのMiniを同じルーターの背後に配置して自動フェイルオーバーを利用でき、不安定な新参モデルが本番パスを停止させることもないということです。性能が不十分な場合は、リクエストは健全なプロバイダーに自動的に切り替わります。

次に見るもの

この評価は暫定的な見解であり、最終的な判定ではありません。Apodex 1.1が1か月後に意味を持つかどうかは、次の3つの点で決まります。ベンダーのエージェンティックな主張を独立に再現できるかどうか(Artificial Analysisが実施したGDPvalとTerminalBenchの数値だけが、Apodex自身によるものではない唯一の数字です)。知識の信頼性ギャップが非推論型バリアントまたは後続リリースで縮小するかどうか。そして、このモデルがより多くのAPIとより多くの独立系スコアボードに登場するかどうか。そうなれば、44と-21.9は、ほかの誰かが打ち破るべき課題になります。このように二面性のあるプロフィールを持つ、リリースから7日しか経っていないモデルとしては、期待できるのはせいぜいこの程度です。本物のエージェンティックな優位性、正直な価格、そして契約する前に分かっている弱点が1つあること。

この記事で比較したモデル1

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新