
Pokee-Isaac 28B: 1000万トークンのコンテキスト、そしてPokeeが説明しないアーキテクチャ
- metaNEWMeta: Muse Spark 1.22026-08-0557知能72コーディング
- qwenNEWQwen: Qwen3.8 Max2026-08-0358知能72コーディング
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3152知能69コーディング
- minimaxNEWMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2152知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1653知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1560知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0952知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0957知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0961知能77コーディング
- grokxAI: Grok 4.52026-07-0856知能72コーディング
- tencentTencent: Hy32026-07-0642知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3055知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
列がある。Pokee-Isaac 28Bのローンチ比較表では、6つのモデルのうち5つが0.0を記録しており、その下の脚注は上の数字よりも興味深い。1000万トークンのコンテキスト長では、Pokee AIの新しい28BモデルはRULERで93.3を記録し、比較対象となったすべてのベースライン — GPT-5.6 Luna、Gemini 3.5 Flash Lite、Claude Haiku 4.5、Nemotron 3 Super 120B、Qwen 3.5 122B — 何も利用可能なものを返さない。脚注は、それら5つのうち3つはそもそも262Kを超えるコンテキスト長では購入できないことを説明している。つまり、スコアは本物であり、部屋は空である。これらは2つの異なる主張であり、2026年8月5日にモデルが登場して以来公開された報道のほとんどは、これらを一緒くたにしている。
それはPokeeが出荷したものを退ける理由にはならない。それは、どの部分が実証されているのか、どの部分が単に異議を唱えられていないだけなのか、どの部分がまったく記述されていないのかを正確に見極める理由にはなる。以下はすべて、Pokee自身のコンソールにあるPokee-Isaacモデルページ、Pokee開発者ドキュメント、NanoGPT上のモデルのリセラー掲載、そしてPokee AIと創業者Zheqing(Bill)Zhuによる発表声明という4つの一次情報源に基づいている。この記事のすべてのベンチマーク数値はPokee AIによって作成された。Pokeeはそう明言している。コンソールには、各数値が「特に記載がない限り、Isaacとすべてのベースラインについて、Pokee AIが単一の管理された環境で測定した」と記されている。評価できる点として、これはベースラインが他のベンダーの発表からコピーされたのではなく、再実行されたことを意味する。また、独立した研究所がそのいずれも再現しておらず、今日の時点で試みを公表したところもないことも意味する。
Pokeeが実際に出荷したもの
モデルの公開面は、これほど新しいローンチとしては異例なほどよく文書化されている。そのため、論争のある部分に入る前に整理しておく価値がある。
• モデル — Pokee-Isaac 28B、バージョン v0としてpokee-isaacapi.pokee.ai から互換性のあるエンドポイント経由で提供されます。
• サイズとコンテキスト — 280億パラメータと1,000万トークンの入力ウィンドウ。Pokeeはこれを「単にアドレス指定可能なだけでなく、エンドツーエンドで実用可能」と評している。
• 出力 — 60,000トークン(デフォルト値かつハードキャップ)。
• モダリティ — テキスト入力、テキスト出力。画像、音声、動画の入力には対応していません。モデルが何から構築されているかを考えると、注目に値します。
• 価格 — 入力トークン100万個あたり$0.15、出力トークン100万個あたり$1.00(Pokee独自のリストに基づく)
• エージェント型機能 — 標準のchat-completionsスキーマにおける関数呼び出しと構造化出力。モデルはチャットモデルではなく、計画・実行・レビューを行うエージェントとして位置づけられています。
• リクエスト制限 — 45 MiBのリクエストボディ上限、16 MiBを超える場合はSSEストリーミングを使用する必要があります(stream: trueと、Accept: text/event-streamヘッダー)。
• レート制限 — 1分あたり500リクエストと2,000万トークン。無料アカウントでは同時リクエスト10件、有料アカウントでは25件。
• 導入 — データセンター向けB200、RTX 4090/5090ワークステーション、Intel Arc Proクライアントカード、エッジNPU(QualcommとIntel Panther Lake、AMDは準備中)、およびオンデバイス。VPCおよびオンプレミスライセンスの下では、Pokeeの言葉を借りれば「リクエストがお客様の境界外に出ることはありません」。
• サービングスタック — vLLMとSGLangにおけるデイゼロサポート。
• 会社 — Pokee AIは、2024年にMetaで応用強化学習の責任者を務めていたZheqing (Bill) Zhu氏が設立。Point72 Venturesが主導し、Qualcomm VenturesとSamsung NEXTが参加した1200万ドルのシードラウンドを調達。
ウェイトはクローズドだ。Coverageはこのモデルを「今のところ」クローズドソースと評しているが、それはPokee自身の逃げ口上であり、約束ではない。リリースの日付やライセンスについても、発表は行われていない。

誰も説明しないアーキテクチャ
Pokeeは、10Mウィンドウを「プロプライエタリな非デコーダーオンリー・アーキテクチャ」に帰している。そのフレーズが技術開示のすべてである。コンソールは、Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Modelと題された技術レポート(2026年8月3日付)にリンクしている。我々はその公開コピーにアクセスできず、アクセス可能なローンチ資料には、アテンション機構、メモリスキーム、トレーニングレシピの記載がない。
Pokeeが系譜について述べたことはより具体的であり、やや言いにくいことでもある。Isaacのウェイトの一部はApache-2.0ライセンスの下でQwen3.6-27Bからファインチューニングされたものであり、他のウェイトはPokeeがゼロからトレーニングしたもので、その結果は「従来のファインチューニングではない」というものだ。それは慎重な一文である。基盤を認めつつ、同時にその特徴づけを否定している。
また、推測を絞り込むのにも十分であり、AI研究コミュニティはすぐにそれを始めた。@teortaxesTexという名前で投稿する研究者は、発表当日に制約条件のセットを提示した — 部分的にQwen3.6-27Bからファインチューニングされ、デコーダーのみではなく、10Mコンテキスト、合計28B — そして2つの候補を提案した:「何らかの強化されたMemory Sparse Attention」または「単なる1Bドキュメントエンコーダー」。どちらの推測も理解する価値がある。なぜなら、それらは的外れではないからだ。
まずは計算から始めよう。Qwen3.6-27Bは、262Kのネイティブウィンドウ、ゲート付きデルタハイブリッドアテンション、そしてテキストのみでモデルを実行するためにスキップ可能なビジョンエンコーダを備えた、デンスな27Bモデルである。Isaacは28Bで、テキストのみである。ベースモデルのビジョンタワーを外して、およそ10億パラメータの何かを追加すれば、28Bというのはまさにそこに辿り着く数字である。27Bデコーダにボルトで取り付けられた〜1Bのドキュメントまたはメモリエンコーダというのは、Pokeeが公開したパラメータ数に対する最も節約的な解釈であり、それは「非デコーダのみ」というラベルを文字通り真にするが、新しい主張にはならない。
メモリスパースアテンション(MSA)という推測が指し示すのは、実在する最近の研究系統である。MSA論文(arXiv:2603.23516)は、スケーラブルなスパースアテンションとドキュメント単位のRoPEを組み合わせることで、トレーニングと推論で線形計算量を実現し、KVキャッシュ圧縮と「メモリパラレル」方式を追加している。16Kトークンから100Mトークンまで一貫して9%未満の性能低下を報告し、100Mトークンの推論は2台のA800上で実行される。これはPokeeが主張している結果と同じ形状であり、異なるグループが1桁先の規模で示したものである。両者を結びつけるのは形状だけであり——MSAはPokeeの成果ではなく、Pokeeもそれを引用していない——しかし、このことは、分離メモリ設計が控えめなハードウェアでこのような長さに到達するのが、マーケティング上の不可能性ではなく、出版済みの妥当なものであることを確立している。
Pokee自身の資料には、分離エンコーダー説をひそかに裏付ける数字が一つある。B200単体でのプリフィルスループットは、1Mトークンのコンテキストでは毎秒42,400トークン、10Mでは毎秒137,200トークンである。スループットの上昇は、コンテキストが10倍長くなると3倍以上に達する。二次関数的なアテンションコストを要するデコーダーは、その逆の挙動を示す。それらのトークンを消費する処理は何であれ、トークンを追加するほどトークン当たりの効率が上がる。これは、通常のプリフィルではなく、ドキュメント群に対する一括エンコードパスの特徴である。
モデルを使うかどうかを決めようとしている人にとって、これがなぜ重要なのか:もし10Mウィンドウが10MエントリのKVキャッシュではなく、ドキュメントエンコーダと圧縮メモリの組み合わせであるなら、ここでいう「コンテキスト」は、あなたの直感が基づいている対象ではありません。会話に追記したとき、コーパスの途中にある1つのドキュメントを編集したとき、あるいはプレフィックスキャッシングが機能することを期待したときの挙動は未指定であり、Pokeeのドキュメントにはキャッシングメカニズムが一切記載されていません。そうした挙動を仕様書から推論することはできず、現時点ではアーキテクチャからも推論できません。
10MのRULERは空の部屋の中の実数である
Pokeeの長文脈エビデンスはRULERであり、256K、512K、1M、2M、4M、10Mで実行され、各構成につき10サンプルが使われています。Isaacはこれら6つの長さで96.9、96.7、95.0、95.8、96.7、93.3を記録しています——これはパネル内で全長さでスコアを返す唯一のモデルです。
1Mより下のパネルは、正直な読み取り値が表示される場所です:
• 256K では — Isaac 96.9、Nemotron 3 Super 120B 96.3、GPT-5.6 Luna 95.0、Gemini 3.5 Flash Lite 94.5、そして Claude Haiku 4.5 と Qwen 3.5 122B はともに 0.0 です。この 2 つのモデルのウィンドウはその長さ未満で止まります。
• 512K の場合 — Isaac 96.7、Nemotron 95.7、Gemini 3.5 Flash Lite 94.6、GPT-5.6 Luna 91.4。
• 1M では — Isaac 95.0、Nemotron 91.8、Gemini 3.5 Flash Lite 29.4、および GPT-5.6 Luna 0.0 で、最後の2つは両方ともコンテキストオーバーフローエラーとしてフラグされました。
• 2M以上では — アイザックだけで、他はすべて0.0。
続いて、3つの点があります。第一に、最大1Mまでの範囲では、アイザックの他モデルに対する差は、世代を変えるほどのものではなく、1〜2ポイント程度です。そして、唯一近いベースラインであるNemotron 3 Super 120Bは、120Bモデルであり、その256Kから1Mまでの数値はNVIDIA自身が公表した自己報告値です。Pokeeはそれを実測値として扱うのではなく、行比較から除外してフラグを立てています。つまり、その長さにおける最も近い競合他社は、実際にはどちらの方向においても、同等条件での計測結果ではないのです。
第二に、空欄の少なくとも1つは、モデルの制限というよりデプロイメントのアーティファクトのように見える。PokeeはAzure経由でGPT-5.6 Lunaを実行し、そのウィンドウを「>272K context」と注記したうえで、1Mでコンテキストオーバーフローエラーを記録した。そのモデルについてベンダー自身が文書化したウィンドウは約105万トークンであり、これは当社のモデルページでも報告されている内容だ。1Mの列を額面どおりに受け取る読者は、Lunaは1Mを処理できないと結論するだろうが、より妥当な結論は、PokeeがテストしたAzureデプロイメントでは処理できなかったというものだ。
第三に、RULERは合成の検索・集約スイートであり、推論ベンチマークではありません。Pokeeはここでも方法論上の難点を率直に説明しています。256Kと512Kの列は13種類すべてのタスク構成の平均ですが、コモンワード抽出は1M以降では利用できないため、長い方の列は残り12種類の平均となっています。したがって、10Mでの93.3と256Kでの96.9は、まったく同じタスク構成で評価されたわけではありません。
より難しい長文脈テストは1Mで停止する。
Pokeeのページでより示唆に富むベンチマークは、RULERではなくMRCR v2である。これは8ニードルのマルチラウンド共参照タスクであり、複数のターゲットが長い会話の中に散在し、モデルは指定された1つを検索して曖昧さを解消しなければならない。そのため、部分的な想起とクロスニードル干渉の両方がコストとなる。0〜1のスケールで、1Mトークンでは:
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5とQwen 3.5 122B — 0.000、その長さでは実用になるものは何もない
これはRULERが生み出すギャップよりもはるかに広く、はるかに信頼性の高いギャップであり、モデルの主張が実際に報われる点でもある。Lunaは256KでのRULERで95.0、1MでのMRCRで0.050を記録している。単一ターゲットの再現とマルチニードルの曖昧性解消は同じスキルではなく、後者が先に崩壊する。Isaacははるかに優雅に劣化する。
これは、今回のローンチにおける最大の証拠上の穴でもある。MRCR v2 は 256K、512K、1M で実行され——そしてそこで止まっている。Isaac 自身のスコアはそこで 0.607、0.743、0.500 であり、非単調で、1M では針の半分しか取得できない。2M、4M、10M におけるマルチニードルの公表結果は、Pokee を含め誰からも出ていない。10M という主張は完全に、2つのテストのうち易しい方に依拠しており、それはより難しいテストが試みられなかったまさにその長さにおいてのことだ。もしあなたがこのモデルを検討しているのが、25,000ページのコーパスを1つのプロンプトに入れ、その中の4つの箇所から答えを組み立てる質問をするためなら、その特定の能力はその特定の長さでは未測定である。

エージェント業務において、IsaacはLunaと同等であり、Lunaより優れているわけではない。
Pokeeは4つのエージェントベンチマークを実施したが、同社の率直さが本当に際立つのはこの点である。自社のページには、その結果が「Isaacは2つで首位、1つで2位、1つで3位」と要約されている。これは正確な説明であり、ローンチ時の報道で見られる説明ではない。
• BFCL v4、関数呼び出し(LLM ジャッジではなく、AST(抽象構文木)と状態遷移マッチングでスコアリング)— Isaac 70.94 vs GPT-5.6 Luna 70.61、Claude Haiku 4.5 は 67.52、Qwen 3.5 122B は 64.88、Gemini 3.5 Flash Lite は 64.85、Nemotron 3 Super は 33.13。
• τ³-bench、4ドメイン平均 (会話の途中で要件が変わるシミュレートされたユーザーを相手にしたマルチターンのカスタマーサービス業務)— Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631、Qwen 3.5 122B 0.611、GPT-5.6 Luna 0.527、Nemotron 0.426、Claude Haiku 4.5 0.408。
• Terminal-Bench 2.1、テキストのみのサブセット — GPT-5.6 Luna 69.8% 対 Isaac 65.1%、次いで Gemini 3.5 Flash Lite と Qwen 3.5 122B が 46.5% で同率、Claude Haiku 4.5 は 34.9%、Nemotron は 24.4%。
• MCP-Atlas、ライブツールサーバー全体でのカバレッジを主張 — GPT-5.6 Luna 77.90%、Gemini 3.5 Flash Lite 76.67%、Isaac 74.59%、Qwen 3.5 122B 70.24%、Claude Haiku 4.5 56.45%、Nemotron 48.95%。
BFCL v4で0.33ポイントの差は互角であり、Pokeeのページもそれを勝利と呼ぶのではなく、そう述べている。4つすべてを見渡すと、28Bモデルはフロンティアベンダーの高速ティアとエージェント型タスクで互角に渡り合っている。28Bモデルとしては、これは強力な結果だ。だが、それはほとんどの読者が「フロンティア級のエージェント型モデル」という言葉から想像する結果ではない。そして、Isaacを選ぶ理由は、エージェンシーではなく、ウィンドウとデプロイ環境にあるということを意味する。
安全番号はパネルの最良値でありながら、それでもまだ良いとは言えない。
DTAP(プロンプトインジェクション用スイート)では、Isaac はパネル内で最も低い攻撃成功率となる合計 35.6 を記録し、Claude Haiku 4.5 の 37.9、GPT-5.6 Luna の 50.1、Qwen 3.5 122B の 54.0、Nemotron の 60.4、Gemini 3.5 Flash Lite の 66.3 を上回る。直接攻撃と間接攻撃の成功率の差は 1 ポイント未満であり、堅牢性は両ベクターにわたって少なくとも均等である。
3つの注意点があり、いずれも批評家ではなくPokee自身の報告に基づく。間接的な測定はガードを無効にした状態で行われた。明示的な拒否は悪意のあるタスクのわずか1.5%にのみ発動し、Pokeeは現在の防御の大半は「拒否ではなく偶発的なもの」だと述べている。つまりモデルは攻撃を認識して拒否しているのではなく、攻撃によってうまく誘導されていないだけなのだ。そして、この6モデルのパネルではなく、より広い16システムのリーダーボードでは、Isaacは直接攻撃で5位、間接攻撃で6位、性能で9位であり、先頭ではなく中位に位置している。
安全性にもコストが伴う。Isaac の良性成功率は 82.5 で、GPT-5.6 Luna の 85.1 を下回る。つまり、攻撃では勝る相手モデルよりも、正当な作業をわずかに多く拒否したり、しくじったりするのだ。そして 35.6 は、約3回に1回のインジェクション試行が依然として成功することを意味する。自分が書いていない文書のトークンを1000万件読むことを前提とするモデルにとって、これは安心するための数字ではなく、ガードレールを設計するための数字である。DTAP 自体も注意を促す価値がある。RULER、BFCL、τ³-bench とは異なり、確立された公開リーダーボードではなく、このスイートの独立したドキュメントも見つけられなかった。
一千万トークンのコールのコストと待ち時間
1,000万トークンはおよそ750万語、つまり約25,000ページに相当します。Pokeeの100万トークンあたり$0.15なら、ウィンドウを一度満杯にするのに$1.50かかります。さらに、100万トークンあたり$1.00で最大長の60,000トークンの回答を追加すると、最大呼び出し1回で約$1.56になります。これは扱うテキスト量に対して本当に安価であり、このモデルを支持する最もシンプルで強力な論拠です。
時間こそが本当の代償である。単一のB200では、Pokeeは10Mトークンで最初のトークンまでの時間を72.9秒と報告している。これは10,000,000を137,200トークン/秒のプリフィル値で割った値に正確に一致するため、実測のAPIレイテンシーではなく、ベンチマーク用ハードウェアの数値である。Pokee自身の開発者向けドキュメントは、開発者に対して異なる話を伝えている。数百万トークンのプロンプトでは、クライアントのタイムアウトを少なくとも10分に設定すべきである。なぜなら、大きなプロンプトは「1,000万トークンで約7分」かかることがあるからだ。これはスループットのスライドと統合ガイドの間に、およそ6倍の開きがあることを意味する。どちらもPokeeの数値であり、ドキュメントに記載されている方が、タイムアウト設定が信じるべき数値なのである。
デコード速度は、コンテキストがどれだけ常駐していても約335トークン/秒で一定です。これは、アーキテクチャ的には良い知らせですが、実用的には厄介な知らせでもあります。つまり、完全な60,000トークンの出力には、プリフィルに加えて約3分かかります。コンシューマーハードウェアでは状況はまた変わります——Intel Arc Pro B70では、Pokeeはプリフィル1,087〜1,500トークン/秒(ストックのllama.cppの3.6〜5倍)と、デコード58.8トークン/秒を報告しています。これらはクライアントGPUとしては立派な数字であり、1000万トークンの数字ではありません。
入力サイズ自体から、実際上の限界が2つ生じる。{{1}}英語の1000万トークンはおよそ38 MiBのテキストに相当し、45 MiBのリクエストボディ上限には収まるが、16 MiBのしきい値をはるかに上回る。したがって、真にフルウィンドウの呼び出しはすべてストリーミングが必須であり、注目機能への非ストリーミング経路は存在しない。{{/1}}さらに、PokeeのAPIには文書化されたプロンプトキャッシュがないため、同じコーパスを再クエリするたびに、追加で1.50ドルと数分間のプリフィルが発生する。{{2}}NanoGPTのリセラーリストには、100万トークンあたり0.079ドルのキャッシュ読み取りレートが確かに記載されている。これがIsaacに適用される場合、キャッシュされた再読み取りは約0.79ドルになり、おおよそ半額ではあるが、他の場所でプロンプトキャッシュが示唆するような桁違いの割引ではない。{{/2}}
価格比較について1点訂正があります。この訂正によって見出しが変わるからです。PokeeはGPT-5.6 Lunaを100万トークンあたり$0.40/$1.80で価格設定しており、この価格はAzureに由来します。2026年7月31日の値下げ後のLunaのベンダー自身の定価は$0.20/$1.20で、これは当社のモデルページに表示されている価格です。OrcaRouterはプロバイダーの定価を0%のマークアップでそのまま通し、マージンを上乗せして再販しないためです。正しい数値と比較すると、Isaacは入力で25%、出力で17%、fast frontier層よりも安価です。依然として安いものの、その優位性はパネルが示唆するよりもはるかに小さいものです。また、パネル全体で最も安い出力価格はNemotron 3 Superの$0.65です。Isaacの価格優位性は確かですが、今回の発表で特筆すべき点はそこではありません。

実際に新しい部分
ベンチマークの枠組みを取り除くと、何か異例なものが残る。VPC内で動作し、ワークステーション向けRTX 4090、Intel Arc Proカード、NPUクラスのモバイルシリコン上で動作する、非常に長いコンテキストを持つ28Bモデル。しかも、提供初日からのvLLMとSGLangサポート、オンプレミスライセンス付き——この組み合わせは、他ではほぼ入手不可能だ。Pokeeはまた、標準実装と比較して約5倍のKVキャッシュ効率を主張しているが、これは再現性のないベンダー公称値であり、しかしデプロイのストーリーが成立するためには真実でなければならない類の数字でもある。
この製品の顧客は、より優れたエージェントを求めている人ではない。大規模で機密性が高く、ほぼ静的なコーパス(契約書セット、訴訟記録、モノリシックなコードベース、数か月分のログ)を抱え、法的または政治的な理由で境界の外に出せず、そうでなければ200Kウィンドウを回避するために検索パイプラインを構築していたであろう人だ。その代替案と比較すると、売り文句は「RAGより安い」ではない。25,000ページを超える埋め込みと検索にはクエリあたり数セントのコストがかかり、今後もそれは変わらない。売り文句は、調整すべきチャンキング戦略も、失う検索リコールも、最初のシステムと同期を保つべき第二のシステムもないということだ。そのトレードオフがクエリあたり1.50ドルと数分の価値があるかどうかは、クエリを実行する頻度に完全に依存する。
今すぐ試すべき人と、待つべき人
もし1M〜4Mの範囲のコーパスに対してプロトタイピングを行うなら、今すぐ試す価値があります。Isaacの数値が最も強く、代替手段が実際に少ない分野です。また、28Bでのオンプレミス展開がこれまで妨げとなっていた要件である場合も同様です。無料枠の10件の同時リクエストで、モデルがあなたのドキュメントを必要な方法で読み取るかどうかを確認するには十分です。
もし10Mという数値が具体的に必要で、しかも質問がマルチホップなのだとしたら、待ったをかけるべきです。というのも、その組み合わせはまだ誰も測定していないからです。また、マルチモーダル入力が必要なら、これも待ったです——このモデルはマルチモーダル入力を受け付けません。レイテンシが重要なら、これも待ったです——フルウィンドウでの呼び出しは秒単位ではなく分単位かかります。そして、明らかな依存リスクも考慮してください。これはv0モデルで、ウェイトはクローズド、シードラウンド1200万ドルの企業の製品であり、その企業が販売している機能を提供できるモデルは世界にこれしかありません。もしこれが消えれば、フェイルオーバー先となるセカンドプロバイダーは存在しないのです。
最後の点こそ、比較を誠実に保つ実際的な理由です。Pokee-Isaac 28Bは現在OrcaRouterにはありません。使いたいなら、Pokee自身のAPIかリセラーが入手先です。しかし、このモデルが比較対象とする5つのベースラインのうち3つ(GPT-5.6 Luna、Gemini 3.5 Flash Lite、Claude Haiku 4.5)は、1つのOrcaRouterキーでプロバイダー定価にて利用できます。つまり、有益な実験を安価にセットアップできるということです。実際の長文脈タスクを、それら3つが対応する長さで実行し、自分のコーパスが本当に1000万トークンを必要とするのか、それとも40万トークンとより良いプロンプトで足りるのかを確かめてください。1000万トークンが必要なら、1回の呼び出しにつき1.50ドルの価値がある何かを学んだことになります。不要なら、単一ソースのv0上に本番パスを構築することを回避できたことになります。
答える価値のある3つの質問
Pokee-Isaac 28Bは単なるファインチューンですか?
普通の言い方での「ファインチューン」には当たらない。ただし、その基盤から完全に独立しているわけでもない。Pokeeの見解では、一部の重みはApache-2.0のもとでQwen3.6-27Bからファインチューンされたものであり、他の重みはゼロから訓練されたもので、アーキテクチャはデコーダーオンリーではないという。その両方の主張はパラメータ数と整合する。Qwen3.6-27Bは27Bのdenseモデルでスキップ可能な視覚エンコーダを備え、Isaacは28Bでテキスト専用である。つまり、約10億パラメータ分の新しい機構が視覚タワーを置き換えたことになる。その機構が何であるかは開示されておらず、それが明らかになるまでは、「従来のファインチューンではない」という主張は、検証可能な根拠ではなくPokeeの言葉に依拠している。ベースのApache-2.0ライセンスは派生を法的に認めるが、その結果をクローズドでリリースすることを特別にしているわけではない。これは主に、これほど具体的な系譜が自発的に明かされることは珍しいからこそ注目に値する。
RTX 4090で本当に1000万トークンを実行できるのか?
シングルGPUという主張と10Mという主張は、同じ発表に由来するが同じ測定結果に基づくわけではない。Pokeeが10Mコンテキストで公開しているスループット数値(プレフィル137,200トークン/秒、ファーストトークンまでの時間72.9秒)は、すべてB200単体での値だ。RTX 4090とArc Proの数値は実測だが、はるかに小規模なスケールで引用されている。Arc Pro B70の数値はプレフィル1,087〜1,500トークン/秒であり、10Mトークンのプレフィルなら数時間かかることになる。「RTX 4090以上のシングルGPUでデプロイ可能」という主張は、モデルの重みが収まり実用的に動作するという意味で読むのが妥当であり、見出しとなるコンテキスト長がそのカードで実用的だという意味ではない。
RAGパイプラインをそれに置き換えるべきでしょうか?
この証拠だけではそうは言えない。ただし、1つ例外がある。検索を置き換える根拠が最も強いのは、クエリがマルチホップの場合だ。これはまさにチャンク検索が苦手とする失敗モードであり、1Mトークンを超えたマルチホップ性能こそ、Pokeeが測定しなかった点である。MRCR v2は1Mで止まっており、そこではIsaacが針の半分を取得している。例外は、1M〜2Mトークンに余裕で収まるコーパスの場合だ。そこではIsaacの測定値は強力で、待ち時間は数分ではなく数十秒であり、検索層を省くことで実際の運用複雑性が削減される。それを超える場合は、このウィンドウをプロトタイプ用に検索を構築するのを避ける手段とみなすべきであり、動作中の検索を削除する理由とはみなすべきではない。
それを解決するものは何だろう
どれも他人を信頼する必要のない4つのこと。公開API上で誰でも実行できる、2M以上での独立したRULERまたはMRCRの実行。Pokeeによる、既に公表されている長さでのMRCR v2の結果。そのメカニズムを明記した、アクセス可能な技術レポート。それが存在すれば、エンコーダーの問題は算術ではなく事実の問題になる。そして、重みの公開。「当面はクローズドソース」という言葉が示唆しながらも約束していないもの。
それまでの間、公平な要約はローンチより狭く、懐疑論より興味深い。Pokee AIは28Bモデルをリリースした。このモデルは、現在購入できるどのモデルよりも長いコンテキストで検索性能を測定可能な形で維持し、エージェント型タスクではフロンティアの高速ティアと互角に渡り合い、自社の評価パネルでは最も安全で、より広範なパネルでは中位に位置し、同等の能力を持つ他のものは動作しない環境でも動作する。また、他社が提供していない能力に関する唯一の数値を公開する一方で、その仕組みについては明かさないことを選んだ。どちらも若い企業が下せる選択だ。だが、どちらも社外の誰かがテストを実行することの代わりにはならない。
この記事で比較したモデル1
この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新
