
Pokee-Isaac 28B:1000萬Token上下文,以及Pokee不願透露的架構
- meta新Meta: Muse Spark 1.22026-08-0557智能72程式
- qwen新Qwen: Qwen3.8 Max2026-08-0358智能72程式
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3152智能69程式
- minimax新MiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百萬 tokens · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463智能78程式
- googleGoogle: Gemini 3.6 Flash2026-07-2152智能69程式
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49程式
- metaMeta: Muse Spark 1.12026-07-1653智能71程式
- kimiMoonshotAI: Kimi K32026-07-1560智能76程式
- openaiOpenAI: GPT-5.6 Luna2026-07-0952智能71程式
- openaiOpenAI: GPT-5.6 Terra2026-07-0957智能77程式
- openaiOpenAI: GPT-5.6 Sol2026-07-0961智能77程式
- grokxAI: Grok 4.52026-07-0856智能72程式
- tencentTencent: Hy32026-07-0642智能59程式
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42程式
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39程式
- anthropicAnthropic: Claude Sonnet 52026-06-3055智能72程式
- klingKling: Kling 3.0 Turbo2026-06-1757智能52程式57數學
在Pokee-Isaac 28B的發布比較表中,有一個欄位顯示六個模型中有五個得分為 0.0,而該欄位下方的註腳比上方的數字更有意思。在 1000 萬個 token 的上下文長度下,Pokee AI 的新 28B 模型在 RULER 上得分 93.3,而所有與之對比的基準模型——GPT-5.6 Luna、Gemini 3.5 Flash Lite、Claude Haiku 4.5、Nemotron 3 Super 120B、Qwen 3.5 122B——都沒有產生可用的結果。註腳解釋說,這五個基準中有三個根本無法以超過 262K 的上下文長度購得。所以這個分數是真實的,只是房間是空的。這是兩個不同的主張,而自該模型於 2026 年 8 月 5 日發布以來,大多數報導都把這兩者混為一談。
這不是否定 Pokee 所推出成果的理由,而是讓我們精確區分其中哪些部分已經得到證實、哪些只是無人質疑、哪些則根本未被描述。以下所有內容均來自四個主要來源:Pokee 自家控制台上的 Pokee-Isaac 模型頁面、Pokee 開發者文件、該模型在 NanoGPT 上的經銷商列表,以及 Pokee AI 與創辦人 Zheqing (Bill) Zhu 的發表聲明。本文中的每一項基準測試數據均由 Pokee AI 產生。Pokee 對此說得很明白——控制台指出,每項數據「除非另有標註,否則均由 Pokee AI 在單一受控環境中為 Isaac 及所有基準模型一視同仁地測量」——值得肯定的是,這意味著基準是重新運行得出的,而非從其他廠商的公告中抄襲而來。但這也意味著,沒有任何獨立實驗室複現過其中任何結果,而且截至目前,也無人發表過複現的嘗試。
Pokee 實際出貨了什麼
這個模型的公開介面,對於一個如此新近的發佈而言,其文件記錄異常完善,因此在探討有爭議的部分之前,值得先將其鋪陳清楚。
• 模型 — Pokee-Isaac 28B,版本 v0,以 pokee-isaac 形式從 api.pokee.ai 背後的相容端點提供。
• 規模與上下文:280億個參數,搭配1,000萬個token的輸入視窗;Pokee 稱其為「可端到端使用,而不僅僅是可定址」。
• 輸出 — 60,000 個 token,這既是預設值也是硬性上限。
• 模态 — 文字輸入、文字輸出。不支援圖像、音訊和視訊輸入,考量到該模型的構成基礎,這點值得注意。
• 價格 — 每百萬個輸入 token 0.15 美元,每百萬個輸出 token 1.00 美元,依 Pokee 自己的價目表。
• 代理型功能 — 在標準 chat-completions 架構中支援函式呼叫與結構化輸出;此模型定位為規劃-執行-審查型代理,而非聊天模型。
• 請求限制 — 請求主體上限為 45 MiB,超過 16 MiB 的內容必須使用 SSE 串流(stream: true 以及一個 Accept: text/event-stream 標頭)。
• 速率限制 — 每分鐘 500 個請求與 2,000 萬個 token,免費帳戶可同時發出 10 個請求,付費帳戶則為 25 個。
• 部署 — 資料中心 B200、RTX 4090/5090 工作站、Intel Arc Pro 用戶端顯示卡、邊緣 NPU(Qualcomm 與 Intel Panther Lake,AMD 列為待定),以及裝置端部署,並提供 VPC 與本地部署授權;用 Pokee 的話來說,「沒有任何請求會離開你的邊界」。
• 服務堆疊 — vLLM 和 SGLang 的首日支援。
• 公司 — Pokee AI,成立於2024年,由曾任Meta應用強化學習主管的Zheqing (Bill) Zhu創立;1200萬美元種子輪由Point72 Ventures領投,Qualcomm Ventures與Samsung NEXT參投。
權重未公開。相關報導將該模型描述為「暫時」閉源,這只是 Pokee 自己的保留說法,而非承諾,且目前並未公布任何發布日期或授權方式。

無人願意描述的架構
Pokee 將 1000 萬 token 的上下文視窗歸因於「專有的非僅解碼器架構」。這句話就是全部的技術揭露。主控台連結到一份標題為Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model的技術報告,日期為 2026 年 8 月 3 日;我們無法取得其公開副本,而在可取得的發布資料中,並未提及注意力機制、記憶體方案或訓練配方。
Pokee 關於模型譜系的說法更為具體,而且說起來有點彆扭:Isaac 的部分權重是依據 Apache-2.0 授權、從 Qwen3.6-27B 微調而來,其他權重則是由 Pokee 從零開始訓練,因此結果「並非傳統意義上的微調」。這是一句措辭謹慎的話,既承認了基礎模型,同時又否定了這種定性。
這也足以限制猜測的範圍,而這正是AI研究社群立即開始做的事情。以 @teortaxesTex 名義發文的研究者在發布當天就列出了這組限制條件——部分從 Qwen3.6-27B 微調而來、非僅解碼器(non-decoder-only)、1000萬上下文、總計280億參數——並提出了兩個候選方案:「某種強化版的 Memory Sparse Attention(記憶稀疏注意力)」或「就是個10億參數的文件編碼器」。這兩個猜測都值得理解,因為它們並非憑空臆測。
先從算術開始。Qwen3.6-27B 是一個稠密的 27B 模型,具有 262K 原生視窗、門控增量混合注意力(gated-delta hybrid attention),以及一個可跳過的視覺編碼器,跳過後模型即可純文字運行。Isaac 是 28B 且僅支援文字。如果移除基礎模型的視覺塔,再加上約十億個其他參數,正好會得到 28B。把約 1B 規模的文件或記憶編碼器接入 27B 解碼器,是對 Pokee 公布的參數數量最簡潔的詮釋,這會讓「非純解碼器」(non-decoder-only)的標籤名副其實,但這並非新穎的主張。
{{1}}這種「記憶稀疏注意力」(Memory Sparse Attention)的猜測,確實指向一條真實且新近的研究脈絡:{{/1}}{{2}}MSA 論文(arXiv:2603.23516)將可擴展的稀疏注意力與逐文件的 RoPE 結合,在訓練與推論上取得線性複雜度,{{/2}}{{3}}並加入 KV-cache 壓縮與「{{KEEP}}Memory Parallel{{/KEEP}}」方案,{{/3}}{{4}}號稱從 16K 一路到 100M tokens 的衰減低於 9%,{{/4}}{{5}}且 100M tokens 的推論只需兩張 A800 即可執行。{{/5}}這個結果的輪廓,正與 Pokee 所宣稱的成果如出一轍——只是數字再往後推了一個數量級,且來自另一個團隊。除了輪廓相似之外,兩者毫無關聯——MSA 並非 Pokee 的工作,Pokee 也沒有引用它——但這至少證明:在中等硬體上達到這種長度的去耦記憶體(decoupled-memory)設計,是已經發表、合理的成果,而非行銷上的不可能之事。
在Pokee自己的資料中,有一個數字默默支持了獨立編碼器的解讀。單一B200的預填充吞吐量在100萬token的上下文下為每秒42,400個token,在1000萬token下為每秒137,200個token。當上下文延長十倍時,吞吐量提升超過三倍。承擔二次注意力成本的解碼器則恰好相反。無論消耗那些token的是什麼,隨著token數量增加,每個token的處理都變得更有效率,這正是對文件進行批量編碼處理、而非普通預填充的特徵。
這些事對決定是否使用該模型的人為何重要:如果 10M 視窗是文件編碼器加上壓縮記憶體,而不是 10M 條目的 KV 快取,那麼這裡的「上下文」就不是你的直覺所圍繞的對象。當你追加到對話、編輯語料庫中間的某份文件,或期望前綴快取能運作時,其行為是未指定的,而 Pokee 的文件完全沒有列出任何快取機制。你無法從規格表推論這些行為,而目前也無法從架構推論它們。
在空房間中,RULER 在 10M 時是一個實數
Pokee 的長上下文證據是 RULER,以 256K、512K、1M、2M、4M 和 10M 執行,每個配置十個樣本。Isaac 在這些六種長度上的分數分別為 96.9、96.7、95.0、95.8、96.7 和 93.3——是該評測組中唯一在每一種長度都獲得分數的模型。
1M 以下的面板才是真實讀數所在:
• 在 256K 長度下——Isaac 96.9,Nemotron 3 Super 120B 96.3,GPT-5.6 Luna 95.0,Gemini 3.5 Flash Lite 94.5,而 Claude Haiku 4.5 與 Qwen 3.5 122B 皆為 0.0,因為它們的上下文視窗低於該長度。
• 在 512K 下 — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.
• 在 1M 時 — Isaac 95.0、Nemotron 91.8、Gemini 3.5 Flash Lite 29.4 與 GPT-5.6 Luna 0.0,最後兩者皆被標記為上下文溢出錯誤。
• 在2M及更遠 — 只有Isaac,其他皆為0.0。
接下來有三點。第一,在長度達 1M 時,Isaac 相對於其他模型的領先幅度只有一兩個百分點,而非一個世代——而唯一保持接近的基準模型 Nemotron 3 Super 120B 是 120B 模型,其 256K 到 1M 的數據是 NVIDIA 自己報告的數字,Pokee 將這些數字標記並排除在列比較之外,而不是當作實測結果。因此,在這些長度下最接近的競爭對手實際上並非對等的測量,無論從哪個方向來看都是如此。
其次,至少其中一個空白看起來是部署產物,而非模型限制。Pokee 透過 Azure 執行 GPT-5.6 Luna,並將其視窗標註為「>272K context」,在 1M 時記錄到上下文溢出錯誤。該廠商自行記載的該模型視窗約為 1.05M tokens,這也正是我們自己的模型頁面所報告的。若讀者僅看 1M 那一欄的表面意義,會得出 Luna 無法處理 1M 的結論;但更站得住腳的結論是,Pokee 所測試的 Azure 部署無法處理。
第三,RULER 是合成式檢索與彙總套件,而非推理基準。Pokee 在這裡也坦承了方法學上的一個小細節:256K 和 512K 欄平均了全部 13 種任務配置,但從 1M 起就無法進行常見詞彙擷取,因此長序列欄平均的是其餘 12 種。所以 10M 的 93.3 與 256K 的 96.9 並非在完全相同的任務組合下評分。
更嚴苛的長上下文測試止於1M。
Pokee 頁面上更具啟發性的基準測試不是 RULER,而是 MRCR v2,這是一項 8-needle 多輪共指任務,其中多個目標散佈在長對話中,模型必須檢索並消歧指定的目標,因此部分召回和跨針干擾都會造成失分。在 0–1 的評分標準下,在 1M tokens 時:
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5和Qwen 3.5 122B — 0.000,在該長度下沒有任何可用結果
{{1}}這比RULER產生的差距更寬廣、也更為可信,而這正是該模型的主張真正兌現之處。{{/1}}{{2}}Luna在256K的RULER上得分95.0,在1M的MRCR上得分0.050{{/2}};{{3}}單目標召回與多針消歧並非同一種技能,而後者會率先崩潰。{{/3}}{{4}}Isaac的退化則遠為平順。{{/4}}
這也是這次發布中最大的一個證據缺口。MRCR v2 在 256K、512K 和 1M 的長度下運行——然後就停了。Isaac 自己在這些長度上的分數是 0.607、0.743 和 0.500:非單調遞增,而且在 1M 時只檢索到一半的針。至今沒有任何人在 2M、4M 或 10M 發布多針結果,包括 Pokee。10M 的宣稱完全建立在兩個測試中較簡單的那個上,而且恰好是在較難的測試沒有嘗試的長度上。如果你正在考慮這個模型,是因為你想把一個 25,000 頁的語料庫放進一個提示詞中,然後提出一個需要從其中四個地方彙整答案的問題,那麼這項特定能力在那個特定長度下是未被測量的。

在代理式工作方面,Isaac 與 Luna 是同級,而非更勝一籌。
Pokee 執行了四項智能體基準測試,而這就是該公司坦誠得真正與眾不同的地方:其自家頁面將結果總結為 Isaac 在兩項中領先、在一項中排名第二、並在一項中排名第三。這是準確的描述,但並非發布報導中的描述。
• BFCL v4,函式呼叫(以 AST 與狀態轉換比對評分,而非由 LLM 裁判評分)— Isaac 70.94 對比 GPT-5.6 Luna 70.61,其中 Claude Haiku 4.5 為 67.52,Qwen 3.5 122B 為 64.88,Gemini 3.5 Flash Lite 為 64.85,Nemotron 3 Super 為 33.13。
• τ³-bench,四個領域的平均值(多輪客服任務,對象為模擬用戶,其需求會在對話中途改變)— Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631、Qwen 3.5 122B 0.611、GPT-5.6 Luna 0.527、Nemotron 0.426、Claude Haiku 4.5 0.408。
• Terminal-Bench 2.1 純文字子集 — GPT-5.6 Luna 69.8% 對比 Isaac 65.1%,接著 Gemini 3.5 Flash Lite 與 Qwen 3.5 122B 並列 46.5%,Claude Haiku 4.5 34.9%,Nemotron 24.4%。
• MCP-Atlas,聲稱覆蓋即時工具伺服器——GPT-5.6 Luna 77.90%,Gemini 3.5 Flash Lite 76.67%,Isaac 74.59%,Qwen 3.5 122B 70.24%,Claude Haiku 4.5 56.45%,Nemotron 48.95%。
在BFCL v4上,0.33分的差距屬於平手,Pokee的頁面也是這麼說的,而非宣稱勝利。綜觀全部四項基準,一個28B模型在代理任務上與前沿供應商的快速層級互有勝負。對一個28B模型來說,這是強勁的結果。但這並非「前沿等級代理模型」一詞對大多數讀者所暗示的結果,也意味著選擇Isaac的理由在於上下文視窗與部署環境,而非代理能力。
安全數字是該小組的最佳成績,但仍然不夠好
在DTAP(一個提示注入評測套件)中,Isaac 在榜單上以綜合35.6的攻擊成功率位居最低,領先於 Claude Haiku 4.5(37.9)、GPT-5.6 Luna(50.1)、Qwen 3.5 122B(54.0)、Nemotron(60.4)及 Gemini 3.5 Flash Lite(66.3)。直接與間接的成功率差異不到一個百分點,因此至少在兩個向量上的穩健性是不相上下的。
有三點需要注意,皆來自 Pokee 自身的報告,而非批評者的說法。間接量測是在防護機制未啟動的情況下進行的。明確拒絕僅在 1.5% 的惡意任務上觸發,Pokee 將此描述為目前大部分的防禦是「附帶發生而非主動拒斥」——該模型與其說是在識別並拒絕攻擊,不如說是未能被這些攻擊有效引導。而相較於這六個模型的評測小組,在更廣泛的 16 系統排行榜上,Isaac 在直接攻擊方面排名第五、間接攻擊第六、能力第九:位居中游,而非領先。
安全性同樣要付出代價。Isaac 的良性成功率為 82.5,低於 GPT-5.6 Luna 的 85.1——它在合法工作上拒絕或失誤的比例略高於它在攻擊測試中擊敗的模型。而 35.6 代表大約每三次注入嘗試就有一次仍會成功。對於一個其整體前提在於閱讀你未曾撰寫的一千萬個 token 文件的模型而言,這個數字是設計防護措施時要圍繞的核心,而不是能令人安心的數字。DTAP 本身值得標記:與 RULER、BFCL 和 τ³-bench 不同,它不是一個成熟的公開排行榜,而且我們找不到該套件的獨立文件。
一千萬個token的呼叫費用,以及你需要等待多久
一千萬個 token 大約等於 750 萬個詞彙,或約 25,000 頁。以 Pokee 每百萬個 token 0.15 美元的價格,填滿一次視窗需要 1.50 美元。再加一個最大長度 60,000 個 token 的回應,以每百萬個 1.00 美元計算,一次最大呼叫約需 1.56 美元。就所涉及的文本量而言,這確實便宜,也是支持該模型最有力的簡單論證。
時間才是真正的價格。在單顆 B200 上,Pokee 回報在 10M token 下,首個 token 需要 72.9 秒——這正好是 10,000,000 除以 137,200 tokens/秒 的 prefill 數字,所以這是基準測試硬體得出的數據,而非實際測量的 API 延遲。Pokee 自己的開發者文件卻向開發者訴說不同的故事:請為數百萬 token 的提示詞設定至少十分鐘的用戶端逾時,因為大型提示詞在 1000 萬個 token 時可能「需要大約七分鐘」。這表示吞吐量簡報與整合指南之間存在大約六倍的落差。兩者都是 Pokee 的數字;而文件中的那個數字,才是你的逾時設定必須相信的。
解碼速度穩定維持在每秒約 335 個 token,無論常駐上下文的多寡皆然——就架構面而言這是好消息,但在實務上卻很棘手:完整輸出 60,000 個 token 時,在 prefill 之上還需約三分鐘。在消費級硬體上,情況又有所不同——在 Intel Arc Pro B70 上,Pokee 回報 prefill 速度為每秒 1,087–1,500 個 token(是原版 llama.cpp 的 3.6–5 倍),解碼速度則為每秒 58.8 個 token。對消費級 GPU 來說,這些數字相當可觀,但並非 10M token 等級的數字。
輸入本身的大小帶來了兩個實際限制。一千萬個英文 token 大約是 38 MiB 的文字,低於 45 MiB 的請求主體上限,但遠高於 16 MiB 的門檻,因此每一次真正的完整視窗呼叫都必須串流傳輸——沒有非串流方式可以達到這項主打功能。而且 Pokee 的 API 沒有文件記載的提示快取機制,因此每次重新查詢同一語料庫,都還要再付 1.50 美元,並再次經歷耗時數分鐘的預填充。NanoGPT 上的轉售商列表確實公佈了每百萬個 token 的快取讀取費率為 0.079 美元,如果此費率適用於 Isaac,則一次快取重讀約為 0.79 美元——大約是半價,而不是提示快取在其他地方所暗示的數量級折扣。
定價比較需要一處更正,因為它會改變標題。Pokee 將 GPT-5.6 Luna 定價為每百萬個 $0.40/$1.80,來源是 Azure。供應商自己在 2026 年 7 月 31 日降價後對 Luna 的目錄價格是 $0.20/$1.20,而我們的模型頁面顯示的正是這個價格,因為 OrcaRouter 以 0% 加成直接轉傳供應商目錄價格,而不是加價轉售。以正確的數字來比較,Isaac 在輸入端便宜 25%、輸出端便宜 17%,比快速前沿等級——仍然比較便宜,但優勢遠比比較表所暗示的窄;而該比較表中整體最便宜的輸出價格是 Nemotron 3 Super 的 $0.65。Isaac 的價格優勢是真實的,只是它並非這次發布中令人矚目的部分。

實際上全新的部分
去除基準測試的框架後,留下的東西有些不同尋常。一個擁有超長上下文的 28B 模型,可以在 VPC 內、搭載 RTX 4090 的工作站、Intel Arc Pro 顯示卡,以及 NPU 級別的行動晶片上運行,並具備首日即支援的 vLLM 和 SGLang,以及內部部署授權——這樣的組合在別處幾乎找不到。Pokee 還宣稱其 KV-cache 效率約為標準實作的 5 倍,這是未經複現的廠商數據,但這正是那種若要讓部署故事成立就必須屬實的數字。
這個客戶不是那些想找更好代理(agent)的人。而是手中握有大量、敏感、且大致靜態的語料庫——合約集、案件檔案、單一龐大的程式碼庫、數個月的日誌——這類資料在法律或政治上不能離開特定邊界,而這類人原本會需要建置一套檢索管道,來繞過 200K 的視窗限制。相對於那種替代方案,這套產品的賣點不是「比 RAG 更便宜」。對 25,000 頁進行嵌入(embedding)與檢索,每次查詢只需幾美分,而且永遠都是如此。真正的賣點在於:沒有切塊(chunking)策略需要調整、沒有檢索召回率(retrieval recall)會損失、也沒有第二套系統需要與第一套保持同步。至於這筆交易是否值得每次查詢花費 1.50 美元和幾分鐘的時間,完全取決於你查詢的頻率。
現在誰該試試看,誰又該再等等
如果您正在針對 1M–4M 範圍的語料庫進行原型開發——Isaac 的數據在此範圍內最強,而替代方案確實很薄弱——或者 28B 的地端部署正是一直阻礙您的需求,那麼現在就試試吧。免費方案的十個並發請求,足以讓您確認該模型是否以您需要的方式閱讀文件。
等等,如果你特別需要 10M 這個數字,而且你問的問題是多跳的,因為這個組合正是從來沒有人量測過的。等等,如果你需要多模態輸入,但這個模型並不接受。等等,如果延遲很重要,因為一次完整視窗的呼叫要花幾分鐘,而不是幾秒鐘。另外,要權衡一下這個顯而易見的依賴風險:這是一個 v0 模型,採用封閉權重,來自一家種子輪僅 1,200 萬美元的公司,而它是世界上唯一提供其所銷售之能力的模型。一旦它消失,沒有任何第二家供應商可以故障轉移。
最後一點是讓比較保持誠實的實際原因。Pokee-Isaac 28B 目前不在 OrcaRouter 上——如果你想要它,Pokee 自家的 API 或經銷商那裡才有。但它用來自我衡量的五個基準中,有三個——GPT-5.6 Luna、Gemini 3.5 Flash Lite 和 Claude Haiku 4.5——都在同一個 OrcaRouter 金鑰上,以供應商定價提供,這讓這個有用的實驗設置起來很便宜:在它們支援的長度下,用這三個模型執行你實際的長上下文任務,看看你的語料庫是真的需要一千萬個 token,還是只需要 40 萬個加上更好的提示詞。如果確實需要一千萬,你就學到了每次呼叫價值 1.50 美元的經驗;如果不需要,你就避免了在單一來源的 v0 上建構生產路徑。
三個值得回答的問題
Pokee-Isaac 28B 只是微調(fine-tune)而已嗎?
就該詞語的任何正常用法而言,這都不是;不過它確實也並非獨立於該基礎之外。Pokee 的立場是,部分權重是在 Apache-2.0 授權下從 Qwen3.6-27B 微調而來,其他權重則從零開始訓練,且其架構並非僅限解碼器(decoder-only)。這兩半都與參數量一致:Qwen3.6-27B 是 27B 的密集模型,帶有可跳過的視覺編碼器;Isaac 則是 28B 且僅限文字,因此約有十億參數的新機制取代了視覺塔。該機制究竟為何尚未公開,而在公開之前,「並非傳統微調」這種說法僅憑 Pokee 的一面之詞,而非任何可查證之事。基礎模型上的 Apache-2.0 授權使衍生作品合法;但這並不使結果的封閉發布顯得不尋常,這點之所以值得注意,主要是因為如此具體的血統來歷很少被主動透露。
它真的能在 RTX 4090 上運行 10M tokens 嗎?
單一 GPU 的說法與 10M 的說法來自同一場發布,但並非來自同一項測量。Pokee 在 10M context 下公布的所有吞吐量數據——prefill 每秒 137,200 tokens、首個 token 72.9 秒——都是在單一 B200 上取得的。RTX 4090 與 Arc Pro 的數據是真的,但引用的是規模小得多的情境;Arc Pro B70 的數字是 prefill 每秒 1,087–1,500 tokens,這會使 10M token 的 prefill 耗時數小時。「可從 RTX 4090 起部署於單一 GPU」最好理解為:權重可以裝下、模型能實際提供服務,而不是說該卡能把主打的那個上下文長度做到實用。
我應該用它取代 RAG 管線嗎?
根據這項證據尚不能如此斷言,只有一個例外。支持取代檢索的論點,在你的查詢屬於多跳時最為有力——這正是分塊檢索處理不當的失敗模式——而超過 1M tokens 的多跳效能,正是 Pokee 沒有測量的部分。MRCR v2 在 1M 時停止,而 Isaac 能檢索到一半的針。例外情況是,當語料庫大小舒適地落在 1M–2M tokens 之間時,Isaac 的實測數據表現強勁,等待時間是幾十秒而非幾分鐘,而且移除檢索層能消除真正的營運複雜性。超過這個範圍,請把長上下文窗口視為避免為原型建構檢索的方法,而不是刪除一個已經可用的檢索系統的理由。
什麼能解決這件事?
四件事,沒有一件需要信任任何人。由任何人在公開 API 上以 2M 或以上長度進行的獨立 RULER 或 MRCR 評測。來自 Pokee 的 MRCR v2 結果,在其已對外宣稱的長度下。一份可取得的技術報告,指明其機制;屆時編碼器問題將不再是算術,而是事實。以及權重釋出——「目前閉源」暗示了此事,卻未作出承諾。
在那之前,公允的總結比發布宣稱更為收斂,也比懷疑論更有意思。Pokee AI 已推出一個 28B 模型;在長語境檢索上,它能撐住的範圍可測量地超過目前市面上任何可購買的產品;在代理式工作上與前沿快速等級打成平手;在自家評測組中是最安全的,在更廣泛的評測中則位居中段;而且能在其他同等能力模型無法運行的地方運行。該公司還選擇公開關於這項別人都沒有的能力僅存的數據,同時不說明其運作方式。這兩者都是一家年輕公司有權做出的選擇,但兩者都不能替代外部人士實際運行測試。
本文中的比較1
根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新
