Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B:1000万Token的上下文,以及一个Pokee不愿描述的架构

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

有一个专栏位于Pokee-Isaac 28B的发布对比中,其中六个模型里有五个得分0.0,其下方的脚注比上方的数字更有意思。在1000万token的上下文长度下,Pokee AI的新28B模型在RULER上得分为93.3,而与之对比的每个基线——GPT-5.6 LunaGemini 3.5 Flash LiteClaude Haiku 4.5、Nemotron 3 Super 120B、Qwen 3.5 122B——都没有返回任何可用结果。脚注解释说,这五个中有三个根本无法以超过262K的上下文长度购买。所以这个分数是真实的,而房间里空无一人。这是两个不同的说法,而自该模型于2026年8月5日发布以来,大部分报道都把两者混为一谈。

这并不是否定 Pokee 所交付成果的理由。相反,它要求我们精确区分:其中哪些部分已得到验证,哪些只是无人质疑,哪些则根本没有被描述。以下所有内容均来自四个主要来源:{{1}}Pokee-Isaac 模型页面{{/1}}(位于{{2}}Pokee 自家控制台{{/2}})、{{3}}Pokee 开发者文档{{/3}}、{{4}}该模型在 NanoGPT 上的经销商列表{{/4}},以及{{5}}由{{6}}Pokee AI 及其创始人朱哲清(Bill Zhu){{/6}}发布的上线声明{{/5}}。本文中的每一项基准测试数据均由 Pokee AI 生成。Pokee 对此直言不讳——控制台上写明,每项数据{{7}}“除非另有标注,否则均由 Pokee AI 在单一受控环境中测量,对 Isaac 与所有基线模型一视同仁”{{/7}}——值得肯定的是,这意味着各基线都是{{8}}重新运行而非照搬{{/8}}其他厂商公告中的数据。这也意味着,没有任何独立实验室复现过其中任何一项结果,而且截至目前,也没有任何机构发表过复现尝试。

Pokee 实际发布的内容

对于一个如此年轻的发布来说,该模型的公共接口文档异常完善,因此在讨论有争议的部分之前,值得先将其梳理清楚。

模型 — Pokee-Isaac 28B,版本 v0,作为 pokee-isaac 从 api.pokee.ai 通过兼容端点提供服务。

规模与上下文 — 280亿参数对应1000万token的输入窗口;Pokee称其“端到端可用,而不仅仅是可以寻址。”

输出 — 60,000 个 token,这既是默认值也是硬性上限。

模态——文本输入,文本输出。不支持图像、音频和视频输入,考虑到模型的构建基础,这一点值得注意。

价格 — 每百万输入令牌 $0.15,每百万输出 $1.00,按 Pokee 自己的价格表。

智能体特性——在标准 chat-completions 模式中支持函数调用和结构化输出;该模型被定位为规划-执行-审查智能体,而非聊天模型。

请求限制——45 MiB 请求体上限,超过 16 MiB 的内容必须使用 SSE 流式传输(stream: true并添加Accept: text/event-stream请求头)。

速率限制 — 每分钟500次请求和2000万tokens,免费账户支持10个并发请求,付费账户支持25个。

部署 — 数据中心B200、RTX 4090/5090工作站、Intel Arc Pro客户端显卡、边缘NPU(Qualcomm和Intel Panther Lake,AMD列为待定)以及端侧设备,提供VPC和本地部署许可,用Pokee的话说,"任何请求都不会离开你的边界"

服务栈—在 vLLM 和 SGLang 中首发即支持。

公司——Pokee AI,由Zheqing (Bill) Zhu于2024年创立,他曾任Meta应用强化学习负责人;1200万美元种子轮融资由Point72 Ventures领投,Qualcomm Ventures和Samsung NEXT参投。

权重未公开。Coverage 将模型描述为“暂时”闭源,这是 Pokee 自己的保留说法,而非承诺,也没有公布发布日期或发布许可。

Pokee-Isaac 28B-2

没有人会描述的架构

Pokee 将 1000 万令牌的上下文窗口归因于一种“专有的非仅解码器架构”。这句话就是全部的技术披露。控制台链接了一份技术报告,标题为Pokee-Isaac 28B v0:面向1000万令牌上下文的高效智能体模型,日期为2026年8月3日;我们无法获取其公开副本,而可获取的发布材料中并未提及注意力机制、记忆方案或训练方案。

Pokee 关于模型谱系的说法更为具体,而且说起来略显尴尬:Isaac 的部分权重是在 Apache-2.0 许可下基于 Qwen3.6-27B 微调而来,其他权重则由 Pokee 从头训练,最终结果是“并非传统的微调”。这句话措辞谨慎,既承认了基础模型,又同时否认了这种定性。

这也足以缩小猜测的范围,而这正是 AI 研究社区立刻开始做的事情。以 @teortaxesTex 名义发帖的研究者在发布当天就列出了约束集——部分微调自 Qwen3.6-27B、非仅解码器架构、10M 上下文、总参数 28B——并提出了两个候选方案:"某种强化版 Memory Sparse Attention"或"仅仅是一个 1B 文档编码器"。这两个猜测都值得理解,因为它们并非无的放矢。

从算术开始。Qwen3.6-27B 是一个稠密 27B 模型,拥有 262K 原生窗口、门控增量混合注意力,以及一个可以跳过以纯文本模式运行模型的视觉编码器。Isaac 是 28B 且仅支持文本。如果你去掉基础模型的视觉塔,再添加大约 10 亿参数的其他东西,正好就是 28B。在 27B 解码器上外挂一个约 1B 的文档或记忆编码器,是对 Pokee 公布的参数数量最简洁的解读,这也将使“非仅解码器”的标签字面意义上成立,而不算什么新颖的主张。

关于Memory Sparse Attention的猜测指向了一条真实且新近的工作路线:MSA论文(arXiv:2603.23516)将可扩展稀疏注意力与文档级RoPE相结合,在训练和推理中获得线性复杂度,并增加了KV缓存压缩与"Memory Parallel"方案,报告显示从16K一直到100M token的性能下降不到9%,且100M token的推理可在两张A800上运行。这与Pokee声称的结果形态相同——只是再远出一个数量级——来自不同的团队。两者之间除了形态之外没有任何关联:MSA并非Pokee的工作,Pokee也没有引用它。但这确证了一点:在中等硬件上达到如此长度的解耦记忆设计,是已发表的、合理可行的事情,而非营销上的不可能。

Pokee 自己的材料中有一个数字悄然支持了独立编码器的解读。在单个 B200 上,1M token 上下文时的预填充吞吐量为每秒 42,400 个 token,10M 时则为每秒 137,200 个 token。吞吐量提升超过三倍,而上下文长度延长了十倍。一个付出二次方注意力代价的解码器则正好相反。无论是什么在消耗这些 token,随着 token 数量增加,每个 token 的处理效率都会提高,这正是对文档进行批量编码处理而非普通预填充的特征。

对于决定是否使用该模型的人来说,这些之所以重要:如果10M窗口是文档编码器加压缩内存,而非10M条目的KV缓存,那么这里的“上下文”就不是你的直觉所围绕的那个对象。当你向对话追加内容、编辑语料库中间的某篇文档,或期望前缀缓存生效时,其行为方式均未明确,而Pokee的文档中完全没有列出任何缓存机制。你无法从规格说明书中推断出这些行为,目前也无法从架构中推断出来。

10M处的RULER是空房间里的一个实数

Pokee 的长上下文证据是 RULER,在 256K、512K、1M、2M、4M 和 10M 长度下运行,每个配置十个样本。Isaac 在这六个长度上的得分分别为 96.9、96.7、95.0、95.8、96.7 和 93.3——它是评测组中唯一在每个长度上都获得分数的模型。

1M 以下的面板才是真实读数的所在:

在256K时— Isaac 96.9,Nemotron 3 Super 120B 96.3,GPT-5.6 Luna 95.0,Gemini 3.5 Flash Lite 94.5,而Claude Haiku 4.5和Qwen 3.5 122B均为0.0,因为它们的上下文窗口低于该长度。

在512K下 — Isaac 96.7、Nemotron 95.7、Gemini 3.5 Flash Lite 94.6、GPT-5.6 Luna 91.4。

在1M时 — Isaac 95.0、Nemotron 91.8、Gemini 3.5 Flash Lite 29.4 和 GPT-5.6 Luna 0.0,后两者均被标记为上下文溢出错误。

在2M及以上 — 仅Isaac,其他均为0.0。

有三点如下。首先,在最高1M的规模上,Isaac相对于同行的优势仅为一两个百分点,而非代际差距——而唯一保持接近的基准模型 Nemotron 3 Super 120B,是一个120B模型,其256K到1M的数值是NVIDIA自行报告的数据,Pokee 对这些数据进行了标记,并将其排除在行对比之外,而不是当作实测结果。因此,在这些长度上最接近的竞争对手实际上并不是一次对等的实测比较,无论从哪个方向来看都是如此。

其次,至少有一个空白看起来像是部署产物,而非模型限制。Pokee 通过 Azure 运行 GPT-5.6 Luna,并将其窗口标注为“>272K 上下文”,在 1M 处记录了一个上下文溢出错误。该模型供应商自己记录的窗口约为 1.05M tokens,这也是我们自己的模型页面所报告的。如果读者按 1M 列的字面意义理解,就会得出 Luna 无法处理 1M 的结论;更站得住脚的结论是,Pokee 所测试的 Azure 部署无法处理。

第三,RULER 是一个合成的检索与聚合套件,而不是推理基准。Pokee 在这里也坦率地说明了一个方法论上的细节问题:256K 和 512K 列平均了全部 13 种任务配置,但从 1M 起,常见词提取不可用,因此较长列平均的是其余 12 种。因此,10M 处的 93.3 和 256K 处的 96.9 并非基于完全相同的任务组合进行评分。

更难的长上下文测试止于1M

Pokee 页面上更具揭示性的基准测试不是 RULER,而是 MRCR v2。这是一项 8 针多轮共指任务,多个目标散布在长对话中,模型必须检索并消歧指定目标,因此部分召回和跨针干扰都会造成损失。在 0–1 的尺度上,在 1M tokens 时:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5Qwen 3.5 122B — 0.000,该长度下没有可用的内容

这比RULER所产生的差距要宽得多,也更具说服力,而这正是该模型的卖点真正兑现之处。Luna在256K长度下的RULER上得分95.0,在1M长度下的MRCR上却只有0.050;单目标召回与多针消歧并非同一种技能,而后者会首先崩溃。Isaac的退化则要平缓得多。

这也是该发布中最大的证据空白。MRCR v2 在 256K、512K 和 1M 下运行——然后就停止了。Isaac 自己的分数是 0.607、0.743 和 0.500:非单调,而且在 1M 时它只能检索到一半的针。目前没有任何人(包括 Pokee)发布过 2M、4M 或 10M 下的多针结果。10M 的说法完全依赖于两项测试中较容易的那一项,且恰好是在较难测试未尝试的长度上。如果你考虑这个模型是因为你想把 25,000 页的语料放入一个提示词中,然后提出一个需要从其中四个位置汇编答案的问题,那么这一特定能力在该特定长度上是未经测量的。

Pokee-Isaac 28B-3

在智能体工作上,Isaac 与 Luna 是平级,而非更胜一筹。

Pokee 运行了四个智能体基准测试,而这家公司在坦诚方面确实非同寻常:它自己的页面将结果总结为 Isaac 在两个项目中领先,在一个项目中排名第二,在一个项目中排名第三。这是一个准确的描述,而发布会报道中的描述并非如此。

BFCL v4,函数调用(通过 AST 和状态转换匹配评分,而非 LLM 裁判)——Isaac 70.94 对 GPT-5.6 Luna 70.61;Claude Haiku 4.5 为 67.52,Qwen 3.5 122B 为 64.88,Gemini 3.5 Flash Lite 为 64.85,Nemotron 3 Super 为 33.13。

τ³-bench,四域平均(多轮客服任务,模拟用户在对话中途改变需求)——Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631、Qwen 3.5 122B 0.611、GPT-5.6 Luna 0.527、Nemotron 0.426、Claude Haiku 4.5 0.408。

Terminal-Bench 2.1 纯文本子集——GPT-5.6 Luna 69.8% vs Isaac 65.1%,Gemini 3.5 Flash Lite 与 Qwen 3.5 122B 以 46.5% 并列,Claude Haiku 4.5 34.9%,Nemotron 24.4%。

MCP-Atlas,声称覆盖实时工具服务器——GPT-5.6 Luna 77.90%、Gemini 3.5 Flash Lite 76.67%、Isaac 74.59%、Qwen 3.5 122B 70.24%、Claude Haiku 4.5 56.45%、Nemotron 48.95%。

在BFCL v4上0.33分的差距属于持平,而Pokee的页面也正是这样表述的,并未将其称为胜出。综合看全部四项,一个28B模型在代理任务上与前沿厂商的快速档位互有胜负。对于28B模型来说,这是一个强劲的结果。但这并非大多数读者从“前沿级代理模型”这一说法中所理解的结果,也意味着选择Isaac的理由在于上下文窗口和部署范围,而非其代理能力。

安全号码是面板中最好的,但仍然不够好

在提示注入测试套件DTAP中,Isaac录得参测模型中最低的综合攻击成功率35.6,领先于Claude Haiku 4.5的37.9、GPT-5.6 Luna的50.1、Qwen 3.5 122B的54.0、Nemotron的60.4和Gemini 3.5 Flash Lite的66.3。直接与间接攻击成功率相差不到一个百分点,因此其鲁棒性在两条攻击向量上至少相当均衡。

三个注意事项,均来自Pokee自己的报告而非批评者。间接测量是在防护未激活的情况下进行的。明确拒绝仅针对1.5%的恶意任务触发,Pokee将此描述为当前大部分防御是“偶然生效而非主动拒绝”——模型并非识别并拒绝攻击,而是未能被这些攻击有效地引导。而相对于这个六模型小组,在更广泛的16系统排行榜上,Isaac在直接攻击方面排名第五,间接攻击方面排名第六,能力方面排名第九:处于中游,而非领先。

安全性也是有代价的。Isaac 的良性任务成功率为 82.5,低于 GPT-5.6 Luna 的 85.1——它在攻击测试中击败了后者,但在合法任务上略多一些拒绝或失误。而 35.6 意味着大约每三次注入尝试中仍有一次会命中。对于一款其全部前提就是读取一千万个并非由你撰写的文档 token 的模型来说,这个数字应当用来设计防护栏,而不是用来获得安心。DTAP 本身也值得警惕:与 RULER、BFCL 和 τ³-bench 不同,它并非公认的公开排行榜,我们也找不到该测试套件的独立文档。

一千万token的调用成本是多少,以及你需要等待多长时间

一千万token大约相当于750万词,也就是约2.5万页。按Pokee每百万token 0.15美元计算,填满一次上下文窗口需要1.50美元。再加上一个最长60,000 token的回答,按每百万token 1.00美元计算,一次最大调用大约为1.56美元。就所涉及的文本量而言,这确实便宜,也是支持该模型最有力的简单论据。

时间才是真正的代价。在单个B200上,Pokee报告称{{1}}在10M token规模下首token输出需72.9秒{{/1}}——这个数字正好是10,000,000除以137,200 tokens/秒的预填充速率得到的结果,因此是基准硬件数字,而非实测的API延迟。Pokee自己的开发者文档却向开发者给出了不同的说法:对于数百万token的提示词,客户端超时时间至少应设置为十分钟,因为大型提示词可能需要{{2}}"1000万token大约需要七分钟"{{/2}}。吞吐量幻灯片与集成指南之间的差距约为六倍。这两个都是Pokee的数字;文档中的那个才是你的超时配置必须相信的。

解码速度稳定在约 335 tokens/秒,无论有多少上下文驻留。这在架构上是好消息,但在实际应用上却很尴尬:完整的 60,000 token 输出在预填充之外还需约三分钟。在消费级硬件上,情况又有所不同——在 Intel Arc Pro B70 上,Pokee 报告的预填充速度为 1,087–1,500 tokens/秒(是原生 llama.cpp 的 3.6–5 倍),解码速度为 58.8 tokens/秒。对于客户端 GPU 来说,这些数字相当不错,但它们不是 10M-token 级别的数字。

输入规模本身就带来两个实际限制。一千万个英文 token 大约对应 38 MiB 的文本,虽然落在 45 MiB 请求体上限之内,却远高于 16 MiB 的阈值,因此所有真正全窗口的调用都必须走流式——不存在非流式路径来使用这一主打功能。此外,由于 Pokee 的 API 没有文档化的提示词缓存,每次重新查询同一语料库都要再花 1.50 美元,并再次经历耗时数分钟的预填充。NanoGPT 上的转售商列表确实公布了每百万 0.079 美元的缓存读取费率;如果该费率适用于 Isaac,那么缓存重读一次大约为 0.79 美元——大约是半价,而非提示词缓存在其它地方通常带来的数量级折扣。

对定价对比作一处更正,因为它会改变标题结论。Pokee 将 GPT-5.6 Luna 定价为每百万 token $0.40/$1.80,数据来自 Azure。该供应商在 2026 年 7 月 31 日降价后对 Luna 的官方标价为 $0.20/$1.20,这也是我们模型页面所显示的价格,因为 OrcaRouter 以 0% 加价直接透传供应商标价,而非加价转售。对照正确数字,Isaac 在输入价格上比快速前沿档便宜 25%,在输出价格上便宜 17%——仍然更便宜,但优势比面板显示的要窄得多;面板中整体输出价格最低的模型是 Nemotron 3 Super,为 $0.65。Isaac 的价格优势是真实存在的;只是它并非这次发布中引人注目的部分。

Pokee-Isaac 28B-4

真正是新的那部分

去除基准测试的框架后,剩下的东西就有些不同寻常了。一个28B模型,拥有超长上下文,能在VPC内、工作站RTX 4090、Intel Arc Pro显卡以及NPU级移动芯片上运行,并附带vLLM和SGLang的同步首发支持与本地部署许可——这样的组合在其他地方几乎找不到。Pokee还声称其KV缓存效率约为标准实现的5倍,这是厂商给出的数字,未经复现验证,但若要部署方案成立,这个数字就必须是真的。

这个产品的目标客户不是正在寻找更好智能体的人,而是拥有大量敏感且基本静态的语料库的人——合同集、案件档案、单体代码库、数月的日志——这些内容出于法律或政治原因不能离开边界;否则,他们本来会构建一条检索流水线来绕开200K窗口的限制。与那种替代方案相比,卖点并不是“比RAG更便宜”。对超过25,000页的内容进行嵌入和检索,每次查询只需几美分,而且永远如此。卖点在于:没有需要调优的分块策略,没有会损失的检索召回率,也没有需要与第一个系统保持同步的第二个系统。这种取舍是否值得每次查询花费1.50美元和几分钟时间,完全取决于你查询的频率。

现在谁应该尝试,谁应该等待

如果您正在针对 1M–4M 范围内的语料库进行原型开发——Isaac 在这一区间的数据表现最强,而替代方案确实寥寥无几——或者当 28B 规模的本地部署成为一直阻碍您的要求时,请立即试用。免费层的十个并发请求足以让您判断该模型是否按您需要的方式阅读您的文档。

等等,如果你特别需要10M这个数字,而且你问的问题是多跳的,因为这种组合恰恰没有人测量过。等等,如果你需要多模态输入,而该模型不接受。等等,如果延迟很重要,因为全窗口调用需要几分钟而不是几秒。还要权衡明显的依赖风险:这是一个v0模型,权重封闭,来自一家完成1200万美元种子轮融资的公司,而它是世界上唯一提供其所售能力的模型。如果它消失了,没有第二个供应商可以切换。

最后一点,是保持对比公平性的实际原因。Pokee-Isaac 28B 目前不在 OrcaRouter 上——如果你想要它,只能通过 Pokee 自己的 API 或经销商获取。但与之对比的五个基线中有三个,即 GPT-5.6 Luna、Gemini 3.5 Flash Lite 和 Claude Haiku 4.5,都可以用同一个 OrcaRouter 密钥按供应商列出的价格访问,这让这个有用的实验变得成本低廉:用这三个模型在你需要的长度下运行真实的长上下文任务,看看你的语料库是真的需要一千万个 token,还是只需要 40 万个 token 加一个更好的提示词。如果确实需要一千万,那你就学到了一个每次调用值 1.5 美元的经验;如果不需要,你就避免了一条基于单一来源 v0 模型构建生产路径的错误方向。

三个值得回答的问题

Pokee-Isaac 28B 只是微调吗?

按该短语的任何常规用法来说都不是,不过它也并非独立于那个基础。Pokee 的立场是,部分权重是在 Apache-2.0 许可下从 Qwen3.6-27B 微调而来,其余则从头训练,且架构并非纯解码器(decoder-only)。这两部分都与参数数量一致:Qwen3.6-27B 是 27B 稠密模型,带有一个可跳过的视觉编码器;Isaac 是 28B 纯文本模型,因此大约十亿参数的新机制替换了视觉塔。这一机制的具体内容尚未公开,而在公开之前,“非传统微调”这一说法只能倚仗 Pokee 之言,而非任何可查证的事实。基础模型的 Apache-2.0 许可使衍生行为合法化,但这并不会让结果的闭源发布显得反常——这一点值得注意,主要是因为如此具体的渊源很少会有人主动透露。

它真的能在RTX 4090上跑10M个token吗?

单GPU的说法和10M的说法来自同一次发布,但并非来自同一项测量。Pokee在10M上下文下发布的每一项吞吐量数据——137,200 tokens/秒的预填充速度、72.9秒的首token时间——都是基于单块B200。RTX 4090和Arc Pro的数据是真实的,但引用的是规模小得多的场景;Arc Pro B70的数字是1,087–1,500 tokens/秒预填充,这意味着10M token的预填充将耗时数小时。“可从RTX 4090起的单GPU部署”最好被理解为关于权重可适配且模型可有效服务的声明,而非关于该显卡上宣传的上下文长度是否切实可用。

我应该用它替换 RAG 管道吗?

仅凭这些证据还不能下此结论,但有一个例外。当查询是多跳时,替换检索系统的理由最充分——这正是分块检索处理得很差的失败模式——而超过100万token的多跳性能正是Pokee没有测量的。MRCR v2在100万token处停止,而Isaac在此处能取回一半的needles。例外是:当语料规模恰好落在100万至200万token区间内时,Isaac的实测数据表现强劲,等待时间仅为几十秒而非几分钟,而且去掉检索层能消除真正的运维复杂性。超过这个规模,请把长窗口视为在原型阶段避免构建检索的手段,而不是删除一个行之有效的检索系统的理由。

什么能解决这个问题

四件事,无一需要信任任何人。任何人在公共API上独立运行RULER或MRCR,长度达到2M或以上。Pokee在其已宣传的长度下提供的MRCR v2结果。一份可访问的技术报告,指明该机制的名称,届时编码器问题不再是算术问题,而成为事实。以及权重发布——“暂时闭源”暗示了这一点,但并未承诺。

在此之前,公允的总结比发布声势更收敛,也比那些质疑更有意思。Pokee AI 发布了一个 28B 模型:在长上下文检索保持距离上,其实测表现超过目前市面上任何可购买的产品;在智能体任务上与前沿快速档位打平;在自己那组评测中安全性最高,在更广泛的对比中处于中游;而且它能部署在许多同等能力模型无法运行的地方。它还选择公开了那项别人都未提供的功能所仅有的数据,同时不说明其工作原理。这两者都是年轻公司有权做出的选择。但无论哪一项,都无法替代由外部人员来运行测试。

本文中的对比1

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube