
Intern-Decision-2B 对比 Gemma 4 12B:8,192 Token 上限对阵 256K 窗口
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 584 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
假设你需要评判的是一份四十页的保险理赔文件。internlm/Intern-Decision-2B会拒绝它。不是截断它,也不是总结它——而是拒绝它,因为其捆绑的推理引擎声明的是 DecisionEngine(max_length=8192),而且模型卡直白地写明,超大输入会被“拒绝,不予截断”。google/gemma-4-12B-it——Gemma 4 12B Unified——会接收同一份文档,外加钉在它上面的扫描照片,再加上录制的通话,然后为你写出答案。这种反差就是整个比较的全部,而它和参数数量——2,213,241,664 对 11,959,730,224——几乎毫无关系,尽管只看规格表本来会把这些放在首位。
Intern-Decision-2B 是 InternLM 于 2026 年 9 月 26 日未经公告上传到 Hugging Face 的三个决策检查点中居中的那个,它基于 Qwen/Qwen3.5-2B 微调,采用 Apache-2.0 许可,并同时保留 Qwen 条款。Gemma 4 12B Unified 是 Google DeepMind 于 2026 年 5 月推出的无编码器多模态模型,一个任意到任意的系统,可接收文本、图像、音频和视频,并在超过 140 种语言中跨 256,000 token 窗口生成文本。其中一个是评分器。另一个是通用模型,只要你仔细设计提示词,它碰巧也能把评分做得很糟。在二者之间做选择,与其说是一个基准测试问题,不如说是一个关于你的答案已经是什么形态的问题。
在两者实际上不可比的情况下
在摆出数据之前,有必要直言不讳,因为这场对决容易让人产生一种虚假的对称错觉。
Intern-Decision-2B 不生成任何 token。它接收一个状态、一到十六个命名问题(每个问题最多有 62 个选项),并可选地接收最多八张图像;渲染一个助手 JSON 骨架,每个字段有一个 <decision> 占位符;运行一次因果前向传递;在每个占位符紧前方的位置读取 logits;仅对该字段的合法符号执行 softmax;并应用拟合温度 2.100509348278。输出是一个校准后的分布,以及每个字段的 argmax。模型卡直截了当地指出了它不做的事:“此 API 执行结构化候选评分。它不会调用 generate(),也不会对自由形式文本进行采样。”
Gemma 4 12B 会生成。它所做的一切——借助可配置思考进行推理、函数调用、OCR、图表理解、语音识别、覆盖 140 种语言——都通过一个基于 262,144 项词表的解码循环来运行。让它给出带概率的路由决策,你得到的会是一段包含某个数字的散文,而这个数字将是采样器生成的任何结果,而不是对你选项集做 softmax 得到的。
所以,实际问题不是“哪个更准确”。而是“我的答案是否已经是一个封闭集合?”如果是,那么 12B 就是从列表里挑选答案的一种浪费方式。如果不是,那么 Intern-Decision-2B 在任何准确率下都完全帮不了你。
输入上限是它们之间最清晰的分界线。
这是应当优先于所有其他维度来权衡的维度,因为它导致的是硬失败,而不是降级后的失败。
• 输入长度——Intern-Decision-2B 接受 8,192 个 token,超出即拒绝,且会明确报错;Gemma 4 12B 接受 256,000 个 token,并且在谷歌自家的技术卡上,其在 128k 长度下的 MRCR v2 八针测试中得分 43.4%。
• 图像 — Intern-Decision-2B 最多支持八张,且它们计入相同的 8,192-token 预算;Gemma 4 12B 支持可变宽高比和分辨率,文本与图像输入可以任意顺序交错。
• 输入模态——一个支持文本和图像;另一个支持文本、图像、音频和视频。
• 语言 — Intern-Decision 文档中没有任何地方声称支持多语言;Gemma 4 覆盖 140 多种预训练语言,其中 12B 在 MMMLU 上的多语言评估得分为 83.4。
• 输出——一个是有类型的 JSON 答案分布;另一个是生成的文本。
8,192 这个上限并非随意设定,而这正是它难以绕开的原因。决策目标会在每个字段的固定位置读取一个 logit,因此提示必须在一次传递中同时包含状态、schema 和完整骨架;没有任何分块策略能保持这一约定。一张工单、一封邮件、一段简短的 JSON 状态、一两张截图——这才是设计的中心。需要检索的文档,就不是这个模型所面向的文档。
每一样真正花掉你多少,老实算清楚
Intern-Decision-2B 没有托管端点,也没有提供方。OrcaRouter 上它的模型页面返回 404,本文中没有任何内容构成可用性声明。调用它意味着要下载大约 4.46 GB 的仓库——一个 3.76 GB 的语言分片、一个 612.5 MB 的视觉塔、一个 50.3 MB 的投影器——并在权重文件旁运行 inference.py,环境为 Python 3.12,搭配 torch 2.9.1 和 transformers 5.14.1,运行在一张你无论如何都在付费的 GPU 上,不管它是否正在对决策打分。
这并非在所有情况下都是劣势,而且值得算一算这笔账,而不是想当然。根据 InternLM 自己的测量,在单块 RTX 4090 上平均每个请求 33.28 ms,本地托管的 Intern-Decision-2B 每次决策不产生任何费用。托管式通用模型按 token 计费,包括它在回答前用于思考所消耗的 token。在规模化场景下,你已经拥有的评分器是更便宜的工具——成本在于 GPU 和工程,而不是调用。
Gemma 4 12B Unified 同样不在我们的目录中;如果你需要它,就得自行获取 119.6 亿个 BF16 参数并自己部署。我们的目录中真正提供 Gemma 4 路由的是另外两个规格,而且价格低廉:Gemma 4 26B A4B 为每百万输入 token 0.06 美元、每百万输出 token 0.33 美元,Gemma 4 31B 则为 0.13 美元和 0.38 美元,两者均标注 262,144 token 的上下文,目录显示的 P50 首 token 时间为 1.73 秒。如果你的问题最终属于通用推理而非封闭集决策,那就应该拿它与本地运行的评分器相比较——同一密钥上的另外两个模型,按供应商标价原样透传、不加价,以及自动故障转移,这样你仍在评估的模型就绝不会成为生产路径中的单点故障。

记分牌,附带注意事项
• 参数 — Intern-Decision-2B 2,213,241,664(BF16),外加视觉塔和投影器;Gemma 4 12B Unified 11,959,730,224(BF16)。
• 上下文 — 8,192 个 token,超出即被拒绝,而相比之下为 256,000 个 token。
• 输出——校准后的概率和一个 argmax,无文本;生成的文本,一次一个词元。
• 模态 — 文本加最多八张图像,对比文本、图像、音频和视频输入、文本输出。
• 已发表的证据——一份七套件厂商表格,平均分 84.68,Brier 分数 0.437,ECE 0.100,实验室之外无人复现;一张 Google 评测卡,MMLU Pro 77.2%、GPQA Diamond 78.8%、AIME 2026 无工具 77.5%,以及 LiveCodeBench v6 72.0,另有一份独立榜单显示 Artificial Analysis 智能指数为 14.2。
• 采用率——2B checkpoint 只获得一个点赞和零下载,而对手是一个自五月以来一直流通、量化、微调和衍生版本数以百计的模型家族。
要以非对称的方式去读这些证据行,因为它们本来就是这样。谷歌的数字已被第三方独立收录并复现;InternLM 的数字则从未被实验室以外的任何人跑过,尤其是那个校准数值,在它经受外部测试集检验之前,应被视为一项有充分记录的良好意愿。诚实的结论并不是说厂商的表格有错,而是说这两列并不具备同等的证据分量,而一个把 84.68 与 77.2 并排印出、却对此只字不提的对比,是在误导读者。

这个该怎么办
当决策真正已成定局、状态能从容放进八千个 token 之内、你想要一个可以设定阈值的概率而不是一段必须解析的文字,并且你有硬件也有意愿去运行一个目前无人支持的检查点时,就选择 Intern-Decision-2B。中间这个尺寸,具体承载着 InternLM 发布的三个模型中已公布的最弱校准——ECE 为 0.100,而规模只有它一半的模型为 0.066,规模接近它两倍的模型为 0.065——所以如果你要在这个系列里挑,2B 是需要你自己拟合温度参数的那一个,而不是可以开箱即信的那一个。
在以下情况下选择 Gemma 4 12B——或者更实际地说,选择我们实际路由的两种 Gemma 4 尺寸之一:当输入超过一页时,当涉及音频、视频或英语以外的语言时,当答案需要被解释而非仅仅被选出时,或者当你不希望自己承担推理栈时。12B 是 Gemma 4 中具备原生音频能力的最小模型;26B A4B 每个 token 激活约四十亿个参数,是进入该系列成本最低的途径。
而如果你实际面对的,是一个还拖着一份长文档的评分问题,那么这两者都不是合适的工具:那是一个披着对比文章外衣的检索问题。

