
Intern-Decision-0.8B vs Gemma 4 12B:评分头对阵多模态通才
- typesafe新TypeSafe: Jev 1.132026-09-24$0.04 / $0.00 每百万 tokens · 592 tok/s
- openai新OpenAI: GPT-6 Luna2026-09-2237智能
- openai新OpenAI: GPT-6 Sol2026-09-2248智能
- anthropic新Anthropic: Claude Opus 5.52026-09-2258智能
- grok新Grok 4.72026-09-2146智能
- Orca新Orca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 每百万 tokens · 187 tok/s
- orca新Orca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 每百万 tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040智能
- openaiOpenAI: GPT-6 Astra2026-09-0453智能77代码
- googleGoogle: Gemini 3.8 Flash2026-09-0241智能76代码
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245智能76代码
- anthropicAnthropic: Claude Fable 5.12026-09-0153智能82代码
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 每百万 tokens · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642智能72代码
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 每百万 tokens · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845智能75代码
- obsidianQwen3.8 27B2026-08-1534智能68代码
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236智能69代码
- grokSpaceXAI: Grok 4.62026-08-1244智能77代码
- metaMeta: Muse Spark 1.22026-08-0540智能72代码
要弄清 Intern-Decision-0.8B 是什么——以及它不是什么——最省事的办法就是把它和 Gemma 4 12B 放在一起比较,然后就会发现,这种比较几乎完全围绕两个模型各自用输出层做什么展开。Gemma 4 12B 是 DeepMind 于 2026 年 6 月 3 日在 Apache 2.0 许可下发布的 119.5 亿参数无编码器多模态模型,是一个生成式通用模型:你给它文本、图像、音频或视频,它写出答案。Intern-Decision-0.8B 则由 InternLM 于 2026 年 9 月 26 日悄然上传到 Hugging Face,没有任何公告;它是对小得多的 Qwen3.5-0.8B 的微调,完全不生成文本——它接收一个状态、一个由具名问题组成的模式以及最多八张图像,并在单次前向传播后为每个问题返回一个校准后的概率分布。一个负责写。另一个负责打分。下文的一切都由此而来。
这就使得把它框定为一场对决显得很奇怪,也值得在规格行之前直说:这两者并非替代品,任何在二者之间做选择的人,其实已经把问题说错了。Gemma 4 12B 回答的是“回复应该是什么”这个问题。Intern-Decision-0.8B 回答的是“在这十六个选项中,是哪一个,以及你有多大的把握”这个问题——而且它给出回答不经过解码器循环,延迟与成本上的差异正源于此。因此,有用的比较在于你会如何把二者分别接入同一个工作流,而不是谁胜出。
最大的差别在于账单的输出部分
Gemma 4 12B 的计费方式与任何生成式模型别无二致:输入 token 和输出 token 都计费。当你让它输出结构化 JSON 时,这些 token 每一个都会被生成、被采样、被计费,而你的 schema 越长、嵌套越深,token 就越多。这并不是对模型的批评——解码器本就是如此工作的——但这恰恰是决策负责人存在的意义:把这笔开支剔除。Intern-Decision-0.8B 没有输出 token。它的模型卡明确说明了原因:推理路径从不调用 generate()/,而是读取每个 <decision>/ 占位符之前紧邻位置的 logits(该占位符位于预渲染骨架之中),并且只对该字段允许的候选符号做 softmax。那个名为 output_tokens/ 的用量计数器统计的是被打分的字段数,而不是文本。
这种后果会随规模放大。一条用 Gemma 4 12B 为上万条记录打标签的流水线,要为上万份 JSON 文档付费;而同一条流水线若改用 Intern-Decision-0.8B,则只需为提示词付费,此外再无其他开销。绝对数字是否可观,完全取决于你的数据量和模式,任何有按 token 预算的人都能在十分钟内用一张电子表格算清楚。但方向本身并无争议,而这也正是小型决策模型这一品类得以出现的原因。
延迟,以及为何参数差距具有误导性
• 吞吐量模型 — Intern-Decision-0.8B:一次前向传播,无解码循环。Gemma 4 12B:自回归生成,一次一个 token。
• 实测延迟 — Intern-Decision-0.8B:在单张 RTX 4090 上通过本地 Hugging Face 路径,平均为 33.98 ms / p95 为 37.50 ms,依据 InternLM 自身的测量结果。Gemma 4 12B:不存在可比的单遍数值,因为没有单遍可供测量。
• 资源占用 — Intern-Decision-0.8B:约 1.73 GB 的仓库存储空间,852,985,920 个参数分布在一个 1.50 GB 的语言分片、一个 176 MB 的视觉分片和一个 25 MB 的投影器中。Gemma 4 12B:Google 的发布资料称其需要 16 GB 的显存或统一内存。
• 输出确定性 — Intern-Decision-0.8B:对候选 logits 取 argmax,因此相同输入每次都会得到相同的标签。Gemma 4 12B:除非将温度固定为零,否则会进行采样;而即便固定为零,标签也会以文本形式返回,你必须自行解析。
这两款模型之间 14 倍的参数差距,并不会转化为决策任务上接近 14 倍的运行时长差距,因为两者所做的工作性质不同。Intern-Decision-0.8B 把它的唯一一次前向传播花在读取提示词上——状态、模式、选项描述——然后就停下了。Gemma 4 12B 同样花时间读完这段提示词,然后还要在其上生成答案的每一个 token。对于一个含十六个字段、且选项标签带描述的模式来说,生成这一段绝不是可以忽略不计的零头;它占据了大部分墙钟时间。InternLM 自己的表格无意中印证了这一点:其 2B 版本录得 33.28 毫秒的均值,比 0.8B 的 33.98 毫秒还略快一点。当提示词处理占主导时,参数量就不再是那根杠杆了。img src="2.png">

而 Gemma 4 12B 则完全属于另一个类别
如果让规格表停留在决策任务的框架内,那会是不诚实的,因为一旦脱离这一框架,Gemma 4 12B 就不仅仅领先——它简直是在玩另一种运动。
Intern-Decision-0.8B 接受文本以及最多八张图像,这就是其全部输入面。其默认输入上限为 8,192 个 token,超出即被拒绝而非截断,这远低于其配置所宣称的 262,144 最大位置嵌入——实际窗口取决于这个上限,而非架构。Gemma 4 12B 通过无编码器设计原生接收文本、图像、音频和视频,将原始图块和波形直接投影到嵌入空间,拥有 256K 上下文窗口,并输出文本。谷歌发布的评测卡显示,其在 MMLU Pro 上得分 77.2%,在无工具条件下的 AIME 2026 上得分 77.5%,在 LiveCodeBench v6 上得分 72.0%,在 GPQA Diamond 上得分 78.8%,在 MMMU Pro 上得分 69.1%,在 MATH-Vision 上得分 79.7%。这些是来自谷歌自家评测卡的厂商数据,与 Intern-Decision-0.8B 的表格不同,它们背后有整整一年的第三方使用经历,因为 Gemma 4 在发布首日就进入了生态系统——LM Studio、Ollama、llama.cpp、MLX、vLLM、SGLang、Unsloth。
这两次发布也看起来毫无相似之处,而对比很能说明问题。Gemma 4 12B 在出现的当天就有发布博客、arXiv 上的技术报告、一个五模型系列页面、一份评估卡,以及一个下载链接。Intern-Decision-0.8B 则只有一张模型卡,其中的 GitHub URL 返回 404,还有一个演示 Space 返回 401,而且它是在两个同样缺少文档的更大同类模型发布后四十秒内出现的。其中一个是产品。另一个是有人决定放到互联网上的检查点。
二者均为 Apache 2.0,而这并非一个无关紧要的共同点。
两者真正交汇的唯一维度是许可,而这值得用一段话说明,因为对商业用户而言,决策正是在这里发生变化。两者均采用 Apache 2.0。Gemma 4 12B 按 Google 托管的 Gemma 4 许可条款发布,模型卡将其认定为 Apache 2.0;Intern-Decision-0.8B 则附带 Apache-2.0,以及第二个 LICENSE-QWEN/ 文件,这是对源自 Qwen 权重的模型所应采取的正确处理方式,也表明即使对一个未宣布的发布,InternLM 也做好了文书工作。
这使两者都有别于 Liquid AI 的 LFM2.5 系列——该系列的 LFM Open License v1.0 将商业权利限定为:你的法律实体年收入须低于 1000 万美元。对正在比较各种方案的决策模型买家而言,这是一项实实在在的限制,在认定“开放权重”在哪儿都意味着同一回事之前,应当先读一读。如果你的使用场景属于商业用途,且你的收入越过了这条线,那么 Apache 2.0 与 LFM 许可证便不可互换,而 Gemma 4 12B 和 Intern-Decision-0.8B 都不带这一限制。
关于 Intern-Decision-0.8B 数字的诚实账本
Intern-Decision-0.8B 的每一项性能数字都由厂商自报,且未经复现。这不是走形式——这就是当前证据的实际状况,它应当决定这张表该被赋予多大的权重。InternLM 自己挑选了基准测试、自己选定了对比对象、自己跑完了评测并公布了结果,而任何公开榜单上都不存在独立的运行记录。在 Artificial Analysis 上查询该模型,结果一无所得。img src="3.png">

即便贴上那个标签,结果的整体形态仍然具有参考价值。0.8B 在 TypeSafe 的 Typed Decision 基准上取得 77.35 分,而该基准正是以其命名的 Jev 1.13 为 73.35 分;在 ToolACE 上则为 94.52 分对 91.29 分。它在整个套件上的平均分为 79.38,而同系列的 2B 和 4B 版本分别为 84.68 和 90.02。最应让买家犹豫的一列是 WildJailBreak,它在这里得分 64.48,而 Jev 为 96.29:如此大的拒答稳健性差距是这次微调本身的特性,而它究竟来自 Qwen3.5-0.8B 基座、决策调优目标,还是参数量,则没有任何文献记录。其校准曲线更值得一读——Brier 分数为 0.530,期望校准误差为 0.066,而 Jev 为 0.358 和 0.095——这意味着它整体上准确度更低,但其给出的置信度与自身准确度的贴合更紧密。对于基于阈值的工作流而言,这一区别比原始准确率更重要,而这类信息正是 InternLM 没有动力公布的。
相比之下,Gemma 4 12B 的评测卡同样是厂商自报的——那些基准测试也是谷歌自己跑的——但它自六月以来就已面世,已经在所有主流本地运行时上完成了部署,任何出入早就该暴露出来了。“一周无人复现”与“四个月无人复现且无人提出异议”之间的证据差距,才是这两栏真正的区别所在。
实际上你会如何将它们组合起来
真正合理的模式并非一种选择。决策头负责处理结构化调用——路由、分诊、分类、按评分标准打分——这类任务的答案集合是封闭的,延迟至关重要,而输出 token 纯属额外开销。通才则负责一切需要行文、代码、综合归纳或长上下文的工作:升级摘要、说明工单为何被转给计费团队、供人工修改的草稿。
如果你正在弄清边界究竟在哪里,最省事的实验就是把两半都放在同一个端点后面。OrcaRouter 通过一个兼容 OpenAI 的单一 API 路由 200+ 个模型,具备自动故障转移,并按提供商标价零加价透传,这意味着在同一个脚本里测试一个托管的决策模型和一个托管的通用模型,只需一个密钥和一个下午。这里值得精确说明一个边界:Intern-Decision-0.8B 不是我们的模型——它是一份 Apache-2.0 检查点,由你自己下载并运行,而选择 1.73 GB 模型的全部理由,正是它驻留在你的数据本就所在的地方。这一模式的生成那一半,只差一行。至于 Gemma 4 12B,它也不在我们的目录中;我们实际路由的 Gemma 4 尺寸是 31B 和 26B A4B,而 12B 是本地下载。img src="4.png">

那么,结论并非谁胜出。Intern-Decision-0.8B 是一个廉价、快速、确定性的评分头,来自一个尚未对它作出说明的实验室,附带一张无人复现过的基准表,以及一列拒绝鲁棒性指标——在让它接触不受信任的输入之前,这一列应当先得到测试。Gemma 4 12B 是一个成熟的开放权重多模态通用模型,有已发布的模型卡、一份技术报告,参数量是它的十四倍;而对于一次十六字段的分类调用来说,它是错误的工具——不是因为它更差,而是因为,对于一个你早已把答案集合写下来的问题,还要去生成一个答案,是一种拿到标签的昂贵方式。
本文中的对比1
根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新
