
Inkling-Small:四分之一大小的模型,胜过自家旗舰型号,却仍落后于指数。
- qwen新Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 每百万 tokens · 56 tok/s
- deepseek新DeepSeek: DeepSeek V4 Flash 07312026-07-3150智能69代码
- qwen新Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 每百万 tokens · 201 tok/s
- orca新OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropic新Anthropic: Claude Opus 52026-07-2461智能78代码
- googleGoogle: Gemini 3.6 Flash2026-07-2150智能69代码
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137智能49代码
- metaMeta: Muse Spark 1.12026-07-1651智能71代码
- kimiMoonshotAI: Kimi K32026-07-1557智能76代码
- openaiOpenAI: GPT-5.6 Luna2026-07-0951智能71代码
- openaiOpenAI: GPT-5.6 Terra2026-07-0955智能77代码
- openaiOpenAI: GPT-5.6 Sol2026-07-0959智能77代码
- grokxAI: Grok 4.52026-07-0854智能72代码
- tencentTencent: Hy32026-07-0641智能59代码
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232智能42代码
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226智能39代码
- anthropicAnthropic: Claude Sonnet 52026-06-3053智能72代码
- klingKling: Kling 3.0 Turbo2026-06-1757智能52代码57数学
- z-aiZ.ai: GLM 5.22026-06-1651智能69代码60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242智能61代码61数学
Thinking Machines Lab 在发布其首个开放权重模型后的两周内,构建了一个大小约为其四分之一的模型,而根据该实验室自己的评分卡,较小的模型胜出。Inkling-Small在 SWE-bench Verified 上报告 80.2% 的成绩,而Inkling为 77.6%;GPQA Diamond 上为 89.5% 对 87.2%;Terminal-Bench 2.1 上为 64.7% 对 63.8%;Humanity's Last Exam 上为 31.6% 对 29.7%——这来自总参数量 276B、激活参数 12B 的模型,而非 975B 总参数、41B 激活参数的模型。在两份模型卡共享的主要数据中,975B 旗舰模型仅在一项上保持领先:AIME 2026,高出 1.6 分。
随后,Artificial Analysis独立对两款模型进行了测试,在Intelligence Index上,Inkling-Small得到40分,Inkling则为41分——较小的模型以一分之差落后。这两个结果都是真实的,而两者之间的差距正是本次发布中最有价值的信息。下文将区分Thinking Machines对自己模型的报告与其他人实测的结果:厂商数据来自发布公告和两张Hugging Face模型卡,独立数据来自Artificial Analysis自己的测试,定价和上下文长度数据则来自OpenRouter的实时端点数据,于本文撰写当日核对。若这三处数据存在分歧——在上下文长度上确实如此——我们会如实说明,而不是选择更好看的那一个。
7月30日实际发布了什么
Inkling-Small是一个稀疏混合专家(MoE)Transformer:总计276B参数,每个token激活12B参数,共42层;每个token被路由到256个专家中的6个,另有2个对所有token都激活的共享专家。注意力机制在局部层和全局层之间交替。权重托管在Hugging Face上,采用Apache 2.0许可证,无商业使用限制;可通过Thinking Machines的Tinker API进行微调,也可以在Tinker Playground中通过文本、图像和音频与它对话。实验室表示,该模型是在NVIDIA GB300 NVL72系统上训练的。

多模态是原生能力而非事后附加的,而且这张模型卡对实现方式的描述异常具体。没有单独的视觉或音频编码器:音频以 dMel 频谱图形式输入,图像则作为 40×40 像素的图像块经四层 hMLP 处理,两者都直接嵌入到与文本相同的词元流中。输入包括文本、图像和音频;输出仅为文本,这一点值得明确说明,因为“多模态”经常被解读为“能说话”,足以毁掉一个下午。思考强度是一个五档旋钮——最低、低、中、高、超高——因此同一组权重既可以低成本运行,也可以高强度运行。
这段配方的有趣之处在于后训练。Inkling-Small 使用完整的 Inkling 作为教师进行了在线策略蒸馏,随后又在智能体编码任务上进行了大约两周的强化学习扩展训练。正是这个顺序解释了结果的特点:学生模型继承了教师模型的通用能力,然后在如今超越教师的那个特定方向上获得了额外训练。
Thinking Machines 发布的记分牌
厂商基准测试在有人复现之前都只是营销,因此请将本节内容视为实验室的说法,而非经过验证的结果。该测试集依然覆盖面很广,而且其广泛性恰恰体现在对旗舰产品不利的方向上。

除了这四个共享数字之外,卡片补齐了其余信息——全部为Thinking Machines自己的运行:
• 智能体工作——在 GDPval-AA v2 上获得 1269 Elo,该基准测试评估的是现实经济任务而非谜题。
• 图表和文档——在 CharXiv RQ 上为 77.4%,当模型被允许编写并运行 Python 时升至 81.3%。这 3.9 个百分点的跃升是一个有用的提示:在视觉推理任务上,工具访问比提示工程带来的收益更大。
• Vision — MMMU Pro 得分 74.0%,略微高于 Inkling 的 73.5%。
• 音频 — 90.1% VoiceBench 和 77.0% MMAU,均略低于旗舰版的 91.4% 和 77.2%。音频是缩减明显付出代价的两个方面之一。
• 安全 — StrongREJECT 为 98.4%,FORTRESS 良性提示为 96.9%,但在 FORTRESS 对抗性测试中仅为 71.6%,而旗舰模型为 78.0%。这是另一个代价:对抗鲁棒性下降了 6.4 个百分点,如果模型要部署在公共文本框后面,这比任何编码能力的提升都更为重要。
• 预测——在 ForecastBench 上无搜索访问时的 Brier 指数为 61.3 ± 0.46,在 Prophet Arena 上的 Brier 得分为 0.1238 ± 0.0086。能报告误差线这一点本身就比大多数发布帖更有严谨性。
一个缺口:旗舰型号的卡片列出了 SWE-bench Pro(SWE-bench Verified 更难的同门)上的 54.3%。Inkling-Small 的卡片没有报告 SWE-bench Pro。鉴于 Verified 数字被大力宣传,它的缺失正是我们最希望填补的数字。
独立指数反而说了什么
Artificial Analysis 在其 Intelligence Index 版本 4.1 中将 Inkling-Small 评为 40 分,比 Inkling 的 41 分低一分。该指数是九项评估的复合指标——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 和 AA-LCR——这份清单解释了大部分表面矛盾。九项中只有两项与 Thinking Machines 卡片上的推理展示重叠。其余则偏向智能体工具使用、长上下文检索和抗幻觉能力,而一个模型可能赢得实验室选择公布的基准测试,却输掉第三方选择运行的测试。双方都没有撒谎;他们衡量的东西不同。

在细则中还有一个比“领先一分”这个头条更有价值的细节:Artificial Analysis 将旗舰型号的条目列为 Inkling (xhigh)——即其最高的思考强度设置——而 Inkling-Small 一行则没有标注强度后缀。因此,旗舰型号的领先一分是在推理强度调到最大的情况下测得的。如果统一思考强度后这一对比哪怕出现一丝变化,那么仅凭能力支持更大模型的最后一条理由也将随之消失。
独立数据完全无法相提并论之处在于速度和成本,而在这两方面,小模型的优势之大,是任何基准测试表都无法传达的:
• 输出速度 — 每秒133个token,而Inkling(xhigh)为80。Artificial Analysis将Inkling-Small按速度在其类别的101个模型中排名第7,而类别中位数为66。
• 首次令牌生成时间——1.63秒对1.84秒。确实有差距,但优势不大。
• 每1M tokens的混合价格 — 按其权重计算为0.22美元,对比0.72美元。成本约为三分之一,但指数点低一分。
• 智能排名 — 在101个中排名第15,同级中位数得分为25分。明显高于平均水平,但远未接近前沿。
• 冗长——但这里有个问题。它在处理索引时消耗了1.3亿个输出token,而中位数是1亿个。Artificial Analysis自己的总结称其“速度显著,但有些冗长”。它比典型模型多思考约30%,这无形中抵消了部分按token计价的折扣。
一条小小的备忘说明,因为任何对比来源的人都会注意到:Artificial Analysis 列出的参数总量为 266B,而公告、两份模型卡以及 OpenRouter 均标注为 276B。我们在全文中统一采用 276B。这不会改变任何结论,但在你于设计文档中引用某个数字之前,这类差异值得了解。
你今天实际能租到的,并不是规格表上说的那样
开源权重发布与实际可用端点之间的差距,正是大多数发布报道停止关注的地方。Thinking Machines 宣传其上下文窗口最高可达 100 万 token,Artificial Analysis 也标明为 100 万。在 OpenRouter 上,目前提供 Inkling-Small 的两家服务商都将其上限设为524,288 个 token——即宣传数字的一半。这与其说是矛盾,不如说是架构支持的能力与生产环境中实际部署之间的差异。相比之下,旗舰版 Inkling 确实有一个端点支持完整的 1,048,576 个 token,但同一端点将补全输出限制在 32,768 个 token。
实时画面的其余部分,从 OpenRouter 的端点数据中读取:
• 两家提供商,两种价格——一家对每百万输入 token 收 0.45 美元、每百万输出 token 收 1.20 美元,另一家则是 0.50 和 1.20 美元。Artificial Analysis 显示 Thinking Machines 自家的第一方价格更低,为 0.30 和 1.20 美元,缓存输入为 0.06 美元。第三方托管对相同模型权重的输入收取 50–67% 的溢价。
• Prompt caching — $0.10 per 1M cached input tokens via OpenRouter, against $0.17 for the flagship.
• 您租用的数值并不是基准测试得出的数值——模型卡列明的是 BF16 和 NVFP4。较便宜的端点提供 fp8,另一个端点则完全未声明量化方式。供应商的基准测试分数并非在 fp8 服务这些权重时测得,而量化对长时间智能体运行的影响,恰恰是 0.9 分的 Terminal-Bench 优势所无法承受的。如果您要复现某个数值,请注明您使用的是哪个端点。
• 各提供商的功能覆盖参差不齐——两个端点都公开了 reasoning 和 reasoning_effort,所以五档思考旋钮可以正常工作。但只有一个提供商宣称支持 tool calling 和 logprobs,并且 目前两者都没有宣传支持 response_format,也就是结构化输出/JSON 模式的参数。旗舰型号 Inkling 有一个端点支持这一点。如果你的流水线依赖 schema 强制约束的 JSON,这个细节第一天就会让你栽跟头,而且这是提供商限制,而非模型限制。
• 补全上限 — fp8 端点为 262,144 个 token;另一个则无上限。
基于实测令牌计数的成本情况
按百万token计价并不是比较推理模型的好方法,因为真正的变量在于它们思考时烧掉了多少token。Artificial Analysis 发布的是实际支出,这才是更好的衡量工具:让 Inkling-Small 跑完整个 Intelligence Index 大约消耗了1.3亿输出token,花费$192.37,折合约每任务$0.07(按他们的加权平均计算)。
将此与人们实际部署的模型的同一指标进行对比:DeepSeek V4 Flash每个任务$0.03,gpt-oss-120b为$0.08,Gemini 3.6 Flash为$0.56,GLM-5.2为$0.57,Kimi K3为$0.86,GPT-5.6 Sol为$1.23,Claude Opus 5为$2.34,Claude Fable 5为$3.15。Inkling-Small是该组中第二便宜的模型,每个任务比GPT-5.6 Sol便宜约18倍,后者得分为59,而Inkling-Small为40。
还有一种更清晰的方式可以看出价格为何跌至当前水平。活跃参数从410亿降至120亿,降幅为3.4倍。输出价格从每百万4.05美元降至1.20美元,降幅为3.375倍。稀疏MoE的租用价格本质上就是其每token的计算成本,Thinking Machines正是据此定价,而不是按基准测试来定价。
关于你自己运行那项比较,有一点实用的提示:Inkling-Small 目前不在 OrcaRouter 目录中,所以你需要从它自己的端点租用它。你要拿来与它对比的闭源模型——GPT-5.6 Sol、Claude Opus 5、Gemini 3.6 Flash 以及那份列表中的其他模型——都在 OrcaRouter 上,只需一个密钥,按0% 加价访问,也就是说你支付的是各提供商的标价,没有任何额外加成。这对成本模型尤其重要:你填进电子表格的数字就是实际扣费的数字;当某家提供商降价时,我们这边当天就能反映出来,而不是要等到重新谈判之后。跨提供商的自动故障转移则解决了评估的另一半问题——也就是基线臂在运行中途宕机、悄悄污染你的数据。
它在开放权重模型中实际处于什么位置
对照旗舰产品来看,Inkling-Small 堪称一大胜利;但对照整个同类模型来看,它只是一个稳健的中游开放权重模型,而发布报道大多跳过了这第二种解读。
在Artificial Analysis Intelligence Index上,排在两款Inklings之前的模型包括:Claude Opus 5(61分)、Claude Fable 5(60分)、GPT-5.6 Sol(59分)、Kimi K3(57分)、Grok 4.5(54分)、GLM-5.2和Muse Spark 1.1(51分),以及Gemini 3.6 Flash(50分)。这在意料之中——那些都是前沿系统,其中大部分是封闭的,有几个规模非常庞大。
真正应该改变决策的是DeepSeek V4 Flash,它在总参数284B、激活参数13B的规模下得分50,而Inkling-Small为40——两者几乎属于同一规模级别,同样是开放权重的实惠之选,但每任务成本却不到后者的一半。如果你想要的是最便宜且性能足够的开放权重模型,独立数据指向的是那款,而不是这一款。此外,与Inkling-Small不同,它可通过OrcaRouter获取,因此用自己的工作负载测试该替代方案,只需更改模型字符串,而非进行一次采购流程。
Inkling-Small 拥有而 DeepSeek V4 Flash 所不具备的,是在同一套权重中原生支持音频和图像输入、五级思考档位,以及来自训练该模型的实验室所提供的 Tinker 微调。对于多模态智能体而言,这些才是真正的差异化优势,也是选择它的诚实理由——而不是排行榜上的分数。
谁应该搬走,谁应该留下?
这一决定划分得干净利落,这很不寻常,值得明确指出。
• 如果你正在运行编码智能体,请从 Inkling 切换到 Inkling-Small。 厂商数据在 SWE-bench Verified 和 Terminal-Bench 上都更偏向小模型,文档给出的原因是额外的 agentic RL(智能体强化学习);它的成本约为大模型的三分之一,token 返回速度快 1.66 倍。为了在最大思考强度下测得的一个指数点多付 3.3 倍,这个理由很难成立。
• 如果每次推理任务的成本是主要制约因素,那就迁移,只要你能接受指数上的40。每个任务0.07美元,加上第一方端点上每百万次缓存命中0.06美元,对于一款原生支持音频和视觉的模型来说,这是激进定价。
• 如果您正在进行微调,请移步。 276B/12B 模型的适配和服务成本远低于 975B/41B,而 Tinker 两者都支持。
• 如果你需要长音频,请继续使用 Inkling。这是本次发布中最严重的回退,而且它被埋在模型卡片里:旗舰版建议音频输入不超过 20 分钟,而 Inkling-Small 的卡片建议不超过 2 分钟。足足缩减了十倍。如果你要转录或推理会议内容,小模型无论价格如何都不是简单的替代品。
• 如果您需要从托管端点获取超过 512K 的上下文,或超过 262K 个 token 的补全,请继续使用。目前只有旗舰版提供完整的百万级上下文端点。
• 如果你需要强制 schema 的 JSON,就继续使用,无需自己编写验证和重试循环,直到某个提供商提供response_format给小型模型。
• 如果对抗鲁棒性是关键支撑,那就保持不变。 在FORTRESS对抗性测试中,71.6%对78.0%对于任何面向用户的产品都是错误的方向,而这是实验室自己的数据。
发射报道留下的三个未解问题
Inkling-Small 只是 Inkling 的蒸馏版本吗?
部分是,而关键恰恰在于不是的那部分。以 Inkling 为教师模型的同策略蒸馏是后训练的一个阶段,因此大量通用能力确实是被继承下来的。但这是一个独立架构的模型——42 层,而旗舰模型为 66 层,采用相同的路由拓扑:256 个专家中激活 6 个,外加 2 个共享专家,这意味着专家本身更窄而非更少。并且它接受了大约两周的智能体编码强化学习(agentic-coding RL),而教师模型从未有过。正是这最后一个阶段,使得蒸馏出的学生在编程基准测试上超过其教师模型,否则这种情况本不应发生。
我能实际自行托管它吗?
只有在真正的专业硬件上才能运行。276B参数在8位精度下权重约为276GB,在BF16下约为552GB,这还不算任何KV缓存——无论哪种方式,都需要多GPU节点,而不是工作站。稀疏MoE的优势在于推理成本而非内存占用;你需要存储全部276B参数,但只需用12B参数进行计算。该规格说明列出了SGLang、vLLM、TokenSpeed、Unsloth和Hugging Face Transformers作为支持的推理服务路径,并列出BF16和NVFP4数值格式。还要注意,目前两个托管端点提供的都是量化版本,因此以BF16自托管的“同一模型”不会与你测试过的API表现完全一致。
975B Inkling 还有存在的理由吗?
有三个,而且都很狭窄:完整的 100 万 token 服务上下文、超过两分钟的音频输入,以及更好的对抗性安全行为。值得注意的是,“它更聪明”并不确定地在这份清单上——在最大思考努力下,面对一组较小模型大多胜出的供应商基准,一个指数点并不能构成能力论证。在推出 975B 旗舰模型两周后,Thinking Machines 发布了这款让人难以推荐的模型。这要么是异乎寻常的坦率,要么是异乎寻常的速度,无论哪种方式,对实验室来说都是个好兆头。
接下来看什么
三件事将决定这次发布如何经得起时间的检验。是否会出现一个端点,提供所宣传的 1M 上下文,从而消除旗舰机型最明显的剩余优势;是否有人发布一份在同等投入下对这两个模型进行对比的独立比较,这是判断那一个指标点是否真实的唯一方法;以及 2 分钟音频推荐是训练限制还是服务端默认配置——因为如果是后者,留在更大模型上的最大理由便不复存在。在那之前,诚实的总结是:Thinking Machines 发布了一款模型,其价格为对手的三分之一,速度快三分之二,在自身证据中编码能力更强,在独立综合评分上略逊一筹,并且明显落后于一个同尺寸竞争对手——而大多数报道都没有提到该竞争对手。
