Inkling AI模型评测:Thinking Machines首款开放权重模型,测试与解析
Guides & Insights

Inkling AI模型评测:Thinking Machines首款开放权重模型,测试与解析

作者

Jim Song

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

这份 Inkling AI 模型评测仔细审视了前 OpenAI CTO Mira Murati 领导的初创公司 Thinking Machines Lab 的首发产品。Inkling 是一个开放权重的多模态专家混合 (MoE) 模型,拥有百万词元上下文窗口和一个可控的“思考强度”旋钮。它速度快、自托管成本低廉,专为定制化而非排行榜主导地位而打造。下文,我们将区分供应商自报的基准与独立测量,介绍其架构,展示如何运行,并详细说明谁应该(以及不应该)采用它。

截至:2026-07-16 — 发布后一天。这是一份基于研究的评测;对于任何如此新款的机型,目前尚无实际操作长期测试,我们在下文中标记了所有未经核实的数字。

对于构建者来说:如果你想同时试用Inkling和其他模型,OrcaRouter通过单个兼容OpenAI的端点为API可用的模型提供前端服务,因此你无需新的集成即可比较和切换。

- 太长不看版总结:Inkling 是一款真正能干且高效的开源模型,在微调和对成本敏感的部署场景中表现出色,但它并非前沿顶尖模型,其开发者对此直言不讳。如果你想要一个可定制、免版税且拥有超大上下文窗口的基础模型,它是2026年最值得关注的发布之一。但如果你追求当下最强的单一模型,请另寻他处。

- 它是什么: 一个开源权重(Apache 2.0)MoE推理模型。适用人群: 希望微调和自托管而不是为封闭前沿API付费的实践者。

关键要点

制造商和日期:Thinking Machines Lab;于2026年7月15日发布,是该实验室的第一个模型。

架构:稀疏MoE,总计975B/41B活跃参数,66层,权重中支持高达1M令牌上下文(通过托管API支持256K)。

许可证:Apache 2.0 — 完整权重已上传至 Hugging Face,可免费用于商业用途和自托管。

诚实的定位:该公司直接声明它“不是当今最强的模型,无论是封闭的还是开放的。”

独立评分: 在Artificial Analysis Intelligence Index上得分41/100——在97个模型中排名第10,领先于几个开源同行(参见下面的对比说明)。

费用: 权重可免版税自行托管;托管访问大约从每百万输入令牌 1.87 美元起。

注意:几乎所有头版基准测试都是由供应商自行报告的,未经独立审计。

Inkling背后是谁

- Founder box.Inkling 是来自Thinking Machines Lab(thinkingmachines.ai),由Mira Murati,前 OpenAI 首席技术官。该实验室在本次发布前一直相对隐秘运营,并采取了开放权重的立场,这与穆拉蒂前雇主的闭源旗舰模式形成对比。Thinking Machines 使模型本身货币化——收入通过其Tinker微调平台和第三方托管合作伙伴。这种商业模式是理解 Inkling 的关键:权重是免费的入门券,当你定制或扩展时,公司就能盈利。

什么是Inkling?

Inkling 是一个开放权重的、多模态的、专家混合的大语言和推理模型,由 Thinking Machines Lab 于2026年7月15日发布,并在宽松的 Apache 2.0许可证下发布,包含完整权重在 Hugging Face 上。

使这次发布引人注目的是其定位。Thinking Machines 没有宣称夺得前沿桂冠,而是将 Inkling 描述为一个多功能、高效、可定制的开放模型。在发布日罕见地坦诚承认,该公司表示 Inkling “并非当前最强模型,无论开源还是闭源。” 这种坦诚奠定了整篇评测的基调:Inkling 是一个旨在被适配、自托管和微调的工具,而不是一个基准奖杯。

来自《财富》和TechCrunch的报道呼应了这一解读。TechCrunch认为,Inkling在顶尖层面并不威胁OpenAI、Anthropic或谷歌,而是对中间层的开放权重托管提供商和微调平台形成压力。《福布斯》则将Murati的开放权重策略描述为更接近中国的开源模型打法(DeepSeek、Qwen、Kimi),而非美国的封闭式旗舰模型——这种“美国vs中国”的开放权重叙事贯穿了此次发布的多数评论。

架构和规格

{{1}}在底层,Inkling是一个稀疏混合专家变换器。每个token仅激活其参数的一小部分,这使得尽管总参数量很大,推理仍能保持高效。{{/1}}{{2}}详细信息记录在官方模型卡和Hugging Face博客中。{{/2}}

总参数量:975B

活跃参数: 41B(稀疏MoE)

层数:66层仅解码器Transformer

专家: 256个路由专家 + 2个共享专家;每个token从256个路由专家中选出6个(2个共享专家始终活跃)

路由: Sigmoid / aux-loss-free

注意: 混合型,5:1滑动窗口(局部)到全局;8 KV heads

位置编码: 已学习的 相对位置嵌入(非RoPE)

多模态:无编码器 — 音频作为dMel频谱图,图像作为40×40的块,直接馈入

额外功能:短卷积 (SConv);MTP层用于推测解码的

数值: BF16、MXFP8、NVFP4(NVIDIA Blackwell的NVFP4检查点)

上下文窗口: 最多1,000,000个令牌(在权重中),在托管API上为256K

更小的变体: Inkling-Small, 总计276B / 活跃12B (预览版,权重尚未发布)

一些设计选择使Inkling区别于标准的MoE:

专家级布局。采用256个路由专家加2个共享专家,每个token激活6个路由专家,共享对作为始终在线的“专家池”捕获通用计算,而路由专家则负责专业化。免辅助损失的Sigmoid路由避免了众多MoE设计中使用的负载均衡惩罚项。

相对位置嵌入,而非RoPE。 大多数现代长上下文模型倾向于使用旋转嵌入;而Inkling则采用了学习到的相对位置嵌入,在这种规模下是一个不寻常的选择。

无编码器的多模态。 与分别拼接独立的视觉/音频编码器不同,Inkling 直接将40×40的图像块和dMel音频频谱图输入到transformer堆栈中。这简化了流水线,也是该模型被描述为原生多模态的部分原因。

用于推测解码的MTP。多令牌预测(MTP)层作为内置起草器,无需单独的草案模型即可加速生成。

编者注 — 添加图示:一个 Inkling 层的带标签的框图 — 滑动窗口与全局注意力(5:1),256+2 专家路由器,其中突出显示 6 个活跃专家,SConv,以及 MTP 草稿头。

训练与“思考努力”旋钮

Inkling 在45万亿多模态token上进行了预训练,涵盖文本、图像、音频和视频,使用混合优化器(Muon用于大型矩阵权重,Adam用于其余部分),在NVIDIA GB300 NVL72系统上运行。训练后阶段采用了大规模异步强化学习,规模超过3000万+次部署,跨越两次长时间连续运行,从初始的合成数据监督微调开始引导。

一个显著特性是可控的推理努力参数,演示中该参数大致从0.2扫描到0.99,数值越高表示推理越多、成本也越高。这使得操作者可以在延迟和成本与思考深度之间进行权衡。以下所有基准测试数据均在努力值=0.99的条件下运行。

可控的思考努力:操作指南

在部署中,努力控制以 reasoning_effort 枚举的形式暴露,其级别为无 / 最低 / 低 / 中 / 高 / 极高 / 最大。没有唯一的“正确”设置——它是延迟、成本与质量权衡的一个实时杠杆。请将下表作为起始参考(相对指导;基准级质量在范围最高端测得):

无/极低。相对延迟和令牌成本:最低;最适合:分类、提取、格式化、路由、检索粘合

低。相对延迟和令牌成本:低;最适合:简短问答、简单摘要、大批量批处理作业

中等。相对延迟与令牌成本:适中;最适合:一般聊天、草稿、大多数代理工具调用

高。相对延迟和令牌成本:更高;最佳用途:多步骤推理、代码生成、分析

xhigh / 最大。相对延迟和代币成本:最高;最佳用于:硬数学、竞赛式推理、基准一致性(Effort=0.99)

你能在本地运行它吗?硬件和VRAM

由于Inkling是一个975B参数的模型,“本地”实际上意味着多GPU服务器,而非笔记本电脑。近似要求(根据发布报道和社区工具):

BF16(全精度)。合计VRAM约:~2 TB;示例配置:8× NVIDIA B300,或16× H200

NVFP4 (量化). 近似聚合 VRAM: ~600 GB; 示例配置: 4× NVIDIA B300, 或 8× H200

GGUF(社区)。大约聚合VRAM:取决于quant;示例配置:Unsloth GGUF构建可用于更小/量化占用空间

NVFP4检查点——专为NVIDIA Blackwell设计——比BF16减少了大约三分之二的内存开销,这相当于8-GPU和4-GPU B300节点之间的差异。对于大多数团队来说,这仍然指向托管服务提供商或租用的GPU节点,而不是自有硬件。Unsloth GGUF量化可以进一步降低硬件门槛进行实验,但会牺牲一些质量。

部署快速入门

Inkling 公开了一个 与OpenAI兼容的API,因此大多数现有客户端代码只需更改基础URL和模型名称即可直接使用。三种常见的服务路径如下:

vLLM — 单命令服务器(默认端口8000):

vllm serve thinkingmachines/Inkling --port 8000
# 然后调用 OpenAI 兼容的端点 http://localhost:8000/v1

SGLang — 分片到8个GPU(默认端口30000):

python -m sglang.启动服务器 \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000

Hugging Face transformers — 通过多模态自动类加载:

transformers 导入 AutoModelForMultimodalLM, AutoProcessor

模型 = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
处理器 = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# 传入 {none, minimal, low, medium, high, xhigh, max} 中的推理力度参数

由于该端点与OpenAI兼容,迁移现有应用通常只需将SDK指向新的基础URL并根据需要设置reasoning_effort即可。发布时还提供了其他运行时,包括TokenSpeed和Unsloth。

在哪里运行:推理提供者的可用性

如果您更愿意不管理GPU,多个合作伙伴托管Inkling。启动时的“Run Inkling on X”选项:

Tinker (Thinking Machines). 角色:微调;备注:64K 和 256K 上下文选项;限时发布优惠 50%(付费)

Together AI. 角色:托管推理;备注:兼容OpenAI的端点

Fireworks. 角色:托管推理;备注:

模态。角色: 托管推理 / 无服务器GPU; 备注:

Databricks. 角色: 托管推理; 备注: 通过Unity AI Gateway

Baseten。角色:托管推理;备注:

基准测试:厂商声称与独立测量对比

这是任何诚实评测中最关键的部分 Inkling review 2026,因为数字来自两个截然不同的地方。

免责声明:除人工分析指数(Artificial Analysis Index)外,下方的每个Inkling基准测试均由供应商在发布时自行报告(Effort = 0.99、temperature 1.0),且未经独立审计。竞争对手数据来自第三方(MarkTechPost、Artificial Analysis)或由Thinking Machines重新运行,同样未经独立审计。部分数据附有测试框架或子集限定词。请视这些数据为方向性参考,而非绝对真理。

供应商自我报告分数

根据Thinking Machines自己的发布材料:

AIME 2026 (数学): 97.1%

GPQA Diamond (科学推理): 87.2%

SWE-bench 已验证(编码,仅Bash测试框架):77.6%

SWE-bench Pro (Public): 54.3%

MMMU Pro (多模态): 73.3%

VoiceBench (音频): 91.4%

MMAU(音频):77.2%

IFBench(指令遵循):79.8%

Terminal Bench 2.1 (代理终端): 63.8

FORTRESS 对抗性: 78.0%

SimpleQA 已验证: 43.9%

从纸面数据看,这些表现确实亮眼,尤其是数学和科学推理方面的成绩。但该公司使用自行生成的分数,将Inkling与近未来的竞品版本(GPT 5.6 Sol、Claude Fable 5Gemini 3.1 ProDeepSeek V4 Pro、Kimi K2.5/K2.6、GLM 5.2、Nemotron 3 Ultra)进行了对标。这些竞品的分数可能与其各自官方公布的数据不一致,因此对于直接对比的结果应谨慎看待。

多模型直接对决(开源权重对手)

对比Inkling与其他开源权重模型最清晰的方式来自MarkTechPost的对比表格(如下所示,来源为MarkTechPost)。该表格非常有价值,因为它将竞争对手放在同一个框架中:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026。Inkling:97.1%;Nemotron 3 Ultra:94.2%;Kimi K2.6:96.4%;GLM 5.2:99.2%;DeepSeek V4 Pro:96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. 未经独立审计.

模式清晰,与Thinking Machines自身的谦逊一致。Inkling 在FORTRESS上领先(对抗性安全),并在全方位击败Nemotron 3 Ultra,但它落后于GLM 5.2、Kimi K2.6和DeepSeek V4 Pro在HLE、SWE-bench Verified,尤其是Terminal Bench 2.1(63.8%对比GLM 5.2的82.7%)。如果智能体编程和终端任务是您的优先事项,那么今天领先的中国开源模型更胜一筹。

独立测量 (Artificial Analysis)

为了获得更中立的解读,Artificial Analysis 于2026年7月15日对Inkling进行了评估,将其评定为在其智能指数中得分为41/100,在97个模型中排名第10。关于如何公平看待这一排名的两点说明:

这是一个强开放模型的展示,并非整体第一。 根据Artificial Analysis,Inkling的指数41位于领先于Nemotron 3 Ultra (38)、Gemma 4 31B (29)和gpt-oss-120b (24) ——因此在开放权重同行中具有竞争力乃至领先地位。但在97个模型中排名第10,意味着整体上有九个模型排名更高,这与“有能力,但非前沿”的框架一致。

效率是它的突出之处。Artificial Analysis 指出其强大的词元效率——完成其评估集大约需要25K词元,而对比模型需要37-43K——以及GDPval-AA v2 Elo为1238,领先于Kimi (1190)和DeepSeek V4 Flash (1189),并且在AA-Omniscience上略微领先(+2)。

输出速度测得72.7 tokens/sec,首token延迟为1.75秒。简而言之:这是一个可敬的前十名位置,且确实高效——但我们刻意避免将其夸大为排行榜上的胜利。

多模态和长上下文能力

Inkling 接受文本(UTF-8)、图像(通过分层补丁编码器,40 像素到 4096 像素)和音频(16kHz WAV,最长约 20 分钟,使用离散令牌编码)。输出仅为文本——没有图像或音频生成,因此请将其视为理解模型,而非生成模型。视频在预训练中使用过,但是启动时支持或评估的输入,所以暂时不要将其纳入计划。

其最具代表性的能力是百万token的上下文窗口,已体现在发布的权重中。这使得无需激进的分块即可进行全仓库代码分析、长文档合成以及扩展的多轮智能体会话。注意实际运用中的细微差别:托管API最多支持256K token,因此完整的百万token目前属于自托管功能。结合滑动窗口注意力设计和推测解码,长上下文能力依然是Inkling最实用的卖点之一。

定价、等级和总拥有成本

Inkling是真正开放的。完整的权重(一个BF16检查点和一个NVFP4检查点)在Hugging Face上,采用Apache 2.0许可证,所以自托管免版税——你只需支付计算费用。Thinking Machines不通过模型本身盈利;收入通过Tinker和第三方托管方产生。

托管式每令牌定价(根据Artificial Analysis),按上下文层级:

64K。输入/1M:$1.87;缓存输入/1M:$0.374;输出/1M:$4.68

256K。输入/1M: $3.74; 缓存输入/1M: $0.748; 输出/1M: $9.36

反映限时50%的发布折扣;确切的Tinker每token数据存在于文档中,并将有所变化。

自托管与 API——如何思考总拥有成本。 经济性取决于使用量和利用率:

API(Tinker / 合作伙伴):零固定成本,按 token 付费,近乎即时启动。最适合低量或波动性大的用量,或在原型开发时使用。

自托管(租赁或自有的GPU):无论是否繁忙,您都需要为一个4–8 GPU节点付费,但边际Token成本接近于原始电力成本。由于Inkling仅激活410亿参数且Token效率高(根据Artificial Analysis数据集约为2.5万个Token,而其他模型为3.7万–4.3万个),每GPU小时的吞吐量具有优势,且一旦节点得到充分利用,繁重且稳定的工作负载的实际成本可能远低于按Token计费的API定价。围绕发布的评论指出,自托管开放权重在大规模使用下比类似的封闭API使用便宜约40–60%——这是一项方向性声明,而非经过审计的数据。

编者注 — 添加示意图:一张盈亏平衡图——月度代币量(x轴)与总成本(y轴),包含三条线:封闭前沿API、Inkling托管API以及在租用GPU节点上自行托管的Inkling——展示自行托管胜出的交叉点。

安全、对齐和审查

安全是Inkling更强大且更具差异化的故事之一。在FORTRESS adversarial基准测试中它得分78.0%——是开放权重模型中最好的,在MarkTechPost的比较中,超越了GLM 5.2(71.3%)、Kimi K2.6(65.6%),并远超DeepSeek V4 Pro(36.0%)。Thinking Machines还强调了模型输出中的校准不确定性。

VentureBeat 的报道强调了一个相关特性:抵制审查。结合宽松的 Apache 2.0 许可证,这使得 Inkling 成为一个开放模型,团队可以将其调整为自己的政策,而不是继承一个不透明的、由供应商强加的内容机制——这对于受监管或特定区域的部署来说是一个有意义的考量。与发布当天的模型一样,在撰写本文时,尚未出现独立的红队或第三方安全审计,因此请将 FORTRESS 的相关信息视为来自供应商/第三方,而非经外部认证。

你应该微调Inkling吗?

微调可以说是Inkling存在的理由。一个快速决策框架:

进行微调(通过 Tinker 或您自己的流水线),如果:您拥有专有数据、狭窄领域或任务,其中较小的专用模型胜过通用模型;您需要拥有权重;或者您希望融入特定的语气、格式或政策。64K/256K 的 Tinker 上下文选项和发布折扣降低了门槛。

如果出现以下情况,请仅使用基础模型(自托管或 API):你的任务是通用型、量小,或尚未验证微调能提升指标。提示工程加上 reasoning_effort 调节通常就能满足需求。

如有以下需求,请另寻他处:您需要当前前沿级别的智能体编码能力(GLM 5.2 和 Kimi K2.6 在这些基准测试中领先)或者您要求经过独立审计的质量保证。

优点与缺点

优点

完全开放的权重根据Apache 2.0,免版税自托管且免费用于商业用途。

高效的稀疏MoE(仅41B活跃参数)加上强大的token效率,使得推理成本和速度保持竞争力。

巨大的1M-token上下文在权重中(通过API为256K)。

真正的多模态(文本、图像、音频输入)。

可调节的推理努力拨盘(无→最大),用于实时成本/质量权衡。

最佳级别的开放权重对抗性安全(根据MarkTechPost,FORTRESS 78.0%)以及“抵抗审查”。

强大的独立地位——在人工分析指数(Artificial Analysis Index)的97个项目中排名前十,领先于Nemotron 3 Ultra、Gemma 4 31B和gpt-oss-120b。

缺点

明确地不是一个前沿模型,据制造商自己承认。

Trails 在智能体和编码基准测试(Terminal Bench 2.1, SWE-bench Verified, HLE)上领先于开源对手(GLM 5.2, Kimi K2.6, DeepSeek V4 Pro)。

大多数基准测试由供应商自行报告,未经独立审计。

仅文本输出;无图像/音频生成;启动时无视频输入;Inkling-Small 仍处于预览阶段。

真正的“本地”使用需要一个多GPU节点(即使量化也需要大约600GB显存)。

在发布时,没有出现任何实质性的独立批判性审查或安全/红队审查。

谁应该使用Inkling?

Inkling 非常适合那些希望拥有并定制自己的模型而不是租用一个封闭的API。理想的使用场景包括:

微调团队通过Tinker或自己的流水线构建领域特定模型。

成本敏感、高容量部署其中免版税的自托管优于按token的前沿定价。

长上下文工作负载,例如覆盖全仓库的代码辅助、文档分析以及长时间的智能体会话。

多模态应用需要结合文本、图像和音频理解。

政策敏感部署想要一个强安全、抗审查的开放基础来调整自身。

如果您需要绝对最强的推理或智能编码性能,需要视频输入或生成式输出,或者在部署前需要独立审计的基准测试,那么它并不合适。

结论与最终评分

让我们直接面对大象:Inkling并不是当今最强的模型,而Thinking Machines正是这么说的。愤世嫉俗地读,这是一个低标准。公正地读,这正是重点——Inkling针对与登顶排行榜不同的目标进行了优化。它高效(41B活跃参数,约25K token任务预算),开源许可(Apache 2.0),按开放权重标准安全(FORTRESS 78%),并且专为微调和自托管而构建。这种组合使其成为2026年最深思熟虑的开源模型发布之一,尽管在最难的智能体和编码基准测试上落后于GLM 5.2和Kimi K2.6。

剩余的注意事项是,这些基准测试很大程度上是自我报告的,而且现阶段缺乏任何独立的批判性审查。但对于其目标受众——那些更看重所有权、定制化、成本控制和大上下文窗口,而非前沿炫耀权利的构建者——Inkling 能够满足需求。

评分:4/5 对于其目标受众(构建者和微调者)而言;如果严格追求前沿能力,则评分较低。

常见问题

Inkling是什么,由谁制造? Inkling是由Mira Murati(前OpenAI CTO)领导的AI初创公司Thinking Machines Lab推出的首个模型。它于2026年7月15日上线,是一个开放权重、多模态的混合专家推理模型。

Inkling 是最好的 AI 模型吗? 不,公司并未声称它是最佳的——它声明 Inkling“不是目前可用的最强模型,无论是闭源还是开源。”独立评测(Artificial Analysis)将其总体排名为第10名(共97个),尽管它领先于几个开源同行。

Inkling有多少个参数,上下文窗口是多少?总共975B,其中41B激活(稀疏MoE),跨越66层。在发布的权重中,上下文窗口可达1,000,000个token,在托管API上可达256K。

Inkling 是开源的吗?许可证是什么? 权重依据 Apache 2.0 发布,允许商业使用和自托管。它是“开放权重”——完整的模型权重在 Hugging Face 上。

Inkling 可以免费使用吗?权重可免费且免版税地自托管。在 Tinker 上进行微调以及通过 Together AI、Fireworks、Modal、Databricks 或 Baseten 等服务商提供的托管推理服务为付费服务。托管访问起价约为每百万输入令牌 1.87 美元(限时发布折扣)。

如何运行或下载 Inkling,以及需要什么硬件? 从 Hugging Face 下载权重,并通过兼容 OpenAI 的 API 使用 vLLM、SGLang 或 Hugging Face transformers 来提供服务。预计需要大约 2TB 的聚合 VRAM(BF16 格式下为 8× B300 / 16× H200),或约 600GB(NVFP4 量化检查点下为 4× B300 / 8× H200)。社区版 Unsloth GGUF 构建进一步降低了实验门槛。

如何微调Inkling?使用Thinking Machines的Tinker平台,该平台提供64K和256K上下文选项以及限时发布50%折扣,或者在自己流程中微调开放权重。

什么是可控思考努力?一个 reasoning_effort 设置(none / minimal / low / medium / high / xhigh / max),用于在延迟和令牌成本与推理深度之间进行权衡。低努力适用于分类和提取;最大努力适用于复杂数学问题,并与基准配置(Effort=0.99)匹配。

Inkling与Kimi、GLM、DeepSeek和Nemotron相比如何?根据MarkTechPost的比较,Inkling在FORTRESS(安全性)方面领先,并在整体上击败了Nemotron 3 Ultra,但在Terminal Bench 2.1、SWE-bench Verified和HLE上落后于GLM 5.2、Kimi K2.6和DeepSeek V4 Pro。它具有竞争力,但并非在代理编程方面最强的开放模型。

Inkling 能否处理图像、音频和视频? 它接受文本、图像(40px–4096px)和音频(16kHz WAV,最长约20分钟)作为输入。输出仅为文本——不生成图像或音频。视频曾用于预训练,但上线时并非支持的输入。

Inkling 的基准测试分数是否可靠?请谨慎对待。除了独立的 Artificial Analysis Intelligence Index 外,这些首要数据均由供应商在发布时自行报告,且未经独立审核。竞争对手的数据来自第三方(MarkTechPost)或由 Thinking Machines 重新运行,可能与对手自己报告的数字存在出入。

什么是 Inkling-Small,其路线图是什么? Inkling-Small 是一个较小的变体(总计276B / 活跃12B)。截至发布时,它仍处于预览阶段,权重尚未发布。主模型已经内置了用于投机解码的 MTP 层。



本文中的对比2

根据本文内容识别 · 基准测试:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服务商

运营推理平台?让您的模型上线 OrcaRouter。

联系我们

加入我们的社区

DiscordEmailXGitHubYouTube