Inkling AI 模型評測:Thinking Machines 的首個開放權重模型,已測試與解析
Guides & Insights

Inkling AI 模型評測:Thinking Machines 的首個開放權重模型,已測試與解析

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

这个Inkling AI 模型评测仔細審視了 Thinking Machines Lab 的首個發布版本。該實驗室由 OpenAI 前 CTO Mira Murati 領導。Inkling 是一個開放權重、多模態的專家混合(MoE)模型,具有 100 萬個 token 的上下文視窗和一個可控制的「思考強度」調節旋鈕。它速度快、自託管成本低,並且專為定製化而非排行榜主導地位而設計。下面,我們將供應商自行報告的基準測試與獨立測量區分開來,梳理其架構,展示如何運行它,並詳細說明哪些人應該(以及不應該)採用它。

截至日期:2026年7月16日——上市後一天。這是一篇基於研究的評測;對於如此新的型號,目前尚無長期實際測試,我們會標註下方所有未經證實的數據。

給建構者的提示:如果您想與其他模型一起嘗試 Inkling,OrcaRouter提供了一個單一的 OpenAI 相容端點來代理可透過 API 使用的模型,因此您可以進行比較和切換,而無需新的整合。

- TL;DR 結論:Inkling 是一個真正有能力且高效能的開放模型,在微調和成本敏感的部署方面表現出色,但它並非前沿領導者,且其開發者也公開承認這一點。如果你想要一個可自訂、免版稅且具有超大上下文視窗的基礎模型,那麼它是2026年最有趣的發布之一。如果你想要目前最強大的單一模型,請另尋他處。

- 這是什麼: 一個開放權重(Apache 2.0)MoE推理模型。 適用對象: 希望進行微調和自託管而非付費使用封閉前沿API的實踐者。

關鍵要點

製造商與日期:Thinking Machines Lab;於2026年7月15日發布,作為該實驗室的第一個模型。

架構:稀疏 MoE,總共975B / 41B活躍參數,66層,權重中最多1M-token的上下文(通過託管API可達256K)。

授權條款:Apache 2.0 — 完整權重於Hugging Face,免費供商業使用及自行託管。

誠實定位:該公司直接表明,它「不是目前最強大的模型,無論是封閉還是開放。」

獨立評分:在 Artificial Analysis Intelligence Index 上獲得41/100 — 在97個模型中排名第10,並領先於數個開源同儕(詳見下方對賬)。

費用:權重可免版稅自行託管;託管存取費用約為每1M輸入代幣1.87美元起。

注意:几乎所有主要基准测试都是由供应商自行报告且未经独立审计。

誰是 Inkling 的幕後推手

- Founder box.Inkling 是首個來自Thinking Machines Lab(thinkingmachines.ai),由Mira Murati,曾任OpenAI首席技術官。該實驗室在本次發布前相對低調運作,並採取了開放權重的立場,與Murati前東家的封閉旗艦模式形成對比。Thinking Machines 並貨幣化模型本身——收入通過其Tinker微調平台和第三方託管合作夥伴。這個商業模式是理解Inkling的核心:權重是免費的入門途徑,當你自定義或擴展時,公司便會獲利。

什麼是Inkling?

Inkling 是一個開放權重、多模態、專家混合的大型語言與推理模型,由 Thinking Machines Lab 於 2026 年 7 月 15 日宣布,並在寬鬆的Apache 2.0授權下發布,完整權重在 Hugging Face 上提供。

這次發布之所以引人注目,在於其定位框架。Thinking Machines 並未宣稱奪得前沿王冠,而是將 Inkling 描述為一個多功能、高效、可自訂的開放模型。在發布日當天,該公司罕見地坦承,Inkling 「並非目前最強大的模型,無論封閉或開放皆是如此。」這份誠實為整篇評測定下了基調:Inkling 是一個設計用於適應、自託管和微調的工具,而非用來爭奪基準測試獎盃的模型。

{{1}}來自《財星》與TechCrunch的報導呼應了這種解讀。TechCrunch認為Inkling在尖端模型領域並不威脅OpenAI、Anthropic或Google,而是對開放權重託管供應商與微調平台的中層市場形成壓力。《富比士》則將Murati的開放權重策略定位為更貼近中國開源模型套路(DeepSeek、Qwen、Kimi),而非美國封閉式旗艦產品——這種「美中開放權重對立」的敘事貫穿多數上市評論。{{/1}}

架構與規格

在底層,Inkling 是一個稀疏混合專家轉換器(sparse Mixture-of-Experts transformer)。每次只有一小部分參數針對每個詞元(token)激活,這使得儘管總參數數量龐大,推理效率依然很高。詳細資訊記錄在官方模型卡和 Hugging Face 部落格中。

總參數: 975B

活躍參數: 41B (sparse MoE)

層數: 66層僅解碼器變換器

專家:256個路由 + 2個共享;每個令牌有256個路由中的6個(2個共享始終處於活動狀態)

路由: Sigmoid / 无辅助损失

注意:混合,5:1 滑動窗口(局部)到全域;8 個 KV heads

位置編碼: 學習的 相對位置嵌入 (not RoPE)

多模态:无编码器 — 音频以dMel频谱图表示,图像以40×40的图块表示,直接输入

額外功能:短卷積(SConv);MTP層用於推論解碼

数值类型: BF16, MXFP8, NVFP4 (NVFP4 checkpoint for NVIDIA Blackwell)

上下文窗口:在權重中最多1,000,000個token(託管API上為256K)

较小变体:Inkling-Small, 总参数量276B / 活跃参数量12B (预览版,权重尚未发布)

一些設計選擇使得 Inkling 有別於標準的 MoE:

專家佈局。擁有256個路由專家加2個共享專家,且每個令牌觸發6個路由專家,共享專家對作為一個始終在線的「專家接收池」,在路由專家進行專門化時捕獲共通計算。無輔助損失的sigmoid路由避免了許多MoE設計中所使用的負載平衡懲罰項。

相对位置嵌入,而非RoPE。 大多数现代长上下文模型依赖旋转嵌入;而Inkling则使用学习到的相对位置嵌入,在这种规模下这是一个不寻常的选择。

無編碼器多模態。與其附加單獨的視覺/音訊編碼器,Inkling 直接將40×40圖像塊和dMel音訊頻譜圖輸入Transformer堆疊。這簡化了管線,也是該模型被描述為原生多模態的部分原因。

用於推測解碼的MTP。多Token預測(MTP)層作為內建草擬器,無需獨立草稿模型即可加速生成。

編輯註記 — 添加視覺元素:一個 Inkling 層的標註方塊圖 — 滑動窗口 vs 全局注意力(5:1)、256+2 專家路由器(突出顯示6個活躍專家)、SConv 以及 MTP 草稿頭。

訓練與「思考努力」轉盤

Inkling 是預訓練於45 兆多模態令牌涵蓋文本、圖像、音頻和視頻,使用混合優化器(Muon 用於大型矩陣權重,Adam 用於其餘部分)在 NVIDIA GB300 NVL72 系統上。訓練後使用大規模異步強化學習,擴大規模超過30M+ 次推演跨越兩次長時間的連續運行,從對合成數據的初始監督微調開始。

一個獨特的特點是可控制的推理努力參數,展示為從大約0.2到0.99的掃描,其中較高的值意味著更多的推理和更高的成本。這讓操作者在延遲和花費與思考深度之間進行權衡。以下所有基準測試數據都是在努力值=0.99下運行的。

可控思維努力:操作指南

在部署中,努力控制暴露为一个名为 reasoning_effort 的枚举,其级别为 none / minimal / low / medium / high / xhigh / max。没有单一的“正确”设置——它是一个用于延迟-成本-质量权衡的实时调节杠杆。使用下表作为起始参考(相对指导;基准级质量在范围顶部测量):

無/最小。相對延遲與代幣成本:最低;最佳用途:分類、提取、格式化、路由、檢索粘合

低。相對延遲與代幣成本:低;最佳用途:簡短問答、簡單摘要、大批量批次作業

中等。相對延遲與代幣成本:中等;最適合:一般聊天、草稿、大多數代理工具調用

高。相對延遲與Token成本:較高;最適合:多步驟推理、程式碼生成、分析

xhigh / max. 相對延遲與 token 成本:最高;最佳用途:難數學、競賽式推理、基準表現一致(Effort=0.99)

可以在本地執行嗎?硬體與VRAM

由於Inkling是一個975B參數的模型,「本地」實際意味著多GPU伺服器,而非筆記型電腦。大致需求(根據發布報導和社群工具):

BF16 (完整模式)。約略總計 VRAM: ~2 TB; 範例配置: 8× NVIDIA B300,或 16× H200

NVFP4 (量化)。近似總VRAM: ~600 GB; 範例配置: 4× NVIDIA B300, 或 8× H200

GGUF (社群)。大約總計VRAM:因量化而異;範例配置:存在適用於較小/量化佔用空間的Unsloth GGUF構建

NVFP4檢查點——專為NVIDIA Blackwell推出——將記憶體開銷比BF16減少約三分之二,這正是8-GPU與4-GPU B300節點之間的差異。對多數團隊而言,這仍指向使用託管供應商或租用GPU節點,而非自有硬體。Unsloth GGUF量化則進一步向下延伸硬體階梯,以便進行實驗,但代價是部分品質損失。

部署快速入門

Inkling 提供了一個 OpenAI 相容的 API,因此大多數現有的客戶端代碼只需更改基礎 URL 和模型名稱即可直接使用。三種常見的服務路徑:

vLLM — 单命令服务器(默认端口8000):

vllm serve thinkingmachines/Inkling --port 8000
# 然後呼叫位於 http://localhost:8000/v1 的 OpenAI 相容端點

SGLang — 跨 8 個 GPU 分片(預設連接埠 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — 通過多模態自動類別加載:

transformers 導入 AutoModelForMultimodalLM, AutoProcessor

模型 = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
處理器 = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# 傳入 reasoning_effort 參數,可選值 {none, minimal, low, medium, high, xhigh, max}

由於此端點與 OpenAI 相容,遷移現有應用程式通常只需將 SDK 指向新的基礎 URL,並根據需要設定 reasoning_effort。上市時的其他運行環境包括 TokenSpeed 和 Unsloth。

在哪裡執行:推理提供者可用性

如果您不想管理GPU,有幾個合作夥伴代管Inkling。發布時的「在X上執行Inkling」選項:

Tinker(Thinking Machines)。角色:微調;備註:64K和256K上下文選項;50%限時上線折扣(付費)

Together AI。角色: 託管推論; 備註: OpenAI相容端點

煙火。角色:託管推理;備註:

模態。角色: 託管推理 / 無伺服器 GPU; 備註:

Databricks。角色: 託管推理; 備註: 透過 Unity AI Gateway

Baseten. 角色: 託管推論; 備註:

基準測試:廠商宣稱 vs. 獨立測量

這是任何誠實的 Inkling review 2026, 因為數字來自兩個非常不同的地方。

披露:除了人工分析指数(Artificial Analysis Index)之外,下文所有的Inkling基准均为供应商在发布时自行报告(Effort = 0.99,温度1.0),且未经独立审计。竞争对手数据来自第三方(MarkTechPost、Artificial Analysis),或由Thinking Machines重新运行,同样未经独立审计。部分数据附有测试框架或子集限定符。请将所有数据视为参考方向,而非绝对真理。

廠商自評分數

根據Thinking Machines自己的發布資料:

AIME 2026(數學):97.1%

GPQA Diamond (科学推理):87.2%

SWE-bench Verified(程式碼,僅 bash 測試環境):77.6%

SWE-bench Pro (Public): 54.3%

MMMU Pro (multimodal): 73.3%

VoiceBench (音訊): 91.4%

MMAU(音訊):77.2%

IFBench(指令遵循):79.8%

Terminal Bench 2.1 (代理終端): 63.8

FORTRESS 對抗性: 78.0%

SimpleQA 已驗證:43.9%

從紙面上看,這些數據很強勁,尤其是數學和科學推理的數字.但該公司將 Inkling 與近未來的競爭對手版本 (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) 使用的是自己生成的評分.這些競爭對手的數字可能與對手自己報告的數據不符,因此在進行直接比較時應謹慎解讀.

多模型正面對決(開放權重競爭對手)

從其他開放權重模型的並排比較來看,最清晰的是來自MarkTechPost的比較表(如下所示,來源為MarkTechPost)。它之所以有用,正是因為它將競爭對手放在同一個框架中:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS(對抗性)。Inkling:78.0%;Nemotron 3 Ultra:77.6%;Kimi K2.6:65.6%;GLM 5.2:71.3%;DeepSeek V4 Pro:36.0%

MarkTechPost。未經獨立審計。

这种模式很清晰,且符合Thinking Machines自身的谦逊。Inkling 在FORTRESS上领先(对抗性安全)并全面击败Nemotron 3 Ultra,但它 落后于GLM 5.2、Kimi K2.6和DeepSeek V4 Pro在HLE、SWE-bench Verified上,尤其是在Terminal Bench 2.1上(63.8%对比GLM 5.2的82.7%)。如果你的重点是代理编程和终端任务,那么领先的中国开源模型今天更胜一筹。

獨立評測 (Artificial Analysis)

為了更中立的解讀,Artificial Analysis 於2026年7月15日評估了Inkling,並將其評為 41/100 在其Intelligence Index上,在97個模型中排名第10。關於如何公正地解讀這個排名的兩點說明:

這是一個強大的開源模型表現,但並非整體第一。根據Artificial Analysis,Inkling的指數為41,領先於Nemotron 3 Ultra(38)、Gemma 4 31B(29)和gpt-oss-120b(24)——因此在開放權重同行中,它具有競爭力甚至領先。但排名第97中的第10位意味著有9個模型整體排名更高,這與「有能力,但不是前沿」的定位一致。

效率是它的突出優勢。 Artificial Analysis 指出其強大的 token 效率——完成評估集約需 25K token,而對比模型則需 37–43K——以及 GDPval-AA v2 Elo 分數 1238,領先 Kimi (1190) 和 DeepSeek V4 Flash (1189),並在 AA-Omniscience 上略佔優勢(+2)。

輸出速度為每秒72.7個token,首個token的生成時間為1.75秒。簡而言之:這是一個值得尊敬的排名前十的成績,且效率確實很高——但我們刻意避免將其誇大為排行榜上的勝利。

多模態與長上下文能力

Inkling 接受文字(UTF-8)、圖片(透過分層區塊編碼器,尺寸從 40px 到 4096px)以及音訊(16kHz WAV,最長約 20 分鐘,使用離散標記編碼)。輸出僅限文字——不包含圖片或音訊生成,因此請規劃為理解模型,而非生成模型。影片在預訓練階段曾使用,但不是上線時支援或評估的輸入類型,目前請勿將其納入規劃。

首當其衝的功能是100萬token的上下文窗口,在已發布的權重中,這為無需過度分塊即可進行整個代碼庫分析、長文檔合成以及擴展的多輪智能體對話打開了大門。注意實際上的微妙之處:託管API最多提供256K個token,因此完整的100萬token目前是自託管功能。結合滑動窗口注意力設計和推測解碼,長上下文能力仍然是Inkling最實用的賣點之一。

定價、層級與總持有成本

Inkling 是真正開放的。完整權重(一個 BF16 檢查點加上一個 NVFP4 檢查點)位於Hugging Face,根據 Apache 2.0 許可,因此自行托管免版稅 — 你只需支付計算費用。Thinking Machines 本身不通過模型盈利;收入通過 Tinker 和第三方托管方流動。

按代幣計價的託管價格(根據 Artificial Analysis), 按上下文級別:

64K. 輸入 / 1M: $1.87; 快取輸入 / 1M: $0.374; 輸出 / 1M: $4.68

256K。輸入 / 1M:$3.74;快取輸入 / 1M:$0.748;輸出 / 1M:$9.36

反映限時上市折扣50%;確切的Tinker每代幣數字在文檔中實時顯示,並將有所變動。

自托管 vs API —— 如何思考TCO.經濟因素取決於使用量與利用率:

API(Tinker / 合作伙伴):零固定成本,按 Token 計費,近乎即時啟動。適合低量或波動量,或在原型開發階段使用。

自托管(租用或自有GPU):無論節點是否忙碌,您都需要為4–8個GPU節點支付費用,但邊際代幣成本接近基礎電力成本。由於Inkling僅啟動410億參數且代幣效率高(根據Artificial Analysis數據集,約2.5萬 vs 3.7–4.3萬),每GPU小時的吞吐量是划算的,一旦節點得到充分利用,穩定且繁重的工作負載在成本上可以顯著低於按代計費的API定價。圍繞發布的評論指出,自托管開放權重在大規模使用時比類似的封閉API使用便宜約40–60%——這是一個方向性的說法,並非經過審計的數據。

編輯註記 — 請加入視覺圖表:一張損益平衡圖 — 橫軸為月度代幣量 (x)、縱軸為總成本 (y),包含三條線:封閉前沿 API、Inkling 託管 API、以及 Inkling 自託管於租用 GPU 節點 — 顯示自託管勝出的交叉點。

安全、對齊與審查

安全性是Inkling最強且最具差異化的故事之一。在FORTRESS adversarial基準測試中,它獲得了78.0%—這是開放權重模型中的最佳表現,在MarkTechPost的比較中領先GLM 5.2 (71.3%)、Kimi K2.6 (65.6%),並大幅領先DeepSeek V4 Pro (36.0%)。Thinking Machines也強調模型輸出中的校準不確定性。

VentureBeat 的報導強調了一個相關特性:抵抗審查的能力。加上寬容的 Apache 2.0 授權,這使 Inkling 成為一個開放的模型,團隊可以根據自己的政策進行調整,而不是繼承一個不透明、由供應商強加的內容制度——這對於受監管或特定地區的部署來說是一個重要的考量。與任何發佈當天的模型一樣,在撰寫本文時,尚未出現獨立紅隊或第三方安全審計的結果,因此請將 FORTRESS 的領先地位視為供應商/第三方來源,而非外部認證。

你應該微調 Inkling 嗎?

微調可以說是Inkling存在的原因。一個快速的決策框架:

微調(透過 Tinker 或你自己的管道)如果: 你擁有專有數據、狹窄領域,或者一個較小的專門模型勝過通用模型的任務;你需要擁有權重;或者你想要注入特定的語氣、格式或政策。64K/256K 的 Tinker 上下文選項和發行折扣降低了門檻。

只需使用基礎模型(自託管或 API),如果:您的任務是一般用途、使用量低,或者您尚未驗證微調能改善指標。提示詞工程加上 reasoning_effort 旋鈕通常就足夠了。

如果符合以下情况,请另寻他处:您需要当今最前沿的智能编码能力(GLM 5.2 和 Kimi K2.6 在这些基准测试中领先),或者您需要独立审计的质量保证。

優缺點

優點

完全開放的權重基於Apache 2.0,免版稅自行託管且可免費商用。

高效的稀疏 MoE(僅 41B 活躍參數)加上強大的詞元效率,使得推理成本和速度保持競爭力。

大量 1M-token上下文在權重中(通過API為256K)。

真正的多模态(文字、图像、音频输入)。

可控的推理努力撥盤(無 → 最大)用於即時成本/品質權衡。

同级最佳的开源權重對抗安全性(FORTRESS 78.0%,根據MarkTechPost)和「抵制審查」。

強大的獨立表現 — 在人工分析指數中位居 97 個模型中的前十名,領先 Nemotron 3 Ultra、Gemma 4 31B 和 gpt-oss-120b。

缺點

明確地 是一個前沿模型,根據製造商自己的承認。

Trails 在智能體和程式設計基準測試 (Terminal Bench 2.1、SWE-bench Verified、HLE) 上領先於開源競爭對手 (GLM 5.2、Kimi K2.6、DeepSeek V4 Pro)。

大多數基準測試是由供應商自行報告,且未經獨立審核。

純文字輸出;不支援圖片/音訊生成;初始版本不支援影片輸入;Inkling-Small 仍處於預覽階段。

真正的「本地」使用需要一個多GPU節點(即使量化後也需要約600GB的VRAM)。

在发布时,没有出现任何实质性的独立批评或安全/红队审查。

誰應該使用Inkling?

Inkling 是一個很適合的選擇,如果你是一位實踐者或團隊,希望擁有和定制你的模型而不是租用封閉 API。理想的使用場景包括:

微調團隊通過Tinker或他們自己的管道構建領域特定模型。

成本敏感、高容量的部署,其中免版稅的自架設比按token計費的前沿定價更具優勢。

长上下文工作负载例如仓库级代码辅助、文档分析和长时间代理会话。

多模態應用程式需要結合文字、圖像和音頻理解。

政策敏感型部署希望擁有一個具有強安全性、抗審查的開放基礎來調整自身。

若您需要最強大的推理能力或自主編碼表現、需要影片輸入或生成式輸出,或在部署前需要獨立審核的基準測試,那麼這並非理想選擇。

評判與最終評分

讓我們直接面對那個顯而易見的問題:Inkling 並非當今市場上最強大的模型,而Thinking Machines也明確這麼說。用懷疑的眼光看,這門檻很低;用公平的眼光看,這正是重點所在——Inkling的優化目標並非在排行榜上奪冠。它注重效率(410億活躍參數,約25K Token任務預算)、採用開放授權(Apache 2.0)、在開放權重標準下安全性高(FORTRESS 78%),且可進行微調和自托管。這樣的組合使其成為2026年最深思熟慮的開放模型發布之一,即使它在最困難的智能體與程式碼基準測試中落後於GLM 5.2和Kimi K2.6。

其餘的注意事項,大多是自報的基準測試,以及目前尚無任何獨立評審。但對於其目標受眾——那些重視所有權、客製化、成本控制,以及擁有巨大上下文窗口,而非追求前沿炫耀資本的開發者而言——Inkling 確實表現出色。

評分:4/5針對其目標受眾(建構者與微調者);如果您純粹是為了追求前沿能力,則評分較低。

常見問題

什麼是Inkling?誰創造了它? Inkling是Thinking Machines Lab推出的第一個模型,這家AI新創公司由Mira Murati(前OpenAI技術長)領導。它於2026年7月15日發布,是一個開放權重、多模態的混合專家(Mixture-of-Experts)推理模型。

Inkling 是最好的 AI 模型嗎? 不,該公司並未聲稱如此——他們表示 Inkling「不是目前最強大的模型,無論是封閉式還是開放式。」獨立評測(Artificial Analysis)將其排名為整體第10名(共97個模型),儘管它領先幾個開源同類。

Inkling 有多少個參數?上下文窗口是多少?總共有 975B 個參數,其中 41B 處於活躍狀態(稀疏 MoE),分佈在 66 層中。釋出的權重支援最多 1,000,000 個令牌的上下文窗口,而託管 API 上最多支援 256K。

Inkling 是開放原始碼嗎?授權條款是什麼? 權重是根據 Apache 2.0 發布的,允許商業使用和自架。這是「開放權重」——完整的模型權重在 Hugging Face 上。

Inkling 可以免费使用嗎?權重是免費且可免版稅自行託管的。在 Tinker 上進行微調,以及透過 Together AI、Fireworks、Modal、Databricks 或 Baseten 等提供商進行託管推論,則為付費服務。託管存取起價約為每 1M 輸入 token 1.87 美元(限時發布折扣)。

我該如何執行或下載 Inkling,以及需要什麼硬體?從 Hugging Face 下載權重,並透過符合 OpenAI 標準的 API,使用 vLLM、SGLang 或 Hugging Face transformers 來提供服務。BF16 格式大約需要 ~2TB 的總 VRAM(8× B300 / 16× H200),而 NVFP4 量化檢查點則需要約 ~600GB(4× B300 / 8× H200)。社群提供的 Unsloth GGUF 建置降低了實驗的門檻。

如何微調 Inkling?使用 Thinking Machines 的 Tinker平台,它提供 64K 和 256K 上下文選項以及限時 50% 上市折扣,或者在你自己的流程中微調開放權重。

什麼是可控制的思考努力?這是一個 reasoning_effort 設定(none / minimal / low / medium / high / xhigh / max),在延遲與令牌成本之間權衡推理深度。較低的努力適用於分類與萃取任務;最高的努力適用於困難的數學問題,並符合基準配置(Effort=0.99)。

Inkling與Kimi、GLM、DeepSeek和Nemotron相比如何?根據MarkTechPost的比較,Inkling在FORTRESS(安全)方面領先,並廣泛勝過Nemotron 3 Ultra,但在Terminal Bench 2.1、SWE-bench Verified和HLE上落後於GLM 5.2、Kimi K2.6和DeepSeek V4 Pro。它具競爭力,但在自主編碼方面並非最強的開放模型。

Inkling 能處理圖片、音訊和影片嗎?它接受文字、圖片(40px–4096px)和音訊(16kHz WAV,長達約20分鐘)作為輸入。輸出僅為文字——不生成圖片或音訊。影片在預訓練中使用過,但推出時不支援作為輸入。

Inkling的基準測試分數可靠嗎?請謹慎對待。除了獨立的人工分析智慧指數(Artificial Analysis Intelligence Index)外,那些頭條數字都是廠商在產品推出時自行報告的,未經獨立稽核。競爭對手的數據來自第三方(MarkTechPost),或是由Thinking Machines重新運行,可能與競爭對手自行報告的數字不符。

Inkling-Small 是什麼,以及路線圖上有什麼?Inkling-Small 是一個較小的變體(總參數276B/活躍參數12B)。在發佈時仍處於預覽階段,權重尚未釋出。主模型已經包含了用於推測解碼的 MTP 層。



本文中的比較2

根據本文內容識別 · 基準測試:Artificial Analysis · 每日更新

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube