Inkling-Small-1
Guides & Insights

Inkling-Small:以四分之一規模擊敗自家旗艦,但仍落後指數

作者

Jim Song

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

Thinking Machines Lab 在發布其首個開放權重模型後的兩週內,打造了一個體積約為其四分之一的模型,而在該實驗室自己的評分表上,較小的那個勝出。Inkling-Small在 SWE-bench Verified 上取得 80.2%,對比 Inkling的 77.6%,在 GPQA Diamond 上為 89.5%,對比 87.2%,在 Terminal-Bench 2.1 上為 64.7%,對比 63.8%,在 Humanity's Last Exam 上為 31.6%,對比 29.7%——來自總參數 276B、活躍參數 12B 的模型,而非總參數 975B、活躍參數 41B 的模型。在兩份模型卡共同列出的主要數字中,975B 旗艦款僅在一項上保持領先:AIME 2026,以 1.6 分之差勝出。

隨後,Artificial Analysis 獨立地對兩者進行了評測,並將 Inkling-Small 在 Intelligence Index 上的得分定為 40,而 Inkling 則為 41——較小的模型以一分之差落後。這兩個結果都是真實的,而它們之間的差距正是這次發布中最有價值的部分。以下內容將 Thinking Machines 對其自身模型的報告與他人實際測量的結果區分開來:廠商數據來自公告和兩張 Hugging Face 模型卡,獨立數據來自 Artificial Analysis 自己的測試,定價與上下文長度數據則來自 OpenRouter 的即時端點資料(於撰寫本文當日核對)。當這三者的數據不一致時——上下文長度確實不一致——我們會如實說明,而非挑選較討喜的那個。

7月30日實際發布了什麼

Inkling-Small 是一個稀疏混合專家(Mixture-of-Experts)轉換器:總共 276B 個參數,每個 token 啟動 12B 個參數,共 42 層,每個 token 會被路由到 256 個專家中的 6 個,加上 2 個對所有輸入都會啟動的共享專家。注意力機制在局部層與全局層之間交替。權重已發布在 Hugging Face 上,採用 Apache 2.0 授權,無商業使用限制;它可在 Thinking Machines 的 Tinker API 上進行微調,你也可以在 Tinker Playground 中以文字、圖像和音訊與它交談。該實驗室表示,它是在 NVIDIA GB300 NVL72 系統上訓練的。

Inkling-Small-2

多模態是原生內建,而非外掛附加,且規格表對實現方式的描述異常具體。沒有獨立的視覺或音訊編碼器:音訊以 dMel 頻譜圖形式輸入,影像則以 40×40 像素的區塊經由四層 hMLP 處理,兩者都直接嵌入與文字相同的 token 串流中。輸入為文字、影像與音訊;輸出僅為文字,這點值得明說,因為「多模態」常被解讀為「它會說話」,足以毀掉一個下午。思考強度是一個有五段設定的旋鈕——minimal、low、medium、high、xhigh——因此同一組權重既可以低成本運行,也可以全力運行。

這個配方有趣的地方在於後續訓練。Inkling-Small 是在完整版 Inkling 作為教師的情況下,以線上策略(on-policy)方式進行蒸餾,隨後又接受了約兩週的強化學習,並在代理式編碼上擴大規模。這樣的順序說明了結果的樣貌:學生繼承了教師的整體能力,然後在正是它目前勝過教師的那個面向上獲得了額外訓練。

Thinking Machines 發布的排行榜

廠商的基準測試在有人重現結果之前,都只是行銷宣傳,因此請將本節視為實驗室的宣稱,而非已經驗證的事實。這仍是一組範圍廣泛的測試,而且其廣度是朝不利於旗艦產品的方向呈現。

Inkling-Small-3

除了四個共用的數字之外,這張卡片補齊了其餘的畫面——全都是 Thinking Machines 自己的運行:

代理式工作 — 在 GDPval-AA v2 上獲得 1269 Elo,此基準測試衡量真實經濟任務而非謎題。

圖表與文件 — 在 CharXiv RQ 上為 77.4%,當模型被允許編寫並執行 Python 時,上升到 81.3%。這 3.9 個百分點的躍升是一個有用的提示:工具取用比提示工程更能提升視覺推理工作的表現。

Vision——在 MMMU Pro 上獲得 74.0%,略高於 Inkling 的 73.5%。

音訊 — VoiceBench 90.1% 與 MMAU 77.0%,兩者均略低於旗艦機型的 91.4% 與 77.2%。音訊是縮小規模明顯付出代價的兩個方面之一。

安全性 — 98.4% StrongREJECT 和 96.9% FORTRESS 良性提示,但對抗性 FORTRESS 僅 71.6%,而旗艦模型為 78.0%。這是另一個代價:對抗穩健性下降 6.4 個百分點,如果模型要放在公開的文字輸入框後,這比任何編碼增益都更重要。

預測 — 在 ForecastBench 上、無搜尋存取時的 Brier 指數為 61.3 ± 0.46,在 Prophet Arena 上的 Brier 分數為 0.1238 ± 0.0086。光是願意列出誤差範圍,就已經比多數發布文章更有紀律了。

一個差距:旗艦型號的卡片在 SWE-bench Pro 上列出了 54.3%,這是 SWE-bench Verified 更難的兄弟版本。Inkling-Small 的卡片沒有報告 SWE-bench Pro。鑑於 Verified 數字被大力宣傳,這個缺席正是我們最希望看到被填補的數字。

獨立指數反而說的是什麼

Artificial Analysis 將 Inkling-Small 在其 Intelligence Index 4.1 版上評為 40 分,比 Inkling 的 41 分低一分。該指數由九項評測綜合而成——GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience 與 AA-LCR——而這份清單正好解釋了大部分表面上的矛盾。九項中僅有兩項與 Thinking Machines 評測卡上的推理展示重疊。其餘項目則側重於代理式工具使用、長上下文檢索與幻覺抵抗力;因此,一個模型可能在實驗室選擇公布的基準測試中勝出,卻在第三方選擇執行的評測中落敗。雙方都沒有說謊;他們衡量的是不同的事物。

Inkling-Small-4

在細則中還有一個比「領先一分」這個標題更值得注意的細節:Artificial Analysis 將旗艦機型的條目標記為Inkling (xhigh)——這是其最高的思考強度設定——而 Inkling-Small 那一行則沒有附加強度後綴。因此,旗艦機型那一分的領先是在其推理強度調到最大的情況下記錄的。如果讓兩者的強度設定一致,即使比較結果只出現一點點變動,單憑能力而支持較大模型的最後一個理由也將隨之消失。

獨立數據相差最大的地方是速度和成本,而在這方面,數據明顯偏向小型模型,其優勢之大,是任何基準測試表都無法呈現的:

輸出速度每秒可輸出133個token,而Inkling(xhigh)為80。Artificial Analysis將Inkling-Small在速度方面評為同類101款模型中的第7名,而同類中位數為66。

首次 token 時間 — 1.63 秒對比 1.84 秒。真實但微小的優勢。

每 1M token 的混合價格 — $0.22,相較於他們加權後的 $0.72。成本約為三分之一,但指數點數少了 1 點。

智力排名 — 在101名中排名第15,班級中位數成績為25。輕鬆高於平均,但遠未達到頂尖水平。

冗長度——這就是問題所在。它為了翻閱索引燃燒了1.3億個輸出token,而中位數僅1億。Artificial Analysis自己的摘要稱其「明顯快速,但有點冗長」。它比典型情況多想約30%,這悄悄抵消了部分單個token折扣。

一則記帳小註記,因為任何比對來源的人都會碰到這點:Artificial Analysis 列出的參數總數為 266B,而公告、兩張模型卡和 OpenRouter 都寫 276B。我們全文統一使用 276B。這不影響任何結論,但在你於設計文件中引用某個數字之前,這是那種值得先知道的差異。

你今日實際能租到的,並非規格表上所描述的

開放權重(open-weights)發布公告與可用端點之間的差距,正是多數發布報導停止關注的地方。Thinking Machines 宣稱支援最高 1M 個 token 的上下文視窗,Artificial Analysis 也列出 1M。在 OpenRouter 上,目前提供 Inkling-Small 的兩家供應商都將其上限設為524,288 個 token——僅為宣稱數字的一半。這與其說是矛盾,不如說是架構所支援的能力與實際部署上線之間的差異。相比之下,旗艦版 Inkling 確實有一個端點提供完整的 1,048,576 個 token,不過該端點同時將補全(completions)限制在 32,768 個 token。

即時畫面的其餘部分,可從 OpenRouter 的端點資料讀取:

兩家供應商,兩種價格 — 一家是每100萬輸入0.45美元、每100萬輸出1.20美元,另一家是0.50美元和1.20美元。Artificial Analysis 列出 Thinking Machines 自家的第一方費率更低,為0.30美元和1.20美元,快取輸入為0.06美元。第三方託管對相同權重的輸入收取50%–67%的溢價。

提示詞快取 — 透過OpenRouter,每1M個快取輸入token僅需$0.10,而旗艦版則為$0.17。

你租用端點所得到的數值,並非基準測試時所用的數值——模型卡列出的是 BF16 與 NVFP4。較便宜的端點提供 fp8;另一個端點則完全未宣告量化方式。廠商的基準測試分數並非在這些權重的 fp8 服務上所測得,而量化對長時間代理執行的影響,正是 0.9 分的 Terminal-Bench 差距所無法承受的。若你要重現某個數值,請註明使用的是哪個端點。

各供應商的功能覆蓋不一——兩個端點都公開了推理與reasoning_effort,因此五段式的思考調整旋鈕可以運作。但只有一個端點宣稱支援工具呼叫與 logprobs,而且目前兩者都沒有標榜支援 response_format,也就是結構化輸出/JSON 模式的參數。旗艦產品 Inkling 有個端點支援。如果你的資料管線依賴以 schema 強制規範的 JSON,這個細節在第一天就會讓你吃虧,而這是供應商的限制,而非模型本身的限制。

完成上限 — fp8 端點上限為 262,144 個 token;另一個則未設上限。

基於測量令牌數的成本案例

每百萬 token 的價格不是比較推理模型的好方式,因為真正的變數是它們在思考時消耗了多少 token。Artificial Analysis 發布實際花費,這是更好的衡量工具:讓 Inkling-Small 跑完整個 Intelligence Index 大約消耗了 130M 個輸出 token,花費為 $192.37,換算下來約為 每項任務 $0.07(依其加權平均計算)。

將此與人們實際部署的模型的相同測量結果進行比較:DeepSeek V4 Flash 每項任務 $0.03,gpt-oss-120b 每項任務 $0.08,Gemini 3.6 Flash 每項任務 $0.56,GLM-5.2 每項任務 $0.57,Kimi K3 每項任務 $0.86,GPT-5.6 Sol 每項任務 $1.23,Claude Opus 5 每項任務 $2.34,Claude Fable 5 每項任務 $3.15。Inkling-Small 是該群體中第二便宜的模型,每項任務比 GPT-5.6 Sol 便宜約 18 倍,後者得分 59,而前者僅得 40。

還有一種更清晰的方式可以看出價格為何跌到這個價位。活躍參數從 41B 降至 12B,降幅為 3.4 倍。輸出價格從每百萬個 $4.05 降至 $1.20,降幅為 3.375 倍。稀疏 MoE 的租用價格基本上就等同於其每個 token 的計算成本,而 Thinking Machines 是依此定價,而不是根據基準測試來定價。

關於自行運行該比較的一個實際注意事項:Inkling-Small 目前不在 OrcaRouter 目錄中,因此您需從其自身的端點租用。您要與之比較的封閉模型 — GPT-5.6 Sol、Claude Opus 5、Gemini 3.6 Flash 以及該清單中的其他模型 — 都在 OrcaRouter 上,只需一把金鑰即可使用,零加價,也就是說您支付的是各供應商的定價,沒有任何額外加成。這對成本模型尤其重要:您輸入試算表的數字就是實際計費的數字,而當供應商降價時,我們這邊當天就會反映,而非等到重新談判之後。跨供應商的自動故障轉移涵蓋了評估的另一半,也就是基準組在運行中途掛掉,悄悄污染您的數據。

它在開放權重模型中實際處於什麼位置

與旗艦產品相比,Inkling-Small 看起來像是個勝利。但拿來跟同類產品相比,它看起來只是個穩健的中段班開放權重模型,而發布報導大多跳過了第二種解讀。

在 Artificial Analysis Intelligence Index 上,領先於這兩個 Inklings 的模型包括:Claude Opus 5(61 分)、Claude Fable 5(60 分)、GPT-5.6 Sol(59 分)、Kimi K3(57 分)、Grok 4.5(54 分)、GLM-5.2 與 Muse Spark 1.1(51 分),以及 Gemini 3.6 Flash(50 分)。這並不意外——那些都是前沿系統,其中大部分是封閉的,有幾個規模非常龐大。

真正應該改變決策的是DeepSeek V4 Flash,它在284B總參數和13B活躍參數下得分50,而Inkling-Small僅得40——兩者幾乎屬於相同規模等級,同樣是開源權重的超值選擇,但每項任務成本卻不到一半。如果你要的是最便宜且堪用的開源權重模型,獨立數據指向的是那邊,而不是這裡。此外,與Inkling-Small不同,它可透過OrcaRouter取得,因此在自有工作負載上測試這個替代方案,只需更改模型字串,而非進行採購流程。

Inkling-Small 擁有而 DeepSeek V4 Flash 所沒有的,是同一組權重中的原生音訊與影像輸入、五級思考旋鈕,以及來自訓練它的實驗室的 Tinker 微調。這些對多模態代理來說是真正的差異化優勢,也是選擇它的誠實理由——而不是指數分數。

誰應該搬家,誰應該留在原處

此決定劃分得乾淨俐落,此情況實屬罕見,值得如此明言。

如果你正在運行編碼代理,請從 Inkling 改用 Inkling-Small。廠商公布的數據顯示,小模型在 SWE-bench Verified 和 Terminal-Bench 上表現更佳;官方文件記載的原因是它額外的 agentic RL。它的成本約為大模型的三分之一,回傳 token 的速度則快 1.66 倍。要為一個在最大思考努力下測得的指數點支付 3.3 倍的價格,是很難成立的論點。

請轉移,如果每個推理任務的成本是限制條件,而且你能接受指數上的40分。每個任務 $0.07,第一方端點的快取命中率為每百萬次 $0.06,對於具備原生音訊與視覺的模型來說,是極具競爭力的定價。

如果您要進行微調,請改用此方案。 276B/12B 模型的調整與服務成本遠低於 975B/41B,且 Tinker 兩者皆支援。

如果您需要長音訊,請繼續使用 Inkling。這是此次發行中最嚴重的效能衰退,而且它就深藏在模型卡中:旗艦模型建議音訊輸入低於 20 分鐘,而 Inkling-Small 的模型卡則建議低於 2 分鐘。整整縮減為原本的十分之一。如果您原本要對會議進行轉錄或推理,小型模型無論價格高低都無法直接替代。

若您需要託管端點提供超過 512K 的上下文,請繼續使用,或需要超過 262K token 的完整生成。目前只有旗艦版提供完整百萬規模的端點。

若您需要強制符合 schema 的 JSON,請繼續使用,無需自行編寫驗證與重試迴圈,直到供應商提供 response_format 給小型模型。

若對抗性穩健性是關鍵要求,就保持現狀。 在 FORTRESS 對抗性測試中,71.6% 對比 78.0% 對任何面向用戶的功能都是錯誤的方向,而且這是實驗室自己的數字。

發布報導留下的三個未解問題

Inkling-Small 只是 Inkling 的蒸餾版本嗎?

部分是這樣,但關鍵在於不是的部分。以 Inkling 為教師的在策略蒸餾(on-policy distillation)只是後訓練的一個階段,所以大量通用能力確實是繼承而來的。然而,這是個獨立架構的模型——42 層對比旗艦款的 66 層,路由拓撲相同:256 個專家中有 6 個活躍專家,外加 2 個共享專家,這意味著專家本身更窄,而不是數量更少。此外,它還接受了約兩週的代理式編碼強化學習(agentic-coding RL),這是教師從未經歷過的。正是這最後階段,讓蒸餾出的學生模型在編碼基準測試上勝過其教師——否則這種情況本不該發生。

我實際上可以自行架設它嗎?

只在專業級硬體上可行。276B 參數在 8-bit 下約為 276GB 的權重,BF16 下約為 552GB,這還未計入任何 KV 快取——無論如何都需要多 GPU 節點,而非工作站。稀疏 MoE 的優勢在於推論成本,而非記憶體佔用;你儲存全部 276B,但僅以 12B 進行運算。模型卡將 SGLang、vLLM、TokenSpeed、Unsloth 和 Hugging Face Transformers 列為支援的服務路徑,並列出 BF16 與 NVFP4 數值格式。另請注意,目前兩個託管端點提供的都是量化版本,因此以 BF16 自行託管的「相同模型」行為不會與你所測試的 API 完全一致。

975B Inkling 還有存在的理由嗎?

有三項,而且都很狹窄:{{1}}完整的1M-token服務上下文、超過兩分鐘的音訊輸入,以及更好的對抗性安全行為{{/1}}。值得注意的是,{{2}}「它更聰明」{{/2}}並不能有把握地列入清單——{{3}}最大思考努力下的一個指數點,相對於一組較小模型多半勝出的供應商基準,並非能力論證{{/3}}。在推出975B旗艦機型兩週後,{{4}}Thinking Machines{{/4}}發佈了{{5}}令其難以被推薦{{/5}}的模型。這要不是異乎尋常的坦率,就是異乎尋常的速度;無論是哪一種,對這個實驗室來說都是好兆頭。

接下來要看什麼

有三件事將決定這次發佈會如何經受時間考驗。是否會出現一個實際提供所宣傳的 1M 上下文的端點,這將消除旗艦機型最明顯的剩餘優勢。是否有人會發布一份付出同等努力的獨立對比,比較這兩個模型,這是唯一能知道那一點指標分數是否真實的方法。以及 2 分鐘音訊建議是訓練限制還是伺服端預設值——因為如果是後者,留在較大模型的頭號理由就消失了。在那之前,誠實的總結是:Thinking Machines 推出了一款模型,價格只有三分之一,速度快了三分之二,根據其自身證據編碼表現更好,在獨立綜合評分上略微落後,並且明顯落後於一個同等規模的競爭對手——而這個競爭對手在大多數報導中並未被提及。

© 2026 OrcaRouter

推理服務商

經營推理平台?讓您的模型上架 OrcaRouter。

聯絡我們

加入我們的社區

DiscordEmailXGitHubYouTube