
Inkling-Small:自社フラッグシップを凌駕するクォーターサイズモデル、それでもインデックスには及ばず
- qwenNEWQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 100万トークンあたり · 56 tok/s
- deepseekNEWDeepSeek: DeepSeek V4 Flash 07312026-07-3150知能69コーディング
- qwenNEWQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100万トークンあたり · 201 tok/s
- orcaNEWOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNEWAnthropic: Claude Opus 52026-07-2461知能78コーディング
- googleGoogle: Gemini 3.6 Flash2026-07-2150知能69コーディング
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137知能49コーディング
- metaMeta: Muse Spark 1.12026-07-1651知能71コーディング
- kimiMoonshotAI: Kimi K32026-07-1557知能76コーディング
- openaiOpenAI: GPT-5.6 Luna2026-07-0951知能71コーディング
- openaiOpenAI: GPT-5.6 Terra2026-07-0955知能77コーディング
- openaiOpenAI: GPT-5.6 Sol2026-07-0959知能77コーディング
- grokxAI: Grok 4.52026-07-0854知能72コーディング
- tencentTencent: Hy32026-07-0641知能59コーディング
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232知能42コーディング
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226知能39コーディング
- anthropicAnthropic: Claude Sonnet 52026-06-3053知能72コーディング
- klingKling: Kling 3.0 Turbo2026-06-1757知能52コーディング57数学
- z-aiZ.ai: GLM 5.22026-06-1651知能69コーディング60数学
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242知能61コーディング61数学
Thinking Machines Lab は、最初のオープンウェイトモデルをリリースした後の2週間を、その約4分の1のサイズのモデルの構築に費やし、ラボ自身の評価では、小さい方のモデルが勝っている。Inkling-Smallは、SWE-bench Verified で80.2%を報告しており、それに対してInklingの77.6%、GPQA Diamond では89.5%に対して87.2%、Terminal-Bench 2.1 では64.7%に対して63.8%、Humanity's Last Exam では31.6%に対して29.7% — これは、合計276Bパラメータ(アクティブ12B)のモデルによるものであり、975B(アクティブ41B)のモデルによるものではない。2つのモデルカードが共通して示す主要な数値のうち、975Bのフラッグシップが唯一上回るのはAIME 2026で、その差は1.6ポイントである。
その後、Artificial Analysisは両方を独立に実行し、Inkling-SmallをそのIntelligence IndexでInklingの41に対して40と評価しました——小型モデルは1ポイント及ばず。その2つの結果はどちらも本物であり、その差こそが今回の発表で最も有用な点です。以下では、Thinking Machinesが自社モデルについて報告する内容と、他者が測定した内容を分けて示します。ベンダー側の数値は公式発表と2つのHugging Faceモデルカードから、独立した数値はArtificial Analysis自身の実行結果から、価格とコンテキスト長の数値はOpenRouterのライブエンドポイントデータ(本稿執筆日に確認)から取得しています。これら3つの情報源が食い違う場合——実際、コンテキスト長では食い違っています——その旨を明記し、都合のよい方を選ぶことはしません。
7月30日に実際にリリースされたもの
Inkling-Smallは、スパース混合エキスパート(MoE)トランスフォーマーです。合計276Bのパラメータを持ち、トークンごとに12Bがアクティブになり、42層で構成されます。各トークンは256個のエキスパートのうち6個と、すべてのトークンに作用する2個の共有エキスパートにルーティングされます。アテンションはローカル層とグローバル層を交互に配置しています。ウェイトはHugging FaceでApache 2.0ライセンスのもと公開されており、商用制限はありません。Thinking MachinesのTinker APIでファインチューニングでき、Tinker Playgroundではテキスト・画像・音声で対話できます。同研究所によると、NVIDIA GB300 NVL72システムでトレーニングされたとのことです。

マルチモダリティは後付けではなく、初めから組み込まれている。モデルカードはその仕組みを異例なほど具体的に説明している。独立したビジョンエンコーダやオーディオエンコーダは存在せず、オーディオはdMelスペクトログラムとして、画像は4層のhMLPを通過した40×40ピクセルのパッチとして入力され、両者ともテキストと同じトークンストリームに直接埋め込まれる。入力はテキスト・画像・オーディオであり、出力はテキストのみ——これは「マルチモーダル」という言葉が「音声で話せる」と読まれることが、午後を台無しにするほど頻繁にあるため、はっきりと述べておく価値がある。思考努力はminimal・low・medium・high・xhighの5段階のダイヤルで、同じ重みを低コストで動かすことも、全力で動かすこともできる。
このレシピで興味深いのは、ポストトレーニングの部分だ。Inkling-Smallは、完全版のInklingを教師としてオン方策で蒸留され、その後、エージェンティックコーディングにスケールアップした強化学習をさらに約2週間施された。この順序が結果の形を説明している。生徒は教師の一般的な能力を受け継ぎ、その後、まさに現在教師を上回っているその軸において追加のトレーニングを受けたのだ。
Thinking Machinesが公開したスコアボード
ベンダーのベンチマークは、誰かが再現するまではマーケティングに過ぎない。したがって、このセクションは検証された事実ではなく、ラボの主張として読むべきである。それでも幅広いテストセットであり、しかもその広さはフラッグシップにとって不利な方向に向いている。

共有されている4つの数字に加えて、カードは全体像の残りを埋めてくれます——すべてThinking Machines自身の実行です:
• エージェント型ワーク — パズルではなく現実的な経済タスクを扱うベンチマークGDPval-AA v2でElo 1269を達成。
• グラフと文書 — CharXiv RQで77.4%、モデルがPythonを書いて実行できる場合は81.3%に上昇します。この3.9ポイントの上昇は、ツールへのアクセスがプロンプトエンジニアリングよりも視覚的推論作業において多くの効果をもたらすことを示す有益なヒントです。
• Vision — MMMU Pro で 74.0% を記録し、Inkling の 73.5% をわずかに上回る。
• Audio — 90.1% VoiceBench and 77.0% MMAU, both fractionally below the flagship's 91.4% and 77.2%. Audio is one of the two places where shrinking clearly cost something.
• 安全性 — StrongREJECT では98.4%、FORTRESS の良性プロンプトでは96.9%、しかし FORTRESS の敵対的プロンプトではフラッグシップの78.0%に対して71.6%です。これがもう一つのコストです。敵対的ロバスト性の6.4ポイントの後退であり、モデルが公開テキストボックスの背後に置かれるなら、いかなるコーディングの向上よりも重要です。
• 予測 — 検索アクセスなしのForecastBenchでBrier Index 61.3 ± 0.46、Prophet ArenaでBrierスコア 0.1238 ± 0.0086。誤差バーを報告するだけでも、ほとんどのローンチ投稿が持てていない規律だ。
ひとつのギャップ:フラッグシップのカードには、SWE-bench Verifiedのより難しい兄弟版であるSWE-bench Proで54.3%と記載されている。しかし、Inkling-SmallのカードにはSWE-bench Proの報告がない。Verifiedの数値がこれほど前面に押し出されていることを考えると、その欠落こそが、私たちが最も埋めてもらいたい数字である。
独立した指数が代わりに示すもの
Artificial Analysisは、Intelligence Indexバージョン4.1でInkling-Smallを40と評価しており、Inklingの41より1ポイント低い。{{1}}このインデックスは、GDPval-AA v2、τ³-Banking、Terminal-Bench v2.1、SciCode、Humanity's Last Exam、GPQA Diamond、CritPt、AA-Omniscience、AA-LCRという9つの評価からなる複合指標であり、そのリストが見かけ上の矛盾の大部分を説明している。{{2}}9つのうち2つだけが、Thinking Machinesのカードに記載された推論ショーケースと重複している。残りは、エージェンティックなツール使用、長文脈検索、幻覚耐性に重点が置かれており、モデルはラボが選んで公表するベンチマークで勝利する一方で、第三者が選んで実施するベンチマークでは敗北することがあり得る。{{3}}どちらの側も嘘をついているわけではなく、測定しているものが異なるだけだ。{{4}}

細かい注記にも、1ポイント差という見出し以上の価値がある。Artificial AnalysisはフラッグシップのエントリーをInkling (xhigh)(最高の推論努力設定)として記載している一方、Inkling-Smallの行には推論努力の接尾辞がない。つまり、フラッグシップの1ポイントのリードは、推論ダイヤルを最大まで回した状態で記録されたのだ。努力レベルを揃えればその比較がほんのわずかでも動くようなら、性能だけを根拠に大型モデルを選ぶ最後の論拠も、それとともに消え去るだろう。
独立データがまったく一致しないのは速度とコストであり、ここでは小型モデルが有利で、その差はベンチマーク表では伝えきれないほどだ。
• 出力速度 — 毎秒133トークン(Inkling (xhigh) は80)。Artificial Analysis は、Inkling-Small の速度を同クラスの101モデル中7位と評価しており、クラス中央値は66です。
• 最初のトークンまでの時間 — 1.63秒対1.84秒。実際の差はあるものの、わずかなアドバンテージです。
• 1Mトークンあたりのブレンド価格 — 加重方式では$0.22に対して$0.72。指数ポイントが1ポイント少ないだけで、コストは約3分の1です。
• 知能ランク — #15(101中)、クラスの中央値スコア25に対して。平均をゆうに上回っており、最先端にはほど遠い。
• 冗長さ — そして、ここが落とし穴です。インデックスを通過するのに130Mの出力トークンを消費しましたが、中央値は100Mでした。Artificial Analysis自身の要約では「顕著に速いが、やや冗長」と評されています。通常より約30%多く思考するため、トークンあたりの割引の一部を静かに食いつぶしています。
小さな記録上の注意:情報源を比較する人なら誰でも気づくでしょう。Artificial Analysisはパラメータ数を合計266Bとしており、一方で発表文、両方のモデルカード、OpenRouterはすべて276Bとしています。この文書では一貫して276Bを使用しています。これは結論を変えるものではありませんが、設計ドキュメントに数値を引用する前に知っておくべき相違です。
今日実際にレンタルできるもの、それは仕様書に書かれている内容とは異なります
オープンウェイトの発表と利用可能なエンドポイントとの間のギャップは、ほとんどのローンチ報道が注目をやめるポイントです。Thinking Machinesは最大100万トークンのコンテキストウィンドウを宣伝しており、Artificial Analysisも100万と記載しています。OpenRouter上で、現在Inkling-Smallを提供している両プロバイダーは、それを524,288トークンに制限しています。これは宣伝されている数字の半分です。これは矛盾というよりも、アーキテクチャがサポートしているものと、実際にプロダクションで構築されたものの違いです。対照的に、フラッグシップのInklingにはフルの1,048,576トークンのエンドポイントが1つありますが、同じエンドポイントでは生成されるテキストは32,768トークンに制限されています。
ライブ画像の残りは、OpenRouter のエンドポイントデータから読み取ります:
• 2つのプロバイダー、2つの価格 — 1つのプロバイダーは入力1Mあたり$0.45、出力1Mあたり$1.20、もう1つは$0.50と$1.20です。Artificial Analysisは、Thinking Machines自身のファーストパーティ料金をさらに低い$0.30と$1.20(キャッシュ入力は$0.06)としてリストしています。サードパーティのホスティングは、同じ重みの入力に対して50〜67%のプレミアムを請求しています。
• プロンプトキャッシュ — OpenRouter経由の場合、キャッシュ済み入力トークン100万件あたり$0.10(最上位モデルは$0.17)。
• レンタルする数値は、ベンチマークされた数値ではありません — モデルカードにはBF16とNVFP4が記載されています。安価なエンドポイントはfp8を提供し、もう一方は量子化を一切宣言していません。ベンダーのベンチマークスコアは、これらの重みのfp8サービングで測定されたものではなく、長期的なエージェント実行における量子化の影響は、Terminal-Benchの0.9ポイント差では耐えられない、まさにその種のものです。数値を再現する場合は、使用したエンドポイントを記してください。
• プロバイダーごとに機能のカバレッジは不均一です — 両エンドポイントとも reasoning と reasoning_effort を公開しているため、5段階設定の思考ダイヤルは機能します。しかし、ツール呼び出しと logprobs を公開しているのは片方だけで、現時点ではどちらも response_format を公開していません。これは構造化出力/JSONモードのパラメータです。旗艦モデルである Inkling には、response_format を公開するエンドポイントがあります。パイプラインがスキーマ強制 JSON に依存しているなら、この詳細は初日に問題になるでしょう。これはモデルによる制限ではなく、プロバイダー側の制限です。
• 完了上限 — fp8エンドポイントでは262,144トークン。もう一方は上限なしとしている。
測定されたトークン数に基づくコストケース
100万トークンあたりの価格は、推論モデルを比較するには不適切な方法です。なぜなら、変動するのは、思考に費やすトークン数だからです。Artificial Analysisは実際の支出を公開しており、これははるかに優れた指標です。Inkling-SmallをIntelligence Index全体で実行すると、約1億3000万の出力トークンを消費し、費用は$192.37となり、約$0.07(タスクあたり)という彼らの加重平均に基づくものになります。
それを、人々が実際にデプロイするモデルの同じ測定値と比較してみましょう: DeepSeek V4 Flashはタスクあたり$0.03、gpt-oss-120bは$0.08、Gemini 3.6 Flashは$0.56、GLM-5.2は$0.57、Kimi K3は$0.86、GPT-5.6 Solは$1.23、Claude Opus 5は$2.34、Claude Fable 5は$3.15です。Inkling-Smallはそのグループで2番目に安いモデルであり、タスクあたりのコストはGPT-5.6 Solの約18分の1です(GPT-5.6 Solのスコアは59、Inkling-Smallは40)。
価格がなぜその水準まで下がったのかを、もっと明確に理解する方法もあります。アクティブパラメータは41Bから12Bへと減少し、3.4倍の差があります。出力価格は100万トークンあたり4.05ドルから1.20ドルへ下がり、3.375倍の差です。スパースMoEのレンタル価格は本質的にトークンあたりの計算コストだけで決まり、Thinking Machinesはベンチマークに基づく価格設定ではなく、それに応じた価格を設定しました。
その比較を自分で実行する際の実用的な注意点: Inkling-Smallは現在OrcaRouterのカタログにはないため、専用のエンドポイントからレンタルする必要があります。比較対象となるクローズドモデル — GPT-5.6 Sol、Claude Opus 5、Gemini 3.6 Flash、およびその他のリスト掲載モデル — は、OrcaRouter上で単一のキーにより、0%マークアップで利用できます。つまり、各プロバイダーの定価を支払うだけで、上乗せは一切ありません。これは特にコストモデルに重要です。スプレッドシートに入力した数値がそのまま請求額になり、プロバイダーが価格を引き下げた場合は、再交渉を待つことなく、その日のうちに当社側へ反映されます。プロバイダー間の自動フェイルオーバーは、評価のもう半分、つまり実行中にベースライン群が停止し、静かに数値を台無しにするという問題をカバーします。
実際、オープンウェイトモデルの中ではどの位置にあるのか
フラッグシップと照らし合わせて読むと、Inkling-Smallは勝利のように見える。しかし、市場全体と照らし合わせて読むと、それは堅実な中位のオープンウェイトモデルに見える。そして、ローンチ時の報道の大半は、この2つ目の読み方を飛ばしている。
Artificial Analysis Intelligence Indexでは、両方のInklingsより上位のモデルとして、Claude Opus 5(61)、Claude Fable 5(60)、GPT-5.6 Sol(59)、Kimi K3(57)、Grok 4.5(54)、GLM-5.2とMuse Spark 1.1(いずれも51)、Gemini 3.6 Flash(50)が挙げられます。これは当然のことです——それらは最前線のシステムであり、そのほとんどがクローズドで、いくつかは非常に大規模です。
実際に意思決定を変えるべきなのはDeepSeek V4 Flashです。これは総パラメータ284B・アクティブ13Bで、Inkling-Smallの40に対して50をスコアしており、実質的に同じサイズクラスでありながら、同じオープンウェイトの割安さを備え、タスクあたりのコストは半分未満です。もし求めるのが最も安価で実用的なオープンウェイトモデルなら、独立した評価指標はこちらではなく、そちらを指しています。また、Inkling-Smallとは異なり、OrcaRouter経由で利用できるため、この代替案を自社のワークロードでテストするのは、調達作業ではなく、モデル文字列の変更だけで済みます。
Inkling-Small が DeepSeek V4 Flash と異なり備えているのは、同じ重みでのネイティブな音声・画像入力、5段階の思考ダイヤル、そしてそれを訓練したラボによる Tinker ファインチューニングです。これらはマルチモーダルエージェントにとって真の差別化要因であり、それを選ぶ正直な理由です — インデックススコアではなく。
誰が移動すべきで、誰が留まるべきか
その決定はきれいに二分されるが、それはそう述べるに足るほど異例なことである。
• コーディングエージェントを実行している場合は、InklingからInkling-Smallに移行してください。 ベンダーの数値では、SWE-bench VerifiedとTerminal-Benchで小モデルが有利です。追加のエージェンティックRLがその理由として文書化されており、コストは約3分の1で、トークン返却速度は1.66倍高速です。最大思考努力で測定された1インデックスポイントのために3.3倍を支払うのは、正当化が難しいでしょう。
• 移行する条件は、推論タスクあたりのコストが制約条件であることであり、インデックスで40を受け入れられることです。タスクあたり$0.07、ファーストパーティエンドポイントでの100万件あたり$0.06のキャッシュヒット率というのは、ネイティブ音声とビジョンを備えたモデルとしては攻撃的な価格設定です。
• ファインチューニングを行う場合は移行してください。276B/12Bモデルは、975B/41Bモデルよりも適応とサービス提供のコストが大幅に低く、Tinkerは両方に対応しています。
• 長い音声が必要なら、Inklingを使い続けてください。これはリリースで最も顕著な退行であり、モデルカードに埋もれています:フラッグシップは20分未満の音声入力を推奨していますが、Inkling-Smallのカードが推奨するのは2分未満です。10分の1の削減です。会議の文字起こしや推論を行っていた場合、小型モデルはどんな価格であっても、そのまま代替できるものではありません。
• ホスト型エンドポイントから512Kを超えるコンテキストが必要な場合は、そのままお使いください、または、262Kトークンを超える補完が必要な場合も同様です。現在、フラッグシップモデルのみが100万トークン全体を提供するエンドポイントを持っています。
• Stay if you need schema-enforced JSON without writing your own validation-and-retry loop, until a provider ships response_format for the small model.
• 敵対的ロバスト性が要となるなら、そのまま維持する。 FORTRESS adversarial での 71.6% 対 78.0% という値は、ユーザー向けの何にとっても間違った方向であり、しかもそれは研究所自身の数値である。
打ち上げ報道が残した3つの疑問
Inkling-Small は、単に Inkling を蒸留しただけのものですか?
部分的にはそうです。そして、そうでない部分こそが重要です。Inklingを教師とするオン方策蒸留はポストトレーニングの一段階であり、したがって一般的な能力の多くは実際に継承されています。しかし、これは別途設計されたモデルです。フラッグシップの66層に対して42層で、256個中6個のアクティブなエキスパートと2個の共有エキスパートという同じルーティングトポロジを備えています。つまり、エキスパートの数が少ないのではなく、それぞれがより狭いのです。そして、教師が受けなかったエージェンティックコーディングのRL(強化学習)を約2週間受けました。この最後の段階こそが、蒸留された生徒がコーディングのベンチマークで教師を上回る理由であり、通常では起こり得ないことです。
現実的にセルフホストできますか?
本格的なハードウェアでのみ可能です。276Bパラメータは、8ビットで約276GB、BF16で約552GBの重みに相当し、KVキャッシュを考慮する前の時点でこの数値です。いずれにしてもマルチGPUノードが必要で、ワークステーションでは足りません。スパースMoEの利点は推論コストであって、メモリフットプリントではありません。すべての276Bを格納し、計算は12Bで行います。カードには、サポートされるサービングパスとしてSGLang、vLLM、TokenSpeed、Unsloth、Hugging Face Transformersが挙げられ、BF16およびNVFP4の数値形式がリストされています。また、現在の両ホスト型エンドポイントは量子化バージョンを提供していることにも注意してください。つまり、BF16でセルフホストした「同じモデル」は、テストしたAPIと同一の動作にはなりません。
975B Inkling には、まだ存在する理由があるのでしょうか?
3つあり、しかもすべて限定的です。すなわち、フル1Mトークンのコンテキスト、2分を超える音声入力、そしてより優れた敵対的セーフティ動作です。注目すべきは、「より賢い」という点が自信を持ってそのリストに載るわけではないことです。最大思考努力での1インデックスポイントは、より小さいモデルがほとんど勝利するベンダーベンチマーク群に対して、能力の論拠にはなりません。975Bのフラッグシップを発表してから2週間後、Thinking Machinesは、それを推奨しにくくするモデルをリリースしました。それは異例の率直さか、異例の速さのどちらかであり、いずれにしても研究所にとって良い兆候です。
次に見るもの
このリリースの評価がどう定まるかは、3つの点にかかっている。宣伝どおりの1Mコンテキストを提供するエンドポイントが現れるかどうか。それが実現すれば、フラッグシップに残された最も明確な優位性は消え去る。同じ労力をかけた独立した両モデルの比較を誰かが公表するかどうか。それこそが、あの1インデックスポイントの差が本物かどうかを知る唯一の方法だ。そして、2分間の音声レコメンデーションが学習上の制約によるものなのか、それともサービング時のデフォルトによるものなのか——後者であれば、大きい方のモデルに留まる最大の理由は消滅する。それまでの間の正直な要約は、Thinking Machinesが、価格は3分の1、速度は3分の2向上し、独自のエビデンスではコーディングに優れる一方、独立した総合スコアではわずかに劣り、そしてほとんどの報道が触れなかった同サイズのライバルには明確に後れを取るモデルを出荷した、ということだ。
