Inkling AI Model レビュー: Thinking Machinesの初のオープンウェイトモデル、テストと解説
Guides & Insights

Inkling AI Model レビュー: Thinking Machinesの初のオープンウェイトモデル、テストと解説

著者

Jim Song

公開日

最新モデル · 20すべてのモデルを見る
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

このInkling AI model reviewは、元OpenAI CTOであるミラ・ムラティが率いるスタートアップ、Thinking Machines Labのデビューリリースを詳しく見ていきます。Inklingは、オープンウェイト、マルチモーダルなMixture-of-Experts(MoE)モデルで、100万トークンのコンテキストウィンドウと調整可能な「思考努力」ダイヤルを備えています。高速で、セルフホスティングが安価であり、リーダーボードの支配よりもカスタマイズのために構築されています。以下では、ベンダーが自己申告したベンチマークと独立した測定を分離し、アーキテクチャを説明し、実行方法を示し、誰が(そして誰がすべきでないか)採用すべきかを正確に説明します。

日付: 2026-07-16 — 発売から1日後。これは研究に基づいたレビューであり、このように新しいモデルに対しては、まだ実際に長期間テストしたものは存在せず、未確認の数値はすべて以下に記載してあります。

ビルダーの皆様への注意: Inklingを他のモデルと一緒に試したい場合、OrcaRouterは、単一のOpenAI互換エンドポイントでAPI利用可能なモデルのフロントエンドとして機能し、新しい統合なしで比較・切り替えができます。

- TL;DR 総評:Inklingは、ファインチューニングやコスト重視のデプロイにおいて真価を発揮する、真に有能で効率的なオープンモデルです。しかし、最先端のリーダーではなく、その開発元もそれを率直に認めています。カスタマイズ可能でロイヤリティフリーのベースモデルに、巨大なコンテキストウィンドウを求めるなら、2026年の最も興味深いローンチの一つです。一方、現時点で最も強力な単一モデルを求めるなら、他を当たってください。

- 説明: オープンウェイト(Apache 2.0)MoE推論モデル。 対象: クローズドフロンティアAPIに料金を支払う代わりに、ファインチューニングしてセルフホストしたい実務者。

重要なポイント

メーカーと日付:Thinking Machines Lab; 2026年7月15日に、同ラボ初のモデルとしてリリースされました。

アーキテクチャ: スパースMoE、総パラメータ975B/アクティブパラメータ41B、66層、重み内で最大1Mトークンのコンテキスト(ホスト型APIでは256K)。

ライセンス:Apache 2.0 — Hugging Face上のフルウェイト、商用利用およびセルフホスティングに無料。

正直なポジショニング: 同社は、それが「今日利用可能な最強のモデルではない、クローズドでもオープンでもない」とはっきり述べている。

独立スコア: Artificial Analysis Intelligence Index で 41/100 — 97モデル中第10位、およびいくつかのオープンピアより上位(以下の調整を参照)。

費用: 重みはセルフホストにロイヤリティフリーです。ホスト型アクセスは約1M入力トークンあたり1.87ドルから始まります。

注意: ほぼすべての主要ベンチマークはベンダー自己申告であり、独立した監査を受けていません。

Inklingの背後にいるのは誰ですか?

- ファウンダーボックス。 Inklingは最初のモデル、Thinking Machines Lab (thinkingmachines.ai) によって設立されたMira Murati、元OpenAIの最高技術責任者。同研究所はこのローンチ前に比較的秘匿で運営されており、Muratiの以前の雇用主のクローズドフラッグシップアプローチとは対照的なオープンウェイトの姿勢をとっています。Thinking Machinesはないモデル自体を収益化する — 収益は、そのTinkerファインチューニングプラットフォームとサードパーティのホスティングパートナーを通じて得られます。このビジネスモデルはInklingを理解する上で中心的なものです。重みは無料の入り口であり、カスタマイズやスケーリングを行う際に同社は収益を得ます。

Inklingとは何ですか?

Inklingは、オープンウェイト、マルチモーダル、Mixture-of-Expertsの大規模言語・推論モデルであり、2026年7月15日にThinking Machines Labによって発表され、寛容なApache 2.0ライセンスのもと、Hugging Face上でフルウェイトが公開されています。

このローンチが注目に値するのは、そのフレーミングにある。フロンティアの王座を主張するのではなく、Thinking MachinesはInklingを多用途で効率的、カスタマイズ可能なオープンモデルと説明している。異例なほど率直なローンチ日の告白として、同社はInklingについて次のように述べている:「現時点で最強のモデルではない。クローズドであれオープンであれ。」この正直さが、本レビュー全体のトーンを決定づけている。Inklingは、ベンチマークのトロフィーではなく、適応、セルフホスト、ファインチューニングのために設計されたツールなのだ。

フォーチュンとテッククランチの報道もこの見解を支持した。テッククランチは、インクリングは最前線層でOpenAI、Anthropic、Googleを脅かすものではなく、むしろオープンウェイトのホスティングプロバイダーやファインチューニングプラットフォームの中間層に圧力をかけると主張した。フォーブスは、ムラティのオープンウェイト戦略を、米国のクローズドな旗艦モデルよりも、中国のオープンモデルの手本(DeepSeek、Qwen、Kimi)に近いと位置づけた——これは、今回のローンチに関する解説の多くに通底する、米国対中国のオープンウェイトというナラティブである。

アーキテクチャとスペック

内部では、InklingはスパースなMixture-of-Expertsトランスフォーマーです。トークンごとに活性化するパラメータはごく一部であり、これにより総パラメータ数が多いにもかかわらず推論が効率的に行われます。詳細は公式モデルカードとHugging Faceブログに記載されています。

総パラメータ数:975B

アクティブパラメータ: 41B (sparse MoE)

レイヤー: 66層のデコーダのみのトランスフォーマー

専門家: 256ルーテッド + 2シェアード; トークンあたり256ルーテッド中6つ (2つのシェアードは常にアクティブ)

ルーティング: Sigmoid / 補助損失なし

注意:ハイブリッド、5:1 スライディングウィンドウ(ローカル)からグローバル;8 KV ヘッド

位置エンコーディング: 学習済み 相対位置埋め込み(RoPEではない)

マルチモダリティ: エンコーダーフリー — 音声はdMelスペクトログラムとして、画像は40×40パッチとして、直接入力される

追加機能: ショート畳み込み (SConv); MTPレイヤー 投機的デコード用

数値: BF16、MXFP8、NVFP4 (NVIDIA Blackwell用NVFP4チェックポイント)

コンテキストウィンドウ: ウェイト内で最大1,000,000トークン(ホステッドAPIでは256K)

小型バリアント:Inkling-Small、総計276B / アクティブ12B(プレビュー、重み未公開)

いくつかの設計上の選択肢が、InklingをバニラMoEから際立たせている:

エキスパート構成。256のルーティングエキスパートと2つの共有エキスパートがあり、1トークンあたり6つのルーティングエキスパートが発火する構成で、共有ペアは常時オンの「エキスパートシンク」として機能し、共通の計算を担当する一方、ルーティングエキスパートは専門化します。補助損失なしのシグモイドルーティングは、多くのMoE設計で使用される負荷分散ペナルティ項を回避します。

RoPEではなく、相対位置埋め込み。最近の長コンテキストモデルの多くは回転位置埋め込み(RoPE)に依存していますが、Inklingは学習された相対位置埋め込みを使用しており、この規模では珍しい選択です。

エンコーダーレスのマルチモーダル性。 別個のビジョン/オーディオエンコーダーを追加するのではなく、Inklingは40×40の画像パッチとdMelオーディオスペクトログラムを直接トランスフォーマースタックに取り込みます。これによりパイプラインが簡素化され、モデルがネイティブにマルチモーダルと説明される理由の一部となっています。

投機的デコードのためのMTP。 Multi-token-prediction (MTP) 層は内蔵のドラフターとして機能し、別のドラフトモデルなしで生成を高速化します。

エディターノート — 図を追加:1つのInkling層の注釈付きブロック図 — スライディングウィンドウ対グローバルアテンション(5:1)、6つのアクティブなエキスパートが強調表示された256+2エキスパートルーター、SConv、およびMTPドラフターヘッド。

トレーニングと「思考努力」ダイヤル

Inklingの事前学習には45兆のマルチモーダルトークンが使用され、テキスト、画像、音声、ビデオにわたり、ハイブリッドオプティマイザ(大規模行列重みにはMuon、それ以外にはAdam)をNVIDIA GB300 NVL72システム上で使用しました。事後学習では大規模な非同期強化学習がスケーリングされ、3000万以上のロールアウトに及び、2つの長い連続実行でブートストラップされ、初期の教師ありファインチューニングを合成データから行いました。

特徴的なのは、制御可能な推論努力パラメータであり、約0.2から0.99まで掃引されることが示されています。値が高いほど推論が多く、コストも高くなります。これにより、オペレーターはレイテンシとコストを思考の深さとトレードオフできます。以下のすべてのベンチマーク数値は、Effort = 0.99で実行されました。

制御可能な思考努力:実践ガイド

デプロイメントでは、努力制御は reasoning_effort 列挙型として公開され、そのレベルは なし / 最小 / 低 / 中 / 高 / 最高 / 最大。単一の「正しい」設定はありません。これはレイテンシー、コスト、品質のトレードオフを調整する動的なレバーです。以下の表を出発点として使用してください(相対的なガイダンスです。ベンチマーク級の品質は範囲の上限で測定されました)。

なし / 最小限。相対的なレイテンシーとトークンコスト: 最も低い; 最適な用途: 分類、抽出、フォーマット、ルーティング、検索の接着剤

低い。相対的なレイテンシとトークンコスト:低い;最適な用途:短いQ&A、簡単な要約、大量バッチジョブ

中規模。相対レイテンシーとトークンコスト: 中程度; 最適な用途: 一般的なチャット、下書き、ほとんどのエージェントツールコール

高い。相対レイテンシとトークンコスト: より高い; 最適な用途: 多段階推論、コード生成、分析

xhigh / max. 相対的なレイテンシ&トークンコスト: 最高; 最適: 難しい数学、競技スタイルの推論、ベンチマーク同等性 (Effort=0.99)

ローカルで実行できますか?ハードウェアとVRAM

Inklingは975Bパラメータモデルであるため、「ローカル」は現実的にはラップトップではなく、マルチGPUサーバーを意味します。おおよその要件(ローンチの報道とコミュニティツールによる):

BF16(フル)。おおよその合計VRAM: ~2 TB; 構成例: 8× NVIDIA B300、または16× H200

NVFP4(量子化)。合計VRAMの概算: ~600 GB; 構成例: 4× NVIDIA B300、または8× H200

GGUF (コミュニティ). おおよその集計VRAM: 量子化によって異なります; 設定例: Unsloth GGUFビルドは、より小型/量子化されたフットプリント向けに用意されています

NVFP4チェックポイントは、特にNVIDIA Blackwell向けに提供されており、BF16と比較してメモリコストを約3分の2削減します。これは、8-GPUノードと4-GPUのB300ノードの違いに相当します。ほとんどのチームにとって、これは依然として自前のハードウェアではなく、ホスティングプロバイダーやレンタルGPUノードを指し示しています。Unsloth GGUF量子化は、実験のためにハードウェアの段階をさらに低くまで拡張しますが、品質面でいくらかのコストがかかります。

デプロイメントクイックスタート

Inklingは公開しているOpenAI互換のAPIを、そのためほとんどの既存のクライアントコードはベースURLとモデル名を変更するだけでそのまま動作します。代表的な3つの提供パスは以下の通りです:

vLLM — シングルコマンドサーバー(デフォルトはポート8000):

vllm serve thinkingmachines/Inkling --port 8000
# 次にOpenAI互換のエンドポイントをhttp://localhost:8000/v1で呼び出します

SGLang — 8台のGPUに分散(デフォルトはポート30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — multimodal auto class を介してロード:

から transformers をインポート AutoModelForMultimodalLM、AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# reasoning_effort には {none, minimal, low, medium, high, xhigh, max} のいずれかを渡します

エンドポイントがOpenAI互換であるため、既存のアプリを移行するには通常、SDKを新しいベースURLに向け、reasoning_effortを好みに設定するだけです。起動時の追加ランタイムにはTokenSpeedとUnslothが含まれます。

実行場所: 推論プロバイダの可用性

GPUを管理したくない場合、いくつかのパートナーがInklingをホストしています。ローンチ時の「Run Inkling on X」オプション:

Tinker (Thinking Machines). 役割: ファインチューニング; 注記: 64Kおよび256Kのコンテキストオプション; 50%の期間限定ローンチ割引(有料)

Together AI. 役割: ホスティング推論; 注記: OpenAI互換エンドポイント

Fireworks。役割:ホスト型推論;注記:

Modal. 役割: ホステッド推論 / サーバーレスGPU; 注記:

Databricks. 役割: ホスト型推論; 注: Unity AI Gateway経由

Baseten。役割:ホステッド推論;注記:

ベンチマーク: ベンダーの主張 vs. 独立した測定

これは、どんな正直なレビューにおいても最も重要なセクションですInkling review 2026、なぜなら数字は二つの全く異なる場所から来ているからです。

開示:以下に示すすべてのInklingベンチマークは、Artificial Analysis Indexを唯一の例外として、ベンダー自己申告による発表時点のもの (Effort = 0.99、temperature 1.0)であり、独立した監査を受けていない。競合他社の数値は第三者機関(MarkTechPost, Artificial Analysis)から入手したもの、またはThinking Machinesが再実行したものであり、同様に独立した監査を受けていない ここでは。 一部の数値にはハーネスやサブセットの限定が付されている。これらはすべて方向性を示すものであり、絶対的なものではない。

ベンダー自己申告スコア

Thinking Machinesの自社発表資料によると:

AIME 2026 (数学): 97.1%

GPQA Diamond (科学推論): 87.2%

SWE-bench Verified (コーディング、bashのみのハーネス): 77.6%

SWE-bench Pro (公開): 54.3%

MMMU Pro (マルチモーダル): 73.3%

VoiceBench (音声): 91.4%

MMAU(音声):77.2%

IFBench (指示追従): 79.8%

Terminal Bench 2.1 (エージェンティックターミナル): 63.8

FORTRESS 敵対的: 78.0%

SimpleQA確認済み: 43.9%

書面上ではこれらは強力に見える、特に数学と科学の推論の数値が。しかし、同社はInklingを近い将来の競合バージョン(GPT 5.6 Sol、Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra)を使用して自社で生成したスコアでベンチマークした。これらの競合の数値は、ライバル自身が報告した数字と一致しない可能性があるため、直接比較には注意が必要である。

マルチモデル対決(オープンウェイトの競合)

、Inklingと他のオープンウェイトモデルとの最もクリーンなサイドバイサイドの比較が得られますMarkTechPostの比較表 (以下に再掲、MarkTechPostによる)。これは、競合他社を一つの枠にまとめている点で有用です:

HLE. Inkling は 29.7%、Nemotron 3 Ultra は 26.6%、Kimi K2.635.9%、GLM 5.240.1%、DeepSeek V4 Pro35.9%

AIME 2026. Inkling:97.1%;Nemotron 3 Ultra:94.2%;Kimi K2.6:96.4%;GLM 5.2:99.2%;DeepSeek V4 Pro:96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (敵対的). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. 独立した監査は行われていません。

このパターンは明確であり、Thinking Machines自身の謙虚さと一致しています。InklingはFORTRESSでリードし(敵対的安全性)でNemotron 3 Ultraを全体的に打ち負かしますが、それは遅れをとっています GLM 5.2、Kimi K2.6、DeepSeek V4 Proに対して、HLE、SWE-bench Verified、そして特にTerminal Bench 2.1(63.8%対GLM 5.2の82.7%)。エージェント的なコーディングやターミナルタスクを優先する場合、中国の主要なオープンモデルが現在先行しています。

独立した測定 (Artificial Analysis)

より中立的な評価として、Artificial Analysisは2026-07-15にInklingを評価し、以下の通りに置きましたそのIntelligence Index上での41/100、97モデル中10位。このランクを公正に読むための2つのポイント:

これは強いオープンモデルの成果であり、全体的な#1ではありません。、Artificial Analysisによると、Inklingの指数41は位置していますNemotron 3 Ultra (38)、Gemma 4 31B (29)、gpt-oss-120b (24)よりも先に — つまり、オープンウェイトの同業者の中では競争力がありリーディングです。しかし、97中10位ということは、全体的に9つのモデルが上位にランクされており、「有能だが最先端ではない」という枠組みと一致しています。

効率性が際立っています。Artificial Analysisは、強いトークン効率(評価セットの完了に約25Kトークン、比較モデルでは37〜43Kトークン)と、GDPval-AA v2 Eloが1238で、Kimi (1190) およびDeepSeek V4 Flash (1189)、さらにAA-Omniscienceで(+2)の僅かな優位があると指摘しています。

出力速度は72.7トークン/秒、最初のトークンまでの時間は1.75秒でした。要するに、上位10位に入る立派な成績であり、真に効率的なものですが、リーダーボードでの勝利として誇張することは意図的に避けています。

マルチモーダルおよび長いコンテキストの機能

Inklingはテキスト(UTF-8)、画像(40pxから4096px、階層パッチエンコーダを使用)、および音声(16kHz WAV、最大約20分、離散トークンエンコーディングを使用)を受け入れます。出力はテキストのみ — 画像や音声の生成はないため、理解モデルとして計画してください(生成モデルではありません)。ビデオはプレトレーニングで使用されましたが、ありませんローンチ時点ではサポートまたは評価される入力であり、まだそれについて計画を立てないでください。

主要な機能は、100万トークンのコンテキストウィンドウであり、リリースされた重みにおいて、リポジトリ全体のコード分析、長文書の合成、および積極的なチャンキングを必要としない拡張マルチターンエージェントセッションへの扉を開きます。実際的なニュアンスに注意してください:ホスト型APIは最大256Kトークンを公開します、そのためフル1Mは現時点ではセルフホスト機能です。スライディングウィンドウアテンション設計と投機的デコードと組み合わせることで、長コンテキストのストーリーはInklingの最も実用的なセールスポイントの一つであり続けています。

価格、ティア、および総保有コスト

Inklingは真にオープンです。完全な重み(BF16チェックポイントとNVFP4チェックポイント)は公開されており、Hugging FaceにApache 2.0の下で、そのためセルフホスティングはロイヤリティフリーです — あなたは計算費用のみを支払います。Thinking Machinesはモデル自体を収益化しておらず、収益はTinkerとサードパーティのホストを通じて得られます。

ホスティング型トークンごとの価格設定(Artificial Analysisによる)、コンテキスト階層別:

64K. 入力 / 1M: $1.87; キャッシュ入力 / 1M: $0.374; 出力 / 1M: $4.68

256K. 入力 / 1M: $3.74; キャッシュ入力 / 1M: $0.748; 出力 / 1M: $9.36

期間限定のローンチ割引50%を反映しています。正確なTinkerのトークンあたりの数字はドキュメントに記載されており、変更される予定です。

セルフホスト vs API — TCOの考え方。 経済はボリュームと利用率に依存します:

API (Tinker / パートナー): 固定費ゼロ、トークンごとの支払い、開始はほぼ即時。低ボリュームまたはスパイク状のボリューム、あるいはプロトタイピング中に最適です。

セルフホスト(レンタルまたは所有のGPU): ビジーかどうかに関わらず 4~8 GPU ノードの料金を支払いますが、限界トークンコストはほぼ電力コストに近づきます。Inkling は 41B パラメータのみを活性化し、トークン効率が良いため(Artificial Analysis セットによると約 25K 対 37~43K)、GPU 時間あたりのスループットは良好で、ノードが十分に活用されれば、大規模で安定したワークロードはトークン単位の API 価格よりも実質的に安くなります。ローンチ時のコメントでは、セルフホストのオープンウェイトは大規模なクローズド API の使用と比較して約 40~60% 安いとされていましたが、これは方向性を示す主張であり、監査済みの数字ではありません。

編集者注 — ビジュアルを追加:損益分岐点チャート — 月間トークン数(x軸)対総コスト(y軸)のグラフで、3つの線:closed frontier API、Inkling hosted API、およびレンタルGPUノード上のInkling self-hosted — 自己ホスティングが優位となるクロスオーバーポイントを示す。

安全性、アライメント、および検閲

安全性はインクリングの最も強力で差別化されたストーリーの一つです。においてFORTRESS adversarialベンチマークのスコアは78.0% — そのオープンウェイトモデルの中で最高MarkTechPostの比較において、GLM 5.2 (71.3%)、Kimi K2.6 (65.6%)を上回り、DeepSeek V4 Pro (36.0%)を大きく上回っています。Thinking Machinesはまた、モデルの出力における校正された不確実性を強調しています。

VentureBeatの報道は関連する特性を強調しました: 検閲への耐性. 寛容なApache 2.0ライセンスと組み合わせることで、Inklingはオープンモデルとして位置づけられ、チームは不透明でベンダーが課すコンテンツ管理体制を継承するのではなく、自社のポリシーに合わせて調整することができます。これは規制対象または地域固有の展開にとって重要な考慮事項です。発売日のモデルと同様に、独立したレッドチームまたは第三者による安全性監査は執筆時点では表面化していなかったため、FORTRESSのリードは外部認証ではなくベンダー/第三者ソースとして扱ってください。

Inklingをファインチューニングすべきでしょうか?

ファインチューニングはおそらくInklingの存在理由です。簡単な意思決定フレームワーク:

ファインチューニング(Tinkerまたは独自のパイプライン経由)を行う条件:プロプライエタリデータ、狭いドメイン、または小規模な特化型モデルが汎用モデルに勝るタスクがある場合、重みを所有する必要がある場合、または特定のトーン、フォーマット、ポリシーを組み込みたい場合。64K/256K Tinkerコンテキストオプションとローンチ割引が障壁を低くします。

以下の場合、ベースモデル(セルフホストまたはAPI)を使用してください:タスクが汎用的である、ボリュームが少ない、またはファインチューニングがメトリクスを改善することをまだ確認していない場合です。プロンプトエンジニアリングとreasoning_effortの調整で、多くの場合十分な成果が得られます。

以下の場合は他を探してください:最先端のエージェント型コーディングを今すぐ必要とする(GLM 5.2とKimi K2.6がそれらのベンチマークでリードしている)か、独立監査済みの品質保証が必要な場合。

長所と短所

長所

のもとで完全にオープンなウェイトApache 2.0、ロイヤリティフリーでセルフホスト可能、商用利用無料。

効率的なスパースMoE(アクティブなパラメータはわずか41B)と強力なトークン効率性により、推論コストと速度の競争力を維持します。

巨大な 1Mトークンコンテキスト(重み内、API経由256K)。

真のマルチモダリティ(テキスト、画像、音声 入力).

制御可能な reasoning_effort ダイヤル(なし→最大)で、リアルタイムのコスト/品質のトレードオフを実現。

クラス最高のオープンウェイト対敵安全性(FORTRESS 78.0%、MarkTechPostによる)と「検閲への耐性」

強力で独立した地位 — Artificial Analysis Indexで97中トップ10、Nemotron 3 Ultra、Gemma 4 31B、gpt-oss-120bを抑えて。

短所

明らかに最先端モデルではない、製造元自身の認めるところにより。

エージェントおよびコーディングベンチマーク(Terminal Bench 2.1、SWE-bench Verified、HLE)において、主要なオープンライバル(GLM 5.2、Kimi K2.6、DeepSeek V4 Pro)に遅れを取っている。

ほとんどのベンチマークはベンダーによる自己報告であり、独立した監査を受けていません。

テキストのみの出力; 画像/音声生成なし; 起動時は動画入力なし; Inkling-Smallはまだプレビュー版

実際の「ローカル」利用には、マルチGPUノードが必要です(量子化しても約600GBのVRAM)。

立ち上げ時には、実質的な独立した批判的レビューや安全性/レッドチームレビューは表面化していませんでした。

誰がInklingを使うべきですか?

Inklingは、あなたが実践者またはチームで、次のことを望む場合に最適です:所有しカスタマイズするあなたのモデルを閉じられたAPIをレンタルするのではなく。理想的なユースケースは次のとおりです。

ファインチューニングチーム Tinkerまたは自社のパイプラインを介してドメイン固有モデルを構築する。

コスト重視の大量展開 において、ロイヤリティフリーのセルフホスティングがトークン単位のフロンティア価格設定に勝る。

長文脈ワークロード(リポジトリ全体のコード支援、文書分析、長時間のエージェントセッションなど)。

マルチモーダルアプリケーション テキスト、画像、音声の理解を組み合わせる必要がある。

ポリシーに敏感なデプロイメント強固な安全性と検閲耐性を備えたオープンベースに自らを合わせることを望む。

絶対的に最強の推論やエージェント的コーディング性能が必要な場合、ビデオ入力や生成出力が必要な場合、または導入前に独立監査済みのベンチマークが必要な場合には、不向きです。

評決と最終評価

象を直接取り上げましょう: Inklingは今日利用可能な最強のモデルではありません、そしてThinking Machinesはまさにそう言っています。皮肉に読めば低い基準です。公平に読めば、それがすべてのポイントです — Inklingはリーダーボードのトップを競うのとは異なる目的に最適化されています。効率的で(41Bアクティブ、約25Kトークンのタスク予算)、オープンライセンス(Apache 2.0)、オープンウェイトの基準では安全(FORTRESS 78%)、そしてファインチューニングとセルフホスティングが可能なように構築されています。その組み合わせにより、最も難しいエージェンティックおよびコーディングベンチマークでGLM 5.2やKimi K2.6に劣るとはいえ、2026年のより思慮深いオープンモデルのローンチの一つとなっています。

残りのアスタリスクは、大部分が自己申告によるベンチマークであり、この初期段階では独立した批評的なレビューは存在しません。しかし、意図された読者層——所有権、カスタマイズ、コスト管理、そして最先端の自慢権よりも巨大なコンテキストウィンドウを重視する開発者——にとっては、Inklingは期待に応えています。

評価: 5点中4点ビルダーやファインチューナーを対象とした場合の評価です。最先端の性能を厳密に求めるなら、評価は下がります。

よくある質問

Inklingとは何か、誰が作ったのか?Inklingは、元OpenAIのCTOであるミラ・ムラーティが率いるAIスタートアップ、Thinking Machines Labによる最初のモデルです。2026年7月15日に、オープンウェイト、マルチモーダルなMixture-of-Experts推論モデルとしてリリースされました。

インクリングは最高のAIモデルですか?いいえ、そして、同社はそれが最高だとは主張していません — インクリングは「今日利用可能なクローズドモデルやオープンモデルの中で最強ではない」と述べています。独立した評価(Artificial Analysis)では、全体97位中10位にランク付けされていますが、いくつかのオープンモデルをリードしています。

Inklingのパラメータ数はいくつで、コンテキストウィンドウはどれくらいですか? 合計975B、アクティブ41B(スパースMoE)、66層。コンテキストウィンドウは、リリースされた重みでは最大1,000,000トークン、ホスト型APIでは最大256Kです。

Inklingはオープンソースですか?ライセンスは何ですか?の下で重みはリリースされていますApache 2.0、商用利用と自家ホスティングが許可されています。これは「オープンウェイト」―完全なモデルの重みはHugging Faceにあります。

Inklingは無料で使えますか?重み付けは無料で、ロイヤリティフリーでセルフホスティングできます。Tinkerでのファインチューニングや、Together AI、Fireworks、Modal、Databricks、Basetenなどのプロバイダーを通じた推論ホスティングは有料サービスです。ホスティングアクセスは、1M入力トークンあたり約1.87ドルから(期間限定のローンチ割引)です。

Inklingを実行またはダウンロードするにはどうすればよいですか?また、必要なハードウェアは何ですか? Hugging Faceから重みをダウンロードし、OpenAI互換APIを介してvLLM、SGLang、またはHugging Face Transformersで提供します。BF16の場合、集約VRAMは約2TB(8×B300 / 16×H200)、NVFP4量子化チェックポイントの場合は約600GB(4×B300 / 8×H200)を見込んでください。コミュニティのUnsloth GGUFビルドは実験のハードルを下げます。

Inklingをファインチューンするにはどうすればいいですか?Thinking Machinesのを使用するTinkerプラットフォーム(64Kおよび256Kのコンテキストオプションと期間限定のローンチ50%割引を提供)を使用するか、オープンウェイトを自身のパイプラインでファインチューンしてください。

制御可能な思考労力とは何ですか? reasoning_effort設定(なし / 最小 / 低 / 中 / 高 / 超高 / 最大)で、遅延とトークンコストを推論の深さと交換します。低労力は分類や抽出に適しており、最大労力は難しい数学問題に適しており、ベンチマーク構成(Effort=0.99)に一致します。

InklingはKimi、GLM、DeepSeek、Nemotronと比較してどうですか?MarkTechPostの比較によると、InklingはFORTRESS(安全性)でリードしており、Nemotron 3 Ultraを広範囲で打ち負かしていますが、Terminal Bench 2.1、SWE-bench Verified、HLEではGLM 5.2、Kimi K2.6、DeepSeek V4 Proに劣っています。競争力はありますが、エージェンティックコーディングにおいて最も強力なオープンモデルではありません。

Inklingは画像、音声、動画を処理できますか?としてテキスト、画像(40px~4096px)、音声(16kHz WAV、最大約20分)を受け付ける入力。出力はテキストのみ — 画像や音声の生成は行いません。動画は事前学習で使用されましたが、ローンチ時点ではサポートされている入力ではありません。

Inklingのベンチマークスコアは信頼できますか?慎重に扱ってください。独立したArtificial Analysis Intelligence Indexを除き、見出しの数値はベンダーが発表時に自己報告したものであり、独立して監査されていません。競合他社の数値は第三者機関(MarkTechPost)からのものか、Thinking Machinesによって再実行されたものであり、競合他社自身が報告した数値と一致しない可能性があります。

Inkling-Smallとは何ですか?そしてロードマップはどうなっていますか? Inkling-Smallは小型のバリアントです(総パラメータ276B、アクティブ12B)。ローンチ時点ではまだプレビュー段階であり、重みはまだ公開されていません。メインモデルには既に投機的デコード用のMTPレイヤーが搭載されています。



この記事で比較したモデル2

この記事から検出 · ベンチマーク:Artificial Analysis · 毎日更新

© 2026 OrcaRouter

プロバイダー向け

推論プラットフォームを運営していますか?OrcaRouter にモデルを掲載しましょう。

お問い合わせ

コミュニティに参加

DiscordEmailXGitHubYouTube