Revue du modèle Inkling AI : le premier modèle à poids ouverts de Thinking Machines, testé et expliqué
Guides & Insights

Revue du modèle Inkling AI : le premier modèle à poids ouverts de Thinking Machines, testé et expliqué

Auteur

Jim Song

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Cette revue du modèle Inkling AI examine de près la première version de Thinking Machines Lab, la startup dirigée par l'ancienne CTO d'OpenAI, Mira Murati. Inkling est un modèle Mixture-of-Experts (MoE) multimodal, à poids ouverts, avec une fenêtre de contexte de 1 million de tokens et un cadran contrôlable d'« effort de réflexion ». Il est rapide, peu coûteux à héberger soi-même, et conçu pour la personnalisation plutôt que pour dominer les classements. Ci-dessous, nous séparons les benchmarks autodéclarés du fournisseur des mesures indépendantes, parcourons l'architecture, montrons comment l'exécuter, et expliquons exactement qui devrait (et ne devrait pas) l'adopter.

En date du : 2026-07-16 — un jour après le lancement. Il s'agit d'une analyse basée sur la recherche ; il n'existe encore aucun test pratique à long terme pour un modèle aussi récent, et nous signalons chaque chiffre non vérifié ci-dessous.

Une note pour les constructeurs : si vous souhaitez essayer Inkling en parallèle d'autres modèles, OrcaRouter fait office de front-end pour les modèles disponibles via API avec un seul point de terminaison compatible OpenAI, afin que vous puissiez comparer et basculer sans nouvelles intégrations.

- TL;DR : verdictInkling est un modèle ouvert véritablement compétent et efficace, qui excelle pour le fine-tuning et le déploiement économique, mais ce n'est pas un leader de la frontière et son créateur le dit ouvertement. Si vous voulez une base personnalisable et libre de droits avec une immense fenêtre de contexte, c'est l'un des lancements les plus intéressants de 2026. Si vous voulez le modèle le plus puissant disponible, cherchez ailleurs.

- Ce que c'est : Un modèle de raisonnement MoE à poids ouverts (Apache 2.0). À qui cela s'adresse : Des praticiens qui souhaitent affiner et auto-héberger plutôt que de payer pour une API frontière fermée.

Points clés

Fabricant & date : Thinking Machines Lab; publié le 15 juillet 2026 comme premier modèle du laboratoire.

Architecture : Sparse MoE, 975B paramètres totaux / 41B paramètres actifs, 66 couches, jusqu'à 1M de tokens de contexte dans les poids (256K via les API hébergées).

Licence : Apache 2.0 — poids complets sur Hugging Face, gratuit pour usage commercial et auto-hébergement.

Positionnement honnête: L'entreprise déclare carrément qu'il “n'est pas le modèle le plus fort disponible aujourd'hui, fermé ou ouvert.”

Score indépendant : 41/100 sur l'Indice Artificial Analysis Intelligence — #10 sur 97 modèles, et devant plusieurs pairs ouverts (voir la réconciliation ci-dessous).

Coût : Les poids sont libres de droits pour auto-hébergement ; l'accès hébergé commence à environ 1,87 $ / 1M tokens d'entrée.

Avertissement : Presque tous les principaux benchmarks sont auto-déclarés par les fournisseurs et ne sont pas audités indépendamment.

Qui est derrière Inkling ?

- Founder box. Inkling est le premier modèle de Thinking Machines Lab (thinkingmachines.ai), fondé par Mira Murati, anciennement Chief Technology Officer chez OpenAI. Le laboratoire a opéré dans une relative discrétion avant ce lancement et a adopté une position open-weights qui contraste avec l’approche closed-flagship de l’ancien employeur de Murati. Thinking Machines ne pas monétise le modèle lui-même — les revenus passent par son Tinker plateforme de fine-tuning et partenaires d'hébergement tiers. Ce modèle économique est essentiel pour comprendre Inkling : les poids sont un point d'entrée gratuit, et l'entreprise gagne de l'argent lorsque vous personnalisez ou mettez à l'échelle.

Qu'est-ce qu'Inkling ?

Inkling est un modèle de langage et de raisonnement à grande échelle, à poids ouverts, multimodal, à mélange d'experts, annoncé par Thinking Machines Lab le 15 juillet 2026 et publié sous la permissive Apache 2.0 licence avec les poids complets sur Hugging Face.

Ce qui rend ce lancement remarquable, c'est le cadrage. Plutôt que de revendiquer une couronne de pionnier, Thinking Machines décrit Inkling comme un modèle ouvert, polyvalent, efficace et personnalisable. Dans un aveu inhabituellement franc pour un jour de lancement, l'entreprise déclare qu'Inkling “n'est pas le modèle le plus fort disponible aujourd'hui, fermé ou ouvert.” Cette honnêteté donne le ton pour l'ensemble de cette critique : Inkling est un outil conçu pour être adapté, auto-hébergé et affiné, et non un trophée de référence.

Les articles de Fortune et TechCrunch ont fait écho à cette lecture. TechCrunch a soutenu qu'Inkling ne menace pas OpenAI, Anthropic ou Google au niveau des modèles de pointe, mais qu'elle exerce plutôt une pression sur la couche intermédiaire des fournisseurs d'hébergement de poids ouverts et des plateformes de réglage fin. Forbes a présenté la stratégie des poids ouverts de Murati comme plus proche du manuel des modèles ouverts chinois (DeepSeek, Qwen, Kimi) que des vaisseaux amiraux fermés américains — un récit de poids ouverts opposant les États-Unis à la Chine qui parcourt une grande partie des commentaires sur le lancement.

Architecture et spécifications

Sous le capot, Inkling est un transformateur à mélange d'experts creux. Seule une fraction de ses paramètres s'active par token, ce qui maintient l'inférence efficace malgré le nombre total élevé de paramètres. Les détails sont documentés dans la fiche officielle du modèle et le blog Hugging Face.

Paramètres totaux : 975B

Paramètres actifs : 41B (MoE éparse)

Couches : transformateur décodeur seul de 66 couches

Experts : 256 routés + 2 partagés ; 6 des 256 routés par jeton (les 2 partagés toujours actifs)

Routage : Sigmoïde / sans perte auxiliaire

Attention : Hybride, fenêtre glissante 5:1 (locale) à globale ; 8 KV heads

Encodage de position : apprisembeddings de position relative (pas RoPE)

Multimodalité : sans encodeur — l'audio sous forme de spectrogrammes dMel, les images sous forme de patches 40×40, alimentés directement

Suppléments : Convolutions courtes (SConv); MTP couches pour le décodage spéculatif

Numériques : BF16, MXFP8, NVFP4 (point de contrôle NVFP4 pour NVIDIA Blackwell)

Fenêtre de contexte : Jusqu'à 1 000 000 tokens dans les poids (256K sur les API hébergées)

Variante plus petite : Inkling-Small, 276B total / 12B actifs (aperçu, poids pas encore publiés)

Quelques choix de conception distinguent Inkling d'un MoE standard :

Disposition experte. Avec 256 experts routés plus 2 experts partagés, et 6 experts routés qui se déclenchent par jeton, la paire partagée agit comme un « puits d’experts » toujours actif qui capture le calcul commun pendant que les experts routés se spécialisent. Le routage sigmoïde sans perte auxiliaire évite le terme de pénalité d’équilibrage de charge utilisé par de nombreuses conceptions MoE.

Embeddings de position relative, pas RoPE. La plupart des modèles modernes à long contexte s'appuient sur les embeddings rotatifs ; Inkling utilise quant à lui des embeddings de position relative appris, un choix inhabituel à cette échelle.

Multimodalité sans encodeur. Plutôt que d'ajouter des encodeurs séparés pour la vision et l'audio, Inkling ingère directement des patchs d'image 40×40 et des spectrogrammes audio dMel dans la pile de transformateurs. Cela simplifie le pipeline et explique en partie pourquoi le modèle est décrit comme nativement multimodal.

MTP pour le décodage spéculatif. Les couches de prédiction multi-tokens (MTP) agissent comme un drafteur intégré, accélérant la génération sans modèle de draft séparé.

Note de l’éditeur — ajouter un visuel :Un diagramme de blocs annoté d’une couche Inkling — attention par fenêtre glissante vs globale (5:1), le routeur d’experts 256+2 avec 6 experts actifs mis en évidence, SConv et la tête MTP drafter.

Entraînement et le cadran « effort de réflexion »

Inkling a été pré-entraîné sur 45 billions de jetons multimodaux couvrant le texte, les images, l'audio et la vidéo, en utilisant un optimiseur hybride (Muon pour les grandes matrices de poids, Adam pour le reste) sur des systèmes NVIDIA GB300 NVL72. Le post-entraînement a utilisé un apprentissage par renforcement asynchrone à grande échelle dépassant 30M+ rollouts sur deux longues séquences continues, amorcé à partir d'un fine-tuning supervisé initial sur des données synthétiques.

Une caractéristique distinctive est un paramètre d'effort de raisonnement contrôlable, démontré comme variant d'environ 0,2 à 0,99, où des valeurs plus élevées signifient plus de raisonnement et plus de coût. Cela permet aux opérateurs de faire un compromis entre latence et dépenses et profondeur de réflexion. Tous les chiffres de référence ci-dessous ont été exécutés avec Effort = 0,99.

Effort de pensée contrôlable : un guide opérationnel

Lors du déploiement, le contrôle de l'effort est exposé sous forme d'une énumération reasoning_effort avec les niveaux aucun / minimal / faible / moyen / élevé / très élevé / max. Il n’existe pas de réglage “idéal” unique — il s’agit d’un levier dynamique pour le compromis latence-coût-qualité. Utilisez le tableau ci-dessous comme point de départ (orientation relative ; la qualité de niveau benchmark a été mesurée au sommet de la fourchette) :

aucun / minimal. Latence relative et coût des tokens : Le plus bas ; Meilleur pour : Classification, extraction, formatage, routage, colle de récupération

faible. Latence relative et coût en tokens : Faible; Idéal pour : Questions-réponses courtes, résumé simple, tâches par lots à volume élevé

Moyen. Latence relative et coût des tokens : Modéré ; Idéal pour : Discussions générales, rédaction, la plupart des appels d'outils d'agent

élevé. Latence relative et coût en jetons : Plus élevé ; Idéal pour : Raisonnement en plusieurs étapes, génération de code, analyse

xhigh / max. Latence relative et coût des jetons : Le plus élevé ; Meilleur pour : Mathématiques difficiles, raisonnement de type compétition, parité de benchmark (Effort=0.99)

Pouvez-vous l'exécuter localement ? Matériel et VRAM

Parce qu'Inkling est un modèle à 975 milliards de paramètres, « local » signifie en réalité un serveur multi-GPU, et non un ordinateur portable. Exigences approximatives (selon la couverture du lancement et les outils de la communauté) :

BF16 (complet). VRAM agrégée approx.: ~2 To ; Exemples de configurations: 8× NVIDIA B300, ou 16× H200

NVFP4 (quantifié). VRAM agrégée approx.:~600 Go ; Exemples de configurations : 4× NVIDIA B300, ou 8× H200

GGUF (communauté). VRAM agrégée approx. : Varie selon la quant. ; Exemples de configurations : Des builds Unsloth GGUF existent pour des empreintes plus petites/quantifiées

Le checkpoint NVFP4 — livré spécifiquement pour NVIDIA Blackwell — réduit la facture mémoire d'environ deux tiers par rapport au BF16, ce qui correspond à la différence entre un nœud B300 à 8 GPU et un nœud à 4 GPU. Pour la plupart des équipes, cela oriente encore vers un fournisseur hébergé ou un nœud GPU loué plutôt que du matériel possédé. Les quantifications Unsloth GGUF étendent encore la portée vers le bas de l'échelle matérielle pour l'expérimentation, au prix d'une certaine qualité.

Démarrage rapide du déploiement

Inkling expose une API compatible avec OpenAI, donc la plupart du code client existant fonctionne comme un remplacement direct avec une URL de base et un nom de modèle modifiés. Les trois chemins de service courants :

vLLM — serveur à commande unique (port par défaut 8000) :

vllm serve thinkingmachines/Inkling --port 8000
# puis appelez le point de terminaison compatible OpenAI sur http://localhost:8000/v1

SGLang — répartir sur 8 GPU (par défaut sur le port 30000):

python -m sglang.launch_server \
  --model-path thinkingmachines/Inkling \
  --tp 8 --port 30000

Hugging Face transformers — chargez via la classe auto multimodale :

from transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# passer reasoning_effort dans {none, minimal, low, medium, high, xhigh, max}

Comme le point de terminaison est compatible avec OpenAI, migrer une application existante consiste généralement à pointer votre SDK vers la nouvelle URL de base et à ajuster reasoning_effort selon vos préférences. Les environnements d'exécution supplémentaires au lancement incluent TokenSpeed et Unsloth.

Où l'exécuter : disponibilité du fournisseur d'inférence

Si vous préférez ne pas gérer les GPU, plusieurs partenaires hébergent Inkling. Options « Exécuter Inkling sur X » au lancement :

Tinker (Thinking Machines). Rôle : Fine-tuning; Notes : options de contexte 64K et 256K ; 50 % de réduction de lancement à durée limitée (payant)

Together AI. Rôle : Inférence hébergée ; Notes : points de terminaison compatibles OpenAI

Feux d'artifice. Rôle : Inférence hébergée ; Notes :

Modal. Rôle : Inférence hébergée / GPU sans serveur ; Notes :

Databricks. Rôle : Inférence hébergée ; Notes : via Unity AI Gateway

Baseten. Rôle : Inférence hébergée ; Notes :

Repères : affirmations du fournisseur vs. mesure indépendante

Ceci est la section la plus importante de toute honnête Inkling review 2026, car les chiffres proviennent de deux endroits très différents.

Divulgation : À l'exception unique de l'Artificial Analysis Index, chaque benchmark Inkling ci-dessous est auto-déclaré par le fournisseur au lancement (Effort = 0.99, température 1.0) et a pas été audité de manière indépendante. Les chiffres des concurrents proviennent de tiers (MarkTechPost, Artificial Analysis) ou ont été ré-exécutés par Thinking Machines, et sont de même pas audités de manière indépendante ici. Certains chiffres comportent des qualificatifs de banc d'essai ou de sous-ensemble. Traitez-les tous comme indicatifs, non comme une vérité.

Scores auto-déclarés par le fournisseur

Selon les propres documents de lancement de Thinking Machines :

AIME 2026 (maths): 97.1%

GPQA Diamond (raisonnement scientifique): 87.2%

SWE-bench Verified (codage, environnement bash uniquement) : 77.6%

SWE-bench Pro (Public): 54,3 %

MMMU Pro (multimodal): 73.3%

VoiceBench (audio) : 91.4%

MMAU (audio): 77,2 %

IFBench (suivi d'instructions) : 79.8%

Terminal Bench 2.1 (agentic terminal) : 63.8

FORTRESS Adversarial: 78.0%

SimpleQA Verified : 43,9 %

Sur le papier, ceux-ci semblent solides, en particulier les chiffres de raisonnement mathématique et scientifique. Mais l'entreprise a comparé Inkling à des versions concurrentes du futur proche (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) en utilisant des scores qu'il a lui-même générés. Ces chiffres des concurrents peuvent ne pas correspondre aux propres chiffres rapportés par les rivaux, donc les comparaisons directes doivent être lues avec prudence.

Tête-à-tête multi-modèle (rivaux à poids ouverts)

Le comparatif le plus clair d'Inkling face à d'autres modèles open-weight provient de le tableau comparatif de MarkTechPost (reproduit ci-dessous, attribué à MarkTechPost). Il est utile précisément car il place les concurrents dans un seul cadre :

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling : 97,1 % ; Nemotron 3 Ultra : 94,2 % ; Kimi K2.6 : 96,4 % ; GLM 5.2 : 99,2 % ; DeepSeek V4 Pro : 96,7 %

SWE-bench Verified. Inkling : 77.6 % ; Nemotron 3 Ultra : 70.7 % ; Kimi K2.6 : 80.2 % ; GLM 5.2 : 80.0 % ; DeepSeek V4 Pro : 80.6 %

Terminal Bench 2.1. Inkling : 63,8 % ; Nemotron 3 Ultra : 56,4 % ; Kimi K2.6 : 71,3 % ; GLM 5.2 : 82,7 % ; DeepSeek V4 Pro : 64 %

FORTRESS (adversaire). Inkling : 78,0 % ; Nemotron 3 Ultra : 77,6 % ; Kimi K2.6 : 65,6 % ; GLM 5.2 : 71,3 % ; DeepSeek V4 Pro : 36,0 %

MarkTechPost. Non audité de manière indépendante.

Le schéma est clair et cohérent avec la modestie propre de Thinking Machines. Inkling mène sur FORTRESS (sécurité antagoniste) et bat Nemotron 3 Ultra sur toute la ligne, mais il est distancé par GLM 5.2, Kimi K2.6 et DeepSeek V4 Pro sur HLE, SWE‑bench Verified, et surtout Terminal Bench 2.1 (63,8 % contre les 82,7 % de GLM 5.2). Si le codage agentique et les tâches terminales sont votre priorité, les principaux modèles chinois ouverts sont en avance aujourd’hui.

Mesure indépendante (Artificial Analysis)

Pour une lecture plus neutre, Artificial Analysis a évalué Inkling le 2026-07-15 et l'a classé à 41/100 sur son Intelligence Index, classé #10 sur 97 modèles. Deux points pour lire ce classement de manière équitable :

C'est une solide démonstration de modèle ouvert, pas un #1 global.Selon Artificial Analysis, l'indice d'Inkling de 41 se situe devant Nemotron 3 Ultra (38), Gemma 4 31B (29) et gpt-oss-120b (24) — donc parmi les pairs en poids ouverts, il est compétitif à leader. Mais #10 sur 97 signifie que neuf modèles sont mieux classés globalement, ce qui correspond au cadre « capable, pas de pointe ».

L'efficacité est ce qui le distingue. Artificial Analysis note une forte efficacité en tokens — environ 25K tokens pour compléter son ensemble d'évaluation contre 37–43K pour les modèles de comparaison — et un Elo GDPval-AA v2 de 1238, devant Kimi (1190) et DeepSeek V4 Flash (1189), plus un léger avantage (+2) sur AA-Omniscience.

La vitesse de sortie mesurée est de 72,7 tokens/s avec un délai avant le premier token de 1,75 s. En bref : un classement respectable dans le top dix, et un résultat réellement efficace — mais nous évitons délibérément de le présenter comme une victoire au classement.

Capacités multimodales et de contexte long

Inkling accepte du texte (UTF-8), des images (de 40px à 4096px via un encodeur de patch hiérarchique) et de l'audio (WAV 16kHz, jusqu'à environ 20 minutes, en utilisant un encodage par tokens discrets). La sortie est uniquement du texte — il n'y a pas de génération d'images ou d'audio, donc planifiez pour un modèle de compréhension, pas un modèle de génération. La vidéo a été utilisée lors du pré-entraînement mais est pas une entrée prise en charge ou évaluée au lancement, donc ne planifiez pas encore autour de cela.

La capacité phare est la fenêtre de contexte d'un million de tokens dans les poids publiés, ce qui ouvre la voie à l'analyse de code de dépôts entiers, à la synthèse de longs documents et à des sessions d'agents multi-tours étendues sans découpage agressif. Notez la nuance pratique : les API hébergées exposent jusqu'à 256K tokens, donc le 1M complet est une fonctionnalité auto-hébergée aujourd'hui. Combiné avec la conception d'attention à fenêtre glissante et le décodage spéculatif, l'histoire du long contexte reste l'un des arguments de vente les plus pratiques d'Inkling.

Tarification, niveaux et coût total de possession

Inkling est véritablement ouvert. Les poids complets (un checkpoint BF16 plus un checkpoint NVFP4) sont sur Hugging Face sous Apache 2.0, donc l'auto-hébergement est sans redevance — vous ne payez que pour le calcul. Thinking Machines ne monétise pas le modèle lui-même ; les revenus passent par Tinker et des hébergeurs tiers.

Tarification hébergée par jeton (par Artificial Analysis), par niveau de contexte :

64K. Entrée / 1M : $1,87 ; Entrée en cache / 1M : $0,374 ; Sortie / 1M : $4,68

256K. Entrée / 1M : $3.74; Entrée mise en cache / 1M : $0.748; Sortie / 1M : $9.36

Reflète une remise de lancement de 50 % à durée limitée ; les chiffres exacts par jeton pour Tinker se trouvent dans la documentation et changeront.

Auto-hébergement vs API — comment penser au TCO. L'économie tourne autour du volume et de l'utilisation :

API (Tinker / partenaires) : zéro coût fixe, paiement par token, démarrage quasi instantané. Idéal pour les volumes faibles ou irréguliers, ou lors du prototypage.

Auto-hébergement (GPU loués ou possédés) : vous payez pour un nœud de 4 à 8 GPU qu'il soit occupé ou non, mais le coût marginal par token se rapproche du coût de l'électricité brute. Comme Inkling n'active que 41B paramètres et est efficace en termes de tokens (~25K contre 37–43K selon l'ensemble Artificial Analysis), le débit par heure de GPU est favorable, et les charges de travail lourdes et constantes peuvent revenir nettement moins cher que la tarification par token d'API une fois qu'un nœud est bien utilisé. Les commentaires autour du lancement ont présenté l'auto-hébergement des poids ouverts comme environ 40 à 60% moins cher que l'utilisation comparable d'API fermée à grande échelle — une affirmation directionnelle, pas un chiffre audité.

Note de l'éditeur — ajouter un visuel : Un graphique de seuil de rentabilité — volume mensuel de tokens (x) vs coût total (y) avec trois lignes : API frontier fermée, API Inkling hébergée, et Inkling auto-hébergée sur un nœud GPU loué — montrant le point de croisement où l'auto-hébergement devient plus rentable.

Sécurité, alignement et censure

La sécurité est l’un des récits les plus forts et les plus différenciés d’Inkling. Sur le FORTRESS adversarial benchmark, il obtient un score de 78.0% — le meilleur parmi les modèles à poids ouverts dans la comparaison de MarkTechPost, devant GLM 5.2 (71.3%), Kimi K2.6 (65.6%) et bien devant DeepSeek V4 Pro (36.0%). Thinking Machines met également l’accent sur l’incertitude calibrée dans les sorties du modèle.

La couverture de VentureBeat a mis en évidence une propriété connexe : résistance à la censure. Combinée avec une licence Apache 2.0 permissive, cela positionne Inkling comme un modèle ouvert que les équipes peuvent aligner sur leurs propres politiques plutôt que d'hériter d'un régime de contenu opaque imposé par un fournisseur — une considération importante pour les déploiements réglementés ou spécifiques à une région. Comme toujours avec un modèle de jour de lancement, aucun red-team indépendant ni audit de sécurité tiers n'était apparu au moment de la rédaction, donc traitez la piste FORTRESS comme provenant d'un fournisseur/tiers plutôt que certifiée de manière externe.

Devriez-vous affiner Inkling ?

L'ajustement précis est sans doute la raison d'être d'Inkling. Un cadre décisionnel rapide :

Ajustez finement (via Tinker ou votre propre pipeline) si : vous disposez de données propriétaires, d'un domaine restreint, ou d'une tâche où un modèle spécialisé plus petit bat un généraliste ; vous devez posséder les poids ; ou vous souhaitez intégrer un ton, un format ou une politique spécifiques. Les options de contexte Tinker 64K/256K et la remise de lancement abaissent la barrière.

Utilisez simplement le modèle de base (auto-hébergé ou API) si : votre tâche est à usage général, votre volume est faible, ou vous n'avez pas encore validé que le fine-tuning améliore votre métrique. L'ingénierie de prompts combinée au curseur reasoning_effort vous mène souvent assez loin.

Cherchez ailleurs si : vous avez besoin de codage agentique de pointe aujourd'hui (GLM 5.2 et Kimi K2.6 sont en tête sur ces benchmarks) ou vous exigez des garanties de qualité auditées indépendamment.

Avantages et inconvénients

Avantages

Poids entièrement ouverts sous Apache 2.0, sans redevance pour auto-hébergement et gratuit pour usage commercial.

Un MoE sparse efficace (seulement 41B actifs) plus une forte efficacité des tokens maintient le coût d'inférence et la vitesse compétitifs.

massifcontexte 1M-token dans les poids (256K via API).

Multimodalité authentique (texte, image, audio entrée).

Curseur d'effort de raisonnement contrôlable (aucun → max) pour les compromis coût/qualité en direct.

Sécurité adversarial open-weight de premier ordre (FORTRESS 78.0%, selon MarkTechPost) et “résistance à la censure.”

Positionnement indépendant solide — top 10 sur 97 dans l'indice Artificial Analysis, devant Nemotron 3 Ultra, Gemma 4 31B et gpt-oss-120b.

Inconvénients

Explicitement pas un modèle de frontière, de l'aveu même du fabricant.

Se trouve derrière les rivaux ouverts de premier plan (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) sur les benchmarks agentiques et de codage (Terminal Bench 2.1, SWE-bench Verified, HLE).

La plupart des benchmarks sont auto-déclarés par les fournisseurs et ne sont pas audités de manière indépendante.

Sortie textuelle uniquement ; pas de génération d'images/audio ; pas d'entrée vidéo au lancement ; Inkling-Small toujours en aperçu.

Une utilisation véritablement « locale » nécessite un nœud multi-GPU (environ 600 Go de VRAM même quantifié).

Aucune revue critique indépendante substantielle ou revue de sécurité/red-team n'était apparue au lancement.

Qui devrait utiliser Inkling ?

Inkling est un bon choix si vous êtes un praticien ou une équipe qui souhaite posséder et personnaliser votre modèle plutôt que de louer une API fermée. Les cas d'utilisation idéaux incluent :

Équipes de fine-tuning construisant des modèles spécifiques à un domaine via Tinker ou leur propre pipeline.

Déploiements sensibles aux coûts et à fort volume où l’hébergement libre de droits bat la tarification à la pointe par token.

Charges de travail à contexte long telles que l'assistance au code à l'échelle du dépôt, l'analyse de documents et les sessions d'agent longues.

Applications multimodales nécessitant une compréhension combinée du texte, de l'image et de l'audio.

Déploiements sensibles aux politiques voulant une base ouverte à haute sécurité et résistante à la censure pour s'aligner.

C'est un mauvais choix si vous avez besoin des capacités de raisonnement ou de codage agentique les plus fortes, d'entrée vidéo ou de sortie générative, ou si vous exigez des benchmarks audités de manière indépendante avant le déploiement.

Verdict et note finale

Parlons franchement de l'éléphant dans la pièce : Inkling n'est pas le modèle le plus fort disponible aujourd'hui, et Thinking Machines dit exactement cela. Lu cyniquement, c'est une barre basse. Lu honnêtement, c'est tout l'intérêt — Inkling est optimisé pour un objectif différent que d'atteindre le sommet d'un classement. Il est efficace (41B actifs, budgets de tâche d'environ 25K tokens), sous licence ouverte (Apache 2.0), sûr selon les standards des poids ouverts (FORTRESS 78%), et conçu pour être affiné et auto-hébergé. Cette combinaison en fait l'un des lancements de modèles ouverts les plus réfléchis de 2026, même s'il est en retard sur GLM 5.2 et Kimi K2.6 dans les benchmarks d'agents et de codage les plus difficiles.

Les astérisques restants sont les benchmarks largement auto-déclarés et l'absence de toute revue critique indépendante à ce stade précoce. Mais pour son public cible — les constructeurs qui valorisent la propriété, la personnalisation, le contrôle des coûts et une énorme fenêtre de contexte plutôt que des droits de vantardise de pointe — Inkling est à la hauteur.

Note : 4 sur 5 pour son public cible de constructeurs et d'affineurs ; moins élevée si vous cherchez strictement une capacité de pointe.

FAQ

Qu'est-ce qu'Inkling et qui l'a créé ? Inkling est le premier modèle de Thinking Machines Lab, la startup d'IA dirigée par Mira Murati (ancienne CTO d'OpenAI). Il a été lancé le 15 juillet 2026 en tant que modèle de raisonnement Mixture-of-Experts multimodal à poids ouverts.

Inkling est-il le meilleur modèle d'IA ?Non, et l'entreprise ne prétend pas qu'il l'est — elle déclare qu'Inkling « n'est pas le modèle le plus fort disponible aujourd'hui, fermé ou ouvert ». Une mesure indépendante (Artificial Analysis) le classe #10 sur 97 au total, bien qu'il soit en tête de plusieurs pairs ouverts.

Combien de paramètres Inkling possède-t-il, et quelle est la fenêtre de contexte ?975B au total avec 41B actifs (MoE clairsemé), répartis sur 66 couches. La fenêtre de contexte peut atteindre 1 000 000 de jetons dans les poids publiés, et jusqu'à 256K sur les API hébergées.

Inkling est-il open source, et quelle est la licence ? Les poids sont publiés sous Apache 2.0, ce qui permet une utilisation commerciale et un auto-hébergement. Il s'agit de « open weights » — les poids complets du modèle sont sur Hugging Face.

Inkling est-il gratuit à utiliser ? Les poids sont gratuits et libres de droits pour l'auto-hébergement. Le fine-tuning sur Tinker et l'inférence hébergée via des fournisseurs comme Together AI, Fireworks, Modal, Databricks ou Baseten sont des services payants. L'accès hébergé commence à environ 1,87 $ / 1 million de tokens d'entrée (une remise de lancement à durée limitée).

Comment puis-je exécuter ou télécharger Inkling, et de quel matériel ai-je besoin ?Téléchargez les poids depuis Hugging Face et servez-les avec vLLM, SGLang ou les transformateurs Hugging Face via une API compatible OpenAI. Attendez-vous à environ ~2 To de VRAM agrégée pour BF16 (8× B300 / 16× H200) ou ~600 Go pour le point de contrôle quantifié NVFP4 (4× B300 / 8× H200). Les versions communautaires Unsloth GGUF abaissent la barrière pour l'expérimentation.

Comment affiner Inkling ? Utilisez de Thinking Machines Tinker plateforme, qui offre des options de contexte 64K et 256K ainsi qu'une remise de lancement de 50% limitée dans le temps, ou affinez les poids ouverts dans votre propre pipeline.

Qu'est-ce que l'effort de raisonnement contrôlable ? Un paramètre reasoning_effort (none / minimal / low / medium / high / xhigh / max) qui échange latence et coût en tokens contre la profondeur de raisonnement. Un effort faible convient pour la classification et l'extraction ; un effort maximal convient pour les mathématiques difficiles et correspond à la configuration de référence (Effort=0.99).

Comment Inkling se compare-t-il à Kimi, GLM, DeepSeek et Nemotron ?Selon la comparaison de MarkTechPost, Inkling est en tête sur FORTRESS (sécurité) et bat largement Nemotron 3 Ultra, mais est à la traîne derrière GLM 5.2, Kimi K2.6 et DeepSeek V4 Pro sur Terminal Bench 2.1, SWE-bench Verified et HLE. Il est compétitif mais pas le modèle open le plus fort en codage agentique.

Inkling peut-il traiter des images, de l'audio et de la vidéo ? Il accepte du texte, des images (40px–4096px) et de l'audio (WAV 16kHz, jusqu'à ~20 minutes) en tant que entrée. La sortie est uniquement du texte — pas de génération d'image ou d'audio. La vidéo a été utilisée lors du pré-entraînement mais n'est pas une entrée prise en charge au lancement.

Les scores de référence d'Inkling sont-ils fiables ?Traitez-les avec prudence. Mis à part l'indice indépendant Artificial Analysis Intelligence Index, les chiffres principaux sont auto-déclarés par le fournisseur au lancement et ne sont pas audités de manière indépendante. Les chiffres des concurrents proviennent de tiers (MarkTechPost) ou ont été ré-exécutés par Thinking Machines et peuvent ne pas correspondre aux chiffres déclarés par les rivaux.

Qu'est-ce qu'Inkling-Small, et qu'y a-t-il sur la feuille de route ? Inkling-Small est une variante plus petite (276B total / 12B actif). Au moment du lancement, elle était encore en avant-première, avec des poids non encore publiés. Le modèle principal embarque déjà des couches MTP pour le décodage spéculatif.



Comparés dans cet article2

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement

© 2026 OrcaRouter

Pour les fournisseurs

Vous exploitez une plateforme d'inférence ? Proposez vos modèles sur OrcaRouter.

Contactez-nous

Rejoignez notre communauté

DiscordEmailXGitHubYouTube