
Inkling-Small : le modèle au quart de la taille qui bat son propre fleuron, et reste encore derrière l'indice.
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 par million de tokens · 56 tok/s
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3150Intelligence69Code
- qwenNOUVEAUQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 201 tok/s
- orcaNOUVEAUOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicNOUVEAUAnthropic: Claude Opus 52026-07-2461Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2150Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1651Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1557Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0951Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0955Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0959Intelligence77Code
- grokxAI: Grok 4.52026-07-0854Intelligence72Code
- tencentTencent: Hy32026-07-0641Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3053Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
- z-aiZ.ai: GLM 5.22026-06-1651Intelligence69Code60Maths
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242Intelligence61Code61Maths
Thinking Machines Lab a passé les deux semaines suivant la sortie de son premier modèle à poids ouverts à en construire un d’environ un quart de la taille, et selon le tableau de bord du labo, le plus petit l’emporte. Inkling-Small affiche 80,2 % sur SWE-bench Verified contre Inkling, qui obtient 77,6 %, 89,5 % sur GPQA Diamond contre 87,2 %, 64,7 % sur Terminal-Bench 2.1 contre 63,8 %, et 31,6 % sur Humanity’s Last Exam contre 29,7 % — à partir de 276B paramètres au total avec 12B actifs, plutôt que 975B avec 41B. Parmi les chiffres clés que les deux fiches techniques ont en commun, le vaisseau amiral de 975B n’en détient qu’un seul : AIME 2026, avec 1,6 point d’écart.
Ensuite, Artificial Analysis a testé les deux indépendamment et a attribué à Inkling-Small un score de 40 sur son Intelligence Index, contre 41 pour Inkling — le modèle plus petit accuse un point de retard. Ces deux résultats sont réels, et l'écart entre eux est ce qu'il y a de plus utile dans ce lancement. Tout ce qui suit sépare ce que Thinking Machines rapporte à propos de son propre modèle de ce qu'un tiers a mesuré : les chiffres du fournisseur proviennent de l'annonce et des deux fiches de modèle Hugging Face, les chiffres indépendants, des propres exécutions d'Artificial Analysis, et les chiffres de prix et de contexte, des données en direct de l'endpoint d'OpenRouter, vérifiés le jour où ce texte a été rédigé. Lorsque ces trois sources divergent — et c'est le cas pour la longueur de contexte — nous le disons plutôt que de retenir le chiffre flatteur.
Ce qui a réellement été expédié le 30 juillet
Inkling-Small est un transformateur à mélange d'experts épars : 276B de paramètres au total, 12B actifs par jeton, 42 couches, chaque jeton étant routé vers 6 des 256 experts, plus 2 experts partagés qui s'activent sur tout. L'attention alterne entre couches locales et globales. Les poids sont sur Hugging Face sous licence Apache 2.0 sans restrictions commerciales, il s'affine sur l'API Tinker de Thinking Machines, et vous pouvez interagir avec lui par texte, image et audio dans le Tinker Playground. Le laboratoire indique qu'il a été entraîné sur des systèmes NVIDIA GB300 NVL72.

La multimodalité est native plutôt que rapportée après coup, et la fiche est inhabituellement précise à ce sujet. Il n'existe pas d'encodeur séparé pour la vision ou l'audio : l'audio arrive sous forme de spectrogrammes dMel, les images sous forme de patchs de 40×40 pixels passés dans un hMLP à quatre couches, et les deux sont intégrés directement dans le même flux de jetons que le texte. L'entrée est du texte, des images et de l'audio ; la sortie est uniquement du texte, ce qui vaut la peine d'être dit clairement parce qu'on lit « multimodal » comme « ça peut parler » assez souvent pour gâcher un après-midi. L'effort de réflexion est un cadran à cinq réglages — minimal, low, medium, high, xhigh — de sorte que les mêmes poids peuvent être exécutés à faible coût ou à plein régime.
La partie intéressante de la recette est le post-entraînement. Inkling-Small a été distillé sur politique avec l'Inkling complet comme enseignant, puis a reçu environ deux semaines supplémentaires d'apprentissage par renforcement mis à l'échelle sur du codage agentique. Cet ordre explique la forme des résultats : l'élève a hérité de la compétence générale de son enseignant, puis a reçu un entraînement supplémentaire précisément sur l'axe où il surpasse désormais l'enseignant.
Le tableau d'affichage que Thinking Machines a publié
Les benchmarks des fournisseurs relèvent du marketing jusqu'à ce que quelqu'un les reproduise ; lisez donc cette section comme ce que le laboratoire affirme, et non comme ce qui a été vérifié. Il s'agit néanmoins d'un ensemble vaste, et il l'est dans une direction peu flatteuse pour le produit phare.

Au-delà des quatre nombres partagés, la carte complète le tableau — toutes les propres séries de Thinking Machines :
• Travail agentique — 1269 Elo sur GDPval-AA v2, un benchmark de tâches économiques réalistes plutôt que des énigmes.
• Graphiques et documents — 77,4 % sur CharXiv RQ, passant à 81,3 % lorsque le modèle est autorisé à écrire et exécuter du Python. Ce bond de 3,9 points est un indice utile que l’accès aux outils apporte plus pour le raisonnement visuel que l’ingénierie de prompts.
• Vision — 74,0 % sur MMMU Pro, un cheveu au-dessus des 73,5 % d'Inkling.
• Audio — 90,1 % VoiceBench et 77,0 % MMAU, tous deux légèrement inférieurs aux 91,4 % et 77,2 % du modèle phare. Audio est l’un des deux domaines où la réduction a clairement coûté quelque chose.
• Sécurité — 98,4 % StrongREJECT et 96,9 % sur les prompts bénins de FORTRESS, mais 71,6 % sur FORTRESS adversarial contre 78,0 % pour le modèle phare. C'est l'autre coût : une régression de 6,4 points en robustesse adversarial, qui compte plus que tout gain de codage si le modèle doit se retrouver derrière une boîte de texte publique.
• Prévisions — 61.3 ± 0.46 indice de Brier sur ForecastBench sans accès à la recherche, et 0.1238 ± 0.0086 score de Brier sur Prophet Arena. Signaler des barres d'erreur, c'est déjà plus de rigueur que n'en montrent la plupart des publications de lancement.
Une lacune : la fiche du produit phare affiche 54,3 % sur SWE-bench Pro, le pendant plus difficile de SWE-bench Verified. La fiche d'Inkling-Small ne mentionne pas SWE-bench Pro. Vu comment le chiffre de Verified est mis en avant, cette absence est le chiffre que nous aimerions le plus voir renseigné.
Ce que dit l'indice indépendant à la place
Artificial Analysis place Inkling-Small à 40 sur la version 4.1 de son Intelligence Index, un point sous Inkling qui obtient 41. L'index est un composite de neuf évaluations — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience et AA-LCR — et cette liste explique l'essentiel de la contradiction apparente. Seules deux des neuf évaluations recoupent le showcase de raisonnement sur la fiche de Thinking Machines. Le reste est pondéré en faveur de l'utilisation agentique d'outils, de la récupération en contexte long et de la résistance aux hallucinations, et un modèle peut gagner les benchmarks qu'un laboratoire choisit de publier tout en perdant ceux qu'un tiers choisit d'exécuter. Aucune des deux parties ne ment ; elles mesurent des choses différentes.

Il y a aussi un détail dans les petites lignes qui vaut plus que le titre d'un point : Artificial Analysis indique l'entrée du modèle phare comme Inkling (xhigh) — son réglage d'effort de réflexion maximal — tandis que la ligne Inkling-Small ne comporte pas de suffixe d'effort. Ainsi, l'avance d'un point du modèle phare a été enregistrée avec son cadran de raisonnement poussé au maximum. Si la correspondance des efforts modifiait ne serait-ce que légèrement cette comparaison, le dernier argument en faveur du modèle plus grand, sur la seule base des capacités, disparaîtrait.
Là où les données indépendantes ne sont pas du tout proches, c'est la vitesse et le coût, et ici cela favorise le petit modèle avec des marges qu'aucun tableau de référence ne traduit :
• Vitesse de sortie — 133 tokens par seconde contre 80 pour Inkling (xhigh). Artificial Analysis classe Inkling-Small au 7e rang sur 101 modèles de sa catégorie en termes de vitesse, contre une médiane de 66 pour la catégorie.
• Temps jusqu'au premier jeton — 1,63s contre 1,84s. Un avantage réel mais mineur.
• Prix mixte par 1M de tokens — 0,22 $ contre 0,72 $ selon leur pondération. Environ un tiers du coût, pour un point d'indice de moins.
• Rang d'intelligence — #15 sur 101, par rapport à un score médian de la classe de 25. Confortablement au-dessus de la moyenne, loin de la frontière.
• Verbosité — et voici le hic. Il a brûlé 130 M de jetons de sortie pour parcourir l'index, contre une médiane de 100 M. Le résumé d'Artificial Analysis lui-même le qualifie de « notablement rapide, mais quelque peu verbeux ». Il réfléchit environ 30 % de plus que la normale, ce qui grignote discrètement une partie de la remise par jeton.
Une petite note de comptabilité, car quiconque compare les sources tombera dessus : Artificial Analysis indique un nombre total de paramètres de 266B, alors que l'annonce, les deux fiches de modèle et OpenRouter indiquent tous 276B. Nous avons utilisé 276B partout. Cela ne change aucune conclusion, mais c'est le genre d'écart qu'il vaut mieux connaître avant de citer un chiffre dans un document de conception.
Ce que vous pouvez réellement louer aujourd'hui, ce qui ne correspond pas à ce que dit la fiche technique.
Le fossé entre l'annonce d'un modèle à poids ouverts et un point de terminaison utilisable est ce sur quoi la plupart des articles de lancement cessent de s'attarder. Thinking Machines annonce une fenêtre de contexte pouvant atteindre 1 million de jetons, et Artificial Analysis mentionne également 1 million. Sur OpenRouter, les deux fournisseurs qui servent actuellement Inkling-Small la plafonnent à 524 288 jetons — soit la moitié du chiffre annoncé. Ce n'est pas tant une contradiction qu'une différence entre ce que l'architecture prend en charge et ce qui a réellement été mis en production. En revanche, le modèle phare Inkling dispose bien d'un point de terminaison offrant la totalité des 1 048 576 jetons, même si ce même point de terminaison limite les complétions à 32 768 jetons.
Le reste de l'image en direct, lu à partir des données d'endpoint d'OpenRouter :
• Deux fournisseurs, deux prix — 0,45 $ par million de jetons en entrée et 1,20 $ par million en sortie pour l'un, 0,50 $ et 1,20 $ pour l'autre. Artificial Analysis répertorie le tarif direct de Thinking Machines, encore plus bas, à 0,30 $ et 1,20 $, avec l'entrée en cache à 0,06 $. L'hébergement tiers facture une prime de 50 à 67 % sur l'entrée pour les mêmes poids.
• Mise en cache des prompts — 0,10 $ par 1M de tokens d'entrée mis en cache via OpenRouter, contre 0,17 $ pour le modèle phare.
• Les chiffres que vous louez ne sont pas ceux qui ont été benchmarkés — la fiche du modèle indique BF16 et NVFP4. L'endpoint le moins cher sert du fp8 ; l'autre ne déclare aucune quantification. Les scores des benchmarks du fournisseur n'ont pas été mesurés sur une version fp8 de ces poids, et les effets de la quantification sur les longues exécutions agentiques sont exactement le genre de chose à laquelle une marge de 0,9 point sur Terminal-Bench ne peut pas survivre. Si vous reproduisez un chiffre, notez quel endpoint vous avez utilisé.
• La couverture des fonctionnalités est inégale selon le fournisseur — les deux endpoints exposent le raisonnement et reasoning_effort, donc le sélecteur de réflexion à cinq niveaux fonctionne. Mais un seul propose l'appel d'outils et les logprobs, et aucun ne propose actuellement response_format, le paramètre de sortie structurée/mode JSON. Le modèle phare Inkling dispose d'un endpoint qui le fait. Si votre pipeline dépend d'un JSON à schéma imposé, c'est le détail qui vous mordra dès le premier jour, et c'est une limitation du fournisseur plutôt que du modèle.
• Plafond de complétion — 262 144 tokens sur le point de terminaison fp8 ; l'autre ne déclare aucune limite.
Le cas des coûts, sur les comptages de tokens mesurés
Les prix par million sont une mauvaise façon de comparer les modèles de raisonnement, car la seule variable est le nombre de jetons qu'ils brûlent en réfléchissant. Artificial Analysis publie la dépense réelle, ce qui est un bien meilleur instrument : faire passer Inkling-Small à travers l'Intelligence Index complet a consommé environ 130M de jetons de sortie et a coûté $192,37, soit environ $0,07 par tâche sur leur moyenne pondérée.
Comparez cela à la même mesure pour les modèles que les gens déploient réellement : DeepSeek V4 Flash à 0,03 $ par tâche, gpt-oss-120b à 0,08 $, Gemini 3.6 Flash à 0,56 $, GLM-5.2 à 0,57 $, Kimi K3 à 0,86 $, GPT-5.6 Sol à 1,23 $, Claude Opus 5 à 2,34 $, Claude Fable 5 à 3,15 $. Inkling-Small est le deuxième modèle le moins cher de ce groupe et environ 18× moins cher par tâche que GPT-5.6 Sol, qui obtient 59 contre 40.
Il existe aussi une manière plus claire de comprendre pourquoi le prix a chuté là où il l'a fait. Les paramètres actifs sont passés de 41B à 12B, soit un facteur de 3,4. Le prix de sortie est passé de 4,05 $ à 1,20 $ par million, soit un facteur de 3,375. Le prix de location d'un MoE épars correspond essentiellement à son coût de calcul par jeton, et Thinking Machines a facturé en conséquence plutôt que d'aligner le prix sur le benchmark.
Une précision pratique si vous voulez faire cette comparaison vous-même : Inkling-Small n’est pas dans le catalogue d’OrcaRouter aujourd’hui, vous devriez donc le louer via ses propres endpoints. Les modèles fermés auxquels vous le compareriez — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash et le reste de cette liste — sont sur OrcaRouter derrière une seule clé à 0 % de majoration, ce qui signifie que vous payez le prix catalogue de chaque fournisseur sans rien ajouter par-dessus. C’est particulièrement important pour un modèle de coûts : le nombre que vous mettez dans le tableur est le nombre qui est facturé, et quand un fournisseur baisse ses prix, cela se répercute de notre côté le jour même plutôt qu’après une renégociation. Le basculement automatique entre fournisseurs couvre l’autre moitié d’une évaluation, à savoir le bras de référence qui tombe en plein milieu de l’exécution et empoisonne silencieusement vos chiffres.
Où il se situe réellement parmi les modèles open-weight.
Lu à l'aune du modèle phare, Inkling-Small semble être un triomphe. Lu à l'aune du secteur, il apparaît comme un solide modèle open-weights de milieu de tableau, et la couverture du lancement a largement ignoré cette seconde lecture.
Sur l'indice Artificial Analysis Intelligence, les modèles qui devancent les deux Inklings incluent Claude Opus 5 à 61, Claude Fable 5 à 60, GPT-5.6 Sol à 59, Kimi K3 à 57, Grok 4.5 à 54, GLM-5.2 et Muse Spark 1.1 à 51, et Gemini 3.6 Flash à 50. C'est prévisible — ce sont des systèmes de pointe, la plupart fermés, plusieurs d'entre eux énormes.
Celui qui devrait réellement changer votre décision, c'est DeepSeek V4 Flash, qui obtient un score de 50 contre 40 pour Inkling-Small, avec 284B au total et 13B actifs — pratiquement la même catégorie de taille et la même aubaine en termes de poids ouverts, à moins de la moitié du coût par tâche. Si ce que vous voulez, c'est le modèle à poids ouverts le moins cher qui soit capable, les chiffres indépendants pointent là-bas, pas ici. Il est également, contrairement à Inkling-Small, disponible via OrcaRouter, donc tester cette alternative sur votre propre charge de travail est un changement de chaîne de modèle plutôt qu'une procédure d'approvisionnement.
Ce que Inkling-Small possède et que DeepSeek V4 Flash n'a pas, c'est l'entrée native audio et image dans les mêmes poids, un cadran de réflexion à cinq niveaux, et le fine-tuning Tinker du laboratoire qui l'a entraîné. Ce sont de véritables différenciateurs pour un agent multimodal, et ce sont les raisons honnêtes de le choisir — pas le score de l'indice.
Qui devrait déménager, et qui devrait rester en place
La décision se divise nettement, ce qui est assez inhabituel pour qu'il vaille la peine de le préciser.
• Passez d'Inkling à Inkling-Small si vous exécutez des agents de codage. Les chiffres du fournisseur favorisent le petit modèle sur SWE-bench Verified et Terminal-Bench, la raison documentée étant le RL agentique supplémentaire, et il coûte environ un tiers du prix et renvoie les tokens 1,66× plus vite. Payer 3,3× pour un point d'indice mesuré à l'effort de réflexion maximal est un argument difficile à défendre.
• Optez pour ce modèle si le coût par tâche de raisonnement est le facteur limitant et que vous pouvez vous contenter d'un 40 sur l'indice. À 0,07 $ par tâche, avec un taux de succès du cache à 0,06 $ par million sur l'endpoint propriétaire, c'est un prix agressif pour un modèle avec audio et vision natifs.
• Passez si vous faites du fine-tuning. Un modèle 276B/12B est nettement moins coûteux à adapter et à servir qu’un 975B/41B, et Tinker prend en charge les deux.
• Restez sur Inkling si vous avez besoin d'audio long. C'est la régression la plus marquante de cette version et elle est enfouie dans les fiches des modèles : le modèle phare recommande des entrées audio de moins de 20 minutes, tandis que la fiche d'Inkling-Small recommande moins de 2 minutes. Une réduction de dix fois. Si vous transcriviez ou raisonniez sur des réunions, le petit modèle n'est pas un remplaçant direct, quel que soit le prix.
• Restez si vous avez besoin d'un contexte au-delà de 512K depuis un point de terminaison hébergé, ou de complétions de plus de 262K tokens. Aujourd'hui, seul le flagship dispose d'un point de terminaison offrant le million complet.
• Restez si vous avez besoin de JSON à schéma imposé sans écrire votre propre boucle de validation et de nouvelle tentative, jusqu'à ce qu'un fournisseur propose response_format pour le petit modèle.
• Restez si la robustesse adversarial est essentielle. 71.6% contre 78.0% sur FORTRESS adversarial est la mauvaise direction pour tout produit destiné aux utilisateurs, et c'est le propre chiffre du laboratoire.
Trois questions que la couverture du lancement a laissées ouvertes
Inkling-Small n'est-il qu'un Inkling distillé ?
En partie, et la partie qui ne l'est pas est celle qui compte. La distillation on-policy avec Inkling comme enseignant était une étape du post-entraînement, donc une grande partie de la capacité générale est réellement héritée. Mais c'est un modèle à l'architecture distincte — 42 couches contre les 66 du modèle phare, avec la même topologie de routage de 6 experts actifs sur 256 plus 2 partagés, ce qui signifie que les experts eux-mêmes sont plus étroits plutôt que moins nombreux. Et il a reçu environ deux semaines de RL de codage agentique que l'enseignant n'a jamais eues. Cette dernière étape explique pourquoi un élève distillé surpasse son enseignant sur les benchmarks de codage, ce qui ne devrait pas se produire autrement.
Est-ce que je peux réellement l'héberger moi-même ?
Uniquement sur du matériel sérieux. 276B paramètres représente environ 276 Go de poids en 8 bits et environ 552 Go en BF16, avant tout cache KV — un nœud multi-GPU dans les deux cas, pas une station de travail. L'avantage du MoE sparse est le coût d'inférence, pas l'empreinte mémoire ; vous stockez les 276B et calculez avec 12B. La fiche cite SGLang, vLLM, TokenSpeed, Unsloth et Hugging Face Transformers comme chemins de service pris en charge et liste les formats numériques BF16 et NVFP4. Notez également que les deux endpoints hébergés servent aujourd'hui une version quantifiée, donc « le même modèle » auto-hébergé en BF16 ne se comportera pas de manière identique à l'API que vous avez testée.
L'Inkling 975B a-t-il encore une raison d'exister ?
Trois, et elles sont toutes étroites : le contexte complet servi de 1M de jetons, les entrées audio de plus de deux minutes, et un meilleur comportement de sécurité adversarial. Notamment, « il est plus intelligent » ne figure pas avec certitude sur cette liste — un point d’indice à l’effort de réflexion maximal, face à un ensemble de benchmarks des fournisseurs que le plus petit modèle remporte majoritairement, n’est pas un argument de capacité. Deux semaines après le lancement d’un modèle phare de 975B, Thinking Machines a publié le modèle qui rend difficile la recommandation. C’est soit une franchise inhabituelle, soit une vitesse inhabituelle, et dans les deux cas, c’est un bon signe pour le laboratoire.
Que regarder ensuite
Trois choses détermineront comment cette sortie vieillira. D'abord, verra-t-on un endpoint servir le contexte de 1M annoncé, ce qui supprimerait l'avantage restant le plus net du modèle phare. Ensuite, quelqu'un publiera-t-il une comparaison indépendante à effort égal des deux modèles, ce qui est le seul moyen de savoir si ce point d'indice est réel. Enfin, la recommandation audio de 2 minutes est-elle une limitation d'entraînement ou une valeur par défaut du service — car si c'est le second cas, la raison majeure de rester sur le modèle plus grand s'évapore. En attendant, le résumé honnête est que Thinking Machines a livré un modèle qui coûte un tiers du prix, est deux tiers plus rapide, meilleur en codage selon ses propres preuves, légèrement en retrait sur les scores agrégés indépendants, et clairement derrière un rival de même taille que la plupart des articles n'ont pas mentionné.
