
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base : le moins cher ne peut pas répondre à une question
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Sur les deux chiffres auxquels un tableur d’approvisionnement accorde le plus d’importance, le modèle le moins cher et le plus rapide l’emporte. Nemotron 3.5 Lightning 30B A3B Base tourne à 298,9 jetons de sortie par seconde, soit le plus rapide des 142 modèles suivis indépendamment, et coûte 0,06 $ par million de jetons d’entrée, contre 0,10 $ pour Claude Haiku 5.5. Ce n’est pas non plus un assistant, comme le mot « Base » dans son nom vous en avertit. C’est un checkpoint pré-entraîné — aucun ajustement supervisé, aucun apprentissage par renforcement, aucun gabarit de conversation digne de ce nom — publié sous licence OpenMDW-1.1 le 11 août 2026 afin que d’autres puissent s’appuyer dessus. Claude Haiku 5.5, publié le 7 octobre 2026, est un produit fini auquel vous pouvez poser une question. Les comparer sur le prix, c’est comme comparer le coût de la farine à celui du pain, et l’intérêt de cette confrontation est de déterminer celui dont votre charge de travail a réellement besoin.
Personne, dans la couverture du lancement, ne dit clairement cette partie, parce que « moins cher et plus rapide que Claude Haiku 5.5 » fait un meilleur titre que « moins cher, plus rapide, et inutilisable sans passer par un fine-tuning ». Les deux affirmations sont vraies. Une seule est utile.
Ce qu'est réellement chaque modèle
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, publié le 7 octobre 2026. Texte et image en entrée, texte en sortie. Contexte de 1 M de tokens, sortie maximale de 128 000 tokens (300 000 derrière un en-tête bêta sur l'API Batch), date de coupure d'entraînement : juin 2026, retrait pas avant le 7 octobre 2027. Effort réglable sur Low, Medium, High, Xhigh et Max, par défaut Medium, avec la réflexion adaptative activée par défaut. API à l'usage, lectures de cache à 0,01 $ par million, Batch à moitié tarif. Disponible via l'API d'Anthropic et, à partir de là, partout où les modèles d'Anthropic sont revendus.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, annoncé le 11 août 2026. Un checkpoint hybride de type mélange d’experts comptant 30 milliards de paramètres, avec environ 3 milliards de paramètres actifs par token, construit sur une pile Mamba-2 + MoE + attention, distillé à partir de Nemotron 3 Ultra, et livré avec le décodage spéculatif MTP, DFlash et DSpark. Le contexte va jusqu’à 1 M de tokens, bien qu’environ 256 000 soit le plafond pratique sur un seul H100. Il est uniquement textuel. Les poids sont ouverts sous OpenMDW-1.1. Et il s’agit d’un checkpoint de base : des poids pré-entraînés bruts, sans ajustement par instructions, ce qui signifie qu’il complète du texte plutôt que de suivre des instructions.

• Les dimensions, une par ligne
• Prix d’entrée — Claude Haiku 5.5 : 0,10 $ par million jusqu’à 100 000 jetons, puis 0,50 $ ; Nemotron 3.5 Lightning 30B A3B Base : 0,06 $ par million.
Prix de sortie — 0,50 $ par million jusqu'à 100K tokens, puis 2,50 $, contre 0,20 $ par million.
• Coût par tâche terminée — 0,21 $ par tâche d’indexation indépendante pour Claude Haiku 5.5, contre 0,09 $ pour Nemotron — le modèle le moins cher est moins cher par tâche, pas seulement par token.
• Vitesse de sortie — 243,4 jetons par seconde pour Claude Haiku 5.5, neuvième sur 182 ; 298,9 jetons par seconde pour Nemotron, premier sur 142.
• Temps jusqu'au premier token — environ 0,3 seconde pour Claude Haiku 5.5, contre 0,54 seconde pour Nemotron.
• Score indépendant — Index d'intelligence Artificial Analysis de 43 pour Claude Haiku 5.5, deuxième sur 182, avec la configuration Max à 43,40 ; index 13 pour Nemotron, vingt-neuvième sur 142.
• Fenêtre de contexte — 1 000 000 de jetons chacune, avec environ 256 000 réellement exploitables pour Nemotron sur un seul H100.
• Modalités — texte et image en entrée pour Claude Haiku 5.5 ; texte uniquement pour Nemotron.
• Poids — propriétaires face à open sous OpenMDW-1.1, un MoE hybride de 30B au total et 3B actifs.
• Réglage par instructions — présent sur Claude Haiku 5.5, absent sur le checkpoint de base.
Le problème « Base », énoncé simplement
Un checkpoint de base prédit le token suivant. Posez-lui une question et il continuera souvent le texte dans le style d'un document susceptible de contenir une telle question, plutôt que d'y répondre. Soumettez-lui « Résume ce contrat » et un modèle de base produira peut-être une continuation plausible d'un document d'entraînement juridique plutôt qu'un résumé du vôtre. NVIDIA publie un checkpoint BF16 distinct et des versions sœurs ajustées aux instructions distinctes, précisément parce que les poids de base sont une matière première.
Sur la fiche de modèle de NVIDIA elle-même — données rapportées par le fournisseur, non reproduites de façon indépendante — le checkpoint de base obtient 78,59 sur MMLU, 67,94 sur MMLU-Pro, 91,28 sur GSM8K, 77,44 sur HumanEval et 69,62 sur RULER à 1 million de tokens. La fiche Lightning de la variante affinée rapporte 81,94 sur MMLU-Pro, 75,44 sur GPQA Diamond, 51,56 sur SWE-Bench Verified et 86 % sur PinchBench, avec une inférence environ 30 % plus rapide que le modèle qu’elle remplace. Même les chiffres de la variante affinée sont ceux de NVIDIA, et les chiffres de base sont ceux qui s’appliquent au checkpoint nommé dans le titre de cet article. Face à eux, le score de 43,40 mesuré indépendamment pour Claude Haiku 5.5 — deuxième sur 182 à l’indice d’Artificial Analysis, un indice différent qui mesure d’autres choses — n’est pas directement comparable, et l’interprétation honnête est qu’un checkpoint de base de 30B et un petit modèle abouti sont évalués par des instruments différents pour des finalités différentes.
Ce qui peut être affirmé sans réserve, c’est la forme de l’écart. Un point de contrôle de base qui a besoin d’un pipeline de fine-tuning, d’une pile de service et d’un harnais d’évaluation avant de répondre à quoi que ce soit ne remplace pas un modèle hébergé à 0,10 $ par million. C’est un point de départ pour quelqu’un qui veut posséder le modèle.
Là où Nemotron gagne véritablement, et ce n’est pas un lot de consolation
La vitesse avant tout. 298,9 jetons de sortie par seconde le placent au sommet d'un classement de 142 modèles — 23 % plus rapide que les 243,4 de Claude Haiku 5.5. Pour un pipeline sensible à la latence, c'est une différence réelle et mesurable, et c'est la raison pour laquelle le nom « Lightning » figure sur la boîte.
Les poids ouverts viennent en deuxième, et c'est le point le plus important. Sous OpenMDW-1.1, vous pouvez télécharger le checkpoint, l'affiner sur vos propres données et le servir vous-même. Claude Haiku 5.5 ne peut pas être affiné du tout et ne peut pas être auto-hébergé, à aucun prix. Pour une équipe confrontée à une tâche propriétaire, à une distribution d'entrées inhabituelle ou à une exigence de conformité imposant que le trafic ne quitte jamais sa propre infrastructure, cette différence est décisive, quels que soient les chiffres affichés sur les pages de benchmarks. Un modèle de 30 B au total avec 3 B actifs est également assez petit pour être économiquement exploitable — l'architecture est conçue exactement pour cela.
Troisième prix : 0,06 $ en entrée et 0,20 $ en sortie par million, avec une remise de 17 % sur le cache et 0,09 $ par tâche d’index, représente environ la moitié des 0,21 $ de Claude Haiku 5.5. Les deux modèles sont bon marché ; Nemotron est moins cher.
Là où Claude Haiku 5.5 l'emporte, c'est-à-dire dans toutes les dimensions qui exigent une réponse
Suivi d’instructions, car il a été entraîné pour cela. Capacité indépendante, à l’Index 43 contre 13 — un écart de trente points sur un tableau qui a évalué les deux, soit le plus grand écart de ce type dans cet ensemble de comparaisons. Entrée d’images, que Nemotron n’accepte pas du tout. Sortie maximale à 128 000 tokens contre un chiffre non publié, avec une voie bêta de 300 000 tokens sur Batch. Et le curseur d’effort, qui permet de récupérer des coûts en abaissant l’effort de raisonnement plutôt qu’en reconstruisant le modèle.
La mise en garde sur la verbosité joue ici dans les deux sens. Sur la suite d'Artificial Analysis, Claude Haiku 5.5 émet environ 440 millions de tokens de sortie, contre une médiane d'environ 100 millions — il réfléchit énormément. Nemotron en émet environ 120 millions, ce que la même source qualifie de plutôt verbeux pour sa taille. Le coût par tâche de Haiku 5.5 est néanmoins de 0,21 $, contre 0,09 $ pour Nemotron, si bien que même le modèle bavard n'est pas le plus cher. Ce que cela révèle, c'est que les prix par token induisent en erreur dans les deux sens, et que c'est le chiffre par tâche qu'il faut prendre comme base de budget.
Auto-hébergement versus un seul point de terminaison
Nemotron 3.5 Lightning 30B A3B Base est distribué sous forme de poids ouverts et servi par plusieurs fournisseurs d'inférence ; NVIDIA publie également les modèles affinés apparentés. Claude Haiku 5.5 est disponible via l'API d'Anthropic et, à partir de là, partout où les modèles d'Anthropic sont revendus. Ni l'un ni l'autre ne figure au catalogue d'OrcaRouter, et nous ne prétendrons pas le contraire — ce que nous routons depuis ce voisinage, c'est anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 et anthropic/claude-fable-5.1, le palier au-dessus de celui dont traite cet article.
Les deux voies que décrit cette comparaison reposent sur des infrastructures réellement différentes, et il vaut la peine de les nommer. La voie auto-hébergée implique un GPU, un framework de service, un choix de quantification et une rotation d'exploitation. La voie hébergée se résume à une clé et à une chaîne de modèle. OrcaRouter existe pour la seconde voie : une API pour plus de 200 modèles, une clé et une facture, le prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu'une baisse de prix du fournisseur est effective le jour même, avec un basculement automatique sous le capot. Ce n'est pas une voie vers un checkpoint de base de 30B, et acheter une machine de classe DGX n'est pas une voie vers un petit modèle hébergé.

Qui devrait choisir lequel ?
Si votre tâche est bien définie, que vos données d'entraînement sont suffisamment volumineuses pour compter et que votre trafic ne peut pas quitter votre propre infrastructure, Nemotron 3.5 Lightning 30B A3B Base est l'objet le plus intéressant : le plus rapide sur 142 en vitesse de sortie, moitié prix par token, et vous êtes libre de le modifier. Prévoyez le budget de la session de fine-tuning et le coût de service avant de compter les économies, car le tarif d'entrée de 0,06 $ suppose que quelqu'un a déjà fait le travail qui transforme un checkpoint en assistant.
Si vous voulez envoyer un prompt et obtenir une réponse cet après-midi, Claude Haiku 5.5 est celui qui le fait — 43 sur l’indice indépendant contre 13, l’entrée d’images, un plafond de sortie de 128 000 jetons et un prix vraiment minime. La comparaison ne paraît serrée que sur une grille tarifaire. Elle cesse de paraître serrée dès que la tâche consiste à répondre à une question plutôt qu’à continuer un document.

