
Claude Haiku 5.5 vs Aion 3.5 : trente fois le prix des tokens d’entrée pour un modèle que personne n’a évalué
- openaiNOUVEAUOpenAI: GPT-6.1 Sol2026-09-2952Intelligence
- anthropicNOUVEAUAnthropic: Claude Sonnet 5.52026-09-2856Intelligence
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Intelligence
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Intelligence
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Intelligence
- xAIGrok 4.72026-09-2146Intelligence
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 par million de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 par million de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
Claude Haiku 5.5 s'affiche à 0,10 $ par million de jetons d'entrée. Aion 3.5 s'affiche à 3,00 $. Cela représente trente fois le prix d'entrée et douze fois le prix de sortie pour deux modèles qui acceptent tous deux un long prompt textuel et renvoient du texte, et l'écart ne s'explique pas par les capacités — il s'explique par ce que chaque entreprise vend. Claude Haiku 5.5, publié le 7 octobre 2026, est un modèle polyvalent au prix d'un produit de base, doté d'un curseur d'effort et d'un score indépendant. Aion 3.5, publié le 23 septembre 2026 par AionLabs, est un ensemble à raisonnement obligatoire qui existe en deux tailles, dont l'une est vraiment bon marché. Que cette prime de trente fois vaille la peine d'être payée dépend entièrement d'une question à laquelle le fournisseur n'a pas répondu.
Voici d'emblée la partie inconfortable : Artificial Analysis a attribué un score à Claude Haiku 5.5 et n'a jamais publié de score pour Aion 3.5. Et personne d'autre que nous ayons pu trouver ne l'a fait non plus. Il ne s'agit donc pas d'une comparaison entre deux éléments mesurés. Il s'agit d'une comparaison d'un élément mesuré avec un ensemble d'allégations d'un fournisseur, et la manière honnête de l'écrire est de le dire dans chaque section plutôt qu'une seule fois dans une note de bas de page.
Les deux modèles, chacun en un paragraphe
Claude Haiku 5.5 est le petit modèle du fournisseur, ID claude-haiku-5-5, texte et image en entrée et texte en sortie, avec une fenêtre de contexte de 1 M de tokens, une sortie maximale de 128 000 tokens (300 000 avec un en-tête bêta sur l'API Batch), une date limite d'entraînement de juin 2026 et un engagement d'Anthropic de ne pas le retirer avant le 7 octobre 2027. L'effort est ajustable entre Low, Medium, High, Xhigh et Max, avec Medium par défaut, et la réflexion adaptative est activée par défaut. Les lectures de cache coûtent 0,01 $ par million de tokens. Au-delà de 100 000 tokens de prompt, les tarifs d'entrée et de sortie sont multipliés par cinq.
Aion 3.5 est le modèle phare d'AionLabs, ID aion-labs/aion-3.5, et il est uniquement textuel en entrée et en sortie. Le contexte est de 262 144 tokens — doublé par rapport aux 131 072 d'Aion 3.0 — avec une sortie maximale de 32 768 tokens. Le raisonnement est obligatoire plutôt qu'optionnel, avec un réglage par défaut sur high pouvant être poussé vers max ou abaissé vers low. Sur le plan architectural, il est décrit comme un ensemble multi-modèles de la famille GLM plutôt qu'un réseau unique entraîné, ce qui est à la fois l'aspect le plus intéressant à son sujet et le plus difficile à vérifier de l'extérieur. Il est facturé 3,00 $ par million de tokens d'entrée, 0,75 $ pour l'entrée mise en cache et 6,00 $ pour la sortie, à tarif fixe sur toute la fenêtre. Aion 3.5 Mini, lancé le même jour, coûte 0,70 $ / 0,18 $ / 1,40 $ pour le même contexte de 256K — et c'est ce petit frère qui rend ce comparatif intéressant.

• Les dimensions, une par ligne
• Prix d'entrée — Claude Haiku 5.5 0,10 $ par million jusqu'à 100 K tokens, puis 0,50 $ au-delà ; Aion 3.5 3,00 $ forfaitaires sur toute la fenêtre de 256 K.
• Prix de sortie — Claude Haiku 5.5 : 0,50 $ par million jusqu'à 100 K, puis 2,50 $ ; Aion 3.5 : 6,00 $ forfaitaire.
• Entrée mise en cache — Claude Haiku 5.5 : 0,01 $ par million pour les lectures et 0,125 $ pour les écritures de cinq minutes ; Aion 3.5 : 0,75 $ sur l’entrée mise en cache, sans tarif de lecture publié séparément.
• Fenêtre de contexte — 1 000 000 de tokens contre 262 144.
• Sortie maximale — 128 000 jetons contre 32 768.
• Modalités d'entrée — texte et images contre texte uniquement.
• Contrôle du raisonnement — un cadran d’effort à cinq positions, de Faible à Max, contre trois positions où Élevé est la valeur par défaut.
• Score indépendant — Indice d'intelligence Artificial Analysis de 43 avec une configuration Max à 43,40, deuxième sur 182 modèles ; aucun n'a été publié pour Aion 3.5.
• Coût par tâche terminée — 0,21 $ par tâche de l'indice Artificial Analysis pour Claude Haiku 5.5 ; non mesurable pour Aion 3.5 sans score.
• Vitesse de sortie — 243,4 tokens par seconde pour Claude Haiku 5.5 ; non communiqué pour Aion 3.5.
Pourquoi le tarif forfaitaire n'est pas aussi avantageux qu'il n'y paraît
Le tarif forfaitaire de 3,00 $ d’Aion 3.5 sur 256 K est l’aspect le plus net de sa tarification, et c’est une réponse directe à la maladresse du côté d’Anthropic : un prompt qui passe de 99 000 à 101 000 tokens coûte cinq fois plus cher par token, ce qui vous oblige soit à rester bien en dessous du seuil, soit à renoncer complètement au palier économique. Aion 3.5 n’a pas de seuil. Vous pouvez envoyer 240 000 tokens et payer le même tarif par token que pour 4 000.
Cet avantage s'évapore dès que l'on fait le calcul sur une charge de travail réelle. Un appel de 240 000 tokens sur Aion 3.5 coûte environ 0,72 $ en entrée ; le même appel sur Claude Haiku 5.5 au-dessus du seuil coûte environ 0,12 $. Même en payant le tarif pénalisé au-delà de 100 000 tokens, Haiku 5.5 est environ six fois moins cher sur le plus grand prompt que l'un ou l'autre modèle puisse traiter. Le tarif unique supprime une falaise, pas un coût.
Là où la tarification forfaitaire aide réellement, c’est pour la prévisibilité. Un pipeline dont la taille de prompt varie entre 80 000 et 130 000 tokens est pénible à budgéter dans un schéma par paliers et d’une simplicité enfantine dans un schéma forfaitaire, et si c’est votre configuration, le caractère forfaitaire d’Aion 3.5 vaut quelque chose avant même que la capacité n’entre en jeu.
L'argumentaire en faveur d'Aion 3.5, présenté avec toute la force que permettent les preuves.
Trois arguments tiennent bon. Premièrement, un raisonnement obligatoire avec un niveau par défaut élevé signifie moins d'ingénierie de prompt : il n'y a aucun paramètre d'effort à régler et aucun risque qu'un réglage faible dégrade discrètement une tâche que personne n'a retestée. Deuxièmement, un ensemble de la famille GLM présente un profil de défaillance réellement différent de celui d'un seul petit modèle Anthropic, et si vous utilisez déjà Claude Haiku 5.5 à grande échelle, un deuxième avis non corrélé a de la valeur, même à un prix d'entrée trente fois supérieur — vous n'y auriez recours que rarement. Troisièmement, Aion 3.5 Mini à 0,70 $ / 0,18 $ / 1,40 $ avec le même contexte de 256K constitue un palier économique crédible, et toute comparaison qui ne considère que le modèle phare compare le mauvais modèle Aion.
Ce qui ne tient pas, c’est de considérer la surprime de trente fois comme la preuve d’une capacité trente fois supérieure. AionLabs ne publie aucun benchmark pour Aion 3.5 que nous puissions trouver, aucun laboratoire indépendant ne l’a évalué, et l’affirmation concernant l’ensemble n’a aucune évaluation publique qui y soit associée. Un fournisseur qui disposerait d’un modèle plus puissant que Claude Haiku 5.5 et pourrait le démontrer le démontrerait.
Là où Claude Haiku 5.5 gagne haut la main, et ce n’est pas serré
L'entrée d'images, d'abord. Aion 3.5 ne prend que le texte, tandis que Claude Haiku 5.5 accepte les images, ce qui tranche d'emblée toute charge de travail de type document, capture d'écran ou diagramme, avant même que le prix ne soit évoqué. La sortie maximale, ensuite : 128 000 tokens contre 32 768, avec un chemin bêta de 300 000 tokens sur Batch. Et le réglage d'effort, qui relève d'un mécanisme de maîtrise des coûts plutôt que d'une capacité : en Low, Claude Haiku 5.5 produit bien moins de tokens de raisonnement, et comme le raisonnement est facturé en sortie, c'est là que vous maintenez un agent bavard dans la fourchette bon marché.
Le score indépendant a le dernier mot sur ce point. Dans l’indice d’Artificial Analysis, Claude Haiku 5.5 affiche 43 au global et 43,40 dans sa configuration Max, deuxième sur 182 modèles, à 0,21 $ par tâche d’index avec 243,4 tokens par seconde en sortie. Ce sont des chiffres obtenus de manière indépendante. Aion 3.5 n’en a aucun, et tant que ce n’est pas le cas, la comparaison que l’acheteur fait réellement oppose « un modèle avec un score publié et un prix que je peux prévoir » à « un modèle avec un prix plus élevé et aucun score », ce qui n’est pas un choix difficile pour une mise en production.

Exécuter les deux sans doubler la plomberie
Aion 3.5 est accessible via l'API propre d'AionLabs et plusieurs plateformes tierces. Claude Haiku 5.5 est disponible via l'API d'Anthropic et, de là, partout où les modèles d'Anthropic sont revendus. Ni l'un ni l'autre ne figure aujourd'hui au catalogue d'OrcaRouter, et nous ne laisserons pas entendre le contraire : ce que nous routons depuis ce coin du marché, c'est anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 et anthropic/claude-fable-5.1 — le palier au-dessus du modèle dont traite cet article.
La raison pour laquelle cela compte ici, c'est que l'architecture sensée pour cette confrontation est une petite part du trafic sur le modèle coûteux. On ne migre pas un pipeline vers un ensemble à 3,00 $ par million ; on lui envoie les deux pour cent d'appels où un second avis vaut 3,00 $, et on garde tout le reste sur le modèle bon marché. Cela signifie deux fournisseurs, deux clés et deux surfaces de facturation pour une charge de travail de deux pour cent, ce qui est exactement la forme pour laquelle une passerelle est conçue. OrcaRouter répercute le prix catalogue du fournisseur à 0 % de marge, de sorte qu'un changement de prix d'un fournisseur est effectif le jour même plutôt que selon un cycle de re-tarification, et que l'A/B est une chaîne de modèle plutôt qu'une seconde intégration. Là où aucun des deux volets n'est dans notre catalogue, la réponse honnête est que nous sommes la mauvaise couche pour cela et qu'une intégration directe est ce qu'il vous faut.

Qu'est-ce qui réglerait cela ?
Une évaluation indépendante d’Aion 3.5. Voilà toute la pièce manquante. Si un laboratoire neutre lui attribue un score proche des 43 de Claude Haiku 5.5, à 0,21 $ par tâche, alors AionLabs facture trente fois le prix d’entrée pour une performance équivalente, et l’argument de l’ensemble devient un handicap plutôt qu’un atout. S’il obtient un score nettement supérieur, alors le surcoût est réel et la bonne décision est de le réserver à la petite fraction d’appels qui en ont besoin. Tant que ce chiffre n’existe pas, un acheteur qui choisit entre ces deux modèles choisit un modèle mesuré à un prix publié ou un modèle non mesuré à un prix plus élevé — et il n’existe qu’un seul choix par défaut défendable dans cette paire.
Cela signifie deux fournisseurs, deux clés et deux surfaces de facturation pour une charge de travail de deux pour cent, ce qui est exactement le type de cas pour lequel une passerelle est conçue.
