Une carte de titre principal pour Apodex 1.1 intitulée « Apodex 1.1 » avec le sous-titre « 44 sur l'indice d'intelligence - puissance agentique, verbosité élevée et rattrapage des connaissances », des badges indiquant « AA Index 44 », « #11 sur 177 », « contexte 256K », et une ligne de pied de page « Publié le 24 août 2026 - premier modèle Apodex sur Artificial Analysis », avec le logo OrcaRouter dans le coin en bas à droite.
Guides & Insights

Apodex 1.1, expliqué : un 44 à l'indice d'intelligence, une véritable puissance agentique — et un bémol sur la fiabilité des connaissances.

Auteur

Alistair Wren

Date de publication

Derniers modèles · 20Voir tous les modèles
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Apodex 1.1 est sorti il y a une semaine, il est propriétaire, et jusqu'à cette semaine, il n'était guère qu'une curiosité de laboratoire. Puis Artificial Analysis a publié sa première évaluation indépendante du modèle — la première d'Apodex sur la plateforme — et le classement a fait quelque chose d'inhabituel : Apodex 1.1 a obtenu un score de 44 à l'Artificial Analysis Intelligence Index, se classant 11e sur 177, tout en affichant des scores de travaux agentiques supérieurs à ceux de tous les modèles de sa catégorie d'intelligence, dont DeepSeek V4 Pro, Qwen3.7 Max et Kimi K2.6. Le même rapport a révélé un second chiffre, plus inquiétant : un score de fiabilité des connaissances suffisamment faible pour remettre en question la décision d'y faire tourner de vrais travaux. Son homologue à poids ouverts, Apodex 1.1 Mini, est le modèle que la plupart des gens peuvent réellement exécuter. Voici ce que dit l'évaluation, ce qu'elle ne dit pas, et à qui elle devrait importer.

Apodex, l'entreprise d'IA fondée par Chen Tianqiao, a lancé sa famille de modèles le 24 août 2026, accompagnée d'un article arXiv cosigné par 70 auteurs, « Apodex 1.1: Scaling Agentic Intelligence for Complex Work » (2608.23283). Le modèle phare est propriétaire — environ 397 milliards de paramètres, selon le rapport du fournisseur — et construit autour de la thèse selon laquelle le véritable goulot d'étranglement des agents n'est pas l'intelligence brute, mais l'environnement dans lequel ils opèrent. Apodex 1.1 a donc été entraîné à travailler directement avec les fichiers, la recherche et le code sur de longs horizons, avec un harnais d'exécution partagé (« AgentOS ») qui coordonne jusqu'à 150 sous-agents en parallèle et tient un registre de provenance de chaque étape. La partie ouverte est le modèle frère : Apodex 1.1 Mini, un MoE de classe 35B affiné à partir du modèle d'Alibaba Qwen3.5-35B-A3B, publié sous licence Apache-2.0 avec un harnais d'agent compagnon appelé FrontierAgent. Le modèle complet n'est accessible que via l'API d'Apodex et son environnement de travail en ligne ; le Mini se déploie uniquement en auto-hébergement, ou pas du tout.

Ce que signifie un 44 sur l'indice d'intelligence

L'Artificial Analysis Intelligence Index est un agrégat pondéré de la suite de benchmarks de la plateforme — incluant des évaluations agentiques comme GDPval-AA v2 et Terminal-Bench, ainsi que des composantes de raisonnement, de mathématiques et de connaissances. Un score de 44 place Apodex 1.1 à la 11e place sur 177 modèles, bien au-dessus de la médiane de 18. Ce score place également le modèle dans un palier dense et intéressant : Kimi K2.6 (45), MiniMax-M3 (45) et Inkling (42) se situent tous à trois points près, et Apodex 1.1 est le seul de ce groupe dont le nom était inconnu de la plupart des utilisateurs d'IA il y a une semaine. Artificial Analysis note que la page couvre la version de raisonnement du modèle et qu'une variante sans raisonnement pourrait également exister.

A single-column scoreboard for Apodex 1.1 titled 'Apodex 1.1 - the scoreboard' listing AA Intelligence Index 44 (#11 of 177), GDPval-AA v2 Elo 1348, TerminalBench v2.1 70%, Output tokens per task ~17,000, Full Index evaluation cost 18.41, and AA-Omniscience -21.9 (78% hallucination), with a footer 'All figures per Artificial Analysis, August 2026.' and the OrcaRouter logo in the bottom-right corner.

Ce n'est pas le score global de l'indice qui rend ce modèle intéressant. Ce qui est intéressant, c'est la répartition de ses forces et de ses faiblesses par rapport à ce score — et c'est ce que la comparaison par paliers concrétise.

Là où il surpasse sa catégorie : évaluations agentiques et du travail intellectuel

Sur les deux composantes de l'Index qui mesurent le travail agentique réel, Apodex 1.1 surpasse ses voisins à 44 points. Sur GDPval-AA v2 — un benchmark qui évalue la capacité d'un agent à accomplir des tâches de bureau réalistes de bout en bout — Apodex 1.1 affiche un Elo de 1348, devant DeepSeek V4 Pro (1333), Qwen3.7 Max (1308) et Kimi K2.6 (1202). Sur TerminalBench v2.1, qui teste un agent travaillant sur un terminal, il obtient 70 %, devant Kimi K2.6 (66 %) et juste derrière Qwen3.7 Max (75 %). Ce sont des chiffres indépendants, établis par Artificial Analysis, et ils constituent la preuve la plus solide du rapport que l'entraînement environnement-d'abord fonctionne.

Les propres affirmations du fournisseur en matière de benchmarks vont plus loin, et doivent être considérées comme des données déclarées par le fournisseur jusqu'à ce que quelqu'un les reproduise : APEX-Agents 38,5, GDPVal 78,8, SWE-bench Verified 77,7 %, Terminal-Bench 2.1 70,8 %, Humanity's Last Exam 56,1 % avec outils, DeepSearchQA 92,4 %, FrontierFinance 54,3 et FrontierScience-Research 63,3. Ce qui rend le profil agentique crédible plutôt que purement marketing, c'est l'architecture qui le sous-tend : la mise à l'échelle de l'environnement (élargir la diversité des environnements de fichiers exécutables, de recherche et de code utilisés lors de l'entraînement) et la mise à l'échelle de la coordination agentique (entraîner le modèle à décomposer les tâches à long horizon, déléguer le travail en parallèle, intégrer les résultats asynchrones et réélaborer le plan). Le mode « Agent Team » génère jusqu'à 150 sous-agents pour les tâches de recherche et de synthèse, et une étape de vérification intégrée (« Statement Review ») contrôle les conclusions avant qu'elles ne soient livrées. En d'autres termes : c'est un modèle conçu pour se tromper, se vérifier et corriger les choses — pas pour réciter des faits de mémoire.

Le coût caché de toute cette autonomie : la verbosité.

Ce design apparaît sur le tableau de coût-efficacité d'Artificial Analysis comme la faiblesse la plus nette du modèle après la connaissance : il est très verbeux. L'exécution de l'Intelligence Index complet a consommé 180 millions de jetons de sortie — contre une médiane de 67 millions — et environ 17 000 jetons de sortie par tâche de référence, contre environ 9 400 pour Qwen3.7 Max et 8 100 pour MiniMax-M3. Au total, l'évaluation complète a coûté 618,41 $ en dépenses API, selon Artificial Analysis.

A screenshot of the Artificial Analysis model page for Apodex 1.1 (captured August 31, 2026), showing 'Apodex 1.1 scores 44 on the Artificial Analysis Intelligence Index' with a median of 18, the note that it generated 180M tokens versus a 67M median, pricing of $0.30 per 1M input and $3.00 per 1M output tokens, and the $618.41 total cost to evaluate the model on the Intelligence Index.

La tarification qui produit cette facture : 0,30 $ par million de jetons en entrée et 3,00 $ par million en sortie — avec un prix de 0,03 $ en cas de hit de cache pour les entrées en cache, soit une remise de 90 % — ce qui donne environ 0,38 $ par million sur un mix typique de 7:2:1 cache/entrée/sortie. Les deux prix par jeton se situent au-dessus des médianes de la plateforme (0,25 $ en entrée, 0,90 $ en sortie). Pourtant, l’estimation du coût par tâche d’Artificial Analysis place toujours Apodex 1.1 à environ 0,05 $ par tâche de référence, moins cher que Qwen3.7 Max (~0,07 $) et Kimi K2.6 (~0,06 $). Cette réconciliation est cruciale pour la budgétisation : ses jetons sont assez bon marché pour que même une verbosité importante reste compétitive par tâche — le risque de coût vient du volume, pas du tarif. Si vous y placez un agent à exécution longue, la facture dépend de la quantité qu’il parle, et il parle beaucoup.

Une note sur les prix avant d'établir votre budget : $0.30/$3.00 correspond au tarif propre du fournisseur. Une plateforme de routage qui transmet les tarifs des fournisseurs sans marge (0 % de majoration) facture exactement ce montant, et toute future baisse de prix d'Apodex apparaît le jour même où elle est annoncée.

Le hic : un faible bilan de fiabilité des connaissances

Voici le chiffre que la couverture du lancement rate en grande partie. Sur AA-Omniscience, la sonde de fiabilité des connaissances d'Artificial Analysis, Apodex 1.1 obtient un score de -21,9. Il tente de répondre à 87 % des questions au lieu de décliner, mais n'en réussit que 32 %, et son taux d'hallucination est de 78,4 %. Pour un modèle présenté comme un solveur robuste, c'est une véritable double personnalité : fort en exécution agentique, faible en connaissances ancrées.

Les deux faits sont liés, non contradictoires. Les benchmarks agentiques récompensent l'action dans un environnement — lancer des appels d'outils, itérer, se remettre d'une erreur — si bien qu'un modèle peut y obtenir de bons scores tout en ayant un faible rappel, parce que l'environnement fait la mémorisation. La conception le suppose d'ailleurs : Statement Review existe pour vérifier les sorties, et l'atelier est construit autour de la vérification, pas autour de la capacité du modèle à avoir raison de mémoire. Le constat pratique est sans détour : n'orientez pas Apodex 1.1 vers des tâches qui reposent sur sa capacité à récupérer des faits depuis ses propres poids. Orientez-le vers des tâches à long horizon où son travail peut être vérifié par rapport aux fichiers, au code et aux sources — et vérifiez la livraison.

Le pendant ouvert : Apodex 1.1 Mini et FrontierAgent

Si la porte fermée du produit phare est un problème, la moitié ouverte de la famille fait contrepoids. Apodex 1.1 Mini est un MoE d'environ 35B au total / ~3B actifs, affiné à partir de Qwen3.5-35B-A3B (un modèle de base open sourcé par Alibaba en février 2026), publié sous licence Apache-2.0 avec une fenêtre de contexte de 262K et des variantes FP8, FP4 et GPTQ-Int4 sur Hugging Face. Son chiffre phare annoncé par le fournisseur est de 50,2 sur FrontierFinance (premier dans la propre comparaison d'Apodex) et 27,7 sur APEX-Agents avec le harnais Agent Team activé. Et FrontierAgent — le runtime open source qui l'accompagne — est véritablement l'artefact intéressant : un harnais en terminal avec les modes ReAct et Agent Team, travail sur fichiers en bac à sable, portes d'approbation, points de contrôle et traces, le tout dialoguant avec n'importe quel endpoint compatible OpenAI.

Deux choses à savoir avant de vous auto-héberger. Premièrement, le Mini est un modèle affiné, pas un modèle de pointe — lisez ses chiffres de benchmark comme vous liriez le tableau du fournisseur du modèle phare : des comparaisons non reproduites, avec harnais inclus, choisies par le fournisseur. Deuxièmement, son comportement hérite du modèle de base : si vous voulez vérifier si le Qwen3.5-35B-A3B sous-jacent accomplit déjà votre tâche, vous n'avez pas besoin d'un GPU ni d'une pile de service pour le découvrir — le modèle de base n'est qu'à un appel API.

Qui devrait utiliser Apodex 1.1 aujourd'hui

Le modèle phare est en accès anticipé, fermé, et uniquement disponible via l'API du fournisseur et son poste de travail en ligne pour l'instant ; Apodex affirme que l'API sera plus largement disponible via les grandes plateformes, mais les poids ne sont pas ouverts. Cela limite qui peut agir sur le classement de cette semaine : les équipes déjà sur le poste de travail Apodex, ou prêtes à s'inscrire pour obtenir une clé API propriétaire. Le Mini est le chemin le plus accessible, mais cela implique de l'hébergement autonome.

A screenshot of the Apodex online workbench homepage (captured August 31, 2026), showing the deep-research interface with the prompt field 'Ask the question that matters', feature points for a step-level reasoning trace, citations in every report, branching off any report, and full-text search across threads, and a sign-in prompt for saving inquiries.

C'est là que le modèle gagne réellement sa place : les pipelines agentiques à long horizon où les sorties sont vérifiées en aval — postes de travail de recherche, tâches multi-étapes impliquant fichiers et outils, travail en terminal — et où le profil de coût d'environ 0,05 $ par tâche survit à la verbosité. Là où il n'a pas encore sa place : tout ce qui dépend de la fiabilité des connaissances propres du modèle, ou un chemin de production qui ne peut pas tolérer qu'un modèle non éprouvé de sept jours se comporte mal. Pour exactement cette situation, une couche de routage est la bonne enveloppe.Une API pour 200+ modèles signifie que le modèle de base Qwen3.5-35B-A3B est déjà utilisable au prix catalogue, qu'un Mini auto-hébergé peut se placer derrière le même routeur avec basculement automatique, et qu'un nouveau venu instable ne peut pas faire tomber un chemin de production — lorsqu'il sous-performe, la requête est redirigée vers un fournisseur sain.

Que regarder ensuite

Cette évaluation est une première lecture, pas un verdict. Trois éléments décideront si Apodex 1.1 compte dans un mois : la reproduction indépendante des affirmations agentiques du fournisseur (les chiffres GDPval et TerminalBench pilotés par Artificial Analysis sont les seuls à ne pas être produits par Apodex lui-même) ; la réduction de l'écart de fiabilité des connaissances dans une variante sans raisonnement ou dans une version ultérieure ; et la présence du modèle sur davantage d'API et de tableaux de bord indépendants, auquel cas le 44 et le -21,9 deviennent le problème de quelqu'un d'autre à battre. Pour un modèle vieux de sept jours avec ce genre de profil contrasté, c'est à peu près tout ce que l'on peut demander : un réel avantage agentique, un prix honnête et une faiblesse que l'on connaît avant de s'inscrire.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement