
Perceptron Mk1.5 vs Qwen 3.8 : Le robot a besoin des deux, et aucun des deux n’est un substitut.
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 610 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 189 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Un robot qui doit ramasser quelque chose a besoin de deux choses de la part d'un modèle, et aucun modèle unique dans ce duo ne vous donne les deux. Perceptron Mk1.5 renvoie de la géométrie : à partir d'images vidéo, il peut retourner un point, une boîte, un polygone ou un élément <track> horodaté, et sa fenêtre de contexte est de 36 864 tokens. Qwen 3.8 — le nom qui correspond au cœur open-weights Qwen3.8-2.4T-A95B du fournisseur — est un raisonneur de type mélange d'experts de 2,4 billions de paramètres avec une fenêtre native de 262K qui s'étend vers un million, et il est uniquement textuel, donc il ne peut pas du tout regarder les images. L'un est une couche de perception qui coûte 0,15 $ et 1,50 $ par million de tokens ; l'autre est un cœur de raisonnement qui coûte environ treize fois plus cher en entrée et quatre fois plus cher en sortie, et obtient un score indépendant de 40 sur l'Artificial Analysis Intelligence Index, tandis que le modèle de perception n'a aucun score indépendant nulle part.
Mis côte à côte en tant que produits concurrents, chacun perd face à l'autre, mais dans des directions opposées, et la comparaison ne produit rien d'utilisable. Mis côte à côte comme les deux moitiés d'un même pipeline, ils expliquent presque toutes les décisions de coût et de fiabilité dans une stack incarnée : où les frames sont interprétées, où le plan est élaboré, et ce qui arrive à votre facture quand la moitié « raisonnement » écrit plus de tokens que la tâche n'en demande.
La séparation qui rend cette association pertinente
Perceptron Mk1.5 est sorti le 25 septembre 2026 comme successeur de Perceptron Mk1, et sa fonction est strictement définie. Il accepte du texte, des images, de la vidéo et de l'audio, et il renvoie du texte ainsi qu'une annotation structurée facultative — points, boîtes englobantes, polygones, clips et pistes. La sortie <track> porte à la fois une observation spatiale et l'horodatage auquel elle se rattache, de sorte qu'un clip de 60 secondes revient sous forme de positions au fil du temps plutôt qu'une unique estimation moyennée. Un champ asset_idx permet à une seule requête de traiter plusieurs images ou vidéos séparément, ce dont a besoin une comparaison entre image de référence et image en direct. Les réponses contraintes se présentent sous deux variantes, JSON Schema et regex, et tout l'intérêt des deux est que la sortie est typée.
Qwen 3.8 est le type d’instrument opposé. Le cœur 2,4 T est un MoE à grain fin — 92 couches, 512 experts par couche avec 10 routés plus un partagé, et 69 de ces 92 couches en attention linéaire — c’est ainsi qu’une architecture aussi grande atteint son contexte long. Là où il est fort, c’est le raisonnement sur de grandes quantités de texte : analyse complexe en plusieurs étapes, longues dérivations, planification agentique. Là où il est incapable, c’est du côté de l’entrée. Le cœur ouvert est texte uniquement, et son raisonnement ne peut pas être désactivé : chaque réponse s’ouvre par un bloc de réflexion, que vous en vouliez un ou non.
Ce n'est pas une déficience d'un modèle de raisonnement ; c'est une déficience d'un modèle de perception, et Qwen 3.8 n'en est pas un. Mettez les deux en séquence et la forme est évidente — Mk1.5 répond « où se trouve le chariot élévateur et quand s'est-il déplacé », Qwen 3.8 répond « compte tenu de cela, que devrait faire le bras ». Aucune des deux questions ne peut être résolue par l'autre modèle.

Combien coûte chaque moitié, aux tarifs réellement facturés
• Entrée — Perceptron Mk1.5 0,15 $ par million de tokens. Qwen 3.8 2,00 $ par million sur le build hébergé que le harnais indépendant mesure, une remise de cache de 88 % appliquée, ce qui ramène un hit de cache à environ 0,24 $.
• Sortie — Mk1.5 1,50 $ par million. Qwen 3.8 6,00 $ par million.
• Cache — l'entrée mise en cache de Mk1.5 coûte 0,0375 $ par million, soit exactement un quart de son tarif d'entrée standard. La remise de Qwen 3.8 est proportionnelle mais plus importante, à 88 %, de sorte que son tarif avec cache est le moins cher des deux en termes absolus et que son tarif sans cache est plus de dix fois celui de Mk1.5.
• Coût par tâche terminée — c’est ici que le classement s’inverse. Artificial Analysis évalue le coût par tâche de l’Intelligence Index de Qwen 3.8 à 2,16 $, ce qui le classe 32e sur 115 dans sa catégorie et lui vaut une note de quatre unités sur quatre pour le coût — bon marché par tâche terminée malgré des tokens coûteux, car le modèle a généré 170 M de tokens de sortie sur l’ensemble des exécutions de l’indice, face à une concurrence qui s’étale davantage. Aucun chiffre équivalent n’a été publié par qui que ce soit pour Mk1.5.
• Contexte — 36 864 tokens pour Mk1.5 contre 262 K natifs pour le cœur Qwen, extensible jusqu’à un million avec la bonne configuration de service.
• Contrôle du raisonnement — Mk1.5 expose reasoning_effort avec les valeurs high, medium, low, minimal ou none, et la valeur par défaut est high. Qwen 3.8 verrouille la réflexion en mode activé, si bien que vous payez les tokens de réflexion à chaque appel.
Relisez cette liste deux fois, car les deux modèles s'inversent sur le coût. Par token, Mk1.5 est nettement moins cher. Par tâche terminée sur un benchmark indépendant, Qwen 3.8 est mesuré comme peu coûteux et Mk1.5 ne l'est pas. Ces deux affirmations ne sont contradictoires que si vous supposez qu'ils exécutent le même travail, et ce n'est pas le cas.

Ici, les preuves vont dans l'autre sens.
Dans la plupart des comparaisons de ce lot, le côté des poids ouverts est celui qui présente une série de chiffres rapportés par les fournisseurs, et l’API fermée est celle qui dispose d’une page tierce. Ici, c’est l’inverse, et ce renversement mérite d’être précisé, car il change ce que vous pouvez vérifier et ce que vous ne pouvez pas.
Qwen 3.8 dispose d’une mesure indépendante. L’Artificial Analysis Intelligence Index place le cœur 2,4 T à 40, classé 5e sur 115 modèles de sa catégorie au moment de la rédaction, avec une vitesse de sortie de 39,6 tokens par seconde — 56e sur 115, ce qui le situe dans la moyenne, et il est utile de le savoir avant d’envisager une boucle interactive autour de lui. Les révisions de l’indice évoluent d’un instantané à l’autre, et la lecture honnête de ces chiffres consiste à les considérer comme indicatifs, mais l’essentiel demeure : quelqu’un d’extérieur à Alibaba a fait tourner ce modèle et publié un chiffre.
Pour Perceptron Mk1.5, rien de tel n’existe. Il n’y a ni entrée Artificial Analysis ni score d’arène pour Mk1.5 ou son prédécesseur, si bien que chaque chiffre de capacité existant a été produit par Perceptron au sujet de son propre modèle. Cet ensemble est inhabituellement spécifique, ce qui plaide en sa faveur — 0,9433 sur egocentric hand_box contre 0,4467 pour Gemini 3.1 Pro dans le propre test du fournisseur ; EgoSchema 80,40 contre 81,20 pour le même concurrent, une perte étroite sur le benchmark de compréhension générale, aux côtés d’un avantage revendiqué de 12 % sur le sous-ensemble plus difficile d’EgoSchema à 63,75 ; 0,647 de centre-F1 et 0,628 de point-HOTA sur Molmo2-Track — mais spécifique et vérifié de manière indépendante sont deux propriétés différentes, et seule la seconde vous indique ce qui se passera sur vos séquences.
Deux mises en garde sur la lecture du tableau de Perceptron, qui s’appliquent toutes deux à toute citation de celui-ci. Le chiffre LiveVQA-W de 56,0 avec outils activés provient d’un vote majoritaire sur quatre échantillons, tandis que le 53,2 auquel il est comparé pour Gemini 3.8 Flash avec ancrage Google Search n’est pas un vote majoritaire ; la technique est légitime et elle flatte un score par rapport à une seule passe gloutonne. Et la ligne de suivi liste Qwen3-VL-8B à 0,180 centre-F1, tiré de l’article de ce modèle, se trouvant dans la même colonne que des chiffres mesurés pour une autre famille de checkpoints. Un chiffre d’article dans une colonne de mesures n’est pas une ligne comparable à périmètre égal, et c’est exactement le genre de ligne qui est citée sans sa provenance.
Le cœur 2.4T n'est pas quelque chose que vous pouvez appeler chez nous — mais son architecture, si.

Voici la partie de la comparaison où la réponse honnête diffère de ce que suggère la renommée du modèle. Qwen 3.8, en tant que nom, est largement utilisé pour désigner le cœur ouvert, et le cœur ouvert est un téléchargement, pas un point de terminaison : 2,4 To de poids BF16 sous la licence personnalisée Qwen3.8-Max d’Alibaba, publiés en août 2026. Nous ne le servons pas, et aucun fournisseur ne le sert de notre côté de la barrière aujourd’hui — l’entrée du catalogue existe sous la forme d’une page de suivi annoncée, pas encore disponible, plutôt que d’une route active.
Ce que nous servons, c'est l'API phare construite sur la même architecture 2.4T. Elle est disponible sous qwen/qwen3.8-max à 2,00 $ et 6,00 $ par million de tokens, le tarif propre d'Alibaba répercuté directement, avec rien d'ajouté par token, portant la fenêtre multimodale de 1M de tokens — entrée texte, image et vidéo — et la même conception d'attention hybride que le cœur ouvert. Si votre partie raisonnement a besoin de voir quoi que ce soit, c'est la voie à suivre, et c'est aussi la voie où un changement de tarif du fournisseur nous parvient le jour même plutôt qu'à votre prochain cycle de facturation. À côté, nous servons le frère dense d'Alibaba qwen/qwen3.8-27b sur notre propre infrastructure à 0,33 $ et 2,40 $ par million, avec une fenêtre de 262 144 tokens et entrée texte, image et vidéo, pour les cas où un raisonneur 27B suffit et où l'indice 40 du 2.4T est plus que ce dont la tâche a besoin.
Câbler les deux moitiés sans second contrat
La raison pratique pour laquelle ce couplage compte plus que l’argument du benchmark, c’est qu’une stack incarnée est déjà deux modèles, et que le coût d’intégration d’un troisième est ce qui tue discrètement la conception. Mk1.5 n’est pas dans notre catalogue, donc y accéder passe par l’API propre du fournisseur — pip install "perceptron>=0.4.0", clé dans PERCEPTRON_API_KEY, endpoint api.perceptron.inc. Il ne manque qu’une clé pour la partie Qwen.
Ce qui justifie la place d'une passerelle, c'est la jonction. Une règle de routage qui envoie chaque image accompagnée d'une question au modèle de perception et chaque plan purement textuel au modèle de raisonnement se résume à une ligne de configuration lorsque les deux se trouvent derrière un point de terminaison compatible OpenAI, et le basculement automatique fait qu'un incident chez un fournisseur, d'un côté ou de l'autre, se transforme en repli plutôt qu'en robot bloqué. Une seule API couvrant plus de 200 modèles, avec des tarifs catalogue répercutés à 0 % de marge, est aussi le moyen le moins coûteux de répondre à la question que cet article ne peut pas trancher : votre tâche de suivi d'objets a-t-elle seulement besoin des coordonnées de Mk1.5, ou un modèle de vision généraliste doté d'une fenêtre bien plus large et d'un score indépendant aurait-il suffi ? Répartir une part du trafic réel entre les candidats et mesurer sur vos propres images coûte moins cher que n'importe quelle étude comparative que vous pourriez commanditer.
Que faire de cela, concrètement ?
Si vous intégrez de la perception dans un système physique, Perceptron Mk1.5 est le seul modèle de ce duo qui répond en coordonnées, et il s’agit d’une capacité plutôt que d’un score — testez l’affirmation hand-box sur votre propre vidéo, définissez reasoning_effort délibérément au lieu d’accepter la valeur par défaut élevée, et prévoyez la fenêtre de 36 864 jetons comme une contrainte dure plutôt que souple. Si vous construisez la couche de raisonnement au-dessus, Qwen 3.8 est mesuré là où Mk1.5 ne l’est pas, et son coût par tâche accomplie est le chiffre sur lequel planifier, plutôt que le titre de 2,00 $ — avec la réserve que sa réflexion ne peut pas être désactivée, de sorte qu’une tâche qui n’a pas besoin d’une chaîne de pensée en paie une quand même.
Les équipes qui se trompent sur ce point sont celles qui cherchent à faire faire les deux à un seul modèle. Un spécialiste de la perception à 36 864 jetons ne pourra pas retenir l’historique opérationnel, et un raisonneur textuel de 2,4 T ne verra jamais la trame. Le couplage n’est pas un compromis entre deux produits. C’est la véritable division du travail, et la seule question utile est de savoir de quel côté de cette division se situe chacun de vos appels.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
