
Perceptron Mk1.5 vs Gemma 4 12B : l'un répond en phrases, l'autre en coordonnées
- typesafeNOUVEAUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 par million de tokens · 610 tok/s
- openaiNOUVEAUOpenAI: GPT-6 Luna2026-09-2237Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Sol2026-09-2248Intelligence
- anthropicNOUVEAUAnthropic: Claude Opus 5.52026-09-2258Intelligence
- grokNOUVEAUGrok 4.72026-09-2146Intelligence
- OrcaNOUVEAUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 par million de tokens · 189 tok/s
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
Voici le chiffre qui devrait vous arrêter d'emblée : Perceptron Mk1.5 est un modèle conçu pour la vidéo et les agents incarnés, et sa fenêtre de contexte est de 36 864 tokens. Gemma 4 12B est un généraliste à poids ouverts de 12B doté d'une fenêtre de 256K. Sur l'axe que la plupart des gens utilisent pour comparer les modèles de vision — quelle quantité de séquences puis-je lui confier —, le modèle plus petit, fermé et conçu pour un usage précis perd d'un facteur sept face au modèle téléchargeable. Cette inversion n'est un défaut ni pour l'un ni pour l'autre produit. Elle vous dit ce pour quoi chacun a réellement été conçu, et les deux tâches sont plus éloignées que ne le suggère la ligne commune « entrée multimodale » sur leurs fiches techniques.
Perceptron Mk1.5 est le modèle de raisonnement incarné que Perceptron a commercialisé le 25 septembre 2026, successeur de Perceptron Mk1 de mai, prenant en entrée du texte, des images, de la vidéo et de l’audio et renvoyant en sortie du texte ainsi que de la géométrie exploitable par machine. Gemma 4 12B est le modèle multimodal à poids ouverts sans encodeur de 11,96 B de Google DeepMind, publié le 3 juin 2026 sous Apache 2.0, qui prend en entrée du texte, des images, de l’audio et de la vidéo et renvoie du texte. Les deux sont bon marché, les deux lisent un flux de caméra, et un seul d’entre eux transmettra à votre contrôleur une boîte englobante sans une seconde étape d’analyse. Le choix entre eux est un choix quant à ce qui doit revenir.
Ce que chacun est conçu pour renvoyer
Placez les deux côte à côte et la différence n'est pas la précision. C'est le type de sortie. Demandez à Gemma 4 12B où se trouve le chariot élévateur et vous obtenez une phrase, et dans la plupart des applications cette phrase est le produit — une description, un résumé, une réponse à une question sur une photo. Demandez à Perceptron Mk1.5 et, parallèlement à sa prose, vous pouvez demander un point, une boîte englobante, un polygone, un clip, ou un <track> élément qui porte une observation spatiale et l'horodatage auquel il appartient. Un clip de 60 secondes revient sous la forme d'une séquence de positions dans le temps plutôt que d'une seule estimation moyennée de la scène.
C’est tout l’argument en faveur de l’existence de Mk1.5, et il vaut la peine d’être précis sur les raisons pour lesquelles cela compte. Une description d’une scène est un artefact fini. Une coordonnée est une entrée pour autre chose — un planificateur de préhension, un contrôle de défaut, une piste d’audit horodatée. Si votre code en aval doit lire de la prose et en déduire la position, vous avez construit un parseur entre deux modèles, et ce parseur est désormais votre surface de défaillance. L’argument de vente de Mk1.5 est que la géométrie arrive typée.
Le contre-argument de Gemma 4 12B n’est pas qu’il fait cela, lui aussi. C’est que vous pouvez disposer des poids. Sous licence Apache 2.0, 11,96 B de paramètres, publiés en variantes pré-entraînées et affinées sur instructions, tournant sur du matériel que vous contrôlez, avec à l’appui une carte d’évaluation publiée et un index tiers. Ce sont des atouts de nature différente, et aucun des deux ne remplace l’autre.
Là où les deux concordent réellement
Moins d’endroits que ne le suggère l’étiquette « multimodal 2026 », mais le terrain d’entente est réel et vaut la peine d’être énoncé précisément parce que c’est là que commence généralement la liste de contrôle d’un acheteur.
• Modalité d’entrée — les deux sont véritablement quadrimodaux. Perceptron Mk1.5 accepte le texte, les images, la vidéo et l’audio (WAV, MP3, FLAC). Gemma 4 12B accepte le texte, l’image, l’audio et la vidéo via un chemin unifié unique sans encodeur.
• Modalité de sortie — aucun des deux ne génère d’audio ni d’images. Les deux produisent du texte. La différence est que le texte de Mk1.5 peut porter des annotations spatiales structurées, contrairement à celui de Gemma 4 12B.
• Appel de fonctions — les deux le prennent en charge. Mk1.5 expose l'appel de fonctions sur les complétions de chat et accepte les réponses contraintes via JSON Schema et regex. Gemma 4 12B intègre l'appel de fonctions dans sa forme ajustée par instructions et son mode de réflexion configurable.
• Contrôle du raisonnement — Mk1.5 remplace l'ancien booléen vision_config.enable_thinking par un champ reasoning_effort prenant les valeurs high, medium, low, minimal ou none, et dont la valeur par défaut est high. Gemma 4 12B expose des variantes avec et sans raisonnement qui obtiennent des scores différents sur le même banc d'essai, car elles effectuent une quantité de travail différente.
• Contexte — 36 864 tokens pour Mk1.5 contre 256K pour Gemma 4 12B. C'est l'écart le plus important de la liste et la section suivante y est consacrée.
• Poids et licence — Mk1.5 est un modèle hébergé fermé avec un SDK, et non un téléchargement. Gemma 4 12B est sous Apache 2.0, de sorte que le prix de l'hébergement est une option parmi d'autres plutôt que le seul moyen de l'exécuter.

La fenêtre de 36K relève d’un choix de conception, et non d’une insuffisance.
Un modèle incarné avec une fenêtre de 36 864 tokens peut sembler une erreur jusqu'à ce qu'on regarde ce que Perceptron a construit en parallèle. Mk1.5 accepte un asset_idx en tant que champ, de sorte qu'une requête peut référencer plusieurs images ou vidéos et s'adresser à chacune séparément. Il plafonne l'audio à 16 384 tokens par élément — la documentation de Perceptron l'estime à environ 21,8 minutes de parole à environ 750 tokens par minute. Et la raison pour laquelle la fenêtre peut rester petite est que la tâche est restreinte : trouver et suivre des éléments précis dans les trames, répondre à leur sujet, s'arrêter.
Il s'agit d'une forme de travail différente de celle de Gemma 4 12B. Une fenêtre de 256K sert à contenir un document, un dépôt, ou une longue conversation et à raisonner sur l'ensemble de son contenu. La fenêtre de Mk1.5 est un budget pour une tâche de perception avec une réponse structurée, et Perceptron l'a dimensionnée pour cette tâche plutôt que pour un classement. C'est au moment où votre tâche est « Regardez toute cette vidéo d'inspection de 40 minutes et dites-moi tout » que la différence se fait sentir — une fenêtre de 36K ne pourra pas contenir à la fois la transcription, les images et la réponse, et la fenêtre de Gemma 4 12B combinée à son score de rappel sur contexte long est l'instrument honnête pour cela.
La seconde moitié de ce compromis, c'est la vitesse. Perceptron annonce un gain de bout en bout allant jusqu'à 4,7× plus rapide, à partir d'une médiane de trois exécutions sur un seul H100, avec la réserve que 4,7× correspond au meilleur de trois mesures et non au cas typique : les réponses de chat sont passées de 5,2 secondes à 1,1, le QA d'images de 1,7 seconde à 0,51 (environ 3,3×), et une vidéo de 60 secondes à une concurrence de huit voies de 19 secondes à 9,1 (environ 2,1×). Sur la charge de travail vidéo qu'un agent incarné exécute réellement, le multiple honnête est d'environ deux.
L'un de ceux-ci a été mesuré par quelqu'un d'autre.

C'est l'asymétrie la plus nette de cette confrontation, et ce n'est même pas serré.
Gemma 4 12B dispose d’une fiche d’évaluation fournisseur et d’un indice tiers. La fiche contient des chiffres rapportés par le fournisseur — MMLU Pro 77,2, GPQA Diamond 78,8, MMMU Pro 69,1, LiveCodeBench v6 72,0, AIME 2026 sans outils 77,5, Tau2 en moyenne sur trois exécutions 69,0 — et un point faible honnête dans MRCR v2 8-needle à 128k, qui atteint 43,4 et constitue la ligne à lire avant de supposer qu’une fenêtre de 256K se comporte comme une fenêtre à l’extrémité. À cela s’ajoute une mesure indépendante : Artificial Analysis place Gemma 4 12B à un Intelligence Index de 14, classé 22e sur 142 modèles de sa catégorie, à 113,7 jetons de sortie par seconde — 20e sur 142 en vitesse — avec un prix catalogue de 0,10 $ en entrée et 0,30 $ en sortie par million de jetons.
Perceptron Mk1.5 n'a rien de tel. Il n'existe aucune entrée dans l'index Artificial Analysis ni aucun score d'arène pour Mk1.5 ou pour Mk1, donc tous les chiffres de capacités qui existent pour ce modèle ont été produits par l'entreprise qui le vend. Cet ensemble est précis plutôt que vague, et il vaut la peine d'être lu : 0,9433 sur egocentric hand_box contre 0,4467 pour Gemini 3.1 Pro et 0,6179 pour le meilleur Gemini dans le propre test de Perceptron ; EgoSchema 80,40 contre 81,20 pour le même concurrent, une perte de 0,80 point sur le benchmark de compréhension générale, avec un avantage revendiqué de 12 % sur le sous-ensemble EgoSchema-hard à 63,75 ; 0,647 de centre-F1 et 0,628 de point-HOTA sur Molmo2-Track ; DailyOmni 74,67 et AVHBench 80,56 du côté audio. Le schéma qui se dégage de ces chiffres — décisif sur la géométrie fine, à peu près au même niveau ou légèrement en retrait sur la compréhension vidéo générale — est cohérent et correspond au récit du produit. Mais le benchmark d'un modèle réalisé par son propre fournisseur reste une affirmation, et les deux modèles de cet article ne sont pas décrits avec le même type de preuves.
Une ligne de ce tableau mérite un avertissement spécifique. La comparaison de suivi de Perceptron liste Qwen3-VL-8B à 0,180 centre-F1, issue de l'article de ce modèle, à côté de chiffres mesurés pour son propre modèle, et l'associe à Qwen3.5-27B à 0,530 et 0,476 sur différents checkpoints et configurations d'évaluation. Une valeur tirée d'un article dans une colonne de valeurs mesurées n'est pas une ligne comparable, et c'est le genre de ligne qui est citée sans sa provenance. La même prudence s'applique a contrario aux résultats 56,0 de Mk1.5 sur LiveVQA-W avec outils activés — ce chiffre provient d'un vote majoritaire sur quatre échantillons, alors que le 53,2 auquel il est comparé pour Gemini 3.8 Flash avec ancrage par recherche n'en provient pas, et le vote majoritaire sur quatre échantillons est une technique légitime qui flatte un score par rapport à une seule passe gloutonne.
Calculer le coût d'une charge de travail réelle
Les grilles tarifaires sont plus proches l’une de l’autre que ne le sont les produits. Perceptron Mk1.5 est à 0,15 $ par million de tokens d’entrée et à 1,50 $ par million de tokens de sortie, avec l’entrée mise en cache à 0,0375 $ — soit exactement le quart du tarif d’entrée standard, et moins cher par token mis en cache que le tarif d’entrée standard de 0,10 $ de Gemma 4 12B. Gemma 4 12B est affiché à 0,10 $ et 0,30 $ sur le harnais tiers qui le mesure, et il est sous Apache 2.0, donc l’auto-hébergement élimine entièrement le coût marginal si vous disposez du matériel.
Deux choses compliquent une comparaison directe et elles vont dans des directions opposées. Premièrement, le reasoning_effort de Mk1.5 est défini par défaut sur high, ce qui signifie que chaque appel que vous ne configurez pas achète le chemin de raisonnement le plus coûteux proposé par le modèle ; passer à medium ou low est un changement d'une seule ligne avec un effet direct sur la facture, et c'est l'expérience la moins chère de la version. Deuxièmement, Gemma 4 12B permet de désactiver entièrement l'étape de réflexion, ce qui change à la fois la facture et la latence, et sur une tâche fixe comme la classification au niveau des trames, une passe sans raisonnement est souvent la bonne.
Faites le calcul sur un cas concret : un pipeline de vision qui traite 40 000 images par jour, à raison d'environ un millier de tokens d'entrée d'image chacune. Cela représente 40 M de tokens d'entrée par jour. Au tarif d'entrée de 0,15 $ de Mk1.5, avec la mise en cache des images lorsque la même scène se répète, vous en êtes à quelques dollars par jour tout au plus pour l'entrée — bon marché, selon n'importe quel critère. Gemma 4 12B, à 0,10 $ en entrée, est encore moins cher, et gratuit à la marge si vous l'hébergez vous-même. Aucun des deux modèles n'est coûteux. La décision ici n'est pas une décision budgétaire ; c'est la question de savoir si vous avez besoin de coordonnées, d'une fenêtre de 256K, ou des deux.
Appeler les deux sans une deuxième intégration

L'obstacle pratique à la réalisation de cette comparaison n'est pas le prix — c'est que Perceptron Mk1.5 et Gemma 4 12B ne figurent pas dans le même catalogue. Aucun des deux n'est routé sur OrcaRouter aujourd'hui : les entrées Gemma 4 que nous servons sont les variantes 31B Instruct et 26B-A4B, et Mk1.5 n'a aucune route du tout, donc le conseil honnête est d'accéder à Mk1.5 via l'API propre de l'éditeur à l'adresse api.perceptron.inc — pip install "perceptron>=0.4.0", clé dans PERCEPTRON_API_KEY — et Gemma 4 12B soit via un hébergeur tiers, soit en servant vous-même les poids Apache-2.0.
Ce à quoi sert véritablement une couche de routage dans cette situation, c'est la décision que vous n'avez pas encore prise. Si la sortie structurée de Mk1.5 est ce dont votre application a besoin et que la fenêtre de Gemma 4 12B est ce dont votre autre charge de travail a besoin, ce sont deux intégrations et deux domaines de défaillance ; les placer derrière un point de terminaison compatible OpenAI avec basculement automatique signifie qu'un incident passager chez un fournisseur, d'un côté ou de l'autre, se transforme en repli plutôt qu'en tâche échouée, et une règle de routage peut envoyer le travail de géométrie et le travail à contexte long vers des modèles différents sans que votre application sache lequel est lequel. Lorsqu'un fournisseur modifie sa grille tarifaire, un routeur transparent facture le prix catalogue du fournisseur sans aucun ajout par token, de sorte que le changement s'applique le jour même plutôt qu'à votre prochain cycle de facturation. Le DSL de routage est aussi la façon dont vous monteriez une comparaison — une part du trafic réel vers chaque modèle, mesurée sur vos propres trames, au lieu d'un argument de benchmark.
Lequel tu veux vraiment ?
Prenez Perceptron Mk1.5 si la réponse doit être lisible par machine. Si vous pilotez quelque chose, ou si vous enregistrez quelque chose où la position et le temps sont l'essentiel, aucune fenêtre de contexte supplémentaire ne remplace une coordonnée saisie, et Mk1.5 est le seul modèle de ce duo qui en produit une. Lancez-vous en gardant les yeux ouverts sur trois choses : le budget de 36 864 jetons, le haut niveau de raisonnement par défaut, et le fait que chaque chiffre de capacité qui lui est associé provient du fournisseur.
La façon la moins coûteuse de trancher est d'acheminer une part du trafic réel vers chacun et de mesurer sur vos propres frames ; les deux se trouvent derrière un point de terminaison compatible OpenAI sur OrcaRouter, ce qui fait d'un test côte à côte une ligne de config plutôt qu'une seconde intégration.
Prenez Gemma 4 12B si vous devez contenir beaucoup de matière, si vous avez besoin des poids, ou si vous devez justifier le choix auprès de quelqu'un qui ne prend pas les benchmarks des fournisseurs pour argent comptant. Il dispose d'un index indépendant, d'une fiche d'évaluation publiée, d'une licence Apache 2.0 et d'une fenêtre sept fois plus grande — et il décrira une scène plutôt que de la mesurer. Cette dernière proposition constitue toute la décision. L'un de ces modèles est un généraliste que vous pouvez posséder et auditer ; l'autre est un spécialiste que vous louez parce qu'il renvoie de la géométrie, et le fait que le spécialiste ait une fenêtre plus petite et aucun score tiers n'est pas une contradiction. C'est à quoi ressemble, vu de l'extérieur, un outil conçu de manière étroite.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
