Une carte de titre principale pour Perceptron Mk1.5 avec le sous-titre « Sortie spatiale structurée pour agents incarnés » et trois icônes linéaires plates au-dessus du titre : une boîte englobante dessinée autour d'un petit objet, une trajectoire de mouvement en pointillés avec deux points de passage, et une onde sonore. Le logo OrcaRouter se trouve dans le coin inférieur droit.
Guides & Insights

Perceptron Mk1.5 apporte une sortie spatiale structurée aux agents incarnés — et met Isaac à la retraite le jour même

Auteur

Rowan Sterling

Date de publication

Derniers modèles · 20Voir tous les modèles →
Benchmarks : Artificial Analysis · mis à jour quotidiennement
Retour à tous les articles

Perceptron Mk1.5 est désormais disponible en version générale, et ce qui est intéressant à son sujet, ce n'est pas le tableau de benchmarks — c'est ce qui revient dans le corps de la réponse. Demandez à un modèle vision-langage classique où se trouve le chariot élévateur et vous obtenez une phrase. Interrogez Perceptron Mk1.5 sur une image vidéo et, parallèlement à sa prose, vous pouvez obtenir une géométrie analysable par machine : un point, une boîte englobante, un polygone, un clip, ou un <track> élément portant des observations spatiales horodatées sur l'ensemble du fichier. C'est là la différence entre un modèle qui décrit une scène et un modèle qu'un contrôleur de robot peut exploiter sans une seconde étape d'analyse syntaxique. Il est le successeur direct de Perceptron Mk1, la première version publiée par l'entreprise en mai 2026, et il a été mis en service le 25 septembre, en même temps que le retrait des checkpoints Isaac 0.1 et 0.2 qui l'avaient précédé.

Ce que Mk1.5 renvoie réellement

Le modèle est un système de raisonnement incarné pour agents physiques. En entrée, il prend du texte, des images, de la vidéo et de l’audio. En sortie, il produit du texte ainsi que des annotations structurées optionnelles : points, boîtes, polygones, clips et pistes. La sortie de suivi est l’élément sur lequel il vaut la peine de s’attarder. La documentation de Perceptron décrit un <track> bloc dont les entrées portent à la fois une observation spatiale et l’horodatage auquel elle appartient, de sorte qu’un clip de 60 secondes revient sous forme d’une séquence de positions d’objets au fil du temps plutôt que d’une seule estimation moyennée de la scène.

Un second détail qui compte pour quiconque intègre ceci dans un pipeline comportant plus d'une ressource : Mk1.5 prend en charge un asset_idxchamp, si bien qu'une seule requête peut référencer plusieurs images ou vidéos et les adresser séparément. Si votre tâche consiste à comparer une photo de référence à une image de caméra en direct — une boucle de contrôle des défauts, une étape de vérification d'assemblage —, cela doit se faire en un seul appel, pas deux.

Le modèle prend également en charge les réponses contraintes, à la fois JSON Schema et regex, ce qui vous permet de transformer « à peu près » en un schéma que votre code en aval peut valider. L'appel de fonctions est pris en charge sur les complétions de chat, et le serveur MCP hébergé de Perceptron a désormais pour valeur par défaut perceptron-mk1.5; c'est en passant model: "perceptron-mk1" explicitement que l'on épingle la valeur par défaut précédente.

La fiche technique, et ce qu’elle coûte

A single-column scoreboard titled 'Perceptron Mk1.5 — the scoreboard' listing Context window 36,864 tokens, Max output 8,192 tokens, Input price $0.15 per million tokens, Output price $1.50 per million tokens, Cached input $0.0375 per million, Reasoning default high, with a footer reading 'Figures per Perceptron's own documentation, September 25, 2026.'

Les chiffres ici méritent d’être énoncés clairement, car ils sont modestes là où un lecteur pourrait ne pas s’y attendre. La fenêtre de contexte est de 36 864 jetons — pas un million, pas 256 K. La sortie maximale est de 8 192 jetons. Ce n’est pas un modèle auquel on confie une vidéo de deux heures et un manuel de 300 pages. Il est dimensionné pour une tâche de perception précise avec une réponse structurée.

Pricing is $0.15 per million input tokens and $1.50 per million output tokens, with cached input at $0.0375 per million — exactly a quarter of the standard input rate. The client library is pip install "perceptron>=0.4.0", the endpoint is https://api.perceptron.inc/v1/chat/completions, and the key lives in PERCEPTRON_API_KEY. Nothing about the integration is exotic.

• Contexte — 36 864 jetons, contre la fenêtre de 32 K livrée avec Perceptron Mk1
• Sortie maximale — 8 192 jetons
• Entrée — texte, images, vidéo, audio (WAV, MP3, FLAC)
• Entrée mise en cache — 0,0375 $/M, soit un quart du tarif d'entrée standard de 0,15 $/M
• Sortie — 1,50 $/M
• Contrôle du raisonnement — reasoning_effort réglé sur high, medium, low, minimal ou none, avec high par défaut

Cette dernière ligne est un changement incompatible déguisé. Mk1.5 remplace l'ancien vision_config.enable_thinking booléen par reasoning_effort, donc toute requête que vous avez construite pour le modèle précédent doit être modifiée plutôt que simplement redirigée. La valeur par défaut de high mérite d'être relevée pour une autre raison : si vous ne définissez pas le champ, vous achetez le chemin de raisonnement le plus coûteux à chaque appel.

Audio, et vidéo avec sa propre bande sonore

L'entrée audio est véritablement nouvelle ici. Perceptron l'accepte de trois manières — en ligne input_audio, une audio_url, ou un audio_file_id — avec un plafond de 16 384 jetons audio par élément. La documentation l'estime à environ 21,8 minutes de parole à environ 750 jetons par minute, ce qui constitue un budget raisonnable pour un enregistrement de passation de service ou un journal de maintenance.

Plus inhabituel est le traitement de la vidéo. Par défaut, Mk1.5 lit la vidéo sous forme d’images et ignore la piste audio. Définir vision_config.enable_audio_in_video: true réactive la bande sonore, ce qui correspond au réglage à privilégier dès lors que le bruit constitue le signal — une machine qui sonne anormalement avant de paraître anormale, une instruction vocale émise hors caméra, une alarme en arrière-plan lors d’une visite de site. Il est désactivé par défaut, de sorte qu’une vidéo présentant un défaut audible sera analysée silencieusement comme un film muet, sauf indication contraire de votre part.

Le tableau de référence, avec les sources explicitement indiquées.

A single-column results scoreboard titled 'Perceptron Mk1.5 — the benchmark picture' listing hand_box 0.9433 against Gemini 3.8 Flash 0.6179, EgoSchema 80.40 against Gemini 3.8 Flash 81.20, EgoSchema-hard 63.75, Molmo2-Track centre-F1 0.647, LiveVQA-W with tools 56.0 against Gemini 3.8 Flash 53.2, and Audio DailyOmni 74.67, with a footer reading 'All figures reported by Perceptron, September 25, 2026. No independent scores.'

Chaque chiffre ci-dessous provient de l’annonce faite par Perceptron lui-même et a été mesuré par Perceptron. Il n’existe aucune entrée d’indice Artificial Analysis ni aucun score d’arène pour Mk1.5 ou son prédécesseur, de sorte qu’aucun chiffre tiers, où que ce soit dans cette comparaison, ne peut leur être opposé. Considérez ces chiffres comme la revendication d’un fournisseur au sujet de son propre produit, et non comme un résultat neutre.

Sur le suivi égocentrique des mains, l'écart est large et spécifique : Mk1.5 obtient 0,9433 sur hand_box contre 0,4467 pour Gemini 3.1 Pro et 0,6179 pour le meilleur Gemini de l'exécution de Perceptron, que l'annonce identifie comme Gemini 3.8 Flash. Ce sont les +111 % et +53 % que met en avant le post de lancement, et c'est le chiffre isolé le plus fort de la publication.

Sur la compréhension générale des vidéos égocentriques, le tableau est bien plus proche. Perceptron rapporte EgoSchema à 80,40 pour Mk1.5 contre 81,20 pour Gemini 3.8 Flash — une perte de 0,80 point — tout en revendiquant un avantage de 12 % sur le sous-ensemble EgoSchema-hard à 63,75. Un modèle qui gagne de manière décisive sur la géométrie fine de la main et perd de peu sur le vaste benchmark de compréhension est un type d’outil spécifique, et il est vendu comme tel.

La segmentation d’objets vidéo atteint 0,647 center-F1 et 0,628 point-HOTA sur Molmo2-Track. Perceptron indique que cela devance Molmo2-Track, Ref-DAVIS17 et ReasonVOS, tout en se classant derrière MolmoPoint-8B sur MeViS valid_u. Face à la gamme de vision Qwen, la comparaison de suivi mérite d’être lue attentivement : l’annonce indique Qwen3-VL-8B à 0,180 center-F1 d’après son article, et Qwen3.5-27B à 0,530 et 0,476 — des checkpoints différents, des configurations d’évaluation différentes, et un chiffre issu d’un article qui se trouve dans la même colonne que des chiffres mesurés. Ce n’est pas une ligne comparable à périmètre égal.

Les résultats audio sont rapportés comme DailyOmni 74,67, WorldSense 50,32, OmniBench 51,05 et AVHBench 80,56, sans ligne de comparaison associée. En recherche multimodale avec outils activés, Mk1.5 obtient 56,0 sur LiveVQA-W à partir d'un vote majoritaire sur quatre échantillons, contre 53,2 pour Gemini 3.8 Flash avec ancrage Google Search, 51,0 pour GPT-6 sol avec recherche web OpenAI, et 33,2 pour GPT-5.2 en ligne. Perceptron revendique également un gain de 36,1 points sur MMSearch une fois les outils activés. Le vote majoritaire sur quatre échantillons est une technique légitime et il flatte le score par rapport à une seule passe gloutonne, donc le 56,0 et le 53,2 ne sont pas mesurés de la même manière.

Latence, et comment le 4,7× a été mesuré

L’affirmation sur la vitesse est celle qui risque le plus d’être citée sans son contexte, alors voici le contexte. Perceptron rapporte jusqu’à 4,7× plus rapide de bout en bout à partir d’une médiane de trois exécutions sur un seul H100, en utilisant des prompts LMArena plafonnés à des réponses de 256 tokens, plus MIA-Bench et Video-MME avec Perception Test. Le 4,7× correspond au cas du chat : de 5,2 secondes à 1,1. Les questions-réponses sur images passent de 1,7 seconde à 0,51, soit environ 3,3×. Une vidéo de 60 secondes traitée par lots de huit passe de 19 secondes à 9,1, soit environ 2,1×.

Ainsi, le multiple mis en avant est le meilleur des trois, pas le cas typique. Sur un seul H100, pour des réponses courtes, le chemin de chat est vraiment 4,7× plus rapide. Sur la charge de travail vidéo qu’un agent incarné exécuterait réellement, on est plus proche de 2×. Ce sont deux bons chiffres ; un seul d’entre eux est mis en avant.

Isaac 0.1 et 0.2 ont été retirés le même jour

A screenshot of the Perceptron documentation model card for perceptron-mk1.5, showing the specifications table (Model ID perceptron-mk1.5, context window 36,864 tokens, maximum output 8,192 tokens, input modalities text, images, video and audio, audio formats WAV/MP3/FLAC, audio limit 16,384 tokens per item, reasoning configured with reasoning_effort, function calling on chat completions, constrained JSON Schema and regex responses) and the pricing table (input $0.15, output $1.50, cached input $0.0375 per million tokens).

Le journal des modifications de Mk1.5 contient une deuxième entrée datée du 25 septembre, et c'est celle qui compte pour quiconque est déjà en production. Les identifiants de modèle isaac-0.1, isaac-0.2-1b et isaac-0.2-2b-preview ont été retirés de l'API Perceptron. Ils n'apparaissent plus dans GET /v1/models, ils ont disparu du serveur MCP hébergé, et les requêtes qui les nomment échouent désormais avec HTTP 404 model_not_found.

Il y a un deuxième changement de comportement enfoui dans la même entrée qui touchera du code qui n'a jamais mentionné les modèles Isaac du tout : les ID de modèle inconnus renvoient désormais 404 au lieu du 400 précédent. Toute logique de réessai, branche d'erreur ou règle d'alerte qui correspondait à un 400 pour un mauvais nom de modèle ne correspond désormais à rien. Le chemin de migration que Perceptron donne est perceptron-mk1.5.

Retirer une famille de modèles le jour même où vous livrez son remplacement est un récit de migration propre et brutal. Si vous avez épinglé Isaac parce qu’il fonctionnait, vous avez une échéance déjà dépassée.

Où le lancer, et comment l’essayer sans parier dessus

La disponibilité passe par l'API propre du fournisseur et plusieurs plateformes tierces. OrcaRouter n'achemine pas actuellement Perceptron Mk1.5 — le modèle ne figure pas dans notre catalogue — le conseil honnête est donc de s'adresser directement à api.perceptron.inc, ce à quoi servent précisément le SDK et la variable d'environnement PERCEPTRON_API_KEY.

Ce qui mérite quand même d’être dit, car cela s’applique à la décision plutôt qu’au modèle : un checkpoint vieux de deux jours sur une fenêtre de 36 864 tokens avec un raisonnement par défaut réglé sur high correspond précisément au profil de quelque chose qu’il ne faut pas mettre sur un chemin de production sans l’avoir vu. Testez-le d’abord sur vos propres frames, et mesurez deux choses en particulier — si les sorties structurées survivent à vos cas limites réels, et ce que reasoning_effort: "high" vous coûte par appel par rapport à un passage à medium ou low. Le second est un changement d’une ligne avec un effet direct sur votre facture, et c’est l’expérience la moins chère de cette version.

Le schéma plus large dans lequel cela s'inscrit — des modèles de perception qui renvoient de la géométrie plutôt que des adjectifs — est précisément ce pour quoi OrcaRouter est conçu. Une seule API couvre plus de 200 modèles, avec les prix catalogue des fournisseurs répercutés à 0 % de marge, si bien qu'un changement de prix d'un fournisseur sur l'un d'eux est répercuté de notre côté le jour même, et le basculement automatique permet à un appel de perception de se rabattre sur un second modèle plutôt que de faire échouer la requête. Si Mk1.5 est la seule option qui atteigne votre seuil de précision, rien de tout cela ne vous aide aujourd'hui. S'il n'est qu'un candidat parmi plusieurs, mener la comparaison via un seul point de terminaison coûte moins cher que de mettre en place un second SDK pour le savoir.

Ce que cette version est et n’est pas

Perceptron Mk1.5 est un outil spécialisé auquel est attaché un ensemble de limites d'une honnêteté inhabituelle. Il renvoie des coordonnées, pas seulement une description. Il lit l'audio, y compris la bande sonore d'une vidéo si vous l'activez. Il est rapide sur les réponses courtes de chat. C'est aussi un modèle de 36 864 tokens avec un plafond de sortie de 8 192 tokens, au prix de 0,15 $ et 1,50 $, évalué entièrement par son propre fournisseur, et vendu par une entreprise qui a abandonné la génération précédente dans la même entrée de changelog.

Si votre problème est « trouver la main, la suivre tout au long du clip, me dire où elle est allée et quand », c’est le numéro de la boîte de la main qu’il faut tester. Si votre problème est la compréhension vidéo générale face à un généraliste de pointe, la ligne EgoSchema — 80,40 contre 81,20 — suggère que vous achetez un spécialiste à peu près à parité, et l’argument en faveur d’un changement doit venir de la sortie structurée et de la latence, pas de la précision.

Comparés dans cet article1

Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement