
Jev refuse d'écrire un seul mot : ce que fait le modèle de décision de TypeSafe AI, et ce que personne n'a encore vérifié
- orcaNOUVEAUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 par million de tokens
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligence
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligence76Code
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligence76Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
Jev est le premier modèle de TypeSafe AI qu'un lecteur est susceptible de rencontrer via un tableau de coûts plutôt qu'une boîte de chat, car il n'y a pas de boîte de chat. Lancé le 15 septembre 2026 par Diogo Almeida — co-auteur de l'article InstructGPT, le travail qui a fait que ChatGPT se comporte comme un assistant — Jev ne génère pas de texte du tout. Il prend un morceau d'état (un e-mail, une ligne de journal, un ticket de support, un blob JSON de coordonnées de jeu) plus une liste de questions typées, et renvoie des réponses typées : un choix parmi un ensemble que vous avez fourni, un score sur une grille d'évaluation, ou une probabilité oui/non, chacune portant sa propre valeur de confiance. Pas de prose, pas de code, pas d'explication. L'argumentaire de TypeSafe est que cette étroitesse est le produit, car elle achète une vitesse et un prix qu'un modèle génératif ne peut pas égaler — 20 à 200 fois plus rapide et 40 à 400 fois moins cher que les « LLM comparables » sur les propres supports de lancement de l'entreprise, à 0,042 $ par million de tokens d'entrée avec une sortie facturée à zéro.
Le nombre le plus utile publié dans les premières 48 heures n'est pas l'un de ceux-là. Il vient d'Every, dont le responsable des évaluations a fait tourner Jev sur 27 articles publiés d'Every plus 10 contreparties de style IA, en posant 21 questions à l'ensemble des 37 documents d'un coup : 777 jugements en moins de 0,7 seconde, pour environ un quart de cent. Un second test, mené par le PDG d'Every, a confronté 12 passages synthétiques — six propres, six avec des défauts délibérément introduits — à quatre contrôles d'écriture. Jev a affiché une médiane de 0,35 seconde par passage, contre 8,83 secondes pour Claude Fable 5.1 en effort élevé : environ 25 fois plus rapide pour à peu près 1/580e du coût. Il a détecté six des sept défauts introduits. Claude Fable 5.1 les a tous détectés. Le verdict d'Every était « bon mais pas parfait », et c'est la lecture honnête en une ligne de Jev à partir du seul test indépendant publié à ce jour — les affirmations sur la vitesse et le coût résistent au contact d'un tiers, celle sur l'exactitude se situe un cran en dessous de la frontière, et l'échantillon est suffisamment petit pour que personne ne doive en tirer une conclusion de production.
Une remarque sur le type de preuves sur lesquelles cet article s’appuie, car les niveaux sont inhabituellement éloignés pour un modèle aussi récent. Jev est réel et appelable : il existe un point de terminaison documenté, un SDK Python, un alias de modèle et un tarif publié. Le lancement est annoncé par le fournisseur, et non issu d’une fuite, et personne ne se demande s’il existe. Mais chaque affirmation de performance que TypeSafe met en avant vient de TypeSafe elle-même, l’architecture n’est pas publiée, les poids ne sont pas disponibles, et le tableau de bord de benchmarks derrière le chiffre phare de 20-200x est un ensemble d’évaluations internes de flux de travail plutôt qu’un classement public. Un acteur externe l’a testé. Cet article garde les chiffres du fournisseur, les chiffres indépendants et les questions ouvertes visiblement séparés plutôt que de les fondre dans une moyenne qui créerait un consensus inexistant.
Ce que TypeSafe a réellement livré
Jev est le premier de ce que TypeSafe appelle les modèles System One — un nom emprunté à la moitié rapide et intuitive de la cognition de Daniel Kahneman, par opposition au mode délibératif plus lent que les chatbots imitent. Le contraste que TypeSafe établit est avec le schéma standard consistant à forcer un générateur de texte à émettre une sortie structurée, puis à analyser ce texte pour en faire quelque chose en quoi le code peut avoir confiance. Jev saute complètement le texte. La documentation de TypeSafe elle-même énonce le cas sans détour : « Les grands modèles de langage (LLM) sont conçus pour produire du texte destiné à être lu par des humains. Lorsque vous avez besoin qu'un modèle porte un jugement que votre code consommera, cela crée une inadéquation. »
La surface de sortie est composée de trois primitives, et il n’y a rien d’autre. Chaque question que vous posez doit être l’une d’entre elles :
• Choix — sélectionnez une option dans une liste que vous fournissez, en renvoyant l'option sélectionnée ainsi qu'une probabilité pour chaque candidat et un niveau de confiance. Les options sont limitées à 255 par champ ; au-delà, TypeSafe documente un schéma en deux étapes consistant à évaluer les candidats indépendamment, puis à choisir.
• Score — placez l’état sur une grille d’évaluation ordonnée, en renvoyant le niveau, une probabilité par niveau et un indice de confiance. Le risque d’attrition sur une échelle de 0 à 1 est l’exemple dans la documentation.
• Noul — un mot-valise formé de « no » et « null » — une affirmation unique de type oui/non, qui renvoie la probabilité calibrée qu’elle soit vraie.

La propriété intéressante n’est pas telle ou telle primitive, mais la manière dont elles se composent. Les trois peuvent être combinées dans un seul appel d’API, et chaque question est évaluée en parallèle sur la base d’une même lecture partagée du même état. La documentation de TypeSafe indique que l’ajout de questions « ne change presque pas le temps de réponse », et le test indépendant le confirme en pratique — 21 questions réparties sur 37 documents ont tenu dans les mêmes 0,7 seconde. C’est ce qui fait s’effondrer le coût par jugement : vous ne payez pas pour une génération plus longue, vous payez pour une seule passe.
L'enveloppe pratique, telle que documentée et rapportée par les premiers utilisateurs : un budget de requête d'environ 32 000 jetons, décrit dans la documentation de TypeSafe comme environ 150 000 caractères anglais ; aucune entrée d'image ou d'audio au lancement ; et une structure de requête et de réponse qui n'est pas la convention chat-completions d'OpenAI, si bien que pour l'appeler il faut un client sur mesure plutôt qu'un simple changement d'URL de base. L'accès se fait via une liste d'attente d'accès anticipé et un environnement de test dans le navigateur, avec code>jev-latest/code> comme alias du modèle.
RLCD signifie calibré, non préféré
TypeSafe entraîne Jev avec une méthode qu'elle appelle RLCD — Reinforcement Learning for Calibrated Decisions, d'après la documentation de l'entreprise elle-même. L'acronyme est suffisamment récent pour que les premières couvertures l'aient développé de manière incohérente, il vaut donc la peine de préciser ce qu'il désigne réellement, car toute l'affirmation de recherche tient à cette distinction.
RLHF optimise pour une sortie préférée par les humains. RLVR optimise pour l'exactitude vérifiable, le genre qui passe les cas de test. RLCD optimise pour la calibration : un modèle qui dit être confiant à 70 % devrait avoir raison environ 70 % du temps. C'est une cible différente du fait d'avoir raison, et c'est la raison pour laquelle chaque réponse de Jev est livrée avec une distribution de probabilités jointe plutôt qu'avec une simple réponse. Le mode de défaillance prévu est un modèle qui sait quand il ne sait pas, afin que votre code puisse décider quoi faire à ce sujet.
Ce que cela vous apporte en pratique, c'est une surface de contrôle. Le modèle documenté est constitué de trois bandes de confiance — agir automatiquement en haut, signaler ou confirmer au milieu, acheminer vers un humain en bas — avec les seuils définis dans votre code plutôt que dans le modèle. Savoir si ces bandes sont honnêtes est une question empirique concernant vos données, et c'est une question à laquelle TypeSafe vous dit explicitement de répondre vous-même, en notant que les seuils de confiance sont spécifiques à chaque cas d'usage et doivent être testés sur vos propres exemples étiquetés. Cette instruction est la phrase la plus importante de la documentation, et la raison pour laquelle la section suivante existe.
Les chiffres, triés selon qui les a produits
C’est ici que la plupart des analyses de Jev deviennent floues, il vaut donc la peine d’être explicite sur la provenance. Voici ce qui vient du fournisseur, ce qui vient d’un testeur indépendant, et ce qui est tout simplement inconnu.
• Rapporté par le fournisseur, non reproduit — les principales allégations de vitesse et de coût. Une latence de bout en bout de 70-500 ms contre 3-329 secondes pour les appels aux LLM de pointe ; 20 à 200 fois plus rapide et 40 à 400 fois moins cher ; un résultat de workflow unique dans le meilleur des cas annoncé comme 193,6 fois plus rapide et 444,6 fois moins cher. TypeSafe reconnaît qu'il s'agit de chiffres correspondant au meilleur des cas, et non de chiffres universels.
• Signalé par le fournisseur, et vérifiable sur la grille tarifaire — 0,042 $ par million de tokens d'entrée, soit 42 $ par milliard, la sortie étant gratuite. La raison pour laquelle la sortie est gratuite est mécanique plutôt que promotionnelle : il n'y a pas de décodage autorégressif à mesurer, donc aucun token de sortie à facturer. Pour donner un ordre de grandeur, les mêmes documents de lancement situent la tarification d'entrée typique des modèles de pointe entre 0,20 $ et 10 $ par million, la sortie représentant souvent environ cinq fois le prix de l'entrée.
Rapporté par le fournisseur, à partir d’un benchmark interne — le tableau de bord de workflow propre à TypeSafe, 711 cas répartis sur quatre tâches, avec des réponses de référence issues de la moyenne des jugements de GPT-6 Astra et de Claude Fable 5.1 plutôt que de la vérité terrain. Sur ce tableau de bord, Jev obtient 67,8 % en agrégé, contre 74,1 % pour le meilleur comparateur. En détail : incidents de sécurité 61,7 % contre 66,2 % pour Opus 5 ; observabilité des traces d’agents 71,6 % contre 76,6 % ; traitement des factures 61,8 % contre 79,1 % ; service client 76,0 % contre 78,3 %. Jev remporte les colonnes coût et latence de ce graphique et perd celle de l’exactitude. Le tableau de bord lui-même signale un éventuel biais du harnais, et TypeSafe a déclaré avoir délibérément évité les classements publics au profit d’évaluations ponctuelles liées aux mises à jour produit.
• Mesuré indépendamment, petit échantillon — les tests d'Every décrits ci-dessus : 777 jugements en moins de 0,7 seconde pour environ un quart de centime ; 1 709 jugements répartis sur 11 expériences pour moins d'un centime au total ; environ 25 fois plus rapide et 1/580e du coût de Claude Fable 5.1 sur une tâche de classification à 12 passages, tout en manquant l'un des sept défauts introduits que le comparateur avait détectés. La conclusion d'Every elle-même était qu'une vérification de l'exactitude bien plus approfondie serait souhaitable avant une mise en production.
• Inconnu — l’architecture. Aucun article au lancement, aucun nombre de paramètres, aucune divulgation sur la puissance de calcul d’entraînement, aucun poids. TypeSafe a déclaré que les détails étaient gardés « au secret pour l’instant », une publication étant éventuellement prévue plus tard.

Le schéma qui traverse ces paliers est cohérent, et ce n’est pas le schéma que suggère le titre 200x. Tous les chiffres, indépendants comme ceux des fournisseurs, concordent : Jev est radicalement moins cher et radicalement plus rapide. Aucun chiffre, où que ce soit, y compris ceux de TypeSafe lui-même, ne montre qu’il est plus précis que les modèles de frontière avec lesquels il est mis en concurrence sur le prix. Sur le tableau de bord du fournisseur lui-même, il se situe autour du niveau d’un bon modèle de milieu de gamme. La comparaison qui tient n’est pas « aussi intelligent qu’un modèle de frontière pour un centième du prix » — c’est « proche du jugement d’un modèle de milieu de gamme pour une fraction de cent par appel, assez rapide pour être exécuté à chaque tour. »
Ce que « zéro hallucination » signifie et ne signifie pas
Les supports de lancement de TypeSafe comprennent un graphique montrant un taux d’erreur d’appel d’outil de 0 % pour Jev, contre un taux non nul pour les modèles de comparaison, et l’expression « résistant aux hallucinations » accompagne le modèle. Les deux sont vrais, et tous deux sont plus restrictifs que ce qu’ils laissent entendre.
La garantie est structurelle. Chaque réponse possible est énumérée avant l'exécution du modèle — vous avez fourni la liste de choix, la grille d'évaluation ou l'affirmation vrai/faux — il n'y a donc aucun espace pour émettre une valeur en dehors du type déclaré. Un appel d'outil malformé n'est pas une chose que Jev peut produire. C'est une véritable propriété d'ingénierie, et pour quiconque a passé une semaine à écrire de la logique de réessai autour d'échecs d'analyse JSON, cela vaut de l'argent réel.
Il ne s'agit pas d'une affirmation sur le fait d'avoir raison. Une réponse valide selon le schéma peut tout de même être fausse : Jev peut avec assurance router une réclamation de facturation vers la file technique, et la sortie sera parfaitement bien formée tout en étant inutile. Almeida l'a dit lui-même, reconnaissant qu'il est possible d'avoir tort avec assurance. La façon utile de tenir les deux faits ensemble est que Jev élimine la classe d'erreurs qui provient du formatage de la sortie, et ne fait rien du tout pour la classe qui provient du jugement. Ce qui signifie que la question de l'exactitude est entièrement une question de calibration, et la calibration est exactement ce que vous devez mesurer vous-même.
Comment tester l’affirmation de calibration sur vos propres données
La calibration est l'une des rares propriétés de modèle que l'on peut vérifier correctement avec quelques centaines d'exemples et sans infrastructure ML, et c'est le seul test qui compte avant que Jev ne touche à un chemin de production. La procédure est courte.
Prenez quelques centaines de cas pour lesquels vous avez déjà des étiquettes. Posez à Jev la question qui compte — la décision de routage, le score de risque, le contrôle de défaut — et classez les réponses selon la confiance rapportée. Vérifiez ensuite si le compartiment de confiance 0,9 a raison environ 90 % du temps, celui de 0,7 environ 70 %, et ainsi de suite. Un modèle bien calibré trace une ligne diagonale. Un modèle qui est simplement confiant regroupe tout au-dessus de 0,9 et a raison 70 % du temps, et c’est cette forme qui casse discrètement un pipeline automatisé.
Le même test vous indique quels seuils utiliser. Si le segment 0,9 est vraiment précis à 90 % sur vos données, vous pouvez l’automatiser. Si votre bande intermédiaire est floue, vous la dirigez vers un humain ou vous la confiez à un modèle génératif, et vous laissez le chemin coûteux gérer l’ambiguïté. Cette séparation — un modèle bon marché sur la majorité confiante, un modèle coûteux sur le reste incertain — est précisément l’architecture que Jev défend, et c’est la raison pour laquelle il est préférable de comprendre le modèle comme un composant plutôt que comme un remplacement.
Ce que cela coûte, calculé en détail
La tarification est assez simple à comprendre, ce qui est rare. L’entrée coûte 0,042 $ par million de jetons. La sortie est gratuite. Avec le budget de requêtes documenté d’environ 150 000 caractères, un seul appel de taille maximale coûte bien moins d’un centime.
Deux chiffres rapportés donnent une idée de l’échelle. Un utilisateur précoce a effectué environ 5 000 requêtes pour à peu près 2 $. La démonstration Doom — Jev pilotant un bot à l’aide d’une description textuelle de l’état du jeu plutôt que des pixels bruts — tournait à environ 10 appels par seconde pour environ 7 $ de l’heure. Et les 777 jugements d’Every sur 37 documents sont revenus à environ un quart de cent, ce qui est le chiffre qui rend lisible le cas d’usage intéressant : à ce prix, vérifier chaque tour d’une boucle d’agent cesse d’être une décision de coût pour devenir un choix par défaut.
Voilà le véritable argument en faveur de Jev. Une passe de vérification à chaque tour — cet appel d’outil contredisait-il le précédent, cette sortie est-elle cohérente avec l’intention déclarée de l’utilisateur, cela devrait-il déclencher une alerte — a toujours été techniquement possible avec un modèle de pointe et économiquement absurde à l’échelle. À 0,042 $ par million de tokens, sans frais de sortie, la même passe devient abordable à chaque tour. La valeur ici n’est pas que Jev pense mieux qu’un modèle de pointe, car ce n’est pas le cas. La valeur est qu’il pense assez bon marché et assez vite pour être consulté en permanence.
Il faut le dire clairement, car c’est la question suivante évidente : OrcaRouter ne sert pas Jev. Le modèle de TypeSafe est en accès anticipé, sur liste d’attente, et utilise sa propre forme de requête, donc toute personne qui le teste passe directement par TypeSafe. Là où une couche de routage trouve sa place, c’est dans l’autre moitié du flux de travail. Le schéma pour lequel Jev est conçu repose sur deux modèles, pas un seul — Jev prend la décision typée, et un modèle génératif gère la partie qui nécessite de la prose, du code ou une explication. Cette moitié générative est celle que couvre OrcaRouter : 197 modèles chez 15 fournisseursderrière une seule clé compatible OpenAI, au prix catalogue du fournisseur répercuté avec 0 % de marge, de sorte qu’une baisse de prix d’un fournisseur arrive de notre côté le jour même de sa sortie. Les deux moitiés d’un flux de travail de type Jev sont testables sans second contrat, et lorsque le composant de décision n’est pas prouvé, le chemin de bascule est ce qui empêche un mauvais résultat de calibration de devenir un incident de production.

Là où Jev ne convient pas
Les limitations sont énoncées avec une clarté inhabituelle par le fournisseur, ce qui rend cette section facile à rédiger honnêtement. Jev ne peut pas générer de texte libre. Il ne peut pas écrire de code. Il ne peut pas tenir une conversation. Il n’a pas d’interface de chat, pas d’entrée d’image, et un budget de contexte d’environ 32 000 tokens — un ordre de grandeur en dessous des modèles à contexte long auxquels il est comparé sur le prix. Les champs de choix sont limités à 255 options. Et la propriété « aucune hallucination », comme ci-dessus, concerne le format de sortie plutôt que la vérité.
Le réseau a un champ d'application assez étroit. Bon : classification et routage à grand volume, passes de garde-fou et de vérification, décisions critiques en latence, notation de grands ensembles de documents en parallèle, partout où la bonne réponse est véritablement un choix, un nombre sur une échelle ou un booléen. Mauvais : génération ouverte de toute sorte, raisonnement à long contexte, dialogue multi-tours, ou toute tâche dont la bonne réponse est une phrase. Si votre problème ne se réduit pas à une question typée, Jev n'est pas un moyen moins coûteux de le résoudre — ce n'est pas du tout un moyen de le résoudre.
Il y a aussi une critique juste de ce cadrage qu'il vaut la peine de conserver. Qualifier Jev de modèle de pointe emprunte une crédibilité que le modèle n'a pas gagnée : il ne sait ni coder, ni converser, ni écrire une phrase, et les graphiques comparatifs s'appuient sur des modèles de pointe comme référence, tandis que la colonne d'exactitude raconte une tout autre histoire. L'affirmation la plus défendable, et celle que les preuves étayent réellement, est que TypeSafe a repoussé très loin la frontière de la vitesse et du coût pour les décisions structurées. C'est une chose considérable que d'avoir fait cela. C'est tout autre chose que de construire un modèle qui rivalise avec GPT-6 Astra ou Claude Fable 5.1.
Qu’est-ce qui changerait cette image ?
Trois choses, dans l’ordre approximatif de l’importance qu’elles auraient.
• Un article d’architecture publié ou des poids ouverts. Tout ce qui concerne la façon dont Jev atteint sa vitesse est actuellement une boîte noire, et l’affirmation selon laquelle l’évaluation parallèle est le mécanisme — l’analogie qu’Almeida établit consiste à remplacer le calcul séquentiel de la même manière que les transformers ont remplacé les réseaux récurrents — est une assertion plutôt qu’un résultat démontré. Tant que la conception n’est pas publiée, la vitesse est un fait et l’explication est du marketing.
• Une deuxième évaluation indépendante sur un échantillon plus large. Les tests d'Every constituent les preuves les plus solides disponibles et couvrent 12 passages sur la question décisive de l'exactitude. Une nouvelle exécution indépendante, sur quelques centaines de cas étiquetés, permettrait de déterminer si le fait de manquer un défaut sur sept relevait du bruit ou correspondait au taux d'erreur réel.
• Un audit de calibration sur des entrées réalistes et désordonnées. Tout ce qui a été publié jusqu’ici utilise des harnais de test propres. La question ouverte, pour un modèle dont toute la proposition de valeur repose sur des scores de confiance fiables, est de savoir ce que ces scores donnent sur les cas réellement ambigus — ceux où un évaluateur humain hésiterait lui aussi. C’est le chiffre qui détermine si l’on peut automatiser en s’appuyant sur Jev en toute sécurité, et personne ne l’a publié.
D'ici là, la posture raisonnable est spécifique plutôt que générale. Jev est un modèle réel, livré, exceptionnellement bon marché, avec un véritable avantage structurel en matière de fiabilité des sorties, un profil de précision qui se situe dans la moyenne intermédiaire, et une affirmation de calibration qui est plausible, explicitement recommandée pour l'auto-test par son propre fournisseur, et validée indépendamment uniquement sur un petit échantillon. Si votre flux de travail comporte une étape qui se résume à une question saisie posée assez souvent pour qu'un modèle de pointe soit un gaspillage, c'est l'une des façons les moins coûteuses de la poser — et la valeur de confiance qu'il renvoie est ce qu'il faut tester avant de vous y fier, pas la vitesse.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
