
Pokee-Isaac 28B : 10 millions de tokens de contexte, et une architecture que Pokee ne décrira pas.
- metaNOUVEAUMeta: Muse Spark 1.22026-08-0557Intelligence72Code
- qwenNOUVEAUQwen: Qwen3.8 Max2026-08-0358Intelligence72Code
- deepseekNOUVEAUDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligence69Code
- minimaxNOUVEAUMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligence69Code
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligence49Code
- metaMeta: Muse Spark 1.12026-07-1653Intelligence71Code
- kimiMoonshotAI: Kimi K32026-07-1560Intelligence76Code
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligence71Code
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligence77Code
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligence77Code
- grokxAI: Grok 4.52026-07-0856Intelligence72Code
- tencentTencent: Hy32026-07-0642Intelligence59Code
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligence42Code
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligence39Code
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligence72Code
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligence52Code57Maths
Il y a une colonne dans la comparaison de lancement de Pokee-Isaac 28B où cinq des six modèles obtiennent 0,0, et la note de bas de page en dessous est plus intéressante que le chiffre au-dessus. Avec une longueur de contexte de 10 millions de jetons, le nouveau modèle 28B de Pokee AI obtient 93,3 sur RULER et chaque référence contre laquelle il a été mesuré — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — ne renvoie rien d'utilisable. La note de bas de page explique que trois de ces cinq modèles ne peuvent tout simplement pas être achetés avec une longueur de contexte supérieure à 262K. Le score est donc réel, et la salle est vide. Ce sont deux affirmations différentes, et la plupart des articles publiés depuis l'apparition du modèle le 5 août 2026 les ont confondues.
Ce n’est pas une raison pour écarter ce que Pokee a livré. C’est une raison pour être précis sur les parties qui sont démontrées, celles qui sont simplement incontestées, et celles qui ne sont tout simplement pas décrites. Tout ce qui suit provient de quatre sources primaires : la page du modèle Pokee-Isaac sur la console propre de Pokee, la documentation développeur de Pokee, la fiche de revente du modèle sur NanoGPT, et les déclarations de lancement de Pokee AI et du fondateur Zheqing (Bill) Zhu. Chaque chiffre de référence dans cet article a été produit par Pokee AI. Pokee le dit clairement — la console indique que chaque chiffre « a été mesuré par Pokee AI dans un environnement contrôlé unique, pour Isaac comme pour chaque référence, sauf indication contraire » — et à leur crédit, cela signifie que les références ont été réexécutées plutôt que copiées depuis les annonces d’autres fournisseurs. Cela signifie aussi qu’aucun laboratoire indépendant n’a reproduit quoi que ce soit, et qu’à ce jour aucun n’a publié de tentative.
Ce que Pokee a réellement livré
La surface publique du modèle est exceptionnellement bien documentée pour un lancement aussi récent, il vaut donc la peine de la présenter avant d'aborder les parties contestées.
• Modèle — Pokee-Isaac 28B, versionné v0, servi sous pokee-isaac depuis api.pokee.ai derrière un point de terminaison compatible.
• Taille et contexte — 28 milliards de paramètres pour une fenêtre d’entrée de 10 000 000 de jetons ; Pokee le décrit comme « utilisable de bout en bout, pas seulement adressable ».
• Sortie — 60 000 jetons, ce qui est à la fois la valeur par défaut et le plafond absolu.
• Modalités — texte en entrée, texte en sortie. Les entrées image, audio et vidéo ne sont pas prises en charge, ce qui mérite d'être noté étant donné ce à partir de quoi le modèle est construit.
• Prix — 0,15 $ par million de tokens d'entrée et 1,00 $ par million de tokens de sortie, sur la propre liste de Pokee.
• Fonctionnalités agentiques — l'appel de fonctions et la sortie structurée dans le schéma standard de chat-completions ; le modèle est positionné comme un agent qui planifie, exécute et révise, plutôt que comme un modèle de chat.
• Limites de requête — une limite de corps de requête de 45 MiB, toute requête dépassant 16 MiB devant utiliser le streaming SSE (stream: true plus un en-tête Accept: text/event-stream).
• Limites de débit — 500 requêtes et 20 millions de jetons par minute, avec 10 requêtes simultanées sur les comptes gratuits et 25 sur les comptes payants.
• Déploiement — datacenter B200, postes de travail RTX 4090/5090, cartes clientes Intel Arc Pro, NPU de périphérie (Qualcomm et Intel Panther Lake, avec AMD indiqué comme en attente), et sur l'appareil, avec des licences VPC et sur site selon lesquelles, pour citer Pokee, « aucune requête ne quitte votre périmètre. »
• Stacks de service — prise en charge dès le premier jour dans vLLM et SGLang.
• Entreprise — Pokee AI, fondée en 2024 par Zheqing (Bill) Zhu, anciennement responsable de l'apprentissage par renforcement appliqué chez Meta ; cycle d'amorçage de 12 M$ mené par Point72 Ventures avec Qualcomm Ventures et Samsung NEXT.
Les poids sont fermés. La couverture médiatique a décrit le modèle comme étant à code source fermé « pour le moment », ce qui est la propre réserve de Pokee plutôt qu'un engagement, et aucune date ni licence de sortie n'a été annoncée.

L'architecture que personne ne décrira
Pokee attribue la fenêtre de 10M de jetons à une « architecture propriétaire non exclusivement à décodeur ». Cette phrase constitue l'intégralité de la divulgation technique. La console renvoie à un rapport technique intitulé Pokee-Isaac 28B v0 : un modèle agentique efficace pour un contexte de 10M de jetons, daté du 3 août 2026 ; nous n'avons pas pu obtenir de copie publique de celui-ci, et les supports de lancement accessibles ne mentionnent ni le mécanisme d'attention, ni le schéma de mémoire, ni la recette d'entraînement.
Ce que Pokee a dit à propos de la lignée est plus spécifique, et c’est une formulation légèrement délicate : certains des poids d’Isaac sont affinés à partir de Qwen3.6-27B sous sa licence Apache-2.0, d’autres poids ont été entraînés de zéro par Pokee, et le résultat « n’est pas un affinage conventionnel ». C’est une phrase prudente. Elle concède la base et nie la caractérisation à la fois.
Cela suffit aussi pour contraindre les suppositions, ce que la communauté de recherche en IA s'est immédiatement mise à faire. Le chercheur qui publie sous le nom de @teortaxesTex a exposé l'ensemble de contraintes le jour du lancement — partiellement affiné à partir de Qwen3.6-27B, non exclusivement décodeur, contexte de 10M, 28B au total — et a proposé deux candidats : « une sorte de Memory Sparse Attention améliorée » ou « juste un encodeur de documents de 1B ». Ces deux suppositions méritent d'être comprises, car elles ne sont pas anodines.
Commençons par l'arithmétique. Qwen3.6-27B est un modèle dense de 27B avec une fenêtre native de 262K, une attention hybride gated-delta, et un encodeur visuel qui peut être désactivé pour exécuter le modèle en mode texte uniquement. Isaac est un modèle de 28B, texte uniquement. Si vous retirez la tour de vision du modèle de base et ajoutez environ un milliard de paramètres d'autre chose, vous atterrissez précisément à 28B. Un encodeur de documents ou de mémoire d'environ 1B fixé sur un décodeur de 27B est la lecture la plus parcimonieuse du nombre de paramètres publié par Pokee, et cela rendrait l'étiquette « non décodeur uniquement » littéralement vraie sans constituer une affirmation nouvelle.
L'hypothèse Memory Sparse Attention pointe vers une ligne de travail réelle et récente : l'article MSA (arXiv:2603.23516) combine une attention sparse scalable avec une RoPE par document pour obtenir une complexité linéaire en entraînement et en inférence, ajoute une compression du cache KV ainsi qu'un schéma « Memory Parallel », et rapporte moins de 9 % de dégradation de 16K jusqu'à 100M de jetons, avec une inférence à 100M de jetons fonctionnant sur deux A800. C'est la même forme de résultat que Pokee revendique, un ordre de grandeur plus loin, provenant d'un groupe différent. Rien ne relie les deux au-delà de la forme — MSA n'est pas le travail de Pokee et Pokee ne l'a pas cité — mais cela établit qu'une conception à mémoire découplée atteignant ces longueurs sur du matériel modeste est une chose publiée et plausible, plutôt qu'une impossibilité marketing.
Il y a un nombre dans les propres documents de Pokee qui soutient discrètement la lecture de l'encodeur séparé. Le débit de préremplissage sur un seul B200 est de 42 400 tokens/seconde avec un contexte de 1M de tokens et de 137 200 tokens/seconde à 10M. Le débit augmente de plus du triple lorsque le contexte devient dix fois plus long. Un décodeur qui paie des coûts d'attention quadratiques fait le contraire. Ce qui consomme ces tokens devient plus efficace par token à mesure qu'on en ajoute, ce qui est la signature d'un passage d'encodage en masse sur des documents plutôt qu'un préremplissage ordinaire.
Pourquoi cela compte pour quiconque décide d'utiliser le modèle : si la fenêtre de 10M est un encodeur de documents plus une mémoire compressée plutôt qu'un cache KV à 10M d'entrées, alors le « contexte » n'est pas ici l'objet autour duquel vos intuitions sont construites. La manière dont le modèle se comporte lorsque vous ajoutez un message à une conversation, modifiez un document au milieu d'un corpus ou vous attendez à ce que la mise en cache de préfixes fonctionne n'est pas spécifiée, et la documentation de Pokee ne mentionne aucun mécanisme de mise en cache. Vous ne pouvez pas raisonner sur ces comportements à partir de la fiche technique, et vous ne le pouvez pas non plus, à l'heure actuelle, à partir de l'architecture.
RULER à 10M est un nombre réel dans une pièce vide.
Les preuves de long-contexte de Pokee proviennent de RULER, exécuté à 256K, 512K, 1M, 2M, 4M et 10M, avec dix échantillons par configuration. Isaac obtient des scores de 96,9, 96,7, 95,0, 95,8, 96,7 et 93,3 sur ces six longueurs — le seul modèle du panel à obtenir un score pour chacune d'elles.
Le panneau sous 1M est là où se trouve la lecture honnête :
• À 256K — Isaac 96,9, Nemotron 3 Super 120B 96,3, GPT-5.6 Luna 95,0, Gemini 3.5 Flash Lite 94,5, et 0,0 pour Claude Haiku 4.5 et Qwen 3.5 122B, dont les fenêtres de contexte s’arrêtent en dessous de cette longueur.
• À 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.
• À 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4, et GPT-5.6 Luna 0.0, ces deux derniers étant signalés comme des erreurs de dépassement de contexte.
• À 2M et au-delà — Isaac seul, tout le reste 0.0.
Trois choses s'ensuivent. Premièrement, jusqu'à 1M, la marge d'Isaac sur le reste du groupe est d'un point ou deux, pas d'une génération — et la seule référence qui reste proche, Nemotron 3 Super 120B, est un modèle de 120B dont les chiffres de 256K à 1M sont ceux que NVIDIA rapporte elle-même, que Pokee signale et exclut de la comparaison de lignes plutôt que de les faire passer pour mesurés. Ainsi, le concurrent le plus proche à ces longueurs n'est pas en réalité une mesure comparable, dans un sens comme dans l'autre.
Deuxièmement, au moins l'une des cases vides ressemble à un artefact de déploiement plutôt qu'à une limite du modèle. Pokee a exécuté GPT-5.6 Luna via Azure et a annoté sa fenêtre comme « >272K de contexte », enregistrant une erreur de dépassement de contexte à 1M. La fenêtre documentée par le fournisseur lui-même pour ce modèle est d'environ 1,05M de tokens, ce que notre propre page dédiée à ce modèle rapporte également. Un lecteur qui prend la colonne 1M au pied de la lettre conclurait que Luna ne peut pas gérer 1M ; la conclusion la plus défendable est que le déploiement Azure testé par Pokee ne le pouvait pas.
Troisièmement, RULER est une suite synthétique de récupération et d'agrégation, et non un benchmark de raisonnement. Pokee est également transparent sur un détail méthodologique ici : les colonnes 256K et 512K font la moyenne des 13 configurations de tâches, mais l'extraction de mots courants n'est pas disponible à partir de 1M, donc les colonnes longues font la moyenne des 12 restantes. Les 93.3 à 10M et les 96.9 à 256K ne sont donc pas évalués sur exactement le même mélange de tâches.
Le test de contexte long plus difficile s'arrête à 1M.
Le benchmark le plus révélateur sur la page de Pokee n'est pas RULER. C'est MRCR v2, une tâche de coréférence multi-tours à 8 aiguilles où plusieurs cibles sont dispersées dans une longue conversation et le modèle doit retrouver et désambiguïser celle qui est spécifiée, de sorte qu'un rappel partiel et une interférence entre les aiguilles vous coûtent tous les deux. Sur une échelle de 0 à 1, à 1M de jetons :
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5 et Qwen 3.5 122B — 0,000, rien d’utilisable à cette longueur
C'est un écart bien plus large et bien plus crédible que celui que produit RULER, et c'est là que l'argument du modèle se concrétise véritablement. Luna obtient 95,0 sur RULER à 256K et 0,050 sur MRCR à 1M ; le rappel à cible unique et la désambiguïsation multi-aiguilles ne sont pas la même compétence, et la seconde s'effondre en premier. Isaac se dégrade beaucoup plus gracieusement.
C'est aussi la plus grande lacune probante du lancement. MRCR v2 a été exécuté à 256K, 512K et 1M — puis arrêté. Les scores d'Isaac lui-même y sont de 0,607, 0,743 et 0,500 : non monotones, et à 1M, il récupère la moitié des aiguilles. Il n'existe aucun résultat multi-aiguilles publié à 2M, 4M ou 10M, de la part de quiconque, y compris Pokee. L'affirmation concernant 10M repose entièrement sur le plus facile des deux tests, précisément aux longueurs où le test plus difficile n'a pas été tenté. Si vous envisagez ce modèle parce que vous voulez mettre un corpus de 25 000 pages dans une seule invite et poser une question dont la réponse est assemblée à partir de quatre endroits de ce corpus, cette capacité précise n'est pas mesurée à cette longueur précise.

En matière de travail agentique, Isaac est l'égal de Luna, pas son supérieur.
Pokee a exécuté quatre benchmarks agentiques, et c'est là que la franchise de l'entreprise est vraiment inhabituelle : sa propre page résume le résultat en indiquant qu'Isaac arrive en tête sur deux, deuxième sur un, et troisième sur un. C'est une description exacte, et ce n'est pas celle de la couverture de lancement.
• BFCL v4, appel de fonction (évalué par appariement d'AST et de transitions d'état plutôt que par un juge LLM) — Isaac 70.94 contre GPT-5.6 Luna 70.61, avec Claude Haiku 4.5 à 67.52, Qwen 3.5 122B à 64.88, Gemini 3.5 Flash Lite à 64.85, Nemotron 3 Super à 33.13.
• τ³-bench, moyenne sur quatre domaines (tâches de service client multi-tours face à un utilisateur simulé dont les exigences changent en cours de conversation) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.
• Terminal-Bench 2.1, sous-ensemble texte uniquement — GPT-5.6 Luna 69,8 % contre Isaac 65,1 %, puis Gemini 3.5 Flash Lite et Qwen 3.5 122B à égalité à 46,5 %, Claude Haiku 4.5 34,9 %, Nemotron 24,4 %.
• MCP-Atlas, revendique une couverture sur les serveurs d'outils en direct — GPT-5.6 Luna 77,90 %, Gemini 3.5 Flash Lite 76,67 %, Isaac 74,59 %, Qwen 3.5 122B 70,24 %, Claude Haiku 4.5 56,45 %, Nemotron 48,95 %.
Une marge de 0,33 point sur BFCL v4 équivaut à une parité, et la page de Pokee le dit clairement plutôt que de l'appeler une victoire. En considérant les quatre benchmarks, un modèle 28B se partage les victoires avec le niveau rapide d'un fournisseur de pointe sur les tâches agentiques. Pour un modèle 28B, c'est un résultat solide. Ce n'est pas le résultat que « modèle agentique de classe frontière » implique pour la plupart des lecteurs, et cela signifie que la raison de choisir Isaac est la fenêtre de contexte et l'enveloppe de déploiement, pas l'agentivité.
Le numéro de sécurité est le meilleur du panneau et n'est toujours pas bon.
Sur DTAP, une suite d'injection de prompts, Isaac affiche le taux de réussite d'attaque le plus bas du panel, à 35,6 combiné, devant Claude Haiku 4.5 à 37,9, GPT-5.6 Luna à 50,1, Qwen 3.5 122B à 54,0, Nemotron à 60,4 et Gemini 3.5 Flash Lite à 66,3. Les taux directs et indirects diffèrent de moins d'un point, la robustesse est donc au moins homogène sur les deux vecteurs.
Trois réserves, toutes issues des propres rapports de Pokee plutôt que de critiques. Les mesures indirectes ont été prises avec les garde-fous inactifs. Les refus explicites ne se sont déclenchés que sur 1,5 % des tâches malveillantes, ce que Pokee décrit comme l'essentiel de la défense actuelle étant « fortuite plutôt que refusée » — le modèle ne reconnaît pas et ne rejette pas les attaques, mais échoue plutôt à se laisser utilement orienter par elles. Et face à un classement plus large de 16 systèmes, plutôt que ce panel de six modèles, Isaac se classe cinquième aux attaques directes, sixième aux attaques indirectes et neuvième en capacité : milieu de tableau, pas en tête.
Il y a aussi un coût à la sécurité. Le taux de réussite bénin d'Isaac est de 82,5, inférieur aux 85,1 de GPT-5.6 Luna — il refuse ou bâcle légèrement plus de travail légitime que le modèle qu'il bat sur les attaques. Et 35,6 signifie qu'environ une tentative d'injection sur trois aboutit encore. Pour un modèle dont toute la prémisse est de lire dix millions de jetons de documents que vous n'avez pas écrits, c'est ce chiffre-là qui doit servir de base à la conception des garde-fous, pas celui qui rassure. DTAP lui-même mérite d'être signalé : contrairement à RULER, BFCL et τ³-bench, ce n'est pas un classement public établi, et nous n'avons trouvé aucune documentation indépendante de cette suite.
Ce que coûte un appel de dix millions de jetons, et combien de temps vous attendez.
Dix millions de jetons représentent environ 7,5 millions de mots, soit environ 25 000 pages. Au tarif de Pokee de 0,15 $ par million, remplir la fenêtre une fois coûte 1,50 $. Ajoutez une réponse de 60 000 jetons de longueur maximale à 1,00 $ par million, et un appel maximal revient à environ 1,56 $. C’est vraiment bon marché pour le volume de texte concerné, et c’est l’argument simple le plus fort en faveur du modèle.
Le temps est le vrai prix. Sur un seul B200, Pokee rapporte 72,9 secondes jusqu'au premier token à 10M — ce qui correspond exactement à 10 000 000 divisé par le chiffre de préremplissage de 137 200 tokens/seconde, il s'agit donc du chiffre du matériel de référence et non d'une latence API mesurée. La documentation développeur de Pokee raconte une histoire différente aux développeurs : prévoyez au moins un délai d'attente client de dix minutes pour les prompts de plusieurs millions de tokens, car un grand prompt peut prendre « environ sept minutes à 10 millions de tokens ». C'est un écart d'environ six fois entre la diapositive sur le débit et le guide d'intégration. Ce sont les deux chiffres de Pokee ; celui de la documentation est celui auquel votre configuration de délai d'attente doit se fier.
Le décodage est constant à environ 335 tokens/seconde, quelle que soit la quantité de contexte en mémoire, ce qui est une bonne nouvelle sur le plan architectural, mais une nouvelle embarrassante sur le plan pratique : une sortie complète de 60 000 tokens prend environ trois minutes, en plus du prefill. Sur du matériel grand public, le tableau change à nouveau — sur une Intel Arc Pro B70, Pokee rapporte 1 087–1 500 tokens/seconde en prefill (3,6–5× le llama.cpp standard) et 58,8 tokens/seconde en décodage. Ce sont des chiffres respectables pour un GPU client, et ce ne sont pas des chiffres de 10 millions de tokens.
Deux limites pratiques découlent de la taille de l'entrée elle-même. Dix millions de tokens d'anglais représentent environ 38 MiB de texte, ce qui tient sous la limite de 45 MiB pour le corps de requête mais se situe bien au-dessus du seuil de 16 MiB ; par conséquent, tout appel réellement en pleine fenêtre doit être diffusé en streaming — il n'existe pas de chemin non-streaming vers la fonctionnalité phare. Et sans mise en cache de prompt documentée sur l'API de Pokee, chaque nouvelle interrogation du même corpus coûte à nouveau 1,50 $ et un autre préremplissage de plusieurs minutes. La liste de revendeur sur NanoGPT publie bien un tarif de lecture en cache de 0,079 $ par million, ce qui, si cela s'applique à Isaac, rend une relecture en cache à environ 0,79 $ — environ moitié prix, et non la réduction d'un ordre de grandeur que la mise en cache de prompt implique ailleurs.
Une correction au comparatif de prix, car elle change le titre. Pokee tarifie GPT-5.6 Luna à 0,40 $/1,80 $ par million, provenant d'Azure. Le prix catalogue du fournisseur lui-même pour Luna après la baisse du 31 juillet 2026 est de 0,20 $/1,20 $ — c'est d'ailleurs ce qu'affiche notre page modèle, car OrcaRouter transmet les prix catalogue des fournisseurs avec une marge de 0 % plutôt que de les revendre en appliquant une marge. Par rapport au bon chiffre, Isaac est 25 % moins cher en entrée et 17 % moins cher en sortie que la catégorie des modèles frontières rapides — toujours moins cher, mais un avantage bien plus mince que ce que suggère le tableau, et le prix de sortie le plus bas du tableau, tous modèles confondus, revient à Nemotron 3 Super, à 0,65 $. L'avantage tarifaire d'Isaac est réel ; ce n'est simplement pas l'élément remarquable de ce lancement.

La partie qui est réellement nouvelle
Enlevez le cadre des benchmarks et il reste quelque chose d’inhabituel. Un modèle de 28B avec un très long contexte qui tourne dans un VPC, sur une station de travail RTX 4090, sur une carte Intel Arc Pro, et sur du silicium mobile de classe NPU, avec un support vLLM et SGLang dès le premier jour et une licence sur site — cette combinaison est presque introuvable ailleurs. Pokee revendique également une efficacité de cache KV environ 5 fois supérieure à celle des implémentations standard, ce qui est un chiffre de fournisseur sans reproduction, mais c’est le genre de chiffre qui devrait être vrai pour que le scénario de déploiement tienne.
Le client visé n'est pas quelqu'un qui cherche un meilleur agent. C'est quelqu'un qui possède un corpus volumineux, sensible et majoritairement statique — des ensembles de contrats, des dossiers d'affaires, une base de code monolithique, des mois de journaux — qui ne peut pas, légalement ou politiquement, franchir une frontière, et qui, autrement, construirait un pipeline de récupération pour contourner une fenêtre de 200K. Face à cette alternative, l'argument n'est pas « moins cher que le RAG ». L'embedding et la récupération de plus de 25 000 pages coûtent des centimes par requête et en coûteront toujours. L'argument est qu'il n'y a pas de stratégie de découpage à régler, pas de rappel de récupération à perdre, et pas de second système à maintenir synchronisé avec le premier. Que ce compromis vaille 1,50 $ et plusieurs minutes par requête dépend entièrement de la fréquence de vos requêtes.
Qui devrait l'essayer maintenant, et qui devrait attendre
Essayez-le maintenant si vous faites du prototypage sur un corpus dans la gamme 1M–4M, où les chiffres d'Isaac sont les plus solides et où les alternatives sont réellement limitées, ou si le déploiement sur site à 28B est l'exigence qui vous bloquait. Les dix requêtes simultanées du palier gratuit suffisent pour savoir si le modèle lit vos documents comme vous en avez besoin.
Attends : si tu as besoin spécifiquement du nombre 10M et que les questions posées sont multi-hop, car cette combinaison est précisément ce que personne n'a mesuré. Attends : si tu as besoin d'une entrée multimodale, ce que le modèle n'accepte pas. Attends : si la latence compte, puisqu'un appel en fenêtre complète prend des minutes, pas des secondes. Et pèse le risque de dépendance évident : c'est un modèle v0, aux poids fermés, d'une entreprise avec un seed round de 12 M$, et c'est le seul modèle au monde à offrir la capacité qu'il vend. Il n'y a pas de second fournisseur vers lequel basculer s'il disparaît.
Ce dernier point est la raison pratique de garder la comparaison honnête. Pokee-Isaac 28B n’est pas sur OrcaRouter aujourd’hui — si vous le voulez, c’est via l’API de Pokee ou un revendeur qu’on le trouve. Mais trois des cinq références auxquelles il se mesure, GPT-5.6 Luna, Gemini 3.5 Flash Lite et Claude Haiku 4.5, sont sur une seule clé OrcaRouter au prix catalogue du fournisseur, ce qui rend l’expérience utile peu coûteuse à mettre en place : exécutez votre tâche réelle de contexte long contre ces trois modèles aux longueurs qu’ils supportent, et voyez si votre corpus a vraiment besoin de dix millions de jetons ou s’il a besoin de 400 000 et d’un meilleur prompt. S’il a besoin de dix millions, vous avez appris quelque chose qui vaut 1,50 $ par appel. Sinon, vous avez évité de construire un chemin de production sur un v0 mono-source.
Trois questions qui méritent une réponse
Pokee-Isaac 28B est-il juste un fine-tuning ?
Pas selon un usage normal de l'expression, bien que cela ne soit pas non plus indépendant de cette base. La position de Pokee est que certains poids sont affinés à partir de Qwen3.6-27B sous licence Apache-2.0, tandis que d'autres ont été entraînés de zéro, et que l'architecture n'est pas à décodeur uniquement. Ces deux volets sont cohérents avec le nombre de paramètres : Qwen3.6-27B est un modèle dense de 27B avec un encodeur de vision contournable, Isaac fait 28B et est limité au texte, si bien qu'environ un milliard de paramètres de nouveaux mécanismes a remplacé la tour de vision. Ce que sont ces mécanismes n'a pas été divulgué, et tant que ce ne sera pas le cas, « pas un affinage conventionnel » est une affirmation qui repose sur la parole de Pokee plutôt que sur quelque chose de vérifiable. La licence Apache-2.0 sur la base rend la dérivation légale ; elle ne rend pas la publication fermée du résultat inhabituelle, ce qui vaut surtout d'être noté parce qu'une lignée aussi spécifique est rarement révélée volontairement.
Peut-il vraiment faire tourner 10 millions de jetons sur une RTX 4090 ?
L'affirmation sur une seule GPU et celle sur les 10M proviennent du même lancement, mais pas de la même mesure. Tous les chiffres de débit que Pokee publie pour un contexte de 10M — 137 200 tokens/seconde en prefill, 72,9 secondes de délai jusqu'au premier token — sont mesurés sur une seule B200. Les chiffres de la RTX 4090 et de l'Arc Pro sont réels, mais cités à une échelle beaucoup plus réduite ; ceux de l'Arc Pro B70 indiquent un prefill de 1 087 à 1 500 tokens/seconde, ce qui porterait un prefill de 10M de tokens à plusieurs heures. « Déployable sur une seule GPU à partir d'une RTX 4090 » doit se comprendre comme une affirmation selon laquelle les poids tiennent en mémoire et le modèle sert les requêtes de manière utile, et non comme une affirmation selon laquelle la longueur de contexte mise en avant est réellement exploitable sur cette carte.
Devrais-je remplacer un pipeline RAG par cela ?
Pas sur la base de ces éléments, à une exception près. L’argument en faveur du remplacement de la récupération est le plus fort lorsque vos requêtes sont multi-sauts — exactement le mode de défaillance que la récupération par morceaux gère mal — et la performance multi-sauts au-delà de 1M de tokens est ce que Pokee n’a pas mesuré. MRCR v2 s’arrête à 1M, où Isaac récupère la moitié des aiguilles. L’exception est un corpus qui tient confortablement dans 1M–2M de tokens, où les chiffres mesurés d’Isaac sont solides, l’attente est de quelques dizaines de secondes plutôt que des minutes, et le retrait d’une couche de récupération supprime une véritable complexité opérationnelle. Au-delà, considérez la fenêtre comme un moyen d’éviter de construire une récupération pour un prototype, et non comme une raison de supprimer une solution qui fonctionne.
Qu'est-ce qui réglerait ça ?
Quatre choses, aucune ne nécessitant de faire confiance à qui que ce soit. Une exécution indépendante de RULER ou MRCR à 2M ou plus, par n'importe qui, sur l'API publique. Un résultat MRCR v2 de Pokee aux longueurs qu'il annonce déjà. Un rapport technique accessible qui nomme le mécanisme, point auquel la question de l'encodeur cesse d'être arithmétique et devient un fait. Et une publication des poids, que « closed-source for now » évoque sans promettre.
Jusque-là, le résumé équitable est plus étroit que le lancement et plus intéressant que le scepticisme. Pokee AI a livré un modèle de 28B qui maintient de manière mesurable la récupération en contexte long plus loin que tout ce que vous pouvez actuellement acheter, fait jeu égal avec un niveau rapide de pointe sur le travail d’agent, est le plus sûr de son propre panel et se situe au milieu face à un panel plus large, et fonctionne dans des endroits où rien de sa capacité ne fonctionne. Elle a également choisi de publier les seuls chiffres qui existent sur la capacité que personne d’autre ne propose, et de ne pas dire comment cela fonctionne. Ce sont deux choix qu’une jeune entreprise peut se permettre. Aucun des deux ne remplace quelqu’un de l’extérieur qui exécute le test.
Comparés dans cet article1
Détecté à partir de cet article · Benchmarks : Artificial Analysis · mis à jour quotidiennement
