Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 miljoen tokens aan context, en een architectuur die Pokee niet wil beschrijven

Auteur

Jim Song

Publicatiedatum

Nieuwste modellen · 20Bekijk alle modellen
Benchmarks: Artificial Analysis · dagelijks bijgewerkt
Terug naar alle berichten

Er staat een kolom in de lanceringsvergelijking van Pokee-Isaac 28B waar vijf van de zes modellen 0,0 scoren, en de voetnoot eronder is interessanter dan het cijfer erboven. Bij een contextlengte van 10 miljoen tokens scoort het nieuwe 28B-model van Pokee AI 93,3 op RULER, en elke basislijn waartegen het werd gemeten — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — levert niets bruikbaars op. De voetnoot legt uit dat drie van die vijf sowieso niet verkrijgbaar zijn voor contextlengtes boven 262K. De score is dus echt, en de kamer is leeg. Dat zijn twee verschillende beweringen, en het grootste deel van de berichtgeving die sinds het verschijnen van het model op 5 augustus 2026 is gepubliceerd, heeft ze door elkaar gehaald.

Dat is geen reden om wat Pokee heeft uitgebracht weg te wuiven. Het is een reden om precies te zijn over welke delen ervan zijn aangetoond, welke slechts onbetwist zijn en welke simpelweg niet zijn beschreven. Al het onderstaande komt uit vier primaire bronnen: de modelpagina van Pokee-Isaac op Pokee's eigen console, de ontwikkelaarsdocumentatie van Pokee, de reseller-listing van het model op NanoGPT, en de lanceringsverklaringen van Pokee AI en oprichter Zheqing (Bill) Zhu. Elk benchmarkcijfer in dit artikel is geproduceerd door Pokee AI. Pokee zegt dat ronduit — de console stelt dat elk cijfer {{1}}"werd gemeten door Pokee AI in één enkele gecontroleerde omgeving, voor Isaac en voor elke baseline op dezelfde wijze, tenzij anders vermeld"{{/1}} — en dat betekent, tot hun eer, dat de baselines opnieuw zijn gedraaid in plaats van overgenomen uit aankondigingen van andere leveranciers. Het betekent ook dat geen onafhankelijk laboratorium er ook maar iets van heeft gereproduceerd, en dat tot op heden niemand een poging heeft gepubliceerd.

Wat Pokee daadwerkelijk heeft uitgebracht

Het publieke oppervlak van het model is ongewoon goed gedocumenteerd voor een zo jonge lancering, dus het is de moeite waard om het uiteen te zetten voordat we bij de omstreden delen komen.

Model — Pokee-Isaac 28B, versie v0, aangeboden als pokee-isaac via api.pokee.ai achter een compatibele endpoint.

Grootte en context — 28 miljard parameters tegenover een invoervenster van 10.000.000 tokens; Pokee beschrijft het als "bruikbaar van begin tot eind, niet slechts adresseerbaar."

Uitvoer — 60.000 tokens, wat zowel de standaardwaarde als de harde limiet is.

Modaliteiten — tekst in, tekst uit. Afbeeldingen, audio en video als invoer worden niet ondersteund, wat het vermelden waard is gezien waar het model uit is opgebouwd.

Prijs — $0,15 per miljoen invoertokens en $1,00 per miljoen uitvoer, op Pokee's eigen lijst.

Agentische functies — function calling en gestructureerde output in het standaard chat-completions schema; het model is gepositioneerd als een plannende, uitvoerende en beoordelende agent in plaats van een chatmodel.

Aanvraaglimieten — een limiet van 45 MiB voor de aanvraagbody, waarbij alles boven 16 MiB SSE-streaming moet gebruiken (stream: true plus een Accept: text/event-stream-header).

Aanvraaglimieten — 500 verzoeken en 20 miljoen tokens per minuut, met 10 gelijktijdige verzoeken voor gratis accounts en 25 voor betaalde accounts.

Implementatie — datacenter B200, RTX 4090/5090 werkstations, Intel Arc Pro clientkaarten, edge-NPU's (Qualcomm en Intel Panther Lake, met AMD vermeld als in afwachting), en op het apparaat, met VPC- en on-premises-licenties, waarbij, in de woorden van Pokee, "geen enkel verzoek uw perimeter verlaat."

Serving stacks — ondersteuning op dag nul in vLLM en SGLang.

Bedrijf — Pokee AI, opgericht in 2024 door Zheqing (Bill) Zhu, voorheen hoofd van toegepast reinforcement learning bij Meta; $12M seedronde onder leiding van Point72 Ventures, met Qualcomm Ventures en Samsung NEXT.

De gewichten zijn gesloten. De verslaggeving heeft het model omschreven als closed-source "voorlopig", wat Pokee's eigen voorbehoud is in plaats van een toezegging, en er is geen aangekondigde datum of licentie voor een release.

Pokee-Isaac 28B-2

De architectuur die niemand zal beschrijven

Pokee schrijft het 10M-venster toe aan een "propriëtaire niet-decoder-only-architectuur". Die frase vormt de volledige technische openbaarmaking. De console linkt naar een technisch rapport getiteld Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, gedateerd 3 augustus 2026; we konden geen openbare kopie ervan vinden, en de toegankelijke lanceermaterialen noemen het aandachtsmechanisme, het geheugenschema of het trainingsrecept niet.

Wat Pokee over de afstamming heeft gezegd is specifieker, en het is een enigszins ongemakkelijke uitspraak: sommige gewichten van Isaac zijn verfijnd op basis van Qwen3.6-27B onder de Apache-2.0-licentie, andere gewichten zijn door Pokee vanaf nul getraind, en het resultaat is "geen conventionele fine-tune." Dat is een zorgvuldige zin. Het geeft de basis toe en ontkent tegelijkertijd de karakterisering.

Het volstaat ook om het giswerk in te perken, iets wat de AI-onderzoeksgemeenschap meteen begon te doen. De onderzoeker die post als @teortaxesTex zette op de dag van de lancering de set van beperkingen uiteen — deels gefinetuned op basis van Qwen3.6-27B, niet-decoder-only, 10M context, 28B totaal — en stelde twee kandidaten voor: "een soort opgevoerde Memory Sparse Attention" of "gewoon een 1B-documentencoder". Beide gissingen zijn de moeite waard om te begrijpen, want ze zijn niet vrijblijvend.

Begin met de rekenkunde. Qwen3.6-27B is een dicht 27B-model met een native venster van 262K, gated-delta hybride aandacht, en een visie-encoder die overgeslagen kan worden om het model alleen-tekst te laten draaien. Isaac is 28B en alleen-tekst. Als je de visietoren van het basismodel weglaat en ruwweg een miljard parameters van iets anders toevoegt, kom je precies op 28B uit. Een ~1B document- of geheugen-encoder gekoppeld aan een 27B-decoder is de meest spaarzame interpretatie van het parameteraantal dat Pokee publiceerde, en het zou het 'niet-alleen-decoder'-label letterlijk waar maken zonder een nieuwe bewering te zijn.

De Memory Sparse Attention-gok wijst op een echte en recente onderzoekslijn: het MSA-artikel (arXiv:2603.23516) combineert schaalbare sparse attention met documentgewijze RoPE om lineaire complexiteit te krijgen in training en inferentie, voegt KV-cachecompressie toe plus een 'Memory Parallel'-schema, en rapporteert minder dan 9% degradatie van 16K tot maar liefst 100M tokens, waarbij inferentie met 100M tokens draait op twee A800's. Dat is dezelfde vorm van resultaat die Pokee claimt, één orde van grootte verder, van een andere groep. Niets verbindt de twee behalve de vorm — MSA is niet het werk van Pokee en Pokee heeft het niet geciteerd — maar het toont aan dat een ontwerp met ontkoppeld geheugen dat deze lengtes op bescheiden hardware haalt, een gepubliceerd, plausibel iets is en geen marketingonmogelijkheid.

Er is één getal in Pokee's eigen materiaal dat in stilte de separate-encoder-lezing ondersteunt. Prefill-doorvoer op een enkele B200 is 42.400 tokens/seconde bij een 1M-token-context en 137.200 tokens/seconde bij 10M. Doorvoer stijgt meer dan drievoudig naarmate de context tien keer langer wordt. Een decoder die kwadratische aandachtskosten betaalt, doet het tegenovergestelde. Wat die tokens ook verbruikt, wordt efficiënter per token naarmate je ze toevoegt, wat het kenmerk is van een bulk-encoding-pass over documenten in plaats van een gewone prefill.

Waarom dit van belang is voor iemand die overweegt het model te gebruiken: als het 10M-venster een documentencoder plus een gecomprimeerd geheugen is in plaats van een KV-cache met 10M entries, dan is 'context' hier niet het object waar je intuïties op zijn gebaseerd. Hoe het zich gedraagt wanneer je iets aan een gesprek toevoegt, één document midden in een corpus bewerkt, of verwacht dat prefix-caching werkt, is niet gespecificeerd, en de documentatie van Pokee vermeldt helemaal geen caching-mechanisme. Je kunt die gedragingen niet afleiden uit het specificatieblad, en op dit moment ook niet uit de architectuur.

RULER op 10M is een reëel getal in een lege kamer.

Pokee's long-context bewijs is RULER, uitgevoerd op 256K, 512K, 1M, 2M, 4M en 10M, met tien samples per configuratie. Isaac scoort 96.9, 96.7, 95.0, 95.8, 96.7 en 93.3 over die zes lengtes — het enige model in het panel dat bij elk daarvan een score behaalt.

Het paneel onder 1M is waar de eerlijke aflezing huist:

Bij 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, en 0.0 voor zowel Claude Haiku 4.5 als Qwen 3.5 122B, waarvan de vensters onder die lengte stoppen.

Bij 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

Bij 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 en GPT-5.6 Luna 0.0, waarbij de laatste twee beide als context-overloop-fouten zijn gemarkeerd.

Vanaf 2M en verder — Isaac alleen, al het andere 0.0.

Er volgen drie dingen. Ten eerste: tot 1M bedraagt Isaacs voorsprong op het veld een punt of twee, geen generatie — en de enige basislijn die dichtbij blijft, Nemotron 3 Super 120B, is een 120B-model waarvan de cijfers van 256K tot 1M NVIDIA's eigen zelfgerapporteerde getallen zijn, die Pokee markeert en uitsluit van de rijvergelijking in plaats van ze als gemeten door te laten gaan. Dus de dichtstbijzijnde concurrent bij die lengtes is in feite geen overeenkomstige meting, in beide richtingen.

Ten tweede lijkt ten minste één van de lege cellen eerder een implementatie-artefact dan een modelbeperking. Pokee draaide GPT-5.6 Luna via Azure, annoteerde het venster als ">272K context" en registreerde daarbij een context-overflowfout bij 1M. De door de leverancier zelf gedocumenteerde venstergrootte voor dat model is ongeveer 1,05M tokens, en dat is ook wat onze eigen modelpagina ervoor meldt. Een lezer die de 1M-kolom letterlijk neemt, zou concluderen dat Luna geen 1M aankan; de beter verdedigbare conclusie is dat de Azure-implementatie die Pokee testte dat niet kon.

Ten derde is RULER een synthetische retrieval- en aggregatiesuite, geen redeneerbenchmark. Pokee is ook hier transparant over een methodologische hobbel: de 256K- en 512K-kolommen middelen alle 13 taakconfiguraties, maar de extractie van veelvoorkomende woorden is niet beschikbaar vanaf 1M, dus de lange kolommen middelen de resterende 12. De 93,3 bij 10M en de 96,9 bij 256K zijn daarom niet gebaseerd op helemaal dezelfde taakmix.

De moeilijkere long-context test stopt bij 1M

De meer onthullende benchmark op Pokee's pagina is niet RULER. Het is MRCR v2, een 8-naalden multi-round co-referentietaak waarbij verschillende doelen verspreid zijn over een lang gesprek en het model een gespecificeerd doel moet ophalen en ontwarren, dus zowel gedeeltelijke recall als kruisnaald-interferentie kosten je punten. Op een schaal van 0–1, bij 1M tokens:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 en Qwen 3.5 122B — 0.000, niets bruikbaars op die lengte

Dit is een veel bredere en veel geloofwaardigere kloof dan RULER produceert, en het is waar de pitch van het model daadwerkelijk zijn vruchten afwerpt. Luna scoort 95,0 op RULER bij 256K en 0,050 op MRCR bij 1M; single-target recall en multi-needle-disambiguatie zijn niet dezelfde vaardigheid, en de tweede stort eerst in. Isaac degradeert veel sierlijker.

Het is ook verreweg het grootste bewijsgat in de lancering. MRCR v2 werd gedraaid op 256K, 512K en 1M — en stopte. Isaac's eigen scores daar zijn 0.607, 0.743 en 0.500: niet-monotoon, en bij 1M haalt het de helft van de naalden op. Er is geen gepubliceerd multi-needle resultaat op 2M, 4M of 10M van wie dan ook, inclusief Pokee. De 10M-claim rust volledig op de makkelijkere van de twee tests, op precies de lengtes waar de moeilijkere test niet werd geprobeerd. Als je dit model overweegt omdat je een corpus van 25.000 pagina's in één prompt wilt plaatsen en een vraag wilt stellen waarvan het antwoord is samengesteld uit vier plaatsen erin, dan is die specifieke capaciteit niet gemeten op die specifieke lengte.

Pokee-Isaac 28B-3

Op het gebied van agentisch werk is Isaac de gelijke van Luna, niet de meerdere.

Pokee voerde vier agentic benchmarks uit, en dit is waar de openhartigheid van het bedrijf werkelijk ongebruikelijk is: de eigen pagina vat het resultaat samen als Isaac die er twee leidt, tweede staat op één, en derde op één. Dat is een accurate beschrijving, en het is niet de beschrijving in de berichtgeving rond de lancering.

BFCL v4, function calling (gescoord via AST- en state-transition-matching in plaats van een LLM-jury) — Isaac 70.94 vs GPT-5.6 Luna 70.61, met Claude Haiku 4.5 op 67.52, Qwen 3.5 122B op 64.88, Gemini 3.5 Flash Lite op 64.85, Nemotron 3 Super op 33.13.

τ³-bench, gemiddelde over vier domeinen (multi-turn klantenservicetaken tegen een gesimuleerde gebruiker waarvan de vereisten halverwege het gesprek veranderen) — Isaac 0.662 versus Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, subset met alleen tekst — GPT-5.6 Luna 69,8% tegen Isaac 65,1%, daarna Gemini 3.5 Flash Lite en Qwen 3.5 122B gelijk op 46,5%, Claude Haiku 4.5 34,9%, Nemotron 24,4%.

MCP-Atlas, claimdekking over live toolservers — GPT-5.6 Luna 77,90%, Gemini 3.5 Flash Lite 76,67%, Isaac 74,59%, Qwen 3.5 122B 70,24%, Claude Haiku 4.5 56,45%, Nemotron 48,95%.

Een marge van 0,33 punt op BFCL v4 is pariteit, en de pagina van Pokee zegt dat ook, in plaats van het een overwinning te noemen. Over alle vier gelezen, wisselt een 28B-model overwinningen af met de snelle laag van een toonaangevende leverancier op agentische taken. Voor een 28B-model is dat een sterk resultaat. Het is niet het resultaat dat 'frontier-class agentic model' bij de meeste lezers impliceert, en het betekent dat de reden om voor Isaac te kiezen het contextvenster en de implementatieomgeving is, niet de agentische capaciteit.

Het veiligheidscijfer is het beste van het panel en is nog steeds niet goed.

Op DTAP, een prompt-injectiesuite, noteert Isaac het laagste aanvalssuccespercentage in het panel met 35,6 gecombineerd, vóór Claude Haiku 4.5 met 37,9, GPT-5.6 Luna met 50,1, Qwen 3.5 122B met 54,0, Nemotron met 60,4 en Gemini 3.5 Flash Lite met 66,3. De directe en indirecte percentages verschillen minder dan een punt, dus de robuustheid is tenminste gelijk over beide vectoren.

Drie kanttekeningen, allemaal uit Pokee's eigen rapportage en niet van critici. De indirecte metingen werden uitgevoerd met uitgeschakelde beveiligingen. Expliciete weigeringen kwamen bij slechts 1,5% van de kwaadaardige taken voor; volgens Pokee is de huidige verdediging daarmee grotendeels 'toevallig in plaats van geweigerd' — het model herkent en verwerpt aanvallen niet zozeer, maar wordt er eerder niet op een nuttige manier door gestuurd. En op een bredere ranglijst van 16 systemen, in plaats van dit panel van zes modellen, staat Isaac vijfde bij directe aanvallen, zesde bij indirecte en negende bij capaciteit: middenmoot, niet aan kop.

Er is ook een prijs voor de veiligheid. Isaacs goedaardige succespercentage is 82,5, lager dan GPT-5.6 Luna's 85,1 — het weigert of verknoeit iets meer legitiem werk dan het model dat het op aanvallen verslaat. En 35,6 betekent dat ruwweg één op de drie injectiepogingen nog steeds slaagt. Voor een model waarvan het hele uitgangspunt is dat het tien miljoen tokens aan documenten leest die je niet hebt geschreven, is dat het getal waar je guardrails omheen ontwerpt, niet het getal waar je gerust op kunt zijn. DTAP zelf is het vermelden waard: in tegenstelling tot RULER, BFCL en τ³-bench is het geen gevestigd openbaar leaderboard, en we konden geen onafhankelijke documentatie van de suite vinden.

Wat een aanroep van tien miljoen tokens kost, en hoe lang je wacht

Tien miljoen tokens is ongeveer 7,5 miljoen woorden, oftewel zo'n 25.000 pagina's. Bij Pokee's $0,15 per miljoen kost het één keer vullen van het venster $1,50. Voeg een antwoord van maximaal 60.000 tokens toe tegen $1,00 per miljoen, en één maximale aanroep komt uit op ongeveer $1,56. Dat is werkelijk goedkoop voor de hoeveelheid tekst, en het is het sterkste eenvoudige argument voor het model.

De tijd is de echte prijs. Op een enkele B200 rapporteert Pokee 72,9 seconden tot het eerste token bij 10M — wat exact 10.000.000 gedeeld door de 137.200 tokens/seconde prefill-waarde is, dus het is het getal van de benchmarkhardware en geen gemeten API-latentie. Pokee's eigen ontwikkelaarsdocumentatie vertelt ontwikkelaars een ander verhaal: sta een clienttimeout van ten minste tien minuten toe voor prompts met miljoenen tokens, omdat een grote prompt "ongeveer zeven minuten bij 10 miljoen tokens" kan duren. Dat is een kloof van ongeveer een factor zes tussen de doorvoerslide en de integratiegids. Beide zijn Pokee's cijfers; het getal in de documentatie is het getal waar je timeoutconfiguratie op moet vertrouwen.

Het decoderen blijft constant op ongeveer 335 tokens/seconde, ongeacht de hoeveelheid residente context — architectonisch goed nieuws, maar praktisch ongemakkelijk: een volledige uitvoer van 60.000 tokens duurt ongeveer drie minuten bovenop de prefill. Op consumentenhardware verschuift het beeld weer — op een Intel Arc Pro B70 rapporteert Pokee 1.087–1.500 tokens/seconde prefill (3,6–5× de standaard llama.cpp) en 58,8 tokens/seconde decode. Dat zijn respectabele cijfers voor een client-gpu, maar geen 10M-token-cijfers.

Uit de omvang van de invoer zelf vloeien twee praktische beperkingen voort. Tien miljoen tokens Engels is ruwweg 38 MiB aan tekst, wat onder de limiet van 45 MiB voor de request-body blijft, maar ruim boven de drempel van 16 MiB ligt — dus elke werkelijk volledige window-aanroep moet worden gestreamd; er is geen niet-streaming pad naar de hoofdfunctionaliteit. En aangezien Pokee's API geen gedocumenteerde prompt-caching biedt, is elke herhaalde query op dezelfde corpus opnieuw $1,50 en een prefill van meerdere minuten. De reseller-lijst op NanoGPT vermeldt wel een cache-leessnelheid van $0,079 per miljoen, wat, als dit van toepassing is op Isaac, een gecachte herlezing op ongeveer $0,79 brengt — ruwweg de halve prijs, niet de orde-van-grootte-korting die prompt-caching elders impliceert.

Eén correctie op de prijsvergelijking, omdat het de kop verandert. Pokee prijst GPT-5.6 Luna op $0,40/$1,80 per miljoen, afkomstig van Azure. De eigen catalogusprijs van de leverancier voor Luna na de prijsverlaging van 31 juli 2026 is $0,20/$1,20, en dat is wat onze modelpagina ervoor toont, omdat OrcaRouter de catalogusprijzen van providers doorgeeft met 0% opslag in plaats van door te verkopen met een marge. Vergeleken met het juiste cijfer is Isaac 25% goedkoper op input en 17% goedkoper op output dan de snelle frontier-tier — nog steeds goedkoper, maar een veel kleinere voorsprong dan het panel suggereert, en de algeheel goedkoopste outputprijs van het panel is voor Nemotron 3 Super met $0,65. Het prijsvoordeel van Isaac is reëel; het is alleen niet het opmerkelijke deel van deze lancering.

Pokee-Isaac 28B-4

Het deel dat daadwerkelijk nieuw is

Als je de benchmarkframing eruit haalt, blijft er iets ongebruikelijks over. Een 28B-model met een zeer lange context dat draait in een VPC, op een RTX 4090-workstation, op een Intel Arc Pro-kaart en op mobiel silicium van NPU-klasse, met vanaf dag één ondersteuning voor vLLM en SGLang en een on-premiseslicentie — die combinatie is vrijwel nergens anders verkrijgbaar. Pokee claimt ook een ruwweg 5× hogere KV-cache-efficiëntie dan standaardimplementaties, een leverancierscijfer dat niet is gereproduceerd, maar het is het soort cijfer dat waar zou moeten zijn als het implementatieverhaal stand wil houden.

De klant hiervoor is niet iemand die op zoek is naar een betere agent. Het is iemand met een groot, gevoelig, grotendeels statisch corpus — contractsets, dossiers, een monolithische codebase, maanden aan logs — dat juridisch of politiek gezien de grenzen niet mag overschrijden, en die anders een retrievalpijplijn zou bouwen om een 200K-venster te omzeilen. Tegenover dat alternatief is de pitch niet "goedkoper dan RAG." Het embedden en ophalen van meer dan 25.000 pagina's kost enkele centen per query en zal dat ook altijd blijven doen. De pitch is dat er geen chunkingstrategie is om af te stemmen, geen retrieval-recall om te verliezen, en geen tweede systeem dat met het eerste gesynchroniseerd moet blijven. Of die afweging $1,50 en enkele minuten per query waard is, hangt volledig af van hoe vaak je query's uitvoert.

Wie moet het nu proberen, en wie moet wachten?

Probeer het nu {{1}}als u een prototype maakt tegen een corpus in het bereik van 1M–4M, waar Isaac's cijfers het sterkst zijn en de alternatieven werkelijk dun gezaaid zijn{{/1}}, {{2}}of als on-premises implementatie bij 28B de vereiste is die u tot nu toe heeft geblokkeerd{{/2}}. De tien gelijktijdige verzoeken van de gratis laag zijn voldoende om te ontdekken of het model uw documenten leest zoals u dat nodig heeft.

Wacht, als je specifiek het getal van 10M nodig hebt en de vragen die je stelt meerstaps zijn, want juist die combinatie is nog door niemand gemeten. Wacht, als je multimodale invoer nodig hebt, die het model niet accepteert. Wacht, als latentie ertoe doet, want een volledige window-aanroep duurt minuten, geen seconden. En weeg het voor de hand liggende afhankelijkheidsrisico af: dit is een v0-model, met gesloten gewichten, van een bedrijf met een seed-ronde van $12M, en het is het enige model ter wereld dat de functionaliteit levert die het verkoopt. Er is geen tweede provider om op terug te vallen als het verdwijnt.

Dat laatste punt is de praktische reden om de vergelijking eerlijk te houden. Pokee-Isaac 28B staat vandaag niet op OrcaRouter — als je het wilt, zit het in Pokee's eigen API of bij een reseller. Maar drie van de vijf basislijnen waartegen het zichzelf meet — GPT-5.6 Luna, Gemini 3.5 Flash Lite en Claude Haiku 4.5 — zitten op één OrcaRouter-sleutel tegen de lijstprijs van de provider, wat het nuttige experiment goedkoop maakt om op te zetten: voer je daadwerkelijke taak met lange context uit tegen die drie op de lengtes die ze ondersteunen, en kijk of je corpus echt tien miljoen tokens nodig heeft of dat het 400.000 nodig heeft en een betere prompt. Als het tien miljoen nodig heeft, heb je iets geleerd dat $1,50 per oproep waard is. Zo niet, dan heb je voorkomen dat je een productiepad bouwt op een single-source v0.

Drie vragen die een antwoord waard zijn

Is Pokee-Isaac 28B slechts een fine-tune?

Niet door enig normaal gebruik van de uitdrukking, hoewel het ook niet onafhankelijk is van die basis. Pokee's standpunt is dat sommige gewichten zijn fijnafgesteld vanuit Qwen3.6-27B onder Apache-2.0 terwijl andere vanaf nul zijn getraind, en dat de architectuur niet decoder-only is. Beide helften daarvan zijn consistent met het parameteraantal: Qwen3.6-27B is 27B dicht met een overslaanbare visuele encoder, Isaac is 28B en tekst-only, dus ongeveer een miljard parameters aan nieuwe mechaniek verving de visietoren. Wat die mechaniek is, is niet openbaar gemaakt, en totdat dat gebeurt, is "geen conventionele fijnafstelling" een bewering die rust op Pokee's woord in plaats van op iets dat controleerbaar is. De Apache-2.0-licentie op de basis maakt de afleiding legaal; het maakt de gesloten release van het resultaat niet ongebruikelijk, wat vooral het vermelden waard is omdat een afstamming zo specifiek zelden vrijwillig wordt aangeboden.

Kan het echt 10 miljoen tokens draaien op een RTX 4090?

De bewering over één GPU en de bewering over 10M komen uit dezelfde aankondiging, maar niet uit dezelfde meting. Elk doorvoercijfer dat Pokee publiceert bij 10M context — 137.200 tokens/seconde prefill, 72,9 seconden time-to-first-token — is afkomstig van één enkele B200. De cijfers voor de RTX 4090 en Arc Pro zijn reëel, maar hebben betrekking op een veel kleinere schaal; de Arc Pro B70-cijfers zijn 1.087–1.500 tokens/seconde prefill, wat een 10M-token prefill op uren zou brengen. "Inzetbaar op één GPU, vanaf een RTX 4090" moet vooral worden gelezen als een bewering over de gewichten die passen en het model dat bruikbaar serveert, niet over de indrukwekkende contextlengte die praktisch haalbaar is op die kaart.

Moet ik er een RAG-pipeline mee vervangen?

Niet op basis van dit bewijs, met één uitzondering. De reden om retrieval te vervangen is het sterkst wanneer je queries multi-hop zijn — precies het faalgeval waar chunked retrieval slecht mee omgaat — en multi-hop prestaties voorbij 1M tokens is wat Pokee niet heeft gemeten. MRCR v2 stopt bij 1M, waar Isaac de helft van de naalden terugvindt. De uitzondering is een corpus dat comfortabel binnen 1M–2M tokens past, waar Isaacs gemeten cijfers sterk zijn, de wachttijd tientallen seconden is in plaats van minuten, en het verwijderen van een retrieval-laag echte operationele complexiteit wegneemt. Boven die grens: behandel het venster als een manier om het bouwen van retrieval voor een prototype te vermijden, niet als een reden om een werkende retrieval-laag te verwijderen.

Wat zou het beslechten?

Vier dingen, waarvan geen enkel vereist dat je iemand vertrouwt. Een onafhankelijke RULER- of MRCR-run op 2M of hoger, door wie dan ook, op de publieke API. Een MRCR v2-resultaat van Pokee op de lengtes die het al adverteert. Een bereikbaar technisch rapport dat het mechanisme benoemt, waarmee de encoder-vraag ophoudt rekenkundig te zijn en een feit wordt. En een release van de gewichten, waar "closed-source for now" op zinspeelt zonder het te beloven.

Tot die tijd is de eerlijke samenvatting beperkter dan de lancering en interessanter dan de scepsis. Pokee AI heeft een 28B-model uitgebracht dat meetbaar langere contextretrieval vasthoudt dan alles wat je momenteel kunt kopen, gelijk speelt met een snelle frontier-tier bij agentisch werk, het veiligst is in zijn eigen panel en middenmoot tegenover een breder panel, en draait op plekken waar niets van zijn kaliber draait. Het heeft er ook voor gekozen om de enige cijfers te publiceren die bestaan over de capaciteit die niemand anders biedt, en niet te zeggen hoe het werkt. Beide zijn keuzes die een jong bedrijf mag maken. Geen van beide vervangt dat iemand buiten het bedrijf de test uitvoert.

Vergeleken in dit artikel1

Herkend uit dit artikel · Benchmarks: Artificial Analysis · dagelijks bijgewerkt

© 2026 OrcaRouter

Voor aanbieders

Beheer je een inferentieplatform? Zet je modellen op OrcaRouter.

Neem contact op

Word lid van de community

DiscordEmailXGitHubYouTube