
Pokee-Isaac 28B: 10 miljoner tokens av kontext, och en arkitektur som Pokee inte kommer att beskriva.
- metaNYMeta: Muse Spark 1.22026-08-0557Intelligens72Kodning
- qwenNYQwen: Qwen3.8 Max2026-08-0358Intelligens72Kodning
- deepseekNYDeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligens69Kodning
- minimaxNYMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligens69Kodning
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligens49Kodning
- metaMeta: Muse Spark 1.12026-07-1653Intelligens71Kodning
- kimiMoonshotAI: Kimi K32026-07-1560Intelligens76Kodning
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligens71Kodning
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligens77Kodning
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligens77Kodning
- grokxAI: Grok 4.52026-07-0856Intelligens72Kodning
- tencentTencent: Hy32026-07-0642Intelligens59Kodning
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligens42Kodning
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligens39Kodning
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligens72Kodning
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligens52Kodning57Matematik
Det finns en kolumn i Pokee-Isaac 28B:s lanseringsjämförelse där fem av de sex modellerna får 0,0, och fotnoten under den är mer intressant än siffran ovanför. Vid en kontextlängd på 10 miljoner token får Pokee AI:s nya 28B-modell 93,3 på RULER och varje baslinje som den mättes mot — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — ger inget användbart. Fotnoten förklarar att tre av dessa fem överhuvudtaget inte kan köpas med en kontextlängd över 262K. Så poängen är verklig, och rummet är tomt. Det är två olika påståenden, och större delen av rapporteringen som publicerats sedan modellen dök upp den 5 augusti 2026 har blandat ihop dem.
Det är inte ett skäl att avfärda det Pokee levererade. Det är ett skäl att vara precis om vilka delar av det som är demonstrerade, vilka som endast är obestridda och vilka som helt enkelt inte beskrivs. Allt nedan kommer från fyra primära källor: Pokee-Isaac-modellsidan på Pokees egen konsol, Pokees utvecklardokumentation, modellens återförsäljarlista på NanoGPT och lanseringsuttalandena från Pokee AI och grundaren Zheqing (Bill) Zhu. Varje benchmarksiffra i den här artikeln togs fram av Pokee AI. Pokee säger det rakt ut – konsolen anger att varje siffra ”mättes av Pokee AI i en enda kontrollerad miljö, för Isaac och för varje baslinje likadant, om inte annat anges” – och till deras fördel innebär det att baslinjerna kördes om snarare än kopierades från andra leverantörers tillkännagivanden. Det innebär också att inget oberoende laboratorium har reproducerat något av det, och hittills har ingen publicerat ett försök.
Vad Pokee faktiskt levererade
Modellens publika yta är ovanligt väldokumenterad för en så ung lansering, så det är värt att presentera den innan vi kommer till de omtvistade delarna.
• Modell — Pokee-Isaac 28B, versionerad v0, serverad som pokee-isaac från api.pokee.ai bakom en kompatibel slutpunkt.
• Storlek och kontext — 28 miljarder parametrar med ett inmatningsfönster på 10 000 000 token; Pokee beskriver det som "användbart från början till slut, inte bara adresserbart."
• Utdata — 60,000 tokens, vilket både är standardvärdet och den maximala gränsen.
• Modaliteter — text in, text ut. Bild-, ljud- och videoinmatningar stöds inte, vilket är värt att notera med tanke på vad modellen är uppbyggd av.
• Pris — $0.15 per miljon inmatningstokens och $1.00 per miljon utdata, på Pokees egen lista.
• Agentiska funktioner — funktionsanrop och strukturerad utdata i standardschemat för chat-completions; modellen positioneras som en planerande, utförande och granskande agent snarare än en chattmodell.
• Begränsningar för förfrågningar — en gräns på 45 MiB för förfrågningskroppen, där allt över 16 MiB kräver att SSE-strömning används (stream: true samt en Accept: text/event-stream header).
• Hastighetsbegränsningar — 500 förfrågningar och 20 miljoner tokens per minut, med 10 samtidiga förfrågningar på gratiskonton och 25 på betalkonton.
• Driftsättning — datacenter B200, RTX 4090/5090-arbetsstationer, Intel Arc Pro-klientkort, edge-NPU:er (Qualcomm och Intel Panther Lake, med AMD markerad som väntande), och på enheten, med VPC och lokal licensiering enligt vilken, med Pokees ord, "ingen förfrågan lämnar din perimeter."
• Servingstackar — stöd från dag ett i vLLM och SGLang.
• Företag — Pokee AI, grundat 2024 av Zheqing (Bill) Zhu, tidigare chef för tillämpad förstärkningsinlärning på Meta; $12M i startkapital lett av Point72 Ventures med Qualcomm Ventures och Samsung NEXT.
Vikterna är stängda. Rapporteringen har beskrivit modellen som sluten källkod "för närvarande", vilket är Pokees egen gardering snarare än ett åtagande, och det finns inget annonserat datum eller licens för ett släpp.

Arkitekturen som ingen kommer att beskriva
Pokee tillskriver 10M-fönstret en "proprietär arkitektur som inte är enbart avkodarbaserad." Den frasen är hela den tekniska redogörelsen. Konsolen länkar till en teknisk rapport med titeln Pokee-Isaac 28B v0: En kontexteffektiv agentisk modell med 10M-token, daterad 3 augusti 2026; vi kunde inte komma åt en offentlig kopia av den, och de lanseringsmaterial som är tillgängliga nämner inte uppmärksamhetsmekanismen, minnesschemat eller träningsreceptet.
Det som Pokee har sagt om härstamningen är mer specifikt, och det är en något besvärlig sak att säga: en del av Isaacs vikter är finjusterade från Qwen3.6-27B under dess Apache-2.0-licens, andra vikter tränades från grunden av Pokee, och resultatet är "inte en konventionell finjustering." Det är en omsorgsfull formulering. Den erkänner basen och förnekar karakteriseringen samtidigt.
Det räcker också för att begränsa gissandet, vilket är precis vad AI-forskningsgemenskapen omedelbart började göra. Forskaren som skriver under namnet @teortaxesTex lade fram begränsningsuppsättningen lanseringsdagen — delvis finjusterad från Qwen3.6-27B, inte enbart avkodare, 10M kontext, 28B totalt — och föreslog två kandidater: "någon form av uppgraderad Memory Sparse Attention" eller "bara en 1B-dokumentkodare". Båda gissningarna är värda att förstå, eftersom de inte är tomma spekulationer.
Börja med aritmetiken. Qwen3.6-27B är en tät 27B-modell med ett nativt fönster på 262K, gated-delta hybrid attention och en vision-encoder som kan hoppas över för att köra modellen text-only. Isaac är 28B och text-only. Om du tar bort basmodellens vision-torn och lägger till ungefär en miljard parametrar av något annat, landar du exakt på 28B. En ~1B dokument- eller minnesencoder bultad på en 27B-avkodare är den mest sparsamma tolkningen av det antal parametrar som Pokee publicerade, och det skulle göra etiketten "non-decoder-only" bokstavligen sann utan att vara ett nytt påstående.
Gissningen om Memory Sparse Attention pekar på en verklig och aktuell forskningslinje: MSA-artikeln (arXiv:2603.23516) kombinerar skalbar gles attention med dokumentvis RoPE för att få linjär komplexitet i både träning och inferens, lägger till KV-cache-komprimering plus ett "Memory Parallel"-upplägg, och rapporterar under 9 procents försämring från 16K ända upp till 100M tokens, med inferens på 100M tokens som körs på två A800:or. Det är samma typ av resultat som Pokee gör anspråk på, en tiopotens längre bort, från en annan grupp. Inget förbinder de två utöver formen — MSA är inte Pokees arbete och Pokee har inte citerat den — men det fastställer att en design med frikopplat minne som når dessa längder på blygsam hårdvara är en publicerad, trovärdig företeelse snarare än en marknadsföringsomöjlighet.
Det finns en siffra i Pokee:s eget material som tyst stöder tolkningen med en separat encoder. Prefill-genomströmningen på en enda B200 är 42 400 tokens/sekund vid en kontext på 1M tokens och 137 200 tokens/sekund vid 10M. Genomströmningen ökar mer än trefaldigt när kontexten blir tio gånger längre. En avkodare som betalar kvadratiska uppmärksamhetskostnader gör det motsatta. Oavsett vad som förbrukar dessa tokens blir det effektivare per token när du lägger till dem, vilket är kännetecknet för en bulk-encoding-pass över dokument snarare än en vanlig prefill.
Varför detta spelar roll för den som överväger att använda modellen: om 10M-fönstret är en dokumentkodare plus ett komprimerat minne snarare än en KV-cache med 10M poster, så är "kontext" här inte det objekt som dina intuitioner är uppbyggda kring. Hur den beter sig när du utökar en konversation, redigerar ett dokument mitt i en korpus eller förväntar dig att prefixcachning ska fungera, är ospecificerat, och Pokees dokumentation listar ingen cachningsmekanism alls. Du kan inte resonera dig fram till dessa beteenden utifrån specifikationen, och just nu kan du inte resonera dig fram till dem utifrån arkitekturen heller.
RULER vid 10M är ett reellt tal i ett tomt rum
Pokees långkontextbevis är RULER, kört vid 256K, 512K, 1M, 2M, 4M och 10M, med tio prover per konfiguration. Isaac får 96.9, 96.7, 95.0, 95.8, 96.7 och 93.3 över dessa sex längder — den enda modellen i panelen som returnerar en poäng för varje.
Panelen nedanför 1M är där den ärliga avläsningen finns:
• Vid 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, och 0.0 för både Claude Haiku 4.5 och Qwen 3.5 122B, vars fönster slutar under den längden.
• Vid 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.
• Vid 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 och GPT-5.6 Luna 0.0, båda de två sista flaggades som kontextöverflödesfel.
• Vid 2M och däröver — Isaac ensam, allt annat 0,0.
Tre saker följer. För det första, upp till 1M, är Isaacs marginal över fältet en punkt eller två, inte en generation — och den enda baslinjen som håller sig nära, Nemotron 3 Super 120B, är en 120B-modell vars 256K-till-1M-siffror är NVIDIAs egna självrapporterade siffror, som Pokee flaggar och utesluter från radjämförelsen snarare än att framställa som uppmätt. Så den närmaste konkurrenten på de längderna är faktiskt inte en matchad mätning, i någon riktning.
För det andra ser åtminstone en av luckorna ut som en distributionsartefakt snarare än en modellbegränsning. Pokee körde GPT-5.6 Luna genom Azure och antecknade dess fönster som ">272K kontext", och registrerade ett kontextöverflödesfel vid 1M. Leverantörens eget dokumenterade fönster för den modellen är cirka 1.05M token, vilket är vad vår egen modellsida för den rapporterar. En läsare som tar 1M-kolumnen för nominellt värde skulle dra slutsatsen att Luna inte klarar 1M; den mer försvarbara slutsatsen är att den Azure-distribution Pokee testade inte kunde.
För det tredje är RULER en syntetisk hämtnings- och aggregeringssvit, inte ett resonemangsriktmärke. Pokee är transparent även här om en metodologisk knepighet: kolumnerna 256K och 512K är medelvärden över alla 13 uppgiftskonfigurationer, men extraktion av vanliga ord är inte tillgänglig från och med 1M, så de långa kolumnerna är medelvärden över de återstående 12. 93.3 vid 10M och 96.9 vid 256K är därför inte poängsatta på exakt samma uppgiftsmix.
Det svårare långkontexttestet slutar vid 1M.
Det mer avslöjande benchmarktestet på Pokees sida är inte RULER. Det är MRCR v2, en 8-nåls multi-round coreferensuppgift där flera mål är utspridda genom en lång konversation och modellen måste hämta och disambiguera ett specificerat sådant, så både partiell återkallelse och störningar mellan nålar kostar dig. På en skala 0–1, vid 1M tokens:
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5 och Qwen 3.5 122B — 0.000, inget användbart på den längden
Detta är ett mycket bredare och mycket mer trovärdigt gap än vad RULER producerar, och det är här modellens pitch faktiskt betalar sig. Luna uppnår 95,0 på RULER vid 256K och 0,050 på MRCR vid 1M; återkallande med enstaka mål och disambiguering med flera nålar är inte samma färdighet, och den senare kollapsar först. Isaac degraderas mycket mer skonsamt.
Det är också den enskilt största bevisluckan i lanseringen. MRCR v2 kördes vid 256K, 512K och 1M — och stoppades. Isaacs egna poäng där är 0.607, 0.743 och 0.500: icke-monotona, och vid 1M hämtar den hälften av nålarna. Det finns inget publicerat multi-nål-resultat vid 2M, 4M eller 10M från någon, inklusive Pokee. 10M-påståendet vilar helt på den lättare av de två testerna, exakt vid de längder där det svårare testet inte försöktes. Om du överväger den här modellen för att du vill lägga ett 25 000-sidigt korpus i en prompt och ställa en fråga vars svar sammanställs från fyra platser i den, så är den specifika förmågan inte uppmätt vid den specifika längden.

Inom agentiskt arbete är Isaac jämbördig med Luna, inte dess överman.
Pokee körde fyra agentiska benchmarks, och det är här företagets uppriktighet verkligen är ovanlig: dess egen sida sammanfattar resultatet som att Isaac leder två, placerar sig tvåa på en, och trea på en. Det är en korrekt beskrivning, och det är inte den beskrivning som ges i lanseringsbevakningen.
• BFCL v4, funktionsanrop (poängsatt genom AST- och tillståndsövergångsmatchning snarare än en LLM-domare) — Isaac 70.94 mot GPT-5.6 Luna 70.61, med Claude Haiku 4.5 på 67.52, Qwen 3.5 122B på 64.88, Gemini 3.5 Flash Lite på 64.85, Nemotron 3 Super på 33.13.
• τ³-bench, genomsnitt över fyra domäner (flervarviga kundtjänstuppgifter mot en simulerad användare vars krav ändras mitt i konversationen) — Isaac 0.662 mot Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.
• Terminal-Bench 2.1, text-only-delmängd — GPT-5.6 Luna 69,8% mot Isaac 65,1%, därefter låg Gemini 3.5 Flash Lite och Qwen 3.5 122B lika på 46,5%, Claude Haiku 4.5 34,9%, Nemotron 24,4%.
• MCP-Atlas, anspråkstäckning över liveverktygsservrar — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.
En marginal på 0,33 poäng på BFCL v4 är paritet, och Pokees sida säger just det snarare än att kalla det en vinst. Betraktar man alla fyra, turas en 28B-modell och en ledande leverantörs snabba nivå om att vinna på agentiska uppgifter. För en 28B-modell är det ett starkt resultat. Det är inte det resultat som "frontier-class agentic model" antyder för de flesta läsare, och det innebär att anledningen att välja Isaac är fönstret och driftsmiljön, inte agentförmågan.
Säkerhetsnumret är panelens bästa och är fortfarande inte bra.
På DTAP, en prompt-injektionssvit, uppvisar Isaac den lägsta attackframgångsfrekvensen i panelen med 35,6 kombinerat, före Claude Haiku 4.5 med 37,9, GPT-5.6 Luna med 50,1, Qwen 3.5 122B med 54,0, Nemotron med 60,4 och Gemini 3.5 Flash Lite med 66,3. Direkta och indirekta frekvenser skiljer sig med mindre än en procentenhet, så robustheten är åtminstone jämn över båda vektorerna.
Tre förbehåll, alla från Pokees egen rapportering snarare än från kritiker. De indirekta mätningarna gjordes med skyddsmekanismerna inaktiva. Explicita avvisanden utlöstes bara vid 1,5 % av de skadliga uppgifterna, vilket Pokee beskriver som att större delen av det nuvarande försvaret är "oavsiktligt snarare än vägrat" — modellen känner inte igen och avvisar attacker så mycket som den misslyckas med att bli användbart styrd av dem. Och mot en bredare topplista med 16 system snarare än denna panel med sex modeller, placerar Isaac sig femma på direkta attacker, sexa på indirekta och nia på kapacitet: mittfält, inte ledande.
Det finns också en kostnad för säkerheten. Isaacs godartade framgångsfrekvens är 82,5, under GPT-5.6 Lunas 85,1 — den vägrar eller fumlar lite mer med legitimt arbete än den modell den slår vid attacker. Och 35,6 innebär att ungefär ett injektionsförsök av tre fortfarande lyckas. För en modell vars hela premiss är att läsa tio miljoner tokens av dokument som du inte har skrivit, är det talet man ska utforma skyddsräcken kring, inte talet man ska bli lugnad av. DTAP i sig förtjänar en varningsflagga: till skillnad från RULER, BFCL och τ³-bench är det inte en etablerad offentlig rankinglista, och vi kunde inte hitta oberoende dokumentation av sviten.
Vad ett anrop på tio miljoner tokens kostar, och hur länge du väntar
Tio miljoner tokens är ungefär 7,5 miljoner ord, eller omkring 25 000 sidor. Med Pokee's $0,15 per miljon kostar det $1,50 att fylla fönstret en gång. Lägg till ett svar på maximalt 60 000 tokens till $1,00 per miljon, och ett maximalt anrop hamnar på ungefär $1,56. Det är verkligt billigt för mängden text det rör sig om, och det är det starkaste enkla argumentet för modellen.
Tiden är det verkliga priset. På en enda B200 rapporterar Pokee 72,9 sekunder till första token vid 10M – vilket är exakt 10 000 000 dividerat med siffran 137 200 tokens/sekund för prefill, så det är benchmark-hårdvarans siffra snarare än en uppmätt API-latens. Pokees egen utvecklardokumentation säger något annat till utvecklare: tillåt en klient-timeout på minst tio minuter för promptar med flera miljoner tokens, eftersom en stor prompt kan ta ”cirka sju minuter vid 10 miljoner tokens.” Det är ungefär en sexfaldig skillnad mellan genomströmningsbilden och integrationsguiden. Båda är Pokees siffror; den i dokumentationen är den som din timeout-konfiguration måste lita på.
Avkodningen är konstant på cirka 335 tokens per sekund oavsett hur mycket kontext som finns i minnet, vilket är goda nyheter arkitekturmässigt men besvärliga i praktiken: en fullständig utdata på 60 000 tokens tar cirka tre minuter utöver prefillen. På konsumenthårdvara skiftar bilden igen — på en Intel Arc Pro B70 rapporterar Pokee 1 087–1 500 tokens/sekund i prefill (3,6–5× standard llama.cpp) och 58,8 tokens/sekund i avkodning. Det är respektabla siffror för ett klient-GPU och de är inte 10M-token-siffror.
Två praktiska begränsningar följer av själva storleken på indatan. Tio miljoner engelska tokens motsvarar ungefär 38 MiB text, vilket ryms under taket på 45 MiB för request body men ligger långt över tröskeln på 16 MiB, så varje verkligt fullfönsteranrop måste strömmas — det finns ingen icke-strömmande väg till huvudfunktionen. Och utan dokumenterad prompt-cachning i Pokee:s API kostar varje ny fråga mot samma korpus ytterligare 1,50 dollar och ytterligare en flera minuter lång prefill. Återförsäljarlistan på NanoGPT publicerar visserligen en cache-läsningsavgift på 0,079 dollar per miljon, vilket, om det gäller Isaac, gör en cachad omläsning till cirka 0,79 dollar — ungefär halva priset, inte den storleksordningsrabatt som prompt-cachning innebär på andra håll.
En korrigering av prissjämförelsen, eftersom den ändrar rubriken. Pokee prissätter GPT-5.6 Luna till $0.40/$1.80 per miljon, med uppgifterna hämtade från Azure. Leverantörens eget listpris för Luna efter sänkningen den 31 juli 2026 är $0.20/$1.20, vilket är vad vår modellsida för den visar, eftersom OrcaRouter förmedlar leverantörernas listpriser med 0 % påslag i stället för att sälja vidare med marginal. Mot den korrekta siffran är Isaac 25 % billigare på input och 17 % billigare på output än den snabba frontiertiern – fortfarande billigare, men en betydligt mindre fördel än vad panelen antyder, och panelens billigaste outputpris överlag tillhör Nemotron 3 Super på $0.65. Isaacs prisfördel är verklig; det är bara inte den del av den här lanseringen som är anmärkningsvärd.

Den del som faktiskt är ny
Rensar man bort benchmark-inramningen återstår något ovanligt. En 28B-modell med ett mycket långt kontextfönster som körs i en VPC, på en arbetsstation med RTX 4090, på ett Intel Arc Pro-kort och på NPU-klassat mobilt kisel, med stöd för vLLM och SGLang från dag ett och en on-premises-licens — den kombinationen är i princip omöjlig att hitta någon annanstans. Pokee hävdar också ungefär 5× KV-cache-effektivitet jämfört med standardimplementeringar, vilket är en leverantörssiffra utan reproduktion, men det är den typen av siffra som måste vara sann för att driftsättningshistorien ska hålla.
Kunden för detta är inte någon som letar efter en bättre agent. Det är någon med en stor, känslig, mestadels statisk korpus — kontraktssamlingar, ärendefiler, en monolitisk kodbas, månader av loggar — som juridiskt eller politiskt inte kan passera en gräns, och som annars skulle bygga en retrieval-pipeline för att kringgå ett 200K-fönster. Mot det alternativet är pitchen inte "billigare än RAG." Att bädda in och hämta från över 25 000 sidor kostar cent per fråga och kommer alltid att göra det. Pitchen är att det inte finns någon chunking-strategi att justera, ingen retrieval-recall att förlora, och inget andra system att hålla i synk med det första. Huruvida den avvägningen är värd $1.50 och flera minuter per fråga beror helt på hur ofta du ställer frågor.
Vem bör prova det nu, och vem bör vänta
Prova det nu om du prototypar mot en korpus i intervallet 1M–4M, där Isaacs siffror är starkast och alternativen är genuint tunna, eller om lokal driftsättning vid 28B är kravet som har blockerat dig. Gratisnivåns tio samtidiga förfrågningar räcker för att ta reda på om modellen läser dina dokument på det sätt du behöver.
Vänta om du specifikt behöver 10M-siffran och frågorna du ställer är multi-hop, eftersom den kombinationen är precis vad ingen har mätt. Vänta om du behöver multimodal indata, vilket modellen inte accepterar. Vänta om latensen spelar roll, eftersom ett helfönsteranrop tar minuter, inte sekunder. Och väg in den uppenbara beroenderisken: detta är en v0-modell, med stängda vikter, från ett företag med en såddrunda på 12 miljoner dollar, och det är den enda modellen i världen som levererar den förmåga den säljer. Det finns ingen andra leverantör att växla över till om den försvinner.
Den sista punkten är det praktiska skälet till att hålla jämförelsen ärlig. Pokee-Isaac 28B finns inte på OrcaRouter idag — vill du ha den är det Pokees eget API eller en återförsäljare som gäller. Men tre av de fem baslinjer som den mäter sig mot, GPT-5.6 Luna, Gemini 3.5 Flash Lite och Claude Haiku 4.5, ligger på en enda OrcaRouter-nyckel till leverantörens listpris, vilket gör det användbara experimentet billigt att genomföra: kör din faktiska långkontextuppgift mot dessa tre i de längder de stöder, och se om din korpus verkligen behöver tio miljoner tokens eller om den behöver 400 000 och en bättre prompt. Om den behöver tio miljoner har du lärt dig något värt 1,50 dollar per anrop. Om den inte gör det har du undvikit att bygga en produktionssökväg på en v0 från en enda källa.
Tre frågor värda att besvara
Är Pokee-Isaac 28B bara en finjustering?
Inte genom någon normal användning av frasen, även om den inte heller är oberoende av den basen. Pokees ståndpunkt är att vissa vikter är finjusterade från Qwen3.6-27B under Apache-2.0 medan andra tränades från grunden, och att arkitekturen inte är decoder-only. Båda halvorna är förenliga med parameterantalet: Qwen3.6-27B är 27B tät med en hoppbar vision-encoder, Isaac är 28B och endast text, så ungefär en miljard parametrar av ny mekanik ersatte vision-tornet. Vad den mekaniken är har inte avslöjats, och tills det sker är ”inte en konventionell finjustering” ett påstående som vilar på Pokees ord snarare än på något kontrollerbart. Apache-2.0-licensen på basen gör härledningen laglig; den gör inte den slutna releasen av resultatet ovanlig, vilket är värt att notera mest för att en så specifik härstamning sällan erbjuds frivilligt.
Kan den verkligen köra 10M tokens på ett RTX 4090?
Påståendet om en enda GPU och 10M-påståendet kommer från samma lansering men inte från samma mätning. Varje genomströmningssiffra som Pokee publicerar vid 10M kontext — 137 200 tokens/sekund i prefill, 72,9 sekunder till första token — gäller en enda B200. RTX 4090- och Arc Pro-siffrorna är verkliga men anges i mycket mindre skala; Arc Pro B70-siffrorna är 1 087–1 500 tokens/sekund i prefill, vilket skulle innebära att en prefill på 10M tokens tar timmar. ”Deployable on a single GPU starting from an RTX 4090” bör läsas som ett påstående om att vikterna får plats och att modellen kan serveras på ett användbart sätt, inte om att den omtalade kontextlängden är praktisk på det kortet.
Borde jag ersätta en RAG-pipeline med den?
Inte på dessa grunder, med ett undantag. Fallet för att ersätta retrieval är starkast när dina frågor är multi-hop — exakt den felsituation som chunked retrieval hanterar dåligt — och multi-hop-prestanda över 1M tokens är det som Pokee inte mätte. MRCR v2 stannar vid 1M, där Isaac hämtar hälften av nålarna. Undantaget är en korpus som bekvämt ryms inom 1M–2M tokens, där Isaacs uppmätta siffror är starka, väntetiden är tiotals sekunder snarare än minuter, och att ta bort ett retrieval-lager eliminerar verklig operationell komplexitet. Ovanför det, behandla fönstret som ett sätt att slippa bygga retrieval för en prototyp, inte som en anledning att ta bort ett som fungerar.
Vad skulle avgöra det
Fyra saker, ingen av dem kräver att man litar på någon. En oberoende RULER- eller MRCR-körning på 2M eller högre, av vem som helst, på det publika API:et. Ett MRCR v2-resultat från Pokee vid de längder den redan annonserar. En tillgänglig teknisk rapport som namnger mekanismen, varvid encoderfrågan slutar vara aritmetik och blir ett faktum. Och ett viktsläpp, vilket "sluten källkod för närvarande" antyder utan att lova.
Till dess är den rättvisa sammanfattningen snävare än lanseringen och mer intressant än skepsisen. Pokee AI har släppt en 28B-modell som mätbart håller långkontextsökning längre ut än något annat du kan köpa idag, går jämnt upp med en snabb frontlinjenivå på agentiskt arbete, är den säkraste i sin egen panel och i mittfältet mot en bredare sådan, och körs på platser där inget med dess kapacitet körs. Det har också valt att publicera de enda siffror som finns om den förmåga ingen annan erbjuder, och att inte säga hur den fungerar. Båda dessa är val som ett ungt företag får göra. Inget av dem ersätter att någon utanför byggnaden kör testet.
Jämförda i den här artikeln1
Identifierat från den här artikeln · Benchmarks: Artificial Analysis · uppdateras dagligen
