
Pokee-Isaac 28B: 10 milioni di token di contesto, e un'architettura che Pokee non descriverà
- metaNUOVOMeta: Muse Spark 1.22026-08-0557Intelligenza72Codice
- qwenNUOVOQwen: Qwen3.8 Max2026-08-0358Intelligenza72Codice
- deepseekNUOVODeepSeek: DeepSeek V4 Flash 07312026-07-3152Intelligenza69Codice
- minimaxNUOVOMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M di token · 2237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Intelligenza78Codice
- googleGoogle: Gemini 3.6 Flash2026-07-2152Intelligenza69Codice
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Intelligenza49Codice
- metaMeta: Muse Spark 1.12026-07-1653Intelligenza71Codice
- kimiMoonshotAI: Kimi K32026-07-1560Intelligenza76Codice
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Intelligenza71Codice
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Intelligenza77Codice
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Intelligenza77Codice
- grokxAI: Grok 4.52026-07-0856Intelligenza72Codice
- tencentTencent: Hy32026-07-0642Intelligenza59Codice
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232Intelligenza42Codice
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226Intelligenza39Codice
- anthropicAnthropic: Claude Sonnet 52026-06-3055Intelligenza72Codice
- klingKling: Kling 3.0 Turbo2026-06-1757Intelligenza52Codice57Matematica
C'è una colonna per Pokee-Isaac 28Bnel confronto di lancio, in cui cinque dei sei modelli ottengono 0.0, e la nota a piè di pagina sottostante è più interessante del numero sopra. Con una lunghezza di contesto di 10 milioni di token, il nuovo modello 28B di Pokee AI ottiene 93.3 su RULER e ogni baseline con cui è stato confrontato — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — non restituisce nulla di utilizzabile. La nota spiega che tre di questi cinque non possono essere acquistati a nessuna lunghezza di contesto superiore a 262K. Quindi il punteggio è reale, e la stanza è vuota. Queste sono due affermazioni diverse, e la maggior parte della copertura pubblicata da quando il modello è apparso il 5 agosto 2026 le ha confuse.
Questa non è una ragione per liquidare ciò che Pokee ha distribuito. È una ragione per essere precisi su quali parti di esso sono dimostrate, quali sono semplicemente non contestate e quali semplicemente non sono descritte. Tutto ciò che segue proviene da quattro fonti primarie: la pagina del modello Pokee-Isaac sulla console di Pokee, la documentazione per sviluppatori di Pokee, la scheda di rivendita del modello su NanoGPT e le dichiarazioni di lancio di Pokee AI e del fondatore Zheqing (Bill) Zhu. Ogni dato di benchmark in questo articolo è stato prodotto da Pokee AI. Pokee lo dice chiaramente — la console afferma che ogni dato "è stato misurato da Pokee AI in un unico ambiente controllato, per Isaac e per ogni baseline allo stesso modo, salvo diversa indicazione" — e a loro merito, ciò significa che le baseline sono state rieseguite piuttosto che copiate dagli annunci di altri fornitori. Significa anche che nessun laboratorio indipendente ha riprodotto nulla di tutto ciò e che, ad oggi, nessuno ha pubblicato un tentativo.
Cosa ha effettivamente spedito Pokee
La superficie pubblica del modello è insolitamente ben documentata per un lancio così recente, quindi vale la pena esporla prima di arrivare alle parti contestate.
• Modello — Pokee-Isaac 28B, versione v0, esposto come pokee-isaac da api.pokee.ai tramite un endpoint compatibile.
• Dimensioni e contesto28 miliardi di parametri contro una finestra di input di 10.000.000 di token; Pokee lo descrive come "utilizzabile end-to-end, non semplicemente indirizzabile."
• Output — 60.000 token, che è sia il valore predefinito che il limite massimo.
• Modalità — testo in ingresso, testo in uscita. Gli input di immagini, audio e video non sono supportati, il che è degno di nota considerando ciò su cui è costruito il modello.
• Prezzo — $0,15 per milione di token di input e $1,00 per milione di output, sulla lista di Pokee stessa.
• Funzionalità agentiche — chiamata di funzioni e output strutturato nello schema standard delle chat-completions; il modello è posizionato come un agente che pianifica, esegue e rivede, piuttosto che come un modello di chat.
• Limiti di richiesta — un tetto di 45 MiB per il corpo della richiesta; sopra i 16 MiB è richiesto l'uso dello streaming SSE (stream: true oltre a un Accept: text/event-stream header).
• Limiti di frequenza — 500 richieste e 20 milioni di token al minuto, con 10 richieste concorrenti sugli account gratuiti e 25 su quelli a pagamento.
• Distribuzione — datacenter B200, workstation RTX 4090/5090, schede client Intel Arc Pro, NPU edge (Qualcomm e Intel Panther Lake, con AMD elencata come in sospeso) e on-device, con licenze VPC e on-premises secondo cui, come dice Pokee, "nessuna richiesta esce dal tuo perimetro."
• Stack di serving — supporto day-zero in vLLM e SGLang.
• Azienda — Pokee AI, fondata nel 2024 da Zheqing (Bill) Zhu, già responsabile del reinforcement learning applicato presso Meta; round seed da 12 milioni di dollari guidato da Point72 Ventures con Qualcomm Ventures e Samsung NEXT.
I pesi sono chiusi. I media hanno descritto il modello come closed-source "per ora", che è una riserva di Pokee piuttosto che un impegno, e non c'è alcuna data o licenza annunciata per un rilascio.

L'architettura che nessuno descriverà
Pokee attribuisce la finestra di 10M a una "architettura proprietaria non solo decoder." Questa frase è l'intera informativa tecnica. La console collega a un rapporto tecnico intitolato Pokee-Isaac 28B v0: Un modello agente efficiente nel contesto da 10M token, datato 3 agosto 2026; non abbiamo potuto accedere a una copia pubblica di esso, e i materiali di lancio accessibili non nominano il meccanismo di attenzione, lo schema di memoria o la ricetta di addestramento.
Ciò che Pokee ha detto sulla discendenza è più specifico, ed è un'affermazione un po' scomoda: alcuni dei pesi di Isaac derivano da un fine-tuning di Qwen3.6-27B sotto la sua licenza Apache-2.0, altri pesi sono stati addestrati da zero da Pokee, e il risultato è "non un fine-tuning convenzionale." È una frase accurata. Concede la base e nega la caratterizzazione allo stesso tempo.
È anche sufficiente a limitare le congetture, che è ciò che la comunità di ricerca sull'IA ha subito iniziato a fare. Il ricercatore che pubblica come @teortaxesTex ha delineato il set di vincoli il giorno del lancio — parzialmente fine-tuned da Qwen3.6-27B, non decoder-only, contesto da 10M, 28B totali — e ha proposto due candidati: "una sorta di Memory Sparse Attention potenziata" o "semplicemente un document encoder da 1B." Entrambe le congetture meritano di essere comprese, perché non sono campate in aria.
Partiamo dall'aritmetica. Qwen3.6-27B è un modello denso da 27B con una finestra nativa di 262K, attenzione ibrida gated-delta e un encoder visivo che può essere omesso per eseguire il modello in modalità solo testo. Isaac è da 28B ed è solo testo. Se si elimina la torre visiva del modello base e si aggiungono circa un miliardo di parametri di qualcos'altro, si arriva esattamente a 28B. Un encoder di documenti o memoria da ~1B agganciato a un decoder da 27B è la lettura più parsimoniosa del conteggio dei parametri pubblicato da Pokee, e renderebbe l'etichetta "non-solo-decoder" letteralmente vera senza essere un'affermazione nuova.
L'ipotesi della Memory Sparse Attention punta a una linea di lavoro reale e recente: l'articolo MSA (arXiv:2603.23516) combina l'attenzione sparsa scalabile con la RoPE per documento per ottenere complessità lineare in training e inferenza, aggiunge la compressione della KV-cache insieme a uno schema "Memory Parallel" e riporta un degrado inferiore al 9% da 16K fino a 100M token, con inferenza a 100M token eseguita su due A800. È la stessa forma di risultato che Pokee rivendica, un ordine di grandezza più avanti, da un gruppo diverso. Nulla collega i due lavori al di là della forma — MSA non è un lavoro di Pokee e Pokee non l'ha citato — ma dimostra che un design a memoria disaccoppiata che raggiunge queste lunghezze su hardware modesto è una cosa pubblicata e plausibile, non un'impossibilità di marketing.
C'è un numero nei materiali stessi di Pokee che supporta silenziosamente la lettura dell'encoder separato. Il throughput di prefill su una singola B200 è di 42,400 token/secondo con un contesto di 1M di token e di 137,200 token/secondo a 10M. Il throughput aumenta di oltre tre volte quando il contesto diventa dieci volte più lungo. Un decoder che paga costi di attenzione quadratici fa l'opposto. Qualunque cosa stia consumando quei token diventa più efficiente per token man mano che li aggiungi, che è la firma di una passata di codifica in blocco sui documenti piuttosto che un prefill ordinario.
Perché tutto questo è rilevante per chi deve decidere se usare il modello: se la finestra da 10M è un encoder di documenti più una memoria compressa, piuttosto che una cache KV con 10M di voci, allora il "contesto" qui non è l'oggetto attorno a cui sono costruite le tue intuizioni. Come si comporta quando aggiungi elementi a una conversazione, modifichi un documento nel mezzo di un corpus, o ti aspetti che il prefisso caching funzioni, non è specificato, e la documentazione di Pokee non elenca alcun meccanismo di caching. Non puoi dedurre questi comportamenti dalla scheda tecnica, e al momento non puoi dedurli nemmeno dall'architettura.
RULER a 10M è un numero reale in una stanza vuota
L'evidenza di lungo contesto di Pokee è RULER, eseguito a 256K, 512K, 1M, 2M, 4M e 10M, con dieci campioni per configurazione. Isaac ottiene 96.9, 96.7, 95.0, 95.8, 96.7 e 93.3 su queste sei lunghezze — l'unico modello del panel che registra un punteggio per ciascuna.
Il pannello sotto 1M è dove vive la lettura onesta:
• A 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, e 0.0 sia per Claude Haiku 4.5 che per Qwen 3.5 122B, le cui finestre si fermano al di sotto di quella lunghezza.
• Con 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.
• A 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 e GPT-5.6 Luna 0.0, entrambi gli ultimi due segnalati come errori di overflow del contesto.
• A 2M e oltre — solo Isaac, tutto il resto 0.0.
Seguono tre cose. In primo luogo, fino a 1M, il margine di Isaac sul campo è di uno o due punti, non una generazione — e l'unico riferimento che rimane vicino, Nemotron 3 Super 120B, è un modello da 120B le cui cifre da 256K a 1M sono numeri auto-dichiarati da NVIDIA, le quali Pokee segnala ed esclude dal confronto delle righe, piuttosto che spacciarle come misurate. Quindi il concorrente più vicino a quelle lunghezze non è in realtà una misurazione corrispondente, in nessuna delle due direzioni.
In secondo luogo, almeno una delle celle vuote sembra un artefatto di distribuzione piuttosto che un limite del modello. Pokee ha eseguito GPT-5.6 Luna tramite Azure e ha annotato la sua finestra come "contesto >272K", registrando un errore di overflow del contesto a 1M. La finestra documentata dal fornitore per quel modello è di circa 1,05M token, che è ciò che riporta anche la nostra pagina del modello. Un lettore che prendesse per buona la colonna 1M concluderebbe che Luna non può gestire 1M; la conclusione più sostenibile è che la distribuzione Azure testata da Pokee non era in grado di farlo.
Terzo, RULER è una suite sintetica di recupero e aggregazione, non un benchmark di ragionamento. Pokee è trasparente anche su una piega metodologica: le colonne da 256K e 512K fanno la media di tutte le 13 configurazioni di task, ma l'estrazione di parole comuni non è disponibile da 1M in poi, quindi le colonne lunghe fanno la media delle restanti 12. Il 93.3 a 10M e il 96.9 a 256K, quindi, non sono valutati esattamente sullo stesso mix di task.
Il test a lungo contesto più difficile si ferma a 1M
Il benchmark più rivelatore sulla pagina di Pokee non è RULER. È MRCR v2, un compito di co-referenza multi-round con 8 aghi in cui diversi target sono sparsi in una lunga conversazione e il modello deve recuperare e disambiguare quello specificato, quindi sia la memoria parziale che l'interferenza tra aghi ti penalizzano. Su una scala da 0 a 1, a 1M di token:
• Pokee-Isaac 28B — 0.500
• Gemini 3.5 Flash Lite — 0.205
• Nemotron 3 Super 120B — 0.067
• GPT-5.6 Luna — 0.050
• Claude Haiku 4.5 e Qwen 3.5 122B — 0.000, nulla di utilizzabile a quella lunghezza
Questo è un divario molto più ampio e molto più credibile di quello prodotto da RULER, ed è qui che la proposta del modello si concretizza realmente. Luna ottiene 95.0 su RULER a 256K e 0.050 su MRCR a 1M; il richiamo a target singolo e la disambiguazione multi-ago non sono la stessa abilità, e la seconda collassa per prima. Isaac degrada in modo molto più graduale.
È anche la più grande lacuna probatoria nel lancio. MRCR v2 è stato eseguito a 256K, 512K e 1M — e si è fermato. I punteggi dello stesso Isaac lì sono 0,607, 0,743 e 0,500: non monotoni, e a 1M recupera metà degli aghi. Non esiste alcun risultato multi-ago pubblicato a 2M, 4M o 10M da nessuno, incluso Pokee. L'affermazione sui 10M si basa interamente sul più facile dei due test, esattamente sulle lunghezze in cui il test più difficile non è stato tentato. Se stai considerando questo modello perché vuoi mettere un corpus di 25.000 pagine in un unico prompt e fare una domanda la cui risposta è assemblata da quattro punti al suo interno, quella specifica capacità non è misurata a quella specifica lunghezza.

Nel lavoro agentico, Isaac è alla pari di Luna, non il suo superiore.
Pokee ha eseguito quattro benchmark agentici, ed è qui che la franchezza dell'azienda è davvero insolita: la sua stessa pagina riassume il risultato con Isaac in testa su due, secondo su uno e terzo su uno. Questa è una descrizione accurata, e non è la descrizione presente nella copertura del lancio.
• BFCL v4, chiamata di funzioni (valutato tramite AST e corrispondenza delle transizioni di stato piuttosto che da un giudice LLM) — Isaac 70.94 vs GPT-5.6 Luna 70.61, con Claude Haiku 4.5 a 67.52, Qwen 3.5 122B a 64.88, Gemini 3.5 Flash Lite a 64.85, Nemotron 3 Super a 33.13.
• τ³-bench, media su quattro domini (attività di assistenza clienti multi-turno con un utente simulato i cui requisiti cambiano a metà conversazione) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.
• Terminal-Bench 2.1, sottoinsieme solo testo — GPT-5.6 Luna 69.8% contro Isaac 65.1%, poi Gemini 3.5 Flash Lite e Qwen 3.5 122B a pari merito al 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.
• MCP-Atlas, copertura delle affermazioni sui server di strumenti live — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.
Un margine di 0,33 punti su BFCL v4 è parità, e la pagina di Pokee lo ammette apertamente invece di definirlo una vittoria. Considerando tutti e quattro, un modello da 28B si scambia vittorie con il livello veloce di un fornitore di frontiera su compiti agentici. Per un modello da 28B è un risultato solido. Non è il risultato che "modello agentico di classe frontier" suggerisce alla maggior parte dei lettori, e significa che il motivo per scegliere Isaac è la finestra e il perimetro di distribuzione, non l'agenticità.
Il numero di sicurezza è il migliore del pannello e comunque non è buono.
Su DTAP, una suite di prompt injection, Isaac registra il tasso di successo di attacco più basso del panel con 35.6 combinato, davanti a Claude Haiku 4.5 con 37.9, GPT-5.6 Luna con 50.1, Qwen 3.5 122B con 54.0, Nemotron con 60.4 e Gemini 3.5 Flash Lite con 66.3. I tassi diretti e indiretti differiscono di meno di un punto, quindi la robustezza è almeno uniforme su entrambi i vettori.
Tre avvertenze, tutte provenienti dal rapporto di Pokee stesso piuttosto che dai critici. Le misurazioni indirette sono state effettuate con le salvaguardie disattivate. I rifiuti espliciti sono scattati solo nell'1,5% dei compiti malevoli, il che, secondo Pokee, significa che la maggior parte della difesa attuale è "incidentale piuttosto che rifiutata" — il modello non tanto riconosce e respinge gli attacchi, quanto piuttosto non riesce a farsi guidare utilmente da essi. E su una classifica più ampia di 16 sistemi, anziché su questo gruppo di sei modelli, Isaac si classifica quinto negli attacchi diretti, sesto in quelli indiretti e nono per capacità: a metà classifica, non in testa.
C'è anche un costo per la sicurezza. Il tasso di successo benigno di Isaac è 82,5, inferiore all'85,1 di GPT-5.6 Luna — rifiuta o sbaglia leggermente più lavoro legittimo rispetto al modello che batte sugli attacchi. E 35,6 significa che circa un tentativo di injection su tre va ancora a segno. Per un modello il cui intero presupposto è leggere dieci milioni di token di documenti che non hai scritto, questo è il numero attorno a cui progettare le barriere di sicurezza, non il numero da cui farsi rassicurare. DTAP stesso merita una segnalazione: a differenza di RULER, BFCL e τ³-bench, non è una classifica pubblica consolidata, e non siamo riusciti a trovare documentazione indipendente della suite.
Quanto costa una chiamata da dieci milioni di token e quanto tempo si aspetta
Dieci milioni di token corrispondono a circa 7,5 milioni di parole, cioè circa 25.000 pagine. Al prezzo di Pokee di 0,15 $ per milione, riempire la finestra una volta costa 1,50 $. Aggiungendo una risposta di lunghezza massima di 60.000 token a 1,00 $ per milione, una chiamata massimale arriva a circa 1,56 $. È davvero economico per il volume di testo coinvolto, ed è il più forte semplice argomento a favore del modello.
Il tempo è il prezzo reale. Su una singola B200, Pokee riporta 72,9 secondi per il primo token a 10M — che corrisponde esattamente a 10.000.000 diviso per la cifra di prefill di 137.200 token/secondo, quindi si tratta del dato del benchmark hardware piuttosto che di una latenza API misurata. La documentazione per sviluppatori di Pokee racconta una storia diversa agli sviluppatori: prevedere almeno un timeout del client di dieci minuti per prompt multimilionari di token, perché un prompt di grandi dimensioni può richiedere "circa sette minuti a 10 milioni di token." Si tratta di un divario di circa sei volte tra la slide sul throughput e la guida all'integrazione. Entrambi sono dati di Pokee; quello nei documenti è quello a cui la configurazione del tuo timeout deve credere.
Il decode è stabile a circa 335 token/secondo, indipendentemente dalla quantità di contesto residente: una buona notizia dal punto di vista architetturale, ma scomoda dal punto di vista pratico, dato che un output completo di 60.000 token richiede circa tre minuti in aggiunta al prefill. Su hardware consumer il quadro cambia di nuovo: su una Intel Arc Pro B70, Pokee riporta 1.087–1.500 token/secondo in prefill (3,6–5× rispetto al llama.cpp standard) e 58,8 token/secondo in decode. Sono numeri rispettabili per una GPU client, ma non sono numeri da 10 milioni di token.
Due limiti pratici derivano dalla dimensione dell'input stesso. Dieci milioni di token di testo in inglese corrispondono a circa 38 MiB di testo, una quantità che rientra nel limite di 45 MiB per il corpo della richiesta ma si colloca ben al di sopra della soglia di 16 MiB; quindi ogni chiamata realmente a finestra piena deve essere trasmessa in streaming — non esiste un percorso non in streaming per la funzionalità di punta. E senza un caching dei prompt documentato sull'API di Pokee, ogni nuova interrogazione dello stesso corpus costa altri $1,50 e un altro prefill di molti minuti. La scheda del rivenditore su NanoGPT pubblica effettivamente una tariffa di lettura della cache di $0,079 per milione, che, se applicata a Isaac, rende una rilettura in cache di circa $0,79 — all'incirca metà prezzo, non lo sconto di un ordine di grandezza che il caching dei prompt comporta altrove.
Una correzione al confronto dei prezzi, perché cambia la conclusione principale. Pokee prezza GPT-5.6 Luna a $0,40/$1,80 per milione, con fonte Azure. Il prezzo di listino del fornitore per Luna dopo il taglio del 31 luglio 2026 è $0,20/$1,20, che è ciò che mostra la nostra pagina del modello, perché OrcaRouter trasmette i prezzi di listino dei provider con un markup dello 0% invece di rivenderli con un margine. Rispetto al numero corretto, Isaac è il 25% più economico in input e il 17% più economico in output rispetto al tier frontier veloce — comunque più economico, ma con un vantaggio molto più ridotto di quanto suggerisca il pannello, e il prezzo di output più basso in assoluto del pannello appartiene a Nemotron 3 Super a $0,65. Il vantaggio di prezzo di Isaac è reale; semplicemente non è la parte notevole di questo lancio.

La parte che è effettivamente nuova
Togliendo la cornice dei benchmark, resta qualcosa di insolito. Un modello da 28B con un contesto molto lungo che gira dentro una VPC, su una workstation RTX 4090, su una scheda Intel Arc Pro e su silicio mobile di classe NPU, con supporto vLLM e SGLang dal giorno zero e una licenza on-premises: una combinazione quasi introvabile altrove. Pokee sostiene inoltre un'efficienza della KV-cache circa 5× rispetto alle implementazioni standard, un dato fornito dal vendor senza riproduzione, ma è il tipo di dato che dovrebbe rivelarsi vero perché la storia del deployment regga.
Il cliente a cui questo è rivolto non è {{1}}qualcuno in cerca di un agente migliore{{/1}}. È qualcuno con un corpus ampio, sensibile e perlopiù statico — {{2}}set di contratti, fascicoli di casi, un codebase monolitico, mesi di log{{/2}} — che {{3}}legalmente o politicamente non può uscire da un perimetro{{/3}}, e che altrimenti si troverebbe a costruire una pipeline di retrieval per aggirare una finestra di 200K. Rispetto a quell'alternativa, la proposta non è {{4}}"più economico della RAG."{{/4}} L'embedding e il retrieval su oltre 25.000 pagine costano centesimi per query, e sempre costeranno. La proposta è che non c'è {{5}}nessuna strategia di chunking da ottimizzare, nessun recall di retrieval da perdere e nessun secondo sistema da tenere sincronizzato con il primo{{/5}}. Se questo compromesso valga 1,50 dollari e diversi minuti per query dipende interamente da quanto spesso si interroga.
Chi dovrebbe provarlo ora, e chi dovrebbe aspettare
Provalo ora se stai facendo prototipi su un corpus nell'intervallo 1M–4M, dove i numeri di Isaac sono più solidi e le alternative sono davvero scarse, o se la distribuzione on-premise a 28B è il requisito che ti ha bloccato. Le dieci richieste concorrenti del livello gratuito sono sufficienti per scoprire se il modello legge i tuoi documenti nel modo di cui hai bisogno.
Aspetta se ti serve specificamente il numero da 10M e le domande che poni sono multi-hop, perché è proprio quella combinazione che nessuno ha mai misurato. Aspetta se ti serve un input multimodale, che il modello non accetta. Aspetta se la latenza è importante, dato che una chiamata a finestra intera richiede minuti, non secondi. E valuta l'ovvio rischio di dipendenza: questo è un modello v0, con pesi chiusi, di un'azienda con un round seed da 12 milioni di dollari, ed è l'unico modello al mondo che offre la capacità che sta vendendo. Non esiste un secondo fornitore a cui passare se dovesse sparire.
Quest'ultimo punto è la ragione pratica per mantenere onesto il confronto. Pokee-Isaac 28B oggi non è su OrcaRouter — se lo vuoi, l'API stessa di Pokee o un rivenditore è dove si trova. Ma tre dei cinque baseline rispetto a cui si misura, GPT-5.6 Luna, Gemini 3.5 Flash Lite e Claude Haiku 4.5, sono su una sola chiave OrcaRouter al prezzo di listino del fornitore, il che rende l'esperimento utile economico da allestire: esegui il tuo task reale a contesto lungo contro questi tre, alle lunghezze che supportano, e verifica se il tuo corpus ha davvero bisogno di dieci milioni di token o se invece ha bisogno di 400.000 e di un prompt migliore. Se ha bisogno di dieci milioni, hai imparato qualcosa che vale 1,50 $ a chiamata. Se non è così, hai evitato di costruire un percorso di produzione su una v0 a fonte unica.
Tre domande che meritano una risposta
Pokee-Isaac 28B è solo un fine-tune?
Non per alcun uso normale dell'espressione, anche se non è nemmeno indipendente da quella base. La posizione di Pokee è che alcuni pesi sono stati messi a punto (fine-tuned) da Qwen3.6-27B sotto licenza Apache-2.0 mentre altri sono stati addestrati da zero, e che l'architettura non è decoder-only. Entrambe le parti sono coerenti con il numero di parametri: Qwen3.6-27B è un modello denso da 27B con un encoder visivo opzionale, Isaac è da 28B e solo testo, quindi circa un miliardo di parametri di nuova meccanica ha sostituito la torre visiva. Cosa sia quella meccanica non è stato divulgato, e finché non lo sarà, "non un fine-tune convenzionale" è un'affermazione che poggia sulla parola di Pokee piuttosto che su qualcosa di verificabile. La licenza Apache-2.0 sulla base rende legale la derivazione; non rende insolita la pubblicazione chiusa del risultato, il che vale la pena notare soprattutto perché una discendenza così specifica viene raramente offerta spontaneamente.
Può davvero eseguire 10M di token su una RTX 4090?
L'affermazione sulla singola GPU e quella sui 10M provengono dallo stesso lancio, ma non dalla stessa misurazione. Ogni dato di throughput che Pokee pubblica con un contesto di 10M — 137.200 token/secondo in prefill, 72,9 secondi di tempo al primo token — è ottenuto su una singola B200. I dati relativi a RTX 4090 e Arc Pro sono reali, ma sono citati su scala molto più ridotta; i numeri dell'Arc Pro B70 sono 1.087–1.500 token/secondo in prefill, il che richiederebbe ore per un prefill di 10M token. "Distribuibile su una singola GPU a partire da una RTX 4090" va letto soprattutto come un'affermazione sul fatto che i pesi ci stiano e che il modello possa servire in modo utile, non come un'indicazione che la lunghezza di contesto di punta sia praticabile su quella scheda.
Dovrei sostituire una pipeline RAG con questo?
Non in base a questa evidenza, con un'eccezione. L'argomento per sostituire il recupero è più forte quando le tue query sono multi-hop — esattamente la modalità di fallimento che il recupero a chunk gestisce male — e le prestazioni multi-hop oltre 1M di token sono la cosa che Pokee non ha misurato. MRCR v2 si ferma a 1M, dove Isaac recupera metà degli aghi. L'eccezione è un corpus che rientra comodamente in 1M–2M token, dove i numeri misurati da Isaac sono solidi, l'attesa è di decine di secondi anziché minuti, e rimuovere un livello di recupero elimina una reale complessità operativa. Al di sopra di ciò, tratta la finestra come un modo per evitare di costruire un recupero per un prototipo, non come una ragione per eliminarne uno che funziona.
Cosa lo risolverebbe
Quattro cose, nessuna delle quali richiede di fidarsi di qualcuno. Un'esecuzione indipendente di RULER o MRCR a 2M o superiore, da parte di chiunque, sull'API pubblica. Un risultato MRCR v2 di Pokee alle lunghezze che già pubblicizza. Un report tecnico raggiungibile che nomini il meccanismo, a quel punto la questione dell'encoder smette di essere aritmetica e diventa un fatto. E un rilascio dei pesi, a cui "closed-source per ora" accenna senza promettere.
Fino ad allora, il giudizio equilibrato è più ristretto del lancio e più interessante dello scetticismo. Pokee AI ha rilasciato un modello da 28B che mantiene in modo misurabile il recupero di contesto lungo più a fondo di qualsiasi cosa si possa acquistare oggi, pareggia con un livello veloce di frontiera nel lavoro agente, è il più sicuro del proprio panel e a metà classifica contro uno più ampio, e gira in posti dove nulla della sua capacità gira. Ha inoltre scelto di pubblicare gli unici numeri che esistono sulla capacità che nessun altro offre, e di non dire come funziona. Entrambe sono scelte che una giovane azienda ha il diritto di fare. Nessuna delle due è un sostituto di qualcuno esterno all'azienda che esegue il test.
Confrontati in questo articolo1
Rilevato da questo articolo · Benchmark: Artificial Analysis · aggiornato ogni giorno
