Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 millones de tokens de contexto, y una arquitectura que Pokee no describirá

Autor

Jim Song

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Hay una columna en la comparación de lanzamiento de Pokee-Isaac 28B donde cinco de los seis modelos obtienen 0.0, y la nota al pie debajo es más interesante que el número de arriba. Con una longitud de contexto de 10 millones de tokens, el nuevo modelo 28B de Pokee AI obtiene 93.3 en RULER y en todas las bases de referencia contra las que se midió — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — no devuelve nada utilizable. La nota al pie explica que tres de esos cinco ni siquiera se pueden comprar a ninguna longitud de contexto superior a 262K. Así que la puntuación es real, y la sala está vacía. Esas son dos afirmaciones distintas, y la mayor parte de la cobertura publicada desde que el modelo apareció el 5 de agosto de 2026 las ha mezclado.

Eso no es razón para descartar lo que Pokee ha lanzado. Es una razón para ser precisos sobre qué partes de ello están demostradas, cuáles son meramente incontestadas y cuáles simplemente no están descritas. Todo lo que sigue proviene de cuatro fuentes principales: la página del modelo Pokee-Isaac en la propia consola de Pokee, la documentación para desarrolladores de Pokee, la ficha del modelo como revendedor en NanoGPT y las declaraciones de lanzamiento de Pokee AI y del fundador Zheqing (Bill) Zhu. Cada cifra de referencia en este artículo fue producida por Pokee AI. Pokee lo dice claramente: la consola afirma que cada figura «fue medida por Pokee AI en un único entorno controlado, para Isaac y para cada línea base por igual, salvo que se indique lo contrario» — y en su favor, eso significa que las líneas base se volvieron a ejecutar en lugar de copiarse de los anuncios de otros proveedores. También significa que ningún laboratorio independiente ha reproducido nada de ello y, a día de hoy, ninguno ha publicado un intento.

Lo que Pokee realmente envió

La superficie pública del modelo está inusualmente bien documentada para un lanzamiento tan reciente, por lo que vale la pena exponerla antes de llegar a las partes en disputa.

Modelo — Pokee-Isaac 28B, con versión v0, servido como pokee-isaac desde api.pokee.ai detrás de un endpoint compatible.

Tamaño y contexto — 28 mil millones de parámetros frente a una ventana de entrada de 10,000,000 de tokens; Pokee lo describe como "utilizable de extremo a extremo, no simplemente direccionable".

Salida — 60,000 tokens, que es tanto el valor predeterminado como el límite máximo.

Modalidades — entrada de texto, salida de texto. No se admiten entradas de imagen, audio ni video, lo cual es digno de mención si se tiene en cuenta de qué está hecho el modelo.

Precio — $0.15 por millón de tokens de entrada y $1.00 por millón de salida, en la propia lista de Pokee.

Funciones agénticas — llamada a funciones y salida estructurada en el esquema estándar de chat-completions; el modelo se posiciona como un agente que planifica, ejecuta y revisa, en lugar de un modelo de chat.

Límites de solicitudes — un límite de cuerpo de solicitud de 45 MiB, con cualquier contenido superior a 16 MiB que deba usar streaming SSE (stream: true más un Accept: text/event-stream como encabezado).

Límites de tasa — 500 solicitudes y 20 millones de tokens por minuto, con 10 solicitudes concurrentes en cuentas gratuitas y 25 en las de pago.

Despliegue — B200 para centro de datos, estaciones de trabajo RTX 4090/5090, tarjetas de cliente Intel Arc Pro, NPU de borde (Qualcomm e Intel Panther Lake, con AMD pendiente de confirmar), y en el dispositivo, con licencias de VPC y on-premises bajo las cuales, en palabras de Pokee, "ninguna solicitud sale de su perímetro".

Stacks de servidores — soporte desde el día cero en vLLM y SGLang.

Empresa — Pokee AI, fundada en 2024 por Zheqing (Bill) Zhu, anteriormente responsable de aprendizaje por refuerzo aplicado en Meta; ronda semilla de 12 millones de dólares liderada por Point72 Ventures con Qualcomm Ventures y Samsung NEXT.

Los pesos están cerrados. La cobertura ha descrito el modelo como de código cerrado "por ahora", lo cual es una evasiva de Pokee más que un compromiso, y no hay una fecha ni licencia anunciada para un lanzamiento.

Pokee-Isaac 28B-2

La arquitectura que nadie describirá

Pokee atribuye la ventana de 10M a una "arquitectura propietaria que no es solo de decoder". Esa frase es toda la divulgación técnica. La consola enlaza un informe técnico titulado Pokee-Isaac 28B v0: A 10M-Token Context Efficient Agentic Model, con fecha del 3 de agosto de 2026; no pudimos acceder a una copia pública del mismo, y los materiales de lanzamiento accesibles no mencionan el mecanismo de atención, el esquema de memoria ni la receta de entrenamiento.

Lo que Pokee ha dicho sobre el linaje es más específico, y es algo ligeramente incómodo de decir: algunos de los pesos de Isaac provienen de un fine-tuning de Qwen3.6-27B bajo su licencia Apache-2.0, otros pesos fueron entrenados desde cero por Pokee, y el resultado es "no es un fine-tuning convencional." Esa es una frase cuidadosa. Concede la base y niega la caracterización al mismo tiempo.

También basta para acotar la especulación, que es lo que la comunidad de investigación en IA empezó a hacer de inmediato. El investigador que publica como @teortaxesTex expuso el conjunto de restricciones el mismo día del lanzamiento — en parte afinado a partir de Qwen3.6-27B, no solo decoder, contexto de 10M, 28B total — y propuso dos candidatos: "una especie de Memory Sparse Attention mejorada" o "simplemente un codificador de documentos de 1B". Ambas conjeturas merecen ser entendidas, porque no son ociosas.

Empecemos con la aritmética. Qwen3.6-27B es un modelo denso de 27B con una ventana nativa de 262K, atención híbrida gated-delta y un codificador de visión que puede omitirse para ejecutar el modelo solo con texto. Isaac tiene 28B y es solo de texto. Si quitas la torre de visión del modelo base y añades aproximadamente mil millones de parámetros de otra cosa, 28B es exactamente donde aterrizas. Un codificador de documentos o memoria de ~1B acoplado a un decodificador de 27B es la lectura más parsimoniosa del recuento de parámetros que publicó Pokee, y haría que la etiqueta "non-decoder-only" sea literalmente cierta sin ser una afirmación novedosa.

La suposición de Memory Sparse Attention apunta a una línea de trabajo real y reciente: el artículo de MSA (arXiv:2603.23516) combina atención dispersa escalable con RoPE por documento para lograr complejidad lineal en entrenamiento e inferencia, añade compresión de caché KV además de un esquema de "Memory Parallel", y reporta menos de un 9 % de degradación desde 16K hasta 100M de tokens, con inferencia de 100M de tokens ejecutándose en dos A800. Es la misma forma de resultado que Pokee afirma, un orden de magnitud más allá, de un grupo diferente. Nada conecta a ambos más allá de la forma — MSA no es trabajo de Pokee y Pokee no lo ha citado — pero establece que un diseño de memoria desacoplada que alcanza estas longitudes en hardware modesto es algo publicado y plausible, no una imposibilidad de marketing.

Hay un número en los propios materiales de Pokee que respalda silenciosamente la lectura del codificador separado. El rendimiento de prefill en un solo B200 es de 42,400 tokens/segundo con un contexto de 1M de tokens y de 137,200 tokens/segundo con 10M. El rendimiento aumenta más de tres veces a medida que el contexto se vuelve diez veces más largo. Un decodificador que incurre en costos de atención cuadráticos hace lo contrario. Lo que sea que consuma esos tokens se vuelve más eficiente por token a medida que los añades, lo cual es la firma de una pasada de codificación masiva sobre documentos en lugar de un prefill ordinario.

Por qué todo esto importa para alguien que decide si usar el modelo: si la ventana de 10M es un codificador de documentos más una memoria comprimida en lugar de una caché KV de 10 millones de entradas, entonces "contexto" aquí no es el objeto sobre el que están construidas tus intuiciones. Cómo se comporta cuando agregas a una conversación, editas un documento en medio de un corpus o esperas que funcione el caché de prefijos no está especificado, y la documentación de Pokee no menciona ningún mecanismo de caché. No puedes razonar sobre esos comportamientos a partir de la ficha técnica, y ahora mismo tampoco puedes razonar sobre ellos a partir de la arquitectura.

RULER a 10M es un número real en una habitación vacía.

La evidencia de contexto largo de Pokee es RULER, ejecutado a 256K, 512K, 1M, 2M, 4M y 10M, con diez muestras por configuración. Isaac obtiene 96.9, 96.7, 95.0, 95.8, 96.7 y 93.3 en esas seis longitudes: el único modelo del panel que devuelve una puntuación en cada una de ellas.

El panel por debajo de 1M es donde reside la lectura honesta:

A 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, y 0.0 tanto para Claude Haiku 4.5 como para Qwen 3.5 122B, cuyas ventanas se detienen por debajo de esa longitud.

A 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

A 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 y GPT-5.6 Luna 0.0, los dos últimos marcados como errores de desbordamiento de contexto.

A 2M y más allá — Isaac solo, todo lo demás 0.0.

A continuación, tres cosas. Primero, hasta 1M, la ventaja de Isaac sobre el resto es de uno o dos puntos, no una generación — y la única referencia que se mantiene cerca, Nemotron 3 Super 120B, es un modelo de 120B cuyas cifras de 256K a 1M son números auto reportados por la propia NVIDIA, que Pokee señala y excluye de la comparación por filas en lugar de presentarlos como medidos. Así que el competidor más cercano en esas longitudes no es en realidad una medición equiparada, en ninguna de las dos direcciones.

En segundo lugar, al menos uno de los espacios en blanco parece un artefacto de implementación más que un límite del modelo. Pokee ejecutó GPT-5.6 Luna a través de Azure y anotó su ventana como ">272K de contexto", registrando un error de desbordamiento de contexto a 1M. La ventana documentada por el propio proveedor para ese modelo es de aproximadamente 1.05M tokens, que es lo que reporta nuestra propia página del modelo. Un lector que tome la columna de 1M al pie de la letra concluiría que Luna no puede hacer 1M; la conclusión más defendible es que la implementación de Azure que Pokee probó no pudo.

En tercer lugar, RULER es un conjunto sintético de recuperación y agregación, no un punto de referencia de razonamiento. Pokee también es transparente sobre un detalle metodológico aquí: las columnas de 256K y 512K promedian las 13 configuraciones de tareas, pero la extracción de palabras comunes no está disponible a partir de 1M, por lo que las columnas largas promedian las 12 restantes. Por lo tanto, el 93.3 en 10M y el 96.9 en 256K no se evalúan exactamente con la misma mezcla de tareas.

La prueba de contexto largo más difícil se detiene en 1M

El punto de referencia más revelador en la página de Pokee no es RULER. Es MRCR v2, una tarea de correferencia multi-ronda de 8 agujas donde varios objetivos están dispersos a lo largo de una conversación larga y el modelo debe recuperar y desambiguar uno específico, por lo que tanto la recuperación parcial como la interferencia entre agujas te penalizan. En una escala de 0 a 1, con 1M de tokens:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 y Qwen 3.5 122B — 0.000, nada utilizable a esa longitud

Esta es una brecha mucho más amplia y mucho más creíble que la que produce RULER, y es donde la propuesta del modelo realmente se materializa. Luna obtiene 95.0 en RULER a 256K y 0.050 en MRCR a 1M; el recall de un solo objetivo y la desambiguación de múltiples agujas no son la misma habilidad, y la segunda colapsa primero. Isaac se degrada de manera mucho más elegante.

Es también el mayor vacío de evidencia en el lanzamiento. MRCR v2 se ejecutó a 256K, 512K y 1M — y se detuvo. Las puntuaciones del propio Isaac allí son 0.607, 0.743 y 0.500: no monótonas, y a 1M recupera la mitad de las agujas. No hay ningún resultado publicado de múltiples agujas a 2M, 4M o 10M por parte de nadie, incluido Pokee. La afirmación de 10M se basa enteramente en el más fácil de los dos tests, exactamente en las longitudes donde no se intentó el test más difícil. Si estás considerando este modelo porque quieres poner un corpus de 25 000 páginas en un solo prompt y hacer una pregunta cuya respuesta se ensambla a partir de cuatro lugares en él, esa capacidad específica no está medida a esa longitud específica.

Pokee-Isaac 28B-3

En cuanto al trabajo agéntico, Isaac es el par de Luna, no su superior.

Pokee ejecutó cuatro benchmarks agénticos, y aquí es donde la franqueza de la empresa es genuinamente inusual: su propia página resume el resultado como Isaac liderando dos, quedando segundo en uno y tercero en uno. Esa es una descripción precisa, y no es la descripción que aparece en la cobertura del lanzamiento.

BFCL v4, llamada a funciones (evaluado mediante coincidencia de AST y transiciones de estado en lugar de un juez LLM) — Isaac 70.94 frente a GPT-5.6 Luna 70.61, con Claude Haiku 4.5 en 67.52, Qwen 3.5 122B en 64.88, Gemini 3.5 Flash Lite en 64.85, Nemotron 3 Super en 33.13.

τ³-bench, promedio de cuatro dominios (tareas de servicio al cliente de múltiples turnos contra un usuario simulado cuyos requisitos cambian a mitad de la conversación) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, subconjunto de solo texto — GPT-5.6 Luna 69.8% vs. Isaac 65.1%, luego Gemini 3.5 Flash Lite y Qwen 3.5 122B empatados con 46.5%, Claude Haiku 4.5 34.9%, Nemotron 24.4%.

MCP-Atlas, afirma cobertura en servidores de herramientas en vivo — GPT-5.6 Luna 77.90%, Gemini 3.5 Flash Lite 76.67%, Isaac 74.59%, Qwen 3.5 122B 70.24%, Claude Haiku 4.5 56.45%, Nemotron 48.95%.

Un margen de 0.33 puntos en BFCL v4 es un empate, y la página de Pokee dice exactamente eso en lugar de llamarlo una victoria. Al considerar los cuatro en conjunto, un modelo de 28B intercambia victorias con el nivel rápido de un proveedor de vanguardia en tareas agénticas. Para un modelo de 28B, ese es un resultado sólido. No es el resultado que "modelo agéntico de clase fronteriza" implica para la mayoría de los lectores, y significa que la razón para elegir a Isaac es la ventana y el entorno de despliegue, no la agencia.

El número de seguridad es el mejor del panel y aún así no es bueno.

En DTAP, una suite de inyección de prompts, Isaac obtiene la tasa de éxito de ataque más baja del panel, con un 35,6 combinado, por delante de Claude Haiku 4.5 (37,9), GPT-5.6 Luna (50,1), Qwen 3.5 122B (54,0), Nemotron (60,4) y Gemini 3.5 Flash Lite (66,3). Las tasas directa e indirecta difieren en menos de un punto, por lo que la robustez es al menos uniforme en ambos vectores.

Tres advertencias, todas ellas del propio informe de Pokee, no de los críticos. Las mediciones indirectas se tomaron con las salvaguardas inactivas. Los rechazos explícitos se activaron solo en el 1,5 % de las tareas maliciosas, lo que Pokee describe como que la mayor parte de la defensa actual es «incidental en lugar de denegada»: el modelo no está reconociendo y rechazando ataques tanto como fallando en ser dirigido útilmente por ellos. Y frente a una tabla clasificatoria más amplia de 16 sistemas, en lugar de este panel de seis modelos, Isaac ocupa el quinto lugar en ataques directos, el sexto en indirectos y el noveno en capacidad: en la mitad de la tabla, no a la cabeza.

También hay un costo en la seguridad. La tasa de éxito benigno de Isaac es de 82.5, por debajo del 85.1 de GPT-5.6 Luna: rechaza o falla ligeramente más trabajo legítimo que el modelo al que supera en ataques. Y 35.6 significa que aproximadamente uno de cada tres intentos de inyección todavía tiene éxito. Para un modelo cuya premisa completa es leer diez millones de tokens de documentos que no escribiste, ese es el número alrededor del cual diseñar las salvaguardas, no el número que debería tranquilizarte. El propio DTAP merece una advertencia: a diferencia de RULER, BFCL y τ³-bench, no es un leaderboard público establecido, y no pudimos encontrar documentación independiente del conjunto de pruebas.

Cuánto cuesta una llamada de diez millones de tokens, y cuánto tiempo hay que esperar

Diez millones de tokens equivalen aproximadamente a 7,5 millones de palabras, o unas 25.000 páginas. Al precio de Pokee de $0,15 por millón, llenar la ventana una vez cuesta $1,50. Añade una respuesta de 60.000 tokens de longitud máxima a $1,00 por millón y una llamada máxima alcanza aproximadamente $1,56. Eso es realmente barato para el volumen de texto implicado, y es el argumento simple más sólido a favor del modelo.

El tiempo es el precio real. En un solo B200, Pokee informa 72.9 segundos hasta el primer token a 10M — que es exactamente 10,000,000 dividido por la cifra de prefill de 137,200 tokens/segundo, por lo que es el número del hardware de referencia más que una latencia de API medida. La propia documentación para desarrolladores de Pokee cuenta una historia diferente a los desarrolladores: permita al menos un tiempo de espera de diez minutos para prompts de varios millones de tokens, porque un prompt grande puede tardar "alrededor de siete minutos en 10 millones de tokens." Eso es aproximadamente una brecha de seis veces entre la diapositiva de rendimiento y la guía de integración. Ambos son números de Pokee; el de los documentos es el que su configuración de tiempo de espera tiene que creer.

La decodificación se mantiene estable en unos 335 tokens/segundo, sin importar cuánto contexto esté residente, lo cual es una buena noticia a nivel arquitectónico y una noticia incómoda en la práctica: una salida completa de 60.000 tokens tarda unos tres minutos, además del prefill. En hardware de consumo, el panorama cambia de nuevo: en una Intel Arc Pro B70, Pokee reporta entre 1.087 y 1.500 tokens/segundo de prefill (3,6–5× el llama.cpp estándar) y 58,8 tokens/segundo de decodificación. Son cifras respetables para una GPU de cliente, pero no son cifras de 10M tokens.

Dos límites prácticos se derivan del tamaño de la entrada en sí. Diez millones de tokens de inglés son aproximadamente 38 MiB de texto, lo que cabe bajo el límite de 45 MiB del cuerpo de la solicitud, pero supera con creces el umbral de 16 MiB, por lo que toda llamada realmente de ventana completa debe transmitirse por streaming; no hay una ruta sin streaming hacia la función principal. Y sin caché de prompts documentado en la API de Pokee, cada nueva consulta del mismo corpus cuesta otros $1.50 y otra prefill de varios minutos. La lista de revendedor en NanoGPT sí publica una tarifa de lectura de caché de $0.079 por millón, que si se aplica a Isaac hace que una relectura en caché cueste alrededor de $0.79 — aproximadamente la mitad del precio, no el descuento de un orden de magnitud que la caché de prompts implica en otros lugares.

Una corrección a la comparación de precios, porque cambia el titular. Pokee lista GPT-5.6 Luna a $0.40/$1.80 por millón, con Azure como fuente. El precio de lista del propio proveedor para Luna tras el recorte del 31 de julio de 2026 es de $0.20/$1.20, que es lo que muestra nuestra página del modelo, porque OrcaRouter transmite los precios de lista de los proveedores con un recargo del 0%, en lugar de revenderlos con margen. Con el número correcto, Isaac es un 25% más barato en entrada y un 17% más barato en salida que la gama de frontera rápida: sigue siendo más barato, pero la ventaja es mucho más reducida de lo que sugiere el panel, y el precio de salida más barato del panel en general pertenece a Nemotron 3 Super, a $0.65. La ventaja de precio de Isaac es real; simplemente no es la parte más notable de este lanzamiento.

Pokee-Isaac 28B-4

La parte que es realmente nueva

Si quitamos el marco de referencias comparativas, queda algo inusual. Un modelo de 28B con un contexto muy largo que se ejecuta dentro de una VPC, en una estación de trabajo con RTX 4090, en una tarjeta Intel Arc Pro y en silicio móvil de clase NPU, con soporte de vLLM y SGLang desde el día cero y una licencia on-premises: esa combinación es casi imposible de encontrar en otro lugar. Pokee también afirma una eficiencia de caché KV aproximadamente 5 veces mayor que las implementaciones estándar, una cifra del proveedor sin reproducción, pero es el tipo de cifra que tendría que ser cierta para que la historia de despliegue se sostenga.

El cliente para esto no es alguien que busque un mejor agente. Es alguien con un corpus grande, sensible y mayormente estático — conjuntos de contratos, expedientes de casos, una base de código monolítica, meses de registros — que legal o políticamente no puede cruzar una frontera, y que de otro modo estaría construyendo un pipeline de recuperación para sortear una ventana de 200K. Frente a esa alternativa, la propuesta no es "más barato que RAG". Generar embeddings y recuperar más de 25,000 páginas cuesta centavos por consulta y siempre lo hará. La propuesta es que no hay una estrategia de fragmentación que ajustar, ni recall de recuperación que perder, ni un segundo sistema que mantener sincronizado con el primero. Si ese intercambio vale $1.50 y varios minutos por consulta depende enteramente de la frecuencia con la que consultes.

Quién debería probarlo ahora, y quién debería esperar

Pruébalo ahora si estás creando prototipos contra un corpus en el rango de 1M a 4M, donde los números de Isaac son los más sólidos y las alternativas son realmente escasas, o si el despliegue local con 28B es el requisito que te ha estado bloqueando. Las diez solicitudes simultáneas del plan gratuito son suficientes para descubrir si el modelo lee tus documentos de la manera que necesitas.

Espera, si necesitas el número de 10M específicamente y las preguntas que haces son de múltiples saltos, porque esa combinación es precisamente lo que nadie ha medido. Espera, si necesitas entrada multimodal, que el modelo no acepta. Espera, si la latencia importa, ya que una llamada de ventana completa toma minutos, no segundos. Y considera el riesgo obvio de dependencia: este es un modelo v0, con pesos cerrados, de una empresa con una ronda semilla de $12M, y es el único modelo en el mundo que ofrece la capacidad que está vendiendo. No hay un segundo proveedor al que conmutar si desaparece.

Ese último punto es la razón práctica para mantener honesta la comparación. Pokee-Isaac 28B no está en OrcaRouter hoy — si lo quieres, la API propia de Pokee o un revendedor es donde se encuentra. Pero tres de los cinco puntos de referencia contra los que se mide, GPT-5.6 Luna, Gemini 3.5 Flash Lite y Claude Haiku 4.5, están en una misma clave de OrcaRouter al precio de lista del proveedor, lo que hace que el experimento útil sea barato de montar: ejecuta tu tarea real de contexto largo contra esos tres en las longitudes que soportan, y comprueba si tu corpus realmente necesita diez millones de tokens o si necesita 400.000 y un mejor prompt. Si necesita diez millones, has aprendido algo que vale $1.50 por llamada. Si no, has evitado construir una ruta de producción sobre una v0 de fuente única.

Tres preguntas que vale la pena responder

¿Es Pokee-Isaac 28B solo un ajuste fino?

No por ningún uso normal de la frase, aunque tampoco es independiente de esa base. La postura de Pokee es que algunos pesos se obtienen mediante ajuste fino de Qwen3.6-27B bajo Apache-2.0, mientras que otros se entrenaron desde cero, y que la arquitectura no es de solo decodificador. Ambas mitades son coherentes con el número de parámetros: Qwen3.6-27B es de 27B densos con un codificador de visión prescindible, Isaac es de 28B y solo de texto, así que alrededor de mil millones de parámetros de maquinaria nueva sustituyeron la torre de visión. Qué es esa maquinaria no se ha revelado y, hasta que se revele, "no es un ajuste fino convencional" es una afirmación que descansa en la palabra de Pokee, no en algo comprobable. La licencia Apache-2.0 sobre la base hace legal la derivación; no hace que el lanzamiento cerrado del resultado sea inusual, lo cual merece la pena señalar sobre todo porque un linaje tan específico rara vez se divulga voluntariamente.

¿Realmente puede ejecutar 10 millones de tokens en una RTX 4090?

La afirmación de la única GPU y la afirmación de 10M provienen del mismo lanzamiento, pero no de la misma medición. Cada cifra de rendimiento que Pokee publica con contexto de 10M — 137,200 tokens/segundo de prefill, 72.9 segundos de tiempo hasta el primer token — se obtiene en una sola B200. Las cifras de la RTX 4090 y la Arc Pro son reales, pero se citan a una escala mucho menor; los números de la Arc Pro B70 son 1,087–1,500 tokens/segundo de prefill, lo que pondría un prefill de 10M tokens en horas. "Desplegable en una sola GPU a partir de una RTX 4090" se interpreta mejor como una afirmación sobre que los pesos caben y que el modelo sirve de manera útil, no sobre que la longitud de contexto destacada sea práctica en esa tarjeta.

¿Debería reemplazar un pipeline de RAG con esto?

No con esta evidencia, con una excepción. El argumento para sustituir la recuperación es más fuerte cuando tus consultas son de múltiples saltos — exactamente el modo de fallo que la recuperación fragmentada maneja mal — y el rendimiento de múltiples saltos más allá de 1M de tokens es lo que Pokee no midió. MRCR v2 se detiene en 1M, donde Isaac recupera la mitad de las agujas. La excepción es un corpus que cabe cómodamente dentro de 1M–2M de tokens, donde las cifras medidas de Isaac son sólidas, la espera es de decenas de segundos en lugar de minutos, y eliminar una capa de recuperación reduce complejidad operativa real. Por encima de eso, trata la ventana como una forma de evitar construir recuperación para un prototipo, no como una razón para eliminar una que funciona.

¿Qué lo resolvería?

Cuatro cosas, ninguna de las cuales requiere confiar en nadie. Una ejecución independiente de RULER o MRCR a 2M o más, por cualquiera, en la API pública. Un resultado de MRCR v2 de Pokee a las longitudes que ya anuncia. Un informe técnico accesible que nombre el mecanismo, punto en el cual la cuestión del codificador deja de ser aritmética y se convierte en un hecho. Y una liberación de pesos, que «código cerrado por ahora» sugiere sin prometer.

Hasta entonces, el resumen justo es más estrecho que el lanzamiento y más interesante que el escepticismo. Pokee AI ha lanzado un modelo de 28B que mantiene de forma medible la recuperación de contexto largo más allá que cualquier cosa que puedas comprar actualmente, empata incluso con un nivel rápido de frontera en trabajo agéntico, es el más seguro de su propio panel y de mitad de tabla frente a uno más amplio, y se ejecuta en lugares donde nada de su capacidad se ejecuta. También ha elegido publicar los únicos números que existen sobre la capacidad que nadie más ofrece, y no decir cómo funciona. Ambas son decisiones que una empresa joven puede tomar. Ninguna sustituye a que alguien fuera del edificio ejecute la prueba.

Comparados en este artículo1

Detectado en este artículo · Benchmarks: Artificial Analysis · actualizado a diario

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

Contáctanos

Únete a la comunidad

DiscordEmailXGitHubYouTube