Pokee-Isaac 28B-1
Engineering & Research

Pokee-Isaac 28B: 10 Milhões de Tokens de Contexto, e uma Arquitetura que a Pokee Não Descreve

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Há uma coluna na comparação de lançamento do Pokee-Isaac 28Bem que cinco dos seis modelos obtêm 0,0, e a nota de rodapé sob ela é mais interessante que o número acima dela. Com um comprimento de contexto de 10 milhões de tokens, o novo modelo 28B da Pokee AI obtém 93,3 no RULER, e nenhuma das linhas de base contra as quais foi medido — GPT-5.6 Luna, Gemini 3.5 Flash Lite, Claude Haiku 4.5, Nemotron 3 Super 120B, Qwen 3.5 122B — retorna nada utilizável. A nota de rodapé explica que três desses cinco não podem ser adquiridos em nenhum comprimento de contexto acima de 262K. Portanto, a pontuação é real, e a sala está vazia. São duas afirmações diferentes, e a maior parte da cobertura publicada desde que o modelo apareceu em 5 de agosto de 2026 tem tratado as duas como se fossem uma coisa só.

Isso não é motivo para descartar o que a Pokee entregou. É um motivo para ser preciso sobre quais partes disso são demonstradas, quais são meramente incontestadas e quais simplesmente não são descritas. Tudo abaixo vem de quatro fontes primárias: a página do modelo Pokee-Isaac no próprio console da Pokee, a documentação para desenvolvedores da Pokee, a listagem do revendedor do modelo no NanoGPT e as declarações de lançamento da Pokee AI e do fundador Zheqing (Bill) Zhu. Cada número de benchmark neste artigo foi produzido pela Pokee AI. A Pokee diz isso claramente — o console afirma que cada número "foi medido pela Pokee AI em um único ambiente controlado, para Isaac e para cada baseline igualmente, salvo indicação em contrário" — e, para seu crédito, isso significa que os baselines foram reexecutados em vez de copiados dos anúncios de outros fornecedores. Também significa que nenhum laboratório independente reproduziu qualquer parte disso e, até hoje, nenhum publicou uma tentativa.

O que a Pokee realmente entregou

A superfície pública do modelo é excepcionalmente bem documentada para um lançamento tão recente, então vale a pena apresentá-la antes de chegarmos às partes contestadas.

Modelo — Pokee-Isaac 28B, versão v0, servido como pokee-isaac de api.pokee.ai atrás de um endpoint compatível.

Tamanho e contexto — 28 bilhões de parâmetros em uma janela de entrada de 10.000.000 de tokens; a Pokee o descreve como "utilizável de ponta a ponta, não meramente endereçável."

Saída — 60.000 tokens, que é tanto o padrão quanto o limite máximo.

Modalidades — texto entra, texto sai. Entradas de imagem, áudio e vídeo não são suportadas, o que é digno de nota, dado o material a partir do qual o modelo é construído.

Preço — $0,15 por milhão de tokens de entrada e $1,00 por milhão de saída, na própria lista da Pokee.

Recursos agênticos — chamada de funções e saída estruturada no esquema padrão de chat-completions; o modelo é posicionado como um agente que planeja, executa e revisa, em vez de um modelo de chat.

Limites de requisição — um limite de 45 MiB para o corpo da requisição, com qualquer valor acima de 16 MiB exigindo o uso de streaming SSE (stream: true além de um cabeçalho Accept: text/event-stream).

Limites de taxa — 500 requisições e 20 milhões de tokens por minuto, com 10 requisições simultâneas em contas gratuitas e 25 em pagas.

Implantação — datacenter B200, estações de trabalho RTX 4090/5090, placas de cliente Intel Arc Pro, NPUs de borda (Qualcomm e Intel Panther Lake, com a AMD listada como pendente), e no dispositivo, com licenciamento VPC e on-premises sob o qual, nas palavras de Pokee, "nenhuma solicitação sai do seu perímetro."

Stacks de serving — suporte desde o dia zero em vLLM e SGLang.

Empresa — Pokee AI, fundada em 2024 por Zheqing (Bill) Zhu, anteriormente chefe de aprendizado por reforço aplicado na Meta; rodada seed de US$ 12M liderada pela Point72 Ventures, com Qualcomm Ventures e Samsung NEXT.

Os pesos estão fechados. A cobertura descreveu o modelo como código-fonte fechado "por enquanto", o que é uma ressalva da própria Pokee, e não um compromisso, e não há data ou licença anunciada para um lançamento.

Pokee-Isaac 28B-2

A arquitetura que ninguém descreverá

Pokee atribui a janela de 10M a uma "arquitetura proprietária não exclusivamente baseada em decodificador". Essa frase é toda a divulgação técnica. O console fornece um link para um relatório técnico intitulado Pokee-Isaac 28B v0: Um Modelo Agêntico Eficiente em Contexto de 10M de Tokens, datado de 3 de agosto de 2026; não conseguimos acessar uma cópia pública dele, e os materiais de lançamento acessíveis não mencionam o mecanismo de atenção, o esquema de memória ou a receita de treinamento.

O que Pokee disse sobre a linhagem é mais específico, e é uma afirmação um tanto estranha: alguns dos pesos de Isaac são derivados de fine-tuning do Qwen3.6-27B sob sua licença Apache-2.0, outros pesos foram treinados do zero por Pokee, e o resultado é "não um fine-tuning convencional." Essa é uma frase cuidadosa. Ela concede a base e nega a caracterização ao mesmo tempo.

Também é suficiente para restringir a adivinhação, que é o que a comunidade de pesquisa em IA imediatamente começou a fazer. O pesquisador que publica como @teortaxesTex estabeleceu o conjunto de restrições no dia do lançamento — parcialmente ajustado a partir do Qwen3.6-27B, não apenas decodificador, contexto de 10M, total de 28B — e propôs dois candidatos: "algum tipo de Memory Sparse Attention turbinada" ou "apenas um codificador de documento de 1B." Ambos os palpites merecem ser compreendidos, pois não são infundados.

Comece pela aritmética. O Qwen3.6-27B é um modelo denso de 27B com janela nativa de 262K, atenção híbrida gated-delta e um codificador de visão que pode ser ignorado para executar o modelo apenas com texto. O Isaac é 28B e apenas texto. Se você remover a torre de visão do modelo base e adicionar aproximadamente um bilhão de parâmetros de outra coisa, 28B é exatamente onde você chega. Um codificador de documento ou memória de ~1B acoplado a um decodificador de 27B é a interpretação mais parcimoniosa da contagem de parâmetros que a Pokee publicou, e isso tornaria o rótulo "não-apenas-decodificador" literalmente verdadeiro sem ser uma afirmação nova.

A suposição sobre Memory Sparse Attention aponta para uma linha de trabalho real e recente: o artigo da MSA (arXiv:2603.23516) combina atenção esparsa escalável com RoPE por documento para obter complexidade linear no treinamento e na inferência, adiciona compressão de KV-cache além de um esquema "Memory Parallel", e relata menos de 9% de degradação de 16K até 100M de tokens, com inferência de 100M de tokens rodando em duas A800s. Esse é o mesmo formato de resultado que a Pokee está reivindicando, uma ordem de magnitude além, de um grupo diferente. Nada conecta os dois além do formato — a MSA não é trabalho da Pokee e a Pokee não a citou — mas isso estabelece que um design de memória desacoplada alcançando esses comprimentos em hardware modesto é algo publicado e plausível, e não uma impossibilidade de marketing.

Há um número nos próprios materiais da Pokee que apoia silenciosamente a interpretação de codificador separado. O throughput de prefill em um único B200 é de 42.400 tokens/segundo em um contexto de 1M de tokens e de 137.200 tokens/segundo em 10M. O throughput aumenta mais de três vezes à medida que o contexto fica dez vezes mais longo. Um decodificador que arca com custos de atenção quadráticos faz o oposto. O que quer que esteja consumindo esses tokens se torna mais eficiente por token à medida que você os adiciona, o que é a assinatura de uma passagem de codificação em massa sobre documentos, em vez de um prefill comum.

Por que tudo isso importa para alguém decidindo se deve usar o modelo: se a janela de 10M é um codificador de documentos mais uma memória comprimida, em vez de um cache KV de 10M de entradas, então "contexto" aqui não é o objeto em torno do qual suas intuições são construídas. Como ele se comporta quando você acrescenta algo a uma conversa, edita um documento no meio de um corpus ou espera que o cache de prefixo funcione não é especificado, e a documentação da Pokee não lista nenhum mecanismo de cache. Você não consegue raciocinar sobre esses comportamentos a partir da ficha técnica, e agora também não consegue raciocinar sobre eles a partir da arquitetura.

RULER a 10M é um número real em uma sala vazia.

As evidências de contexto longo da Pokee são o RULER, executado em 256K, 512K, 1M, 2M, 4M e 10M, com dez amostras por configuração. Isaac pontua 96,9, 96,7, 95,0, 95,8, 96,7 e 93,3 nesses seis comprimentos — o único modelo do painel que retorna uma pontuação em cada um deles.

O painel abaixo de 1M é onde a leitura honesta vive:

Com 256K — Isaac 96.9, Nemotron 3 Super 120B 96.3, GPT-5.6 Luna 95.0, Gemini 3.5 Flash Lite 94.5, e 0.0 para ambos Claude Haiku 4.5 e Qwen 3.5 122B, cujas janelas param abaixo desse comprimento.

A 512K — Isaac 96.7, Nemotron 95.7, Gemini 3.5 Flash Lite 94.6, GPT-5.6 Luna 91.4.

Em 1M — Isaac 95.0, Nemotron 91.8, Gemini 3.5 Flash Lite 29.4 e GPT-5.6 Luna 0.0, ambos os dois últimos marcados como erros de estouro de contexto.

A 2M e além — Isaac sozinho, todo o resto 0.0.

Três coisas se seguem. Primeiro, até 1M, a margem de Isaac sobre o campo é de um ou dois pontos, não uma geração — e a única linha de base que permanece próxima, Nemotron 3 Super 120B, é um modelo de 120B cujos números de 256K a 1M são números auto-relatados pela própria NVIDIA, que Pokee sinaliza e exclui da comparação de linha em vez de apresentá-los como medidos. Portanto, o concorrente mais próximo nesses comprimentos não é, na verdade, uma medição equivalente, em nenhuma direção.

Em segundo lugar, pelo menos um dos espaços em branco parece ser um artefato de implantação, e não um limite do modelo. A Pokee executou o GPT-5.6 Luna por meio do Azure e anotou sua janela como ">272K de contexto", registrando um erro de estouro de contexto em 1M. A janela documentada pelo próprio fornecedor para esse modelo é de cerca de 1,05M de tokens, que é o que a nossa própria página do modelo informa. Um leitor que leva a coluna de 1M ao pé da letra concluiria que a Luna não consegue lidar com 1M; a conclusão mais defensável é que a implantação do Azure testada pela Pokee não conseguia.

Em terceiro lugar, o RULER é um conjunto sintético de recuperação e agregação, não um benchmark de raciocínio. O Pokee também é transparente sobre uma peculiaridade metodológica aqui: as colunas de 256K e 512K calculam a média de todas as 13 configurações de tarefas, mas a extração de palavras comuns não está disponível a partir de 1M, portanto as colunas longas calculam a média das 12 restantes. Os 93,3 em 10M e os 96,9 em 256K, assim, não são avaliados exatamente na mesma combinação de tarefas.

O teste de contexto longo mais difícil para em 1M.

O benchmark mais revelador na página do Pokee não é o RULER. É o MRCR v2, uma tarefa de correferência multi-turno com 8 agulhas, em que vários alvos estão dispersos ao longo de uma longa conversa e o modelo deve recuperar e desambiguar um específico; portanto, recall parcial e interferência entre agulhas ambos contam contra você. Em uma escala de 0–1, a 1M de tokens:

Pokee-Isaac 28B — 0.500

Gemini 3.5 Flash Lite — 0.205

Nemotron 3 Super 120B — 0.067

GPT-5.6 Luna — 0.050

Claude Haiku 4.5 e Qwen 3.5 122B — 0,000, nada utilizável nesse comprimento

Esta é uma lacuna muito mais ampla e muito mais credível do que a que o RULER produz, e é aqui que a proposta do modelo realmente se concretiza. A Luna pontua 95,0 no RULER a 256K e 0,050 no MRCR a 1M; o recall de alvo único e a desambiguação multi-agulha não são a mesma habilidade, e a segunda colapsa primeiro. O Isaac degrada-se de forma muito mais suave.

É também o maior buraco probatório isolado no lançamento. O MRCR v2 foi executado em 256K, 512K e 1M — e parou. As próprias pontuações de Isaac lá são 0,607, 0,743 e 0,500: não monotônicas, e em 1M ele recupera metade das agulhas. Não há nenhum resultado publicado de múltiplas agulhas em 2M, 4M ou 10M por ninguém, incluindo a Pokee. A alegação de 10M depende inteiramente do mais fácil dos dois testes, exatamente nos comprimentos em que o teste mais difícil não foi tentado. Se você está considerando este modelo porque quer colocar um corpus de 25.000 páginas em um único prompt e fazer uma pergunta cuja resposta é montada a partir de quatro lugares nele, essa capacidade específica não foi medida nesse comprimento específico.

Pokee-Isaac 28B-3

Em trabalho agêntico, Isaac é o par de Luna, não seu superior.

Pokee executou quatro benchmarks de agentes, e é aqui que a franqueza da empresa é genuinamente incomum: sua própria página resume o resultado como Isaac liderando dois, ficando em segundo em um e em terceiro em um. Essa é uma descrição precisa, e não é a descrição na cobertura do lançamento.

BFCL v4, chamada de funções (avaliado por correspondência de AST e transição de estado, em vez de um avaliador LLM) — Isaac 70.94 vs GPT-5.6 Luna 70.61, com Claude Haiku 4.5 em 67.52, Qwen 3.5 122B em 64.88, Gemini 3.5 Flash Lite em 64.85, Nemotron 3 Super em 33.13.

τ³-bench, média de quatro domínios (tarefas de atendimento ao cliente em múltiplas interações contra um usuário simulado cujos requisitos mudam no meio da conversa) — Isaac 0.662 vs Gemini 3.5 Flash Lite 0.631, Qwen 3.5 122B 0.611, GPT-5.6 Luna 0.527, Nemotron 0.426, Claude Haiku 4.5 0.408.

Terminal-Bench 2.1, subconjunto somente texto — GPT-5.6 Luna 69,8% vs Isaac 65,1%, depois Gemini 3.5 Flash Lite e Qwen 3.5 122B empatados em 46,5%, Claude Haiku 4.5 34,9%, Nemotron 24,4%.

MCP-Atlas, cobertura de alegações em servidores de ferramentas ativos — GPT-5.6 Luna 77,90%, Gemini 3.5 Flash Lite 76,67%, Isaac 74,59%, Qwen 3.5 122B 70,24%, Claude Haiku 4.5 56,45%, Nemotron 48,95%.

Uma margem de 0,33 ponto no BFCL v4 é paridade, e a página da Pokee diz exatamente isso em vez de chamar de vitória. Considerando todos os quatro, um modelo de 28B alterna vitórias com o nível rápido de um fornecedor de fronteira em tarefas agênticas. Para um modelo de 28B, esse é um resultado forte. Não é o resultado que "modelo agêntico de classe de fronteira" implica para a maioria dos leitores, e significa que o motivo para escolher o Isaac é a janela e o envelope de implantação, não a agência.

O número de segurança é o melhor do painel e mesmo assim não é bom.

No DTAP, uma suíte de injeção de prompt, Isaac registra a menor taxa de sucesso de ataque do painel, com 35,6 no total combinado, à frente de Claude Haiku 4.5 com 37,9, GPT-5.6 Luna com 50,1, Qwen 3.5 122B com 54,0, Nemotron com 60,4 e Gemini 3.5 Flash Lite com 66,3. As taxas diretas e indiretas diferem em menos de um ponto, portanto a robustez é pelo menos uniforme entre os dois vetores.

Três ressalvas, todas vindas do próprio relato da Pokee, e não de críticos. As medições indiretas foram feitas com as salvaguardas inativas. Recusas explícitas ocorreram em apenas 1,5% das tarefas maliciosas, o que a Pokee descreve como a maior parte da defesa atual sendo "incidental em vez de recusada" — o modelo não está reconhecendo e rejeitando ataques, mas sim falhando em ser utilmente direcionado por eles. E contra um leaderboard mais amplo, de 16 sistemas, em vez deste painel de seis modelos, Isaac fica em quinto lugar em ataques diretos, sexto em indiretos e nono em capacidade: meio de tabela, não liderando.

Também há um custo para a segurança. A taxa de sucesso benigna de Isaac é 82,5, abaixo dos 85,1 do GPT-5.6 Luna — ele recusa ou atrapalha um pouco mais de trabalho legítimo do que o modelo que supera em ataques. E 35,6 significa que cerca de uma em cada três tentativas de injeção ainda vinga. Para um modelo cuja premissa inteira é ler dez milhões de tokens de documentos que você não escreveu, esse é o número em torno do qual projetar salvaguardas, não o número com o qual se tranquilizar. O próprio DTAP merece uma ressalva: ao contrário de RULER, BFCL e τ³-bench, não é um ranking público estabelecido, e não conseguimos encontrar documentação independente da suíte.

Quanto custa uma chamada de dez milhões de tokens, e quanto tempo você espera

Dez milhões de tokens equivalem a cerca de 7,5 milhões de palavras, ou aproximadamente 25.000 páginas. Com o preço de US$ 0,15 por milhão da Pokee, preencher a janela uma vez custa US$ 1,50. Acrescente uma resposta de comprimento máximo de 60.000 tokens a US$ 1,00 por milhão, e uma chamada máxima chega a cerca de US$ 1,56. Isso é genuinamente barato para o volume de texto envolvido, e é o argumento simples mais forte a favor do modelo.

O tempo é o preço real. Em um único B200, a Pokee relata 72,9 segundos até o primeiro token em 10M — o que é exatamente 10.000.000 dividido pelo valor de prefill de 137.200 tokens/segundo, portanto é o número do hardware de benchmark, e não uma latência medida de API. A própria documentação para desenvolvedores da Pokee conta uma história diferente: permita pelo menos um timeout de cliente de dez minutos para prompts com milhões de tokens, porque um prompt grande pode levar "cerca de sete minutos em 10 milhões de tokens." Isso é aproximadamente uma diferença de seis vezes entre o slide de throughput e o guia de integração. Ambos são números da Pokee; o que está na documentação é aquele em que sua configuração de timeout precisa acreditar.

A decodificação é estável em cerca de 335 tokens/segundo, independentemente da quantidade de contexto residente, o que é uma boa notícia do ponto de vista arquitetural e uma notícia desconfortável na prática: uma geração completa de 60.000 tokens leva cerca de três minutos, além do prefill. Em hardware de consumo, o cenário muda novamente — em uma Intel Arc Pro B70, a Pokee relata prefill de 1.087–1.500 tokens/segundo (3,6–5× o llama.cpp padrão) e decodificação de 58,8 tokens/segundo. Esses são números respeitáveis para uma GPU de cliente e não são números de 10 milhões de tokens.

Duas limitações práticas decorrem do tamanho da própria entrada. Dez milhões de tokens de inglês correspondem a aproximadamente 38 MiB de texto, o que cabe dentro do teto de 45 MiB do corpo da requisição, mas fica muito acima do limiar de 16 MiB — portanto, toda chamada genuinamente de janela completa precisa ser transmitida via streaming; não há caminho sem streaming para o recurso principal. E, sem cache de prompt documentado na API da Pokee, cada nova consulta ao mesmo corpus custa outros US$ 1,50 e mais um prefill de vários minutos. A listagem de revenda no NanoGPT publica uma taxa de leitura de cache de US$ 0,079 por milhão, que, se aplicável a Isaac, faz uma releitura em cache custar cerca de US$ 0,79 — aproximadamente metade do preço, não o desconto de ordem de grandeza que o cache de prompt implica em outros lugares.

Uma correção à comparação de preços, porque isso muda a manchete. A Pokee precifica o GPT-5.6 Luna a US$ 0,40/US$ 1,80 por milhão, com fonte na Azure. O preço de tabela do próprio fornecedor para o Luna após o corte de 31 de julho de 2026 é de US$ 0,20/US$ 1,20, que é o que a nossa página do modelo mostra, porque o OrcaRouter repassa os preços de tabela dos provedores com markup de 0% em vez de revender com margem. Comparando com o número correto, o Isaac é 25% mais barato no input e 17% mais barato no output do que o nível frontier rápido — ainda mais barato, mas uma vantagem muito menor do que o painel sugere, e o preço de output mais barato do painel no geral pertence ao Nemotron 3 Super, a US$ 0,65. A vantagem de preço do Isaac é real; só não é a parte deste lançamento que é notável.

Pokee-Isaac 28B-4

A parte que é realmente nova

Tirando o enquadramento de benchmark, sobra algo incomum. Um modelo de 28B com contexto muito longo que roda dentro de uma VPC, em uma estação de trabalho RTX 4090, em uma placa Intel Arc Pro e em silício móvel classe NPU, com suporte de vLLM e SGLang desde o dia zero e licença on-premises — essa combinação é praticamente indisponível em outros lugares. A Pokee também afirma uma eficiência de cache KV cerca de 5× em comparação com implementações padrão, o que é um número do fornecedor sem reprodução, mas é o tipo de número que teria que ser verdadeiro para que a história de implantação se sustente.

O cliente para isso não é alguém que está procurando um agente melhor. É alguém com um corpus grande, sensível e majoritariamente estático — conjuntos de contratos, arquivos de casos, uma base de código monolítica, meses de logs — que legal ou politicamente não pode sair de um perímetro, e que de outra forma estaria construindo um pipeline de recuperação para contornar uma janela de 200K. Contra essa alternativa, o argumento não é "mais barato que RAG". Gerar embeddings e recuperar mais de 25.000 páginas custa centavos por consulta e sempre custará. O argumento é que não há estratégia de chunking para ajustar, nenhum recall de recuperação a perder e nenhum segundo sistema para manter sincronizado com o primeiro. Se essa troca vale $1,50 e vários minutos por consulta depende inteiramente de com que frequência você consulta.

Quem deve experimentar agora, e quem deve esperar

Experimente agora se você está prototipando contra um corpus na faixa de 1M–4M, onde os números de Isaac são os mais fortes e as alternativas são realmente escassas, ou se a implantação on-premises em 28B é o requisito que tem bloqueado você. As dez solicitações simultâneas do plano gratuito são suficientes para descobrir se o modelo lê seus documentos do jeito que você precisa.

Espere, se você precisar especificamente do {{1}}número de 10M{{/1}} e as perguntas que você faz forem multi-hop, porque essa combinação é exatamente o que ninguém mediu. Espere, se você precisar de {{2}}entrada multimodal{{/2}}, que o modelo não aceita. Espere, se a latência for importante, já que uma chamada de janela completa leva minutos, não segundos. E considere o risco óbvio de dependência: este é um {{3}}modelo v0{{/3}}, com pesos fechados, de uma empresa com uma {{4}}rodada inicial de US$ 12M{{/4}}, e é o único modelo no mundo que oferece a capacidade que está vendendo. Não há um segundo provedor para o qual migrar se ele desaparecer.

Esse último ponto é a razão prática para manter a comparação honesta. Pokee-Isaac 28B não está no OrcaRouter hoje — se você quiser, ele está na API da própria Pokee ou em um revendedor. Mas três dos cinco baselines com os quais ele se compara, GPT-5.6 Luna, Gemini 3.5 Flash Lite e Claude Haiku 4.5, estão em uma única chave do OrcaRouter pelo preço de tabela do provedor, o que torna o experimento útil barato de configurar: execute sua tarefa real de contexto longo contra esses três nos comprimentos que eles suportam e veja se o seu corpus realmente precisa de dez milhões de tokens ou se precisa de 400.000 e de um prompt melhor. Se precisar de dez milhões, você aprendeu algo que vale US$ 1,50 por chamada. Se não precisar, você evitou construir um caminho de produção em um v0 de fonte única.

Três perguntas que valem a pena responder.

O Pokee-Isaac 28B é apenas um fine-tune?

Não pelo uso normal da expressão, embora também não seja independente dessa base. A posição da Pokee é que alguns pesos são ajustados a partir do Qwen3.6-27B sob Apache-2.0, enquanto outros foram treinados do zero, e que a arquitetura não é apenas decoder-only. Ambas as metades disso são consistentes com a contagem de parâmetros: o Qwen3.6-27B é 27B denso com um codificador visual que pode ser ignorado, o Isaac é 28B e somente texto, então cerca de um bilhão de parâmetros de nova maquinaria substituíram a torre de visão. O que essa maquinaria é não foi divulgado, e até que seja, "não é um ajuste fino convencional" é uma afirmação baseada na palavra de Pokee, e não em algo verificável. A licença Apache-2.0 na base torna a derivação legal; isso não torna incomum o lançamento fechado do resultado, o que vale a pena notar principalmente porque uma linhagem tão específica raramente é oferecida voluntariamente.

Será que ele realmente consegue rodar 10 milhões de tokens em uma RTX 4090?

A alegação de GPU única e a alegação de 10M vêm do mesmo lançamento, mas não da mesma medição. Cada valor de throughput publicado pela Pokee em contexto de 10M — 137.200 tokens/segundo de prefill, 72,9 segundos de tempo até o primeiro token — é em uma única B200. Os números da RTX 4090 e da Arc Pro são reais, mas citados em uma escala muito menor; os números da Arc Pro B70 são de 1.087 a 1.500 tokens/segundo de prefill, o que colocaria um prefill de 10M de tokens na casa das horas. "Implantável em uma única GPU a partir de uma RTX 4090" é melhor interpretado como uma alegação sobre os pesos caberem e o modelo servir de forma útil, e não sobre o comprimento de contexto de destaque ser prático nessa placa.

Devo substituir um pipeline RAG por ele?

Não com base nessa evidência, com uma exceção. O argumento para substituir a recuperação é mais forte quando suas consultas são multi-hop — exatamente o modo de falha que a recuperação por chunks trata mal — e o desempenho multi-hop acima de 1M de tokens é o que a Pokee não mediu. O MRCR v2 para em 1M, onde o Isaac recupera metade das agulhas. A exceção é um corpus que cabe confortavelmente em 1M–2M de tokens, onde os números medidos do Isaac são fortes, a espera é de dezenas de segundos em vez de minutos, e remover uma camada de recuperação elimina complexidade operacional real. Acima disso, trate a janela como uma forma de evitar construir recuperação para um protótipo, não como uma razão para apagar uma que funciona.

O que resolveria isso

Quatro coisas, nenhuma das quais exige confiar em ninguém. Uma execução independente de RULER ou MRCR a 2M ou mais, por qualquer pessoa, na API pública. Um resultado de MRCR v2 da Pokee nos comprimentos que ela já anuncia. Um relatório técnico acessível que nomeie o mecanismo, ponto em que a questão do codificador deixa de ser aritmética e se torna um fato. E uma liberação de pesos, que “código-fonte fechado por enquanto” acena sem prometer.

Até lá, o resumo justo é mais estreito do que o lançamento e mais interessante do que o ceticismo. A Pokee AI lançou um modelo de 28B que, de forma mensurável, sustenta a recuperação de contexto longo mais adiante do que qualquer coisa que você pode comprar atualmente, empata com um nível rápido de fronteira em trabalho agêntico, é o mais seguro do próprio painel e fica no meio do campo contra um painel mais amplo, e roda em lugares onde nada da sua capacidade roda. Também escolheu publicar os únicos números que existem sobre a capacidade que ninguém mais oferece, e não dizer como funciona. Ambas são escolhas que uma empresa jovem pode fazer. Nenhuma delas substitui alguém de fora do prédio executando o teste.

Comparados neste artigo1

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube