
Claude Haiku 5.5 vs PPLX 27B: $0.00 por token não é o mesmo que gratuito
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
O PPLX 27B não custa nada por token. Ele roda localmente, no hardware que você possui, e, depois que o hardware é comprado, o custo marginal do próximo token é realmente zero. O Claude Haiku 5.5 custa US$ 0,10 por milhão de tokens de entrada e US$ 0,50 por milhão de saída — um número pequeno o suficiente para valer a pena fazer a subtração direito, em vez de aceitar a conclusão óbvia. Uma máquina capaz de rodar bem o PPLX 27B é um DGX Spark de cerca de US$ 4.500 ou um desktop com uma placa RTX de 24 GB ou mais, e US$ 4.500 em tokens de saída do Claude Haiku 5.5 equivalem a cerca de nove bilhões deles. Então, a pergunta que este confronto realmente faz não é qual dos dois é mais barato. É quantos tokens você espera queimar, e se a resposta a isso muda porque os tokens ficam na sua mesa.
Claude Haiku 5.5 é o modelo pequeno do fornecedor, lançado em 7 de outubro de 2026. O PPLX 27B foi anunciado pela Perplexity em 25 de agosto de 2026, juntamente com o Portable Computer, construído com a NVIDIA, e é uma versão pós-treinada do Qwen 3.8 27B de pesos abertos, ajustada para o próprio harness da Perplexity. Nenhum deles é um substituto direto do outro, e nenhum consta no catálogo da OrcaRouter.
Os dois modelos, e por que um deles mora na sua mesa
Claude Haiku 5.5 — ID claude-haiku-5-5, entrada de texto e imagem, saída de texto, contexto de 1M de tokens, saída máxima de 128.000 tokens com um caminho beta de 300.000 tokens na Batch API, corte de treinamento em junho de 2026 e o compromisso de não descontinuá-lo antes de 7 de outubro de 2027. O esforço vai de Low a Max, com Medium como padrão, o pensamento adaptativo está ativado por padrão, leituras de cache custam US$ 0,01 por milhão de tokens e o Batch reduz a tarifa pela metade. É um produto hospedado: você envia tokens, recebe tokens, nunca vê uma GPU.
PPLX 27B — um modelo denso de 27 bilhões de parâmetros derivado do Qwen 3.8 27B e pós-treinado para o próprio harness de agente da Perplexity. Ele roda dentro do Portable Computer em um DGX Spark ou em uma máquina Linux com uma placa NVIDIA RTX de 24 GB ou mais, e não sai dessa máquina. Um modo híbrido adicionado em 1º de setembro de 2026 o combina com um modelo de nuvem para trabalhos mais pesados, atrás de um Privacy Gate no dispositivo; o suporte do Linux para RTX chegou em 3 de setembro; o suporte do Windows para placas RTX de 24 GB ou mais chegou em 14 de setembro, junto com MCP local e tarefas agendadas. Os pesos pós-treinados são proprietários e ficam atrás de uma assinatura Perplexity Pro ou Max.

• As dimensões, uma por linha
• Custo marginal por token — Claude Haiku 5.5 US$ 0,10 por milhão de entrada e US$ 0,50 de saída até 100 mil tokens de prompt, depois US$ 0,50 e US$ 2,50; PPLX 27B nada, depois que o hardware estiver pago.
• Custo para começar — nada além de uma chave de API para o Claude Haiku 5.5; cerca de US$ 4.500 para um DGX Spark, ou um desktop com uma placa NVIDIA RTX de 24 GB ou mais, para o PPLX 27B.
• Janela de contexto — 1.000.000 de tokens para o Claude Haiku 5.5 contra cerca de 262.144 herdados do Qwen 3.8 27B.
Saída máxima — 128.000 tokens para o Claude Haiku 5.5, com um cabeçalho beta de 300.000 tokens no Batch; não publicado para o PPLX 27B.
• Para onde os dados vão — a nuvem da Anthropic contra a sua própria máquina, com o Privacy Gate do modo híbrido decidindo o que sai dela.
• Pontuação independente — Artificial Analysis Intelligence Index 43 para Claude Haiku 5.5, configuração Max 43.40, segundo de 182; nada publicado para o PPLX 27B, que a Artificial Analysis não acompanha.
• Velocidade de saída — 243,4 tokens por segundo para Claude Haiku 5.5; depende da sua GPU para PPLX 27B e não é comparável sem uma métrica publicada.
• Modalidades de entrada — texto e imagens versus texto, herdadas de uma base multimodal.
• Pesos — proprietários em ambos os casos, mas por razões diferentes: nenhum peso divulgado versus um pós-treinamento restrito que exige uma assinatura para ser obtido.
O hardware é o preço, e o preço é o teste de honestidade.
"Grátis" é a palavra errada para inferência local, e os fornecedores sabem disso, razão pela qual o número citado é sempre o custo marginal. A comparação correta é um ponto de equilíbrio: uma máquina de US$ 4.500, ao preço de US$ 0,50 por milhão de tokens de saída do Claude Haiku 5.5, equivale a nove bilhões de tokens de saída antes que o hardware se pague. Uma equipe que gera cem milhões de tokens de saída por mês chega a esse ponto em cerca de sete anos e meio, quando então a GPU já estará obsoleta. Uma equipe que gera cinco bilhões por mês chega a esse ponto em menos de dois meses.
Ambas as respostas estão corretas, e estão corretas para empresas diferentes. É exatamente por isso que esta comparação não pode ser resolvida em uma ficha de especificações, e também é por isso que a aritmética acima ignora tudo o que torna a inferência local cara na prática: a eletricidade, o espaço no rack, a pessoa responsável pelas atualizações de driver e o fato de que uma máquina sobre a mesa é um ponto único de falha, a menos que você tenha comprado duas. Acrescente esses fatores e o ponto de equilíbrio se afasta ainda mais.
O que a inferência local compra com esse dinheiro não é custo de forma alguma. É a garantia de que um prompt nunca sai das instalações, o que vale mais do que qualquer tarifa por token para uma equipe jurídica, médica ou ligada à defesa, e nenhum desconto que a Anthropic ofereça substitui isso. Em contrapartida, o contexto de 1M de tokens e o teto de saída de 128.000 tokens do Claude Haiku 5.5 são coisas que você não consegue comprar a preço algum em uma placa de 24 GB, e uma máquina de US$ 4.500 não muda isso.
O que os 85,4% realmente medem
O número publicado pela Perplexity para o PPLX 27B é 85,4% em seu próprio Local Knowledge Work Bench de 53 tarefas, contra 82,6% para o mesmo harness rodando na base Qwen 3.8 27B sem ajuste, 77,6% para o Pi e 74,0% para o Hermes. Três coisas sobre isso merecem ser ditas claramente, porque a cobertura do lançamento geralmente não as mencionou.
É reportado pelo fornecedor e não foi reproduzido de forma independente. É uma comparação no próprio harness do fornecedor, que é o teste mais justo possível para um modelo pós-treinado nesse harness — o ganho em relação ao modelo base é, em parte, um ganho em se ajustar ao teste. E mede especificamente trabalho de conhecimento local: recuperação, sumarização, tratamento de documentos, as tarefas para as quais o Portable Computer foi criado. Não é uma pontuação de capacidade geral e não deve ser lida como tal.
O modelo base é outra questão. O Qwen 3.8 27B é denso, licenciado sob Apache-2.0, multimodal e lançado em 14 de agosto de 2026 com uma janela de contexto nativa de 262.144 tokens, e o Artificial Analysis pontua sua configuração de raciocínio em 44 no Intelligence Index — um ponto acima dos 43,40 do Claude Haiku 5.5, a um preço diferente. O PPLX 27B é esse modelo mais o pós-treinamento da Perplexity, então a leitura honesta é que os pesos subjacentes estão na faixa de capacidade do Claude Haiku 5.5 e o ajuste os deslocou em direção à carga de trabalho de um fornecedor. Qual dessas duas coisas você está comprando é a pergunta que os 85,4% foram projetados para não responder.
Onde o Claude Haiku 5.5 vence sem precisar de um benchmark
Contexto longo, primeiro: 1M de tokens contra cerca de 262K, e 128.000 tokens de saída máxima contra um número não divulgado. Entrada de imagem, em segundo lugar, que a linhagem Qwen 3.8 traz, mas que o harness da Perplexity não anuncia. Controle de esforço, em terceiro lugar, e é o subestimado — a configuração Low existe especificamente para que você possa parar de pagar por tokens de raciocínio em chamadas que não precisam deles, o que é uma alavanca de custo que nenhum modelo local oferece porque não há fatura para reduzir.
E disponibilidade, quarto. Claude Haiku 5.5 é uma string de modelo em uma API, e os números independentes existem: Índice de Inteligência 43 no geral e 43,40 no Esforço Máximo, o segundo entre 182, a US$ 0,21 por tarefa de índice e 243,4 tokens de saída por segundo, com cerca de 0,3 segundos até o primeiro token. Quando você está decidindo se uma carga de trabalho está pronta para migrar, uma pontuação publicada que você não calculou por conta própria vale mais do que um número mais rápido que você mesmo obteve.

Onde o PPLX 27B vence sem precisar de um benchmark
A privacidade é a primeira e mais importante: os tokens nunca saem da máquina, o que nenhum modelo hospedado consegue igualar. O custo em volume é o segundo, e é real depois de alguns milhares de milhões de tokens de saída por mês. A operação offline é a terceira — um portátil numa cave sem ligação continua a responder, e o Claude Haiku 5.5 não. E o modo híbrido adicionado a 1 de setembro é o desenho mais interessante do produto: um modelo local a fazer o trabalho de rotina com um modelo na nuvem atrás de um gate no dispositivo para as chamadas difíceis é precisamente como se obtém privacidade e capacidade, e é a arquitetura que a maioria das equipas deveria copiar, independentemente do fornecedor a quem a compra.
O que o PPL 27B não oferece é uma resposta portável. Ele está vinculado ao Portable Computer, exige uma assinatura para obter os pesos, e os pesos são derivados do modelo de outra pessoa — então a licença que você de fato possui é da Perplexity, não a Apache-2.0. Se o objetivo é um modelo que você possa fazer fork e distribuir, o Qwen 3.8 27B base é o que tem a licença permissiva, mas esse é um modelo diferente daquele sobre o qual este artigo trata.

Executando qualquer um dos dois a partir de uma única tecla, e onde isso para
O PPLX 27B não vem por meio de uma API de forma alguma: ele é executado dentro do Portable Computer no seu próprio hardware, e o modo híbrido alcança um modelo na nuvem à escolha da Perplexity do outro lado do Privacy Gate. O Claude Haiku 5.5 está disponível por meio da própria API da Anthropic e, a partir daí, onde quer que os modelos da Anthropic sejam revendidos. Nenhum dos dois está no catálogo do OrcaRouter, e não vamos sugerir o contrário — o que roteamos dessas duas famílias é anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 e anthropic/claude-fable-5.1, e, separadamente, a base Qwen 3.8 27B a partir da qual o PPLX 27B é pós-treinado, que está no catálogo em qwen/qwen3.8-27b e auto-hospedada na nossa própria infraestrutura.
Esse último ponto é o ponto prático. Se o motivo pelo qual você estava considerando o PPLX 27B eram os pesos do Qwen 3.8 27B por trás dele, em vez da execução local, você pode ter o modelo base por meio de uma única API para mais de 200 modelos, com uma chave e uma fatura, com o preço de tabela do provedor repassado com 0% de margem e failover automático entre provedores por baixo. Se o que você realmente precisa é que o prompt nunca saia da máquina, nenhum gateway é a resposta, e o Portable Computer é.
A decisão, sem fingir que os números a resolvem
Se seus prompts não podem sair da sua infraestrutura, o PPLX 27B é o único desses dois que existe para você, e os US$ 4.500 não são uma comparação de custo — é o preço de uma restrição que você não consegue contornar por negociação. Se você estiver queimando mais de alguns bilhões de tokens de saída por mês, a rota local se paga dentro de um trimestre e depois continua compensando.
Se nenhuma dessas condições for verdadeira, o Claude Haiku 5.5 é a melhor compra em praticamente qualquer volume: sem hardware, sem operações, uma janela de 1M de tokens, um teto de saída de 128.000 tokens, entrada de imagem, um ajuste de esforço que reduz o custo sob demanda, uma pontuação independente publicada de 43 e um preço de $0,10 e $0,50 por milhão que faz o ponto de equilíbrio em relação a uma estação de trabalho ficar a cerca de nove bilhões de tokens de distância. O valor de $0,00 por token é verdadeiro. Só não é a subtração inteira.
Se o motivo pelo qual você estava considerando o PPLX 27B eram os pesos do Qwen 3.8 27B por trás dele, e não a execução local, você pode obter o modelo base por meio de uma única API para mais de 200 modelos, uma chave e uma fatura, com o preço de tabela do provedor repassado com 0% de markup e failover automático entre provedores nos bastidores.
