Una tarjeta hero generada titulada 'Claude Haiku 5.5 vs PPLX 27B' con el antetítulo '$0.00 POR TOKEN NO ES GRATIS' y chips que indican sin hardware frente a unos $4,500, 1M frente a 262K de contexto, y nube frente a en el dispositivo.
Guides & Insights

Claude Haiku 5.5 vs PPLX 27B: $0.00 por token no es lo mismo que gratis

Autor

Gideon Frost

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

PPLX 27B no cuesta nada por token. Se ejecuta de forma local, en hardware que es tuyo, y una vez comprado el hardware, el costo marginal del siguiente token es realmente cero. Claude Haiku 5.5 cuesta $0.10 por millón de tokens de entrada y $0.50 por millón de salida —una cifra lo bastante pequeña como para que valga la pena hacer bien la resta en vez de aceptar la conclusión obvia. Una máquina capaz de ejecutar PPLX 27B bien es una DGX Spark de unos $4,500 o una computadora de escritorio con una tarjeta RTX de 24 GB o más, y $4,500 en tokens de salida de Claude Haiku 5.5 son alrededor de nueve mil millones de ellos. Así que la pregunta que realmente plantea esta comparación no es cuál es más barato. Es cuántos tokens esperas quemar, y si la respuesta a eso cambia porque los tokens están sobre tu escritorio.

Claude Haiku 5.5 es el modelo pequeño del proveedor, lanzado el 7 de octubre de 2026. PPLX 27B fue anunciado por Perplexity el 25 de agosto de 2026 junto con Portable Computer, construido con NVIDIA, y es una versión post-entrenada del Qwen 3.8 27B de pesos abiertos, ajustada para el propio harness de Perplexity. Ninguno es un reemplazo directo del otro, y ninguno está en el catálogo de OrcaRouter.

Los dos modelos, y por qué uno de ellos vive en tu escritorio

Claude Haiku 5.5 — ID claude-haiku-5-5, entrada de texto e imágenes, salida de texto, contexto de 1 M de tokens, salida máxima de 128.000 tokens con una ruta beta de 300.000 tokens en la Batch API, fecha de corte de entrenamiento en junio de 2026 y el compromiso de no retirarlo antes del 7 de octubre de 2027. El esfuerzo abarca de Low a Max con Medium como valor predeterminado, el pensamiento adaptativo está activado de forma predeterminada, las lecturas de caché cuestan $0.01 por millón de tokens y Batch reduce la tarifa a la mitad. Es un producto alojado: envías tokens, recibes tokens, nunca ves una GPU.

PPLX 27B — un modelo denso de 27 mil millones de parámetros derivado de Qwen 3.8 27B y entrenado posteriormente para el harness de agentes propio de Perplexity. Se ejecuta dentro de Portable Computer en un DGX Spark o en una máquina Linux con una tarjeta NVIDIA RTX de 24 GB o más, y no sale de esa máquina. Un modo híbrido añadido el 1 de septiembre de 2026 lo empareja con un modelo en la nube para trabajos más pesados tras una Privacy Gate en el dispositivo; la compatibilidad de Linux para RTX llegó el 3 de septiembre; la compatibilidad de Windows para tarjetas RTX de 24 GB o más llegó el 14 de septiembre, junto con MCP local y tareas programadas. Los pesos post-entrenados son propietarios y están detrás de una suscripción Perplexity Pro o Max.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• Las dimensiones, una por línea

• Costo marginal por token — Claude Haiku 5.5: $0.10 por millón de entrada y $0.50 de salida hasta 100K tokens de prompt, luego $0.50 y $2.50; PPLX 27B, nada, una vez que se paga el hardware.

• Costo inicial — nada más allá de una clave de API para Claude Haiku 5.5; aproximadamente $4,500 para un DGX Spark, o un equipo de escritorio con una tarjeta NVIDIA RTX de 24 GB o más, para PPLX 27B.

• Ventana de contexto — 1.000.000 de tokens para Claude Haiku 5.5 frente a unos 262.144 heredados de Qwen 3.8 27B.

• Salida máxima — 128.000 tokens para Claude Haiku 5.5, con un encabezado beta de 300.000 tokens en Batch; no publicado para PPLX 27B.

• Adónde van los datos: la nube de Anthropic frente a tu propia máquina, con la Privacy Gate del modo híbrido decidiendo qué sale de ella.

• Puntuación independiente — Índice de Inteligencia de Artificial Analysis 43 para Claude Haiku 5.5, configuración Max 43.40, segundo de 182; nada publicado para PPLX 27B, que Artificial Analysis no monitorea.

• Velocidad de salida — 243,4 tokens por segundo para Claude Haiku 5.5; depende de tu GPU para PPLX 27B y no es comparable sin una cifra publicada.

• Modalidades de entrada — texto e imágenes frente a texto, heredadas de una base multimodal.

• Pesos — de propiedad exclusiva en ambos casos, pero por razones diferentes: no se publican los pesos frente a un postentrenamiento restringido que requiere una suscripción para obtenerlo.

El hardware es el precio, y el precio es la prueba de honestidad.

«Gratis» es la palabra equivocada para la inferencia local, y los proveedores lo saben, por eso la cifra que citan siempre es el costo marginal. La comparación correcta es un punto de equilibrio: una máquina de $4,500, con Claude Haiku 5.5 a $0.50 por millón de tokens de salida, equivale a nueve mil millones de tokens de salida antes de que el hardware se pague por sí mismo. Un equipo que genera cien millones de tokens de salida al mes alcanza ese punto en unos siete años y medio, para cuando la GPU ya está obsoleta. Un equipo que genera cinco mil millones al mes lo alcanza en menos de dos meses.

Ambas respuestas son correctas, y lo son para empresas diferentes. Esa es precisamente la razón por la que esta comparación no puede resolverse en una hoja de especificaciones, y también por la que la aritmética anterior ignora todo lo que hace que la inferencia local sea costosa en la práctica: la electricidad, el espacio en rack, la persona que se encarga de las actualizaciones de controladores y el hecho de que una máquina en un escritorio es un punto único de fallo a menos que hayas comprado dos. Añade eso y el punto de equilibrio se aleja aún más.

Lo que la inferencia local ofrece por ese dinero no es el costo en absoluto. Es la garantía de que un prompt nunca sale del edificio, algo que vale más que cualquier tarifa por token para un equipo legal, médico o cercano al ámbito de la defensa, y ningún descuento que ofrezca Anthropic puede sustituirla. A la inversa, el contexto de 1M de tokens y el límite de salida de 128.000 tokens de Claude Haiku 5.5 son cosas que no se pueden comprar a ningún precio en una tarjeta de 24 GB, y una máquina de $4.500 no cambia eso.

Qué mide realmente el 85.4%

El número publicado por Perplexity para PPLX 27B es del 85,4% en su propio Local Knowledge Work Bench de 53 tareas, frente al 82,6% del mismo arnés de evaluación ejecutado sobre la base Qwen 3.8 27B sin ajustar, el 77,6% para Pi y el 74,0% para Hermes. Hay tres cosas al respecto que merecen decirse sin rodeos, porque la cobertura del lanzamiento por lo general no las mencionó.

Está reportado por el proveedor y no ha sido reproducido de forma independiente. Es una comparación en el propio entorno de evaluación del proveedor, que es la prueba más justa posible para un modelo postentrenado en ese entorno: la mejora sobre el modelo base es en parte una mejora en ajustarse a la prueba. Y mide específicamente el trabajo de conocimiento local: recuperación, síntesis, manejo de documentos, las tareas para las que está diseñado Portable Computer. No es una puntuación de capacidad general y no debería interpretarse como tal.

El modelo base es otra historia. Qwen 3.8 27B es denso, tiene licencia Apache-2.0, es multimodal y se publicó el 14 de agosto de 2026 con una ventana de contexto nativa de 262.144 tokens, y Artificial Analysis puntúa su configuración de razonamiento con un Intelligence Index de 44 —un punto por encima del 43,40 de Claude Haiku 5.5, a un precio distinto. PPLX 27B es ese modelo más el postentrenamiento de Perplexity, así que la lectura honesta es que los pesos subyacentes están dentro de la banda de capacidad de Claude Haiku 5.5 y que el ajuste los desplazó hacia la carga de trabajo de un proveedor. Cuál de esas dos cosas estás comprando es la pregunta que el 85,4 % está diseñado para no responder.

Donde Claude Haiku 5.5 gana sin necesidad de un benchmark

Contexto largo, primero: 1M de tokens frente a unos 262K, y 128,000 tokens de salida máxima frente a una cifra no publicada. Entrada de imágenes, segundo, que la línea Qwen 3.8 incorpora pero que el harness de Perplexity no anuncia. Control de esfuerzo, tercero, y es el subestimado — el ajuste Low existe específicamente para que puedas dejar de pagar por tokens de razonamiento en llamadas que no los necesitan, lo cual es una palanca de costos que ningún modelo local ofrece porque no hay factura que reducir.

Y disponibilidad, cuarto. Claude Haiku 5.5 es una cadena de modelo en una API, y los números independientes existen: Intelligence Index 43 en general y 43.40 en Max effort, segundo de 182, a $0.21 por tarea de índice y 243.4 tokens de salida por segundo con aproximadamente 0.3 segundos hasta el primer token. Cuando estás decidiendo si una carga de trabajo está lista para moverse, una puntuación publicada que no calculaste tú mismo vale más que un número más rápido que sí calculaste.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Dónde gana PPLX 27B sin necesidad de un benchmark

La privacidad es lo primero y lo más importante: los tokens nunca salen de la máquina, algo que ningún modelo alojado puede igualar. El coste a escala es lo segundo, y es real a partir de unos pocos miles de millones de tokens de salida al mes. El funcionamiento sin conexión es lo tercero: un portátil en un sótano sin conexión sigue respondiendo, y Claude Haiku 5.5 no. Y el modo híbrido añadido el 1 de septiembre es el diseño más interesante del producto: un modelo local que hace el trabajo rutinario con un modelo en la nube detrás de una compuerta en el propio dispositivo para las llamadas difíciles es precisamente cómo se consiguen tanto la privacidad como la capacidad, y es la arquitectura que la mayoría de los equipos debería copiar, sin importar a qué proveedor se la compren.

Lo que PPLX 27B no ofrece es una respuesta portátil. Está vinculado a Portable Computer, requiere una suscripción para obtener los pesos, y los pesos son un derivado del modelo de otra persona — así que la licencia que realmente posees es la de Perplexity, no la Apache-2.0. Si el objetivo es un modelo que puedas bifurcar y distribuir, el Qwen 3.8 27B base es el que tiene la licencia permisiva, pero ese es un modelo diferente del que trata este artículo.

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Ejecutar cualquiera de los dos con una sola tecla, y dónde se detiene eso

PPLX 27B no llega a través de una API en absoluto: se ejecuta dentro de Portable Computer en tu propio hardware, y el modo híbrido alcanza un modelo en la nube que Perplexity elige al otro lado de Privacy Gate. Claude Haiku 5.5 está disponible a través de la propia API de Anthropic y, desde allí, dondequiera que se revendan los modelos de Anthropic. Ninguno de los dos está en el catálogo de OrcaRouter, y no vamos a sugerir lo contrario — lo que enrutamos de estas dos familias es anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 y anthropic/claude-fable-5.1, y por separado la base Qwen 3.8 27B sobre la que se post-entrena PPLX 27B, que está en el catálogo en qwen/qwen3.8-27b y autoalojado en nuestra propia infraestructura.

Ese último punto es el práctico. Si la razón por la que estabas considerando PPLX 27B eran los pesos subyacentes de Qwen 3.8 27B, más que la ejecución local, puedes tener el modelo base a través de una única API para más de 200 modelos, una sola clave y una sola factura, con el precio de lista del proveedor traspasado con un margen del 0 % y conmutación por error automática entre proveedores por debajo. Si lo que realmente necesitas es que el prompt nunca salga de la máquina, ninguna puerta de enlace es la respuesta, y Portable Computer sí lo es.

La decisión, sin pretender que los números lo zanjen

Si tus prompts no pueden salir de tu infraestructura, PPLX 27B es el único de estos dos que existe para ti, y los $4,500 no son una comparación de costos — es el precio de una restricción que no puedes negociar para eliminarla. Si consumes más de unos pocos miles de millones de tokens de salida al mes, la ruta local se paga sola en un trimestre y luego sigue rindiendo.

Si ninguna de esas dos cosas es cierta, Claude Haiku 5.5 es la mejor compra casi a cualquier volumen: sin hardware, sin operaciones, una ventana de 1M de tokens, un límite de salida de 128.000 tokens, entrada de imágenes, un dial de esfuerzo que reduce el costo a demanda, una puntuación independiente publicada de 43 y un precio de $0.10 y $0.50 por millón que sitúa el punto de equilibrio frente a una estación de trabajo a unos nueve mil millones de tokens de distancia. La cifra de $0.00 por token es cierta. Simplemente no es toda la resta.

Si la razón por la que estabas mirando PPLX 27B eran los pesos de Qwen 3.8 27B que tiene debajo y no la ejecución local, puedes tener el modelo base a través de una API para más de 200 modelos, una sola clave y una sola factura, con el precio de lista del proveedor pasado tal cual con un 0 % de margen y conmutación por error automática entre proveedores.