Una tarjeta de título principal para 'PPLX 27B Launches in Perplexity's Portable Computer' con el subtítulo 'Un agente local-first — 85.4% en trabajo de conocimiento, $0 por token', un ícono de línea de computadora de escritorio con escudo a la izquierda y un ícono de línea de chip a la derecha, y el logotipo de OrcaRouter en la esquina inferior derecha.
Guides & Insights

PPLX 27B se lanza en la computadora portátil de Perplexity: un agente local que supera a los arneses abiertos.

Autor

Rowan Sterling

Fecha de publicación

Últimos modelos · 20Ver todos los modelos
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

El PPLX 27B de Perplexity no es un modelo en la nube, y esa es toda la historia. Anunciado el 25 de agosto de 2026, junto con Portable Computer —el agente local-first de la empresa, construido con NVIDIA—, el PPLX 27B es una versión post-entrenada del modelo de pesos abiertos Qwen 3.8 27B de Alibaba, ajustado por Perplexity para su propio arnés de agentes y enviado para ejecutarse íntegramente en hardware que tú posees. En el Local Knowledge Work Bench de 53 tareas de Perplexity, el arnés que ejecuta el PPLX 27B obtuvo un 85,4 %, superando al mismo arnés con Qwen 3.8 27B (82,6 %) y a dos arneses de agentes de código abierto, Pi (77,6 %) y Hermes (74,0 %). Esas son cifras propias del proveedor, tomadas de la publicación de lanzamiento y del artículo de investigación adjunto, "A Local-First Agent for Private and Cost-Effective Knowledge Work", no reproducidas de forma independiente, pero son la primera evidencia pública de que un modelo de 27B en un escritorio puede realizar trabajo de conocimiento real a una fracción del precio de la nube.

Lo que realmente se envió

Portable Computer es la versión local de la plataforma de agentes "Computer" de Perplexity. Mientras que el anterior producto Computer ejecutaba su orquestador en la nube, Portable Computer empaqueta toda la pila en un solo sistema que se ejecuta en tu máquina: el arnés de agentes, el orquestador, el planificador, el enrutador de herramientas, el programador, una cola de tareas duradera, un índice de búsqueda local, el motor de inferencia y los conectores de aplicaciones para Google Drive, Gmail, Slack, GitHub y Outlook.

Dos propiedades lo separan de una configuración local de tipo DIY. Primero, la ejecución de código y herramientas ocurre dentro de un sandbox impuesto por el sistema operativo, y si el sandbox no está disponible, la ejecución de herramientas se desactiva en lugar de ejecutarse sin protección. Segundo, es local-first por diseño: cada tarea comienza en el dispositivo, y si un paso necesita datos web en vivo o razonamiento de vanguardia, el orquestador se detiene y pide permiso antes de escalar ese único paso a uno de los más de 15 modelos en la nube. Un clasificador de PII se ejecuta primero sobre el contexto saliente y te muestra exactamente qué saldría de la máquina.

Los dos modelos 27B

En el lanzamiento, puedes elegir entre dos modelos de 27 mil millones de parámetros. Qwen 3.8 27B es el modelo de pesos abiertos Apache-2.0 de Alibaba: un 27B denso y multimodal con una ventana nativa de 262 000 tokens, lanzado dos semanas antes y que ya es una sólida opción de autoalojamiento. PPLX 27B es esa misma base post-entrenada por Perplexity: no es una arquitectura nueva, sino un entrenamiento adicional ajustado específicamente para esta plataforma, y la empresa afirma que su comportamiento es más preciso y eficiente en sus propias cargas de trabajo de agentes. El Nemotron 3.5 Lightning (30B) de NVIDIA aparece como «próximamente», y se admiten tanto el modelo propio como el servidor de inferencia propio, por lo que la plataforma no está atada a los pesos de Perplexity.

El benchmark, y lo que no es

La cifra principal proviene del Local Knowledge Work Bench de 53 tareas, un conjunto que abarca el tipo de trabajo que un trabajador del conocimiento realmente delegaría: investigación profunda, análisis financiero, creación de documentos. Perplexity dice que planea abrir el código del benchmark, lo que eventualmente hará que la comparación sea repetible en lugar de confiar en la fe. Hasta entonces, estos resultados son ejecutados por el proveedor. En ese conjunto, según el proveedor:

• Computadora portátil con PPLX 27B — 85.4%

Computadora portátil con Qwen 3.8 27B — 82.6%

• Pi (entorno de código abierto) — 77.6%

• Hermes (banco de pruebas de código abierto) — 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

Dos resultados más reportados por los proveedores completan el panorama. En BrowseComp, el conjunto de investigación web, Computer obtuvo 66.7% frente al 50.2% de Pi y al 43.9% de Hermes, mientras usaba 51% menos tiempo real y 70% menos tokens que Pi. En ParseBench-100, una prueba de extracción de documentos, obtuvo 65.1% frente al 34.6% de Hermes y al 13.9% de Pi. Las brechas más amplias se dan en las tareas que recompensan la infraestructura propia del arnés —búsqueda, enrutamiento, uso de herramientas—, que es donde un modelo post-entrenado más una pila de integraciones construida a medida demuestra su valor.

El giro económico

El número más interesante es el precio. El trabajo completado localmente tiene un costo de cero por token y no consume créditos de Perplexity: el contador se queda en cero para una tarea completamente local. La escalada es lo único que cuesta dinero, y es opcional en cada paso. Perplexity publicó las matemáticas híbridas en Terminal Bench 2.1: el modo completamente local obtuvo un 59,6% con un costo aproximado de cero; añadir un modelo frontera como asesor lo elevó al 73,0% con unos 0,415 $ por ejecución; el modelo frontera por sí solo alcanzó el 82,4% con unos 0,65 $ por ejecución. Ese último contraste es la tesis: la inferencia local aplana la curva de costos para los agentes siempre activos, y la escalada a la nube se convierte en un gasto quirúrgico donde se paga por sí misma.

Nada de esto es gratis para empezar. La caja importa. Portable Computer se lanza primero en Linux en el NVIDIA DGX Spark, la supercomputadora de escritorio con 128GB de memoria unificada (precio de lista alrededor de $4,500), o en PC con Linux con GPUs RTX de al menos 24GB de VRAM — aproximadamente una RTX 3090 o más nueva — con 32GB recomendados. El soporte para Windows está programado para septiembre; macOS no ha sido anunciado. Y el software en sí requiere un plan de pago de Perplexity: Pro, Max, Enterprise Pro o Enterprise Max. Este es un producto de suscripción más hardware dirigido a personas que ya pagan Perplexity, no una API general.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

Dónde encaja el router

PPLX 27B no es algo que OrcaRouter enrute: se ejecuta en hardware propio, tras una suscripción de Perplexity, y no pretendemos lo contrario. Lo que sí enrutamos es el conjunto comparativo que este lanzamiento invita. Qwen 3.8 27B, los pesos base exactos a partir de los cuales PPLX 27B realiza el post-entrenamiento, está activo en OrcaRouter autoalojado; también lo están DeepSeek V4 Flash, Gemini 3.5 Flash Lite y GPT-5.6 Luna, todos tras una única clave de API al precio de lista del proveedor, con traspaso sin margen alguno, de modo que un recorte de precio del proveedor se refleja en nuestro lado el mismo día en que se anuncia.

Eso importa aquí por una razón específica. La propuesta de Portable Computer es el contraste de costos entre lo local y la nube, y la parte de la nube de ese contraste solo es tan honesta como los precios con los que comparas. En OrcaRouter, esos son los precios de lista reales del proveedor, lo que convierte la decisión entre local y nube en un cálculo en el que puedes confiar en lugar de una comparación de marketing. Y si quieres prototipar el mismo agente de ambas formas — arnés local en una máquina, modelos de nube detrás de un único endpoint — la conmutación automática permite que el lado de la nube tome el relevo cuando el modelo local se queda corto, sin un segundo contrato ni una segunda ruta de código.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

Qué ver

Tres cosas durante el próximo mes deciden si esto es un producto de nicho o el comienzo de una categoría. Si Perplexity realmente libera el código de Local Knowledge Work Bench, lo que convertiría las cifras destacadas de meras afirmaciones en algo que la comunidad pueda reproducir. Si Nemotron 3.5 Lightning llega y vence a PPLX 27B en el mismo harness — la tesis de «post-entrenar para el harness» solo es tan buena como el modelo base subyacente. Y si el soporte de Windows en septiembre amplía el alcance más allá de los propietarios de DGX Spark. Si el benchmark es real y el harness se transfiere, «ejecutar el agente en tu propia GPU» deja de ser un patrón de aficionados y se convierte en una opción de despliegue con dientes reales — y los modelos en la nube con los que se le compare tendrán que ganarse sus precios por token.

© 2026 OrcaRouter

Para proveedores

¿Operas una plataforma de inferencia? Publica tus modelos en OrcaRouter.

providers@orcarouter.ai

Únete a la comunidad

Discordsupport@orcarouter.aiXGitHubYouTube