PPLX 27B, Perplexity의 휴대용 컴퓨터에서 출시 — 오픈 하네스를 능가하는 로컬 에이전트. 재생성된 일러스트레이션.
Guides & Insights

PPLX 27B가 Perplexity의 휴대용 컴퓨터에서 출시: 오픈 하네스를 능가하는 로컬 에이전트

작성자

Rowan Sterling

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Perplexity의 PPLX 27B는 클라우드 모델이 아니며, 그게 이야기의 전부다. 2026년 8월 25일, NVIDIA와 함께 만든 회사의 로컬 우선 에이전트인 Portable Computer와 함께 발표된 PPLX 27B는 Alibaba의 오픈웨이트 Qwen 3.8 27B를 사후 학습한 버전으로, Perplexity가 자사 에이전트 하네스에 맞게 튜닝했으며 전적으로 사용자가 소유한 하드웨어에서 실행되도록 출시되었다. Perplexity의 53개 과제 Local Knowledge Work Bench에서 PPLX 27B를 실행한 하네스는 85.4%를 기록해, 동일 하네스의 Qwen 3.8 27B(82.6%)와 두 오픈소스 에이전트 하네스인 Pi(77.6%), Hermes(74.0%)보다 앞섰다. 이는 출시 게시물과 동반 연구 논문 “A Local-First Agent for Private and Cost-Effective Knowledge Work”에 실린 벤더 자체 수치이며 독립적으로 재현된 것은 아니다 — 하지만 데스크톱의 27B 모델이 클라우드 가격의 몇 분의 일로 실제 지식 노동을 감당할 수 있다는 첫 공개 증거다. 일주일 후인 9월 1일, 같은 사후 학습 모델이 두 번째 배포에서 나타났다: Perplexity의 Computer 에이전트의 새 Mac 모드인 Hybrid Compute는 단일 작업을 클라우드 프런티어 모델과 Apple silicon에서 실행되는 PPLX 27B 사이에 나누며, 새로운 온디바이스 Privacy Gate 뒤에서 무엇이든 기기를 떠나기 전에 개인 데이터를 스캔한다. Mac 발표 이틀 후인 9월 3일, Perplexity는 Portable Computer가 이제 24GB 이상의 VRAM을 갖춘 NVIDIA RTX GPU용 Linux에서도 사용 가능하다고 밝혔다. 9월 14일, 회사는 Portable Computer가 이제 NVIDIA RTX GPU가 있는 Windows PC에서도 사용 가능하다고 밝혔다 — 회사에 따르면 로컬 우선 제안이 도달한 가장 넓은 범위이며, 가장 흔한 데스크톱 플랫폼에서 자체 하드웨어로 에이전트를 실행하는 것을 실제 배포 옵션으로 만드는 단계다. 두 주장 모두 벤더가 밝힌 것이다.

실제로 출시된 것

Portable Computer는 Perplexity의 "Computer" 에이전트 플랫폼을 기기에서 직접 실행하는 빌드입니다. 이전 Computer 제품이 오케스트레이터를 클라우드에서 실행했던 반면, Portable Computer는 전체 스택을 하나의 시스템으로 묶어 사용자의 머신에서 실행합니다. 즉, 에이전트 하네스, 오케스트레이터, 플래너, 도구 라우터, 스케줄러, 내구성 있는 작업 큐, 로컬 검색 인덱스, 추론 엔진, 그리고 Google Drive, Gmail, Slack, GitHub, Outlook용 앱 커넥터가 포함됩니다.

두 가지 속성이 이 제품을 DIY 로컬 설정과 구분 짓는다. 첫째, 코드와 도구 실행은 OS가 강제하는 샌드박스 안에서 이루어지며, 샌드박스를 사용할 수 없을 때는 보호되지 않은 채 실행하는 대신 도구 실행 자체가 비활성화된다. 둘째, 설계상 로컬 우선이다. 모든 작업은 기기에서 시작되며, 어떤 단계에 실시간 웹 데이터나 프런티어 추론이 필요하면 오케스트레이터는 해당 단계 하나를 15개 이상의 클라우드 모델 중 하나로 상향 조정하기 전에 멈추고 허락을 구한다. 기기 내 PII 분류기 — Perplexity가 이후 Privacy Gate로 제품화한 기술 — 가 먼저 외부로 나가는 컨텍스트를 살펴보고, 무엇이 기기를 떠나게 될지 정확히 보여준다.

두 27B 모델

출시 시점에 두 가지 270억 파라미터 모델 중에서 선택하게 됩니다. Qwen 3.8 27B는 Alibaba의 Apache-2.0 오픈 웨이트 모델로, 262K 토큰 네이티브 윈도를 갖춘 dense 멀티모달 27B이며, 2주 먼저 출시되어 이미 강력한 자체 호스팅 옵션입니다. PPLX 27B는 동일한 베이스를 Perplexity가 후속 학습한 것입니다. 새로운 아키텍처가 아니라 이 하네스에 특별히 맞춰 추가 학습한 모델이며, 회사는 자체 에이전트 워크로드에서 더 정밀하고 더 효율적인 동작을 보인다고 주장합니다. NVIDIA의 Nemotron 3.5 Lightning(30B)은 곧 출시 예정으로 표시되어 있고, 자체 모델 반입과 추론 서버가 모두 지원되므로 이 하네스는 Perplexity의 가중치에 묶여 있지 않습니다.

벤치마크, 그리고 그것이 아닌 것

주요 수치는 53개 작업으로 구성된 Local Knowledge Work Bench에서 비롯된 것으로, 지식 근로자가 실제로 위임할 만한 작업 유형——심층 조사, 재무 분석, 문서 작성——을 포괄하는 벤치마크입니다. Perplexity는 이 벤치마크를 오픈소스로 공개할 계획이라고 밝혔으며, 이는 결국 비교 결과를 맹신이 아니라 반복 검증 가능한 것으로 만들 것입니다. 그때까지는 이 결과는 공급업체가 실행한 것입니다. 해당 벤치마크에서 공급업체에 따르면:

• PPLX 27B 탑재 휴대용 컴퓨터 — 85.4%

Qwen 3.8 27B 탑재 휴대용 컴퓨터 — 82.6%

• Pi (오픈소스 하네스) — 77.6%

• Hermes (오픈소스 하네스) — 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

{{1}}공급업체가 보고한 두 가지 결과가 더해져 전체 그림이 완성됩니다.{{/1}} {{2}}웹 리서치 스위트인 BrowseComp에서 Computer는 Pi의 50.2%, Hermes의 43.9%에 비해 66.7%를 기록했으며, Pi보다 실제 소요 시간을 51% 덜 쓰고 토큰은 70% 더 적게 사용했습니다.{{/2}} {{3}}문서 추출 테스트인 ParseBench-100에서는 Hermes의 34.6%, Pi의 13.9%에 비해 65.1%를 기록했습니다.{{/3}} {{4}}가장 큰 격차는 하네스 자체 인프라(검색, 라우팅, 도구 사용)에 보상이 주어지는 작업, 즉 사후 훈련된 모델과 목적에 맞게 구축된 전용 파이프라인 스택이 제 몫을 하는 작업에서 나타납니다.{{/4}}

경제학의 전환

더 흥미로운 숫자는 가격이다. 로컬에서 완료된 작업은 토큰당 비용이 0이고 Perplexity 크레딧도 소모하지 않는다. 완전 로컬 작업의 카운터는 0에 머문다. 비용이 발생하는 것은 오직 에스컬레이션뿐이며, 이는 단계별로 선택할 수 있다. Perplexity는 Terminal Bench 2.1에서 하이브리드 계산 결과를 공개했다. 완전 로컬은 비용이 거의 0이면서 59.6%를 기록했다. 프런티어 모델을 어드바이저로 추가하면 롤아웃당 약 $0.415로 73.0%까지 올라갔다. 프런티어 모델 단독으로는 롤아웃당 약 $0.65로 82.4%에 도달했다. 이 마지막 대비가 핵심 주장이다. 로컬 추론은 상시 가동 에이전트의 비용 곡선을 평평하게 만들고, 클라우드 에스컬레이션은 그 비용을 스스로 상쇄하는 정밀한 지출이 된다.

이 중 어느 것도 처음부터 무료는 아니다. 박스가 중요하다. Portable Computer는 8월 25일 Linux 우선으로 출시되었는데, 128GB 통합 메모리를 갖춘 데스크톱 슈퍼컴퓨터인 NVIDIA DGX Spark(정가 약 4,500달러)에서, 또는 최소 24GB VRAM의 RTX GPU — 대략 RTX 3090 이상 — 를 갖춘 Linux PC에서 실행되며, 32GB를 권장한다. 9월 3일 Perplexity는 Portable Computer가 이제 24GB 이상의 VRAM을 갖춘 NVIDIA RTX GPU용 Linux에서 사용 가능하다고 밝혔으며 — 회사 측에 따르면 — 같은 주 NVIDIA의 IFA 2026 발표에서는 24GB 이상의 VRAM을 갖춘 RTX GPU를 정조준한 원클릭 설치 프로그램과 간소화된 로컬 AI 설정을 추가했고, Hermes agent 및 OpenClaw와 함께 Portable Computer를 언급했다. Windows 지원은 예정대로 도착했다: 9월 14일 Perplexity는 Portable Computer가 이제 NVIDIA RTX GPU를 갖춘 Windows PC에서 사용 가능하다고 밝혔으며 — 회사 측에 따르면 — Perplexity Windows 앱에서 제공되고, 온디바이스 추론에는 24GB 이상의 VRAM을 갖춘 RTX GPU가 필요해 Linux 기준과 일치하며, Linux 경로에는 없는 두 가지 추가 기능이 있다: 자체 도구와 앱 통합을 연결하기 위한 로컬 MCP, 그리고 자리를 비운 동안 PC에서 Computer가 반복 작업을 실행하도록 하는 예약 작업이다. macOS는 Linux 출시 일주일 후 다른 형태로 도착했다 — Hybrid Compute, 이어서 다룬다. 그리고 소프트웨어 자체는 유료 Perplexity 요금제가 필요하다: Pro, Max, Enterprise Pro, Enterprise Max. 이것은 이미 Perplexity를 유료로 사용하는 사람들을 겨냥한 구독+하드웨어 제품이지, 범용 API가 아니다.

Mac의 전환: 하이브리드 컴퓨팅과 프라이버시 게이트

9월 1일, Portable Computer가 기반으로 삼은 에이전트 플랫폼인 Perplexity Computer가 Mac 데스크톱 앱에서 하이브리드 컴퓨트(Hybrid Compute)를 갖추게 되었다. 여기서는 분할 방식이 Linux 빌드와 반대 방향으로 작동한다. 작업은 클라우드에서 시작되어, 최전선 모델들이 가장 어려운 추론과 웹 리서치, 장기적 계획을 처리하고, 오케스트레이터는 민감한 하위 단계를 Apple silicon에서 실행되는 로컬 서브에이전트에 넘긴다. 파일과 로컬 데이터, 기기 동작은 Mac에 그대로 남고, 컨텍스트는 핸드오프 후에도 유지되며, 로컬 토큰은 어느 것도 클라우드에 도달하지 않는다. 로컬 엔진은 바로 이 글에서 다루는 모델이다. PPLX 27B, 즉 Perplexity가 포스트트레이닝한 Qwen 3.8 27B로, Perplexity에 따르면 회사의 Mac 자료에는 PPLX Qwen 3.8 27B로 기재되어 있으며 앱에서 원클릭 다운로드로 설치되고 Ollama나 터미널 설정이 필요 없다. 출시 보도는 나머지 라인업에 대해서는 엇갈린다. 대부분의 매체는 다른 온디바이스 옵션으로 Google의 Gemma 4 E4B와 Alibaba의 Qwen3.6 35B-A3B를 덧붙이고, 한 곳은 27B 대신 Perplexity가 포스트트레이닝한 Qwen 3.6 35B를 언급한다. 언론이 출시 첫날 일관되게 짚어내지 못한 세부 사항이다.

퍼플렉시티가 앞세우는 기능은 프라이버시 게이트(Privacy Gate)로, 자체 보안 인텔리전스 연구소(Secure Intelligence Institute)에서 훈련된 온디바이스 분류기입니다. 이 분류기는 각 작업(프롬프트, 도구 출력, 메모리, 로그)을 전송 전에 읽어 개인 식별 정보(이름, 주소, 계좌 번호, 자격 증명, 결제 카드 번호, 정부 발급 ID)를 찾습니다. 감지된 값은 요청이 Mac을 떠나기 전에 대체 값으로 바뀌었다가 응답이 돌아올 때 복원됩니다. 게이트가 무언가를 플래그하면 사용자가 해당 단계를 로컬에서 실행할지, 마스킹할지, 공유할지 결정합니다. 게이트는 묻기만 하고 결정하지 않습니다. 퍼플렉시티는 또한 분류기를 오픈소스로 공개했고, 13개 언어로 된 13,148개의 합성 대화로 구축된 PII 탐지기 평가용 벤치마크인 PII-TRACE를 출시했다고 밝혔습니다. 이는 회사 측 주장일 뿐, 독립적인 감사를 받은 것은 아닙니다.

하이브리드 컴퓨트는 macOS 15 이상 및 통합 메모리 최소 24GB(권장 32GB)를 갖춘 모든 Apple 실리콘 Mac에서 실행된다. Perplexity에 따르면 8GB 및 16GB 기기는 지원 대상에서 제외된다. 이 기능은 Pro, Max 및 Enterprise 구독자가 데스크톱 앱을 통해 사용할 수 있으며, 엔터프라이즈 계정은 옵트인 방식으로 적용된다. 관리자는 조직 전체의 민감도 정책을 설정하고 각 기기에서 외부로 나가는 데이터 기록을 확인할 수 있다. 로컬 작업에는 클라우드 크레딧이 사용되지 않으며 로컬에서 생성된 토큰은 청구되지 않는다. 클라우드 오케스트레이션 및 위임 단계에만 비용이 발생하며 API 키는 필요 없다. 주의 사항은 Linux 출시 때와 동일하다. 게이트 자체가 모델이므로 거짓 음성이 발생할 수 있으며, 리뷰어들은 프롬프트가 표시될 때 사용자가 내리는 선택에 따라서만 보호 효과가 결정된다는 점을 즉시 지적했다. 특히 AppleInsider는 민감한 데이터를 맡기기 전에 이 기능을 테스트해 볼 것을 권고했다.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

라우터가 들어맞는 위치

PPLX 27B는 OrcaRouter가 라우팅하는 대상이 아닙니다 — 그것은 Perplexity 구독 뒤에서 여러분이 소유한 하드웨어에서 실행되며, 저희는 아닌 척하지 않습니다. 저희가 실제로 라우팅하는 것은 이번 출시가 불러온 비교 대상군입니다. Qwen 3.8 27B, 즉 PPLX 27B가 포스트트레이닝의 출발점으로 삼는 바로 그 기본 가중치는 OrcaRouter 셀프 호스팅에서 라이브입니다. DeepSeek V4 Flash, Gemini 3.5 Flash Lite, GPT-5.6 Luna도 마찬가지입니다 — 모두 하나의 API 키 뒤에서 제공사 정가로, 마크업 없이 그대로 전달되므로, 벤더의 가격 인하는 발표되는 당일 저희 쪽에도 바로 반영됩니다.

그것이 여기서 한 가지 특정한 이유로 중요합니다. Portable Computer의 제안은 로컬 대 클라우드 비용 대비이며, 그 대비의 클라우드 절반은 당신이 비교하는 가격만큼만 정직합니다. OrcaRouter에서는 그것이 공급자의 실제 정가이므로, 로컬이냐 클라우드냐 하는 결정을 마케팅 비교가 아니라 신뢰할 수 있는 계산으로 바꿔 줍니다. 그리고 같은 에이전트를 양쪽 방식으로 프로토타이핑하고 싶다면 — 한 대의 장비에 로컬 하네스, 하나의 엔드포인트 뒤에 클라우드 모델 — 자동 페일오버가 로컬 모델이 역부족일 때 클라우드 쪽이 대신하게 해 주며, 두 번째 계약이나 두 번째 코드 경로가 필요 없습니다. Hybrid Compute도 같은 조건을 되풀이합니다 — 로컬 토큰은 무료, 클라우드 오케스트레이션만 지출 — 따라서 로컬 절반이 DGX Spark, Linux RTX 워크스테이션, Mac, 또는 — 9월 14일 이후로는 — RTX GPU가 있는 Windows PC에서 실행되든 계산은 적용됩니다.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

볼 만한 것

앞으로 한 달 동안의 네 가지가 이것이 틈새 제품인지, 아니면 하나의 카테고리의 시작인지를 결정한다. Perplexity가 실제로 Local Knowledge Work Bench를 오픈소스로 공개하는지 여부 — 그러면 헤드라인 수치가 주장에서 커뮤니티가 재현할 수 있는 무언가로 바뀐다. Nemotron 3.5 Lightning이 출시되어 같은 하네스에서 PPLX 27B를 이기는지 여부 — “하네스를 위한 포스트트레인”이라는 명제는 그 밑에 깔린 베이스 모델이 받쳐주는 만큼만 유효하다. 분류기가 오픈소스화된 지금 Privacy Gate가 적대적 검증을 견뎌내는지 여부 — 확률적 PII 탐지기는 이름, 계좌번호, 자격 증명을 실제로 네트워크로 내보내지 않을 때에만 하이브리드 제안의 핵심축이 된다. 그리고 Linux 출시가 결코 누리지 못했던 도달 범위가 9월의 확장을 통해 마침내 찾아오는지 여부 — 9월 3일 확인된 RTX-24GB Linux 경로, 9월 14일 Perplexity Windows 앱에서 확인된 Windows 지원, 그리고 Mac의 Hybrid Compute — 이는 Perplexity가 지금까지 출시한 가장 광범위한 소비자 하드웨어에 동일한 로컬 에이전트 경제성을 올려놓는다. 벤치마크가 진짜이고 하네스가 전이된다면, “자신의 하드웨어에서 에이전트를 실행하라”는 더 이상 취미가의 패턴이 아니라 실질적인 위력을 지닌 배포 옵션이 된다 — 그리고 그것과 비교되는 클라우드 모델들은 토큰당 가격을 정당화해야 할 것이다.