
PPLX 27B가 Perplexity의 휴대용 컴퓨터에서 출시: 오픈 하네스를 능가하는 로컬 에이전트
- DeepSeekNEWDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.15 / $0.29 100만 토큰당
- z-aiNEWZ.ai: GLM 5.32026-08-1860지능75코딩
- obsidianNEWQwen3.8 27B2026-08-1552지능68코딩
- qwenNEWQwen: Qwen3.8 27B (free)2026-08-13qwen/qwen3.8-27b-free
- deepseekNEWDeepSeek: DeepSeek V4 Pro 08132026-08-1253지능69코딩
- grokNEWSpaceXAI: Grok 4.62026-08-1261지능77코딩
- metaMeta: Muse Spark 1.22026-08-0557지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0358지능72코딩
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152지능69코딩
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 100만 토큰당
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463지능78코딩
- googleGoogle: Gemini 3.6 Flash2026-07-2152지능69코딩
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137지능49코딩
- metaMeta: Muse Spark 1.12026-07-1653지능71코딩
- kimiMoonshotAI: Kimi K32026-07-1560지능76코딩
- openaiOpenAI: GPT-5.6 Luna2026-07-0952지능71코딩
- openaiOpenAI: GPT-5.6 Terra2026-07-0957지능77코딩
- openaiOpenAI: GPT-5.6 Sol2026-07-0961지능77코딩
Perplexity의 PPLX 27B는 클라우드 모델이 아니며, 그것이 전부입니다. 2026년 8월 25일, NVIDIA와 함께 구축된 회사의 로컬 우선 에이전트인 Portable Computer와 함께 발표된 PPLX 27B는 Alibaba의 오픈 가중치 Qwen 3.8 27B를 사후 학습한 버전으로, Perplexity가 자체 에이전트 하네스에 맞게 튜닝했으며 전적으로 사용자가 소유한 하드웨어에서 실행되도록 제공됩니다. Perplexity의 53개 과제로 구성된 Local Knowledge Work Bench에서 PPLX 27B를 실행하는 하네스는 85.4%를 기록하여, 동일한 하네스로 Qwen 3.8 27B를 실행한 경우(82.6%)와 두 오픈소스 에이전트 하네스인 Pi(77.6%) 및 Hermes(74.0%)보다 앞섰습니다. 이 수치는 출시 게시물과 함께 공개된 연구 논문 "A Local-First Agent for Private and Cost-Effective Knowledge Work"에 포함된 벤더 자체의 수치로, 독립적으로 재현된 결과는 아닙니다. 그럼에도 이는 데스크톱의 27B 모델이 클라우드 비용의 극히 일부만으로 실제 지식 작업을 수행할 수 있다는 최초의 공개적 증거입니다.
실제로 출시된 것
Portable Computer는 Perplexity의 "Computer" 에이전트 플랫폼의 온디바이스 빌드입니다. 이전 Computer 제품이 오케스트레이터를 클라우드에서 실행했던 반면, Portable Computer는 에이전트 하네스, 오케스트레이터, 플래너, 도구 라우터, 스케줄러, 영속적 작업 큐, 로컬 검색 인덱스, 추론 엔진, 그리고 Google Drive, Gmail, Slack, GitHub, Outlook용 앱 커넥터를 포함한 전체 스택을 사용자 머신에서 실행되는 하나의 시스템으로 패키징합니다.
두 가지 속성이 이를 DIY 로컬 설정과 구분합니다. 첫째, 코드와 도구 실행은 OS가 적용하는 샌드박스 안에서 이루어지며, 샌드박스를 사용할 수 없으면 보호되지 않은 상태로 실행하는 대신 도구 실행이 비활성화됩니다. 둘째, 설계상 로컬 우선입니다. 모든 작업은 기기에서 시작되며, 어떤 단계에 실시간 웹 데이터나 최첨단 추론이 필요하면 오케스트레이터는 중단하고 권한을 요청한 후 해당 단계만 15개 이상의 클라우드 모델 중 하나로 승격합니다. PII 분류기가 먼저 나가는 컨텍스트를 검사하여 무엇이 기기를 떠나는지 정확히 보여줍니다.
두 27B 모델
출시 시 두 개의 270억 파라미터 모델 중에서 선택할 수 있습니다. Qwen 3.8 27B는 알리바바의 Apache-2.0 오픈 가중치 모델로, 262K 토큰 네이티브 컨텍스트 창을 갖춘 덴스(dense) 멀티모달 27B 모델입니다. 2주 먼저 출시되어 이미 강력한 자체 호스팅 옵션으로 자리 잡았습니다. PPLX 27B는 동일한 베이스 모델을 Perplexity가 추가 학습(post-training)시킨 버전입니다. 새로운 아키텍처가 아니라 이 하네스에 맞춰 특별히 튜닝된 추가 훈련을 거쳤으며, Perplexity는 자체 에이전트 워크로드에서 더 정밀하고 효율적인 동작을 보인다고 주장합니다. NVIDIA의 Nemotron 3.5 Lightning(30B)은 곧 출시 예정으로 목록에 올라와 있으며, 자체 보유 모델과 추론 서버를 모두 지원하므로 이 하네스는 Perplexity의 가중치에 얽매이지 않습니다.
벤치마크, 그리고 그것이 아닌 것
주요 수치는 53개 작업으로 구성된 Local Knowledge Work Bench에서 비롯된 것으로, 지식 근로자가 실제로 위임할 만한 작업 유형——심층 조사, 재무 분석, 문서 작성——을 포괄하는 벤치마크입니다. Perplexity는 이 벤치마크를 오픈소스로 공개할 계획이라고 밝혔으며, 이는 결국 비교 결과를 맹신이 아니라 반복 검증 가능한 것으로 만들 것입니다. 그때까지는 이 결과는 공급업체가 실행한 것입니다. 해당 벤치마크에서 공급업체에 따르면:
• PPLX 27B 탑재 휴대용 컴퓨터 — 85.4%
Qwen 3.8 27B 탑재 휴대용 컴퓨터 — 82.6%
• Pi (오픈소스 하네스) — 77.6%
• Hermes (오픈소스 하네스) — 74.0%

{{1}}공급업체가 보고한 두 가지 결과가 더해져 전체 그림이 완성됩니다.{{/1}} {{2}}웹 리서치 스위트인 BrowseComp에서 Computer는 Pi의 50.2%, Hermes의 43.9%에 비해 66.7%를 기록했으며, Pi보다 실제 소요 시간을 51% 덜 쓰고 토큰은 70% 더 적게 사용했습니다.{{/2}} {{3}}문서 추출 테스트인 ParseBench-100에서는 Hermes의 34.6%, Pi의 13.9%에 비해 65.1%를 기록했습니다.{{/3}} {{4}}가장 큰 격차는 하네스 자체 인프라(검색, 라우팅, 도구 사용)에 보상이 주어지는 작업, 즉 사후 훈련된 모델과 목적에 맞게 구축된 전용 파이프라인 스택이 제 몫을 하는 작업에서 나타납니다.{{/4}}
경제학의 전환
더 흥미로운 숫자는 가격이다. 로컬에서 완료된 작업은 토큰당 비용이 0이고 Perplexity 크레딧도 소모하지 않는다. 완전 로컬 작업의 카운터는 0에 머문다. 비용이 발생하는 것은 오직 에스컬레이션뿐이며, 이는 단계별로 선택할 수 있다. Perplexity는 Terminal Bench 2.1에서 하이브리드 계산 결과를 공개했다. 완전 로컬은 비용이 거의 0이면서 59.6%를 기록했다. 프런티어 모델을 어드바이저로 추가하면 롤아웃당 약 $0.415로 73.0%까지 올라갔다. 프런티어 모델 단독으로는 롤아웃당 약 $0.65로 82.4%에 도달했다. 이 마지막 대비가 핵심 주장이다. 로컬 추론은 상시 가동 에이전트의 비용 곡선을 평평하게 만들고, 클라우드 에스컬레이션은 그 비용을 스스로 상쇄하는 정밀한 지출이 된다.
어느 것도 처음부터 무료는 아닙니다. 하드웨어가 중요합니다. Portable Computer는 Linux 우선으로 출시되며, NVIDIA DGX Spark(통합 메모리 128GB를 갖춘 데스크톱 슈퍼컴퓨터, 정가 약 $4,500) 또는 최소 24GB VRAM의 RTX GPU(대략 RTX 3090 이상)를 탑재한 Linux PC에서 실행됩니다. 32GB 메모리가 권장됩니다. Windows 지원은 9월로 예정되어 있으며 macOS는 발표되지 않았습니다. 또한 소프트웨어 자체에는 유료 Perplexity 요금제(Pro, Max, Enterprise Pro 또는 Enterprise Max)가 필요합니다. 이는 일반 API가 아니라 이미 Perplexity를 결제하는 사용자를 대상으로 한 구독+하드웨어 상품입니다.

라우터가 들어맞는 위치
PPLX 27B는 OrcaRouter가 라우팅하는 대상이 아닙니다. 이는 귀하가 소유한 하드웨어에서 Perplexity 구독을 통해 실행되며, 우리는 그렇지 않은 척하지 않습니다. 우리가 라우팅하는 것은 이번 출시가 초대하는 비교 세트입니다. PPLX 27B가 포스트 트레이닝하는 정확한 기본 가중치인 Qwen 3.8 27B는 OrcaRouter 자체 호스팅으로 제공되며, DeepSeek V4 Flash, Gemini 3.5 Flash Lite, GPT-5.6 Luna도 마찬가지입니다. 모두 하나의 API 키로 제공업체 목록 가격에 제공되며, 마크업 없이 전달되므로 공급업체의 가격 인하는 발표된 당일에 저희 쪽에도 반영됩니다.
여기서 이 점은 한 가지 구체적인 이유로 중요합니다. Portable Computer가 내세우는 핵심은 로컬 대 클라우드 비용 대비이며, 그 대비의 클라우드 측면은 비교 대상이 되는 가격만큼만 정직합니다. OrcaRouter에서는 그 가격이 제공업체의 실제 정가이므로, 로컬 또는 클라우드 결정을 마케팅 비교가 아닌 신뢰할 수 있는 계산으로 만들어 줍니다. 그리고 동일한 에이전트를 양쪽 방식으로 프로토타입하려는 경우 — 한 대의 시스템에서 로컬 하네스를, 하나의 엔드포인트 뒤에서 클라우드 모델을 — 자동 장애 조치를 통해 로컬 모델이 한계에 부딪히면 클라우드 측이 두 번째 계약이나 두 번째 코드 경로 없이 대신 처리할 수 있습니다.

볼 것
향후 한 달 동안 세 가지가 이 제품이 틈새 제품인지, 아니면 새로운 카테고리의 시작인지를 결정합니다. Perplexity가 실제로 Local Knowledge Work Bench를 오픈소스화하는지 여부 — 그렇게 되면 헤드라인 수치가 주장에서 커뮤니티가 재현할 수 있는 무언가로 바뀝니다. Nemotron 3.5 Lightning이 출시되어 동일한 하네스에서 PPLX 27B를 이기는지 여부 — "하네스를 위한 포스트트레이닝"이라는 테제는 그 기반이 되는 베이스 모델만큼만 유효합니다. 그리고 9월의 Windows 지원이 DGX Spark 소유자를 넘어 영향력을 확장하는지 여부입니다. 벤치마크가 실제이고 하네스가 전이된다면, "자체 GPU에서 에이전트 실행"은 더 이상 취미 개발자 패턴이 아니라 실질적인 영향력을 가진 배포 옵션이 되며 — 비교 대상이 되는 클라우드 모델들은 자신의 토큰당 가격을 정당화해야 할 것입니다.
