
PPLX 27B ra mắt trong Máy tính di động của Perplexity: Một tác nhân cục bộ đánh bại các Open Harnesses
- OrcaMỚIOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 trên 1 triệu token · 87 tok/s
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 446 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
PPLX 27B của Perplexity không phải là một mô hình đám mây, và đó chính là toàn bộ câu chuyện. Được công bố vào ngày 25 tháng 8 năm 2026, cùng với Portable Computer — tác nhân ưu tiên cục bộ của công ty, được xây dựng với NVIDIA — PPLX 27B là một phiên bản hậu huấn luyện của Qwen 3.8 27B trọng số mở của Alibaba, được Perplexity tinh chỉnh cho bộ khung tác nhân của riêng mình và được phát hành để chạy hoàn toàn trên phần cứng bạn sở hữu. Trên Local Knowledge Work Bench gồm 53 tác vụ của Perplexity, bộ khung chạy PPLX 27B đạt 85,4%, cao hơn cùng bộ khung đó trên Qwen 3.8 27B (82,6%) và cao hơn hai bộ khung tác nhân mã nguồn mở, Pi (77,6%) và Hermes (74,0%). Đó là những con số do chính nhà cung cấp công bố từ bài đăng ra mắt và bài báo nghiên cứu đi kèm, "A Local-First Agent for Private and Cost-Effective Knowledge Work," chưa được tái lập độc lập — nhưng chúng là bằng chứng công khai đầu tiên cho thấy một mô hình 27B trên máy để bàn có thể đảm đương công việc tri thức thực sự với chi phí chỉ bằng một phần nhỏ so với giá của đám mây. Một tuần sau, vào ngày 1 tháng 9, cùng mô hình hậu huấn luyện đó xuất hiện trong một triển khai thứ hai: Hybrid Compute, chế độ Mac mới của tác nhân Computer thuộc Perplexity, chia một tác vụ duy nhất giữa các mô hình tiên phong trên đám mây và PPLX 27B chạy trên Apple silicon — phía sau một Privacy Gate trên thiết bị mới, có nhiệm vụ quét tìm dữ liệu cá nhân trước khi bất cứ thứ gì rời khỏi máy. Hai ngày sau thông báo về Mac, vào ngày 3 tháng 9, Perplexity cho biết Portable Computer hiện cũng đã có trên Linux dành cho GPU NVIDIA RTX có 24GB VRAM trở lên. Vào ngày 14 tháng 9, công ty cho biết nó hiện đã có trên PC Windows với GPU NVIDIA RTX — theo công ty, đây là mức độ phủ sóng rộng nhất mà đề xuất ưu tiên cục bộ từng đạt được, và là bước khiến việc chạy tác nhân trên phần cứng của chính bạn trở thành một lựa chọn triển khai thực sự trên nền tảng máy để bàn phổ biến nhất. Cả hai tuyên bố đều do nhà cung cấp đưa ra.
Những gì thực sự đã được phát hành
Portable Computer là bản dựng trên thiết bị của nền tảng tác nhân "Computer" của Perplexity. Trong khi sản phẩm Computer trước đây chạy bộ điều phối của nó trên đám mây, Portable Computer đóng gói toàn bộ ngăn xếp vào một hệ thống chạy trên máy của bạn: bộ khung tác nhân, bộ điều phối, bộ lập kế hoạch, bộ định tuyến công cụ, bộ lập lịch, hàng đợi tác vụ bền bỉ, chỉ mục tìm kiếm cục bộ, công cụ suy luận và các trình kết nối ứng dụng cho Google Drive, Gmail, Slack, GitHub và Outlook.
Hai đặc điểm tách biệt nó khỏi một hệ thống cục bộ tự dựng. Thứ nhất, việc thực thi mã và công cụ diễn ra bên trong một sandbox do hệ điều hành áp đặt, và nếu sandbox không khả dụng, tính năng thực thi công cụ sẽ bị vô hiệu hóa thay vì chạy mà không được bảo vệ. Thứ hai, nó được thiết kế theo hướng ưu tiên xử lý cục bộ: mọi tác vụ đều bắt đầu trên thiết bị, và nếu một bước cần dữ liệu web trực tiếp hoặc khả năng suy luận tiên tiến, bộ điều phối sẽ dừng lại và xin phép trước khi chuyển bước riêng lẻ đó lên một trong hơn 15 mô hình đám mây. Một bộ phân loại PII trên thiết bị — công nghệ mà Perplexity sau này đã sản phẩm hóa thành Privacy Gate — sẽ rà soát ngữ cảnh gửi đi trước tiên và cho bạn thấy chính xác những gì sẽ rời khỏi máy.
Hai mô hình 27B
Khi khởi chạy, bạn chọn giữa hai mô hình 27 tỷ tham số. Qwen 3.8 27B là mô hình trọng số mở theo giấy phép Apache-2.0 của Alibaba — một mô hình dense, đa phương thức 27B với cửa sổ gốc 262K token, ra mắt sớm hơn hai tuần và đã là một lựa chọn tự vận hành (self-host) mạnh mẽ. PPLX 27B chính là cùng phần nền đó nhưng được Perplexity huấn luyện thêm sau (post-train): không phải một kiến trúc mới, mà là phần huấn luyện bổ sung được tinh chỉnh riêng cho harness này, với tuyên bố từ công ty rằng nó cho hành vi chính xác hơn và hiệu quả hơn trên chính các khối lượng công việc agent của họ. NVIDIA Nemotron 3.5 Lightning (30B) được liệt kê là sắp ra mắt, và cả việc mang mô hình của riêng bạn lẫn máy chủ suy luận đều được hỗ trợ, nên harness không hề bị ràng buộc cứng vào trọng số của Perplexity.
Điểm chuẩn, và điều nó không phải
Con số chính đến từ Local Knowledge Work Bench với 53 tác vụ, một bộ bài kiểm tra bao gồm các loại công việc mà một nhân viên tri thức thực sự sẽ ủy thác — nghiên cứu sâu, phân tích tài chính, tạo lập tài liệu. Perplexity cho biết họ có kế hoạch mã nguồn mở hóa bộ chuẩn này, điều này sẽ giúp việc so sánh trở nên có thể lặp lại thay vì chỉ tin theo niềm tin. Cho đến lúc đó, những kết quả này do nhà cung cấp tự vận hành. Trên bộ bài kiểm tra đó, theo nhà cung cấp:
• Máy tính xách tay với PPLX 27B — 85.4%
• Máy tính xách tay với Qwen 3.8 27B — 82.6%
• Pi (khung mã nguồn mở) — 77.6%
• Hermes (bộ công cụ mã nguồn mở) — 74.0%

Hai kết quả nữa do nhà cung cấp báo cáo giúp hoàn thiện bức tranh. Trên BrowseComp, bộ kiểm tra nghiên cứu web, Computer đạt 66,7% so với 50,2% của Pi và 43,9% của Hermes, đồng thời sử dụng ít hơn 51% thời gian thực thi và ít hơn 70% số token so với Pi. Trên ParseBench-100, bài kiểm tra trích xuất tài liệu, nó đạt 65,1% so với 34,6% của Hermes và 13,9% của Pi. Khoảng cách lớn nhất nằm ở các tác vụ đề cao hạ tầng của chính bộ khung — tìm kiếm, định tuyến, sử dụng công cụ — nơi mà một mô hình được hậu huấn luyện cộng với một ngăn xếp kết nối chuyên dụng phát huy giá trị của nó.
Sự đảo ngược kinh tế
Con số thú vị hơn là mức giá. Công việc được thực hiện cục bộ có chi phí bằng 0 cho mỗi token và không tiêu tốn tín dụng Perplexity — bộ đếm vẫn đứng ở mức 0 cho một tác vụ hoàn toàn cục bộ. Nâng cấp (escalation) là thứ duy nhất tốn tiền và nó là tùy chọn theo từng bước. Perplexity đã công bố số liệu lai trên Terminal Bench 2.1: mô hình hoàn toàn cục bộ đạt 59,6% với chi phí gần như bằng 0; thêm một mô hình tiên tiến làm cố vấn đã nâng kết quả lên 73,0% với khoảng 0,415 USD mỗi lượt chạy; chỉ riêng mô hình tiên tiến đạt 82,4% với khoảng 0,65 USD mỗi lượt chạy. Sự tương phản cuối cùng đó chính là luận điểm — suy luận cục bộ làm phẳng đường cong chi phí cho các tác nhân luôn hoạt động, và việc nâng cấp lên đám mây trở thành một khoản chi phí có chọn lọc, tự bù đắp cho chính nó.
Không có mục nào trong số đó là miễn phí khi bắt đầu. Chiếc máy mới là điều quan trọng. Portable Computer ra mắt ưu tiên Linux trước vào ngày 25 tháng 8 trên NVIDIA DGX Spark, siêu máy tính để bàn với 128GB bộ nhớ hợp nhất (giá niêm yết khoảng 4.500 USD), hoặc trên các PC Linux có GPU RTX với ít nhất 24GB VRAM — khoảng RTX 3090 trở lên — với 32GB được khuyến nghị. Vào ngày 3 tháng 9, Perplexity cho biết Portable Computer hiện đã có trên Linux dành cho GPU NVIDIA RTX với 24GB VRAM trở lên — theo công ty — và đợt ra mắt IFA 2026 của NVIDIA trong cùng tuần đã bổ sung trình cài đặt một cú nhấp chuột và thiết lập AI cục bộ được đơn giản hóa nhắm thẳng vào GPU RTX có 24GB VRAM trở lên, đồng thời nhắc đến Portable Computer cùng với tác nhân Hermes và OpenClaw. Hỗ trợ Windows đã đến đúng như kế hoạch: vào ngày 14 tháng 9, Perplexity cho biết Portable Computer hiện đã có trên PC Windows với GPU NVIDIA RTX — theo công ty — trong ứng dụng Perplexity dành cho Windows, với suy luận trên thiết bị yêu cầu GPU RTX có 24GB VRAM trở lên, ngang bằng mức của Linux, và có thêm hai tính năng mà phương án Linux không có: MCP cục bộ để kết nối các công cụ và tích hợp ứng dụng của riêng bạn, và tác vụ theo lịch để Computer chạy công việc định kỳ trên PC của bạn khi bạn vắng mặt. macOS đã đến dưới một hình thức khác một tuần sau khi Linux ra mắt — Hybrid Compute, sẽ được đề cập tiếp theo. Và bản thân phần mềm yêu cầu gói Perplexity trả phí: Pro, Max, Enterprise Pro hoặc Enterprise Max. Đây là một sản phẩm gói đăng ký cộng phần cứng nhắm đến những người đã trả tiền cho Perplexity, chứ không phải một API phổ thông.
Bước ngoặt của Mac: Điện toán lai và Cánh cổng quyền riêng tư
Vào ngày 1 tháng 9, Perplexity Computer — nền tảng agent mà Portable Computer được xây dựng dựa trên — đã có thêm Hybrid Compute trong ứng dụng desktop Mac. Ở đây, cách phân tách diễn ra ngược lại so với bản Linux: một tác vụ bắt đầu trên đám mây, nơi các mô hình tiên tiến đảm nhận phần suy luận khó nhất, nghiên cứu web và lập kế hoạch dài hạn, còn bộ điều phối chuyển các bước con nhạy cảm cho một subagent cục bộ chạy trên Apple silicon. Tệp, dữ liệu cục bộ và các thao tác trên thiết bị vẫn ở lại trên Mac, ngữ cảnh được giữ nguyên qua quá trình bàn giao, và không token cục bộ nào từng chạm tới đám mây. Công cụ cục bộ chính là mô hình mà bài viết này nói tới — PPLX 27B, Qwen 3.8 27B được Perplexity huấn luyện hậu kỳ, được liệt kê trong tài liệu Mac của công ty là PPLX Qwen 3.8 27B và được cài đặt chỉ với một cú nhấp tải xuống trong ứng dụng, không cần thiết lập Ollama hay terminal, theo Perplexity. Thông tin đưa tin về buổi ra mắt có sự khác biệt ở phần còn lại của dòng sản phẩm: hầu hết các cơ quan báo chí bổ sung Gemma 4 E4B của Google và Qwen3.6 35B-A3B của Alibaba như những lựa chọn trên thiết bị khác, và một đơn vị nêu tên Qwen 3.6 35B được Perplexity huấn luyện hậu kỳ thay vì 27B — một chi tiết mà giới báo chí đã không thống nhất được trong ngày đầu tiên.
Tính năng nổi bật nhất mà Perplexity đang đề cao là Privacy Gate, một bộ phân loại trên thiết bị được huấn luyện bởi Secure Intelligence Institute của mình. Nó đọc từng tác vụ — lời nhắc, đầu ra của công cụ, bộ nhớ, nhật ký — trước khi bất kỳ thứ gì được truyền đi, nhằm tìm kiếm thông tin nhận dạng cá nhân: tên, địa chỉ, số tài khoản, thông tin xác thực, số thẻ thanh toán và giấy tờ tùy thân do chính phủ cấp. Các giá trị phát hiện được sẽ được thay thế bằng các giá trị tạm trước khi yêu cầu rời khỏi Mac và được khôi phục khi câu trả lời quay trở lại; khi Privacy Gate đánh dấu điều gì đó, người dùng quyết định bước đó chạy cục bộ, được che giấu hay được chia sẻ — Privacy Gate chỉ hỏi, nó không quyết định. Perplexity cũng cho biết họ đã mở mã nguồn bộ phân loại và phát hành PII-TRACE, một chuẩn đánh giá được xây dựng từ 13.148 cuộc hội thoại tổng hợp bằng 13 ngôn ngữ để đánh giá các bộ phát hiện PII. Đó là những tuyên bố của công ty, chưa được kiểm định một cách độc lập.
Hybrid Compute chạy trên mọi Mac dùng chip Apple silicon với macOS 15 trở lên và tối thiểu 24GB bộ nhớ hợp nhất — khuyến nghị 32GB, và Perplexity cho biết các máy 8GB và 16GB không được hỗ trợ. Tính năng này dành cho người đăng ký gói Pro, Max và Enterprise thông qua ứng dụng desktop, với tài khoản enterprise đăng ký tham gia và quản trị viên có thể đặt chính sách nhạy cảm trên toàn tổ chức cũng như xem nhật ký về dữ liệu rời khỏi từng thiết bị. Công việc cục bộ không sử dụng tín dụng đám mây và token tạo cục bộ không bị tính phí — chỉ các bước điều phối và ủy quyền đám mây mới tốn chi phí, và không cần khóa API. Các điểm lưu ý tương tự như khi ra mắt trên Linux: cổng kiểm soát bản thân nó là một mô hình, nên có thể xảy ra âm tính giả, và các nhà đánh giá nhanh chóng chỉ ra rằng sự bảo vệ chỉ tốt bằng những lựa chọn mà người dùng đưa ra khi được nhắc. Đặc biệt, AppleInsider khuyên nên thử nghiệm tính năng này trước khi tin tưởng giao phó dữ liệu nhạy cảm.

Vị trí đặt router
PPLX 27B không phải là thứ OrcaRouter định tuyến — nó chạy trên phần cứng bạn sở hữu, sau một gói đăng ký Perplexity, và chúng tôi sẽ không giả vờ điều khác. Thứ chúng tôi định tuyến là nhóm so sánh mà lần ra mắt này gợi ra. Qwen 3.8 27B, đúng bộ trọng số cơ sở mà PPLX 27B hậu huấn luyện từ đó, đang hoạt động trên OrcaRouter tự vận hành; DeepSeek V4 Flash, Gemini 3.5 Flash Lite và GPT-5.6 Luna cũng vậy — tất cả sau một API key duy nhất với giá niêm yết của nhà cung cấp, được chuyển qua với mức chênh lệch bằng không, nên khi nhà cung cấp giảm giá thì phía chúng tôi cập nhật ngay trong cùng ngày công bố.
Điều đó quan trọng ở đây vì một lý do cụ thể. Lời chào hàng của Portable Computer là sự tương phản chi phí giữa cục bộ và đám mây, và nửa phần đám mây trong sự tương phản đó chỉ trung thực ngang với mức giá mà bạn đem ra so sánh. Trên OrcaRouter, đó là giá niêm yết thực tế của nhà cung cấp, biến quyết định dùng cục bộ hay đám mây thành một phép tính bạn có thể tin cậy thay vì một so sánh mang tính tiếp thị. Và nếu bạn muốn tạo nguyên mẫu cùng một agent theo cả hai cách — khung chạy cục bộ trên một máy, mô hình đám mây sau một endpoint — thì chuyển đổi dự phòng tự động cho phép phía đám mây thay thế khi mô hình cục bộ không đủ sức, mà không cần hợp đồng thứ hai hay luồng mã thứ hai. Hybrid Compute lặp lại cùng một thỏa thuận — token cục bộ miễn phí, điều phối đám mây là khoản chi duy nhất — nên phép tính này vẫn áp dụng dù nửa cục bộ chạy trên DGX Spark, một máy trạm Linux RTX, một máy Mac, hay — kể từ ngày 14 tháng 9 — một PC Windows có GPU RTX.

Xem gì
Bốn điều trong tháng tới sẽ quyết định liệu đây là một sản phẩm ngách hay là khởi đầu của một hạng mục. Liệu Perplexity có thực sự mở mã nguồn Local Knowledge Work Bench hay không, điều này sẽ biến những con số nổi bật từ những tuyên bố thành thứ mà cộng đồng có thể tái tạo. Liệu Nemotron 3.5 Lightning có ra mắt và đánh bại PPLX 27B trên cùng một harness hay không — luận điểm "huấn luyện sau cho harness" chỉ tốt bằng mô hình cơ sở bên dưới nó. Liệu Privacy Gate có sống sót qua sự soi xét đối kháng khi bộ phân loại đã được mở mã nguồn hay không — một công cụ phát hiện PII xác suất là mấu chốt của bản chào hybrid chỉ khi nó thực sự giữ tên, số tài khoản và thông tin đăng nhập không bị truyền qua mạng. Và liệu phạm vi tiếp cận mà sự ra mắt Linux chưa từng có cuối cùng có đến được thông qua đợt mở rộng tháng 9 hay không — tuyến RTX-24GB Linux được xác nhận vào ngày 3 tháng 9, hỗ trợ Windows được xác nhận vào ngày 14 tháng 9 trong ứng dụng Perplexity trên Windows, và Hybrid Compute trên Mac — đặt cùng một nền kinh tế tác nhân cục bộ lên phần cứng tiêu dùng rộng nhất mà Perplexity đã tung ra cho đến nay. Nếu điểm chuẩn là thật và harness chuyển giao được, "chạy tác nhân trên phần cứng của riêng bạn" không còn là mô hình của người nghiệp dư nữa mà trở thành một lựa chọn triển khai có sức nặng thực sự — và các mô hình đám mây mà nó được so sánh với sẽ phải xứng đáng với giá trên mỗi token của chúng.
