Thẻ tiêu đề hero cho 'PPLX 27B ra mắt trong máy tính di động của Perplexity' với phụ đề 'Tác nhân ưu tiên cục bộ — 85,4% trong công việc tri thức, $0 mỗi token', biểu tượng đường nét máy tính để bàn có khiên ở bên trái và biểu tượng đường nét chip ở bên phải, cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

PPLX 27B ra mắt trong Máy tính di động của Perplexity: Một tác nhân cục bộ đánh bại các Open Harnesses

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

PPLX 27B của Perplexity không phải là mô hình đám mây, và đó chính là toàn bộ câu chuyện. Ra mắt ngày 25 tháng 8 năm 2026, cùng với Portable Computer — tác nhân ưu tiên cục bộ (local-first agent) của công ty, được xây dựng cùng NVIDIA — PPLX 27B là phiên bản post-trained của mô hình Qwen 3.8 27B trọng số mở đến từ Alibaba, được Perplexity tinh chỉnh cho khung tác nhân (agent harness) của riêng mình và phát hành để chạy hoàn toàn trên phần cứng mà người dùng sở hữu. Trên Local Knowledge Work Bench gồm 53 tác vụ của Perplexity, khung tác nhân chạy PPLX 27B đạt 85,4%, cao hơn khung tác nhân tương tự trên Qwen 3.8 27B (82,6%) và hai khung tác nhân mã nguồn mở là Pi (77,6%) và Hermes (74,0%). Đây là những con số do chính hãng công bố trong bài viết ra mắt và bài báo nghiên cứu đi kèm, "A Local-First Agent for Private and Cost-Effective Knowledge Work," chưa được tái lập độc lập — nhưng chúng là bằng chứng công khai đầu tiên cho thấy một mô hình 27B trên máy tính để bàn có thể đảm đương những công việc tri thức thực thụ với chi phí chỉ bằng một phần nhỏ so với dịch vụ đám mây.

Những gì thực sự đã được phát hành

Portable Computer là bản dựng trên thiết bị của nền tảng tác tử "Computer" của Perplexity. Trong khi sản phẩm Computer trước đây chạy bộ điều phối của nó trên đám mây, Portable Computer đóng gói toàn bộ ngăn xếp thành một hệ thống duy nhất chạy trên máy của bạn: bộ khung tác tử, bộ điều phối, bộ lập kế hoạch, bộ định tuyến công cụ, bộ lập lịch, hàng đợi tác vụ bền vững, chỉ mục tìm kiếm cục bộ, bộ máy suy luận, và các trình kết nối ứng dụng cho Google Drive, Gmail, Slack, GitHub và Outlook.

Hai đặc điểm phân biệt nó với một thiết lập cục bộ tự làm. Thứ nhất, việc thực thi mã và công cụ diễn ra bên trong một sandbox do hệ điều hành áp đặt, và nếu sandbox không khả dụng, việc thực thi công cụ sẽ bị vô hiệu hóa thay vì chạy không được bảo vệ. Thứ hai, nó ưu tiên cục bộ theo thiết kế: mọi tác vụ bắt đầu trên thiết bị, và nếu một bước cần dữ liệu web trực tiếp hoặc suy luận tiên tiến, bộ điều phối sẽ dừng lại và xin phép trước khi nâng bước đó lên một trong hơn 15 mô hình đám mây. Một bộ phân loại PII chạy trên ngữ cảnh gửi đi trước và hiển thị cho bạn chính xác những gì sẽ rời khỏi máy.

Hai mô hình 27B

Khi ra mắt, bạn chọn giữa hai mô hình 27 tỷ tham số. Qwen 3.8 27B là mô hình trọng số mở Apache-2.0 của Alibaba — một mô hình 27B dense, đa phương thức với cửa sổ ngữ cảnh gốc 262K token, được phát hành sớm hơn hai tuần và đã là một lựa chọn tự lưu trữ mạnh mẽ. PPLX 27B là cùng mô hình nền đó được Perplexity hậu huấn luyện: không phải một kiến trúc mới, mà là huấn luyện bổ sung được tinh chỉnh riêng cho khung này, trong khi công ty khẳng định hành vi chính xác hơn và hiệu quả hơn trên các tác vụ tác nhân của riêng mình. Nemotron 3.5 Lightning (30B) của NVIDIA được liệt kê là sắp ra mắt, và cả tùy chọn tự mang mô hình lẫn máy chủ suy luận đều được hỗ trợ, nên khung này không bị gắn chặt với trọng số của Perplexity.

Điểm chuẩn, và điều nó không phải

Con số chính đến từ Local Knowledge Work Bench với 53 tác vụ, một bộ bài kiểm tra bao gồm các loại công việc mà một nhân viên tri thức thực sự sẽ ủy thác — nghiên cứu sâu, phân tích tài chính, tạo lập tài liệu. Perplexity cho biết họ có kế hoạch mã nguồn mở hóa bộ chuẩn này, điều này sẽ giúp việc so sánh trở nên có thể lặp lại thay vì chỉ tin theo niềm tin. Cho đến lúc đó, những kết quả này do nhà cung cấp tự vận hành. Trên bộ bài kiểm tra đó, theo nhà cung cấp:

• Máy tính xách tay với PPLX 27B — 85.4%

• Máy tính xách tay với Qwen 3.8 27B — 82.6%

• Pi (khung mã nguồn mở) — 77.6%

• Hermes (bộ công cụ mã nguồn mở) — 74.0%

A single-column scoreboard titled 'PPLX 27B — the scoreboard' listing Local Knowledge Work Bench 85.4%, BrowseComp 66.7%, marginal cost $0 per token, context 262K tokens, runs on DGX Spark or RTX 24GB+, status new Aug 25 2026, with footer 'Perplexity-reported; not independently reproduced.'

Hai kết quả nữa do nhà cung cấp báo cáo giúp hoàn thiện bức tranh. Trên BrowseComp, bộ kiểm tra nghiên cứu web, Computer đạt 66,7% so với 50,2% của Pi và 43,9% của Hermes, đồng thời sử dụng ít hơn 51% thời gian thực thi và ít hơn 70% số token so với Pi. Trên ParseBench-100, bài kiểm tra trích xuất tài liệu, nó đạt 65,1% so với 34,6% của Hermes và 13,9% của Pi. Khoảng cách lớn nhất nằm ở các tác vụ đề cao hạ tầng của chính bộ khung — tìm kiếm, định tuyến, sử dụng công cụ — nơi mà một mô hình được hậu huấn luyện cộng với một ngăn xếp kết nối chuyên dụng phát huy giá trị của nó.

Sự đảo ngược kinh tế

Con số thú vị hơn là mức giá. Công việc được thực hiện cục bộ có chi phí bằng 0 cho mỗi token và không tiêu tốn tín dụng Perplexity — bộ đếm vẫn đứng ở mức 0 cho một tác vụ hoàn toàn cục bộ. Nâng cấp (escalation) là thứ duy nhất tốn tiền và nó là tùy chọn theo từng bước. Perplexity đã công bố số liệu lai trên Terminal Bench 2.1: mô hình hoàn toàn cục bộ đạt 59,6% với chi phí gần như bằng 0; thêm một mô hình tiên tiến làm cố vấn đã nâng kết quả lên 73,0% với khoảng 0,415 USD mỗi lượt chạy; chỉ riêng mô hình tiên tiến đạt 82,4% với khoảng 0,65 USD mỗi lượt chạy. Sự tương phản cuối cùng đó chính là luận điểm — suy luận cục bộ làm phẳng đường cong chi phí cho các tác nhân luôn hoạt động, và việc nâng cấp lên đám mây trở thành một khoản chi phí có chọn lọc, tự bù đắp cho chính nó.

Không có lựa chọn nào trong số đó là miễn phí ngay từ đầu. Phần cứng mới là thứ quan trọng. Portable Computer ra mắt trước tiên trên Linux, chạy trên NVIDIA DGX Spark — siêu máy tính để bàn với 128GB bộ nhớ hợp nhất (giá niêm yết khoảng 4.500 USD) — hoặc trên các PC Linux có GPU RTX với ít nhất 24GB VRAM, tương đương RTX 3090 trở lên, với 32GB được khuyến nghị. Hỗ trợ Windows dự kiến vào tháng 9; macOS chưa được công bố. Và bản thân phần mềm yêu cầu một gói Perplexity trả phí: Pro, Max, Enterprise Pro hoặc Enterprise Max. Đây là sản phẩm thuê bao kết hợp phần cứng, nhắm đến những người đã trả phí cho Perplexity, không phải một API thông thường.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-27b showing the Vision, Tools, JSON and Reasoning badges and the description 'Qwen3.8-27B is Alibaba's open-weight 27B dense multimodal model, released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure'.

Vị trí đặt router

PPLX 27B không phải thứ mà OrcaRouter định tuyến — nó chạy trên phần cứng bạn sở hữu, sau một gói đăng ký Perplexity, và chúng tôi sẽ không giả vờ điều ngược lại. Điều chúng tôi định tuyến là bộ so sánh mà đợt ra mắt này mang lại. Qwen 3.8 27B — bộ trọng số gốc chính xác mà PPLX 27B được huấn luyện bổ sung từ đó — đang hoạt động trên OrcaRouter tự lưu trữ; DeepSeek V4 Flash, Gemini 3.5 Flash LiteGPT-5.6 Luna cũng vậy — tất cả chỉ cần một khóa API duy nhất, theo giá niêm yết của nhà cung cấp, chuyển qua với mức chênh lệch bằng không, nên khi nhà cung cấp giảm giá, phía chúng tôi cũng áp dụng ngay trong ngày công bố.

Điều đó quan trọng ở đây vì một lý do cụ thể. Luận điểm của Portable Computer là sự so sánh chi phí giữa mô hình cục bộ và đám mây, và phần đám mây trong sự so sánh đó chỉ trung thực bằng mức giá mà bạn dùng để so sánh. Trên OrcaRouter, đó là giá niêm yết thực tế của nhà cung cấp, biến quyết định chọn cục bộ hay đám mây thành một phép tính bạn có thể tin cậy thay vì một sự so sánh mang tính tiếp thị. Và nếu bạn muốn tạo nguyên mẫu cùng một agent theo cả hai cách — bộ khung cục bộ trên một máy, các mô hình đám mây sau một endpoint duy nhất — cơ chế chuyển đổi dự phòng tự động cho phép phía đám mây thay thế khi mô hình cục bộ không đủ khả năng xử lý, mà không cần hợp đồng thứ hai hay đường mã thứ hai.

A two-panel infographic titled 'Local vs Cloud — the cost shape' comparing a left 'PPLX 27B (local)' panel (cost per token $0, upfront ~$4,500 DGX Spark, escalation opt-in per step) with a right 'Cloud escalation' panel (fully local 59.6% at ~$0.00, hybrid 73.0% at ~$0.415, frontier alone 82.4% at ~$0.65), footer 'Perplexity-reported hybrid math on Terminal Bench 2.1.'

Xem gì

Ba điều trong tháng tới sẽ quyết định liệu đây là một sản phẩm ngách hay khởi đầu của một phân khúc mới. Liệu Perplexity có thực sự mở mã nguồn Local Knowledge Work Bench hay không — điều này sẽ biến các con số nổi bật từ những tuyên bố thành thứ mà cộng đồng có thể tái tạo. Liệu Nemotron 3.5 Lightning có ra mắt và đánh bại PPLX 27B trên cùng một bộ kiểm thử hay không — luận điểm "hậu huấn luyện cho bộ kiểm thử" cũng chỉ mạnh ngang mô hình cơ sở bên dưới nó. Và liệu hỗ trợ Windows vào tháng 9 có mở rộng phạm vi tiếp cận vượt ra ngoài những người sở hữu DGX Spark hay không. Nếu điểm chuẩn là thật và bộ kiểm thử chuyển giao được, "chạy agent trên GPU của riêng bạn" sẽ không còn là mô hình của những người đam mê công nghệ mà trở thành một tùy chọn triển khai có sức nặng thực sự — và các mô hình đám mây được đem ra so sánh sẽ phải xứng đáng với mức giá tính theo token của mình.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube