Một thẻ hero được tạo có tiêu đề 'Claude Haiku 5.5 vs PPLX 27B' với dòng giới thiệu '$0.00 MỖI TOKEN KHÔNG PHẢI LÀ MIỄN PHÍ' và các chip hiển thị không phần cứng so với khoảng 4.500 USD, 1M so với ngữ cảnh 262K, và cloud so với trên thiết bị.
Guides & Insights

Claude Haiku 5.5 so với PPLX 27B: $0.00 một token không đồng nghĩa với miễn phí

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

PPLX 27B không tốn gì cho mỗi token. Nó chạy cục bộ, trên phần cứng bạn sở hữu, và một khi đã mua phần cứng thì chi phí biên của token tiếp theo thực sự bằng không. Claude Haiku 5.5 tốn 0,10 USD cho mỗi triệu token đầu vào và 0,50 USD cho mỗi triệu token đầu ra — một con số đủ nhỏ để đáng làm phép trừ cho đàng hoàng thay vì chấp nhận kết luận hiển nhiên. Một cỗ máy có thể chạy PPLX 27B tốt là một DGX Spark khoảng 4.500 USD hoặc một máy để bàn với card RTX 24GB trở lên, và 4.500 USD token đầu ra của Claude Haiku 5.5 tương đương khoảng chín tỷ token. Vậy câu hỏi mà cuộc so tài này thực sự đặt ra không phải là cái nào rẻ hơn. Mà là bạn dự kiến đốt bao nhiêu token, và liệu câu trả lời cho điều đó có thay đổi vì token nằm ngay trên bàn của bạn hay không.

Claude Haiku 5.5 là mô hình nhỏ của nhà cung cấp, ra mắt ngày 7 tháng 10 năm 2026. PPLX 27B được Perplexity công bố vào ngày 25 tháng 8 năm 2026 cùng với Portable Computer, được xây dựng với NVIDIA, và đây là phiên bản hậu huấn luyện của Qwen 3.8 27B trọng số mở, được tinh chỉnh cho harness riêng của Perplexity. Không cái nào có thể thay thế trực tiếp cho cái kia, và cả hai đều không có trong danh mục của OrcaRouter.

Hai mô hình, và vì sao một trong hai lại nằm trên bàn làm việc của bạn

Claude Haiku 5.5 — ID claude-haiku-5-5, đầu vào văn bản và hình ảnh, đầu ra văn bản, ngữ cảnh 1 triệu token, đầu ra tối đa 128.000 token với đường dẫn beta 300.000 token trên Batch API, thời điểm cắt dữ liệu huấn luyện tháng 6 năm 2026 và cam kết không ngừng cung cấp trước ngày 7 tháng 10 năm 2027. Mức độ nỗ lực chạy từ Low đến Max với Medium là mặc định, suy luận thích ứng được bật theo mặc định, đọc bộ nhớ đệm tốn 0,01 đô la cho mỗi triệu token và Batch giảm một nửa mức giá. Đây là một sản phẩm lưu trữ: bạn gửi token, bạn nhận token, bạn không bao giờ thấy GPU.

PPLX 27B — một mô hình dense 27 tỷ tham số, được phát triển từ Qwen 3.8 27B và được huấn luyện hậu kỳ cho agent harness của chính Perplexity. Mô hình chạy bên trong Portable Computer trên DGX Spark hoặc trên một máy Linux có card NVIDIA RTX từ 24GB trở lên, và không rời khỏi máy đó. Một chế độ hybrid được thêm vào ngày 1 tháng 9 năm 2026 sẽ ghép nó với một mô hình đám mây cho các tác vụ nặng hơn phía sau Privacy Gate trên thiết bị; hỗ trợ Linux cho RTX ra mắt ngày 3 tháng 9; hỗ trợ Windows cho card RTX từ 24GB trở lên ra mắt ngày 14 tháng 9, cùng với MCP cục bộ và các tác vụ theo lịch. Các trọng số huấn luyện hậu kỳ là độc quyền và nằm sau đăng ký Perplexity Pro hoặc Max.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• Các kích thước, mỗi dòng một kích thước

• Chi phí biên trên mỗi token — Claude Haiku 5.5 $0.10 mỗi triệu token đầu vào và $0.50 mỗi triệu token đầu ra cho tới 100K token prompt, sau đó là $0.50 và $2.50; PPLX 27B không tốn gì, sau khi đã trả tiền cho phần cứng.

• Chi phí để bắt đầu — không cần gì ngoài một khóa API cho Claude Haiku 5.5; khoảng 4.500 USD cho một DGX Spark, hoặc một máy tính để bàn có card NVIDIA RTX 24GB trở lên, dành cho PPLX 27B.

• Cửa sổ ngữ cảnh — 1.000.000 token cho Claude Haiku 5.5 so với khoảng 262.144 token được kế thừa từ Qwen 3.8 27B.

• Đầu ra tối đa — 128.000 token cho Claude Haiku 5.5, với header beta 300.000 token trên Batch; không được công bố cho PPLX 27B.

• Dữ liệu đi đâu — đám mây của Anthropic so với máy của riêng bạn, với Privacy Gate của chế độ hybrid quyết định thứ gì rời khỏi nó.

• Điểm độc lập — Chỉ số Trí tuệ Artificial Analysis là 43 đối với Claude Haiku 5.5, cấu hình Max là 43.40, đứng thứ hai trong số 182; không có công bố nào cho PPLX 27B, mẫu mà Artificial Analysis không theo dõi.

• Tốc độ đầu ra — 243,4 token mỗi giây đối với Claude Haiku 5.5; phụ thuộc vào GPU của bạn đối với PPLX 27B, và không thể so sánh khi chưa có số liệu được công bố.

• Các phương thức đầu vào — văn bản và hình ảnh so với văn bản, được kế thừa từ một nền tảng đa phương thức.

• Trọng số — độc quyền trong cả hai trường hợp, nhưng vì những lý do khác nhau: không phát hành trọng số so với một bản hậu huấn luyện bị hạn chế, đòi hỏi phải đăng ký thuê bao mới có được.

Phần cứng là cái giá, và cái giá là phép thử của sự trung thực.

"Miễn phí" là từ sai khi nói về suy luận cục bộ, và các nhà cung cấp biết rõ điều đó, nên con số họ luôn đưa ra là chi phí biên. Phép so sánh đúng phải là điểm hòa vốn: một cỗ máy giá 4.500 đô la, với mức 0,50 đô la mỗi triệu token đầu ra của Claude Haiku 5.5, tương đương chín tỷ token đầu ra trước khi phần cứng hoàn vốn. Một nhóm tạo ra một trăm triệu token đầu ra mỗi tháng sẽ đạt đến điểm đó sau khoảng bảy năm rưỡi, và đến lúc ấy thì GPU đã lỗi thời. Một nhóm tạo ra năm tỷ token mỗi tháng sẽ đạt đến đó trong chưa đầy hai tháng.

Cả hai câu trả lời đều đúng, và chúng đúng với những công ty khác nhau. Đó chính là lý do toàn bộ phép so sánh này không thể được giải quyết trên một bảng thông số kỹ thuật, và cũng là lý do phép tính ở trên bỏ qua mọi thứ khiến suy luận cục bộ trở nên tốn kém trên thực tế: tiền điện, không gian giá rack, người chịu trách nhiệm cập nhật driver, và việc một cỗ máy đặt trên bàn là một điểm lỗi đơn lẻ trừ khi bạn mua hai chiếc. Cộng thêm những thứ đó vào, điểm hòa vốn lại càng lùi xa hơn.

Điều mà suy luận cục bộ mua được bằng số tiền đó hoàn toàn không phải là chi phí. Đó là sự bảo đảm rằng một prompt không bao giờ rời khỏi tòa nhà, thứ đáng giá hơn bất kỳ mức giá trên mỗi token nào đối với một nhóm liên quan đến pháp lý, y tế hoặc quốc phòng, và không mức giảm giá nào Anthropic đưa ra có thể thay thế được điều đó. Ngược lại, ngữ cảnh 1M token và giới hạn đầu ra 128.000 token của Claude Haiku 5.5 là những thứ bạn không thể mua bằng bất kỳ giá nào trên một card 24GB, và một cỗ máy $4,500 không thay đổi được điều đó.

85,4% thực sự đo lường điều gì

Con số được Perplexity công bố cho PPLX 27B là 85,4% trên Local Knowledge Work Bench gồm 53 nhiệm vụ của riêng mình, so với 82,6% cho cùng bộ kiểm thử đó chạy trên nền Qwen 3.8 27B chưa tinh chỉnh, 77,6% cho Pi và 74,0% cho Hermes. Có ba điều về chuyện đó đáng được nói thẳng, bởi vì các bài đưa tin về buổi ra mắt nói chung đã không nói ra chúng.

Đây là thông tin do nhà cung cấp báo cáo và chưa được tái lập độc lập. Đây là so sánh trên chính bộ kiểm thử của nhà cung cấp, tức phép thử công bằng nhất có thể đối với một mô hình được hậu huấn luyện trên bộ kiểm thử đó — mức cải thiện so với mô hình nền một phần là nhờ khớp với bài kiểm tra. Và nó đo lường cụ thể công việc tri thức cục bộ: truy xuất, tóm tắt, xử lý tài liệu, những tác vụ mà Portable Computer được thiết kế để làm. Đây không phải là điểm năng lực tổng quát và không nên được hiểu như vậy.

Mô hình cơ sở lại là chuyện khác. Qwen 3.8 27B là mô hình dense, được cấp phép Apache-2.0, đa phương thức và phát hành ngày 14 tháng 8 năm 2026 với cửa sổ ngữ cảnh gốc 262.144 token, và Artificial Analysis chấm điểm cấu hình suy luận của nó ở Intelligence Index 44 — cao hơn 43,40 của Claude Haiku 5.5 một điểm, ở một mức giá khác. PPLX 27B chính là mô hình đó cộng với quá trình hậu huấn luyện của Perplexity, nên cách hiểu trung thực là các trọng số nền tảng nằm trong dải năng lực của Claude Haiku 5.5 và việc tinh chỉnh đã đẩy chúng về phía khối lượng công việc của một nhà cung cấp. Việc bạn đang mua thứ nào trong hai thứ đó chính là câu hỏi mà 85,4% được thiết kế để không trả lời.

Nơi Claude Haiku 5.5 chiến thắng mà không cần đến một bài kiểm chuẩn

Ngữ cảnh dài, thứ nhất: 1M token so với khoảng 262K, và 128.000 token đầu ra tối đa so với một con số chưa được công bố. Đầu vào hình ảnh, thứ hai, thứ mà dòng Qwen 3.8 có nhưng bộ khung của Perplexity không quảng cáo. Kiểm soát nỗ lực, thứ ba, và đây là yếu tố bị đánh giá thấp — cài đặt Low tồn tại chính là để bạn có thể ngừng trả tiền cho các token suy luận trong những lượt gọi không cần đến chúng, một đòn bẩy chi phí mà không mô hình cục bộ nào có được vì không có hóa đơn nào để giảm.

Và tính sẵn có, điều thứ tư. Claude Haiku 5.5 là một chuỗi mô hình trên API, và các con số độc lập đều tồn tại: Chỉ số Trí tuệ 43 tổng thể và 43,40 ở Max effort, đứng thứ hai trong 182, với 0,21 đô la mỗi tác vụ chỉ số và 243,4 token đầu ra mỗi giây cùng khoảng 0,3 giây để có token đầu tiên. Khi bạn đang quyết định liệu một khối lượng công việc đã sẵn sàng để chuyển đi hay chưa, một điểm số đã được công bố mà bạn không tự tính toán có giá trị hơn một con số nhanh hơn do bạn tính ra.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

Nơi PPLX 27B chiến thắng mà không cần benchmark

Quyền riêng tư là điều đầu tiên và quan trọng nhất: các token không bao giờ rời khỏi máy, điều mà không mô hình hosted nào có thể sánh bằng. Chi phí ở quy mô lớn là điều thứ hai, và nó thực sự đáng kể khi vượt qua vài tỷ token đầu ra mỗi tháng. Hoạt động ngoại tuyến là điều thứ ba — một chiếc laptop trong tầng hầm không có kết nối vẫn trả lời được, còn Claude Haiku 5.5 thì không. Và chế độ hybrid được bổ sung vào ngày 1 tháng 9 là thiết kế thú vị nhất trong sản phẩm: một mô hình cục bộ đảm nhận công việc thường ngày, với một mô hình đám mây đằng sau một cổng trên thiết bị cho những tác vụ khó, chính xác là cách bạn có được cả quyền riêng tư lẫn năng lực, và đó là kiến trúc mà hầu hết các đội nên sao chép, bất kể họ mua nó từ nhà cung cấp nào.

Điều mà PPLX 27B không cung cấp là một giải pháp có thể mang đi. Nó bị ràng buộc với Portable Computer, đòi hỏi phải đăng ký thuê bao để có được các trọng số, và các trọng số là một dẫn xuất từ mô hình của người khác — nên giấy phép mà bạn thực sự nắm giữ là của Perplexity, không phải Apache-2.0. Nếu mục tiêu là một mô hình mà bạn có thể fork và phát hành, thì Qwen 3.8 27B gốc là mô hình có giấy phép thông thoáng, nhưng đó là một mô hình khác với mô hình mà bài viết này nói đến.

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

Chạy một trong hai cái đó từ một phím duy nhất, và chỗ mà nó dừng lại

PPLX 27B hoàn toàn không được cung cấp qua API: nó chạy bên trong Portable Computer trên chính phần cứng của bạn, và chế độ kết hợp sẽ kết nối tới một mô hình đám mây do Perplexity lựa chọn ở phía bên kia Cổng Riêng tư. Claude Haiku 5.5 có sẵn thông qua API của chính Anthropic và, từ đó, ở bất cứ nơi nào các mô hình của Anthropic được bán lại. Cả hai đều không có trong danh mục của OrcaRouter, và chúng tôi sẽ không gợi ý điều ngược lại — những gì chúng tôi định tuyến từ hai dòng này là anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 và anthropic/claude-fable-5.1, và riêng phần nền Qwen 3.8 27B mà PPLX 27B được hậu huấn luyện từ đó, vốn có trong danh mục tại qwen/qwen3.8-27b và được tự vận hành trên hạ tầng của chính chúng tôi.

Điểm cuối cùng đó mới là điểm thực tế. Nếu lý do bạn đang xem xét PPLX 27B là các trọng số Qwen 3.8 27B bên dưới nó chứ không phải khả năng thực thi cục bộ, thì bạn có thể có mô hình cơ sở thông qua một API cho hơn 200 mô hình, một khóa và một hóa đơn, với giá niêm yết của nhà cung cấp được chuyển thẳng qua ở mức markup 0% và tự động chuyển đổi dự phòng giữa các nhà cung cấp ở bên dưới. Nếu điều bạn thực sự cần là prompt không bao giờ rời khỏi máy, thì không có gateway nào là câu trả lời cả và Portable Computer mới là.

Quyết định, không giả vờ rằng những con số định đoạt nó.

Nếu các prompt của bạn không thể rời khỏi hạ tầng của mình, thì PPLX 27B là lựa chọn duy nhất trong hai phương án này tồn tại đối với bạn, và $4,500 không phải là một so sánh chi phí — đó là cái giá của một ràng buộc mà bạn không thể thương lượng để gỡ bỏ. Nếu bạn đang đốt hơn vài tỷ token đầu ra mỗi tháng, phương án cục bộ sẽ tự hoàn vốn trong vòng một quý và sau đó tiếp tục sinh lời.

Nếu cả hai điều đó đều không đúng, thì Claude Haiku 5.5 là lựa chọn đáng mua hơn ở gần như mọi khối lượng: không cần phần cứng, không cần vận hành, cửa sổ 1M token, giới hạn đầu ra 128.000 token, đầu vào hình ảnh, một núm điều chỉnh nỗ lực giúp hạ chi phí khi cần, điểm số độc lập được công bố là 43, và mức giá 0,10 đô la và 0,50 đô la mỗi triệu token khiến điểm hòa vốn so với một máy trạm rơi vào khoảng chín tỷ token. Con số 0,00 đô la mỗi token là đúng. Chỉ có điều nó không phải là toàn bộ phép trừ.

Nếu lý do bạn đang xem xét PPLX 27B là các trọng số Qwen 3.8 27B bên dưới nó chứ không phải khả năng chạy cục bộ, thì bạn có thể dùng mô hình cơ sở thông qua một API cho hơn 200 mô hình, một khóa và một hóa đơn, với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức markup 0% và tự động chuyển đổi dự phòng giữa các nhà cung cấp ở bên dưới.