제목이 'Claude Haiku 5.5 vs PPLX 27B'이고 킥커가 '토큰당 $0.00은 무료가 아니다'이며, 칩에는 하드웨어 없음 대 약 $4,500, 1M 대 262K 컨텍스트, 클라우드 대 온디바이스라고 적혀 있는 생성된 히어로 카드.
Guides & Insights

Claude Haiku 5.5 vs PPLX 27B: 토큰당 $0.00은 무료와 같지 않다

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

PPLX 27B는 토큰당 비용이 전혀 들지 않습니다. 이 모델은 당신이 소유한 하드웨어에서 로컬로 실행되며, 하드웨어를 한 번 구입하고 나면 다음 토큰의 한계 비용은 정말로 0입니다. Claude Haiku 5.5는 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.50입니다. 이는 너무 작은 숫자라서, 명백한 결론을 받아들이기보다 빼기를 제대로 계산해 볼 가치가 있습니다. PPLX 27B를 잘 실행할 수 있는 기계는 대략 $4,500짜리 DGX Spark이거나 24GB 이상의 RTX 카드를 장착한 데스크톱이며, $4,500어치의 Claude Haiku 5.5 출력 토큰은 약 90억 개입니다. 따라서 이 대결이 실제로 던지는 질문은 어느 쪽이 더 저렴한가가 아닙니다. 바로 당신이 얼마나 많은 토큰을 태울 것으로 예상하는지, 그리고 그 토큰이 당신의 책상 위에 놓여 있기 때문에 그 답이 달라지는지입니다.

Claude Haiku 5.5는 공급업체의 소형 모델로, 2026년 10월 7일에 출시되었습니다. PPLX 27B는 Perplexity가 2026년 8월 25일 NVIDIA와 함께 제작된 Portable Computer와 함께 발표한 모델로, Perplexity 자체 하네스에 맞춰 조정된 오픈 웨이트 Qwen 3.8 27B의 포스트트레이닝 버전입니다. 어느 쪽도 서로를 그대로 대체할 수 있는 제품이 아니며, 둘 다 OrcaRouter의 카탈로그에 없습니다.

두 가지 모델, 그리고 그중 하나가 당신 책상 위에 있는 이유

Claude Haiku 5.5 — ID claude-haiku-5-5, 텍스트와 이미지를 입력받아 텍스트를 출력하며, 100만 토큰 컨텍스트, 최대 128,000 토큰 출력(배치 API에서는 30만 토큰 베타 경로 제공), 2026년 6월 학습 컷오프, 그리고 2027년 10월 7일 이전에는 서비스를 종료하지 않겠다는 약속. Effort는 Low부터 Max까지이고 기본값은 Medium이며, 적응형 사고(adaptive thinking)는 기본으로 켜져 있고, 캐시 읽기는 백만 토큰당 $0.01이며 Batch는 요금을 절반으로 줄입니다. 호스팅형 제품입니다. 토큰을 보내면 토큰을 받고, GPU는 볼 일이 없습니다.

PPLX 27B — Qwen 3.8 27B에서 파생되어 Perplexity의 자체 에이전트 하네스를 위해 포스트 트레이닝된 270억 개의 매개변수를 가진 덴스 모델입니다. 이 모델은 DGX Spark 또는 24GB 이상의 NVIDIA RTX 카드가 장착된 Linux 머신의 Portable Computer 내에서 실행되며, 해당 머신을 벗어나지 않습니다. 2026년 9월 1일에 추가된 하이브리드 모드는 온디바이스 Privacy Gate 뒤에서 더 무거운 작업을 위해 이 모델을 클라우드 모델과 페어링합니다. RTX용 Linux 지원은 9월 3일에 제공되었으며, 24GB 이상의 RTX 카드용 Windows 지원은 로컬 MCP 및 예약 작업과 함께 9월 14일에 제공되었습니다. 포스트 트레이닝된 가중치는 독점적이며, Perplexity Pro 또는 Max 구독이 있어야 사용할 수 있습니다.

A generated two-column scoreboard titled 'Claude Haiku 5.5 vs PPLX 27B — the scoreboard'. Claude Haiku 5.5 reads marginal price $0.10 / $0.50 per million tokens, no upfront hardware, 1M-token context, 128K max output, AA Index 43, vendor-cloud data path; PPLX 27B reads marginal price $0.00 per token, about $4,500 upfront hardware, about 262K tokens of context, max output not published, no published independent score, on-device-only data path. A footer notes the Claude figures are per Artificial Analysis and the PPLX 27B figures are vendor-reported.

• 치수, 각각 한 줄씩

• 토큰당 한계 비용 — Claude Haiku 5.5는 프롬프트 100K 토큰까지는 입력 100만 토큰당 $0.10, 출력 100만 토큰당 $0.50이고, 그 이후에는 입력 $0.50, 출력 $2.50; PPLX 27B는 하드웨어 비용을 지불하고 나면 비용이 0이다.

• 시작 비용 — Claude Haiku 5.5용 API 키 외에는 아무것도 들지 않습니다. PPLX 27B의 경우 약 $4,500 상당의 DGX Spark 또는 24GB 이상의 NVIDIA RTX 카드가 장착된 데스크톱이 필요합니다.

• 컨텍스트 윈도우 — Claude Haiku 5.5의 경우 1,000,000 토큰으로, Qwen 3.8 27B에서 물려받은 약 262,144 토큰과 대비됩니다.

• 최대 출력 — Claude Haiku 5.5의 경우 128,000토큰, Batch에서는 300,000토큰 베타 헤더 사용; PPLX 27B에 대해서는 공개되지 않음.

• 데이터가 어디로 가는지 — Anthropic의 클라우드와 사용자의 자체 머신, 그리고 하이브리드 모드의 Privacy Gate가 무엇이 머신을 떠날지 결정합니다.

• 독립 점수 — Claude Haiku 5.5의 Artificial Analysis Intelligence Index 43, Max 구성 43.40, 182개 중 2위; PPLX 27B에 대해서는 공개된 것이 없으며, Artificial Analysis는 이를 추적하지 않습니다.

• 출력 속도 — Claude Haiku 5.5의 경우 초당 243.4토큰이며, PPLX 27B의 경우 사용자의 GPU에 따라 달라지고, 공개된 수치가 없어 비교할 수 없습니다.

• 입력 모달리티 — 텍스트와 이미지 대 텍스트, 멀티모달 기반에서 상속됨.

• 가중치 — 두 경우 모두 독점적이지만, 이유는 다릅니다: 가중치가 공개되지 않은 경우와, 구독해야 얻을 수 있는 제한된 포스트트레인인 경우입니다.

하드웨어가 곧 가격이고, 그 가격이 정직성 테스트다.

“Free”는 로컬 추론에 맞는 단어가 아니며, 벤더들도 이를 알고 있다. 그래서 항상 인용되는 숫자는 한계 비용이다. 올바른 비교는 손익분기점이다: $4,500짜리 머신은 Claude Haiku 5.5의 백만 출력 토큰당 $0.50 기준으로, 하드웨어가 본전을 뽑기까지 90억 출력 토큰이 필요하다. 한 달에 1억 출력 토큰을 생성하는 팀은 약 7년 6개월 만에 그 지점에 도달하는데, 그때쯤이면 GPU는 구식이 된다. 한 달에 50억을 생성하는 팀은 두 달이 채 안 되어 그 지점에 도달한다.

두 답 모두 맞습니다. 그리고 서로 다른 회사에 맞는 답입니다. 바로 이것이 이 비교를 스펙 시트만으로 결론 낼 수 없는 이유이며, 위 계산이 실제 환경에서 로컬 추론을 비싸게 만드는 모든 요소—전기, 랙 공간, 드라이버 업데이트를 책임지는 사람, 그리고 두 대를 사지 않는 한 책상 위의 머신은 단일 장애점이라는 사실—을 무시하는 이유이기도 합니다. 이것들을 더하면 손익분기점은 더 멀어집니다.

그 돈으로 로컬 추론이 얻는 것은 비용이 전혀 아니다. 그것은 프롬프트가 결코 건물 밖으로 나가지 않는다는 보장이며, 법무·의료·국방 인접 팀에게는 어떤 토큰당 요율보다도 더 가치가 있고, Anthropic이 제공하는 어떤 할인도 그것을 대신하지 못한다. 반대로, Claude Haiku 5.5의 1M 토큰 컨텍스트와 128,000토큰 출력 상한은 24GB 카드에서는 어떤 가격을 치러도 살 수 없는 것이며, 4,500달러짜리 머신도 그것을 바꾸지 못한다.

85.4%가 실제로 측정하는 것

PPLX 27B에 대해 Perplexity가 공개한 수치는 자체 53개 과제 Local Knowledge Work Bench에서 85.4%이며, 튜닝되지 않은 Qwen 3.8 27B 베이스에서 동일한 하네스를 실행했을 때는 82.6%, Pi는 77.6%, Hermes는 74.0%였다. 이와 관련해 분명히 말할 만한 세 가지가 있는데, 출시 보도에서는 일반적으로 그것들을 말하지 않았다.

이는 벤더가 보고한 것이며 독립적으로 재현되지 않았습니다. 이는 벤더 자체 하네스에서의 비교로, 해당 하네스에 사후 학습된 모델에게는 가능한 한 가장 공정한 테스트입니다 — 기본 모델 대비 향상은 부분적으로 테스트에 맞춰진 데서 오는 향상입니다. 그리고 이는 로컬 지식 작업, 구체적으로 검색, 요약, 문서 처리, 즉 Portable Computer가 위해 만들어진 작업들을 측정합니다. 이는 일반 역량 점수가 아니며 그렇게 읽혀서도 안 됩니다.

기반 모델은 별개의 문제다. Qwen 3.8 27B는 dense이고 Apache-2.0 라이선스이며 멀티모달이고, 2026년 8월 14일 262,144토큰 네이티브 컨텍스트 윈도우와 함께 공개되었으며, Artificial Analysis는 이 모델의 추론 구성을 Intelligence Index 44점으로 평가한다 — 이는 Claude Haiku 5.5의 43.40보다 1점 높은 점수이고, 가격대는 다르다. PPLX 27B는 그 모델에 Perplexity의 포스트트레이닝을 더한 것이므로, 솔직히 해석하자면 기반 가중치는 Claude Haiku 5.5의 역량 대역에 있고 튜닝이 이를 특정 벤더의 워크로드 쪽으로 옮겨 놓은 것이다. 당신이 그 두 가지 중 어느 것을 사고 있는지가 바로 85.4%가 답하지 않도록 설계된 질문이다.

Claude Haiku 5.5가 벤치마크 없이도 앞서는 부분

첫째, 긴 컨텍스트: 100만 토큰 대 약 262K, 그리고 최대 출력 128,000 토큰 대 비공개 수치입니다. 둘째, 이미지 입력: Qwen 3.8 계열은 갖추고 있지만 Perplexity의 하네스는 내세우지 않습니다. 셋째, 에포트 제어인데, 이것이 가장 과소평가된 항목입니다 — Low 설정은 추론 토큰이 필요 없는 호출에서 그 비용을 계속 지불하지 않도록 존재합니다. 이는 어떤 로컬 모델도 제공하지 않는 비용 레버입니다. 낮출 청구서가 없기 때문입니다.

그리고 가용성, 네 번째. Claude Haiku 5.5는 API의 모델 문자열이고, 독립적인 수치들이 존재한다: Intelligence Index는 종합 43, Max effort에서 43.40으로 182개 중 2위이며, 인덱스 작업당 $0.21, 초당 출력 토큰 243.4개, 첫 토큰까지 약 0.3초이다. 워크로드가 이전할 준비가 되었는지 판단할 때, 직접 계산하지 않은 공개된 점수는 당신이 계산한 더 빠른 숫자보다 더 가치가 있다.

A capture of Anthropic's Claude Platform models documentation showing the current Claude lineup — Claude Fable 5.1, Claude Opus 5.5, Claude Sonnet 5.5 and Claude Haiku 5.5 — with each model's context window, maximum output and per-million input and output pricing.

PPLX 27B가 벤치마크 없이도 승리하는 지점

프라이버시가 첫 번째이자 가장 중요합니다: 토큰은 절대 기기를 떠나지 않으며, 이는 어떤 호스팅 모델도 따라올 수 없습니다. 대규모 비용이 두 번째이며, 월 수십억 개의 출력 토큰을 넘어서면 실제로 체감됩니다. 오프라인 작동이 세 번째입니다 — 연결이 없는 지하실의 노트북도 여전히 답하지만, Claude Haiku 5.5는 그렇지 않습니다. 그리고 9월 1일에 추가된 하이브리드 모드는 이 제품에서 가장 흥미로운 설계입니다: 로컬 모델이 일상적인 작업을 처리하고, 어려운 호출에는 온디바이스 게이트 뒤의 클라우드 모델이 나서는 방식은 바로 프라이버시와 성능을 모두 얻는 방법이며, 어느 벤더에서 구매하든 대부분의 팀이 따라 해야 할 아키텍처입니다.

PPLX 27B가 제공하지 않는 것은 이식 가능한 해답이다. 그것은 Portable Computer에 묶여 있고, 가중치를 얻으려면 구독이 필요하며, 그 가중치는 다른 누군가의 모델에서 파생된 것이므로 실제로 보유하게 되는 라이선스는 Apache-2.0이 아니라 Perplexity의 것이다. 목표가 포크해서 배포할 수 있는 모델이라면, 기반 Qwen 3.8 27B가 허용적 라이선스를 가진 쪽이지만, 그것은 이 기사에서 다루는 모델과는 다른 모델이다.

A capture of the OrcaRouter model page for qwen/qwen3.8-27b showing the Qwen3.8-27B listing with its Vision, Tools, JSON and Reasoning badges, its per-million pricing and the description noting it is released under Apache-2.0 and self-hosted on OrcaRouter's own infrastructure.

둘 중 하나를 하나의 키에서 실행하는 것, 그리고 그것이 멈추는 지점

PPLX 27B는 API를 통해 전혀 제공되지 않습니다. 이 모델은 사용자의 자체 하드웨어에 있는 Portable Computer 내부에서 실행되며, 하이브리드 모드는 Privacy Gate 건너편에서 Perplexity가 선택한 클라우드 모델에 연결됩니다. Claude Haiku 5.5는 Anthropic 자체 API를 통해 이용할 수 있으며, 거기서부터는 Anthropic의 모델이 재판매되는 곳이라면 어디든 이용할 수 있습니다. 둘 다 OrcaRouter의 카탈로그에 없으며, 그렇지 않은 것처럼 말하지 않겠습니다. 이 두 제품군에서 저희가 라우팅하는 것은 anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 그리고 anthropic/claude-fable-5.1이며, 이와는 별도로 PPLX 27B가 포스트 트레이닝의 기반으로 삼은 Qwen 3.8 27B 베이스는 카탈로그에 qwen/qwen3.8-27b로 등재되어 있으며 저희 자체 인프라에서 셀프 호스팅됩니다.

마지막 요점이 실질적인 요점입니다. PPLX 27B를 살펴본 이유가 로컬 실행이 아니라 그 밑에 있는 Qwen 3.8 27B 가중치 때문이라면, 200개 이상의 모델을 위한 하나의 API를 통해 기본 모델을 사용할 수 있습니다. 하나의 키와 하나의 청구서로, 공급자 정가는 0% 마크업으로 그대로 전달되며 그 아래에서 공급자 간 자동 장애 조치가 이루어집니다. 정말로 필요한 것이 프롬프트가 절대 머신을 떠나지 않는 것이라면, 게이트웨이가 없는 것이 답이고 Portable Computer가 그 답입니다.

숫자가 그것을 해결한다고 가장하지 않는 그 결정

프롬프트가 여러분의 인프라를 벗어날 수 없다면, 이 둘 중 여러분에게 존재하는 것은 PPLX 27B뿐이며, $4,500은 비용 비교가 아니라 협상으로 없앨 수 없는 제약의 대가입니다. 한 달에 수십억 개가 넘는 출력 토큰을 태운다면, 로컬 경로는 한 분기 안에 본전을 뽑고 그 뒤에도 계속 이득을 가져다줍니다.

그 둘 중 어느 것도 사실이 아니라면, Claude Haiku 5.5는 거의 모든 사용량에서 더 나은 선택이다: 하드웨어도, 운영도 필요 없고, 1M 토큰 창, 128,000 토큰 출력 상한, 이미지 입력, 필요할 때 비용을 낮춰 주는 effort 다이얼, 공개된 독립 점수 43, 그리고 워크스테이션 대비 손익분기점을 약 90억 토큰 이후로 밀어내는 백만 토큰당 $0.10 및 $0.50의 가격을 갖췄다. 토큰당 $0.00라는 수치는 사실이다. 다만 그것이 전체 뺄셈은 아니다.

PPLX 27B를 살펴본 이유가 로컬 실행이 아니라 그 밑에 깔린 Qwen 3.8 27B 가중치 때문이었다면, 200개 이상의 모델을 제공하는 하나의 API를 통해 기본 모델을 이용할 수 있습니다, 하나의 키와 하나의 청구서, 0% 마크업으로 공급자 정가가 그대로 적용되고 그 밑에서 공급자 간 자동 페일오버가 이루어집니다.