
Claude Haiku 5 vs PPLX 27B: $0.00 per Token Tidak Sama dengan Gratis
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
PPLX 27B tidak memakan biaya per token. Model ini berjalan secara lokal, di perangkat keras yang Anda miliki, dan setelah perangkat kerasnya dibeli, biaya marginal untuk token berikutnya benar-benar nol. Claude Haiku 5.5 memakan biaya $0,10 per juta token input dan $0,50 per juta token output — sebuah angka yang cukup kecil sehingga ada baiknya melakukan pengurangan dengan benar alih-alih menerima kesimpulan yang sudah jelas. Mesin yang mampu menjalankan PPLX 27B dengan baik adalah DGX Spark seharga sekitar $4.500 atau desktop dengan kartu RTX 24GB atau lebih, dan $4.500 token output Claude Haiku 5.5 adalah sekitar sembilan miliar token. Jadi, pertanyaan yang sebenarnya diajukan oleh perbandingan ini bukanlah mana yang lebih murah. Melainkan berapa banyak token yang Anda perkirakan akan Anda bakar, dan apakah jawabannya berubah karena token-token itu berada di meja Anda.
Claude Haiku 5.5 adalah model kecil milik vendor tersebut, dirilis 7 Oktober 2026. PPLX 27B diumumkan oleh Perplexity pada 25 Agustus 2026 bersama Portable Computer, dibangun dengan NVIDIA, dan merupakan versi pasca-pelatihan dari Qwen 3.8 27B berbobot terbuka yang disetel untuk harness milik Perplexity. Keduanya bukan pengganti langsung satu sama lain, dan keduanya tidak ada di katalog OrcaRouter.
Dua model, dan mengapa salah satunya berada di meja Anda
Claude Haiku 5.5 — ID claude-haiku-5-5, teks dan gambar masuk, teks keluar, konteks 1 juta token, keluaran maksimum 128.000 token dengan jalur beta 300.000 token pada Batch API, batas waktu pelatihan Juni 2026 dan komitmen untuk tidak menghentikannya sebelum 7 Oktober 2027. Effort berjalan dari Low hingga Max dengan Medium sebagai default, adaptive thinking aktif secara default, pembacaan cache berbiaya $0,01 per juta token dan Batch memangkas tarifnya menjadi setengah. Ini produk terkelola: Anda mengirim token, Anda menerima token, Anda tidak pernah melihat GPU.
PPLX 27B — model dense dengan 27 miliar parameter yang diturunkan dari Qwen 3.8 27B dan dilatih lanjut untuk harness agen milik Perplexity sendiri. Model ini berjalan di dalam Portable Computer pada DGX Spark atau pada mesin Linux dengan kartu NVIDIA RTX berkapasitas 24GB atau lebih, dan tidak pernah meninggalkan mesin tersebut. Mode hibrida yang ditambahkan pada 1 September 2026 memasangkannya dengan model cloud untuk pekerjaan yang lebih berat di balik Privacy Gate yang berjalan di perangkat; dukungan Linux untuk RTX hadir pada 3 September; dukungan Windows untuk kartu RTX 24GB ke atas hadir pada 14 September, bersama dengan MCP lokal dan tugas terjadwal. Bobot hasil pelatihan lanjutannya bersifat proprietary dan hanya dapat diakses di balik langganan Perplexity Pro atau Max.

• Dimensinya, satu baris masing-masing
• Biaya marginal per token — Claude Haiku 5.5 $0.10 per juta untuk input dan $0.50 untuk output hingga 100K token prompt, lalu $0.50 dan $2.50; PPLX 27B tidak ada biaya, setelah perangkat kerasnya sudah dibayar.
Biaya untuk memulai — tidak ada apa pun selain kunci API untuk Claude Haiku 5.5; sekitar $4.500 untuk DGX Spark, atau desktop dengan kartu NVIDIA RTX 24GB atau lebih, untuk PPLX 27B.
• Jendela konteks — 1.000.000 token untuk Claude Haiku 5.5 dibandingkan sekitar 262.144 yang diwarisi dari Qwen 3.8 27B.
• Output maksimum — 128.000 token untuk Claude Haiku 5.5, dengan header beta 300.000 token pada Batch; tidak dipublikasikan untuk PPLX 27B.
• Ke mana data pergi — cloud Anthropic versus mesin Anda sendiri, dengan Privacy Gate dari mode hybrid yang menentukan apa yang keluar darinya.
• Skor independen — Indeks Kecerdasan Artificial Analysis 43 untuk Claude Haiku 5.5, konfigurasi Max 43.40, peringkat kedua dari 182; tidak ada yang dipublikasikan untuk PPLX 27B, yang tidak dilacak oleh Artificial Analysis.
• Kecepatan keluaran — 243,4 token per detik untuk Claude Haiku 5.5; bergantung pada GPU Anda untuk PPLX 27B, dan tidak dapat dibandingkan tanpa angka yang dipublikasikan.
• Modalitas masukan — teks dan gambar terhadap teks, diwarisi dari basis multimodal.
• Bobot — eksklusif dalam kedua kasus, tetapi karena alasan yang berbeda: tidak ada bobot yang dirilis versus pasca-pelatihan terbatas yang memerlukan langganan untuk memperolehnya.
Perangkat keras adalah harganya, dan harga adalah ujian kejujuran.
"Gratis" adalah kata yang salah untuk inferensi lokal dan para vendor mengetahuinya, itulah sebabnya angka yang dikutip selalu biaya marginal. Perbandingan yang benar adalah titik impas: mesin $4.500 dengan $0,50 per juta token keluaran Claude Haiku 5.5 setara dengan sembilan miliar token keluaran sebelum perangkat kerasnya melunasi dirinya sendiri. Tim yang menghasilkan seratus juta token keluaran per bulan mencapai titik itu dalam sekitar tujuh setengah tahun, dan pada saat itu GPU sudah usang. Tim yang menghasilkan lima miliar per bulan mencapainya dalam kurang dari dua bulan.
Kedua jawaban itu benar, dan keduanya benar untuk perusahaan yang berbeda. Itulah alasan utama mengapa perbandingan ini tidak bisa diselesaikan hanya dengan lembar spesifikasi, dan juga mengapa perhitungan di atas mengabaikan segala hal yang membuat inferensi lokal mahal dalam praktik: listrik, ruang rak, orang yang bertanggung jawab atas pembaruan driver, dan fakta bahwa sebuah mesin di atas meja merupakan titik kegagalan tunggal kecuali Anda membeli dua. Tambahkan semua itu dan titik impasnya bergeser semakin jauh.
Apa yang diperoleh dari inferensi lokal untuk uang sebesar itu sama sekali bukan biaya. Itu adalah jaminan bahwa sebuah prompt tidak pernah meninggalkan gedung, yang nilainya lebih besar daripada tarif per token mana pun bagi tim hukum, medis, atau yang berkaitan dengan pertahanan, dan tidak ada diskon yang ditawarkan Anthropic yang dapat menggantikannya. Sebaliknya, konteks 1M-token dan batas keluaran 128.000-token Claude Haiku 5.5 adalah hal-hal yang tidak dapat Anda beli dengan harga berapa pun pada kartu 24GB, dan mesin seharga $4,500 tidak mengubah itu.
Apa yang sebenarnya diukur oleh 85,4%
Angka yang diterbitkan Perplexity untuk PPLX 27B adalah 85,4% pada Local Knowledge Work Bench 53 tugas miliknya sendiri, dibandingkan dengan 82,6% untuk perangkat uji yang sama yang dijalankan pada Qwen 3.8 27B base yang belum disetel, 77,6% untuk Pi, dan 74,0% untuk Hermes. Ada tiga hal tentang itu yang layak dikatakan secara terus terang, karena liputan peluncuran umumnya tidak menyebutkannya.
Ini dilaporkan oleh vendor dan belum direproduksi secara independen. Ini adalah perbandingan pada harness milik vendor sendiri, yang merupakan uji paling adil yang mungkin untuk model yang dilatih lanjut pada harness tersebut — keunggulan dibanding model dasar sebagian merupakan keunggulan dalam menyesuaikan diri dengan uji tersebut. Dan ini mengukur pekerjaan pengetahuan lokal secara spesifik: pengambilan, peringkasan, penanganan dokumen, tugas-tugas yang menjadi tujuan pembuatan Portable Computer. Ini bukan skor kemampuan umum dan tidak boleh dibaca sebagai demikian.
Model dasar adalah hal yang berbeda. Qwen 3.8 27B bersifat padat, berlisensi Apache-2.0, multimodal dan dirilis pada 14 Agustus 2026 dengan jendela konteks native 262.144 token, dan Artificial Analysis menilai konfigurasi penalarannya pada Intelligence Index 44 — satu poin di atas Claude Haiku 5.5 yang 43,40, pada harga yang berbeda. PPLX 27B adalah model itu plus pasca-pelatihan Perplexity, jadi pembacaan yang jujur adalah bahwa bobot dasarnya berada dalam rentang kemampuan Claude Haiku 5.5 dan penyetelan memindahkannya ke arah beban kerja salah satu vendor. Mana dari dua hal itu yang Anda beli adalah pertanyaan yang angka 85,4% dirancang untuk tidak dijawab.
Di mana Claude Ha5.5 menang tanpa perlu tolok ukur
Konteks panjang, pertama: 1M token versus sekitar 262K, dan 128.000 token keluaran maksimum versus angka yang tidak dipublikasikan. Input gambar, kedua, yang dibawa oleh keluarga Qwen 3.8 tetapi tidak dipromosikan oleh harness Perplexity. Kontrol upaya, ketiga, dan inilah yang paling diremehkan — pengaturan Low ada khusus agar Anda bisa berhenti membayar token penalaran pada panggilan yang tidak membutuhkannya, yang merupakan tuas biaya yang tidak ditawarkan model lokal mana pun karena tidak ada tagihan yang perlu diturunkan.
Dan ketersediaan, keempat. Claude Haiku 5.5 adalah string model pada sebuah API, dan angka-angka independennya sudah ada: Intelligence Index 43 secara keseluruhan dan 43,40 pada Max effort, peringkat kedua dari 182, dengan biaya $0,21 per tugas indeks dan 243,4 token keluaran per detik dengan sekitar 0,3 detik ke token pertama. Saat Anda memutuskan apakah suatu beban kerja sudah siap dipindahkan, skor yang dipublikasikan yang tidak Anda hitung sendiri lebih bernilai daripada angka yang lebih cepat yang Anda hitung sendiri.

Ketika PPLX 27B unggul tanpa perlu benchmark
Privasi adalah yang pertama dan paling penting: token tidak pernah meninggalkan mesin, yang tidak dapat ditandingi oleh model hosted mana pun. Biaya pada volume besar adalah yang kedua, dan itu nyata setelah beberapa miliar token keluaran per bulan. Operasi offline adalah yang ketiga — laptop di ruang bawah tanah tanpa koneksi tetap menjawab, dan Claude Haiku 5.5 tidak. Dan mode hibrida yang ditambahkan pada 1 September adalah desain paling menarik dalam produk ini: model lokal yang mengerjakan pekerjaan rutin dengan model cloud di balik gerbang on-device untuk panggilan yang sulit adalah tepat cara Anda mendapatkan privasi sekaligus kapabilitas, dan itulah arsitektur yang paling harus ditiru oleh sebagian besar tim terlepas dari vendor mana mereka membelinya.
Yang tidak ditawarkan PPLX 27B adalah jawaban yang portabel. Model ini terikat pada Portable Computer, memerlukan langganan untuk memperoleh bobotnya, dan bobot tersebut merupakan turunan dari model milik orang lain — jadi lisensi yang sebenarnya Anda pegang adalah lisensi Perplexity, bukan Apache-2.0. Jika tujuannya adalah model yang dapat Anda fork dan distribusikan, Qwen 3.8 27B versi dasar adalah model dengan lisensi permisif, tetapi itu adalah model yang berbeda dari yang dibahas dalam artikel ini.

Menjalankan salah satu dari keduanya dari satu tombol, dan di mana itu berhenti
PPLX 27B sama sekali tidak tersedia melalui API: model ini berjalan di dalam Portable Computer pada perangkat keras Anda sendiri, dan mode hybrid-nya menjangkau model cloud pilihan Perplexity di sisi lain Privacy Gate. Claude Haiku 5.5 tersedia melalui API milik Anthropic sendiri dan, dari sana, di mana pun model-model Anthropic dijual kembali. Keduanya tidak ada dalam katalog OrcaRouter, dan kami tidak akan menyarankan sebaliknya — yang kami rutekan dari kedua keluarga ini adalah anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 dan anthropic/claude-fable-5.1, serta secara terpisah basis Qwen 3.8 27B yang menjadi dasar pasca-pelatihan PPLX 27B, yang ada dalam katalog di qwen/qwen3.8-27b dan di-hosting sendiri di infrastruktur kami sendiri.
Poin terakhir itu yang praktis. Jika alasan Anda melihat PPLX 27B adalah bobot Qwen 3.8 27B di baliknya, bukan eksekusi lokalnya, Anda bisa mendapatkan model dasar tersebut melalui satu API untuk 200+ model, satu kunci dan satu tagihan, dengan harga daftar penyedia diteruskan apa adanya pada markup 0% dan failover otomatis antar penyedia di baliknya. Jika yang sebenarnya Anda butuhkan adalah prompt tidak pernah meninggalkan mesin, jawabannya bukan gateway, melainkan Portable Computer.
Keputusan itu, tanpa berpura-pura bahwa angka-angka menyelesaikannya
Jika prompt Anda tidak boleh meninggalkan infrastruktur Anda, PPLX 27B adalah satu-satunya dari kedua ini yang ada untuk Anda, dan $4,500 bukanlah perbandingan biaya — itu adalah harga dari kendala yang tidak dapat Anda hilangkan melalui negosiasi. Jika Anda membakar lebih dari beberapa miliar token keluaran per bulan, jalur lokal akan balik modal dalam satu kuartal dan kemudian terus memberi keuntungan.
Jika tidak ada satu pun dari itu yang benar, Claude Haiku 5.5 adalah pilihan yang lebih baik pada hampir semua volume: tanpa perangkat keras, tanpa ops, jendela 1M token, batas keluaran 128.000 token, input gambar, pengatur upaya yang menurunkan biaya sesuai permintaan, skor independen yang dipublikasikan sebesar 43, dan harga $0,10 dan $0,50 per juta yang membuat titik impas terhadap workstation terjadi sekitar sembilan miliar token. Angka $0,00 per token itu benar. Hanya saja, itu bukan keseluruhan pengurangannya.
Jika alasan Anda melihat PPLX 27B adalah bobot Qwen 3.8 27B yang mendasarinya, bukan eksekusi lokal, Anda bisa mendapatkan model dasar tersebut melalui satu API untuk lebih dari 200 model, satu kunci dan satu tagihan, dengan harga daftar dari penyedia diteruskan pada markup 0% dan failover otomatis antar penyedia di baliknya.
