
Claude Haiku 5.5 vs Nemotron 3.5 Lightning 30B A3B Base: Yang Murah Tidak Bisa Menjawab Pertanyaan
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 56 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 347 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Pada dua angka yang paling dipedulikan oleh spreadsheet pengadaan, model yang lebih murah dan lebih cepatlah yang menang. Nemotron 3.5 Lightning 30B A3B Base berjalan pada 298,9 token keluaran per detik, tercepat di antara 142 model yang dilacak secara independen, dan berbiaya $0,06 per juta token, dibandingkan $0,10 milik Claude Haiku 5.5. Model ini juga, seperti yang diperingatkan oleh kata "Base" dalam namanya, bukanlah asisten. Ini adalah checkpoint pra-latih — tanpa supervised fine-tuning, tanpa reinforcement learning, tanpa templat obrolan yang layak disebut — yang diterbitkan dengan lisensi OpenMDW-1.1 pada 11 Agustus 2026 agar orang lain dapat membangun di atasnya. Claude Haiku 5.5, yang dirilis pada 7 Oktober 2026, adalah produk jadi yang bisa Anda kirimi pertanyaan. Membandingkan keduanya dari segi harga seperti membandingkan biaya tepung dengan biaya roti, dan bagian yang menarik dari pertarungan ini adalah mencari tahu mana yang sebenarnya dibutuhkan beban kerja Anda.
Tidak seorang pun dalam liputan peluncuran mengatakan bagian itu dengan jelas, karena "lebih murah dan lebih cepat daripada Claude Haiku 5.5" adalah judul yang lebih baik daripada "lebih murah, lebih cepat, dan tidak dapat digunakan tanpa menjalankan fine-tuning." Kedua pernyataan itu benar. Hanya satu di antaranya yang berguna.
Apa sebenarnya masing-masing model
Claude Haiku 5.5 — Anthropic, ID claude-haiku-5-5, dirilis 7 Oktober 2026. Masukan teks dan gambar, keluaran teks. Konteks 1 juta token, keluaran maksimum 128.000 token (300.000 di balik header beta pada Batch API), batas akhir pelatihan Juni 2026, pensiun tidak lebih awal dari 7 Oktober 2027. Upaya yang dapat disesuaikan di antara Low, Medium, High, Xhigh, dan Max, dengan default Medium, serta pemikiran adaptif yang aktif secara default. API berbayar per penggunaan, pembacaan cache sebesar $0,01 per juta, Batch dengan tarif setengah. Tersedia melalui API Anthropic dan, dari sana, di mana pun model Anthropic dijual kembali.
Nemotron 3.5 Lightning 30B A3B Base — NVIDIA, diumumkan pada 11 Agustus 2026. Sebuah checkpoint campuran para-ahli hibrida dengan 30 miliar parameter dan sekitar 3 miliar parameter aktif per token, dibangun di atas tumpukan Mamba-2 plus MoE plus attention, disuling dari Nemotron 3 Ultra, dan hadir dengan decoding spekulatif MTP, DFlash, dan DSpark. Konteksnya mencapai 1 juta token, meskipun sekitar 256.000 adalah batas praktis pada satu H100. Ini hanya teks. Bobotnya terbuka di bawah OpenMDW-1.1. Dan ini adalah checkpoint dasar: bobot pra-terlatih mentah tanpa penyetelan instruksi, yang berarti ia melengkapi teks alih-alih mengikuti instruksi.

• Dimensinya, satu baris masing-masing
• Harga input — Claude Haiku 5.5 $0.10 per juta hingga 100K token, lalu $0.50; Nemotron 3.5 Lightning 30B A3B Base $0.06 per juta.
• Harga output — $0.50 per juta hingga 100K token lalu $2.50, dibandingkan $0.20 per juta.
• Biaya per tugas yang diselesaikan — $0,21 per tugas indeks independen untuk Claude Haiku 5.5, dibandingkan $0,09 untuk Nemotron — model yang lebih murah lebih hemat per tugas, bukan hanya per token.
• Kecepatan output — 243,4 token per detik untuk Claude Haiku 5.5, peringkat kesembilan dari 182; 298,9 token per detik untuk Nemotron, peringkat pertama dari 142.
• Waktu hingga token pertama — sekitar 0,3 detik untuk Claude Haiku 5.5, dibandingkan 0,54 detik untuk Nemotron.
• Skor independen — Artificial Analysis Intelligence Index 43 untuk Claude Haiku 5.5, kedua dari 182, dengan konfigurasi Max pada 43,40; Indeks 13 untuk Nemotron, kedua puluh sembilan dari 142.
• Jendela konteks — masing-masing 1.000.000 token, dengan sekitar 256.000 yang praktis untuk Nemotron pada satu H100.
• Modalitas — teks dan gambar masuk untuk Claude Haiku 5.5; hanya teks untuk Nemotron.
• Bobot — proprieter vs terbuka di bawah OpenMDW-1.1, MoE hibrida dengan total 30B dan 3B aktif.
• Penyetelan instruksi — ada pada Claude Haiku 5.5, tidak ada pada checkpoint Base.
Masalah "Base", dinyatakan secara lugas
Checkpoint dasar memprediksi token berikutnya. Ajukan pertanyaan kepadanya, dan ia akan sering kali melanjutkan teks dengan gaya dokumen yang mungkin memuat pertanyaan semacam itu, bukan menjawabnya. Beri ia prompt "Summarise this contract", dan model dasar mungkin menghasilkan kelanjutan yang masuk akal dari dokumen pelatihan hukum, bukan ringkasan kontrak Anda. NVIDIA menerbitkan checkpoint BF16 terpisah dan model-model sejenis terpisah yang telah disetel instruksi justru karena bobot dasarnya adalah bahan mentah.
Pada kartu model NVIDIA sendiri — dilaporkan vendor, bukan direproduksi secara independen — checkpoint dasarnya mencetak 78.59 pada MMLU, 67.94 pada MMLU-Pro, 91.28 pada GSM8K, 77.44 pada HumanEval, dan 69.62 pada RULER pada 1 juta token. Kartu Lightning untuk varian yang telah disetel melaporkan MMLU-Pro 81.94, GPQA Diamond 75.44, SWE-Bench Verified 51.56, dan 86% pada PinchBench, dengan inferensi sekitar 30% lebih cepat daripada model yang digantikannya. Bahkan angka yang telah disetel itu pun milik NVIDIA sendiri, dan angka dasar adalah angka yang berlaku untuk checkpoint yang disebutkan dalam judul artikel ini. Dibandingkan dengan itu, 43.40 yang diukur secara independen dari Claude Haiku 5.5 — peringkat kedua dari 182 pada indeks Artificial Analysis, indeks berbeda yang mengukur hal-hal berbeda — tidak dapat dibandingkan secara langsung, dan pembacaan yang jujur adalah bahwa checkpoint dasar 30B dan model kecil yang sudah jadi dinilai oleh instrumen yang berbeda untuk tujuan yang berbeda.
Yang dapat dikatakan tanpa perlu kualifikasi adalah bentuk celahnya. Checkpoint dasar yang membutuhkan pipeline fine-tuning, stack penyajian, dan perangkat evaluasi sebelum bisa menjawab apa pun bukanlah pengganti bagi model yang dihosting dengan harga $0,10 per juta. Ini adalah titik awal bagi seseorang yang ingin memiliki modelnya sendiri.
Di mana Nemotron benar-benar menang, dan itu bukan hadiah hiburan
Kecepatan dulu. 298,8 token keluaran per detik menempatkannya di puncak papan 142 model — 23% lebih cepat daripada 243,4 milik Claude Haiku 5.5. Untuk pipeline yang sensitif terhadap latensi, itu adalah perbedaan nyata yang terukur, dan itulah alasan nama "Lightning" ada di kotaknya.
Bobot terbuka berada di urutan kedua, dan ini yang lebih besar. Di bawah OpenMD-1.1, Anda dapat mengunduh checkpoint, melakukan fine-tune dengan data Anda sendiri, dan menyajikannya sendiri. Claude Haiku 5.5 tidak dapat di-fine-tune dengan harga berapa pun dan tidak dapat di-hosting sendiri dengan harga berapa pun. Bagi tim dengan tugas proprietary, distribusi input yang tidak biasa, atau persyaratan kepatuhan bahwa lalu lintas tidak pernah meninggalkan infrastruktur mereka sendiri, perbedaan itu menentukan terlepas dari apa yang dikatakan halaman benchmark. Model 30B total dengan 3B aktif juga cukup kecil untuk dapat dilayani secara ekonomis — arsitekturnya dirancang tepat untuk itu.
Harga ketiga: $0.06 input dan $0.20 output per juta, dengan diskon cache 17% dan $0.09 per tugas indeks, kira-kira setengah dari $0.21 milik Claude Haiku 5.5. Kedua model murah; Nemotron lebih murah.
Tempat Claude Haiku 5.5 menang, yaitu setiap dimensi yang membutuhkan jawaban
Kepatuhan terhadap instruksi, karena telah dilatih untuk itu. Kemampuan independen, pada Index 43 versus 13 — selisih tiga puluh poin pada papan skor yang menilai keduanya, yang merupakan selisih terbesar dalam rangkaian perbandingan ini. Input gambar, yang sama sekali tidak diterima oleh Nemotron. Output maksimum pada 128.000 token versus angka yang belum dipublikasikan, dengan jalur beta 300.000 token pada Batch. Dan pengatur upaya, yang memungkinkan Anda menghemat biaya dengan menurunkan upaya penalaran alih-alih membangun ulang model.
Catatan verbositas di sini berlaku dua arah. Pada rangkaian pengujian Artificial Analysis, Claude Haiku 5.5 mengeluarkan sekitar 440 juta token keluaran dibandingkan median sekitar 100 juta — ia berpikir sangat banyak. Nemotron mengeluarkan sekitar 120 juta, yang oleh sumber yang sama digambarkan sebagai agak bertele-tele untuk ukurannya. Meskipun demikian, biaya per tugas Haiku 5.5 adalah $0,21 versus $0,09 milik Nemotron, jadi model yang cerewet pun bukan yang mahal. Apa yang ditunjukkan hal itu adalah bahwa harga per token menyesatkan di kedua arah, dan angka per tugas adalah yang harus dijadikan acuan anggaran.
Hosting mandiri versus satu endpoint
Nemotron 3.5 Lightning 30B A3B Base didistribusikan sebagai bobot terbuka dan dilayani oleh beberapa penyedia inferensi; NVIDIA juga menerbitkan varian saudara yang telah disetel. Claude Haiku 5.5 tersedia melalui API Anthropic dan, dari sana, di mana pun model Anthropic dijual kembali. Tidak satu pun ada dalam katalog OrcaRouter, dan kami tidak akan berpura-pura sebaliknya — yang kami rutekan dari lingkungan ini adalah anthropic/claude-haiku-4.5, anthropic/claude-sonnet-5.5, anthropic/claude-opus-5.5 dan anthropic/claude-fable-5.1, tingkat di atas subjek artikel ini.
Dua jalur yang dijelaskan perbandingan ini benar-benar memiliki sistem yang berbeda, dan penting untuk menyebutkannya. Jalur self-hosted berarti GPU, kerangka kerja serving, keputusan kuantisasi, dan rotasi ops. Jalur hosted berarti satu kunci dan satu string model. OrcaRouter hadir untuk jalur kedua: satu API untuk 200+ model, satu kunci dan satu tagihan, harga daftar penyedia diteruskan dengan markup 0% sehingga potongan vendor langsung berlaku pada hari yang sama, dengan failover otomatis di baliknya. Ini bukan jalur menuju checkpoint dasar 30B, dan membeli kotak kelas DGX bukanlah jalur menuju model kecil yang dihosting.

Siapa yang harus memilih yang mana?
Jika tugas Anda terdefinisi dengan baik, data pelatihan Anda cukup besar untuk berarti, dan lalu lintas Anda tidak dapat meninggalkan infrastruktur Anda sendiri, Nemotron 3.5 Lightning 30B A3B Base adalah objek yang lebih menarik: tercepat dari 142 dalam hal kecepatan output, setengah harga per token, dan milik Anda untuk dimodifikasi. Anggarkan biaya untuk menjalankan fine-tuning dan biaya serving sebelum Anda menghitung penghematannya, karena tarif input $0.06 mengasumsikan seseorang sudah melakukan pekerjaan yang mengubah checkpoint menjadi asisten.
Jika Anda ingin mengirim prompt dan mendapatkan jawaban sore ini, Claude Haiku 5.5 adalah pilihan yang melakukannya — 43 pada indeks independen berbanding 13, input gambar, batas keluaran 128.000 token, dan harga yang benar-benar murah. Perbandingan itu hanya terlihat imbang di lembar harga. Perbandingan itu berhenti terlihat imbang begitu tugasnya adalah menjawab pertanyaan, bukan melanjutkan dokumen.

