
Claude Sonnet 5.5 vs Tencent HY4 Preview: Kedua Lab Menjual Tagihan Token
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 931 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 192 tok/s
- OrcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1174 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 107 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- xAISpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Dua peluncuran, berjarak enam minggu, menjanjikan hal yang sama dengan kata-kata yang berbeda. Klaim vendor adalah bahwa Claude Sonnet 5.5, yang dirilis pada 28 September 2026, berbiaya "hingga 30% lebih murah per tugas" daripada Claude Sonnet 5 dengan tarif per token yang tidak berubah. Klaim kedua adalah bahwa optimalisasi 7 September pada build yang dihosting dari Tencent HY4 Preview, yang pertama kali dirilis dan dijadikan open source pada 28 Agustus 2026, memangkas putaran penalaran dan konsumsi token per tugas pada kualitas tugas yang sama. Tidak ada vendor yang menaikkan atau menurunkan harga untuk membuat klaim itu. Keduanya memberi tahu Anda bahwa token adalah produknya sekarang, dan bagian menarik dari adu ini adalah hanya satu dari dua klaim tersebut yang dapat diperiksa terhadap angka per tugas yang dipublikasikan — karena hanya satu dari dua model ini yang memiliki pengukuran independen untuk memeriksanya.
Asimetri itu bukanlah celaan terhadap Tencent. HY4 Preview tidak memiliki halaman model Artificial Analysis, tidak memiliki skor Intelligence Index independen, dan tidak memiliki angka biaya per tugas dari pihak ketiga mana pun. Yang dimilikinya adalah tabel benchmark vendor — Terminal-Bench 2.1 pada 85,4, DeepSWE 64,3, evaluasi buta internal di 203 tugas rekayasa dengan rata-rata 2,99 melawan GLM-5.3 pada 2,92 dan Kimi K3 pada 2,94 — dan debut publik yang dipilih melalui voting massa di papan peringkat WebDev Arena, tempat Tencent melaporkan model ini berada di sekitar peringkat kelima secara keseluruhan dan ketiga di antara model berbobot terbuka. Semua itu adalah sinyal nyata. Tidak satu pun dari itu merupakan biaya per tugas, yang berarti angka pasti yang menjadi ajang kompetisi kedua vendor tersebut, untuk HY4 Preview, tidak tersedia.
Apa yang sebenarnya dirilis oleh masing-masing pihak
Tencent HY4 Preview adalah campuran pakar dengan 770 miliar parameter, 49 miliar aktif per token, 78 lapisan, 256 pakar routed plus satu pakar bersama, lapisan MTP native untuk speculative decoding, dan jendela konteks yang melewati satu juta token. Secara desain, model ini hanya untuk teks — Tencent membangunnya untuk agen coding, penggunaan alat yang kompleks, dan pekerjaan produktivitas, bukan untuk gambar — dan secara default menggunakan penalaran berat, dengan tiga tingkat yang dapat dikonfigurasi (tinggi, rendah, tidak ada) serta pengaturan sampling yang direkomendasikan vendor, yaitu temperature 0.9 dan top_p 1.0. Bobotnya berlisensi Apache 2.0 dan dapat diunduh dari Hugging Face, GitHub, ModelScope, dan GitCode. Tencent awalnya menandai dua kekurangan dalam pratinjau ini, yaitu menghabiskan waktu lebih lama dari yang diperlukan untuk berpikir dan memverifikasi pekerjaannya sendiri secara berlebihan, dan pembaruan 7 September menyasar tepat hal-hal tersebut.
Claude Sonnet 5.5 adalah model generasi 5.5 kedua dari Anthropic dan model yang diposisikannya sebagai kombinasi terbaik antara kecepatan dan kecerdasan dalam jajaran produk. Satu juta token konteks, 128.000 token output secara sinkron dan 300.000 pada Message Batches API, input teks, gambar, dan file, pemikiran adaptif dengan upaya yang dapat dipilih, batas pengetahuan Juni 2026, retensi data nol tersedia sejak peluncuran, dan batas akhir masa pakai 28 September 2027. Kartu tarif tidak berubah dari Claude Sonnet 5: $2,00 per juta input, $10,00 per juta output, $0,20 untuk pembacaan cache dan $2,50 untuk penulisan cache. Bobot tertutup, Anthropic API plus Bedrock, Google Cloud, dan Microsoft Foundry.
Sejajarkan keduanya, dan posisinya hampir simetris:
• Harga — Claude Sonnet 5.5 $2,00 masuk / $10,00 keluar per juta vs Tencent HY4 Preview $0,83 masuk / $2,50 keluar di katalog kami, dari daftar vendor ¥6 / ¥18
• Pembacaan cache — Claude Sonnet 5.5 $0.20 per juta vs Tencent HY4 Preview $0.042 per juta pada katalog kami
• Bobot — Claude Sonnet 5.5 tertutup vs Tencent HY4 Preview Apache 2.0, dapat diunduh
• Konteks — Claude Sonnet 5.5 1.000.000 token vs Tencent HY4 Preview 1.048.576 token, praktis identik
• Output maksimum — Claude Sonnet 5.5 128.000 sinkron, 300.000 pada Batches vs Tencent HY4 Preview 64.000 pada katalog kami
• Modalitas masukan — Claude Sonnet 5.5 teks, gambar, dan file vs Tencent HY4 Preview hanya teks
• Skor independen — Claude Sonnet 5.5 Intelligence Index 56 dengan $7,60 per tugas, revisi v4.3.2 vs Tencent HY4 Preview tidak ada yang dipublikasikan
• Kecepatan output terukur — Claude Sonnet 5.5 138.7 token/detik vs Tencent HY4 Preview 22.3 token/detik pada traffic kami sendiri

Klaim yang dibuat kedua laboratorium, dan mengapa salah satunya dapat diperiksa
"30% lebih sedikit per tugas" milik Anthropic dan "lebih sedikit putaran penalaran, konsumsi token lebih rendah" milik Tencent adalah proyek rekayasa yang sama yang dijelaskan dari dua arah: buat model menghabiskan lebih sedikit token untuk mencapai jawaban yang sama. Anthropic secara eksplisit menyatakan bahwa tarifnya tidak berubah, yang berarti setiap penghematan per tugas harus berasal dari jumlah token — dan papan independen memungkinkan Anda melihat bentuk masalahnya, bukan besarnya perbaikan. Claude Sonnet 5.5 menghasilkan 410 juta token keluaran di seluruh evaluasi Intelligence Index, dibandingkan 117 juta untuk MiniMax M3 dan 77 juta untuk Grok 4.5. Ini adalah model yang bertele-tele, terukur, pada papan yang mempublikasikan angka tersebut. Apa pun arti peningkatan 30% dibanding Claude Sonnet 5, itu diterapkan pada basis yang sangat besar.
Untuk HY4 Preview, angka yang setara tidak tersedia untuk publik. Catatan optimasi Tencent sendiri adalah satu-satunya penjelasan tentangnya, dan catatan itu menyatakan hasilnya tanpa angka: lebih sedikit giliran, token masukan dan keluaran lebih sedikit, kualitas tetap sama, divalidasi oleh metrik benchmark dan evaluasi manusia dalam dua lintasan. Itu adalah klaim vendor dalam arti yang ketat — dinyatakan, masuk akal, belum direproduksi — dan di sini dilabeli seperti itu. Mengadopsi model pratinjau dengan bersandar pada klaim ekonomi token seorang vendor, ketika ekonomi token adalah hal yang tidak dapat Anda ukur dari luar, justru merupakan taruhan yang diminta oleh rilis pratinjau untuk Anda ambil.
Ada satu kerumitan tambahan yang perlu diketahui sebelum siapa pun merencanakan deployment self-hosted seputar optimasi itu. Perubahan Tencent pada 7 September berlaku untuk build yang Tencent sediakan di endpoint yang di-host sendiri. Snapshot open-weight tidak diperbarui — tanggal modifikasi terakhir repositori Hugging Face masih 28 Agustus — sehingga salinan bobot yang di-host sendiri menjalankan perilaku penalaran lebih panjang yang asli, yang ditandai oleh catatan pratinjau. Versi yang dioptimalkan dan versi yang dapat diunduh bukan artefak yang sama.
Di mana bobot terbuka benar-benar memberi manfaat adalah di tempat yang sama seperti biasanya: penerapan yang tidak dapat memanggil API. Model 770B parameter dengan 49B aktif adalah keputusan pusat data, bukan keputusan stasiun kerja, jadi ini bukan cerita kelas laptop yang disampaikan model 30B — tetapi bagi pembeli yang membutuhkan model di dalam perimeter mereka sendiri, Apache 2.0 pada skala itu adalah opsi yang tidak ditawarkan Claude Sonnet 5.5 dengan harga berapa pun.
Mencoba pratinjau tanpa mempertaruhkan jalur produksi padanya
Model pratinjau adalah kasus ketika perutean berhenti menjadi optimisasi biaya dan menjadi kontrol risiko. Alasan menempatkan build pratinjau di belakang router alih-alih memanggilnya secara langsung adalah bahwa pratinjau didefinisikan oleh kemungkinan berubah saat Anda sedang menggunakannya, dan dua hal yang Anda inginkan dari lapisan di depannya adalah pembagian persentase dan sesuatu untuk menangkap kegagalan.
Itulah bentuk yang disediakan OrcaRouter: satu endpoint yang kompatibel dengan OpenAI yang mencakup lebih dari 200 model, harga daftar penyedia diteruskan tanpa tambahan markup, failover otomatis antar penyedia hulu, dan DSL perutean untuk menyusun panggilan dari beberapa model. Tencent HY4 Preview sudah dapat dirutekan di sini hari ini sebagai tencent/hy4-preview dengan harga $0.83 untuk input dan $2.50 untuk output per juta token serta pembacaan cache $0.042 pada jendela 1,048,576 tokennya — build yang sama, dengan tarif penyedia, dapat diakses dari kunci yang sudah Anda gunakan untuk semua hal lain di katalog. Claude Sonnet 5 juga dapat dirutekan di sini, dengan tarif Anthropic sebesar $2.00 dan $10.00, dan sudah demikian sejak 30 Juni; model ini menjadi mitra failover yang jelas selagi model yang baru berusia sehari mengumpulkan bukti produksi.

Claude Sonnet 5.5 sendiri tidak ada di katalog kami. Layanan ini dirilis kemarin, rutenya adalah API milik Anthropic sendiri, dan halaman ini tidak akan menyarankan sebaliknya — inti dari saran perutean adalah bahwa cara aman untuk menjalankan tier yang benar-benar baru di produksi adalah memberinya sebagian trafik dengan sesuatu yang sudah terbukti di belakangnya, dan itu hanya berhasil bila kedua ujung pengaturan berada di tempat yang dapat Anda jangkau dari satu tempat. HY4 Preview membawa 372 ribu token trafik per minggu di sini, yang merupakan gambaran pratinjau berusia dua hari sebelum ada yang berkomitmen padanya; Claude Sonnet 5 telah membawa 7,9 juta per minggu sejak 30 Juni, dan itulah perbedaan antara kandidat dan dasar.

Ke mana uang itu sebenarnya pergi
Jika hanya melihat tarifnya, HY4 Preview empat kali lebih murah untuk output dibanding Claude Sonnet 5.5 dan hampir lima kali lebih murah untuk pembacaan cache, serta menyamai ukuran jendelanya. Pada sisi terukur, Claude Sonnet 5.5 menghasilkan output enam kali lebih cepat pada trafik kami sendiri — 138,7 token per detik dibanding 22,3 — celah semacam itu mengubah keunggulan tarif empat kali lipat menjadi keunggulan waktu aktual yang jauh lebih kecil, dan kadang-kadang menjadi kerugian, setelah antrean diperhitungkan.
Di antara kedua fakta itu, keputusan bergantung pada empat pertanyaan yang hanya dapat dijawab oleh pembaca. Apakah pekerjaan membutuhkan gambar atau file dalam prompt? HY4 Preview hanya teks dan itu mengakhiri diskusi. Apakah pekerjaan itu perlu menyelesaikan tugas perangkat lunak multi-langkah, yang skor Terminal-Bench 2.1 HY4 Preview sebesar 85.4 adalah angka Tencent sendiri dan belum direproduksi? Maka status pratinjau adalah risiko yang Anda terima, dan optimasi 7 September layak diuji ulang daripada dipercaya. Apakah beban kerja harus berjalan di dalam perimeter Anda sendiri? Maka bobot Apache 2.0 adalah fakta yang menentukan. Dan apakah tingkat kapabilitas gabungan lebih penting daripada tarifnya? Maka 56 yang diukur secara independen dari Claude Sonnet 5.5 adalah angka yang perlu dipertimbangkan, pada $7.60 per tugas Index, dengan catatan bahwa tidak ada angka yang setara di sisi Tencent untuk membandingkannya.
Yang sebenarnya ditunjukkan oleh kedua peluncuran itu adalah bahwa garis terdepan telah bergerak melampaui kartu tarif. Dua laboratorium, terpisah enam minggu, merilis model dan mengedepankan konsumsi token per tugas alih-alih harga per juta, dan konsekuensi praktisnya bagi pembeli adalah bahwa angka yang berguna tidak lagi ada di halaman harga kedua vendor itu. Angka itu adalah jumlah token yang dihasilkan oleh beban kerja Anda sendiri, yang diukur pada kedua model, dan itulah satu-satunya angka dalam artikel ini yang tidak dapat diberikan oleh vendor mana pun kepada Anda.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
