
Boreal vs Qwen3.8 Max: Baris yang Setiap Vendor Berharap Anda Lewati
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiBARUOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleBARUGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenBARUQwen: Qwen3.8 Max (0902)2026-09-0240Kecerdasan72Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0340Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2134Kecerdasan69Koding
Setiap peluncuran model menerbitkan kartu berisi angka-angka, dan setiap kartu punya satu baris yang sebaiknya tidak Anda perhatikan berlama-lama. Untuk Qwen3.8 Max, yang dirilis pada 3 Agustus 2026, baris-baris yang menyanjung mudah ditemukan: model ini menempati peringkat pertama di papan peringkat front-end CodeArena dengan 1.691 poin, mencapai Artificial Analysis Agentic Index 58 sehingga menyamai Claude Opus 5 pada high effort — pencapaian terdekat sebuah laboratorium Tiongkok ke puncak papan tersebut — dan meraih skor GDPval-AA 1.739 Elo, di depan GPT-5.6 Sol. Baris di bawahnya lebih sulit dibaca. Pada rangkaian pengujian evaluator yang sama, tingkat halusinasi terukur naik dari 23% pada generasi sebelumnya menjadi 40%, dan skor pengambilan konteks panjang model ini turun dua poin. Boreal, model video iklan milik Creatify, yang diluncurkan pada 15 September 2026 dengan tarif satu sen per detik, memiliki baris sejenis di kartunya sendiri — dan lebih spesifik, karena vendor itulah yang menerbitkannya.
Tidak ada baris yang mendiskualifikasi. Keduanya lebih informatif daripada skor utama, itulah sebabnya keduanya layak disandingkan daripada membandingkan banner.
Apa yang benar-benar paling dikuasai Qwen3.8 Max
Kemenangan-kemenangan itu nyata dan tidaklah kecil.
Qwen3.8 Max adalah model mixture-of-experts dengan 2,4 triliun parameter dengan sekitar 95 miliar parameter yang aktif per token, dan ini adalah Qwen kelas Max pertama yang menurut Alibaba akan dirilis sebagai open weights — diumumkan untuk minggu 10 Agustus 2026 tanpa lisensi atau tanggal pasti, sebuah detail yang patut dicatat karena pengumuman bukanlah perilisan. Model ini memiliki jendela konteks 1 juta token dengan batas keluaran 131.072 token, dan menerima teks, gambar, serta video sebagai input. Poin terakhir itu patut ditekankan dalam perbandingan khusus ini: dari empat model teks terdepan yang dibandingkan seri ini dengan Boreal, Qwen3.8 Max adalah satu dari hanya dua yang dapat diberi klip video yang sudah jadi dan ditanyai tentangnya.
Penetapan harganya agresif dengan cara yang membentuk ulang segmen tersebut. Pada $2,00 per juta token input dan $6,00 per juta token output, dengan pembacaan cache seharga $0,25, harganya lebih murah sekitar 20% daripada generasi sebelumnya sekaligus menggandakan panjang output maksimum. Di papan kami, itu tercatat pada $2,00 dan $6,00, konteks 1M token, p50 waktu ke token pertama 10,00 detik — batas maksimum yang dilaporkan instrumentasi kami, jadi bacalah sebagai "lambat" alih-alih presisi — dan 183,0 juta token lalu lintas selama tujuh hari terakhir.
Dan baris di bawahnya
Inilah bagian yang tidak masuk ke dalam judul utama postingan peluncuran.
Evaluasi independen Artificial Analysis mencatat dua regresi antara Qwen3.7-Max dan Qwen3.8 Max. Ukuran retrieval konteks panjangnya turun dua poin. Ukuran kemahatahuan-nya turun sepuluh, dan tingkat halusinasi yang diukur oleh evaluator naik dari 23% menjadi 40%. Pada saat yang sama, biaya per tugas model pada indeks kecerdasan naik dari $0,53 menjadi $1,14 — model ini membutuhkan sekitar 64 putaran per tugas, sedangkan pendahulunya hanya 14.
Bacalah semuanya secara bersama-sama, dan sebuah gambaran yang koheren akan muncul. Qwen3.8 Max adalah model yang menjadi lebih baik pada hal-hal yang dapat diukur oleh tolok ukur dengan satu jawaban benar — kode, penyelesaian tugas agentik, pemecahan masalah terstruktur — dan menjadi lebih buruk pada hal yang paling sulit dinilai: mengetahui kapan dirinya tidak tahu. Model yang lebih banyak berdeliberasi dan lebih banyak berhalusinasi tidak sedang bertentangan dengan dirinya sendiri. Jejak penalaran yang lebih panjang menciptakan lebih banyak peluang untuk berkomitmen pada jawaban salah yang penuh keyakinan, dan tolok ukur yang memberi imbalan atas penyelesaian tugas tidak menghukum hal itu sampai tugas tersebut memiliki invarian tersembunyi yang harus dilanggar.
Bagi pembeli, konsekuensi praktisnya sempit dan spesifik. Jika penggunaan Anda atas model itu adalah pembuatan kode atau alur kerja agentik di mana jawaban yang salah gagal secara mencolok — tes gagal, build rusak — regresinya sebagian besar tidak terlihat dan keuntungannya adalah seluruh ceritanya. Jika penggunaan Anda adalah pengambilan informasi, peringkasan, atau apa pun di mana jawaban salah yang lancar sampai ke manusia tanpa pemeriksaan, pergeseran 23-ke-40 adalah angka yang seharusnya menentukan evaluasi Anda, bukan posisi di CodeArena.
Baris terburuk Boreal sendiri, diterbitkan oleh vendor
Kontras yang membuat pasangan ini berguna adalah bahwa Creatify melakukan sesuatu yang tidak dilakukan sebagian besar vendor: ia menempatkan hasil terlemahnya di postingan yang sama dengan hasil terkuatnya.
Boreal diuji secara buta terhadap model dasarnya sendiri yang belum disentuh, dengan prompt, resolusi, jumlah frame, dan seed dijaga tetap, pada 40 kasus produksi. Creatify melaporkan preferensi 81% untuk Boreal — 25 berbanding 6 dengan 9 seri, uji tanda p<0,001 — lalu merinci rata-rata tersebut. Iklan produk: 83%. Adegan Kreator dan UGC: 85%. Klip bicara satu orang: 60%.
Angka terakhir itu adalah barisnya. Talking head termasuk format yang paling umum dalam periklanan respons langsung, dan inilah format ketika keunggulan model dibandingkan basisnya sendiri paling tipis — nyaris tidak lebih baik daripada lempar koin melawan model yang tidak akan dirilis siapa pun. Waktu render dikutip setara 1:1 dengan realtime pada kelas 720p, dan retensi detail halus meningkat 11,3% pada p=0,004, jadi gambaran agregatnya benar-benar positif. Rinciannya sekadar memberi tahu Anda separuh kategori mana yang menjadi sasaran penyetelan model ini, dan itu bukan separuh dengan orang yang berbicara ke kamera.
Perhatikan juga jenis bukti apa setiap baris ini. Regresi Qwen3.8 Max ditemukan oleh evaluator independen yang menjalankan harness miliknya sendiri. Baris lemah Boreal diungkapkan oleh vendor, dalam tes yang dirancang dan dijalankan oleh vendor. Yang kedua lebih dapat dipercaya sebagai pernyataan fakta dan kurang informatif sebagai perbandingan, karena tidak ada angka independen di mana pun dalam berkas Boreal.

Kontras spesifikasi
• Keluaran — Boreal: video hasil render, kelas 720p, teks-ke-video dan gambar-ke-video. Qwen3.8 Max: hanya teks, hingga 131.072 token.
• Input — Boreal: prompt teks atau gambar statis. Qwen3.8 Max: teks, gambar, dan video.
• Harga — Boreal: $0.01 per detik video jadi. Qwen3.8 Max: $2.00 per 1M input / $6.00 per 1M output, pembacaan cache sebesar $0.25.
• Konteks — Boreal: belum dipublikasikan. Qwen3.8 Max: 1 juta token masuk, 131K keluar.
• Latensi — Boreal: dikutip 1:1 dengan realtime. Qwen3.8 Max: p50 waktu ke token pertama 10,00 detik di board kami.
• Bobot — Boreal: proprieter, dimiliki dan dilayani oleh Creatify. Qwen3.8 Max: proprieter saat peluncuran; Alibaba telah mengumumkan rilis berbobot terbuka untuk Qwen kelas Max pertama, tanpa lisensi atau tanggal yang dikonfirmasi.
Bukti — Boreal: uji buta 40 kasus yang dijalankan vendor, tanpa evaluasi independen. Qwen3.8 Max: cakupan benchmark independen termasuk dua regresi terukur, di samping baris vendor sebesar 86,1 pada OSWorld-Verified dan 86,6 pada Terminal-Bench 2.1.
Apa nilai sebuah regresi bagi seseorang yang membeli
Regresi di papan peringkat biasanya dianggap hal sepele. Padahal, regresi justru lebih mendekati hal yang diterbitkan sebuah benchmark yang paling relevan untuk pengambilan keputusan, karena hanya baris itulah yang memberi tahu Anda apa yang dikorbankan vendor.
Langkah yang berguna bukanlah membaca kartu mana pun, melainkan menjalankan kedua model pada trafik Anda sendiri — dan hambatan praktisnya adalah bahwa ini biasanya berarti dua kontrak, dua SDK, dan dua hubungan penagihan, yang cukup merepotkan sehingga sebagian besar tim melewatkan uji tersebut dan justru membeli berdasarkan skor utamanya.
Gesekan itulah bagian yang dihilangkan oleh lapisan perutean. Qwen3.8 Max ada di katalog kami bersama generasi sebelumnya, jadi membandingkannya pada set evaluasi Anda sendiri hanyalah perubahan satu baris pada string model, bukan siklus pengadaan, dan kunci yang sama menjangkau sisa katalog ketika perbandingan menunjukkan Anda menginginkan model berbeda untuk tahap pipeline yang berbeda. Ini berada di tarif daftar penyedia dengan markup 0%, yang penting di sini karena alasan spesifik: Qwen3.8 Max hadir sekitar 20% lebih murah daripada generasi yang digantikannya, dan penetapan harga ulang vendor semacam itu adalah hal yang seharusnya langsung masuk ke tagihan Anda saat terjadi, bukan pada perpanjangan berikutnya.
Boreal tidak ada dalam katalog kami. OrcaRouter tidak menyediakan model pembuatan video, dan tidak ada apa pun di sini yang boleh ditafsirkan sebagai mengklaim sebaliknya. Yang kami sediakan adalah lapisan di atasnya — naskah, varian, pemeriksaan kepatuhan, analisis atas apa yang berkinerja — dan dua model dalam seri ini, termasuk Qwen3.8 Max, dapat diberi klip yang sudah jadi untuk ditinjau.

Cara membaca kartu mana pun
Qwen3.8 Max adalah pilihan pembelian yang lebih kuat jika pekerjaan Anda adalah kode, agen, atau penalaran terstruktur dengan harga yang lebih murah daripada pendahulunya sendiri, dan dua regresi independen adalah alasan untuk mengujinya pada lalu lintas pengambilan dan peringkasan Anda sebelum Anda mengarahkan produksi ke sana. Angka halusinasi 40% bukanlah alasan untuk menghindari model ini; itu adalah alasan untuk mengetahui beban kerja mana Anda yang dapat mentoleransinya.
Boreal adalah satu-satunya dari keduanya yang menghasilkan artefak yang secara nominal menjadi pokok perbandingan ini, dan ini adalah opsi kredibel termurah berdasarkan tarif yang dipublikasikan untuk video iklan format pendek. Batasannya spesifik pada format dan dinyatakan oleh vendornya sendiri: preferensi 60% pada klip bicara satu orang. Uji format itu sebelum iklan produk, karena di situlah ruang geraknya paling kecil.
Dua hal akan mengubah keadaan ini. Jika Alibaba merilis bobot terbuka yang diumumkannya untuk Qwen3.8 Max, harga dan daya tahan model tersebut sama-sama berubah, dan lisensi yang menyertainya saat dirilis akan lebih penting daripada tanggal perilisannya. Dan bagi Boreal, evaluasi independen pertama — dalam bentuk apa pun, oleh siapa pun — akan menggantikan uji vendor dengan 40 kasus yang saat ini memikul seluruh beban bukti untuk model yang dijual ke format di mana merek-merek luar biasa sensitif terhadap tampilan produk mereka.

Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
