
Qwen3.8-Flash-Next Telah Rilis: Alibaba Menghadirkan Arsitektur Qwen4 Sebelum Qwen4 Ada
- OrcaBARUOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 per 1 juta token · 84 tok/s
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 122 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 60 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 354 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
Qwen3.8-Flash-Next akhirnya memiliki angka yang tidak dihasilkan Alibaba — dan angka-angka itu tidak mengatakan apa yang dikatakan versi cerita yang paling lantang. Pada Artificial Analysis Intelligence Index, yang dinyatakan ulang ke v4.3 pada 7 September, pratinjau open-weight Alibaba mencetak 40 dan menempati peringkat kelima di antara 113 model dalam kelas perbandingannya. DeepSeek V4 Flash 0731 (Reasoning, Max Effort) — model yang terus dijadikan pembandingnya — mencetak 35 dan berada di peringkat kesembilan. Itu bukan paritas; itu keunggulan lima poin bagi model yang lebih kecil. Ini juga papan skor yang luas dan independen pertama yang menjangkau model yang satu-satunya angka yang dipublikasikan, sampai bulan ini, berasal dari vendornya sendiri. Modelnya sendiri bukan hal baru: bobotnya mulai tersedia di Hugging Face pada 24 Agustus dan rilis resmi ModelScope hadir pada 26 Agustus. Yang berubah bulan ini adalah pembaca kini dapat memeriksa klaim-klaim itu alih-alih menerimanya begitu saja.
Pemicu untuk meninjau ulang postingan ini datang dari @teortaxesTex di X, yang bertanya apakah pratinjau ini secara diam-diam kurang dihype: konon berada di tingkat Artificial Analysis yang sama dengan DeepSeek V4 Flash 0731, "hampir 4x lebih kecil," dengan "hampir 3x lebih sedikit parameter aktif." Dua dari tiga klaim tersebut tidak bertahan saat dihadapkan pada data yang dipublikasikan — dan koreksinya justru menguntungkan model tersebut, karena pada angka-angka yang penting, pratinjau ini lebih unggul daripada pembandingnya, bukan setara dengannya.
Mulai dari ukuran, di mana angkanya tidak ambigu. Qwen3.8-Flash-Next menyimpan sekitar 180B parameter — badan mixture-of-experts 125B, tabel embedding n-gram 51B terpisah, dan sekitar 4B lapisan prediksi multi-token — serta mengaktifkan 6B di antaranya per token. DeepSeek V4 Flash 0731 menyimpan 284B dan mengaktifkan 13B. Itulah angka pada kartu model Qwen dan dokumentasi DeepSeek, dan itulah angka yang dicantumkan Artificial Analysis di kedua halaman model. Rasio yang dihasilkan adalah 1.6x pada parameter tersimpan dan 2.2x pada parameter aktif. Itu adalah cerita efisiensi yang nyata, dan itulah alasan arsitektur ini penting — tetapi bukan 4x dan bukan 3x. Kami tidak dapat menemukan angka yang dipublikasikan di mana pun yang mendukung pengali yang lebih besar. Jika yang dimaksud adalah jejak memori yang disajikan, bukan jumlah parameter, angka itu juga tidak dipublikasikan.
Apa yang diumumkan?
Alibaba merilis arsitektur Qwen4 sebelum merilis model Qwen4. Qwen3.8-Flash-Next — model campuran pakar multimodal berbobot terbuka yang dibangun di atas arsitektur generasi berikutnya yang akan menjadi tulang punggung keluarga Qwen4 — hadir dalam dua tahap: repositori resmi Qwen/Qwen3.8-Flash-Next aktif di Hugging Face pada 24 Agustus, dua hari sebelum perilisan di ModelScope yang selama ini ditunjuk oleh penghitung waktu teaser. Perilisan resmi di ModelScope mendarat pada 26 Agustus pukul 23.00 UTC+08.00, dan harga varian Qwen3.8-Flash yang disajikan diumumkan pada waktu yang sama. Klaim utama pada kartu model tersebut, yang sejak itu terus beredar, adalah bahwa model yang mengaktifkan 6B parameter per token mengalahkan Claude Opus 4.6 Max pada 8 dari 9 tolok ukur yang sebanding dalam tabel milik Alibaba sendiri. Keluarga Qwen4 yang lengkap, begitu Alibaba terus mengatakan, akan datang belakangan.
Jika Anda belum mengikuti ritme Alibaba bulan ini, patokannya adalah Qwen3.8-Max — model unggulan 2,4 triliun parameter yang dirilis pada 3 Agustus dan dirilis sebagai open source dengan nama Qwen3.8-2.4T-A95B kurang dari dua minggu setelahnya. Bobot Qwen3.8-Flash-Next sudah tersedia kurang dari sebulan setelah itu. Lab yang sama yang merilis model berbobot terbuka 2,4 triliun parameter kini membagikan arsitektur untuk generasi setelahnya, bahkan sebelum model unggulan generasi itu diberi nama.

Bagian yang layak dibaca ulang adalah pembingkaian Alibaba sendiri. Model ini digambarkan dibangun di atas arsitektur generasi berikutnya "yang akan menggerakkan keluarga Qwen4 yang akan datang" — dan secara eksplisit bukan sebagai Qwen4 itu sendiri. Alasan yang dikemukakan Alibaba adalah bahwa perubahan arsitektur harus sudah berada di tangan komunitas sebelum keluarga itu hadir, sehingga runtime, kuantisasi, dan aplikasi siap ketika produk yang sebenarnya dirilis. Itu adalah posisi pemasaran, tetapi juga komitmen teknis: pratinjau dulu bagian yang sulit, bawa komunitas ikut serta.
Apa yang ditetapkan oleh kartu model, dan apa yang tidak:
Dikonfirmasi, sesuai kartu model resmi: Qwen3.8-Flash-Next adalah model open-weight, multimodal, dan mixture-of-experts pada arsitektur Qwen4 — kartu tersebut menyebutnya "pratinjau eksperimental dari arsitektur yang akan mendasari Qwen4."
• Dikonfirmasi, sesuai model card dan konfigurasi: dua perubahan arsitektur utama — Gated Delta Network (GDN) dan Qwen Sparse Attention (QSA) — di dalam hibrida 48 lapisan yang menjalankan 36 lapisan attention linear melawan 12 lapisan attention penuh.
• Dikonfirmasi dari repositori: 125B parameter total dengan 6B diaktifkan per token (512 expert, 10 dirutekan plus satu bersama) — Artificial Analysis mencantumkan 180B setelah tabel embedding n-gram 51B yang terpisah dan lapisan MTP dihitung — dengan konteks native 262.144 token yang dapat diperluas hingga 1.000.000 di bawah Qwen Community License 1.0.
• Tidak lagi belum terkonfirmasi: model tersebut kini telah dinilai secara independen, dua kali. Tabel Alibaba masih milik vendor itu sendiri dan masih belum direproduksi, tetapi bukan lagi satu-satunya bukti yang ada.
Skor independen pertama sudah keluar — dan hasilnya menyebut "unggul", bukan "setara"
Artificial Analysis merilis Intelligence Index v4.3 pada 7 September, dan penilaian ulang itulah alasan semua ini bisa dibandingkan sama sekali. Pembaruan v4.3 mengganti Terminal-Bench v2.1 dengan Terminal-Bench v4.0 yang jauh lebih sulit dan menukar τ³-Banking dengan AutomationBench-AA, tolok ukur alur kerja agentik yang dibangun bersama Zapier pada set pengujian private held-out berisi 657 tugas. Bobot private held-out naik menjadi 45%. Tujuan yang dinyatakan adalah untuk menghentikan model-model terdepan dari memanipulasi indeks, dan dampaknya terhadap skor besar: GPT-6 Astra dan Claude Fable 5.1, dua yang teratas, keduanya berada di angka 53 setelah sebelumnya mendapat skor di kisaran enam puluhan pada skala lama.
Itu penting ketika Anda membaca angka komunitas. Angka "56 versus 52" yang beredar untuk Qwen3.8-Flash-Next dan DeepSeek V4 Flash 0731 pada awal September dihitung berdasarkan indeks pra-v4.3; pada v4.3, pasangan tersebut berada di 40 dan 35. Mengutip salah satu set angka untuk dibandingkan dengan yang lain berarti membandingkan dua ujian yang berbeda.
Pada indeks saat ini, berikut adalah perbandingan sebenarnya antara kedua model dalam evaluasi milik Artificial Analysis sendiri:
• Indeks Kecerdasan — Qwen3.8-Flash-Next 40 (ke-5 dari 113 di kelasnya) vs DeepSeek V4 Flash 0731 (Penalaran, Upaya Maksimal) 35 (ke-9 dari 113).
• Pekerjaan pengetahuan agentik — AA-Briefcase 1587 vs 1259; GDPval-AA v2 1647 vs 1468; AutomationBench-AA 56% vs 54%.
• Terminal dan pengkodean — Terminal-Bench v4.0 25% vs 12%; SciCode 51% vs 50%.
• Penalaran umum dan ilmiah — Humanity's Last Exam 38% vs 39%; CritPt 11% vs 17%; GDP.pdf 16% vs 11%; AA-LCR v1.1 80% vs 80%.
• Pengingatan faktual versus konfabulasi — AA-Omniscience −10 vs −14, keunggulan empat poin untuk pratinjau Qwen.
• Harga — $0.15 per juta input / $0.47 per juta output vs $0.44 / $1.32; gabungan $0.0882 per juta token vs $0.2298. Biaya per tugas Intelligence Index: $0.37 vs $0.22.
• Kecepatan dan latensi — 53 token keluaran per detik vs 210; waktu ke token pertama 2,80 detik vs 0,98 detik; respons end-to-end 49,76 detik vs 12,88 detik; waktu per tugas 1.572,60 detik vs 221,65 detik.
• Penggunaan token — 108k token keluaran per tugas vs 62k, dengan 72k di antaranya adalah token penalaran vs 45k. Artificial Analysis menyebut pratinjau tersebut "sangat bertele-tele" dan "lebih lambat dari rata-rata."
• Konteks dan ukuran — 256k token vs 1.000k; total 180B / 6B aktif vs 284B / 13B.
Jika dibaca bersama-sama, itu jawaban yang lebih tajam daripada "tier yang sama." Qwen3.8-Flash-Next memenangkan argumen akurasi-dan-efisiensi di hampir setiap sumbu yang diukur Artificial Analysis — model ini berperingkat lebih tinggi, ukurannya lebih kecil, dan biayanya sekitar sepertiga per token. DeepSeek V4 Flash 0731 menang telak dalam argumen produksi: throughput empat kali lipat, latensi end-to-end seperempatnya, waktu aktual per tugas yang diselesaikan tujuh kali lebih sedikit, dan jendela konteks empat kali lebih besar. Dan dari segi biaya per tugas yang diselesaikan — angka yang tetap berlaku meski token berlimpah — DeepSeek adalah model yang lebih murah pada $0.22 versus $0.37, meskipun harga terteranya lebih tinggi. Jika "underhyped" berarti "lebih baik daripada reputasinya dalam hal kualitas per parameter," label itu pantas. Jika berarti "Anda seharusnya menjalankan ini sebagai gantinya," kolom kecepatan dan latensi berkata sebaliknya.

Ada bukti independen di luar Artificial Analysis juga. Sebuah harness pihak ketiga, smf-bench, menerbitkan hasil "Official A" pada 5 September: Qwen3.8-Flash-Next dalam kuantisasi NVFP4 NVIDIA pada satu DGX Spark, dengan mode berpikir nonaktif, mencetak skor 137 dari 157 (87,3%) dengan hasil sempurna 30 dari 30 pada bagian pengodeannya, dibandingkan 117 dari 157 untuk uji dua-Spark DeepSeek V4 Flash Vision-Exp pada harness 157 tes yang sama. Itu adalah satu harness pada satu kelas mesin, dan itu bukan pengganti evaluasi yang luas — tetapi itu adalah titik data kedua yang menunjuk ke arah yang sama, dan datang dari seseorang yang tidak memiliki kepentingan pada vendor mana pun.
Apa sebenarnya arsitektur Qwen4 itu.
Dua mekanisme membawa cerita ini. Yang pertama, GDN — Gated Delta Network — adalah lapisan linear-attention milik Alibaba. Jika transformer standar menyimpan cache key-value yang bertambah seiring panjang sekuens, lapisan GDN mempertahankan state rekuren berukuran tetap dan memperbaruinya dengan aturan gating yang dipelajari; garis keturunannya melewati DeltaNet dan Mamba-2. Manfaatnya adalah hal yang diam-diam menggerakkan lini Qwen sejak Qwen3-Next: konteks panjang tetap murah karena state tidak bertambah, sementara minoritas lapisan full-attention tetap berada dalam campuran untuk melakukan retrieval presisi yang tidak dikuasai linear attention. Pada generasi saat ini, campuran itu berada pada rasio kira-kira tiga lapisan GDN untuk setiap lapisan full-attention — analisis komunitas terhadap checkpoint Qwen3.8-2.4T-A95B menghitung 69 lapisan GDN berbanding 23 lapisan attention. Qwen3.8-Flash-Next menunjukkan pembagian tiga-berbanding-satu yang sama: 36 lapisan linear-attention berbanding 12 lapisan full-attention.
Yang kedua, QSA — Qwen Sparse Attention — adalah bagian yang benar-benar baru, dan deskripsi publiknya masih minim: kartu model menambahkan bahwa ia beroperasi pada tingkat blok mikro dengan anggaran 512-blok / 2048-token, tetapi belum ada uraian teknis lengkap. Kelangkaan detail itu sendiri adalah bagian dari polanya. Pratinjau Qwen3-Next pada akhir 2025 memperkenalkan Gated DeltaNet dengan dokumentasi yang sama minimnya, dan arsitektur itu baru ditentukan secara lengkap setelah seri Qwen3.5 mengadopsinya. Bagi pembaca, intisari praktisnya sama pada kedua kesempatan: canary arsitektur muncul lebih dulu, dokumentasi dan model produksi menyusul setelahnya.
Buku pedoman yang sudah pernah berhasil
Alibaba pernah menjalankan langkah persis ini sebelumnya, dan itu berhasil. Pada akhir 2025, Qwen3-Next mempratinjau Gated DeltaNet dan hibrida atensi linear dan penuh. Ketika seri Qwen3.5 dirilis, seri itu mengadopsi cetak biru tersebut dalam skala besar — dan hibrida itu telah diteruskan hingga generasi Qwen3.8 sejak saat itu, termasuk model unggulan 2.4T. Alasan preseden ini penting di sini adalah waktu yang disiratkannya. Keluarga Qwen4 lengkap semestinya diperkirakan muncul setelah pratinjau ini, bukan di dalamnya; jika jeda Qwen3-Next bisa menjadi petunjuk, jarak antara "inilah arsitekturnya" dan "inilah keluarganya" diukur dalam hitungan bulan. Tidak ada apa pun dalam kartu model yang mengonfirmasi hal itu — ini adalah inferensi dari pola yang kini telah dijalankan Alibaba dua kali.
Apa yang masih belum kita ketahui
Hal-hal yang tidak diketahui telah menyusut, tetapi belum hilang:
• Tabel benchmark vendor tetap milik vendor. Artificial Analysis kini telah menilai model itu secara independen, yang menutup celah terbesar dalam liputan peluncuran — tetapi klaim utama Alibaba sendiri, bahwa model tersebut mengalahkan Claude Opus 4.6 Max pada 8 dari 9 benchmark yang sebanding, bertumpu pada evaluasi internal Alibaba (CoWorkBench, JobBench, AndroidWorld) bersama evaluasi publik, dan tak satu pun dari itu yang telah direproduksi oleh pihak ketiga.
• Apakah pratinjau tersebut merupakan model yang sama dengan yang dilayani. Kartu tersebut memosisikan Qwen3.8-Flash-Next sebagai pratinjau eksperimental berbobot terbuka, sedangkan varian produksi yang dilayani — Qwen3.8-Flash dari Qwen Cloud — menambahkan konteks default 1.000.000 token dan alat bawaan. Apakah model yang dilayani itu merupakan arsitektur yang sama di bawah jendela konteks yang lebih besar masih belum dinyatakan, dan skor independen di atas adalah untuk pratinjau berbobot terbuka, bukan untuk model API yang dilayani.
• Lisensinya dikenal dan merupakan lisensi nyata: Qwen Community License 1.0 mengizinkan penggunaan komersial, termasuk menjual karya turunan, tetapi mewajibkan perjanjian komersial terpisah dengan Alibaba jika Anda menjalankan bisnis Model-as-a-Service atau asisten kerja AI yang melampaui ambang batas pendapatan dan pengguna aktif bulanan yang ditentukan. Lisensi ini tidak sama dengan lisensi Qwen3.8-Max yang dibatasi pendapatan, tetapi layak dibaca sebelum membangun di atas bobotnya.
• Satu laporan lapangan yang layak ditandai: tulisan 6 September tentang build NVFP4 komunitas mencatat kegagalan pemanggilan alat yang dibatasi tata bahasa saat thinking dan prediksi multi-token keduanya diaktifkan, yang dilacak ke jalur constrained-decoding xgrammar. Itu adalah bug runtime pada build komunitas terkuantisasi, bukan properti model — tetapi jika harness evaluasi Anda bergantung pada panggilan alat yang dibatasi tata bahasa, itu adalah hal pertama yang harus diuji.
Sebuah keluarga yang beriterasi dalam siklus dua mingguan.
Irama di sekitarnya adalah cerita tersendiri. Qwen3.8-Max, model unggulan berparameter 2,4 triliun, dirilis 3 Agustus; Qwen3.8-2.4T-A95B dengan bobot terbuka menyusul pada 12–13 Agustus; Qwen3.8-27B gratis berlisensi Apache-2.0 hadir beberapa hari kemudian; dan kini, sebelum bulan ini berakhir, arsitektur generasi berikutnya tengah dipratinjau — dan di-benchmark secara independen seminggu kemudian. Tidak ada laboratorium lain yang saat ini melakukan iterasi dengan tempo ini. Bagi pembaca yang memilih model, konsekuensi praktisnya adalah bahwa "Qwen terbaik" adalah target yang bergerak — dan delta antargenerasi datang lebih cepat daripada laju adaptasi ekosistem di sekitarnya pada umumnya. Membeli keputusan alih-alih model semakin menjadi langkah yang dapat dipertahankan.
Apa yang harus dilakukan seorang pengembang sekarang
Angka-angka efisiensi mengubah perhitungan untuk melayani secara lokal lebih daripada peluncuran itu sendiri. Model dengan 6B aktif yang mencetak skor 40 pada indeks saat ini dapat dikompresi: kuantisasi NVFP4 resmi NVIDIA adalah yang digunakan dalam uji smf-bench 5 September, dan build NVFP4 serta FP8 komunitas di luar itu sudah beredar, itulah yang membuat deployment kelas single-GPU dari model berpenyimpanan 180B menjadi masuk akal. Peringatannya tidak berubah — ini adalah pratinjau yang belum terbukti, tabel vendor tidak direproduksi, dan bentuk skor independennya (kuat pada pekerjaan pengetahuan dan tugas terminal, lebih lemah pada pembuatan repo jangka panjang dan tingkat kelulusan agen one-shot) berarti kelemahan model muncul tepat di tempat perubahan kode produksi berada. Jalankan salinan berisiko rendah dari beban kerja nyata padanya sebelum ia menyentuh apa pun yang penting, dan biarkan failover otomatis menyerap momen-momen ketika pratinjau berperilaku tidak semestinya.
Soal harga, gambaran yang tadinya kabur saat peluncuran kini sudah konkret. Artificial Analysis mencantumkan tarif penyajian pratinjau ini pada $0,15 per juta token masukan dan $0,47 per juta token keluaran, dibandingkan $0,44 dan $1,32 untuk DeepSeek V4 Flash 0731 — orde besaran yang sama dengan varian Qwen3.8-Flash yang disajikan, yang dicantumkan Qwen Cloud pada ¥1 dan ¥3 (sekitar $0,16 dan $0,47). Varian produksi adalah yang benar-benar bisa Anda panggil hari ini: ia dirutekan di sini sebagai qwen/qwen3.8-flash, dan OrcaRouter meneruskan harga daftar vendor tersebut dengan markup 0%, sehingga ketika Alibaba mengubah angka itu, endpoint-nya ikut berpindah pada hari yang sama. Hal yang sama berlaku untuk model pembanding dalam artikel ini — DeepSeek V4 Flash 0731 dirutekan sebagai deepseek/deepseek-v4-flash-0731 pada harga daftar penyedia, yang membuat separuh perbandingan biaya per token di atas dapat diuji terhadap trafik Anda sendiri, bukan terhadap jumlah token suatu tolok ukur. Yang tidak dirutekan di sini adalah pratinjau Flash-Next berbobot terbuka itu sendiri: untuk menggunakannya hari ini Anda harus menarik bobotnya dan menyajikannya sendiri, dan itulah justru alasan kisah kuantisasi di atas lebih penting daripada harga daftar. Batas atas yang harus dilewati generasi ini masih terlihat pada endpoint yang sama: Qwen3.8-Max (qwen/qwen3.8-max) berada pada $2,00 per juta token masukan dan $6,00 per juta token keluaran, yang juga diteruskan pada harga daftar vendor.

Urutan praktisnya tidak banyak berubah, tetapi keyakinan di baliknya sudah meningkat. Jika Anda menginginkan varian produksi yang dilayani tanpa menarik 100GB bobot, Qwen3.8-Flash sudah dapat dipanggil dengan harga daftar. Jika Anda menginginkan arsitekturnya — GDN, QSA, tabel n-gram, trik offload — bobotnya dapat diunduh dan runtime-nya sudah siap: vLLM menyajikannya sejak hari pertama dengan jalur offload yang menyimpan tabel embedding n-gram 51B parameter di memori host alih-alih VRAM permanen, SGLang dan TensorRT-LLM ada dalam daftar Day 0 NVIDIA, dan pustaka Ollama menyediakan build MLX yang dapat Anda tarik di Apple Silicon. Satu hal yang harus dihentikan adalah memperlakukan model ini sebagai sesuatu yang belum diketahui soal kualitas. Sekarang model ini sudah diukur, dan hasil pengukurannya baik.
Tontonan Berikutnya
• Apakah angka-angka independen tetap berlaku seiring indeks menjadi matang. Angka 40 dari Qwen3.8-Flash-Next hadir dengan tagihan token yang luar biasa tinggi — ia membakar 245M token pada proses indeks, dibandingkan median 140M — dan catatan Artificial Analysis sendiri menyebutnya "sangat verbose." Skor yang dihasilkan melalui penalaran lebih lama tetap merupakan skor, tetapi itu adalah jenis hal yang berubah ketika evaluasi berubah. Revisi indeks berikutnya adalah ujian sesungguhnya apakah 40 adalah sebuah level atau maksimum lokal.
• Apakah Qwen3.8-Flash yang dilayankan dinilai secara terpisah. Setiap angka independen dalam tulisan ini adalah untuk pratinjau berbobot terbuka. Varian produksi dengan konteks 1M dan alat bawaan tidak memiliki skor independennya sendiri, dan jika itu adalah arsitektur yang sama di bawah konteks yang lebih panjang, itu adalah evaluasi murah yang semestinya dipublikasikan oleh seseorang.
• Seberapa baik dukungan serving day-0 bertahan dalam praktik — angka throughput GB300 yang dinyatakan vendor masih sekadar klaim vendor, dan konfigurasi expert-parallel TP4 serta KV-offload masih cukup baru sehingga rentan.
• Berapa lama Alibaba menunggu sebelum seluruh keluarga Qwen4 menyusul pratinjau.
Bagian yang sudah kita ketahui sejauh ini dari kisah ini kini sebagian besar telah tertutup. Lembar spesifikasinya sudah publik, bobotnya dapat diunduh, arsitekturnya telah dikonfirmasi, varian Qwen3.8-Flash yang disajikan sudah live di API hosted dengan harga daftar, dan model ini telah dinilai secara independen oleh dua pihak terpisah — dengan model yang lebih kecil memenangkan argumen kualitas dan model yang lebih besar memenangkan argumen throughput. Yang masih terbuka adalah apakah pratinjau 6B-aktif dapat digeneralisasi melampaui tolok ukur yang menjadi dasar penyetelannya, dan berapa lama Alibaba menunggu sebelum keluarga Qwen4 lengkap menyusul. Pertanyaan terakhir itu masih menjadi pertanyaan yang tidak dijawab oleh rilis ini, dan itu masih menjadi pertanyaan yang akan paling penting.
Dibandingkan dalam artikel ini4
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
