
Qwen3.8-Omni-Flash vs Qwen 3.8: Bill Spesialis vs Satu Flagship
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 984 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 196 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
Jika Anda ingin versi singkatnya: Qwen3.8-Omni-Flash kira-kira tiga belas kali lebih murah per token daripada Qwen 3.8 dan merupakan satu-satunya dari keduanya yang dibuat untuk menangani satu jam audio-video tanpa tersendat — sementara Qwen 3.8, inti terbuka dengan 2,4 triliun parameter di puncak lini Qwen3.8, adalah yang Anda gunakan ketika jawabannya harus benar daripada murah, dan satu-satunya dari keduanya yang bobotnya dapat Anda unduh. Keduanya berbagi panjang konteks, nama keluarga, dan jendela peluncuran Agustus-September. Keduanya bukan pengganti, dan seluruh nilai perbandingan ini terletak pada mengetahui pertanyaan apa yang sebenarnya Anda ajukan.
Agar tepat soal namanya, karena keluarganya memang padat. Qwen 3.8 di sini berarti inti terbuka mixture-of-experts 2.4T-A95B — model di balik endpoint Qwen3.8-Max, yang diperkenalkan Alibaba pada 3 Agustus 2026 dan bobotnya diterbitkan pada 12 Agustus, serta yang diindeks Artificial Analysis pada 40 di Intelligence Index-nya. Qwen3.8-Omni-Flash adalah model omni-modal native yang dimasukkan Alibaba ke layanan API pada 18 September 2026, dibangun di atas lini arsitektur Qwen3.8-Flash, menerima masukan teks, gambar, audio, dan video lalu mengembalikan teks. Segala hal tentang model unggulan itu dilaporkan vendor atau diindeks secara independen, sebagaimana dicatat; segala hal tentang model omni hanya dilaporkan vendor, karena usianya baru beberapa jam dan belum ada pihak di luar Alibaba yang mengukurnya.
Dua model, satu keluarga, arahan desain yang berlawanan
Godaan untuk membacanya sebagai model besar dan model kecil dari generasi yang sama, seperti Anda membaca Qwen3.8-Max versus Qwen3.8-Flash. Pembacaan itu salah dengan cara yang memakan biaya. Inti Qwen 3.8 adalah mesin penalaran yang kebetulan menerima gambar dan video; laju pemrosesannya diukur dalam token per detik pada soal-soal sulit, harganya ditetapkan untuk mencerminkan biaya komputasi forward pass dengan 95 miliar parameter aktif, dan lembar evaluasinya adalah daftar papan skor penalaran dan coding. Qwen3.8-Omni-Flash adalah mesin persepsi dan aksi yang kebetulan bernalar; harganya ditetapkan berdasarkan biaya mencerna berjam-jam media, dan lembar evaluasinya adalah daftar papan skor audio, video, dan tool-calling. Satu dioptimalkan untuk kedalaman per token. Yang lain dioptimalkan untuk token per jam konten.
Perbedaan itu paling mencolok di tempat yang tidak disebutkan oleh pemasaran. Kedua model menerima sekitar satu juta token dan keduanya menerima video. Tetapi Qwen3.8-Omni-Flash secara eksplisit dirancang untuk mengatasi masalah durasi — hingga satu jam audio-video berkelanjutan dalam satu panggilan, dengan mode Pemahaman Agentic di mana model memilih apa yang akan disampel alih-alih memproses setiap frame, memangkas token per kueri dari 145.736 menjadi 79.117 sekaligus meningkatkan akurasi pada OmniVideoBench dari 63,4 menjadi 67,8. Qwen 3.8 tidak memiliki mekanisme setara yang dipublikasikan. Memberinya dua jam video mungkin secara teori; melakukannya pada harga yang bisa diterima tim keuangan adalah pertanyaan yang berbeda, dan itulah pertanyaan yang dirancang untuk dijawab oleh model omni tersebut.
Dimensi-dimensi yang benar-benar menentukan hal itu
• Harga — Qwen3.8-Omni-Flash $0.15 per juta token input dan $0.47 per juta token output, dibandingkan Qwen 3.8 pada $2.00 dan $6.00. Pembacaan cache: $0.016 dibandingkan $0.25.
• Bobot terbuka — Qwen 3.8 menerbitkan bobot pada 12 Agustus 2026 di bawah lisensi khusus; Qwen3.8-Omni-Flash hanya tersedia melalui API dan Alibaba belum menyatakan akan merilisnya.
• Konteks — satu juta token di kedua sisi; input maksimum 991K pada model omni, dengan output maksimum 131K dan anggaran penalaran 262K.
• Durasi media — hingga satu jam audio-video berkelanjutan dalam satu panggilan omni; produk unggulan didokumentasikan untuk input video tanpa keterangan biaya per jam yang disertakan.
• Modalitas keluaran — teks di kedua sisi. Keduanya tidak menghasilkan ucapan, meskipun memiliki garis keturunan model omni.
• Skor independen — Qwen 3.8 berada di 40 pada Artificial Analysis Intelligence Index. Qwen3.8-Omni-Flash belum memiliki skor independen dalam bentuk apa pun.

Mengapa tabel benchmark tidak dapat menyelesaikan ini
Tidak ada papan head-to-head, dan tidak akan ada dalam waktu dekat. Materi peluncuran Alibaba untuk Qwen3.8-Omni-Flash membandingkannya secara eksklusif dengan Qwen3.5-Omni-Plus, pendahulu langsungnya, dan dengan Gemini 3.8 Flash; angka-angka produk unggulan itu berasal dari serangkaian evaluasi penalaran dan pengodean yang sama sekali berbeda. Kedua lembar tersebut tidak memiliki satu baris pun yang sama. Siapa pun yang menerbitkan tabel yang menempatkan keduanya berdampingan pada satu sumbu telah membangun sumbu itu sendiri.
Yang dapat dikatakan secara jujur bersifat indikatif. Berdasarkan angka vendor sendiri, model omni ini merupakan lompatan besar dibandingkan lini omni yang digantikannya — kenaikan rata-rata di atas 26% pada sekitar tiga puluh evaluasi, dengan WildClawBench-MM di 71,0, UniClawBench di 69,6, LongAudioSpan di 82,7 — dan peningkatan yang nyata tetapi parsial dibandingkan Gemini 3.8 Flash, di mana ia unggul pada papan peringkat berbasis audio seperti SpotSoundBench (67,2 versus 39,7) dan MMAU (81,8 versus 76,9) serta tertinggal pada AgenticVBench untuk penalaran video murni (36,8 versus 45,0). Di sisi flagship, skor Index Qwen 3.8 sebesar 40 adalah pengukuran independen dan lebih bernilai daripada semua yang disebutkan di atas. Itu adalah jenis-jenis bukti yang berbeda dan tidak boleh dirata-ratakan menjadi satu.

Perbandingan biaya yang telah dihitung, dengan asumsi yang dinyatakan.
Ambil pekerjaan analisis dokumen panjang dan video: 300.000 token masukan dan 20.000 token keluaran, gambaran yang masuk akal untuk rapat terekam selama sembilan puluh menit dengan slide. Pada Qwen3.8-Omni-Flash itu berarti 300.000 × $0,15 per juta = $0,045 untuk masukan dan 20.000 × $0,47 per juta = $0,0094 untuk keluaran, jadi sekitar 5,4 sen. Pada Qwen 3.8 panggilan yang sama adalah 300.000 × $2,00 per juta = $0,60 dan 20.000 × $6,00 per juta = $0,12, atau sekitar 72 sen. Sedikit lebih dari tiga belas kali biaya untuk jumlah token yang sama.
Angka yang mengubah keputusan bukanlah rasionya, melainkan volumenya. Pada seratus pekerjaan semacam itu per hari, itu kira-kira $5 per hari dibandingkan kira-kira $72 per hari — perbedaan antara fitur yang Anda rilis dan fitur yang Anda pangkas cakupannya. Tetapi jika tugasnya adalah satu ekstraksi sulit dari kontrak 300K token di mana jawaban yang salah memakan satu jam peninjauan manusia, premi 13x menjadi tidak relevan dan model penalaran yang lebih kuat menang pada kesalahan pertama yang tidak dilakukannya. Tetapkan asumsinya sebelum Anda melihat baris harga, bukan setelahnya.
Di mana masing-masing sebenarnya unggul
Qwen3.8-Omni-Flash unggul untuk apa pun yang diukur dalam jam. Transkripsi rapat dengan diarisasi dan ekstraksi tugas tindak lanjut, peringkasan video panjang, laporan riset audio-visual, pipeline pembuatan takarir, dan agen apa pun yang harus memutuskan sendiri menit mana dari suatu rekaman yang penting. Peningkatan diarisasi yang dilaporkan vendor — tingkat kesalahan pembicara AliMeeting turun dari 88.11 ke 3.35 — adalah jenis selisih yang mengubah pipeline yang ditinjau secara manual menjadi otomatis, meskipun analisis teknis berbahasa Mandarin tentang peluncuran tersebut berpendapat bahwa sebagian besar perolehan itu berasal dari rekayasa front-end dan diarisasi yang membungkus model, bukan dari model itu sendiri, jadi ujilah dengan tolok ukur pada audio Anda sendiri sebelum Anda menghentikan langkah peninjauan manusia. Model omni ini juga jelas unggul dalam hal harga untuk beban kerja teks bervolume tinggi apa pun yang kualitas teksnya memadai, yang diklaim Alibaba sebanding dengan model khusus teks berukuran sama — klaim yang belum direproduksi, dan layak diuji ketimbang diasumsikan.
Qwen 3.8 menang di mana pun output dinilai alih-alih dihitung: penalaran sulit, kerja agentic berjangka panjang, pekerjaan kode berskala besar, analisis dokumen sejuta token yang sintesisnya merupakan produk akhir. Ia juga menang pada dimensi yang sama sekali tidak berkaitan dengan benchmark — ia open-weight. Jika kendala Anda adalah residensi data, penerapan on-premise, fine-tuning, atau sekadar tidak ingin ada vendor di jalur inferensi, model omni sama sekali bukan kandidat, dan tidak ada keunggulan harga yang mampu menutup kesenjangan itu. Kendala tunggal itu menentukan lebih banyak penerapan nyata daripada semua angka di atas.
Menjalankannya tanpa dua kontrak
Gesekan praktis dalam perbandingan seperti ini jarang terletak pada pilihan model; yang terjadi adalah Anda akhirnya harus mengintegrasikan dua vendor, dua hubungan penagihan, dan dua set kode klien hanya untuk mengetahui mana yang sebenarnya Anda inginkan. Qwen3.8-Max — endpoint yang membawa inti terbuka berparameter 2,4 triliun — sudah aktif di OrcaRouter dengan id model qwen/qwen3.8-max, seharga $2,00 per juta token input dan $6,00 per juta token output, dengan konteks satu juta token serta input teks, gambar, dan video, bersama lebih dari 200 model lain dalam satu kunci pada harga daftar penyedia dengan markup 0% dan failover otomatis antarpenyedia jika sebuah endpoint menurun. Qwen3.8-Omni-Flash tidak ada dalam katalog itu — model tersebut berjalan di platform Alibaba sendiri — jadi konfigurasi yang jujur saat ini adalah model unggulan di rute kami dan model omni dipanggil secara langsung, dengan lapisan perutean memberi Anda tempat untuk menempatkan pihak yang kalah dalam pengujian tersebut setelah Anda menjalankannya.

Putusan
Pilih Qwen3.8-Omni-Flash saat input panjang, output pendek, dan volume membuat harga per unit menjadi kendala yang mengikat. Pilih Qwen 3.8 saat input padat, output adalah produknya, dan baik kebenaran maupun kendali penerapan tidak dapat ditawar. Zona tumpang tindih — pemahaman video — adalah satu-satunya tempat perbandingan langsung yang sesungguhnya ada, dan di zona itu model omni memegang argumen biaya dan durasi sementara model unggulan memegang argumen penalaran dan bobot terbuka. Jalankan keduanya pada data Anda sendiri sebelum berkomitmen; model omni belum memiliki evaluasi independen, dan keunggulan harga pada hari peluncuran justru merupakan hal yang layak dikonfirmasi terhadap tagihan, bukan terhadap pengumuman.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
