
Qwen3.8-Omni-Flash Memasuki Hari Kelima: Satu Pintu, Tanpa Bobot, dan Skor Pertama yang Bukan dari Alibaba
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token
- deepseekBARUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0345Kecerdasan76Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Lima hari setelah vendor tersebut membuka Qwen3.8-Omni-Flash untuk pelanggan API, model itu masih memiliki tepat satu rumah. Model ini berjalan di platform Qianwen milik vendor sendiri dan di layanan cloud Bailian miliknya; listing pihak ketiga yang muncul sejak peluncuran hanyalah proksi di depan endpoint yang sama, bukan tempat kedua model itu berada. Tidak ada bobot yang dirilis. Angka-angka hari peluncuran — pemangkasan 98% pada biaya satu jam audio, peningkatan rata-rata 26% dibandingkan Qwen3.5-Omni-Plus, konteks satu juta token, keluaran teks saja — tetap milik vendor sendiri dan belum direproduksi. Yang sebenarnya berubah dalam lima hari bukanlah modelnya melainkan lanskap di sekitarnya: lapisan tipis skor pihak ketiga telah muncul, dukungan kerangka kerja tiba pada hari nol, dan perbandingan yang semua orang cari adalah dengan Gemini 3.8 Flash alih-alih Qwen3.8-Flash yang menjadi rekan pengembangan model ini. Masing-masing dari hal itu layak ditelaah lebih dekat daripada yang diberikan liputan peluncuran kepadanya.
Pintu itu adalah pintu yang bagus, dan itu satu-satunya.
Ketersediaan telah meluas tanpa menjadi jamak. Model ini menjawab permintaan berbentuk OpenAI tanpa perubahan, yang berarti kode klien yang ada sebagian besar tetap berfungsi; yang rusak adalah endpoint-nya, karena host internasional dan Tiongkok daratan merupakan layanan terpisah dengan penagihan terpisah. Kode yang diarahkan ke default akan gagal atau ditagih dalam mata uang yang salah, dan kisah harga per jam hanya berlaku di sisi internasional. Pustaka klien open-source merilis dukungan hari pertama untuk model ini, yang benar-benar berguna dan juga bukan penyedia kedua: pustaka yang berbicara dengan Bailian adalah pembungkus praktis di sekitar satu sumber pasokan yang sama.
Itu adalah risiko struktural yang layak disebutkan. Model sumber tunggal tidak memiliki jalur failover. Jika endpoint membatasi laju, menurun kinerjanya, atau suatu region mati, tidak ada tempat lain untuk beralih, dan seberapa pun dukungan pustaka klien tidak mengubah hal itu. Itulah juga sebabnya kami menyatakan posisi kami sendiri secara terang-terangan alih-alih menyiratkan sebaliknya: Qwen3.8-Omni-Flash tidak ada dalam katalog kami. Kami tidak menghostingnya, dan pembaca yang mendaftar dengan harapan dapat merutekannya akan disesatkan. Yang dapat dirutekan adalah anggota keluarga lainnya — Qwen3.8-Flash dan Qwen3.8-Max keduanya sudah aktif di API kami — dan OrcaRouter meneruskan harga daftar penyedia tanpa markup 0%, jadi ketika harga omni Alibaba berubah, atau pada hari model omni tersedia untuk dirutekan, perubahan itu sampai ke pelanggan pada hari yang sama alih-alih pada pembaruan kontrak berikutnya.

Skor pertama yang bukan milik Alibaba itu tipis, dan itu tidak menyanjung
Tidak ada apa pun di Artificial Analysis untuk model ini, dan ketiadaan itu adalah berita utama yang jujur setelah lima hari: papan peringkat yang semua orang kutip untuk model-model yang berdekatan belum memiliki baris untuk yang omni. Celah itu telah diisi oleh hal lain. Sebuah platform evaluasi pihak ketiga telah mulai menerbitkan hasil pengujian terhadap model tersebut, dan ringkasannya layak dibaca justru karena betapa banyak hal yang tidak dikatakannya. Platform itu melaporkan klasifikasi email dengan akurasi 99,0% (persentil ke-86), etika 95,0% (persentil ke-23), dan penalaran 56,0%, yang ditempatkannya pada persentil ke-28 dan disebut sebagai kelemahan yang mencolok; kecepatan berada pada persentil ke-21, biaya pada persentil ke-58, dengan tingkat keberhasilan 89% secara keseluruhan.
Tangani itu dengan sangat hati-hati, dan bukan hanya karena sampelnya kecil. Halaman yang sama mencantumkan tanggal rilis model sebagai 20 September, dua hari setelah Alibaba merilisnya, tidak memberikan tanggal eksekusi untuk hasil mana pun, dan menampilkan tabel benchmark kosong di bawah ringkasan yang menjelaskan angka-angka yang tidak ada dalam tabel tersebut. Itu adalah profil perangkat pengujian awal dengan pengawasan ringan, bukan evaluasi yang terukur, dan pembacaan yang jujur adalah bahwa ini adalah titik data non-vendor pertama, bukan titik data pertama yang dapat diandalkan. Semua itu menjadi alasan untuk menguji modelnya sendiri, bukan alasan untuk menyimpulkan apa pun. Namun, arahnya konsisten dengan apa yang tersirat dari materi vendor sendiri melalui apa yang tidak disebutkan: ini adalah model persepsi dan media panjang, dan papan penilaian yang berat penalaran bukanlah sasaran model ini.
Ada juga jebakan dalam hasil pencarian yang akan menangkap orang selama beberapa minggu ke depan. Qwen 3.8, model teks, membawa Artificial Analysis Intelligence Index di kisaran empat puluhan, dan angka itu telah dikutip dalam lebih dari satu ringkasan seolah-olah menggambarkan model omni. Tidak demikian. Itu adalah model yang berbeda dengan tugas yang berbeda, dan model omni belum memiliki indeks sama sekali.

Tabel benchmark itu masih satu vendor yang membandingkan dengan dirinya sendiri
Angka peluncuran — peningkatan rata-rata lebih dari 26% pada sekitar tiga puluh evaluasi — sepenuhnya diukur terhadap Qwen3.5-Omni-Plus. Itu memberi tahu Anda bahwa keluarga ini telah bergerak. Itu tidak memberi tahu Anda di mana model ini berada dibandingkan apa pun yang mungkin sudah Anda bayar, dan perbandingan selektif yang beredar bersamanya juga tidak menutup kesenjangan itu. Gambaran yang dilaporkan vendor terhadap Gemini 3.8 Flash adalah kemenangan nyata pada papan audio dan kekalahan pada papan yang mengukur pekerjaan video agentik: WildClawBench-MM 71.0 berbanding 58.9 dan SpotSoundBench 67.2 berbanding 39.7 di satu sisi, AgenticVBench 36.8 berbanding 45.0 dan OmniGAIA 74.0 berbanding 78.6 di sisi lain. Bahasa ringkasan Alibaba sendiri — performa audio-video "mendekati" Gemini, performa audio keseluruhan melampauinya — lebih berhati-hati daripada judul-judul berita yang dihasilkannya, dan versi yang berhati-hati itulah yang akurat.
• Konteks — 1 juta token, dengan input maksimum sekitar 991K (sekitar 983K dalam mode berpikir) dan output maksimum 131K.
• Modalitas — teks, gambar, audio, dan video masuk; keluaran hanya teks. Tidak ada pembuatan ucapan di model dasar.
• Durasi — hingga satu jam audio atau audio-video berkelanjutan per panggilan, itulah yang memungkinkan pekerjaan rapat dan media panjang tanpa pemotongan.
• Cakupan bahasa — pengenalan dalam 74 bahasa ditambah 39 dialek Tionghoa dalam materi peluncuran, dengan angka yang lebih luas (113 bahasa dan dialek) yang disebutkan di tempat lain untuk input audio.
• Detail masukan — audio spasial stereo dan empat kanal diterima, dengan varian Realtime digambarkan sebagai model omni-modal pertama yang mampu menemukan target berdasarkan suaranya.
• Harga — $0.15 per juta token input, $0.016 untuk yang di-cache, $0.47 output di sisi internasional, dan daftar harga Tiongkok daratan terpisah yang tidak dapat dibandingkan.
98% itu nyata, dan itu bukan tagihan Anda
Menurut metodologi Alibaba sendiri — sampel dua menit yang dikalikan tiga puluh, video disampel pada 720p dan satu bingkai per detik — satu jam input audio turun dari $0,28 menjadi di bawah $0,01, dan satu jam gabungan audio dan video dari $3,27 menjadi $0,20. Itu adalah pengurangan besar, spesifik, yang dilaporkan vendor, dan itu adalah pengurangan pada satu item baris. Aritmetika yang penting adalah berapa porsi beban kerja Anda yang merupakan item baris tersebut. Pipeline yang menghabiskan sebagian besar tokennya untuk output, untuk konteks yang di-cache, atau untuk bingkai video yang disampel lebih rapat daripada satu per detik akan melihat perubahan persentase yang jauh lebih kecil pada tagihan daripada yang dijanjikan judul, dan judul itu tentang input audio, bukan tentang total. Tambahkan output hanya teks dan kesenjangannya melebar lagi: apa pun yang harus berbicara balik memerlukan model kedua, dan model itu ditagih secara terpisah.
Inilah bagian dari gambaran besar di mana perutean membuktikan kegunaannya. Nilai dari router pass-through bukanlah diskon — melainkan bahwa daftar harga milik vendor sendirilah yang Anda bayar, dan bahwa beban kerja dapat disebar ke beberapa model sehingga model sumber tunggal menjadi komponen, bukan ketergantungan. Model omni yang merupakan satu-satunya yang dapat Anda panggil adalah titik kegagalan tunggal baik pada lapisan ketersediaan maupun lapisan penetapan harga.

Apa yang sebenarnya akan diberitahukan oleh lima hari produksi kepada Anda
Tiga hal akan menjawab pertanyaan-pertanyaan yang masih terbuka. Pengukuran independen atas hasil diarisasi AliMeeting — tingkat kesalahan yang turun dari 88,11 menjadi 3,35 dan cpWER dari 89,61 menjadi 17,18 — akan menunjukkan apakah itu berasal dari model atau dari rekayasa diarisasi dan front-end yang membungkusnya, yang menurut setidaknya satu analisis teknis Tiongkok menjadi sumber sebagian besar peningkatan tersebut. Uji replikasi atas pengurangan token mode agentic, dengan akurasi naik dari 63,4 menjadi 67,8 pada OmniVideoBench sementara token per kueri turun dari 145.736 menjadi 79.117, akan mengonfirmasi klaim paling berguna dalam rilis ini: bahwa model dapat menjadi lebih baik sekaligus lebih murah pada saat yang sama. Dan baris Artificial Analysis atau arena akan mengubah setiap angka vendor di atas menjadi sesuatu yang dapat dibandingkan, yang merupakan prasyarat agar model dipilih ketimbang sekadar dicoba.
Sampai saat itu, sikap yang masuk akal adalah sikap yang berlaku untuk model berusia lima hari apa pun dengan satu host dan tanpa evaluasi independen: layak diukur pada audio dan video Anda sendiri, tidak layak dijadikan satu-satunya jalur melalui pipeline Anda. Jika beban kerja Anda adalah analisis rapat atau media bentuk panjang dalam bahasa Mandarin atau Inggris dan biaya Anda didominasi oleh jam input, bukan token output, ekonomi di sini cukup kuat untuk membenarkan pengujian minggu ini. Jika beban kerja Anda memerlukan keluaran suara, atau memerlukan fallback saat penyedia menurun, model sebagaimana adanya saat ini tidak dapat menjadi jawaban lengkap — dan tidak ada banyaknya dukungan framework hari nol yang mengubah itu.
Dibandingkan dalam artikel ini2
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
