Kartu judul hero untuk Qwen3.8-Omni-Flash dengan eyebrow 'Alibaba - Qwen - 18 September 2026', subjudul 'Model omni-modal native Qwen — teks, gambar, audio, dan video sebagai masukan, konteks satu juta token, hingga satu jam audio-video berkelanjutan per panggilan', dan tiga chip statistik yang bertuliskan 'Harga per 1 juta token: $0.15 masuk / $0.47 keluar', 'Biaya audio vs generasi sebelumnya: 98% lebih rendah', dan 'Modalitas keluaran: hanya teks'.
Guides & Insights

Qwen3.8-Omni-Flash Telah Hadir: Konteks 1M Token, Audio 98% Lebih Murah, Hanya Output Teks

Penulis

Gideon Frost

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Peluncuran ini membuka Qwen3.8-Omni-Flash bagi pelanggan API hari ini, 18 September 2026, dan angka yang ditonjolkan adalah tagihan, bukan skor. Per jam input audio, Qwen mengatakan model baru ini berbiaya 98% lebih murah daripada pendahulunya Qwen3.5-Omni-Plus; per jam gabungan audio dan video, 93% lebih murah. Semua hal lain dalam pengumuman ini mengikuti kerangka tersebut. Qwen3.8-Omni-Flash adalah model omni-modal native — teks, gambar, audio, dan video sebagai input, konteks satu juta token, hingga satu jam penuh audio-video berkelanjutan dalam satu panggilan — dan Alibaba memasarkannya bukan sebagai pendeskripsi media yang lebih baik, melainkan sebagai model Qwen pertama yang dibangun untuk bertindak berdasarkan itu. Slogannya adalah "Omni Senses. Agentic Delivery." Kendalanya, yang dinyatakan secara gamblang dalam materi yang sama, adalah bahwa model ini hanya menjawab dalam bentuk teks: ia mendengar dan menonton, ia tidak berbicara.

Tidak ada apa pun di bawah ini yang telah direproduksi secara independen. Model ini baru berumur beberapa jam, belum ada evaluasi pihak ketiga terhadapnya, dan setiap tolok ukur dan angka harga dalam materi peluncuran adalah milik Alibaba sendiri. Jika suatu angka dilaporkan oleh vendor, tulisan ini menyatakannya demikian dalam kalimat yang memuatnya; jika suatu tafsiran berasal dari kritikus dan bukan dari vendor, sumbernya disebutkan. Satu-satunya hal yang memang dapat diperiksa secara independen hari ini — bahwa model ini aktif di platform Alibaba dan bukan di katalog pihak lain — adalah hal yang paling tidak ingin dibicarakan oleh peluncuran ini.

Apa yang sebenarnya dirilis

Lembar spesifikasi ini luar biasa bersih untuk peluncuran omni-modal, dan itu sendiri adalah intinya: generasi sebelumnya dari model omni dalam keluarga ini dirakit dari encoder persepsi terpisah yang dipasang ke LLM teks, sedangkan yang ini dibangun langsung di atas lini arsitektur Qwen3.8-Flash, dengan modalitas ditangani secara native alih-alih ditempelkan.

• Masukan — teks, gambar, audio, dan video, dengan audio spasial stereo dan empat kanal yang diterima; keluaran hanya berupa teks.

• Konteks — satu juta token, dengan input maksimum sekitar 991K (sekitar 983K dalam mode berpikir), output maksimum 131K, dan anggaran penalaran yang mencapai 262K.

• Durasi — hingga satu jam audio atau audio-video berkelanjutan per panggilan, yang merupakan angka yang memungkinkan kasus penggunaan rapat dan video panjang tanpa pemotongan.

• Cakupan ucapan — pengenalan dalam 74 bahasa dan pembuatan ucapan dalam 29 bahasa pada perkakas di sekitarnya; satu laporan berbahasa Mandarin tentang rilis tersebut menyatakan 113 bahasa dan dialek untuk masukan audio.

• Ketersediaan — platform Qianwen AI dan Alibaba Cloud Model Studio (Bailian), dengan id API qwen3-8-omni-flash. Bobotnya tidak dirilis. Varian Realtime digambarkan sebagai model omni-modal pertama dengan pelokalan sumber suara.

A single-model scoreboard for Qwen3.8-Omni-Flash with six rows: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Price $0.15 in / $0.47 out per M, Output text only, and Independent score none yet. A footer reads 'All figures vendor-reported from Alibaba's launch materials, 18 Sep 2026. No independent evaluation of this model exists at the time of writing.'

Angka 98% adalah klaim biaya, dan perhitungan di baliknya layak untuk dilihat.

Penurunan 98% dalam biaya satu jam audio adalah angka yang jauh lebih besar daripada penurunan 98% dalam harga satu token, dan celah antara kedua hal itulah tempat pengumuman ini menjalankan tugasnya. Angka per jam tersebut diperoleh dengan menghitung harga sampel dua menit lalu mengalikannya dengan tiga puluh, dengan video disampel pada 720p dan satu bingkai per detik. Itu cara yang sah untuk mengutip beban kerja produksi, dan sekaligus merupakan deskripsi tentang apa yang diminta untuk dilihat oleh model: satu bingkai per detik cukup untuk mengetahui apa yang dikatakan dan secara garis besar apa yang terjadi di layar, namun jauh dari cukup untuk memeriksa operasi tingkat bingkai, menilai kualitas penyuntingan, atau menangkap artefak satu bingkai. Dua perubahan dikalikan satu sama lain — pemangkasan harga satuan yang nyata, dan kebijakan penyampelan yang jauh lebih agresif — dan hanya yang pertama yang merupakan peningkatan model.

Harga satuannya sendiri sudah konkret. Harga internasional dikutip sebesar $0.15 per juta token masukan, $0.016 per juta token masukan yang di-cache, dan $0.47 per juta token keluaran. Harga Bailian domestik dikutip sebesar ¥0.8 per juta untuk masukan multimodal, turun dari sekitar ¥18. Perhatikan bahwa sistem penagihan internasional dan Tiongkok daratan terpisah dan angka-angkanya tidak dapat dipertukarkan; siapa pun yang membandingkannya secara langsung akan mendapatkan jawaban yang salah.

Ini adalah bagian dari rilis ini di mana perutean lebih penting daripada biasanya. OrcaRouter meneruskan harga daftar dari penyedia tanpa markup 0%, sehingga pemotongan harga vendor seperti ini sampai ke pelanggan kami pada hari yang sama saat diberlakukan, bukan pada perpanjangan kontrak berikutnya. Satu perbandingan yang benar-benar dapat diverifikasi sudah ada di katalog kami sendiri: Qwen3.8-Flash, model multimodal yang dibangun berdampingan dengan model ini, dapat dirutekan hari ini dengan harga $0,15 per juta token masukan dan $0,47 per juta token keluaran — harga daftar yang sama dengan yang dikutip Alibaba untuk model omni baru — dan model itu membawa 2,47 miliar token lalu lintas melalui API kami dalam tujuh hari sebelum ini ditulis, yang merupakan ukuran yang wajar untuk seberapa besar minat yang sudah dimiliki tier ini. Model omni itu sendiri belum ada di katalog kami, dan sampai itu terjadi, model tersebut hanya berjalan di platform milik Alibaba dan tidak di tempat lain. Kami tidak akan berpura-pura sebaliknya.

Setiap benchmark dalam peluncuran ini membandingkan satu hal

Sorotan utamanya adalah peningkatan rata-rata sebesar lebih dari 26% pada sekitar 30 evaluasi — dan setiap evaluasi tersebut dilakukan terhadap Qwen3.5-Omni-Plus. Itu adalah baseline yang tepat untuk sebuah peluncuran, sekaligus baseline yang sempit: ini memberi tahu Anda bahwa keluarga modelnya bergerak, bukan di mana posisinya relatif terhadap apa pun yang mungkin sudah Anda bayar.

Angka-angka individual, semuanya dilaporkan vendor: WildClawBench-MM 71,0, naik 36,5 poin dan merupakan lonjakan tunggal terbesar dalam kumpulan ini; UniClawBench 69,6; AgenticVBench naik 22,3 poin menjadi 36,8; LongAudioSpan 82,7, naik 8,3; OmniVideoBench 63,4, naik 9,6; OmniCap-IF 28,2. Pasangan yang paling mencolok adalah diarisasi pembicara pada AliMeeting, di mana tingkat kesalahan turun dari 88,11 menjadi 3,35 dan cpWER dari 89,61 menjadi 17,18 — lonjakan yang cukup besar sehingga pantas diteliti secara saksama alih-alih sekadar mendapat tepuk tangan. Sebuah analisis teknis berbahasa Mandarin tentang peluncuran ini berargumen persis seperti itu, dengan mengaitkan sebagian besar peningkatan tersebut pada rekayasa front-end dan diarisasi yang membungkus model, bukan pada penalaran model itu sendiri, serta memperingatkan bahwa sistem ini tampak terspesialisasi pada kemampuan mendengar dengan penalaran video mendalam yang relatif lebih lemah. Itu adalah tafsiran seorang kritikus, bukan replikasi terukur, tetapi besarnya selisih itulah alasan untuk terus mengingatnya.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Angka lain yang patut dipertahankan sama sekali bukan skor. Dalam apa yang disebut Alibaba sebagai mode Agentic Understanding, model memutuskan sendiri apa yang harus dilihat dan didengar alih-alih memproses setiap frame, mengumpulkan bukti dalam putaran dari kasar ke halus. Pada OmniVideoBench, mode itu menaikkan akurasi dari 63,4 menjadi 67,8 sambil memangkas token per kueri dari 145.736 menjadi 79.117 — pengurangan 45,7%. Akurasi naik dan biaya turun secara bersamaan adalah klaim terkuat dalam rilis ini, dan itulah yang paling langsung mendukung gagasan agentic.

Perbandingan Gemini lebih sempit daripada yang disiratkan cakupannya.

Posisi Alibaba adalah bahwa kemampuan audio-video "mendekati" Gemini 3.8 Flash sementara performa audio secara keseluruhan melampauinya. Tanpa pembingkaian, perbandingan yang dilaporkan vendor tampak seperti ini. WildClawBench-MM: 71.0 versus 58.9. SpotSoundBench: 67.2 versus 39.7. MMAU: 81.8 versus 76.9. DailyOmni: 85.1 versus 84.0. Itu adalah kesenjangan nyata pada audio dan penggunaan alat yang berpusat pada audio. Itu juga selektif. Pada AgenticVBench, papan penalaran video murni, urutannya terbalik — Gemini di 45.0 versus Qwen 36.8 — dan penjelasan Alibaba sendiri mengakui Gemini masih memimpin beberapa tes pemahaman video. Ringkasan yang wajar adalah bahwa Qwen telah menguasai separuh audio dari omni dan masih tertinggal di separuh video, yang merupakan klaim berbeda dari yang diusung oleh berita utama.

"Model omni-modal pertama Qwen" perlu kualifikasi

Anggapan bahwa Qwen3.8-Omni-Flash adalah model omni-modal pertama Qwen beredar luas hari ini dan layak untuk ditanggapi dengan presisi, karena keluarga ini memiliki entri yang lebih awal yang cukup berhak menyandang gelar tersebut. Qwen2.5-Omni, model open-weight 7B yang dirilis pada Maret 2025 dengan arsitektur Thinker-Talker, juga menerima teks, gambar, audio, dan video sebagai input — dan model itu menghasilkan ucapan sekaligus teks. Yang benar-benar pertama di sini adalah native omni-modalitas: satu model yang dibangun di atas fondasi Qwen3.8-Flash alih-alih LLM teks dengan encoder persepsi yang ditempelkan, plus rancangan desain yang mengutamakan agen. Kedua pernyataan itu benar; hanya satu di antaranya yang menjadi versi yang terus diulang. Jika Anda mengevaluasi model ini dengan asumsi bahwa tidak ada model omni Qwen sebelum minggu ini, Anda akan salah menilai jalur peningkatan dari Qwen2.5-Omni, yang merupakan perbandingan yang telah kami tulis secara terpisah.

Perkakasnya adalah tempat klaim agentik itu sebenarnya berada.

Dua hal dirilis bersamaan dengan model ini, dan keduanya lebih penting daripada yang tersirat dalam kartu model, karena keduanya-lah yang mengubah persepsi menjadi hasil. Qwen-MM-Plugins adalah rangkaian plugin multimodal untuk harness agen yang memberikan kemampuan pemahaman gambar, audio, video, dan dokumen kepada agen eksternal, plus memori video panjang dan penyuntingan video; plugin ini mengklaim mendukung Codex, Claude Code, Qwen Code, Gemini CLI, dan beberapa lainnya, serta menyertakan alat-alat bernama termasuk Video2Note, yang mengubah video berjam-jam menjadi catatan PDF berilustrasi. Qwen-Live Harness adalah runtime sumber terbuka untuk interaksi omni-modal real-time yang berkelanjutan, berperan sebagai lapisan penjadwalan tempat pengguna berbicara secara langsung dan mendelegasikan pekerjaan yang lebih berat kepada agen latar belakang. Satu catatan dari liputan hari peluncuran: halaman GitHub Qwen-Live Harness mengembalikan 404 saat Gigazine memeriksanya, jadi anggap perangkat ini masih sebatas diumumkan, bukan terverifikasi, sampai repositorinya dapat diakses.

Kalimat yang dikubur oleh peluncuran: ia tidak berbicara

Bagi model yang pendahulunya menghasilkan ucapan, fakta bahwa Qwen3.8-Omni-Flash bersifat multimodal-in dan text-out adalah baris paling berkonsekuensi dalam spesifikasi, dan dalam materi-materi hal itu muncul sebagian besar hanya sebagai catatan kaki. Ini berarti model tersebut tidak dapat begitu saja dimasukkan ke dalam produk speech-to-speech dengan sendirinya. Dubbing, agen suara, atau percakapan real-time apa pun yang dibangun di atasnya memerlukan tahap text-to-speech eksternal dan, untuk video, renderer eksternal — yang justru menjadi alasan keberadaan rangkaian plugin dan harness live tersebut. Konsekuensi praktisnya adalah pipeline dengan lebih banyak bagian yang bergerak daripada "satu model omni", dan latensi yang harus dianggarkan di semua bagian tersebut.

Ada demonstrasi yang apik tentang kesenjangan tersebut, dan tentang untuk apa model itu berguna, yang tersembunyi di dalam rilis ini. Dalam eksperimen "model yang mengoptimalkan model", Qwen3.8-Omni-Flash secara otonom meningkatkan pengenalan dialek Sichuan dari Qwen2.5-Omni-3B, memangkas tingkat kesalahan karakter dari 25,79% menjadi 15,30% dalam dua belas jam dan membangun 3.413 sampel pelatihan dalam empat putaran. Model yang dapat mendiagnosis dan memperbaiki penanganan dialek model saudara yang lebih kecil sedang melakukan sesuatu yang tidak dapat dilakukan API transkripsi. Itu, bukan tabel benchmark, adalah argumen paling jelas tentang apa yang seharusnya dimaksud dengan "agentic" di sini.

A screenshot of the OrcaRouter model catalogue at www.orcarouter.ai/models (captured 18 September 2026), headed '199 models - 15 providers - one API key, one bill', with modality tabs reading Text 164, Image 10, Embeddings 5, Video 10 and TTS 10, a 'How to call any model' panel showing the OpenAI-compatible endpoint, and model cards including Qwen3.8 Max (0902) and DeepSeek V4.1 Flash.

Apa yang akan mengubah penilaian kita

Kenyataan yang jujur soal posisi saat ini adalah bahwa ini adalah peluncuran dengan spesifikasi yang jelas, dengan narasi harga yang menarik, tanpa evaluasi independen, dan setidaknya satu keterbatasan struktural yang cenderung diremehkan oleh pengumumannya. Tiga hal akan menyelesaikannya. Entri di Artificial Analysis atau LMArena akan mengubah angka vendor menjadi angka yang dapat dibandingkan, dan belum ada satu pun yang demikian. Pengujian pihak ketiga atas pengurangan token sebesar 45,7% — klaim bahwa akurasi naik sementara biaya turun — akan mengonfirmasi hasil paling berguna dan paling tidak glamor dalam rilis ini. Dan pengukuran independen atas diarisasi AliMeeting akan menunjukkan apakah penurunan 88 poin itu berasal dari model atau dari pipeline di sekitarnya.

Sampai saat itu, sikap yang masuk akal adalah sikap yang berlaku untuk model apa pun pada hari pertamanya: layak diuji, tidak layak untuk dipertaruhkan sebagai jalur produksi. Jika Anda sudah merutekan melalui OrcaRouter, langkah praktisnya adalah mempertahankan beban kerja pada model yang sudah Anda ukur, dan memperlakukan Qwen3.8-Omni-Flash sebagai kandidat untuk diuji tanding terhadap model-model tersebut pada audio dan video Anda sendiri, bukan pada tabel tolok ukur masing-masing vendor. Jika kasus penggunaan Anda adalah analisis rapat atau media berdurasi panjang dalam bahasa Mandarin dan Inggris, ekonomi token di sini cukup kuat untuk membenarkan pengujian sekarang.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari