Kartu judul hero untuk perbandingan 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni' dengan teks pengantar 'Berjarak delapan belas bulan - Maret 2025 hingga September 2026', subjudul 'Konteksnya tiga puluh kali lipat, media selama satu jam alih-alih hitungan detik - dan satu hal yang bisa dilakukan model lama tetapi tidak bisa dilakukan model baru', serta tiga chip statistik bertuliskan 'Konteks: 32K hingga 1M', 'Media per panggilan: detik hingga 1 jam', dan 'Output suara: hanya model 2025'.
Guides & Insights

Qwen3.8-Omni-Flash vs Qwen2.5-Omni: 18 Bulan Kemudian, Peningkatan Ini Kehilangan Suaranya

Penulis

Alistair Wren

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Inilah fakta yang membuat perbandingan ini lebih menarik daripada sekadar penyegaran antargenerasi. Model yang lebih lama bisa berbicara dan model yang lebih baru tidak bisa. Qwen2.5-Omni, yang dirilis pada Maret 2025, menerima masukan teks, gambar, audio, dan video lalu membalas dalam bentuk teks atau dalam ucapan alami secara streaming, dalam satu model end-to-end yang bisa Anda unduh. Qwen3.8-Omni-Flash, yang dirilis pada 18 September 2026, menerima empat modalitas yang sama dengan jendela konteks tiga puluh kali lebih besar, menyerap satu jam audio-video berkelanjutan sedangkan pendahulunya hanya menangani hitungan detik, dan mengembalikan teks saja. Delapan belas bulan kerja menghasilkan cakupan masukan yang jauh lebih luas namun mengorbankan saluran keluaran. Apakah itu kemajuan atau trade-off sepenuhnya bergantung pada untuk apa Anda menggunakan model lama tersebut — dan jawabannya terbagi jelas menjadi dua.

Angka-angka untuk Qwen2.5-Omni adalah milik vendor, dari materi rilis Maret 2025-nya, dan delapan belas bulan penerapan luas telah memvalidasinya sebagian. Angka-angka untuk Qwen3.8-Omni-Flash juga milik Alibaba, dari materi peluncuran yang diterbitkan beberapa jam sebelum ini ditulis, dan tidak ada satu pun di dalamnya yang telah direproduksi secara independen. Jika suatu klaim berasal dari kritikus alih-alih vendor, klaim itu diatribusikan sebagai demikian. Satu fakta struktural yang tidak perlu diverifikasi juga yang paling berdampak: Qwen2.5-Omni berbobot terbuka dan dapat diunduh, dan Qwen3.8-Omni-Flash tidak.

Apa itu Qwen2.5-Omni, dan mengapa itu penting

Ketika dirilis pada 26 Maret 2025, Qwen2.5-Omni adalah model omni-modal end-to-end pertama di keluarga ini — peluncurannya digambarkan sebagai jawaban atas masalah "kebun binatang spesialis", di mana transkripsi, visi, dan suara masing-masing memerlukan model terpisah dan lapisan perekat terpisah. Model 7B ini menangani keempat modalitas input serta output teks dan ucapan, mengklaim hasil tercanggih pada tolok ukur fusi OmniBench di depan Gemini-1.5-Pro, dan melaporkan skor kualitas pembangkitan ucapan 4,51 yang digambarkan Alibaba sebagai setara manusia. Varian 3B menyusul dengan arsitektur yang sama.

Rekayasa yang membuatnya berhasil layak disebutkan, karena model baru tidak menggunakannya. Thinker-Talkermembagi pekerjaan menjadi dua: transformer Thinker menggabungkan encoder audio dan gambar serta menghasilkan semantik dan teks, sementara Talker menstreaming token ucapan dari hidden state Thinker, sambil berbagi riwayat percakapan penuh. Time-aligned multimodal RoPE (TMRoPE) menyelipkan posisi video dan audio secara bergantian sehingga kedua aliran tetap sinkron. Streaming blok demi blok memungkinkan encoder melakukan persepsi sementara model bahasa menangani urutan panjang, yang membuat balasan lisan berlatensi rendah menjadi mungkin. Dua suara tetap disertakan, Chelsie dan Ethan.

Batasan-batasannya sama nyatanya. Konteksnya adalah 32.768 token. Memori adalah batas yang mengikat, jauh lebih daripada komputasi: tabel Alibaba sendiri menempatkan inferensi BF16 dengan FlashAttention-2 pada sekitar 31GB memori GPU untuk video 15 detik, 42GB untuk 30 detik, dan 60GB untuk satu menit penuh. Satu menit video, pada model 7B, pada salah satu GPU tunggal terbesar yang dapat Anda sewa. Angka itu adalah angka yang harus terus diperhatikan, karena itulah angka yang model 2026 dibangun untuk menghancurkan.

Apa itu Qwen3.8-Omni-Flash

Model baru ini bersifat omni-modal native, bukan rakitan — dibangun langsung di atas Qwen3.8-Flash lini arsitektur, bukan sebagai LLM teks dengan encoder persepsi yang ditempelkan, yang merupakan perbedaan struktural dan bukan sekadar label generasi. Model ini menerima teks, gambar, audio, dan video, termasuk audio stereo dan spasial empat kanal, serta mengembalikan teks dalam konteks satu juta token dengan input maksimum sekitar 991K, output maksimum 131K, dan anggaran penalaran 262K. Model ini menangani hingga satu jam audio-video berkelanjutan per panggilan. Pengenalan ucapan mencakup 74 bahasa, dengan generasi ucapan untuk 29 bahasa ditangani di perkakas pendukung, bukan oleh model. Model ini tersedia di platform Qianwen AI dan Alibaba Cloud Model Studio dengan id qwen3-8-omni-flash, dengan harga $0,15 per juta token input dan $0,47 per juta token output, dengan input yang di-cache seharga $0,016.

A two-column scoreboard, 'Qwen3.8-Omni-Flash vs Qwen2.5-Omni - the scoreboard'. Left column Qwen3.8-Omni-Flash: Released 18 Sep 2026, Context 1M tokens, Media per call 1 hour continuous A/V, Output text only, Weights API only, Hardware hosted endpoint. Right column Qwen2.5-Omni: Released 26 Mar 2025, Context 32,768 tokens, Media per call seconds and GPU-bound, Output text + streaming speech, Weights open and downloadable, Hardware roughly 60GB GPU for 60s of video. The footer reads 'Qwen2.5-Omni figures per Alibaba's March 2025 release materials; Qwen3.8-Omni-Flash figures vendor-reported and unreproduced.'

Delapan belas bulan, dimensi demi dimensi

• Konteks — Qwen2.5-Omni 32.768 token dibandingkan dengan Qwen3.8-Omni-Flash pada satu juta, peningkatan sekitar tiga puluh kali lipat.

• Durasi media — detik video, dibatasi oleh memori GPU, dibandingkan dengan satu jam audio-video berkelanjutan dalam satu panggilan terhosting.

• Output — teks plus ucapan alami secara streaming pada model lama; hanya teks pada model baru.

• Penyebaran — Qwen2.5-Omni berbobot terbuka di bawah Apache-2.0, dapat diunduh dari Hugging Face dan ModelScope; Qwen3.8-Omni-Flash hanya tersedia melalui API tanpa pengumuman rilis bobot.

• Perangkat keras — 7B parameter yang membutuhkan hingga ~60GB memori GPU untuk satu menit video, dibandingkan dengan endpoint yang dihosting yang sama sekali tidak Anda sediakan.

• Harga — model lama mengharuskan Anda memiliki GPU; model baru hanya $0,15 per juta token masukan, dan Alibaba mengklaim masukan audio per jam 98% lebih murah dibanding generasi Qwen3.5-Omni-Plus yang digantikannya.

• Generasi ucapan — dua suara tetap pada 2025, dibandingkan dengan 29 bahasa untuk generasi ucapan pada perkakas 2026, tidak ada satu pun yang dihasilkan oleh model itu sendiri.

Perdagangan yang tidak diiklankan siapa pun

Baca kedua lembar spesifikasi itu bersama-sama dan gambaran delapan belas bulan terakhir menjadi jelas. Alibaba menghabiskan selang waktu itu untuk memecahkan masalah asupan — seberapa banyak media yang dapat diserap model, seberapa murah, dan seberapa banyak pengambilan keputusan yang dapat dilakukannya sendiri. Qwen3.8-Omni-Flash adalah kemenangan pada sumbu itu. Mode Agentic Understanding, di mana model memilih apa yang akan disampel alih-alih memproses setiap frame, memangkas token per kueri dari 145.736 menjadi 79.117 sekaligus meningkatkan akurasi OmniVideoBench dari 63,4 menjadi 67,8, dan vendor melaporkan galat diarisasi pembicara pada AliMeeting menyusut dari 88,11 menjadi 3,35.

Yang tidak diprioritaskan oleh interval ini adalah keluaran. Trik penentu model 2025 — satu model yang mendengar Anda dan menjawab dengan suara, secara end-to-end, tanpa penyintesis suara terpisah — tidak memiliki penerus di sini. Jika Anda membangun agen suara, pipeline dubbing, atau alat aksesibilitas di atas Talker milik Qwen2.5-Omni, model 2026 bukanlah peningkatan untuknya; ini adalah komponen yang harus Anda pasangi tahap text-to-speech baru, menambahkan latensi dan vendor ke pipeline yang sebelumnya tidak memiliki keduanya. Materi peluncurannya jujur soal ini jika Anda membaca baris modalitasnya dengan saksama, tetapi itu bukan berita utamanya, dan siapa pun yang bermigrasi dengan asumsi bahwa "omni" berarti hal yang sama di kedua rilis akan menemukan perbedaannya di produksi.

A screenshot of the Qwen3.8-Omni-Flash launch post on qwen.ai (captured 18 September 2026, English UI), showing the 'Conducting Deep Research with Audio and Video' section with an embedded demo video, a MODEL WORKFLOW panel listing steps including Write report, Grab key frames, Dispatch Web research and Screenshot check, and a TIMELINE panel with chapter timestamps such as 0:00 Intro + a 5-minute composite and 10:02 Arrangement & Matching.

Mengapa model 2025 masih memiliki pekerjaan

Tiga alasan, dan tak satu pun soal nostalgia. Yang pertama adalah suaranya, seperti di atas. Yang kedua adalah bobot terbuka: konteks 32K dan jejak 7B akan berjalan di perangkat keras yang Anda kendalikan, secara offline, tanpa data keluar dari gedung dan tanpa meteran per token — satu-satunya pilihan jika audio Anda tunduk pada aturan residensi data atau anggaran latensi Anda melarang perjalanan bolak-balik. Yang ketiga adalah biaya pada volume yang sangat rendah. GPU yang sudah Anda miliki gratis di margin; model yang dihosting seharga $0,15 per juta token memang murah tetapi bukan nol, dan biaya tetap untuk menyiapkan kapasitas untuknya nyata bagi beban kerja yang hanya berjalan dua kali seminggu.

Argumen tandingannya adalah bahwa batasan model lama semakin terasa berat setiap tahun. Satu menit video, konteks 32K, dan tidak adanya pemanggilan alat atau output terstruktur di dunia yang menjadikan agen sebagai bentuk penerapan default merupakan cakupan yang sempit. Untuk pipeline yang harus menyerap rekaman rapat, Qwen3.8-Omni-Flash bukan sekadar lebih baik — ini adalah perbedaan antara mungkin dan tidak, karena model 2025 secara fisik tidak dapat menampung input tersebut.

Ada baiknya kita bersikap konkret tentang berapa banyak masa pakai yang tersisa pada bobot lama, karena "legacy" meremehkannya. Repositori Qwen2.5-Omni-7B mencatat 343.676 unduhan dalam sebulan terakhir saat kami memeriksanya pada 18 September 2026, dengan sekitar seratus Spaces komunitas dan puluhan fine-tune, adapter, dan kuantisasi yang dibangun di atasnya. Apa pun yang dilakukan model unggulan, banyak orang masih merilis dengan model 2025 — dan, yang patut dicatat, Hugging Face tidak mencantumkan penyedia inferensi yang menerapkannya, yang berarti hampir semua penggunaan itu di-hosting sendiri.

Model baru meningkatkan yang lama

Detail paling aneh dan paling meyakinkan dalam peluncuran ini terkubur di dekat bagian akhir materi. Dalam sebuah eksperimen yang digambarkan Alibaba sebagai model yang mengoptimalkan model, Qwen3.8-Omni-Flash secara otonom meningkatkan pengenalan suara dialek Sichuan pada Qwen2.5-Omni-3B — saudara kecil dari model yang secara nominal digantikannya — memangkas tingkat kesalahan karakter dari 25,79% menjadi 15,30% dalam dua belas jam dan membangun 3.413 sampel pelatihan dalam empat putaran.

Itu adalah argumen yang lebih baik untuk model yang lebih baru daripada benchmark apa pun dalam rilis tersebut, dan itu membingkai ulang hubungan antara keduanya. Model 2026 bukan hanya pengganti model 2025; model itu adalah alat yang membuat bobot 2025 menjadi lebih baik. Jika Anda menjalankan Qwen2.5-Omni di produksi untuk bahasa atau dialek yang ditanganinya dengan buruk, jalur praktisnya mungkin adalah mempertahankan penerapan dan menggunakan model baru untuk membangun data pelatihan, alih-alih memigrasikan beban kerja. Namun, perlu dicatat bahwa ini adalah demonstrasi yang dilaporkan vendor tanpa metodologi yang dipublikasikan, dan ini harus diperlakukan sebagai anekdot yang menggembirakan, bukan resep yang dapat direproduksi.

A screenshot of the Hugging Face model card for Qwen/Qwen2.5-Omni-7B (captured 18 September 2026), showing the Apache-2.0 licence tag, a 'Downloads last month' figure of 343,676, a Safetensors model size of 11B params, 100 Spaces using the model, 57 adapters, 67 finetunes and 24 quantisations, a note that the model is not deployed by any Inference Provider, and the model card text describing the Thinker-Talker architecture and TMRoPE position embedding.

Jika Anda bermigrasi

Keputusan ini jarang bergantung pada satu model. Tim yang meninggalkan model omni yang dihosting sendiri memilih di antara tiga bentuk: tetap menggunakan bobot terbuka dan terus melakukan provisi, beralih ke API vendor dan melepaskan kendali, atau memecah beban kerja sehingga hanya bagian yang memerlukan masukan sejuta token yang dikirim ke model terkelola. Opsi ketiga itu biasanya tepat dan juga yang dilewatkan orang, karena terdengar seperti lebih banyak pekerjaan daripada kenyataannya — fine-tune dialek yang Anda habiskan sebulan untuk mengerjakannya tidak harus dibuang hanya karena tahap peringkasan rapat berpindah.

Di mana routing membantu adalah pada titik sambungannya. OrcaRouter memberi Anda satu kunci untuk lebih dari 200 model dengan markup 0% atas harga daftar penyedia dan failover otomatis jika sebuah endpoint mengalami degradasi, yang berarti separuh bagian yang di-hosting dari pipeline yang dipisah tidak perlu memiliki kontraknya sendiri, kode kliennya sendiri, dan pemantauannya sendiri sebelum Anda tahu apakah beban kerja itu memang membenarkan semua itu. Untuk memperjelas apa yang tidak kami lakukan: tidak ada model omni yang ada dalam katalog kami — keduanya berjalan di platform Alibaba atau di perangkat keras Anda sendiri — jadi ini adalah keputusan routing yang Anda buat di sekitar model-model tersebut, bukan melalui kami.

Siapa yang harus pindah, dan siapa yang tidak

Beralih jika beban kerja Anda berupa audio atau video berdurasi panjang, jika konteks 32K adalah hal yang menghalangi terwujudnya sebuah pipeline, jika Anda membutuhkan perilaku agentik terhadap media, atau jika diarisasi pembicara dalam skala besar adalah masalah yang Anda hadapi. Tetap jika Anda memerlukan model untuk berbicara, jika audio Anda tidak dapat meninggalkan infrastruktur Anda, jika Anda bergantung pada bobot Qwen2.5-Omni spesifik yang sudah Anda tuning, atau jika volume panggilan Anda cukup rendah sehingga GPU yang Anda miliki mengalahkan penagihan berbasis meteran.

Ringkasan yang tidak nyaman adalah bahwa ini bukan sekadar penggantian, melainkan sebuah percabangan dalam lini produk. Alibaba telah menghabiskan delapan belas bulan untuk membangun model masukan terbaik yang bisa dibuatnya dan belum membangun penerus untuk separuh keluaran. Jika pekerjaan Anda berada di sisi masukan, peningkatan ini nyaris wajib. Jika berada di sisi keluaran, model 2025 masih menjadi yang terbaru yang melakukan apa yang Anda butuhkan — dan itu penting untuk diketahui sebelum Anda merencanakan migrasi yang diam-diam akan menghapus kemampuan yang Anda andalkan.