Qwen 3.7 Flash: Model Visi Super Murah dari Alibaba untuk Agen yang Benar-benar Melihat Layar
Guides & Insights

Qwen 3.7 Flash: Model Visi Super Murah dari Alibaba untuk Agen yang Benar-benar Melihat Layar

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tim Qwen Alibaba telah menghabiskan dua tahun terakhir untuk meluncurkan jajaran model yang padat di hampir setiap tingkat harga dan kemampuan yang dapat dibayangkan, dan pada 27 Juli 2026, satu model lain mendarat dengan tenang sebagai daftar API komersial: qwen/qwen3.7-flash. Model ini tidak hadir dengan kemeriahan peluncuran flagship, dan Alibaba belum menerbitkan laporan teknis, rangkaian benchmark, atau diagram arsitektur untuknya. Yang hadir bersamanya adalah deskripsi yang jauh lebih berarti bagi para pengembang daripada skor papan peringkat lainnya: model penalaran visi-bahasa, jendela konteks 1 juta token, dan harga yang sangat rendah sehingga hampir tidak tercatat sebagai item baris.

Kombinasi itu — murah, konteks besar, dan "melihat" gambar secara native — menempatkan Qwen 3.7 Flash tepat dalam kategori yang telah menjadi salah satu yang paling kompetitif dan paling berguna di seluruh pasar model: kuda kerja multimodal berbiaya rendah. Ini bukan model yang memenangkan bagan tolok ukur. Mereka adalah model yang dipanggil sepuluh juta kali sehari di dalam loop agen, pipeline otomatisasi browser, dan alat dukungan, karena dengan $0,03 masukan dan $0,13 keluaran per juta token, biaya pada dasarnya berhenti menjadi kendala desain.

Tulisan ini adalah ulasan awal: apa sebenarnya Qwen 3.7 Flash itu, apa yang telah diungkapkan Alibaba (dan yang penting, apa yang belum), bagaimana aspek ekonominya berjalan dengan perhitungan token yang nyata, serta di mana posisinya di samping keluarga Qwen lainnya — termasuk Qwen 3.8 dan Qwen 3.7 Max yang jauh lebih besar — dan melawan rival multimodal murah seperti Gemini 3.5 Flash-Lite. Kami juga akan membahas bagaimana lapisan routing seperti OrcaRouter memperlakukan model seperti ini: bukan sebagai model pahlawan, melainkan sebagai tingkatan default yang secara diam-diam menyerap sebagian besar lalu lintas multimodal.

Intinya

Qwen 3.7 Flash adalah model visi-bahasa dari tim Qwen Alibaba, terdaftar dengan ID model qwen/qwen3.7-flash sejak 27 Juli 2026. Model ini dibangun untuk agen multimodal, pengkodean visual, pencarian, dan interaksi komputer/UI, dengan klaim keunggulan dalam pengenalan objek dan pemahaman spasial. Model ini mendukung jendela konteks 1.000.000 token dan dihargai sebesar $0,03 per 1M token masukan dan $0,13 per 1M token keluaran — di antara model berkemampuan visi termurah yang tersedia di mana pun. Panjang output maksimum, jumlah parameter yang tepat, dan arsitektur tidak diungkapkan secara resmi; spekulasi komunitas mengarah pada desain mixture-of-experts kecil dan kemungkinan pendahulu dari rilis Qwen 3.7 open-weight, tetapi hal itu belum dikonfirmasi. Model ini merupakan model yang berbeda, lebih kecil, dan lebih murah dibandingkan Qwen 3.8 (flagship open-weight 2,4T parameter yang diumumkan terpisah oleh Alibaba) dan Qwen 3.7 Max (flagship yang lebih besar di generasi yang sama). Belum ada rangkaian benchmark independen — termasuk Artificial Analysis — yang memberikannya skor, jadi anggap klaim kualitas sebagai hal yang masih awal dan belum terbukti sampai ada angka dari pihak ketiga.

Poin-poin penting

• Qwen 3.7 Flash adalah vision-language, bukan hanya teks — diposisikan untuk agen multimodal, coding visual, pencarian, dan tugas penggunaan komputer, bukan obrolan umum.

• Harga adalah $0.03/1M token input dan $0.13/1M token output, kira-kira sejalan dengan tingkatan termurah dari model multimodal yang mendekati frontier di pasar saat ini.

• Jendela konteks adalah 1M token, yang lebih penting untuk sesi agen yang banyak gambar dan multi-putaran daripada kedengarannya, karena gambar dan tangkapan layar menghabiskan token dengan cepat.

• Catatan harga pada listing tersebut menyebutkan bahwa dengan prompt caching pada konteks yang berulang, biaya efektif dapat berjalan 60-80% lebih rendah dari harga daftar — sebuah pengungkit yang berarti untuk loop agen yang memutar ulang system prompt atau riwayat tangkapan layar yang sama.

• Alibaba tidak mempublikasikan jumlah token output maksimum, jumlah parameter, atau detail arsitektur; informasi yang lebih spesifik yang Anda baca di tempat lain adalah kesimpulan dari komunitas, bukan pengungkapan dari vendor.

Ini bukan Qwen 3.8 (flagship bobot terbuka 2.4T) dan bukan Qwen 3.7 Max (flagship tertutup yang lebih besar dalam gelombang rilis yang sama) — terlepas dari kemiripan nama, ini adalah tiga model berbeda dengan tiga tugas berbeda.

• Tidak ada organisasi benchmark independen, termasuk Artificial Analysis, yang telah menerbitkan skor untuk Qwen 3.7 Flash pada saat tulisan ini dibuat — kualitas benar-benar tidak terbukti di luar deskripsi vendor.

Apa Sebenarnya Qwen 3.7 Flash Itu

Singkirkan konvensi penamaan dan Qwen 3.7 Flash adalah jawaban Alibaba terhadap pertanyaan yang kini telah ditanyakan oleh setiap laboratorium besar: seperti apa bentuk model ketika keseluruhan desainnya adalah "menangani lalu lintas visual, agen, dan volume tinggi semurah mungkin tanpa menjadi tidak berguna"? Google menjawabnya dengan tingkatan Gemini Flash dan Flash-Lite. OpenAI menjawabnya dengan lini mini dan nano. Jawaban Alibaba, dalam generasi ini, adalah Qwen 3.7 Flash.

Deskripsi resmi berfokus pada empat kasus penggunaan: agen multimodal, pengkodean visual, pencarian, dan interaksi komputer atau antarmuka pengguna. Itu adalah daftar yang sangat disengaja. Bukan "hebat dalam menulis kreatif" atau "penalaran kuat pada soal olimpiade matematika" — ini adalah daftar pekerjaan di mana model perlu melihat tangkapan layar, halaman web, bagian antarmuka pengguna, atau perbedaan kode yang dirender secara visual, lalu bertindak berdasarkan itu. Alibaba juga menyebut pengenalan objek dan pemahaman spasial sebagai kekuatan tertentu, yang sejalan dengan kerangka penggunaan komputer dan interaksi antarmuka pengguna: agen yang akan mengklik tombol, membaca tata letak, atau menavigasi layar perlu mengetahui di mana letak benda, bukan hanya apa yang tertulis.

Perlu dijelaskan secara eksplisit apa yang dimaksud dengan "penalaran" dalam konteks ini. Qwen 3.7 Flash digambarkan sebagai model penalaran visi-bahasa, artinya model ini diharapkan mampu mengerjakan tugas visual multi-langkah, bukan sekadar memberi keterangan pada gambar atau menjawab pertanyaan sederhana. Itulah perbedaan antara "jelaskan tangkapan layar ini" dan "ini tangkapan layar formulir dengan tiga kesalahan validasi — cari tahu apa yang salah dan beri tahu saya kolom mana yang harus diperbaiki terlebih dahulu."

Spesifikasi dan Fokus Multimodal-Agentik

Inilah daftar lengkap dari apa yang benar-benar dikonfirmasi, versus apa yang tidak.

Terkonfirmasi:Pembuatnya adalah tim Qwen milik Alibaba. Model ini terdaftar dengan ID model qwen/qwen3.7-flash, aktif sejak 27 Juli 2026. Ia menerima masukan multimodal (visual dan bahasa). Jendela konteksnya adalah 1,000,000 token. Harganya adalah $0.03 per 1M token masukan dan $0.13 per 1M token keluaran. Catatan harga pada daftar model itu sendiri menunjukkan bahwa prompt caching pada konteks berulang dapat menurunkan biaya efektif hingga 60-80% dibandingkan harga daftar untuk beban kerja yang menggunakan kembali instruksi sistem atau gambar referensi yang sama antar panggilan — detail yang sangat penting bagi loop agen yang mengirim ulang riwayat tangkapan layar atau skema alat yang sama di setiap giliran.

Tidak diungkapkan: Batas maksimum token keluaran. Jumlah parameter pasti. Arsitektur (padat vs. campuran ahli). Komposisi data pelatihan. Skor tolok ukur pihak pertama mana pun.

Spekulasi komunitas (sebutkan demikian, karena itu hanya spekulasi):Dengan nama "Flash", harga yang agresif, dan pola yang telah diikuti Alibaba pada generasi Qwen sebelumnya, beberapa pengamat menduga bahwa Qwen 3.7 Flash menggunakan arsitektur small mixture-of-experts yang dioptimalkan untuk biaya komputasi per token yang rendah, dan bahwa ini mungkin merupakan langkah pratinjau atau distilasi menjelang rilis open-weight Qwen 3.7 pada akhirnya, mirip dengan bagaimana varian "flash" atau "turbo" Qwen sebelumnya kadang mendahului rilis terbuka yang lebih luas. Tidak ada satupun dari ini yang dikonfirmasi oleh Alibaba. Anggap saja sebagai tebakan yang beralasan, bukan fakta, sampai laporan teknis resmi atau model card mengatakan sebaliknya.

Tidak adanya angka output maksimum yang dipublikasikan perlu diperhatikan bagi siapa pun yang membangun dengan model ini: jika kasus penggunaan Anda menghasilkan output terstruktur yang panjang (payload JSON besar, pembuatan kode multi-file, transkrip panjang), uji batas output aktual secara empiris sebelum menggunakannya di produksi, karena Anda tidak dapat memeriksa dokumentasi untuk angka yang tidak ada.

Contoh Perhitungan Harga: Biaya Sebenarnya

Angka sekecil ini mudah diabaikan, jadi mari kita hitung dengan benar.

Pada $0.03 per 1M token input dan $0.13 per 1M token output, satu panggilan dengan 2,000 token input (tangkapan layar berukuran cukup besar ditambah instruksi singkat) dan 300 token output (jawaban terstruktur) biayanya: 2,000/1,000,000 × $0.03 = $0.00006 untuk input, ditambah 300/1,000,000 × $0.13 = $0.000039 untuk output. Total: kira-kira $0.0001 per panggilan — seperseratus sen.

Skalakan itu ke volume. Jalankan 1 juta panggilan tersebut — beban harian yang masuk akal untuk produk agentik berukuran menengah yang melakukan analisis tangkapan layar atau pemeriksaan status UI — dan Anda akan mendapatkan: 1,000,000 × 2,000 = 2 miliar token input × $0.03/1M = $60, ditambah 1,000,000 × 300 = 300 juta token output × $0.13/1M = $39. Total: sekitar $99 untuk satu juta panggilan agen vision. Bahkan sebelum menambahkan prompt caching (yang menurut catatan listing tersebut dapat mengurangi ini sebesar 60-80% untuk beban kerja dengan konteks berulang), itu adalah angka yang dapat disetujui sebagian besar tim tanpa rapat anggaran.

Sekarang bandingkan skenario yang lebih berat: agen penggunaan komputer yang menyimpan konteks 50.000 token secara berjalan (tangkapan layar, riwayat tindakan, hasil alat) dan menghasilkan 500 token tindakan per langkah, dijalankan 100.000 kali sehari. Biaya input: 100.000 × 50.000 = 5 miliar token × $0.03/1M = $150/hari. Biaya output: 100.000 × 500 = 50 juta token × $0.13/1M = $6.50/hari. Itu kira-kira $156/hari, atau sekitar $4.700/bulan, untuk beban kerja agen dengan konteks panjang yang cukup agresif — dan itu sebelum diskon penyimpanan sementara (caching) pada bagian yang berulang dari konteks 50K tersebut, yang dalam loop penggunaan komputer (prompt sistem yang sama, definisi alat yang sama, status layar yang tumpang tindih) adalah jenis beban kerja yang tepat yang dirancang untuk caching prompt.

Panduan Skenario Dunia Nyata

Tugas Visi Volume Tinggi

Bayangkan sebuah pipeline katalog produk yang perlu mengklasifikasikan, memberi tag, dan mengekstrak atribut dari beberapa ratus ribu gambar produk setiap hari — ini persis jenis beban kerja di mana biaya per token berlipat ganda cukup cepat untuk menghancurkan anggaran pada model visi kelas menengah tetapi tetap nyaman terjangkau dengan harga Qwen 3.7 Flash. Pengenalan objek dan pemahaman spasial, dua kemampuan yang secara eksplisit disebutkan oleh Alibaba, secara langsung dipetakan ke "apa yang ada di gambar ini, di mana letaknya, dan dalam kondisi apa gambarnya."

Pengodean Visual

"Visual coding" sebagai kasus penggunaan yang dinamai menunjukkan alur kerja seperti: berikan model tangkapan layar dari UI yang dirender beserta kode komponen yang mendasarinya, dan mintalah untuk menemukan ketidakcocokan, atau ambil ekspor Figma dan dapatkan implementasi awal. Ini adalah kategori tugas yang secara khusus menghukum model kode berbasis teks saja — Anda dapat menggambarkan bug tata letak dengan kata-kata, tetapi model yang benar-benar dapat melihat padding yang rusak atau tombol yang tidak sejajar akan mendiagnosisnya lebih cepat dan lebih andal.

Agentik / Penggunaan Komputer

Ini adalah kasus penggunaan utama. Agen pengguna komputer harus melihat layar, memahami apa yang bisa diklik, memutuskan tindakan, dan mengulanginya — sering kali puluhan langkah per tugas. Ekonomi di sini sangat keras bagi model mahal: tugas otomatisasi browser atau desktop sebanyak 30 langkah, setiap langkah membawa tangkapan layar baru, dapat menghabiskan ratusan ribu token sebelum tugas selesai. Dengan harga model terdepan, itu berarti uang sungguhan per tugas; dengan harga Qwen 3.7 Flash, menjalankan ribuan sesi seperti itu per hari masih dalam jangkauan anggaran tim kecil.

Pencarian visual — mencocokkan gambar dengan korpus, memverifikasi bahwa hasil yang diambil benar-benar cocok dengan foto referensi, atau mendasarkan kueri pencarian pada tangkapan layar dari apa yang dilihat pengguna — mendapat manfaat dari kombinasi yang sama antara konteks besar (untuk menampung banyak gambar kandidat atau set dokumen hasil pencarian yang panjang) dan biaya per panggilan yang rendah (karena loop pencarian dan verifikasi sering kali berarti banyak panggilan model per kueri pengguna, bukan satu).

Cara Mengakses dan Menggunakan Qwen 3.7 Flash

Qwen 3.7 Flash dipanggil dengan pengidentifikasi model qwen/qwen3.7-flash, dan ia dapat bekerja dengan perkakas apa pun yang kompatibel dengan OpenAI — artinya integrasi gaya chat-completions atau responses yang sudah ada dapat mengarahkannya hanya dengan mengubah nama model tanpa menulis ulang kode klien. Di sinilah lapisan perutean seperti OrcaRouter menjadi praktis, bukan sekadar teoretis: alih-alih menanamkan satu model secara tetap ke setiap layanan, endpoint terpadu yang kompatibel dengan OpenAI memungkinkan Anda menetapkan model multimodal yang murah dan mumpuni sebagai tingkat default untuk lalu lintas visi dan agen, serta menyisihkan model penalaran yang lebih mahal untuk sebagian permintaan yang benar-benar membutuhkannya. Untuk model yang seluruh proposisi nilainya adalah "sangat murah, cukup mumpuni, belum teruji di garis depan," perutean berjenjang semacam itu — murah secara default, tingkatkan saat diperlukan — bisa dibilang cara yang tepat untuk menyebarkannya di produksi, alih-alih mempertaruhkan seluruh pipeline pada satu model yang belum terverifikasi.

Pemformatan permintaan multimodal standar berlaku: input gambar bersama teks dalam pesan yang sama, jendela konteks besar untuk sesi multi-gambar atau multi-giliran, dan penagihan per-token yang tampil dengan rapi di dasbor penggunaan. Uji batas panjang output praktis untuk beban kerja Anda sebelum mengandalkannya, karena maksimumnya tidak dipublikasikan.

Keterbatasan yang Jujur dan Apa yang Belum Terkonfirmasi

Untuk bersikap terus terang mengenai apa yang benar-benar tidak diketahui di sini: belum ada data tolok ukur independen tentang Qwen 3.7 Flash dari Artificial Analysis atau evaluator sebanding lainnya saat tulisan ini dibuat. Segala hal tentang kualitasnya—seberapa baik kinerjanya dalam penalaran visual, seberapa andal untuk tugas multi-langkah agen, seberapa tahan terhadap gangguan dalam skenario konteks panjang—saat ini hanya didukung oleh bahasa pemosisian Alibaba sendiri, bukan oleh pihak ketiga yang menjalankannya melalui rangkaian uji standar. Deskripsi vendor dan verifikasi independen adalah dua hal yang berbeda, dan pembaca harus mempertimbangkan kemampuan model ini sesuai dengan itu hingga verifikasi tersebut tersedia.

Di luar tolok ukur (benchmark), Alibaba belum mengungkapkan arsitektur, jumlah parameter, atau panjang keluaran maksimum. Teori "MoE kecil, kemungkinan pendahulu Qwen 3.7 dengan bobot terbuka" yang beredar di komunitas adalah tebakan yang masuk akal berdasarkan pola penamaan dan harga, tetapi itu hanyalah spekulasi, bukan sesuatu yang telah dikonfirmasi Alibaba. Jika transparansi model (arsitektur yang dipublikasikan, bobot terbuka, laporan teknis) merupakan persyaratan untuk kasus penggunaan Anda, Qwen 3.7 Flash saat ini belum memenuhi standar tersebut — model ini tertutup, hanya berbasis API, dengan dokumentasi publik yang minimal selain daftar API-nya.

Bagaimana Perbandingannya: Qwen 3.8, Qwen 3.7 Max, dan Cheap Rivals

Penamaan di sini sering membingungkan orang, jadi ada baiknya untuk tepat. Qwen 3.8 adalah flagship open-weight Alibaba yang diumumkan secara terpisah, dikabarkan dibangun di sekitar desain 2,4 triliun parameter — model yang pada dasarnya berbeda dengan tujuan yang berbeda: model besar, terbuka, tujuan umum yang dimaksudkan untuk bersaing di garis depan, bukan tingkat utilitas multimodal yang murah. Qwen 3.7 Max adalah flagship tertutup yang lebih besar dan mungkin lebih mampu dalam gelombang rilis '3.7' yang sama — model yang akan Anda gunakan saat tugas membutuhkan kualitas maksimal tanpa mempedulikan biaya. Qwen 3.7 Flash, subjek dari tulisan ini, adalah titik ketiga dan termurah dalam konstelasi tersebut: lebih kecil, lebih cepat, jauh lebih murah, dan secara khusus ditujukan untuk beban kerja multimodal-agentik, bukan keunggulan tujuan umum. Jangan berasumsi bahwa kemampuan atau perilaku berlaku di antara ketiganya hanya karena dua di antaranya berbagi nomor versi — mereka adalah model yang berbeda dengan tugas yang berbeda.

Melawan persaingan dari luar, perbandingan terdekat adalah Google's Gemini 3.5 Flash-Lite, yang menempati ceruk serupa: tingkatan murah, multimodal, throughput tinggi yang dimaksudkan untuk jenis beban kerja volume yang dijelaskan di atas. Kedua model bersaing terutama pada sumbu yang sama — harga per token, panjang konteks, dan penanganan multimodal — daripada pada tolok ukur penalaran mentah, karena keduanya tidak diposisikan sebagai model penalaran frontier. Tanpa data tolok ukur independen untuk Qwen 3.7 Flash, klaim kualitas head-to-head terhadap Gemini 3.5 Flash-Lite bukanlah sesuatu yang dapat dibuat secara bertanggung jawab oleh tulisan ini; yang dapat dikatakan adalah bahwa harga Qwen 3.7 Flash kompetitif dengan atau di bawah tingkatan tersebut, dan jendela konteks 1M-nya murah hati untuk model dalam kisaran biaya ini, yang merupakan jenis kesenjangan yang membuat tingkatan multimodal murah layak diuji secara empiris terhadap beban kerja Anda sendiri daripada memilih hanya berdasarkan harga.

FAQ

Apa itu Qwen 3.7 Flash?

Ini adalah model penalaran visi-bahasa dari tim Qwen milik Alibaba, yang dibangun untuk agen multimodal, pengkodean visual, pencarian, dan interaksi komputer/antarmuka pengguna, terdaftar di bawah ID model qwen/qwen3.7-flash sejak 27 Juli 2026.

Berapa harga Qwen 3.7 Flash?

$0,03 per 1 juta token input dan $0,13 per 1 juta token output — termasuk model berkapabilitas visi termurah yang tersedia saat ini, dengan keterangan yang menyebutkan kemungkinan diskon tambahan 60-80% melalui prompt caching pada konteks berulang.

Apa itu jendela konteks?

1.000.000 token.

Apakah Qwen 3.7 Flash sama dengan Qwen 3.8?

Tidak. Qwen 3.8 adalah model flagship berbobot terbuka (open-weight) dengan 2,4 triliun parameter yang diumumkan secara terpisah oleh Alibaba. Qwen 3.7 Flash adalah model multimodal tertutup yang jauh lebih kecil, lebih murah, dengan tujuan yang berbeda. Keduanya tidak boleh disamakan meskipun sama-sama berasal dari lini Qwen milik Alibaba.

Apakah Qwen 3.7 Flash sama dengan Qwen 3.7 Max?

Tidak. Qwen 3.7 Max adalah model andalan yang lebih besar dalam gelombang rilis "3.7" yang sama. Qwen 3.7 Flash adalah model yang lebih kecil, lebih cepat, dan jauh lebih murah, yang ditujukan untuk tugas multimodal dan agen dengan volume tinggi, bukan untuk keluaran dengan kualitas maksimal.

Apakah Qwen 3.7 Flash mendukung gambar?

Ya, ini adalah model visi-bahasa — ia menerima masukan multimodal (gambar dan teks) dan secara khusus diposisikan di sekitar tugas visual seperti pengenalan objek, pemahaman spasial, pengkodean visual, dan interaksi komputer/UI.

Berapa panjang output maksimum?

Tidak secara resmi diungkapkan oleh Alibaba. Siapa pun yang membangun beban produksi harus menguji batas output praktis secara langsung daripada mengasumsikan angka.

Apakah Qwen 3.7 Flash merupakan model mixture-of-experts?

Belum dikonfirmasi. Beberapa di komunitas berspekulasi bahwa ia menggunakan arsitektur MoE kecil berdasarkan pola harga dan penamaannya, tetapi Alibaba belum mempublikasikan detail arsitektur, sehingga ini tetap spekulasi, bukan fakta.

Bagaimana perbandingannya dengan Gemini 3.5 Flash-Lite?

Keduanya menempati tingkatan multimodal berbiaya rendah dan throughput tinggi yang serupa, serta bersaing terutama pada harga dan panjang konteks, bukan pada tolok ukur penalaran mentah. Belum ada data tolok ukur independen untuk membuat perbandingan kualitas yang definitif untuk Qwen 3.7 Flash.

Di mana saya bisa mengakses Qwen 3.7 Flash?

Menggunakan model ID qwen/qwen3.7-flash melalui klien yang kompatibel dengan OpenAI, atau melalui lapisan routing seperti OrcaRouter yang dapat menetapkannya sebagai tier multimodal murah default di samping model-model lain.

Apakah Qwen 3.7 Flash bagus?

Belum terbukti secara independen pada saat penulisan ini — tidak ada organisasi benchmark pihak ketiga, termasuk Artificial Analysis, yang telah mempublikasikan skor untuknya. Proposisi nilainya adalah harga dan ukuran konteks, bukan keunggulan kualitas yang telah terbukti, jadi layak diuji secara empiris terhadap beban kerja spesifik Anda sebelum berkomitmen.

Intinya

Qwen 3.7 Flash tidak berusaha memenangkan papan peringkat, dan Alibaba tidak memberikan dokumentasi kepada siapa pun untuk memeriksa meskipun ia menginginkannya. Yang ingin dilakukannya adalah membuat beban kerja visi-dan-agen — analisis tangkapan layar, pemeriksaan kode visual, loop penggunaan komputer, pencarian visual — cukup murah sehingga biaya tidak lagi menjadi alasan Anda tidak membangun fitur tersebut. Dengan $0.03/$0.13 per juta token dengan konteks 1 juta token, secara ekonomi sangat mendukung lalu lintas agen multimodal volume tinggi yang selalu aktif dengan cara yang hanya bisa ditandingi oleh sedikit model di tingkat kualitas mana pun. Kekurangannya adalah kejujuran tentang kesenjangan: tidak ada tolok ukur independen, tidak ada arsitektur atau panjang output maksimum yang diungkapkan, dan ketidakpastian nyata tentang bagaimana ia bertahan melawan pesaing murah yang sudah mapan seperti Gemini 3.5 Flash-Lite. Perlakukan sebagai default yang menjanjikan dan sangat terjangkau untuk beban kerja multimodal-agen yang layak diuji sekarang — dan tetap jaga dengan jelas terpisah di kepala Anda dari Qwen 3.8 dan Qwen 3.7 Max, yang merupakan model berbeda yang memecahkan masalah yang sama sekali berbeda.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari