Kartu judul yang dihasilkan untuk 'ARTEMIS vs Qwen3.8' dengan subjudul 'Benchmark yang sama, dua pekerjaan yang berbeda', yang membandingkan hasil AndroidWorld 99,1% yang dilaporkan sendiri oleh ARTEMIS dengan kenaikan 22,5 poin yang dilaporkan vendor Qwen3.8-Flash dibandingkan Opus 4.6 pada benchmark yang sama, dengan catatan kaki bahwa AndroidWorld tidak memverifikasi kiriman secara independen.
Guides & Insights

ARTEMIS vs Qwen3.8: benchmark yang sama, dua pekerjaan yang berbeda

Penulis

Magnus Corvin

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

ARTEMIS milik Google dan Qwen3.8 keduanya diukur pada AndroidWorld, dan kebetulan itu adalah fakta tunggal yang paling menyesatkan dalam liputan peluncuran kedua proyek tersebut. ARTEMIS adalah harness otomasi Android — dirilis sebagai sumber terbuka oleh Google pada Agustus 2026 di bawah Apache 2.0, ia menerima instruksi berbahasa alami, mengendalikan ponsel sungguhan melalui ADB, dan mengklaim tingkat penyelesaian 99%+ pada tolok ukur AndroidWorld 116 tugas milik Google Research, dengan menunjukkan 99,1% di papan peringkat publik per 11 September 2026. Qwen3.8-Flash adalah model mixture-of-experts multimodal milik Alibaba, yang dirilis dan dibuka sumbernya pada 26 Agustus 2026, yang materi peluncurannya mengklaim mengalahkan Claude Opus 4.6 dengan selisih 22,5 poin pada AndroidWorld. Salah satu dari angka-angka itu adalah skor sebuah sistem. Yang satunya lagi adalah kontribusi sebuah model terhadap sistem yang ditulis orang lain. Bacalah keduanya sebagai rival dan Anda akan menyimpulkan hal yang keliru tentang keduanya; bacalah keduanya sebagai dua bagian dari satu tumpukan dan pertanyaan yang menarik — berapa biaya sebenarnya dari satu proses Android yang panjang — akhirnya memiliki jawaban.

Apa itu Qwen3.8, per ukuran

"Qwen3.8" adalah sebuah keluarga, bukan sebuah checkpoint, dan anggota yang penting di sini bukanlah model unggulan.

Qwen3.8-Max — tingkatan unggulan, diposisikan untuk bersaing dengan model hosted terdepan.

Qwen3.8-27B — varian dense berukuran menengah dari keluarga yang sama, bersifat terbuka.

Qwen3.8-Flash — sebuah MoE multimodal pada arsitektur "Next" yang baru: 125B parameter transformer dengan hanya 6B yang diaktifkan per token, Qwen Sparse Attention yang digabungkan dengan GDN dalam skema attention hibrida untuk percepatan konteks panjang saat cache terpenuhi, Gated Residual yang membagi saluran informasi menjadi empat bagian, dan 51B parameter embedding N-gram. Alibaba mendeskripsikan arsitektur Next sebagai prototipe untuk Qwen4 generasi berikutnya.

Konteks — secara bawaan berukuran besar, dengan sebagian besar daftar berada di 1M token dan beberapa sumber menyebutkan 262K bawaan yang diperluas hingga 1M. Output maksimum sekitar 131K.

Harga — tarif API yang dipublikasikan adalah ¥1 per juta token input dan ¥3 per juta output, yang setara dengan $0,15 / $0,47 di katalog kami, dengan pembacaan cache sebesar $0,018 dan penulisan cache sebesar $0,230. Kerangka Alibaba sendiri adalah bahwa harga cache-hit serendah ¥0,1 per juta itulah yang membuat alur kerja agen dengan input panjang layak, dan angka-angkanya mendukung hal itu: biaya pembacaan cache sekitar seperdua belas dari token input baru.

Pertanyaan soal bobot terbuka — bobot Flash dipublikasikan di Hugging Face dan ModelScope pada hari peluncurannya. Perhatikan cara keluarga ini dihitung: Alibaba menyebut seri Qwen3.8 telah merilis tiga ukuran secara terbuka — Max, 27B, dan Flash — dengan total 2,4T parameter, yang merupakan angka kumulatif seluruh seri, bukan jumlah parameter salah satu model saja.

Klaim benchmark ini luas dan, menurut materi peluncuran Alibaba sendiri, semuanya adalah selisih, bukan angka absolut: SWE-bench Pro +9,1 di atas Opus 4.6, JobBench sekitar +20, MathVision +25,1, ERQA +31,5, AndroidWorld +22,5. Selisih terhadap konfigurasi model pesaing yang tidak disebutkan bukan kategori bukti yang sama dengan entri papan peringkat, dan tak satu pun dari ini telah direproduksi secara independen. Pembingkaian utama perusahaan — pendefinisian ulang "garis pembunuh" biaya industri dari harga per token menjadi total biaya per tugas yang diselesaikan — adalah klaim yang benar-benar penting untuk perbandingan ini, dan itu juga yang dapat Anda uji sendiri.

A screenshot of the OrcaRouter model page for qwen/qwen3.8-flash, showing the model released 2026-08-26 with Vision, Tools, JSON and Reasoning badges, a 1M-token context window with 131K maximum output, $0.15 per million input tokens and $0.47 per million output, a p50 time to first token of 7.12 seconds and a p95 of 10.00 seconds, and 2,298.5M tokens of traffic over seven days.

Apa yang ARTEMIS kontribusikan, dan mengapa kedua angka tersebut tidak dapat dibandingkan

ARTEMIS tidak berisi model. Lencananya bertuliskan "Multi-Model — Gemini | Claude | GPT-4o | Qwen-VL" dan konfigurasinya berada di code>config/artemis.jsonc/code>. Yang dibawanya adalah bagian yang mengubah tebakan model menjadi tindakan terverifikasi: locator yang mengutamakan dinamis yang membaca pohon aksesibilitas bila memungkinkan dan beralih ke visi dan koordinat ketika permukaan Compose atau Flutter tidak memberinya apa pun, Safety Net yang membersihkan popup sistem yang mengganggu sebelum ketukan terjadi, verifikasi checkpoint pada empat level dari code>off/code> hingga code>strict/code>, dan ledger sesi yang memadatkan tangkapan layar lama menjadi ringkasan visual sehingga konteks seratus langkah tetap terjangkau.

Ini juga menyertakan server MCP native. code>uv run artemis mcp --install all/code> mengekspos code>mobile_run_task/code>, code>mobile_manage_task/code>, code>mobile_get_device_state/code>, code>mobile_inspect_trace/code> dan code>mobile_diagnose/code> ke Antigravity, Claude Code, Codex dan apa pun yang berbicara MCP — yang membuat proyek ini menyebar secepat itu, dan yang merupakan pernyataan paling jelas tentang tujuannya. ARTEMIS adalah alat yang dipanggil agen. Model juga demikian, itulah sebabnya menempatkan keduanya dalam kolom yang sama adalah kesalahan kategori.

Satu hal yang perlu diperhatikan saat membaca 99,1% milik ARTEMIS: papan peringkat AndroidWorld secara eksplisit tidak memverifikasi kiriman secara independen. Setiap angka di dalamnya, termasuk milik ARTEMIS, dilaporkan sendiri oleh tim yang menghasilkannya. Peringatan yang sama berlaku lebih kuat lagi untuk selisih yang dikutip dalam pos peluncuran.

Membaca "vs" dalam dua cara

Ada dua cara jujur untuk membaca pertemuan ini, dan keduanya menunjuk ke arah yang berlawanan.

Sebagai rival, perbandingannya sebenarnya: "haruskah saya menggunakan model hosted plus harness, atau haruskah saya menggunakan model yang cukup baik untuk tugas seluler sehingga saya bisa menulis harness sendiri?" Dalam pembacaan itu ARTEMIS menang secara default, karena model bukanlah harness — dan selisih +22,5 poin AndroidWorld tidak memberi tahu Anda apakah Qwen3.8-Flash dapat bertahan pada langkah ke-74 dari proses seratus langkah ketika pop-up sistem menelan ketukannya. Tidak ada apa pun dalam tabel benchmark yang mengukur Safety Net.

Sebagai sebuah stack, perbandingan inilah yang berguna: ARTEMIS adalah loop kendali, Qwen3.8-Flash adalah mesin yang masuk akal untuknya, dan pertanyaannya pun menjadi soal biaya dan keandalan dalam penggunaan berdurasi panjang. Seluruh promosi Alibaba untuk tier Flash — bahwa angka yang penting adalah total biaya per tugas yang diselesaikan, bukan harga per token — justru merupakan metrik yang menjadi dasar penilaian sebuah rangkaian otomasi Android, dan itu adalah metrik yang bisa Anda ukur pada set pengujian Anda sendiri dalam sehari.

Detail canggung yang menghalangi: Qwen3.8-Flash tidak ada dalam daftar backend yang diuji ARTEMIS, yang mencantumkan Gemini, Claude, GPT-4o, dan Qwen-VL. Qwen-VL adalah model yang berbeda. Harness menerima endpoint model dan pasangan tersebut secara teknis masuk akal, tetapi belum ada yang menerbitkan evaluasinya, dan jika Anda menjalankannya, Anda melakukan pekerjaan orisinal alih-alih mengikuti dokumentasi.

Aritmetika yang menentukan hasilnya

Berikut perhitungan yang layak dilakukan sebelum salah satu dari kedua tulisan peluncuran itu meyakinkan Anda akan apa pun. Ini adalah model dengan asumsi yang dinyatakan secara eksplisit, bukan pengukuran, dan Anda sebaiknya mengganti angka-angkanya dengan angka Anda sendiri — tetapi bentuknya itulah intinya.

Jalankan Pro run 100 langkah. Pro berjalan sekitar 15–40 detik per langkah, jadi waktu aktualnya berada di antara 25 menit hingga satu jam, dan setiap langkah mengirimkan tangkapan layar plus prompt yang makin panjang. Asumsikan 8.000 token prompt dan 300 token keluaran per langkah — anggaran tangkapan layar dan instruksi yang konservatif, jauh di bawah biaya satu frame mentah beresolusi penuh. Itu berarti 800.000 token masukan dan 30.000 token keluaran untuk satu pengujian.

• Pada tarif Qwen3.8-Flash $0.15 / $0.47, proses itu memerlukan biaya sekitar $0.12 untuk input dan $0.014 untuk output — kurang lebih tiga belas sen.

• Pada tarif hosted frontier di kisaran satu digit rendah per juta input dan pertengahan belasan per juta output, eksekusi yang sama menghasilkan biaya dalam satuan dolar, bukan sen. Kedua tarif itu sengaja dibuat samar di sini, karena angka pastinya bergantung pada model frontier mana yang Anda pilih dan rasionyalah yang penting: rasionya satu orde besaran, pada setiap pengujian, setiap eksekusi.

• Dan karena ARTEMIS membaca ulang konteks yang terus bertambah pada setiap langkah, rasionya meningkat lebih jauh untuk model mana pun yang biaya pembacaan cache-nya lebih murah. Pembacaan cache Qwen3.8-Flash adalah $0,018 per juta dibandingkan $0,15 untuk input baru — seperdua belas dari harganya, dan alasan Alibaba terus menyoroti tingkat cache-hit saat membicarakan beban kerja agen.

Sekarang kalikan dengan suite Anda. Regresi 500 tes yang dijalankan setiap malam adalah 400 juta token masukan per malam, dan perbedaan antara tiga belas sen dan tiga dolar per tes adalah perbedaan antara harness yang mampu Anda jalankan terus-menerus dan harness yang Anda jadwalkan setiap minggu.

A generated bar chart titled 'What one 100-step Pro run costs', showing Qwen3.8-Flash at about $0.13 per run against a frontier hosted model in the dollars, with a note that the figure is modelled from 8,000 prompt and 300 output tokens per step over 100 steps, and a footer stating it is an illustrative model with stated assumptions.

Menjalankannya, dan di mana plumbing itu penting

Jika Anda ingin menguji perhitungan itu pada aplikasi Anda sendiri, cara yang jujur adalah mengarahkan ARTEMIS ke endpoint model dan mengukurnya. Qwen3.8-Flash ada di katalog kami dengan harga yang dipublikasikan $0.15 / $0.47 dengan pembacaan cache sebesar $0.018 dan penulisan cache sebesar $0.230, pada kunci yang sama dan tagihan yang sama seperti ukuran Qwen3.8 lainnya dan semua yang kami rutekan — yang merupakan bagian yang penting ketika alur kerja yang Anda hitung adalah harness yang melakukan ratusan panggilan per pengujian, bukan seseorang yang melakukan satu panggilan. Halaman model juga memuat angka operasional yang Anda butuhkan sebelum Anda menetapkan sebuah suite padanya: konteks 1M token dengan output maksimum 131K, p50 waktu ke token pertama 7,12 detik dan p95 10,00, serta sekitar 2,3 miliar token lalu lintas melaluinya dalam tujuh hari terakhir. Angka terakhir itu milik kami, bukan dari vendor, dan itu adalah proksi yang wajar untuk apakah orang lain sudah menjalankan beban kerja agen yang panjang di endpoint ini.

Detail infrastruktur yang berhenti bersifat teoretis pada skala ini adalah apa yang terjadi pada langkah 74. Sebuah Pro run mempertahankan konteksnya di satu endpoint selama hampir satu jam; insiden penyedia di tengahnya tidak menurunkan kualitas run, melainkan mengakhirinya, dan Anda tetap membayar untuk 73 langkah yang tidak menghasilkan hasil. Merutekan sesi agen yang panjang melalui lapisan yang melakukan failover ke penyedia lain untuk model yang sama adalah perbedaan antara suite yang tidak konsisten dan suite yang terputus. Itu adalah properti rekayasa yang biasa saja, dan itulah yang menentukan apakah biaya terukur Anda per tugas yang diselesaikan mampu bertahan saat berhadapan dengan satu minggu run nyata.

A generated scoreboard comparing ARTEMIS and Qwen3.8-Flash across six dimensions: what it is (Android automation harness vs multimodal MoE model), AndroidWorld (99.1% self-reported vs +22.5 versus Opus 4.6, vendor-reported), step speed (3-5s Flash and 15-40s Pro vs model latency only), price (per-step model calls vs $0.15 in / $0.47 out per 1M), cache pricing (not applicable vs $0.018 read / $0.230 write per 1M) and context (compressed session ledger vs 1M tokens).

Apa sebenarnya kegunaan masing-masing

Jika Anda memiliki aplikasi Android dan rangkaian pengujian, Anda menginginkan ARTEMIS, dan Qwen3.8-Flash adalah mesin kandidat untuknya, bukan alternatif bagi ARTEMIS — mesin yang tidak terdokumentasi, layak untuk eksperimen satu sore, dengan harga yang membuat eksperimen itu tidak memakan biaya terukur apa pun. Jika Anda sedang memilih model untuk agen seluler yang Anda tulis sendiri, delta AndroidWorld sebesar +22,5 poin adalah alasan untuk melirik Qwen3.8-Flash dan bukan alasan untuk mempercayainya, karena itu adalah delta yang dilaporkan vendor tanpa skor absolut yang disertakan dan tanpa reproduksi independen.

Hal yang secara diam-diam diperdebatkan kedua proyek itu adalah hal yang sama, dan tak satu pun mengatakannya secara gamblang. Google mengklaim bahwa harness-lah yang membuat agen mobile andal, dan menjadikannya open source agar klaim itu dapat diperiksa. Alibaba mengklaim bahwa biaya per tugas yang diselesaikan adalah satu-satunya angka yang penting, dan menetapkan harga sesuai dengan itu. Keduanya mungkin benar, itulah sebabnya konfigurasi yang menarik bukanlah ARTEMIS atau Qwen3.8 — melainkan ARTEMIS di atas Qwen3.8-Flash, diukur pada aplikasi Anda sendiri, dengan trace tetap diaktifkan.

Dan karena ARTEMIS membaca ulang konteks yang terus bertambah pada setiap langkah, rasio tersebut semakin membaik untuk model mana pun yang memiliki pembacaan cache lebih murah.

Dibandingkan dalam artikel ini2

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari