
Perceptron Mk1.5 vs Qwen 3.8: Robot Membutuhkan Keduanya dan Tidak Satu pun Merupakan Pengganti
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 610 tok/s
- openaiBARUOpenAI: GPT-6 Luna2026-09-2237Kecerdasan
- openaiBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- anthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- grokBARUGrok 4.72026-09-2146Kecerdasan
- OrcaBARUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 per 1 juta token · 189 tok/s
- orcaBARUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- openaiOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 111 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 225 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Kecerdasan69Koding
- grokSpaceXAI: Grok 4.62026-08-1244Kecerdasan77Koding
- metaMeta: Muse Spark 1.22026-08-0540Kecerdasan72Koding
Robot yang harus mengambil sesuatu membutuhkan dua hal dari sebuah model, dan tidak ada satu model pun dalam pasangan ini yang memberi Anda keduanya. Perceptron Mk1.5 mengembalikan geometri: jika diberi bingkai video, ia dapat mengembalikan titik, kotak, poligon, atau elemen <track> berstempel waktu, dan jendela konteksnya adalah 36.864 token. Qwen 3.8 — nama yang mengacu pada inti berbobot terbuka Qwen3.8-2.4T-A95B milik vendor — adalah penalar mixture-of-experts dengan 2,4 triliun parameter dengan jendela asli 262K yang meluas hingga mendekati satu juta, dan ia hanya teks, sehingga sama sekali tidak dapat melihat bingkainya. Satu adalah lapisan persepsi yang berbiaya $0,15 dan $1,50 per juta token; yang lain adalah inti penalaran yang berbiaya sekitar tiga belas kali lipat untuk input dan empat kali lipat untuk output, serta memiliki skor independen 40 pada Artificial Analysis Intelligence Index, sedangkan model persepsi tidak memiliki skor independen di mana pun.
Jika disandingkan sebagai produk yang bersaing, keduanya saling kalah dalam arah yang berlawanan dan perbandingannya tidak menghasilkan apa pun yang bisa digunakan. Jika disandingkan sebagai dua bagian dari satu pipeline, keduanya menjelaskan hampir setiap keputusan biaya dan keandalan dalam stack yang diwujudkan: di mana frame ditafsirkan, di mana rencana dibuat, dan apa yang terjadi pada tagihan Anda ketika bagian penalaran menulis lebih banyak token daripada yang dibutuhkan tugas.
Pemisahan yang membuat pasangan ini masuk akal
Perceptron Mk1.5 dirilis pada 25 September 2026 sebagai penerus Perceptron Mk1, dan tugasnya didefinisikan secara spesifik. Ia menerima teks, gambar, video, dan audio, dan mengembalikan teks plus anotasi terstruktur opsional — titik, kotak pembatas, poligon, klip, dan track. Output <track> membawa baik observasi spasial maupun stempel waktu yang terkait, sehingga klip berdurasi 60 detik dikembalikan sebagai posisi dari waktu ke waktu, bukan satu tebakan rata-rata. Bidang asset_idx memungkinkan satu permintaan untuk menangani beberapa gambar atau video secara terpisah, yang dibutuhkan oleh perbandingan frame referensi versus frame langsung. Respons yang dibatasi hadir dalam dua varian, JSON Schema dan regex, dan inti dari keduanya adalah bahwa output-nya bertipe.
Qwen 3.8 adalah jenis instrumen yang berlawanan. Inti 2.4T-nya adalah MoE berbutir halus — 92 lapisan, 512 pakar per lapisan dengan 10 pakar yang dirutekan plus satu pakar bersama, dan 69 dari 92 lapisan itu menggunakan atensi linear — itulah cara arsitektur sebesar itu mencapai konteks panjangnya. Keunggulannya terletak pada penalaran di atas banyak teks: analisis bertahap yang kompleks, penurunan panjang, perencanaan agentik. Kelemahannya ada di sisi masukan. Inti terbukanya hanya teks, dan penalarannya tidak dapat dimatikan: setiap respons dibuka dengan blok pemikiran, entah Anda menginginkannya atau tidak.
Itu bukan kekurangan pada model penalaran; itu kekurangan pada model persepsi, dan Qwen 3.8 bukan model persepsi. Tempatkan keduanya secara berurutan dan polanya menjadi jelas — Mk1.5 menjawab "di mana forklift itu berada dan kapan ia bergerak", Qwen 3.8 menjawab "berdasarkan itu, apa yang harus dilakukan lengan". Tak satu pun pertanyaan itu dapat dijawab oleh model lainnya.

Berapa biaya setiap bagiannya, pada tarif yang benar-benar ditagih
• Input — Perceptron Mk1.5 $0,15 per juta token. Qwen 3.8 $2,00 per juta pada build yang dihosting yang diukur oleh harness independen, dengan diskon cache 88% yang diterapkan, sehingga cache hit menjadi sekitar $0,24.
• Keluaran — Mk1.5 $1,50 per juta. Qwen 3.8 $6,00 per juta.
• Cache — input cache Mk1.5 adalah $0,0375 per juta, tepat seperempat dari tarif input standarnya. Diskon Qwen 3.8 berbasis persentase tetapi lebih besar, yaitu 88%, sehingga tarif cache-nya lebih murah di antara keduanya secara absolut dan tarif tanpa cache-nya lebih dari sepuluh kali lipat tarif Mk1.5.
• Biaya per tugas yang diselesaikan — di sinilah peringkatnya terbalik. Artificial Analysis menempatkan biaya Qwen 3.8 per tugas Intelligence Index pada $2,16, berada di peringkat ke-32 dari 115 di kelasnya dan diberi nilai empat dari empat unit untuk biaya — murah per tugas yang diselesaikan meskipun tokennya mahal, karena model tersebut menghasilkan 170M token keluaran di seluruh uji indeks dibandingkan dengan pesaing yang lebih bertele-tele. Mk1.5 tidak memiliki angka setara yang dipublikasikan oleh siapa pun.
• Konteks — 36.864 token untuk Mk1.5 dibandingkan dengan 262K native untuk inti Qwen, dapat diperluas hingga satu juta dengan konfigurasi serving yang tepat.
• Kontrol penalaran — Mk1.5 menyediakan reasoning_effort pada high, medium, low, minimal, atau none dan default ke high. Qwen 3.8 mengunci thinking agar selalu aktif, jadi Anda membayar token thinking pada setiap panggilan.
Baca daftar itu dua kali, karena kedua model ini berkebalikan soal biaya. Per token, Mk1.5 jauh lebih murah. Per tugas yang diselesaikan pada tolok ukur independen, Qwen 3.8 terukur sebagai murah dan Mk1.5 tidak terukur. Kedua pernyataan itu hanya bertentangan jika Anda mengasumsikan keduanya mengerjakan pekerjaan yang sama, dan ternyata tidak.

Buktinya justru mengarah ke arah sebaliknya di sini
Dalam sebagian besar perbandingan dalam batch ini, sisi open-weights adalah sisi yang memiliki setumpuk angka yang dilaporkan vendor, dan API tertutup adalah sisi yang memiliki halaman pihak ketiga. Di sini justru terbalik, dan pembalikan itu layak disebutkan secara tepat karena mengubah apa yang dapat dan tidak dapat Anda verifikasi.
Qwen 3.8 memiliki pengukuran independen. Artificial Analysis Intelligence Index menempatkan inti 2,4T pada 40, diperingkat ke-5 dari 115 model di kelasnya pada saat penulisan, dengan kecepatan keluaran 39,6 token per detik — ke-56 dari 115, yang termasuk kelas menengah dan layak diketahui sebelum ada yang merencanakan loop interaktif di sekitarnya. Revisi indeks berubah antar snapshot dan cara jujur untuk membaca angka-angka ini adalah sebagai indikatif, tetapi intinya tetap berlaku: seseorang di luar Alibaba telah menjalankan model ini dan menerbitkan sebuah angka.
Perceptron Mk1.5 tidak memiliki hal semacam itu. Tidak ada entri Artificial Analysis dan tidak ada skor arena untuk Mk1.5 atau pendahulunya, jadi setiap angka kemampuan yang ada dihasilkan oleh Perceptron tentang model milik Perceptron sendiri. Kumpulan itu luar biasa spesifik, yang merupakan nilai plus — 0,9433 pada egocentric hand_box versus 0,4467 untuk Gemini 3.1 Pro dalam uji yang dijalankan vendor sendiri; EgoSchema 80,40 versus 81,20 untuk pesaing yang sama, kekalahan tipis pada tolok ukur pemahaman luas di samping klaim keunggulan 12% pada subset EgoSchema yang lebih sulit pada 63,75; 0,647 centre-F1 dan 0,628 point-HOTA pada Molmo2-Track — tetapi spesifik dan terverifikasi secara independen adalah sifat yang berbeda, dan hanya yang kedua yang memberi tahu Anda apa yang akan terjadi pada rekaman Anda.
Dua peringatan saat membaca tabel Perceptron, yang keduanya berlaku untuk setiap pengutipan tabel itu. Angka LiveVQA-W sebesar 56.0 dengan tools diaktifkan berasal dari pemungutan suara mayoritas empat sampel, sedangkan 53.2 yang dijadikan pembanding untuk Gemini 3.8 Flash dengan grounding Google Search bukanlah pemungutan suara mayoritas; teknik itu sah dan membuat skor tampak lebih baik dibandingkan satu greedy pass tunggal. Dan baris tracking mencantumkan Qwen3-VL-8B pada 0.180 centre-F1 yang diambil dari makalah model tersebut, berada di kolom yang sama dengan angka-angka terukur untuk keluarga checkpoint yang berbeda. Angka dari makalah di kolom terukur bukanlah baris yang sebanding, dan itulah persis jenis baris yang dikutip tanpa asal-usulnya.
Inti 2.4T bukanlah sesuatu yang bisa Anda dapatkan dengan menghubungi kami — tetapi arsitekturnya bisa

Inilah bagian dari perbandingan yang jawaban jujurnya berbeda dari apa yang disiratkan oleh ketenaran model tersebut. Qwen 3.8 sebagai nama banyak digunakan untuk merujuk pada inti terbuka, dan inti terbuka itu adalah unduhan, bukan endpoint: bobot BF16 sebesar 2,4TB di bawah lisensi Qwen3.8-Max khusus Alibaba, yang diterbitkan pada Agustus 2026. Kami tidak melayaninya, dan tidak ada penyedia yang melayaninya di sisi kami saat ini — entri katalognya ada sebagai halaman pelacakan yang diumumkan, belum tersedia, bukan sebagai rute aktif.
Yang kami sediakan adalah API unggulan yang dibangun di atas arsitektur 2.4T yang sama. API ini sudah aktif sebagai qwen/qwen3.8-max dengan harga $2,00 dan $6,00 per juta token, tarif milik Alibaba sendiri yang diteruskan apa adanya dengan tanpa tambahan per token, membawa jendela multimodal 1 juta token — input teks, gambar, dan video — serta desain attention hibrida yang sama dengan inti terbuka. Jika separuh penalaran Anda perlu melihat sesuatu, itulah jalurnya, dan itu juga jalur di mana perubahan tarif vendor sampai ke sisi kami pada hari yang sama, bukan pada siklus penagihan Anda berikutnya. Di sampingnya, kami menyediakan saudara dense milik Alibaba qwen/qwen3.8-27b di infrastruktur kami sendiri dengan harga $0,33 dan $2,40 per juta, dengan jendela 262.144 token serta input teks, gambar, dan video, untuk kasus-kasus di mana penalar 27B sudah cukup dan indeks 40 milik 2.4T melebihi kebutuhan tugas tersebut.
Menghubungkan dua bagian tanpa kontrak kedua
Alasan praktis mengapa pasangan ini lebih penting daripada argumen benchmark adalah bahwa stack embodied sudah terdiri dari dua model, dan biaya integrasi model ketiga adalah hal yang diam-diam membunuh desain. Mk1.5 tidak ada di katalog kami, jadi untuk mencapainya berarti harus lewat API milik vendor itu sendiri — pip install "perceptron>=0.4.0", key di PERCEPTRON_API_KEY, endpoint api.perceptron.inc. Bagian Qwen tinggal satu key lagi.
Di titik sambunganlah sebuah gateway membuktikan nilainya. Aturan perutean yang mengirim setiap frame-dengan-pertanyaan ke model persepsi dan setiap rencana teks-saja ke model penalaran hanyalah satu baris konfigurasi ketika keduanya berada di belakang satu endpoint yang kompatibel dengan OpenAI, dan failover otomatis berarti insiden penyedia di sisi mana pun terdegradasi menjadi fallback alih-alih robot yang macet. Satu API yang mencakup 200 lebih model dengan harga daftar yang diteruskan pada markup 0% juga merupakan cara termurah untuk menjawab pertanyaan yang tidak dapat dijawab artikel ini: apakah tugas pelacakan objek Anda memerlukan koordinat Mk1.5 sama sekali, atau apakah model visi umum dengan jendela yang jauh lebih besar dan skor independen sudah cukup. Merutekan sebagian lalu lintas nyata di antara para kandidat dan mengukurnya pada frame Anda sendiri lebih murah daripada studi benchmark apa pun yang dapat Anda pesan.
Apa yang harus dilakukan dengan ini, secara konkret
Jika Anda membangun persepsi ke dalam sistem fisik, Perceptron Mk1.5 adalah satu-satunya model dalam pasangan ini yang menjawab dalam koordinat, dan itu adalah kemampuan, bukan skor — uji klaim hand-box pada video Anda sendiri, atur reasoning_effort secara sengaja alih-alih menerima default tinggi, dan anggarkan jendela 36.864 token sebagai batasan keras, bukan batasan lunak. Jika Anda membangun lapisan penalaran di atasnya, Qwen 3.8 diukur pada hal yang tidak diukur oleh Mk1.5, dan biaya per tugas yang diselesaikannya adalah angka yang harus dijadikan acuan perencanaan, bukan angka utama $2.00 — dengan catatan bahwa mode berpikirnya tidak dapat dimatikan, jadi tugas yang tidak memerlukan rantai pemikiran tetap membayar untuk itu.
Tim yang keliru dalam hal ini adalah tim yang mencoba membuat satu model melakukan keduanya. Spesialis persepsi 36.864 token tidak akan menampung riwayat operasional, dan penalar 2,4T yang hanya berbasis teks tidak akan pernah melihat bingkai. Pemasangan ini bukanlah kompromi antara dua produk. Itu adalah pembagian kerja yang sesungguhnya, dan pertanyaan yang berguna hanyalah di sisi mana dari pembagian itu setiap panggilan Anda seharusnya berada.
Dibandingkan dalam artikel ini1
Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari
