
Qwen3.8-27B Benchmarks: Tabel Lengkap, dengan Catatan yang Menyertainya
- openaiBARUOpenAI: GPT-6.1 Sol2026-09-2952Kecerdasan
- anthropicBARUAnthropic: Claude Sonnet 5.52026-09-2856Kecerdasan
- typesafeBARUTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 per 1 juta token · 219 tok/s
- OpenAIBARUOpenAI: GPT-6 Luna2026-09-2238Kecerdasan
- OpenAIBARUOpenAI: GPT-6 Sol2026-09-2248Kecerdasan
- AnthropicBARUAnthropic: Claude Opus 5.52026-09-2258Kecerdasan
- xAIBARUGrok 4.72026-09-2146Kecerdasan
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 per 1 juta token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 per 1 juta token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Kecerdasan
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Kecerdasan77Koding
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Kecerdasan76Koding
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Kecerdasan76Koding
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Kecerdasan82Koding
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 per 1 juta token · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 juta token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Kecerdasan72Koding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 per 1 juta token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Kecerdasan75Koding
- obsidianQwen3.8 27B2026-08-1534Kecerdasan68Koding
Qwen/Qwen3.8-27B mencetak skor Terminal-Bench 2.1 sebesar 73,0, SWE-bench Pro sebesar 61,7, LiveCodeBench v6 sebesar 90,3, dan OSWorld-Verified sebesar 84,3 — dan setiap angka tersebut adalah milik Alibaba sendiri. Model open-weights dengan 27 miliar parameter ini hadir di Hugging Face pada 14 Agustus 2026 di bawah lisensi Apache 2.0, dan dalam dua minggu pertamanya ia memperoleh tiga hasil independen dari pihak ketiga: posisi #1 open-weight pada tolok ukur Legal Agent milik Harvey, dalam studi yang dijalankan oleh firma AI hukum Harvey dan perusahaan memori Engram; peringkat #9 secara keseluruhan pada papan peringkat WebDev Code Arena, satu-satunya model di kelas ukurannya yang masuk 10 besar, menurut pengumuman Alibaba pada 25 Agustus; dan, diumumkan pada 26 Agustus, posisi #1 open-weight pada papan peringkat Image-to-WebDev milik Arena.ai, menempati peringkat #7 secara keseluruhan dengan skor yang dilaporkan sebesar 1.574. Halaman ini adalah ringkasan lengkap dengan sumber: semua 25 tolok ukur resmi dari kartu model, apa yang berubah dibandingkan pendahulunya Qwen3.6-27B, apa yang diukur oleh tes throughput independen AMD, hasil-hasil legal-agent dan webdev-arena tersebut, serta klaim mana yang masih harus Anda anggap sementara.
Panduan membaca sebelum angka-angka: "resmi" di sini berarti evaluasi Alibaba yang tercetak pada kartu model di Qwen/Qwen3.8-27B. Nilai tersebut dilaporkan oleh vendor dan belum direproduksi. "Independen" berarti seseorang di luar lab yang mengukurnya — sejauh ini mencakup uji throughput perangkat keras, studi agen domain hukum, dan penempatan di dua papan peringkat pengembangan web Arena.ai, yaitu Code Arena's WebDev dan arena Image-to-WebDev. Benchmark yang perlengkapan ujinya penting ditandai langsung di teks.
Model, satu baris per spesifikasi.
• 27B parameter padat (28B termasuk encoder visi), 64 lapisan, ukuran tersembunyi 5120.
• Atensi hibrida — 48 lapisan atensi linear Gated DeltaNet ditambah 16 lapisan atensi penuh, rasio 3:1 — yang membuat jendela 262K token terjangkau untuk dijalankan.
• 262.144 token konteks native, dapat diperluas hingga 1.000.000 dengan penskalaan YaRN.
• Input gambar dan video native (output teks), bobot Apache 2.0, sekitar 55,6GB dalam BF16.
Versi singkatnya: ini adalah model yang dirancang untuk mengambil apa yang dipelajari Alibaba dari pembangunan Qwen3.8-Max dengan 2,4 triliun parameter dan mengompresnya menjadi sesuatu yang dapat dijalankan oleh satu GPU.
Papan skor: setiap tolok ukur pada kartu model
Semua skor di bawah ini dilaporkan Alibaba dari kartu model 14 Agustus, dengan skor Qwen3.6-27B yang digantikan oleh model tersebut dalam tanda kurung.
Pemrograman. Terminal-Bench 2.1 (pengkodean terminal agen) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Pengujian SWE-bench Pro dan QwenSWEBench menggunakan harness Claude Code, sesuai catatan kaki kartu model — perlu diingat sebelum membandingkannya dengan model yang dinilai pada harness yang berbeda.
Agen berhorizon panjang dan pekerjaan kantor. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / skor 42.9 (10.6 / 27.3).
Penalaran dan pengetahuan. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE dinilai oleh GPT-4o, sesuai kartu.
Visi dan penggunaan komputer. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 dengan CI / 90.0 tanpa (85.1); BabyVision 85.6 dengan CI / 65.7 tanpa (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" adalah peningkatan waktu inferensi milik Alibaba; selisih antara kondisi aktif dan nonaktifnya adalah angka paling informatif di kartu ini tentang seberapa banyak skor yang dapat Anda beli dengan komputasi inferensi tambahan.

Apa yang sebenarnya berubah dibandingkan Qwen3.6-27B
Setiap tolok ukur pada kartu tersebut meningkat, tetapi perubahannya tidak seragam — dan bentuk peningkatan itulah ceritanya. Peningkatan tersebut terkonsentrasi pada coding agen dan penggunaan komputer, bukan pada pengingatan pengetahuan:
• DeepSWE 1.1 (agentic coding) 13.3 → 42.2, kira-kira lonjakan 3x lipat
• QwenSWEBench 49.3 → 79.0
• Skor Ujian Terakhir Agents 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 dan AndroidWorld 70.3 → 81.9
• BabyVision (dengan CI) 28.9 → 85.6 — peningkatan relatif terbesar di kartu ini
Sementara itu, GPQA Diamond naik dari 87.8 → 89.2 dan RealWorldQA dari 84.1 → 85.9: nyata namun kecil. Ini bukan rilis yang "lebih pintar dalam segala hal". Ini adalah rilis yang ditujukan langsung untuk agen yang membaca layar, menggunakan alat, dan menulis kode dalam banyak langkah.

Hasil independen pertama: #1 open-weight pada benchmark Harvey's Legal Agent.
Sejak halaman ini tayang, perkembangan terpenting bersifat hukum, bukan teknis. Alibaba mengumumkan bahwa Qwen3.8-27B adalah model open-weight #1 pada benchmark Legal Agent milik Harvey — klaim peringkat dari keterangan vendor itu sendiri, jadi perlakukan sebagai pernyataan Alibaba. Hasil yang mendasarinya adalah studi yang bukan milik Alibaba: Harvey, perusahaan AI hukum, dan Engram, perusahaan rintisan memori AI, membangun firma hukum sintetis bernama Calderwood & Harkness dari 100M+ token yang tersebar di sekitar 10.000 dokumen dan 266 perkara, lalu mengadaptasi Qwen3.8-27B padanya dengan memori parametrik, catatan terkompresi, dan alat retrieval.
Pada 250 tugas hukum, 27B yang diadaptasi rata-rata mencapai 67%, melampaui setiap model yang diuji dalam studi tersebut — termasuk Claude Opus 4.8 — dan pada kriteria kebenaran all-or-nothing yang ketat, ia mengungguli Opus 4.8 dengan 30% berbanding 25%, dengan biaya sekitar $0.13 per kueri dibandingkan $1.32 untuk Opus 4.8. Angka-angka tersebut dilaporkan oleh Harvey/Engram, belum direproduksi secara independen. Sebelum dilatih pada dokumen internal firma, model yang sama hanya mencetak 4.7% pada pertanyaan spesifik firma; setelah mempelajarinya, menjadi 72.6%.
Baca #1 dengan satu catatan besar: model yang menduduki peringkat teratas dalam tolok ukur tersebut telah mempelajari korpus uji sebelumnya, diadaptasi pada 100M token perusahaan sebelum dievaluasi. Itu menjadikan ini demonstrasi tentang apa yang dapat diserap oleh 27B dengan penyesuaian khusus domain, bukan skor untuk bobot Apache-2.0 standar pada harness netral — dan itu mencakup satu domain, hukum, bukan kualitas umum. Yang didukungnya adalah narasi di balik tweet: 27B yang cukup kecil untuk dijalankan di mesin lokal cukup kuat untuk pekerjaan tingkat profesional setelah memiliki pengetahuan yang tepat.
Hasil independen kedua: peringkat #9 secara keseluruhan di WebDev Code Arena
Hasil independen kedua adalah hasil coding, dan itulah mengapa halaman ini berubah pada 25 Agustus. Code Arena adalah papan peringkat pengembangan web milik Arena.ai — proyek yang sebelumnya dikenal sebagai WebDev Arena, di situs yang sebelumnya dikenal sebagai LMArena — tempat pengguna membangun aplikasi nyata dengan pasangan model anonim dan memberikan suara pada keluaran mana yang lebih ingin mereka rilis. Di papan peringkat publik tersebut, Qwen3.8-27B berada di peringkat #9 secara keseluruhan dengan skor 1595, satu-satunya model di kelas ukurannya yang masuk dalam 10 besar.
Penempatan tersebut adalah bagian yang independen — berada di papan peringkat pihak ketiga yang dapat dibuka siapa pun. Headline di sekitarnya berasal dari pernyataan Alibaba: bingkai "satu-satunya model kecil di 10 besar" dan penempatan pendampingnya berasal dari pengumuman Qwen pada 25 Agustus. Hal-hal itu layak diulang dengan label tersebut. Model 27B berada enam peringkat di bawah Qwen3.8-Max yang jauh lebih besar (yang menurut pengumuman tersebut berada di peringkat #3 secara keseluruhan), dan jauh di depan Gemma 4-31B yang berukuran serupa (yang menurut pengumuman yang sama berada di peringkat #80). Intinya bukan bahwa model 27B mengungguli model frontier dalam membangun aplikasi web; melainkan bahwa model yang cukup kecil untuk dijalankan pada satu GPU berada di sepuluh besar arena coding buta yang penghuni lainnya adalah model yang jauh lebih besar.
Hasil independen ketiga: model terbuka #1 di Image-to-WebDev milik Arena.ai
Hasil independen ketiga tiba pada 26 Agustus, dan ini adalah yang terkuat sejauh ini untuk model seukuran ini. Image-to-WebDev adalah papan saudara dari WebDev milik Code Arena di Arena.ai — arena tempat model diberikan tangkapan layar atau referensi visual lainnya dan harus mengubahnya menjadi antarmuka web yang berfungsi, dengan pemilih manusia buta yang memilih keluaran yang mereka lebih ingin rilis. Di papan peringkat publik itu, Qwen3.8-27B menempati peringkat #1 di antara model terbuka dan #7 secara keseluruhan, dengan skor arena yang dilaporkan sebesar 1.574.
Penempatan tersebut adalah bagian yang independen — itu berada di papan peringkat pihak ketiga yang dapat dibuka siapa saja. Judul di sekitarnya dinyatakan oleh Alibaba: pengumuman tim Qwen pada 26 Agustus menyebut 27B "setara dengan model 100x ukurannya" dalam tes ini, sebuah perbandingan yang tidak didokumentasikan oleh papan peringkat. Dan peringkat preferensi bukanlah vonis kualitas kode — suara Image-to-WebDev mengukur output mana yang lebih ingin dikirim oleh manusia, bukan apakah HTML tersebut aman, dapat diakses, atau mudah dirawat. Yang ditetapkan oleh hasil ini adalah bahwa model open-weights 27B kini memimpin seluruh bidang terbuka dalam mengubah gambar menjadi halaman, yang merupakan keterampilan yang menjadi dasar bagi kategori produk "screenshot to site" yang sedang berkembang.
Kesenjangan yang jujur: di mana ia masih kalah, dan catatan metodologi.
Jika dibandingkan dengan model frontier, hasilnya menyanjung tetapi tidak sepihak. Pada tolok ukur yang sama-sama diikuti oleh Qwen3.8-27B dan Claude Opus 4.6 Max, Qwen memenangkan mayoritas — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, dan seluruh blok visi. Melawan Muse Glimmer-30B milik Meta, saingan alami di kelas lokal, Qwen memenangkan kedelapan tolok ukur yang tumpang tindih tanpa kecuali. Namun, ia tetap kalah dalam Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0), dan NL2Repo-Bench (42.3 vs 47.6) dari Claude Opus 4.6 Max. Jika beban kerja Anda adalah penalaran frontier yang paling sulit — matematika frontier, pertanyaan yang sangat multidisiplin — 27B belum sampai di sana.
Tiga catatan sebelum Anda mengutip hal-hal ini. Pertama, tabel model card di atas masih sepenuhnya berdasarkan laporan Alibaba — belum ada indeks Artificial Analysis untuk 27B. Kini sudah ada tiga hasil independen dari pihak ketiga, tetapi masing-masing sempit cakupannya: peringkat Code Arena mengukur pembangunan aplikasi web dari prompt teks, peringkat Image-to-WebDev mengukur pengubahan tangkapan layar menjadi halaman yang berfungsi, keduanya dinilai melalui voting buta pada keluaran yang dianonimkan, dan studi agen hukum Harvey mencakup satu domain dengan model yang dilatih untuk pengujian tersebut. Tidak satu pun yang merupakan hasil pengujian bobot standar pada harness tujuan umum. Kedua, model card menggunakan harness Claude Code untuk SWE-bench Pro dan QwenSWEBench, serta penilai GPT-4o untuk Humanity's Last Exam — perbandingan dengan model yang dinilai pada pengaturan lain akan menggeser angka-angkanya. Ketiga, pengujian MathVision milik Alibaba menggunakan prompt tetap, sementara para pesaing mendapatkan varian dengan skor lebih tinggi dari dua varian. Semua ini tidak berarti hasilnya salah; melainkan berarti hasil-hasil tersebut adalah batas atas, bukan batas bawah, sampai laboratorium independen menjalankan model pada harness tujuan umum yang netral.
Apa yang diperlukan untuk menjalankannya
Qwen3.8-27B adalah model lokal, yang mengubah apa yang dimaksud dengan "performa": throughput pada perangkat keras Anda sendiri, bukan dari daftar harga. Bobot BF16 kira-kira 55,6GB; jika dikuantisasi ke 4-bit, ia muat di kartu 24GB seperti RTX 3090 atau 4090. AMD memberikan dukungan Day-0 pada hari peluncuran, dan pengukuran llama.cpp/Vulkan miliknya sendiri — Agustus 2026, rata-rata dari tiga kali atau lebih — menempatkannya pada 24,5 token/detik pada Ryzen AI Max+ 395 dan 51,8 token/detik pada Radeon AI PRO R9700 dengan 32GB, pada sistem dengan memori grafis variabel atau VRAM lebih dari sekitar 24GB. Pengujian komunitas terhadap build FP8 pada NVIDIA GH200 mampu menangani 10 permintaan konteks 262K secara bersamaan dengan waktu-ke-token-pertama di bawah 10ms. Angka Anda sendiri pasti berbeda — itu GPU milik orang lain — tetapi polanya nyata: ini adalah rilis Qwen pertama di kelas ini yang berjalan, bukan hanya dalam ulasan, di satu workstation.
Bobot gratis, atau API berbayar?
Keputusan yang dipaksa oleh model ini adalah keputusan yang memisahkan lokal dari hosted: bobotnya gratis, tetapi GPU Anda tidak gratis. Self-hosting berarti memiliki silikonnya sendiri — satu kartu 24GB jika Anda menerima kuantisasi 4-bit dan generasi yang lebih lambat, atau yang lebih besar jika Anda menginginkan konteks 262K penuh dengan kualitas penuh. Alternatif hosted di OrcaRouter adalah $0,33 per juta token input dan $2,40 per juta token output, dengan konteks 262K yang sama dan input gambar-plus-video, serta p50 time-to-first-token 225ms yang diukur selama tujuh hari terakhir — tanpa GPU yang harus dibeli, tanpa VRAM yang harus diawasi. Perhitungannya sama seperti yang selalu Anda lakukan dengan open weights: throughput token yang sebenarnya Anda butuhkan dikalikan biaya per token Anda, dibandingkan dengan harga tetap sebuah kartu. Pada volume besar yang berkelanjutan, self-hosting menang; pada volume yang melonjak atau sedang, membayar $0,33/$2,40 lebih baik daripada membeli silikon yang sebagian besar menganggur.

Intinya
Qwen3.8-27B adalah model open-weights terkuat yang pernah Alibaba hadirkan di kelas ukuran ini, menurut angka Alibaba sendiri: terbaik di tabel untuk coding agentic, penggunaan komputer, dan penalaran visi, dengan jendela konteks 262K dan bobot berlisensi Apache 2.0. Pembacaan yang benar atas papan skor ini bersifat kondisional — setiap angka pada model card dilaporkan oleh vendor, bersifat spesifik terhadap harness, dan belum direproduksi, serta model frontier masih memenangkan tolok ukur penalaran paling sulit. Jika Anda memutuskan untuk self-host atau memanggilnya sebagai API, perlakukan tabel benchmark sebagai janji, angka throughput AMD sebagai pengukuran perangkat keras independen pertama, hasil agen legal Harvey sebagai tanda independen pertama bahwa kemampuan model ini bertahan di luar harness Alibaba sendiri, dan dua penempatan di arena webdev — #9 keseluruhan di Code Arena's WebDev dan #1 model terbuka di Arena.ai's Image-to-WebDev — sebagai konfirmasi independen pertama di papan peringkat coding atas kemampuan tersebut. Kami akan memperbarui halaman ini seiring semakin banyak lab independen yang memublikasikan skor.
