
Qwen3.8-27B Benchmarks: Tabel Lengkap, dengan Catatan yang Menyertainya
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1359 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 230 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
- tencentTencent: Hy32026-07-0642Kecerdasan59Koding
Qwen3.8-27B mencetak skor Terminal-Bench 2.1 sebesar 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, dan OSWorld-Verified 84,3 — dan setiap angka tersebut adalah milik Alibaba sendiri. Model open-weights dengan parameter 27 miliar ini dirilis di Hugging Face pada 14 Agustus 2026 di bawah lisensi Apache 2.0, dan per 15 Agustus belum ada pihak di luar Alibaba yang secara independen menilai kualitasnya. Halaman ini adalah ringkasan lengkap dengan sumber: seluruh 25 benchmark resmi dari kartu model, apa yang berubah dibanding pendahulunya Qwen3.6-27B, apa yang diukur oleh uji throughput independen AMD, dan klaim mana yang sebaiknya Anda anggap sementara.
Panduan membaca sebelum angka-angka: "resmi" di sini berarti evaluasi Alibaba yang tertera pada kartu model di Qwen/Qwen3.8-27B. Ini dilaporkan oleh vendor dan belum direproduksi. "Independen" berarti seseorang di luar lab mengukurnya — sejauh ini hal itu berlaku hanya untuk throughput perangkat keras, bukan untuk skor kualitas. Tolok ukur yang kerangka ujinya penting ditandai sebaris.
Model, satu baris per spesifikasi.
• 27B parameter padat (28B termasuk encoder visi), 64 lapisan, ukuran tersembunyi 5120.
• Atensi hibrida — 48 lapisan atensi linear Gated DeltaNet ditambah 16 lapisan atensi penuh, rasio 3:1 — yang membuat jendela 262K token terjangkau untuk dijalankan.
• 262.144 token konteks native, dapat diperluas hingga 1.000.000 dengan penskalaan YaRN.
• Input gambar dan video native (output teks), bobot Apache 2.0, sekitar 55,6GB dalam BF16.
Versi singkatnya: ini adalah model yang dirancang untuk mengambil apa yang dipelajari Alibaba dari pembangunan Qwen3.8-Max dengan 2,4 triliun parameter dan mengompresnya menjadi sesuatu yang dapat dijalankan oleh satu GPU.
Papan skor: setiap tolok ukur pada kartu model
Semua skor di bawah ini dilaporkan Alibaba dari kartu model 14 Agustus, dengan skor Qwen3.6-27B yang digantikan oleh model tersebut dalam tanda kurung.
Pemrograman. Terminal-Bench 2.1 (pengkodean terminal agen) 73.0 (63.4); SWE-bench Pro 61.7 (53.5); QwenSWEBench 79.0 (49.3); DeepSWE 1.1 42.2 (13.3); NL2Repo-Bench 42.3 (36.2); LiveCodeBench v6 90.3 (83.9). Pengujian SWE-bench Pro dan QwenSWEBench menggunakan harness Claude Code, sesuai catatan kaki kartu model — perlu diingat sebelum membandingkannya dengan model yang dinilai pada harness yang berbeda.
Agen berhorizon panjang dan pekerjaan kantor. CoWorkBench 70.7 (61.0); JobBench 33.4 (21.8); Agents' Last Exam Pass@1 20.4 / skor 42.9 (10.6 / 27.3).
Penalaran dan pengetahuan. GPQA Diamond 89.2 (87.8); Humanity's Last Exam 30.8 (24.0); IFBench instruction-following 79.5 (69.1). HLE dinilai oleh GPT-4o, sesuai kartu.
Visi dan penggunaan komputer. OSWorld-Verified 84.3 (63.9); WebArena-Verified 64.8 (48.8); AndroidWorld 81.9 (70.3); MathVision 94.6 dengan CI / 90.0 tanpa (85.1); BabyVision 85.6 dengan CI / 65.7 tanpa (28.9); OmniDocBench 1.5 91.1 (89.4); RealWorldQA 85.9 (84.1). "CI" adalah peningkatan waktu inferensi milik Alibaba; selisih antara kondisi aktif dan nonaktifnya adalah angka paling informatif di kartu ini tentang seberapa banyak skor yang dapat Anda beli dengan komputasi inferensi tambahan.

Apa yang sebenarnya berubah dibandingkan Qwen3.6-27B
Setiap tolok ukur pada kartu tersebut meningkat, tetapi perubahannya tidak seragam — dan bentuk peningkatan itulah ceritanya. Peningkatan tersebut terkonsentrasi pada coding agen dan penggunaan komputer, bukan pada pengingatan pengetahuan:
• DeepSWE 1.1 (agentic coding) 13.3 → 42.2, kira-kira lonjakan 3x lipat
• QwenSWEBench 49.3 → 79.0
• Skor Ujian Terakhir Agents 27.3 → 42.9
• OSWorld-Verified 63.9 → 84.3 dan AndroidWorld 70.3 → 81.9
• BabyVision (dengan CI) 28.9 → 85.6 — peningkatan relatif terbesar di kartu ini
Sementara itu, GPQA Diamond naik dari 87.8 → 89.2 dan RealWorldQA dari 84.1 → 85.9: nyata namun kecil. Ini bukan rilis yang "lebih pintar dalam segala hal". Ini adalah rilis yang ditujukan langsung untuk agen yang membaca layar, menggunakan alat, dan menulis kode dalam banyak langkah.

Kesenjangan yang jujur: di mana ia masih kalah, dan catatan metodologi.
Melawan kelas frontier, gambarnya menyanjung tetapi tidak sepihak. Di area di mana Qwen3.8-27B dan Claude Opus 4.6 Max tumpang tindih, Qwen memenangkan mayoritas — SWE-bench Pro, QwenSWEBench, CoWorkBench, LiveCodeBench v6, OSWorld-Verified, AndroidWorld, IFBench, dan seluruh blok visi. Melawan Muse Glimmer-30B milik Meta, rival kelas lokal yang natural, ia memenangkan kedelapan tolok ukur yang tumpang tindih dengan telak. Namun ia masih kalah dalam Terminal-Bench 2.1 (73.0 vs 78.2), GPQA Diamond (89.2 vs 91.3), Humanity's Last Exam (30.8 vs 40.0), dan NL2Repo-Bench (42.3 vs 47.6) dari Claude Opus 4.6 Max. Jika beban kerja Anda adalah penalaran frontier yang paling berat — matematika frontier, pertanyaan multidisiplin yang sangat masif — 27B belum sampai di sana.
Tiga peringatan sebelum Anda mengutip semua ini. Pertama, tidak ada satu pun yang diverifikasi secara independen; tidak ada indeks Artificial Analysis dan tidak ada run LMArena untuk 27B per 15 Agustus, dan alat uji milik Alibaba sendiri bukanlah yang akan digunakan pihak ketiga. Kedua, kartu model menggunakan alat uji Claude Code untuk SWE-bench Pro dan QwenSWEBench serta juri GPT-4o untuk Humanity's Last Exam — perbandingan dengan model yang dinilai pada pengaturan lain akan mengubah angka-angkanya. Ketiga, pengujian MathVision milik Alibaba menggunakan prompt tetap, sedangkan kompetitor mendapat hasil yang lebih tinggi dari dua varian. Tidak satu pun dari ini berarti hasilnya salah; itu berarti hasil tersebut adalah batas atas, bukan batas bawah, sampai orang lain menjalankan modelnya.
Apa yang diperlukan untuk menjalankannya
Qwen3.8-27B adalah model lokal, yang mengubah makna "performa": throughput pada perangkat keras Anda sendiri, bukan pada kartu harga. Bobot BF16 kira-kira 55,6GB; jika dikuantisasi ke 4-bit, ia muat di kartu 24GB seperti RTX 3090 atau 4090. AMD merilis dukungan Day-0 pada hari peluncuran, dan pengukuran llama.cpp/Vulkan miliknya sendiri — Agustus 2026, rata-rata dari tiga kali atau lebih pengujian — menempatkannya pada 24,5 token/detik di Ryzen AI Max+ 395 dan 51,8 token/detik di Radeon AI PRO R9700 dengan 32GB, pada sistem dengan memori grafis variabel atau VRAM lebih dari sekitar 24GB. Pengujian komunitas terhadap build FP8 pada NVIDIA GH200 mampu menangani 10 permintaan konteks 262K secara bersamaan dengan waktu-ke-token-pertama di bawah 10ms. Angka Anda sendiri akan berbeda — itu GPU milik orang lain — tetapi polanya nyata: ini adalah rilis Qwen pertama di kelas ini yang berjalan, bukan hanya dalam ulasan, pada satu workstation.
Bobot gratis, atau API berbayar?
Keputusan yang dipaksa oleh model ini adalah keputusan yang memisahkan lokal dari hosted: bobotnya gratis, tetapi GPU Anda tidak gratis. Self-hosting berarti memiliki silikonnya sendiri — satu kartu 24GB jika Anda menerima kuantisasi 4-bit dan generasi yang lebih lambat, atau yang lebih besar jika Anda menginginkan konteks 262K penuh dengan kualitas penuh. Alternatif hosted di OrcaRouter adalah $0,33 per juta token input dan $2,40 per juta token output, dengan konteks 262K yang sama dan input gambar-plus-video, serta p50 time-to-first-token 225ms yang diukur selama tujuh hari terakhir — tanpa GPU yang harus dibeli, tanpa VRAM yang harus diawasi. Perhitungannya sama seperti yang selalu Anda lakukan dengan open weights: throughput token yang sebenarnya Anda butuhkan dikalikan biaya per token Anda, dibandingkan dengan harga tetap sebuah kartu. Pada volume besar yang berkelanjutan, self-hosting menang; pada volume yang melonjak atau sedang, membayar $0,33/$2,40 lebih baik daripada membeli silikon yang sebagian besar menganggur.

Intinya
Qwen3.8-27B adalah model berbobot terbuka terkuat yang pernah dirilis Alibaba di kelas ukuran ini, menurut angka Alibaba sendiri: terbaik dalam tabel untuk pengkodean agen, penggunaan komputer, dan penalaran visi, dengan jendela konteks 262K dan bobot Apache 2.0. Pembacaan yang benar atas papan skor ini bersifat kondisional — setiap angka dilaporkan vendor, spesifik terhadap harness, dan belum direproduksi, serta model frontier masih memenangkan tolok ukur penalaran terberat. Jika Anda memutuskan untuk meng-host sendiri atau memanggilnya sebagai API, perlakukan tabel tolok ukur sebagai janji dan angka throughput AMD sebagai satu-satunya pengukuran independen yang ada saat ini. Kami akan memperbarui halaman ini pada hari laboratorium independen memublikasikan skor.
