
Qwen3.8-27B Text+Video Akan Hadir di CPU: Apa yang Diubah oleh PR torchcodec SGLang
- z-aiBARUZ.ai: GLM 5.32026-08-1860Kecerdasan75Koding
- obsidianBARUQwen3.8 27B Uncensored (Aggressive)2026-08-1552Kecerdasan68Koding
- qwenBARUQwen: Qwen3.8 27B (free)2026-08-1341 tok/s
- deepseekBARUDeepSeek: DeepSeek V4 Pro 08132026-08-1253Kecerdasan69Koding
- grokBARUSpaceXAI: Grok 4.62026-08-1261Kecerdasan77Koding
- metaBARUMeta: Muse Spark 1.22026-08-0557Kecerdasan72Koding
- qwenQwen: Qwen3.8 Max2026-08-0358Kecerdasan72Koding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3152Kecerdasan69Koding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 juta token · 237 tok/s
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2463Kecerdasan78Koding
- googleGoogle: Gemini 3.6 Flash2026-07-2152Kecerdasan69Koding
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137Kecerdasan49Koding
- metaMeta: Muse Spark 1.12026-07-1653Kecerdasan71Koding
- kimiMoonshotAI: Kimi K32026-07-1560Kecerdasan76Koding
- openaiOpenAI: GPT-5.6 Luna2026-07-0952Kecerdasan71Koding
- openaiOpenAI: GPT-5.6 Terra2026-07-0957Kecerdasan77Koding
- openaiOpenAI: GPT-5.6 Sol2026-07-0961Kecerdasan77Koding
- grokxAI: Grok 4.52026-07-0856Kecerdasan72Koding
Sebuah draf pull request di SGLang saat ini berjudul “[CPU] Dukungan Qwen3.8 text+video: menambahkan torchcodec, ffmpeg, dan menghapus pin_memory.” Buang bagian teknisnya dan ini terbaca sebagai peta jalan: Qwen3.8-27B — model visi-bahasa berparameter 27 miliar besutan Alibaba, berlisensi Apache-2.0, yang dirilis sebagai sumber terbuka lima hari lalu — sedang disiapkan agar mode text+video-nya berjalan pada perangkat keras tanpa GPU di dalamnya. Itu adalah sinyal konkret pertama bahwa model 27B multimodal ini mendapatkan jalur serving CPU yang sesungguhnya di salah satu runtime inferensi yang benar-benar digunakan tim, dan ini penting bagi siapa pun yang telah menunggu menjalankan pemahaman video secara lokal tanpa membeli kartu grafis 48GB.
Belum ada apa pun dalam PR itu yang di-merge — masih berupa draf, CI-nya merah, dan pin versinya masih berubah-ubah. Tapi justru itulah mengapa PR ini layak dibaca dengan saksama. Model di baliknya nyata dan sudah dirilis, ekosistem serving-nya sudah menyusul di sisi GPU, dan PR ini menunjukkan ke mana arah jalur tanpa GPU. Berikut ini apa yang sebenarnya dilakukan perubahan tersebut, mengapa inferensi video CPU untuk model 27B lebih penting daripada yang terdengar, apa yang sudah dikonfirmasi tentang Qwen3.8-27B, dan di mana Anda bisa memanggilnya hari ini.
Model dalam satu paragraf.
Qwen3.8-27B adalah model open-weight 27B dari generasi Qwen 3.8: model visi-bahasa padat dengan ~27,8 miliar parameter (64 lapisan, ukuran tersembunyi 5.120) dengan menara visi khusus, dirilis di bawah Apache 2.0 di Hugging Face dan ModelScope pada malam 14 Agustus 2026 (waktu Beijing). Model ini menerima teks, gambar, dan video serta menghasilkan teks — secara native, bukan melalui adapter tempelan — dengan jendela konteks native 262.144 token, yang dapat diperluas hingga sekitar satu juta melalui YaRN. Lisensinya permisif: penggunaan komersial, fine-tuning, dan redistribusi, tanpa ambang pendapatan dan tanpa perjanjian komersial terpisah, tidak seperti ketentuan checkpoint unggulan.
Dua detail arsitektur lebih penting bagi seorang deployer daripada spesifikasi utamanya. {{1}}Yang pertama adalah hybrid attention: sebagian besar lapisan menggunakan Gated DeltaNet linear attention dan hanya seperempat yang mempertahankan cache KV penuh, sehingga memori konteks panjang hanyalah sebagian kecil dari kebutuhan model padat 64 lapisan konvensional — trik yang sama yang membuat jendela 262K realistis di dalam satu GPU konsumen.{{/1}} {{2}}Yang kedua adalah multi-token prediction (MTP), yang mengirimkan checkpoint dengan speculative-decoding head miliknya sendiri dan secara terukur mempercepat decoding saat tumpukan layanan menggunakannya.{{/2}}
Ini juga yang mampu video di antara keluarga ini. Checkpoint terbuka andalannya, Qwen3.8-2.4T-A95B, secara efektif hanya teks dalam bentuk yang dapat diunduh, dan API Qwen3.8-Max yang dihosting menambahkan visi di atas bobot tersebut. 27B adalah bobot yang benar-benar dapat Anda unduh dan jalankan yang mendukung teks, gambar, dan video langsung dari kotaknya — itulah mengapa jalur CPU untuk mode videonya layak untuk diperhatikan.
Apa yang sebenarnya diubah oleh PR SGLang
Pull request (sgl-project/sglang #35492) ini sempit dan jelas. Deskripsinya sendiri: “PR ini untuk mendukung Qwen3.8 teks+video, dengan menambahkan torchcodec, ffmpeg, dan menghapus pin_memory.” Dalam praktiknya, itu adalah tiga langkah.
• torchcodec — pustaka decoding video berbasis ffmpeg milik PyTorch — ditambahkan ke dalam stack, sehingga bingkai video untuk Qwen3.8 teks+video dapat didekode dan dipraproses di CPU host. PR tersebut mengunci torchcodec 0.12.0 dengan torch 2.12, dan mencatat bahwa ffmpeg harus tetap di bawah versi 9.
• pin_memory telah dihapus dari jalur multimodal. pin_memory adalah optimasi transfer GPU yang mengunci buffer host untuk penyalinan asinkron cepat ke perangkat; menghapusnya pada jalur khusus CPU adalah tanda bahwa perangkat keras target tidak memiliki akselerator diskrit di jalur data.
• Perintah reproduksi menjalankan model yang sebenarnya — Qwen/Qwen3.8-27B — melalui sglang.launch_server pada CPU dengan jalur input teks+video yang diaktifkan.
Baca label status sebelum Anda membangun apa pun di atasnya: PR ini masih draft, kedua proses CI gagal, dan masih menunggu review dari pemilik kode SGLang per hari ini. Ini adalah arah, bukan rilis. Konteks pentingnya adalah SGLang sudah melayani Qwen3.8-27B di GPU — cookbook mencakup H200, RTX PRO 6000, RTX 5090, dan DGX Spark, dengan image khusus lmsysorg/sglang:qwen38-27b — jadi jalur teks+video CPU adalah bagian yang benar-benar baru.
![A screenshot of the draft SGLang pull request #35492 titled '[CPU] Support Qwen3.8 text+video: adding torchcodec, ffmpeg and removing pin_memory', showing the description quoting torchcodec 0.12.0 against torch 2.12 and ffmpeg below 9, a reproduce command launching Qwen/Qwen3.8-27B with --device cpu, and the note that an approving review is required before the pull request can merge.](https://cms.orcarouter.ai/api/media/file/2-375.png)
Mengapa CPU text+video lebih penting daripada yang terdengar
Alibaba sejak awal memposisikan 27B untuk AI edge — MediaTek mengadaptasinya ke chip mobile Dimensity dan kokpit otomotif C-X1 pada hari yang sama bobotnya dirilis. Kisah penerapan lokal semakin memperkuatnya: kuantisasi Q4_K_M kira-kira 17.1GB, yang muat di GPU konsumen 24GB atau Mac dengan Apple Silicon dan memori terpadu 32GB. Satu hal yang tidak bisa dilakukan kisah itu adalah video di mesin tanpa GPU sama sekali. Itulah celah yang diatasi oleh PR ini.
Jalur teks+video membuat pemahaman video dapat digunakan di kotak CPU biasa — mesin virtual, server kecil, unit rak on-prem, gateway edge — di mana beban kerja bersifat asinkron dan throughput lebih penting daripada latensi. Pembuatan keterangan video, moderasi konten, penguraian dokumen dan diagram, pengambilan data offline dari rekaman: ini persis pekerjaan batch yang tidak membutuhkan GPU, dan saat ini mereka tetap mengasumsikan GPU diperlukan untuk VLM apa pun yang memiliki input video.
Trade-off yang jujur adalah Qwen3.8-27B adalah model dengan 27 miliar parameter dan tidak ada jalur CPU yang membuat 27B menjadi cepat. Perkirakan kecepatan token satu digit per detik pada server kelas AVX yang serius dengan bingkai video dalam konteks — layak untuk pekerjaan batch dan semalam, bukan untuk obrolan interaktif melalui video. Inti dari jalur CPU adalah opsi tersebut memang ada: penerapan tanpa GPU dapat menjalankan mode video model yang sama alih-alih beralih ke model visi yang lebih kecil atau mengirim setiap bingkai ke GPU cloud.
Di mana Qwen3.8-27B berjalan hari ini
Ekosistem dengan cepat menyusul model tersebut. Di sisi self-host, Anda memiliki llama.cpp dan LM Studio dengan paket GGUF hingga kuantisasi 2-bit sekitar 10,7GB, Ollama untuk perintah satu baris, dan vLLM serta SGLang untuk serving yang layak. Sebagian besar itu berupa teks atau gambar saat ini; jalur video di CPU adalah bagian yang masih dalam pengembangan.
Jika Anda lebih memilih untuk tidak menjalankan 27B sendiri, rute yang dihosting sudah ada: OrcaRouter melayani qwen/qwen3.8-27b dengan masukan teks, gambar, dan video, jendela konteks 262.144 token, dan keluaran teks, dengan biaya $0,33 per juta token masukan dan $2,40 per juta token keluaran. Ini berada di belakang endpoint yang kompatibel dengan OpenAI yang sama seperti setiap model lain di platform — satu kunci API, tanpa kontrak kedua — dan failover otomatis serta DSL perutean platform berlaku untuk 200+ model pada kunci tersebut. Model yang baru berumur lima hari dengan jalur CPU yang belum teruji adalah contoh klasik untuk perutean daripada pengkabelan langsung: Anda dapat mencoba Qwen3.8-27B pada beban kerja nyata di belakang rute tanpa mempertaruhkan seluruh jalur panggilan Anda pada satu tumpukan penyajian, dan beralih antara versi yang dihosting sendiri dan yang dihosting tanpa mengubah kode.

Angka-angka tersebut — dilaporkan vendor, dan layak untuk diperiksa
Setiap angka utama di bawah ini adalah milik Alibaba sendiri, berasal dari kartu model dan materi peluncuran. Model ini baru berusia lima hari dan reproduksi independen baru mulai bermunculan, jadi anggap ini sebagai klaim dengan arah yang jelas, bukan vonis akhir. Untuk ukuran 27B, skor coding dan agen adalah yang paling menonjol:
• SWE-bench Pro — 61.7 (dilaporkan Alibaba; tabelnya sendiri menunjukkan Claude Opus 4.6 Max pada 53.4)
• Terminal-Bench 2.1 — 73.0 (pengkodean terminal agen)
• OSWorld-Verified — 84.3 (tugas agen penggunaan komputer)
• AndroidWorld — 81.9
• DeepSWE 1.1 — 42.2, kira-kira tiga kali lipat dari 13.3 milik open 27B sebelumnya.
Di sisi visi — sisi yang sebenarnya dibahas artikel ini — Alibaba melaporkan VideoMME 87.0 untuk pemahaman video dan MathVision 90.0 untuk penalaran visual tanpa alat. Pembacaan awal Artificial Analysis menempatkan model ini pada 52 di Intelligence Index dan 51 di Agentic Index, kompetitif dengan model tertutup yang jauh lebih besar pada setelan penalaran tertentu; skor tersebut masih awal untuk model yang baru berusia lima hari.

{{1}}Ada satu peringatan yang sangat penting bagi siapa pun yang menjalankan model secara lokal atau di CPU, yaitu dial penalaran.{{/1}} Qwen3.8-27B hadir dengan mode berpikir aktif dan pengaturan reasoning_effort per permintaan (low / medium / xhigh). {{2}}Default xhigh berpikir terlalu berlebihan: proses pertama yang kini terkenal dari GGUF 17GB memakan waktu sekitar 21 menit dan 22.000 token penalaran hanya untuk membuat gambar sederhana.{{/2}} {{3}}Terutama di CPU, atur reasoning_effort secara sengaja — perbedaan antara interaktif dan tidak dapat digunakan hanyalah satu parameter.{{/3}}
Apa yang harus ditonton
Tiga hal akan memberi tahu Anda apakah jalur CPU menjadi nyata:
• Apakah PR #35492 akan digabungkan. Saat ini masih berupa draf dengan CI merah. Masuknya versi yang sudah digabungkan dan berstatus hijau ke dalam sebuah rilis adalah titik ketika jalur teks+video CPU menjadi dapat dijalankan oleh kita semua.
• Tolok ukur independen. Angka 61.7 SWE-bench Pro dan 87.0 VideoMME dilaporkan vendor. Pengujian LMArena dan Artificial Analysis dalam beberapa minggu ke depan akan menunjukkan seberapa banyak yang bertahan di luar kerangka pengujian Alibaba sendiri.
• Apakah versi konteks 1M yang dihosting akan terwujud. 262K native sudah banyak; mode multimodal satu juta token adalah tempat penghematan cache hybrid-attention terbayar dengan sendirinya.
Untuk saat ini keputusannya sederhana. Jika Anda memiliki perangkat kerasnya, Q4 GGUF 17GB plus SGLang atau llama.cpp dapat menjalankan model tersebut saat ini, dan PR CPU text+video menunjukkan ke mana arah jalur tanpa GPU. Jika tidak, Qwen3.8-27B dapat dipanggil melalui OrcaRouter dengan harga $0.33 per juta token input dan $2.40 per juta token output dengan satu kunci. Apa pun pilihannya, 27B terbuka yang mampu memproses video adalah model paling menarik untuk dicermati dalam generasi Qwen 3.8 — dan usianya baru lima hari.
