Sebuah jam pasir di atas alas model yang kosong — bobot Qwen3.8-27B belum dirilis, jadi tidak ada API gratis yang dapat ada.
Guides & Insights

API Qwen 3.8 27B Gratis: Belum Tersedia — Apa yang Bisa Anda Jalankan Sebagai Alternatif

Penulis

Rowan Sterling

Tanggal Terbit

Model terbaru · 20Lihat semua model
Benchmark: Artificial Analysis · diperbarui setiap hari
Kembali ke semua artikel

Tidak — per 12 Agustus 2026, belum ada API Qwen3.8-27B gratis, dan juga tidak ada yang berbayar. Model ini diumumkan pada 3 Agustus dengan bobot terbuka yang dijanjikan ke Hugging Face dan ModelScope "minggu 10 Agustus," tetapi organisasi resmi Qwe​n masih belum memiliki repositori Qwen3.8. Hingga bobotnya dirilis, tidak ada yang bisa menghosting Qwen3.8-27B, jadi "gratis" menjadi tidak relevan. Berikut tiga rute menuju gratis setelah bobotnya dirilis (dan biaya sebenarnya dari masing-masing), plus model yang bisa Anda jalankan gratis secara lokal hari ini.

Belum ada API gratis — bobotnya adalah pintu masuknya.

Alibaba mengumumkan keluarga Qwen3.8 pada 3 Agustus 2026: Qwen3.8-Max dengan 2,4 triliun parameter (sekitar 95 miliar parameter aktif, konteks 1M token, dengan harga $2 per juta token input dan $6 per juta token output di Alibaba Cloud Model Studio) dan Qwen3.8-27B yang padat dan single-machine. Keduanya dijanjikan sebagai bobot terbuka di Hugging Face dan ModelScope pada minggu yang sama.

Janji itu sekarang sudah terlambat dua hari. Saya memeriksa Hugging Face secara langsung pada 12 Agustus: organisasi Qwe​n resmi tidak memiliki repositori Qwen3.8 apa pun. Repositori Qwen3.8-27B-GGUF, -FP8, -NVFP4A16, dan -NInfer yang muncul di pencarian model hanyalah kartu placeholder — nol file bobot, jumlah unduhan satu digit, kartu model yang secara harfiah bertuliskan "dicadangkan menjelang rilis Qwe​n/Qwen3.8-27B." Jangan perlakukan itu sebagai bukti bahwa model tersebut ada; anggaplah mereka seperti orang yang memesan tempat parkir.

Dua hal yang tidak bisa kamu asumsikan. Pertama, lisensi: belum ada lisensi yang disebutkan untuk Qwen3.8-27B. Model open-weight Qwen terbaru dirilis di bawah lisensi Tongyi Qianwen, yang klausul 100-juta-pengguna-aktif-bulanannya memicu pembahasan lisensi komersial dalam skala besar — Apache 2.0 bukan default yang aman. Kedua, spesifikasi: Alibaba belum menerbitkan tabel tolok ukur, jendela konteks, atau kebutuhan perangkat keras yang terkonfirmasi untuk 27B. Semua yang diulang-ulang tentangnya hari ini hanyalah proyeksi.

Kami membahas checklist sebelum perilisan — apa yang sudah dikonfirmasi, apa yang masih rumor, apa yang perlu diperiksa sebelum Anda mengunduh — dalam Qwen3.8-27B Open Weights: What We Know Before the Drop. Artikel ini adalah bagian yang tidak dibahas oleh tulisan tersebut: bagaimana "gratis" sebenarnya akan bekerja setelah model diluncurkan.

Setelah beban turun: tiga jalur menuju kebebasan, dan apa sebenarnya harga masing-masing.

"Gratis" tidak pernah gratis. Ketiga jalur menuju Qwen3.8-27B gratis mengalihkan biaya ke suatu tempat; perbedaannya terletak di mana biaya itu berakhir. Model 27B adalah model dense — setiap satu dari ~27 miliar parameternya aktif pada setiap token — jadi biaya di bawah ini adalah soal perangkat keras sungguhan, bukan pemasaran.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Rute 1: Jalankan sendiri — gratis secara tunai, dibayar dengan perangkat keras

Satu-satunya jalur di mana "gratis" menjadi benar-benar harfiah setelah perangkat keras dibeli. Rekan pendiri Unsloth, Daniel Han, memperkirakan model 27B dapat berjalan pada sekitar 17GB VRAM saat rilis — itu target, bukan spesifikasi final. Dengan menggunakan tangga kuantisasi terukur Qwen3.6-27B sebagai proksi: Q4_K_M berada di sekitar 16GB, Q6_K sekitar 21GB, FP8 sekitar 27GB, dan BF16 penuh sekitar 54–56GB. Minimum yang realistis saat ini adalah kartu 24GB — kelas RTX 3090, RTX 4090, atau A6000 — pada Q4.

Waktu itu penting: bobot resmi dengan vLLM atau SGLang biasanya berfungsi dalam hitungan hari setelah rilis, tetapi kuantisasi komunitas GGUF dan AWQ tertinggal satu hingga dua minggu, jadi gaya "pull and run" ala Ollama tidak akan ada pada hari rilis. Biaya tersembunyinya adalah daya, mesin yang senyap, dan waktu Anda. Keuntungannya adalah privasi — tidak ada yang keluar dari perangkat Anda — dan biaya marjinal nol yang bertambah jika Anda menggunakan GPU juga untuk model-model lain.

Rute 2: Tingkat gratis yang dihosting — gratis dari segi uang, tetapi dibayar dengan batasan.

Begitu bobot-bobot dirilis, perkirakan akan ada kuota evaluasi dari Alibaba Cloud dan tingkat gratis dari host serverless biasa. Pola yang diharapkan adalah yang sudah Alibaba jalankan untuk Qwen3.8-Max: kuota pengguna baru 1M token, hanya wilayah Singapura, berlaku 90 hari, tanpa rollover — dan token penalaran ditagih sebagai output, sehingga model yang bernalar secara default dapat menghabiskan seluruh jatah dalam satu akhir pekan pembuatan prototipe. Yang sebenarnya Anda bayar adalah batas laju, kunci regional, tanggal kedaluwarsa, dan prompt Anda yang dikirim ke pihak ketiga. Tingkat gratis adalah jalan masuk untuk mengevaluasi model, bukan tempat untuk menyebarkannya.

Rute 3: Tingkatan gratis OrcaRouter — direncanakan, belum aktif

Karena kueri pencariannya secara harfiah adalah "gratis," kami akan bersikap eksplisit: OrcaRouter berencana menyediakan tier gratis untuk Qwen3.8-27B setelah bobotnya dirilis. Ini belum aktif. Belum ada endpoint yang bisa dipanggil, dan saya tidak akan menempelkan contoh placeholder. Kami akan mengumumkannya ketika sudah ada yang bisa diumumkan. Yang kami host saat ini adalah Qwen3.8-Max dengan harga $2/$6 per 1M token tanpa markup — dan 27B tidak ada di platform, karena belum ada yang bisa menyajikannya.

Apa yang dapat Anda gunakan secara gratis sekarang

Jika kebutuhan Anda adalah "model terbuka kelas 27B yang dapat saya jalankan tanpa membayar," Anda tidak perlu menunggu. Jawaban jujur pada level yang sama adalah Qwen3.6-27B, pendahulu langsung dari model yang Anda tunggu.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B berlisensi Apache 2.0, model padat 27.8B dengan konteks 262K dan masukan teks, gambar, serta video secara native. GGUF Q4_K_M berukuran sekitar 16.5GB dan berjalan dengan kecepatan sekitar 25 token per detik pada GPU konsumen 24GB (16–18 token per detik pada M4 Max). Angka yang dilaporkan vendor dari kartu modelnya: SWE-Bench Verified 77.2, MMLU-Pro 86.2, AIME 2026 94.1, GPQA Diamond 87.8, dan MMMU 82.9. Jika Qwen3.8-27B adalah "a 27B," ini adalah 27B yang benar-benar bisa Anda sentuh hari ini — keluarga yang sama, desain padat yang sama, dan sudah terbuka.

Nemotron 3.5 Lightning 30B A3Badalah bentuk yang berbeda, juga gratis: dirilis pada 11 Agustus 2026 dengan lisensi OpenMDW 1.1 milik NVIDIA. Model ini adalah Mixture-of-Experts dengan total 30B, aktif ~3B, dengan arsitektur Mamba-2 hibrida dan konteks hingga 1M — checkpoint NVFP4 sekitar 21,6GB dan Q4 GGUF sekitar 25GB. Ia membutuhkan kartu grafis 24GB+, karena semua 30 miliar parameter berada di memori meskipun hanya sekitar 3 miliar yang aktif per token. Laporan awal menyebutkan kecepatannya mendekati 45 token per detik pada satu GPU. Model ini dirancang untuk lapisan eksekusi agen — panggilan alat, validasi, pemformatan — bukan penalaran mutakhir. Jika beban Anda adalah pekerjaan rutin agen bervolume tinggi, model ini dapat mengungguli 27B padat pada tugas nyata Anda.

Dan jika yang Anda inginkan secara spesifik adalah API ter-hosting gratis hari ini, bukan instalasi lokal, satu-satunya "gratis" yang jujur adalah kuota Qwen3.8-Max milik Alibaba: 1M token, region Singapura, 90 hari. Itu bukan 27B, dan itu adalah alokasi evaluasi, bukan layanan — gunakan untuk mencoba perilaku Qwen3.8 sekarang, lalu beralih.

Ketika saran ini salah.

Jika Anda sudah memiliki GPU 24GB+, cara pandang "menunggu tingkatan gratis" keliru bagi Anda. Begitu bobotnya dirilis, vLLM dengan bobot resmi sudah menjadi tingkatan gratis Anda; Anda akan menunggu kemudahan yang tidak Anda butuhkan. Tunggulah sekitar dua minggu hanya jika Anda secara khusus menginginkan jenjang kuantisasi GGUF yang telah disempurnakan.

Jika Anda membuat prototipe terhadap kontrak API,kuota gratis yang dihosting (setelah 27B memilikinya) mungkin lebih murah daripada waktu Anda — bahkan dengan masa berlaku 90 hari dan kunci wilayah, menyewa kotak GPU untuk seminggu pembuatan prototipe biasanya merupakan rute yang lebih mahal.

Jika lisensinya ternyata adalah Tongyi Qianwen, bukan Apache,"bobot gratis" tidak berarti bebas untuk dikomersialkan di atas ambang 100 juta MAU. Bacalah file LICENSE di repositori yang sebenarnya sebelum Anda membangun apa pun di atasnya — itulah cara paling umum "bobot terbuka gratis" berubah menjadi tagihan.

Dan jika Alibaba mengundurkan tanggalnya lagi — jangka waktu yang dijanjikan sudah lewat dua hari — setiap minggu yang berlalu menjadikan Qwen3.6-27B pilihan yang tepat, bukan sekadar pengganti sementara.

A timeline from announcement to free local run of Qwen3.8-27B.

Intinya

Tidak ada API Qwen3.8-27B gratis karena Qwen3.8-27B tidak ada di mana pun. Saat bobotnya dirilis, tiga jalur gratisnya adalah hosting mandiri (membayar dalam bentuk perangkat keras), tingkat gratis yang dihosting (membayar dalam bentuk batasan), dan tingkat gratis OrcaRouter yang direncanakan — yang belum aktif, dan kami akan mengatakannya saat sudah aktif. Hari ini, hal gratis yang paling mendekati adalah Qwen3.6-27B di perangkat keras Anda sendiri. Menunggu tidak mengorbankan apa pun kecuali 27B; menjalankan pendahulunya tidak mengorbankan apa pun kecuali GPU yang bisa Anda gunakan untuk mengerjakan segala hal lainnya sambil menunggu.

Dibandingkan dalam artikel ini1

Terdeteksi dari artikel ini · Benchmark: Artificial Analysis · diperbarui setiap hari