Snapshot tertanggal 2 September 2026 dari Qwen3.8 Max, model penalaran multimodal unggulan Alibaba: input teks + gambar + video, output teks, konteks 1M-token. Kapabilitas dan harga sama dengan model dasar; sematkan untuk perilaku yang dapat direproduksi.
Qwen3.8 Max (0902) adalah entri model di OrcaRouter dari penyedia qwen, yang diterbitkan dengan ID model qwen/qwen3.8-max-0902. Notasi 0902 ditampilkan dalam daftar, tetapi fakta yang diberikan tidak…
Model ini mendukung jendela konteks (context window) sebesar 1.000.000 token. Itu adalah jumlah total input yang dapat diproses model dalam satu permintaan, termasuk konten teks, gambar, dan video dalam prompt. Tidak ada batasan lebih lanjut yang diberikan dalam fakta, sehingga batasan praktis bergantung pada cara OrcaRouter dan penyedia menerapkan tokenisasi serta batas waktu permintaan. Untuk teks panjang, 1.000.000 token memungkinkan banyak dokumen substansial disertakan dalam satu prompt, sehingga mengurangi kebutuhan untuk memotong (chunk) atau merangkum sebelum memanggil model. Untuk video, fakta tidak menyebutkan berapa banyak token yang dikonsumsi per detik, per bingkai (frame), atau per file video, jadi Anda harus memperkirakannya dari metadata atau panggilan uji. Penting juga untuk diingat bahwa ukuran jendela konteks tidak memberi tahu Anda seberapa akurat model pada prompt 1.000.000 token; tidak ada data tolok ukur (benchmark) yang disediakan. Jika aplikasi Anda membutuhkan kualitas konteks panjang yang presisi, evaluasi pada sampel dokumen Anda sendiri sebelum digunakan di produksi.
Dengan teks, gambar, dan video yang diterima sebagai masukan, model dapat diminta untuk bernalar atas materi sumber yang menggabungkan jenis-jenis tersebut dalam satu permintaan yang sama. Contohnya mencakup membaca instruksi dalam teks, memeriksa gambar, dan merujuk pada video saat menghasilkan jawaban. Lembar fakta penyedia tidak mencantumkan kemampuan khusus tugas seperti OCR, deteksi objek, atau penalaran video temporal, sehingga perilaku tersebut tidak boleh diasumsikan. Apa yang dapat diharapkan dari model terutama bergantung pada kemampuan terlatihnya, yang tidak didokumentasikan dalam fakta yang disediakan. Desain yang aman adalah menggunakannya untuk tugas yang memerlukan keluaran teks dari prompt multimodal dan yang dapat mentoleransi biaya penyimpanan gambar serta video sebagai token input. Jika beban kerja hanya berupa teks, model lain tanpa masukan gambar dan video mungkin lebih sederhana. Jika tugas memerlukan operasi video akurat pada tingkat stempel waktu, kartu model tidak memberikan bukti apakah perilaku tersebut andal.
Memilih model yang lebih murah masuk akal ketika tugas tidak memerlukan fitur-fitur yang mendefinisikan daftar ini. Pertanyaan teks pendek tidak membutuhkan konteks 1.000.000 token atau batas keluaran 131.072 token. Alur kerja khusus teks tidak membutuhkan masukan gambar atau video. OrcaRouter menagih model ini sebesar $2,00 per 1.000.000 token masukan dan $6,00 per 1.000.000 token keluaran. Jika alternatif yang lebih murah memiliki harga per token yang lebih rendah serta dukungan konteks dan modalitas yang memadai, biaya akan berkurang. Tidak ada tolok ukur kualitas atau kecepatan dalam fakta yang diberikan, sehingga pemilihan model ini dibandingkan model lain tidak dapat dibenarkan oleh akurasi terukur; pemilihan ini harus dibenarkan oleh persyaratan produk yang eksplisit: konteks besar, masukan campuran teks/gambar/video, atau keluaran panjang dalam satu generasi. Karena harga masukan berlaku untuk setiap token dalam konteks, panggilan dengan konteks yang sangat besar dapat memakan biaya lebih banyak daripada panggilan yang lebih kecil bahkan ketika pertanyaan pengguna pendek, jadi hindari menambah prompt secara berlebihan.
Fakta model yang tersedia untuk Qwen3.8 Max (0902) tidak menyertakan skor benchmark, set evaluasi, atau angka akurasi. Karena alasan itu, pernyataan apa pun tentang kualitas model hanyalah spekulasi, dan OrcaRouter tidak memublikasikan skor inferensi. Jika Anda memerlukan angka untuk membandingkan kandidat, jalankan pengujian Anda sendiri pada input yang representatif, termasuk kasus gambar dan video yang ingin Anda kirim. Benchmark seperti tes pengetahuan publik tidak akan memberi tahu Anda seberapa baik model menangani prompt video spesifik dengan 1.000.000 token. Perlu diingat bahwa nama model seperti Max hanyalah label, bukan bukti kualitas. Hal-hal yang dapat diukur dalam daftar ini adalah jendela konteks, panjang output maksimum, modalitas input, dan harga. Atribut-atribut tersebut memengaruhi apakah suatu beban kerja cocok, tetapi tidak menggambarkan akurasi, kedalaman penalaran, kepatuhan terhadap instruksi, atau perilaku keamanan. Perlakukan kemampuan di area tersebut sebagai belum terverifikasi kecuali Anda melakukan evaluasi sendiri.
Fakta model tidak memberikan tingkat token per detik, angka waktu hingga token pertama, panduan batas waktu permintaan, atau pengukuran kinerja lainnya. OrcaRouter tidak mengklaim angka latensi untuk model penyedia ini. Kecepatan akan bergantung pada infrastruktur penyajian penyedia, ukuran masukan, dan jumlah keluaran yang diminta. Masukan dengan 1.000.000 token dan keluaran dengan 131.072 token kemungkinan akan memakan waktu lebih lama daripada permintaan singkat, tetapi daftar tersebut tidak memberikan hubungan yang pasti. Masukan video juga dapat memperburuk latensi karena video harus diubah menjadi token terlebih dahulu sebelum model dapat memprosesnya; fakta tidak mengukur langkah tersebut. Peninjau tidak boleh berasumsi bahwa harga per token yang rendah mengindikasikan decoding yang cepat. Satu-satunya keputusan terkait kecepatan yang didukung oleh fakta adalah menguji ukuran permintaan yang representatif di bawah beban yang Anda perkirakan. Jangan menyimpulkan kesesuaian waktu nyata dari ukuran jendela konteks atau nama model.
Kekuatan yang dinyatakan bersifat struktural. Model ini memiliki jendela konteks 1.000.000 token, output maksimum tinggi 131.072 token, serta menerima input teks, gambar, dan video. Hal ini berguna untuk aplikasi yang membutuhkan satu panggilan model untuk mengamati materi berukuran besar atau campuran sebelum menulis respons yang panjang. Keterbatasan juga lebih mudah dinyatakan dari fakta daripada kekuatan. Tidak ada tolok ukur kualitas yang dipublikasikan, sehingga akurasi, penalaran, dan keamanan tidak terdokumentasi. Tidak ada daftar terpisah untuk data pelatihan, catatan rilis, atau metodologi pembaruan di balik label 0902. Input gambar dan video tidak menjamin pemahaman visual atau temporal yang tepat. Batas konteks dan output adalah maksimum, bukan penggunaan yang disarankan; output yang sangat besar bisa mahal dengan harga $6,00 per 1.000.000 token output. Permintaan yang mengisi konteks 1.000.000 token akan menghabiskan $2,00 token input sebelum output apa pun dihasilkan, yang merupakan biaya operasional yang signifikan.
Harga satuan yang terdaftar adalah $2.00 untuk setiap 1,000,000 token masukan dan $6.00 untuk setiap 1,000,000 token keluaran. OrcaRouter menagih model dengan tarif penyedia tanpa markup, sehingga harga yang dinyatakan adalah tarif penyedia yang diteruskan. Token masukan mencakup token teks, gambar, dan video yang dikirim dalam prompt. Token keluaran adalah token respons yang dihasilkan. Pada tarif ini, 1,000,000 token masukan berharga $2.00; 1,000,000 token keluaran berharga $6.00. Permintaan yang lebih kecil berbiaya lebih rendah secara proporsional: 100,000 token masukan akan menjadi $0.20 dan 100,000 token keluaran akan menjadi $0.60, asalkan jumlah tersebut diukur oleh penyedia. Kartu model tidak mencakup harga terpisah untuk input yang di-cache, permintaan batch, atau tingkat interaktif, jadi tidak ada harga semacam itu yang boleh diasumsikan. Jumlah token yang ditagih secara tepat harus diperiksa dari respons penggunaan atau log OrcaRouter untuk setiap panggilan.
Ketika OrcaRouter mengatakan sebuah model ditagih dengan tarif penyedia tanpa markup, itu berarti OrcaRouter tidak menambahkan biaya per-token sendiri di atas tarif penyedia untuk daftar ini. Jumlah akhir untuk penggunaan token oleh karena itu harus didasarkan pada harga input $2,00 dan output $6,00 yang dinyatakan per 1.000.000 token. Itu tidak berarti tagihan akhir tidak memiliki biaya lain; pajak atau biaya tingkat akun dapat berlaku tergantung pada pengaturan Anda, tetapi tidak ada biaya semacam itu yang didokumentasikan dalam fakta-fakta ini. Ini juga tidak berarti model tersebut gratis untuk dilayani, karena tarif per-token tetap berlaku. Saat membandingkan penyedia, harga yang ditampilkan oleh OrcaRouter untuk model ini harus mewakili satuan yang sama dengan daftar ini. Jika gateway lain mengutip harga yang berbeda, perbedaannya adalah struktur penagihan, bukan perubahan pada jendela konteks model.
Manajemen biaya harus dimulai dengan panjang prompt. Karena biaya input adalah $2.00 per 1,000,000 token, setiap token tambahan akan meningkatkan biaya input, dan setiap gambar atau video yang dikirim dalam permintaan dikonversi menjadi token menggunakan aturan yang tidak disediakan dalam daftar ini. Memangkas materi sumber yang tidak relevan dapat mengurangi biaya. Harga output adalah tiga kali harga satuan input, sehingga membatasi panjang output yang diminta juga mengendalikan biaya. Model dengan batas output 131,072 token dapat menghasilkan respons yang membutuhkan biaya; pada $6.00 per 1,000,000 token, 131,072 token output akan menghabiskan biaya sekitar $0.79 hanya untuk token output. Menghasilkan token sebanyak itu tidak otomatis, karena prompt mengontrol ukuran respons. Tidak ada harga cache yang dipublikasikan untuk model ini, jadi jangan berasumsi bahwa konteks yang berulang mendapatkan diskon. Tidak adanya harga cache atau batch dalam fakta-fakta tersebut bukan bukti bahwa opsi semacam itu tidak ada; itu hanya berarti opsi tersebut bukan bagian dari daftar ini.
Qwen3.8 Max (0902) diekspos melalui API kompatibel OpenAI milik OrcaRouter. Atur base URL klien ke https://api.orcarouter.ai/v1 dan gunakan ID model yang tepat, yaitu qwen/qwen3.8-max-0902. Dengan SDK yang kompatibel dengan OpenAI, struktur permintaannya pada dasarnya sama dengan panggilan chat-completions lainnya: berikan kunci API untuk OrcaRouter, base URL di atas, dan ID model di dalam body. Jangan gunakan nama generik seperti Qwen3.8 Max atau qwen3.8; daftar tersebut mensyaratkan qwen/qwen3.8-max-0902. ID model yang sama juga harus digunakan dalam permintaan HTTP langsung ke base URL, di mana path dan payload mengikuti kontrak kompatibel OpenAI yang diekspos oleh OrcaRouter. Karena kompatibel dengan OpenAI, kode yang sudah ada untuk chat completions OpenAI biasanya dapat dimigrasikan dengan mengubah parameter base_url dan model, meskipun detail autentikasi harus sesuai dengan persyaratan OrcaRouter.
Untuk chat completion yang kompatibel dengan OpenAI, parameter seperti model, messages, dan batas token output ditangani sama seperti model kompatibel lainnya. Fakta menyebutkan output maksimum 131.072 token, jadi jika Anda menetapkan batas output, nilainya tidak boleh lebih dari 131.072; batas output default tidak disebutkan dalam fakta. Temperature, top-p, stop, dan parameter sampling lainnya tidak didokumentasikan dalam fakta model yang disediakan, jadi ikuti dokumentasi API OrcaRouter dan semantik parameter OpenAI standar. Untuk input gambar dan video, gunakan format konten multimodal yang diharapkan oleh API OrcaRouter; fakta tidak menyediakan contoh. Jika API mengembalikan error tentang nama parameter yang tidak didukung, periksa apakah SDK Anda mengirimkan parameter legacy. Jendela konteks adalah 1.000.000 token, jadi prompt harus menjaga semua token input, termasuk token gambar dan video, tetap di bawah batas tersebut. Respons dihitung secara terpisah terhadap maksimum 131.072 token.
Karena OrcaRouter menawarkan API yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1, migrasi pada dasarnya hanya perubahan konfigurasi. Ganti base URL dengan https://api.orcarouter.ai/v1, ganti kolom API key dengan kunci OrcaRouter, dan atur model ke qwen/qwen3.8-max-0902. Jika kode Anda menggunakan pustaka klien yang kompatibel dengan OpenAI, perbarui base_url dan api_key pada klien tersebut dan biarkan sebagian besar struktur pesan tetap utuh, dengan asumsi format multimodal cocok dengan model ini. Fakta yang ada tidak menyebutkan apakah model ini mendukung setiap parameter khusus OpenAI, jadi sebelum migrasi, tinjau parameter yang dikirim oleh aplikasi Anda. Selain itu, karena batas konteksnya adalah 1.000.000 dan output maksimumnya adalah 131.072, sesuaikan logika pemotongan permintaan dengan batas tersebut. Kode yang ada yang menuliskan panjang konteks maksimum yang berbeda mungkin perlu diperbarui. Terakhir, pastikan ekspektasi penanganan data aplikasi Anda selaras dengan ketentuan OrcaRouter, karena fakta model itu sendiri tidak membahas retensi data.
Dasar utama perbandingan adalah kontrak input. Qwen3.8 Max (0902) menerima teks, gambar, dan video, sehingga alternatif khusus teks akan menghilangkan modalitas tersebut. Jika beban kerja aktual Anda hanya berisi teks, model khusus teks dengan konteks yang cukup besar kemungkinan lebih cocok secara langsung dan mungkin memiliki harga yang berbeda. Fakta model tidak mencakup perbandingan akurasi atau kecepatan terhadap model lain, sehingga Anda tidak dapat memilih berdasarkan skor kualitas publik. Anda dapat membandingkan atribut struktural: alternatif khusus teks mungkin memiliki konteks yang lebih kecil, batas output yang lebih pendek, atau harga input yang lebih rendah. OrcaRouter menagih model ini sebesar $2,00 untuk input dan $6,00 untuk output per 1.000.000 token. Fakta bahwa model ini memiliki input gambar dan video hanya berguna jika input tersebut digunakan. Jika input tersebut tidak digunakan, Anda mungkin membayar untuk kapasitas multimodal yang tidak relevan dengan tugas.
Pilih Qwen3.8 Max (0902) ketika profil tugas cocok dengan fitur yang tercantum. Pertama, Anda memerlukan konteks 1.000.000 token karena materi sumber tidak dapat dipersingkat agar muat dalam jendela yang lebih kecil. Kedua, Anda memerlukan input gambar dan video dalam prompt yang sama, atau Anda memperkirakan modalitas tersebut akan digunakan dalam permintaan mendatang. Ketiga, Anda menginginkan output maksimum hingga 131.072 token. Jika beban kerja Anda tidak memiliki salah satu persyaratan tersebut, banyak manfaat dari daftar ini tidak terpakai. Jangan memilihnya hanya karena nama Max tampak kuat; daftar ini tidak menyertakan bukti benchmark. Karena OrcaRouter menyediakan model melalui API yang kompatibel dengan OpenAI yang sama, mengganti ID model sangat mudah, jadi Anda dapat menguji model ini terhadap kandidat lain pada tugas Anda sendiri. Hanya perlu diingat bahwa harga input dan output berbeda, dan tidak ada harga cache yang ditetapkan untuk model ini.
Ketika membandingkan biaya, pertama-tama normalisasikan ke basis token yang sama. Model ini menggunakan $2,00 per 1.000.000 token masukan dan $6,00 per 1.000.000 token keluaran, diteruskan langsung dari penyedia tanpa markup. Model pesaing dengan harga per token masukan yang lebih rendah sebenarnya mungkin lebih murah untuk permintaan konteks penuh, tetapi jendela konteks dan keluaran maksimum juga harus dipertimbangkan. Misalnya, permintaan 1.000.000 token dapat menggunakan konteks penuh model ini dalam satu panggilan; model dengan konteks 200.000 token akan memerlukan beberapa panggilan, dan proses keluaran atau peringkasan tambahan dapat mengubah total harga. Fakta yang diberikan tidak menyediakan nilai akurasi atau latensi yang objektif, jadi perbandingan biaya per jawaban benar apa pun harus berasal dari pengujian Anda sendiri. Periksa juga apakah model pesaing mengenakan biaya terpisah untuk token gambar atau video, karena hal tersebut tidak dijelaskan di sini. Jika ragu, jalankan beban kerja yang umum pada OrcaRouter dan bandingkan penggunaan token terukur serta kualitas respons daripada hanya mengandalkan harga yang tercantum.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Input / 1M token | $2.00 |
| Output / 1M token | $6.00 |
| Baca cache / 1M | $0.250 |
| Tulis cache / 1M | $2.50 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/qwen/qwen3.8-max-0902Buka @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902