Qwen3-VL 8B Thinking — model penalaran visi-bahasa kecil dengan bobot terbuka, 8B parameter, konteks 128k.
Qwen3 VL 8B Thinking adalah model bahasa multimodal dengan 8 miliar parameter yang dikembangkan oleh tim Qwen di Alibaba Cloud, dihosting di OrcaRouter dengan penyedia qwen. Model ini termasuk dalam…
Qwen3 VL 8B Thinking unggul dalam menjawab pertanyaan visual, terutama ketika pertanyaan melibatkan banyak objek, hubungan spasial, atau teks yang tertanam dalam gambar (misalnya, rambu jalan, tanda terima). Ia juga dapat menangani tugas pemahaman video, seperti merangkum klip pendek, mengidentifikasi tindakan, atau menjawab pertanyaan tentang stempel waktu tertentu. Analisis dokumen adalah kasus penggunaan yang kuat: mengekstrak informasi dari PDF yang berisi teks dan bagan, atau dari formulir yang dipindai. Jendela konteksnya yang panjang membuatnya cocok untuk memproses dokumen besar (misalnya, PDF 100+ halaman) dengan sisipan gambar sesekali, selama total input yang ditokenisasi tetap di bawah 131K.
Jika kasus penggunaan Anda murni berbasis teks dan tidak melibatkan gambar atau video, model khusus teks saja (misalnya, Qwen3-8B atau varian Llama dengan ukuran serupa) kemungkinan akan lebih hemat biaya. Model multimodal menimbulkan overhead tambahan untuk mengodekan masukan visual, dan harga per token untuk Qwen3 VL 8B Thinking ($0.18 input, $2.10 output per juta token) mungkin lebih tinggi daripada banyak alternatif teks saja. Selain itu, jika tugas Anda adalah klasifikasi atau ekstraksi sederhana dari gambar yang sangat pendek, model visi-bahasa yang lebih kecil dengan latensi dan biaya lebih rendah (misalnya, Qwen2 VL 2B) mungkin sudah memadai tanpa mengorbankan kinerja.
Ya, model dapat menerima beberapa gambar yang diselingi dengan teks dalam satu panggilan API, selama jumlah total token (token gambar ditambah token teks) tetap berada dalam jendela konteks 131.072. Setiap gambar dikodekan menjadi sejumlah token yang bervariasi tergantung pada resolusi dan kompleksitasnya. API kompatibel OpenAI milik OrcaRouter memungkinkan Anda mengirim beberapa URL gambar atau gambar yang dienkode base64 dalam array konten. Tidak ada batasan keras pada jumlah gambar selain batasan konteks. Untuk video, Anda biasanya akan mengekstrak bingkai kunci dan mengirimkannya sebagai gambar terpisah bersama dengan perintah teks.
Seperti semua model multimodal, Qwen3 VL 8B Thinking mungkin saja menghasilkan detail yang bersifat halusinasi dalam gambar atau video, terutama pada resolusi rendah atau konten yang ambigu. Model ini tidak dirancang untuk streaming video secara real-time; model ini memproses kumpulan frame statis. Ukuran parameter 8B berarti akurasinya mungkin lebih rendah pada domain yang sangat terspesialisasi (misalnya, pencitraan medis, citra satelit) dibandingkan dengan model yang lebih besar (misalnya, model visi-bahasa 70B-100B+). Model ini tidak mendukung masukan audio. Proses berpikir dapat memperpanjang panjang keluaran, jadi sesuaikan anggaran untuk token keluaran. Terakhir, model ini dioptimalkan untuk bahasa Inggris tetapi dapat menangani bahasa lain dengan tingkat efektivitas yang bervariasi.
Skor benchmark spesifik untuk Qwen3 VL 8B Thinking pada evaluasi multimodal standar (misalnya, MMMU, MathVista, VideoMME) belum tersedia dalam fakta yang ada. Pengguna disarankan untuk berkonsultasi dengan kartu model resmi Qwen atau makalah penelitian untuk hasil akhir yang dipublikasikan. Secara umum, seri Qwen3 VL telah menunjukkan kinerja yang kompetitif pada tugas-tugas penglihatan-bahasa dibandingkan dengan model parameter 7B-8B lainnya. Varian "Thinking" diharapkan dapat meningkatkan benchmark yang membutuhkan penalaran tinggi seperti visual chain-of-thought. Tanpa skor publik, disarankan untuk menguji model pada dataset representatif Anda sendiri untuk mengevaluasi kesesuaiannya.
Data latensi untuk model spesifik ini pada infrastruktur OrcaRouter belum diungkapkan. Sebagai aturan umum, model multimodal dengan 8B parameter akan memiliki latensi yang lebih tinggi daripada model teks murni dengan ukuran yang sama karena encoding visual. Input video meningkatkan latensi lebih lanjut karena pemrosesan frame tambahan. Pada kluster GPU berkinerja tinggi (mis., A100, H100), waktu-ke-token-pertama tipikal untuk model 8B berada dalam kisaran beberapa ratus milidetik hingga beberapa detik, tergantung pada panjang input dan ukuran batch. Kecepatan generasi token output biasanya diukur dalam puluhan token per detik. Nilai-nilai ini bersifat kualitatif; kinerja aktual tergantung pada provisioning dan beban OrcaRouter saat ini.
Kekuatan: Model ini menangani konteks multimodal yang panjang (131K token), memungkinkan keluaran besar (hingga 40K token), dan memproses tiga jenis masukan. Kemampuan berpikirnya meningkatkan penalaran pada tugas yang memerlukan deduksi langkah demi langkah. Harganya kompetitif untuk model multimodal 8B. Keterbatasan: Model ini belum diuji tolok ukur terhadap model perbatasan terbaru di banyak papan peringkat publik. Throughput keluaran maksimumnya mungkin lebih rendah daripada model yang lebih kecil. Model ini tidak dioptimalkan untuk pembuatan gambar kreatif (hanya menghasilkan teks). Pengguna tidak boleh menganggap tidak ada halusinasi dalam tugas visual. Pemrosesan video terbatas pada ekstraksi berbasis frame, bukan analisis berkelanjutan.
Qwen3 VL 8B Thinking dikenakan biaya per token sesuai tarif penyedia tanpa markup. Token input berharga $0,18 per 1 juta token. Token output berharga $2,10 per 1 juta token. Tidak ada biaya infrastruktur tambahan, tidak ada biaya dasar per permintaan, dan tidak ada langganan bulanan. Harga berlaku sama untuk semua modalitas input (teks, gambar, video); setiap modalitas ditokenisasi dan dikenakan biaya sesuai tarif input. OrcaRouter tidak membebankan biaya tambahan di atas tarif yang disebutkan. Sebagai contoh, memproses gambar yang ditokenisasi menjadi 2.000 token input akan dikenakan biaya 2.000 * ($0,18 / 1M) = $0,00036 dalam biaya input. Biaya output dihitung dengan cara yang sama.
Setiap gambar dikodekan menjadi sejumlah token yang bervariasi berdasarkan dimensi dan tingkat kompresinya. Gambar resolusi tinggi mungkin menghabiskan ribuan token. Video ditangani dengan mengekstrak bingkai (biasanya satu bingkai per beberapa detik) dan mengodekan setiap bingkai sebagai gambar; oleh karena itu biaya token meningkat secara linear sesuai durasi video dan kecepatan bingkai. Pengguna dapat mengendalikan biaya dengan mengubah ukuran gambar atau mengurangi jumlah bingkai. Tidak ada biaya terpisah untuk mengodekan media selain biaya token. Biaya keluaran hanya bergantung pada jumlah token teks yang dihasilkan. Untuk video panjang, token masukan dapat dengan cepat mendekati batas 131K, meningkatkan biaya per permintaan.
Berdasarkan informasi yang diberikan, tidak ada diskon untuk penggunaan batch atau komitmen pembayaran di muka. OrcaRouter saat ini tidak menawarkan caching token yang dapat mengurangi biaya untuk perintah atau gambar yang berulang. Semua permintaan ditagih per token secara real time dengan tarif standar. Jika penyedia (qwen) memperkenalkan harga berjenjang diskon di masa depan, OrcaRouter akan meneruskan penghematan tersebut tanpa markup. Pengguna disarankan untuk memantau halaman harga OrcaRouter untuk pembaruan apa pun. Untuk kasus penggunaan volume tinggi, pertimbangkan untuk bekerja langsung dengan OrcaRouter untuk mendiskusikan kemungkinan harga volume.
Dibandingkan dengan model multimodal yang lebih besar (mis., GPT-4V, Gemini 1.5 Pro), Qwen3 VL 8B Thinking secara signifikan lebih murah per token: model-model tersebut sering kali berharga $2–$10+ per juta token masukan. Di antara model visi-bahasa dengan parameter 7B-8B, model ini sejalan dengan harga tipikal (Qwen2 VL 7B kira-kira $0.10–$0.20 masukan, $1–$2 keluaran). Biaya token keluaran ($2.10 per juta) lebih tinggi dibandingkan beberapa model teks murni 8B (mis., $0.20 per juta keluaran), mencerminkan overhead penalaran yang ditambahkan. Jika Anda dapat menggunakan model yang lebih kecil (mis., parameter 2B–4B), biaya dapat 50–90% lebih rendah, tetapi dengan kemampuan yang berkurang.
Anda memanggil Qwen3 VL 8B Thinking dengan mengirimkan permintaan POST ke endpoint OpenAI-compatible milik OrcaRouter di https://api.orcarouter.ai/v1/chat/completions. Atur parameter model menjadi "qwen/qwen3-vl-8b-thinking". Sertakan kunci API Anda di header Authorization sebagai "Bearer <key>". Badan permintaan mengikuti skema chat completions OpenAI. Untuk input multimodal, struktur konten pesan sebagai array objek: satu dengan tipe "text" untuk teks perintah, dan satu dengan tipe "image_url" untuk setiap gambar (dengan URL atau data base64). Video dapat dikirim sebagai beberapa entri image_url yang mewakili frame. Respons mengikuti struktur OpenAI standar dengan semua teks yang dihasilkan dalam array choices.
Semua parameter penyelesaian obrolan OpenAI standar didukung: temperature (0–2, default 1.0), top_p (0–1, default 1.0), max_tokens (hingga 40960), urutan berhenti (stop sequences), frequency_penalty, presence_penalty, logprobs, dan n (jumlah penyelesaian). Model tidak mendukung streaming? OrcaRouter kemungkinan mendukung streaming saat streaming=true diatur; periksa dokumentasi penyedia. Parameter tools (function calling) mungkin didukung jika penyedia yang mendasarinya mengaktifkannya; saat ini tidak dijamin. System prompt diizinkan. User IDs dapat dilewatkan untuk pemantauan. Pastikan Anda tetap berada dalam jendela konteks 131072 token dengan memantau jumlah token sebelum mengirim.
Jika Anda saat ini menggunakan model yang sama dari penyedia API yang berbeda (misalnya, langsung dari Alibaba Cloud), migrasi ke OrcaRouter cukup mudah: ubah URL dasar menjadi https://api.orcarouter.ai/v1, perbarui string model menjadi "qwen/qwen3-vl-8b-thinking", dan ganti kunci API dengan kunci API OrcaRouter. Tidak ada perubahan kode lain yang diperlukan karena OrcaRouter menggunakan antarmuka yang kompatibel dengan OpenAI yang sama persis. Perlu diketahui bahwa penggunaan token dan harga akan didasarkan pada tarif OrcaRouter (yang diteruskan tanpa markup). Anda mungkin perlu menyesuaikan alat pemantauan biaya Anda untuk mencerminkan harga baru.
Streaming tersedia melalui API OrcaRouter. Atur parameter stream ke true dalam permintaan Anda. Respons akan berupa aliran Server-Sent Events (SSE) dengan delta dari token yang dihasilkan. Ini berguna untuk tampilan real-time. Perhatikan bahwa untuk varian "Thinking", proses berpikir dapat menyebabkan penundaan lebih lama sebelum token pertama, tetapi streaming akan tetap mengirim token secara bertahap saat dihasilkan. Format aliran mengikuti spesifikasi streaming OpenAI, dengan event bertipe "chat.completion.chunk". Setiap chunk berisi delta dengan konten atau peran token.
Qwen3 VL 8B Thinking adalah penerus dari Qwen2 VL 7B, dengan jumlah parameter yang kurang lebih sama (8B vs 7B) namun arsitektur yang lebih baik untuk konteks yang lebih panjang (131K vs 32K untuk Qwen2 VL 7B). Model ini juga menambahkan kemampuan "Thinking" untuk penalaran langkah demi langkah, yang tidak ada di Qwen2 VL. Panjang output maksimum meningkat dari 2048 token (Qwen2 VL 7B) menjadi 40960 token. Harga untuk Qwen3 VL 8B Thinking sedikit lebih tinggi per token dibandingkan Qwen2 VL 7B (yang biayanya sekitar $0.15 input, $1.80 output per juta token), mencerminkan kemampuan tambahan dan konteks yang lebih besar. Pengguna yang melakukan upgrade dapat mengharapkan performa yang lebih baik pada tugas penalaran yang kompleks.
GPT-4o mini adalah model multimodal andalan dari OpenAI dengan jendela konteks 128K. Jumlah parameternya jauh lebih besar (tidak diketahui, tetapi diperkirakan >70B) dan umumnya mencapai akurasi yang lebih tinggi pada tolok ukur standar. Namun, Qwen3 VL 8B Thinking jauh lebih murah: GPT-4o mini berbiaya $0,15 per juta token input dan $0,60 per juta token output, yang ternyata lebih rendah dari input $0,18 dan output $2,10 milik Qwen3? Tunggu, periksa: input GPT-4o mini $0,15, output $0,60 — lebih murah dari Qwen3 VL 8B Thinking? Sebenarnya output-nya jauh lebih murah. Jadi biaya tidak lebih rendah di semua sisi. Tapi Qwen3 mendukung video dan output yang lebih panjang (40960 vs 16384 untuk GPT-4o mini). Jendela konteksnya serupa. Pilihan tergantung pada akurasi yang dibutuhkan dan anggaran; Qwen3 cocok untuk output yang sangat panjang dan deployment sumber terbuka.
Llama 3.2 11B Vision adalah model multimodal dengan 11B parameter, jendela konteks 128K, dan output maksimal 8K token. Qwen3 VL 8B Thinking memiliki jumlah parameter yang lebih kecil tetapi output maksimal yang jauh lebih besar (40960 vs 8000) dan mencakup kemampuan berpikir. Keduanya mendukung input teks dan gambar, tetapi Llama 3.2 11B tidak mendukung video secara native. Harga Llama melalui penyedia layanan serupa, sekitar $0,15–$0,20 per input, $0,60–$1,00 per output per juta token, menjadikan Qwen3 lebih mahal pada output. Untuk tugas yang membutuhkan teks yang sangat panjang (misalnya, penulisan laporan dari video), Qwen3 lebih cocok. Untuk tugas yang lebih pendek dan sensitif terhadap biaya, Llama 3.2 11B mungkin lebih disukai.
Gemini 1.5 Flash adalah model multimodal yang cepat, efisien dalam biaya dengan jendela konteks 1M (hingga 2M), mendukung gambar, video, dan audio. Harganya lebih murah daripada Qwen3 VL 8B Thinking (biaya input Gemini Flash $0,075, output $0,30 per juta token) dan lebih cepat. Namun, Qwen3 VL 8B Thinking menawarkan proses berpikir yang dapat meningkatkan penalaran pada tugas visual yang menantang, dan output maksimumnya jauh lebih besar (40K vs 8K untuk Gemini Flash). Jika aplikasi Anda memerlukan penalaran langkah demi langkah dan output yang panjang, Qwen3 adalah pilihan yang lebih baik. Untuk throughput tinggi dan latensi rendah, Gemini Flash biasanya unggul. Selain itu, Qwen3 mungkin lebih disukai ketika kedaulatan data memerlukan penyebaran yang di-host sendiri atau agnostik penyedia.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-8b-thinking",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.180 |
| Output / 1M token | $2.10 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/qwen/qwen3-vl-8b-thinkingBuka @misc{orcarouter_qwen3_vl_8b_thinking,
title = {Qwen3 VL 8B Thinking API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking}
}Qwen. (2025). Qwen3 VL 8B Thinking API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking