Qwen3 VL 8B Thinking

qwen/qwen3-vl-8b-thinking
VisiAlatJSONPenalaran
oleh Qwen · 2025-10-14

Qwen3-VL 8B Thinking — model penalaran visi-bahasa kecil dengan bobot terbuka, 8B parameter, konteks 128k.

ctx131.1K token
Output maks41K
Masukantext + image + video
Keluarantext
p50 TTFT7.50 s
INPUT$0.18/ 1M token
OUTPUT$2.10/ 1M token
p50 TTFT7.50 s7h
p95 TTFT10.00 s7h
LALU LINTAS14.3Ktoken / 7h

Qwen3 VL 8B Thinking adalah model bahasa multimodal dengan 8 miliar parameter yang dikembangkan oleh tim Qwen di Alibaba Cloud, dihosting di OrcaRouter dengan penyedia qwen. Model ini termasuk dalam…

Apa itu Qwen3 VL 8B Thinking?

Siapa yang harus menggunakan model ini?

Apa modalitas yang didukungnya?

Bagaimana varian 'Thinking' berbeda dari Qwen3 VL standar?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key="$ORCAROUTER_API_KEY",
)

response = client.chat.completions.create(
    model="qwen/qwen3-vl-8b-thinking",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Harga

Input / 1M token$0.180
Output / 1M token$2.10
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $7.56

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.001053

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
7.50 s
Kecepatan output
916 tok/s
p95 TTFT
10.00 s
Tingkat kesalahan
0%

Benchmark publik

Sumber: Design Arena

Perbandingan

Qwen3 VL 8B Thinkingqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Input $/M$0.18$0.86$0.17$0.12
Output $/M$2.10$3.44$1.03$0.69
Konteks131K262K33K1.0M
Kualitas4/108/108/108/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya per juta token untuk Qwen3 VL 8B Thinking di OrcaRouter?
Token masukan: $0.18 per 1 juta token. Token keluaran: $2.10 per 1 juta token. Ini adalah tarif penyedia yang diteruskan tanpa markup.
Apa itu jendela konteks dan jumlah token output maksimum?
Jendela konteks adalah 131,072 token. Token output maksimum adalah 40,960 token.
Apa kelebihan utama dari model ini?
Ini menangani tiga modalitas input (teks, gambar, video), menawarkan konteks dan panjang output yang besar, serta menyertakan kemampuan berpikir (rantai pemikiran) yang meningkatkan kinerja pada tugas penalaran yang kompleks.
Bagaimana model ini dibandingkan dengan Qwen2 VL 7B?
Memiliki konteks yang lebih besar (131K vs 32K), output maksimal yang lebih besar (40K vs 2K), dan menambahkan kemampuan berpikir. Harganya sedikit lebih tinggi tetapi menawarkan penalaran yang lebih baik dan pemahaman multimodal.
Apakah OrcaRouter menyimpan cache data pengguna saat menggunakan model ini?
OrcaRouter tidak melaporkan adanya mekanisme penyimpanan sementara (caching) yang menyimpan prompt atau gambar; penanganan data mengikuti praktik API standar. Konsultasikan kebijakan privasi OrcaRouter untuk detail lebih lanjut.
Bagaimana cara memanggil model ini melalui API yang kompatibel dengan OpenAI?
Kirim POST ke https://api.orcarouter.ai/v1/chat/completions dengan model "qwen/qwen3-vl-8b-thinking" dan kunci API Anda. Gunakan array konten dengan entri teks dan image_url untuk input multimodal.
Apakah model dapat memproses input video?
Ya, video diterima dengan mengirim frame yang diekstrak sebagai entri image_url terpisah. Model tidak memiliki dukungan codec video asli; ia bekerja pada kumpulan frame statis.
Apakah ada batasan jumlah gambar per permintaan?
Tidak, kecuali jumlah total token (termasuk token teks dan gambar) harus berada dalam batas konteks 131.072. Tidak ada batas gambar terpisah.
Bahasa pemrograman atau pustaka apa yang bisa saya gunakan untuk mengakses model ini melalui OrcaRouter?
Bahasa apa pun yang mendukung permintaan HTTP dan format API OpenAI. Python dengan pustaka openai, JavaScript dengan fetch, dll. Cukup atur URL dasar dan ID model.
Apakah varian berpikir selalu mengembalikan penalaran rantai pemikiran?
Model secara internal menggunakan penalaran langkah demi langkah sebelum menghasilkan jawaban akhir, tetapi output yang Anda lihat adalah respons lengkap. Anda tidak dapat mengekstrak token pemikiran antara secara terpisah.

Sematkan lencana ini

Qwen: Qwen3 VL 8B Thinking$0.18/M in7500ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg" alt="Qwen: Qwen3 VL 8B Thinking di OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3 VL 8B Thinking](https://www.orcarouter.ai/embed/qwen/qwen3-vl-8b-thinking.svg)](https://www.orcarouter.ai/models/qwen/qwen3-vl-8b-thinking)

Kartu model sebagai data

GET /api/public/models/qwen/qwen3-vl-8b-thinkingBuka