qwen/qwen3.5-flash

qwen/qwen3.5-flash
VisiAlatJSONPenalaran
oleh qwen

Qwen3.5 Flash — obrolan multimodal (teks/gambar/video) dioptimalkan untuk biaya, konteks 1M.

ctx1M token
Output maks65K
Masukantext + image + video
Keluarantext
p50 TTFT2.71 s
INPUT$0.10/ 1M token
OUTPUT$0.40/ 1M token
p50 TTFT2.71 s7h
p95 TTFT10.00 s7h
LALU LINTAS1.3Mtoken / 7h

Qwen3.5 Flash adalah model bahasa multimodal dari keluarga Qwen, yang dirancang untuk inferensi cepat dan biaya rendah. Model ini menerima input teks, gambar, dan video serta menghasilkan respons…

Apa itu Qwen3.5 Flash?

Untuk siapa model ini?

Spesifikasi utama sekilas

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.5-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • enable_search
  • enable_thinking
  • include_reasoning
  • logprobs
  • max_tokens
  • n
  • parallel_tool_calls
  • presence_penalty
  • reasoning
  • repetition_penalty
  • response_format
  • seed
  • stop
  • stream
  • stream_options
  • temperature
  • thinking_budget
  • tool_choice
  • tools
  • top_k
  • top_logprobs
  • top_p

Harga

Input / 1M token$0.100
Output / 1M token$0.400
Mata uangUSD

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $1.90

Perkiraan berdasarkan harga daftar

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.000202

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
2.71 s
Kecepatan output
206 tok/s
p95 TTFT
10.00 s
Tingkat kesalahan
7.3%

Benchmark publik

Sumber: Design Arena

Perbincangan komunitas

Yang dibicarakan developer minggu ini

Hacker News0 sebutan · 7 hr

Perbandingan

qwen/qwen3.5-flashQwen3.8 Maxqwen/qwen3-max-previewQwen3.5 397B A17B
Input $/M$0.10$2.00$0.86$0.17
Output $/M$0.40$6.00$3.44$1.03
Konteks1.0M1.0M262K33K
Kualitas6/109/108/108/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya untuk menggunakan Qwen3.5 Flash di OrcaRouter?
Biayanya adalah $0.10 per 1 juta token input dan $0.40 per 1 juta token output. Ini adalah tarif penyedia dengan markup nol oleh OrcaRouter. Anda membayar persis seperti yang ditagihkan penyedia, tanpa biaya tambahan.
Berapa ukuran jendela konteksnya?
Jendela konteks adalah 1.048.576 token (sekitar 1 juta token). Ini mencakup token masukan dan keluaran di seluruh riwayat percakapan. Output maksimum per generasi adalah 65.536 token.
Apa kelebihan dari Qwen3.5 Flash?
Kelebihannya meliputi input multimodal (teks, gambar, video), jendela konteks yang sangat besar yaitu 1M, output panjang hingga 65K token, biaya per token yang rendah, serta inferensi cepat dibandingkan model Qwen yang lebih besar. Model ini ideal untuk tugas multimodal dengan volume tinggi atau real-time.
Bagaimana perbandingannya dengan model Qwen yang lebih besar?
Model Qwen yang lebih besar seperti Qwen3.5-72B menawarkan akurasi yang lebih tinggi pada penalaran kompleks tetapi lebih lambat dan lebih mahal. Qwen3.5 Flash mengorbankan sebagian akurasi untuk kecepatan dan efisiensi biaya, sambil mempertahankan kemampuan multimodal dan konteks panjang yang sama.
Apakah OrcaRouter melakukan markup pada harga penyedia?
Tidak. Harga diteruskan sesuai tarif penyedia tanpa markup. Anda membayar tepat $0.10 per 1M token input dan $0.40 per 1M token output untuk Qwen3.5 Flash melalui OrcaRouter.
Bisakah saya memanggil Qwen3.5 Flash menggunakan API yang kompatibel dengan OpenAI?
Ya. OrcaRouter menyediakan endpoint yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1. Gunakan ID model "qwen/qwen3.5-flash" dengan kunci API OrcaRouter Anda. Format permintaan dan respons sesuai dengan API chat completions OpenAI.
Bagaimana cara penanganan data bekerja dengan OrcaRouter?
Kebijakan penanganan data ditentukan oleh OrcaRouter dan Qwen. Entri katalog tidak memberikan rincian spesifik. Pengguna harus meninjau kebijakan privasi OrcaRouter dan ketentuan penggunaan data Qwen sebelum mengirim data sensitif.
Apa saja modalitas yang didukung oleh model ini?
Mendukung input teks, gambar, dan video. Gambar dapat disediakan sebagai URL atau data base64 dalam pesan pengguna. Input video biasanya dikirim sebagai urutan frame (gambar). Model hanya menghasilkan output teks.
Apakah ada jumlah minimum atau maksimum token yang diperlukan?
Tidak ada jumlah token minimum. Token input maksimum (termasuk riwayat percakapan) adalah 1.048.576 token. Token output maksimum per respons adalah 65.536. Gunakan parameter max_tokens untuk mengontrol panjang output.
Bagaimana cara memulai memanggil model ini melalui OrcaRouter?
Daftar ke OrcaRouter untuk mendapatkan kunci API. Atur URL dasar ke https://api.orcarouter.ai/v1 di kode Anda. Gunakan ID model "qwen/qwen3.5-flash" dan kirim permintaan penyelesaian obrolan standar dengan konten multimodal Anda. Lihat dokumentasi OrcaRouter untuk contoh.

Sematkan lencana ini

qwen/qwen3.5-flash$0.10/M in2705ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.5-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg" alt="qwen/qwen3.5-flash di OrcaRouter" /> </a>
Markdown [![qwen/qwen3.5-flash](https://www.orcarouter.ai/embed/qwen/qwen3.5-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.5-flash)

Kartu model sebagai data

GET /api/public/models/qwen/qwen3.5-flashBuka