Qwen3.5 Flash — obrolan multimodal (teks/gambar/video) dioptimalkan untuk biaya, konteks 1M.
Qwen3.5 Flash adalah model bahasa multimodal dari keluarga Qwen, yang dirancang untuk inferensi cepat dan biaya rendah. Model ini menerima input teks, gambar, dan video serta menghasilkan respons…
Qwen3.5 Flash menerima teks, gambar (termasuk beberapa gambar per permintaan), dan masukan video. Untuk video, model dapat memproses bingkai atau seluruh berkas video hingga batas konteks. Model ini memproses modalitas-modalitas ini bersama-sama dalam satu panggilan API, memungkinkan tugas-tugas seperti mendeskripsikan adegan video, menjawab pertanyaan tentang gambar, atau menggabungkan instruksi teks dengan konten visual. Panjang video tepat yang didukung bergantung pada ekstraksi bingkai dan penganggaran token dalam jendela konteks 1M.
Model ini unggul dalam tugas yang memerlukan konteks besar dan input multimodal. Contohnya termasuk merangkum transkrip video panjang, mengekstrak data terstruktur dari dokumen pindaian dengan gambar, dan membangun agen percakapan yang merujuk pada konteks visual. Model ini juga efektif untuk pemrosesan batch throughput tinggi, di mana biaya rendah per token (terutama input) membuatnya ekonomis untuk jutaan kueri. Untuk tugas teks saja yang sederhana, model khusus teks yang lebih murah mungkin lebih hemat biaya.
Untuk tugas yang murni berbasis teks dan tidak memerlukan kemampuan multimodal, model yang lebih kecil atau khusus teks dengan harga lebih rendah mungkin lebih hemat biaya. Qwen3.5 Flash memiliki keunggulan dalam kemampuan multimodal dan konteks panjang; jika aplikasi Anda hanya membutuhkan penyelesaian teks pendek, model seperti text-davinci atau varian Qwen yang lebih kecil dapat menghemat biaya. Demikian pula, jika Anda tidak membutuhkan konteks 1M penuh, model dengan jendela yang lebih kecil dapat mengurangi latensi dan biaya.
Penunjukan 'Flash' menunjukkan bahwa model ini mengorbankan beberapa akurasi tolok ukur untuk inferensi yang lebih cepat dan biaya komputasi yang lebih rendah. Dibandingkan dengan model Qwen yang lebih besar (misalnya, Qwen3.5-72B), model ini menggunakan arsitektur yang lebih efisien dengan parameter yang lebih sedikit. Skor tolok ukur dipublikasikan oleh Qwen tetapi tidak disediakan dalam entri katalog ini. Dalam praktiknya, model ini berkinerja kompetitif dalam tugas pemahaman multimodal sambil mempertahankan latensi yang lebih rendah per permintaan, sehingga cocok untuk aplikasi real-time.
Latensi tergantung pada ukuran input, panjang output, dan beban server. Karena Qwen3.5 Flash dirancang untuk kecepatan, biasanya mengembalikan respons lebih cepat daripada model yang lebih besar seperti Qwen3.5-72B untuk jumlah token yang setara. Angka pasti token per detik tidak disediakan dalam katalog. Pengguna dapat menguji kinerja melalui endpoint OrcaRouter untuk mengukur latensi di dunia nyata untuk kasus penggunaan spesifik mereka. Jendela konteks 1M dapat memperkenalkan overhead pemrosesan untuk input yang sangat panjang.
Kekuatan termasuk input multimodal, konteks yang sangat besar, 65K token output, dan biaya rendah per token. Model ini menangani dokumen panjang dan video dengan baik. Keterbatasan: model ini tidak paling akurat dalam penalaran kompleks atau tugas matematika dibandingkan dengan model frontier yang lebih besar. Model ini juga mungkin kesulitan dengan instruksi multi-langkah yang bernuansa. Untuk tugas di mana kualitas output terdepan sangat penting, pertimbangkan model Qwen yang lebih besar atau kelas GPT-4o. Arsitektur 'Flash' mengutamakan throughput dan biaya daripada akurasi puncak.
Biaya layanan adalah $0,10 per 1 juta token input (token teks, gambar, atau video) dan $0,40 per 1 juta token output. Tarif ini ditagih sesuai tarif penyedia tanpa markup oleh OrcaRouter. Tidak ada biaya tambahan untuk gateway API. Harga ini diteruskan secara langsung, artinya pengguna akhir membayar sama seperti jika memanggil API penyedia sendiri, tanpa biaya tambahan OrcaRouter. Penghitungan token mengikuti tokenisasi standar untuk setiap modalitas.
Harga token input ($0.10/1M) sangat kompetitif di antara model multimodal. Misalnya, banyak model multimodal besar mengenakan biaya $2-10 per juta token input. Harga output ($0.40/1M) juga rendah. Namun, karena model memiliki jendela konteks 1M, memproses input yang sangat panjang dapat menghasilkan biaya total tinggi meskipun tarif per token rendah. Pengguna harus menyeimbangkan panjang konteks dengan jumlah permintaan. Untuk input pendek, model yang lebih kecil mungkin menawarkan biaya absolut yang lebih rendah.
Entri katalog tidak menyebutkan apakah caching tersedia untuk Qwen3.5 Flash di OrcaRouter. Pengguna harus berkonsultasi dengan dokumentasi OrcaRouter untuk detail tentang fitur prompt caching atau response caching. Jika caching tidak didukung, input identik yang berulang akan dikenakan biaya token penuh setiap kali. Untuk pemrosesan batch, pertimbangkan untuk mendeduplikasi input atau menggunakan cache lokal guna mengurangi panggilan API. Harga tetap mengikuti tarif penyedia tanpa markup terlepas dari status caching.
Gunakan endpoint yang kompatibel dengan OpenAI di https://api.orcarouter.ai/v1. Atur parameter model menjadi "qwen/qwen3.5-flash" dalam permintaan Anda. Sediakan kunci API dari OrcaRouter. Format permintaan sesuai dengan API chat completions OpenAI, mendukung peran (system, user, assistant) dan konten multimodal menggunakan array "content" dengan "type": "image_url" atau "type": "text". Untuk video, Anda mungkin perlu mengekstrak frame dan mengirimkannya sebagai gambar. Lihat dokumentasi OrcaRouter untuk panduan penanganan video yang tepat.
Parameter standar kompatibel OpenAI: temperature, top_p, max_tokens (hingga 65536), stop sequences, presence_penalty, frequency_penalty, dan seed. Parameter max_tokens dibatasi hingga 65536 untuk menyesuaikan dengan output maksimal model. Model mendukung streaming melalui stream: true. Anda juga dapat menetapkan ID pengguna untuk pelacakan. Untuk permintaan multimodal, sertakan konten gambar atau video dalam pesan pengguna. Model menerima hingga jendela konteks sebanyak 1,048,576 token total di semua giliran.
Jika Anda sudah menggunakan SDK Python OpenAI, ubah base_url menjadi https://api.orcarouter.ai/v1 dan perbarui nama model menjadi "qwen/qwen3.5-flash". Autentikasi menggunakan kunci API OrcaRouter, bukan kunci OpenAI. Struktur permintaan dan responsnya identik. Untuk migrasi dari penyedia lain, gunakan format chat completions. Pastikan prompt sistem dan konten multimodal Anda diformat sesuai dengan konvensi OpenAI. Tidak diperlukan perubahan kode selain endpoint dan nama model.
Ya, API OrcaRouter mendukung pesan sistem, pesan pengguna, dan pesan asisten dalam percakapan multi-giliran. Riwayat percakapan penuh dihitung terhadap jendela konteks 1.048.576 token. Model memproses konten multimodal dalam pesan pengguna. Untuk video, Anda dapat mengirim beberapa bingkai sebagai gambar dalam satu pesan pengguna. Model mempertahankan konteks antar giliran, sehingga Anda dapat memiliki interaksi yang diperluas dengan riwayat yang panjang, asalkan total token tetap di bawah batas.
Qwen3.5 Flash adalah alternatif yang lebih kecil, lebih cepat, dan lebih murah dibandingkan dengan model Qwen yang lebih besar seperti Qwen3.5-72B atau Qwen3.5-32B. Model ini mengorbankan sedikit akurasi benchmark demi latensi dan biaya yang lebih rendah. Ia mendukung input multimodal yang sama dan jendela konteks besar (1M) seperti saudara-saudaranya yang lebih besar. Untuk tugas-tugas yang memerlukan penalaran mutakhir, model yang lebih besar lebih disukai. Untuk aplikasi volume tinggi atau real-time di mana kecepatan dan biaya lebih penting, Flash adalah pilihan yang lebih baik.
GPT-4o menawarkan akurasi yang lebih tinggi pada banyak tolok ukur penalaran dan multimodal, tetapi dengan harga yang jauh lebih mahal (biasanya $2.50 per juta token input untuk GPT-4o dan $0.15 untuk GPT-4o mini). Qwen3.5 Flash lebih murah ($0.10 per input) dan memiliki jendela konteks yang lebih besar (1M vs 128K untuk GPT-4o). Batas token outputnya (65K) juga melebihi GPT-4o mini (16K). Untuk aplikasi yang sensitif terhadap biaya dengan input yang sangat panjang, Qwen3.5 Flash mungkin lebih ekonomis sambil tetap memberikan pemahaman multimodal yang baik.
Claude 3 Haiku dan Gemini 1.5 Flash adalah model 'flash' yang serupa. Claude 3 Haiku hanya teks dan dihargai $0.25 per juta token input. Gemini 1.5 Flash mendukung input multimodal dan memiliki jendela konteks 1M, dihargai $0.075 per juta token input. Dukungan multimodal Qwen3.5 Flash dan konteks 1M menempatkannya di tingkat yang serupa, dengan harga output ($0.40/1M) lebih tinggi dari Gemini Flash ($0.30/1M) tetapi lebih rendah dari Haiku ($1.25/1M). Performa tolok ukur bervariasi berdasarkan tugas.
OrcaRouter menampung model open-source seperti Llama 3.1 8B dan Mistral 7B. Qwen3.5 Flash adalah model proprietary, tetapi bersaing dalam hal biaya dan kemampuan. Model open-source seringkali memiliki biaya per-token yang lebih rendah atau tidak ada (Anda hanya membayar untuk komputasi), tetapi mungkin memerlukan lebih banyak rekayasa untuk diatur. Qwen3.5 Flash menawarkan API terkelola dengan markup nol, jendela konteks 1M, dan dukungan multimodal yang tidak dimiliki sebagian besar model open-source. Ini adalah jalan tengah yang baik antara fleksibilitas open-source dan kualitas proprietary.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.5-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Input / 1M token | $0.100 |
| Output / 1M token | $0.400 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
Yang dibicarakan developer minggu ini
GET /api/public/models/qwen/qwen3.5-flashBuka @misc{orcarouter_qwen3_5_flash,
title = {qwen/qwen3.5-flash API},
author = {qwen},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-flash}
}qwen. (n.d.). qwen/qwen3.5-flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-flash