Qwen3-VL 235B-A22B Instruct — model visi-bahasa dengan bobot terbuka, 235B total / 22B parameter aktif, 256k konteks, tanpa mode berpikir.
Qwen3 VL 235B A22B Instruct adalah varian vision-language dari seri model Qwen3, yang dibangun oleh Alibaba Cloud. Model ini menggunakan desain mixture-of-experts dengan total 235 miliar parameter,…
Model ini unggul dalam tugas-tugas di mana gambar dan teks saling berinteraksi. Ia dapat menjawab pertanyaan tentang konten gambar, mendeskripsikan pemandangan secara detail, membaca teks dari dokumen atau rambu, serta menalar hubungan antar objek dalam gambar. Ia juga menangani beberapa gambar dalam satu percakapan, memungkinkan analisis perbandingan atau penalaran berurutan. Penyetelan instruksi memungkinkan model mengikuti perintah multimodal yang kompleks, seperti 'Jelaskan mengapa grafik ini menunjukkan tren' atau 'Ekstrak semua nilai numerik dari tabel ini.' Kemampuan ini berasal dari backbone MoE yang besar dan pelatihan visi-bahasa khusus.
Sebagai varian Instruct, model ini telah disetel halus untuk mengikuti instruksi pengguna dengan ketelitian tinggi di seluruh petunjuk teks-saja dan multimodal. Ini dapat menangani dialog multi-giliran di mana gambar diperkenalkan secara bertahap, menjaga konteks selama beberapa pertukaran, dan mengikuti instruksi pemformatan (mis., output sebagai JSON, poin-poin, atau langkah demi langkah). Ini bekerja dengan baik pada tugas-tugas yang memerlukan kepatuhan terhadap batasan, seperti 'Jawab hanya jika gambar berisi anjing.' Hal ini membuatnya cocok untuk aplikasi di mana perilaku yang konsisten dan mengikuti aturan adalah penting.
Untuk tugas yang hanya berupa teks tanpa komponen visual, model 235B MoE mungkin berlebihan; model yang lebih kecil atau varian Qwen khusus teks lainnya akan lebih hemat biaya. Demikian pula, jika gambar Anda sederhana (misalnya, logo dasar, objek tunggal) atau Anda memerlukan throughput yang sangat tinggi dengan anggaran terbatas, model visi yang lebih kecil seperti Qwen2-VL 7B mungkin sudah cukup. Model ini paling tepat digunakan saat Anda perlu menangani gambar yang kompleks dan beresolusi tinggi, dokumen dengan teks padat, atau tugas yang memerlukan penalaran multimodal yang mendalam. Di OrcaRouter, Anda dapat membandingkan harga dan mengganti ID model dengan mudah.
Tidak. Qwen3 VL 235B A22B Instruct adalah model pembuatan teks yang hanya menerima gambar sebagai masukan. Model ini tidak menghasilkan gambar, audio, atau modalitas lainnya. Keluaran selalu berupa string teks. Jika Anda membutuhkan pembuatan gambar, Anda harus menggunakan model terpisah. Kekuatan model ini terletak pada pemahaman dan penalaran terhadap masukan visual. Model ini dapat, misalnya, mendeskripsikan tampilan suatu gambar atau menjawab pertanyaan tentangnya, tetapi tidak dapat membuat, mengedit, atau mengubah gambar itu sendiri.
Skor MMLU-Pro yang dilaporkan untuk model ini adalah 82,3. MMLU-Pro adalah versi peningkatan dari tolok ukur Massive Multitask Language Understanding, yang mencakup 57 subjek di bidang STEM, humaniora, dan ilmu sosial. Skor 82,3 menunjukkan pengetahuan umum yang kuat serta penalaran di berbagai topik. Ini adalah agregat angka tunggal; performa dapat bervariasi per subjek. Skor ini menempatkan model ini di antara para pemain terbaik di kelas ukurannya, terutama mengingat arsitektur MoE yang hanya mengaktifkan sebagian kecil dari total parameternya per kueri.
Kekuatannya mencakup akurasi tinggi pada tolok ukur penalaran multimodal, pengikutan instruksi yang kuat, dan efisiensi biaya dibandingkan dengan model padat dengan jumlah parameter total yang serupa. Desain MoE memungkinkannya untuk menskalakan kapasitas tanpa biaya komputasi yang proporsional. Keterbatasannya mencakup biaya absolut yang lebih tinggi dibandingkan model yang lebih kecil, potensi peningkatan latensi karena jumlah parameter total yang besar (meskipun hanya 22B yang aktif, keseluruhan model harus dimuat di memori). Model ini juga mungkin sesekali berhalusinasi pada detail halus dalam gambar atau gagal pada input visual yang sangat ambigu. Kinerja pada tugas domain spesifik (misalnya, pencitraan medis) tidak dijamin.
Kecepatan inferensi bergantung pada backend perangkat keras yang digunakan oleh OrcaRouter dan beban saat ini. Sebagai model MoE dengan total 235 miliar parameter, model ini membutuhkan memori GPU yang signifikan meskipun hanya 22 miliar parameter yang diaktifkan per token. Hal ini biasanya mengakibatkan latensi per permintaan yang lebih tinggi dibandingkan dengan model padat yang lebih kecil (misalnya, parameter 7B-70B). Throughput juga dipengaruhi oleh ukuran batch dan panjang sekuens. Untuk aplikasi yang sensitif terhadap latensi, pertimbangkan untuk menggunakan model yang lebih kecil atau mengoptimalkan prompt yang lebih pendek. OrcaRouter tidak memberikan jaminan latensi tertentu tetapi bertujuan untuk responsivitas tingkat produksi.
OrcaRouter mengenakan biaya persis sesuai tarif yang tercantum dari penyedia: $0.40 per 1 juta token input dan $1.60 per 1 juta token output. Tidak ada markup tambahan. Token input dan output dihitung sesuai aturan tokenisasi OpenAI, yang mungkin sedikit berbeda dari tokenizer internal model. Gambar juga ditagih sebagai token berdasarkan dimensi dan tingkat detailnya, mengikuti kebijakan penyedia. Anda dapat memperkirakan biaya dengan mengalikan perkiraan penggunaan token Anda dengan tarif ini.
Biaya per token lebih tinggi dibandingkan model yang lebih kecil atau model padat, tetapi arsitektur MoE menyediakan kapasitas lebih besar per parameter aktif daripada model padat dengan ukuran aktif yang setara. Untuk tugas multimodal yang kompleks, model ini dapat menyelesaikan tugas dengan jumlah token lebih sedikit atau dengan akurasi lebih tinggi, sehingga berpotensi mengurangi total pengeluaran. Namun, untuk tugas sederhana, model yang lebih murah akan menekan biaya. Di OrcaRouter, Anda dapat mengganti model secara langsung, sehingga hanya menggunakan model ini saat diperlukan. Tidak ada komitmen bulanan minimum atau biaya tersembunyi.
OrcaRouter saat ini tidak mengungkapkan kebijakan caching spesifik untuk model ini. Caching tingkat token mungkin diterapkan oleh penyedia yang mendasarinya tetapi tidak dijamin. Tidak ada diskon massal atau harga berjenjang yang disebutkan; tarif tetap per token. Untuk pengguna dengan volume tinggi, mungkin ada baiknya menghubungi dukungan OrcaRouter untuk kemungkinan pengaturan khusus. Secara umum, harga bersifat transparan dan berdasarkan penggunaan.
Gambar dikonversi menjadi jumlah token berdasarkan resolusi dan pengaturan detailnya. Rumus pastinya ditentukan oleh penyedia (Qwen) dan dapat bervariasi. Biasanya, gambar dengan resolusi lebih tinggi mengonsumsi lebih banyak token. OrcaRouter meneruskan tokenisasi penyedia tanpa perubahan. Anda dapat mengontrol biaya dengan mengubah ukuran gambar atau menggunakan mode detail rendah jika model mendukungnya. Selalu rujuk ke dokumentasi penyedia untuk perhitungan token gambar yang tepat. Token input untuk gambar dihitung dengan tarif $0,40 per juta.
Anda mengirim permintaan POST ke https://api.orcarouter.ai/v1/chat/completions dengan payload JSON yang kompatibel dengan OpenAI. Atur bidang model menjadi "qwen/qwen3-vl-235b-a22b-instruct". Sertakan array messages di mana setiap pesan dapat berisi teks dan/atau konten gambar. Untuk gambar, gunakan format konten gambar OpenAI standar (URL atau base64). Autentikasi dilakukan melalui token Bearer (kunci API Anda). Contoh parameter: temperature, max_tokens, top_p, dan urutan stop bekerja sama dengan API OpenAI. Dokumentasi OrcaRouter memberikan detail lengkap.
Semua parameter penyelesaian obrolan standar didukung: temperature (0-2, default 1), top_p (0-1, default 1), max_tokens (jumlah token output), stop (daftar string), presence_penalty, frequency_penalty, dan seed untuk reproduksibilitas. Model juga menghormati pesan sistem untuk mengatur perilaku. Untuk permintaan multimodal, Anda menyertakan bagian gambar dalam konten pesan pengguna. Tidak ada parameter khusus model yang diekspos; API dibuat generik untuk kompatibilitas. Jika Anda perlu mengontrol perutean MoE, itu ditangani secara internal.
Ya. Karena OrcaRouter menggunakan format API OpenAI, migrasinya mudah. Ganti base URL dan ID model Anda yang sudah ada dengan endpoint OrcaRouter dan "qwen/qwen3-vl-235b-a22b-instruct". Pastikan kunci API Anda valid dan Anda memiliki kredit yang cukup. Format pesan untuk gambar identik dengan OpenAI (menggunakan tipe konten 'image_url'). Anda mungkin perlu menyesuaikan perkiraan jumlah token karena tokenisasi yang berbeda. Tidak ada perubahan pada logika aplikasi Anda yang diperlukan selain endpoint dan nama model.
Qwen3 VL 235B A22B Instruct dan GPT-4V keduanya menangani input multimodal. Perbedaan utama: Qwen3 VL menggunakan MoE dengan 22B parameter aktif, sedangkan GPT-4V adalah model dense kepemilikan dengan ukuran yang tidak diungkapkan. Harga Qwen3 VL melalui OrcaRouter adalah $0,40/$1,60 per juta token, yang secara signifikan lebih rendah dari tarif GPT-4V pada umumnya. Skor benchmark tidak dapat dibandingkan secara langsung karena MMLU-Pro dan pengujian lainnya menggunakan subset yang berbeda. GPT-4V memiliki dukungan ekosistem yang lebih luas, tetapi Qwen3 VL menawarkan keunggulan biaya untuk beban kerja multimodal volume tinggi di OrcaRouter.
Claude 3.5 Sonnet adalah model padat dari Anthropic dengan kemampuan teks dan visi yang kuat. Ia tidak menggunakan MoE, sehingga kapasitas totalnya lebih kecil dari total parameter Qwen3 VL tetapi kapasitas aktif per inferensinya lebih tinggi dari 22B. Harga untuk Claude 3.5 Sonnet umumnya lebih tinggi per token (sekitar $3.00/$15.00 per juta token). Qwen3 VL menawarkan biaya yang jauh lebih rendah untuk tugas multimodal. Namun, model Claude memiliki jendela konteks yang lebih besar (200K token). Pilihan tergantung pada anggaran, kebutuhan panjang konteks, dan penyedia yang disukai.
Kemungkinan OrcaRouter menawarkan model Qwen lainnya seperti Qwen2.5 7B, Qwen2.5 72B, atau varian Qwen2-VL. Qwen3 VL 235B A22B Instruct adalah model MoE multimodal terbesar dalam jajaran Qwen. Dibandingkan dengan Qwen2-VL 72B, model ini memiliki lebih banyak parameter total dan arsitektur MoE, yang dapat menghasilkan kinerja lebih baik pada tugas-tugas kompleks sambil mempertahankan biaya inferensi yang wajar. Biaya per token lebih mahal dibandingkan model Qwen yang lebih kecil, tetapi mungkin hemat biaya jika mengurangi kebutuhan akan banyak panggilan atau konsumsi token yang tinggi.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Input / 1M token | $0.400 |
| Output / 1M token | $1.60 |
| Mata uang | USD |
Perkiraan berdasarkan harga daftar
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructBuka @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct