Qwen3.5 122B-A10B — open-weight MoE multimodal (teks/gambar/video), 122B total / 10B parameter aktif, konteks 32k (mode visi).
Qwen3.5-122B-A10B adalah model bahasa besar dari seri Qwen oleh Alibaba Cloud. Model ini menggunakan arsitektur mixture-of-experts (MoE) di mana hanya 10 miliar parameter yang diaktifkan per forward…
Berdasarkan arsitektur dan skor benchmark-nya, Qwen3.5-122B-A10B unggul dalam tugas-tugas yang melibatkan penalaran multi-langkah, penggunaan alat, dan mengikuti instruksi. Skor τ²-Bench sebesar 93,6 menunjukkan performa yang kuat pada benchmark yang mengharuskan model untuk merencanakan dan mengeksekusi rangkaian tindakan menggunakan alat (misalnya, kalkulator, mesin pencari, penerjemah kode). Hal ini membuatnya cocok untuk membangun agen otonom yang perlu berinteraksi dengan sistem eksternal. Model ini juga menangani masukan multimodal, sehingga tugas-tugas seperti penalaran visual, analisis dokumen dengan gambar yang disematkan, atau peringkasan video termasuk dalam keunggulannya. Selain itu, batas outputnya yang besar memungkinkannya untuk menghasilkan penjelasan yang mendalam, penyelesaian kode, atau data terstruktur dalam satu respons. Pengembang yang mengerjakan chatbot kompleks, asisten pengkodean, atau alat analisis penelitian mungkin menemukan model ini efektif.
Meskipun Qwen3.5-122B-A10B sangat kuat, model ini bukanlah pilihan yang paling hemat biaya untuk setiap kasus penggunaan. Jika tugas Anda adalah klasifikasi sederhana, pembuatan teks pendek, atau tanya jawab langsung yang tidak memerlukan penalaran multi-langkah atau pemahaman multimodal, Anda mungkin mendapatkan hasil yang memuaskan dengan model yang lebih kecil seperti Qwen-7B atau model non-multimodal. Model-model tersebut bisa lebih cepat dan lebih murah per token. Selain itu, jika kebutuhan konteks Anda sangat kecil (misalnya, kurang dari 1.000 token), overhead relatif menggunakan model 122B parameter mungkin tidak sepadan. OrcaRouter menawarkan berbagai model dengan harga dan karakteristik kinerja yang berbeda. Anda dapat bereksperimen dengan model yang lebih kecil terlebih dahulu dan meningkatkan hanya jika kualitasnya tidak memadai. Terakhir, jika Anda tidak memerlukan batas output 65K, model dengan output yang lebih pendek mungkin sudah mencukupi.
Model ini memiliki jendela konteks sebesar 32.768 token dan output maksimal 65.536 token, yang memungkinkannya menangani rantai penalaran yang panjang dan instruksi yang ekstensif. Skor τ²-Bench yang tinggi menunjukkan bahwa model ini dapat mempertahankan koherensi dalam beberapa langkah dan mengikuti instruksi kompleks dengan benar yang melibatkan logika kondisional, pemanggilan alat, dan percabangan. Dalam praktiknya, pengguna melaporkan bahwa model seri Qwen3.5 kompetitif dengan model mutakhir lainnya dalam tugas seperti pemecahan masalah matematika, pembuatan kode, dan teka-teki logika. Namun, seperti semua model besar, kinerja dapat menurun jika konteks dipenuhi dengan informasi yang tidak relevan atau jika instruksinya ambigu. Rekayasa prompt disarankan untuk memandu model secara efektif. Model ini juga mungkin mengalami kesulitan dengan dokumen yang sangat panjang (mendekati batas konteks) di mana ia harus mengingat detail dari awal.
Input multimodal (teks + gambar/video) memungkinkan beberapa aplikasi praktis. Dalam analisis dokumen, model dapat membaca teks maupun grafik, diagram, atau tanda tangan yang tertanam dalam PDF atau gambar. Misalnya, model dapat mengekstrak data dari tabel yang dipindai atau menginterpretasikan grafik. Dalam tanya jawab visual, model dapat menjawab pertanyaan tentang foto atau ilustrasi. Dalam analisis video, model dapat memproses bingkai untuk mendeskripsikan adegan atau melacak perubahan dari waktu ke waktu. Pengembang dapat membangun alat untuk aksesibilitas (misalnya, mendeskripsikan gambar untuk pengguna tunanetra) atau otomatisasi (misalnya, menganalisis tangkapan layar antarmuka pengguna). Karena model diakses melalui OrcaRouter, kemampuan ini dapat diintegrasikan ke dalam aplikasi yang sudah ada dengan panggilan API yang sama yang digunakan untuk perintah hanya teks, cukup dengan menyertakan image_url atau video_url dalam konten pesan.
Satu-satunya tolok ukur yang dipublikasikan untuk model ini adalah τ²-Bench, di mana ia mendapat skor 93.6. τ²-Bench dirancang untuk mengevaluasi kemampuan model dalam menggunakan alat dan menyelesaikan tugas multi-langkah di lingkungan simulasi. Skor 93.6 menunjukkan bahwa model dapat menyelesaikan sebagian besar tugas-tugas ini dengan benar. Sebagai konteks, skor ini kompetitif dengan model-model canggih lainnya pada tolok ukur yang sama. Namun, skor tolok ukur tidak selalu mencerminkan kinerja di dunia nyata, karena tugas dapat bervariasi dalam kesulitan dan tolok ukur mungkin tidak mencakup semua domain. Pengguna harus melakukan evaluasi sendiri pada tugas-tugas spesifik mereka. Tidak ada skor tolok ukur lain (misalnya, MMLU, HumanEval, atau tolok ukur multimodal) yang disediakan dalam fakta yang tersedia, sehingga tidak mungkin untuk membandingkan model ini pada serangkaian metrik standar yang lebih luas.
Kelebihan: Model ini mencapai skor tinggi pada tolok ukur penggunaan alat, menunjukkan penalaran yang kuat dan kepatuhan terhadap instruksi. Kemampuan multimodalnya dan batas output yang besar membuatnya serbaguna. Arsitektur MoE dapat memberikan keseimbangan yang baik antara kinerja dan efisiensi (setidaknya dibandingkan dengan model padat dengan total parameter serupa). Keterbatasan: Model ini memiliki jendela konteks hanya 32.768 token, yang tergolong moderat dibandingkan beberapa model yang menawarkan 100K atau lebih. Parameter yang diaktifkan (10B) relatif rendah untuk model dengan ukuran totalnya, yang dapat membatasi kinerja pada tugas yang sangat kompleks. Tidak ada informasi yang tersedia tentang latensi, throughput, atau persyaratan perangkat keras. Juga, karena model ini baru, ekosistem komunitas (misalnya, skrip fine-tuning, alat kuantisasi) mungkin kurang berkembang dibandingkan dengan model yang lebih mapan. Pengguna harus menguji model ini secara menyeluruh.
Tidak ada angka latensi atau throughput spesifik yang tersedia untuk model ini di OrcaRouter. Kecepatan inferensi tergantung pada faktor-faktor seperti panjang input, panjang output, ukuran batch, dan perangkat keras yang dialokasikan oleh OrcaRouter. Model MoE dapat memiliki kecepatan yang bervariasi karena mekanisme routing dapat mengaktifkan expert yang berbeda untuk token yang berbeda. Umumnya, model dengan 10B parameter yang diaktifkan dapat menghasilkan kecepatan sedang pada GPU modern, tetapi total 122B parameter dalam memori dapat menyebabkan penggunaan memori yang lebih tinggi dan waktu prefill yang lebih lama. Jika latensi rendah sangat penting, Anda mungkin ingin menguji model tersebut dengan prompt khas Anda. API OrcaRouter mengembalikan stempel waktu dan metrik kinerja di header respons yang dapat membantu Anda mengukur kecepatan. Untuk aplikasi yang sensitif terhadap latensi, pertimbangkan untuk menggunakan model yang lebih kecil jika tugas memungkinkan.
Fakta yang tersedia hanya mencakup satu tolok ukur: τ²-Bench. Tolok ukur umum seperti MMLU (pengetahuan), HumanEval (kode), GSM8K (matematika), atau tolok ukur multimodal seperti MMBench tidak disediakan. Hal ini menyulitkan untuk mengukur kinerja model pada tugas-tugas yang tidak terkait dengan alat. Misalnya, jika aplikasi Anda memerlukan akurasi faktual, Anda pasti ingin mengetahui kinerjanya pada MMLU. Demikian pula, untuk tugas multimodal, skor pada tolok ukur penalaran visual akan berguna. Tidak adanya skor-skor ini tidak berarti kinerja yang buruk, tetapi berarti pengguna harus melakukan evaluasi sendiri. OrcaRouter dapat memberikan hasil tolok ukur tambahan berdasarkan permintaan atau dalam dokumentasi. Sampai data lebih tersedia, disarankan untuk membandingkan model secara kualitatif dengan model lain pada domain spesifik Anda.
Detail harga untuk Qwen3.5-122B-A10B di OrcaRouter tidak diberikan secara eksplisit dalam fakta yang tersedia. Biasanya, OrcaRouter mengenakan biaya per token untuk input dan output, dengan tarif terpisah untuk token prompt dan token yang dihasilkan. Input multimodal (gambar/video) ditagih sebagai ekuivalen token berdasarkan jumlah blok gambar atau bingkai video yang diproses. Beberapa penyedia juga menawarkan tarif diskon untuk cache hit jika pengguna mengulangi prompt yang sama. Untuk mendapatkan harga pasti, pengguna harus merujuk ke halaman harga OrcaRouter atau menghubungi tim penjualan mereka. Karena model ini memiliki 122B parameter total dan multimodal, harga per token mungkin lebih tinggi daripada model yang lebih kecil atau hanya teks. Penting untuk memperhitungkan biaya token untuk gambar/video saat memperkirakan total pengeluaran untuk suatu tugas.
Menggunakan model yang lebih besar seperti Qwen3.5-122B-A10B biasanya menimbulkan biaya per token yang lebih tinggi daripada model yang lebih kecil. Namun, jika model dapat menyelesaikan tugas dalam langkah yang lebih sedikit atau dengan token yang lebih sedikit karena kemampuannya, total biaya mungkin masih kompetitif. Batas output yang besar (65.536 token) dapat menjadi keuntungan sekaligus risiko biaya: menghasilkan output yang panjang dapat dengan cepat mengakumulasi biaya token. Selain itu, input multimodal mengonsumsi lebih banyak token per prompt daripada prompt teks saja. Misalnya, satu gambar resolusi tinggi mungkin menghabiskan ratusan token. Jika tugas Anda tidak memerlukan kemampuan penuh model, Anda dapat menghemat uang dengan memilih model yang lebih kecil. OrcaRouter kemungkinan menyediakan dasbor penggunaan dan kontrol biaya, seperti mengatur jumlah maksimum token output atau peringatan anggaran, yang dapat membantu mengelola pengeluaran.
Fakta yang tersedia tidak menyebutkan adanya diskon caching untuk model ini di OrcaRouter. Banyak penyedia inferensi menawarkan prompt caching, di mana teks yang berulang dalam system prompt atau pesan pengguna disimpan sementara dan ditagih dengan tarif lebih rendah. Jika OrcaRouter mendukung caching, hal ini dapat mengurangi biaya untuk aplikasi yang menggunakan prompt statis panjang (misalnya, instruksi sistem, deskripsi karakter). Namun, tanpa dokumentasi spesifik, hal tersebut tidak boleh diasumsikan. Pengguna dapat memeriksa header respons API untuk indikator cache hit jika caching diimplementasikan. Untuk meminimalkan biaya, Anda dapat merancang prompt agar tidak mengulangi prefiks panjang yang sama dengan memisahkan instruksi statis dari konten dinamis. Selain itu, pertimbangkan untuk menggunakan jendela konteks yang lebih pendek atau menghilangkan gambar yang tidak perlu jika memungkinkan.
Untuk menggunakan Qwen3.5-122B-A10B, kirim permintaan POST ke endpoint API OrcaRouter di https://api.orcarouter.ai/v1/chat/completions. Atur parameter model menjadi "qwen/qwen3.5-122b-a10b". API ini sepenuhnya kompatibel dengan format chat completions OpenAI, sehingga Anda dapat menggunakan pustaka klien yang sama (misalnya, pustaka Python openai) dengan mengubah URL dasar dan kunci API. Badan permintaan mencakup pesan (masing-masing dengan peran dan konten), dan secara opsional parameter seperti temperature, max_tokens, top_p, dll. Untuk input multimodal, gunakan blok konten dengan tipe: "image_url" untuk gambar atau penanganan video spesifik model (kemungkinan melalui frame yang dienkode base64 atau URL). API akan mengembalikan respons JSON dengan teks yang dihasilkan dan metadata penggunaan (jumlah token). Dokumentasi OrcaRouter memberikan detail lebih lanjut tentang parameter yang didukung.
Model ini mendukung parameter obrolan standar: temperature (biasanya default 0,7), top_p (default 0,9), max_tokens (hingga output maksimum model yaitu 65.536), presence_penalty, frequency_penalty, dan urutan stop. Batas jendela konteks adalah 32.768 token, yang mencakup semua pesan, gambar, dan bingkai video. Jika jumlah total token melebihi batas ini, API akan mengembalikan kesalahan atau memotong input (tergantung pengaturan). Parameter max_tokens tidak boleh melebihi 65.536. Untuk permintaan multimodal, perlu diketahui bahwa gambar dan video menambah token; rasio konversi yang tepat tidak diberikan, tetapi resolusi tinggi atau video panjang dapat dengan cepat menghabiskan jendela konteks. OrcaRouter juga dapat mendukung mode streaming, di mana respons dialirkan token demi token, yang berguna untuk aplikasi real-time. Periksa referensi API untuk opsi tambahan seperti logprobs atau tools.
Migrasi cukup mudah: ganti base URL Anda menjadi https://api.orcarouter.ai/v1, gunakan model ID "qwen/qwen3.5-122b-a10b", dan berikan kunci API OrcaRouter Anda. Format permintaan identik dengan API chat completions OpenAI. Sebagai contoh, dalam Python dengan pustaka openai, Anda dapat mengatur client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key'). Kemudian panggil client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...). Jika aplikasi Anda menggunakan function calling atau alat, perhatikan bahwa model mendukungnya karena dilatih pada τ²-Bench yang melibatkan penggunaan alat. Namun, sintaks panggilan alat yang tepat mungkin berbeda dari OpenAI; OrcaRouter kemungkinan mendukung format OpenAI tetapi uji coba untuk memastikan. Untuk input multimodal, kode Anda yang ada yang mengirim image_url dalam pesan mungkin berfungsi selama model mendukung format tersebut.
Dalam keluarga Qwen, model ini berada di antara model padat yang lebih kecil (misalnya, Qwen-7B, Qwen-14B) dan model MoE terbesar (misalnya, Qwen3.5-235B). Dibandingkan dengan model padat, model MoE ini dapat mengakses total parameter yang lebih besar tetapi hanya mengaktifkan sebagian kecil per token, yang memungkinkan adanya spesialis yang lebih terspesialisasi. Hal ini dapat menghasilkan kinerja yang lebih baik pada berbagai tugas, terutama yang membutuhkan pengetahuan yang beragam. Namun, model padat yang lebih kecil bisa lebih cepat dan lebih murah untuk tugas yang sempit. Dibandingkan dengan Qwen3.5-235B yang lebih besar, model ini kemungkinan memiliki kinerja yang lebih rendah tetapi lebih efisien. Dukungan multimodal adalah fitur umum dari generasi Qwen3.5; versi sebelumnya (Qwen2, Qwen1) hanya teks. Pengguna harus membandingkan hasil tolok ukur pada tugas spesifik mereka untuk memutuskan model mana yang paling sesuai.
Perbandingan langsung sulit dilakukan tanpa tolok ukur yang komprehensif. Qwen3.5-122B-A10B mencapai 93.6 pada τ²-Bench, yang merupakan hasil yang kuat untuk tugas penggunaan alat. Sebagai referensi, skor serupa pada tolok ukur tersebut untuk model lain tidak disediakan, tetapi ini dianggap sebagai kemampuan tingkat tinggi. Dari segi arsitektur, model Llama bersifat padat dan lebih sederhana, sementara model Claude memiliki arsitektur kepemilikan yang berbeda. Qwen3.5 menawarkan masukan multimodal (gambar/video) yang didukung oleh Claude tetapi Llama 3.2 dan 3.1 hanya teks (kecuali untuk beberapa varian visi). Jendela konteks 32K lebih kecil dari 100K atau 200K milik Claude tetapi sebanding dengan 128K milik Llama 3.1? Tidak tepat; kita tidak boleh menciptakan angka. Untuk kode dan penalaran, banyak model yang kompetitif. Keunggulan model ini mungkin terletak pada penyesuaian spesifiknya untuk penggunaan alat (skor tinggi τ²-Bench) dan efisiensi MoE multimodal. Namun, Claude dan Llama memiliki ekosistem yang lebih besar dan dukungan komunitas yang lebih luas.
Hanya sedikit model yang menggabungkan input multimodal, jendela konteks yang besar, batas output yang besar, dan skor τ²-Bench yang tinggi dalam satu paket. Seri Qwen3.5 dirancang untuk menjadi model serbaguna yang mumpuni dengan kemampuan penalaran dan penggunaan alat yang kuat. Arsitektur MoE dengan total 122B dan aktif 10B memungkinkannya untuk menyimpan banyak pengetahuan sambil menjaga biaya inferensi lebih rendah daripada model padat 122B. Meskipun demikian, model MoE lainnya seperti Mixtral 8x7B (total 47B, aktif 13B) memiliki trade-off yang berbeda. Qwen3.5-122B-A10B memiliki jumlah parameter total yang jauh lebih besar tetapi parameter aktif per token lebih sedikit (10B vs. 13B). Dukungan multimodal adalah pembeda; Mixtral hanya teks. Di ruang MoE multimodal, model seperti Qwen-VL atau lainnya ada tetapi seringkali memiliki jendela konteks yang lebih kecil. Model ini diposisikan sebagai opsi yang kuat bagi pengembang yang membutuhkan satu model untuk tugas-tugas yang beragam, multimodal, dan berat-alat di OrcaRouter.
Pilih Qwen3.5-122B-A10B jika aplikasi Anda membutuhkan pemahaman multimodal dan penalaran multi-langkah yang kompleks, serta Anda memerlukan batas output besar untuk menghasilkan respons panjang. Ini juga merupakan pilihan yang baik jika Anda membangun sistem agen yang menggunakan alat, mengingat skor τ²-Bench yang tinggi. Jika tugas Anda hanya berbasis teks dan tidak memerlukan kapasitas tambahan, model yang lebih murah seperti Llama 3.1 70B atau Qwen-14B mungkin sudah mencukupi. Jika Anda memerlukan jendela konteks yang lebih besar (misalnya, >100K token), pertimbangkan model yang dirancang khusus untuk konteks panjang. Jika Anda memerlukan latensi rendah, model yang lebih kecil atau model padat mungkin lebih baik. Karena OrcaRouter menawarkan banyak model, Anda dapat mengevaluasi beberapa model melalui API yang sama untuk menemukan yang paling sesuai dengan target biaya dan kualitas Anda. ID model-nya adalah qwen/qwen3.5-122b-a10b.
Kompatibel OpenAI — pakai SDK Anda yang sekarang
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Tingkat | Input / 1M token | Output / 1M token |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Tingkat dipilih berdasarkan jumlah token input setiap permintaan | ||
Perkiraan berdasarkan harga daftar
Harga berjenjang — perkiraan ini memakai tarif jenjang dasar.
Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.
GET /api/public/models/qwen/qwen3.5-122b-a10bBuka @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b