Qwen3.7 Flash

qwen/qwen3.7-flash
BaruUnggulan
VisiAlatJSONPenalaran
oleh Qwen · 2026-07-27

Qwen3.7 Flash adalah model cepat dan sangat efisien biaya dari Alibaba dalam keluarga Qwen3.7, berada di bawah Qwen3.7-Plus dan Qwen3.7-Max sebagai tingkatan throughput tinggi. Model ini secara native multimodal pada sisi input — menerima teks, gambar, dan video dengan output teks — dan melayani jendela konteks 1M token dengan hingga 64K token output, sehingga dokumen panjang, tangkapan layar, dan bingkai video tetap dapat dijangkau bahkan pada harga tingkat Flash. Dengan harga sekitar $0,03 per juta token input pada tingkatan dasar, model ini adalah salah satu model multimodal konteks 1M termurah yang tersedia, menjadikannya cocok secara alami untuk klasifikasi, ekstraksi, routing, peringkasan, agen ringan, dan pipeline apa pun yang dijalankan dalam volume sangat tinggi. Model ini mendukung mode penalaran, pemanggilan alat secara native, output terstruktur melalui response_format, dan kontrol sampling biasa (temperature / top_p / seed / logprobs). Perhatikan bahwa harga bertingkat berdasarkan panjang prompt: biaya naik di atas 32K dan lagi di atas 256K token input, sehingga menggabungkan permintaan pendek secara materi lebih murah daripada memperpanjang yang panjang. Gunakan Flash sebagai kuda beban volume dan naikkan ke Qwen3.7-Plus atau Max ketika suatu tugas benar-benar membutuhkan lebih banyak kemampuan.

ctx1M token
Output maks65K
Masukantext + image + video
Keluarantext
p50 TTFT2.83 s
INPUT$0.03/ 1M token
OUTPUT$0.13/ 1M token
p50 TTFT2.83 s7h
p95 TTFT9.64 s7h
LALU LINTAS13.5Mtoken / 7h

Qwen3.7 Flash adalah model bahasa besar multimodal yang dibuat oleh tim Qwen dan tersedia melalui OrcaRouter. Model ini memproses input teks, gambar, dan video serta mendukung jendela konteks sebesar…

Apa itu Qwen3.7 Flash dan siapa yang seharusnya menggunakannya?

Mode input apa yang didukung oleh Qwen3.7 Flash?

Berapa ukuran jendela konteks dari Qwen3.7 Flash?

Bagaimana cara mengakses Qwen3.7 Flash melalui OrcaRouter?

Contoh kode

Panggil dari SDK apa pun

Kompatibel OpenAI — pakai SDK Anda yang sekarang

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parameter yang didukung

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Harga

TingkatInput / 1M tokenOutput / 1M tokenBaca cache / 1MTulis cache / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Tingkat dipilih berdasarkan jumlah token input setiap permintaan

Kalkulator biaya

Token / bulan10MM
Porsi input70%%
Perkiraan / bulan $0.600 · Dengan cache prompt $0.516

Perkiraan berdasarkan harga daftar

Harga berjenjang — perkiraan ini memakai tarif jenjang dasar.

Estimator token & biaya

Token masukan: 17Biaya per permintaan: $0.000066

Hanya perkiraan — jumlah token sebenarnya bergantung pada tokenizer penyedia.

Performa

p50 TTFT
2.83 s
Kecepatan output
333 tok/s
p95 TTFT
9.64 s
Tingkat kesalahan
0%

Benchmark publik

Sumber: Design Arena

Perbincangan komunitas

Yang dibicarakan developer minggu ini

Hacker News0 sebutan · 7 hr

Perbandingan

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Input $/M$0.03$0.86$0.17$0.12
Output $/M$0.13$3.44$1.03$0.69
Konteks1.0M262K33K1.0M
Kualitas7/108/108/108/10
Bandingkan berdampinganBandingkan berdampinganBandingkan berdampinganBandingkan berdampingan

FAQ

Berapa biaya Qwen3.7 Flash pada OrcaRouter?
Tidak ada harga spesifik untuk Qwen3.7 Flash yang disediakan dalam fakta yang tersedia. OrcaRouter biasanya mengenakan biaya per token untuk input dan output. Sebagai model Flash, kemungkinan harganya lebih rendah daripada model flagship. Kunjungi halaman harga OrcaRouter atau hubungi dukungan untuk tarif terkini.
Berapa ukuran jendela konteks dari Qwen3.7 Flash?
Jendela konteksnya adalah 1,000,000 token. Hal ini memungkinkan model untuk memproses dokumen yang sangat panjang, percakapan yang panjang, atau kumpulan gambar/video yang besar dalam satu prompt.
Apa kelebihan Qwen3.7 Flash?
Kelebihannya termasuk konteks 1M-token, dukungan masukan multimodal (teks, gambar, video), output maksimal 65k token, dan arsitektur 'Flash' yang dioptimalkan yang menyeimbangkan kecepatan dan biaya. Ini sangat cocok untuk analisis dokumen panjang dan pemahaman multimodal.
Bagaimana perbandingan Qwen3.7 Flash dengan GPT-4o-mini?
Qwen3.7 Flash menawarkan jendela konteks yang jauh lebih besar (1M vs. 128k) dan output maksimum yang lebih tinggi (65k vs. 16k). GPT-4o-mini mungkin memiliki dukungan ekosistem yang lebih luas. Baik harga maupun tolok ukur tidak disediakan untuk perbandingan langsung.
Apakah OrcaRouter menyimpan cache prompt untuk mengurangi biaya?
OrcaRouter mungkin menawarkan penyimpanan sementara (prompt caching), tetapi kebijakan spesifiknya untuk Qwen3.7 Flash tidak dirinci dalam fakta. Periksa dokumentasi OrcaRouter untuk indikator cache hit dan informasi diskon.
Bagaimana cara memanggil Qwen3.7 Flash menggunakan API yang kompatibel dengan OpenAI?
Atur URL dasar ke https://api.orcarouter.ai/v1 dan gunakan ID model "qwen/qwen3.7-flash". Sertakan kunci API OrcaRouter Anda. Titik akhir penyelesaian obrolan bekerja dengan parameter OpenAI standar. Untuk input multimodal, tambahkan objek gambar atau video dalam larik konten pesan.
Mode input apa yang didukung oleh Qwen3.7 Flash?
Ini mendukung input teks, gambar, dan video. Hal ini memungkinkan tugas-tugas seperti menganalisis gambar bersama teks, merangkum video, dan menggabungkan beberapa jenis media dalam satu perintah.
Dapatkah saya melakukan fine-tuning pada Qwen3.7 Flash dengan data saya sendiri?
Fakta yang tersedia tidak menyebutkan kemampuan fine-tuning. Sebagai model yang diakses melalui API melalui OrcaRouter, fine-tuning kemungkinan tidak didukung. Untuk fine-tuning kustom, pertimbangkan alternatif sumber terbuka.
Berapa panjang output maksimal dari Qwen3.7 Flash?
Output maksimal adalah 65.536 token. Hal ini memungkinkan pembuatan respons, laporan, atau kode yang sangat panjang dalam satu panggilan API.
Bagaimana cara menangani input video dengan Qwen3.7 Flash?
Detail penanganan video spesifik tidak disediakan. Biasanya, input video diproses sebagai urutan frame. Anda mungkin perlu melakukan prapemrosesan video menjadi serangkaian gambar dan meneruskannya sebagai URL gambar atau data base64. Konsultasikan dokumentasi OrcaRouter untuk format yang tepat.

Sematkan lencana ini

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash di OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Kartu model sebagai data

GET /api/public/models/qwen/qwen3.7-flashBuka