Qwen3.7 Flash

qwen/qwen3.7-flash
NuovoIn evidenza
VisioneStrumentiJSONRagionamento
di Qwen · 2026-07-27

Qwen3.7 Flash è il modello veloce ed estremamente conveniente di Alibaba nella famiglia Qwen3.7, posizionato al di sotto di Qwen3.7-Plus e Qwen3.7-Max come livello ad alta produttività. È nativamente multimodale sul lato input — accettando testo, immagini e video con output testuale — e offre una finestra di contesto di 1 milione di token con fino a 64K token in output, quindi documenti lunghi, screenshot e fotogrammi video rimangono alla portata anche con i prezzi del livello Flash. Con circa $0.03 per milione di token in input sul livello base, è uno dei modelli multimodali con contesto da 1 milione più economici disponibili, il che lo rende naturalmente adatto per classificazione, estrazione, routing, riassunto, agenti leggeri e qualsiasi pipeline eseguito a volumi molto elevati. Supporta la modalità di ragionamento, la chiamata nativa a strumenti, output strutturati tramite response_format e i consueti controlli di campionamento (temperature / top_p / seed / logprobs). Nota che i prezzi sono scaglionati per lunghezza del prompt: i costi aumentano oltre i 32K e nuovamente oltre i 256K token in input, quindi raggruppare richieste brevi è sostanzialmente più economico che allungare quelle lunghe. Usa Flash come cavallo di battaglia per grandi volumi e passa a Qwen3.7-Plus o Max quando un'attività richiede realmente maggiori capacità.

ctx1M token
Output max65K
Inputtext + image + video
Outputtext
p50 TTFT2.83 s
INGRESSO$0.03/ 1M token
USCITA$0.13/ 1M token
p50 TTFT2.83 s7 g
p95 TTFT9.64 s7 g
TRAFFICO13.5Mtoken / 7 g

Qwen3.7 Flash è un modello linguistico multimodale di grandi dimensioni creato dal team Qwen e reso disponibile tramite OrcaRouter. Elabora input di testo, immagini e video e supporta una finestra di…

Che cos'è Qwen3.7 Flash e chi dovrebbe usarlo?

Quali modalità di input supporta Qwen3.7 Flash?

Qual è la dimensione della finestra di contesto di Qwen3.7 Flash?

Come si accede a Qwen3.7 Flash tramite OrcaRouter?

Esempi di codice

Chiama da qualsiasi SDK

Compatibile con OpenAI: mantieni il tuo SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Parametri supportati

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Prezzi

LivelloInput / 1M tokenOutput / 1M tokenLettura cache / 1MScrittura cache / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Livello selezionato in base al numero di token di input di ogni richiesta

Calcolatore dei costi

Token / mese10MM
Quota di input70%%
Stimato / mese $0.600 · Con cache dei prompt $0.516

Stima basata sul prezzo di listino

Prezzi a livelli — questa stima usa le tariffe del livello base.

Stima di token e costo

Token di input: 17Costo per richiesta: $0.000066

Solo una stima — il numero effettivo di token dipende dal tokenizzatore del provider.

Prestazioni

p50 TTFT
2.83 s
Velocità di output
333 tok/s
p95 TTFT
9.64 s
Tasso di errore
0%

Benchmark pubblici

Fonte: Design Arena

Discussioni della community

Di cosa parlano gli sviluppatori questa settimana

Hacker News0 menzioni · 7 gg

A confronto

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Input $/M$0.03$0.86$0.17$0.12
Output $/M$0.13$3.44$1.03$0.69
Contesto1.0M262K33K1.0M
Qualità7/108/108/108/10
Confronta affiancatiConfronta affiancatiConfronta affiancatiConfronta affiancati

FAQ

Quanto costa Qwen3.7 Flash su OrcaRouter?
Non sono disponibili prezzi specifici per Qwen3.7 Flash nei fatti disponibili. OrcaRouter di solito addebita per token in input e output. Essendo un modello Flash, è probabilmente prezzato più basso rispetto ai modelli di punta. Visita la pagina dei prezzi di OrcaRouter o contatta il supporto per le tariffe attuali.
Qual è la dimensione della finestra di contesto di Qwen3.7 Flash?
La finestra di contesto è di 1.000.000 di token. Ciò consente al modello di elaborare documenti molto lunghi, conversazioni estese o grandi insiemi di immagini/video in un unico prompt.
Quali sono i punti di forza di Qwen3.7 Flash?
I suoi punti di forza includono un contesto di 1M token, supporto per input multimodale (testo, immagine, video), 65k token massimi di output e un'architettura 'Flash' ottimizzata che bilancia velocità e costi. È ben adatto per l'analisi di documenti lunghi e la comprensione multimodale.
Come si confronta Qwen3.7 Flash con GPT-4o-mini?
Qwen3.7 Flash offre una finestra di contesto significativamente più ampia (1M vs. 128k) e una maggiore uscita massima (65k vs. 16k). GPT-4o-mini potrebbe avere un supporto ecosistemico più ampio. Né i prezzi né i benchmark sono forniti per un confronto diretto.
OrcaRouter memorizza nella cache i prompt per ridurre i costi?
OrcaRouter può offrire la memorizzazione nella cache dei prompt, ma la sua politica specifica per Qwen3.7 Flash non è dettagliata nei fatti. Controlla la documentazione di OrcaRouter per gli indicatori di hit della cache e le informazioni sugli sconti.
Come faccio a chiamare Qwen3.7 Flash usando un'API compatibile con OpenAI?
Imposta l'URL di base su https://api.orcarouter.ai/v1 e utilizza l'ID del modello "qwen/qwen3.7-flash". Includi la tua chiave API OrcaRouter. L'endpoint delle chat completions funziona con i parametri standard di OpenAI. Per l'input multimodale, aggiungi oggetti immagine o video nell'array del contenuto del messaggio.
Quali modalità di input supporta Qwen3.7 Flash?
Supporta input di testo, immagini e video. Ciò consente attività come l'analisi di immagini insieme al testo, il riepilogo di video e la combinazione di più tipi di media in un unico prompt.
Posso fare fine-tuning di Qwen3.7 Flash sui miei dati?
Le informazioni disponibili non menzionano le funzionalità di fine-tuning. Essendo un modello accessibile tramite API attraverso OrcaRouter, il fine-tuning probabilmente non è supportato. Per un fine-tuning personalizzato, considera alternative open-source.
Qual è la lunghezza massima di output di Qwen3.7 Flash?
Il massimo output è di 65,536 token. Ciò consente di generare risposte, report o codice molto lunghi in una singola chiamata API.
Come gestire gli input video con Qwen3.7 Flash?
I dettagli specifici sulla gestione dei video non sono forniti. Tipicamente, gli input video vengono elaborati come sequenze di fotogrammi. Potrebbe essere necessario pre-elaborare i video in una serie di immagini e passarli come URL di immagini o dati base64. Consulta la documentazione di OrcaRouter per la formattazione esatta.

Incorpora questo badge

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50tramite OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash su OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Scheda del modello come dati

GET /api/public/models/qwen/qwen3.7-flashApri
Leggibile dalle macchine:/llms.txt/llms-full.txt