Qwen3.7 Flash

qwen/qwen3.7-flash
NouveauEn vedette
VisionOutilsJSONRaisonnement
par Qwen · 2026-07-27

Qwen3.7 Flash est le modèle rapide et extrêmement économique d'Alibaba dans la famille Qwen3.7, se situant en dessous de Qwen3.7-Plus et Qwen3.7-Max en tant que niveau à haut débit. Il est nativement multimodal côté entrée — acceptant texte, images et vidéo avec sortie texte — et offre une fenêtre de contexte de 1 million de tokens avec jusqu'à 64 000 tokens de sortie, de sorte que les longs documents, captures d'écran et images vidéo restent accessibles même au tarif Flash. À environ 0,03 $ par million de tokens d'entrée sur le niveau de base, c'est l'un des modèles multimodaux à contexte 1M les moins chers disponibles, ce qui en fait un choix naturel pour la classification, l'extraction, le routage, le résumé, les agents légers et toute pipeline exécutée à très grand volume. Il prend en charge le mode raisonnement, l'appel d'outils natif, les sorties structurées via response_format, et les contrôles d'échantillonnage habituels (temperature / top_p / seed / logprobs). Notez que la tarification est échelonnée par longueur de prompt : les coûts augmentent au-dessus de 32K tokens d'entrée, puis à nouveau au-dessus de 256K tokens. Il est donc nettement moins cher de traiter par lots des requêtes courtes que d'allonger des requêtes longues. Utilisez Flash comme cheval de bataille pour le volume et passez à Qwen3.7-Plus ou Max lorsqu'une tâche nécessite réellement plus de capacité.

Points de terminaison:/v1/chat/completions/v1/responses
ctx1M tokens
Sortie max65K
Entréetext + image + video
Sortietext
p50 TTFT2.83 s
ENTRÉE$0.03/ 1M tokens
SORTIE$0.13/ 1M tokens
p50 TTFT2.83 s7 j
TTFT p959.64 s7 j
TRAFIC13.5Mtokens / 7 j

Qwen3.7 Flash est un modèle de langage multimodal de grande taille créé par l'équipe Qwen et rendu disponible via OrcaRouter. Il traite des entrées textuelles, images et vidéos et prend en charge une…

Qu'est-ce que Qwen3.7 Flash et qui devrait l'utiliser ?

Quelles modalités d'entrée Qwen3.7 Flash supporte-t-il ?

Quelle est la taille de la fenêtre de contexte de Qwen3.7 Flash ?

Comment Qwen3.7 Flash est-il accessible via OrcaRouter?

Exemples de code

Appelez depuis n'importe quel SDK

Compatible OpenAI — gardez votre SDK actuel

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Paramètres pris en charge

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Tarifs

PalierEntrée / 1M tokensSortie / 1M tokensLecture cache / 1MÉcriture cache / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Palier sélectionné selon le nombre de tokens d'entrée de chaque requête

Calculateur de coût

Tokens / mois10MM
Part d'entrée70%%
Estimé / mois $0.600 · Avec cache de prompt $0.516

Estimation basée sur le tarif public

Tarification par paliers — cette estimation utilise les tarifs du palier de base.

Estimateur de tokens et de coût

Tokens d'entrée: 17Coût par requête: $0.000066

Estimation seulement — le nombre réel de tokens dépend du tokeniseur du fournisseur.

Performances

p50 TTFT
2.83 s
Vitesse de sortie
333 tok/s
TTFT p95
9.64 s
Taux d'erreur
0%

Benchmarks publics

Buzz communautaire

Ce dont parlent les développeurs cette semaine

Hacker News0 mentions · 7 j

Comparatif

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Entrée $/M$0.03$0.86$0.17$0.12
Sortie $/M$0.13$3.44$1.03$0.69
Contexte1.0M262K33K1.0M
Qualité7/108/108/108/10
Comparer côte à côteComparer côte à côteComparer côte à côteComparer côte à côte

FAQ

Combien coûte Qwen3.7 Flash sur OrcaRouter ?
Aucun prix spécifique pour Qwen3.7 Flash n'est fourni dans les faits disponibles. OrcaRouter facture généralement par token pour l'entrée et la sortie. En tant que modèle Flash, il est probablement moins cher que les modèles phares. Visitez la page de tarifs d'OrcaRouter ou contactez le support pour connaître les tarifs actuels.
Quelle est la taille de la fenêtre de contexte de Qwen3.7 Flash ?
La fenêtre de contexte est de 1 000 000 jetons. Cela permet au modèle de traiter des documents très longs, des conversations étendues ou de grands ensembles d'images/vidéos en une seule invite.
Quels sont les points forts de Qwen3.7 Flash ?
Ses atouts incluent un contexte de 1M tokens, une prise en charge d'entrées multimodales (texte, image, vidéo), un maximum de 65k tokens de sortie, et une architecture 'Flash' optimisée qui équilibre vitesse et coût. Elle est bien adaptée à l'analyse de longs documents et à la compréhension multimodale.
Comment Qwen3.7 Flash se compare-t-il à GPT-4o-mini ?
Qwen3.7 Flash offre une fenêtre de contexte nettement plus grande (1M contre 128k) et une sortie maximale plus élevée (65k contre 16k). GPT-4o-mini peut bénéficier d'un support plus large de l'écosystème. Ni les prix ni les benchmarks ne sont fournis pour une comparaison directe.
Est-ce qu'OrcaRouter met en cache les prompts pour réduire les coûts ?
OrcaRouter peut offrir la mise en cache des prompts, mais sa politique spécifique pour Qwen3.7 Flash n'est pas détaillée dans les faits. Consultez la documentation d'OrcaRouter pour les indicateurs de succès de cache et les informations de réduction.
Comment appeler Qwen3.7 Flash en utilisant une API compatible OpenAI ?
Définissez l'URL de base sur https://api.orcarouter.ai/v1 et utilisez l'ID de modèle "qwen/qwen3.7-flash". Incluez votre clé API OrcaRouter. Le point de terminaison de complétions de chat fonctionne avec les paramètres standard d'OpenAI. Pour une entrée multimodale, ajoutez des objets image ou vidéo dans le tableau de contenu du message.
Quelles modalités d'entrée Qwen3.7 Flash supporte-t-il ?
Il prend en charge les entrées de texte, d'image et de vidéo. Cela permet des tâches telles que l'analyse d'images avec du texte, le résumé de vidéos et la combinaison de plusieurs types de médias dans une seule requête.
Puis-je affiner Qwen3.7 Flash sur mes propres données ?
Les faits disponibles ne mentionnent pas les capacités de réglage fin. En tant que modèle accessible via API via OrcaRouter, le réglage fin n'est probablement pas pris en charge. Pour un réglage fin personnalisé, envisagez des alternatives open source.
Quelle est la longueur maximale de sortie de Qwen3.7 Flash ?
La sortie maximale est de 65 536 tokens. Cela permet de générer de très longues réponses, rapports ou code en un seul appel API.
Comment gérer les entrées vidéo avec Qwen3.7 Flash ?
Les détails spécifiques de gestion vidéo ne sont pas fournis. En général, les entrées vidéo sont traitées comme des séquences d'images. Vous devrez peut-être prétraiter les vidéos en une série d'images et les transmettre sous forme d'URL d'images ou de données base64. Consultez la documentation d'OrcaRouter pour le format exact.

Intégrer ce badge

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash sur OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Fiche du modèle en données

GET /api/public/models/qwen/qwen3.7-flashOuvrir
Lisible par machine:/llms.txt/llms-full.txt