Qwen3.7 Flash ist das schnelle, äußerst kosteneffiziente Modell von Alibaba in der Qwen3.7-Familie, das als High-Throughput-Stufe unter Qwen3.7-Plus und Qwen3.7-Max angesiedelt ist. Es ist eingangsseitig nativ multimodal – es akzeptiert Text, Bilder und Videos mit Textausgabe – und bietet ein Kontextfenster von 1M Token mit bis zu 64K Ausgabetoken, sodass lange Dokumente, Screenshots und Videobilder selbst zu Flash-Preisen in Reichweite bleiben. Mit etwa $0.03 pro Million Eingabetoken in der Basisstufe ist es eines der günstigsten multimodalen Modelle mit 1M Kontext, was es zu einer natürlichen Wahl für Klassifikation, Extraktion, Routing, Zusammenfassung, leichte Agenten und jede Pipeline mit sehr hohem Volumen macht. Es unterstützt Reasoning-Modus, natives Tool Calling, strukturierte Ausgaben über response_format und die üblichen Sampling-Steuerungen (temperature / top_p / seed / logprobs). Beachten Sie, dass die Preisgestaltung nach Prompt-Länge gestaffelt ist: Die Kosten steigen ab 32K und erneut ab 256K Eingabetoken an, sodass das Bündeln kurzer Anfragen wesentlich günstiger ist als das Auffüllen langer. Verwenden Sie Flash als Volumen-Arbeitspferd und steigen Sie auf Qwen3.7-Plus oder Max um, wenn eine Aufgabe tatsächlich mehr Leistung benötigt.
Qwen3.7 Flash ist ein multimodales großes Sprachmodell, das vom Qwen-Team entwickelt und über OrcaRouter bereitgestellt wird. Es verarbeitet Text-, Bild- und Videoeingaben und unterstützt einen…
Qwen3.7 Flash zeichnet sich durch multimodales Verständnis mit sehr langem Kontext aus. Zu den wichtigsten Anwendungsfällen gehören: Verarbeitung und Zusammenfassung langer Video-Transkripte oder Vorlesungsaufzeichnungen; Analyse medizinischer Bilder zusammen mit Patientengeschichte oder Rechtsdokumenten; Erstellung von Chatbots, die sich an gesamte Gesprächsverläufe erinnern können (bis zu 1M Token); und Durchführung von Retrieval-Augmented Generation über große Unternehmensdokumentbestände, bei denen der gesamte Kontext in eine einzige Aufforderung passt. Die Ausgabekapazität von 65.536 Token eignet sich auch für Aufgaben wie die Erstellung detaillierter Berichte oder Code mit umfangreichen Kommentaren. Da es sich um eine „Flash“-Variante handelt, ist sie wahrscheinlich kosteneffizienter und zeitsparender als größere Modelle für Aufgaben, die nicht die höchste Denktiefe erfordern. Bei rein textbasierten Aufgaben mit moderaten Kontextanforderungen können kleinere Modelle (z. B. ein schnelles reines Textmodell) jedoch günstiger und schneller sein. Der multimodale Charakter macht Qwen3.7 Flash zu einem starken Kandidaten für Anwendungen mit gemischten Medien, wie z. B. die Analyse von E-Commerce-Produkten aus Bildern und Beschreibungen oder Echtzeit-Videoüberwachungsassistenten.
Während Qwen3.7 Flash im Vergleich zu größeren Flaggschiffmodellen hinsichtlich Geschwindigkeit und Kosten optimiert ist, kann es für einfache Anwendungsfälle dennoch übertrieben sein. Wenn Ihre Anwendung nur kurze Textsequenzen verarbeitet (z. B. ein paar hundert Tokens pro Nachricht), ist ein kleineres, reines Textmodell mit niedrigeren Kosten pro Token wirtschaftlicher. Wenn Sie nie Bilder oder Videos analysieren müssen, vermeiden Sie mit einem reinen Textmodell von OrcaRouter die Bezahlung ungenutzter Bildverarbeitungsfunktionen. Aufgaben, die nur minimale Schlussfolgerungen erfordern, wie eine einfache Klassifizierung oder einfache Übersetzung, können von leichteren Modellen mit geringerer Latenz bewältigt werden. Für Entwicklung und Prototyping spart die Verwendung eines günstigeren Modells während der Iteration Guthaben. Der 1M-Token-Kontext ist ein großer Vorteil, wenn er benötigt wird, aber wenn Ihr durchschnittlicher Prompt unter 10k Tokens liegt, sind die Kosten für die Verarbeitung großer Stapel-Eingaben möglicherweise nicht gerechtfertigt. Bewerten Sie Ihr typisches Arbeitsvolumen und Ihre Modalitätsanforderungen, bevor Sie sich für Qwen3.7 Flash entscheiden.
Qwen3.7 Flash ist möglicherweise nicht die beste Wahl für Aufgaben, die extrem hohe mathematische Präzision, mehrstufiges symbolisches Denken oder domänenspezifische Fachkenntnisse erfordern, die nicht in seinen Trainingsdaten vorhanden sind. Die „Flash“-Variante tauscht wahrscheinlich etwas Tiefe gegen Geschwindigkeit, daher könnten komplexe Denkaufgaben besser von größeren Non-Flash-Modellen bewältigt werden. Wenn Ihre Anwendung zudem eine Echtzeit-Audioverarbeitung (z. B. Speech-to-Text) erfordert, sind die Eingabemodalitäten von Qwen3.7 Flash auf Text, Bild und Video beschränkt; es akzeptiert keine direkten Audiostreams. Für Aufgaben, die eine konsistente Formatierung über sehr lange Ausgaben hinweg erfordern, ist die maximale Ausgabelänge von 65.536 Token des Modells großzügig, aber sehr lange Generierungen können zu Wiederholungen oder Themenabweichungen neigen. Sicherheitsrelevante Anwendungen sollten auf Ausrichtung getestet werden, da in den Fakten keine spezifischen Sicherheitsbewertungen bereitgestellt werden. Multimodale Aufgaben mit minderwertigen oder stark mehrdeutigen Bildern/Videos können unzuverlässige Ergebnisse liefern.
Es werden keine Benchmark-Ergebnisse in den verfügbaren Fakten für Qwen3.7 Flash bereitgestellt. Daher können keine spezifischen Zahlen zitiert werden. Im Allgemeinen sind Flash-Varianten von großen Sprachmodellen für schnellere Inferenz und geringere Kosten ausgelegt, oft mit einer moderaten Genauigkeitsreduktion im Vergleich zu ihren größeren Gegenstücken. Benutzer, die an einer quantitativen Bewertung interessiert sind, sollten ihre eigenen Benchmarks mit der OrcaRouter-API an repräsentativen Aufgaben durchführen, wie z. B. Standard-NLP-Benchmarks, multimodale Verständnistests und Genauigkeit bei langen Kontextabrufen. Beim Vergleich mit anderen Modellen ist es üblich, Metriken wie MMLU, HumanEval oder multimodale Benchmarks (z. B. MMMU, ChartQA) zu betrachten. Ohne veröffentlichte Ergebnisse sollten die Stärken und Schwächen des Modells empirisch ermittelt werden. OrcaRouter bietet möglicherweise zusätzliche Metadaten oder Leistungs-Dashboards. Für Produktionsentscheidungen wird empfohlen, A/B-Tests mit Ihren spezifischen Daten durchzuführen.
Konkrete Latenz- oder Durchsatzwerte für Qwen3.7 Flash sind in den Fakten nicht angegeben. Als „Flash“-Modell ist es jedoch grundsätzlich darauf optimiert, Antworten schneller zu liefern als größere, nicht-Flash-Modelle derselben Familie. Die tatsächliche Geschwindigkeit hängt von Faktoren wie Eingabelänge, Ausgabe-Token-Anzahl, Batch-Größe und der zugrunde liegenden Hardware-Infrastruktur ab, die von OrcaRouter verwendet wird. Benutzer können eine niedrigere Zeit bis zum ersten Token für kurze Prompts und angemessene Tokens-pro-Sekunde für Streaming-Antworten erwarten. Angesichts des 1M-Token-Kontexts wird die Verarbeitung sehr langer Eingaben aufgrund des Aufmerksamkeitsmechanismus des Modells länger dauern. Bei latenzkritischen Anwendungen verbessert die Verwendung eines kleineren Kontexts (auch wenn das Limit hoch ist) die Antwortzeiten. Tests über die API von OrcaRouter mit repräsentativen Payload-Größen sind der beste Weg, um die reale Leistung zu messen. Die API unterstützt Streaming, was die inkrementelle Anzeige von Ausgabe-Tokens ermöglicht und die wahrgenommene Latenz für Endbenutzer reduziert.
Stärken: Der 1M-Token-Kontext des Modells ermöglicht die Verarbeitung sehr langer Dokumente in einem einzigen Durchgang, wodurch die Komplexität von Chunking oder Schiebefenstern vermieden wird. Die multimodale Unterstützung (Text, Bild, Video) ermöglicht umfangreiche Interaktionen ohne separate Modelle. Die Ausgabekapazität von 65,536 Token ist großzügig für die Erstellung umfassender Berichte oder Code. Als Flash-Variante bietet es wahrscheinlich ein günstiges Verhältnis von Geschwindigkeit und Kosten für viele Produktionsworkloads. Einschränkungen: Es werden keine spezifischen Benchmarks bereitgestellt, daher sind seine logischen Fähigkeiten und Genauigkeit im Vergleich zu vollwertigen Modellen unbekannt. Die multimodalen Fähigkeiten könnten bei fein granularen Aufgaben nicht mit dedizierten Bildverarbeitungsmodellen mithalten. Die Grenzen der Videoverarbeitung sind nicht definiert – Benutzer müssen möglicherweise Videos in einzelne Bildframes vorverarbeiten. Es gibt keine Erwähnung von Audioeingabe oder Tool-Use-Unterstützung. Wie bei jedem Modell sollten die Ausgaben auf Korrektheit und Sicherheit überprüft werden, insbesondere in sensiblen Bereichen. Das Fehlen offengelegter Trainingsdaten macht Verzerrungen und Robustheit unbekannt.
In den verfügbaren Fakten wird keine spezifische Preisgestaltung pro Token für Qwen3.7 Flash angegeben. OrcaRouter berechnet im Allgemeinen basierend auf der Anzahl der verarbeiteten Eingabe-Token und Ausgabe-Token, wobei die Kosten je nach Modellstufe variieren. Als „Flash“-Modell ist es wahrscheinlich günstiger als Flaggschiff-Modelle (z. B. Qwen3.7 Max), um den Kompromiss zwischen Geschwindigkeit und Effizienz widerzuspiegeln. Preisdetails sollten auf der offiziellen Preisseite oder dem Dashboard von OrcaRouter eingeholt werden. Bei der Kostenschätzung ist zu beachten, dass das 1-Millionen-Token-Kontextfenster zu großen Eingabe-Token-Anzahlen führen kann, wenn es gefüllt wird. Beispielsweise verursacht eine Eingabe von 500.000 Token proportional höhere Kosten als eine Eingabe von 10.000 Token. Nutzer mit einem knappen Budget sollten ihre Kontextnutzung richtig dimensionieren – nur notwendige Token einfügen. Die API wird pro Token abgerechnet, daher können Caching-Strategien, die im nächsten Abschnitt besprochen werden, helfen, wiederholte Eingabekosten zu reduzieren.
Der Hauptkompromiss liegt zwischen Kontextgröße und Kosten. Während das Modell bis zu 1M Token unterstützt, erhöht die Verarbeitung sehr langer Eingaben die Rechnung linear. Wenn der vollständige Kontext nicht erforderlich ist, reduziert das Kürzen oder Zusammenfassen alter Inhalte die Ausgaben. Ebenso kostet die Generierung sehr langer Ausgaben (bis zu 65k Token) mehr als kurze Antworten. Beim Vergleich von Qwen3.7 Flash mit kleineren, reinen Textmodellen: Wenn Ihr Arbeitsablauf keine multimodalen oder Langkontext-Fähigkeiten erfordert, ist ein günstigeres Modell möglicherweise ratsam. Da keine Preise veröffentlicht sind, können wir keine genauen Vergleiche anstellen. Allerdings sind Flash-Modelle in der Regel 10-50 % günstiger pro Token als ihre vollwertigen Pendants und bieten dabei vergleichbare Geschwindigkeit. Erwägen Sie die Verwendung von Caching, um die erneute Verarbeitung identischer Eingabe-Präfixe zu vermeiden. OrcaRouter könnte Rabatte für Prompt-Caching anbieten (nicht spezifiziert). Überwachen Sie in der Produktion Ihren Token-Verbrauch über die Nutzungsmetriken von OrcaRouter und passen Sie Parameter wie max_tokens und Kontextlänge an, um die Kosten zu kontrollieren.
OrcaRouter bietet möglicherweise automatisches Caching von Eingabe-Präfixen an, um Kosten und Latenz zu reduzieren, aber die spezifische Caching-Richtlinie für Qwen3.7 Flash wird in den bereitgestellten Fakten nicht detailliert beschrieben. Viele API-Anbieter gewähren Rabatte auf Tokens, wenn dasselbe Prompt-Präfix über mehrere Anfragen hinweg wiederverwendet wird, oft mit einem Frischefenster. Wenn Caching aktiviert ist, können wiederholte System-Prompts oder gemeinsamer Kontext günstiger verarbeitet werden. Benutzer sollten die Dokumentation von OrcaRouter oder die API-Antwortheader überprüfen (z. B. ob sie einen Cache-Hit-Indikator enthalten), um festzustellen, ob Caching angewendet wird. Bei multimodalen Eingaben ist Caching aufgrund der Vielfalt der visuellen Inhalte weniger effektiv. Um die Vorteile des Cachings zu maximieren, strukturieren Sie Ihre Prompts mit einer statischen Systemnachricht und minimaler Variation im Präfix. Wenn Caching nicht verfügbar ist, erwägen Sie, Anfragen zu bündeln oder eine dedizierte Anfragebibliothek zu verwenden, die Prompt-Caching-Mechanismen unterstützt.
Um Qwen3.7 Flash mit der OpenAI Python-Bibliothek aufzurufen, setzen Sie die Basis-URL und den API-Schlüssel für OrcaRouter. Beispielcodeausschnitt: ```python import openai client = openai.OpenAI( api_key="your-orcarouter-api-key", base_url="https://api.orcarouter.ai/v1" ) response = client.chat.completions.create( model="qwen/qwen3.7-flash", messages=[ {"role": "user", "content": "Hallo, was kannst du tun?"} ], max_tokens=1024, temperature=0.7 ) print(response.choices[0].message.content) ``` Für multimodale Eingaben mit Bildern oder Videos fügen Sie die Medien als Teil des content-Arrays mit dem Typ "image_url" (für Bilder) oder einem strukturierten Objekt für Video ein (Details hängen von der OrcaRouter-Spezifikation ab). Die Modell-ID muss exakt "qwen/qwen3.7-flash" lauten. Alle standardmäßigen OpenAI-Parameter (stream, top_p, stop usw.) werden unterstützt. Stellen Sie sicher, dass Ihr API-Schlüssel Zugriff auf dieses Modell hat.
Bei Verwendung der OpenAI-kompatiblen API von OrcaRouter unterstützt Qwen3.7 Flash die Standard-Parameter für Chat-Vervollständigungen: - model: Zeichenkette, muss „qwen/qwen3.7-flash“ sein - messages: Array von Nachrichtenobjekten mit role und content - max_tokens: Ganzzahl bis zu 65.536 (maximale Ausgabe des Modells) - temperature: float (0 bis 2, typischerweise 0,0–1,0) - top_p: float für Nukleus-Sampling - stream: Boolean für Token-Streaming - stop: Zeichenkette oder Array von Zeichenketten für benutzerdefinierte Stopp-Token - presence_penalty, frequency_penalty: Wiederholung anpassen - logprobs: Token-Log-Wahrscheinlichkeiten anfordern - user: Zeichenkette zum Verfolgen von Anfragen Für multimodale Eingaben kann das content-Feld eine Liste von Inhaltsbestandteilen (Text oder image_url) sein. Die Videoverarbeitung erfordert möglicherweise zusätzliche Parameter, die hier nicht behandelt werden. Die API unterstützt auch Funktionsaufrufe und den JSON-Modus, sofern OrcaRouter diese implementiert; Dokumentation prüfen. Es werden keine spezifischen Details zur Werkzeugnutzung in den Fakten bereitgestellt. Standardwerte für temperature und top_p sind typischerweise 1,0 bzw. 0,0.
Die Migration von einem beliebigen OpenAI-kompatiblen Modell (einschließlich OpenAIs GPT-Modellen) zu Qwen3.7 Flash auf OrcaRouter erfordert nur minimale Änderungen: Aktualisieren Sie die Basis-URL auf https://api.orcarouter.ai/v1, setzen Sie den Modellparameter auf "qwen/qwen3.7-flash" und besorgen Sie sich einen OrcaRouter-API-Key. Das Nachrichtenformat bleibt für reine Textkonversationen identisch. Für multimodale Eingaben stellen Sie sicher, dass Sie OrcaRouters spezifisches Schema für Bilder und Videos befolgen – dieses kann geringfügig von OpenAIs Format abweichen. Wenn Sie zuvor nur Textmodelle verwendet haben, können Sie jetzt visuelle Inhalte einbringen. Möglicherweise müssen Sie max_tokens anpassen, wenn Ihr vorheriges Modell eine kleinere Grenze hatte (OpenAI GPT-4o-mini hat 16k Ausgabe; dieses Modell hat 65k). Außerdem ist der Kontextfenster viel größer (1M gegenüber typischen 128k), sodass Sie längere Prompts einreichen können. Testen Sie mit einer Teilmenge Ihrer Daten, um Antwortqualität und Latenz zu überprüfen. OrcaRouters API kann andere Ratenbegrenzungen haben; lesen Sie die Dokumentation.
Authentifizierung erfolgt über einen API-Schlüssel, der von OrcaRouter bereitgestellt wird. Sie müssen den API-Schlüssel im HTTP Authorization-Header als Bearer-Token angeben: "Authorization: Bearer your-api-key". Im OpenAI Python-Client übergeben Sie den Schlüssel über den Parameter api_key. Stellen Sie sicher, dass dem Schlüssel Zugriff auf das Modell "qwen/qwen3.7-flash" gewährt wurde; manche Schlüssel sind auf bestimmte Modelle oder Tarife beschränkt. Geben Sie Ihren API-Schlüssel nicht öffentlich weiter. Verwenden Sie für die Produktion Umgebungsvariablen oder einen sicheren Secrets-Manager. OrcaRouter unterstützt möglicherweise auch andere Authentifizierungsmethoden (z. B. OAuth), aber der OpenAI-kompatible Endpunkt verwendet in der Regel die API-Schlüssel-Authentifizierung. Wenn Sie einen 401 Unauthorized-Fehler erhalten, überprüfen Sie, ob der Schlüssel korrekt und aktiv ist. Der API-Schlüssel sollte vertraulich behandelt werden; falls er kompromittiert wurde, rotieren Sie ihn über das Dashboard von OrcaRouter.
Sowohl Qwen3.7 Flash als auch GPT-4o-mini sind multimodale Modelle, die auf Geschwindigkeit und Kosten optimiert sind, aber es gibt wichtige Unterschiede basierend auf den verfügbaren Fakten. Qwen3.7 Flash bietet ein riesiges Kontextfenster von 1M Token, während GPT-4o-mini 128k Token unterstützt. Für Aufgaben, die sehr lange Kontexte oder die Verarbeitung großer Videos erfordern, hat Qwen3.7 Flash einen klaren Vorteil. Die maximale Ausgabe von GPT-4o-mini beträgt 16,384 Token; Qwen3.7 Flash erlaubt bis zu 65,536 Token. Auf dieser Seite werden für keines der Modelle Benchmark-Werte bereitgestellt. Im Allgemeinen profitiert GPT-4o-mini von umfangreichem Fine-Tuning und breiter Ökosystemunterstützung, während Qwen3.7 Flash aufgrund seiner Trainingsdaten möglicherweise in asiatischen Sprachverständnis hervorragt (nicht bestätigt). Die API-Kompatibilität bedeutet, dass der Wechsel zwischen ihnen auf OrcaRouter unkompliziert ist. Die Preisgestaltung ist nicht angegeben, daher hängt der Kostenvergleich von den Tarifen von OrcaRouter ab. Wählen Sie basierend auf den Anforderungen an die Kontextlänge und der gewünschten Antwortlänge.
Qwen3.7 Flash ist eine Variante der Qwen 3.7-Familie, die für schnellere Inferenz und niedrigere Kosten entwickelt wurde, wobei im Vergleich zum Flaggschiff Qwen3.7 Max typischerweise etwas Genauigkeit eingebüßt wird. Obwohl keine spezifischen Benchmark-Unterschiede angegeben werden, erzielen Max-Modelle in der Regel höhere Ergebnisse bei Reasoning- und Mathe-Aufgaben, während Flash-Modelle den Durchsatz priorisieren. Der Kontextbereich und die maximale Ausgabe sind bei beiden identisch (1 Mio. Eingabe, 65.000 Ausgabe), sodass die Hauptunterschiede in der Leistung pro Token und der Latenz liegen. Wenn Ihre Anwendung eine etwas geringere Genauigkeit toleriert, aber niedrige Latenz oder hohe Parallelität erfordert, ist Flash geeignet. Für Aufgaben, die höchste Qualität verlangen, wie z. B. komplexe Codegenerierung oder fortgeschrittenes Reasoning, kann sich der Aufpreis für Max lohnen. Die Modell-IDs auf OrcaRouter sind unterschiedlich: eine lautet „qwen/qwen3.7-flash“, die andere vermutlich „qwen/qwen3.7-max“. Benutzer sollten beide anhand ihrer spezifischen Daten evaluieren, um die beste Wahl zu treffen.
Qwen3.7 Flash, über OrcaRouter zugänglich, bietet einen verwalteten API-Dienst ohne Infrastrukturaufwand, während LLaVA-Next (ein Open-Source-Multimodalmodell) selbst gehostet werden muss. Dies betrifft Kosten, Skalierbarkeit und Wartung. Qwen3.7 Flash unterstützt bis zu 1M Kontext-Token und 65k Ausgabe, was in der Regel größer ist als das Kontextfenster von LLaVA-Next. LLaVA-Next kann jedoch mit benutzerdefinierten Daten feinabgestimmt werden, was für Qwen3.7 Flash über die API nicht als verfügbare Option genannt wird. Ohne Benchmarks können wir die Genauigkeit nicht vergleichen. LLaVA-Next ist stark in der visuellen Fragebeantwortung; Qwen3.7 Flash könnte eine breitere Sprachabdeckung haben. OrcaRouter kümmert sich um Verfügbarkeit und Kapazität, während Selbsthosting GPU-Ressourcen erfordert. Für schnelles Prototyping und geringen Wartungsaufwand ist das API-Modell attraktiv. Für vollständige Kontrolle und spezialisiertes Training könnte Open-Source besser sein. Das geistige Eigentum des API-Modells gehört Qwen, daher können die Ausgaben andere Nutzungsbedingungen haben.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.7-flash",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoninglogprobsmax_tokenspresence_penaltyreasoningresponse_formatseedtemperaturetool_choicetoolstop_logprobstop_p| Stufe | Eingabe / 1M Tokens | Ausgabe / 1M Tokens | Cache-Lesen / 1M | Cache-Schreiben / 1M |
|---|---|---|---|---|
| ≤ 32K | $0.030 | $0.130 | $0.0060 | $0.038 |
| ≤ 256K | $0.100 | $0.400 | $0.020 | $0.125 |
| ≤ ∞ | $0.200 | $0.800 | $0.040 | $0.250 |
| Stufe wird durch die Eingabe-Token-Anzahl jeder Anfrage bestimmt | ||||
Schätzung auf Basis des Listenpreises
Gestaffelte Preise — diese Schätzung verwendet die Basisstufe.
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/qwen/qwen3.7-flashÖffnen @misc{orcarouter_qwen3_7_flash,
title = {Qwen3.7 Flash API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.7-flash}
}Qwen. (2026). Qwen3.7 Flash API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.7-flash