Qwen3.7 Flash

qwen/qwen3.7-flash
NeuEmpfohlen
VisionToolsJSONReasoning
von Qwen · 2026-07-27

Qwen3.7 Flash ist das schnelle, äußerst kosteneffiziente Modell von Alibaba in der Qwen3.7-Familie, das als High-Throughput-Stufe unter Qwen3.7-Plus und Qwen3.7-Max angesiedelt ist. Es ist eingangsseitig nativ multimodal – es akzeptiert Text, Bilder und Videos mit Textausgabe – und bietet ein Kontextfenster von 1M Token mit bis zu 64K Ausgabetoken, sodass lange Dokumente, Screenshots und Videobilder selbst zu Flash-Preisen in Reichweite bleiben. Mit etwa $0.03 pro Million Eingabetoken in der Basisstufe ist es eines der günstigsten multimodalen Modelle mit 1M Kontext, was es zu einer natürlichen Wahl für Klassifikation, Extraktion, Routing, Zusammenfassung, leichte Agenten und jede Pipeline mit sehr hohem Volumen macht. Es unterstützt Reasoning-Modus, natives Tool Calling, strukturierte Ausgaben über response_format und die üblichen Sampling-Steuerungen (temperature / top_p / seed / logprobs). Beachten Sie, dass die Preisgestaltung nach Prompt-Länge gestaffelt ist: Die Kosten steigen ab 32K und erneut ab 256K Eingabetoken an, sodass das Bündeln kurzer Anfragen wesentlich günstiger ist als das Auffüllen langer. Verwenden Sie Flash als Volumen-Arbeitspferd und steigen Sie auf Qwen3.7-Plus oder Max um, wenn eine Aufgabe tatsächlich mehr Leistung benötigt.

Ktx1M Tokens
Max. Ausgabe65K
Eingabetext + image + video
Ausgabetext
p50 TTFT2.83 s
EINGABE$0.03/ 1M Tokens
AUSGABE$0.13/ 1M Tokens
p50 TTFT2.83 s7 T
p95 TTFT9.64 s7 T
DATENVERKEHR13.5MTokens / 7 T

Qwen3.7 Flash ist ein multimodales großes Sprachmodell, das vom Qwen-Team entwickelt und über OrcaRouter bereitgestellt wird. Es verarbeitet Text-, Bild- und Videoeingaben und unterstützt einen…

Was ist Qwen3.7 Flash und wer sollte es verwenden?

Welche Eingabemodalitäten unterstützt Qwen3.7 Flash?

Wie groß ist das Kontextfenster von Qwen3.7 Flash?

Wie wird Qwen3.7 Flash über OrcaRouter aufgerufen?

Code-Beispiele

Aus jedem SDK aufrufen

OpenAI-kompatibel — behalte dein bisheriges SDK

  • OpenAI SDKhttps://api.orcarouter.ai/v1
import os

from openai import OpenAI

client = OpenAI(
    base_url="https://api.orcarouter.ai/v1",
    api_key=os.environ["ORCAROUTER_API_KEY"],
)

response = client.chat.completions.create(
    model="qwen/qwen3.7-flash",
    messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)

Unterstützte Parameter

  • include_reasoning
  • logprobs
  • max_tokens
  • presence_penalty
  • reasoning
  • response_format
  • seed
  • temperature
  • tool_choice
  • tools
  • top_logprobs
  • top_p

Preise

StufeEingabe / 1M TokensAusgabe / 1M TokensCache-Lesen / 1MCache-Schreiben / 1M
32K$0.030$0.130$0.0060$0.038
256K$0.100$0.400$0.020$0.125
$0.200$0.800$0.040$0.250
Stufe wird durch die Eingabe-Token-Anzahl jeder Anfrage bestimmt

Kostenrechner

Tokens / Monat10MM
Eingabeanteil70%%
Geschätzt / Monat $0.600 · Mit Prompt-Caching $0.516

Schätzung auf Basis des Listenpreises

Gestaffelte Preise — diese Schätzung verwendet die Basisstufe.

Token- und Kostenschätzer

Eingabe-Tokens: 27Kosten pro Anfrage: $0.000066

Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.

Leistung

p50 TTFT
2.83 s
Ausgabegeschwindigkeit
333 tok/s
p95 TTFT
9.64 s
Fehlerquote
0%

Öffentliche Benchmarks

Quelle: Design Arena

Community-Buzz

Worüber Entwickler diese Woche sprechen

Hacker News0 Erwähnungen · 7 T

Im Vergleich

Qwen3.7 Flashqwen/qwen3-max-previewQwen3.5 397B A17Bqwen/qwen3.5-plus
Eingabe $/M$0.03$0.86$0.17$0.12
Ausgabe $/M$0.13$3.44$1.03$0.69
Kontext1.0M262K33K1.0M
Qualität7/108/108/108/10
Nebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichenNebeneinander vergleichen

FAQ

Wie viel kostet Qwen3.7 Flash auf OrcaRouter?
Für Qwen3.7 Flash sind in den verfügbaren Fakten keine spezifischen Preise angegeben. OrcaRouter berechnet üblicherweise pro Token für Eingabe und Ausgabe. Als Flash-Modell ist es wahrscheinlich günstiger als Flaggschiff-Modelle. Besuchen Sie die Preisseite von OrcaRouter oder kontaktieren Sie den Support für aktuelle Tarife.
Wie groß ist das Kontextfenster von Qwen3.7 Flash?
Der Kontextfenster beträgt 1.000.000 Tokens. Dadurch kann das Modell sehr lange Dokumente, ausgedehnte Unterhaltungen oder große Mengen an Bildern/Videos in einem einzigen Prompt verarbeiten.
Was sind die Stärken von Qwen3.7 Flash?
Zu seinen Stärken gehören ein Kontext von 1 Million Token, Unterstützung für multimodale Eingaben (Text, Bild, Video), maximal 65.000 Ausgabe-Token sowie eine optimierte 'Flash'-Architektur, die Geschwindigkeit und Kosten ausbalanciert. Es eignet sich hervorragend für die Analyse langer Dokumente und multimodales Verständnis.
Wie schneidet Qwen3.7 Flash im Vergleich zu GPT-4o-mini ab?
Qwen3.7 Flash bietet einen deutlich größeren Kontextfenster (1M vs. 128k) und eine höhere maximale Ausgabe (65k vs. 16k). GPT-4o-mini kann eine breitere Ökosystemunterstützung bieten. Weder Preise noch Benchmarks werden für einen direkten Vergleich bereitgestellt.
Cacht OrcaRouter Prompts, um Kosten zu senken?
OrcaRouter bietet möglicherweise Prompt-Caching an, aber seine spezifische Richtlinie für Qwen3.7 Flash wird in den Fakten nicht detailliert beschrieben. Überprüfen Sie die Dokumentation von OrcaRouter auf Cache-Treffer-Indikatoren und Rabattinformationen.
Wie rufe ich Qwen3.7 Flash über eine OpenAI-kompatible API auf?
Setze die Basis-URL auf https://api.orcarouter.ai/v1 und verwende die Modell-ID "qwen/qwen3.7-flash". Füge deinen OrcaRouter-API-Schlüssel hinzu. Der Chat-Completions-Endpunkt funktioniert mit den standardmäßigen OpenAI-Parametern. Für multimodale Eingaben füge Bild- oder Videoobjekte im Nachrichteninhaltsarray hinzu.
Welche Eingabemodalitäten unterstützt Qwen3.7 Flash?
Es unterstützt Texteingaben, Bildeingaben und Videoeingaben. Dies ermöglicht Aufgaben wie die Analyse von Bildern zusammen mit Text, das Zusammenfassen von Videos und die Kombination mehrerer Medientypen in einer einzigen Eingabeaufforderung.
Kann ich Qwen3.7 Flash auf meinen eigenen Daten feinabstimmen?
Die verfügbaren Fakten erwähnen keine Feinabstimmungsmöglichkeiten. Als ein über API zugängliches Modell durch OrcaRouter ist eine Feinabstimmung wahrscheinlich nicht unterstützt. Für kundenspezifische Feinabstimmung ziehen Sie Open-Source-Alternativen in Betracht.
Was ist die maximale Ausgabelänge von Qwen3.7 Flash?
Die maximale Ausgabe beträgt 65.536 Tokens. Dies ermöglicht die Generierung sehr langer Antworten, Berichte oder Code in einem einzigen API-Aufruf.
Wie verarbeite ich Videoeingaben mit Qwen3.7 Flash?
Spezifische Details zur Videoverarbeitung werden nicht bereitgestellt. Typischerweise werden Videoeingaben als Bildsequenzen verarbeitet. Möglicherweise müssen Sie Videos in eine Reihe von Bildern vorverarbeiten und diese als Bild-URLs oder Base64-Daten übergeben. Konsultieren Sie die Dokumentation von OrcaRouter für die genaue Formatierung.

Dieses Abzeichen einbetten

Qwen: Qwen3.7 Flash$0.03/M in2828ms p50via OrcaRouter
HTML <a href="https://www.orcarouter.ai/models/qwen/qwen3.7-flash" target="_blank"> <img src="https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg" alt="Qwen: Qwen3.7 Flash auf OrcaRouter" /> </a>
Markdown [![Qwen: Qwen3.7 Flash](https://www.orcarouter.ai/embed/qwen/qwen3.7-flash.svg)](https://www.orcarouter.ai/models/qwen/qwen3.7-flash)

Modellkarte als Daten

GET /api/public/models/qwen/qwen3.7-flashÖffnen
Maschinenlesbar:/llms.txt/llms-full.txt