Qwen3-VL 235B-A22B Instruct — Open-Weight-Vision-Language-Modell, 235B gesamt / 22B aktive Parameter, 256k Kontext, kein Denkmodus.
Qwen3 VL 235B A22B Instruct ist eine visuell-sprachliche Variante der Qwen3-Modellreihe, entwickelt von Alibaba Cloud. Sie verwendet eine Mixture-of-Experts-Architektur mit insgesamt 235 Milliarden…
Das Modell zeichnet sich bei Aufgaben aus, bei denen Bilder und Text interagieren. Es kann Fragen zum Inhalt eines Bildes beantworten, Szenen detailliert beschreiben, Text aus Dokumenten oder Schildern lesen und über Beziehungen zwischen Objekten in einem Bild schlussfolgern. Es verarbeitet auch mehrere Bilder in einer einzelnen Konversation, was vergleichende Analysen oder sequenzielles Denken ermöglicht. Das Instruction Tuning befähigt das Modell, komplexe multimodale Anweisungen wie 'Explain why this chart shows a trend' oder 'Extract all numerical values from this table' zu befolgen. Diese Fähigkeiten resultieren aus dem großen MoE-Backbone und dem spezialisierten Vision-Language-Training.
Als Instruct-Variante wurde das Modell feinabgestimmt, um Benutzeranweisungen sowohl bei reinen Text- als auch bei multimodalen Prompts mit hoher Genauigkeit zu befolgen. Es kann Mehrfachdialoge verarbeiten, bei denen Bilder schrittweise eingeführt werden, den Kontext über mehrere Austausche hinweg beibehalten und Formatierungsanweisungen befolgen (z. B. Ausgabe als JSON, Aufzählungspunkte oder schrittweise). Es erfüllt Aufgaben, die die Einhaltung von Einschränkungen erfordern, wie z. B. „Antworte nur, wenn das Bild einen Hund enthält.“ Dies macht es geeignet für Anwendungen, bei denen konsistentes, regelkonformes Verhalten wichtig ist.
Für reine Textaufgaben ohne visuelle Komponente könnte das 235B MoE-Modell überdimensioniert sein; kleinere dichte Modelle oder andere rein textbasierte Qwen-Varianten wären kosteneffizienter. Ähnlich verhält es sich, wenn Ihre Bilder einfach sind (z. B. einfache Logos, einzelne Objekte) oder Sie ein extrem hohes Durchsatzvolumen bei begrenztem Budget benötigen, könnte ein kleineres Vision-Modell wie Qwen2-VL 7B ausreichen. Dieses Modell ist am ehesten gerechtfertigt, wenn Sie komplexe, hochauflösende Bilder, Dokumente mit dichtem Text oder Aufgaben bearbeiten müssen, die tiefgehendes multimodales Denken erfordern. Auf OrcaRouter können Sie Preise vergleichen und Modell-IDs einfach wechseln.
Nein. Qwen3 VL 235B A22B Instruct ist ein Textgenerierungsmodell, das nur Bilder als Eingabe akzeptiert. Es generiert keine Bilder, Audiodateien oder andere Modalitäten. Die Ausgabe ist immer eine Textzeichenfolge. Falls Sie Bildgenerierung benötigen, würden Sie ein separates Modell verwenden. Die Stärke dieses Modells liegt im Verständnis und in der Schlussfolgerung über visuelle Eingaben. Es kann beispielsweise beschreiben, wie ein Bild aussieht, oder Fragen dazu beantworten, aber es kann selbst keine Bilder erstellen, bearbeiten oder transformieren.
Der berichtete MMLU-Pro-Wert für dieses Modell beträgt 82,3. MMLU-Pro ist eine erweiterte Version des Massive Multitask Language Understanding Benchmarks und umfasst 57 Fächer aus den Bereichen STEM, Geistes- und Sozialwissenschaften. Ein Wert von 82,3 deutet auf starkes Allgemeinwissen und logisches Denken in verschiedenen Themenbereichen hin. Es handelt sich um eine aggregierte Einzelzahl; die Leistung kann je nach Fach variieren. Dieser Wert platziert das Modell unter den Spitzenreitern seiner Größenklasse, insbesondere angesichts der MoE-Architektur, die pro Abfrage nur einen Bruchteil seiner Gesamtparameter aktiviert.
Zu den Stärken zählen eine hohe Genauigkeit bei multimodalen Reasoning-Benchmarks, eine starke Befolgung von Anweisungen und Kosteneffizienz im Vergleich zu dichten Modellen mit ähnlicher Gesamtparameterzahl. Das MoE-Design ermöglicht es, die Kapazität zu skalieren, ohne dass die Rechenkosten proportional steigen. Zu den Einschränkungen gehören höhere absolute Kosten im Vergleich zu kleineren Modellen, potenziell erhöhte Latenzzeiten aufgrund der großen Anzahl von Gesamtparametern (obwohl nur 22B aktiv sind, muss das vollständige Modell in den Speicher geladen werden). Es kann auch gelegentlich feine Details in Bildern halluzinieren oder bei stark mehrdeutigen visuellen Eingaben versagen. Die Leistung bei spezifischen Bereichsaufgaben (z. B. medizinische Bildgebung) ist nicht garantiert.
Die Inferenzgeschwindigkeit hängt vom verwendeten Hardware-Backend von OrcaRouter und der aktuellen Last ab. Als MoE-Modell mit insgesamt 235 Milliarden Parametern benötigt es erheblichen GPU-Speicher, obwohl nur 22 Milliarden Parameter pro Token aktiviert werden. Dies führt im Vergleich zu kleineren dichten Modellen (z. B. 7B-70B Parameter) typischerweise zu einer höheren Latenz pro Anfrage. Der Durchsatz wird auch durch Batch-Größe und Sequenzlänge beeinflusst. Für latenzempfindliche Anwendungen sollten Sie ein kleineres Modell verwenden oder kürzere Prompts optimieren. OrcaRouter bietet keine spezifischen Latenzgarantien, zielt jedoch auf eine produktionsreife Reaktionsfähigkeit ab.
OrcaRouter berechnet exakt den vom Anbieter gelisteten Tarif: $0.40 pro 1 Million Eingabe-Token und $1.60 pro 1 Million Ausgabe-Token. Es gibt keinen zusätzlichen Aufschlag. Sowohl Eingabe- als auch Ausgabe-Token werden gemäß den Tokenisierungsregeln von OpenAI gezählt, die geringfügig vom internen Tokenizer des Modells abweichen können. Bilder werden ebenfalls als Token basierend auf ihren Abmessungen und Detaillierungsgrad abgerechnet, gemäß der Richtlinie des Anbieters. Sie können die Kosten schätzen, indem Sie Ihre erwartete Token-Nutzung mit diesen Tarifen multiplizieren.
Die Kosten pro Token sind höher als bei kleineren oder dichten Modellen, aber die MoE-Architektur bietet mehr Kapazität pro aktivem Parameter als ein dichtes Modell mit vergleichbarer aktiver Größe. Für komplexe multimodale Aufgaben kann dieses Modell die Aufgabe mit weniger Tokens oder höherer Genauigkeit abschließen, was die Gesamtausgaben senken kann. Für einfache Aufgaben würde jedoch ein günstigeres Modell die Kosten verringern. Auf OrcaRouter können Sie Modelle spontan umschalten, sodass Sie dieses Modell nur bei Bedarf einsetzen können. Es gibt keine monatlichen Mindestverpflichtungen oder versteckten Gebühren.
OrcaRouter gibt derzeit keine spezifischen Caching-Richtlinien für dieses Modell bekannt. Token-basiertes Caching kann vom zugrunde liegenden Anbieter angewendet werden, ist jedoch nicht garantiert. Es werden keine Mengenrabatte oder gestaffelten Preise erwähnt; die Tarife sind flach pro Token. Für Nutzer mit hohem Volumen kann es sich lohnen, den OrcaRouter-Support zu kontaktieren, um mögliche individuelle Vereinbarungen zu treffen. Generell ist die Preisgestaltung transparent und nutzungsabhängig.
Bilder werden basierend auf ihrer Auflösung und Detailstufe in eine Token-Anzahl umgewandelt. Die genaue Formel wird vom Anbieter (Qwen) festgelegt und kann variieren. Höher aufgelöste Bilder verbrauchen in der Regel mehr Tokens. OrcaRouter leitet die Tokenisierung des Anbieters unverändert weiter. Sie können Kosten steuern, indem Sie Bilder verkleinern oder den Modus mit niedriger Detailstufe verwenden, falls das Modell dies unterstützt. Für die genaue Berechnung der Bild-Tokens konsultieren Sie stets die Dokumentation des Anbieters. Eingabe-Tokens für Bilder werden zum Satz von $0,40 pro Million gezählt.
Sie senden eine POST-Anfrage an https://api.orcarouter.ai/v1/chat/completions mit einem OpenAI-kompatiblen JSON-Payload. Setzen Sie das model-Feld auf "qwen/qwen3-vl-235b-a22b-instruct". Fügen Sie ein messages-Array hinzu, wobei jede Nachricht Text- und/oder Bildinhalt enthalten kann. Verwenden Sie für Bilder das standardmäßige OpenAI-Bildinhaltsformat (URL oder base64). Die Authentifizierung erfolgt über ein Bearer-Token (Ihren API-Schlüssel). Beispielparameter: temperature, max_tokens, top_p und stop-Sequenzen funktionieren identisch zur OpenAI-API. Die Dokumentation von OrcaRouter bietet vollständige Details.
Alle standardmäßigen Chat-Vervollständigungsparameter werden unterstützt: temperature (0-2, Standard 1), top_p (0-1, Standard 1), max_tokens (Anzahl der Ausgabetokens), stop (Liste von Zeichenfolgen), presence_penalty, frequency_penalty und seed für Reproduzierbarkeit. Das Modell respektiert auch Systemnachrichten zur Festlegung des Verhaltens. Für multimodale Anfragen fügen Sie einen Bildteil in den Inhalt einer Benutzernachricht ein. Es werden keine modellspezifischen Parameter verfügbar gemacht; die API wird aus Kompatibilitätsgründen generisch gehalten. Wenn Sie das MoE-Routing steuern müssen, wird dies intern gehandhabt.
Ja. Da OrcaRouter das OpenAI API-Format verwendet, ist die Migration unkompliziert. Ersetzen Sie Ihre bisherige Basis-URL und Modell-ID durch den OrcaRouter-Endpunkt und "qwen/qwen3-vl-235b-a22b-instruct". Stellen Sie sicher, dass Ihr API-Schlüssel gültig ist und Sie über ausreichend Guthaben verfügen. Das Nachrichtenformat für Bilder ist identisch mit dem von OpenAI (unter Verwendung des Inhalts-Typs 'image_url'). Möglicherweise müssen Sie die Token-Anzahlschätzungen aufgrund einer anderen Tokenisierung anpassen. Außer dem Endpunkt und dem Modellnamen sind keine Änderungen an der Logik Ihrer Anwendung erforderlich.
Qwen3 VL 235B A22B Instruct und GPT-4V verarbeiten beide multimodale Eingaben. Hauptunterschiede: Qwen3 VL verwendet MoE mit 22B aktiven Parametern, während GPT-4V ein proprietäres dichtes Modell mit nicht offengelegter Größe ist. Die Preise für Qwen3 VL über OrcaRouter betragen 0,40 $/1,60 $ pro Million Tokens, was deutlich niedriger ist als die typischen GPT-4V-Tarife. Die Benchmark-Ergebnisse sind nicht direkt vergleichbar, da MMLU-Pro und andere Tests unterschiedliche Teilmengen verwenden. GPT-4V bietet eine breitere Ökosystemunterstützung, aber Qwen3 VL bietet einen Kostenvorteil für hochvolumige multimodale Workloads auf OrcaRouter.
Claude 3.5 Sonnet ist ein dichtes Modell von Anthropic mit starken Text- und Vision-Fähigkeiten. Es verwendet kein MoE, daher ist seine Gesamtkapazität geringer als die Gesamtparameter von Qwen3 VL, aber seine aktive Kapazität pro Inferenz ist höher als 22B. Die Preisgestaltung für Claude 3.5 Sonnet ist im Allgemeinen höher pro Token (ca. $3,00/$15,00 pro Million Tokens). Qwen3 VL bietet viel niedrigere Kosten für multimodale Aufgaben. Allerdings haben Claude-Modelle einen größeren Kontextfenster (200K Tokens). Die Wahl hängt vom Budget, den Anforderungen an die Kontextlänge und dem bevorzugten Anbieter ab.
OrcaRouter bietet wahrscheinlich andere Qwen-Modelle wie Qwen2.5 7B, Qwen2.5 72B oder Qwen2-VL-Varianten an. Das Qwen3 VL 235B A22B Instruct ist das größte multimodale MoE-Modell in der Qwen-Reihe. Im Vergleich zu Qwen2-VL 72B hat es mehr Gesamtparameter und eine MoE-Architektur, was eine bessere Leistung bei komplexen Aufgaben ermöglichen kann, während die Inferenzkosten angemessen bleiben. Es ist pro Token teurer als kleinere Qwen-Modelle, kann aber kosteneffizient sein, wenn es die Notwendigkeit mehrerer Aufrufe oder hohen Tokenverbrauch reduziert.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3-vl-235b-a22b-instruct",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)| Eingabe / 1M Tokens | $0.400 |
| Ausgabe / 1M Tokens | $1.60 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/qwen/qwen3-vl-235b-a22b-instructÖffnen @misc{orcarouter_qwen3_vl_235b_a22b_instruct,
title = {Qwen3 VL 235B A22B Instruct API},
author = {Qwen},
year = {2025},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct}
}Qwen. (2025). Qwen3 VL 235B A22B Instruct API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3-vl-235b-a22b-instruct