Qwen3.5 122B-A10B — Open-Weight-MoE multimodal (Text/Bild/Video), 122B gesamt / 10B aktive Parameter, 32k-Kontext (Vision-Modus)
Qwen3.5-122B-A10B ist ein großes Sprachmodell aus der Qwen-Reihe von Alibaba Cloud. Es verwendet eine Mixture-of-Experts (MoE)-Architektur, bei der pro Vorwärtsdurchlauf nur 10 Milliarden Parameter…
Basierend auf seiner Architektur und Benchmark-Bewertung zeichnet sich Qwen3.5-122B-A10B bei Aufgaben aus, die mehrschrittiges Denken, Werkzeugnutzung und das Befolgen von Anweisungen erfordern. Der τ²-Bench-Wert von 93,6 zeigt eine starke Leistung in einem Benchmark, der vom Modell verlangt, Aktionssequenzen mithilfe von Werkzeugen (z. B. Taschenrechner, Suchmaschinen, Code-Interpreten) zu planen und auszuführen. Dies macht es geeignet für den Aufbau autonomer Agenten, die mit externen Systemen interagieren müssen. Das Modell verarbeitet auch multimodale Eingaben, sodass Aufgaben wie visuelles Denken, Dokumentenanalyse mit eingebetteten Bildern oder Videozusammenfassung zu seinen Stärken gehören. Darüber hinaus ermöglicht sein großes Ausgabelimit, ausführliche Erklärungen, Code-Vervollständigungen oder strukturierte Daten in einer einzigen Antwort zu generieren. Entwickler, die an komplexen Chatbots, Codierungsassistenten oder Forschungsanalysetools arbeiten, könnten dieses Modell als effektiv empfinden.
Obwohl Qwen3.5-122B-A10B leistungsstark ist, ist es nicht die kosteneffizienteste Wahl für jeden Anwendungsfall. Wenn Ihre Aufgabe eine einfache Klassifikation, kurze Textgenerierung oder eine einfache Frage-Antwort ist, die kein mehrstufiges Denken oder multimodales Verständnis erfordert, können Sie mit einem kleineren Modell wie Qwen-7B oder einem nicht-multimodalen Modell zufriedenstellende Ergebnisse erzielen. Diese Modelle können pro Token schneller und günstiger sein. Wenn Ihr Kontextbedarf sehr gering ist (z.B. weniger als 1.000 Tokens), kann der relative Overhead der Verwendung eines 122B-Parameter-Modells nicht lohnenswert sein. OrcaRouter bietet eine Reihe von Modellen mit unterschiedlichen Preis- und Leistungsmerkmalen an. Sie können mit kleineren Modellen experimentieren und nur dann upgraden, wenn die Qualität nicht ausreicht. Wenn Sie außerdem das 65K-Ausgabelimit nicht benötigen, könnte ein Modell mit kürzerer Ausgabe ausreichen.
Das Modell verfügt über ein Kontextfenster von 32.768 Token und eine maximale Ausgabe von 65.536 Token, was es ermöglicht, erweiterte Denkketten und lange Anweisungen zu verarbeiten. Der hohe τ²-Bench-Wert deutet darauf hin, dass es über mehrere Schritte hinweg Kohärenz bewahren und komplexe Anweisungen, die bedingte Logik, Tool-Aufrufe und Verzweigungen umfassen, korrekt befolgen kann. In der Praxis berichten Nutzer, dass die Modelle der Qwen3.5-Serie bei Aufgaben wie mathematischer Problemlösung, Code-Generierung und Logikrätseln mit anderen modernsten Modellen konkurrieren können. Allerdings kann die Leistung, wie bei allen großen Modellen, nachlassen, wenn der Kontext mit irrelevanten Informationen überladen ist oder die Anweisungen mehrdeutig sind. Um das Modell effektiv zu führen, wird Prompt-Engineering empfohlen. Das Modell kann zudem Schwierigkeiten mit sehr langen Dokumenten haben (nahe der Kontextgrenze), bei denen es Details vom Anfang abrufen muss.
Die multimodale Eingabe (Text + Bild/Video) ermöglicht mehrere praktische Anwendungen. In der Dokumentenanalyse kann das Modell sowohl den Text als auch eingebettete Diagramme, Schaubilder oder Unterschriften in einer PDF oder einem Bild lesen. Beispielsweise kann es Daten aus einer gescannten Tabelle extrahieren oder eine Grafik interpretieren. Bei der visuellen Fragenbeantwortung kann das Modell Fragen zu einem Foto oder einer Illustration beantworten. In der Videoanalyse kann es Frames verarbeiten, um Szenen zu beschreiben oder Veränderungen über die Zeit zu verfolgen. Entwickler können Werkzeuge für Barrierefreiheit (z. B. Bildbeschreibungen für sehbehinderte Nutzer) oder Automatisierung (z. B. Analyse von UI-Screenshots) erstellen. Da das Modell über OrcaRouter aufgerufen wird, können diese Fähigkeiten mit denselben API-Aufrufen wie bei reinen Text-Prompts in bestehende Anwendungen integriert werden – einfach durch Einfügen von image_url oder video_url in den Nachrichteninhalt.
Der einzige veröffentlichte Benchmark für dieses Modell ist der τ²-Bench, bei dem es 93,6 erzielte. τ²-Bench wurde entwickelt, um die Fähigkeit eines Modells zu bewerten, Werkzeuge zu nutzen und mehrstufige Aufgaben in einer simulierten Umgebung zu lösen. Ein Ergebnis von 93,6 deutet darauf hin, dass das Modell einen hohen Anteil dieser Aufgaben korrekt abschließen kann. Im Vergleich dazu ist dieser Wert wettbewerbsfähig mit anderen hochmodernen Modellen im selben Benchmark. Allerdings lassen sich Benchmark-Ergebnisse nicht immer auf die tatsächliche Leistung in der Praxis übertragen, da Aufgaben in ihrer Schwierigkeit variieren können und der Benchmark möglicherweise nicht alle Bereiche abdeckt. Anwender sollten ihre eigenen Evaluierungen für ihre spezifischen Aufgaben durchführen. In den verfügbaren Fakten werden keine weiteren Benchmark-Ergebnisse (z. B. MMLU, HumanEval oder multimodale Benchmarks) bereitgestellt, sodass ein Vergleich dieses Modells anhand einer breiteren Palette standardisierter Metriken nicht möglich ist.
Stärken: Das Modell erzielt eine hohe Punktzahl bei einem Tool-Use-Benchmark, was auf starke Reasoning- und Instruktionsbefolgungsfähigkeiten hindeutet. Seine multimodale Fähigkeit und das große Ausgabelimit machen es vielseitig. Die MoE-Architektur bietet möglicherweise eine gute Balance zwischen Leistung und Effizienz (zumindest im Vergleich zu einem dichten Modell mit ähnlicher Gesamtparameterzahl). Einschränkungen: Das Modell hat nur ein Kontextfenster von 32.768 Token, was im Vergleich zu einigen Modellen, die 100K oder mehr bieten, moderat ist. Die aktivierten Parameter (10B) sind für ein Modell dieser Gesamtgröße relativ niedrig, was die Leistung bei sehr komplexen Aufgaben begrenzen könnte. Es liegen keine Informationen zu Latenz, Durchsatz oder Hardwareanforderungen vor. Da das Modell neu ist, ist das Community-Ökosystem (z. B. Feinabstimmungsskripte, Quantisierungswerkzeuge) möglicherweise weniger ausgereift als bei etablierteren Modellen. Benutzer sollten das Modell gründlich testen.
Für dieses Modell auf OrcaRouter sind keine spezifischen Latenz- oder Durchsatzwerte verfügbar. Die Inferenzgeschwindigkeit hängt von Faktoren wie Eingabelänge, Ausgabelänge, Batchgröße und der zugrunde liegenden Hardware ab, die OrcaRouter zuweist. MoE-Modelle können eine variable Geschwindigkeit aufweisen, da der Routing-Mechanismus für verschiedene Tokens unterschiedliche Experten aktivieren kann. Modelle mit 10B aktivierten Parametern können auf modernen GPUs mit moderater Geschwindigkeit generieren, aber die Gesamtzahl von 122B Parametern im Speicher kann zu einer höheren Speichernutzung und längeren Vorbereitungszeiten führen. Wenn niedrige Latenz entscheidend ist, sollten Sie das Modell mit Ihren typischen Eingabeaufforderungen testen. Die API von OrcaRouter gibt Zeitstempel und Leistungskennzahlen in den Antwort-Headern zurück, die Ihnen bei der Geschwindigkeitsmessung helfen können. Für latenzempfindliche Anwendungen sollten Sie ein kleineres Modell in Betracht ziehen, falls die Aufgabe dies zulässt.
Die verfügbaren Fakten enthalten nur einen einzigen Benchmark: τ²-Bench. Übliche Benchmarks wie MMLU (Wissen), HumanEval (Code), GSM8K (Mathe) oder multimodale Benchmarks wie MMBench werden nicht bereitgestellt. Dies erschwert die Beurteilung der Modellleistung bei Aufgaben, die nicht werkzeugbezogen sind. Wenn Ihre Anwendung beispielsweise faktische Genauigkeit erfordert, möchten Sie die Leistung auf MMLU kennen. Ebenso wären bei multimodalen Aufgaben Punktzahlen auf einem visuellen Reasoning-Benchmark nützlich. Das Fehlen dieser Punktzahlen bedeutet keine schlechte Leistung, aber es bedeutet, dass Benutzer ihre eigenen Bewertungen durchführen müssen. OrcaRouter kann auf Anfrage oder in der Dokumentation zusätzliche Benchmark-Ergebnisse bereitstellen. Bis mehr Daten verfügbar sind, ist es ratsam, das Modell qualitativ mit anderen in Ihrer spezifischen Domäne zu vergleichen.
Preisdetails für Qwen3.5-122B-A10B auf OrcaRouter sind in den verfügbaren Fakten nicht explizit angegeben. Normalerweise berechnet OrcaRouter pro Token sowohl für Eingabe als auch Ausgabe, mit separaten Raten für Eingabe-Tokens und generierte Tokens. Multimodale Eingaben (Bilder/Videos) werden als Token-Äquivalente basierend auf der Anzahl der verarbeiteten Bildblöcke oder Videobilder abgerechnet. Einige Anbieter bieten auch ermäßigte Tarife für Cache-Treffer an, wenn der Benutzer dieselbe Eingabe wiederholt. Um genaue Preise zu erhalten, sollten Benutzer die Preisgestaltungsseite von OrcaRouter konsultieren oder das Vertriebsteam kontaktieren. Da dieses Modell 122B Gesamtparameter hat und multimodal ist, könnte der Preis pro Token höher sein als bei kleineren oder reinen Textmodellen. Es ist wichtig, die Token-Kosten für Bilder/Videos bei der Schätzung der Gesamtkosten für eine Aufgabe zu berücksichtigen.
Die Verwendung eines größeren Modells wie Qwen3.5-122B-A10B ist in der Regel mit höheren Kosten pro Token verbunden als bei kleineren Modellen. Wenn das Modell jedoch aufgrund seiner Fähigkeiten eine Aufgabe mit weniger Schritten oder weniger Token lösen kann, können die Gesamtkosten dennoch wettbewerbsfähig sein. Das große Ausgabelimit (65.536 Token) kann sowohl ein Vorteil als auch ein Kostenrisiko sein: Die Erzeugung langer Ausgaben kann schnell Token-Kosten anhäufen. Darüber hinaus verbrauchen multimodale Eingaben mehr Token pro Prompt als reine Texteingaben. Beispielsweise kann ein einzelnes hochauflösendes Bild Hunderte von Token kosten. Wenn Ihre Aufgabe nicht die vollen Fähigkeiten des Modells erfordert, können Sie Geld sparen, indem Sie ein kleineres Modell wählen. OrcaRouter bietet wahrscheinlich Nutzungs-Dashboards und Kostenkontrollen, wie das Festlegen einer maximalen Anzahl von Ausgabe-Tokens oder Budgetwarnungen, die bei der Verwaltung der Ausgaben helfen können.
Die verfügbaren Fakten erwähnen keine Caching-Rabatte für dieses Modell auf OrcaRouter. Viele Inferenzanbieter bieten Prompt-Caching an, bei dem wiederholter Text in Systemaufforderungen oder Benutzernachrichten temporär gespeichert und zu einem niedrigeren Satz abgerechnet wird. Wenn OrcaRouter Caching unterstützt, könnte dies die Kosten für Anwendungen senken, die lange statische Prompts verwenden (z. B. Systemanweisungen, Charakterbeschreibungen). Ohne spezifische Dokumentation sollte dies jedoch nicht angenommen werden. Benutzer können die API-Antwortheader auf Cache-Hit-Indikatoren überprüfen, falls Caching implementiert ist. Um Kosten zu minimieren, können Sie Prompts so gestalten, dass sie das Wiederholen derselben langen Präfixe vermeiden, indem Sie statische Anweisungen von dynamischen Inhalten trennen. Erwägen Sie auch die Verwendung kürzerer Kontextfenster oder das Weglassen unnötiger Bilder, wenn möglich.
Um Qwen3.5-122B-A10B zu verwenden, senden Sie eine POST-Anfrage an den OrcaRouter API-Endpunkt unter https://api.orcarouter.ai/v1/chat/completions. Setzen Sie den Parameter model auf "qwen/qwen3.5-122b-a10b". Die API ist vollständig kompatibel mit OpenAIs Chat-Completions-Format, sodass Sie dieselben Client-Bibliotheken (z. B. die openai Python-Bibliothek) verwenden können, indem Sie die Basis-URL und den API-Schlüssel ändern. Der Anfragekörper enthält Nachrichten (jeweils mit einer Rolle und einem Inhalt) und optional Parameter wie temperature, max_tokens, top_p usw. Für multimodale Eingaben verwenden Sie einen Inhaltsblock mit type: "image_url" für Bilder oder die spezifische Videoverarbeitung des Modells (wahrscheinlich über base64-kodierte Frames oder eine URL). Die API gibt eine JSON-Antwort mit dem generierten Text und Nutzungsmetadaten (Token-Anzahlen) zurück. Die OrcaRouter-Dokumentation enthält weitere Details zu unterstützten Parametern.
Das Modell unterstützt die Standard-Chat-Parameter: temperature (Standard typischerweise 0.7), top_p (Standard 0.9), max_tokens (bis zum maximalen Output des Modells von 65.536), presence_penalty, frequency_penalty und stop sequences. Das Context-Window-Limit beträgt 32.768 Token, was alle Nachrichten, Bilder und Videoframes umfasst. Wenn die Gesamtzahl der Token dieses Limit überschreitet, gibt die API einen Fehler zurück oder kürzt die Eingabe (je nach Einstellungen). Der max_tokens-Parameter darf 65.536 nicht überschreiten. Bei multimodalen Anfragen ist zu beachten, dass Bilder und Videos Token hinzufügen; der genaue Umrechnungskurs wird nicht angegeben, aber hochauflösende oder lange Videos können schnell das Context-Window verbrauchen. OrcaRouter unterstützt möglicherweise auch den Stream-Modus, bei dem Antworten Token für Token gestreamt werden, was für Echtzeitanwendungen nützlich ist. Überprüfen Sie die API-Referenz auf weitere Optionen wie logprobs oder tools.
Die Migration ist unkompliziert: Ersetzen Sie Ihre Basis-URL durch https://api.orcarouter.ai/v1, verwenden Sie die Modell-ID "qwen/qwen3.5-122b-a10b" und geben Sie Ihren OrcaRouter-API-Schlüssel an. Das Anfrageformat ist identisch mit der OpenAI Chat Completions API. Zum Beispiel können Sie in Python mit der openai-Bibliothek Folgendes festlegen: `client = OpenAI(base_url='https://api.orcarouter.ai/v1', api_key='your_key')`. Rufen Sie dann `client.chat.completions.create(model='qwen/qwen3.5-122b-a10b', messages=...)` auf. Wenn Ihre Anwendung Funktionsaufrufe oder Tools verwendet, beachten Sie, dass das Modell diese unterstützt, da es auf τ²-Bench trainiert wurde, das Tool-Nutzung beinhaltet. Allerdings kann die genaue Syntax für Tool-Aufrufe von der von OpenAI abweichen; OrcaRouter unterstützt wahrscheinlich das OpenAI-Format, aber testen Sie dies zur Bestätigung. Für multimodale Eingaben kann Ihr vorhandener Code, der `image_url` in Nachrichten sendet, funktionieren, solange das Modell dieses Format unterstützt.
Innerhalb der Qwen-Familie positioniert sich dieses Modell zwischen kleineren dichten Modellen (z. B. Qwen-7B, Qwen-14B) und den größten MoE-Modellen (z. B. Qwen3.5-235B). Im Vergleich zu dichten Modellen kann dieses MoE-Modell auf einen größeren Gesamtparametersatz zugreifen, aktiviert jedoch nur einen Bruchteil pro Token, was spezialisiertere Experten ermöglichen kann. Dies kann zu einer besseren Leistung bei einer Vielzahl von Aufgaben führen, insbesondere solchen, die vielfältiges Wissen erfordern. Kleinere dichte Modelle können jedoch bei eng gefassten Aufgaben schneller und günstiger sein. Im Vergleich zum größeren Qwen3.5-235B hat dieses Modell wahrscheinlich eine geringere Leistung, ist aber effizienter. Die multimodale Unterstützung ist ein gemeinsames Merkmal der Qwen3.5-Generation; frühere Versionen (Qwen2, Qwen1) waren rein textbasiert. Nutzer sollten Benchmark-Ergebnisse für ihre spezifischen Aufgaben vergleichen, um zu entscheiden, welches Modell am besten passt.
Direkte Vergleiche sind ohne umfassende Benchmarks schwierig. Qwen3.5-122B-A10B erreicht 93,6 im τ²-Bench, was ein starkes Ergebnis für Tool-Use-Aufgaben ist. Als Referenz: Ähnliche Punktzahlen für andere Modelle in diesem Benchmark sind nicht angegeben, aber es wird als eine hochrangige Fähigkeit betrachtet. In Bezug auf die Architektur sind Llama-Modelle dicht und einfacher, während Claude-Modelle unterschiedliche proprietäre Architekturen haben. Qwen3.5 bietet multimodale Eingabe (Bild/Video), die Claude unterstützt, aber Llama 3.2 und 3.1 sind nur textbasiert (außer bei einigen Vision-Varianten). Das Kontextfenster von 32K ist kleiner als Claudes 100K oder 200K, aber vergleichbar mit Llama 3.1s 128K? Nicht genau; wir dürfen keine Zahlen erfinden. Bei Code und Reasoning sind viele Modelle wettbewerbsfähig. Der Vorteil dieses Modells könnte seine spezifische Optimierung für Tool-Use (τ²-Bench hohe Punktzahl) und multimodale MoE-Effizienz sein. Allerdings haben Claude und Llama größere Ökosysteme und mehr Community-Unterstützung.
Wenige Modelle vereinen multimodale Eingabe, ein großes Kontextfenster, eine große Ausgabebegrenzung und eine hohe τ²-Bench-Punktzahl in einem Paket. Die Qwen3.5-Serie ist darauf ausgelegt, ein fähiges Allzweckmodell mit starken Denk- und Werkzeugnutzungsfähigkeiten zu sein. Die MoE-Architektur mit 122B insgesamt und 10B aktiv ermöglicht es, eine große Wissensmenge zu packen, während die Inferenzkosten niedriger bleiben als bei einem dichten 122B-Modell. Allerdings haben andere MoE-Modelle wie Mixtral 8x7B (insgesamt 47B, aktiv 13B) andere Kompromisse. Qwen3.5-122B-A10B hat eine viel größere Gesamtparameterzahl, aber weniger aktive Parameter pro Token (10B vs. 13B). Die multimodale Unterstützung ist ein Differenzierungsmerkmal; Mixtral ist nur textbasiert. Im multimodalen MoE-Bereich existieren Modelle wie Qwen-VL oder andere, haben aber oft kleinere Kontextfenster. Dieses Modell positioniert sich als starke Option für Entwickler, die ein einzelnes Modell für vielfältige, multimodale und werkzeugintensive Aufgaben auf OrcaRouter benötigen.
Wählen Sie Qwen3.5-122B-A10B, wenn Ihre Anwendung sowohl multimodales Verständnis als auch komplexe mehrstufige Überlegungen erfordert und Sie das große Ausgabelimit für die Generierung langer Antworten benötigen. Es ist auch eine gute Wahl, wenn Sie agentische Systeme erstellen, die Werkzeuge verwenden, angesichts seiner hohen τ²-Bench-Bewertung. Wenn Ihre Aufgabe reine Textverarbeitung ist und keine zusätzliche Kapazität benötigt, kann ein günstigeres Modell wie Llama 3.1 70B oder Qwen-14B ausreichen. Wenn Sie ein größeres Kontextfenster (z. B. >100.000 Token) benötigen, ziehen Sie Modelle in Betracht, die speziell für lange Kontexte entwickelt wurden. Wenn Sie eine niedrigere Latenz benötigen, ist ein kleineres oder dichtes Modell möglicherweise besser geeignet. Da OrcaRouter viele Modelle anbietet, können Sie mehrere über dieselbe API testen, um die beste Lösung für Ihre Kosten- und Qualitätsziele zu finden. Die Modell-ID lautet qwen/qwen3.5-122b-a10b.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="qwen/qwen3.5-122b-a10b",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_searchenable_thinkinginclude_reasoninglogprobsmax_tokensnparallel_tool_callspresence_penaltyreasoningrepetition_penaltyresponse_formatseedstopstreamstream_optionstemperaturethinking_budgettool_choicetoolstop_ktop_logprobstop_p| Stufe | Eingabe / 1M Tokens | Ausgabe / 1M Tokens |
|---|---|---|
| ≤ 128K | $0.115 | $0.917 |
| ≤ 256K | $0.287 | $2.294 |
| Stufe wird durch die Eingabe-Token-Anzahl jeder Anfrage bestimmt | ||
Schätzung auf Basis des Listenpreises
Gestaffelte Preise — diese Schätzung verwendet die Basisstufe.
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
GET /api/public/models/qwen/qwen3.5-122b-a10bÖffnen @misc{orcarouter_qwen3_5_122b_a10b,
title = {Qwen3.5-122B-A10B API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b}
}Qwen. (2026). Qwen3.5-122B-A10B API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.5-122b-a10b