Stand vom 2. September 2026, Schnappschuss von Qwen3.8 Max, Alibabas Flaggschiff-Modell für multimodales Denken: Text + Bild + Video als Eingabe, Text als Ausgabe, 1M-Token-Kontext. Gleiche Funktionen und Preisgestaltung wie das Basismodell; für reproduzierbares Verhalten anheften.
Qwen3.8 Max (0902) ist ein Modelleintrag auf OrcaRouter vom Anbieter qwen, veröffentlicht unter der Modell-ID qwen/qwen3.8-max-0902. Die Bezeichnung 0902 wird in der Auflistung angezeigt, aber die…
Das Modell unterstützt ein Kontextfenster von 1.000.000 Tokens. Das ist die Gesamtmenge an Eingaben, auf die das Modell in einer einzigen Anfrage zugreifen kann, einschließlich des Text-, Bild- und Videoinhalts im Prompt. In den Fakten ist keine weitere Begrenzung angegeben; die praktischen Grenzen hängen also davon ab, wie OrcaRouter und der Anbieter Tokenisierung und Anfragetimeouts durchsetzen. Bei langem Text ermöglicht ein Kontextfenster von 1.000.000 Tokens, viele umfangreiche Dokumente in einen einzigen Prompt aufzunehmen, wodurch die Notwendigkeit verringert wird, Inhalte vor dem Aufruf des Modells in Chunks zu unterteilen oder zusammenzufassen. Für Videos ist in den Fakten nicht festgelegt, wie viele Tokens pro Sekunde, pro Frame oder pro Videodatei verbraucht werden; Sie sollten daher anhand von Metadaten oder Testaufrufen schätzen. Außerdem ist zu beachten, dass die Größe des Kontextfensters keine Aussage darüber trifft, wie genau das Modell bei einem Prompt mit 1.000.000 Tokens arbeitet; es werden keine Benchmark-Daten bereitgestellt. Wenn Ihre Anwendung eine exakte Qualität bei langen Kontexten erfordert, evaluieren Sie das Modell anhand einer Stichprobe Ihrer eigenen Dokumente, bevor Sie es in Produktion nehmen.
Da Text, Bilder und Videos als Eingaben akzeptiert werden, kann das Modell aufgefordert werden, über Quellmaterial zu schlussfolgern, das diese Typen in derselben Anfrage kombiniert. Beispiele hierfür sind das Lesen von Anweisungen in Textform, das Untersuchen eines Bildes und das Heranziehen eines Videos bei der Erstellung einer Antwort. Das Faktenblatt des Anbieters listet keine aufgabenspezifischen Fähigkeiten wie OCR, Objekterkennung oder zeitliches Video-Reasoning auf, daher sollten diese Verhaltensweisen nicht vorausgesetzt werden. Was von dem Modell erwartet werden kann, hängt hauptsächlich von seinen trainierten Fähigkeiten ab, die in den bereitgestellten Fakten nicht dokumentiert sind. Das sichere Design besteht darin, es für Aufgaben zu verwenden, die eine Textausgabe aus einem Prompt mit gemischten Modalitäten erfordern und die Kosten für die Speicherung von Bildern und Videos als Eingabe-Tokens tolerieren können. Wenn eine Arbeitslast rein textbasiert ist, könnte ein anderes Modell ohne Bild- und Videoeingabe einfacher sein. Wenn eine Aufgabe exakte Videooperationen auf Zeitstempel-Ebene erfordert, liefert die Modellkarte keine Belege dafür, ob ein solches Verhalten zuverlässig ist.
Die Wahl eines günstigeren Modells ist sinnvoll, wenn die Aufgabe nicht die Funktionen erfordert, die diese Auflistung definieren. Eine kurze Textfrage benötigt weder einen Kontext von 1,000,000 Token noch eine Ausgabegrenze von 131,072 Token. Ein reiner Text-Workflow benötigt keine Bild- oder Videoeingabe. OrcaRouter berechnet für dieses Modell $2.00 pro 1,000,000 Eingabe-Token und $6.00 pro 1,000,000 Ausgabe-Token. Wenn eine günstigere Alternative niedrigere Preise pro Token sowie eine angemessene Kontext- und Modalitätsunterstützung bietet, senkt sie die Kosten. In den vorliegenden Fakten gibt es keine Qualitäts- oder Geschwindigkeits-Benchmarks, daher lässt sich die Wahl dieses Modells gegenüber anderen Modellen nicht durch gemessene Genauigkeit rechtfertigen; sie sollte durch explizite Produktanforderungen begründet werden: großer Kontext, gemischte Text-/Bild-/Video-Eingabe oder lange Ausgabe in einer einzigen Generierung. Da der Eingabepreis für jedes Token im Kontext gilt, können Aufrufe mit sehr großem Kontext teurer sein als kleinere Aufrufe, selbst wenn die Benutzerfrage kurz ist; vermeiden Sie daher das Auffüllen von Prompts.
Die bereitgestellten Modelldaten für Qwen3.8 Max (0902) enthalten keine Benchmark-Ergebnisse, Evaluierungssets oder Genauigkeitszahlen. Aus diesem Grund wäre jede Aussage über die Modellqualität Spekulation, und OrcaRouter veröffentlicht keine abgeleiteten Bewertungen. Wenn Sie eine Zahl zum Vergleich der Kandidaten benötigen, führen Sie eigene Tests mit repräsentativen Eingaben durch, einschließlich der Bild- und Videofälle, die Sie voraussichtlich senden werden. Ein Benchmark wie ein öffentlicher Wissenstest würde Ihnen nicht sagen, wie gut das Modell einen bestimmten Video-Prompt mit 1.000.000 Token verarbeitet. Bedenken Sie, dass ein Modellname wie Max nur ein Label ist und kein Beweis für Qualität. Die messbaren Größen in dieser Auflistung sind das Kontextfenster, die maximale Ausgabelänge, die Eingabemodalitäten und der Preis. Diese Attribute beeinflussen, ob eine Arbeitslast passt, aber sie beschreiben weder Genauigkeit noch Reasoning-Tiefe, Instruktionsbefolgung oder Sicherheitsverhalten. Behandeln Sie Fähigkeiten in diesen Bereichen als unverifiziert, solange Sie keine Evaluierung durchführen.
Die Modellfakten enthalten keine Angaben zu Tokens-pro-Sekunde-Raten, Werten für die Zeit bis zum ersten Token, Hinweisen zum Request-Timeout oder anderen Leistungsmessungen. OrcaRouter beansprucht für dieses Provider-Modell keine Latenzangabe. Die Geschwindigkeit hängt von der Serving-Infrastruktur des Providers, der Größe der Eingabe und der Menge der angeforderten Ausgabe ab. Eine Eingabe mit 1.000.000 Tokens und eine Ausgabe mit 131.072 Tokens dauern wahrscheinlich länger als eine kurze Anfrage, aber die Auflistung gibt keinen genauen Zusammenhang an. Videoeingaben können die Latenz ebenfalls verschlechtern, da sie in Tokens verarbeitet werden müssen, bevor das Modell sie berücksichtigen kann; die Fakten beziffern diesen Schritt nicht. Prüfer sollten nicht davon ausgehen, dass ein niedriger Preis pro Token eine schnelle Dekodierung bedeutet. Die einzige geschwindigkeitsbezogene Entscheidung, die durch die Fakten gestützt wird, ist, repräsentative Anfragegrößen unter Ihrer erwarteten Last zu testen. Leiten Sie die Eignung für Echtzeitanwendungen nicht aus der Kontextfenstergröße oder dem Modellnamen ab.
Die angegebenen Stärken sind struktureller Natur. Das Modell verfügt über ein Kontextfenster von 1.000.000 Token, eine maximale Ausgabelänge von 131.072 Token und akzeptiert Text-, Bild- und Videoeingaben. Diese Eigenschaften sind nützlich für Anwendungen, die in einem einzigen Modellaufruf eine große oder gemischte Materialmenge erfassen müssen, bevor eine lange Antwort verfasst wird. Einschränkungen lassen sich anhand der Fakten ebenfalls leichter benennen als Stärken. Es werden keine Qualitäts-Benchmarks veröffentlicht; Genauigkeit, Reasoning und Sicherheit sind daher nicht dokumentiert. Für das Label 0902 gibt es keine separate Auflistung von Trainingsdaten, Versionshinweisen oder Aktualisierungsmethodik. Bild- und Videoeingaben garantieren kein exaktes visuelles oder zeitliches Verständnis. Kontext- und Ausgabelimits sind Maximalwerte und keine Nutzungsempfehlung; sehr große Ausgabemengen können bei 6,00 $ pro 1.000.000 Ausgabe-Token kostspielig werden. Eine Anfrage, die den vollen 1.000.000-Token-Kontext ausfüllt, würde bereits Eingabe-Token im Wert von 2,00 $ verbrauchen, bevor eine Ausgabe generiert wird – ein erheblicher operativer Kostenfaktor.
Die aufgeführten Einheitspreise betragen 2,00 $ pro 1.000.000 Eingabe-Tokens und 6,00 $ pro 1.000.000 Ausgabe-Tokens. OrcaRouter reicht den Anbieterpreis ohne Aufschlag direkt weiter; der angegebene Preis ist also der unveränderte Anbieterpreis. Eingabe-Tokens umfassen die im Prompt enthaltenen Text-, Bild- und Video-Tokens. Ausgabe-Tokens sind die generierten Antwort-Tokens. Bei diesen Preisen kosten 1.000.000 Eingabe-Tokens 2,00 $; 1.000.000 Ausgabe-Tokens kosten 6,00 $. Eine kleinere Anfrage kostet proportional weniger: 100.000 Eingabe-Tokens würden 0,20 $ und 100.000 Ausgabe-Tokens 0,60 $ kosten, sofern diese Mengen vom Anbieter gemessen werden. Die Modellkarte enthält keine separaten Preise für gecachte Eingaben, Batch-Anfragen oder interaktive Tarifstufen; solche Preise sollten daher nicht angenommen werden. Die genauen abgerechneten Token-Anzahlen sollten für jeden Aufruf anhand der OrcaRouter-Nutzungsantwort oder der Protokolle überprüft werden.
Wenn OrcaRouter angibt, dass ein Modell zum Anbieterpreis ohne Aufschlag abgerechnet wird, bedeutet das, dass OrcaRouter für dieses Angebot keine eigene Gebühr pro Token auf den Anbieterpreis aufschlägt. Der Endbetrag für die Token-Nutzung sollte daher auf den angegebenen Preisen von $2.00 für Eingabe und $6.00 für Ausgabe pro 1 Million Tokens basieren. Das bedeutet nicht unbedingt, dass die Endrechnung keine weiteren Gebühren enthält; je nach Vereinbarung können Steuern oder Gebühren auf Kontenebene anfallen, aber solche Gebühren sind in diesen Angaben nicht dokumentiert. Es bedeutet auch nicht, dass das Modell kostenlos bereitgestellt wird, da der Preis pro Token weiterhin gilt. Beim Vergleich von Anbietern sollte der von OrcaRouter für dieses Modell angezeigte Preis in denselben Einheiten vorliegen wie dieses Angebot. Wenn ein anderes Gateway einen anderen Preis angibt, liegt der Unterschied in der Abrechnungsstruktur, nicht in einer Änderung des Kontextfensters des Modells.
Kostenmanagement sollte mit der Eingabeaufforderungslänge beginnen. Da die Eingabekosten 2,00 $ pro 1.000.000 Tokens betragen, erhöht jedes zusätzliche Token die Eingabegebühr, und jedes in einer Anfrage gesendete Bild oder Video wird gemäß Regeln, die in dieser Auflistung nicht angegeben sind, in Tokens umgewandelt. Das Kürzen irrelevanten Quellmaterials kann Kosten senken. Die Ausgabe kostet das Dreifache des Eingabestückpreises, sodass auch die Begrenzung der angeforderten Ausgabelänge die Kosten kontrolliert. Ein Modell mit einem Ausgabelimit von 131.072 Tokens kann Antworten generieren, die Geld kosten; bei 6,00 $ pro 1.000.000 Tokens würden 131.072 Ausgabetokens allein etwa 0,79 $ an Ausgabetokens kosten. Das Generieren so vieler Tokens erfolgt nicht automatisch, da die Eingabeaufforderung die Antwortgröße steuert. Für dieses Modell ist kein Cache-Preis veröffentlicht, also sollten Sie nicht davon ausgehen, dass wiederholter Kontext einen Rabatt erhält. Das Fehlen von Cache- oder Batch-Preisen in den Fakten ist kein Beweis dafür, dass solche Optionen nicht existieren; es bedeutet lediglich, dass sie nicht Teil dieser Auflistung sind.
Qwen3.8 Max (0902) wird über die OpenAI-kompatible API von OrcaRouter bereitgestellt. Setzen Sie die Client-Basis-URL auf https://api.orcarouter.ai/v1 und verwenden Sie die exakte Modell-ID qwen/qwen3.8-max-0902. Bei einem OpenAI-kompatiblen SDK ist die Anforderungsstruktur im Grunde dieselbe wie bei jedem Chat-Completions-Aufruf: Übergeben Sie einen API-Schlüssel für OrcaRouter, die oben genannte Basis-URL und die Modell-ID im Body. Verwenden Sie keinen generischen Namen wie Qwen3.8 Max oder qwen3.8; die Auflistung erfordert qwen/qwen3.8-max-0902. Dieselbe Modell-ID sollte in direkten HTTP-Anfragen an die Basis-URL verwendet werden, wobei Pfad und Payload dem von OrcaRouter bereitgestellten OpenAI-kompatiblen Vertrag folgen. Da es OpenAI-kompatibel ist, kann vorhandener Code, der für OpenAI-Chat-Completions geschrieben wurde, in der Regel migriert werden, indem die Parameter base_url und model geändert werden; die Authentifizierungsdetails müssen jedoch den Anforderungen von OrcaRouter entsprechen.
Bei einer OpenAI-kompatiblen Chat-Completion werden Parameter wie Modell, Nachrichten und das Limit für Ausgabe-Token wie bei anderen kompatiblen Modellen behandelt. Die Fakten geben ein Maximum von 131.072 Ausgabe-Token an. Wenn Sie also ein Ausgabelimit festlegen, sollte es nicht höher als 131.072 sein; das Standard-Ausgabelimit ist in den Fakten nicht angegeben. Temperatur, Top-p, Stop und andere Sampling-Parameter sind in den bereitgestellten Modellfakten nicht dokumentiert; folgen Sie daher der API-Dokumentation von OrcaRouter und der standardmäßigen Parametersemantik von OpenAI. Verwenden Sie für Bild- und Videoeingaben das multimodale Inhaltsformat, das die API von OrcaRouter erwartet; die Fakten enthalten kein Beispiel. Wenn die API einen Fehler bezüglich nicht unterstützter Parameternamen zurückgibt, prüfen Sie, ob Ihr SDK Legacy-Parameter sendet. Das Kontextfenster umfasst 1.000.000 Token; der Prompt muss daher alle Eingabe-Token, einschließlich Bild- und Video-Token, unter diesem Limit halten. Antworten werden separat auf das Maximum von 131.072 Token angerechnet.
Da OrcaRouter eine OpenAI-kompatible API unter https://api.orcarouter.ai/v1 anbietet, ist die Migration größtenteils eine Konfigurationsänderung. Ersetzen Sie die Basis-URL durch https://api.orcarouter.ai/v1, ersetzen Sie das API-Schlüsselfeld durch einen OrcaRouter-Schlüssel und setzen Sie das Modell auf qwen/qwen3.8-max-0902. Wenn Ihr Code eine OpenAI-kompatible Client-Bibliothek verwendet, aktualisieren Sie base_url und api_key des Clients und lassen Sie die meisten Nachrichtenstrukturen unverändert, vorausgesetzt, das multimodale Format entspricht diesem Modell. Die Fakten sagen nicht, ob dieses Modell jeden OpenAI-spezifischen Parameter unterstützt. Überprüfen Sie daher vor der Migration die Parameter, die Ihre Anwendung sendet. Da das Kontextlimit 1.000.000 und die maximale Ausgabe 131.072 beträgt, passen Sie außerdem die Logik zur Abschneidung von Anfragen an diese Grenzen an. Vorhandener Code, der eine andere maximale Kontextlänge fest codiert hat, muss möglicherweise aktualisiert werden. Bestätigen Sie schließlich, dass die Erwartungen Ihrer Anwendung an die Datenverarbeitung mit den OrcaRouter-Bedingungen übereinstimmen, da die Modellfakten selbst keine Datenaufbewahrung erörtern.
Die Hauptgrundlage für den Vergleich ist der Eingabevertrag. Qwen3.8 Max (0902) akzeptiert Text, Bild und Video, daher würde eine reine Text-Alternative diese Modalitäten eliminieren. Wenn Ihre tatsächliche Arbeitslast nur Text enthält, ist ein reines Textmodell mit ausreichend großem Kontext wahrscheinlich direkt passender und kann eine andere Preisgestaltung aufweisen. Die Modellfakten enthalten keine Genauigkeits- oder Geschwindigkeitsvergleiche mit anderen Modellen, daher können Sie nicht auf der Grundlage öffentlicher Qualitätsbewertungen wählen. Sie können strukturelle Merkmale vergleichen: Eine reine Text-Alternative kann einen kleineren Kontext, ein kürzeres Ausgabelimit oder einen niedrigeren Eingabepreis haben. OrcaRouter berechnet für dieses Modell $2.00 Eingabe und $6.00 Ausgabe pro 1,000,000 Token. Die Tatsache, dass es Bild- und Videoeingaben unterstützt, ist nur dann nützlich, wenn diese Eingaben genutzt werden. Wenn diese Eingaben nicht genutzt werden, zahlen Sie möglicherweise für multimodale Kapazität, die für die Aufgabe irrelevant ist.
Wählen Sie Qwen3.8 Max (0902), wenn Ihr Aufgabenprofil zu den aufgeführten Eigenschaften passt. Erstens benötigen Sie einen Kontext von 1.000.000 Token, weil das Quellmaterial nicht gekürzt werden kann, um in ein kleineres Fenster zu passen. Zweitens benötigen Sie Bild- und Videoeingaben im selben Prompt, oder Sie erwarten diese Modalitäten in zukünftigen Anfragen. Drittens möchten Sie ein Ausgabemaximum von bis zu 131.072 Token. Wenn für Ihre Arbeitslast keine dieser Anforderungen zutrifft, bleiben viele Vorteile dieses Eintrags ungenutzt. Wählen Sie dieses Modell nicht, nur weil der Name Max stark klingt; der Eintrag enthält keine Benchmark-Belege. Da OrcaRouter Modelle über dieselbe OpenAI-kompatible API bereitstellt, lassen sich Modell-IDs einfach austauschen, sodass Sie dieses Modell bei Ihrer eigenen Aufgabe gegen einen anderen Kandidaten testen können. Beachten Sie nur, dass sich die Preise für Eingabe und Ausgabe unterscheiden und für dieses Modell keine Cache-Preise angegeben sind.
Beim Kostenvergleich sollten Sie zuerst auf dieselbe Token-Basis normalisieren. Bei diesem Modell werden 2,00 $ pro 1.000.000 Eingabe-Tokens und 6,00 $ pro 1.000.000 Ausgabe-Tokens berechnet, wobei die Preise ohne Aufschlag vom Anbieter durchgereicht werden. Ein Konkurrenzmodell mit einem niedrigeren Preis pro Eingabe-Token kann bei einer Anfrage mit vollem Kontextumfang tatsächlich günstiger sein; Kontextfenster und maximale Ausgabe müssen jedoch ebenfalls berücksichtigt werden. Beispielsweise kann eine Anfrage mit 1.000.000 Tokens den vollständigen Kontext dieses Modells in einem einzigen Aufruf nutzen, während ein Modell mit einem Kontextfenster von 200.000 Tokens mehrere Aufrufe erfordern würde. Die zusätzlichen Ausgabe- oder Zusammenfassungsschritte können dann den Gesamtpreis verändern. Die bereitgestellten Angaben enthalten keine objektiven Werte für Genauigkeit oder Latenz; daher muss ein Vergleich der Kosten pro richtige Antwort auf eigenen Tests beruhen. Prüfen Sie außerdem, ob ein Konkurrenzmodell separate Gebühren für Bild- oder Video-Tokens erhebt, da solche hier nicht beschrieben sind. Im Zweifelsfall führen Sie eine typische Arbeitslast auf OrcaRouter aus und vergleichen Sie den gemessenen Token-Verbrauch sowie die Antwortqualität, statt sich nur auf Listenpreise zu verlassen.
OpenAI-kompatibel — behalte dein bisheriges SDK
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="qwen/qwen3.8-max-0902",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)enable_thinkinginclude_reasoningmax_tokenspresence_penaltyreasoningreasoning_effortresponse_formatseedstopstructured_outputstemperaturetool_choicetoolstop_p| Eingabe / 1M Tokens | $2.00 |
| Ausgabe / 1M Tokens | $6.00 |
| Cache-Lesen / 1M | $0.250 |
| Cache-Schreiben / 1M | $2.50 |
| Währung | USD |
Schätzung auf Basis des Listenpreises
Nur eine Schätzung — die tatsächliche Token-Anzahl hängt vom Tokenizer des Anbieters ab.
Worüber Entwickler diese Woche sprechen
GET /api/public/models/qwen/qwen3.8-max-0902Öffnen @misc{orcarouter_qwen3_8_max_0902,
title = {Qwen3.8 Max (0902) API},
author = {Qwen},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902}
}Qwen. (2026). Qwen3.8 Max (0902) API. OrcaRouter. https://www.orcarouter.ai/models/qwen/qwen3.8-max-0902