Eine Sanduhr auf einem leeren Modell-Sockel — die Qwen3.8-27B-Gewichte wurden nicht freigegeben, daher kann es keine kostenlose API geben.
Guides & Insights

Kostenlose Qwen 3.8 27B API: Noch nicht — Was stattdessen ausführen

Autor

Rowan Sterling

Veröffentlicht am

Neueste Modelle · 20Alle Modelle ansehen
Benchmarks: Artificial Analysis · täglich aktualisiert
Zurück zu allen Beiträgen

Nein — Stand 12. August 2026 gibt es keine kostenlose Qwen3.8-27B-API, und es gibt auch keine kostenpflichtige. Das Modell wurde am 3. August angekündigt; offene Gewichte wurden für Hugging Face und ModelScope „in der Woche ab dem 10. August“ versprochen, aber die offizielle Qwen-Organisation hat immer noch kein Qwen3.8-Repository. Bis die Gewichte veröffentlicht werden, kann niemand Qwen3.8-27B hosten, daher ist „kostenlos“ hinfällig. Hier sind die drei Wege zu kostenlos, sobald die Gewichte erscheinen (und was jeder wirklich kostet), plus die Modelle, die du heute kostenlos lokal ausführen kannst.

Noch keine kostenlose API — die Gewichte sind das Tor

Alibaba hat am 3. August 2026 die Qwen3.8-Familie angekündigt: das Qwen3.8-Max mit 2,4 Billionen Parametern (etwa 95 Milliarden aktive Parameter, ein 1M-Token-Kontext, Preis: 2 $ pro Million Input-Tokens und 6 $ pro Million Output-Tokens auf Alibaba Cloud Model Studio) sowie das dichte, für einzelne Maschinen ausgelegte Qwen3.8-27B. Beide wurden noch in derselben Woche als offene Gewichte auf Hugging Face und ModelScope versprochen.

Dieses Versprechen ist nun zwei Tage überfällig. Ich habe Hugging Face direkt am 12. August geprüft: Die offizielle Qwe​n-Organisation hat keinerlei Qwen3.8-Repository. Die Repos Qwen3.8-27B-GGUF, -FP8, -NVFP4A16 und -NInfer, die in der Modellsuche auftauchen, sind Platzhalter-Karten – null Gewichtsdateien, Download-Zahlen im einstelligen Bereich, Modellkarten, die wörtlich „reserved ahead of the Qwe​n/Qwen3.8-27B release" lauten. Behandle das nicht als Beweis, dass das Modell existiert; behandle es als Leute, die sich Parkplätze reservieren.

Zwei Dinge kann man nicht voraussetzen. Erstens die Lizenz: Für Qwen3.8-27B wurde keine genannt. Aktuelle offene Qwen-Gewichte wurden unter der Tongyi-Qianwen-Lizenz veröffentlicht, deren Klausel über 100 Millionen monatlich aktive Nutzer bei großem Maßstab Gespräche über kommerzielle Lizenzen auslöst — Apache 2.0 ist keine sichere Standardannahme. Zweitens die Spezifikationen: Alibaba hat für die 27B keine Benchmark-Tabelle, kein Kontextfenster und keine bestätigte Hardware-Anforderung veröffentlicht. Alles, was heute darüber wiederholt wird, ist Spekulation.

Wir haben die Pre-Drop-Checkliste behandelt – was bestätigt ist, was Gerücht ist, was du vor dem Download prüfen solltest – in Qwen3.8-27B Open Weights: Was wir vor dem Drop wissen. Dieser Artikel ist der Teil, den jener Beitrag nicht abgedeckt hat: wie „frei“ tatsächlich funktionieren wird, sobald das Modell veröffentlicht wird.

Nachdem die Gewichte fallen: drei Wege zur Freiheit, und was jeder wirklich kostet

„Kostenlos“ ist nie kostenlos. Alle drei Wege zu einem kostenlosen Qwen3.8-27B verlagern die Kosten nur woanders hin; der Unterschied liegt darin, wo sie landen. Das 27B ist ein dichtes Modell – jedes seiner ~27 Milliarden Parameter ist bei jedem Token aktiv – die unten genannten Kosten betreffen also echte Hardware, nicht Marketing.

Three routes to a free Qwen3.8-27B API after the weights drop: run it yourself, a hosted free tier, or OrcaRouter's planned free tier — and the real cost of each.

Route 1: Selbst betreiben — in bar kostenlos, in Hardware bezahlt

Der einzige Weg, auf dem „frei“ nach dem Kauf der Hardware buchstäblich wahr wird. Unsloth-Mitbegründer Daniel Han erwartet, dass die 27B bei der Veröffentlichung in etwa 17 GB VRAM läuft – ein Ziel, keine ausgelieferte Spezifikation. Nimmt man die gemessene Quantisierungsleiter von Qwen3.6-27B als Näherungswert: Q4_K_M liegt bei etwa 16 GB, Q6_K bei etwa 21 GB, FP8 bei etwa 27 GB und volles BF16 bei etwa 54–56 GB. Das realistische Minimum ist heute eine 24-GB-Karte – RTX 3090, RTX 4090 oder A6000-Klasse – bei Q4.

Das Timing ist entscheidend: Offizielle Gewichte mit vLLM oder SGLang funktionieren normalerweise innerhalb weniger Tage nach einem Release, aber Community-Quantisierungen wie GGUF und AWQ hinken ein bis zwei Wochen hinterher, sodass ein Ollama-artiges „Pull and Run“ am Veröffentlichungstag nicht existieren wird. Die versteckten Kosten sind Strom, eine leise Maschine und Ihre Zeit. Der Gewinn ist Privatsphäre – nichts verlässt Ihren Rechner – und Grenzkosten von null, die sich auszahlen, wenn Sie die GPU auch für andere Modelle nutzen.

Route 2: Gehostete kostenlose Stufen — kostenlos in Geld, bepreist in Grenzen

Sobald die Gewichte veröffentlicht sind, ist mit einem Evaluierungskontingent von Alibaba Cloud und kostenlosen Stufen der üblichen Serverless-Hosts zu rechnen. Das erwartbare Muster ist das, das Alibaba bereits für Qwen3.8-Max anbietet: ein 1M-Token-Kontingent für neue Nutzer, nur Region Singapur, 90 Tage gültig, keine Übertragung – und Reasoning-Tokens werden als Output abgerechnet, sodass ein Modell, das standardmäßig Reasoning durchführt, das gesamte Guthaben an einem Wochenende des Prototypings verbrennen kann. Was du tatsächlich bezahlst, sind Rate Limits, eine regionale Sperre, ein Ablaufdatum und die Tatsache, dass deine Prompts an einen Drittanbieter gehen. Eine kostenlose Stufe ist eine Einstiegsrampe zum Evaluieren des Modells, nicht ein Ort zum Bereitstellen.

Route 3: OrcaRouters kostenloser Tarif – geplant, nicht live

Da die Suchanfrage wörtlich „frei“ lautet, werden wir es klar sagen: OrcaRouter plant eine kostenlose Stufe für Qwen3.8-27B, sobald die Gewichte veröffentlicht werden. Sie ist noch nicht live. Es gibt keinen Endpunkt, den man aufrufen kann, und ich werde kein Platzhalter-Beispiel einfügen. Wir werden es ankündigen, wenn es etwas anzukündigen gibt. Was wir heute tatsächlich hosten, ist Qwen3.8-Max zu $2/$6 pro 1 Million Token ohne Aufschlag – und die 27B ist nicht auf der Plattform, weil sie noch niemand bereitstellen kann.

Was du jetzt kostenlos nutzen kannst

Wenn Sie ein offenes Modell der 27B-Klasse benötigen, das Sie ohne Bezahlung ausführen können, müssen Sie nicht warten. Die ehrliche Antwort auf derselben Stufe ist Qwen3.6-27B, der direkte Vorgänger des Modells, auf das Sie warten.

Comparison of Qwen3.6-27B and Nemotron 3.5 Lightning 30B A3B, which you can run free today, against Qwen3.8-27B, which is not yet released.

Qwen3.6-27B ist Apache 2.0, ein dichtes 27,8B-Modell mit 262K Kontext und nativem Text-, Bild- und Videoeingang. Ein Q4_K_M GGUF hat etwa 16,5 GB und läuft mit ungefähr 25 Token pro Sekunde auf einer 24-GB-Verbraucher-GPU (16–18 Token pro Sekunde auf einem M4 Max). Vom Anbieter gemeldete Werte aus der Modellkarte: SWE-Bench Verified 77,2, MMLU-Pro 86,2, AIME 2026 94,1, GPQA Diamond 87,8 und MMMU 82,9. Wenn Qwen3.8-27B „ein 27B“ ist, dann ist dies der 27B, den man heute tatsächlich anfassen kann – gleiche Familie, gleiches dichtes Design, bereits offen.

Nemotron 3.5 Lightning 30B A3Bist eine andere Variante, ebenfalls kostenlos: Es wurde am 11. August 2026 unter der OpenMDW-1.1-Lizenz von NVIDIA veröffentlicht. Es ist ein Mixture-of-Experts-Modell mit insgesamt 30B und etwa 3B aktiven Parametern, einer hybriden Mamba-2-Architektur und bis zu 1M Kontext – NVFP4-Checkpoints sind etwa 21,6 GB groß und ein Q4-GGUF etwa 25 GB. Es benötigt eine Grafikkarte mit mindestens 24 GB, weil alle 30 Milliarden Parameter im Speicher liegen, auch wenn pro Token nur etwa 3 Milliarden aktiviert werden. Ersten Berichten zufolge erreicht es auf einer einzelnen GPU fast 45 Token pro Sekunde. Es ist für die Agenten-Ausführungsschicht gebaut – Tool-Aufrufe, Validierung, Formatierung – nicht für Spitzen-Reasoning. Wenn deine Arbeitslast aus vielen Agenten-Routineaufgaben besteht, kann es bei deiner eigentlichen Aufgabe ein dichtes 27B-Modell schlagen.

Und wenn Sie heute konkret eine kostenlose gehostete API möchten statt einer lokalen Installation, ist das einzige ehrliche „kostenlos“ Alibabas Qwen3.8-Max-Kontingent: 1 Million Tokens, Region Singapur, 90 Tage. Es ist nicht das 27B-Modell, sondern ein Evaluierungskontingent, kein Dienst – nutzen Sie es, um das Verhalten von Qwen3.8 jetzt auszuprobieren, und steigen Sie dann um.

Wenn dieser Rat falsch ist

Wenn du bereits eine 24GB+ GPU besitzt, ist das „Warten auf kostenlose Stufen“ für dich der falsche Ansatz. An dem Tag, an dem die Gewichte veröffentlicht werden, ist vLLM mit den offiziellen Gewichten deine kostenlose Stufe; du würdest auf einen Komfort warten, den du nicht brauchst. Halte nur etwa zwei Wochen durch, wenn du gezielt die ausgefeilte GGUF-Quantisierungsleiter möchtest.

Wenn Sie Prototypen gegen einen API-Vertrag entwickeln, könnten die gehosteten kostenlosen Kontingente (sobald die 27B sie hat) weniger kosten als Ihre Zeit — selbst mit dem 90-Tage-Ablauf und der Regionssperre ist das Mieten einer GPU-Box für eine Woche Prototyping in der Regel der teurere Weg.

Falls sich herausstellt, dass die Lizenz Tongyi Qianwen statt Apache ist, „freie Gewichte“ bedeuten nicht, dass du oberhalb der 100-Millionen-MAU-Schwelle frei kommerzialisieren darfst. Lies die LICENSE-Datei im tatsächlichen Repository, bevor du irgendetwas darauf aufbaust — das ist der mit Abstand häufigste Weg, wie aus „freien offenen Gewichten“ eine Rechnung wird.

Und falls Alibaba den Termin erneut verschiebt — es sind bereits zwei Tage über das zugesagte Zeitfenster hinaus — macht jede weitere Woche Qwen3.6-27B zur richtigen Wahl statt zur Notlösung.

A timeline from announcement to free local run of Qwen3.8-27B.

Fazit

Es gibt keine kostenlose Qwen3.8-27B-API, weil es Qwen3.8-27B nirgendwo gibt. Wenn die Gewichte veröffentlicht werden, sind die drei kostenlosen Wege: Selbsthosting (bezahlt man mit Hardware), gehostete Gratis-Stufen (bezahlt man mit Limits) und der geplante kostenlose Tarif von OrcaRouter – der noch nicht live ist, und wir werden das sagen, wenn es so weit ist. Heute ist das, was einem kostenlosen Angebot am nächsten kommt, Qwen3.6-27B auf eigener Hardware. Warten kostet dich nichts außer der 27B; den Vorgänger zu betreiben kostet dich nichts außer einer GPU, die du in der Zwischenzeit für alles andere einsetzen kannst.