
Hy Image3.5 vs. LLaDA-Image: Endpoint mieten oder die Gewichte besitzen
- OrcaNEUOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 pro 1 Mio. Tokens
- orcaNEUOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 pro 1 Mio. Tokens
- deepseekNEUDeepSeek: DeepSeek V4.1 Flash2026-09-1040Intelligenz
- openaiOpenAI: GPT-6 Astra2026-09-0453Intelligenz77Coding
- googleGoogle: Gemini 3.8 Flash2026-09-0241Intelligenz76Coding
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Intelligenz76Coding
- anthropicAnthropic: Claude Fable 5.12026-09-0153Intelligenz82Coding
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligenz72Coding
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 pro 1 Mio. Tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligenz75Coding
- obsidianQwen3.8 27B2026-08-1534Intelligenz68Coding
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligenz69Coding
- grokSpaceXAI: Grok 4.62026-08-1244Intelligenz77Coding
- metaMeta: Muse Spark 1.22026-08-0540Intelligenz72Coding
- qwenQwen: Qwen3.8 Max2026-08-0345Intelligenz76Coding
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Intelligenz69Coding
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 pro 1 Mio. Tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Es gibt zwei Möglichkeiten, im September 2026 ein 2K-Bildmodell zu kaufen, und dabei handelt es sich weniger um zwei Produkte als vielmehr um zwei Geschäftsmodelle. Hy Image3.5 preview, seit dem 22. September 2026 live, ist ein nutzungsabhängiger Endpunkt: 0,024 US-Dollar pro Bild auf Tencent internationaler Preisliste, 0,15 ¥ im Inland, abgerechnet nach gelieferter Ausgabe, und Sie kommen nie mit einer GPU in Berührung. LLaDA-Image, aus der inclusionAI-Open-Model-Gruppe und veröffentlicht am 4. September 2026, ist ein herunterladbarer Checkpoint: eine vereinheitlichte 7B-Klasse-Familie für Generierung und Bearbeitung unter einer Apache-2.0-Kennzeichnung, die auf Hugging Face liegt, ohne dass ein gehosteter Endpunkt daran angebunden ist. Hunderttausend 2K-Bilder pro Monat kosten auf dem ersten Weg etwa 2.400 US-Dollar. Der zweite Weg kostet nichts pro Bild und einen Geldbetrag, den Sie selbst ermitteln müssen, weil die Gewichte kostenlos sind, die Hardware aber nicht.
Das ist der ganze Vergleich, und fast jeder Fehler, der dabei gemacht wird, rührt daher, dass man die beiden vergleicht, als wäre die Preisspalte der einzige Unterschied. Dem ist nicht so. Eines davon kann dir unter den Füßen weg als veraltet eingestuft werden. Eines davon lässt sich feinabstimmen. Eines davon kommt mit einem herstellereigenen Benchmark und ohne unabhängige Bewertung; das andere kommt mit einem technischen Bericht, einem öffentlichen Repository und etwa tausend Downloads.
Zwei LLaDA-Image zugeschriebene Behauptungen, die sich selbst widersprechen
Bevor der Vergleich irgendetwas wert ist, müssen zwei Details auf der LLaDA-Image-Karte kenntlich gemacht statt geklärt werden, denn beide sind echte Widersprüche in der öffentlichen Quellenlage, und stillschweigend eine Seite zu wählen wäre ein schlimmerer Fehler, als es zu sagen.
Der erste Punkt ist die Parameteranzahl. Der eigene Fließtext der Modellkarte beschreibt „eine wettbewerbsfähige quelloffene, vereinheitlichte Modellfamilie mit 6 Mrd. Parametern für Bildgenerierung und -bearbeitung". Die Seitenleiste auf derselben Seite gibt die Safetensors-Modellgröße mit 7 Mrd. Parametern bei BF16 an. Beide Zahlen stehen auf derselben Seite, wurden von derselben Organisation veröffentlicht, und nichts in der Karte bringt sie miteinander in Einklang. Behandle die Klasse als „grob sieben Milliarden Parameter, mit einer Angabe von sechs Milliarden in der Beschreibung" und gib keine der beiden Zahlen als gesichert an. Wer dir die genaue Anzahl nennt, rät anhand derselben Karte, die du selbst lesen kannst.
Das Zweite ist die Lizenz. Die Karte trägt License: apache-2.0 heute. Unsere eigene frühere Berichterstattung über diese Familie sagte, dass keine der veröffentlichten Karten ein Lizenz-Tag trug und dass es keine LICENSE-Datei im Repository gab. Beide Aussagen können zu unterschiedlichen Zeitpunkten zutreffen – ein Tag kann hinzugefügt werden –, aber wir werden nicht so tun, als wären sie immer gleich gewesen, und eine Lizenz, die nach der Veröffentlichung auftauchte, ist eine wesentlich andere Tatsache als eine Lizenz, die mit den Gewichten ausgeliefert wurde. Wenn die Lizenz für Ihren Anwendungsfall tragend ist, prüfen Sie das Repository selbst im Moment des Downloads und prüfen Sie, ob der Trainingscode, den die Karte als demnächst verfügbar beschreibt, unter denselben Bedingungen erscheint.

Was die beiden Architekturen tatsächlich verkaufen
LLaDA-Image ist kein Diffusionsmodell im üblichen Sinne, und genau das ist das Interessante daran. Es kombiniert einen Diffusion-Transformer mit einem eingefrorenen Vision-Language-Modell – LLaDA2.0-mini – und einem RQA-Connector dazwischen, und es wird als Familie statt als einzelner Checkpoint veröffentlicht: Base mit 50 Schritten für Qualität, Turbo mit zwei bis vier Schritten für Durchsatz, jeweils in BF16 und FP8. Das sind vier Checkpoints, und die Schrittanzahlen sind der Grund, warum ein selbst gehostetes Deployment überhaupt mit begrenztem Budget realisierbar ist: Ein 7B-Modell mit 50 Schritten ist eine andere Hardware-Anforderung als eines mit 2 bis 4 Schritten. Der technische Bericht ist öffentlich, und das Trainingsrezept wird als vollständig offen beschrieben, was eine stärkere Transparenzaussage ist, als die meisten Open-Weight-Veröffentlichungen machen.
Hy Image3.5 preview ist bewusst genau umgekehrt aufgebaut. Es ist ein Endpunkt mit einem Verhalten: Text-zu-Bild und Bild-zu-Bild im selben Aufruf, mehrstufige Bearbeitung, die frühere Runden als Kontext mitführt, bis zu fünf Referenzbilder pro Anfrage, eine 2K-Obergrenze für die Ausgabe und die Kennung hy-image-v3.5-preview. Es gibt nichts auszuwählen, nichts abzustimmen und nichts herunterzuladen. Der Funktionsumfang ist von Haus aus größer — mehrstufige konversationelle Bearbeitung mit beibehaltenem Kontext ist eine echte Funktion, die die offene Familie nicht bewirbt — und Sie haben auf nichts davon Einfluss.
• Kostenbasis — Hy Image3.5 preview kostet 0,024 $ pro 2K-Bild, abgerechnet auf Basis des gelieferten Outputs; LLaDA-Image bietet freie Gewichte plus das, was deine GPU zum Ausführen kostet.
• Was Sie bekommen — Hy Image3.5 preview ist eine gehostete API mit Multi-Turn-Bearbeitung und fünf Referenzbildern; LLaDA-Image sind vier Checkpoints (Base und Turbo, BF16 und FP8) und ein Trainingsrezept.
• Schritte bis zum Bild — Hy Image3.5 preview ist ein einzelner Aufruf, bei dem kein Schrittparameter offengelegt wird; LLaDA-Image benötigt 50 Schritte auf Base oder 2 bis 4 auf Turbo, die Sie selbst festlegen.
• Gewichte — Hy Image3.5 preview veröffentlicht keine; LLaDA-Image veröffentlicht die vollständige Familie.
• Lizenz — Hy Image3.5 preview ist ein kommerzieller Dienst, der den Bedingungen von Tencent unterliegt; LLaDA-Image trägt ein apache-2.0-Tag, das in unserer eigenen früheren Berichterstattung nicht zu sehen war.
• Belege — Hy Image3.5 preview hat einen vom Anbieter durchgeführten GSD-Blindtest und keine unabhängige Elo-Wertung; LLaDA-Image hat einen vom Autor berichteten Qwen-Image-Bench-Wert von 53,53 auf Englisch und 53,38 auf Chinesisch und ebenfalls keine unabhängige Elo-Wertung.
Die Dinge, die nur eines davon kann
Beginnen Sie mit dem, was die Gewichte Ihnen verschaffen, denn es ist mehr als eine Lizenzpräferenz. Ein Checkpoint ist ein Aktivposten: Er kann nicht als veraltet eingestuft, neu bepreist, gedrosselt oder abgeschaltet werden, und eine Pipeline, die an eine bestimmte Datei gebunden ist, läuft auch in drei Jahren noch. Er kann auf Ihrem eigenen Material feinabgestimmt werden, was für ein Team mit einem Hausstil oder einem bestimmten Zeichensatz der Unterschied zwischen dem Prompting eines fremden Modells und dem Training eines eigenen ist. Er läuft offline, was wichtig ist, wenn das Material Kundenarbeit ist, die einer Vertraulichkeitsvereinbarung unterliegt. Und sein Durchsatz ist eine Funktion der Hardware, die Sie gekauft haben, und nicht einer Warteschlange, in die Sie sich eingereiht haben.
Dagegen erkauft dir ein Endpoint die Abwesenheit von Arbeit. Niemand in deinem Team lernt einen Serving-Stack, niemand dimensioniert eine GPU, niemand entdeckt in der Produktion, dass der FP8-Checkpoint eine andere Runtime braucht als der BF16-Checkpoint, und niemand muss geradestehen, wenn der Job um 3 Uhr nachts fehlschlägt. Das Tencent-Modell bringt zudem eine Fähigkeit mit, die die offene Familie nicht für sich beansprucht: Multi-Turn-Editing, das die Konversation beibehält – genau der Mechanismus, mit dem eine Figur über eine lange Reihe von Bearbeitungen hinweg gehalten wird. Die Bearbeitungsunterstützung von LLaDA-Image ist real – es ist eine vereinheitlichte Familie für Generierung und Bearbeitung –, aber ein Konversationszustand über mehrere Turns hinweg ist nichts, womit die Modellkarte wirbt.
Ehrlich gesagt konkurrieren diese überhaupt nicht über die Qualität. Sie konkurrieren darum, wer das operative Risiko trägt, und die beiden Antworten lauten „Tencent“ und „Sie“.
Was tatsächlich gemessen wurde, auf beiden Seiten
Keines der beiden Modelle hat eine unabhängige Platzierung. Das Text-zu-Bild-Board von Artificial Analysis, abgerufen am 23. September 2026, führt keine Zeile für Hy Image3.5 Preview und keine Zeile für LLaDA-Image. Wo das Board Tencent überhaupt führt, handelt es sich um die vorherige Generation: HunyuanImage 3.0 Instruct mit 964 Elo und HunyuanImage 3.0 mit 945, auf Rang 65 und 70 von 156 Modellen – die einzige Drittanbieter-Messung von irgendetwas in dieser Familie, und sie ist eine Generation alt.
Was jede Seite stattdessen anbietet, ist ihre eigene Arbeit. Die von Tencent ist der Blind-Präferenztest im GSD-Stil, der mit mehreren hundert eigenen professionellen Designern des Unternehmens durchgeführt wurde und etwa dreißig Prozent Vorsprung vor Hy Image3.0, Gleichstand mit Seedream 5.0 Pro sowie einen leichten Vorsprung vor Nano-Banana Pro und Qwen-Image-3.0-Pro meldet. Vom Anbieter durchgeführt, vom Anbieter besetzt, Prompt-Set unveröffentlicht – eine echte Methode mit einem echten Interessenkonflikt, und beide Hälften dieses Satzes gehören in denselben Atemzug.
Der Qwen-Image-Bench-Score von LLaDA-Image liegt bei 53,53 auf Englisch und 53,38 auf Chinesisch, eine von den Autoren gemeldete Zahl auf einem Benchmark, den die Autoren selbst ausgewählt haben. Er ist nicht unabhängiger als Tencents Test; er ist auf andere Weise nicht auditiert. Die Modellkarte listet außerdem fünf Community-Spaces und eine monatliche Downloadzahl von rund tausend auf, was zeigt, dass die offene Familie echte, aber bescheidene Verbreitung hat — es ist kein Modell, das das Feld bereits übernommen hat, und wer Ihnen etwas anderes erzählt, hat sich die Zahl nicht angesehen.

Wohin das Geld tatsächlich fließt – in großem Umfang
Rechnen Sie die Mietseite ehrlich durch, denn sie ist die einzige Seite mit einem veröffentlichten Preis. Hunderttausend 2K-Bilder pro Monat bei 0,024 $ sind 2.400 $. Eine halbe Million pro Monat sind 12.000 $, oder etwa 144.000 $ pro Jahr, und in diesem Maßstab ist ein selbst gehostetes Bildmodell der 7B-Klasse keine Hobby-Option mehr, sondern wird zu einem offensichtlichen Rechnungsposten. Unter ungefähr zehntausend Bildern pro Monat geht die Rechnung überhaupt nicht so auf: 240 $ gegenüber den Kosten für eine GPU, den Strom, den Speicher, den Serving-Stack und jemandes Aufmerksamkeit ist keine knappe Angelegenheit, und der nutzungsabhängig abgerechnete Endpunkt gewinnt auf jeder Achse, einschließlich derjenigen, die Sie nicht mitzählen.
Der Break-even-Punkt ist keine Zahl, die Ihnen jemand einfach nennen kann, denn die selbst gehostete Seite hängt von der Hardware ab, die Sie bereits besitzen, von der tatsächlich erreichten Auslastung und davon, ob die GPU etwas anderes tut, wenn sie gerade keine Bilder generiert. Was sich präzise sagen lässt, ist die Form der Kurve: Das verbrauchsabhängige Modell ist linear in Bezug auf das Volumen, und das selbst gehostete Modell ist eine Stufenfunktion, sodass die Frage nicht lautet, welches günstiger ist, sondern wo Ihr Volumen relativ zur Stufe liegt.
Ein Endpunkt, ganz gleich, welchen Weg Sie wählen
OrcaRouter leitet keines von beiden weiter. Wir hosten kein Tencent-Bildmodell – die einzigen Tencent-Einträge im Katalog sind die reine Textlinie Hy3 – und überhaupt nichts von inclusionAI. Hy Image3.5 preview bedeutet also Tencents eigene Cloud und die First-Party-Produkte von Tencent, und LLaDA-Image bedeutet die veröffentlichten Gewichte und die Runtime, auf die du sie auch immer richtest. Das unmissverständlich zu sagen, ist nützlicher als eine Modellseite, die dies offenlässt.
Wofür eine Routing-Schicht in dieser Entscheidung gut ist, ist die dritte Option, die sie günstig macht. Wenn Sie 2.400 $ pro Monat gegen einen GPU-Kauf abwägen, ist der nützliche Zwischenschritt, zu wissen, was dieselbe Workload über Modelle hinweg kostet, die Sie heute ohne Vertrag erreichen können — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, die Imagen-4-Familie und grok/grok-imagine-image liegen alle hinter einem OpenAI-kompatiblen Endpoint zum Listenpreis des Anbieters mit 0 % Aufschlag, sodass eine Preisänderung eines Anbieters bei uns noch am selben Tag live ist, und automatisches Failover bedeutet, dass ein schlechter Nachmittag eines Anbieters nicht zu Ihrem Ausfall wird. Das ist kein Ersatz für eines der beiden Modelle in diesem Vergleich. Es ist das, was verhindert, dass der Vergleich eine im Dunkeln getroffene Zwei-Wege-Entscheidung bleibt.

Die eine Frage, die den Ausschlag gibt
Fragen Sie sich, ob Ihre Workload eine Form hat, die die Gewichte erfassen können und der Endpunkt nicht. Wenn Sie gegen einen Hausstil, einen festen Zeichensatz oder das eigene Material eines Kunden generieren und über das Volumen und die Hardware verfügen, damit sich ein Modell der 7B-Klasse rechnet, dann ist LLaDA-Image der langlebigere Vermögenswert, und das Apache-2.0-Tag – prüfen Sie es beim Download, angesichts der obigen Historie – ist das, was es nutzbar macht. Sie kaufen Wahlfreiheit und zahlen dafür im Betrieb.
Wenn Ihre Workload stoßweise auftritt, wenn niemand im Team einen Serving-Stack verantworten möchte, wenn Multi-Turn-Bearbeitung mit beibehaltenem Kontext die Funktion ist, die Sie tatsächlich brauchen, oder wenn Ihr Volumen unter zehntausend Bildern pro Monat liegt, dann sind $0,024 pro geliefertem 2K-Bild ein guter Preis für das Problem von jemand anderem, und das Preview-Label ist das Wichtigste, das Sie im Blick behalten sollten. Das Einzige, was sich vor dem 7. Oktober 2026 lohnt – während Miora, WorkRally und OnSolo das kostenlose Zeitfenster laufen lassen –, ist, Ihr eigenes Prompt-Set durch das Tencent-Modell zu schicken und die Akzeptanzrate aufzuschreiben, denn diese Zahl, nicht die dreißig Prozent, ist diejenige, die entscheidet, ob die verbrauchsabhängig abgerechnete Seite ihren Zähler wert ist.
