Hero-titelkort med texten ”Hy Image3.5 vs LLaDA-Image – endpointen mot checkpointen”, med underrubriken ”Två sätt att köpa en 2K-bildmodell i september 2026, och vem som bär den operativa risken”. Den vänstra kolumnen, ”Hy Image3.5 preview – hyra”, listar: åtkomst via en mätarbaserad endpoint utan vikter; $0,024 per 2K-bild som faktureras på levererad output; ett tak på 2K och upp till 5 referensbilder; redigering i flera turer med bibehållen kontext, ja; går att finjustera, nej; kan avvecklas under dig, ja. Den högra kolumnen, ”LLaDA-Image – äga”, listar: åtkomst via nedladdningsbara checkpoints utan hostad endpoint; gratis vikter plus din egen GPU; en familj av Base 50-steg och Turbo 2–4-steg i BF16 och FP8; redigering i flera turer med bibehållen kontext annonseras inte; går att finjustera, ja; kan avvecklas under dig, nej. En sidfot lyder: ”Tencent-siffrorna är leverantörsrapporterade. LLaDA-Image ingår i inclusionAI:s öppna familj; dess kort har en apache-2.0-tagg och anger 6B i löptext mot 7B i sidopanelen. OrcaRouter dirigerar ingen av dem.” OrcaRouter-logotypen är komponerad i det nedre högra hörnet.
Guides & Insights

Hy Image3.5 vs LLaDA-Image: Hyr slutpunkten eller äg vikterna

Författare

Elias Hawthorne

Publiceringsdatum

Senaste modellerna · 20Visa alla modeller
Benchmarks: Artificial Analysis · uppdateras dagligen
Tillbaka till alla inlägg

Det finns två sätt att köpa en 2K-bildmodell i september 2026, och de är inte så mycket två produkter som två affärsmodeller. Hy Image3.5 preview, i drift sedan den 22 september 2026, är en mätarbaserad slutpunkt: 0,024 dollar per bild enligt Tencents internationella prislista, 0,15 ¥ inrikes, debiteras utifrån levererad utdata, och du behöver aldrig röra en GPU. LLaDA-Image, från open-modellgruppen inclusionAI och släppt den 4 september 2026, är en nedladdningsbar checkpoint: en enhetlig familj för generering och redigering i 7B-klassen under en Apache-2.0-tagg, som ligger på Hugging Face utan någon kopplad hostad slutpunkt. Hundra tusen 2K-bilder i månaden kostar cirka 2 400 dollar på det första sättet. Det andra sättet kostar ingenting per bild och en summa pengar som du själv måste räkna ut, eftersom vikterna är gratis och hårdvaran inte är det.

Det är hela jämförelsen, och nästan varje misstag som görs kring den kommer från att jämföra de två som om priskolumnen vore den enda skillnaden. Det är den inte. En av dessa kan bli utfasad under dig. En av dem kan finjusteras. En av dem kommer med leverantörens egen benchmark och inget oberoende resultat; den andra kommer med en teknisk rapport, ett offentligt kodförråd och omkring tusen nedladdningar.

Två påståenden kopplade till LLaDA-Image som inte stämmer överens med sig själva

Innan jämförelsen är värd något finns det två detaljer på LLaDA-Image-kortet som behöver flaggas snarare än lösas, eftersom båda är verkliga konflikter i det offentliga materialet och att i tysthet välja sida skulle vara ett värre misstag än att säga det.

Det första är parameterantalet. Modellkortets egen prosa beskriver "en konkurrenskraftig öppen källkodsmodellfamilj för enhetlig bildgenerering och redigering med 6B parametrar". Sidopanelen på samma sida anger Safetensors-modellstorleken som 7B parametrar i BF16. Båda siffrorna finns på samma sida, publicerade av samma organisation, och ingenting i kortet förklarar hur de hänger samman. Behandla klassen som "ungefär sju miljarder parametrar, med en siffra på sex miljarder i beskrivningen" och citera inte någon av dem som fastställd. Den som uppger det exakta antalet för dig gissar utifrån samma kort som du själv kan läsa.

Det andra är licensen. Kortet bär License: apache-2.0 i dag. Vår egen tidigare bevakning av den här familjen sade att inget av de släppta korten bar en licenstagg och att det inte fanns någon LICENSE-fil i repot. Båda påståendena kan vara sanna vid olika tidpunkter — en tagg kan läggas till — men vi tänker inte låtsas att de alltid var likadana, och en licens som dök upp efter släppet är ett väsentligt annat faktum än en licens som levererades med vikterna. Om licensen är avgörande för ditt användningsfall bör du själv kontrollera repot i det ögonblick du laddar ner det, och kontrollera om träningskoden, som kortet beskriver som kommande, kommer under samma villkor.

Screenshot of the Hugging Face model card for inclusionAI/LLaDA-Image, showing License: apache-2.0, tags including Text-to-Image, Diffusers, Safetensors, LLaDAImagePipeline, image-generation, image-editing and arxiv:2609.03796, model-scope badges for Base, Base-FP8, Turbo and Turbo-FP8, the description text 'LLaDA-Image is a competitive 6B-parameter open-source unified image generation and editing model family', and a right rail listing 1,021 downloads last month, Safetensors with model size 7B params at BF16 tensor type, an inference-providers panel reading 'This model isn't deployed by any Inference Provider', a model tree with 1 finetune and 3 quantizations, 5 Spaces, and a collection updated 19 days ago with the paper published 20 days ago.

Vad de två arkitekturerna egentligen säljer

LLaDA-Image är inte en diffusionsmodell i vanlig mening och det är det intressanta med den. Den kombinerar en diffusionstransformator med en fryst visionsspråkmodell — LLaDA2.0-mini — och en RQA-koppling mellan dem, och den publiceras som en familj snarare än en enskild checkpoint: Base vid 50 steg för kvalitet, Turbo vid två till fyra steg för genomströmning, var och en i BF16 och FP8. Det är fyra checkpoints, och stegantalet är anledningen till att en självhostad driftsättning överhuvudtaget kan fås att fungera på en budget: en 7B-modell med 50 steg är en annan hårdvaruförutsättning än en med 2 till 4 steg. Den tekniska rapporten är offentlig och träningsreceptet beskrivs som helt öppet, vilket är ett starkare transparensanspråk än de flesta släpp av öppna vikter gör.

Hy Image3.5 preview är med avsikt den motsatta formen. Det är en endpoint med ett beteende: text-till-bild och bild-till-bild i samma anrop, redigering över flera turer som bär med sig tidigare turer som kontext, upp till fem referensbilder per begäran, ett tak på 2K för utdata, och identifieraren hy-image-v3.5-preview. Det finns inget att välja, inget att ställa in och inget att ladda ner. Funktionsuppsättningen är bredare direkt ur lådan — flerrunds konversationsredigering med bevarat sammanhang är en riktig funktion som den öppna familjen inte gör reklam för — och du har ingen kontroll över något av det.

• Kostnadsbas — Hy Image3.5 preview kostar $0.024 per 2K-bild, mätt på levererad utdata; LLaDA-Image har gratis vikter plus vad din GPU kostar att köra.

• Vad du får — Hy Image3.5 preview är ett hostat API med redigering i flera turer och fem referensbilder; LLaDA-Image är fyra checkpoints (Base och Turbo, BF16 och FP8) och ett träningsrecept.

• Steg till en bild — Hy Image3.5 preview är ett enda anrop utan någon stegparameter exponerad; LLaDA-Image är 50 steg på Base eller 2 till 4 på Turbo, vilket du ställer in själv.

• Vikter — Hy Image3.5 preview publicerar inga; LLaDA-Image publicerar hela familjen.

• Licens — Hy Image3.5 preview är en kommersiell tjänst som regleras av Tencents villkor; LLaDA-Image bär en apache-2.0-tagg som vår egen tidigare rapportering inte såg.

• Bevis — Hy Image3.5 preview har ett GSD-blindtest från leverantören och inget oberoende Elo; LLaDA-Image har en av författaren rapporterad Qwen-Image-Bench-siffra på 53,53 på engelska och 53,38 på kinesiska, och inte heller något oberoende Elo.

Sakerna som bara en av dessa kan göra

Börja med vad vikterna ger dig, för det är mer än en licenspreferens. En checkpoint är en tillgång: den kan inte fasas ut, omprissättas, hastighetsbegränsas eller stängas av, och en pipeline som är låst till en specifik fil kommer fortfarande att köras om tre år. Den kan finjusteras på ditt eget material, vilket för ett team med en egen stil eller en specifik teckenuppsättning är skillnaden mellan att prompta någon annans modell och att träna sin egen. Den körs offline, vilket spelar roll om materialet är kundarbete under ett sekretessavtal. Och dess genomströmning är en funktion av hårdvaran du köpte snarare än en kö du ställde dig i.

Mot det ger en endpoint dig en avsaknad av arbete. Ingen i ditt team lär sig en serving-stack, ingen dimensionerar en GPU, ingen upptäcker i produktion att FP8-checkpointen kräver en annan runtime än BF16-varianten, och ingen hålls ansvarig när jobbet misslyckas klockan 3 på natten. Tencent-modellen har också en förmåga som den öppna familjen inte gör anspråk på: redigering över flera turer som behåller konversationen, vilket är precis mekanismen bakom att hålla en karaktär genom en lång serie redigeringar. Redigeringsstödet i LLaDA-Image är verkligt – det är en enhetlig familj för generering och redigering – men konversationstillstånd över turer är inte något som modellkortet gör reklam för.

Den ärliga beskrivningen är att dessa inte tävlar om kvalitet alls. De tävlar om vem som bär den operativa risken, och de två svaren är "Tencent" och "du".

Vad har faktiskt mätts, på båda sidor

Ingen av modellerna har en oberoende placering. Artificial Analysis resultattavla för text-till-bild, läst den 23 september 2026, innehåller ingen rad för Hy Image3.5 preview och ingen rad för LLaDA-Image. Där tavlan faktiskt har Tencent är det den föregående generationen: HunyuanImage 3.0 Instruct med 964 Elo och HunyuanImage 3.0 med 945, rankade som 65:e och 70:e av 156 modeller — vilket är den enda tredjepartsmätningen av något i den här familjen, och den är en generation gammal.

Det som varje sida i stället erbjuder är sitt eget arbete. Tencents är det GSD-liknande blinda preferenstestet som genomförts med flera hundra av företagets egna professionella designers, och som rapporterar ett försprång på cirka trettio procent gentemot Hy Image3.0, paritet med Seedream 5.0 Pro samt ett litet övertag över Nano-Banana Pro och Qwen-Image-3.0-Pro. Utfört av leverantören, med deltagare från leverantören, och med opublicerad promptuppsättning – en riktig metod med en riktig intressekonflikt, och båda halvorna av den meningen hör hemma i samma andetag.

LLaDA-Images poäng på Qwen-Image-Bench är 53,53 på engelska och 53,38 på kinesiska, vilket är ett författarrapporterat nummer på en benchmark som författarna själva valt. Den är inte mer oberoende än Tencents test; den är oreviderad på ett annat sätt. Kortet listar också fem community Spaces och ett månatligt nedladdningsantal på runt tusen, vilket säger dig att den öppna familjen har ett reellt men blygsamt genomslag — det är inte en modell som fältet redan har adopterat, och den som säger något annat har inte tittat på siffran.

A single-panel card titled 'Hy Image3.5 preview vs LLaDA-Image - two unaudited claims and one empty column', subtitled 'Neither model has a third-party placement; both sides are reporting their own work'. Five rows: 'Independent board - no Hy Image3.5 preview row, no LLaDA-Image row, on the 156-model Artificial Analysis text-to-image board'; 'Tencent's own test - GSD-style blind preference with several hundred of its own designers, roughly +30% over Hy Image3.0 and parity with Seedream 5.0 Pro'; 'LLaDA-Image's own numbers - Qwen-Image-Bench 53.53 English and 53.38 Chinese, author-reported on a benchmark the authors chose'; 'Traction for the open family - about 1,021 downloads in the last month and 5 community Spaces on the model card'; 'Previous Tencent generation - HunyuanImage 3.0 Instruct 964 Elo at rank 65 and HunyuanImage 3.0 945 Elo at rank 70, the only third-party measurement in the family'. A footer reads: 'Tencent and inclusionAI figures are vendor-reported and unreproduced by us. Board figures per Artificial Analysis, read 23 September 2026.' The OrcaRouter logo is composited in the bottom-right corner.

Vart pengarna faktiskt tar vägen, i volym

Räkna ärligt på hyrsidan, för det är den enda sidan som har ett publicerat pris. Hundratusen 2K-bilder i månaden till 0,024 dollar blir 2 400 dollar. En halv miljon i månaden blir 12 000 dollar, eller cirka 144 000 dollar om året, och i den skalan slutar en självhostad bildmodell i 7B-klass att vara ett hobbyalternativ och börjar bli en självklar budgetpost. Under ungefär tiotusen bilder i månaden fungerar kalkylen inte alls på det sättet: 240 dollar mot kostnaden för en GPU, elen, lagringen, serving-stacken och någons uppmärksamhet är inte ett svårt val, och den mätarstyrda slutpunkten vinner på varje punkt, inklusive den du inte räknar med.

Brytpunkten är inte ett tal som någon kan ge dig, eftersom den självhostade sidan beror på hårdvara du redan äger, utnyttjandegrad du faktiskt uppnår, och huruvida GPU:n gör något annat när den inte genererar bilder. Det som kan sägas exakt är kurvans form: den förbrukningsbaserade modellen är linjär i volym och den självhostade modellen är en stegfunktion, så frågan är inte vilken som är billigare utan var din volym ligger i förhållande till steget.

En slutpunkt, oavsett vilken väg du tar

OrcaRouter routar ingen av dessa. Vi hostar ingen Tencent-bildmodell – de enda Tencent-posterna i katalogen är den textbaserade Hy3-linjen – och ingenting från inclusionAI alls, så Hy Image3.5 preview betyder Tencents eget moln och Tencents förstapartsprodukter, och LLaDA-Image betyder de publicerade vikterna och vilken runtime du än pekar dem mot. Att säga det rakt ut är mer användbart än en modellsida som lämnar det oklart.

Det ett routningslager är bra för i det här beslutet är det tredje alternativet som det gör billigt. Om du väger 2 400 dollar i månaden mot ett GPU-köp är den användbara mellanvägen att veta vad samma arbetsbelastning kostar hos de modeller du kan nå i dag utan avtal — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, Imagen 4-familjen och grok/grok-imagine-image ligger alla bakom en enda OpenAI-kompatibel slutpunkt till leverantörens listpris utan påslag, så en prisändring från en leverantör slår igenom hos oss samma dag, och automatisk failover innebär att en leverantörs dåliga eftermiddag inte blir ditt avbrott. Det är ingen ersättning för någon av modellerna i den här jämförelsen. Det är vad som hindrar jämförelsen från att bli ett tvåvägsval fattat i mörkret.

A single-panel card titled 'The crossover is not a number anyone can hand you', subtitled 'Metered pricing is the only side of this comparison with a published rate card'. Six rows: '10,000 images a month - about $240 metered, against a GPU, its power, its storage and somebody's attention'; '100,000 images a month - about $2,400 metered'; '500,000 images a month - about $12,000 a month, roughly $144,000 a year'; 'The shape of the curve - the metered model is linear in volume, the self-hosted model is a step function'; 'The question - not which is cheaper, but where your volume sits relative to the step'; 'Before 7 October 2026 - run your own prompt set through the free window on Miora, WorkRally and OnSolo and write down the accept rate'. A footer reads: 'Hy Image3.5 preview pricing per Tencent ($0.024 per 2K image, billed on delivered output). OrcaRouter routes neither model; we host no Tencent or inclusionAI image model.' The OrcaRouter logo is composited in the bottom-right corner.

Den enda frågan som avgör det

Fråga dig om din arbetsbelastning har en form som vikterna kan fånga och slutpunkten inte kan. Om du genererar mot en husstil, en fast teckenuppsättning eller en kunds eget material, och du har volymen och hårdvaran för att få en modell i 7B-klass att löna sig, då är LLaDA-Image den mer varaktiga tillgången, och Apache-2.0-märkningen – kontrollera den vid nedladdningstillfället, med tanke på historiken ovan – är det som gör den användbar. Du köper optionalitet och betalar för den i driften.

Om din arbetsbelastning är burstig, om ingen i teamet vill äga en serving-stack, om redigering i flera turer med bevarad kontext är funktionen du faktiskt behöver, eller om din volym är under tiotusen bilder i månaden, då är $0,024 per levererad 2K-bild ett bra pris för någon annans problem, och förhandsvisningsetiketten är det viktigaste att ha i åtanke. Det enda som är värt att göra före den 7 oktober 2026 – medan Miora, WorkRally och OnSolo kör sin gratisperiod – är att köra din egen promptuppsättning genom Tencent-modellen och skriva ned acceptansgraden, för det är den siffran, inte de trettio procenten, som avgör om den mätarstyrda sidan är värd sin mätare.