
Hy Image3.5 vs LLaDA-Image: Wynająć endpoint czy mieć własne wagi
- OrcaNOWOŚĆOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 za 1 mln tokenów
- orcaNOWOŚĆOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 za 1 mln tokenów
- deepseekNOWOŚĆDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencja
- openaiOpenAI: GPT-6 Astra2026-09-0453Inteligencja77Kod
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencja76Kod
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencja76Kod
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencja82Kod
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 za 1 mln tokenów
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencja72Kod
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 za 1 mln tokenów
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencja75Kod
- obsidianQwen3.8 27B2026-08-1534Inteligencja68Kod
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligencja69Kod
- grokSpaceXAI: Grok 4.62026-08-1244Inteligencja77Kod
- metaMeta: Muse Spark 1.22026-08-0540Inteligencja72Kod
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligencja76Kod
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Inteligencja69Kod
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 za 1 mln tokenów
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Istnieją dwa sposoby kupienia modelu obrazu 2K we wrześniu 2026 roku i nie są to tyle dwa produkty, ile dwa modele biznesowe. Hy Image3.5 preview, dostępny od 22 września 2026 roku, to endpoint rozliczany za użycie: 0,024 USD za obraz według międzynarodowego cennika Tencent, 0,15 juana na rynku krajowym, opłata naliczana od dostarczonego wyniku — i nigdy nie dotykasz GPU. LLaDA-Image, z grupy modeli otwartych inclusionAI, wydany 4 września 2026 roku, to checkpoint do pobrania: rodzina klasy 7B do zunifikowanego generowania i edycji objęta licencją Apache-2.0, dostępna na Hugging Face, bez dołączonego hostowanego endpointu. Sto tysięcy obrazów 2K miesięcznie kosztuje w pierwszym wariancie około 2400 USD. Drugi wariant nie kosztuje nic za obraz plus kwota, którą musisz obliczyć samodzielnie, bo wagi są darmowe, a sprzęt nie.
To całe porównanie, a niemal każdy popełniany przy nim błąd wynika z porównywania tych dwóch tak, jakby kolumna z ceną była jedyną różnicą. Nie jest. Jedno z nich może zostać zdeprecjonowane, gdy już z niego korzystasz. Jedno z nich można dostroić. Jedno z nich ma własny benchmark dostawcy i żadnego niezależnego wyniku; drugie ma raport techniczny, publiczne repozytorium i około tysiąca pobrań.
Dwa twierdzenia przypisane do LLaDA-Image, które nie zgadzają się ze sobą
Zanim to porównanie będzie cokolwiek warte, dwa szczegóły na karcie LLaDA-Image wymagają raczej zasygnalizowania niż rozstrzygnięcia, ponieważ oba stanowią autentyczne sprzeczności w publicznym zapisie, a ciche opowiedzenie się po jednej stronie byłoby gorszym błędem niż powiedzenie o tym.
Pierwsza to liczba parametrów. Własny opis karty modelu mówi o „konkurencyjnej rodzinie otwartoźródłowych, zunifikowanych modeli generowania i edycji obrazów o 6 mld parametrów”. Panel boczny na tej samej stronie podaje rozmiar modelu Safetensors jako 7B parametrów w BF16. Obie liczby znajdują się na tej samej stronie, opublikowanej przez tę samą organizację, i nic w karcie ich nie uzgadnia. Traktuj tę klasę jako „około siedem miliardów parametrów, z liczbą sześciu miliardów w opisie” i nie cytuj żadnej z nich jako rozstrzygniętej. Każdy, kto podaje ci dokładną liczbę, zgaduje na podstawie tej samej karty, którą możesz przeczytać.
Drugi to licencja. Karta zawiera License: apache-2.0 obecnie. Nasze wcześniejsze własne omówienie tej rodziny mówiło, że żadna z opublikowanych kart nie miała znacznika licencji i że w repozytorium nie było pliku LICENSE. Oba stwierdzenia mogą być prawdziwe w różnych momentach — znacznik można dodać — ale nie zamierzamy udawać, że zawsze było tak samo, a licencja, która pojawiła się po wydaniu, to zasadniczo inny fakt niż licencja dostarczona wraz z wagami. Jeśli licencja ma kluczowe znaczenie dla twojego przypadku użycia, sprawdź repozytorium samodzielnie w momencie pobierania i sprawdź, czy kod treningowy, który karta opisuje jako „wkrótce", pojawi się na tych samych warunkach.

Co tak naprawdę sprzedają te dwie architektury
LLaDA-Image nie jest modelem dyfuzyjnym w zwykłym sensie i to jest w nim interesujące. Łączy transformator dyfuzyjny z zamrożonym modelem językowo-wizyjnym — LLaDA2.0-mini — oraz łącznikiem RQA między nimi, i jest publikowany jako rodzina, a nie pojedynczy checkpoint: Base przy 50 krokach dla jakości, Turbo przy dwóch do czterech krokach dla przepustowości, każdy w BF16 i FP8. To cztery checkpointy, a liczby kroków są powodem, dla którego samodzielnie hostowane wdrożenie może w ogóle działać przy ograniczonym budżecie: model 7B z 50 krokami to inne wymagania sprzętowe niż model z 2–4 krokami. Raport techniczny jest publiczny, a przepis treningowy opisano jako w pełni otwarty, co jest silniejszym twierdzeniem o przejrzystości niż w przypadku większości wydań z otwartymi wagami.
Hy Image3.5 preview ma celowo odwrotny kształt. To jeden punkt końcowy o jednym zachowaniu: text-to-image i image-to-image w tym samym wywołaniu, wieloturażowa edycja, która przenosi wcześniejsze tury jako kontekst, do pięciu obrazów referencyjnych na żądanie, limit wyjściowy 2K oraz identyfikator hy-image-v3.5-preview. Nie ma nic do wyboru, nic do dostrajania i nic do pobrania. Zestaw możliwości jest szerszy od razu po wyjęciu z pudełka — wieloturażowa edycja konwersacyjna z zachowanym kontekstem to prawdziwa funkcja, której otwarta rodzina nie reklamuje — a nie masz nad tym żadnej kontroli.
• Podstawa kosztów — Hy Image3.5 preview to 0,024 USD za obraz 2K, rozliczane na podstawie dostarczonych wyników; LLaDA-Image to darmowe wagi plus koszt działania Twojego GPU.
• Co otrzymujesz — Hy Image3.5 preview to hostowane API z edycją w wielu turach i pięcioma obrazami referencyjnymi; LLaDA-Image to cztery checkpointy (Base i Turbo, BF16 i FP8) oraz przepis treningowy.
• Kroki do obrazu — Hy Image3.5 preview to pojedyncze wywołanie bez udostępnionego parametru kroków; LLaDA-Image to 50 kroków w Base lub od 2 do 4 w Turbo, które ustawiasz samodzielnie.
• Wagi — Hy Image3.5 preview nie udostępnia żadnych; LLaDA-Image udostępnia całą rodzinę.
• Licencja — Hy Image3.5 preview to usługa komercyjna podlegająca warunkom Tencent; LLaDA-Image ma znacznik apache-2.0, którego nasze własne wcześniejsze doniesienia nie odnotowały.
• Dowody — Hy Image3.5 preview ma test ślepy GSD dostawcy i brak niezależnego Elo; LLaDA-Image ma zgłoszony przez autora wynik Qwen-Image-Bench wynoszący 53,53 w języku angielskim i 53,38 w chińskim, a także brak niezależnego Elo.
Rzeczy, które potrafi zrobić tylko jedna z nich
Zacznij od tego, co dają ci wagi, bo to więcej niż preferencja licencyjna. Checkpoint jest aktywem: nie można go oznaczyć jako przestarzałego, ponownie wycenić, ograniczyć liczby żądań ani wyłączyć, a pipeline przypięty do konkretnego pliku będzie nadal działać za trzy lata. Można go dostroić na własnych materiałach, co dla zespołu z własnym stylem lub określonym zestawem znaków oznacza różnicę między promptowaniem cudzego modelu a trenowaniem własnego. Działa offline, co ma znaczenie, jeśli materiał to praca dla klienta objęta klauzulą poufności. A jego przepustowość zależy od sprzętu, który kupiłeś, a nie od kolejki, do której dołączyłeś.
W zamian endpoint daje ci brak pracy. Nikt w twoim zespole nie uczy się stosu serwowania, nikt nie dobiera rozmiaru GPU, nikt nie odkrywa na produkcji, że checkpoint FP8 wymaga innego środowiska uruchomieniowego niż BF16, i nikt nie ponosi odpowiedzialności, gdy zadanie padnie o 3 w nocy. Model Tencenta ma też możliwość, której otwarta rodzina nie deklaruje: edycję w wielu turach, która zachowuje konwersację — a to dokładnie ten mechanizm, który stoi za utrzymaniem postaci przez długą serię edycji. Wsparcie edycji w LLaDA-Image jest prawdziwe — to zunifikowana rodzina generowania i edycji — ale stan konwersacji między turami to coś, czego karta nie reklamuje.
Szczerze mówiąc, one wcale nie konkurują jakością. Konkurują o to, kto ponosi ryzyko operacyjne, a odpowiedzi są dwie: „Tencent” i „ty”.
Co tak naprawdę zostało zmierzone po obu stronach
Żaden z modeli nie ma niezależnej pozycji. Ranking tekst-na-obraz Artificial Analysis, odczytany 23 września 2026 r., nie zawiera wiersza podglądu Hy Image3.5 ani wiersza LLaDA-Image. Tam, gdzie ranking faktycznie ma Tencent, jest to poprzednia generacja: HunyuanImage 3.0 Instruct z 964 Elo i HunyuanImage 3.0 z 945, sklasyfikowane na 65. i 70. miejscu na 156 modeli — co jest jedynym pomiarem strony trzeciej czegokolwiek w tej rodzinie i jest o jedną generację starsze.
W zamian każda ze stron oferuje własną pracę. Oferta Tencenta to test ślepej preferencji w stylu GSD, przeprowadzony z udziałem kilkuset własnych profesjonalnych projektantów firmy, wykazujący około trzydziestu procent przewagi nad Hy Image3.0, równy wynik z Seedream 5.0 Pro i niewielką przewagę nad Nano-Banana Pro oraz Qwen-Image-3.0-Pro. Prowadzony przez dostawcę, obsadzony przez dostawcę, niepublikowany zestaw promptów — prawdziwa metoda z prawdziwym konfliktem interesów, a obie części tego zdania trzeba wypowiedzieć jednym tchem.
Wynik LLaDA-Image w Qwen-Image-Bench to 53,53 w języku angielskim i 53,38 w chińskim, czyli liczba podana przez autorów na benchmarku, który sami wybrali. Nie jest bardziej niezależny niż test Tencenta; jest niezaudytowany w inny sposób. Karta modelu wymienia też pięć społecznościowych Spaces i miesięczną liczbę pobrań na poziomie około tysiąca, co mówi, że otwarta rodzina ma realne, ale skromne zainteresowanie — nie jest to model, który środowisko już przyjęło, a każdy, kto mówi inaczej, nie spojrzał na tę liczbę.

Dokąd faktycznie trafiają pieniądze — na dużą skalę
Policz uczciwie stronę wynajmu, bo tylko ona ma opublikowaną stawkę. Sto tysięcy obrazów w rozdzielczości 2K miesięcznie po 0,024 USD to 2400 USD. Pół miliona miesięcznie to 12 000 USD, czyli około 144 000 USD rocznie, a w tej skali samodzielnie hostowany model obrazowy klasy 7B przestaje być opcją dla hobbystów i zaczyna być oczywistą pozycją w budżecie. Poniżej mniej więcej dziesięciu tysięcy obrazów miesięcznie arytmetyka wcale nie działa w ten sposób: 240 USD wobec kosztu GPU, energii, pamięci masowej, stosu serwowania i czyjejś uwagi to nie jest wyrównana walka, a endpoint rozliczany za użycie wygrywa na każdej płaszczyźnie, w tym tej, której nie wliczasz.
Punkt przejścia nie jest liczbą, którą ktokolwiek może ci podać, ponieważ strona self-hosted zależy od sprzętu, który już posiadasz, wykorzystania, które faktycznie osiągasz, oraz tego, czy GPU robi coś innego, gdy nie generuje obrazów. To, co można powiedzieć precyzyjnie, to kształt krzywej: model rozliczany za użycie jest liniowy względem wolumenu, a model self-hosted jest funkcją schodkową, więc pytanie nie brzmi, który jest tańszy, ale gdzie twój wolumen znajduje się względem tego progu.
Jeden punkt końcowy, niezależnie od tego, którą drogę wybierzesz
OrcaRouter nie kieruje ruchu do żadnego z nich. Nie hostujemy żadnego modelu obrazowego Tencenta — jedyne wpisy Tencenta w katalogu to wyłącznie tekstowa linia Hy3 — a z inclusionAI nie ma zupełnie nic, więc Hy Image3.5 preview oznacza własną chmurę Tencenta i produkty własne Tencenta, a LLaDA-Image oznacza opublikowane wagi i dowolne środowisko uruchomieniowe, na które je wskażesz. Powiedzenie tego wprost jest bardziej użyteczne niż strona modelu, która pozostawia to niejednoznacznym.
To, do czego w tej decyzji przydaje się warstwa routingu, to trzecia opcja, którą czyni ona tanią. Jeśli rozważasz $2,400 miesięcznie w zestawieniu z zakupem GPU, przydatnym rozwiązaniem pośrednim jest wiedza, ile to samo obciążenie kosztuje w modelach, do których możesz sięgnąć już dziś bez umowy — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, rodzina Imagen 4 oraz grok/grok-imagine-image są dostępne za jednym endpointem zgodnym z OpenAI po cenie katalogowej dostawcy z 0% marży, więc zmiana ceny u dostawcy jest widoczna po naszej stronie tego samego dnia, a automatyczne przełączanie awaryjne oznacza, że gorsze popołudnie jednego dostawcy nie jest Twoją awarią. To nie zastępuje żadnego z modeli w tym porównaniu. To właśnie sprawia, że porównanie przestaje być dwukierunkowym wyborem podejmowanym po ciemku.

Jedno pytanie, które o tym decyduje
Zapytaj, czy Twoje obciążenie ma kształt, który wagi mogą uchwycić, a endpoint nie. Jeśli generujesz zgodnie z firmowym stylem, stałym zestawem znaków lub materiałami własnymi klienta, a masz wolumen i sprzęt, by model klasy 7B na siebie zarabiał, to LLaDA-Image jest trwalszym zasobem, a oznaczenie Apache-2.0 — sprawdź je przy pobieraniu, biorąc pod uwagę powyższą historię — jest tym, co czyni go użytecznym. Kupujesz opcjonalność i płacisz za nią w operacjach.
Jeśli Twoje obciążenie ma charakter skokowy, jeśli nikt w zespole nie chce być właścicielem stosu obsługi modeli, jeśli edycja wieloturazowa z zachowanym kontekstem to funkcja, której naprawdę potrzebujesz, albo jeśli Twój wolumen wynosi poniżej dziesięciu tysięcy obrazów miesięcznie, to 0,024 USD za dostarczony obraz 2K jest dobrą ceną za czyjś problem, a etykieta wersji zapoznawczej to główna rzecz, którą trzeba mieć na uwadze. Jedyna rzecz, którą warto zrobić przed 7 października 2026 r. — gdy Miora, WorkRally i OnSolo prowadzą darmowe okno — to przepuścić własny zestaw promptów przez model Tencent i zapisać współczynnik akceptacji, ponieważ to ta liczba, a nie te trzydzieści procent, decyduje o tym, czy rozliczana część jest warta swojego licznika.
