Karta hero dla Qwen-Image-2.1-Turbo, 8-krokowego przyspieszonego checkpointu Qwen-Image-2.1, przedstawiająca 8-krokowy harmonogram zapisany wraz z wagami, domyślnie CFG 1, ponowne wykorzystanie pamięci podręcznej KV prefiksu oraz niezmienioną Qwen Research Licence
Engineering & Research

Qwen-Image-2.1-Turbo: 8-krokowy checkpoint, który przeniósł harmonogram do wag

Autor

Elias Hawthorne

Data publikacji

Najnowsze modele · 20Zobacz wszystkie modele →
Benchmarki: Artificial Analysis · aktualizowane codziennie
Powrót do wszystkich wpisów

Repozytorium dla Qwen-Image-2.1-Turbo pojawiło się na Hugging Face 9 października 2026 r., a najciekawszą rzeczą w nim nie jest liczba kroków. Znajdują się tam wagi bfloat16, karta modelu z kodem do uruchomienia, plik licencji, osiem obrazów pokazowych i jedna linijka na liście nowości projektu Qwen-Image-2.1 na GitHubie ogłaszająca wydanie. Nie ma własnego wpisu na blogu, tabeli wyników, cyklu prasowego ani żadnej zmiany w warunkach, na jakich Qwen-Image-2.1 jest dystrybuowany. Turbo to przyspieszony checkpoint Qwen-Image-2.1 do generowania obrazów na podstawie tekstu i edycji obrazów, który działa w ośmiu krokach odszumiania zamiast czterdziestu, których używają własne przykłady modelu bazowego. Po cichu zmienia także pochodzenie harmonogramu próbkowania — i to jest część, która zepsuje kod.

Co tak naprawdę znajduje się w repozytorium

Karta jest krótka i nietypowo konkretna, co ułatwia oddzielenie tego, co potwierdzone, od tego, co jest tylko sugerowane.

• Co to jest: karta opisuje Qwen-Image-2.1-Turbo jako „przyspieszony checkpoint Qwen-Image-2.1 do generowania obrazów z tekstu i edycji obrazów w 8 krokach odszumiania”. Nie jest to nowa architektura ani nowa rodzina modeli. To ten sam 7B komponent generowania wizualnego, przepakowany wokół znacznie krótszej trajektorii próbkowania.

• Jak się ładuje: poprzez QwenImage21Pipeline w Diffusers, tę samą klasę pipeline'u, której używa model bazowy, z podmienioną nazwą checkpointu. Metadane samego repozytorium deklarują base_model: Qwen/Qwen-Image-2.1 oraz library_name: diffusers, a także zawierają base_model:finetune:Qwen/Qwen-Image-2.1 jako drugi tag. To producent opisuje to jako dostrojenie bazowego checkpointu, a nie jako model pokrewny.

• Co zachowuje: tę samą 7B architekturę generowania obrazów, te same siedem ustawień rozdzielczości co Qwen-Image-2.1 (kwadrat 2048 × 2048, 4:3 przy 2400 × 1792, 3:4 przy 1792 × 2400, 3:2 przy 2528 × 1696, 2:3 przy 1696 × 2528, 16:9 przy 2752 × 1536 i 9:16 przy 1536 × 2752) oraz te same dwie możliwości — generowanie obrazu na podstawie tekstu i edycję obrazu kierowaną instrukcją. Prezentacja tej karty jest uporządkowana według kategorii: fotografia portretowa, pozy i ruch człowieka, generowanie przezroczystych RGBA, typografia i projektowanie plakatów, układ UI i informacji, przekształcanie pojedynczego obrazu, kompozycja z wieloma materiałami odniesienia i kompozycja wnętrza z czterech obrazów.

• Czego nie zawiera: żadnej liczby oceny. Na karcie nie ma wyniku Qwen-Image-Bench dla checkpointu Turbo ani porównania z modelem bazowym. Jedynym wynikiem gdziekolwiek w linii Qwen-Image-2.1 pozostaje własny wynik Qwen-Image-Bench modelu bazowego, który jest wartością podaną przez dostawcę, zmierzoną na checkpointcie bazowym — nie na tym.

Screenshot of the Hugging Face model card for Qwen/Qwen-Image-2.1-Turbo, captured in English, showing the Text-to-Image, Diffusers, Safetensors and QwenImage21Pipeline tags, 25 likes, the qwen-research licence label, and the introduction text describing it as an accelerated checkpoint of Qwen-Image-2.1 for text-to-image generation and image editing with 8 denoising steps that loads directly with QwenImage21Pipeline in Diffusers

Harmonogram jest teraz zapisany w wagach i to jest prawdziwa zmiana

Oto zdanie, które ma największe znaczenie na karcie, a jest ukryte pod instrukcjami instalacji: checkpoint „zawiera zalecany harmonogram próbkowania, więc jest gotowy do użycia bez ręcznej konfiguracji schedulera”.

Następnie konsekwencja, wyrażona wprost w sekcji próbkowania: „Zalecany 8-krokowy harmonogram próbkowania jest zapisywany wraz z checkpointem i ładowany automatycznie. Samo ustawienie num_inference_steps go nie nadpisuje”.

Przeczytaj to dwa razy. W konwencji Diffusers, którą większość ludzi nosi w głowach, liczba kroków jest argumentem przekazywanym w momencie wywołania — podajesz num_inference_steps=40 dla modelu bazowego, num_inference_steps=4 dla destylowanego checkpointu, a pipeline buduje harmonogram, który temu odpowiada. Qwen-Image-2.1-Turbo łamie tę konwencję. Ośmiokrokowy harmonogram jest metadanymi checkpointu, a nie parametrem żądania. Możesz przekazać inną liczbę całkowitą, a pipeline nadal użyje zapisanego harmonogramu. Karta mówi, że jedynym sposobem na jego zastąpienie jest przekazanie jawnego argumentu sigmas w momencie wywołania, i dodaje, że inne harmonogramy „nie zostały ocenione dla tego checkpointu”.

Praktyczny wniosek to pułapka reprodukcji. Kod skopiowany z karty modelu Qwen-Image-2.1 i skierowany na repozytorium Turbo uruchomi się, nie zgłosi błędu i nie wygeneruje wyników pokazywanych w prezentacji Turbo. Będzie też wymagał kompilacji Diffusers, która rozumie sigmy próbkowania konfigurowane w potoku — wsparcie dodane w PR #14950 w Diffusers, które w chwili pisania znajduje się w drzewie źródłowym, a nie w wydaniu oznaczonym tagiem. Podana instalacja to kompilacja PyTorch zgodna z CUDA plus git+https://github.com/huggingface/diffusers.git, transformers>=5.17.0, accelerate i pillow.

Dwa kolejne ustawienia domyślne pochodzą z karty, a nie z czegokolwiek, co ustawisz: generowanie domyślnie używa CFG 1, a buforowanie KV prefiksu „ponownie wykorzystuje kontekst tekstu i obrazu referencyjnego na przestrzeni kroków odszumiania”. CFG 1 oznacza brak przebiegu guidance bez klasyfikatora, co w dużej mierze odpowiada za to, że trajektoria jest skracana bez zapaści — i dlatego karta nie zawraca sobie głowy zaleceniem dotyczącym skali guidance. Bufor KV prefiksu to spadek po modelu bazowym: ten sam mechanizm, którego Qwen-Image-2.1 używa do ponownego wykorzystywania kontekstu tekstu i obrazu referencyjnego, co ma większe, a nie mniejsze znaczenie, gdy pętla odszumiania ma tylko osiem iteracji.

Ogłoszone w dzienniku zmian, dostarczone jako repozytorium

Ramy, które pasują do tego wydania, to nie „premiera” ani nie „wyciek”. To artefakt wprowadzony do repozytorium z opatrzoną datą pozycją na liście nowości. Lista nowości na GitHubie dla projektu Qwen-Image-2.1 zawiera dwa wpisy z datą 2026.10.09: jeden dotyczący checkpointu Turbo, drugi odnotowujący, że API Qwen-Image-2.1 Pro i Turbo „są już oficjalnie dostępne” w Alibaba Cloud Model Studio. Nie ma osobnego wpisu na blogu o Turbo; link do bloga na karcie prowadzi do wpisu o Qwen-Image-2.1 z 20 września 2026.

Porównaj to z tym, jak model bazowy pojawił się trzy tygodnie wcześniej. Lista aktualności Qwen-Image-2.1 zawiera opatrzony datą wpis o wagach, a potem jeszcze pięć tego samego dnia: obsługę Diffusers od dnia zero przez PR #14804, natywną obsługę ComfyUI od dnia zero, obsługę vLLM-Omni z wykonaniem krok po kroku, buforowaniem KV prefiksów, kwantyzacją FP8 i równoległością tensorową, obsługę SGLang z Cache-DiT i grafami CUDA oraz przyspieszenie od dnia zero dzięki LightX2V. Checkpoint Turbo nie ma nic z tego. Każdy z tych wpisów dotyczących ekosystemu odnosi się do Qwen-Image-2.1.

Screenshot of the GitHub repository page for QwenLM/Qwen-Image-2.1, captured in English, showing the file listing with the README and LICENSE and the most recent commit message reading 'docs: announce Qwen-Image-2.1-Turbo and API availability' committed 27 minutes ago

Liczniki w repozytorium opowiadają tę samą historię o dojrzałości, a nie o wartości, i są migawką, a nie wyrokiem: w chwili pisania Qwen-Image-2.1 wykazuje 122 311 pobrań w ostatnim miesiącu i 3 142 polubienia, podczas gdy Qwen-Image-2.1-Turbo — mający zaledwie kilka godzin — ma 33 polubienia. Pobrania są wskaźnikiem opóźnionym, a liczba dla Turbo się zmieni. Jedyne, co to dziś mówi, to że nikt nie miał jeszcze czasu go uruchomić.

Czego nie mówi ci osiem kroków

Liczba kroków to nagłówek i najmniej użyteczna liczba w wydaniu, z trzech powodów, które warto podać wprost.

• Kroki to nie sekundy. Ani karta, ani repozytorium nie publikują przepustowości, opóźnienia ani zużycia pamięci dla checkpointu Turbo. Osiem kroków przy 2048 × 2048 na modelu 7B bfloat16 to inne obciążenie niż osiem kroków na mniejszym modelu, a karta nie podaje, na jakim sprzęcie je zmierzono, ponieważ w ogóle nie raportuje pomiaru.

• Nie istnieje jeszcze żaden punkt odniesienia dla jakości. Nie opublikowano żadnego wyniku dla Turbo, brak porównania obok siebie z bazowym checkpointem i brak niezależnej oceny któregokolwiek z nich. Obrazy prezentacyjne to wybrane przez dostawcę wyniki przy zalecanych przez niego ustawieniach. Są dowodem na to, że model generuje obrazy; nie są dowodem na to, ile jakości poświęcono na rzecz redukcji liczby kroków, i nie zastępują benchmarku.

• Brak wskazówek dotyczących pamięci. Karta modelu bazowego zawiera sekcję optymalizacji pamięci; karta Turbo dokumentuje instalację, generowanie, edycję, próbkowanie i proporcje obrazu oraz zatrzymania. Jeśli planujesz to wdrożyć jako usługę, zaplanuj pomiary.

Summary card for Qwen-Image-2.1-Turbo with two columns: the left column headed 'Stated in the repository' listing 8 denoising steps, schedule saved with the checkpoint, CFG 1 by default, prefix KV caching across steps, the same seven resolution presets and the Qwen Research Licence; the right column headed 'Not stated anywhere' listing no quality score for this checkpoint, no speed or memory figure and no day-zero framework support

Licencja pozostaje bez zmian i to jest najważniejsza wiadomość dla każdego, kto wdraża.

Qwen-Image-2.1-Turbo jest objęty licencją Qwen Research License Agreement. Metadane repozytorium wskazują license: other z license_name: qwen-research i license_link: LICENSE, a plik LICENSE znajduje się w repozytorium obok wag. Własna sekcja licencji na karcie zawiera jedno zdanie: model jest objęty licencją Qwen Research License Agreement.

Przyspieszenie niczego w tym nie zmienia. Niekomercyjna licencja badawcza na model bazowy nie staje się licencją komercyjną tylko dlatego, że checkpoint jest szybszy, a repozytorium Turbo to osobne pobranie na tych samych warunkach. Jeśli interesuje Cię generowanie w ośmiu krokach dlatego, że czyni model wystarczająco tanim, by umieścić go w produkcie, ograniczeniem jest licencja, a nie liczba kroków. To pytanie trzeba skierować do dostawcy; nigdzie w tym repozytorium nie ma na nie odpowiedzi.

Hostowana ścieżka i miejsce OrcaRouter w niej

OrcaRouter nie routuje Qwen-Image-2.1-Turbo ani nie routuje Qwen-Image-2.1. Żaden z nich nie występuje w naszym katalogu i nic w tym artykule nie powinno być odczytywane jako oferta ich obsługi. Jeśli chcesz którykolwiek z nich, dostępne ścieżki to własne interfejsy API dostawcy i kilka platform zewnętrznych, albo same wagi z kompilacją Diffusers wystarczająco nową, aby wczytać zapisany harmonogram checkpointu Turbo.

To, co wysuwamy na pierwszy plan, to hostowana linia modeli obrazowych, a warto wiedzieć, co się na niej znajduje, aby móc zestawić ją z eksperymentem self-hosted. OrcaRouter umieszcza ponad 200 modeli za jednym punktem końcowym zgodnym z OpenAI, w cenie katalogowej dostawcy, bez żadnej marży — więc gdy dostawca obniża cenę, obniżka obowiązuje u nas tego samego dnia, zamiast czekać na aktualizację cennika. Dodaje automatyczne przełączanie awaryjne, gdy dostawca zaczyna działać gorzej, DSL routingu do określania, których modeli i dostawców może użyć żądanie, oraz fuzję modeli do łączenia kilku modeli w jedno wywołanie. Modele obrazowe, które routujemy, to rodzina OpenAI GPT-Image, poziomy Google Imagen 4, w tym warianty fast i ultra, punkty końcowe podglądu obrazów Google Gemini oraz punkt końcowy obrazów xAI Grok Imagine.

Uczciwy obraz tej decyzji: jeśli potrzebujesz ośmiokrokowego modelu 7B z otwartymi wagami, który możesz przejrzeć i modyfikować, Turbo to praca związana z samodzielnym hostingiem, a licencja to rzecz, którą trzeba ustalić w pierwszej kolejności. Jeśli potrzebujesz endpointu do obrazów na produkcji w tym tygodniu, to inny zakup — i to ten, który sprzedajemy.

Co można powiedzieć, a czego nie można

• Potwierdzone przez samo repozytorium: przyspieszony checkpoint 7B modelu Qwen-Image-2.1, który wykonuje generowanie tekstu na obraz i edycję obrazów w ośmiu krokach odszumiania; zapisany harmonogram próbkowania, którego num_inference_steps nie nadpisuje; CFG 1 domyślnie; buforowanie KV prefiksu dla tekstu i kontekstu obrazu referencyjnego; te same siedem presetów rozdzielczości co model bazowy; ścieżka ładowania QwenImage21Pipeline; wpis wydania z datą 9 października 2026 w liście nowości samego projektu; oraz ta sama Qwen Research License Agreement co w modelu bazowym.

• Nigdzie nie ustalono: żadnego pomiaru jakości dla checkpointu Turbo, żadnego pomiaru szybkości ani pamięci, żadnej niezależnej oceny bazowego checkpointu, z którego został wyprowadzony, żadnego oświadczenia o warunkach komercyjnych wykraczających poza licencję badawczą ani żadnego wsparcia frameworków od dnia zero w rodzaju tego, z jakim trafił Qwen-Image-2.1.

Osiem kroków to liczba, która zostanie przytoczona. Harmonogram, który przeniósł się do wag, to szczegół, który decyduje, czy twoje pierwsze uruchomienie cokolwiek odtworzy.