
Qwen-Image-2.1-Turbo vs Qwen-Image-2.1: Điều gì thực sự đã thay đổi giữa checkpoint cơ sở và phiên bản tăng tốc
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 118 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 53 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 347 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 355 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Cùng một thành phần tạo hình ảnh 7B. Cùng 32 lớp DiT luồng đơn. Cùng bảy preset độ phân giải, cùng một bề mặt tạo và chỉnh sửa thống nhất, cùng giấy phép phi thương mại, cùng lớp pipeline để nạp nó. Qwen-Image-2.1-Turbo và Qwen-Image-2.1 không phải là hai mô hình để bạn chọn giữa chúng dựa trên năng lực — checkpoint Turbo là bản tinh chỉnh của bản cơ sở, và kho chứa nói điều đó ngay trong metadata của chính nó. Điều phân biệt chúng là một quỹ đạo lấy mẫu duy nhất, và cách quỹ đạo đó được lưu trữ. Một cái chạy bốn mươi bước. Cái còn lại chạy tám bước, và từ chối bị bảo khác đi vào lúc gọi. Mọi điều thú vị về cặp đôi này nằm ở câu thứ hai.
Bắt đầu với những phần giống hệt nhau
Trước những khác biệt, những điểm tương đồng đáng để ta phác họa, bởi chúng bao quát hơn những gì nhãn "Turbo" gợi ý và chính chúng là điều khiến việc hoán đổi trở nên hấp dẫn.
• Kiến trúc. Thẻ Turbo tuyên bố rằng nó “sử dụng cùng kiến trúc tạo hình ảnh 7B” như Qwen-Image-2.1. Dự án mô tả thành phần đó là 7B tham số trên 32 lớp DiT Single-Stream. Không có nội dung nào trong kho Turbo công bố một backbone nhỏ hơn, đã bị cắt tỉa hoặc được thiết kế lại kiến trúc.
• Các khả năng.Cả hai checkpoint đều được mô tả là có khả năng tạo ảnh từ văn bản và chỉnh sửa ảnh. Turbo kế thừa các đặc điểm bề mặt của mô hình cơ sở thay vì trình bày lại chúng: thẻ của mô hình cơ sở nêu rõ khả năng trong suốt RGBA gốc, tối đa 10 ảnh tham chiếu, và các chỉnh sửa cục bộ được chỉ định bằng vòng tròn, chú thích vẽ tay hoặc mặt nạ riêng, cùng khả năng giữ nguyên nhận dạng cho người và sản phẩm.

• Độ phân giải. Thẻ của Turbo ghi rằng hãy "dùng cùng các preset độ phân giải như Qwen-Image-2.1" và sau đó liệt kê chúng: 1:1 ở 2048 × 2048, 4:3 ở 2400 × 1792, 3:4 ở 1792 × 2400, 3:2 ở 2528 × 1696, 2:3 ở 1696 × 2528, 16:9 ở 2752 × 1536 và 9:16 ở 1536 × 2752. Thẻ của mô hình cơ sở liệt kê bảng giống hệt. Cả hai thẻ đều dùng mức độ phân giải 2048 cho các ví dụ của mình.
• Đường dẫn tải. Cả hai đều được tải qua QwenImage21Pipeline trong Diffusers. Phần quick start của thẻ Turbo chính là phần quick start của thẻ cơ sở, chỉ thay đổi tên checkpoint và viết bfloat16 thành dtype thay vì torch_dtype.
• Giấy tờ.Cả hai đều được cấp phép theo Thỏa thuận Cấp phép Nghiên cứu Qwen-Image-2.1, cả hai đều ghi license: other với license_name: qwen-research, và cả hai đều có một tệp LICENSE nằm trong kho lưu trữ ngay cạnh các trọng số.
Nếu bạn đã thiết lập xong Qwen-Image-2.1, thì phạm vi cần di trú thực sự nhỏ. Đó chính là lý do khiến cho đối số duy nhất không hành xử theo cách bạn mong đợi lại đáng để ta bàn kỹ.
Lịch trình đã chuyển ra khỏi mã của bạn và vào trong checkpoint
Trên mô hình base, số bước là do bạn tự đặt. Ví dụ text-to-image của card Qwen-Image-2.1, ví dụ chỉnh sửa của nó và ví dụ trong suốt RGBA của nó đều truyền num_inference_steps=40, và con số đó là một đối số truyền lúc gọi trong Diffusers thông thường. Không có gì trên card đó cho bạn biết rằng checkpoint có ý kiến riêng về lịch trình.
Trên Turbo, lịch trình là metadata của checkpoint. Thẻ nêu rằng checkpoint “bao gồm lịch lấy mẫu được đề xuất của nó, nên nó sẵn sàng để dùng mà không cần cấu hình thủ công bộ lập lịch,” và sau đó, trong phần lấy mẫu, giải thích rõ điều đó nghĩa là gì trên thực tế: “Lịch lấy mẫu 8 bước được đề xuất được lưu cùng checkpoint và được tải tự động. Việc chỉ đặt num_inference_steps không ghi đè nó.”
Có hai điều tiếp theo sau đây, và cả hai đều dễ bị hiểu sai theo hai hướng ngược nhau.
Điều đầu tiên là tám không phải là một giá trị mặc định mà bạn có thể tinh chỉnh tăng lên. Nếu bạn muốn biết Turbo trông ra sao ở mười hai bước hay hai mươi bước, thẻ cho bạn biết con đường duy nhất là một đối số sigmas được chỉ định tường minh tại thời điểm gọi — rồi đóng sập cánh cửa thử nghiệm bằng cách lưu ý rằng các lịch trình khác "chưa được đánh giá cho checkpoint này." Đó là việc một nhà cung cấp nói với bạn rằng cấu hình tám bước chính là cấu hình họ đứng ra bảo đảm, và rằng mọi thứ khác là vùng lãnh thổ chưa được khám phá mà bạn đang bước vào một mình. Đó là một câu nói trung thực một cách bất thường, và nên được đọc như một ranh giới chứ không phải một lời mời gọi.
Thứ hai là một cái bẫy tái tạo không kèm theo thông báo lỗi nào. Lấy ví dụ của mô hình cơ sở, đổi chuỗi repository thành checkpoint Turbo, giữ nguyên num_inference_steps=40, và đoạn mã sẽ chạy. Nó sẽ không cảnh báo bạn. Nó sẽ tạo ra một ảnh bằng lịch trình tám bước đã lưu, và đó sẽ không phải là đầu ra mà Turbo showcase hiển thị, bởi vì số bốn mươi chưa từng được đọc. Đây là chế độ thất bại mà ở đó trông chẳng có gì hỏng — quá trình render hoàn tất, ảnh trông hợp lý, và cách duy nhất bạn phát hiện ra là nếu bạn đi tìm một sự khác biệt. Có một phụ thuộc thứ hai bị chôn cùng nó: checkpoint cần một bản dựng Diffusers hiểu được các sigma lấy mẫu được cấu hình theo pipeline, được thêm trong PR #14950, mà tại thời điểm viết bài nằm trong cây nguồn Diffusers chứ không phải một bản phát hành có gắn thẻ. Bản cài đặt được nêu là một bản dựng PyTorch tương thích CUDA cùng với mã nguồn Diffusers, transformers>=5.17.0, accelerate và pillow.
Điều gì bù đắp cho 32 bước bạn đã không thực hiện?
Thẻ này nêu tên hai cơ chế, và cả hai đều đáng để biết vì chúng giải thích điều mà Turbo checkpoint giả định về cách bạn sẽ gọi nó.
• CFG 1 theo mặc định. "Quá trình sinh dùng CFG=1 theo mặc định." Ở thang hướng dẫn không phân loại (classifier-free guidance) bằng một, mô hình không chạy lượt thứ hai, mang tính vô điều kiện mà CFG thông thường vẫn yêu cầu — và đây chính là phần lớn lý do khiến một quỹ đạo được rút ngắn thay vì chỉ đơn thuần bị cắt bớt. Điều đó cũng có nghĩa là thói quen tinh chỉnh thang hướng dẫn của mô hình cơ sở không còn được kế thừa; ở đây không có gì để tinh chỉnh, và thẻ mô hình cũng không đưa ra khuyến nghị hướng dẫn nào để tinh chỉnh theo.
• Bộ nhớ đệm KV tiền tố. Thẻ của Turbo ghi rằng "bộ nhớ đệm KV tiền tố tái sử dụng ngữ cảnh văn bản và ảnh tham chiếu xuyên suốt các bước khử nhiễu." Đây là bộ máy kế thừa, không phải thứ gì mới dành cho checkpoint được tăng tốc: thông báo về Qwen-Image-2.1 liệt kê việc tái sử dụng bộ nhớ đệm KV tiền tố là một trong bốn cải tiến chủ chốt của mô hình nền, bên cạnh attention có độ chi tiết hỗn hợp, và các tích hợp phục vụ ngay từ ngày đầu cho mô hình nền — các mục vLLM-Omni và SGLang trong danh sách tin tức của dự án — nêu rõ bộ nhớ đệm KV tiền tố trong số những tính năng mà chúng hỗ trợ. Trong một vòng lặp bốn mươi bước, việc tái sử dụng đó là một tối ưu hóa. Trong một vòng lặp tám bước, nó lại càng quan trọng hơn theo tỷ lệ tương ứng, bởi mỗi bước được lưu đệm chiếm một phần lớn hơn trong tổng khối lượng công việc.
Điều mà thẻ không nêu tên là bất kỳ kỹ thuật chưng cất nào. Thẻ Qwen-Image-2.1 của mô hình cơ sở và README của dự án mô tả kiến trúc và các khả năng; thẻ Turbo mô tả cơ chế. Nếu bạn đang cố suy luận xem tám bước phải đánh đổi bao nhiêu về mặt chất lượng, thì kho lưu trữ không cho bạn phương pháp nào để suy luận — chỉ có một lịch trình và một bộ ảnh trình diễn.
Số bước không phải là một thước đo chuẩn
Đây là phần của phép so sánh mà ở đó câu trả lời trung thực là không có gì để so sánh, và thật đáng để nói thẳng lý do vì sao.
• Checkpoint Turbo không có điểm số nào được công bố.Thẻ của nó không mang bất kỳ con số đánh giá nào. Không có kết quả Qwen-Image-Bench nào dành cho Turbo, không có so sánh song song với checkpoint cơ sở, không có phân tích ablation theo số bước, và không có bảng nào cho thấy chất lượng chững lại ở đâu.
• Điểm của checkpoint cơ sở là do nhà cung cấp báo cáo. Con số tiêu đề duy nhất của dòng Qwen-Image-2.1 là kết quả Qwen-Image-Bench của chính mô hình cơ sở, do nhà cung cấp báo cáo dựa trên checkpoint cơ sở. Đây không phải là phép đo trên checkpoint Turbo và không nên được chuyển sang cho nó — việc tăng tốc chính là yếu tố được cho là sẽ làm thay đổi một con số như vậy, và nhà cung cấp vẫn chưa nói rõ mức thay đổi là bao nhiêu.
• Cả hai thẻ đều không báo cáo về thời gian hay bộ nhớ. Không có con số độ trễ, không có con số thông lượng và không có dấu chân bộ nhớ cho cả hai checkpoint, và cả hai thẻ đều không nêu tên phần cứng mà các ví dụ của chúng đã chạy trên đó. Thẻ của mô hình cơ sở ít nhất có ghi lại một mục tối ưu hoá bộ nhớ; thẻ Turbo ghi lại phần cài đặt, tạo sinh, chỉnh sửa, lấy mẫu và tỷ lệ khung hình, rồi dừng ở đó.
Vậy nên lập luận chọn Turbo thay vì base checkpoint hiện tại là lập luận về ý đồ thiết kế, chứ không phải về kết quả đo được. Tám bước ở cùng kiến trúc và cùng mức phân giải 2048 đáng lẽ phải tốn ít hơn đáng kể cho mỗi ảnh. “Substantially” đang gánh vai trò thực sự trong câu đó, và cách duy nhất để thay nó bằng một con số là chạy cả hai checkpoint trên khối lượng công việc của chính bạn, đây cũng là cách duy nhất để biết quỹ đạo bị rút ngắn đó gây ra điều gì cho những hình ảnh cụ thể mà bạn quan tâm.
Không có gì khác di chuyển, kể cả giấy phép.
Hai điều mà một độc giả có thể hợp lý mong đợi là đã thay đổi, nhưng lại không.
Đầu tiên là hệ sinh thái. Khi Qwen-Image-2.1 ra mắt vào ngày 20 tháng 9 năm 2026, danh sách tin tức của dự án đã ghi nhận năm tích hợp ngay ngày ra mắt riêng biệt trong cùng ngày: hỗ trợ Diffusers qua PR #14804, hỗ trợ ComfyUI gốc với các mẫu quy trình làm việc đã được công bố cho tạo ảnh từ văn bản và chỉnh sửa, hỗ trợ vLLM-Omni với thực thi từng bước, giải mã CUDA Graph, lượng tử hóa FP8 và song song tensor, SGLang với Cache-DiT và offload thành phần, và tăng tốc từ dự án LightX2V. Mục ghi ngày 9 tháng 10 năm 2026 viết về Qwen-Image-2.1-Turbo ghi lại chính checkpoint và một ghi chú rằng các API Pro và Turbo có mặt trên Alibaba Cloud Model Studio. Không có danh sách framework ngay ngày ra mắt cho Turbo, và mọi mục framework trong danh sách tin tức vẫn đề cập đến bản cơ sở. Checkpoint Turbo được tải thông qua một lớp pipeline đã tồn tại; hỗ trợ cho lịch trình đã lưu của nó là phần mới duy nhất, và nó đến thông qua mã nguồn Diffusers thay vì một bản phát hành được gắn thẻ.
Điều thứ hai là giấy phép. Turbo mang theo Thỏa thuận Cấp phép Nghiên cứu Qwen, y hệt như mô hình gốc. Việc tăng tốc không đi kèm một ngoại lệ thương mại, một hạng riêng, hay một sự nới lỏng các điều khoản — hạn chế phi thương mại áp dụng cho bản tinh chỉnh cũng nhiều như cho bản gốc. Siêu dữ liệu của chính kho lưu trữ và tệp giấy phép nằm cạnh các trọng số là bằng chứng; phần giấy phép trên thẻ chỉ là một câu trỏ đến cùng thỏa thuận đó. Nếu lý do tám bước quan trọng với bạn là vì nó khiến mô hình đủ rẻ để đưa vào một sản phẩm, thì giấy phép chính là rào cản thẳng thừng, và chính nhà cung cấp — không phải kho lưu trữ này — mới là bên phải chịu trách nhiệm về điều đó.
Các endpoint được lưu trữ, và OrcaRouter phù hợp ở đâu
OrcaRouter không định tuyến cho cả Qwen-Image-2.1-Turbo lẫn Qwen-Image-2.1. Cả hai đều không có trong danh mục của chúng tôi và không có nội dung nào ở đây là lời đề nghị cung cấp dịch vụ cho một trong hai. Nếu bạn muốn có chúng, các lựa chọn của bạn là API do chính nhà cung cấp lưu trữ, một số nền tảng bên thứ ba, hoặc trọng số với bản dựng Diffusers đủ mới để xử lý lịch lấy mẫu đã lưu của checkpoint Turbo.
Chỗ mà OrcaRouter trở nên liên quan đến phép so sánh cụ thể này là sự thay thế bạn thực hiện khi việc tự host một checkpoint không còn là câu trả lời đúng. Chuyển từ một mô hình trọng số mở do bạn tự chạy sang một điểm cuối hình ảnh được host không chỉ là thay đổi mô hình — đó là thay đổi các kiểu hỏng hóc. Một tiến trình cục bộ hỏng theo những cách bạn có thể thấy; một điểm cuối được host hỏng theo những cách phụ thuộc vào việc nhà cung cấp nào đã trả lời, và vào điều gì xảy ra khi một trong số họ suy giảm giữa chừng yêu cầu. OrcaRouter đặt hơn 200 mô hình phía sau một điểm cuối tương thích OpenAI duy nhất và chuyển nguyên giá niêm yết của nhà cung cấp mà không markup, vì vậy khi nhà cung cấp cắt giảm giá, bên chúng tôi thấy ngay trong cùng ngày thay vì phải chờ một lượt định giá lại. Thêm vào đó, nó bổ sung khả năng chuyển đổi dự phòng tự động giữa các nhà cung cấp, một DSL định tuyến để chỉ định mô hình và nhà cung cấp mà một yêu cầu được phép sử dụng, cùng tính năng hợp nhất mô hình để kết hợp nhiều mô hình vào một lệnh gọi. Các mô hình hình ảnh mà chúng tôi đứng ra cung cấp là dòng OpenAI GPT-Image, các bậc Imagen 4 của Google bao gồm biến thể fast và ultra, các điểm cuối xem trước hình ảnh Gemini của Google, và điểm cuối hình ảnh xAI Grok Imagine.
Cụ thể: nếu bạn đang cân nhắc giữa hai checkpoint Qwen, thì đó là quyết định tự host, và lý do để ưu tiên cái này hơn cái kia là hành vi lập lịch và số bước. Nếu điều bạn thực sự cần là một hình ảnh trong môi trường production mà không phải sở hữu GPU, thì đó là quyết định mà chúng tôi có thể hỗ trợ, và đó là một quyết định khác.
Phiên bản ngắn
• Chọn Qwen-Image-2.1 nếu bạn muốn checkpoint có hành vi lấy mẫu khớp với tài liệu của nó, nếu bạn cần thay đổi số bước hoặc khám phá lịch trình, hoặc nếu bạn muốn bản phát hành đi kèm hỗ trợ ngay từ ngày đầu trên Diffusers, ComfyUI, vLLM-Omni, SGLang và LightX2V.
• Chọn Qwen-Image-2.1-Turbo nếu bạn muốn giữ nguyên kiến trúc và các khả năng như vậy nhưng với quỹ đạo ngắn hơn đáng kể, đồng thời sẵn sàng cố định tám bước và cài đặt Diffusers từ mã nguồn để tải nó.

• Dù theo cách nào, hãy kỳ vọng cùng một giấy phép, và đừng kỳ vọng có con số chất lượng nào được công bố cho checkpoint tăng tốc để đem so với bản cơ sở. Việc giảm số bước là có thật và đã được ghi lại. Còn nó tốn bao nhiêu chất lượng hình ảnh thì không được ghi lại ở bất kỳ đâu, và dù bạn có đọc hai tấm card đó bao nhiêu lần đi nữa cũng không thể biết được — câu trả lời đó chỉ tồn tại trên phần cứng của chính bạn, với chính những prompt của bạn.
