
Hy Image3.5 vs LLaDA-Image: Thuê endpoint hay sở hữu trọng số
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Có hai cách để mua một mô hình hình ảnh 2K vào tháng 9 năm 2026, và chúng không hẳn là hai sản phẩm mà đúng hơn là hai mô hình kinh doanh. Hy Image3.5 preview, hoạt động từ ngày 22 tháng 9 năm 2026, là một endpoint tính phí theo mức sử dụng: 0,024 USD một ảnh theo bảng giá quốc tế của Tencent, 0,15 CNY tại thị trường trong nước, tính phí trên đầu ra được giao, và bạn không bao giờ phải đụng đến GPU. LLaDA-Image, thuộc nhóm mô hình mở inclusionAI và được phát hành ngày 4 tháng 9 năm 2026, là một checkpoint có thể tải về: một họ mô hình lớp 7B tích hợp cả tạo và chỉnh sửa, dưới thẻ Apache-2.0, nằm trên Hugging Face mà không kèm theo endpoint lưu trữ nào. Một trăm nghìn ảnh 2K mỗi tháng tốn khoảng 2.400 USD theo cách thứ nhất. Cách thứ hai không tốn đồng nào cho mỗi ảnh, cộng thêm một khoản tiền mà bạn phải tự tính lấy, bởi vì trọng số thì miễn phí còn phần cứng thì không.
Đó là toàn bộ sự so sánh, và gần như mọi sai lầm được đưa ra về nó đều đến từ việc so sánh hai thứ này như thể cột giá là khác biệt duy nhất. Không phải vậy. Một trong số chúng có thể bị ngừng hỗ trợ ngay dưới chân bạn. Một trong số chúng có thể được tinh chỉnh. Một trong số chúng đi kèm với benchmark của chính nhà cung cấp và không có điểm đánh giá độc lập; cái còn lại đi kèm với một báo cáo kỹ thuật, một kho lưu trữ công khai, và khoảng một nghìn lượt tải xuống.
Hai tuyên bố gắn với LLaDA-Image không thống nhất với chính chúng
Trước khi việc so sánh có chút giá trị nào, hai chi tiết trên card LLaDA-Image cần được gắn cờ hơn là giải quyết, bởi vì cả hai đều là những mâu thuẫn thực sự trong hồ sơ công khai, và việc lặng lẽ chọn một phe sẽ là một sai lầm tồi tệ hơn là nói ra điều đó.
Đầu tiên là số lượng tham số. Phần văn xuôi của chính thẻ mô hình mô tả "một họ mô hình hợp nhất tạo và chỉnh sửa hình ảnh mã nguồn mở 6B tham số có tính cạnh tranh." Thanh bên trên cùng trang đó báo cáo kích thước mô hình Safetensors là 7B tham số ở BF16. Cả hai con số đều nằm trên cùng một trang, do cùng một tổ chức công bố, và không có gì trong thẻ mô hình dung hòa được chúng. Hãy coi nhóm này là "khoảng bảy tỷ tham số, với một con số sáu tỷ trong phần mô tả" và đừng trích dẫn bất kỳ con số nào như đã chốt. Bất cứ ai nói với bạn số lượng chính xác đều đang đoán từ chính thẻ mô hình mà bạn có thể đọc.
Điều thứ hai là giấy phép. Thẻ mang Giấy phép: apache-2.0 hôm nay. Bài đưa tin trước đây của chính chúng tôi về dòng mô hình này nói rằng không có thẻ nào trong số các thẻ đã phát hành mang nhãn giấy phép và rằng không có tệp LICENSE nào trong kho lưu trữ. Cả hai phát biểu đều có thể đúng ở những thời điểm khác nhau — một nhãn có thể được thêm vào — nhưng chúng tôi sẽ không giả vờ rằng chúng luôn như vậy, và một giấy phép xuất hiện sau khi phát hành là một dữ kiện khác biệt về bản chất so với một giấy phép đi kèm với trọng số. Nếu giấy phép có tính quyết định đối với trường hợp sử dụng của bạn, hãy tự kiểm tra kho lưu trữ vào thời điểm bạn tải xuống, và kiểm tra xem mã huấn luyện, thứ mà thẻ mô tả là sắp có, có đến dưới cùng các điều khoản hay không.

Những gì hai kiến trúc này thực sự đang bán
LLaDA-Image không phải là một mô hình khuếch tán theo nghĩa thông thường, và đó chính là điểm thú vị của nó. Nó ghép một diffusion transformer với một mô hình ngôn ngữ - thị giác đóng băng — LLaDA2.0-mini — cùng một bộ kết nối RQA ở giữa, và nó được công bố như một họ mô hình chứ không phải một checkpoint đơn lẻ: Base với 50 bước để đạt chất lượng, Turbo với hai đến bốn bước để đạt thông lượng, mỗi bản đều có BF16 và FP8. Như vậy là bốn checkpoint, và số bước chính là lý do khiến một triển khai tự vận hành có thể khả thi trong một ngân sách hạn hẹp: một mô hình 7B chạy 50 bước là một bài toán phần cứng khác hẳn so với một mô hình chạy 2 đến 4 bước. Báo cáo kỹ thuật được công khai và công thức huấn luyện được mô tả là hoàn toàn mở, đây là một tuyên bố minh bạch mạnh hơn so với hầu hết các bản phát hành trọng số mở khác.
Hy Image3.5 preview có dạng đối lập theo thiết kế. Nó là một endpoint với một hành vi duy nhất: text-to-image và image-to-image trên cùng một lệnh gọi, chỉnh sửa nhiều lượt mang các lượt trước làm ngữ cảnh, tối đa năm ảnh tham chiếu mỗi yêu cầu, giới hạn đầu ra 2K, và định danh hy-image-v3.5-preview. Không có gì để chọn, không có gì để tinh chỉnh và không có gì để tải xuống. Bộ năng lực vốn đã rộng hơn ngay từ đầu — chỉnh sửa hội thoại nhiều lượt với ngữ cảnh được giữ lại là một tính năng thực sự mà dòng mở không hề quảng cáo — và bạn không kiểm soát được bất kỳ điều nào trong đó.
• Cơ sở chi phí — Hy Image3.5 preview là $0.024 mỗi ảnh 2K, tính phí theo đầu ra được giao; LLaDA-Image có trọng số miễn phí cùng với mọi chi phí GPU mà bạn phải bỏ ra để chạy nó.
• Những gì bạn nhận được — Hy Image3.5 preview là một API được lưu trữ với tính năng chỉnh sửa đa lượt và năm ảnh tham chiếu; LLaDA-Image là bốn checkpoint (Base và Turbo, BF16 và FP8) cùng một công thức huấn luyện.
• Số bước để tạo một hình ảnh — Hy Image3.5 preview là một lệnh gọi duy nhất không có tham số số bước nào được hiển thị; LLaDA-Image là 50 bước trên Base hoặc 2 đến 4 trên Turbo, do bạn tự thiết lập.
• Trọng số — Hy Image3.5 preview không công bố trọng số nào; LLaDA-Image công bố đầy đủ cả họ mô hình.
• Giấy phép — Hy Image3.5 preview là một dịch vụ thương mại được điều chỉnh bởi các điều khoản của Tencent; LLaDA-Image mang thẻ apache-2.0 mà các báo cáo trước đây của chúng tôi không thấy.
• Bằng chứng — Hy Image3.5 preview có một bài kiểm tra mù GSD do nhà cung cấp thực hiện và không có Elo độc lập; LLaDA-Image có một con số Qwen-Image-Bench do tác giả báo cáo là 53,53 bằng tiếng Anh và 53,38 bằng tiếng Trung, và cũng không có Elo độc lập.
Những điều mà chỉ một trong số này có thể làm
Hãy bắt đầu với những gì trọng số mang lại cho bạn, vì đó không chỉ là một sở thích về cấp phép. Một checkpoint là một tài sản: nó không thể bị ngừng hỗ trợ, bị định giá lại, bị giới hạn tần suất hay bị tắt, và một pipeline được ghim vào một tệp cụ thể vẫn sẽ chạy sau ba năm. Nó có thể được tinh chỉnh trên chính tư liệu của bạn, mà với một nhóm có phong cách riêng hoặc một bộ ký tự cụ thể, đó là sự khác biệt giữa việc nhắc lệnh cho mô hình của người khác và việc huấn luyện mô hình của chính mình. Nó chạy ngoại tuyến, điều này quan trọng nếu tư liệu là công việc khách hàng thuộc một điều khoản bảo mật. Và thông lượng của nó là một hàm của phần cứng bạn đã mua chứ không phải một hàng đợi bạn đã tham gia.
Đổi lại, một endpoint mang đến cho bạn sự vắng mặt của công việc. Không ai trong nhóm của bạn phải học một serving stack, không ai phải tính toán kích cỡ GPU, không ai phát hiện ra trong môi trường production rằng checkpoint FP8 cần một runtime khác với checkpoint BF16, và không ai phải chịu trách nhiệm khi job thất bại lúc 3 giờ sáng. Mô hình của Tencent còn sở hữu một năng lực mà dòng open không tuyên bố: chỉnh sửa đa lượt giữ lại được mạch hội thoại, đúng cơ chế đằng sau việc giữ nguyên một nhân vật xuyên suốt một chuỗi chỉnh sửa dài. Hỗ trợ chỉnh sửa của LLaDA-Image là có thật — nó là một dòng mô hình hợp nhất giữa sinh tạo và chỉnh sửa — nhưng trạng thái hội thoại xuyên các lượt không phải là điều mà model card quảng cáo.
Cách diễn đạt trung thực là những thứ này hoàn toàn không cạnh tranh về chất lượng. Chúng cạnh tranh về việc ai gánh chịu rủi ro vận hành, và hai câu trả lời là "Tencent" và "bạn".
Điều gì đã thực sự được đo lường, ở cả hai phía
Cả hai mô hình đều không có vị trí xếp hạng độc lập. Bảng xếp hạng text-to-image của Artificial Analysis, đọc ngày 23 tháng 9 năm 2026, không có hàng Hy Image3.5 preview và cũng không có hàng LLaDA-Image. Chỗ mà bảng xếp hạng thực sự có Tencent là ở thế hệ trước: HunyuanImage 3.0 Instruct với 964 Elo và HunyuanImage 3.0 với 945, xếp thứ 65 và 70 trong số 156 mô hình — đây là phép đo bên thứ ba duy nhất đối với bất kỳ thứ gì trong dòng họ này, và nó đã cũ một thế hệ.
Thay vào đó, thứ mỗi bên đưa ra là công trình của chính mình. Của Tencent là bài kiểm tra ưu tiên mù kiểu GSD, được thực hiện với vài trăm nhà thiết kế chuyên nghiệp của chính công ty, báo cáo kết quả cao hơn Hy Image3.0 khoảng ba mươi phần trăm, ngang bằng với Seedream 5.0 Pro, và nhỉnh hơn một chút so với Nano-Banana Pro và Qwen-Image-3.0-Pro. Do nhà cung cấp tự vận hành, tự tuyển chọn người tham gia, bộ prompt không được công bố — một phương pháp thực sự đi kèm một xung đột lợi ích thực sự, và cả hai vế của câu đó đều thuộc về cùng một hơi thở.
Điểm Qwen-Image-Bench của LLaDA-Image là 53.53 cho tiếng Anh và 53.38 cho tiếng Trung, đây là con số do tác giả báo cáo trên một benchmark mà chính các tác giả chọn. Nó không độc lập hơn bài kiểm tra của Tencent; nó khác ở chỗ không được kiểm toán. Thẻ mô hình cũng liệt kê năm Spaces cộng đồng và số lượt tải hàng tháng khoảng một nghìn, điều đó cho thấy nhóm mô hình mở này có sức hút thật nhưng khiêm tốn — đây không phải là mô hình mà lĩnh vực đã áp dụng rộng rãi, và bất kỳ ai nói khác đều chưa nhìn vào con số đó.

Tiền thực sự đi đâu, ở quy mô lớn
Hãy tính phía thuê một cách trung thực, vì đó là phía duy nhất có mức giá được công bố. Một trăm nghìn ảnh 2K mỗi tháng với giá $0.024 là $2,400. Nửa triệu ảnh mỗi tháng là $12,000, tức khoảng $144,000 một năm, và ở quy mô đó, một mô hình ảnh cấp 7B tự vận hành không còn là lựa chọn của người nghiệp dư nữa mà bắt đầu trở thành một khoản mục chi phí hiển nhiên. Dưới khoảng mười nghìn ảnh mỗi tháng thì phép tính hoàn toàn không diễn ra như vậy: $240 so với chi phí một GPU, điện, lưu trữ, ngăn xếp phục vụ và sự chú ý của ai đó không phải là một so sánh sát nút, và endpoint tính theo mức sử dụng thắng trên mọi phương diện, kể cả phương diện bạn đang không tính đến.
Điểm giao nhau không phải là một con số mà bất kỳ ai có thể đưa sẵn cho bạn, vì phía tự vận hành phụ thuộc vào phần cứng bạn đã sở hữu, mức sử dụng bạn thực sự đạt được, và liệu GPU có đang làm việc gì khác khi nó không tạo ảnh hay không. Điều có thể nói một cách chính xác là hình dạng của đường cong: mô hình tính phí theo mức dùng là tuyến tính theo khối lượng, còn mô hình tự vận hành là một hàm bậc thang, nên câu hỏi không phải là cái nào rẻ hơn mà là khối lượng của bạn nằm ở đâu so với bậc thang.
Một điểm cuối, dù bạn đi theo hướng nào.
OrcaRouter không định tuyến cho cả hai mục này. Chúng tôi không lưu trữ mô hình hình ảnh nào của Tencent — những mục Tencent duy nhất trong danh mục là dòng Hy3 chỉ dành cho văn bản — và không có bất cứ thứ gì từ inclusionAI, vì vậy Hy Image3.5 preview nghĩa là nền tảng đám mây của chính Tencent và các sản phẩm Tencent do chính hãng phát triển, còn LLaDA-Image nghĩa là các trọng số đã công bố cùng bất kỳ runtime nào mà bạn trỏ chúng tới. Nói rõ điều đó hữu ích hơn là một trang mô hình để mọi thứ mơ hồ.
Điều mà một lớp định tuyến có ích trong quyết định này chính là lựa chọn thứ ba mà nó khiến trở nên rẻ. Nếu bạn đang cân nhắc giữa 2.400 đô la một tháng với việc mua GPU, thì bước trung gian hữu ích là biết được cùng khối lượng công việc đó tốn bao nhiêu chi phí ở những mô hình bạn có thể tiếp cận ngay hôm nay mà không cần hợp đồng — openai/gpt-image-2, google/gemini-3.1-flash-image-preview, nhóm Imagen 4 và grok/grok-imagine-image đều nằm sau một endpoint tương thích OpenAI với giá niêm yết của nhà cung cấp và mức chênh lệch 0%, nên thay đổi giá của nhà cung cấp sẽ hiển thị ngay bên phía chúng tôi trong cùng ngày, và chuyển đổi dự phòng tự động nghĩa là một buổi chiều trục trặc của một nhà cung cấp không trở thành sự cố gián đoạn của bạn. Đó không phải là sự thay thế cho mô hình nào trong so sánh này. Đó chính là thứ ngăn phép so sánh biến thành một lựa chọn hai chiều được đưa ra trong bóng tối.

Câu hỏi duy nhất quyết định điều đó
Hãy tự hỏi liệu khối lượng công việc của bạn có một dạng thức mà các trọng số có thể nắm bắt được còn endpoint thì không. Nếu bạn đang tạo nội dung theo một house style, một bộ ký tự cố định hoặc tài liệu riêng của khách hàng, và bạn có đủ sản lượng cùng phần cứng để khiến một mô hình lớp 7B xứng đáng với chi phí, thì LLaDA-Image là tài sản bền vững hơn, và thẻ Apache-2.0 — hãy kiểm tra nó lúc tải xuống, với lịch sử ở trên — chính là thứ khiến nó dùng được. Bạn đang mua tính linh hoạt và trả giá cho nó bằng khâu vận hành.
Nếu khối lượng công việc của bạn bùng nổ theo từng đợt, nếu không ai trong nhóm muốn đứng ra phụ trách một serving stack, nếu chỉnh sửa nhiều lượt có giữ ngữ cảnh là tính năng bạn thực sự cần, hoặc nếu sản lượng của bạn dưới mười nghìn ảnh mỗi tháng, thì $0.024 cho một ảnh 2K được giao là một mức giá tốt để biến nó thành vấn đề của người khác, và nhãn preview là điều chính cần lưu tâm. Điều duy nhất đáng làm trước ngày 7 tháng 10 năm 2026 — khi Miora, WorkRally và OnSolo đang chạy cửa sổ miễn phí — là đưa bộ prompt của riêng bạn qua mô hình tencent và ghi lại tỷ lệ chấp nhận, vì con số đó, chứ không phải ba mươi phần trăm, mới là con số quyết định liệu phía tính phí theo dùng có xứng đáng với đồng hồ đo của nó hay không.
