Một thẻ tiêu đề được tạo ra có dòng chữ 'Qwen-Image-3.0 — General Availability', với các chip tính năng cho prompt 4.500 token, hiển thị văn bản ~10px, 12 ngôn ngữ, và giá từ ¥0,18 mỗi ảnh, cùng logo OrcaRouter được ghép ở góc.
Guides & Insights

Qwen-Image-3.0 chính thức phát hành: Mô hình tạo ảnh thực dụng của Alibaba có giá ¥0,18 mỗi hình ảnh

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Vào ngày 5 tháng 8 năm 2026, Qwen-Image-3.0 không còn là bản xem trước chỉ dành cho khách mời và mở cửa cho mọi người dùng của nền tảng AI Qwe​n của Alibaba. Toàn bộ sản phẩm được định giá như một tiện ích thay vì một dịch vụ nghệ thuật cao cấp — tạo ảnh từ văn bản với giá khoảng ¥0.18 mỗi hình ở phía người dùng thông thường, cùng với tầng Pro cao hơn — và quan điểm của Alibaba là đây là một mô hình tạo ảnh được xây dựng để làm một công việc, không phải để giành chiến thắng trong một cuộc thi sắc đẹp. Một tuần sau khi phát hành rộng rãi hoàn toàn, quan điểm đó đáng được xem xét nghiêm túc: hai điều mà Qwen-Image-3.0 dẫn đầu, lời nhắc rất dài và văn bản nhỏ rất dễ đọc, chính là hai điều mà hầu hết các mô hình tạo ảnh âm thầm thất bại.

Qwen-Image-3.0 được phát hành với hai phiên bản — Qwen-Image-3.0-ProQwen-Image-3.0-Standard — cả hai đều được cung cấp qua cùng một API lưu trữ. Việc ra mắt được chia làm hai giai đoạn: công bố vào ngày 21 tháng 7 năm 2026 với quyền truy cập API chỉ dành cho khách mời trên Alibaba Cloud Bailian và nền tảng Qwen AI, sau đó mở hoàn toàn vào ngày 5 tháng 8. Các nhà phát triển quốc tế tiếp cận qua Qwen Cloud, nơi thông tin ra mắt niêm yết Pro ở mức 0,04 USD mỗi hình ảnh và Standard ở mức 0,03 USD mỗi hình ảnh. Giá dành cho người tiêu dùng trong nước bắt đầu từ khoảng ¥0,18 mỗi hình ảnh. Đây là những con số ra mắt do nhà cung cấp công bố, và bài viết này coi chúng đúng như vậy — chúng là những con số Alibaba chọn công bố, chứ không phải kết quả kiểm toán độc lập.

Buổi ra mắt, qua ba con số

Nếu bạn chỉ đọc một điều từ thông báo này, thì đó là ba điều sau đây:

Các lời nhắc 4.500 token. Qwen-Image-3.0 chấp nhận độ dài lời nhắc gấp khoảng 4,5 lần so với phiên bản tiền nhiệm. Đó là thay đổi nền tảng cho mọi thứ khác: một lời nhắc giờ đây có thể xác định toàn bộ một trang báo, một bảng phân cảnh, một đồ họa thông tin dạng lưới 9 ô, hoặc một đề thi và tạo ra nó trong một lần thay vì phải ghép lại trong trình biên tập.

~Kết xuất văn bản 10 pixel. Mô hình kết xuất văn bản nhỏ, dễ đọc với chiều cao chữ khoảng mười pixel — sự khác biệt giữa một hình ảnh trông như có chữ và một hình ảnh thực sự đọc được chính xác.

12 ngôn ngữ, 20+ phông chữ.Đầu ra đa ngôn ngữ là bản địa chứ không phải là một tính năng thêm vào: tiếng Trung, tiếng Anh, tiếng Hàn và hơn thế nữa, được hiển thị bằng đúng loại chữ viết mà lời nhắc yêu cầu, không có các ô ký tự bị thiếu vốn gây khó khăn cho hầu hết các mô hình huấn luyện theo phương Tây khi xử lý CJK.

Thêm những phần ít trích dẫn được nhưng cũng quan trọng không kém — chuyển ảnh sang ảnh và chỉnh sửa ảnh trong cùng một mô hình, sơ đồ tri thức kết hợp công thức, hình học và các bước suy luận, cùng các bản mô phỏng hợp lý của giao diện web, trò chơi và phát trực tiếp — và bức tranh tổng thể đã rõ ràng. Alibaba đang nhắm đến công việc sản xuất: tạo đề thi hàng loạt trong giáo dục, poster thương mại điện tử xuyên biên giới, dàn trang xuất bản, tạo mẫu giao diện người dùng. Các tài liệu ra mắt tại Trung Quốc tóm tắt định vị bằng một chữ: , "thực dụng".

A generated spec scoreboard for Qwen-Image-3.0 showing 4,500-token prompts, ~10px text, 12 native languages, pricing from ¥0.18 / $0.03-0.04 per image, Pro and Standard editions, and closed API-only weights, footnoted as sourced from Alibaba launch materials.

Điều gì đã được xác minh độc lập cho đến nay

Screenshot of the Qwen-Image blog post 'Qwen Image 3.0 Released: Long Prompts, Small Text, and Multilingual Layouts', announcing Qwen-Image-3.0 on July 21, 2026.

Đây là phần quan trọng đối với bất kỳ ai từng bị "đốt" bởi một bản ra mắt hào nhoáng. Qwen-Image-3.0 là một mô hình đóng: không có trọng số, không có giấy phép, không có báo cáo kỹ thuật, không có bản công bố benchmark chính thức. Đây là một sự đảo ngược có chủ đích — Qwen-Image 1.0 và 2.0 được phát hành dưới dạng mở, với trọng số Apache-2.0 trên Hugging Face kèm báo cáo kỹ thuật ngay trong ngày. Bản 3.0 phá vỡ điều đó, và Alibaba chưa công bố thẻ mô hình (model card) hay số tham số. Các bài đưa tin ban đầu về bản ra mắt mô tả nó có khoảng 20B tham số trên kiến trúc MMDiT, nhưng hãy coi đó là thông tin được báo cáo chứ chưa được xác nhận: không có báo cáo để kiểm tra, không ai ngoài Alibaba có thể xác minh được.

Điều đó có nghĩa là mọi tính năng nổi bật nêu trên — đầu vào 4.500 token, chữ 10px, 12 ngôn ngữ — chỉ là tuyên bố của nhà cung cấp. Điểm dữ liệu độc lập mạnh nhất cho đến nay là một bài so sánh thực tế của Trung Quốc được công bố trong giai đoạn ra mắt, đã chạy Qwen-Image-3.0-Pro so với mười một cấu hình khác. Kết quả của nó có hai mặt: Qwen-Image-3.0-Pro xuất sắc trong việc tạo giao diện người dùng/bảng điều khiển, sơ đồ khoa học và hệ thống thiết kế thống nhất, với chất lượng hoàn thiện tổng thể cao nhất ở các hạng mục đó — nhưng nó cũng là mô hình chậm nhất tính trung bình, và văn bản phông chữ nhỏ vẫn tạo ra ký tự lỗi trong một số trường hợp. Về độ chính xác văn bản nghiêm ngặt, bài kiểm tra tương tự ưu tiên GPT-Image-2 medium, Gemi​ni 3 Pro và Seedream 5.0 Lite. Đó là một bức tranh hữu ích và trung thực: mạnh về cấu trúc, nhưng chưa hoàn hảo ở kiểu chữ nhỏ mà nó quảng cáo.

Về phía bảng xếp hạng, thông tin ra mắt của Alibaba tuyên bố Qwen-Image-3.0-Pro đạt vị trí #1 trong số các mô hình Trung Quốc và #2 trong số các mô hình chính thống trên bảng xếp hạng text-to-image của Arena, xếp sau dòng sản phẩm Ope​nAI G​PT-Image. Một trang web theo dõi độc lập (AITNT, ngày 5 tháng 8) cho thấy mô hình Pro đứng đầu trong số các mô hình của Alibaba ở cả hai hạng mục Art Creation (1.256 Elo, thứ hạng toàn cầu từ 2–11) và Photorealistic (1.258 Elo, toàn cầu 4–13). Theo bảng xếp hạng hàng tuần của Arena vào ngày 10 tháng 8, mô hình Pro đứng ở vị trí #7 tổng thể trong tạo hình ảnh — vẫn ở top đầu, và đáng để theo dõi xem liệu vị trí này có giữ vững khi cơn sốt ra mắt lắng xuống hay không.

Screenshot of the Text-to-Image Arena overall leaderboard on arena.ai, showing 77 ranked image models by Elo as of August 10, 2026.

Hai phiên bản, một câu chuyện giá.

Qwen-Image-3.0-Pro và Qwen-Image-3.0-Standard là cùng một dòng mô hình nhưng được định giá ở hai mức. Trên Qwen Cloud, mức giá công bố cho mỗi ảnh là 0,04 USD cho Pro và 0,03 USD cho Standard; mức giá dành cho người tiêu dùng trong nước khởi điểm khoảng 0,18 NDT. Để so sánh, mức giá này nằm dưới bậc trung của GPT-Image-2 và gần ngang với mức mà Google's Nano Banana 2 Lite từng đạt tới — một mức giá được chủ ý chọn là "đủ rẻ để thử nghiệm lặp lại". Một lưu ý đáng nêu từ một cuộc đánh giá độc lập về tính khả thi khi xây dựng: chính cuộc đánh giá đó đã không thể tìm thấy mục Qwen-Image-3.0 trên trang giá của Model Studio thuộc Alibaba Cloud tại một thời điểm cuối tháng Bảy. Khoảng trống này sau đó đã được lấp khi quá trình phát hành GA diễn ra, nhưng nó nhắc nhở rằng bề mặt API của một mô hình mới ra mắt một tuần vẫn có thể đang trong quá trình ổn định — hãy kiểm tra trang giá hiện tại trước khi gắn một pipeline sản xuất vào nó.

Nơi bạn có thể gọi nó

Qwen-Image-3.0 là mô hình hosted, do đó đường truy cập là API của riêng nhà cung cấp và một số nền tảng bên thứ ba đã hỗ trợ nó kể từ khi GA. Không có tùy chọn tự triển khai (self-hosting) và cũng không có hướng trọng số mở (open-weights), điều này đáng cân nhắc nếu yêu cầu của bạn là lưu trữ dữ liệu tại chỗ hoặc toàn quyền kiểm soát pipeline. Về mặt tích cực, việc sử dụng mô hình hosted đồng nghĩa với việc không cần quy hoạch dung lượng GPU — bạn trả phí theo từng hình ảnh và nhà cung cấp tự mở rộng quy mô.

Đây cũng chính là thời điểm một router chứng tỏ giá trị của mình. Qwen-Image-3.0 hoàn toàn mới và trang giá của nó đã thay đổi một lần chỉ trong một tuần; nếu bạn đang so sánh nó với phần còn lại của lĩnh vực mô hình hình ảnh, bạn sẽ không muốn phải viết tích hợp riêng cho từng nhà cung cấp trong lúc đưa ra quyết định. OrcaRouter tập hợp hơn 200 mô hình phía sau một endpoint tương thích OpenAI với giá niêm yết của nhà cung cấp, không thêm bất kỳ khoản phụ phí nào, vì vậy khi một nhà cung cấp giảm giá — kể cả trên một mô hình mới chỉ một tuần tuổi — phía chúng tôi sẽ cập nhật ngay trong ngày sản phẩm ra mắt. Tự động chuyển đổi dự phòng cho phép bạn chạy các khối lượng công việc liên quan đến Qwen-Image-3.0 thông qua các mô hình mà chúng tôi định tuyến (gpt-image-2 của Ope​nAI, Grok Imagine của xAI, dòng Imagen 4 của Goo​gle) mà không lo đường ống xử lý hình ảnh bị gián đoạn trong khi bạn so sánh một mô hình mới với phần còn lại. So sánh chính là mục đích: một khóa API duy nhất, một định dạng gọi duy nhất, và các con số đặt cạnh nhau.

Ai nên hành động ngay bây giờ?

Các nhóm tạo ra tài liệu dày đặc chữ — đề thi, bảng thông số sản phẩm, áp phích đa ngôn ngữ, bản mô phỏng bảng điều khiển, bảng phân cảnh — tự nhiên trở thành những người áp dụng sớm, vì đó chính xác là những loại công việc mà một prompt 4.500 token với khả năng kết xuất đa ngôn ngữ gốc giúp tiết kiệm hàng giờ ghép nối và gõ lại. Với các nhóm đặt tiêu chuẩn về tính chân thực như ảnh chụp hoặc độ trung thực tuyệt đối về kiểu chữ, hiện nay đã có những lựa chọn được kiểm chứng tốt hơn, và dữ liệu kiểm thử độc lập cũng ủng hộ việc chờ các vấn đề về chữ nhỏ được khắc phục. Dù thế nào đi nữa, đừng chỉ dựa vào những tuyên bố khi ra mắt: mô hình này là mã nguồn đóng, nên điều duy nhất có thể cho bạn biết liệu nó có xứng đáng một vị trí trong bộ công cụ của bạn hay không chính là tự chạy các prompt thực tế của bạn trên nó — một thử nghiệm rẻ, vì mỗi ảnh chỉ tốn 0,03–0,04 đô la.

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube