Thẻ hero cho trận so tài Bernini-Diffusers-v2 với Qwen Image 3.0, thể hiện các trọng số Apache-2.0 bạn tự lưu trữ so với một API đóng kín hiển thị văn bản xuống tới ~10px, với tagline: Cùng một mô tả công việc, câu trả lời trái ngược về khả năng kiểm soát.
Guides & Insights

Bernini-Diffusers-v2 so với Qwen Image 3.0: Trọng số bạn sở hữu so với một API hiển thị văn bản

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai phòng thí nghiệm Trung Quốc đã phát hành các mô hình tạo hình ảnh cách nhau chỉ ba tuần và rơi vào hai phía đối lập của sự phân chia lớn nhất trong hạng mục này. Qwen-Image-3.0, do nhóm Alibaba phát hành vào ngày 21 tháng 7 năm 2026 và được mở cho API quốc tế vào ngày 4 tháng 8, là một mô hình tạo ảnh trọng số đóng mà bạn gọi qua HTTP. Bernini-Diffusers-v2, mà ByteDance đã đưa lên Hugging Face vào ngày 13 tháng 8 năm 2026 mà không có thông báo, là trọng số mở Apache-2.0 mà bạn tải về và chạy. Cùng một mô tả công việc chung — tạo và chỉnh sửa hình ảnh — nhưng có câu trả lời trái ngược cho câu hỏi ai kiểm soát mô hình. Phần lớn những gì tiếp theo là hệ quả của quyết định duy nhất đó, vì vậy đây là điểm khởi đầu của sự so sánh này chứ không phải là điểm kết thúc.

Các trọng lượng chia

Qwen-Image-3.0 — trọng số đóng. Tính đến thời điểm viết bài, Alibaba vẫn chưa công bố trọng số hay báo cáo kỹ thuật cho mô hình này; bạn sử dụng nó qua API trên Alibaba Cloud Bailian hoặc nền tảng Qwen. Đầu ra mang nhãn xuất xứ AIGC. Điều bạn mua là năng lực mà không có quyền sở hữu: không tự lưu trữ, không tinh chỉnh, không sử dụng ngoại tuyến, không được nhìn vào bên trong.

Bernini-Diffusers-v2 — trọng số mở. Apache-2.0, một thư mục diffusers khép kín trên Hugging Face và các tập lệnh suy luận cục bộ trong kho lưu trữ bytedance/Bernini. Bạn có thể tinh chỉnh nó, chạy nó ở chế độ cách ly mạng (air-gapped), giữ dữ liệu trên phần cứng của riêng bạn và ngừng trả phí cho từng hình ảnh. Cái giá của việc tự quản lý là phải vận hành nó: README khuyến nghị GPU lớp Hopper và bộ công nghệ Python 3.11.2 / PyTorch 2.7.1+cu126.

Đối với một nhóm có hình ảnh chứa tài liệu mật, hoặc có quy định tuân thủ cấm gửi dữ liệu đến API của bên thứ ba, ranh giới đó tự nó đã giải quyết cuộc tranh cãi.

Độ trung thực của văn bản và bố cục

Điều thực sự khác biệt của Qwen-Image-3.0 là văn bản. Các con số nổi bật của nó, từ tài liệu phát hành của Alibaba:

• Cửa sổ prompt — lên tới 4,500 tokens dữ liệu đầu vào, gấp 4,5 lần so với thế hệ trước, nhờ đó xử lý được các bản mô tả dày đặc như trang nhất báo hoặc lưới tri thức chín ô trong một lần gọibr />• Văn bản nhỏ — hiển thị rõ ràng đến khoảng 10px, bao gồm ký hiệu toán học, chỉ số dưới, chỉ số trên và công thức nhiều dòngbr />• Ngôn ngữ — hiển thị tự nhiên trên 12 ngôn ngữ với hơn 20 phông chữ và hơn 100 phong cách nghệ thuật, cùng khả năng quen thuộc với các giao diện web, game và phần mềm phổ biến

Bernini-Diffusers-v2 không đưa ra tuyên bố tương đương nào về văn bản và bố cục trên thẻ của nó. Thế mạnh của nó nằm ở chỗ khác — chỉnh sửa ngữ nghĩa dựa trên lập kế hoạch và một pipeline video — và với một đề bài chủ yếu là "thể hiện chính xác infographic này", Qwen-Image-3.0 là lựa chọn đã được chứng minh, còn Bernini là lựa chọn chưa được kiểm chứng.

Độ sâu chỉnh sửa

Qwen-Image-3.0 — tạo sinh và chỉnh sửa, với một loạt các kỹ thuật chuyên biệt: phục chế tranh cổ, tạo ảnh toàn cảnh, chuyển phác thảo thành PPT, và phân cảnh đa khung hình. Điểm nhấn là tính hữu dụng trong sản xuất — bố cục vững chắc, chi tiết trông chân thực — thay vì một kiến trúc chỉnh sửa cụ thể.

Bernini-Diffusers-v2 — chỉnh sửa thông qua một bộ lập kế hoạch ngữ nghĩa. Bộ lập kế hoạch Qwen2.5-VL phân rã chỉ dẫn thành một kế hoạch về những gì cần thay đổi, và một trình kết xuất dựa trên Wan2.2 vẽ ra nó. Đó là một thiết kế hấp dẫn cho các chỉnh sửa phức tạp, nhiều bước — "đổi mùa, thay xe, giữ khung hình" — và nó mở rộng sang các tác vụ video (t2v, v2v, rv2v) mà đối thủ không đụng tới. Toàn bộ đều do nhà cung cấp công bố và chưa được xác minh công khai.

Two-column comparison scoreboard for Bernini-Diffusers-v2 and Qwen Image 3.0: weights, price, prompt window, text rendering, editing strengths, and hosted API availabilityScreenshot of the ByteDance/Bernini-Diffusers-v2 model card on Hugging Face showing the News and Highlights sections, including the v2 training-recipe change, and the start of the model card table

Chi phí

Qwen-Image-3.0 — khoảng $0.025 mỗi 1K ảnh tại API quốc tế (khoảng 0,18 nhân dân tệ), với đầu ra lên đến 2048×2048 và tối đa sáu ảnh mỗi lần gọi. Nó được định giá để cạnh tranh mạnh mẽ với phần còn lại của thị trường API ảnh — một phần nhỏ so với những gì các mô hình ảnh lưu trữ cao cấp đã tính phí một năm trước.

Bernini-Diffusers-v2 — trọng số miễn phí, không tính phí theo từng ảnh, mà thay vào đó là hóa đơn phần cứng. Tính kinh tế đảo ngược theo khối lượng: tự lưu trữ là một lựa chọn kém cho việc tạo ảnh thỉnh thoảng, nhưng ngày càng trở nên tốt hơn khi bạn tạo càng nhiều, vì chi phí biên cho mỗi ảnh bổ sung tiến dần về con số không.

Có một chi phí thứ ba có lợi cho phía open-weights và dễ bị định giá thấp: chi phí chuyển đổi. Mô hình API đóng trói buộc bạn vào mức giá, giới hạn tốc độ và lộ trình phát triển của nó; còn mô hình bạn sở hữu có thể được thay thế, vá lỗi hoặc tinh chỉnh mà không cần đàm phán lại bất cứ điều gì.

Bạn xây dựng trên API nào?

Qwen-Image-3.0 chỉ có qua API, vì vậy nếu bạn xây dựng trên nó, bạn đang cam kết trả phí theo từng ảnh trên hạ tầng của người khác — đây chính là lúc khả năng chuyển tiếp (pass-through) của OrcaRouter trở nên quan trọng. Giá bạn thấy ở phía chúng tôi là giá niêm yết của Alibaba với mức cộng thêm 0%, và mức giảm giá của nhà cung cấp được áp dụng ngay trong ngày, vì vậy chi phí mỗi ảnh là của nhà cung cấp, không phải khoản cộng thêm của bên bán lại. Tự động chuyển đổi dự phòng (failover) giữa các nhà cung cấp là nửa còn lại của lập luận: một API tạo ảnh gặp sự cố giữa chiến dịch sẽ không còn đáng lo khi các lời gọi của bạn định tuyến vòng qua nó. Nếu thay vào đó bạn chọn con đường trọng số mở với Bernini-Diffusers-v2, bạn đang chấp nhận gánh nặng vận hành hôm nay để đổi lấy phí bằng 0 cho mỗi ảnh, và khi một nhà cung cấp lưu trữ cuối cùng sử dụng các trọng số này, cơ chế chuyển tiếp tương tự sẽ áp dụng cho bất kỳ mức phí nào mà nhà cung cấp đó tính.

Decision card for the Bernini-Diffusers-v2 versus Qwen Image 3.0 matchup: Qwen Image 3.0 rents the capability as a text-accurate API at ~$0.025 per image with zero infrastructure; Bernini-Diffusers-v2 owns the model as Apache-2.0 weights that are self-hosted and fine-tunable but unverified

Bản án

Trên lý thuyết, Qwen-Image-3.0 là mô hình hình ảnh thuần túy mạnh hơn: khả năng hiển thị văn bản đã được chứng minh, cửa sổ prompt rất lớn, độ trung thực bố cục đa ngôn ngữ và giá API cạnh tranh. Đây là lựa chọn an toàn cho việc tạo hình ảnh trong sản xuất khi yêu cầu tóm tắt nặng về văn bản và quy trình làm việc định hướng API. Bernini-Diffusers-v2 là mô hình bạn thực sự có thể sở hữu — trọng số Apache-2.0, tự lưu trữ, tinh chỉnh được, hỗ trợ video — với cái giá phải tự vận hành và tin vào một bảng điểm chuẩn mà chưa ai tái lập. Chọn Qwen-Image-3.0 vì độ chính xác và không cần hạ tầng; chọn Bernini-Diffusers-v2 vì quyền sở hữu và kiểm soát. Quy tắc quyết định trong một câu: bạn muốn thuê năng lực, hay sở hữu mô hình?

© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube