Thẻ tiêu đề hero cho GPT-Image-2 so với Flux 3, tiêu đề 'GPT-Image-2 vs Flux 3' với phụ đề 'Một mô hình đang hoạt động, một lộ trình', hai thẻ hiển thị GPT-Image-2 với huy hiệu 'API công khai từ tháng 5 năm 2026' và Flux 3 với huy hiệu 'Gói hình ảnh: sắp ra mắt', logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-Image-2 so với Flux 3: So sánh mô hình hiện có với lộ trình phát triển

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đây không phải là một bài viết so sánh mô hình với mô hình thông thường, vì GPT-Image-2Flux 3 không ở cùng một trạng thái tồn tại. GPT-Image-2 được phát hành vào ngày 21 tháng 4 năm 2026, đã có thể gọi được qua API của Ope​nAI kể từ đầu tháng 5, và vừa có thêm một khả năng mới trong tuần này — tạo hình ảnh với nền trong suốt trong API, được công bố vào ngày 20 tháng 8 và hiện đã khả dụng. Flux 3 là mô hình nền tảng đa phương thức của Black Forest Labs, được công bố vào ngày 23 tháng 7 năm 2026, và phần hình ảnh vẫn chưa có endpoint công khai, chưa có ID mô hình, và chưa có bảng giá tính đến thời điểm viết bài. Một trong số đó bạn có thể gọi lúc 3 giờ sáng với một key hợp lệ; cái còn lại bạn có thể đăng ký để được vào danh sách chờ. So sánh hữu ích, vì vậy, không phải là "cái nào tốt hơn" — mà là mô hình đã phát hành thực sự làm được gì hôm nay, lộ trình hứa hẹn điều gì cho mô hình chưa phát hành, và một nhà phát triển nên đối xử thế nào với một mô hình được hứa hẹn mà cứ liên tục bị trì hoãn trong khi một mô hình đang hoạt động thì ngày càng được cải thiện.

Một trong số này có một điểm cuối.

Hãy bắt đầu từ tính khả dụng, vì nó quyết định mọi thứ khác. Black Forest Labs đã ra mắt Flux 3 vào ngày 23 tháng 7 như một mô hình đơn lẻ được huấn luyện chung cho các tác vụ dự đoán hình ảnh, video, âm thanh và hành động robot, dựa trên phương pháp flow-matching mà phòng thí nghiệm gọi là Self-Flow. Theo báo cáo, hơn 95% tài nguyên tính toán của quá trình huấn luyện đó được dành cho dự đoán video, điều này thể hiện rõ qua những gì thực sự được phát hành: chỉ có Flux 3 Video đạt trạng thái phát hành chính thức (general availability) vào ngày 4 tháng 8, với một API tính phí. Trang mô hình của phiên bản hình ảnh vẫn còn mang nhãn "coming soon" kèm biểu mẫu đăng ký, chứ không phải nút bắt đầu — không có endpoint, không có tham số được ghi trong tài liệu, không có chi phí cho mỗi hình ảnh và không có benchmark nào để bất kỳ ai có thể chạy.

Ngược lại, GPT-Image-2 đã được đưa vào sản xuất được bốn tháng. Ope​nAI đã mở quyền truy cập API vào đầu tháng Năm, và định danh của mô hình, gpt-image-2, đủ ổn định để một bản chụp cố định, gpt-image-2-2026-04-21, cùng tồn tại với nó. Đây hiện là mô hình text-to-image số một trên cả hai bảng xếp hạng độc lập lớn — 1,381 Elo trên bảng xếp hạng text-to-image của Arena (bản trung bình) và 1,369 Elo cho bản cao trên Artificial Analysis — đồng thời nó hiển thị văn bản đa ngôn ngữ bao gồm CJK, căn cứ tạo sinh vào tìm kiếm web và tạo ra đầu ra lên đến 4K. Bốn tháng lưu lượng sản xuất là sự khác biệt giữa một lời tuyên bố và một thành tích thực tế.

Sự thay đổi gần đây ở phía GPT-Image-2

Sự kiện khiến cuộc đối đầu này trở nên đúng thời điểm không liên quan gì đến Flux 3. Vào ngày 20 tháng 8, Ope​nAI đã mở bản xem trước nền trong suốt cho GPT-Image-2 trong Images API: đặt nền thành "transparent" và endpoint sẽ trả về PNG hoặc WebP với kênh alpha thực sự, đã tách nền và sẵn sàng để ghép. Đây là tính năng nhắm thẳng vào công việc sản xuất mà lộ trình hình ảnh Flux 3 cũng đang chào bán — ảnh sản phẩm, biểu tượng, tài liệu tiếp thị — và nó được triển khai như một tham số trên một endpoint đã hoạt động thay vì một mô hình mới. Vì vậy, trong khi thế giới chờ đợi một endpoint hình ảnh Flux 3 vẫn ghi "sắp ra mắt," bên đương nhiệm vừa lấp một trong những khoảng trống khiến nó đứng ngoài các quy trình ghép ảnh.

Tính năng này chỉ dành riêng cho API — không có nút gạt ChatGPT — và nó là một tham số, không phải một sản phẩm mới. Cả hai điểm cuối của Images API, generation và edit, đều chấp nhận trường background với các giá trị "transparent", "opaque" và "auto" (mặc định, do mô hình tự quyết định). Kênh alpha chỉ được giữ lại trong đầu ra PNG hoặc WebP, nên yêu cầu phải cố định rõ ràng định dạng đầu ra. Tài liệu tham chiếu API của chính Ope​nAI vẫn đánh dấu hỗ trợ transparent cho gpt-image-2 và bản snapshot gpt-image-2-2026-04-21 của nó là "in preview" (đang xem trước) — đó là nhãn của nhà cung cấp, không phải thông báo phát hành chính thức — và hướng dẫn của họ là giữ cho prompt không mô tả bất kỳ hậu cảnh nào để mô hình thực sự tôn trọng yêu cầu transparent. Không có điểm cuối mới, không có ID mô hình mới, không có bảng giá riêng: cùng một lời gọi gpt-image-2 từng trả về PNG không trong suốt giờ trả về ảnh cắt nền.

Comparison scoreboard titled 'GPT-Image-2 vs Flux 3 - the scoreboard'. GPT-Image-2 column: Released Apr 21, 2026; Availability Public API since May; Arena T2I Elo 1,381 (#1); Text rendering multilingual incl. CJK; Transparent bg preview Aug 20; Max resolution 4K. Flux 3 column: Released announced Jul 23, 2026; Availability image tier coming soon; Arena T2I Elo none yet; Text rendering promised; Transparent bg not stated; Max resolution not specified. Footer: GPT-Image-2 figures per Arena and OpenAI list pricing; Flux 3 image claims are a vendor roadmap. OrcaRouter logo bottom-right.

Điều mà hình ảnh Flux 3 hứa hẹn, và những gì thực sự được phát hành

Bảng thông số kỹ thuật của tầng hình ảnh Flux 3 là một lộ trình của nhà cung cấp, vì vậy hãy coi nó như vậy. Black Forest Labs đã hứa hẹn về tổng hợp và chỉnh sửa hình ảnh trên nhiều phong cách và độ phân giải, cải thiện xử lý prompt phức tạp, kết xuất văn bản đa ngôn ngữ độ chính xác cao, truyền phong cách zero-shot từ hình ảnh tham chiếu, nhất quán nhân vật và thương hiệu mà không cần tinh chỉnh, và chỉnh sửa không phá hủy giữ nguyên kết cấu và ánh sáng. Đó là những điều đúng đắn để hứa hẹn — chúng chính là các tính năng mà các nhà dẫn đầu thị trường hiện tại đang cạnh tranh — nhưng không ai trong số chúng có thể kiểm thử được hôm nay vì không cái nào có endpoint.

Thứ thực sự có thể gọi được từ BFL là mảng video và dòng sản phẩm ảnh FLUX cũ hơn. Flux 3 Video được bán với giá 0,17 USD mỗi giây ở HD và 0,29 USD mỗi giây ở FHD cho các bản render đầy đủ, cùng chế độ nháp với giá 0,06 USD mỗi giây. Các con số do chính họ công bố là 1.135 Elo cho text-to-video và 1.051 cho image-to-video, cùng chiến thắng về độ ưa thích trước Luma Ray 3.2, Runway Gen-4.5, Gr​ok Imagine Video và Kling v3 Pro — tất cả đều do nhà cung cấp tự báo cáo và chưa được tái lập, và dù sao thì chẳng con số nào trong đó áp dụng cho mảng ảnh. Với ảnh tĩnh, sản phẩm hiện tại của BFL vẫn là dòng FLUX.2, đạt 1.226 Elo trên cùng bảng xếp hạng Artificial Analysis nơi GPT-Image-2 dẫn đầu với 1.369. Khoảng cách đó chính là bối cảnh thực tế cho câu "Flux 3 image sắp ra mắt": API ảnh của BFL hiện nay kém khoảng 140 Elo so với API của Ope​nAI, và mô hình đã hứa hẹn chính là thứ BFL cần để thu hẹp khoảng cách đó.

Screenshot of the Artificial Analysis Text-to-Image leaderboard (captured August 20, 2026) showing GPT Image 2 (high) in first place at 1,369 Elo and Black Forest Labs' current image entry FLUX.2 (max) at 1,226 Elo, with no Flux 3 image entry present, in English.

Định giá: chỉ có duy nhất một thẻ giá thực sự tồn tại.

Không có giá hình ảnh Flux 3 vì không có sản phẩm hình ảnh Flux 3. Các con số được công bố duy nhất là mức giá token của GPT-Image-2: 5 USD cho mỗi triệu token đầu vào văn bản, 8 USD cho mỗi triệu token đầu vào hình ảnh và 30 USD cho mỗi triệu token đầu ra hình ảnh, với Batch API chạy ở mức khoảng một nửa cho thời gian xử lý lên đến 24 giờ. OpenAI không công bố số token trên mỗi hình ảnh, vì vậy các con số trên mỗi hình ảnh chỉ là quy đổi, không phải báo giá chính thức: khoảng 0,006 USD cho ảnh 1024×1024 chất lượng thấp, khoảng 0,05 USD cho ảnh trung bình, khoảng 0,21 USD ở chất lượng cao và lên đến khoảng 0,41 USD cho bản render 4K độ phân giải cao. Để so sánh, đó là một bên của bảng đối chiếu là có thật; cột hình ảnh Flux 3 là một ô trống.

Screenshot of the OrcaRouter model page for openai/gpt-image-2 (captured August 20, 2026), showing the model description, input rate of $8.00 and output rate of $30.00 per million tokens, median latency, and community usage, in English.

Người xây dựng nên làm gì với một mô hình đã được hứa hẹn

Thái độ hợp lý khi mô hình của đối thủ liên tục trượt hẹn là xây dựng trên những gì đã có và biến tương lai thành một thay đổi cấu hình thay vì một cuộc tái kiến trúc. GPT-Image-2 có thể định tuyến ngay hôm nay qua OrcaRouter — một khóa API, giá niêm yết của Ope​nAI được chuyển qua với biên lợi nhuận 0%, tự động chuyển đổi dự phòng giữa các nhà cung cấp — vì vậy một pipeline tạo tài nguyên bằng nó sau này có thể trỏ cùng một endpoint tới API của Flux 3 image vào ngày endpoint đó thực sự tồn tại, và định tuyến một phần lưu lượng tới đó bằng DSL định tuyến mà không cần đụng đến mã gọi. Bạn có được mô hình đã phát hành ngay bây giờ, và khi mô hình được hứa hẹn ra mắt, bạn đánh giá nó dựa trên một đường cơ sở hoạt động thay vì dựa trên thông cáo báo chí. Việc chờ đợi không làm bạn mất gì; xây dựng trên không gì cả trong lúc chờ đợi là mất tất cả.

Phán quyết nghiêng hẳn về một phía là có chủ đích. Nếu bạn cần tạo hình ảnh trong quý này, GPT-Image-2 là lựa chọn và không có gì phải bàn cãi — nó là số một một cách độc lập, nó vừa bổ sung tính năng xuất nền trong suốt trong API, và nó có API công khai cùng mức giá ổn định. Flux 3 image là lý do để để mắt tới Black Forest Labs, không phải là lý do để trì hoãn một dự án. Hãy theo dõi thời điểm mở truy cập sớm và các bài đánh giá chuẩn độc lập đầu tiên; ngay khi một endpoint xuất hiện, sự so sánh trong bài viết này sẽ trở thành một bài kiểm tra mà bạn thực sự có thể chạy.