Thẻ tiêu đề cho FLUX 3 Image so với Bernini-Diffusers-v2, đối chiếu 'FLUX 3 Image - hoạt động từ ngày 1 tháng 10 năm 2026, $0.048 một ảnh ở 1K, trên api.bfl.ai' với 'Bernini-Diffusers-v2 - trọng số Apache-2.0, chỉ tự vận hành, không có API lưu trữ' và lưu ý rằng OrcaRouter không định tuyến cả hai. Logo OrcaRouter nằm ở góc dưới bên phải.
Guides & Insights

FLUX 3 Image vs Bernini-Diffusers-v2: Một endpoint trả phí đối đầu với một repo có thể tải xuống

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

FLUX 3 Image và Bernini-Diffusers-v2 đều là những mô hình hình ảnh mà bạn có thể sở hữu trọn vẹn ngay hôm nay, và không cái nào trong số chúng là sản phẩm bạn có thể thuê. FLUX 3 Image ra mắt vào ngày 1 tháng 10 năm 2026 tại api.bfl.ai/v1/flux-3-image với bảng giá được công bố và không có điểm số được công bố. Bernini-Diffusers-v2 xuất hiện trên Hugging Face vào ngày 13 tháng 8 năm 2026 theo Apache-2.0 với điểm số được công bố và không có cách nào để gọi nó ngoại trừ GPU của chính bạn. Một cái đi kèm hóa đơn. Cái còn lại đi kèm một bản ghim phiên bản Python.

Sự phân tách đó chính là toàn bộ phép so sánh, và đáng để nói cho chính xác về điều đó, vì cách diễn giải thông thường kiểu “được lưu trữ so với trọng số mở” không phù hợp ở đây. Bernini không phải là một mô hình trọng số mở mà bạn có thể thả thẳng vào một ngăn xếp suy luận hiện có. Nó là một hệ thống hai giai đoạn — một bộ lập kế hoạch Qwen2.5-VL-7B đứng trước một bộ giải mã khuếch tán Wan2.2-T2V-A14B — và bản phát hành v2 của nó là một bản sửa lịch huấn luyện, không phải một tầng năng lực mới. FLUX 3 Image là một endpoint duy nhất với một lượng bề mặt điều khiển bất thường được gắn vào nó: định vị không gian, lưới tọa độ 0–1000, và chỉnh sửa theo phạm vi hộp, nơi bạn chỉ định vùng nào được giữ lại. Những dạng thứ khác nhau.

Thực tế mỗi thứ là gì

• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.

• Bernini-Diffusers-v2 — ngăn xếp planner-plus-renderer của ByteDance, được đẩy lên Hugging Face vào ngày 13 tháng 8 năm 2026 mà không có thông báo kèm theo. Kho lưu trữ được gắn thẻ image-text-to-video và phụ thuộc vào diffusers. Các tác vụ được liệt kê: văn bản sang hình ảnh, hình ảnh sang hình ảnh, văn bản sang video, video sang video, tham chiếu sang video và tham chiếu sang hình ảnh. Không có dịch vụ suy luận được host và không có bảng giá — cách bắt đầu là hf download và một ứng dụng Gradio.

• Khoảng cách phân phối — FLUX 3 Image là một dịch vụ tính phí theo mức sử dụng mà bạn gọi qua API. Bernini là một kho mã nguồn mà bạn tự triển khai. Trước khi bất kỳ câu hỏi nào về chất lượng trở nên đáng để đặt ra, một trong hai thứ này đòi hỏi một GPU cấp Hopper, còn thứ kia chỉ cần một chiếc thẻ tín dụng.

Việc cấp phép là nơi hai điều này khác biệt gay gắt nhất.

Bernini-Diffusers-v2 là Apache-2.0 ở cấp kho lưu trữ. Đối với một pipeline tự vận hành tại chỗ, điều đó cực kỳ quan trọng: không có đồng hồ đo theo từng ảnh, không có thỏa thuận thương mại phải đàm phán, không phải báo cáo mức sử dụng. Bạn trả tiền điện và thời gian scheduler, và chi phí biên của bức ảnh thứ mười nghìn cũng bằng bức ảnh đầu tiên.

FLUX 3 Image không phải là trọng số mở, và Black Forest Labs nói rõ rằng đây chỉ là tạm thời. Trọng số thương mại đã có sẵn ngay hôm nay theo một giấy phép BFL được đàm phán, còn bản phát hành trọng số mở công khai được mô tả là sẽ đến trong những tuần tiếp theo. Đó là một lời hứa có hình hài nhưng không có ngày cụ thể, và đây là điều quan trọng nhất trên trang này cần kiểm tra lại thay vì giả định. Nếu bạn đang chọn một stack hình ảnh cho hai năm tới, câu hỏi về giấy phép có lẽ quan trọng hơn câu hỏi về Elo — nhưng chỉ khi bạn sẵn sàng tự vận hành một stack khuếch tán bản địa video hai giai đoạn.

Bề mặt điều khiển: hộp giới hạn so với tăng cường câu lệnh

Đây là phần thực sự thú vị của cuộc đối đầu, bởi vì hai mô hình giải quyết việc “khiến nó đi chính xác đến đó” theo những cách hoàn toàn khác nhau.

FLUX 3 Image nhận một mảng JSON được nối thêm vào prompt. Tọa độ chạy trên lưới 0–1000 trên cả hai trục, và mỗi hộp được viết dưới dạng [top, left, bottom, right]. Bạn cung cấp một bảng các phần tử, mỗi phần tử có một id, một bbox và một desc, cùng với một chú thích toàn cục tham chiếu các id đó theo tên. Trong ví dụ của chính BFL, các id đọc như animal_1 và silhouette_1; chú thích tham chiếu trực tiếp đến chúng. Phía trên lệnh gọi tạo có grounding, được bật theo mặc định, chạy tìm kiếm web và hình ảnh trước khi tạo.

FLUX 3 Image sau đó mở rộng cùng hệ tọa độ đó sang chỉnh sửa. Thay vì gửi mặt nạ, bạn gửi một tập hợp các thao tác theo phạm vi hộp: Giữ (hộp nguồn đến cùng hộp, lấy từ ref_image_0), Di chuyển (hộp nguồn đến hộp đích mới), Mới (không có nguồn, hộp đích được tạo từ mô tả — thêm, thay thế hoặc đổi màu) và Xóa (hộp nguồn đến đích rỗng). Nhiều thao tác có thể nằm trong một yêu cầu.

Sự bảo lưu này rất quan trọng. Tài liệu của BFL nói rằng các pixel bên ngoài vùng chỉnh sửa “thường vẫn giữ nguyên”. Thường. Đó là một tuyên bố về việc bảo toàn, với một sự rào đón nằm ngay trong cách diễn đạt, vốn là cách trung thực để đưa ra một tuyên bố như vậy, và cũng là lý do bạn nên kiểm thử trên khung hình của chính mình thay vì tin vào một bản demo.

Bernini không có ngôn ngữ tọa độ dành cho người dùng tương đương. Khả năng chỉnh sửa theo tham chiếu của nó được cải thiện trong v2 nhờ một thay đổi trong huấn luyện — mô-đun kết nối được làm nóng trong hàng nghìn bước trước khi quá trình đồng huấn luyện bắt đầu — và ByteDance báo cáo rằng thay đổi đó thể hiện ở khả năng chỉnh sửa theo tham chiếu và hiệu năng OpenS2V tốt hơn. Đó là một bản sửa lỗi chất lượng bên trong kiến trúc hiện có, không phải một giao diện điều khiển mới. Nếu quy trình làm việc của bạn phụ thuộc vào việc cho mô hình biết hình chữ nhật nào cần giữ nguyên, thì chỉ một trong hai câu trả lời này mới giải quyết được vấn đề.

Screenshot of Black Forest Labs' FLUX 3 Image model page, headed 'Maximum control over every pixel', showing the bounding-box and region-editing feature list for the October 1, 2026 image release

Những gì các con số ủng hộ và không ủng hộ

Trang của Bernini-Diffusers-v2 có một bảng gồm bảy chỉ số so sánh v2 với v1, và mọi con số trên đó đều do nhà cung cấp báo cáo. Xu hướng thì trái chiều, điều này đáng để nói thẳng ra:

• Tăng — OpenS2V 63.83 (từ 62.30), VBench 84.46 (từ 84.37), Bernini-rv2v 3.55 (từ 3.48).

• Không đổi — EditVerse 8.02, không thay đổi, và Bernini-v2v 3.49, không thay đổi.

• Giảm — OpenVE 3.96, từ 4.03.

Trang này cũng tuyên bố rằng v2 nằm trong nhóm hạng nhất trong số các mô hình thương mại nguồn đóng hàng đầu trong một đấu trường so sánh cặp do con người đánh giá mù nội bộ. Điều đó không thể kiểm chứng được từ bên ngoài ByteDance và nên được hiểu là một tuyên bố tiếp thị, chứ không phải một phép đo. Ba thay đổi thực sự là những thay đổi được liệt kê ở trên, và chúng do chính cùng phòng thí nghiệm tự báo cáo so với v1 của chính họ.

FLUX 3 Image hiện vẫn hoàn toàn chưa có số liệu nào. Bảng text-to-image của Artificial Analysis và bảng chỉnh sửa của nó đều đã được kiểm tra vào ngày 1 tháng 10 và 2026-10-02, và không có dòng FLUX 3 Image nào — các mục BFL trên những bảng đó dừng ở dòng FLUX.2, nơi FLUX.2 [max] đạt 1021 Elo trên bảng tạo ảnh và 996 trên bảng chỉnh sửa. FLUX.2 [dev] neo cả hai bảng ở đúng 1000. Vậy nên, phát biểu trung thực về chất lượng của FLUX 3 Image ở thời điểm hiện tại là không ai ngoài Black Forest Labs đã công bố điểm cho nó, và điểm tham chiếu gần nhất hiện có là thế hệ trước nó.

Sự bất đối xứng đó chính là cái bẫy thực tế trong phép so sánh này. Các con số của Bernini do nhà cung cấp tự chạy nhưng chúng tồn tại và mang tính định hướng. Còn của FLUX 3 Image thì không có. Sự vắng mặt không phải là thất bại — mô hình mới chỉ một ngày tuổi — nhưng nó có nghĩa là bằng chứng duy nhất cho tuyên bố về khả năng chỉnh sửa của FLUX 3 Image hiện chỉ đến từ công ty đang bán nó.

Về phía giá cả, vốn hoàn toàn không đối xứng

FLUX 3 Image được tính giá theo từng ảnh dựa trên bậc độ phân giải, và bảng giá của nhà cung cấp liệt kê năm bậc:

• 768sq — giá niêm yết $0.041, còn $0.0205 trong thời gian ra mắt.

• 1K (mặc định) — giá niêm yết $0.048, giá ưu đãi $0.024.

• 1.5K — giá niêm yết $0.07, giá ưu đãi $0.035.

• 2K — giá niêm yết $0.10, giá ưu đãi $0.05.

• 4K — giá niêm yết $0.607, giá ưu đãi $0.3035.

Screenshot of Black Forest Labs' pricing page captured October 2, 2026, showing the FLUX 3 Image tab and its per-image rates by resolution tier, from 768sq through 4K

Hình ảnh tham chiếu và độ dài prompt được bao gồm mà không tính thêm phí, còn các yêu cầu bị từ chối, thất bại hoặc bị kiểm duyệt thì không bị tính phí — điều này ở đây quan trọng hơn bình thường, vì một lệnh gọi 4K diễn ra chậm và cám dỗ muốn bỏ dở một yêu cầu là có thật. Giá ra mắt có hiệu lực từ 15:00 UTC ngày 1 tháng 10 đến 15:00 UTC ngày 8 tháng 10. Giá niêm yết từ 2K lên 4K tăng gấp 6,07 lần, cao hơn nhiều so với tỷ lệ số điểm ảnh, nên bậc độ phân giải bạn chọn là quyết định chi phí chính trong toàn bộ API.

Các bậc phân loại theo dõi ngân sách pixel thay vì một khung cố định. Đầu ra ví dụ của BFL là 5456 × 3072, tức khoảng 16,8 megapixel, so với UHD 2160p ở mức 8,3 megapixel — vậy nên "4K" ở đây là tên gọi của một ngân sách, và kích thước đầu ra được làm tròn đến bội số của 16, với con số thực tế được trả về dưới dạng output_mp.

Giá của Bernini là 0 mỗi ảnh và khác 0 mỗi giờ. Tám GPU cho suy luận song song theo chuỗi, khuyến nghị dùng silicon lớp Hopper, Python 3.11.2 với PyTorch 2.7.1 và CUDA 12.6. Điểm hòa vốn so với 0,048 đô la một ảnh ở 1K rơi vào đâu đó trong khoảng vài nghìn ảnh mỗi tháng, phụ thuộc hoàn toàn vào mức bạn trả cho compute — và đó là một con số thật, không phải con số tu từ. Nếu bạn đã vận hành hạ tầng suy luận, chi phí biên cho mỗi ảnh của Bernini gần như bằng không. Nếu bạn chưa có, endpoint FLUX 3 Image rẻ hơn đáng kể so với việc dựng lên một ngăn xếp khuếch tán hai giai đoạn.

Định tuyến: cả hai đều không có trong danh mục của chúng tôi

Đáng nói thẳng, vì đây là kiểu tuyên bố nhanh chóng trở nên lỗi thời. OrcaRouter không định tuyến FLUX 3 Image và cũng không định tuyến Bernini-Diffusers-v2. Gọi FLUX 3 Image nghĩa là gọi trực tiếp Black Forest Labs tại endpoint của họ. Gọi Bernini nghĩa là bạn phải tự triển khai nó.

Điều mà một router tương thích OpenAI thực sự dùng để làm, trong một pipeline như thế này, là mọi thứ ở hai bên của lệnh gọi tạo ảnh. Một bước tạo chú thích hoặc viết lại prompt, một mô hình thị giác kiểm tra bản render so với yêu cầu, một mô hình video tạo chuyển động cho ảnh tĩnh đã được duyệt, một mô hình văn bản nhỏ phân loại đầu ra — đó là những bước mà việc có thể đổi nhà cung cấp chỉ bằng một chuỗi ký tự, trên một khóa API, và tự động chuyển sang phương án dự phòng khi một nhà cung cấp gặp sự cố, giúp cắt bỏ một khối lượng bảo trì đáng kể. OrcaRouter chuyển tiếp đúng giá niêm yết của nhà cung cấp mà không thêm phụ phí, nên khi một nhà cung cấp cắt giảm mức giá, thay đổi đó có hiệu lực ngay trong cùng ngày thay vì phải chờ một đại lý bán lại định giá lại, và DSL định tuyến cho phép bạn ghim một mô hình cụ thể hoặc định nghĩa thứ tự dự phòng mà không cần chạm vào mã ứng dụng. Không điều nào trong số đó khiến FLUX 3 Image trở nên có thể định tuyến. Nó chỉ có nghĩa là phần còn lại của pipeline không cần bận tâm mô hình nào đã tạo ra bức ảnh tĩnh đó.

Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board

Xây dựng dựa trên cái nào

Ba câu hỏi phân tách rạch ròi những điều này, và chúng không có câu trả lời chung.

Bạn có cần kiểm soát vị trí của mọi thứ không? FLUX 3 Image là công cụ duy nhất trong hai công cụ sở hữu ngôn ngữ tọa độ, và các thao tác chỉnh sửa theo phạm vi hộp của nó — giữ, di chuyển, thêm, xóa — là một giao diện thực sự khác biệt so với việc chỉnh sửa bằng lệnh văn bản. Nếu công việc của bạn là ghép ảnh, dàn trang hay hình ảnh sản phẩm, nơi các vùng phải được giữ nguyên, thì đó là yếu tố mang tính quyết định, và sự dè dặt trong cụm "thường giữ nguyên không đổi" là điều bạn cần kiểm chứng chứ không nên mặc định tin theo.

Bạn có cần biết nó tốt đến mức nào trước khi cam kết không? Bernini có số liệu, tất cả đều do nhà cung cấp báo cáo, và hướng đi thì trái chiều. FLUX 3 Image không có gì. Nếu bạn không thể tự đánh giá, bạn đang chọn giữa một mô hình đã được đo lường và một mô hình chưa được đo lường, và mô hình đã được đo lường lại là kiến trúc cũ hơn.

Bạn có thể vận hành một ngăn xếp khuếch tán hai giai đoạn không? Đó mới là rào cản thực sự trên Bernini. Một bộ lập kế hoạch Qwen2.5-VL-7B cấp dữ liệu cho bộ giải mã Wan2.2-T2V-A14B, trên các GPU Hopper, với hook tăng cường prompt trỏ tới endpoint tương thích OpenAI. Giấy phép thì thoáng, còn hóa đơn tính toán thì không. Nếu bạn không làm được, câu hỏi trở nên vô nghĩa và $0,048 cho mỗi ảnh là câu trả lời.

Điều duy nhất có thể khiến trang này thay đổi nhanh nhất là việc BFL mở trọng số FLUX 3 Image, điều mà công ty cho biết chỉ còn vài tuần nữa. Điều đó biến sự bất đối xứng về giấy phép từ mang tính quyết định thành chỉ còn nhẹ, và để khác biệt về bề mặt điều khiển trở thành phép so sánh thực sự. Cho đến lúc đó, tóm tắt chính xác là đây là hai mô hình tốt với mô hình phân phối trái ngược nhau, và lựa chọn được đưa ra dựa trên giấy phép và khả năng kiểm soát rất lâu trước khi được đưa ra dựa trên chất lượng.