
GPT-Image-2.5 vs LLaDA-Image: API 30$/triệu token so với mô hình khuếch tán 6B miễn phí
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0455Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0247Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0247Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0157Trí tuệ82Lập trình
- AlibabaMỚIQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiMỚIZ.ai: GLM 5.3 Flash2026-08-2646Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1849Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1541Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1242Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1251Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0547Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0347Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3141Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2454Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2140Trí tuệ69Lập trình
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2128Trí tuệ49Lập trình
Hãy hỏi rằng việc tạo hình ảnh nên có giá bao nhiêu, và hai phòng thí nghiệm đã đưa ra hai câu trả lời trái ngược nhau chỉ trong vòng một tuần. Vào ngày 8 tháng 9 năm 2026, OpenAI phát hành GPT-Image-2.5 — mô hình đứng sau ChatGPT Images 2.5, được bán qua API với tên gọi GPT-Image-2.5 Flare và GPT-Image-2.5 Sunburst — với bảng giá token là {{1}}$8 cho mỗi triệu token hình ảnh đầu vào{{/1}} và {{2}}$30 cho mỗi triệu token hình ảnh đầu ra{{/2}}. Năm ngày trước đó, vào ngày 4 tháng 9, inclusionAI (phòng thí nghiệm thuộc Ant Group, đơn vị đứng sau dòng ngôn ngữ LLaDA) đã âm thầm phát hành LLaDA-Image, một trình tạo và chỉnh sửa hình ảnh diffusion-transformer {{3}}sáu tỷ tham số{{/3}} có thể tải trọng số miễn phí. {{4}}Một bên là mô hình hình ảnh có sức mạnh thương mại lớn nhất mà OpenAI từng đặt sau đồng hồ token; bên còn lại là nỗ lực chứng minh rằng một mô hình hình ảnh mạnh mẽ có thể được xây dựng bằng quy trình huấn luyện mở và phát hành miễn phí.{{/4}} {{5}}So sánh chúng không phải là cuộc đối đầu trực diện mà là quyết định về việc bạn thực sự đang trả cho định nghĩa chi phí nào.{{/5}}
Gần như mọi con số từ phía GPT-Image-2.5 đều do nhà cung cấp tự báo cáo và chưa có con số nào được kiểm chứng độc lập: OpenAI cho biết Flare giảm độ trễ tới 50% so với GPT-Image-2 và rằng các bài kiểm tra bên thứ ba do công ty agent Manus thực hiện đo được tốc độ tạo ảnh nhanh hơn 2–4 lần, nhưng tính đến ngày 9 tháng 9 năm 2026, cả hai mẫu GPT-Image-2.5 đều chưa có mục nào trên bảng xếp hạng hình ảnh của Artificial Analysis. Con số nổi bật của LLaDA-Image cũng không được tái lập tương tự — inclusionAI báo cáo 53,53 tiếng Anh / 53,38 tiếng Trung trên Qwen-Image-Bench, đứng đầu trong số các mô hình trọng số mở tại thời điểm phát hành — và vì mô hình này không có API lưu trữ nên nó hoàn toàn không thể xuất hiện trên các bảng xếp hạng chỉ dành cho API. Cả hai phía của sự so sánh này đều đang dựa trên chính tuyên bố của nhà sản xuất, điều đáng để ghi nhớ xuyên suốt phần còn lại của bài viết này.
Hai mô hình gần như không cùng chung một danh mục
GPT-Image-2.5 là một mô hình hình ảnh đóng, được lưu trữ (hosted), cùng dòng với ChatGPT Images 2.0 từ tháng 4 năm 2026. Mô hình này đa phương thức ở phía đầu vào và tạo ra hình ảnh mà OpenAI tuyên bố là sắc nét hơn trong các chi tiết nhỏ, tự nhiên hơn về ánh sáng và kết cấu, và ổn định hơn qua các lần chỉnh sửa nhiều lượt — điểm cuối Sunburst tồn tại cụ thể cho công việc sản xuất thiên về chỉnh sửa, nơi tốc độ tạo chậm hơn được chấp nhận để đổi lấy khả năng kiểm soát chỉ dẫn chặt chẽ hơn, trong khi Flare là lựa chọn mặc định nhanh cho nhu cầu tạo khối lượng lớn. Đầu ra có kích thước lên đến 2048×2048 và 3840×2160, hỗ trợ nền trong suốt, và mọi đầu ra đều mang siêu dữ liệu nguồn gốc C2PA cùng hình mờ vô hình.
LLaDA-Image là một bản phát hành mở kiểu nghiên cứu dựa trên một lựa chọn hoàn toàn khác. Trong khi GPT-Image-2.5 được phục vụ bởi hạ tầng của OpenAI, LLaDA-Image là một bộ trọng số bạn tự chạy: một diffusion transformer (DiT) 6 tỷ tham số ở phía sinh — thẻ mô hình ghi nhận khoảng 7B tham số khi tính cả phía ngôn ngữ — kết hợp với LLaDA 2.0-mini, một mô hình ngôn ngữ diffusion mixture-of-experts với tổng 16B / 1B kích hoạt, làm phía "hiểu" để chuyển đổi các lời nhắc văn bản hoặc chỉ dẫn chỉnh sửa thành tín hiệu mà DiT tuân theo. Điểm bất thường trong báo cáo arXiv (2609.03796) là công thức huấn luyện: hơn 90% trong khoảng 220 triệu mẫu tiền huấn luyện và huấn luyện trung gian tích lũy chỉ là ảnh, với một mô hình thị giác-ngôn ngữ đóng băng trích xuất ngữ nghĩa từ các ảnh không nhãn làm tín hiệu tự điều kiện, để mô hình "học vẽ trước, rồi mới nghe lời." Độ phân giải tăng dần đưa quá trình huấn luyện từ 256×256 qua 512×512 lên đến tinh chỉnh 1024×1024, tiếp theo là huấn luyện hỗn hợp chuyển văn bản thành ảnh và chỉnh sửa, cùng với phương pháp chưng cất vài bước TwinFlow tạo ra biến thể LLaDA-Image-Turbo.
Điều mà mỗi loại thực sự làm tốt
Điểm mạnh của GPT-Image-2.5 là độ chính xác và khả năng kiểm soát ở chất lượng thương mại. Thông báo của OpenAI nhấn mạnh đến độ trung thực tham chiếu — giữ cho một người, thú cưng hoặc sản phẩm vẫn được nhận diện rõ khi bạn thay đổi bối cảnh hoặc phong cách — và tính năng chỉnh sửa chỉ thay đổi đúng những gì bạn yêu cầu, duy trì ổn định qua nhiều vòng chỉnh sửa trong cùng một cuộc hội thoại. Khả năng hiển thị chữ bên trong hình ảnh được nêu cụ thể, bao gồm việc loại bỏ lỗi ký tự tiếng Trung bị biến dạng từng gây khó khăn cho các mô hình tạo ảnh trước đó. Đó chính xác là những khả năng mà một nhóm sản phẩm, thương hiệu hoặc quảng cáo cần sử dụng lặp đi lặp lại.
Điểm nhấn của LLaDA-Image là một bộ trọng số duy nhất có khả năng sinh song ngữ và chỉnh sửa theo hướng dẫn với công thức mở. inclusionAI công bố khả năng kết xuất văn bản tiếng Trung và tiếng Anh tự nhiên, một luồng chỉnh sửa đưa ảnh tham chiếu vào qua thiết kế hai nhánh nhằm bảo toàn nội dung không bị biến đổi, và — trên Qwen-Image-Bench — đạt điểm số open-weights cao nhất tại thời điểm phát hành. Những lưu ý thẳng thắn từ bản phát hành là chất lượng chỉnh sửa theo cảm nhận vẫn thua kém các trình chỉnh sửa chuyên dụng và khả năng đếm vật thể vẫn còn yếu. Đây là một mô hình mở đa năng, không phải là một sản phẩm thương mại hoàn chỉnh.

Bảng xếp hạng cố tình không phải là một cuộc thi về chất lượng hình ảnh — hai mô hình chưa bao giờ được chấm bằng cùng một bài đánh giá. Điều nó cho thấy là nơi tiền bạc và quyền kiểm soát đang chảy về.
Cái giá của một bức ảnh là con số mà không bên nào sẽ tiết lộ cho bạn.
OpenAI công bố biểu giá token cho GPT-Image-2.5 giống hệt GPT-Image-2: 8 USD mỗi triệu token hình ảnh đầu vào, 30 USD mỗi triệu token hình ảnh đầu ra, token hình ảnh lưu trong bộ nhớ đệm ở mức 2 USD, và token văn bản được tính riêng ở mức 5 USD mỗi triệu. Điều họ không công bố là một hình ảnh cụ thể tiêu thụ bao nhiêu token, nghĩa là không có giá chính thức cho mỗi hình ảnh và không có máy tính chi phí. Với mức giá AA niêm yết cho phiên bản tiền nhiệm trên bảng xếp hạng của họ — khoảng 211 USD cho mỗi 1.000 hình ảnh đối với GPT Image 2 ở chất lượng "cao" — một sản phẩm chủ lực tính phí theo token là một công cụ đắt đỏ khi dùng ở quy mô lớn, nhưng con số đó là dành cho GPT-Image-2, không phải 2.5, và chi phí cho mỗi hình ảnh đối với mô hình mới thực sự không ai biết ngoài OpenAI.
LLaDA-Image lại gặp vấn đề minh bạch theo chiều ngược lại. Bộ trọng số không tốn phí và thẻ mô hình gắn nhãn Apache-2.0, nhưng cái giá thực sự nằm ở hạ tầng: diffusion transformer 6B cần một GPU mạnh cho biến thể Base 50 bước, và các checkpoint FP8 (khoảng 49 GB trong bố cục diffusers) là lựa chọn khả thi cho hầu hết người dùng. Quá trình chưng cất 2–4 bước của LLaDA-Image-Turbo chính là sự nhượng bộ trước thực tế đó. Công cụ cộng đồng đã tiến nhanh — một pull request của SGLang bổ sung hỗ trợ text-to-image, chỉnh sửa ảnh, sequence-parallel và FP8, còn gói nút ComfyUI của RebelAI hỗ trợ suy luận cục bộ với lượng tử hóa INT8 và GGUF — nhưng "mô hình miễn phí" vẫn đồng nghĩa với việc "bạn chính là nhà cung cấp hạ tầng." Với một đội ngũ đã vận hành sẵn năng lực GPU, chi phí biên của LLaDA-Image tiến gần về không; còn với mọi người khác, tổng chi phí trọn gói để phục vụ nó có thể vượt hóa đơn API tính theo mức sử dụng khi bạn tính cả thời gian kỹ thuật.
Con đường trung thực nếu bạn muốn cả hai.
Với hầu hết các đội ngũ, đây không phải là chuyện chỉ chọn một trong hai. Một quy trình sản xuất có thể sử dụng API lưu trữ như GPT-Image-2.5 cho công việc hướng tới khách hàng, đòi hỏi chỉnh sửa nhiều và không được phép thất bại, đồng thời giữ một mô hình mở như LLaDA-Image cho các thử nghiệm, các tác vụ hàng loạt ngoại tuyến và mọi thứ không thể gửi prompt đến bên thứ ba. Sự phân tách đó đúng là dạng bài toán mà một lớp định tuyến được tạo ra để giải quyết — một API duy nhất có thể kết nối tới các mô hình lưu trữ bạn thực sự dùng, giá niêm yết từ nhà cung cấp được chuyển thẳng không cộng thêm phí, nên thử một mô hình trọng số mở qua route lưu trữ sau này cũng có chi phí bằng với việc đến thẳng nhà cung cấp. Tính đến ngày 9 tháng 9 năm 2026, cả hai mô hình đều chưa nằm trong danh mục của OrcaRouter: GPT-Image-2.5 hiện chỉ có qua OpenAI API (thế hệ trước, GPT-Image-2, đã được định tuyến), còn LLaDA-Image chỉ có dạng trọng số, không có dịch vụ suy luận lưu trữ. Ý đồ thiết kế vẫn còn nguyên giá trị bất kể danh mục hiện tại ra sao.

Bạn nên xây dựng dựa trên cái nào?
Nếu công việc của bạn là tạo hình ảnh thương mại, nơi một lần chỉnh sửa thất bại có thể làm mất quan hệ khách hàng — {{1}}ảnh sản phẩm, sáng tạo chiến dịch, hình ảnh nhất quán theo tham chiếu, các phiên chỉnh sửa dài nhiều lượt{{/1}} — GPT-Image-2.5 là mô hình có toàn bộ thiết kế nhắm vào công việc đó, và endpoint Sunburst là lý do để chú ý ngay cả trước khi có các điểm số độc lập. Các rủi ro nằm ở {{2}}sự thiếu minh bạch về giá theo từng ảnh và thực tế rằng mọi tuyên bố chất lượng đều do chính OpenAI đưa ra{{/2}}. Nếu công việc của bạn là {{3}}nghiên cứu, thử nghiệm khối lượng lớn, tạo sinh song ngữ tiếng Trung và tiếng Anh, hoặc bất cứ điều gì phải chạy trong môi trường của riêng bạn hoặc trên dữ liệu của riêng bạn{{/3}}, LLaDA-Image là bản phát hành thú vị hơn — {{4}}trọng số thực sự mở với công thức đã được công bố, đổi lại là bạn phải tự lo cơ sở hạ tầng và chấp nhận những điểm số chưa được tái lập{{/4}}. Hai mô hình chỉ cách nhau một tuần về thời điểm phát hành nhưng khác xa một trời một vực về mô hình vận hành; lựa chọn đúng là mô hình nào khớp với cái giá mà bạn thực sự có thể trả.

