
Ideogram 4.5 vs GPT Image 2.5: Ideogram tự khơi mào cuộc đối đầu này
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 261 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 216 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- xAISpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Hầu hết các so sánh mô hình đều do chính người viết chúng tập hợp lại. Bản so sánh này được tập hợp bởi Ideogram. Trang ra mắt của Ideogram 4.5, hoạt động từ ngày 30 tháng 9 năm 2026, chạy một bản demo chỉnh sửa đặt cạnh nhau và nêu tên các đối thủ trong chú thích: "những chỉnh sửa tương tự trên Ideogram 4.5 so với GPT Image 2.5 Sunburst, Nano Banana Pro và Nano Banana 2." Sau đó, nó đưa ra một tuyên bố về những gì người xem sẽ thấy — "đầu ra của GPT Image và Nano Banana trở nên không dùng được chỉ sau vài lần chỉnh sửa, trong khi Ideogram 4.5 vẫn sạch qua từng lần chỉnh sửa."
Điều đó thẳng thắn một cách bất thường. Việc một nhà cung cấp chọn mục tiêu đánh giá và nói trước kết quả cho bạn là điều đáng để coi trọng ở một khía cạnh và hoài nghi ở khía cạnh khác. GPT Image 2.5 là thứ mạnh nhất trên các bảng độc lập ở cả hai hạng mục hình ảnh, nên đó là đối thủ đúng đắn để chọn. Và đây là bản phát hành hai định danh — Flare và Sunburst, cả hai đều ra mắt ngày 8 tháng 9 năm 2026 — với điểm số đấu trường công khai mà Ideogram 4.5 hiện chưa đạt được. Câu hỏi thú vị không phải là ai thắng đấu trường. Mà là liệu tuyên bố của Ideogram có đang đo lường một thứ gì đó mà đấu trường không đo được hay không.
Cả hai mô hình đang ở đâu, chính xác
• Ideogram 4.5 — ra mắt ngày 30 tháng 9 năm 2026. Mô hình chỉnh sửa chính xác; tạo và chỉnh sửa ở bốn tốc độ kết xuất; độ phân giải gốc 2K; các chỉnh sửa được minh họa ở độ phân giải gốc lên tới 4.016 × 6.016 (24,2 MP). Tạo hình ảnh từ văn bản xếp thứ 34/167 với 1.014 ± 11 Elo (2.247 phiếu); chỉnh sửa hình ảnh xếp thứ 23 với 1.064 ± 11 Elo (2.382 phiếu). $0,03–$0,22 mỗi hình ảnh tùy theo cài đặt tốc độ.
• GPT Image 2.5 Sunburst — ra mắt ngày 8 tháng 9 năm 2026 với vai trò là nửa ưu tiên độ chính xác trong bản nâng cấp hình ảnh chia tách của OpenAI, mã định danh API gpt-image-2.5-sunburst. Tạo ảnh từ văn bản Số 1 với 1.197 ± 9 Elo (14.023 phiếu); chỉnh sửa ảnh Số 1 với 1.182 ± 8 Elo (17.899 phiếu). Giá $210,70 cho mỗi 1.000 hình ảnh theo quy đổi của bảng xếp hạng.
• GPT Image 2. Flare — nửa nhanh của cùng bản phát hành, mã định danh gpt-image-2.5-flare. Đứng thứ 2 trên cả hai bảng xếp hạng: 1.190 điểm tạo ảnh từ văn bản, 1.162 điểm chỉnh sửa ảnh. Vẫn mức 210,70 USD cho mỗi 1.000.
Đặt hai con số chỉnh sửa cạnh nhau và khoảng cách là 118 Elo — 1,182 so với 1,064 — với khoảng tin cậy ±8 và ±11. Các khoảng này không chồng lấn. Trên bảng đo lường sở thích chỉnh sửa một lần, Sunburst thắng, và thắng với số phiếu bầu đứng sau nhiều gấp khoảng bảy lần rưỡi.
Bảng xếp hạng đang đo lường điều gì và không đo lường điều gì
Đây là phần quyết định liệu tuyên bố của Ideogram có đứng vững khi đối mặt với bằng chứng hay không.
Đấu trường chỉnh sửa của Artificial Analysis là kiểu đánh giá ưu tiên theo cặp của con người một cách mù: người bình chọn nhìn thấy cùng một ảnh nguồn và cùng một hướng dẫn, nhận được hai kết quả chỉnh sửa không có nhãn, rồi chọn kết quả tốt hơn. Đây là một phương pháp mạnh để trả lời câu hỏi "trong hai đầu ra này, cái nào trông giống với điều mà hướng dẫn yêu cầu hơn."
Nó không thể đo được thứ mà Ideogram đang quảng cáo. Một người bình chọn đánh giá một chỉnh sửa không thể thấy liệu mô hình có âm thầm thay đổi hình nền, dịch chuyển khuôn mặt đi hai milimét, hay kết xuất lại hạt nhiễu trên phần còn lại của khung hình hay không. Lỗi mà Ideogram tuyên bố đang sửa chỉ trở nên hữu hình qua một chuỗi — lượt bốn, lượt bảy, lượt mười — và không có đấu trường chính thống nào trình bày chuỗi cho người bình chọn. Một mức 1.064 Elo nói rằng các chỉnh sửa riêng lẻ của Ideogram là tốt. Nó không nói gì cả về việc liệu chúng có tiếp tục tốt hay không.
Điều đó có thể gây bất lợi cho cả đôi bên đối với Ideogram, và phiên bản trung thực là thế này: bảng xếp hạng không xác nhận tuyên bố về drift, và nó cũng không bác bỏ tuyên bố đó. Điều nó thực sự bác bỏ là tuyên bố mạnh hơn, ẩn ý mà người đọc có thể rút ra từ trang ra mắt — rằng 4.5 là trình chỉnh sửa tốt hơn, dứt khoát như vậy. Đối chiếu với bảng xếp hạng, nó là trình chỉnh sửa có thứ hạng thấp hơn với mức chênh lệch lớn hơn cả biên độ sai số của nó.

Mỗi cái làm được gì mà cái kia không làm được
• Chỉnh sửa ở độ phân giải gốc — tuyên bố kỹ thuật tạo nên sự khác biệt của Ideogram 4.5. Trang của họ cho thấy một chỉnh sửa được áp dụng lên ảnh nguồn 4,016 × 6,016 mà không hạ mẫu, kèm theo lời hứa rằng ranh giới chỉnh sửa được giữ nguyên đủ tốt để ghép phần cắt trở lại ảnh gốc. Với công việc in ấn, đó là sự khác biệt giữa một sản phẩm bàn giao hoàn chỉnh và một sự thỏa hiệp.
• Độ rộng của bề mặt tham số — của GPT Image 2.5. OpenAI đã thêm xhigh và max vào thang chất lượng và biến nền trong suốt thành một tham số hạng nhất, với background được đặt thành transparent, opaque hoặc auto cùng đầu ra PNG hoặc WebP. Đầu ra trong suốt từng là một khoảng trống trên GPT Image 2 và đã trở thành một tính năng chủ đạo trên cặp 2.5.
• Làn tốc độ — Flare ra đời với mục đích cụ thể là lựa chọn mặc định nhanh. OpenAI tuyên bố độ trễ thấp hơn tới 50% so với thế hệ trước; Sunburst cố tình chậm hơn và hướng tới những chỉnh sửa buộc phải chịu được sự soi xét kỹ lưỡng.
• Cấu trúc giá — Ideogram tính phí theo từng hình dựa trên tốc độ dựng hình ($0.03 đến $0.22). OpenAI tính phí theo token trên cùng bảng giá như GPT Image 2 — $8 mỗi triệu token đầu vào hình ảnh, $30 mỗi triệu token đầu ra hình ảnh — đó là lý do việc quy đổi độc lập theo từng hình rơi vào khoảng $0.21 cho một hình 1024 × 1024 chất lượng cao.
Các đường giá giao nhau ở một chỗ khó xử. Ở các thiết lập Low và Medium của Ideogram 4.5, giá mỗi ảnh rẻ hơn đáng kể so với cặp OpenAI. Ở High — nơi phần minh họa drift nằm, và cũng là nơi bạn sẽ chạy một nguồn 24 megapixel — hai bên gần như cùng một con số. Phép so sánh mà hầu hết người mua thực sự sẽ chạy là Ideogram 4.5 chất lượng High đối đầu với Sunburst chất lượng cao, và trong phép so sánh đó, giá gần như hòa nhau, còn trên bảng đo lường thì kém 118 Elo.
Điều đó thì ổn, nếu tuyên bố về sự trôi dạt là thật. Đó chính là toàn bộ canh bạc.


Sự khác biệt về khả năng tiếp cận mà không ai quảng bá
Một điểm bất đối xứng thực tế lại đi theo hướng ngược lại so với bảng điểm. Hai mã định danh của GPT Image 2.5 mới hơn mọi thứ trong danh mục của OrcaRouter — dòng sản phẩm hình ảnh OpenAI của chúng tôi hiện nay là GPT-Image-1.5 ở mức $8/$32 mỗi triệu token và GPT-Image-2 ở mức $8/$30, cả hai đều theo giá niêm yết của nhà cung cấp, không có phụ phí được cộng thêm. Cặp 2.5 xuất hiện trên bảng giá của OpenAI với đúng mức $8/$30 như GPT-Image-2, nghĩa là ngay khi chúng có thể được định tuyến, chúng sẽ rơi vào đúng mức giá chuyển tiếp đó chứ không phải một mức giá mới, và câu hỏi về chi phí giữa chúng trở thành vấn đề hiệu quả token chứ không phải chuyện bạn gọi nhà cung cấp nào.
Ideogram 4.5 có trên API riêng của Ideogram và trên các nền tảng đối tác. Nó không có trong danh mục của chúng tôi. Điều đó ảnh hưởng đến việc so sánh theo một cách khá nhàm chán: một trong hai mô hình này có thể thay thế trực tiếp cho một client tương thích OpenAI, còn mô hình kia là một tích hợp mới. Nếu bạn đang gọi GPT-Image-2 qua một endpoint kiểu OpenAI, chi phí để thử Sunburst chỉ là đổi ID mô hình; còn chi phí để thử Ideogram 4.5 là thêm một hợp đồng và thêm một client, trước cả khi bạn bắt tay vào đánh giá chất lượng.
Một lớp định tuyến không xóa bỏ sự khác biệt đó — nó chỉ gỡ bỏ phần kết nối cồng kềnh khỏi phía vốn đã tương thích, và cho phép bạn đặt một phần lưu lượng lên một nhân tố mới gia nhập mà không phải cam kết một đường chạy production cho nó. Khả năng chuyển đổi dự phòng ở đây quan trọng hơn mức thông thường, bởi vì thứ bạn đang thử nghiệm là một mô hình mà tuyên bố cốt lõi không hề có sự kiểm chứng độc lập và có kích thước mẫu chỉ bằng một phần năm so với đối thủ của nó.
Làm thế nào để giải quyết điều đó
Đừng chạy so sánh này trên từng ảnh đơn lẻ. Đó là phương pháp của arena và là công cụ sai lầm — nó sẽ cho bạn biết Sunburst thắng, điều mà bạn đã biết rồi.
Hãy chạy nó trên các chuỗi. Lấy năm hoặc mười hình ảnh từ chính công việc của bạn, viết cùng một chuỗi gồm sáu hoặc tám chỉnh sửa lũy tiến, rồi thực hiện chuỗi y hệt trên Ideogram 4.5 (High) và trên Sunburst (max). Sau đó, so sánh khác biệt giữa lượt một và lượt tám đối với từng mô hình, trên những vùng mà bạn chưa từng yêu cầu mô hình chạm tới. Đếm số pixel đã thay đổi. Con số đó — độ phân kỳ trên vùng không đổi xuyên suốt một chuỗi — chính là thứ mà Ideogram đang tuyên bố sẽ thắng, và theo hiểu biết của tôi, không ai công bố nó cho mô hình nào trong hai mô hình cả.
Sau đó, hãy định giá cả hai lần chạy theo từng chuỗi hoàn chỉnh. Đến lúc đó, bạn sẽ có một câu trả lời đáng giá hơn 118 Elo, vì nó sẽ nói về hình ảnh của bạn chứ không phải của một hội đồng bình chọn.
Cuộc đối đầu này thực sự là gì
Ideogram 4.5 đã không tham gia một cuộc thi mà nó thắng trên các bảng xếp hạng, và có vẻ như nó biết điều đó — đó là lý do trang ra mắt minh họa một hành vi thay vì in ra một thứ hạng. Hành vi mà nó minh họa đủ thật để đáng đem ra kiểm nghiệm và đủ cụ thể để có thể bị phản bác: hoặc là các chỉnh sửa lặp lại vẫn nhất quán với nhau, hoặc là không, và một bài kiểm tra mười lượt trên chính tệp của bạn sẽ giải quyết được điều đó trong một buổi chiều.
Cách diễn giải hợp lý hiện nay là GPT Image 2.5 Sunburst là trình chỉnh sửa tốt hơn theo thước đo độc lập duy nhất hiện có, với khoảng cách nằm ngoài biên sai số, cùng lượng bằng chứng hậu thuẫn con số đó nhiều hơn hẳn — và rằng Ideogram 4.5 đang bán một thuộc tính hẹp hơn, chưa được đo lường, ở mức giá rẻ hơn khi thiết lập thấp và gần như tương đương ở thiết lập mà tuyên bố của nó phụ thuộc vào. Nếu độ trung thực qua nhiều lượt là nút thắt trong sản xuất của bạn, bài kiểm tra rất rẻ và mô hình xứng đáng được thử. Nếu không, bảng xếp hạng đã trả lời rồi.
