Thẻ tiêu đề hero cho Ideogram 4.5 vs GPT Image 2.5, với nội dung 'cách nhau 97 Elo về khả năng chỉnh sửa — và nhà cung cấp đã gọi tên đối thủ', cùng các chip cho 'Ideogram 4.5 — ra mắt ngày 30 tháng 9, 2026', 'GPT Image 2.5 Sunburst — ra mắt ngày 8 tháng 9, 2026', 'Elo chỉnh sửa của Ideogram 4.5 1.064', 'Elo chỉnh sửa của Sunburst 1.182'. Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

Ideogram 4.5 vs GPT Image 2.5: Ideogram tự khơi mào cuộc đối đầu này

Tác giả

Alistair Wren

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hầu hết các so sánh mô hình đều do chính người viết chúng tập hợp lại. Bản so sánh này được tập hợp bởi Ideogram. Trang ra mắt của Ideogram 4.5, hoạt động từ ngày 30 tháng 9 năm 2026, chạy một bản demo chỉnh sửa đặt cạnh nhau và nêu tên các đối thủ trong chú thích: "những chỉnh sửa tương tự trên Ideogram 4.5 so với GPT Image 2.5 Sunburst, Nano Banana Pro và Nano Banana 2." Sau đó, nó đưa ra một tuyên bố về những gì người xem sẽ thấy — "đầu ra của GPT Image và Nano Banana trở nên không dùng được chỉ sau vài lần chỉnh sửa, trong khi Ideogram 4.5 vẫn sạch qua từng lần chỉnh sửa."

Điều đó thẳng thắn một cách bất thường. Việc một nhà cung cấp chọn mục tiêu đánh giá và nói trước kết quả cho bạn là điều đáng để coi trọng ở một khía cạnh và hoài nghi ở khía cạnh khác. GPT Image 2.5 là thứ mạnh nhất trên các bảng độc lập ở cả hai hạng mục hình ảnh, nên đó là đối thủ đúng đắn để chọn. Và đây là bản phát hành hai định danh — Flare và Sunburst, cả hai đều ra mắt ngày 8 tháng 9 năm 2026 — với điểm số đấu trường công khai mà Ideogram 4.5 hiện chưa đạt được. Câu hỏi thú vị không phải là ai thắng đấu trường. Mà là liệu tuyên bố của Ideogram có đang đo lường một thứ gì đó mà đấu trường không đo được hay không.

Cả hai mô hình đang ở đâu, chính xác

• Ideogram 4.5 — ra mắt ngày 30 tháng 9 năm 2026. Mô hình chỉnh sửa chính xác; tạo và chỉnh sửa ở bốn tốc độ kết xuất; độ phân giải gốc 2K; các chỉnh sửa được minh họa ở độ phân giải gốc lên tới 4.016 × 6.016 (24,2 MP). Tạo hình ảnh từ văn bản xếp thứ 34/167 với 1.014 ± 11 Elo (2.247 phiếu); chỉnh sửa hình ảnh xếp thứ 23 với 1.064 ± 11 Elo (2.382 phiếu). $0,03–$0,22 mỗi hình ảnh tùy theo cài đặt tốc độ.

• GPT Image 2.5 Sunburst — ra mắt ngày 8 tháng 9 năm 2026 với vai trò là nửa ưu tiên độ chính xác trong bản nâng cấp hình ảnh chia tách của OpenAI, mã định danh API gpt-image-2.5-sunburst. Tạo ảnh từ văn bản Số 1 với 1.197 ± 9 Elo (14.023 phiếu); chỉnh sửa ảnh Số 1 với 1.182 ± 8 Elo (17.899 phiếu). Giá $210,70 cho mỗi 1.000 hình ảnh theo quy đổi của bảng xếp hạng.

• GPT Image 2. Flare — nửa nhanh của cùng bản phát hành, mã định danh gpt-image-2.5-flare. Đứng thứ 2 trên cả hai bảng xếp hạng: 1.190 điểm tạo ảnh từ văn bản, 1.162 điểm chỉnh sửa ảnh. Vẫn mức 210,70 USD cho mỗi 1.000.

Đặt hai con số chỉnh sửa cạnh nhau và khoảng cách là 118 Elo — 1,182 so với 1,064 — với khoảng tin cậy ±8 và ±11. Các khoảng này không chồng lấn. Trên bảng đo lường sở thích chỉnh sửa một lần, Sunburst thắng, và thắng với số phiếu bầu đứng sau nhiều gấp khoảng bảy lần rưỡi.

Bảng xếp hạng đang đo lường điều gì và không đo lường điều gì

Đây là phần quyết định liệu tuyên bố của Ideogram có đứng vững khi đối mặt với bằng chứng hay không.

Đấu trường chỉnh sửa của Artificial Analysis là kiểu đánh giá ưu tiên theo cặp của con người một cách mù: người bình chọn nhìn thấy cùng một ảnh nguồn và cùng một hướng dẫn, nhận được hai kết quả chỉnh sửa không có nhãn, rồi chọn kết quả tốt hơn. Đây là một phương pháp mạnh để trả lời câu hỏi "trong hai đầu ra này, cái nào trông giống với điều mà hướng dẫn yêu cầu hơn."

Nó không thể đo được thứ mà Ideogram đang quảng cáo. Một người bình chọn đánh giá một chỉnh sửa không thể thấy liệu mô hình có âm thầm thay đổi hình nền, dịch chuyển khuôn mặt đi hai milimét, hay kết xuất lại hạt nhiễu trên phần còn lại của khung hình hay không. Lỗi mà Ideogram tuyên bố đang sửa chỉ trở nên hữu hình qua một chuỗi — lượt bốn, lượt bảy, lượt mười — và không có đấu trường chính thống nào trình bày chuỗi cho người bình chọn. Một mức 1.064 Elo nói rằng các chỉnh sửa riêng lẻ của Ideogram là tốt. Nó không nói gì cả về việc liệu chúng có tiếp tục tốt hay không.

Điều đó có thể gây bất lợi cho cả đôi bên đối với Ideogram, và phiên bản trung thực là thế này: bảng xếp hạng không xác nhận tuyên bố về drift, và nó cũng không bác bỏ tuyên bố đó. Điều nó thực sự bác bỏ là tuyên bố mạnh hơn, ẩn ý mà người đọc có thể rút ra từ trang ra mắt — rằng 4.5 là trình chỉnh sửa tốt hơn, dứt khoát như vậy. Đối chiếu với bảng xếp hạng, nó là trình chỉnh sửa có thứ hạng thấp hơn với mức chênh lệch lớn hơn cả biên độ sai số của nó.

Screenshot of the Ideogram 4.5 model page showing the model-comparison section headed 'Compare models across multi-turn edits', with a side-by-side video widget captioned to show the same edits applied to Ideogram 4.5 alongside GPT Image 2.5 Sunburst, Nano Banana Pro and Nano Banana 2

Mỗi cái làm được gì mà cái kia không làm được

• Chỉnh sửa ở độ phân giải gốc — tuyên bố kỹ thuật tạo nên sự khác biệt của Ideogram 4.5. Trang của họ cho thấy một chỉnh sửa được áp dụng lên ảnh nguồn 4,016 × 6,016 mà không hạ mẫu, kèm theo lời hứa rằng ranh giới chỉnh sửa được giữ nguyên đủ tốt để ghép phần cắt trở lại ảnh gốc. Với công việc in ấn, đó là sự khác biệt giữa một sản phẩm bàn giao hoàn chỉnh và một sự thỏa hiệp.

• Độ rộng của bề mặt tham số — của GPT Image 2.5. OpenAI đã thêm xhigh và max vào thang chất lượng và biến nền trong suốt thành một tham số hạng nhất, với background được đặt thành transparent, opaque hoặc auto cùng đầu ra PNG hoặc WebP. Đầu ra trong suốt từng là một khoảng trống trên GPT Image 2 và đã trở thành một tính năng chủ đạo trên cặp 2.5.

• Làn tốc độ — Flare ra đời với mục đích cụ thể là lựa chọn mặc định nhanh. OpenAI tuyên bố độ trễ thấp hơn tới 50% so với thế hệ trước; Sunburst cố tình chậm hơn và hướng tới những chỉnh sửa buộc phải chịu được sự soi xét kỹ lưỡng.

• Cấu trúc giá — Ideogram tính phí theo từng hình dựa trên tốc độ dựng hình ($0.03 đến $0.22). OpenAI tính phí theo token trên cùng bảng giá như GPT Image 2 — $8 mỗi triệu token đầu vào hình ảnh, $30 mỗi triệu token đầu ra hình ảnh — đó là lý do việc quy đổi độc lập theo từng hình rơi vào khoảng $0.21 cho một hình 1024 × 1024 chất lượng cao.

Các đường giá giao nhau ở một chỗ khó xử. Ở các thiết lập Low và Medium của Ideogram 4.5, giá mỗi ảnh rẻ hơn đáng kể so với cặp OpenAI. Ở High — nơi phần minh họa drift nằm, và cũng là nơi bạn sẽ chạy một nguồn 24 megapixel — hai bên gần như cùng một con số. Phép so sánh mà hầu hết người mua thực sự sẽ chạy là Ideogram 4.5 chất lượng High đối đầu với Sunburst chất lượng cao, và trong phép so sánh đó, giá gần như hòa nhau, còn trên bảng đo lường thì kém 118 Elo.

Điều đó thì ổn, nếu tuyên bố về sự trôi dạt là thật. Đó chính là toàn bộ canh bạc.

Screenshot of OrcaRouter's public model catalogue listing 206 models from 16 providers behind one API key, with the model cards and the three-step 'How to call any model' panel showing the OpenAI-compatible endpoint.Comparison scoreboard for Ideogram 4.5 and GPT Image 2.5 Sunburst. Left column 'Ideogram 4.5': live Sep 30 2026, editing rank 23 at 1,064 Elo from 2,382 votes, text-to-image rank 34 at 1,014 Elo, $0.03 to $0.22 per image, max edit resolution 4,016 by 6,016 pixels, open weights planned. Right column 'GPT Image 2.5 Sunburst': live Sep 8 2026, editing rank 1 at 1,182 Elo from 17,899 votes, text-to-image rank 1 at 1,197 Elo, $210.70 per 1,000 images, transparent background output, quality ladder through max. A footer reads 'All leaderboard figures per Artificial Analysis, October 2026; price conversions are the board's own.'

Sự khác biệt về khả năng tiếp cận mà không ai quảng bá

Một điểm bất đối xứng thực tế lại đi theo hướng ngược lại so với bảng điểm. Hai mã định danh của GPT Image 2.5 mới hơn mọi thứ trong danh mục của OrcaRouter — dòng sản phẩm hình ảnh OpenAI của chúng tôi hiện nay là GPT-Image-1.5 ở mức $8/$32 mỗi triệu token và GPT-Image-2 ở mức $8/$30, cả hai đều theo giá niêm yết của nhà cung cấp, không có phụ phí được cộng thêm. Cặp 2.5 xuất hiện trên bảng giá của OpenAI với đúng mức $8/$30 như GPT-Image-2, nghĩa là ngay khi chúng có thể được định tuyến, chúng sẽ rơi vào đúng mức giá chuyển tiếp đó chứ không phải một mức giá mới, và câu hỏi về chi phí giữa chúng trở thành vấn đề hiệu quả token chứ không phải chuyện bạn gọi nhà cung cấp nào.

Ideogram 4.5 có trên API riêng của Ideogram và trên các nền tảng đối tác. Nó không có trong danh mục của chúng tôi. Điều đó ảnh hưởng đến việc so sánh theo một cách khá nhàm chán: một trong hai mô hình này có thể thay thế trực tiếp cho một client tương thích OpenAI, còn mô hình kia là một tích hợp mới. Nếu bạn đang gọi GPT-Image-2 qua một endpoint kiểu OpenAI, chi phí để thử Sunburst chỉ là đổi ID mô hình; còn chi phí để thử Ideogram 4.5 là thêm một hợp đồng và thêm một client, trước cả khi bạn bắt tay vào đánh giá chất lượng.

Một lớp định tuyến không xóa bỏ sự khác biệt đó — nó chỉ gỡ bỏ phần kết nối cồng kềnh khỏi phía vốn đã tương thích, và cho phép bạn đặt một phần lưu lượng lên một nhân tố mới gia nhập mà không phải cam kết một đường chạy production cho nó. Khả năng chuyển đổi dự phòng ở đây quan trọng hơn mức thông thường, bởi vì thứ bạn đang thử nghiệm là một mô hình mà tuyên bố cốt lõi không hề có sự kiểm chứng độc lập và có kích thước mẫu chỉ bằng một phần năm so với đối thủ của nó.

Làm thế nào để giải quyết điều đó

Đừng chạy so sánh này trên từng ảnh đơn lẻ. Đó là phương pháp của arena và là công cụ sai lầm — nó sẽ cho bạn biết Sunburst thắng, điều mà bạn đã biết rồi.

Hãy chạy nó trên các chuỗi. Lấy năm hoặc mười hình ảnh từ chính công việc của bạn, viết cùng một chuỗi gồm sáu hoặc tám chỉnh sửa lũy tiến, rồi thực hiện chuỗi y hệt trên Ideogram 4.5 (High) và trên Sunburst (max). Sau đó, so sánh khác biệt giữa lượt một và lượt tám đối với từng mô hình, trên những vùng mà bạn chưa từng yêu cầu mô hình chạm tới. Đếm số pixel đã thay đổi. Con số đó — độ phân kỳ trên vùng không đổi xuyên suốt một chuỗi — chính là thứ mà Ideogram đang tuyên bố sẽ thắng, và theo hiểu biết của tôi, không ai công bố nó cho mô hình nào trong hai mô hình cả.

Sau đó, hãy định giá cả hai lần chạy theo từng chuỗi hoàn chỉnh. Đến lúc đó, bạn sẽ có một câu trả lời đáng giá hơn 118 Elo, vì nó sẽ nói về hình ảnh của bạn chứ không phải của một hội đồng bình chọn.

Cuộc đối đầu này thực sự là gì

Ideogram 4.5 đã không tham gia một cuộc thi mà nó thắng trên các bảng xếp hạng, và có vẻ như nó biết điều đó — đó là lý do trang ra mắt minh họa một hành vi thay vì in ra một thứ hạng. Hành vi mà nó minh họa đủ thật để đáng đem ra kiểm nghiệm và đủ cụ thể để có thể bị phản bác: hoặc là các chỉnh sửa lặp lại vẫn nhất quán với nhau, hoặc là không, và một bài kiểm tra mười lượt trên chính tệp của bạn sẽ giải quyết được điều đó trong một buổi chiều.

Cách diễn giải hợp lý hiện nay là GPT Image 2.5 Sunburst là trình chỉnh sửa tốt hơn theo thước đo độc lập duy nhất hiện có, với khoảng cách nằm ngoài biên sai số, cùng lượng bằng chứng hậu thuẫn con số đó nhiều hơn hẳn — và rằng Ideogram 4.5 đang bán một thuộc tính hẹp hơn, chưa được đo lường, ở mức giá rẻ hơn khi thiết lập thấp và gần như tương đương ở thiết lập mà tuyên bố của nó phụ thuộc vào. Nếu độ trung thực qua nhiều lượt là nút thắt trong sản xuất của bạn, bài kiểm tra rất rẻ và mô hình xứng đáng được thử. Nếu không, bảng xếp hạng đã trả lời rồi.