Thẻ tiêu đề hero cho Grok Imagine Image 2.0 hiển thị dòng chữ 'Grok Imagine Image 2.0 — #2 trên Arena text-to-image, chỉnh sửa chính xác, hiện đã có mặt trong các ứng dụng Grok' kèm dòng chú thích 'Được xAI công bố ngày 7 tháng 8 năm 2026' và biểu tượng chỉnh sửa khung ảnh phẳng có cây bút.
Guides & Insights

Grok Imagine Image 2.0: Đứng thứ 4 trên Artificial Analysis, với mức giá chỉ bằng một phần ba

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Grok Imagine Image 2.0 đã đạt vị trí #4 trên Text to Image Leaderboard của Artificial Analysis, và con số đáng quan tâm không phải là thứ hạng — mà là mức giá bên cạnh nó. Mô hình này đạt 1.153,66 Elo, xếp sau ba mục: GPT Image 2.5 Flare (max), GPT Image 2.5 Sunburst (max) và GPT Image 2 (high). Đứng trên mọi mô hình của các phòng thí nghiệm khác, bao gồm MAI-Image-2.6 của Microsoft và mô hình Nano Banana 2. Điều đó khiến mô hình trở thành trình tạo ảnh có thứ hạng cao nhất ngoài bộ ba đó, và là thứ rẻ nhất trong top bốn đó với khoảng cách lớn: Artificial Analysis định giá nó ở mức 60 USD cho 1.000 hình ảnh, so với khoảng 211 USD cho ba mục phía trên. Bản thân mô hình có từ ngày 7 tháng 8 năm 2026 — điều đã thay đổi là vị trí mà bảng độc lập đặt nó vào, và điều đó ảnh hưởng thế nào đến cách định vị “world #2” mà nhà sản xuất đã sử dụng khi ra mắt.

Vị trí #4 thực sự đo lường điều gì

Bảng xếp hạng Text to Image của Artificial Analysis là một đấu trường mù dựa trên sở thích của con người: người bình chọn xem các đầu ra từ cùng một prompt mà không có nhãn mô hình và chọn ra cái tốt hơn, còn điểm Elo thu được sẽ được công bố độc lập với bất kỳ nhà cung cấp nào. Mục của Grok Imagine Image 2.0 ghi #4 ở mức 1.153,66 Elo với khoảng tin cậy 95% là 1.141,66 đến 1.165,66. Không có phần nào của con số đó đến từ xAI. (Một chi tiết nhỏ đáng biết khi đọc bảng: Artificial Analysis liệt kê đơn vị tạo ra mô hình là SpaceXAI.)

Phần giá của câu chuyện là phần thú vị hơn. Cùng trang đó vẽ chất lượng so với giá bằng một đường Pareto đánh dấu các mô hình mang lại nhiều Elo nhất trên mỗi đô la, và theo chính các số liệu đã công bố của bảng xếp hạng, Grok Imagine Image 2.0 là mô hình có điểm cao nhất được định giá dưới 100 đô la cho mỗi 1.000 hình ảnh. Mô hình ngay trên nó về chất lượng, GPT Image 2 (high), có giá 211 đô la cho mỗi 1.000 hình ảnh — cao gấp khoảng ba lần rưỡi để đổi lấy thêm khoảng 17 Elo. Đó là một tuyên bố về hiệu năng trên giá, không phải tuyên bố rằng đây là mô hình tốt nhất, và đó là phiên bản của câu chuyện mà dữ liệu độc lập thực sự ủng hộ.

Vị thế tiên phong là có thật nhưng mong manh, và đáng để nói thẳng như vậy. MAI-Image-2.6 của Microsoft đứng ngay dưới một bậc ở mức 38,90 USD cho mỗi 1.000, còn Muse Image của Meta là 10 USD cho mỗi 1.000 ở 1.111 Elo. Khoảng Elo trên bảng này dao động khoảng ±12 điểm, nên #4 và #5 — cách nhau 6,5 Elo — nằm trong khoảng sai số của nhau. Hãy coi vị trí này là "top five", chứ không phải một vị trí đã an bài.

Việc vươn lên 14 bậc chính là khoảng cách tới phân hạng mà Grok Imagine Image 2.0 đã thay thế. Phân hạng chất lượng trước đây của xAI, grok-imagine-image-quality, đứng ở vị trí #18 trên cùng bảng xếp hạng với 1.043,21 Elo, còn grok-imagine-image nguyên bản đứng ở vị trí #29 với 1.017,86. Đó là khoảng chênh lệch khoảng 110 Elo và 14 bậc xếp hạng giữa mô hình mà xAI hiện ghi nhận là mặc định hình ảnh của mình và mô hình mà nó thay thế.

Tuyên bố "số 2 thế giới" hiện nay ra sao

Khi ra mắt, xAI đã dẫn vị trí thứ 2 trên cả hai bảng xếp hạng Arena về tạo ảnh từ văn bản và chỉnh sửa ảnh, với khoảng 1.320 Elo và được đánh dấu là Preliminary. Đó là những số liệu mà xAI nhấn mạnh trong thông báo của chính mình — không phải một đánh giá độc lập do họ đặt hàng — và chúng đã thay đổi kể từ đó: bản chụp ngày 10 tháng 8 đặt mô hình ở vị trí thứ 3 với 1.316 Elo, xếp sau MAI-Image-2.6 và GPT Image 2. Vị trí thứ 2 về chỉnh sửa ảnh vẫn là trích dẫn của chính xAI.

Artificial Analysis là một bảng xếp hạng khác với phương pháp khác và một nhóm người bình chọn khác, và hiện tại nó đặt mô hình ở vị trí #4. Hai bên thực sự không mâu thuẫn với nhau — chúng lấy mẫu sở thích của con người theo cách khác nhau, và cả hai đều là những ảnh chụp nhanh của các bảng xếp hạng thay đổi từng tuần. Tóm tắt trung thực về sáu tuần xếp hạng độc lập là Grok Imagine Image 2.0 luôn nằm trong top năm và chưa bao giờ đúng là vị trí #2 mà xAI công bố.

Grok Imagine Image 2.0 thực sự được phát hành với những gì

xAI định vị Grok Imagine Image 2.0 như một môi trường chỉnh sửa thay vì một trình tạo ảnh một lần nữa. Bộ tính năng:

Đũa thần — chỉnh sửa ở cấp độ vùng mà không ảnh hưởng đến phần còn lại của khung hình

Phân vùng — lựa chọn vùng chính xác để hiệu chỉnh màu, thay thế hoặc điều chỉnh

Xóa phông nền — xuất đối tượng với nền trong suốt

Đầu vào nhiều ảnh — tối đa năm ảnh nguồn cho mỗi lần chỉnh sửa; tài liệu của xAI hiện liệt kê năm, tăng từ ba ảnh mà API giới hạn khi ra mắt

Smart Resize — tái tạo một hình ảnh thành 9 tỷ lệ khung hình (từ dọc 1:2 đến ngang 2:1), tạo ra nội dung khung mới thay vì cắt xén

Mẫu — quy trình làm việc cài sẵn cho chụp ảnh sản phẩm, ảnh chân dung, danh sách thương mại điện tử, tài sản trò chơi và áp phích tiếp thị

API hiển thị các điều khiển mà ứng dụng dành cho người tiêu dùng không hiển thị: tỷ lệ khung hình — bao gồm 21:9 và 5:2, cả hai đều mới trong 2.0 — độ phân giải (mặc định là 1K, tùy chọn 2K), và một tham số chất lượng nhận các giá trị thấp, trung bình hoặc tự động. Về phía người tiêu dùng, mô hình này được cung cấp dưới dạng Quality Mode mặc định trên grok.com/imagine, iOS và Android, và kể từ ngày 13 tháng 8, nó cũng đã được liệt kê trên nền tảng của Runway, nơi nó tham gia cùng các mô hình hình ảnh và video mà Runway đã lưu trữ. Danh sách đó là tuyên bố từ nhà cung cấp và đối tác chứ không phải một đánh giá độc lập, nhưng đó là dấu hiệu đầu tiên về phân phối của bên thứ ba sau khi ra mắt.

Trong phần hiển thị văn bản tiêu đề, xAI cho biết mô hình "lên kế hoạch về kiểu chữ và bố cục theo cách một nhà thiết kế sẽ làm," giữ nguyên các bố cục phức tạp gồm nhiều phần dày đặc và hiển thị văn bản nhỏ một cách sắc nét. Mô hình cũng bảo toàn danh tính và cài đặt của đối tượng qua các lần chỉnh sửa lặp đi lặp lại nhiều lượt.

Những gì một bài kiểm tra độc lập đầu tiên phát hiện ra

Một so sánh sáu prompt, một seed, không chọn lọc kết quả với gpt-image-2 đã cho thấy sự phân hóa rõ rệt, và không có gì trong vị trí mới trên bảng xếp hạng có thể lật ngược điều đó.

Grok thắng: độ chân thực như ảnh chụp và khả năng giữ danh tính. Giải phẫu bàn tay trong ảnh chân dung chính xác, với chi tiết da đến từng lỗ chân lông, tán xạ dưới bề mặt, cùng điểm sáng tự nhiên trong mắt và ánh sáng viền. Trong bài kiểm tra xoay hình học 45 độ, Grok giữ được danh tính khuôn mặt trên ngưỡng 0.5 của ArcFace trong khi gpt-image-2 lệch nhiều hơn.

Grok thất bại: các mảng quan trọng trong sản xuất. Khi được yêu cầu tạo tiêu đề áp phích phim bằng tiếng Trung Giản thể, nó đã tạo ra các ký tự tiếng Trung Phồn thể — được gọi là "yếu tố loại trừ cứng" đối với quy trình bản địa hóa và xuất bản. Một yêu cầu kết hợp phong cách màu nước đã trả về một hình ảnh chân thực như ảnh chụp chỉ với một lớp kết cấu hội họa nhẹ — một "sự loại trừ ở cấp độ thể loại". Các chỉnh sửa cục bộ đã hoàn thành cả ba yêu cầu nhưng không giữ được khung cảnh nhìn ra cửa sổ và neo sai một điểm sáng.

Tóm tắt: Grok Imagine Image 2.0 "dẫn đầu về độ chân thực như ảnh chụp và bản sắc, đồng thời kém hơn về độ tin cậy khi chỉnh sửa, văn bản đa ngôn ngữ và chuyển phong cách thực sự." Một bảng xếp hạng lấy trung bình mức độ ưa thích qua hàng nghìn so sánh mù; nó không thể cho bạn biết liệu mô hình có xử lý đúng tiêu đề tiếng Trung của bạn hay không. Một bài kiểm tra sáu lời nhắc cũng không phải là một khối bằng chứng — nhưng giữa hai điều đó, thất bại cụ thể là tín hiệu có thể hành động hơn đối với một nhóm đang phát hành nội dung đã bản địa hóa.

API và phép tính giá

Câu chuyện dành cho nhà phát triển đã thay đổi kể từ khi ra mắt. grok-imagine-image-2.0 hiện là mô hình mà xAI đưa vào tài liệu cho việc tạo hình ảnh, chỉnh sửa một ảnh và chỉnh sửa nhiều ảnh, và đây là mô hình mà trang mô hình của chính xAI khuyến nghị cho hình ảnh. Dòng “quyền truy cập API dành cho nhà phát triển sắp ra mắt” thời ra mắt đã không còn trên các trang mô hình và định giá của nhà cung cấp.

• grok-imagine-image-2.0: từ $0.04 mỗi ảnh, tính phí theo chất lượng thực tế được cung cấp

• grok-imagine-image (1.0): $0.02 mỗi ảnh, không bị ảnh hưởng bởi thay đổi bên dưới

• grok-imagine-image-quality: $0,05 mỗi ảnh, sẽ ngừng hoạt động vào ngày 2 tháng 11 năm 2026

Chất lượng là đòn bẩy kiểm soát chi phí. Auto — giá trị mặc định khi tham số bị bỏ qua — hiện đang dùng mức low cho tạo sinh và medium cho chỉnh sửa, vì vậy một yêu cầu tạo sinh sẽ được tính theo mức giá low còn yêu cầu chỉnh sửa tính theo mức medium. Cố định ở mức low hoặc medium giúp hóa đơn có thể dự đoán được thay vì phụ thuộc vào việc dịch vụ chọn đường xử lý nào.

Gạch đầu dòng cuối cùng đó mang theo một thời hạn. Hướng dẫn migration của xAI cho biết slug grok-imagine-image-quality sẽ bị khai tử vào ngày 2 tháng 11 năm 2026, sau thông báo trước 60 ngày bắt đầu từ ngày 2 tháng 9. Từ ngày đó, slug vẫn tiếp tục phân giải, nhưng các yêu cầu được phục vụ bởi grok-imagine-image-2.0 với quality đặt ở mức low — một dạng chuyển hướng tương thích, không phải ngắt hẳn. Vì tier low rẻ hơn 0,01 USD mỗi ảnh so với tier quality cũ ở mọi độ phân giải, những đội không thay đổi gì sẽ thấy giá giảm và chất lượng đầu ra thay đổi âm thầm. Chủ động migration, bằng cách chỉ định rõ grok-imagine-image-2.0 và ghim quality ở những nơi cần đầu ra ổn định, là phương án bạn nên chọn. Ngày đó và hành vi chuyển hướng đều nằm trong tài liệu của chính xAI — do nhà cung cấp công bố, chưa được kiểm nghiệm độc lập.

So với các lựa chọn của OpenAI, đây là khác biệt về mô hình định giá cũng nhiều như khác biệt về giá. gpt-image-2 được định giá theo token — 8 USD cho mỗi triệu token đầu vào hình ảnh và 30 USD cho mỗi triệu token đầu ra hình ảnh theo mức giá công bố của OpenAI — nên chi phí trên mỗi hình ảnh dao động theo độ phân giải và mức độ chi tiết. Con số đại diện 211 USD cho mỗi 1.000 hình ảnh của Artificial Analysis dành cho GPT Image 2 (high), so với 60 USD của Grok, chính là sự dao động đó được thể hiện thành một con số duy nhất. Định giá cố định theo từng hình ảnh dễ dự báo hơn nhiều ở quy mô lớn, và đó là phần lớn lý do vì sao một mô hình đứng thứ tư lại đáng để xem xét.

Thử dùng mà không đánh cược cả pipeline

Phản ứng hợp lý với Grok Imagine Image 2.0 vẫn là “hãy thử nó, đừng cam kết với nó vội”. Vị trí của nó nằm trong những khoảng tin cậy chồng lấn, một bài kiểm tra độc lập đã chỉ ra những điểm yếu thực sự ở văn bản bản địa hóa và chuyển đổi phong cách, và xAI sẽ khai tử một slug bên dưới nó vào tháng 11. Đó chính xác là trường hợp nên định tuyến thay vì đấu nối trực tiếp một tích hợp.

Trên OrcaRouter, grok-imagine-image — mô hình hình ảnh của xAI trong danh mục của chúng tôi — nằm trên cùng một endpoint tương thích OpenAI như gpt-image-2, nên việc chuyển đổi giữa các mô hình hình ảnh của xAI và OpenAI chỉ là thay đổi chuỗi mô hình: không cần hợp đồng thứ hai, không cần SDK mới. OrcaRouter chuyển nguyên giá niêm yết của nhà cung cấp mà không cộng thêm phí, nên việc nhà cung cấp giảm giá sẽ có hiệu lực tại đây ngay trong cùng ngày, và cơ chế chuyển đổi dự phòng tự động có thể đưa lỗi, giới hạn tốc độ hoặc từ chối sang một mô hình dự phòng thay vì đẩy chúng vào luồng vận hành thực tế của bạn. Một lưu ý trung thực, không thay đổi so với đánh giá ban đầu: hạng chất lượng mới nhất của xAI là một mục riêng biệt so với mô hình hình ảnh Grok đã có trong danh mục của chúng tôi, nên hãy kiểm tra danh sách mô hình hiện tại thay vì mặc định rằng một biến thể Grok cụ thể nào đó có thể định tuyến được ngay hôm nay.

Xem gì tiếp theo

1. Đợt di chuyển ngày 2 tháng 11.Việc các đội chuyển sang grok-imagine-image-2.0 một cách rõ ràng hay trôi dạt vào redirect và mặc định chất lượng thấp của nó là điều lớn nhất mà xAI vẫn có thể làm sai với mô hình này — và redirect khiến sai lầm trở nên vô hình trừ khi bạn đọc trường model trong các phản hồi của mình.

2. Liệu #4 có giữ được vị trí hay không. Khoảng cách với MAI-Image-2.6 là 6,5 Elo với khoảng tin cậy ±12 điểm, nên thêm vài nghìn phiếu nữa có thể xáo trộn thứ hạng theo bất kỳ hướng nào. Mức tăng 110 Elo so với bậc trước có vẻ bền vững; còn thứ hạng chính xác thì không.

3. Bao nhiêu phần trong giao diện dành cho người dùng cuối có thể truy cập được API. Việc tạo, chỉnh sửa và chỉnh sửa nhiều ảnh đều đã được ghi tài liệu. Templates và quy trình Smart Resize có tên cụ thể vẫn là các tính năng của ứng dụng, và khoảng trống đó chính là nơi tồn tại lưu ý "chỉ dành cho người dùng cuối" còn lại.

Tóm lại: Grok Imagine Image 2.0 là một mô hình thực sự, có năng lực, giờ đây đã được xếp hạng độc lập — vị trí thứ 4 trên Bảng xếp hạng Text to Image của Artificial Analysis, mô hình không thuộc OpenAI tốt nhất ở đó, cao hơn khoảng 110 Elo so với phân hạng mà nó thay thế, và nằm trên đường biên chất lượng-giá của bảng xếp hạng với mức 60 USD cho 1.000 ảnh, so với khoảng 211 USD cho các mô hình OpenAI ngay trên nó. Cách diễn đạt “số 2 thế giới” vốn luôn là ảnh chụp nhanh lúc ra mắt của xAI, và các bảng xếp hạng độc lập chưa từng thực sự nói như vậy. Hai điểm yếu độc lập rõ ràng nhất của nó — khả năng tuân thủ tiếng Trung giản thể và độ tin cậy của chuyển đổi phong cách — nằm ở những tính năng mà các nhóm thường cần nhất từ một API hình ảnh. Hãy dùng thử ngay cho công việc ảnh chân thực, bảo toàn danh tính; hãy chờ đã đối với các quy trình xuất bản văn bản đã bản địa hóa hoặc tài nguyên cách điệu, và nếu bạn đang gọi slug chất lượng sắp ngừng, hãy chuyển đổi trước ngày 2 tháng 11.