Thẻ tiêu đề anh hùng cho Meta Muse Image so với GPT Image 2, hiển thị dòng chữ 'Meta Muse Image vs GPT Image 2' kèm phụ đề 'Mô hình suy nghĩ trước khi vẽ đối đầu với vua text', và hai thẻ bo tròn phẳng bên dưới được gắn nhãn 'Agentic' và 'Text-first'.
Guides & Insights

Meta Muse Image vs GPT Image 2: Tân binh biết suy nghĩ vs Vua văn bản

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

{{1}}Meta Muse Image{{/1}} không tạo ra hình ảnh như cách các mô hình hình ảnh thông thường vẫn làm. Được ra mắt vào ngày {{2}}7 tháng 7 năm 2026{{/2}} với tư cách là mô hình hình ảnh nội bộ đầu tiên của Meta Superintelligence Labs, dưới tên mã {{3}}Mango{{/3}}, nó hoạt động như một tác tử: có thể tìm kiếm trên web để gắn kết lời nhắc với các dữ kiện thực tế, viết và chạy mã để bố trí biểu đồ và mã QR một cách chính xác, đồng thời tự sửa lại bản nháp trước khi bạn kịp nhìn thấy kết quả — một thói quen tự sửa lỗi mà Meta cho biết không được lập trình một cách tường minh mà đã tự xuất hiện thông qua học tăng cường. Mục tiêu của toàn bộ cỗ máy đó là {{4}}OpenA​I's GPT Image 2{{/4}}, mô hình được phát hành vào tháng {{5}}4 năm 2026{{/5}} và vẫn đang giữ vị trí {{6}}#1{{/6}} trên mọi bảng xếp hạng hình ảnh công khai. Một tháng sau khi Muse Image được phát hành, nói thật thì đây là màn ra mắt mô hình hình ảnh thú vị nhất trong năm — và rõ ràng nó vẫn chỉ đứng thứ hai.

Cả hai mô hình đều không phải là tin nóng, chính vì vậy cuộc so sánh này xứng đáng có một bài phân tích bình tĩnh thay vì bài viết ra mắt. GPT Image 2 đã là lựa chọn hiện tại kể từ mùa xuân và vừa có làn gió thứ hai: OpenAI đang loại bỏ công cụ DALL-E khỏi ChatGPT vào ngày 30/8 và gộp toàn bộ khả năng tạo hình vào ChatGPT Images, nơi GPT Image 2 đảm nhiệm, và các bài kiểm tra mới nhất vào ngày 7/8 đã xác nhận lại vị thế dẫn đầu của nó. Muse Image đã dành hai tuần đầu tiên trên mặt báo vì một vụ vấp ngã về quyền riêng tư mà Meta sau đó đã rút lại, và mô hình này vẫn chưa có API dành cho nhà phát triển. Đằng sau những ồn ào đó, câu chuyện kỹ thuật là có thật: Meta đã tạo ra mô hình tạo ảnh đầu tiên có thể suy nghĩ một cách nhìn thấy được, còn OpenAI đã tạo ra mô hình đầu tiên vẽ ra chữ bạn có thể đọc thực sự. Mọi thứ khác trong bài so sánh này đều là hệ quả trực tiếp từ hai sự thật đó.

Two-column comparison scoreboard for Meta Muse Image and GPT Image 2: availability 'App-only; no developer API yet' vs 'API-first; OpenAI API + OrcaRouter'; working mode 'Agentic: web search + code + self-correction' vs 'Autoregressive; optional thinking mode'; Text-to-Image Arena 'Elo 1,281, #3 (Jul 31)' vs 'Elo 1,381, #1'; in-image text 'claimed, unverified' vs 'best-in-class, CJK Hindi Bengali'; price 'free tier in Meta apps' vs '~$0.05 to $0.21 per 1024x1024 image'; editing 'strong multi-image (Meta-reported)' vs 'leader on edit boards'. Footer reads 'Muse Image figures per arena.ai + Meta; GPT Image 2 per arena.ai + OpenAI — August 2026.'

Bảng tỷ số

Cùng sáu chiều, cả hai phía, nên sự tương phản vẫn dễ quan sát mà không cần bảng. Chỉ số arena của Muse Image là bên thứ ba báo cáo và độ mạnh chỉnh sửa của nó là Meta báo cáo; các chỉ số của GPT Image 2 lấy từ arena.ai và trang giá của OpenA​I. Mọi số liệu do nhà cung cấp báo cáo đều được đánh dấu.

• Khả dụng — Muse Image chỉ có trong ứng dụng, miễn phí trên Meta AI, Instagram và WhatsApp, chưa có API dành cho nhà phát triển, so với GPT Image 2 vốn ưu tiên API, có thể gọi qua API của OpenAI và thông qua OrcaRouter.

• Chế độ hoạt động — Muse Image có tính tác nhân (agentic) theo mặc định: tìm kiếm web, thực thi mã, tự sửa lỗi, so với GPT Image 2 chỉ là một lượt hồi quy tự động (autoregressive) duy nhất với chế độ "suy nghĩ" tùy chọn.

Text-to-Image Arena — Muse Image Elo 1,281, đứng thứ ba tính đến ngày 31 tháng 7, so với GPT Image 2 Elo 1,381, đứng đầu — khoảng cách 100 điểm tương đương với tỷ lệ thắng dự kiến khoảng 64%.

• Văn bản trong hình ảnh — Muse Image tuyên bố tạo văn bản chính xác thông qua phương thức mã hóa và kết xuất, chưa được kiểm chứng độc lập so với tiêu chuẩn tốt nhất của GPT Image 2, kết xuất rõ ràng tiếng Nhật, tiếng Hàn, tiếng Trung, tiếng Hindi và tiếng Bengal.

• Giá — Muse Image có gói miễn phí trong các ứng dụng của Meta, dùng nhiều hơn thì phải trả phí qua Meta One với giá $7.99 hoặc $19.99 mỗi tháng, còn GPT Image 2 tốn khoảng $0.05 đến $0.21 cho mỗi ảnh 1024×1024 trên API.

• Chỉnh sửa — Muse Image mạnh về chỉnh sửa ảnh đơn và đa ảnh theo đánh giá của chính Meta, trong khi GPT Image 2 dẫn đầu tuyệt đối trên các bảng xếp hạng chỉnh sửa ảnh công khai.

Vòng lặp tác nhân chính là sản phẩm thực sự.

Lời giới thiệu của Meta về Muse Image không phải là "nhiều pixel chân thực hơn" — mà là một chế độ làm việc khác. Với một câu lệnh đòi hỏi mật độ kiến thức cao, chẳng hạn như hình ảnh chiếc cúp Wimbledon kèm tên nhà vô địch hiện tại, Muse Image tìm kiếm trên web trước, neo việc tạo hình vào những gì nó tìm thấy, và chỉ sau đó mới vẽ. Đối với biểu đồ, đồ họa thông tin và mã QR, nó viết và chạy mã, kết xuất đầu ra, rồi dùng kết xuất đó để hiệu chỉnh hình ảnh cuối cùng. Các tài liệu sau khi ra mắt của Meta mô tả mô hình tự suy ngẫm về đầu ra của chính nó: sửa lỗi nhỏ cho các lỗi nhẹ, vẽ lại toàn bộ cho các lỗi lớn, tìm kiếm thêm khi không chắc chắn. Tuyên bố đáng chú ý là hành vi chỉnh sửa này không được lập trình một cách tường minh — nó xuất hiện trong quá trình học tăng cường vì việc chỉnh sửa dẫn đến phần thưởng ưu tiên của con người cao hơn. Meta báo cáo mức cải thiện tự sửa lỗi là tăng tỷ lệ thắng khoảng 57% trong văn bản thành hình ảnh và 56% trong cả hai hạng mục chỉnh sửa; đây là những con số từ nhà cung cấp đang chờ được tái lập một cách độc lập.

{{1}}Suy nghĩ trong quá trình tạo cũng thay đổi đòn bẩy bạn kéo để cải thiện mô hình.{{/1}} {{2}}Meta cho biết chất lượng của Muse Image cải thiện theo logarit khi tăng số bước suy luận, và việc dùng sức mạnh tính toán cho suy luận sâu hơn đánh bại việc tạo nhiều ứng viên rồi chọn ra cái tốt nhất{{/2}} — một quan điểm coi test-time compute (sức mạnh tính toán tại thời điểm suy luận) là biên giới mới. {{3}}GPT Image 2 có ý tưởng song song trong chế độ suy nghĩ tùy chọn, vốn lên kế hoạch bố cục, có thể tìm kiếm trên web và kiểm tra lại bài làm trước khi vẽ;{{/3}} trên API, nó được hiển thị dưới dạng tham số thinking ở mức thấp, trung bình hoặc cao, được tính phí dưới dạng token bổ sung. Sự khác biệt nằm ở giá trị mặc định: {{KEEP}}Muse Image{{/KEEP}} là một tác tử ngay từ thiết kế, được xây dựng để lặp; đường dẫn mặc định của {{KEEP}}GPT Image 2{{/KEEP}} chỉ là một lượt duy nhất, với suy luận là một bản nâng cấp trả phí. {{4}}Nếu bạn tin rằng việc tạo hình ảnh đang hướng tới các pipeline sử dụng công cụ và tự sửa lỗi, {{KEEP}}Muse Image{{/KEEP}} là mô hình sản xuất đầu tiên được xây dựng hoàn toàn dựa trên giả định đó{{/4}} — và việc kết hợp nó với mô hình ngôn ngữ {{KEEP}}Muse Spark{{/KEEP}} của Meta, vốn lập kế hoạch trong khi mô hình hình ảnh vẽ, là sự hiện thực hóa rõ ràng nhất của tương lai đó được ra mắt cho đến nay.

Văn bản là nơi khoảng cách rộng nhất.

Lợi thế vững chắc nhất của GPT Image 2 là khả năng hiển thị chữ rõ ràng bên trong hình ảnh — khả năng được yêu cầu nhiều nhất trong tạo hình ảnh ở quy mô sản xuất. GPT Image 2 là mô hình đầu tiên kết xuất đáng tin cậy các thực đơn, áp phích, đồ họa thông tin và bố cục nhiều khung mà không bị lỗi chữ, bao gồm cả các hệ chữ không phải Latinh vốn trước đây luôn khiến mọi mô hình cũ thất bại. Đó cũng là lý do nó quét sạch bảng xếp hạng chỉnh sửa hình ảnh: một bố cục được chỉnh sửa chỉ có hiệu quả nếu văn bản bên trong vẫn chính xác. Hướng tiếp cận code-and-render của Muse Image là một nỗ lực thực sự thông minh cho cùng vấn đề — nó không cố gắng vẽ chữ mà sắp chữ rồi ghép kết quả — nhưng chưa có điểm chuẩn độc lập nào cho thấy nó sánh được với đầu ra của GPT Image 2 trên các hình ảnh nhiều chữ, và tài liệu của chính Meta cũng định vị thế mạnh của nó ở khả năng chỉnh sửa và bố cục thay vì typography.

Một trong số này có thể gọi được; cái còn lại là một ứng dụng.

Sự phân chia thực tế đối với bất kỳ ai đang xây dựng sản phẩm còn rõ rệt hơn sự phân chia trên benchmark. GPT Image 2 là API-first: bạn gọi nó qua API images của OpenA​I theo định giá token — đầu vào hình ảnh 8 USD mỗi triệu token, đầu ra hình ảnh 30 USD, đầu vào văn bản 5 USD, đầu ra văn bản 10 USD, với đầu vào cache giảm một nửa giá — tương đương khoảng $0.05 cho một ảnh 1024×1024 ở chất lượng trung bình và $0.21 ở chất lượng cao, trước khi cài đặt thinking làm tăng thêm chi phí. Muse Image hoàn toàn không có API dành cho nhà phát triển. Nó miễn phí trong ứng dụng Meta AI, trên Instagram Stories và trong WhatsApp, với mức sử dụng cao hơn bị giới hạn sau gói đăng ký Meta One với giá $7.99 hoặc $19.99 một tháng, và Meta cho biết họ vẫn đang đánh giá liệu có mở mô hình cho các nhà phát triển bên ngoài hay không. Bạn có thể dùng thử Muse Image chiều nay; bạn không thể xây dựng trên nó.

Screenshot of the Meta AI chat interface on meta.ai, showing the 'What can I do for you?' prompt box, a left rail with 'New chat' and 'Vibes', a 'Sign up' button, and suggested prompts such as 'Create a 3-in-3 arcade game' — the consumer app where Muse Image is free to use.

Chính sự bất đối xứng đó là lý do trang này có thể định tuyến một trong các mô hình này mà không phải mô hình kia. GPT Image 2 đã có mặt trên OrcaRouter tại openai/gpt-image-2 — bản nâng cấp thay thế trực tiếp từ gpt-image-1 trên cùng cấu trúc API, được tính phí theo giá niêm yết của OpenAI mà không cộng thêm bất kỳ khoản phí nào, vì vậy mức giá $8/$30 cho mỗi triệu token bạn thấy là giá của nhà cung cấp, và bất kỳ đợt giảm giá nào từ nhà cung cấp cũng sẽ có hiệu lực tại đây ngay trong cùng ngày được công bố. Ngay khi Meta mở một endpoint Muse Image — và việc họ tự triển khai Muse Spark API trả phí cho thấy ngày đó đang đến gần — cả hai trở thành một quyết định định tuyến thay vì lựa chọn một trong hai: một khóa duy nhất để A/B test mô hình mới với mô hình hiện tại trên chính prompt của bạn, với khả năng chuyển đổi dự phòng tự động sang một trình tạo đã được kiểm chứng trong khi mô hình hoàn toàn mới vẫn đang khẳng định lợi thế của mình. Đó chính là mô hình mà tầng định tuyến tồn tại để phục vụ — dùng thử mô hình mới thú vị mà không cần đặt cược quy trình sản xuất vào nó.

Screenshot of the OrcaRouter model page for openai/gpt-image-2, showing the $8.00 per million input tokens and $30.00 per million output tokens pricing, the 'drop-in upgrade from gpt-image-1' description, the OpenAI-compatible endpoint api.orcarouter.ai/v1/images/generations, and a 7-day performance block.

Vụ vấp ngã về quyền riêng tư gần như đã định hình buổi ra mắt

Hai tuần đầu tiên của Muse Image không bị thống trị bởi các bài benchmark mà bởi một tính năng: người dùng có thể @-mention một tài khoản Instagram công khai trong lời nhắc, và mô hình sẽ lấy chân dung của người đó từ các bức ảnh công khai để đưa vào những cảnh được tạo ra — với các tài khoản công khai mặc định đồng ý tham gia. Các nhóm bảo vệ quyền riêng tư và các hiệp hội Hollywood đã phản đối chỉ trong vài giờ; Meta gỡ bỏ tính năng này vào ngày 10 tháng 7, chưa đầy một tuần sau khi ra mắt, trong khi vẫn giữ lại mô hình nền tảng. Tình tiết này có ý nghĩa hai chiều cho việc so sánh. Nó nhắc nhở về lợi thế thực sự của Meta — khả năng phân phối có thể đưa một mô hình hình ảnh đến trước hàng tỷ người dùng chỉ sau một đêm — và về sự giám sát đi kèm với điều đó. Riêng biệt, Reuters phát hiện trình phát hiện hình mờ Content Seal của Meta không xác minh được 55% số ảnh có hình mờ sau khi bị cắt xén, vì vậy dấu vết kiểm toán yếu hơn so với quảng cáo. Không điều nào trong số đó làm thay đổi câu chuyện về chất lượng, nhưng nó là một phần trong hồ sơ công khai của mô hình.

Nên dùng cái nào

Đối với bất cứ thứ gì cần văn bản chính xác — bao bì, áp phích, bản mô phỏng UI, infographic, hoặc một quy trình xử lý chạm tới các ký tự không thuộc hệ Latin — GPT Image 2 là lựa chọn, và đây là mô hình duy nhất trong hai cái mà bạn có thể gọi từ mã nguồn ngay hôm nay. Muse Image là thử nghiệm thú vị hơn: vòng lặp agentic của nó chỉ ra nơi ngành tạo hình ảnh đang hướng tới, khả năng chỉnh sửa của nó thực sự mạnh, và nó được dùng thử miễn phí trong các ứng dụng của Meta ngay lúc này. Khoảng cách giữa hai mô hình là có thật, nhưng không mang tính cấu trúc — một mô hình đã học được cách tự sửa lại tác phẩm của chính mình là một kiểu đối thủ khác hẳn những gì ngành từng phải đối mặt, và nếu khả năng tự hiệu chỉnh đó được nhân rộng, 100 điểm Elo cụ thể này sẽ không trụ vững được lâu. Đưa GPT Image 2 vào sản xuất, theo dõi sát trạng thái API của Muse Image, và xếp kẻ mới vào sau bộ định tuyến ngay ngày nó có thể được gọi.