gpt-image-2 của OpenAI là thế hệ tiếp theo của dòng gpt-image — một mô hình hình ảnh tính phí theo token, được truy cập qua OpenAI Images API tiêu chuẩn. Đây là bản nâng cấp thay thế trực tiếp từ gpt-image-1: cùng SDK, cùng cấu trúc lệnh gọi, cùng các tham số. Chỉ cần trỏ OpenAI client hiện tại của bạn đến base URL của OrcaRouter và đặt model thành `openai/gpt-image-2`. Giá là $5.00 đầu vào / $30.00 đầu ra trên 1M token, tính phí theo chi phí gốc — không chênh lệch, không cần di chuyển dữ liệu.
OpenAI GPT-Image-2 là mô hình đa phương thức từ OpenAI chuyên tạo và chỉnh sửa hình ảnh. Mô hình này chấp nhận các lời nhắc dạng văn bản và tùy chọn đầu vào hình ảnh để tạo ra đầu ra hình ảnh đã được…
GPT-Image-2 được thiết kế để tạo hình ảnh từ mô tả văn bản và chỉnh sửa ảnh hiện có dựa trên hướng dẫn bằng chữ. Nó có thể sửa đổi các thuộc tính như màu sắc, kết cấu, hình dạng và bố cục, cũng như thêm hoặc xóa đối tượng. Mô hình hỗ trợ inpainting (thay thế một phần của ảnh) và outpainting (mở rộng khung hình) một cách ngầm thông qua thiết kế prompt. Nó cũng cho phép chuyển đổi phong cách, giúp người dùng áp dụng một thẩm mỹ nhất định lên ảnh nguồn. Những khả năng này làm cho nó phù hợp với các tác vụ từ hiệu chỉnh đơn giản đến thử nghiệm hình ảnh sáng tạo.
Có, GPT-Image-2 có thể tạo ra những hình ảnh hoàn toàn mới từ các gợi ý văn bản mà không cần bất kỳ hình ảnh đầu vào nào. Mô hình sử dụng mô tả được cung cấp để tạo ra một biểu diễn trực quan, bao gồm các chi tiết về bố cục cảnh, ánh sáng, màu sắc và các đối tượng. Chất lượng và độ trung thực của hình ảnh được tạo ra phụ thuộc vào độ cụ thể của gợi ý và các giới hạn của kiến trúc cơ bản. Để có kết quả tốt nhất, các gợi ý nên rõ ràng và tránh các tham chiếu mơ hồ. Khả năng này hữu ích cho việc hình thành ý tưởng, tạo mẫu thử và tạo ra các minh họa độc đáo từ các mô tả khái niệm.
GPT-Image-2 chấp nhận các lời nhắc văn bản làm đầu vào chính. Khi chỉnh sửa ảnh, nó yêu cầu một ảnh hiện có được cung cấp dưới dạng URL hoặc dữ liệu mã hóa base64 thô trong yêu cầu API. Ảnh phải ở định dạng tiêu chuẩn như PNG hoặc JPEG, với giới hạn độ phân giải và kích thước được xác định bởi thông số kỹ thuật API của OpenAI. Mô hình không hỗ trợ đầu vào video hoặc nhiều ảnh một cách tự nhiên; mỗi yêu cầu hoạt động trên một cặp lời nhắc-ảnh duy nhất. Ảnh đầu ra được tạo ở các định dạng phổ biến, thường là PNG, và có thể được gửi dưới dạng URL hoặc dữ liệu base64 tùy theo sở thích của khách hàng.
GPT-Image-2 không duy trì trạng thái giữa các yêu cầu; mỗi lần gọi API là độc lập. Chỉnh sửa nhiều bước—nơi một hình ảnh được tinh chỉnh dần qua một loạt lời nhắc—phải do ứng dụng gọi quản lý. Các nhà phát triển có thể triển khai một quy trình làm việc trong đó mỗi bước chuyển đầu ra của bước trước thành đầu vào cho yêu cầu tiếp theo. Cách tiếp cận này cho phép chỉnh sửa lặp lại, chẳng hạn như điều chỉnh màu sắc trước, sau đó thêm nền, rồi thay đổi kích thước. Mặc dù có chức năng, nhưng việc thiếu trạng thái tích hợp có nghĩa là ứng dụng phải xử lý ngữ cảnh, chẳng hạn như lưu trữ hình ảnh trung gian và xây dựng các lời nhắc phù hợp cho từng bước.
Điểm Elo chỉnh sửa hình ảnh LM Arena là 1467.0, một chuẩn mực đo lường chất lượng đầu ra của việc chỉnh sửa hình ảnh. Điểm Elo trong ngữ cảnh này được tính toán dựa trên so sánh theo cặp các đầu ra mô hình bởi các đánh giá viên con người. Điểm 1467 cho thấy GPT-Image-2 vượt trội đáng kể so với các mô hình cơ sở và có tính cạnh tranh với các mô hình chỉnh sửa hình ảnh hàng đầu khác. Nó phản ánh hiệu suất mạnh mẽ trong các tác vụ như chèn đối tượng, thay thế nền, thay đổi màu sắc và chỉnh sửa bố cục. Điểm này là một trong những điểm cao nhất trên bảng xếp hạng LM Arena cho thể loại chỉnh sửa hình ảnh, cho thấy mô hình tạo ra các chỉnh sửa mạch lạc, trung thành với hướng dẫn và hấp dẫn về mặt thị giác.
Độ trễ của GPT-Image-2 thay đổi tùy thuộc vào độ phức tạp của prompt, kích thước đầu vào (nếu có) và độ phân giải đầu ra mong muốn. OpenAI không công bố các cam kết độ trễ cố định cho mô hình này; thời gian phản hồi điển hình dao động từ vài giây đến vài chục giây đối với hình ảnh lớn hoặc các chỉnh sửa phức tạp. Vì OrcaRouter là một relay không thêm độ trễ nào vào thời gian xử lý của nhà cung cấp, thời gian chờ thực tế giống như gọi trực tiếp OpenAI. Đối với các ứng dụng sản xuất, người dùng nên triển khai timeout và logic retry, đồng thời cân nhắc xử lý theo lô để quản lý thông lượng.
GPT-Image-2 xuất sắc trong các tác vụ chỉnh sửa hình ảnh đòi hỏi sửa đổi chính xác dựa trên hướng dẫn ngôn ngữ tự nhiên. Điểm LM Arena Elo cao của nó phản ánh khả năng tạo ra các chỉnh sửa vừa chính xác vừa thẩm mỹ. Mô hình xử lý tốt các thay đổi bố cục phức tạp, chẳng hạn như thay thế vật thể trong khi vẫn duy trì ánh sáng và bóng đổ phù hợp. Mô hình cũng tạo ra hình ảnh chất lượng cao từ đầu với độ chân thực ảnh tốt và tuân thủ mô tả. Người dùng thường phản hồi rằng nó xử lý các hướng dẫn sáng tạo (ví dụ: "làm cho cảnh này trông giống như một bức tranh sơn dầu") bằng cách chuyển đổi phong cách hợp lý.
Mặc dù có hiệu suất chuẩn mạnh mẽ, GPT-Image-2 vẫn có những hạn chế. Nó có thể gặp khó khăn với các hướng dẫn rất dài hoặc nhiều phần, đặc biệt khi nhiều đối tượng yêu cầu sửa đổi đồng thời. Mô hình có thể tạo ra các hiện tượng giả tạo không thường xuyên, chẳng hạn như khuôn mặt bị méo mó hoặc kết cấu không thực tế, đặc biệt trong các cảnh phức tạp. Nó cũng có các hạn chế về an toàn ngăn chặn việc tạo ra một số loại nội dung, điều này có thể hạn chế một số mục đích sáng tạo. Ngoài ra, vì mô hình được truy cập thông qua cơ sở hạ tầng của OpenAI, người dùng phải tuân theo chính sách nội dung và giới hạn tỷ lệ của OpenAI, điều này có thể ảnh hưởng đến quy trình chỉnh sửa hàng loạt.
GPT-Image-2 được định giá theo token: $8.00 cho mỗi triệu token đầu vào và $30.00 cho mỗi triệu token đầu ra. Token đầu vào bao gồm phần văn bản prompt và bất kỳ dữ liệu hình ảnh nào được mã hóa dưới dạng base64 (vì hình ảnh được token hóa). Token đầu ra là biểu diễn hình ảnh được tạo ra. Tổng chi phí cho một yêu cầu phụ thuộc vào độ dài của prompt và độ phân giải của cả hình ảnh đầu vào và đầu ra. OrcaRouter chuyển tiếp mức giá này mà không tăng thêm, nghĩa là chi phí chính xác bằng với phí mà OpenAI tính. Không có khoản phí bổ sung nào được thêm vào bởi nền tảng OrcaRouter.
Không. OrcaRouter tuyên bố rõ ràng rằng nó tính phí GPT-Image-2 theo mức giá của nhà cung cấp mà không có phụ phí. Điều này có nghĩa là giá mỗi token chính xác là $8.00 đầu vào và $30.00 đầu ra. Không có phí đăng ký hàng tháng, chi phí cơ bản hoặc tỷ lệ phần trăm phụ thêm nào do OrcaRouter thêm vào. Các khoản phí duy nhất là chi phí token tiêu thụ bởi OpenAI. Người dùng nên đảm bảo họ đã thiết lập phương thức thanh toán hợp lệ với OrcaRouter để tránh gián đoạn dịch vụ, nhưng công thức tính giá là minh bạch và có thể dự đoán trước.
OpenAI không công khai cung cấp bộ nhớ đệm cho các prompt tạo hoặc chỉnh sửa hình ảnh; mỗi yêu cầu được xử lý độc lập. Do đó, việc lặp lại các prompt giống hệt nhau với cùng một hình ảnh đầu vào thường sẽ phải chịu toàn bộ chi phí token cho mỗi lần gọi. Tuy nhiên, nếu ứng dụng của bạn thường xuyên sử dụng cùng một hình ảnh đầu vào, bạn có thể giảm lượng token đầu vào bằng cách lưu trữ hình ảnh bên ngoài và tham chiếu đến nó qua URL (nếu được hỗ trợ) thay vì mã hóa lại nó dưới dạng base64. OrcaRouter không cung cấp bất kỳ lớp bộ nhớ đệm bổ sung nào có thể giảm mức tiêu thụ token cho mô hình này.
GPT-Image-2 pricing is set by OpenAI và là một trong những tùy chọn chi phí cao hơn cho các mô hình hình ảnh do khả năng chỉnh sửa chuyên biệt của nó. Các lựa chọn thay thế rẻ hơn, chẳng hạn như các mô hình Stability AI có sẵn trên OrcaRouter, có thể cung cấp tỷ lệ mỗi token thấp hơn nhưng có thể không đạt được độ chính xác chỉnh sửa được đo bằng chuẩn LM Arena. Sự đánh đổi nằm giữa chi phí và chất lượng đầu ra. Đối với các chỉnh sửa đơn giản hoặc ứng dụng ít rủi ro, một mô hình ít tốn kém hơn có thể đủ, trong khi GPT-Image-2 được ưu tiên khi độ trung thực cao và tuân thủ prompt là yếu tố quan trọng.
Để sử dụng GPT-Image-2 qua OrcaRouter, hãy gửi một yêu cầu HTTP POST đến endpoint tương thích OpenAI tại https://api.orcarouter.ai/v1/images/generations (hoặc một endpoint tương tự tùy theo thao tác). Đặt tham số model thành "openai/gpt-image-2". Bao gồm một chuỗi prompt và tùy chọn một hình ảnh (dưới dạng base64 hoặc URL) cho các tác vụ chỉnh sửa. OrcaRouter xác thực yêu cầu bằng khóa API của bạn (thường được truyền trong header Authorization dưới dạng "Bearer <key>"). Phản hồi sẽ chứa dữ liệu hình ảnh đã tạo theo định dạng được chỉ định trong yêu cầu, thường là URL hoặc chuỗi base64.
Các tham số API phần lớn tuân theo lược đồ tạo hình ảnh của OpenAI. Các tham số chính bao gồm "model" (đặt là "openai/gpt-image-2"), "prompt" (chỉ dẫn văn bản), "n" (số lượng hình ảnh cần tạo, mặc định là 1), "size" (kích thước đầu ra như "1024x1024"), "response_format" ("url" hoặc "b64_json") và "user" (dùng để theo dõi giới hạn tốc độ). Đối với các tác vụ chỉnh sửa, bạn cũng có thể bao gồm "image" (hình ảnh đầu vào dạng base64) và "mask" (dùng cho inpainting, chỉ định các vùng cần sửa đổi). Tham khảo tài liệu chính thức của OpenAI để có danh sách đầy đủ các tham số được hỗ trợ và các ràng buộc của chúng.
Việc chuyển đổi rất đơn giản vì OrcaRouter cung cấp API hoàn toàn tương thích với OpenAI. Các thay đổi duy nhất cần thực hiện là cập nhật base URL từ https://api.openai.com thành https://api.orcarouter.ai/v1 và sửa đổi chuỗi model từ dạng như "gpt-image-2" thành "openai/gpt-image-2". Mã hiện tại của bạn để xác thực, tuần tự hóa yêu cầu và xử lý phản hồi sẽ hoạt động mà không cần sửa đổi. Không cần thay đổi tên tham số hoặc cấu trúc dữ liệu. Sau khi cập nhật endpoint và model ID, hãy kiểm tra bằng một yêu cầu duy nhất để xác nhận kết nối và hành vi thanh toán.
OrcaRouter sử dụng xác thực API key. Bạn phải bao gồm API key OrcaRouter của mình trong header yêu cầu. Giới hạn tốc độ được xác định bởi cả OrcaRouter và OpenAI. OrcaRouter có thể áp đặt giới hạn để ngăn chặn lạm dụng, nhưng thường thì các giới hạn này khá thoải mái. OpenAI áp dụng các giới hạn tốc độ riêng dựa trên cấp độ và hóa đơn, và các giới hạn này vẫn có hiệu lực bất kể bạn truy cập mô hình qua OrcaRouter hay trực tiếp. Người dùng nên theo dõi mức sử dụng qua bảng điều khiển OrcaRouter và điều chỉnh nhịp độ yêu cầu cho phù hợp. Không yêu cầu xác thực bổ sung nào ngoài API key.
GPT-Image-2 và DALL-E 3 đều là các mô hình tạo hình ảnh từ OpenAI, nhưng chúng hướng đến các trường hợp sử dụng khác nhau. DALL-E 3 là mô hình chuyển văn bản thành hình ảnh đa năng, tập trung vào việc tạo ra hình ảnh sáng tạo và chân thực từ đầu. GPT-Image-2 được tối ưu hóa cho việc chỉnh sửa ảnh có sẵn, thể hiện qua điểm LM Arena Image Edit Elo cao của nó. Mặc dù DALL-E 3 cũng có thể thực hiện một số chỉnh sửa, nhưng thế mạnh của nó nằm ở khả năng tạo hình ảnh gốc. GPT-Image-2 có xu hướng tạo ra các sửa đổi chính xác hơn đối với ảnh đầu vào, đặc biệt khi prompt liên quan đến việc giữ nguyên các yếu tố của bố cục gốc.
Các mô hình Stability AI như SD3.5 là trình tạo ảnh mã nguồn mở có chi phí mỗi token thấp hơn nhưng có thể yêu cầu nhiều công đoạn tinh chỉnh prompt hơn để đạt chất lượng tương tự. GPT-Image-2, với tư cách là mô hình độc quyền, được hưởng lợi từ lượng dữ liệu huấn luyện phong phú và tinh chỉnh cho các tác vụ chỉnh sửa, thể hiện qua điểm LM Arena của nó. Sự lựa chọn giữa chúng phụ thuộc vào ngân sách và yêu cầu chất lượng. Đối với các tác vụ chỉnh sửa quan trọng đòi hỏi độ chính xác cao, GPT-Image-2 là lựa chọn tốt hơn. Đối với tạo ảnh hàng loạt hoặc khi chi phí là mối quan tâm chính, các mô hình Stability AI có sẵn trên OrcaRouter có thể là một giải pháp thay thế khả thi, mặc dù bạn phải đánh giá sự khác biệt về chất lượng cho ứng dụng cụ thể của mình.
Chọn một mô hình rẻ hơn khi nhiệm vụ của bạn là tạo hình ảnh đơn giản mà không yêu cầu chỉnh sửa, hoặc khi khả năng chấp nhận chỉnh sửa không hoàn hảo cao. Ví dụ, tạo hình ảnh giữ chỗ, biểu tượng đơn giản hoặc đồ họa độ phân giải thấp có thể không cần đến sự tinh vi của GPT-Image-2. Tương tự, nếu prompt của bạn chỉ liên quan đến các điều chỉnh nhỏ (ví dụ: thay đổi độ sáng hoặc cắt xén), một mô hình ít chuyên biệt hơn có thể đủ dùng. OrcaRouter cung cấp nhiều mô hình hình ảnh với các mức giá khác nhau. Đánh giá trường hợp sử dụng cụ thể của bạn—nếu tác vụ chỉnh sửa phức tạp và yêu cầu độ trung thực cao, GPT-Image-2 là hợp lý; nếu không, hãy cân nhắc tiết kiệm chi phí từ các mô hình thay thế.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1| Đầu vào / 1M tokens | $8.00 |
|---|---|
| Đầu ra / 1M tokens | $30.00 |
| Đọc cache / 1M | $1.25 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/openai/gpt-image-2Mở @misc{orcarouter_gpt_image_2,
title = {openai/gpt-image-2 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-2}
}openai. (n.d.). openai/gpt-image-2 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-2