GPT-Image 1.5 của OpenAI cho đầu vào văn bản và hình ảnh, truy cập thông qua API của OrcaRouter với giá trực tiếp từ nhà cung cấp.
openai/gpt-image-1.5 là một mô hình đa phương thức do OpenAI phát triển, chấp nhận cả đầu vào văn bản và hình ảnh. Mô hình này được thiết kế để thực hiện các tác vụ suy luận yêu cầu hiểu nội dung…
Mô hình có khả năng hiểu và suy luận về hình ảnh kết hợp với hướng dẫn dạng văn bản. Các tác vụ phổ biến bao gồm tạo chú thích mô tả cho ảnh chụp, trả lời câu hỏi về nội dung của hình ảnh (ví dụ: 'Chiếc xe có màu gì?') và trích xuất văn bản từ hình ảnh (các tác vụ giống OCR khi được nhắc phù hợp). Mô hình cũng có thể được sử dụng cho các suy luận phức tạp hơn, chẳng hạn như phân tích biểu đồ, sơ đồ hoặc ghi chú viết tay. Phạm vi chính xác của các khả năng phụ thuộc vào quá trình huấn luyện của mô hình, mà OpenAI chưa công bố chi tiết, nhưng nó tuân theo mô hình transformer đa phương thức tổng quát.
Mô hình này hoạt động xuất sắc trong các tình huống cần ngữ cảnh trực quan để tạo ra đầu ra văn bản chính xác. Các trường hợp sử dụng ví dụ bao gồm cung cấp mô tả thời gian thực cho người dùng khiếm thị, tự động gắn thẻ sản phẩm từ ảnh danh mục và hỗ trợ phân tích hình ảnh y tế bằng cách tạo báo cáo sơ bộ. Nó cũng phù hợp với các ứng dụng giáo dục, chẳng hạn như giải thích sơ đồ hoặc giải câu đố trực quan. Vì là mô hình văn bản-hình ảnh chuyên biệt, nó có thể vượt trội hơn các mô hình đa phương thức đa năng trong các tác vụ thuần hình ảnh sang văn bản, mặc dù nhà cung cấp không cung cấp so sánh trực tiếp.
Nếu ứng dụng của bạn không yêu cầu đầu vào hình ảnh, bạn nên cân nhắc một mô hình chỉ văn bản rẻ hơn có sẵn trên OrcaRouter, chẳng hạn như openai/gpt-4o-mini, với chi phí mỗi token thấp hơn. Tương tự, nếu các tác vụ dựa trên hình ảnh của bạn đơn giản (ví dụ: phân loại nhị phân) và có thể được xử lý bởi một mô hình thị giác nhẹ, một lựa chọn thay thế nhỏ hơn có thể tiết kiệm chi phí hơn. GPT-Image 1.5 được định giá ở mức cao hơn trong các dịch vụ của OpenAI, vì vậy đối với các tác vụ hình ảnh có khối lượng lớn, độ phức tạp thấp, có thể đáng để đánh giá liệu một mô hình nhỏ hơn có đáp ứng yêu cầu độ chính xác của bạn hay không. OrcaRouter cho phép bạn thử nghiệm nhiều mô hình trên cùng một tác vụ để so sánh chi phí và chất lượng.
Mô hình yêu cầu cả đầu vào văn bản và hình ảnh để tạo ra đầu ra. Trong thực tế, bạn có thể cung cấp một lời nhắc văn bản tối giản như 'Mô tả hình ảnh này' để xử lý hiệu quả riêng hình ảnh. Tuy nhiên, kiến trúc của mô hình luôn yêu cầu một thành phần văn bản trong tin nhắn; không có chế độ suy luận chỉ dùng hình ảnh. Các hình ảnh được coi là một phần của ngữ cảnh hội thoại, vì vậy bạn cũng có thể xâu chuỗi nhiều trao đổi hình ảnh-văn bản. Không có thông tin công khai về việc liệu mô hình có hỗ trợ đầu vào video hay khung hình hoạt ảnh hay không.
Tính đến thời điểm cắt kiến thức, OpenAI chưa công bố bất kỳ điểm chuẩn nào cho mô hình GPT-Image 1.5. Điều này thường xảy ra đối với các biến thể mô hình chuyên biệt có thể được dùng cho mục đích nội bộ hoặc truy cập sớm. Nếu không có điểm chuẩn chính thức, không thể đưa ra so sánh định lượng với các mô hình đa phương thức khác. Người dùng nên đánh giá mô hình trên bộ dữ liệu riêng của mình để xác định hiệu quả của nó cho các tác vụ cụ thể. Nền tảng của OrcaRouter cung cấp tính năng ghi nhật ký và phân tích có thể hỗ trợ trong các đánh giá như vậy.
Chi tiết về độ trễ của openai/gpt-image-1.5 không được công bố công khai. Nhìn chung, xử lý đầu vào hình ảnh thường chậm hơn so với các yêu cầu chỉ có văn bản vì mô hình phải mã hóa thông tin hình ảnh trước khi tạo văn bản. Thời gian phản hồi thực tế sẽ phụ thuộc vào các yếu tố như kích thước hình ảnh, độ phức tạp của yêu cầu và tải hiện tại của API. API của OrcaRouter bao gồm các thời gian chờ tiêu chuẩn có thể được cấu hình và người dùng nên thử nghiệm mô hình với kích thước hình ảnh của riêng họ để đánh giá hiệu suất thực tế. Hiện không có điểm chuẩn tốc độ nào được biết đến công khai cho mô hình này.
Điểm mạnh chính của GPT-Image 1.5 là khả năng tích hợp thông tin thị giác vào quá trình suy luận của mô hình ngôn ngữ, cho phép xử lý các tác vụ mà mô hình văn bản thuần túy không thể thực hiện được. Một hạn chế là thiếu dữ liệu hiệu suất công khai, khiến việc dự đoán độ chính xác trở nên khó khăn nếu không có kiểm tra thực nghiệm. Ngoài ra, mô hình này có thể kém phù hợp hơn đối với các tác vụ yêu cầu chi tiết hình ảnh độ phân giải cao (ví dụ: OCR tinh vi trên chữ rất nhỏ) so với các mô hình thị giác máy tính chuyên dụng. Cũng như tất cả các mô hình ngôn ngữ lớn khác, nó có thể tạo ra các mô tả có vẻ hợp lý nhưng không chính xác, do đó kết quả đầu ra cần được xác thực cho các trường hợp sử dụng quan trọng.
Định giá cho openai/gpt-image-1.5 được tính theo token: $8.00 mỗi triệu token đầu vào và $32.00 mỗi triệu token đầu ra. Các mức giá này do OpenAI thiết lập và được OrcaRouter chuyển tiếp mà không có phụ phí. Cả dữ liệu văn bản và hình ảnh đều được tính vào token đầu vào; hình ảnh được token hóa dựa trên kích thước và độ phân giải theo sơ đồ token hóa của OpenAI. Token đầu ra là văn bản do mô hình tạo ra. Việc thanh toán được đo đếm theo mỗi lần gọi API mà không yêu cầu mức sử dụng tối thiểu. OrcaRouter không tính thêm bất kỳ khoản phí nào cho mỗi yêu cầu.
Chi phí cho mỗi token tương đối cao so với các mô hình ngôn ngữ nhỏ, nhưng mô hình này được chuyên biệt hóa cho các tác vụ đa phương thức, nơi đầu vào hình ảnh là cần thiết. Đối với các ứng dụng xử lý nhiều hình ảnh với các lời nhắc văn bản ngắn, chi phí token đầu vào sẽ chiếm ưu thế. Đối với các ứng dụng tạo ra các mô tả dài và chi tiết, token đầu ra sẽ là yếu tố lớn hơn. Không có thông tin về việc mô hình có hỗ trợ lưu đệm lời nhắc (prompt caching) hay giảm giá cho việc sử dụng khối lượng lớn hay không. Các nhà phát triển được khuyến khích ước tính số lượng token cho các yêu cầu điển hình của họ trước khi cam kết sử dụng mô hình này.
API của OrcaRouter có thể hỗ trợ các cơ chế caching, nhưng điều này không dành riêng cho GPT-Image 1.5. Nếu caching được bật, các yêu cầu giống hệt nhau lặp đi lặp lại có thể giảm số lượng token được tính phí, nhưng nhà cung cấp (OpenAI) quyết định xem caching có được áp dụng hay không và ở mức độ nào. Người dùng nên tham khảo tài liệu của OrcaRouter để biết chi tiết về hành vi cache và tác động đến giá cước. Hiện tại, không có tuyên bố công khai nào từ OpenAI về caching cho mô hình này, vì vậy tốt nhất là giả định không có lợi ích từ caching.
Việc thanh toán cho việc sử dụng openai/gpt-image-1.5 trên OrcaRouter được xử lý thông qua hệ thống đo lường hiện có của nền tảng. Chi phí được tính dựa trên mức sử dụng token do API báo cáo, không có thêm phí nào. OrcaRouter cung cấp bảng điều khiển sử dụng để xem mức tiêu thụ gần như theo thời gian thực. Các phương thức thanh toán được cấu hình ở cấp tài khoản. Không có hoàn tiền hoặc tín dụng cho các yêu cầu thất bại trả về lỗi; các cuộc gọi API thành công sẽ được tính phí bình thường. Người dùng nên đảm bảo giới hạn tốc độ của họ phù hợp để tránh các khoản phí bất ngờ.
Để gọi openai/gpt-image-1.5 qua OrcaRouter, hãy đặt base URL thành https://api.orcarouter.ai/v1 và sử dụng tham số model 'openai/gpt-image-1.5' trong các yêu cầu chat completion của bạn. API này hoàn toàn tương thích với thư viện client Python của OpenAI; ví dụ, trong Python bạn sẽ đặt openai.api_base = 'https://api.orcarouter.ai/v1' và openai.api_key = 'your-orcarouter-key'. Các tin nhắn có thể bao gồm cả nội dung văn bản và hình ảnh bằng cách sử dụng mảng 'content' với loại 'image_url' hoặc 'image_base64', tuân theo định dạng tin nhắn đa phương thức của OpenAI.
API hỗ trợ các tham số chuẩn như 'messages' (bắt buộc), 'max_tokens', 'temperature', 'top_p', 'frequency_penalty', và 'presence_penalty'. Không có tham số đặc thù cho mô hình nào được ghi lại công khai ngoài các tham số chuẩn. Dữ liệu hình ảnh được truyền trong trường 'content' của tin nhắn hệ thống hoặc người dùng. Định dạng chính xác cho hình ảnh tuân theo quy ước của OpenAI: sử dụng 'type': 'image_url' với đối tượng 'image_url' chứa trường 'url' (dữ liệu base64 URI hoặc URL công khai). OrcaRouter có thể áp đặt các ràng buộc bổ sung; tham khảo tài liệu tham khảo API của họ để biết chi tiết.
Nếu bạn hiện đang sử dụng trực tiếp API của OpenAI cho GPT-Image 1.5, việc di chuyển sang OrcaRouter chỉ yêu cầu hai thay đổi: cập nhật base URL thành https://api.orcarouter.ai/v1 và thay thế khóa API OpenAI của bạn bằng khóa API OrcaRouter. Các định dạng yêu cầu và phản hồi hoàn toàn giống nhau, do đó không cần thay đổi mã cho cấu trúc tin nhắn. OrcaRouter cung cấp cùng mô hình với cùng mức giá của nhà cung cấp, không có phụ phí. Ngoài ra, OrcaRouter có thể cung cấp các tính năng giới hạn tốc độ, ghi nhật ký và các tính năng khác khác với dịch vụ của OpenAI.
Xác thực đến API của OrcaRouter được thực hiện thông qua một khóa API được gửi trong header 'Authorization': 'Authorization: Bearer <your-api-key>'. Các khóa API được lấy từ bảng điều khiển OrcaRouter. Không yêu cầu thêm OAuth hoặc chứng chỉ máy khách. Khóa phải được giữ bí mật và không được để lộ trong mã phía client. OrcaRouter hỗ trợ giới hạn tốc độ cho từng khóa và có thể tạo nhiều khóa cho các ứng dụng khác nhau. Các khóa có thể bị thu hồi bất kỳ lúc nào từ bảng điều khiển.
GPT-4o là một mô hình đa phương thức lớn hơn từ OpenAI, cũng chấp nhận đầu vào văn bản và hình ảnh. Sự khác biệt chính là GPT-4o có cửa sổ ngữ cảnh lớn hơn (128k token) và được thiết kế để suy luận đa năng, trong khi GPT-Image 1.5 là một mô hình chuyên biệt với kích thước ngữ cảnh không xác định. Giá của GPT-4o là $5/M đầu vào và $15/M đầu ra, khiến GPT-Image 1.5 đắt hơn (đặc biệt là đầu ra). Nếu không có điểm chuẩn, không rõ mô hình nào hoạt động tốt hơn trong các tác vụ liên quan đến hình ảnh. GPT-4o có thể tiết kiệm chi phí hơn cho khối lượng công việc hỗn hợp, trong khi GPT-Image 1.5 có thể được tinh chỉnh cụ thể cho việc hiểu văn bản-hình ảnh.
Có các mô hình thị giác máy tính chuyên dụng như CLIP, DALL-E hoặc các công cụ OCR chuyên biệt có thể hiệu quả hơn trong các tác vụ hình ảnh cụ thể (ví dụ: phân loại, sinh ảnh hoặc trích xuất văn bản). GPT-Image 1.5 kết hợp hiểu hình ảnh với sinh ngôn ngữ tự nhiên, mang lại tính linh hoạt nhưng có thể không đạt được độ chính xác của các mô hình được xây dựng chuyên biệt cho các tác vụ hẹp. Ví dụ, để trích xuất dữ liệu có cấu trúc từ tài liệu, một mô hình OCR chuyên dụng có thể có độ chính xác cao hơn và độ trễ thấp hơn, nhưng GPT-Image 1.5 có thể tuân theo các hướng dẫn ngôn ngữ tự nhiên phức tạp. Sự lựa chọn phụ thuộc vào độ phức tạp của tác vụ và nhu cầu về khả năng giải thích.
OrcaRouter cung cấp quyền truy cập vào openai/gpt-image-1.5 mà không thêm phí trên giá nhà cung cấp, nghĩa là bạn trả chính xác mức giá mà OpenAI đặt ra. Nó cung cấp API tương thích với OpenAI, giúp việc chuyển đổi trở nên dễ dàng đối với người dùng hiện tại. Ngoài ra, OrcaRouter có thể cung cấp các tính năng như theo dõi sử dụng, ghi log, quản lý giới hạn tốc độ và định tuyến đa mô hình mà không có sẵn trực tiếp từ OpenAI. Đối với người dùng cần so sánh nhiều mô hình hoặc quản lý khóa API tập trung, OrcaRouter cung cấp giao diện thống nhất mà không bị khóa nhà cung cấp.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1backgroundmoderationnoutput_compressionoutput_formatpartial_imagesqualitysize| Đầu vào / 1M tokens | $8.00 |
| Đầu ra / 1M tokens | $32.00 |
| Đọc cache / 1M | $1.25 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/openai/gpt-image-1.5Mở @misc{orcarouter_gpt_image_1_5,
title = {openai/gpt-image-1.5 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-image-1.5}
}openai. (n.d.). openai/gpt-image-1.5 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-image-1.5