GPT-5.5 là mô hình tiên phong của OpenAI được thiết kế cho các khối lượng công việc chuyên nghiệp phức tạp, xây dựng dựa trên GPT-5.4 với khả năng suy luận mạnh hơn, độ tin cậy cao hơn và hiệu quả token được cải thiện trên các tác vụ khó. Nó có tính năng 1M+ token...
GPT-5.5 là một mô hình ngôn ngữ từ OpenAI được thiết kế cho đầu ra mở rộng và đầu vào đa phương thức. Nó chấp nhận tệp, hình ảnh và văn bản, và có thể tạo ra tới 128,000 token trong một lần hoàn…
Khi được cung cấp một tệp tin, GPT-5.5 có thể đọc và phân tích nội dung của nó. Điều này bao gồm việc trích xuất thông tin từ tài liệu, tóm tắt nội dung, trả lời các câu hỏi về tài liệu, hoặc chuyển đổi dữ liệu sang một định dạng khác. Ví dụ, bạn có thể tải lên một tệp PDF nhiều trang và yêu cầu một bản tóm tắt có cấu trúc hoặc các điểm dữ liệu cụ thể. Mô hình xử lý tệp tin như một phần đầu vào, kết hợp với bất kỳ văn bản hoặc hình ảnh đi kèm. Khả năng này hữu ích cho việc tự động hóa việc xem xét tài liệu, trích xuất dữ liệu và tạo báo cáo từ các tệp tin.
GPT-5.5 có thể diễn giải hình ảnh được cung cấp dưới dạng đầu vào. Điều này bao gồm nhận dạng đối tượng, đọc văn bản từ hình ảnh, mô tả cảnh, phân tích biểu đồ và trả lời các câu hỏi về nội dung trực quan. Ví dụ, bạn có thể cung cấp một hình ảnh biểu đồ và yêu cầu diễn giải bằng văn bản về các xu hướng, hoặc một bức ảnh chụp bảng trắng và yêu cầu các mục hành động. Mô hình xử lý hình ảnh cùng với bất kỳ đầu vào văn bản và tệp nào, cho phép các tác vụ suy luận đa phương thức kết hợp thông tin trực quan và văn bản.
Mặc dù GPT-5.5 cung cấp đầu ra lớn và đầu vào đa phương thức, nhưng nó có thể là quá mức cần thiết cho các tác vụ đơn giản. Nếu trường hợp sử dụng của bạn chỉ liên quan đến tạo văn bản ngắn (ví dụ: trả lời email, đoạn mã ngắn, phân loại) mà không cần nhập tệp hoặc hình ảnh, một mô hình nhỏ hơn, rẻ hơn như GPT-4o mini của OpenAI (nếu có) có thể hiệu quả hơn về chi phí. Tương tự, nếu bạn không yêu cầu đầu ra 128k-token, các mô hình có giới hạn đầu ra nhỏ hơn có thể đáp ứng được. Hãy đánh giá kích thước đầu vào-đầu ra điển hình và nhu cầu phương thức của bạn trước khi chọn GPT-5.5 để tránh trả tiền cho dung lượng bạn sẽ không sử dụng.
Điểm số 93.9 của mô hình trên τ²-Bench cho thấy hiệu suất mạnh mẽ trong các tác vụ agentic liên quan đến sử dụng công cụ, tuân theo hướng dẫn nhiều bước và duy trì tính nhất quán qua nhiều hành động. Điều này bao gồm các kịch bản như duyệt web, gọi API, truy vấn cơ sở dữ liệu hoặc thực thi mã trong vòng lặp. Năng lực đầu ra lớn cũng cho phép mô hình tạo ra các chuỗi dài các lệnh gọi công cụ hoặc bước suy luận mà không bị cắt ngắn. Tuy nhiên, điểm số chuẩn phản ánh hiệu suất trên các bộ kiểm thử cụ thể; hiệu suất agentic trong thực tế có thể thay đổi tùy thuộc vào độ phức tạp của tác vụ và chất lượng của các công cụ có sẵn.
τ²-Bench là một điểm chuẩn được thiết kế để đánh giá khả năng của một tác nhân trong việc thực hiện các tác vụ phức tạp, nhiều bước bằng cách sử dụng các công cụ. Nó kiểm tra mức độ mà một mô hình có thể làm theo hướng dẫn, lập kế hoạch hành động, sử dụng các công cụ bên ngoài (như công cụ tìm kiếm, trình thông dịch mã, hoặc API) và sửa lỗi qua nhiều bước. Điểm số 93.9 mà GPT-5.5 đạt được đặt mô hình này ở mức hiệu suất cao trên điểm chuẩn này, cho thấy mô hình có thể thực thi đáng tin cậy các quy trình tác nhân với tỷ lệ thất bại tối thiểu. Đây là một điểm dữ liệu; các điểm chuẩn khác có thể cho thấy các điểm mạnh hoặc điểm yếu khác nhau.
Điểm τ²-Bench 93.9 cho thấy GPT-5.5 đặc biệt mạnh trong các tác vụ yêu cầu suy luận kéo dài và sử dụng công cụ qua nhiều lượt. Benchmark này thưởng cho các mô hình có thể diễn giải đúng hướng dẫn, chọn đúng công cụ và phục hồi sau sai lầm. Do đó, GPT-5.5 có lẽ rất phù hợp để xây dựng các tác nhân tự trị cần hoàn thành tác vụ với ít sự can thiệp của con người. Thêm vào đó, khoảng trống đầu ra lớn của mô hình có thể hữu ích trong các tình huống mà các bước suy luận trung gian dài. Tuy nhiên, các benchmark này có phạm vi hẹp; những khả năng khác như viết sáng tạo hay tri thức thông thường có thể không được đo lường trực tiếp bởi τ²-Bench.
Dữ liệu được cung cấp chỉ bao gồm một điểm chuẩn duy nhất (τ²-Bench) và không xác định hiệu suất trên các điểm chuẩn phổ biến khác như MMLU, HumanEval hay GSM8K. Do đó, các khả năng về kiến thức tổng quát, suy luận toán học và sinh mã nguồn không được định lượng ở đây. Độ dài ngữ cảnh đầu vào của mô hình cũng không được nêu rõ, vì vậy bạn có thể cần phải tự kiểm tra cho trường hợp sử dụng cụ thể của mình. Ngoài ra, mô hình có thể xử lý hình ảnh và tệp tin, nhưng không có số liệu về độ trễ hay tỷ lệ lỗi được cung cấp. Người dùng nên đánh giá GPT-5.5 trên các tác vụ của riêng mình để hiểu rõ những hạn chế thực tế của nó.
Dữ liệu được cung cấp không bao gồm các số liệu về độ trễ hoặc tốc độ cho GPT-5.5. Là một mô hình lớn với khả năng xuất ra 128k token, thời gian phản hồi sẽ phụ thuộc vào một số yếu tố: độ dài của cả đầu vào và đầu ra, độ phức tạp của yêu cầu và tải máy chủ hiện tại trên OrcaRouter. Đối với các prompt ngắn và đầu ra nhỏ, độ trễ có thể chấp nhận được; đối với đầu ra có độ dài tối đa, có thể kéo dài hơn đáng kể. Để ước tính tốc độ, bạn có thể đánh giá mô hình bằng cách sử dụng API của OrcaRouter với các payload điển hình cho trường hợp sử dụng của bạn. Không có bảo đảm về chất lượng dịch vụ nào được đề cập trong thông tin có sẵn.
Chi tiết giá cho GPT-5.5 không được bao gồm trong dữ liệu được cung cấp. Trên OrcaRouter, phí thường dựa trên số lượng token đầu vào và đầu ra, với mức giá riêng cho xử lý văn bản, hình ảnh và tệp. Để có giá chính xác, hãy tham khảo trang giá của OrcaRouter hoặc liên hệ bộ phận hỗ trợ của họ. Lưu ý rằng số lượng token đầu ra lớn (lên đến 128k) có thể tích lũy chi phí đáng kể cho các bản tạo dài, vì vậy bạn nên đặt tham số `max_tokens` phù hợp trong các lệnh gọi API của mình để kiểm soát chi phí.
Nếu không có mức giá cụ thể, các sự đánh đổi chung vẫn áp dụng. Các mô hình có dung lượng đầu ra lớn hơn và đầu vào đa phương thức có xu hướng đắt hơn trên mỗi token so với các lựa chọn đơn giản hơn. Đối với các tác vụ không yêu cầu toàn bộ 128k đầu ra hoặc đầu vào đa phương thức, một mô hình nhỏ hơn có thể tiết kiệm hơn. Ngoài ra, việc xử lý hình ảnh và tệp tin phát sinh thêm chi phí, thường được tính theo kích thước hoặc số lượng hình ảnh. Nếu pipeline của bạn chủ yếu sử dụng văn bản, hãy cân nhắc xem khả năng xử lý tệp/hình ảnh có xứng đáng với mức giá cao hơn hay không. Lưu trữ đệm (caching) hoặc xử lý theo lô (batch processing) có thể giảm chi phí; hãy hỏi OrcaRouter về bất kỳ chương trình giảm giá nào có sẵn cho nội dung lặp lại.
Thông tin được cung cấp không chỉ rõ bất kỳ cơ chế lưu đệm nào cho GPT-5.5 trên OrcaRouter. Lưu đệm có thể giảm chi phí bằng cách tái sử dụng các kết quả đã được tính toán trước đó cho các yêu cầu giống hệt hoặc tương tự. Một số nhà cung cấp API cung cấp tính năng lưu đệm tự động cho các prompt thường dùng. Để xác định xem có hỗ trợ lưu đệm hay không, hãy kiểm tra tài liệu của OrcaRouter hoặc liên hệ với bộ phận hỗ trợ của họ. Nếu không có tính năng lưu đệm, bạn có thể triển khai bộ lưu đệm riêng ở cấp ứng dụng để tránh các lệnh gọi trùng lặp, đặc biệt đối với các truy vấn phổ biến hoặc đầu vào tĩnh.
Để ước tính chi phí, bạn cần tỷ lệ theo token cho đầu vào và đầu ra, cùng với các khoản phụ phí cho hình ảnh hoặc tệp. Vì tỷ lệ không được cung cấp, bạn có thể bắt đầu bằng cách thực hiện một vài cuộc gọi thử nghiệm với các tải trọng đại diện và kiểm tra số tiền đã được tính phí trong bảng điều khiển sử dụng của OrcaRouter. Đối với các cuộc gọi chỉ văn bản, nhân số lượng token đầu vào và số lượng token đầu ra với tỷ lệ tương ứng. Đối với các cuộc gọi đa phương thức, đếm hình ảnh và kích thước tệp theo quy tắc định giá của OrcaRouter. Lưu ý rằng đầu ra tối đa 128k có thể dẫn đến việc sử dụng token cao; đặt giới hạn `max_tokens` thấp hơn có thể ngăn ngừa các hóa đơn bất ngờ.
Bạn có thể gọi GPT-5.5 thông qua API tương thích với OpenAI của OrcaRouter. URL cơ sở là https://api.orcarouter.ai/v1. Sử dụng ID mô hình "openai/gpt-5.5" trong các yêu cầu của bạn. Bất kỳ thư viện khách hàng OpenAI tiêu chuẩn nào (Python, JavaScript, v.v.) đều có thể được sử dụng bằng cách chỉ thay đổi URL cơ sở và khóa API. Ví dụ sử dụng thư viện openai của Python: đặt `openai.api_base = "https://api.orcarouter.ai/v1"` và `openai.api_key = "your-key"`. Sau đó gọi `openai.ChatCompletion.create(model="openai/gpt-5.5", messages=[...])`.
Bởi vì OrcaRouter cung cấp một endpoint tương thích với OpenAI, bạn có thể sử dụng hầu hết các tham số tiêu chuẩn từ OpenAI Chat Completion API. Bao gồm các tham số như `temperature`, `max_tokens`, `top_p`, `frequency_penalty`, `presence_penalty`, `stop`, và `n`. Đối với đầu vào đa phương thức, bạn có thể bao gồm nội dung hình ảnh hoặc tệp trong mảng messages theo định dạng API vision của OpenAI (sử dụng `content` với loại `image_url` hoặc `file`). Tham số `max_tokens` kiểm soát độ dài đầu ra lên đến 128.000. Lưu ý rằng đặt `max_tokens` quá cao có thể làm tăng độ trễ và chi phí.
Việc di chuyển khá đơn giản nhờ tương thích API. Chỉ cần thay URL cơ sở OpenAI bằng của OrcaRouter (https://api.orcarouter.ai/v1) và cập nhật khóa API của bạn. Đổi tên mô hình từ `gpt-5.5` (hoặc bất kỳ tên nào bạn đã dùng trên OpenAI) thành `openai/gpt-5.5`. Hầu hết các thay đổi mã nguồn chỉ giới hạn ở cấu hình. Nếu bạn đang sử dụng bất kỳ tính năng đặc thù nào của OpenAI không được OrcaRouter hỗ trợ (ví dụ: một số biến thể streaming hoặc gọi hàm), hãy kiểm tra chúng để đảm bảo tương thích. Cùng một định dạng tin nhắn, bao gồm nội dung đa phương thức, vẫn hoạt động như mong đợi.
Tính năng streaming được hỗ trợ thông qua API tương thích với OpenAI của OrcaRouter. Đặt `stream=True` trong yêu cầu của bạn để nhận token theo từng bước. Điều này có thể cải thiện độ trễ cảm nhận đối với các đầu ra dài và cho phép bạn xử lý văn bản khi nó đến. Đối với các đầu ra lớn (lên đến 128k token), streaming có thể rất quan trọng để tránh hết thời gian chờ. Lưu ý rằng streaming có thể ảnh hưởng đến cách tính chi phí giống như non-streaming (bạn trả tiền cho tất cả token được tạo ra). Đảm bảo ứng dụng khách của bạn có thể xử lý các phản hồi streaming, đặc biệt đối với đầu vào đa phương thức khi sự kiện đầu tiên có thể bị trì hoãn trong khi mô hình xử lý hình ảnh.
So với các mô hình đời trước như GPT-4, GPT-4 Turbo hay GPT-4o, GPT-5.5 cung cấp đầu ra tối đa lớn hơn (128k so với thường là 4k-32k trên các biến thể cũ hơn) và khả năng nhập liệu đa phương thức (tệp, hình ảnh, văn bản). Điểm τ²-Bench 93,9 cho thấy hiệu suất tác nhân được cải thiện. Tuy nhiên, sự khác biệt chính xác về kiến trúc và dữ liệu huấn luyện không được công bố. Các mô hình cũ hơn có thể nhanh hơn hoặc rẻ hơn cho các tác vụ đơn giản. Đối với các tác vụ văn bản thuần túy không cần đầu ra lớn hoặc đầu vào đa phương thức, một mô hình nhỏ hơn có thể hiệu quả hơn.
So sánh trực tiếp bị hạn chế nếu không có dữ liệu điểm chuẩn trên cùng một tác vụ. Nhiều đối thủ cạnh tranh (ví dụ: Anthropic Claude, Google Gemini) cũng hỗ trợ đầu vào đa phương thức và có cửa sổ ngữ cảnh lớn. Điểm số τ²-Bench 93,9 của GPT-5.5 là một chỉ báo về hiệu suất tác nhân; các mô hình khác có thể có điểm số tương tự hoặc khác biệt. Đầu ra tối đa 128k của GPT-5.5 tương đối cao. Khi lựa chọn giữa các nhà cung cấp, hãy cân nhắc các yếu tố như giá cả trên OrcaRouter, độ ổn định API, hỗ trợ phương thức cụ thể (định dạng tệp) và yêu cầu về độ trễ của ứng dụng của bạn.
Các mô hình mã nguồn mở (ví dụ: Llama 3, Mistral) thường rẻ hơn và cho phép kiểm soát hoàn toàn việc triển khai, nhưng có thể thiếu khả năng tích hợp đa phương thức hoặc hiệu suất tác nhân ở cùng mức độ. GPT-5.5, truy cập qua OrcaRouter, là mô hình thương mại đóng với giá API. Khả năng xuất 128k và nhập tệp/hình ảnh của nó là những tính năng mà các mô hình mã nguồn mở có thể không đạt được nếu không có cơ sở hạ tầng bổ sung. Đối với dữ liệu nhạy cảm cần triển khai cục bộ, mã nguồn mở có thể là lựa chọn ưu tiên. Đối với sự tiện lợi và khả năng toàn diện có sẵn ngay lập tức, GPT-5.5 trên OrcaRouter là một lựa chọn mạnh mẽ.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key="$ORCAROUTER_API_KEY",
)
response = client.chat.completions.create(
model="openai/gpt-5.5",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningresponse_formatseedstreamstructured_outputstool_choicetools| Bậc | Đầu vào / 1M tokens | Đầu ra / 1M tokens | Đọc cache / 1M |
|---|---|---|---|
| ≤ 272K | $5.00 | $30.00 | $0.500 |
| ≤ ∞ | $10.00 | $45.00 | $1.00 |
| Bậc được chọn theo số token đầu vào của mỗi yêu cầu | |||
Ước tính theo giá niêm yết
Giá theo bậc — ước tính này dùng mức giá bậc cơ bản.
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
GET /api/public/models/openai/gpt-5.5Mở @misc{orcarouter_gpt_5_5,
title = {GPT-5.5 API},
author = {OpenAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-5.5}
}OpenAI. (2026). GPT-5.5 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-5.5