Mô hình hàng đầu của OpenAI với ngữ cảnh 400k token, đầu vào đa phương thức, và đầu ra 272k token, được truy cập qua OrcaRouter với giá của nhà cung cấp.
Đây là một phiên bản chụp nhanh cụ thể của GPT‑5 Pro của OpenAI, được tối ưu hóa cho các tác vụ suy luận phức tạp và ngữ cảnh dài. Mô hình này chấp nhận đầu vào là hình ảnh, văn bản và tệp tin, xử lý…
Mô hình chấp nhận ba loại đầu vào: văn bản, hình ảnh và tệp tin. Văn bản có thể là chuỗi UTF‑8 tiêu chuẩn. Hình ảnh có thể được cung cấp dưới dạng URL hoặc dữ liệu mã hóa base64, và mô hình có thể phân tích nội dung trực quan như ảnh chụp, sơ đồ và ảnh chụp màn hình. Đầu vào tệp bao gồm nhiều định dạng khác nhau (ví dụ: PDF, Word, Excel, văn bản thuần) cho phép mô hình đọc và suy luận trên các tài liệu có cấu trúc hoặc phi cấu trúc. Tất cả các phương thức đều có thể được kết hợp trong một prompt duy nhất, cho phép thực hiện các tác vụ như trích xuất thông tin từ ảnh chụp biểu đồ và so sánh với báo cáo văn bản.
Cửa sổ ngữ cảnh lớn lý tưởng cho các tác vụ yêu cầu duy trì tính mạch lạc trên các chuỗi rất dài. Ví dụ bao gồm phân tích toàn bộ một bài báo nghiên cứu hoặc bản tóm tắt pháp lý trong một lần, thực hiện lập luận nhiều bước trên lịch sử hội thoại dài, hoặc xử lý toàn bộ mã nguồn để đưa ra gợi ý tái cấu trúc. Nó cũng hỗ trợ các chiến lược kỹ thuật prompt như sử dụng bộ hướng dẫn dài hoặc các ví dụ few‑shot mà không bị cắt bớt. Đối với các tác vụ phù hợp tự nhiên trong các ngữ cảnh ngắn hơn, các mô hình nhỏ hơn và rẻ hơn có thể hiệu quả hơn về chi phí.
Trong khi GPT‑5 Pro cung cấp khả năng cao nhất, chi phí của nó ($15/$120 mỗi triệu token) cao hơn đáng kể so với các mô hình như GPT‑4o mini hoặc các giải pháp nguồn mở. Nếu tác vụ của bạn nằm trong phạm vi 8k–32k token và không yêu cầu đầu vào đa phương thức, một mô hình nhỏ hơn có thể mang lại kết quả chấp nhận được với chi phí chỉ bằng một phần nhỏ. Ngoài ra, nếu độ dài đầu ra nhỏ, chi phí trên mỗi token sẽ chiếm ưu thế. Hãy đánh giá xem liệu bạn có thực sự cần ngữ cảnh 400k và đầu ra 272k hay không; nếu không, hãy cân nhắc các tùy chọn chi phí thấp hơn trên OrcaRouter.
Các tệp đầu vào được xử lý theo quy trình xử lý tệp của OpenAI. Mô hình có thể đọc văn bản từ các định dạng tệp được hỗ trợ và diễn giải hình ảnh hoặc bảng được nhúng. Đối với các tệp rất lớn, số lượng token của nội dung được trích xuất sẽ được tính vào cửa sổ ngữ cảnh. Nên tiền xử lý tệp để chỉ trích xuất các phần liên quan nếu việc sử dụng token là một vấn đề cần quan tâm. API OrcaRouter chấp nhận tệp thông qua cùng cấu trúc tham số như API của OpenAI, thường là qua URL tệp hoặc mã hóa base64.
Không có số liệu benchmark cụ thể nào được cung cấp trong danh sách này cho snapshot này. Là một mô hình hàng đầu của OpenAI, nó được kỳ vọng sẽ đạt được kết quả tốt nhất trên các benchmark NLP, lý luận và đa phương thức phổ biến so với các mẫu GPT trước đó. Người dùng nên tự đánh giá trên các tác vụ đại diện của mình để xác nhận sự phù hợp. Cửa sổ ngữ cảnh lớn không làm giảm hiệu suất trên các đầu vào ngắn; mô hình vẫn giữ được sức mạnh lý luận bất kể độ dài ngữ cảnh.
Độ trễ thường cao hơn so với các mô hình nhỏ hơn do khả năng xử lý ngữ cảnh lớn và đầu ra dài. Thời gian đến token đầu tiên và tốc độ sinh tổng thể phụ thuộc vào độ dài prompt, độ dài đầu ra và tải máy chủ OpenAI hiện tại. Đối với các tác vụ chỉ yêu cầu phản hồi ngắn, các mô hình nhanh hơn như GPT‑4o mini có thể phản hồi nhanh hơn. OrcaRouter không gây ra độ trễ đáng kể ngoài thời gian phản hồi của nhà cung cấp. Không có số liệu độ trễ cụ thể nào cho ảnh chụp nhanh này.
Các điểm mạnh của nó bao gồm lý luận đa bước sâu, xử lý ngữ cảnh rất dài với mức độ mất thông tin tối thiểu, hiểu đa phương thức (kết hợp văn bản, hình ảnh, tệp tin) và tạo ra đầu ra có cấu trúc, mạch lạc lên tới 272k token. Nó vượt trội trong các tác vụ liên quan đến hướng dẫn phức tạp, tập dữ liệu lớn hoặc yêu cầu tổng hợp thông tin từ nhiều nguồn trong một lời nhắc duy nhất. Ví dụ, nó có thể phân tích một tài liệu 300 trang và tạo ra một bản tóm tắt toàn diện với trích dẫn.
Mặc dù mạnh mẽ, mô hình này không phải là hoàn hảo. Nó vẫn có thể tạo ra các ảo giác, đặc biệt là về các chủ đề ít phổ biến hoặc khi ngữ cảnh chứa thông tin mâu thuẫn. Cửa sổ ngữ cảnh lớn không loại bỏ được lỗi trong cơ chế chú ý; đầu vào dài đôi khi có thể khiến mô hình bỏ sót các chi tiết nhỏ. Ngoài ra, giới hạn token đầu ra cao có thể dẫn đến các phản hồi rất dài nhưng không nhất thiết chính xác hoàn toàn. Người dùng nên thực hiện xác minh đối với các đầu ra có độ quan trọng cao. Giá cả là một hạn chế đối với các ứng dụng nhạy cảm về ngân sách.
Token đầu vào được tính phí $15.00 cho mỗi 1 triệu token, và token đầu ra là $120.00 cho mỗi 1 triệu token. Đây là mức giá chính xác do OpenAI đặt ra; OrcaRouter không cộng thêm bất kỳ khoản phụ phí nào. Ví dụ, một prompt tiêu thụ 50.000 token đầu vào và tạo ra 10.000 token đầu ra sẽ có chi phí $0.75 cho đầu vào và $1.20 cho đầu ra, tổng cộng $1.95. Không có khoản phí bổ sung nào ngoài mức tiêu thụ theo token.
Tỉ lệ 8× giữa giá đầu vào và đầu ra phản ánh chi phí tính toán lớn hơn cho việc tạo ra token. Việc tạo ra các phản hồi dài và mạch lạc đòi hỏi nhiều xử lý hơn so với mã hóa đầu vào. Giá đầu ra cao cũng khuyến khích việc tạo prompt hiệu quả: đối với các tác vụ có thể hoàn thành với câu trả lời ngắn, sử dụng mô hình có đầu ra thấp hơn có thể tiết kiệm hơn. Với chính sách không đánh dấu giá của OrcaRouter, bạn trả chính xác chi phí của nhà cung cấp cho mỗi token.
OrcaRouter không cung cấp dịch vụ lưu trữ token tạm thời hoặc chương trình giảm giá riêng cho mô hình này; bạn sẽ bị tính phí theo token theo giá của nhà cung cấp. Một số nhà cung cấp có thể đưa ra mức giá thấp hơn cho xử lý theo lô hoặc dung lượng dự trữ, nhưng bản chụp này chỉ khả dụng dưới dạng lệnh gọi API theo yêu cầu. Nếu bạn có khối lượng sử dụng rất lớn, hãy liên hệ bộ phận hỗ trợ của OrcaRouter để thảo luận về các thỏa thuận tùy chỉnh tiềm năng, mặc dù không có chương trình giảm giá cụ thể nào được quảng cáo.
Ước tính bằng cách tính số token trong prompt trung bình của bạn và độ dài đầu ra dự kiến. Sử dụng tokeniser của OpenAI hoặc endpoint đếm token của API OrcaRouter. Ví dụ, một prompt 100.000 token với phản hồi 50.000 token có chi phí $1,50 cho đầu vào + $6,00 cho đầu ra = $7,50 mỗi lần gọi. Nếu ứng dụng của bạn thực hiện hàng nghìn lần gọi như vậy, chi phí có thể tăng nhanh chóng. Cân nhắc sử dụng các mô hình nhỏ hơn cho các tác vụ đơn giản và dành GPT‑5 Pro cho những tác vụ đòi hỏi cao nhất.
Sử dụng URL cơ sở OrcaRouter https://api.orcarouter.ai/v1 với ID mô hình "openai/gpt-5-pro-2025-10-06". API này hoàn toàn tương thích với endpoint chat completions của OpenAI. Một yêu cầu điển hình bao gồm khóa API của bạn, tham số model, mảng messages và các tham số tùy chọn như max_tokens, temperature và top_p. Đối với đầu vào đa phương thức, hãy bao gồm các trường image_url hoặc file_url trong nội dung tin nhắn. Phản hồi được trả về theo cùng định dạng với API của OpenAI.
Tham số max_tokens có thể được đặt lên đến 272.000 (tùy thuộc vào giới hạn cửa sổ ngữ cảnh). Phạm vi temperature là 0–2, với các giá trị thấp hơn tạo ra kết quả đầu ra có tính xác định cao hơn. top_p (0–1) kiểm soát lấy mẫu nucleus. frequency_penalty và presence_penalty nằm trong khoảng từ –2 đến 2. Đối với đầu vào đa phương thức, bạn phải chỉ định loại nội dung (text, image_url, file_url). Tham số stop chấp nhận tối đa bốn chuỗi. Tất cả các tham số khác được hỗ trợ bởi tính năng chat completions của OpenAI cũng được hỗ trợ.
Thay đổi URL cơ sở từ https://api.openai.com/v1 thành https://api.orcarouter.ai/v1, và thay thế khóa API bằng khóa API OrcaRouter của bạn. Sử dụng chính xác tên mô hình "openai/gpt-5-pro-2025-10-06". Tất cả các cấu trúc yêu cầu và phản hồi khác vẫn giữ nguyên. Không cần đào tạo lại hay thay đổi mã nguồn ngoài endpoint và khóa. OrcaRouter hỗ trợ các chế độ truyền phát và không truyền phát tương tự. Hãy kiểm tra bằng một truy vấn chi phí thấp trước để xác minh hóa đơn và chức năng.
Xác thực sử dụng khóa API được gửi trong header Authorization (Bearer token). Giới hạn tốc độ của OrcaRouter có thể khác với giới hạn trực tiếp của OpenAI; hãy kiểm tra bảng điều khiển tài khoản OrcaRouter của bạn để biết chi tiết. Đối với việc sử dụng khối lượng lớn, hãy cân nhắc gộp yêu cầu hoặc liên hệ hỗ trợ để tăng giới hạn. Bản thân mô hình kế thừa các giới hạn tốc độ của OpenAI ở phần backend. Đảm bảo ứng dụng của bạn xử lý lỗi giới hạn tốc độ (HTTP 429) bằng logic thử lại.
GPT‑4 Turbo (thường có cửa sổ ngữ cảnh 128k và đầu ra tối đa 16k) rẻ hơn và nhanh hơn cho các tác vụ tiêu chuẩn. GPT‑5 Pro cung cấp gấp hơn ba lần ngữ cảnh và độ dài đầu ra gấp 17 lần, cho phép thực hiện các tác vụ mà GPT‑4 Turbo không thể xử lý trong một lần gọi. Tuy nhiên, chi phí thấp hơn của GPT‑4 Turbo ($10/$30 cho mỗi 1M token) khiến nó kinh tế hơn cho các prompt ngắn. Chọn GPT‑5 Pro khi bạn cần khả năng ngữ cảnh hoặc đầu ra mở rộng; nếu không, GPT‑4 Turbo thường là đủ.
GPT‑4o hỗ trợ đầu vào đa phương thức (văn bản, hình ảnh) với ngữ cảnh 128k và đầu ra 16k. Nó thường nhanh hơn và rẻ hơn ($5/$15 mỗi 1 triệu token) so với GPT‑5 Pro. Ngữ cảnh và dung lượng đầu ra lớn hơn của GPT‑5 Pro giúp nó phù hợp hơn cho phân tích sâu các tài liệu rất dài hoặc tạo nội dung dài. Đối với các tác vụ đa phương thức điển hình nằm trong giới hạn của GPT‑4o, GPT‑4o mang lại tỷ lệ hiệu năng trên giá cả tốt hơn. Cả hai mô hình đều có sẵn thông qua OrcaRouter.
Nếu trường hợp sử dụng của bạn không yêu cầu hệ sinh thái của OpenAI hoặc hiệu năng cụ thể của GPT‑5 Pro, các mô hình từ Anthropic (Claude 3.5 Sonnet) hoặc Google (Gemini 1.5 Pro) có thể cung cấp khả năng tương đương ở các mức giá khác nhau hoặc chính sách xử lý dữ liệu khác nhau. Ví dụ, Claude 3.5 Sonnet có ngữ cảnh 200k và chi phí đầu ra thấp hơn. Hãy đánh giá dựa trên độ trễ, định giá theo token, vị trí lưu trữ dữ liệu và các chuẩn đánh giá cụ thể liên quan đến tác vụ của bạn. OrcaRouter cung cấp quyền truy cập vào nhiều nhà cung cấp để dễ dàng so sánh.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-5-pro-2025-10-06",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningresponse_formatseedstreamstructured_outputstool_choicetools| Đầu vào / 1M tokens | $15.00 |
|---|---|
| Đầu ra / 1M tokens | $120.00 |
| Tiền tệ | USD |
Ước tính theo giá niêm yết
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/openai/gpt-5-pro-2025-10-06Mở @misc{orcarouter_gpt_5_pro_2025_10_06,
title = {openai/gpt-5-pro-2025-10-06 API},
author = {openai},
year = {n.d.},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-5-pro-2025-10-06}
}openai. (n.d.). openai/gpt-5-pro-2025-10-06 API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-5-pro-2025-10-06