GPT-6 Astra là mô hình chủ lực của OpenAI cho các tác vụ đầu-cuối đòi hỏi cao và kéo dài — phân tích nâng cao, kỹ thuật phần mềm, nghiên cứu chuyên sâu, công việc khoa học và tạo tài liệu. Mô hình kết hợp cửa sổ ngữ cảnh 1M token với đầu vào đa phương thức (văn bản, hình ảnh, tệp) và khả năng suy luận thường trực, với mức độ nỗ lực có thể tùy chỉnh từ thấp đến tối đa để đánh đổi giữa độ trễ và chất lượng. Đây là mô hình hỗ trợ sẵn việc sử dụng công cụ và đầu ra có cấu trúc: hỗ trợ đầy đủ function calling, response_format / structured outputs, seed và web search dưới dạng công cụ. Astra tương thích cả định dạng chat-completions của OpenAI lẫn Responses API gốc, do đó có thể tích hợp ngay vào các hệ thống tương thích OpenAI hiện có và trả về đầy đủ chuỗi suy luận khi sử dụng giao diện Responses. Trên Artificial Analysis, mô hình đạt chỉ số Intelligence Index là 54.7, Coding Index là 76.9 và Agentic Index là 51.6. Lưu ý về biểu giá phân tầng: các yêu cầu trên 272K prompt token sẽ được tính theo mức giá cho ngữ cảnh dài.
GPT-6 Astra là mô hình chủ lực (flagship) trên OrcaRouter từ nhà cung cấp OpenAI. Mô hình này chấp nhận đầu vào văn bản, hình ảnh và tệp, cung cấp cửa sổ ngữ cảnh 1,050,000 token và có thể tạo ra tối…
Một cửa sổ ngữ cảnh 1.050.000 token cho phép một yêu cầu duy nhất xử lý lượng thông tin tương đương với nhiều bài nghiên cứu dài, một kho mã nguồn lớn, hoặc một hồ sơ quy định dày đặc trong một lần truy cập. Đây không phải là ước tính chính xác về số trang vì độ dài trang phụ thuộc vào định dạng, nhưng đủ cho nhiều đầu vào để tránh phải xây dựng logic phân đoạn từ trước. Do đó, mô hình hữu ích cho việc tóm tắt, so sánh và trả lời câu hỏi trên toàn bộ đầu vào. Hàm ý kỹ thuật chính là kích thước đầu vào ảnh hưởng đến chi phí, độ trễ và khả năng mô hình tập trung vào bằng chứng tốt nhất. Các prompt rất dài nên được viết với ranh giới tài liệu hoặc tiêu đề rõ ràng, vì mô hình phải tự chọn nội bộ phần nào quan trọng. OrcaRouter xử lý yêu cầu như một lượt chat hoàn chỉnh duy nhất, vì vậy ứng dụng của bạn chỉ cần quản lý thời gian chờ mạng và mức sử dụng token. Các đầu vào vượt quá giới hạn ngữ cảnh được liệt kê vẫn cần tiền xử lý hoặc phân đoạn.
Số token đầu ra tối đa là 128.000. Điều này cho phép xuất ra các nội dung dài mà các mô hình API cũ hơn buộc phải chia thành nhiều lần sinh khác nhau. GPT-6 Astra có thể tạo một báo cáo mở rộng, một bản dịch hoàn chỉnh, một bản diff có cấu trúc của một mã nguồn lớn, hoặc một tập dữ liệu JSON có cấu trúc trong một lần hoàn thành duy nhất. Khi bạn yêu cầu gần mức giới hạn, API sẽ tiêu tốn nhiều thời gian và tài nguyên tính toán hơn so với một câu trả lời ngắn. Thông lệ tốt nhất là đặt giá trị max_tokens mong muốn thay vì yêu cầu mức trần cho mỗi lần gọi. Tính đến bản ghi này, OrcaRouter không công bố quy ước tự động tiếp tục nào. Nếu một quá trình sinh dài tiến gần đến giới hạn đầu ra và bị cắt ngắn, ứng dụng của bạn phải phát hiện điều kiện hoàn tất quá trình sinh và phản hồi tương ứng. Con số 128.000 token là giới hạn kiến trúc của mô hình, không phải là mục tiêu cho mỗi yêu cầu.
Catalog không cung cấp bộ benchmark cho từng nhiệm vụ, nhưng các thuộc tính được cung cấp cho thấy các mẫu sử dụng cụ thể. Năng lực trả lời câu hỏi độ chính xác cao được thể hiện qua điểm 96,1 trên GPQA Diamond. Kiểm toán và nghiên cứu ngữ cảnh dài được thể hiện qua cửa sổ 1.050.000 token và khả năng nhập tệp. Diễn giải hình ảnh và tệp được thể hiện qua danh sách phương thức đầu vào, và giới hạn đầu ra 128.000 token cho phép tạo ra các sản phẩm bàn giao cuối cùng có quy mô lớn. Kết hợp lại, những đặc điểm trên khiến GPT-6 Astra trở thành lựa chọn hợp lý cho suy luận cấp độ sau đại học, rà soát hợp đồng, phân tích bài báo khoa học, so sánh nhiều hình ảnh và tạo ra bộ ghi chú làm việc toàn diện chỉ trong một lần xử lý. Các nhóm nên xây dựng một bộ đánh giá riêng nhỏ với tài liệu của chính mình. Nếu bộ đánh giá không chứa nhiệm vụ nào dài hơn 20.000 token thì ngữ cảnh dài của mô hình có thể không ảnh hưởng đến điểm số, và một mô hình rẻ hơn có thể cũng vượt qua bài kiểm tra đó.
Bạn nên cân nhắc một mô hình rẻ hơn khi tác vụ ngắn, mang tính thực tế, hoặc bị giới hạn trong một ngữ cảnh nhỏ. GPT-6 Astra được định vị là mô hình cao cấp, nghĩa là OrcaRouter có thể định giá ngữ cảnh lớn và quy mô mô hình khác với các phiên bản nhỏ hơn. Đối với một câu hỏi 200 từ không có phần phụ lục, khả năng bổ sung không giúp ích gì cho câu trả lời; một mô hình nhỏ hơn sẽ trả về kết quả tốt với chi phí thấp hơn và độ trễ thấp hơn. Danh mục không có giá số trong bản ghi mô hình này, vì vậy trang giá cước là nơi duy nhất để xác nhận sự khác biệt. Bạn cũng nên chọn một mô hình rẻ hơn khi bạn cần phản hồi xác định từ một prompt nhỏ, ổn định, khi dữ liệu của bạn không thể được gửi qua mô hình đa phương thức của bên thứ ba, hoặc khi vòng lặp phát triển của bạn yêu cầu nhiều lần gọi lặp lại để đánh giá. Cấp cao cấp chỉ nên được sử dụng sau khi xác định rằng hành vi ngữ cảnh dài hoặc độ chính xác cao của nó thực sự cải thiện các chỉ số đánh giá của bạn.
GPQA Diamond là một benchmark trắc nghiệm ở cấp độ sau đại học, thiên về nghiên cứu, gồm 198 câu hỏi về sinh học, hóa học và vật lý. Chỉ số benchmark định lượng duy nhất được liệt kê cho GPT-6 Astra trong dữ liệu mô hình của OrcaRouter là 96.1. Theo cách báo cáo thông thường của benchmark này, điều đó có nghĩa là mô hình đã trả lời đúng khoảng 96.1% số câu hỏi đánh giá trong điều kiện của bài đánh giá. Đây là một kết quả cao, mang tính đặc thù theo lĩnh vực và là một phép thử ban đầu hợp lý về khả năng suy luận. Điểm số này không nên được quy đổi thành điểm chất lượng đa dụng. Nó không chứng nhận khả năng lập trình, độ trung thực khi tóm tắt, tuân thủ chỉ dẫn, hành vi an toàn hay tính sáng tạo. Khi bạn sử dụng GPT-6 Astra qua OrcaRouter, cách đánh giá có ý nghĩa nhất là chạy các câu hỏi trong lĩnh vực của riêng bạn với mô hình và so sánh kết quả đầu ra.
OrcaRouter không đưa ra cam kết về độ trễ hay chỉ số token trên mỗi giây trong hồ sơ mô hình được cung cấp. Điều bạn có thể kỳ vọng mang tính định tính: một yêu cầu có hàng trăm nghìn token ngữ cảnh thường sẽ tốn nhiều thời gian hơn để đọc và xử lý các đầu vào đó so với một yêu cầu chỉ có vài nghìn token. Tương tự, việc yêu cầu một phản hồi dài sẽ tốn nhiều thời gian hơn so với việc xuất ra một câu. Độ trễ mạng giữa ứng dụng của bạn và https://api.orcarouter.ai/v1 cũng phụ thuộc vào khu vực triển khai của bạn. Với giới hạn đầu ra 128,000 token và dung lượng đầu vào lớn, phương thức giúp kiểm soát độ trễ trong sản xuất là phát trực tuyến (streaming). Endpoint chat completions tương thích OpenAI hỗ trợ streaming, do đó ứng dụng khách (client) của bạn có thể hiển thị token ngay khi chúng được tạo ra. Đừng suy ra tốc độ phản hồi từ con số benchmark 96.1.
Điểm mạnh được ghi nhận trong hồ sơ gồm có dung lượng đầu vào lớn, dung lượng đầu ra dài, hỗ trợ đa phương thức cho đầu vào văn bản, hình ảnh và tệp tin, cùng điểm số nổi bật 96,1 GPQA Diamond. Một điểm mạnh bắt nguồn từ kiến trúc là những tác vụ trước đây phải chia thành nhiều lời gọi giờ có thể nằm gọn trong một lời gọi. Điều này có thể giảm độ phức tạp của mã nguồn, giảm chi phí do lặp lại chỉ dẫn và cải thiện tính nhất quán giữa các phần của mã nguồn. Hạn chế: không có đầu vào âm thanh hoặc video nào được liệt kê; cửa sổ ngữ cảnh bị giới hạn ở mức 1.050.000 token; mô hình chạy trên hạ tầng lưu trữ của OpenAI nên không có phiên bản ngoại tuyến được phục vụ qua OrcaRouter; và một chuẩn đánh giá duy nhất không thể xác thực tính an toàn, mức độ liên kết hay độ chính xác chuyên ngành. Vì mô hình thuộc hạng flagship, các lỗi và lần thử lại kéo theo chi phí dự kiến cao hơn, do đó nên thực hiện kiểm tra ở cấp ứng dụng để phát hiện đầu ra bị sai định dạng hoặc bị cắt cụt.
OrcaRouter là nhà cung cấp API mà bạn xác thực và việc tính phí dựa trên mức sử dụng token cho mô hình này. Trong phản hồi tương thích OpenAI, các trường usage hiển thị token đầu vào, token sinh ra và tổng token, vì vậy ứng dụng của bạn có thể ghi lại chính xác cơ sở sử dụng. Mã mô hình openai/gpt-6-astra là văn bản thông thường trong phần thân yêu cầu và không làm thay đổi định dạng yêu cầu. Bản ghi mô hình được cung cấp ở đây không bao gồm bảng giá theo token. Để xây dựng ngân sách triển khai, hãy ước tính kích thước đầu vào trung bình và kích thước đầu ra trung bình, sau đó áp dụng biểu giá hiện tại mà OrcaRouter công bố cho các mô hình chủ lực của OpenAI. Không nên suy ra một mức giá cụ thể nào chỉ từ điểm chuẩn hoặc nhãn cấp độ. Xem xét đối tượng usage trong mỗi phản hồi API là cách đáng tin cậy nhất để theo dõi chi tiêu thực tế.
Thanh toán theo token có nghĩa là chi phí của một đầu vào tăng lên khi cửa sổ ngữ cảnh được lấp đầy. Sự đánh đổi thực tế tinh tế hơn: một lệnh gọi có ngữ cảnh lớn duy nhất có thể tốn ít hơn một chuỗi các lệnh gọi nhỏ hơn để lắp ráp cùng một câu trả lời, vì chuỗi đó chạy mô hình nhiều lần và tạo ra các đầu ra trung gian. Đó là lý do tại sao bản thân độ rộng ngữ cảnh lại có giá trị. Nhưng một ngữ cảnh lớn cũng bao gồm các token không chứa bằng chứng hữu ích, và mô hình có thể dành tính toán để chú ý đến các đoạn không liên quan. Chiến lược đúng đắn là đo chi phí cho mỗi câu trả lời chất lượng cao. Nếu phải phân tích toàn bộ tài liệu, hãy đưa nó vào; nếu chỉ một số điều khoản nhất định quan trọng, hãy trích xuất chúng trước. OrcaRouter tính phí theo token thực tế trong mỗi yêu cầu, không phải theo dung lượng của mô hình, vì vậy một yêu cầu ngắn không phải trả tiền cho không gian ngữ cảnh không được sử dụng.
Hồ sơ mô hình không có tuyên bố chính thức nào về bộ nhớ đệm (caching) cho GPT-6 Astra. Các nền tảng tương thích OpenAI đôi khi giảm chi phí khi prompt hệ thống hoặc tiền tố tệp được lặp lại, nhưng hành vi của OrcaRouter đối với mô hình này phải được xác nhận từ tài liệu hiện tại và từ các trường usage trong phản hồi của bạn. Nếu một tiền tố lặp lại lớn không được lưu vào bộ nhớ đệm, cùng 500.000 token sẽ bị tính phí cho mọi yêu cầu gửi chúng. Không nên đưa các giả định về bộ nhớ đệm vào ngân sách khi chưa có tài liệu xác nhận. Một mẫu phát triển an toàn là tránh gửi lại nội dung không thay đổi. Hãy lưu trữ đầu ra của yêu cầu trước đó, lưu các dữ kiện đã trích xuất cục bộ hoặc thiết kế một ngữ cảnh nhỏ gọn chỉ chứa văn bản thiết yếu. Không có tham số cache-key hoặc prompt-cache nào được bao gồm trong hồ sơ mô hình được cung cấp, vì vậy mọi tính năng như vậy cần phải được xác nhận riêng.
Giá flagship hợp lý khi model phân khúc thấp hơn trượt bài kiểm tra chất lượng, hoặc khi tác vụ yêu cầu độ dài ngữ cảnh và độ dài đầu ra mà chỉ phân khúc này mới cung cấp. Thẩm định tài liệu dài, tổng hợp tài liệu khoa học và đánh giá hình ảnh kèm văn bản là những ví dụ trong đó khối lượng token đủ lớn để biện minh cho phiên bản có năng lực cao hơn. Nếu model gộp hàng chục lệnh gọi API thành một, mức giá trên mỗi token cao hơn vẫn có thể tiết kiệm chi phí. Giá flagship không phù hợp khi bạn cần một câu trả lời ngắn, một loạt prompt nhỏ hoặc một tác vụ phân loại đơn giản. OrcaRouter liệt kê các mã model OpenAI khác bên dưới phân khúc flagship. Chúng thường cho kết quả tương tự với các thao tác rất ngắn ở chi phí thấp hơn và độ trễ giảm. Dữ liệu model tại đây không chứa bảng giá, vì vậy ngưỡng chính xác phụ thuộc vào bảng giá hiện tại của OrcaRouter.
Gửi một yêu cầu POST đến https://api.orcarouter.ai/v1/chat/completions với khóa API OrcaRouter trong header Authorization. Đặt trường model thành openai/gpt-6-astra trong nội dung JSON. Messages tuân theo schema OpenAI; nội dung có thể là chuỗi văn bản thuần túy hoặc danh sách các phần đa phương thức, tùy thuộc vào việc bạn đang gửi văn bản, hình ảnh hay tệp tin. Phản hồi cũng tuân theo schema OpenAI và chứa choices và usage. Nếu bạn nhận được mã 404, hãy kiểm tra rằng URL cơ sở chính xác là https://api.orcarouter.ai/v1 và không có wrapper nào đang viết lại đường dẫn. Nếu bạn nhận được lỗi model-not-found, hãy xác nhận rằng openai/gpt-6-astra là chính xác. Bạn có thể liệt kê các model tại endpoint /v1/models, một endpoint tương thích OpenAI, để xem id chính xác mà OrcaRouter trả về cho mục này.
Endpoint hoàn tất tương thích OpenAI hỗ trợ bộ tham số chat completion tiêu chuẩn, bao gồm temperature, top_p, max_tokens hoặc max_completion_tokens, stream, stop, presence_penalty, frequency_penalty và user. OrcaRouter không liệt kê các tham số đặc thù cho mô hình GPT-6 Astra trong bản ghi này. Các giá trị bạn gửi sẽ được tuần tự hóa theo đúng dạng tương thích, nên mọi thứ mà OpenAI SDK của bạn hỗ trợ đều có thể truyền qua bình thường. Một giới hạn quan trọng là đầu ra tối đa 128.000 token được nêu trên model card. Một yêu cầu vượt quá giới hạn đầu ra đó sẽ không thành công. Hạn mức đầu vào bị giới hạn bởi cửa sổ ngữ cảnh 1.050.000 token; các lời nhắc vượt quá ngưỡng trần đó là không hợp lệ. Hãy sử dụng tham số temperature và các tham số lấy mẫu một cách có chủ đích, vì các kết quả sinh dài có độ biến thiên cao có thể cần được rà soát thủ công trước khi được tin cậy.
Các SDK của OpenAI cho phép bạn đặt một base URL tùy chỉnh. Trong client Python chính thức, đặt base_url=https://api.orcarouter.ai/v1 và api_key thành khóa OrcaRouter của bạn, sau đó sử dụng tên mô hình openai/gpt-6-astra. Trong client JavaScript, truyền baseURL trong đối tượng cấu hình. Hầu hết các SDK tương thích với OpenAI đều tuân theo cùng mẫu đó, vì vậy không cần SDK OrcaRouter đặc biệt nào. Trước khi chuyển tất cả môi trường, hãy chạy một bài kiểm tra chuyển đổi nhỏ trên một yêu cầu. Xác nhận rằng định dạng tin nhắn trước đây của bạn được chấp nhận. Nếu pipeline cũ của bạn đang chia nhỏ tài liệu do cửa sổ ngữ cảnh ngắn hơn, bạn có thể đơn giản hóa quá trình nạp dữ liệu khi GPT-6 Astra chấp nhận toàn bộ tệp trong một lần gọi. Đồng thời, loại bỏ mọi URL được mã hóa cứng trỏ trực tiếp đến api.openai.com.
Tính năng phát trực tuyến được hỗ trợ vì API của OrcaRouter tương thích với OpenAI: đặt stream thành true và nhận các khối hoàn thành hội thoại khi mô hình tạo sinh. Nội dung văn bản, hình ảnh và tệp có thể được gửi trong cấu trúc thông điệp đa phương thức chuẩn cho mô hình này, vì đó là các loại nội dung được liệt kê trong danh mục. Gọi công cụ là một phần của hợp đồng chat-completions của OpenAI, nhưng dữ liệu mô hình được cung cấp không bao gồm tuyên bố về hỗ trợ công cụ cho GPT-6 Astra, vì vậy hãy kiểm tra các lời gọi công cụ bằng một yêu cầu đơn giản trước khi dựa vào chúng trong môi trường sản xuất. Giới hạn đầu ra 128.000 token vẫn được áp dụng khi phát trực tuyến. Phát trực tuyến không tăng mức tối đa đó; nó chỉ làm đầu ra xuất hiện sớm hơn. Giữ tất cả nội dung đa phương thức trong cửa sổ ngữ cảnh 1.050.000 token. Không có phần thông điệp âm thanh hoặc video nào được khai báo trong các thuộc tính được cung cấp.
So sánh cùng các trường của từng mô hình: nhà cung cấp, cấp độ, cửa sổ ngữ cảnh, đầu ra tối đa và dạng đầu vào. Giá trị của GPT-6 Astra là OpenAI, flagship, 1.050.000 token, 128.000 token và văn bản/hình ảnh/tệp. Nếu một mô hình khác có cửa sổ ngữ cảnh nhỏ hơn nhưng vượt qua các bài kiểm tra chất lượng và vẫn đủ chứa tài liệu, thì mô hình rẻ hơn có thể là lựa chọn đúng. Nếu phương án thay thế có ngữ cảnh tương đương nhưng điểm benchmark liên quan thấp hơn, GPT-6 Astra có lợi thế trên lý thuyết. Vì OrcaRouter cung cấp API tương thích với OpenAI, việc so sánh này có thể tiến hành trực tiếp: gửi các prompt giống hệt nhau đến hai ID mô hình khác nhau rồi so sánh đầu ra, lượng token sử dụng, độ trễ và chi phí. Không có bảng benchmark đối chiếu nào được đưa vào bản ghi cụ thể này, vì vậy không nên đưa ra tuyên bố ra bên ngoài rằng bất kỳ mô hình nào vượt trội hơn về mọi mặt.
Các mô hình bình dân trong danh mục của OrcaRouter nằm dưới phân khúc cao cấp và được thiết kế cho các tác vụ không cần ngữ cảnh dài hoặc đầu ra dài như được mô tả ở đây. Giới hạn của chúng được công bố trong hồ sơ mô hình riêng. Việc so sánh thực tế dựa trên độ dài đầu vào, độ dài đầu ra yêu cầu và tỷ lệ lỗi mục tiêu. Với prompt ngắn, mô hình bình dân thường là lựa chọn cân bằng tốt hơn vì độ trễ thấp hơn và chi phí mỗi yêu cầu dự kiến thấp hơn. GPT-6 Astra trở thành lựa chọn tốt hơn khi đầu vào của bạn quá lớn so với mô hình bình dân, câu trả lời cuối cùng phải rất dài, hoặc đánh giá của riêng bạn cho thấy sự cải thiện chất lượng đáng kể. Vì OrcaRouter sử dụng cùng định dạng tin nhắn giữa các mô hình, bạn có thể xây dựng một luồng tăng cấp thử mô hình cấp thấp hơn trước và định tuyến đến openai/gpt-6-astra khi độ tin cậy thấp hoặc ngữ cảnh vượt quá giới hạn của mô hình nhỏ hơn.
Bản ghi được cung cấp không bao gồm số liệu benchmark của các thế hệ trước, vì vậy sẽ không có cơ sở để khẳng định trên trang này rằng GPT-6 Astra vượt trội hơn một checkpoint cũ cụ thể trong mọi bài kiểm tra. Điều được biết từ bản ghi là GPT-6 Astra là mô hình chủ lực của OpenAI với ngữ cảnh 1.050.000 token, giới hạn đầu ra 128.000 token, khả năng đa phương thức truy cập văn bản/hình ảnh/tệp, và điểm nổi bật là 96,1 trên GPQA Diamond. Các mô hình thế hệ trước được liệt kê trên OrcaRouter có thẻ ngữ cảnh, đầu ra và benchmark riêng của chúng. Một cách kiểm tra di chuyển thực tế là lấy một mô hình cũ mà bạn đã có dữ liệu chất lượng lịch sử, chạy cùng một bài đánh giá trên GPT-6 Astra, và so sánh các câu trả lời chính xác. Điều này mang lại sự so sánh công bằng ngang ngửa qua lớp API chuẩn hóa của OrcaRouter. Đừng di chuyển chỉ vì tồn tại mô hình mới hơn; hãy di chuyển nếu đánh giá cho thấy đầu ra tốt hơn với chi phí hợp lý.
Tương thích OpenAI — giữ nguyên SDK bạn đang dùng
https://api.orcarouter.ai/v1import os
from openai import OpenAI
client = OpenAI(
base_url="https://api.orcarouter.ai/v1",
api_key=os.environ["ORCAROUTER_API_KEY"],
)
response = client.chat.completions.create(
model="openai/gpt-6-astra",
messages=[{"role": "user", "content": "Hello"}],
)
print(response.choices[0].message.content)include_reasoningmax_completion_tokensmax_tokensreasoningreasoning_effortresponse_formatseedstructured_outputstool_choicetools| Bậc | Đầu vào / 1M tokens | Đầu ra / 1M tokens | Đọc cache / 1M | Ghi cache / 1M |
|---|---|---|---|---|
| ≤ 272K | $10.00 | $50.00 | $1.00 | $12.50 |
| ≤ ∞ | $20.00 | $75.00 | $2.00 | $25.00 |
| Bậc được chọn theo số token đầu vào của mỗi yêu cầu | ||||
Ước tính theo giá niêm yết
Giá theo bậc — ước tính này dùng mức giá bậc cơ bản.
Chỉ là ước tính — số token thực tế phụ thuộc vào bộ tách token của nhà cung cấp.
Điều các nhà phát triển đang nói tuần này
GET /api/public/models/openai/gpt-6-astraMở @misc{orcarouter_gpt_6_astra,
title = {GPT-6 Astra API},
author = {OpenAI},
year = {2026},
howpublished = {OrcaRouter},
url = {https://www.orcarouter.ai/models/openai/gpt-6-astra}
}OpenAI. (2026). GPT-6 Astra API. OrcaRouter. https://www.orcarouter.ai/models/openai/gpt-6-astra