Một thẻ tiêu đề hero được tạo có nội dung 'GPT-6 Luna vs GPT-6 Astra', phụ đề 'Giá trên bảng giá cao gấp một trăm lần. Gấp bốn mươi sáu lần cho mỗi tác vụ hoàn thành.', cùng các chip hiển thị Luna ở mức $0.10/$0.50 mỗi 1M với chỉ số 37, Astra ở mức $10.00/$50.00 mỗi 1M với chỉ số 53, và chi phí mỗi tác vụ chỉ số là $0.07 so với $3.26, với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-6 Luna vs GPT-6 Astra: Cái giá gấp trăm lần cho mười sáu điểm chỉ số

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Nhà cung cấp đã tung ra cả hai mô hình này trong cùng một tháng. GPT-6 Astra ra mắt ngày 3 tháng 9 năm 2026 với mức 10,00 USD cho mỗi triệu token đầu vào và 50,00 USD cho mỗi triệu token đầu ra, được định vị là hệ thống mạnh mẽ nhất của công ty cho những công việc chuyên môn dài hạn. GPT-6 Luna tiếp nối vào ngày 22 tháng 9 năm 2026 với mức 0,10 và 0,50 USD — bằng một phần trăm giá đầu vào, một phần trăm giá đầu ra — trong vai trò tầng hiệu quả của dòng sản phẩm. Mười sáu điểm chỉ số ngăn cách chúng trên bảng xếp hạng độc lập đo lường cả hai. Mười sáu điểm đổi lấy mức giá gấp trăm lần — đó là toàn bộ phép so sánh gói gọn trong một dòng, và đó không phải là phần thú vị.

Điều thú vị là con số gấp trăm lần trên nhãn sẽ co lại chỉ còn gần gấp bốn mươi sáu lần khi bạn tính đến cách mỗi mô hình thực sự hành xử trong một tác vụ, và khoảng cách còn lại hoàn toàn không phải là trí tuệ tổng quát. Đó là khả năng sử dụng máy tính, tính tự chủ trong dài hạn, và một phân loại an toàn quyết định liệu tổ chức của bạn có được phép gọi mô hình ngay từ đầu hay không. Mục cuối cùng đó là thứ không bảng đánh giá nào nắm bắt được, và với rất nhiều đội nhóm, nó định đoạt câu hỏi trước cả khi giá được nhắc đến.

Hai thế hệ của cùng một gia đình, cách nhau mười chín ngày.

Astra là mô hình chủ lực của OpenAI và là mô hình được công ty mô tả là thông minh nhất và được căn chỉnh tốt nhất thế giới. Mô hình chấp nhận đầu vào văn bản, hình ảnh và tệp, sở hữu cửa sổ ngữ cảnh 1.050.000 token với giới hạn đầu ra 128.000 token, và có suy luận luôn bật với mức nỗ lực có thể cấu hình từ thấp đến tối đa. Đây là mô hình OpenAI đầu tiên vượt qua ngưỡng năng lực an ninh mạng Critical theo Khung Chuẩn bị của công ty, và việc triển khai bắt nguồn từ phân loại đó chứ không phải từ công suất: các tổ chức hạn chế trước tiên, quyền truy cập doanh nghiệp bị tắt theo mặc định và có thể quản trị từ ngày 9 tháng 9, với các tầng biện pháp bảo vệ mở rộng dần sau đó.

Luna là đầu bên kia của cùng một dòng họ. Đầu vào văn bản và hình ảnh, đầu ra văn bản, cùng cửa sổ ngữ cảnh 1.050.000 token và cùng giới hạn đầu ra 128.000 token, cùng một thang suy luận chạy từ none qua low, medium, high, xhigh và max, với medium là mặc định. Không có gating, không có công tắc dành cho doanh nghiệp, không có bậc an toàn nào cần đáp ứng. Nó được cung cấp rộng rãi cho bất kỳ ai có khóa API, và mô tả của chính OpenAI rất hẹp và trung thực: mô hình hiệu quả nhất cho các tác vụ tập trung, khối lượng lớn.

Hai mô hình này chia sẻ một cửa sổ ngữ cảnh, một giới hạn đầu ra, một nhóm mốc cắt kiến thức và một điều khoản giá cho ngữ cảnh dài. Chúng gần như không chia sẻ gì khác, và lý do là chúng được xây dựng cho hai nửa khác nhau của cùng một công việc.

Bảng giá cho biết một trăm lần. Chi phí nhiệm vụ cho biết bốn mươi sáu.

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào mỗi 1M — GPT-6 Luna $0.10 so với GPT-6 Astra $10.00

• Đầu ra trên 1M — GPT-6 Luna $0.50 so với GPT-6 Astra $50.00

• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Luna $0.01 mỗi 1M so với GPT-6 Astra $1.00 mỗi 1M, cả hai đều được giảm giá 90% so với mức giá không lưu trữ của chính chúng

• Chi phí cho mỗi tác vụ chỉ mục — GPT-6 Luna khoảng $0.07 so với GPT-6 Astra khoảng $3.26

• Chi phí để chạy toàn bộ chỉ mục — GPT-6 Luna $122.39 so với GPT-6 Astra $5,324.10

• AA Intelligence Index — GPT-6 Luna 37 ở mức nỗ lực tối đa so với GPT-6 Astra 53 ở mức nỗ lực tối đa

• Số token đầu ra trong lượt chạy chỉ số — GPT-6 Luna 150M so với GPT-6 Astra 60M, so với mức trung vị của bảng là 88M

• Tốc độ đầu ra — GPT-6 Luna 153,9 token/giây so với GPT-6 Astra 51,4 token/giây ở xhigh

• Thời gian tới token đầu tiên — GPT-6 Luna đủ nhanh để chạy sau một bề mặt tương tác so với GPT-6 Astra 208,73 giây ở xhigh

• Công tắc tắt suy luận — GPT-6 Luna từ none đến max, với none là một tùy chọn, so với GPT-6 Astra luôn bật, không có chế độ không suy luận

• Sử dụng máy tính và khả năng tự chủ — gọi công cụ và vòng lặp tác tử của GPT-6 Luna so với GPT-6 Astra được xây dựng để vận hành máy tính từ đầu đến cuối

• Quyền truy cập — GPT-6 Luna nhìn chung khả dụng cho bất kỳ ai, so với GPT-6 Astra bị hạn chế, tính năng doanh nghiệp mặc định tắt, cần có sự kiểm soát của quản trị viên

• Trên OrcaRouter — GPT-6 Luna không có trong danh mục của chúng tôi so với GPT-6 Astra có thể định tuyến theo giá niêm yết của OpenAI

A generated single-panel scoreboard card headed 'A hundred times on the rate card' with six rows: GPT-6 Luna $0.10 in / $0.50 out per 1M with index 37 at max effort; GPT-6 Astra $10.00 in / $50.00 out per 1M with index 53 at max effort; cost per completed index task about $0.07 against about $3.26; output tokens on the index run Luna 150M against Astra's 60M and a board median of 88M; output speed Luna 153.9 tokens per second against Astra's 51.4 at xhigh; and access, Luna open to anyone with an API key against Astra gated with enterprise off by default. Footer: 'Index, cost per task and speed per Artificial Analysis; prices per OpenAI.'

Đối chiếu hàng chi phí trên mỗi tác vụ với tỷ lệ bảng giá, khoảng cách thu hẹp hơn một nửa. Luna chi 150 triệu token đầu ra để hoàn thành chỉ mục; Astra chi 60 triệu. Astra súc tích hơn gấp hai lần rưỡi, và trên một mô hình tính giá theo đầu ra, điều đó rất đáng giá — đó là lý do mức chênh lệch bảng giá gấp trăm lần trở thành mức chênh lệch chi phí tác vụ gấp bốn mươi sáu lần, và là lý do mọi so sánh chỉ dựa trên giá niêm yết sẽ phóng đại lợi thế của hạng rẻ lên gấp đôi.

Các hàng tốc độ đi theo hướng ngược lại và không hề gần nhau. Luna tạo ra số token mỗi giây gấp ba lần Astra và trả về token đầu tiên trong khoảng thời gian cho phép người dùng chờ đợi. Thời gian 208,73 giây để có token đầu tiên của Astra ở xhigh không phải là một chỉ số độ trễ; đó là một lời tuyên bố về mục đích của mô hình. Không có tác vụ nào mà một người đang theo dõi có thể chạy trên Astra ở thiết lập đó.

Mười sáu điểm thực sự mua được những gì

Khoảng cách chỉ số là có thật, và câu hỏi hữu ích là điều gì nằm bên trong nó, bởi vì câu trả lời không phải là "thông minh hơn mười sáu phần trăm."

Các năng lực được công bố của Astra tập trung vào một chỗ cụ thể. OpenAI báo cáo 72,6% trên OSWorld 2.0 và 69% trên AutomationBench-AA — cả hai đều là thước đo việc một mô hình vận hành phần mềm theo cách con người làm, qua nhiều bước, trong một khoảng thời gian dài. Về phía kiến thức, các con số là 96,1 trên GPQA Diamond, 97,6% trên FrontierMath Tier 4 và 57,2% trên Humanity's Last Exam khi dùng công cụ, và truy hồi ngữ cảnh dài là một điểm mạnh được nhấn mạnh: 100% trên bài kiểm chuẩn eight-needle của chính OpenAI trong khoảng 256K đến 512K token, 96,3% trong khoảng 512K đến 1M. Đây là những số liệu do nhà cung cấp báo cáo và chưa được tái lập, và khung đánh giá rất quan trọng — cùng một mô hình đạt 99,9% trên ARC-AGI-3 dưới bộ điều hợp nhà cung cấp tùy chỉnh của OpenAI, so với 62,7% trên khung đánh giá tiêu chuẩn, một mức chênh lệch nói lên nhiều điều về khung đánh giá cũng như về mô hình.

Đọc cùng nhau, đó không phải là một lợi thế đa mục đích. Đó là một lợi thế tập trung vào những tác vụ tốn nhiều thời gian, có sử dụng máy tính và có điểm kết thúc có thể kiểm chứng. Cách định vị cạnh tranh của Astra không nhắm vào một chatbot khác; nó nhắm vào một phiên làm việc, và những mô hình mà nó được đo bên cạnh trên bảng độc lập là các flagship khác ở cùng phân khúc — nó ngang bằng với Claude Fable 5.1 ở mức 53 trên Intelligence Index với chi phí mỗi tác vụ chỉ bằng khoảng 40%.

Mức thiếu hụt mười sáu điểm của Luna vì thế không được phân bố đồng đều. Với một tác vụ ngắn, được đặc tả rõ ràng, do chương trình xử lý, hai mô hình sẽ thường tạo ra cùng một câu trả lời hữu dụng và khác biệt sẽ không thể thấy được. Với một tác vụ đòi hỏi bốn mươi hành động tuần tự trong trình duyệt cùng một điểm kiểm tra ở cuối, mức thiếu hụt chính là khác biệt giữa hoàn thành và không hoàn thành — và đó là tác vụ mà Astra được xây dựng để làm còn Luna thì không.

Cánh cổng mà không ai tính vào giá

Astra là mô hình OpenAI đầu tiên vượt qua ngưỡng an ninh mạng Critical theo Preparedness Framework của công ty, và hệ quả thực tế là nó được phát hành trong trạng thái tắt đối với các tài khoản doanh nghiệp. Quản trị viên phải bật nó, theo bảng giá và thỏa thuận áp dụng, trước khi người dùng có thể thấy nó dưới bất kỳ hình thức nào. Quyền truy cập đã mở cho một nhóm tổ chức hạn chế vào ngày 3 tháng 9 và mở rộng dần từ đó; cơ chế quản trị đã ra mắt vào ngày 9 tháng 9.

Luna không có bất kỳ điều nào trong số đó. Nó khả dụng cho bất kỳ ai có khóa API ngay từ ngày đầu tiên, không có bước xét duyệt, không có nút bật/tắt dành cho quản trị viên và không có tầng biện pháp bảo vệ nào nằm giữa nhà phát triển và cuộc gọi đầu tiên.

Với một nhóm trong ngành được quản lý chặt chẽ, một nhà thầu quốc phòng, hay bất kỳ nơi nào có bước kiểm tra an ninh trong quy trình mua sắm, đây chính là toàn bộ quyết định. Chênh lệch giá gấp trăm lần chỉ là một khoản mục chi phí; một cổng truy cập lại là cả một dự án. Còn với một nhóm nằm ngoài những ràng buộc đó, cổng truy cập ấy chẳng hề quan trọng, và Astra đơn thuần chỉ là một mô hình đắt đỏ với thời gian tạo token đầu tiên dài bất thường.

Điều đáng nói thêm là việc hạn chế phát hành này là một quan điểm đã được cân nhắc kỹ, chứ không phải một sự bất tiện. Một mô hình có thể tự vận hành máy tính và tìm ra lỗ hổng giỏi là mô hình mà phòng thí nghiệm nên cẩn trọng khi phát hành rộng rãi, và hình thức triển khai được quyết định bởi kết luận về năng lực. Điều đó không khiến việc thu mua trở nên dễ dàng hơn, nhưng có nghĩa là ràng buộc này khó có thể được nới lỏng chỉ bằng một phiếu hỗ trợ.

Cùng một vách đá, cùng một gia đình, hai lần

Cả hai mô hình đều có cùng một điều khoản ngữ cảnh dài giống hệt nhau, và đây là thứ tốn kém nhất nếu bỏ sót trên bất kỳ bảng giá nào. Các yêu cầu vượt quá 272.000 token đầu vào sẽ bị tính phí gấp đôi mức giá đầu vào và bộ nhớ đệm, cùng mức gấp 1,5 lần giá đầu ra — cho toàn bộ yêu cầu, không chỉ phần vượt ngưỡng. Trên Astra, điều đó biến một lượt gọi $10.00/$50.00 thành $20.00/$75.00. Trên Luna, nó biến $0.10/$0.50 thành $0.20/$0.75.

Vì điều khoản này có tính tỷ lệ, nó không thay đổi tỷ lệ giữa hai mô hình — nó nhân đôi cả hai. Điều nó thay đổi là quy mô tuyệt đối của sai lầm, và sai lầm dễ xảy ra hơn trên Astra, bởi vì những khối lượng công việc mà Astra tồn tại để phục vụ chính là những khối mang ngữ cảnh làm việc một triệu token. Một lần gọi Astra ngữ cảnh dài duy nhất tốn 75 đô la cho mỗi triệu token đầu ra; chia cùng công việc đó thành hai lần gọi dưới 272K sẽ giảm một nửa mà không thay đổi prompt. Trên một mô hình mà toàn bộ đề xuất giá trị của nó là công việc tầm xa, phép tính đó đáng để chạy trước lần gọi sản xuất đầu tiên, chứ không phải sau đó.

Quyết định này là một quyết định định tuyến

Điều khiến cặp mô hình này trở nên khác thường so với các so sánh trên blog này là cả hai đều thuộc cùng một nhà cung cấp, chạy trên cùng một tài khoản và được truy cập qua cùng một endpoint. Không có hợp đồng thứ hai nào phải ký và không có SDK thứ hai nào phải học. Việc lựa chọn giữa chúng hoàn toàn không phải là một quyết định mua hàng — đó là một quyết định định tuyến, và là quyết định mà hầu hết các nhóm nên đưa ra theo từng yêu cầu thay vì chỉ một lần.

Cách phân chia đã đủ rõ ràng. Luna dành cho hàng nghìn lời gọi nhỏ mà một agent thực hiện trên đường tới một tác vụ: phân loại, trích xuất, chọn công cụ, tóm tắt một kết quả trung gian. Astra dành cho chính tác vụ đó, một lần, ở cuối, nơi câu trả lời chính là sản phẩm. Đó là một pipeline hai tầng bên trong một ứng dụng, và chênh lệch chi phí giữa việc chạy toàn bộ trên Astra và chạy vòng lặp bên trong trên Luna chính là khác biệt giữa một nền kinh tế đơn vị khả thi và một nền kinh tế đơn vị bất khả thi.

GPT-6 Astra có mặt trên OrcaRouter với mức giá niêm yết của OpenAI, theo cơ chế định giá chuyển tiếp, nghĩa là khi OpenAI thay đổi mức giá thì phía chúng tôi cập nhật ngay trong cùng ngày. GPT-6 Luna hiện chưa có trong danh mục của chúng tôi tại thời điểm viết bài này và phải truy cập qua API riêng của OpenAI, vì vậy một nhóm muốn dùng cả hai sẽ dùng một khóa cho GPT-6 Astra song song với bất cứ thứ gì họ đang dùng cho OpenAI. Đây cũng là sự kết hợp mà model fusion phát huy giá trị: một nhóm gồm một mô hình giá rẻ, thông lượng cao và một mô hình đắt đỏ, cẩn trọng cùng trả lời, trong đó thành viên giá rẻ đảm nhận phần lớn công việc còn thành viên đắt đỏ đóng vai trò trọng tài, là một cấu hình mà lớp định tuyến có thể thể hiện mà ứng dụng không cần biết đến sự tồn tại của cả hai mô hình.

A screenshot of the Artificial Analysis page for GPT-6 Luna (max), showing an Intelligence rank of 6th of 183 models, a Speed rank of 35th, a Cost rank of 20th and a Verbosity rank of 36th, input pricing of $0.10 and output of $0.50 per 1M tokens, an Intelligence Index score of 37 against a comparable-model median of 12, 150M output tokens generated during the index run, 153.9 tokens per second, and a total of $122.39 spent evaluating the model.

Cái nào, và khi nào

Hãy dùng GPT-6 Luna trừ khi bạn có lý do cụ thể để không dùng. Nó có giá bằng một phần trăm trên bảng giá và bằng một phần bốn mươi sáu chi phí cho mỗi tác vụ hoàn thành, nhanh gấp ba lần, token đầu tiên của nó đến trong khoảng thời gian mà người dùng có thể chờ đợi, và có thể được yêu cầu dừng suy luận hoàn toàn — đó chính là điều khiến nó dùng được như một bộ phân loại. Hãy đặt tham số effort một cách rõ ràng, vì mặc định là medium và con số 37 trên tiêu đề là con số ở mức effort tối đa. Giữ các lệnh gọi dài dưới 272.000 token đầu vào. Hãy kiểm tra mức suy giảm hai điểm của Coding Agent Index dựa trên đánh giá của riêng bạn thay vì biểu đồ của nhà cung cấp.

Hãy chọn GPT-6 Astra khi tác vụ là loại dài hơi và câu trả lời chính là sản phẩm. Sử dụng máy tính xuyên suốt nhiều bước, phân tích chuyên nghiệp với một điểm kết thúc có thể kiểm chứng, bất cứ việc gì mà mười sáu điểm chỉ số là sự khác biệt giữa hoàn thành và lặng lẽ dừng lại. Hãy chấp nhận thời gian đến token đầu tiên — 208 giây ở xhigh không phải là con số bạn có thể gán cho một con người — và chấp nhận cổng mua sắm nếu tổ chức của bạn có một cổng như vậy. Sau đó, hãy chạy mọi thứ dẫn đến tác vụ đó trên hạng rẻ, vì vòng lặp bên trong mới là nơi tiền bạc được chi ra.

Sai lầm mà sự so sánh này dễ dẫn tới là coi nó như một lựa chọn giữa hai mô hình. Thực ra đó là lựa chọn về việc mỗi mô hình nằm ở đâu trong một pipeline, và câu trả lời hầu như luôn là cả hai.

A screenshot of the OrcaRouter model page for GPT-6 Astra (openai/gpt-6-astra), showing the Vision, Tools, JSON and Reasoning badges, a 2026-09-04 catalogue date, 1M-token context with 128K maximum output and text, image and file input, list pricing of $10.00 input and $50.00 output per 1M tokens, a p50 time to first token of 7.81s, and the description of GPT-6 Astra as OpenAI's flagship model for long-horizon end-to-end work with always-on reasoning from low through max.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày