
GPT-6 Luna so với Claude Opus 5: Giá gấp năm mươi lần và vẫn cùng một buổi chiều
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
GPT-6 Luna có giá 0,10 đô la cho mỗi triệu token đầu vào và 0,50 đô la cho mỗi triệu token đầu ra. Claude Opus 5 có giá 5,00 đô la và 25,00 đô la. Đó là khoảng cách gấp năm mươi lần ở cả hai phía của bảng giá, và đó là điều đầu tiên mà bất kỳ ai cũng nhận ra về cặp đôi này — một mô hình mà nhà cung cấp phát hành vào ngày 22 tháng 9 năm 2026, được định giá đặt cạnh một mô hình mà công ty ra mắt vào ngày 24 tháng 7 năm 2026, đã có mặt trên thị trường được hai tháng. Con số gấp năm mươi lần là có thật. Nó cũng gần như là sự thật ít hữu ích nhất trong phép so sánh này, bởi vì hai mô hình này không cạnh tranh cho cùng một lượt gọi, và bởi vì một điều gì đó đã xảy ra ở phía bên kia hàng rào của mô hình thứ hai vào đúng buổi chiều mà Luna ra mắt.
GPT-6 Luna là phân khúc nhỏ trong thế hệ GPT-6 của OpenAI, nằm dưới GPT-6 Sol ở mức $2.00/$10.00 và thấp hơn nhiều so với mô hình chủ lực GPT-6 Astra ở mức $10.00/$50.00. Claude Opus 5 từng là mô hình chủ lực của Anthropic cho đến ngày 22 tháng 9, khi Anthropic ra mắt Claude Opus 5.5 với mức $4.00/$20.00 và đẩy Opus 5 xuống một bậc. Tính đến hôm nay, cả hai mô hình được nêu trong tiêu đề bài viết này đều đang ở một bậc dưới đỉnh thang sản phẩm của nhà cung cấp tương ứng — vì những lý do chẳng liên quan gì đến nhau. Điều đó quan trọng hơn tỷ lệ giá, và đó chính là điểm khởi đầu của bài viết này.
Buổi chiều, cả hai nhà cung cấp đã gửi hàng.
OpenAI đã công bố GPT-6 Sol và GPT-6 Luna vào ngày 22 tháng 9. Vài giờ trước đó, Anthropic đã công bố Claude Opus 5.5. Hai trong số ba mô hình được nhắc đến trong câu đó đã cắt giá khoảng một nửa so với các thế hệ tiền nhiệm, và đó không hẳn là một sự trùng hợp ngẫu nhiên mà đúng hơn là một thị trường: mười tám tháng trước đó, các đợt phát hành mô hình trọng số mở từ các phòng thí nghiệm Trung Quốc đã đẩy mạnh việc giảm chi phí cho một token đủ năng lực, và cả hai nhà cung cấp đều đang phản ứng trước cùng một áp lực.
Hệ quả thực tế đối với bất kỳ ai đang vận hành một triển khai Claude Opus 5 là mô hình mà họ xây dựng dựa trên đó không còn là mô hình mà Anthropic đang bán mạnh nhất. Claude Opus 5.5 có giá $4.00/$20.00 — giảm 20% so với giá niêm yết — với đầu vào được cache ở mức $0.20 mỗi triệu token, giảm từ $0.50 của Opus 5, và Artificial Analysis đo nó ở mức 58 trên Intelligence Index của mình khi nỗ lực tối đa, con số cao nhất mà tổ chức này từng ghi nhận. Claude Opus 5 đạt 51 trên cùng chỉ số. Nếu bạn đang chạy Opus 5 hôm nay, phép so sánh gấp năm mươi lần trong tiêu đề bài viết này không phải là phép so sánh đang ở trước mắt bạn. Điều đang ở trước mắt bạn là liệu bạn có chuyển sang Opus 5.5 hay không, và câu trả lời cho điều đó là một bài toán riêng biệt, tách khỏi bất cứ điều gì GPT-6 Luna đang làm.
Tuy nhiên, con số gấp năm mươi lần vẫn chi phối một quyết định thực sự, bởi vì những khối lượng công việc mà GPT-6 Luna được thiết kế để phục vụ chính là những khối lượng công việc mà hóa đơn Claude Opus 5 trở nên khó chịu. Cả hai sự thật đều có thể đúng cùng một lúc.
Thực ra mỗi thứ trong hai thứ này là gì
Thông số kỹ thuật, mỗi dòng một kích thước, cả hai mặt trên mỗi dòng:
• Giá trên mỗi 1 triệu token — GPT-6 Luna $0,10 đầu vào / $0,50 đầu ra so với Claude Opus 5 $5,00 đầu vào / $25,00 đầu ra
• Đầu vào đã cache — GPT-6 Luna 0,01 USD mỗi 1M, giảm giá 90% so với Claude Opus 5 0,50 USD mỗi 1M trên bảng giá Opus 5, giảm còn 0,20 USD trên Opus 5.5
• Cửa sổ ngữ cảnh — GPT-6 Luna tổng cộng 1.050.000 với đầu vào tối đa 922.000 so với Claude Opus 5 1 triệu, cả hai đều giới hạn ở 128.000 token đầu ra
• Định giá lại ngữ cảnh dài — GPT-6 Luna tăng gấp đôi giá đầu vào và bộ nhớ đệm, đồng thời tăng giá đầu ra lên 1,5 lần khi vượt quá 272K token đầu vào, áp dụng cho toàn bộ yêu cầu; so với Claude Opus 5 giữ mức không đổi trên toàn cửa sổ của nó
• AA Intelligence Index — GPT-6 Luna 37 ở mức nỗ lực tối đa so với Claude Opus 5 51
• Chỉ số AA Intelligence, khớp theo mức nỗ lực — GPT-6 Luna 29 ở mức nỗ lực trung bình mặc định của nó so với Claude Opus 5 51 ở mức tối đa, cài đặt duy nhất mà Anthropic đo lường nó
• Tốc độ đầu ra — GPT-6 Luna 153,9 token/giây so với Claude Opus 5 53,6 token/giây
• Chi phí chạy chỉ mục — GPT-6 Luna $122.39 so với Claude Opus 5 $7.274,74
• Công tắc tắt suy luận — GPT-6 Luna cung cấp các mức none, low, medium, high, xhigh và max, trong khi Claude Opus 5 có khả năng suy luận thích ứng và luôn bật
• Đã phát hành — GPT-6 Luna 2026-09-22 so với Claude Opus 5 2026-07-24

Ba trong số những dòng đó đang gánh vác nhiều hơn những dòng còn lại, và dòng đầu tiên là dòng về mức nỗ lực. 37 của GPT-6 Luna là điểm số của nó ở mức nỗ lực tối đa. Mặc định của nó là medium, và ở mức medium nó đạt 29 điểm. 51 của Claude Opus 5 là con số ở mức nỗ lực tối đa, vì Anthropic không công bố một thiết lập thấp hơn được Artificial Analysis đo lường. Vậy nên khoảng cách được nêu chính là mười bốn điểm thực chất là so sánh giữa mức trần của một mô hình với mức trần của một mô hình khác — và một nhóm cài đặt GPT-6 Luna rồi không thay đổi gì thì đang chạy ở mức 29, chứ không phải 37. Đó là khoảng cách hai mươi hai điểm, không phải mười bốn điểm, và nó vô hình trừ khi bạn chịu khó đi tìm mặc định về mức nỗ lực.
Thứ hai là dòng chi phí chỉ số. Đây không phải là một báo giá — đó là số tiền mà Artificial Analysis thực sự đã chi để chạy toàn bộ bộ đánh giá trên mỗi mô hình bằng tiền của chính họ. 122,39 đô la so với 7.274,74 đô la là mức chênh lệch gấp năm mươi chín lần về chi phí để tìm ra mô hình tốt đến mức nào, và đây là đại diện rõ ràng nhất hiện có cho cách hai mô hình này thể hiện ở quy mô lớn. Claude Opus 5 đã tạo ra 140 triệu token trong lần chạy đó; GPT-6 Luna tạo ra 150 triệu. Mô hình rẻ hơn dài dòng hơn mà vẫn tốn ít hơn năm mươi chín lần.
Thứ ba là công tắc tắt. GPT-6 Luna có thể được yêu cầu không suy luận chút nào. Claude Opus 5 thì không. Chỉ một dòng thông số đó là lý do vì sao một trong hai mô hình này có thể nằm sau một bộ phân loại, một bộ định tuyến, hoặc một màn kiểm duyệt còn mô hình kia thì không, và nó giải thích phần lớn mức chênh lệch giá mà không cần viện đến năng lực gì cả.
Nơi gói rẻ không còn rẻ nữa
Có một "vách" trong bảng giá GPT-6 Luna, và đây là điều đắt đỏ nhất nếu bỏ sót. Các yêu cầu vượt quá 272.000 token đầu vào bị tính phí gấp đôi mức giá đầu vào và cache, cùng gấp 1,5 lần mức giá đầu ra — cho toàn bộ yêu cầu, không chỉ phần đã vượt mốc. Một lệnh gọi 300.000 token trên GPT-6 Luna bị tính 0,20 USD mỗi triệu token đầu vào cho cả 300.000 token, vì nó đã vượt mốc 28.000 token. Chia cùng một tài liệu thành hai lệnh gọi thì chi phí giảm một nửa mà không thay đổi prompt.
Claude Opus 5 không có điều khoản tương đương. Mức $5.00/$25.00 của nó là cố định trên toàn bộ cửa sổ 1M, nghĩa là tỷ lệ gấp năm mươi lần là gấp năm mươi lần ở mọi nơi — ngoại trừ trên 272K token đầu vào, khi đó mức giá đầu vào hiệu dụng của GPT-6 Luna tăng gấp đôi lên $0.20 và mức giá đầu ra tăng lên $0.75, và khoảng cách thu hẹp xuống còn hai mươi lăm lần. Vẫn rất lớn. Vẫn đáng để biết, bởi vì những khối lượng công việc có khả năng nhất có ngữ cảnh làm việc 300.000 token chính xác là những khối lượng công việc dạng tác tử mà cả hai nhà cung cấp đang nhắm đến.
Điều thứ hai cần định giá là công sức. Chạy GPT-6 Luna ở mức công sức tối đa cho một tác vụ mà mức trung bình đã đủ tốt là cách phổ biến nhất để tiêu hết khoản tiết kiệm bạn vừa có được. Khoảng cách 37 so với 29 chính là độ lớn của cái giá phải trả cho việc chọn sai thiết lập, và khác với một điều khoản giá, nó không xuất hiện ở bất kỳ đâu trên hóa đơn — nó thể hiện dưới dạng khối lượng token, thứ trông có vẻ như là thành công.
Sự chia rẽ mới là thứ thực sự quyết định điều đó.
Phiên bản trung thực của so sánh này là hai mô hình không thay thế cho nhau, và tỷ lệ giá cả chỉ làm xao nhãng khỏi một câu hỏi về khối lượng công việc vốn dĩ đã có câu trả lời rõ ràng theo cả hai hướng.
GPT-6 Luna thuộc về mọi trường hợp mà đầu ra được tiêu thụ bởi một chương trình chứ không phải con người, và khối lượng mới là điều quan trọng. Phân loại, trích xuất, ra quyết định định tuyến, tóm tắt hàng loạt, vòng lặp bên trong của một agent thực hiện hàng nghìn lệnh gọi nhỏ mỗi tác vụ. Với mức $0.10/$0.50 cùng mức giá đầu vào được lưu đệm là một xu, và với Batch và Flex chỉ bằng một nửa mức giá tiêu chuẩn, các tính toán kinh tế không phải là một so sánh sát nút với bất kỳ thứ gì trong dòng Opus. Artificial Analysis chỉ ra một điểm thoái bộ thực sự đáng biết trước khi bạn chuyển đổi: Chỉ số Coding Agent của GPT-6 Luna giảm hai điểm xuống 41, so với 43 của GPT-5.6 Luna, với mức giảm tập trung ở SWE-Atlas-QnA và DeepSWE v1.1. Nó cũng chỉ ra một điểm cải thiện thực sự có cùng mức độ — tỷ lệ ảo giác của mô hình trên AA-Omniscience giảm từ khoảng 93% xuống 77%, trong khi độ chính xác gần như không thay đổi. Nó từ chối trả lời thường xuyên hơn thay vì biết nhiều hơn, và với bất kỳ thứ gì có bên tiêu thụ ở hạ nguồn, đó chính là nửa có giá trị hơn của sự đánh đổi.
Claude Opus 5 thuộc về nơi mà đầu ra chính là sản phẩm. Các kết quả do chính Anthropic công bố — được nhà cung cấp báo cáo, không được tái tạo độc lập — đặt nó ở mức 96,0% trên SWE-bench Verified và 79,2% trên SWE-bench Pro, và khoảng cách chỉ số mười bốn điểm là kiểu chênh lệch quyết định liệu một tác nhân tầm xa có hoàn thành nhiệm vụ hay lặng lẽ dừng lại giữa chừng. Nếu bạn đang ở ranh giới của những gì mô hình có thể làm, một mô hình rẻ hơn năm mươi lần và kém hơn hai mươi hai điểm ở mức nỗ lực mặc định không phải là một phiên bản rẻ hơn của cùng một thứ.
Chạy cả hai mà không chọn
Lý do so sánh này không thể dẫn đến một khuyến nghị duy nhất là ranh giới giữa hai khối lượng công việc không ổn định. Nó dịch chuyển mỗi khi một trong hai nhà cung cấp phát hành sản phẩm mới, và nó đã dịch chuyển hai lần trong ba tuần trước bài viết này — một lần khi Anthropic cắt mức giá Opus xuống $4.00/$20.00, và một lần khi OpenAI giảm một nửa giá của toàn bộ phân khúc nhỏ. Một nhóm đã cố định cứng một người thắng vào tháng Bảy thì hôm nay đang chạy sai cấu hình.
Claude Opus 5 đang có trên OrcaRouter với mức giá niêm yết của Anthropic, theo cơ chế định giá chuyển tiếp, nghĩa là khi nhà cung cấp thay đổi mức giá thì phía chúng tôi có ngay trong cùng ngày, thay vì phải chờ một nhà bán lại đàm phán lại — đó chính là lý do cụ thể khiến đợt giảm giá Opus 5.5 có mặt trong danh mục của chúng tôi mà không cần một dự án tích hợp nào. Tính đến thời điểm viết bài này, GPT-6 Luna chưa có trên OrcaRouter; bạn truy cập nó qua API riêng của OpenAI. Vậy nên cách thiết lập trung thực cho một đội muốn dùng cả hai là một khóa cho Claude Opus 5 song song với bất cứ thứ gì bạn đang dùng cho OpenAI, với tính năng chuyển đổi dự phòng tự động bù đắp khoảng trống khi một nhà cung cấp gặp sự cố. Việc di chuyển một tuyến giữa một bộ phân loại giá một xu và một mô hình suy luận giá hai mươi lăm đô la bằng cách thay đổi cấu hình thay vì thay đổi đường dẫn mã đáng giá hơn việc chọn đúng vào tháng Chín.

Việc cần làm trong tuần này
Nếu bạn đang chạy Claude Opus 5, thì khoảng cách gấp năm mươi lần trong tiêu đề là một con số thật đang chỉ vào một quyết định sai. Quyết định của bạn là Opus 5.5 — giảm 20% giá niêm yết, điểm chỉ số cao hơn, và tỷ lệ đầu vào được lưu trong bộ nhớ đệm giảm 60% — còn GPT-6 Luna là một câu hỏi khác, tình cờ lại nằm cùng một trang.
Nếu bạn đang vận hành một pipeline phân loại hoặc trích xuất khối lượng lớn trên một mô hình đẳng cấp Opus, GPT-6 Luna là thay đổi chi phí đơn lẻ lớn nhất mà bạn có thể thực hiện trong tháng này, và việc chuyển đổi nhỏ hơn mức mà việc giảm giá hàm ý: cùng lớp ngữ cảnh 1M, cùng giới hạn đầu ra 128.000, và mức giá trên mỗi token thấp hơn năm mươi lần ở cả hai phía. Hãy thử nó ở mức nỗ lực trung bình trước khi bạn mặc nhiên dùng cấu hình mặc định, đặt các lệnh gọi ngữ cảnh dài của bạn ở phía bên phải của 272.000 token, và kiểm tra hồi quy lập trình dựa trên đánh giá của chính bạn thay vì dựa trên biểu đồ của nhà cung cấp.
Và nếu bạn đang chạy cả hai, thứ cần sửa không phải là bạn đã chọn cái nào. Mà là việc đổi ý hiện tại đang tốn một lần triển khai mã.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
