
Claude Opus 5.5 vs GPT-6 Astra: Khoảng cách 6 đô, và mức giá thứ hai mà Astra thu thêm khi vượt 272K
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 177 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1323 tok/s
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
Hai nhà cung cấp đã công bố bảng điểm chuẩn cho các mẫu flagship của mình trong tháng này, mỗi bảng đều cho thấy mô hình của chính họ giành chiến thắng, và không bảng nào có dù chỉ một dòng mà hai mô hình được chạy đối đầu với nhau. Claude Opus 5.5, ra mắt ngày 22 tháng 9 năm 2026 với giá 4 đô la cho mỗi triệu token đầu vào, và GPT-6 Astra, ra mắt ngày 3 tháng 9 năm 2026 với giá 10 đô la cho mỗi triệu token đầu vào, giữa chúng chỉ có đúng hai bài đánh giá trùng nhau — và chúng chia đôi hai bài đó, với Opus 5.5 chiếm phần việc gần với AutomationBench trong bảng của Anthropic và Astra chiếm phần đó trong bảng của OpenAI, còn Astra rõ ràng dẫn trước về suy luận khoa học ở cả hai. Đó là những gì tài liệu của nhà cung cấp có thể cho bạn biết. Bức tranh độc lập thì ít mơ hồ hơn và lại chỉ về hướng ngược lại, còn bức tranh về giá thì lệch hơn cả hai.
Mỗi bên đã công bố những gì
Bảng của Anthropic cho Opus 5.5 sử dụng harness riêng của họ và các thiết lập mức nỗ lực riêng, và ở những chỗ liệt kê Astra, các con số là của Anthropic, không phải kết quả chạy lại. Hãy coi toàn bộ tập hợp này là do nhà cung cấp báo cáo:
• Terminal-Bench 4.0 — Claude Opus 5.5 đạt 66,4% so với GPT-6 Astra 57,9% (Anthropic lưu ý rằng lượt chạy của Opus đã sử dụng mức nỗ lực xhigh)
• FrontierCode v1.1 — Claude Opus 5.5 54,4% so với GPT-6 Astra 53,3%
• GDPval-AA v2.1, công việc tri thức — Claude Opus 5.5 1.846 Elo so với GPT-6 Astra 1.542
• AutomationBench — Claude Opus 5.5 40,0% so với GPT-6 Astra 41,4% (Astra dẫn trước)
• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% so với GPT-6 Astra 64,6% (Astra dẫn trước)
• Humanity's Last Exam, với công cụ — Claude Opus 5.5 67.7% so với GPT-6 Astra 57.2%
Phía OpenAI thì khó đối chiếu hơn, vì OpenAI công bố Astra so với chính thế hệ tiền nhiệm của mình thay vì so với mẫu chủ lực của Anthropic, và những benchmark mà họ chọn — sử dụng máy tính, kỹ thuật front-end, kiến thức tổng quát — hầu như không xuất hiện trong bảng của Anthropic. Đó không phải là gian dối, mà là hành vi ra mắt thông thường, và đó chính xác là lý do vì sao một so sánh được dựng từ hai bảng của nhà cung cấp là so sánh giữa hai lựa chọn chứ không phải giữa hai mô hình. Điều duy nhất mà cả hai bảng đều đồng tình là Astra mạnh về agentic science và sử dụng máy tính, và rằng hai mô hình đủ sát nhau về lập trình đến mức việc chọn harness có thể làm thay đổi kết quả.
Bản đọc độc lập mà cả hai nhà cung cấp đều không chọn

Artificial Analysis chạy mọi mô hình trong một cấu hình đã được công bố, vì vậy các con số của nó là những con số duy nhất ở đây được tạo ra bởi cùng một đơn vị đánh giá dưới cùng những điều kiện:
• Chỉ số trí tuệ — Claude Opus 5.5 58, xếp hạng #1 trong 210 so với GPT-6 Astra 53, xếp hạng #6
• Nhãn cấu hình — Claude Opus 5.5 "Lý luận thích ứng, Nỗ lực tối đa, Dự phòng mặc định", GPT-6 Astra "max"
• Tốc độ đầu ra — GPT-6 Astra 52,5 token/giây, ở mức thấp của phân khúc giá so với Claude Opus 5.5 vốn chưa được công bố
• Thời gian đến token đầu tiên — GPT-6 Astra 352,15 giây so với trung vị của bảng xếp hạng là 3,83 giây; Claude Opus 5.5 chưa được công bố
• Giá — Claude Opus 5.5 $4.00 đầu vào / $20.00 đầu ra mỗi triệu token so với GPT-6 Astra $10.00 / $50.00
• Ngữ cảnh và đầu ra — ngữ cảnh 1M và đầu ra tối đa 128K của GPT-6 Astra so với 1M và 128K của Claude Opus 5.5
Khoảng cách năm điểm trên chỉ số tự nó không mang tính quyết định, và không nên được đọc như thể nó mang tính quyết định — cả hai mô hình đều nằm trong cùng một dải năng lực, và đó chính là ý nghĩa của "frontier" trong quý này. Điều mà các dòng Astra thực sự chứng minh là mức giá cao không mua được lợi thế dẫn đầu về năng lực trên bảng duy nhất mà cả hai mô hình cùng xuất hiện. Dòng độ trễ là điểm phức tạp trung thực: 352 giây cho token đầu tiên là cao nhất trong nhóm này với khoảng cách lớn, mặc dù nó được đo ở mức nỗ lực tối đa và một mô hình suy luận biết suy nghĩ trước khi phát ra sẽ luôn trông chậm theo chỉ số này. Con số 52.5 token/giây là con số dễ áp dụng hơn, và nó ở mức thấp đối với một mô hình có giá $10/$50.
Giá thứ hai của Astra, trên 272.000 token

Bảng giá là nơi hai dịch vụ này không còn có thể so sánh với nhau nữa, vì cách tính giá của Astra có một bậc nhảy. Mức giá tiêu chuẩn là $10.00 cho đầu vào, $1.00 cho đầu vào cache, $12.50 cho ghi cache và $50.00 cho đầu ra mỗi triệu token. Tuy nhiên, khi vượt qua 272.000 token đầu vào, toàn bộ yêu cầu sẽ được tính lại giá — không chỉ phần vượt, mà toàn bộ lần gọi — với mức đầu vào và cache gấp 2 lần, còn đầu ra gấp 1,5 lần. Điều đó khiến công việc ngữ cảnh dài rơi vào khoảng $20 cho đầu vào và $75 cho đầu ra mỗi triệu token.
Claude Opus 5.5 không làm điều này. Anthropic tính phí $4,00 và $20,00 với toàn bộ cửa sổ 1M token ở mức giá tiêu chuẩn, và tuyên bố rõ rằng một yêu cầu 900K token được tính phí theo cùng mức giá trên mỗi token như một yêu cầu 9K token. Vậy nên tỷ lệ được nêu bật giữa hai mô hình này — Astra có chi phí gấp 2,5 lần Opus 5.5 ở cả hai chiều — không phải là tỷ lệ áp dụng cho các khối lượng công việc mà cả hai mô hình thực sự được bán để phục vụ. Trên một tác nhân vận hành dài hạn mang theo ngữ cảnh làm việc lớn, so sánh là $20/$75 so với $4/$20, tức hệ số năm lần ở đầu vào và gần bốn lần ở đầu ra. Giá theo lô càng làm trầm trọng thêm thay vì khắc phục điều đó: Opus 5.5 giảm một nửa xuống $2,00/$10,00 trong khi gói linh hoạt của Astra giảm một nửa xuống $5,00/$25,00 trên một mức cơ sở vốn đã cao gấp năm lần trong trường hợp ngữ cảnh dài.
Đây là sự bất đối xứng liên quan đến quyết định nhất trong cuộc so tài này, và nó vô hình trong mọi bảng ra mắt của cả hai công ty, vì cả hai nhà cung cấp đều niêm yết mức giá chính. Nếu prompt của bạn nằm dưới 272K token, hãy bỏ qua nó. Nếu bạn đang xây dựng một agent đọc một repository hoặc một tập tài liệu, hãy định giá nó ở mức $20/$75 trước khi bạn so sánh bất cứ điều gì.
Khả năng tiếp cận là một phần của bản đặc tả
Astra là mô hình OpenAI đầu tiên vượt qua ngưỡng năng lực an ninh mạng Critical theo chính Khung Chuẩn bị (Preparedness Framework) của công ty, và cách triển khai phản ánh phân loại đó chứ không phải năng lực. Quyền truy cập được mở trước tiên cho một nhóm tổ chức hạn chế; quyền truy cập dành cho doanh nghiệp đòi hỏi quản trị viên phải bật trước khi người dùng nhìn thấy mô hình, và mô hình được phát hành từ chối thẳng một số loại công việc. Claude Opus 5.5 ra mắt với một phiên bản của vấn đề tương tự nhưng từ hướng ngược lại: nó đi kèm tầng biện pháp bảo vệ mà Anthropic trước đây dành riêng cho Claude Fable 5.1, nghĩa là hầu hết các yêu cầu về an ninh mạng đều được định tuyến lại sang Claude Opus 4.8 và công việc sinh học sẽ chuyển về Claude Opus 5 trừ khi tài khoản được xác minh.
Cả hai hành vi này đều xuất hiện ở cùng một chỗ, đó chính là bài đánh giá của bạn. Artificial Analysis gắn nhãn cho cấu hình của Opus 5.5 là "Default Fallback" chính xác là vì các yêu cầu có thể rơi vào một mô hình khác với mô hình mà bạn đã nêu tên, và với các prompt về bảo mật hoặc khoa học sự sống, điều đó xảy ra thường xuyên. Nếu khối lượng công việc của bạn thuộc những lĩnh vực đó, chuỗi mô hình trong yêu cầu của bạn không phải là sự đảm bảo về mô hình đã trả lời, và các số liệu chất lượng của bạn sẽ bao gồm một mô hình nhỏ hơn trong một tỷ lệ cuộc gọi chưa xác định. Không nhà cung cấp nào che giấu điều này — cả hai đều ghi rõ trong tài liệu — nhưng cả hai tiêu đề cũng không đề cập đến nó.
Lựa chọn giữa chúng
Quyết định mà cuộc đối đầu này thực sự đặt ra là liệu một khối lượng công việc ngữ cảnh dài có biện minh cho mức giá theo bậc của Astra hay không, và với hầu hết các nhóm, câu trả lời sẽ là không: Opus 5.5 rẻ hơn ở mọi mức dưới 272K, rẻ hơn đáng kể ở trên ngưỡng đó, đạt điểm cao hơn trên bảng xếp hạng độc lập duy nhất, và đạt tới 1M token ngữ cảnh mà không phụ thu thêm. Trường hợp của Astra hẹp hơn và có thật — suy luận khoa học, sử dụng máy tính, và bộ công cụ của hệ sinh thái OpenAI — và nếu các đánh giá của bạn đặt nó vượt trội ở những điểm đó, thì khoản phí cao hơn là một mục chi phí chứ không phải một sai sót.
Điều đó trở nên thực tế ở chỗ cách bạn cho hai mô hình đối đầu với nhau, bởi vì một so sánh công bằng đòi hỏi cả hai mô hình phải dùng cùng một khóa và cùng một hóa đơn. Cả hai đều có thể được định tuyến qua OrcaRouter ở mức giá niêm yết của nhà cung cấp với 0% phụ phí — Claude Opus 5.5 ở mức $4.00/$20.00 của Anthropic và GPT-6 Astra ở mức $10.00/$50.00 — nghĩa là quyết định 272K có thể được kiểm chứng trên chính lưu lượng của bạn thay vì tranh luận dựa trên hai thông cáo báo chí. Ghim Astra vào những lớp tác vụ mà nó giành chiến thắng và để tự động chuyển đổi dự phòng lo phần còn lại chính là một quy tắc định tuyến, và một yêu cầu vượt qua ranh giới 272K có thể được đưa xuống một đường rẻ hơn mà không cần thay đổi mã, bởi vì quy tắc nằm trong bộ định tuyến chứ không phải trong ứng dụng của bạn.

Điều gì sẽ làm thay đổi câu trả lời
Một điều sẽ là: một cuộc đối đầu trực tiếp có kiểm soát ở mức nỗ lực tương đương trên các benchmark dùng chung. Không nhà cung cấp nào đã công bố một cuộc như vậy và cũng không bên nào có động lực để làm điều đó, khiến chỉ số độc lập trở thành so sánh cùng điều kiện duy nhất hiện có — và chỉ số đó đặt Opus 5.5 cao hơn Astra năm điểm và năm bậc với mức giá token chưa bằng một nửa. Phản biện đáng lưu tâm là cả hai mô hình đều được chấm ở mức nỗ lực tối đa trong khi Opus 5.5 được phát hành với mặc định là mức trung bình; nếu lợi thế của Astra trong công việc khoa học dài hạn vẫn giữ được khi chạy ở nỗ lực tương đương, thì lập luận cho mức giá cao cấp sẽ mạnh hơn chứ không yếu đi. Cho đến khi có ai đó chạy nó, quan điểm có thể bảo vệ là Astra là một chuyên gia được định giá như mô hình tổng quát, còn Opus 5.5 là mô hình tổng quát mà tình cờ đạt điểm cao hơn.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
