Một thẻ tiêu đề được tạo cho Claude Opus 5.5 đấu với GPT-6 Astra, với phụ đề 'Chênh lệch sáu đô-la, và khoản phụ phí trên 272.000 token', cùng một biểu tượng cân thăng bằng phẳng và dòng chân trang ghi 'Chỉ số theo Artificial Analysis ở mức nỗ lực tối đa; giá theo nhà cung cấp.' Logo OrcaRouter thật được ghép ở góc dưới bên phải.
Guides & Insights

Claude Opus 5.5 vs GPT-6 Astra: Khoảng cách 6 đô, và mức giá thứ hai mà Astra thu thêm khi vượt 272K

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai nhà cung cấp đã công bố bảng điểm chuẩn cho các mẫu flagship của mình trong tháng này, mỗi bảng đều cho thấy mô hình của chính họ giành chiến thắng, và không bảng nào có dù chỉ một dòng mà hai mô hình được chạy đối đầu với nhau. Claude Opus 5.5, ra mắt ngày 22 tháng 9 năm 2026 với giá 4 đô la cho mỗi triệu token đầu vào, và GPT-6 Astra, ra mắt ngày 3 tháng 9 năm 2026 với giá 10 đô la cho mỗi triệu token đầu vào, giữa chúng chỉ có đúng hai bài đánh giá trùng nhau — và chúng chia đôi hai bài đó, với Opus 5.5 chiếm phần việc gần với AutomationBench trong bảng của Ant​hropic và Astra chiếm phần đó trong bảng của Open​AI, còn Astra rõ ràng dẫn trước về suy luận khoa học ở cả hai. Đó là những gì tài liệu của nhà cung cấp có thể cho bạn biết. Bức tranh độc lập thì ít mơ hồ hơn và lại chỉ về hướng ngược lại, còn bức tranh về giá thì lệch hơn cả hai.

Mỗi bên đã công bố những gì

Bảng của Anthropic cho Opus 5.5 sử dụng harness riêng của họ và các thiết lập mức nỗ lực riêng, và ở những chỗ liệt kê Astra, các con số là của Anthropic, không phải kết quả chạy lại. Hãy coi toàn bộ tập hợp này là do nhà cung cấp báo cáo:

• Terminal-Bench 4.0 — Claude Opus 5.5 đạt 66,4% so với GPT-6 Astra 57,9% (Anthropic lưu ý rằng lượt chạy của Opus đã sử dụng mức nỗ lực xhigh)

• FrontierCode v1.1 — Claude Opus 5.5 54,4% so với GPT-6 Astra 53,3%

• GDPval-AA v2.1, công việc tri thức — Claude Opus 5.5 1.846 Elo so với GPT-6 Astra 1.542

• AutomationBench — Claude Opus 5.5 40,0% so với GPT-6 Astra 41,4% (Astra dẫn trước)

• Terminal-Bench-Science 0.1 — Claude Opus 5.5 58,7% so với GPT-6 Astra 64,6% (Astra dẫn trước)

• Humanity's Last Exam, với công cụ — Claude Opus 5.5 67.7% so với GPT-6 Astra 57.2%

Phía OpenAI thì khó đối chiếu hơn, vì OpenAI công bố Astra so với chính thế hệ tiền nhiệm của mình thay vì so với mẫu chủ lực của Anthropic, và những benchmark mà họ chọn — sử dụng máy tính, kỹ thuật front-end, kiến thức tổng quát — hầu như không xuất hiện trong bảng của Anthropic. Đó không phải là gian dối, mà là hành vi ra mắt thông thường, và đó chính xác là lý do vì sao một so sánh được dựng từ hai bảng của nhà cung cấp là so sánh giữa hai lựa chọn chứ không phải giữa hai mô hình. Điều duy nhất mà cả hai bảng đều đồng tình là Astra mạnh về agentic science và sử dụng máy tính, và rằng hai mô hình đủ sát nhau về lập trình đến mức việc chọn harness có thể làm thay đổi kết quả.

Bản đọc độc lập mà cả hai nhà cung cấp đều không chọn

A two-column scoreboard comparing Claude Opus 5.5 and GPT-6 Astra across six shared rows: Intelligence Index (58, ranked #1 of 210, against 53, ranked #6), price in and out ($4.00 / $20.00 per million against $10.00 / $50.00), long-context surcharge (none against 2x input and 1.5x output above 272K), context window (1M tokens on both), output speed (not yet published against 52.5 tokens per second) and time to first token (not yet published against 352.15s). The footer reads 'Index, speed and latency figures per Artificial Analysis; prices and the 272K step per the vendors.'

Artificial Analysis chạy mọi mô hình trong một cấu hình đã được công bố, vì vậy các con số của nó là những con số duy nhất ở đây được tạo ra bởi cùng một đơn vị đánh giá dưới cùng những điều kiện:

• Chỉ số trí tuệ — Claude Opus 5.5 58, xếp hạng #1 trong 210 so với GPT-6 Astra 53, xếp hạng #6

• Nhãn cấu hình — Claude Opus 5.5 "Lý luận thích ứng, Nỗ lực tối đa, Dự phòng mặc định", GPT-6 Astra "max"

• Tốc độ đầu ra — GPT-6 Astra 52,5 token/giây, ở mức thấp của phân khúc giá so với Claude Opus 5.5 vốn chưa được công bố

• Thời gian đến token đầu tiên — GPT-6 Astra 352,15 giây so với trung vị của bảng xếp hạng là 3,83 giây; Claude Opus 5.5 chưa được công bố

• Giá — Claude Opus 5.5 $4.00 đầu vào / $20.00 đầu ra mỗi triệu token so với GPT-6 Astra $10.00 / $50.00

• Ngữ cảnh và đầu ra — ngữ cảnh 1M và đầu ra tối đa 128K của GPT-6 Astra so với 1M và 128K của Claude Opus 5.5

Khoảng cách năm điểm trên chỉ số tự nó không mang tính quyết định, và không nên được đọc như thể nó mang tính quyết định — cả hai mô hình đều nằm trong cùng một dải năng lực, và đó chính là ý nghĩa của "frontier" trong quý này. Điều mà các dòng Astra thực sự chứng minh là mức giá cao không mua được lợi thế dẫn đầu về năng lực trên bảng duy nhất mà cả hai mô hình cùng xuất hiện. Dòng độ trễ là điểm phức tạp trung thực: 352 giây cho token đầu tiên là cao nhất trong nhóm này với khoảng cách lớn, mặc dù nó được đo ở mức nỗ lực tối đa và một mô hình suy luận biết suy nghĩ trước khi phát ra sẽ luôn trông chậm theo chỉ số này. Con số 52.5 token/giây là con số dễ áp dụng hơn, và nó ở mức thấp đối với một mô hình có giá $10/$50.

Giá thứ hai của Astra, trên 272.000 token

A generated graphic titled 'Where GPT-6 Astra's price steps', with a subtitle reading 'Crossing 272,000 input tokens reprices the whole call, not the excess.' Two panels compare per-million-token rates: below 272,000 input tokens Claude Opus 5.5 is $4.00 / $20.00 against GPT-6 Astra at $10.00 / $50.00, and above 272,000 input tokens Claude Opus 5.5 stays at $4.00 / $20.00 while GPT-6 Astra moves to approximately $20.00 / $75.00. The footer reads 'Per-million-token rates. Astra's step per OpenAI; Opus 5.5 bills its full 1M window at one rate per Anthropic.'

Bảng giá là nơi hai dịch vụ này không còn có thể so sánh với nhau nữa, vì cách tính giá của Astra có một bậc nhảy. Mức giá tiêu chuẩn là $10.00 cho đầu vào, $1.00 cho đầu vào cache, $12.50 cho ghi cache và $50.00 cho đầu ra mỗi triệu token. Tuy nhiên, khi vượt qua 272.000 token đầu vào, toàn bộ yêu cầu sẽ được tính lại giá — không chỉ phần vượt, mà toàn bộ lần gọi — với mức đầu vào và cache gấp 2 lần, còn đầu ra gấp 1,5 lần. Điều đó khiến công việc ngữ cảnh dài rơi vào khoảng $20 cho đầu vào và $75 cho đầu ra mỗi triệu token.

Claude Opus 5.5 không làm điều này. Anthropic tính phí $4,00 và $20,00 với toàn bộ cửa sổ 1M token ở mức giá tiêu chuẩn, và tuyên bố rõ rằng một yêu cầu 900K token được tính phí theo cùng mức giá trên mỗi token như một yêu cầu 9K token. Vậy nên tỷ lệ được nêu bật giữa hai mô hình này — Astra có chi phí gấp 2,5 lần Opus 5.5 ở cả hai chiều — không phải là tỷ lệ áp dụng cho các khối lượng công việc mà cả hai mô hình thực sự được bán để phục vụ. Trên một tác nhân vận hành dài hạn mang theo ngữ cảnh làm việc lớn, so sánh là $20/$75 so với $4/$20, tức hệ số năm lần ở đầu vào và gần bốn lần ở đầu ra. Giá theo lô càng làm trầm trọng thêm thay vì khắc phục điều đó: Opus 5.5 giảm một nửa xuống $2,00/$10,00 trong khi gói linh hoạt của Astra giảm một nửa xuống $5,00/$25,00 trên một mức cơ sở vốn đã cao gấp năm lần trong trường hợp ngữ cảnh dài.

Đây là sự bất đối xứng liên quan đến quyết định nhất trong cuộc so tài này, và nó vô hình trong mọi bảng ra mắt của cả hai công ty, vì cả hai nhà cung cấp đều niêm yết mức giá chính. Nếu prompt của bạn nằm dưới 272K token, hãy bỏ qua nó. Nếu bạn đang xây dựng một agent đọc một repository hoặc một tập tài liệu, hãy định giá nó ở mức $20/$75 trước khi bạn so sánh bất cứ điều gì.

Khả năng tiếp cận là một phần của bản đặc tả

Astra là mô hình OpenAI đầu tiên vượt qua ngưỡng năng lực an ninh mạng Critical theo chính Khung Chuẩn bị (Preparedness Framework) của công ty, và cách triển khai phản ánh phân loại đó chứ không phải năng lực. Quyền truy cập được mở trước tiên cho một nhóm tổ chức hạn chế; quyền truy cập dành cho doanh nghiệp đòi hỏi quản trị viên phải bật trước khi người dùng nhìn thấy mô hình, và mô hình được phát hành từ chối thẳng một số loại công việc. Claude Opus 5.5 ra mắt với một phiên bản của vấn đề tương tự nhưng từ hướng ngược lại: nó đi kèm tầng biện pháp bảo vệ mà Anthropic trước đây dành riêng cho Claude Fable 5.1, nghĩa là hầu hết các yêu cầu về an ninh mạng đều được định tuyến lại sang Claude Opus 4.8 và công việc sinh học sẽ chuyển về Claude Opus 5 trừ khi tài khoản được xác minh.

Cả hai hành vi này đều xuất hiện ở cùng một chỗ, đó chính là bài đánh giá của bạn. Artificial Analysis gắn nhãn cho cấu hình của Opus 5.5 là "Default Fallback" chính xác là vì các yêu cầu có thể rơi vào một mô hình khác với mô hình mà bạn đã nêu tên, và với các prompt về bảo mật hoặc khoa học sự sống, điều đó xảy ra thường xuyên. Nếu khối lượng công việc của bạn thuộc những lĩnh vực đó, chuỗi mô hình trong yêu cầu của bạn không phải là sự đảm bảo về mô hình đã trả lời, và các số liệu chất lượng của bạn sẽ bao gồm một mô hình nhỏ hơn trong một tỷ lệ cuộc gọi chưa xác định. Không nhà cung cấp nào che giấu điều này — cả hai đều ghi rõ trong tài liệu — nhưng cả hai tiêu đề cũng không đề cập đến nó.

Lựa chọn giữa chúng

Quyết định mà cuộc đối đầu này thực sự đặt ra là liệu một khối lượng công việc ngữ cảnh dài có biện minh cho mức giá theo bậc của Astra hay không, và với hầu hết các nhóm, câu trả lời sẽ là không: Opus 5.5 rẻ hơn ở mọi mức dưới 272K, rẻ hơn đáng kể ở trên ngưỡng đó, đạt điểm cao hơn trên bảng xếp hạng độc lập duy nhất, và đạt tới 1M token ngữ cảnh mà không phụ thu thêm. Trường hợp của Astra hẹp hơn và có thật — suy luận khoa học, sử dụng máy tính, và bộ công cụ của hệ sinh thái OpenAI — và nếu các đánh giá của bạn đặt nó vượt trội ở những điểm đó, thì khoản phí cao hơn là một mục chi phí chứ không phải một sai sót.

Điều đó trở nên thực tế ở chỗ cách bạn cho hai mô hình đối đầu với nhau, bởi vì một so sánh công bằng đòi hỏi cả hai mô hình phải dùng cùng một khóa và cùng một hóa đơn. Cả hai đều có thể được định tuyến qua OrcaRouter ở mức giá niêm yết của nhà cung cấp với 0% phụ phí — Claude Opus 5.5 ở mức $4.00/$20.00 của Anthropic và GPT-6 Astra ở mức $10.00/$50.00 — nghĩa là quyết định 272K có thể được kiểm chứng trên chính lưu lượng của bạn thay vì tranh luận dựa trên hai thông cáo báo chí. Ghim Astra vào những lớp tác vụ mà nó giành chiến thắng và để tự động chuyển đổi dự phòng lo phần còn lại chính là một quy tắc định tuyến, và một yêu cầu vượt qua ranh giới 272K có thể được đưa xuống một đường rẻ hơn mà không cần thay đổi mã, bởi vì quy tắc nằm trong bộ định tuyến chứ không phải trong ứng dụng của bạn.

A screenshot of OrcaRouter's own model page for openai/gpt-6-astra, headed 'GPT-6 Astra' and credited to OpenAI, showing a 1M-token context, 128K max output, a text, image and file input modality, and a stat strip reading INPUT $10.00 and OUTPUT $50.00 per 1M tokens with a 10.00s p50 time to first token and 298.0M tokens of traffic over 7 days.

Điều gì sẽ làm thay đổi câu trả lời

Một điều sẽ là: một cuộc đối đầu trực tiếp có kiểm soát ở mức nỗ lực tương đương trên các benchmark dùng chung. Không nhà cung cấp nào đã công bố một cuộc như vậy và cũng không bên nào có động lực để làm điều đó, khiến chỉ số độc lập trở thành so sánh cùng điều kiện duy nhất hiện có — và chỉ số đó đặt Opus 5.5 cao hơn Astra năm điểm và năm bậc với mức giá token chưa bằng một nửa. Phản biện đáng lưu tâm là cả hai mô hình đều được chấm ở mức nỗ lực tối đa trong khi Opus 5.5 được phát hành với mặc định là mức trung bình; nếu lợi thế của Astra trong công việc khoa học dài hạn vẫn giữ được khi chạy ở nỗ lực tương đương, thì lập luận cho mức giá cao cấp sẽ mạnh hơn chứ không yếu đi. Cho đến khi có ai đó chạy nó, quan điểm có thể bảo vệ là Astra là một chuyên gia được định giá như mô hình tổng quát, còn Opus 5.5 là mô hình tổng quát mà tình cờ đạt điểm cao hơn.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày