
Claude Opus 5.5 vs GPT-6 Astra: Phép Thử Nếm Vượt Xa Các Bài Đánh Giá Chuẩn
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Ai đó đã yêu cầu Claude Opus 5.5 làm một video ngắn về việc một phòng thí nghiệm đối thủ giải được Navier-Stokes, đăng kết quả lên, rồi viết câu khiến việc so sánh này trở nên đáng làm: mô hình này "rất dễ chịu", nó có "gu thẩm mỹ tuyệt vời", và đây là Claude đầu tiên kể từ Opus 4.7 mà họ thực sự muốn chạy với cường độ cao — nhưng họ vẫn giữ GPT-6 Astra và GPT-5.6 Sol làm mô hình chính, vì công việc của họ nặng về nghiên cứu. Đó là ba tuyên bố trong một bài đăng, và chúng kéo về những hướng khác nhau. Một mô hình có thể là thứ dễ chịu nhất để làm việc cùng mà vẫn không phải là mô hình bạn định tuyến lưu lượng production tới. Câu hỏi thú vị không phải là mô hình nào tốt hơn. Mà là phán quyết nào trong hai phán quyết đó đứng vững khi đối chiếu với các con số, và phán quyết nào hóa ra chỉ là một phát biểu về thị hiếu.
Bài viết là báo cáo của một người thực hành, không phải một lần chạy benchmark — hãy coi nó như một tín hiệu về cảm giác của mô hình khi làm việc sáng tạo và kết thúc mở, chứ không phải bằng chứng về năng lực. Mọi số liệu bên dưới đều được ghi rõ ai tạo ra chúng.
Thử nếm có thể và không thể cho bạn biết được điều gì
Ở đây, thành phẩm mới là điều quan trọng. Việc làm một video về một kết quả toán học không phải là một nhiệm vụ lập trình có cổng đạt/không đạt. Không có bước biên dịch, không có bộ kiểm thử, không có khung Terminal-Bench để chấm điểm xem thứ đó có tốt hay không. Mô hình phải chọn một góc tiếp cận, quyết định sẽ trình bày gì, giữ cho nó mạch lạc, và dừng lại. Khi một người hành nghề nói rằng một mô hình có "gu thẩm mỹ tuyệt vời", đó chính là điều họ đang mô tả: khả năng phán đoán về phạm vi và mức độ nhấn mạnh, thứ thể hiện rõ trong những công việc mà bản đặc tả cố tình mơ hồ.
Đó là một năng lực thực sự, và đó là thứ mà các bộ benchmark đo lường kém nhất. Đó cũng là lý do cùng một người có thể khen một mô hình mà không chuyển sang dùng nó. Gu là thứ bạn muốn khi đang khám phá. Nó không phải thứ bạn muốn khi bạn có 200.000 dòng mã cần kiểm tra và một hóa đơn cần biện minh.
Cách định khung khi ra mắt của chính Anthropic cũng hướng đến cùng năng lực đó, bằng văn xuôi thay vì video: Claude Opus 5.5 được quảng bá là viết ít "Claudish" hơn — ít mào đầu, ít rào đón, sẵn sàng nêu ý chính trước hơn. Các thang điểm đọc hiểu độc lập ủng hộ hướng của tuyên bố đó, ngay cả khi chúng không đồng tình về mức độ. Nhà cung cấp cũng báo cáo một bài kiểm tra kiểm chứng thông tin nội bộ đạt 16 trên 18 lần thử, so với 0 trên 18 đối với cả Claude Fable 5.1 và Claude Opus 5; con số đó là của chính Anthropic, chưa được tái lập, và nên được đọc như một tuyên bố thay vì một kết quả.
Hai bảng điểm, một bất đồng đáng quan tâm

Trên các kết quả đánh giá thô đã công bố, Claude Opus 5.5 thường dẫn trước GPT-6 Astra hơn là không. Vấn đề là hai nguồn được trích dẫn nhiều nhất không thống nhất về mức độ dẫn trước là bao nhiêu.
Bảng công bố của Anthropic đặt Claude Opus 5.5 ở mức 66,4% trên Terminal-Bench 4.0, với GPT-6 Astra đạt 57,9% và Claude Fable 5.1 đạt 55,8%. Đó là mức dẫn trước 8,5 điểm do nhà cung cấp tự báo cáo trong lập trình agentic — kiểu cách biệt đủ để kết thúc mọi tranh luận trên một bộ slide tiếp thị. Artificial Analysis, khi vận hành harness riêng, đo được Claude Opus 5.5 ở mức 59,6% trên cùng benchmark: ngang bằng GPT-6 Astra ở mức nỗ lực xhigh, và cao hơn Claude Opus 5 khoảng 11 điểm. Khoảng cách dẫn đầu là có thật trong cả hai cách đọc. Còn độ lớn của nó thì không.
Nơi hai mô hình hoán đổi vị trí cho nhau hữu ích hơn nơi chúng không làm thế:
• Terminal-Bench 4.0 (lập trình tác tử) — Claude Opus 5.5 đạt 66,4% theo bảng của chính Anthropic, 59,6% theo Artificial Analysis; GPT-6 Astra đạt 57,9%.
• Humanity's Last Exam, với các công cụ — Claude Opus 5.5 67,7% do nhà cung cấp báo cáo, được đo lường độc lập ở mức 61,4%; GPT-6 Astra 57,2%.
• GDPval-AA v2.1 (công việc tri thức thực tế trên 44 nghề nghiệp) — Claude Opus 5.5 1.846 Elo; GPT-6 Astra 1.542 Elo. Cả hai con số đều đến từ bảng độc lập của Artificial Analysis, không phải từ nhà cung cấp.
• Terminal-Bench-Science 0.1 — GPT-6 Astra 64,6% so với Claude Opus 5.5 58,7%. Đây là một chiến thắng thuyết phục của Astra, và đây là benchmark tác tử mang hơi hướng khoa học.
• AutomationBench — GPT-6 Astra 41,4% so với Claude Opus 5.5 40,0%. Sít sao, nhưng lại là Astra.
• FrontierCode v1.1 — Claude Opus 5.5 54,4% so với GPT-6 Astra 53,3%. Chênh lệch chưa đầy một điểm.
Hãy đọc danh sách đó theo cách một người hành nghề sẽ đọc. Những khối lượng công việc nặng về nghiên cứu — những cái có thành phần khoa học hoặc tài liệu, những cái chạy một vòng lặp sử dụng công cụ dài và cần mô hình giữ vững phong độ — chính là nơi GPT-6 Astra trụ vững. Các bảng xếp hạng về công việc tri thức và lập trình, nơi Claude Opus 5.5 bỏ xa, chính là những bảng bạn sẽ chỉ vào nếu công việc của bạn là phát hành phần mềm. Cả hai người trong cuộc trò chuyện này đều đang đọc đúng benchmark của riêng họ. Họ chỉ đang đọc những benchmark khác nhau.
Thiết lập mức độ nỗ lực đang làm việc nhiều hơn cả mô hình
Có một lý do thứ hai, kém tô hồng hơn, khiến biên lợi nhuận nổi bật trở nên yếu ớt. Các so sánh nhà cung cấp không được chạy trong cùng một thiết lập.
Các số liệu được công bố của Claude Opus 5.5 đến từ cấu hình nỗ lực suy luận cao đặc biệt (xhigh), đối đầu với GPT-6 Astra ở mức high. Các lần chạy độc lập của Artificial Analysis đặt cả hai mô hình ở xhigh, và khoảng cách về lập trình biến mất — mức dẫn trước 8,5 điểm của nhà cung cấp trở thành hòa. Đó không phải là lời cáo buộc hành vi sai trái; đó là điều xảy ra khi một nhà cung cấp chọn cấu hình thể hiện mô hình của họ tốt nhất và một phòng thí nghiệm độc lập chọn cấu hình phù hợp với đối thủ cạnh tranh. Trước khi bạn chuyển một khối lượng công việc dựa trên sức mạnh của một bảng benchmark, hãy kiểm tra xem nó đã được chạy ở cài đặt nỗ lực nào, vì câu trả lời thường là "cấu hình tâng bốc."
Hóa đơn token kể cùng một câu chuyện từ một góc nhìn khác. Tài liệu ra mắt của chính Anthropic cho thấy Claude Opus 5.5 tiêu tốn vào khoảng 119.000 token cho mỗi bài toán, với khoảng 84.000 trong số đó dành cho suy luận, trong khi GPT-6 Astra giải các bài toán tương đương chỉ với khoảng 27.000 token. Token suy luận được tính như token đầu ra. Một mô hình dùng số token gấp bốn lần với mức giá đầu ra chỉ bằng một phần năm thì gần như huề tiền — và đó là còn chưa tính đến việc mô hình rẻ hơn thường lại chính là mô hình mà bạn vốn sẵn sàng chạy ở thiết lập nỗ lực cao hơn.
Một lưu ý bổ sung nữa nằm riêng ở phía Claude Opus 5.5: cơ chế định tuyến bảo vệ của Anthropic có thể đưa một số yêu cầu liên quan đến an ninh mạng và sinh học sang một luồng hạn chế hơn, khiến điểm số đã công bố trên các đánh giá đó thấp hơn so với mức mà mô hình nền sẽ tạo ra. Nếu công việc của bạn chạm đến những lĩnh vực đó, khoảng cách giữa benchmark và trải nghiệm của bạn sẽ là thật, và nó sẽ theo hướng benchmark lạc quan hơn.
Một tác vụ thực sự tốn bao nhiêu trên mỗi cái

Claude Opus 5.5 là mô hình rẻ hơn trên bảng giá, và khoảng cách không hề nhỏ:
• Claude Opus 5.5 — 4,00 USD cho mỗi triệu token đầu vào, 20,00 USD cho mỗi triệu token đầu ra, 0,20 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm, 5,00 USD cho mỗi triệu lần ghi vào bộ nhớ đệm. Ngữ cảnh 1M token, đầu ra tối đa 128k.
• GPT-6 Astra — $10.00 mỗi triệu đầu vào, $50.00 mỗi triệu đầu ra, $1.00 mỗi triệu đầu vào được lưu trong bộ nhớ đệm, $12.50 mỗi triệu lần ghi bộ nhớ đệm. Khi vượt quá 272,000 token đầu vào trong một yêu cầu duy nhất, toàn bộ yêu cầu được tính lại giá ở mức $20.00 cho đầu vào và $100.00 cho đầu ra; bậc theo lô là $5.00/$25.00.
Vậy Claude Opus 5.5 rẻ hơn 2,5 lần ở đầu vào và rẻ hơn 2,5 lần ở đầu ra, với đầu vào được cache rẻ hơn năm lần. Nếu các tác vụ của bạn tương tự về token, thì đó là toàn bộ quyết định và câu hỏi về gu chỉ còn là trang trí.
Lưu ý về mức sử dụng token ở trên chính là điều khiến nó không đơn giản như vậy, và việc định giá lại cho ngữ cảnh dài của GPT-6 Astra là cái bẫy còn lại. Vượt qua 272.000 token đầu vào trong một yêu cầu thì toàn bộ yêu cầu — chứ không chỉ phần vượt mức — sẽ chuyển sang mức giá ngữ cảnh dài. Một khối lượng công việc nghiên cứu nhồi cả một tập ngữ liệu lớn vào một lần gọi duy nhất chính là dạng thức kích hoạt điều đó. Batch với giá bằng một nửa là lối thoát chính đáng, và nó nằm trên hàng đợi chậm hơn.
Tóm tắt trung thực là bức tranh chi phí đảo ngược tùy vào việc bạn đang làm gì. Với một tác vụ mà cả hai mô hình dùng lượng token tương đương, Claude Opus 5.5 thắng về giá với khoảng cách lớn. Với một vòng lặp nghiên cứu agentic dài, nơi số token phân kỳ đúng như tài liệu ra mắt của chính Anthropic cho thấy, cả hai hội tụ lại — một tiêu đề kém hấp dẫn hơn nhiều so với việc cắt giảm 40% chi phí, và gần với những gì người thực hành đã báo cáo.
Vì sao người dùng chú trọng nghiên cứu đã không chuyển đổi
Ghép các mảnh lại với nhau thì câu "vẫn thích Astra hơn" không còn là điều mâu thuẫn với câu "hương vị tuyệt vời" nữa. Đó vẫn là cùng một nhận xét, chỉ là nhìn từ một chỗ ngồi khác.
Các khối lượng công việc mà người dùng nêu tên đều dài, kết thúc mở, có dùng công cụ và tốn kém mỗi lần chạy. Với những khối lượng đó, GPT-6 Astra đứng đầu các bảng xếp hạng khoa học và tự động hóa, chỉ dùng một phần nhỏ token suy nghĩ, và — theo đo lường độc lập — ngang ngửa về lập trình khi cả hai mô hình chạy ở cùng mức nỗ lực. Các lợi thế của Claude Opus 5.5 tập trung vào phần việc mà bạn có thể nhìn thấy đầu ra và đánh giá nó: văn xuôi, các lựa chọn thiết kế, xác định phạm vi cho một đề bài mơ hồ, quyết định xem một video về Navier-Stokes thực ra nên thể hiện điều gì. Đó là gu thẩm mỹ, và gu thẩm mỹ chính xác là phần không xuất hiện trên một trục benchmark.
Nếu bạn đang hy vọng vào một phán quyết rằng một mô hình sẽ thắng, thì bằng chứng không ủng hộ điều đó. Cách diễn giải có thể bảo vệ được thì hẹp hơn: Claude Opus 5.5 là mô hình tốt hơn cho công việc mà khả năng phán đoán là điểm nghẽn, GPT-6 Astra là mô hình tốt hơn cho công việc mà nỗ lực bền bỉ với ngữ cảnh dài là điểm nghẽn, và khoảng cách giá giữa chúng thu hẹp đến gần như không còn ở loại công việc thứ hai. Đó là một quyết định định tuyến, không phải một sự chuyển đổi.
Chạy cả hai mà không cần migration

Đây là phần mà hai mô hình không còn là chuyện hoặc cái này hoặc cái kia nữa. GPT-6 Astra đã có trên OrcaRouter ngay hôm nay với đúng mức giá niêm yết của chính OpenAI — $10.00 đầu vào, $50.00 đầu ra, $1.00 đọc từ bộ nhớ đệm, $12.50 ghi bộ nhớ đệm — với 0% phụ thu, giá niêm yết của nhà cung cấp được chuyển thẳng qua. Nghĩa là khi nhà cung cấp thay đổi mức giá, phía chúng tôi cập nhật ngay trong cùng ngày, thay vì phải chờ đến khi nhà bán lại đồng bộ xong.
Claude Opus 5.5 có thể truy cập được thông qua API của chính Anthropic và một số nền tảng bên thứ ba; chúng tôi không liệt kê nó như một dịch vụ mà chúng tôi cung cấp, và bạn nên hoài nghi bất cứ ai khẳng định điều ngược lại trước khi mô hình được phổ biến rộng rãi. Điều bạn có thể làm ngay hôm nay là đặt cả hai mô hình phía sau một khóa và một dạng endpoint, rồi định tuyến theo từng khối lượng công việc thay vì theo sở thích: gửi yêu cầu mở, nặng về phán đoán đến Claude Opus 5.5 và vòng nghiên cứu dài đến GPT-6 Astra mà không phải duy trì hai hợp đồng hay hai tích hợp client.
Chuyển đổi dự phòng tự động là điều khiến việc đó an toàn để thử nghiệm. Một mô hình mới vẫn chưa phải là một đường đi vào sản xuất, và định tuyến qua một điểm cuối duy nhất nghĩa là sự cố của nhà cung cấp hoặc giới hạn tần suất sẽ chuyển hướng yêu cầu thay vì làm nó thất bại. Nếu bạn muốn tìm hiểu liệu khoảng cách về gu có thật trên chính công việc của mình hay không, đó là cách rẻ để tìm ra — hãy chạy nó song song với những gì bạn đã có thay vì thay thế, và để bộ kiểm thử của riêng bạn quyết định thay vì các bảng số liệu khi ra mắt.
Câu hỏi mà các benchmark không thể trả lời
Có hai điều đáng để quan tâm, và không điều nào trong số đó là một điểm benchmark khác.
Điều đầu tiên là liệu sự bất đối xứng trong thiết lập mức nỗ lực có được giải quyết hay không. Hiện tại, một bảng của nhà cung cấp ở xhigh so với đối thủ ở high tạo ra mức dẫn trước 8,5 điểm mà thử nghiệm độc lập ở các thiết lập khớp nhau biến thành thế hòa. Khi các phòng thí nghiệm độc lập công bố các lượt chạy ở thiết lập khớp nhau trên các bảng khoa học và tự động hóa, nơi GPT-6 Astra hiện đang dẫn đầu, bức tranh đó có thể dịch chuyển theo chiều hướng bất kỳ — và nó sẽ dịch chuyển dựa trên bằng chứng chứ không dựa trên cách đặt vấn đề của bất kỳ ai.
Điều thứ hai là câu hỏi về hiệu quả token. Nếu chi phí suy nghĩ của Claude Opus 5.5 giảm xuống trong một bản phát hành điểm, thì lợi thế bảng giá gấp 2,5 lần của nó không còn bị bù trừ nữa, và lập luận về giá thắng hoàn toàn. Nếu không, thì người thực hành vẫn giữ GPT-6 Astra làm lựa chọn chính không hề tụt lại phía sau chu kỳ tin tức. Họ đã đọc đúng khối lượng công việc của chính mình, và bảng ra mắt đơn giản là không đo lường được điều đó.
So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
