Thẻ tiêu đề được tạo ghi "GPT-6 so với Claude Opus 5", với một chip ghi "Opus 5 được thay thế bởi Claude Opus 5.5, 22 tháng 9, 2026" và một chip ghi "GPT-6 Sol được thay thế bởi GPT-6.1 Sol, 29 tháng 9, 2026", và một chân trang ghi "Cả hai mô hình vẫn được định tuyến; số liệu chỉ số theo Artificial Analysis." Logo OrcaRouter được ghép ở góc dưới cùng bên phải.
Guides & Insights

GPT-6 {{1}}Claude Opus 5{{/1}}: Cả hai phía của cuộc đối đầu này đều đã bị thay thế

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Điều hữu ích nhất cần biết về GPT-6 so với Claude Opus 5 là cả hai phía trong cuộc so tài này đều đã tụt lại một thế hệ so với chính nhà cung cấp của chúng. Claude Opus 5 ra mắt ngày 24 tháng 7 năm 2026 và được thay thế bằng Claude Opus 5.5 vào ngày 22 tháng 9. GPT-6 Sol ra mắt ngày 22 tháng 9 và được thay thế bằng GPT-6.1 Sol vào ngày 29 tháng 9. Nếu bạn tìm kiếm so sánh này vì đang cân nhắc chọn một trong hai cho công việc mới, thì bạn đang chọn giữa hai mô hình mà mỗi nhà cung cấp đều đã vượt qua — và phiên bản trung thực của bài viết này nói về thời điểm cặp cũ hơn vẫn là lựa chọn đúng, chứ không phải về việc ai thắng.

Hai mô hình thực sự là gì

Claude Opus 5 là mẫu flagship của Anthropic: cửa sổ ngữ cảnh 1.000.000 token, tối đa 128.000 token đầu ra, nhận đầu vào dạng văn bản, hình ảnh và tệp, với giá niêm yết 5,00 USD mỗi triệu token đầu vào và 25,00 USD mỗi triệu token đầu ra, cùng mức 0,50 USD cho đầu vào đã lưu đệm và 10,00 USD cho ghi bộ đệm. Đây là một mô hình duy nhất với một id duy nhất, anthropic/claude-opus-5.

GPT-6 Sol là bậc trung của một thế hệ gồm ba mô hình — GPT-6 Astra ở trên nó và GPT-6 Luna ở dưới nó — với cùng ngữ cảnh hơn 1.000.000 token (danh mục liệt kê 1.050.000 cho phía OpenAI so với 1.000.000 của Opus 5), cùng giới hạn đầu ra 128.000 token và cùng đầu vào văn bản/hình ảnh/tệp. Nó được niêm yết ở mức $2,00 / $10,00, với mức $0,20 cho đầu vào được lưu trong bộ nhớ đệm và mức $2,50 cho ghi bộ nhớ đệm. Bảng giá của nó có một bước mà bảng giá Anthropic không có: mọi yêu cầu trên 272.000 token đầu vào sẽ định giá lại toàn bộ yêu cầu thành $4,00 / $15,00.

Đó là khoảng cách giá 2,5 lần trên mỗi token theo hướng có lợi cho Sol ở đầu ngắn, và khoảng cách này cũng giữ nguyên khi tính đến cache — mức chiết khấu 90% cho đầu vào được cache trên Sol so với mức chiết khấu 98% trên Opus 5, điều này thu hẹp chênh lệch xuống còn 0,20 đô-la so với 0,50 đô-la mỗi triệu token chứ không xóa bỏ nó. Với khối lượng công việc ngữ cảnh dài, khoảng cách giảm một nửa chứ không khép lại.

• Đầu vào — GPT-6 Sol $2.00 mỗi triệu so với Claude Opus 5 $5.00
• Đầu ra — GPT-6 Sol $10.00 mỗi triệu so với Claude Opus 5 $25.00
• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Sol $0.20 mỗi triệu so với Claude Opus 5 $0.50
• Ghi vào bộ nhớ đệm — GPT-6 Sol $2.50 mỗi triệu so với Claude Opus 5 $10.00
• Đầu vào trên 272K — GPT-6 Sol định giá lại toàn bộ yêu cầu thành $4.00 / $15.00; không có mức tương đương trên bảng giá Opus 5
• Ngữ cảnh và đầu ra — 1,050,000 đầu vào và 128,000 đầu ra so với 1,000,000 đầu vào và 128,000 đầu ra

Bảng độc lập, nơi khoảng cách lớn hơn giá

Về giá, GPT-6 Sol chiếm ưu thế gấp 2,5 lần. Bảng xếp hạng lại nghiêng về Claude Opus 5 nhiều hơn mức mà khoảng cách giá cho thấy, điều này ngược lại với câu chuyện thường thấy về các mô hình rẻ.

• AA Intelligence Index — Claude Opus 5 50.8, xếp thứ 11; GPT-6 Sol 47.6, xếp thứ 14
• AA Coding Index — Claude Opus 5 78.0, xếp thứ 2 trên bảng xếp hạng đó; GPT-6 Sol 60.0
• GPQA Diamond — Claude Opus 5 93.2
• Humanity's Last Exam — Claude Opus 5 54.9 so với GPT-6 Sol 47.9
• Terminal-Bench 2.1 — Claude Opus 5 89.1
• Terminal-Bench 4.0 — Claude Opus 5 49.0 so với GPT-6 Sol 43.9
• τ-bench banking — Claude Opus 5 42.1
• SciCode — Claude Opus 5 56.4 so với GPT-6 Sol 57.6
• Khả năng ghi nhớ ngữ cảnh dài — Claude Opus 5 79.3 so với GPT-6 Sol 83.7

Hai hàng đi theo hướng ngược lại, và chúng đáng được nêu tên, bởi vì con số tổng hợp đã che giấu chúng. GPT-6 Sol đánh bại Opus 5 ở khả năng truy hồi ngữ cảnh dài với cách biệt 4,4 điểm và nhỉnh hơn ở SciCode 1,2 điểm. Vậy nên bức tranh trung thực không phải là "Opus 5 giỏi hơn ở mọi thứ" — mà là Opus 5 vượt trội một cách dứt khoát trên các bảng về lập trình và tác nhân (mức dẫn trước 24 điểm trên Coding Index là một đẳng cấp kết quả khác hẳn), trong khi Sol nắm giữ hàng truy hồi trên cửa sổ dài và hòa ở một trong hai thước đo mã khoa học.

Một lưu ý về phương pháp trước khi một trong hai con số được trích dẫn ở bất kỳ đâu khác: Artificial Analysis không đảm bảo rằng hai trang mô hình được hiển thị dựa trên cùng một bản sửa đổi chỉ số trong cùng một ngày, và tổ chức này chia tách các nhóm so sánh ngang hàng của mình — các mô hình trọng số mở được xếp hạng so với các mô hình trọng số mở khác cùng phân khúc kích thước, còn các mô hình độc quyền được so trong một dải giá độc quyền. Cả hai mô hình ở đây đều là độc quyền, nên hai con số đến từ cùng một phía của ranh giới đó, nhưng hãy coi những khác biệt dưới một điểm là mang tính định hướng thay vì một phép đo có kiểm soát. Mọi con số nhà cung cấp trong bài viết này đều là việc nhà cung cấp tự đánh giá mô hình của chính họ so với phiên bản tiền nhiệm của chính họ và đều được ghi nhãn như vậy.

Hai sự thay thế đã thay đổi những gì

Claude Opus 5.5 ra mắt ngày 22 tháng 9 với mức giá 4,00 USD / 20,00 USD — rẻ hơn Opus 5 trên cả hai thước đo, với mức giá đầu vào được lưu đệm là 0,20 USD ngang bằng với Sol — và đạt 57,6 điểm trên cùng Intelligence Index. Như vậy là cao hơn Opus 5 6,8 điểm với chi phí ít hơn 20%. Mọi lập luận cho việc giữ Opus 5 trong một bản dựng mới đều phải giải thích được vì sao đáng để bỏ ra thêm 6,8 điểm chỉ số và 1,00 USD/5,00 USD mỗi triệu token mà vẫn ở lại với checkpoint cũ hơn.

GPT-6.1 Sol ra mắt vào ngày 29 tháng 9 với cùng mức giá $2.00 / $10.00 như GPT-6 Sol, đạt 51,8 điểm trên chỉ số so với 47,6 của Sol, cùng mức $0.10 cho đầu vào đã lưu trong bộ nhớ đệm, giúp giảm một nửa chi phí đọc từ bộ nhớ đệm. Đây là cùng một mức giá nhưng với điểm số tốt hơn và hiệu quả bộ nhớ đệm tốt hơn. Lập luận duy nhất dành riêng cho GPT-6 Sol cũng chính là lập luận áp dụng cho Opus 5: một bộ kiểm thử hồi quy đã được lấy đường cơ sở dựa trên nó, nơi mà việc thay đổi mô hình sẽ vô hiệu hóa những so sánh mà bạn đã tin tưởng.

Có một lý do thứ hai, âm thầm hơn khiến một nhóm vẫn ở lại với cặp cũ hơn, và đó không phải là chuyện benchmark. Cả hai đều là những checkpoint có lịch sử production dài nhất phía sau. Opus 5 đã có thể được gọi từ ngày 24 tháng 7 và GPT-6 Sol từ ngày 22 tháng 9, và các đo lường của đơn vị đánh giá độc lập trên cả hai đã diễn ra đủ lâu để cho thấy một xu hướng thay vì một kết quả đọc đơn lẻ. Lưu lượng bảy ngày gần nhất của Sol trên dữ liệu định tuyến của chính chúng tôi đạt khoảng 2,1 triệu token; của Opus 5 đạt khoảng 23,0 triệu. Đó là một cửa sổ trượt, không phải tổng cộng cả vòng đời, và chúng thay đổi giữa các lần đọc — nhưng chúng là lời nhắc rằng Opus 5 vẫn đang làm công việc thực sự trong production ngay cả sau khi bản thay thế của nó đã được phát hành.

Hình thái độ trễ và chi phí, đó chính là nơi Sol chứng tỏ giá trị của mình

• Thời gian trung vị đến token đầu tiên — GPT-6 Sol 6.785 ms so với Claude Opus 5 4.652 ms
• Tốc độ đầu ra trung vị — GPT-6 Sol 179,6 token/s so với Claude Opus 5 82,2 token/s
• Lưu lượng bảy ngày quan sát từ phía chúng tôi — GPT-6 Sol ~2,1M token, Claude Opus 5 ~23,0M token

Sol trả lời token đầu tiên sau khoảng 2,1 giây nhưng sau đó truyền phát với tốc độ gấp hơn hai lần Opus 5. Trong một lượt tạo dài — kiểu chạy mà đầu ra là hàng nghìn token thay vì hàng chục — con số thứ hai chiếm ưu thế, và một mô hình rẻ hoàn thành sớm hơn thì đáng giá hơn mức mà bảng giá của nó gợi ý. Trong một lệnh gọi ngắn, nhạy cảm với độ trễ, chỉ số token đầu tiên là cái mà người dùng cảm nhận được.

Cả hai đều là các số đo phục vụ từ hệ thống định tuyến của chính chúng tôi, được lấy trong cửa sổ bảy ngày cuốn chiếu, và chúng thay đổi giữa các lần đọc. Chúng hữu ích để so sánh hình dạng của hai mô hình chứ không phải để trích dẫn như một kỳ vọng cấp độ dịch vụ.

A generated two-column comparison scoreboard titled "GPT-6 Sol vs Claude Opus 5 — the scoreboard". The left column, GPT-6 Sol, reads Input $2.00, Output $10.00, AA Intelligence 47.6, AA Coding 60.0, Long-context recall 83.7, Output speed 180 tok/s. The right column, Claude Opus 5, reads Input $5.00, Output $25.00, AA Intelligence 50.8, AA Coding 78.0, Long-context recall 79.3, Output speed 82 tok/s. A footer line reads "Index figures per Artificial Analysis; serving figures are a rolling seven-day window from OrcaRouter." The OrcaRouter logo is composited in the bottom-right corner.

Chạy cặp đôi trong khi việc di trú chưa được quyết định

Lý do khiến việc so sánh này đáng để trả lời là cả hai phương án thay thế đều không phải là quyết định thay thế trực tiếp. Nếu các đánh giá của bạn được xây dựng dựa trên Claude Opus 5, thì việc chuyển sang Opus 5.5 là một lần thiết lập lại baseline, không phải một bản nâng cấp; điều tương tự cũng đúng với GPT-6 Sol so với GPT-6.1 Sol. Việc hữu ích cần làm trong khoảng thời gian đó là chạy cả hai thế hệ song song trên lưu lượng của chính bạn thay vì chọn dựa trên bảng xếp hạng của người khác.

Cả bốn mô hình đều nằm trong cùng một danh mục trên OrcaRouter — Claude Opus 5, Claude Opus 5.5, GPT-6 Sol và GPT-6.1 Sol, được gọi qua một API duy nhất đứng trước hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên qua ở mức 0% markup, nên khi nhà cung cấp cắt giá thì mức giá mới có hiệu lực ngay trong ngày tại đây chứ không phải đợi đến kỳ đối chiếu tiếp theo của bạn — điều này biến việc so sánh thành một câu hỏi về định tuyến chứ không phải về mua sắm. DSL định tuyến cho phép bạn chia tách theo kích thước yêu cầu hoặc theo tỷ lệ: gửi một phần lưu lượng production sang checkpoint mới hơn, so sánh nó với baseline trên chính các đánh giá của bạn, mở rộng phần đó khi các con số vẫn giữ vững, và giữ mô hình cũ hơn làm phương án dự phòng cho đến khi chúng đạt được điều đó. Chuyển đổi dự phòng tự động giữa các nhà cung cấp xử lý trường hợp một tuyến bị suy giảm giữa chừng trong quá trình di chuyển, đây chính là kiểu lỗi khiến người ta bỏ dở cuộc di chuyển nửa chừng.

Screenshot of the OrcaRouter model page for anthropic/claude-opus-5, showing the Anthropic vendor label, a 2026-07-24 catalogue release date, a 1M-token context window, a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $5.00 per million input, $25.00 per million output, a 4.65 s median time to first token, a 10.00 s p95, and 23.0M tokens routed in seven days.Screenshot of the OrcaRouter model page for openai/gpt-6-sol, showing the OpenAI vendor label, a 2026-09-22 catalogue release date, a 1,050,000-token context window (shown as 1.05M-token context in the model blurb), a 128K maximum output, text, image and file input with Vision, Tools, JSON and Reasoning badges, and a rate strip reading $2.00 per million input, $10.00 per million output, a 6.79 s median time to first token, a 10.00 s p95, and 2.1M tokens routed in seven days.

Ai nên chọn cái nào, khi cả hai đều đã bị thay thế?

Nếu bạn đang bắt đầu một điều gì đó mới: không chọn cái nào cả. Claude Opus 5.5 rẻ hơn Claude Opus 5 và đạt điểm cao hơn 6.8 điểm, còn GPT-6.1 Sol có cùng giá với GPT-6 Sol nhưng chỉ số tốt hơn và giá đọc từ bộ nhớ đệm giảm một nửa. Lý do duy nhất để bắt đầu với cặp cũ hơn là phụ thuộc cứng vào một checkpoint mà bạn không thể thay đổi.

Nếu bạn đang chạy một trong số chúng: quyết định nằm ở bộ kiểm thử hồi quy của bạn, không phải ở các bảng xếp hạng. Claude Opus 5 vẫn là mô hình lập trình và agentic mạnh hơn trong hai mô hình, với khoảng cách lớn, nên một pipeline lập trình ổn định trên nó nên so sánh với Opus 5.5 thay vì chuyển ngang sang phân khúc GPT-6. Một pipeline khối lượng lớn, nhạy cảm về chi phí trên GPT-6 Sol có bản nâng cấp dễ dàng hơn — cùng mức giá, điểm số tốt hơn, bộ nhớ đệm tốt hơn — và lý do trung thực để trì hoãn chỉ là bạn vẫn chưa chạy lại các đánh giá của mình.

Và nếu câu trả lời bạn muốn chỉ đơn giản là trong hai cái thì cái nào thắng: Claude Opus 5 thắng, trên gần như mọi bảng đánh giá, với mức giá gấp 2,5 lần. Lập luận của GPT-6 Sol chưa bao giờ là nó tốt hơn. Mà là nó đủ rẻ để đáng với khoản chênh lệch — và lập luận đó giờ thuộc về GPT-6.1 Sol ở cùng mức giá với điểm số tốt hơn.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày