
GPT-6 Sol Pro so với Claude Opus 5: Nấc thang nỗ lực mà không ai đưa vào bảng
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
GPT-6 Sol Pro và Claude Opus 5 liên tục được đem so sánh với nhau, và gần như luôn ở sai cấu hình. Phép so sánh đang lan truyền là Claude Opus 5 ở mức nỗ lực suy luận cao nhất đối đầu với GPT-6 Sol Pro ở mức nỗ lực suy luận cao nhất, tạo ra khoảng cách ba điểm trên chỉ số trung lập và mức chênh lệch chi phí gấp năm lần. Hãy đặt cả hai mô hình về cấu hình mà chính nhà cung cấp của chúng phát hành làm mặc định — và nhớ rằng "Pro" trong cái tên đầu tiên là một cấu hình suy luận, không phải một mô hình riêng — thì khoảng cách ba điểm biến mất hoàn toàn. Thứ còn lại là chênh lệch chi phí, và đó là phần duy nhất của câu chuyện trụ được khi đối mặt với hóa đơn vận hành sản xuất thực tế.
Đây không phải là một mánh lới trình bày. Đó là hệ quả trực tiếp của hai thang đo nỗ lực không được hiệu chuẩn với nhau, được công bố bởi hai nhà cung cấp vốn lấy các mô hình cũ hơn của nhau làm chuẩn đối sánh.
Hai mô hình thực sự là gì, trước mọi so sánh
GPT-6 Sol là mô hình suy luận tầm trung của OpenAI, được cung cấp rộng rãi kể từ ngày 22 tháng 9 năm 2026, với mức giá 2,00 USD mỗi triệu token đầu vào và 10,00 USD mỗi triệu token đầu ra. Không có mã định danh mô hình gpt-6-sol-pro trong tài liệu dành cho nhà phát triển của OpenAI — trang đó chỉ liệt kê một mục Sol duy nhất, với cửa sổ ngữ cảnh 1.050.000 token, đầu vào tối đa 922.000 token, giới hạn đầu ra 128.000 token, thời điểm cắt kiến thức là ngày 20 tháng 4 năm 2026, và thang mức nỗ lực suy luận gồm none, low, medium, high, xhigh và max, trong đó medium là mặc định. "Pro" là một giá trị của chế độ suy luận, đúng kiểu bí danh mà thế hệ GPT-5.6 đã thiết lập và thế hệ này kế thừa. Có tồn tại một mục trong danh mục của bên thứ ba mang tên GPT-5.6 Sol Pro và hiện niêm yết mức 2,00 USD và 10,00 USD — đúng con số của GPT-6 Sol — đó là một lỗi đặt tên, không phải một sản phẩm.
Claude Opus 5 là một mô hình thực sự, được định giá riêng từ Anthropic, được cung cấp rộng rãi kể từ ngày 24 tháng 7 năm 2026 với mức giá 5,00 USD cho đầu vào và 25,00 USD cho đầu ra trên mỗi triệu token. Cửa sổ ngữ cảnh của nó là 1.000.000 token, giới hạn đầu ra đồng bộ là 128.000, và thang mức nỗ lực riêng của nó — output_config.effort — gồm low, medium, high, xhigh và max, với high là mặc định. Tính năng suy nghĩ có tính thích ứng và được bật theo mặc định, lần đầu tiên đối với dòng Opus.
Thêm một sự thật nữa định hình mọi nội dung bên dưới, và chưa có trang so sánh nào hiện có đề cập đến: bảng vòng đời của chính Anthropic liệt kê Claude Opus 5 là Đang hoạt động (cũ), kèm một biểu ngữ di chuyển trỏ đến Claude Opus 5.5, phiên bản đã đạt trạng thái sẵn có rộng rãi vào ngày 22 tháng 9 năm 2026 với mức giá 4,00 USD và 20,00 USD. Các biểu đồ ra mắt của OpenAI vẫn lấy Opus 5 làm chuẩn đối sánh, chứ không phải 5.5. Mô hình được đưa vào so sánh là Opus thuộc thế hệ trước.
Hai dòng giá, từng dòng một
Cả hai đều là danh sách nhà cung cấp — những con số do chính OpenAI và Anthropic công bố, được các nền tảng lưu trữ chúng truyền đi nguyên vẹn.
• Đầu vào — GPT-6 Sol $2.00 mỗi triệu token so với Claude Opus 5 $5.00 mỗi triệu token
• Đầu ra — GPT-6 Sol $10.00 mỗi triệu token so với Claude Opus 5 $25.00 mỗi triệu token
• Đọc cache — GPT-6 Sol $0.20 mỗi triệu token so với Claude Opus 5 $0.50 mỗi triệu token; cả hai đều ở mức cố định 10% giá đầu vào chưa cache
• Ghi bộ đệm — GPT-6 Sol $2.50 mỗi triệu token tại một TTL duy nhất so với Claude Opus 5 $6.25 tại TTL năm phút và $10.00 tại TTL một giờ; TTL dài hơn là một tùy chọn mà OpenAI không cung cấp, và đó là mức mà hầu hết các bảng so sánh vô tình trích dẫn, bởi vì nó là mức xuất hiện trên các thẻ danh mục được lưu trữ
• Xử lý ngữ cảnh dài — GPT-6 Sol định giá lại một yêu cầu vượt ngưỡng đầu vào của nó ở mức cao hơn cho toàn bộ yêu cầu; Claude Opus 5 hoàn toàn không áp dụng phụ phí ngữ cảnh dài, vì vậy một yêu cầu 900.000 token được tính cùng mức giá trên mỗi token như yêu cầu 9.000 token
• Theo lô — GPT-6 Sol có endpoint theo lô với mức chiết khấu tiêu chuẩn, trong khi Message Batches API của Claude Opus 5 được giảm 50% ở cả hai chiều, và mức chiết khấu theo lô của Anthropic cộng dồn với bộ nhớ đệm prompt
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Claude Opus 5 1.000.000 token
• Đầu ra tối đa — 128.000 token cho cả hai, với Claude Opus 5 nâng con số đó lên 300.000 trên Message Batches API theo header beta output-300k-2026-03-24
Ngăn xếp batch cộng bộ đệm là dòng ít được bàn đến nhất trong danh sách này, và cũng là dòng làm thay đổi nhiều phép tính nhất. Một mức chiết khấu batch 50% kết hợp với việc đọc từ bộ đệm ở mức bằng một phần mười giá đầu vào là một ưu đãi khác hẳn so với chỉ riêng chiết khấu batch 50%, và đối với các tác vụ tổng hợp dài — nơi giới hạn đầu ra batch 300.000 token của Anthropic cũng được áp dụng — nó thu hẹp một phần đáng kể khoảng cách trông như không thể vượt qua ở mức giá niêm yết.

Thang nỗ lực mới là phép so sánh thực sự.
Đây là con số đáng lẽ phải có trong mọi bài viết như thế này. Trên Artificial Analysis — nơi có bộ khung đánh giá trung lập duy nhất công bố đầy đủ thang mức nỗ lực cho cả hai mô hình — Claude Opus 5 đạt 51 điểm ở mức nỗ lực tối đa và tốn 5,86 đô-la cho mỗi tác vụ chỉ số. Ở thiết lập cao mặc định, nó đạt 48 điểm và tốn 3,61 đô-la. GPT-6 Sol đạt 48 điểm ở mức nỗ lực tối đa và tốn 1,06 đô-la — còn ở mức nỗ lực cao thì được 43 điểm với 0,37 đô-la.
Đọc hai dòng đó cùng nhau. Claude Opus 5 chạy ở thiết lập nỗ lực mà Anthropic phát hành làm mặc định đạt đúng cùng điểm chỉ số như GPT-6 Sol chạy hết công suất. Khoảng cách mà các bài đưa tin ra mắt báo cáo — ba điểm — chỉ tồn tại nếu bạn so sánh từng mô hình ở nấc cao nhất trong thang điều chỉnh của chính nó, và nấc cao nhất của thang không phải là nơi mô hình nào chạy theo mặc định. Lợi thế của Opus 5 ở mức nỗ lực tối đa là có thật và để đạt được nó tốn khoảng năm lần rưỡi chi phí cho mỗi tác vụ hoàn thành.
Có hai lưu ý về tính trung thực cần được gắn kèm với những con số đó, và cả hai đều vắng mặt trên những trang trích dẫn chúng.
• Phiên bản của chỉ số thay đổi. Điểm số của Opus 5 đã được công bố là 61, 63, 54 và 51 qua các lần sửa đổi kế tiếp của chỉ số Artificial Analysis kể từ tháng Bảy. Không có con số nào trong số đó là sai; mỗi con số đều sai nếu thiếu nhãn phiên bản của nó. Con số 51 ở trên là bảng điểm hiện tại, và nó không thể so sánh với con số 61 được trích dẫn từ một bài viết ngày ra mắt.
• Thang bậc nỗ lực không được hiệu chuẩn giữa các nhà cung cấp. Mức "high" trên một mô hình không tương đương với cùng một lượng suy nghĩ như mức "high" trên mô hình kia. Các điểm số khớp nhau ở những thiết lập danh nghĩa khác nhau là bằng chứng về chi phí, chứ không phải về sự tương đương năng lực.
Nơi hồ sơ độc lập mỏng hơn vẻ ngoài của nó
Claude Opus 5 đã có tám tuần được bên thứ ba đo lường và một bộ số liệu ra mắt do nhà cung cấp tự báo cáo, được ghi nhãn rõ ràng như vậy — Frontier-Bench v0.1 đạt 43,3%, ARC-AGI-3 đạt 30,2%, GDPval-AA v2 đạt 1.861 Elo. Mỗi một trong số đó đều được đo lường so với GPT-5.6 Sol hoặc Claude Fable 5, chứ không phải so với GPT-6 Sol. Không có kết quả nào từ cùng một harness ở bất cứ đâu đặt Opus 5 và GPT-6 Sol đối đầu trực tiếp trên các benchmark của chính Anthropic, và system card của Anthropic thừa nhận mô hình không có năng lực tổng thể cao hơn Claude Fable 5.
Hồ sơ độc lập cũng mang một lưu ý theo hướng ngược lại. Trong đánh giá AA-Omniscience của Artificial Analysis, tỷ lệ ảo giác của Opus 5 là 50%, tăng mười bốn điểm so với Opus 4.8 — nguyên nhân được ghi nhận là các lần từ chối giảm từ khoảng 23% xuống 7%, nên mô hình trả lời nhiều câu hỏi hơn và sai nhiều câu hơn. Vals AI riêng rẽ tiết lộ rằng Opus 5 và Fable 5 đã dùng Opus 4.8 làm phương án dự phòng khi từ chối trong các lần chạy Terminal-Bench; việc phân loại lại chín lượt đạt bị ảnh hưởng thành thất bại đưa Opus 5 từ 84,64% xuống 81,27%. Đây không phải là những phát hiện đủ để loại bỏ, nhưng một bài viết lập luận rằng Opus 5 là lựa chọn đáng tin cậy hơn cần gắn kèm chúng.

Thành tích độc lập của GPT-6 Sol, trong tuần này, chỉ rộng đúng một con số: điểm chỉ số ở trên, được đo ở mức nỗ lực tối đa, với mười tám tháng phát hành mô hình phía sau nó trong hoạt động kiểm thử bên thứ ba tích lũy. Sự bất đối xứng đó — tám tuần bị soi xét đối lại một ngày — chính là lý do trung thực để một người mua vẫn có thể trả mức phụ trội gấp năm lần, và đó là lý do tốt hơn cả tiêu đề ba điểm.
Nơi một lớp định tuyến thay đổi quyết định
Claude Opus 5 nằm trong danh mục củaOrcaRouter với mức giá 5,00 USD cho đầu vào, 25,00 USD cho đầu ra, 0,50 USD cho đọc cache và 10,00 USD cho ghi cache trên mỗi triệu token, cùng cửa sổ 1.000.000 token, giới hạn đầu ra 128.000 token và cả hai endpoint /v1/chat/completions lẫn /v1/messages — giá niêm yết của nhà cung cấp được chuyển nguyên sang với không cộng thêm phụ phí nào, nên khi Anthropic thay đổi giá thì bên chúng tôi cũng áp dụng ngay trong cùng ngày họ áp dụng. Con số ghi cache trên model card là mức TTL một giờ; bậc năm phút của Anthropic là 6,25 USD, và việc trích dẫn một con số mà không nói rõ là bậc nào chính là cách để hai con số trông như mâu thuẫn với nhau.
GPT-6 Sol không phải là một trong những tuyến của chúng tôi, vì vậy không có nội dung nào ở đây là tuyên bố về giá của nó thông qua chúng tôi.

Điều mà một endpoint duy nhất thực sự mang lại trong cuộc đối đầu này là khả năng nắm giữ cả hai câu trả lời cùng lúc. Lập luận ủng hộ Opus 5 và lập luận ủng hộ Sol đều phụ thuộc vào effort, và effort là một tham số theo từng yêu cầu, chứ không phải một hợp đồng. Một đội ngũ định tuyến cả hai mô hình phía sau một key duy nhất với chuyển đổi dự phòng tự động có thể gửi công việc cần mức trần effort tối đa của Opus 5 đến Opus 5 và tầng khối lượng lớn đến Sol ở mức effort trung bình, mà không cần tích hợp thứ hai hay bộ giới hạn tốc độ thứ hai. DSL định tuyến kết hợp quyết định đó vào chính lệnh gọi thay vì vào một dự án di trú — điều này đặc biệt quan trọng ở đây, bởi vì câu trả lời đúng cho cặp đôi này thay đổi theo từng yêu cầu, chứ không phải theo từng quý.
Quy tắc quyết định
• Công việc khối lượng lớn ở một chuẩn chất lượng đã biết — GPT-6 Sol ở mức nỗ lực trung bình hoặc cao. Bốn mươi điểm chỉ số với $0,25 mỗi tác vụ là mức rẻ nhất đáng tin trên bảng này, và nút chỉnh nỗ lực là một tham số đã được ghi rõ, không phải phỏng đoán.
• Công việc cần đến mức cao nhất của dải năng lực và có thể chi trả cho nó — Claude Opus 5 ở mức xhigh hoặc max. Cao hơn trần của Sol ba điểm chỉ số, với $4,88 đến $5,86 mỗi tác vụ, và là một trong hai mô hình duy nhất có giới hạn đầu ra theo lô 300.000 token.
• Các tác vụ batch trên tập dữ liệu lớn — Claude Opus 5, dựa trên lập luận về cấu trúc thay vì lập luận theo từng token. Không phụ phí ngữ cảnh dài, chiết khấu theo lô cộng dồn được với caching, và TTL cache một giờ cho các tiền tố tồn tại lâu hơn cửa sổ năm phút.
• Bất cứ việc gì mà một câu trả lời sai sẽ gây tốn kém — xét theo ghi nhận hiện tại thì không bên nào. Tỷ lệ ảo giác của Opus 5 đã tăng thêm mười bốn điểm tại bản phát hành này, còn ghi nhận từ bên thứ ba về Sol chỉ vỏn vẹn một con số.
• Nếu phép so sánh mà bạn được xem là "Opus 5 max so với Sol max" — hãy chạy lại ở mức nỗ lực mặc định trước khi bạn quyết định. Đó mới là nơi quyết định thực sự được đưa ra, và đó là cấu hình duy nhất mà phạm vi đánh giá hiện có chưa từng cho bạn thấy.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
