Thẻ hero có tiêu đề Claude Sonnet 5.5 vs GPT-6 Sol, phụ đề là hạng $2 giờ đã có hai mẫu flagship, với các pill ghi cùng mức giá: $2 / $10, Chỉ số 56 vs 47, và ngữ cảnh 1M vs 1.05M, cùng phần chân trang dẫn nguồn Artificial Analysis v4.3.2 và giá niêm yết của nhà cung cấp.
Guides & Insights

Claude Sonnet 5.5 vs GPT-6 Sol: Phân khúc 2 USD giờ đây đã có hai mẫu flagship

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Claude Sonnet 5.5 và GPT-6 Sol có cùng mức giá — 2 USD cho mỗi triệu token đầu vào, 10 USD cho mỗi triệu token đầu ra — và chúng ra mắt cách nhau sáu ngày vào cuối tháng 9 năm 2026. Sự trùng hợp đó không phải là điểm thú vị. Điểm thú vị là khi Artificial Analysis đo cả hai trên Intelligence Index v4.3.2 của mình, mô hình tầm trung của Anthropic lại vượt lên trên mô hình mà OpenAI vẫn bán như sản phẩm chủ lực của họ: 56 cho Claude Sonnet 5.5 so với 47 cho GPT-6 Sol. Ở cùng bản sửa đổi đó, Claude Sonnet 5 — mô hình mà Sonnet 5.5 thay thế — ở mức 38.

Vậy đây không còn là so sánh giữa một phân khúc rẻ với một phân khúc đắt. Đây là so sánh giữa hai mô hình ở cùng mức giá, đến từ hai phòng thí nghiệm, với khoảng cách 18 điểm giữa mô hình Anthro​pic và chính phiên bản tiền nhiệm của nó, cùng khoảng cách chín điểm nghiêng về Anthro​pic so với bản phát hành cao cấp nhất của Open​AI. Tất cả những gì dưới đây là một nỗ lực nhằm xác định khoảng cách nào trong số đó vẫn đứng vững khi tiếp xúc với một khối lượng công việc thực tế, và khoảng cách nào chỉ là sản phẩm phụ của benchmark.

Mỗi mô hình thực sự là gì

Claude Sonnet 5.5 là mô hình thứ hai trong thế hệ 5.5 của Anthropic, ra mắt ngày 28 tháng 9 năm 2026, năm ngày sau khi Claude Opus 5.5 ra mắt với lời hứa về nó. Mô hình mang id claude-sonnet-5-5 trên khắp Claude API, Amazon Bedrock, Google Cloud và Microsoft Foundry, giữ nguyên cửa sổ ngữ cảnh 1M token và giới hạn đầu ra 128K của phân hạng này, đồng thời giữ nguyên mức giá của Claude Sonnet 5: 2 USD đầu vào, 10 USD đầu ra, 0,20 USD mỗi triệu token cho đọc bộ nhớ đệm, 2,50 USD cho ghi bộ nhớ đệm năm phút. Mô hình có sẵn với chính sách không lưu trữ dữ liệu ngay từ ngày đầu tiên, và cam kết ngừng hỗ trợ của Anthropic kéo dài đến ngày 28 tháng 9 năm 2027.

Two-column scoreboard for Claude Sonnet 5.5 and GPT-6 Sol across six rows. Left column Claude Sonnet 5.5: input $2.00 per million, output $10.00 per million, 1M-token context, AA Intelligence Index 56, cost per Index task $7.60, released September 28 2026. Right column GPT-6 Sol: input $2.00 per million, output $10.00 per million up to 272K then $4 / $15, 1,050,000-token context, AA Intelligence Index 47, cost per task not published, released September 22 2026. A footer line reads Index and cost per task per Artificial Analysis v4.3.2; prices per the vendors.

GPT-6 Sol là phiên bản kế nhiệm của mô hình được gọi một cách gây nhầm lẫn là GPT-5.6 Sol — mô hình mà OrcaRouter vẫn liệt kê là có thể truy cập với giá 4 USD đầu vào và 20 USD đầu ra, và mà Artificial Analysis từ đó đã đánh dấu là ngừng hỗ trợ kèm một chỉ dẫn đến GPT-6 Sol. Mô hình mới ra mắt vào ngày 22 tháng 9 năm 2026 với mức 2 USD / 10 USD, cửa sổ ngữ cảnh 1.050.000 token, giới hạn đầu ra 128K và mức giá theo bậc: mức niêm yết 2 USD / 10 USD áp dụng cho tới 272.000 token đầu vào, còn mọi thứ vượt trên mức đó được tính ở 4 USD / 15 USD.

Chi tiết cuối cùng đó là điểm đầu tiên mà cách diễn đạt “định giá giống hệt nhau” bị phá vỡ.

Giá ngang nhau chỉ đúng với các prompt ngắn.

Cả hai bảng giá đều báo $2 và $10, và gần như mọi so sánh trong ngày ra mắt đều dừng lại ở đó. Hãy đặt hai bảng cạnh nhau dựa trên các điều khoản quyết định hóa đơn:

• Mức giá niêm yết — Claude Sonnet 5.5 $2 / $10 so với GPT-6 Sol $2 / $10

• Mức phí ngữ cảnh dài — Sonnet 5.5 tính phí toàn bộ cửa sổ 1M theo mức tiêu chuẩn; GPT-6 Sol tăng gấp đôi lên $4 / $15 khi vượt 272.000 token đầu vào

• Cửa sổ ngữ cảnh — 1.000.000 token so với 1.050.000 token

• Tối đa — 128K token trên API đồng bộ đối với cả hai; Sonnet 5.5 đạt tới 300K trên API Message Batches phía sau output-300k-2026-03-24cờ

• Chiết khấu theo lô — giảm 50% cho đầu vào và đầu ra đối với Sonnet 5.5; hãy kiểm tra các điều khoản hiện hành của OpenAI dành cho Sol thay vì giả định là tương đương

• Đọc cache — 0,20 đô la mỗi triệu trên cả hai

Một đợt quét kho mã 800.000 token tốn gấp đôi chi phí trên mỗi token khi chạy trên GPT-6 Sol so với Claude Sonnet 5.5, và đó chính xác là khối lượng công việc mà cả hai mô hình đều được quảng cáo là để phục vụ. Nếu prompt của bạn ngắn, bảng giá thực sự ngang nhau và giá cả không nên quyết định bất cứ điều gì. Nếu chúng dài, thì giá đã quyết định rồi.

Bảng điểm của chính Anthropic, hãy đọc kỹ

Anthropic đã công bố một so sánh bốn cột với Claude Sonnet 5, Claude Opus 5.5 và GPT-6 Sol. Các số liệu do nhà cung cấp báo cáo, mà chưa bên thứ ba nào tái lập được:

Artificial Analysis model page for Claude Sonnet 5.5 (Adaptive Reasoning, Max Effort, Default Fallback), released September 2026, showing an Intelligence Index of 56, a price of $2.00 per million input tokens and $10.00 per million output tokens, a cost of $7.60 per Intelligence Index task, a verbosity of 410M output tokens against a median of 88M, and a 1M-token context window.

• Terminal-Bench 4.0 — Sonnet 5.5 70,6% so với Sonnet 5 10,3%

• FrontierCode 1.1, Main — Sonnet 5.5 46.2% ở mức nỗ lực tối đa, Sonnet 5 42.4%, Opus 5.5 54.4%, GPT-6 Sol 49.3%

• CursorBench 4.0 — Sonnet 5.5 55,5% so với Sonnet 5 34,1% so với Opus 5.5 57,8%

• GDPval-AA v2.1 — Sonnet 5.5 1844 so với Sonnet 5 1449 so với Opus 5.5 1846 so với GPT-6 Sol 1487

• AA-Briefcase v1.1 — Sonnet 5.5 1811 so với Sonnet 5 1359 so với Opus 5.5 1822 so với GPT-6 Sol 1483

• Humanity's Last Exam, với công cụ — Sonnet 5.5 64,5% so với Sonnet 5 54,9% so với Opus 5.5 67,7%

• OSWorld 2.1, một phần — Sonnet 5.5 80,1% so với Sonnet 5 57,0% so với Opus 5.5 81,8%

• Chartography, không dùng công cụ — Sonnet 5.5 61,6% so với Sonnet 5 15,6% so với Opus 5.5 64,4% so với GPT-6 Sol 53,6%

Hai trong số những hàng đó mang chú thích, và cả hai đều quan trọng. Các số liệu GDPval-AA, AA-Briefcase và Chartography của GPT-6 Sol được Anthropic đánh dấu là được đo sau khi phía OpenAI sửa lỗi hiểu hình ảnh, còn con số FrontierCode của Sonnet 5.5 là kết quả ở mức Max-effort, mà Anthropic ghi chú rằng thấp hơn kết quả Xhigh của chính nó trong cùng bài đánh giá. Một nhà cung cấp tự so sánh mình với đối thủ trên một benchmark do chính mình vận hành, với những chú thích bổ sung điều kiện cho cả hai phía, thì không phải là bằng chứng trung lập. Đó là bằng chứng tốt nhất hiện có trong ngày ra mắt, và nó không đồng nghĩa với đo lường.

Những con số độc lập nói lên điều gì, và không nói lên điều gì

Artificial Analysis đã công bố lần chạy độc lập đầu tiên: Index 56 trên v4.3.2, chi phí 7,60 USD cho mỗi tác vụ Index, và chỉ số độ dài dòng là 410M token đầu ra so với trung vị 88M. Con số độ dài dòng đó xứng đáng được chú ý nhiều hơn mức hiện tại. Nó có nghĩa là mô hình có xu hướng tiêu tốn rất nhiều token trên đường đi đến câu trả lời, và đó là cơ chế đằng sau một tuyên bố hiệu quả duy nhất không đến từ bảng của chính Anthropic.

Anthropic nói Claude Sonnet 5.5 tạo đầu ra nhanh hơn 30% so với Claude Sonnet 5 và tốn "ít hơn tới 30% cho mỗi tác vụ" ở cùng mức giá trên mỗi token. Hai tuyên bố đó cùng nhau mô tả một mô hình làm cùng một công việc với ít token hơn, chứ không phải một bảng giá rẻ hơn. Liệu điều đó có đúng hay không chính là điều mà một phép đo độ rườm rà 410M token nhắm tới, và một lần chạy độc lập thì không đủ để phân xử — nhưng đủ để nói rằng câu quảng cáo và số token đo được đang chỉ về hai hướng ngược nhau, và con số đo được mới là con số xuất hiện trên hóa đơn.

Cũng cần lưu ý những gì bảng chỉ số độc lập vẫn chưa có. Chưa có bản tái lập OSWorld, Terminal-Bench hay CursorBench nào được công bố từ bất kỳ ai ngoài Anthropic. Và con số 56 là một chỉ số tổng hợp: nó không cho biết bài đánh giá nào trong số mười bài đánh giá bên trong đã tạo nên khoảng cách so với 47 của Sol. Một mức dẫn trước chín điểm trên chỉ số tổng hợp có thể che giấu mức thua kém mười lăm điểm ở đúng bài đánh giá mà workload của bạn phụ thuộc vào.

Nơi chúng khác biệt theo những cách mà một bảng giá không thể thể hiện được.

Giá cả và điểm chỉ số là hai trục dễ. Những yếu tố quyết định việc chuyển đổi lại nằm ở khía cạnh hành vi, và ở đây hai mô hình không hề gần nhau.

OrcaRouter model page for openai/gpt-5.6-sol, attributed to OpenAI and dated 2026-07-09, showing a 1M-token context window, 128K maximum output, text, image and file input, an input price of $4.00 and output price of $20.00 per million tokens, a p50 time to first token of 10.00 seconds, and OpenAI-compatible base URL https://api.orcarouter.ai/v1

Claude Sonnet 5.5 bật tư duy thích ứng theo mặc định với high là mức nỗ lực mặc định, và nó loại bỏ ba thứ mà thế hệ trước cho phép: gửi thinking: {"type": "disabled"} giờ trả về lỗi 400 và phải được thay bằng between_tools; việc ép buộc sử dụng công cụ — tool_choice được đặt thành "any" hoặc một công cụ có tên — sẽ trả về lỗi 400 ngay lập tức; và công cụ sử dụng máy tính computer_20251124 cũ hơn bị từ chối trên Claude API và Google Cloud để thay bằng một bộ công cụ. Các khối tư duy giờ cũng được gắn với mô hình đã tạo ra chúng, nên một cuộc hội thoại có thể chuyển từ Claude Sonnet 5 sang Claude Sonnet 5.5 và giữ nguyên khả năng suy luận của nó, nhưng không thể chuyển ngược trở lại cùng với nó.

Nếu vòng lặp tác nhân của bạn đặt tool_choice: "any" để buộc một lệnh gọi hợp lệ theo schema, Claude Sonnet 5.5 sẽ từ chối yêu cầu cho đến khi bạn chuyển sang auto với strict tool use hoặc structured outputs. Đó là một tác vụ chuyển đổi thực sự, và đó là kiểu việc biến một thay đổi ID mô hình chỉ một dòng thành cả một buổi chiều.

Chi phí chuyển đổi sang GPT-6 Sol khác về bản chất, bởi vì mô hình mà nó thay thế vẫn còn trong danh mục và vẫn đang được gọi đến. GPT-5.6 Sol không bị rút khỏi; nó bị đánh dấu ngừng hỗ trợ tại Artificial Analysis, có giá gấp đôi mô hình mới và vẫn đang nhận lưu lượng truy cập. Các phép đo của chính OrcaRouter cho thấy nó xử lý khoảng 95 triệu token mỗi tuần, một chỉ báo hợp lý cho việc còn bao nhiêu tích hợp chưa di trú. Chuyển sang GPT-6 Sol là một quyết định về giá mà bạn có thể đưa ra sau; bạn không cần phải làm điều đó ngay bây giờ.

Đang chạy so sánh trên một khóa

Vấn đề thực tế khi so sánh hai nhà cung cấp là thường bạn phải tốn hai tài khoản, hai đường SDK và hai bộ giới hạn tốc độ trước khi biết được điều gì. OrcaRouter ra đời để thu gọn điều đó: một endpoint tương thích OpenAI, hơn 200 mô hình, giá niêm yết của nhà cung cấp được chuyển nguyên, không cộng thêm phụ phí, và tự động chuyển đổi dự phòng giữa các nhà cung cấp.

Cả hai mô hình đáng quan tâm ở đây đều có thể định tuyến trên đó ngay hôm nay. GPT-6 Sol có trong danh mục với mức giá $2 / $10 và vẫn giữ nguyên hạng long-context, còn Claude Sonnet 5 — mô hình mà phần lớn lưu lượng API Claude vẫn đang chạy, với tốc độ đo được 150 token đầu ra mỗi giây và thời gian p50 cho token đầu tiên vào khoảng năm giây — đã có mặt trên nền tảng từ ngày 30 tháng 6 với mức giá $2 / $10 của chính Anthropic.

Bản thân Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng ta. Dù điều đó là đúng, con đường trung thực để có được nó là API riêng của nhà cung cấp và ba đám mây mà Anthropic liệt kê, và cách trung thực để đánh giá nó là hướng nó vào một phần lưu lượng mà bạn có thể chấp nhận mất. Đó chính là mục đích của lớp định tuyến: tăng dần một tỷ lệ phần trăm, theo dõi tỷ lệ lỗi, và giữ mô hình trước đó làm phương án dự phòng thay vì làm kế hoạch khôi phục.

Cái nào sẽ được đưa vào production?

Chọn theo hình dạng của khối lượng công việc thay vì theo điểm tổng hợp.

Claude Sonnet 5.5 là lựa chọn mua tốt hơn cho công việc ngữ cảnh dài, cho bất cứ thứ gì đã được viết dựa trên bề mặt tool-use và computer-use của Anthropic, và cho các nhóm mà prompt thường xuyên vượt qua một phần tư triệu token — cửa sổ giá cố định đáng giá hơn ở đó so với bất kỳ mức chênh lệch chỉ số nào. Hãy chấp nhận rằng việc di chuyển có kèm một danh sách kiểm tra: buộc sử dụng công cụ, nút bật/tắt thinking, các cặp công cụ cố vấn, và một thay đổi công cụ computer-use.

GPT-6 Sol là lựa chọn đảm bảo tính liên tục an toàn hơn cho một ngăn xếp mang hình dạng OpenAI, và cũng là lựa chọn rẻ hơn nếu prompt của bạn ngắn và các tích hợp của bạn đã được xây dựng sẵn. Lợi thế của nó không nằm ở năng lực — trên chỉ số tổng hợp thì nó xếp sau — mà ở chỗ phiên bản tiền nhiệm của nó vẫn đang hoạt động và việc di chuyển không có hạn chót.

Dựa trên những con số hiện có ở thời điểm này, Claude Sonnet 5.5 thắng trong màn đối đầu trực tiếp trên chỉ số độc lập và về khía cạnh kinh tế của ngữ cảnh dài, đồng thời không thua ở bất cứ điểm nào mà bất kỳ phép đo đã công bố nào hiện vẫn có thể phát hiện được, ngoài độ tin cậy trong bảng của chính nhà cung cấp. Đó là một tuyên bố hẹp hơn so với những gì tài liệu ra mắt đưa ra, và đó là tuyên bố đáng để hành động theo.

Điều có thể thay đổi câu trả lời là một lần chạy độc lập thứ hai trên các đánh giá tác tử, cùng một con số tokens cho mỗi tác vụ được công bố cho cả hai mô hình trên cùng những tác vụ đó. Cho đến khi cả hai điều đó tồn tại, chỉ số tổng hợp là mức dẫn trước chín điểm cho mô hình rẻ hơn khi vận hành, và mức dẫn trước tổng hợp chín điểm không giống với mức dẫn trước chín điểm trên khối lượng công việc của bạn.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày