
Claude Sonnet 5.5 so với Grok 4.6: Bảng giá nói một đằng, hóa đơn token lại nói một nẻo
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 984 tok/s
- openaiMỚIOpenAI: GPT-6 Luna2026-09-2237Trí tuệ
- openaiMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- anthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- grokMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token · 195 tok/s
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1327 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- tencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 109 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 221 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
Phép tính trên tiêu đề có vẻ đã ngã ngũ trước khi bài viết bắt đầu. Grok 4.6 có giá 2 USD cho mỗi triệu token đầu vào và 6 USD cho mỗi triệu token đầu ra; Claude Sonnet 5.5 có giá 2 USD và 10 USD. Mô hình của SpaceXAI rẻ hơn 40% ở đầu ra, ngang bằng ở đầu vào, và đã được phát hành rộng rãi kể từ ngày 12 tháng 8 năm 2026 — đủ lâu để những điểm kỳ quặc của nó được ghi chép lại thay vì chỉ là tin đồn. Mô hình của Anthropic ra mắt vào ngày 28 tháng 9 năm 2026, một ngày trước khi bài này được viết, và là thứ mới nhất trong phân khúc này với cách biệt lớn.
Sau đó bạn đi đến các số liệu hiệu quả độc lập và thứ tự đảo ngược. Artificial Analysis đo lường các mô hình thuộc lớp GPT và Claude trên cơ sở chi phí cho mỗi tác vụ song song với Chỉ số Thông minh của mình, và ở bản sửa đổi v4.3.2, hai mô hình ở đây là $1.86 cho mỗi tác vụ chỉ số đối với Grok 4.6 và $7.60 đối với Claude Sonnet 5.5. Mô hình có bảng giá rẻ hơn lại là mô hình đắt đỏ hơn để vận hành, gấp bốn lần. Việc tìm ra lý do tại sao, và khi nào sự đảo ngược đó đúng và không đúng, chính là toàn bộ phép so sánh.
Hai mẫu, hai vị trí trong dòng sản phẩm của riêng chúng
Grok 4.6 là mẫu flagship hiện tại của dòng Grok — tài liệu dành cho nhà phát triển của chính SpaceXAI liệt kê nó là mới nhất, và nó kế nhiệm Grok 4.5 với cùng cửa sổ ngữ cảnh 500.000 token, cùng bề mặt đầu vào văn bản, hình ảnh và tệp, và cùng mức giá cơ bản. Nó hỗ trợ mức độ suy luận có thể cấu hình, gọi công cụ gốc, đầu ra có cấu trúc và toàn bộ bề mặt lấy mẫu, và với tư cách là mô hình OpenAI Responses hạng nhất, nó tích hợp thẳng vào các framework tác nhân hiện có mà không cần lớp dịch. Artificial Analysis xếp nó ở Chỉ số Thông minh 44, đứng thứ 31 trong số 216 mô hình mà tổ chức này đo lường, với chỉ số GPQA Diamond là 94,9%.

Claude Sonnet 5.5 là mục thứ hai trong thế hệ 5.5 của Anthropic và là mô hình mà công ty định vị là sự kết hợp tốt nhất giữa tốc độ và trí tuệ trong dòng sản phẩm của mình. Nó được phát hành dưới dạng claude-sonnet-5-5/ trên Claude API và ba nền tảng đám mây lớn, mang cửa sổ ngữ cảnh 1M token với giới hạn đầu ra đồng bộ 128K, giữ nguyên mức giá $2 / $10 của Claude Sonnet 5 cho đầu vào, đầu ra và bộ nhớ đệm, và khả dụng với chính sách không lưu giữ dữ liệu. Trên cùng bản sửa đổi chỉ số, nó đạt 56 điểm và xếp thứ ba trong số 216.
Vậy nên hai mô hình này thực ra không cùng một thị trường. Một bên là mô hình tiên phong 500.000 token đã được bán ra suốt bảy tuần với mức giá tiết kiệm. Bên còn lại là một hạng đa dụng 1 triệu token, có chi phí mỗi token không cao hơn so với phiên bản tiền nhiệm và đạt điểm cao hơn mười hai điểm trên chỉ số tổng hợp. Dù sao thì việc so sánh vẫn đáng để thực hiện, bởi cả hai đều là những mô hình có giá đầu vào 2 đô la và đó chính là nơi các quyết định thu mua thực sự bắt đầu.
Khoảng cách gấp bốn lần mà không ai đưa lên slide
Bảng giá định giá theo token. Hóa đơn được tính theo tác vụ, và số token mà một mô hình tiêu tốn để đi đến câu trả lời là một lựa chọn thiết kế chứ không phải một hằng số. Đó là chỗ hai điều này tách khỏi nhau, và những con số đo được thì thật rõ rệt:
• Giá đầu ra — Claude Sonnet 5.5 10 $ mỗi triệu so với Grok 4.6 6 $ mỗi triệu
• Chi phí cho mỗi tác vụ Chỉ số Trí tuệ — Claude Sonnet 5.5 $7,60 so với Grok 4.6 $1,86
• Mức độ dài dòng trên Chỉ số — Claude Sonnet 5.5 410M token đầu ra so với Grok 4.6 94M
• Chỉ số Trí tuệ — Claude Sonnet 5.5 56 so với Grok 4.6 44, cả hai trên v4.3.2
• Tốc độ đầu ra — Grok 4.6 đo được 67,7 token mỗi giây so với mức trung vị 82,7; Anthropic báo cáo Claude Sonnet 5.5 tạo đầu ra nhanh hơn 30%+ so với Claude Sonnet 5, mà Artificial Analysis đo được 78,7 token mỗi giây
Lập luận về tính dài dòng chính là cơ chế. Một mô hình phát ra lượng token gấp bốn lần không cần tốc độ đầu ra cao hơn 67% để tốn gấp bốn lần chi phí cho mỗi tác vụ — nhưng điều đó cũng góp phần, và ở đây cả hai hiệu ứng đều chỉ về cùng một hướng. Cách diễn đạt của chính Anthropic ủng hộ cách lý giải này chứ không hề mâu thuẫn với nó: tài liệu ra mắt khẳng định Claude Sonnet 5.5 "tốn ít hơn tới 30% cho mỗi tác vụ" so với Claude Sonnet 5 ở mức giá trên mỗi token như nhau, đây là một khẳng định về số lượng token, không phải về tốc độ. So với một đường cơ sở bên ngoài tiết kiệm hơn hẳn, chính đặc tính đó lại trở thành rủi ro chi phí lớn nhất của mô hình.
Không điều nào trong số này làm khoảng cách chỉ số biến mất. Mười hai điểm trên chỉ số tổng hợp là một khác biệt năng lực thực sự, và một tác vụ rẻ hơn nhưng thất bại thì không hề rẻ hơn. Điều đó có nghĩa câu hỏi trung thực không phải là "tỷ lệ nào thấp hơn" mà là "tác vụ khó hơn tốn bao nhiêu token", và con số đó chỉ tồn tại khi bạn chạy khối lượng công việc của chính mình.

Bối cảnh, nỗ lực và hình thái của sự tích hợp
Sự khác biệt thứ hai là mục, nó quyết định nên áp dụng cái nào trong hai cái mà không cần viết lại bất cứ thứ gì.

Claude Sonnet 5.5 thay đổi sáu hành vi so với Claude Sonnet 5, trong đó năm hành vi gây phá vỡ tương thích. Việc gửi thinking: {"type": "disabled"}/ giờ trả về lỗi 400 và phải được thay bằng between_tools/. Việc buộc sử dụng công cụ — tool_choice/ với giá trị "any"/ hoặc một công cụ được đặt tên — bị từ chối thẳng, nên một vòng lặp buộc phải thực hiện một lệnh gọi hợp lệ theo schema phải chuyển sang auto/ với strict tool use hoặc structured outputs. Loại cũ hơn computer_20251124/ công cụ sử dụng máy tính bị từ chối trên Claude API và Google Cloud. Các khối suy nghĩ giờ đây bị ràng buộc với mô hình và tài khoản đã tạo ra chúng, nên một cuộc hội thoại có thể mang lý luận của nó tiến tiếp từ Claude Sonnet 5 nhưng không thể chuyển ngang sang một họ mô hình khác. Và công cụ cố vấn không còn chấp nhận Claude Opus 4.8, Claude Opus 4.7 hay Claude Sonnet 5 làm cố vấn phía sau một bộ thực thi Sonnet 5.5.
Grok 4.6 không yêu cầu bất kỳ điều nào trong số đó. Đây là một mô hình theo định dạng OpenAI với bề mặt lấy mẫu còn nguyên vẹn, và việc chuyển từ Grok 4.5 chỉ là thay đổi chuỗi mô hình. Tuy nhiên, cấu trúc chi phí của riêng nó có một điểm đáng lưu ý, và nó là hình ảnh phản chiếu của Anthropic: mức giá $2 / $6 áp dụng cho tối đa 200.000 token đầu vào, và mọi thứ vượt quá mức đó bị tính phí ở mức $4 / $12. Claude Sonnet 5.5 tính phí theo mức tiêu chuẩn trên toàn bộ cửa sổ 1M.
Đặt hai cấu trúc cạnh nhau thì lựa chọn không còn là về việc nhà cung cấp nào rẻ hơn nữa:
• Lời nhắc ngắn gọn, đầu ra dày đặc — thói quen dùng token tiết kiệm hơn và tốc độ đầu ra thấp hơn của Grok 4.6 giành chiến thắng dứt khoát
• Đầu vào rất dài — mức giá cố định 1M của Claude Sonnet 5.5 bắt đầu vượt trội so với bậc tăng gấp đôi từ khá lâu trước khi chạm giới hạn ngữ cảnh
• Đầu ra đơn lẻ lớn — giới hạn 128K của Sonnet 5.5 ngang bằng với Grok 4.6, và nó đạt 300K trên Message Batches API phía sau output-300k-2026-03-24/ header
• Code hiện có theo dạng OpenAI — Grok 4.6 không cần thay đổi; Sonnet 5.5 cần phần xử lý tool-use và thinking ở trên
Đưa cả hai vào cùng một chứng chỉ
Giữ một so sánh hai nhà cung cấp trong đầu thì dễ. Chạy nó mới là nơi chi phí ẩn nấp: hai tài khoản, hai bộ giới hạn, hai giao diện thanh toán, và một số lượng token phải được đo hai lần trước khi nó có ý nghĩa gì.
OrcaRouter gộp tất cả lại thành một endpoint tương thích với OpenAI duy nhất, bao trùm hơn 200 mô hình, với giá niêm yết của nhà cung cấp được chuyển nguyên vẹn và không cộng thêm phụ phí, nhờ đó mọi thay đổi biểu giá từ phía Grok hay Claude đều được cập nhật ngay trong cùng ngày thay vì phải chờ đến kỳ gia hạn hợp đồng tiếp theo.Toàn bộ dòng Grok 4.x đều có mặt trong danh mục với đúng mức giá của nhà cung cấp, và Claude Sonnet 5 đã có thể định tuyến từ ngày 30 tháng 6 với mức giá 2 đô-la / 10 đô-la của Anthropic — mô hình mà phần lớn lưu lượng API Claude vẫn đang chạy, được đo ở 150 token đầu ra mỗi giây với thời gian p50 cho token đầu tiên vào khoảng năm giây.
Cụ thể là Claude Sonnet 5.5 vẫn chưa có trong danh mục của chúng tôi. Cho đến khi có, con đường để tiếp cận nó là API riêng của nhà cung cấp, và cách để thử nghiệm nó mà không đặt cược cả một khối lượng công việc vào một mô hình chưa từng được ai đánh giá độc lập vượt qua một chỉ số tổng hợp duy nhất là gửi cho nó một tỷ lệ phần trăm lưu lượng phía sau cơ chế chuyển đổi dự phòng tự động, với Grok 4.6 hoặc Claude Sonnet 5 đón lấy những gì nó đánh rơi. Dùng thử một tầng hoàn toàn mới là một quyết định định tuyến, chứ không phải một dự án di trú.
Làm gì với các con số
Grok 4.6 là mô hình tốt hơn để tìm đến khi công việc ngắn, đầu ra cô đọng, và tích hợp đã vốn nói tiếng OpenAI. Nó gọn nhẹ hơn một cách đo lường được trên mỗi tác vụ so với bất cứ thứ gì khác trong khung giá này, các điều khiển lấy mẫu của nó vẫn nguyên vẹn, và việc đã có mặt được bảy tuần nghĩa là các dạng lỗi của nó đã được người khác tìm ra.
Claude Sonnet 5.5 là mô hình tốt hơn khi đầu vào cực lớn, khi điểm tổng hợp là thứ bạn đang mua, hoặc khi công việc mang tính tác tử đủ để khoảng cách chỉ số mười hai điểm và giới hạn đầu ra 128K quan trọng hơn mức chênh lệch gấp bốn lần về chi phí mỗi tác vụ. Danh sách kiểm tra chuyển đổi là có thật, và đó là một ngày làm việc chứ không phải chỉ sửa một chuỗi mô hình.
Điều sẽ giải quyết được vấn đề là phép đo tokens-per-task trên lưu lượng của chính bạn, chạy trên cả hai. Mọi con số trong bài viết này quyết định kết quả — $1,86 so với $7,60, 94M so với 410M — đều là đại diện cho con số đó, và đó là con số duy nhất trong số chúng mà bạn có thể tự tạo ra.
So sánh trong bài viết này4
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
