Thẻ tiêu đề chính cho 'GPT-5.6 vs Grok 4.6' với dòng trên 'Chỉ số hòa ở mức 61 — giá và ngữ cảnh phân kỳ': thẻ bo tròn bên trái 'GPT-5.6 Sol' (OpenAI — phát hành ngày 9/7/2026; $4.00 / $20.00 mỗi 1M; ngữ cảnh ~1.05M · đầu ra 128K; nỗ lực tối đa = 4 tác tử phụ) và thẻ bo tròn bên phải 'Grok 4.6' (SpaceXAI — phát hành ngày 12/8/2026; $2.00 / $6.00 mỗi 1M; ngữ cảnh 500K · không giới hạn đầu ra; núm nỗ lực từ thấp đến cực cao), chân trang 'Chỉ số AA độc lập: 61 = 61.', logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-5.6 so với Grok 4.6: Ngang bằng về chỉ số, khác biệt về ngữ cảnh và giá cả

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

{{1}}Trên thang điểm Artificial Analysis Intelligence Index mà cả hai đều được đo lường tính đến đầu tháng 9 năm 2026, GPT-5.6 của OpenAI — với cấp bậc đầu bảng GPT-5.6 Sol, chính là thứ mà tên API gpt-5.6 trỏ đến — và Grok 4.6 của SpaceXAI đạt cùng một con số: 61.{{/1}} {{2}}Một chỉ số độc lập xếp hai mẫu đầu bảng của đối thủ ngang nhau là loại kết quả hiếm gặp nhất trong một cuộc so sánh tiên phong, và đây chính là nơi trận so tài này trở nên thú vị chứ không phải là nơi nó kết thúc.{{/2}} {{3}}Các mô hình hòa nhau này được bán theo những cách rất khác nhau.{{/3}} {{4}}GPT-5.6 Sol, mẫu đầu bảng mà OpenAI phát hành vào ngày 9 tháng 7 và định vị lại thành phân khúc giá trị khi GPT-6 Astra ra mắt vào ngày 3 tháng 9, có giá niêm yết $4.00 cho mỗi triệu token đầu vào và $20.00 cho mỗi triệu token đầu ra sau đợt giảm giá ngày 24 tháng 8, đồng thời hỗ trợ ngữ cảnh lên tới khoảng 1,05 triệu token.{{/4}} {{5}}Grok 4.6, mẫu mà xAI phát hành vào ngày 12 tháng 8, có giá niêm yết $2.00 / $6.00 và giới hạn tối đa ở 500.000 token.{{/5}} {{6}}Cùng điểm số trên bảng xếp hạng độc lập, và rồi hai mô hình chia tách nhau ở việc bạn có thể đẩy một yêu cầu đơn lẻ đi bao xa — và chi phí để đẩy nó đi là bao nhiêu.{{/6}}

Trang này giờ đây tồn tại vì một lý do cụ thể: hai bảng giá và hai mức trần đã dịch chuyển chỉ trong vòng vài tuần của nhau. Grok 4.6 phát hành ngày 12 tháng 8 và đến ngày 28 tháng 8 đã có mặt trong các cuộc trò chuyện Grok thông thường trên web và di động sau hai tuần đầu chỉ giới hạn trong Grok Build và API. Đợt giảm giá quảng bá của GPT-5.6 Sol diễn ra ngày 24 tháng 8, và mười ngày sau, sự ra mắt của GPT-6 Astra đã âm thầm hạ Sol từ flagship xuống flagship giá trị. Cả hai mẫu bên dưới hiện là thứ bạn hướng tới khi muốn có khả năng suy luận gần mức tiên phong mà không phải trả mức giá đẳng cấp Astra — đó chính là lý do vì sao tỷ số hòa 61-61 đã trở thành điểm quyết định trực tiếp thay vì chỉ là một câu hỏi vặt vãnh.

Cụm từ "tied at 61" nghĩa là gì, và nó không có nghĩa là gì?

Điểm số cần có ngày tháng và một thước đo. Artificial Analysis đo GPT-5.6 Sol ở mức ~61 và Grok 4.6 ở mức 61 trên thang chỉ số được sử dụng đến đầu tháng 9 — thang mà các bài đối đầu GPT-5.6 khác của blog này trích dẫn — trong đó Grok xếp hạng 11 trong số 202 mô hình mà AA theo dõi, còn Sol cách nó vài bậc với cùng số điểm. AA sau đó đã hiệu chỉnh lại chỉ số vào ngày 7 tháng 9 (v4.3), một phiên bản nén điểm số: GPT-5.6 Sol đo được 47 ở phiên bản này, GPT-6 Astra và Claude Fable 5.1 đo được 53, và vẫn chưa có điểm tổng thể nào cho Grok 4.6 được công bố trên thang mới. Do đó, sự ngang bằng dưới đây là một tuyên bố về thang điểm tháng 9 trước khi hiệu chỉnh, và tốt nhất nên được đọc theo vị trí tương đối: trên chỉ số gần nhất đo cả hai, hai mô hình này ngang bằng nhau, và cả hai đều xếp ngay sau nhóm Claude Opus 5.

Một lưu ý nữa về kết quả hòa này, và nó ảnh hưởng đến cách bạn sử dụng. Hai điểm số được tạo ra ở các mức cài đặt nỗ lực khác nhau — GPT-5.6 Sol ở mức suy luận tối đa, cài đặt cao nhất của OpenAI (chạy bốn tác tử phụ song song cho các yêu cầu khó), và Grok 4.6 ở mức cao, mức mặc định của xAI trên thang từ thấp đến rất cao. Cả hai đều là cấu hình "dốc toàn lực", nhưng chúng không phải là cùng một cấu hình, và kết quả hòa là giữa hai cài đặt cụ thể đó chứ không phải giữa mọi cài đặt mà các mô hình cung cấp. Điều mà điểm số ngang nhau xác lập là không mô hình nào nắm giữ lợi thế trí tuệ tổng quát mà phe đối lập có thể viện dẫn trên một chỉ số tổng hợp độc lập — vì vậy người mua khi lựa chọn giữa chúng phải nhìn xa hơn chỉ số, xét đến bối cảnh, giá cả và bằng chứng mà mỗi bên thực sự có thể trình ra.

Hai bảng giá, hai vách đá

Cả hai nhà cung cấp đều tính phí một prompt dài như một sự kiện cao cấp, và cả hai đều tính toàn bộ yêu cầu ở mức cao hơn khi vượt qua một ngưỡng — đó là cơ chế chung giúp việc so sánh giá này trở nên rõ ràng. Giá của OpenAI cho GPT-5.6 Sol là $4,00 / $20,00 mỗi triệu token với lượt đọc bộ nhớ cache ở mức $0,40, và khi một yêu cầu vượt qua khoảng 272K token đầu vào, toàn bộ yêu cầu sẽ được định giá lại thành $8,00 / $30,00 — cấu trúc ngữ cảnh dài mà Epoch AI đã ghi nhận vào ngày 8 tháng 9. Giá của xAI cho Grok 4.6 là $2,00 / $6,00 với lượt đọc bộ nhớ cache ở mức $0,50, và khi một prompt vượt qua 200K token, toàn bộ yêu cầu sẽ chuyển sang mức $4,00 / $12,00.

Phát hành — GPT-5.6: 9 tháng 7, 2026 (API công khai; bí danh gpt-5.6 đạt đến tầng Sol). Grok 4.6: 12 tháng 8, 2026.

Giá niêm yết cho mỗi 1M (vào / ra) — GPT-5.6 Sol: $4.00 / $20.00, đọc từ bộ nhớ đệm $0.40 (khuyến mãi đến ít nhất ngày 21 tháng 11, 2026). Grok 4.6: $2.00 / $6.00, đọc từ bộ nhớ đệm $0.50.

Hạng prompt dài — GPT-5.6 Sol: toàn bộ yêu cầu lên đến $8.00 / $30.00 sau khoảng 272K đầu vào. Grok 4.6: toàn bộ yêu cầu lên đến $4.00 / $12.00 ở mức 200K đầu vào.

Ngữ cảnh / trần đầu ra — GPT-5.6 Sol: ~1.05M đầu vào, 128K đầu ra. Grok 4.6: 500K đầu vào, không có trần đầu ra được công bố.

Chỉ số (độc lập) — GPT-5.6 Sol (tối đa) ~61 so với Grok 4.6 (cao) 61, thang đo tháng 9 trước khi hiệu chuẩn lại.

Phương thức — cả hai đều chấp nhận đầu vào văn bản và hình ảnh, và tạo ra văn bản.

Chạy các con số đã được tính toán và kết quả rất rõ ràng: ở mọi độ dài prompt mà Grok 4.6 có thể phục vụ, nó là phương án rẻ hơn, vì mức trần được định giá lại của nó vẫn ở mức bằng hoặc thấp hơn mức giá tiêu chuẩn của GPT-5.6 Sol.

100K đầu vào / 8K đầu ra — GPT-5.6 Sol: 0.10 × $4 + 0.008 × $20 = $0.56. Grok 4.6: 0.10 × $2 + 0.008 × $6 = $0.25. Grok rẻ hơn khoảng 55% cho yêu cầu.

400K vào / 30K ra (cả hai đều được định giá lại) — GPT-5.6 Sol: 0.40 × $8 + 0.03 × $30 = $4.10. Grok 4.6: 0.40 × $4 + 0.03 × $12 = $1.96. Grok vẫn có giá chỉ khoảng một nửa ngay cả sau khi bước qua ngưỡng giá của chính nó.

600K vào / 30K ra — GPT-5.6 Sol: 0.60 × $8 + 0.03 × $30 = $5.70. Grok 4.6: không thể — 600K vượt quá cửa sổ ngữ cảnh 500K của nó. Đây là khoảng mà Sol là lựa chọn duy nhất, và giá của nó không còn trông đắt đỏ nữa.

A two-column scoreboard titled 'GPT-5.6 vs Grok 4.6 — the scoreboard'. Left column 'GPT-5.6 Sol': Released Jul 9 2026; Price $4.00 / $20.00 per 1M, cache $0.40; Over 272K input whole request $8.00 / $30.00; Context / output ~1.05M / 128K; AA Intelligence Index ~61 (max); SWE-bench Verified ~96% (reported). Right column 'Grok 4.6': Released Aug 12 2026; Price $2.00 / $6.00 per 1M, cache $0.50; At 200K input whole request $4.00 / $12.00; Context / output 500K / no published cap; AA Intelligence Index 61 (high); GPQA Diamond 94.9% (reported). Footer: 'Independent index: tied at 61 — AA scale, pre-Sept-7 2026 recalibration.'; OrcaRouter logo bottom-right.

Hình dạng vách đá khác biệt ở một điểm có lợi cho GPT-5.6 Sol: {{1}}ngưỡng của nó (272K) nằm cao hơn ngưỡng của Grok (200K){{/1}}, vì vậy có một dải — khoảng 200K đến 272K đầu vào — nơi Grok đã định giá lại còn Sol thì chưa. Ngay cả ở đó Grok vẫn thường thắng về chi phí, vì mức giá đầu ra sau khi định giá lại là $12 vẫn thấp hơn 40% so với mức $20 tiêu chuẩn của Sol. Các tính toán kinh tế chỉ đảo chiều có lợi cho Sol {{2}}khi vượt quá 500K token{{/2}}, đây chính là vùng mà cửa sổ ngữ cảnh của Grok không thể tiếp cận. Nếu độ dài prompt của bạn luôn dưới 200K — đúng với hầu hết lưu lượng chat, RAG và code-assist — thì Grok 4.6 rẻ hơn ở quy mô lớn gần gấp đôi về chi phí tổng hợp, và cơ chế vách đá áp dụng cho toàn bộ yêu cầu có nghĩa là bạn nên coi 200K là ranh giới lập kế hoạch chứ không phải gợi ý mềm.

Nửa triệu token bổ sung của Sol thực sự dùng để làm gì

{{1}}Cửa sổ 500K của Grok 4.6 đáp ứng được nhiều khối lượng công việc thực tế hơn so với những gì bảng thông số kỹ thuật thể hiện{{/1}} — {{2}}đọc toàn bộ mã nguồn, bản ghi tác nhân dài, ngữ cảnh truy xuất lớn{{/2}} — {{3}}và việc không công bố giới hạn đầu ra giúp ích cho phía tạo sinh{{/3}}: {{4}}đối với một lần gọi duy nhất phải tạo ra một artifact rất dài, Grok không có trần quy định nào trong khi GPT-5.6 Sol dừng ở 128K token đầu ra{{/4}}. {{5}}Lợi thế của GPT-5.6 Sol nằm ở dải 500K đến 1.05M{{/5}}, {{6}}và các khối lượng công việc thực sự cần đến nó hẹp hơn so với những gì tiếp thị ngụ ý{{/6}}: {{7}}các tác nhân giữ toàn bộ kho mã nguồn cùng lịch sử tác vụ dài trong ngữ cảnh{{/7}}, {{8}}các bản ghi cuộc họp hoặc nghiên cứu rất dài được phân tích trong một lần{{/8}}, {{9}}và các công việc truy xuất trên kho dữ liệu quá lớn để chia nhỏ thành các cửa sổ có kích thước Grok{{/9}}. {{10}}Nếu không có pipeline nào của bạn chạm tới dải đó, thì ngữ cảnh thêm của Sol là dư địa mà bạn đang trả mức phí đầu vào $4.00 để không sử dụng.{{/10}}

Hai mô hình cũng định hướng suy luận theo những cách khác nhau. GPT-5.6 Sol cung cấp núm xoay mức nỗ lực low / medium / high / max, trong đó mức max chạy bốn tác tử con song song phối hợp trên các tác vụ khó — thực chất là một bầy tác tử nhỏ cho mỗi yêu cầu khó, mạnh mẽ nhưng tốn kém về output token, và là cài đặt đằng sau điểm chỉ số ~61. Grok 4.6 chạy một mô hình duy nhất với núm xoay low-to-xhigh (mặc định là high) cùng các công cụ phía máy chủ để tìm kiếm và thực thi mã, giúp hành vi của nó dễ dự đoán hơn khi lập ngân sách: một yêu cầu, một mô hình, một khoản chi phí bạn có thể ước tính từ bảng giá. Đối với nhà phát triển muốn chi phí có thể xác định trước, thiết kế một mô hình duy nhất của Grok đơn giản hơn về mặt vận hành; còn với những tác vụ dài hạn khó nhất, bầy tác tử nỗ lực tối đa của Sol là cấu hình có năng lực hơn — và đó là lý do điểm số tốt nhất lẫn hóa đơn tốn kém nhất của nó đều đến từ cùng một cài đặt.

Bằng chứng mà mỗi bên thực tế có thể trình bày

Không mô hình nào có lợi thế được xác nhận độc lập trên bảng xếp hạng mã hóa, nên bằng chứng trích dẫn được chia theo nhà cung cấp. {{1}}OpenAI báo cáo GPT-5.6 Sol đạt khoảng 96% trên SWE-bench Verified — trích dẫn mã hóa mạnh nhất mà một trong hai mô hình có thể đưa ra, nhưng chỉ mới là kết quả do hãng báo cáo, chưa có kiểm toán độc lập nào được công bố — và lợi thế thực tế của Sol bao gồm việc nằm ngay trong bộ công cụ Codex và ChatGPT.{{/1}} {{2}}xAI báo cáo Grok 4.6 đạt 94,9% trên GPQA Diamond, mà hãng này tuyên bố là điểm số cao nhất từng được thử nghiệm trên điểm chuẩn đó, đồng thời trích dẫn các đánh giá tác nhân (agentic) có chi phí API trung bình khoảng 0,84 USD cho mỗi tác vụ toàn diện; cả hai đều là số liệu do nhà cung cấp đưa ra.{{/2}} Về tốc độ, hai mô hình gần nhau hơn mức chênh lệch giá gợi ý: {{3}}AA đo được Grok 4.6 ở 64,9 token đầu ra mỗi giây và GPT-5.6 Sol cũng ở mức giữa 60 tương tự trên dịch vụ tiêu chuẩn, còn bản xem trước "Ultrafast" riêng biệt chạy trên nền Cerebras của OpenAI (lên tới khoảng 750 token mỗi giây) vẫn còn giới hạn và chưa có mức giá.{{/3}} Hãy đọc toàn bộ bảng bằng chứng như sau: hòa về chỉ số, bằng chứng mã hóa ở cả hai phía mà không bên nào có kiểm toán độc lập, và không có khoảng cách tốc độ nào làm thay đổi quyết định.

Lựa chọn mặc định nào là hợp lý vào tháng 9 năm 2026?

Hãy chọn Grok 4.6 khi lưu lượng truy cập của bạn nằm dưới 200K token đầu vào — giá chỉ bằng gần một nửa ở mọi độ dài mà nó phục vụ, chỉ số độc lập cho thấy các mô hình ngang hàng nhau, và một bộ điều chỉnh mô hình duy nhất với các công cụ phía máy chủ giúp hóa đơn luôn dự đoán được. Hãy chọn GPT-5.6 Sol khi bạn thực sự cần dải ngữ cảnh 500K–1.05M, khi bộ công nghệ của bạn vốn đã dùng Codex hoặc ChatGPT làm nền tảng và con số ~96% SWE-bench được công bố giúp bộ phận thu mua có bằng chứng về năng lực lập trình, hoặc khi bạn muốn tùy chọn cấu hình nỗ lực tối đa với bốn tác tử con cho những tác vụ dài hạn khó nhất. Và hãy theo dõi hai mốc thời gian: chương trình khuyến mãi $4/$20 của GPT-5.6 Sol chỉ được đảm bảo đến hết ít nhất là ngày 21 tháng 11 năm 2026, sau đó sự so sánh này sẽ thay đổi, và xAI đã hé lộ Grok 4.7 — một trong hai sự kiện đó đều có thể định giá lại cuộc đối đầu mà bạn sắp lấy làm tiêu chuẩn.

Chạy cả hai mà không cần tái cấu trúc.

Vì việc ngang điểm trên chỉ số này đồng nghĩa đây là quyết định theo trần năng lực và giá chứ không phải theo chất lượng, cách thức thực tế cho hầu hết các đội nhóm là định tuyến thay vì chọn lựa. GPT-5.6 Sol và Grok 4.6 đều có trên OrcaRouter với giá niêm yết của nhà cung cấp, được chuyển qua với mức chênh lệch bằng 0 — giá $4/$20 của OpenAI và $2/$6 của xAI là những con số trên bảng niêm yết, và khi một trong hai nhà cung cấp thay đổi mức giá, giá mới sẽ có hiệu lực trên cùng một key ngay trong ngày. Với một endpoint tương thích OpenAI, bạn có thể gửi lưu lượng dưới 200K đến Grok 4.6, chuyển lên các prompt cần ngữ cảnh dài hơn của Sol hoặc cấu hình max-effort của nó, và sử dụng chuyển đổi dự phòng tự động để giới hạn tốc độ trên một đường dẫn của nhà cung cấp chỉ là một sự kiện định tuyến thay vì một sự cố ngừng hoạt động.

A screenshot of the OrcaRouter model page for GPT-5.6 Sol (model id openai/gpt-5.6-sol), showing the header price of $4.00 in / $20.00 out per 1M tokens, tags including Vision, Tools, JSON and Reasoning, 'by OpenAI — 2026-07-09', a description of GPT-5.6 Sol as the flagship model in OpenAI's GPT-5.6 series covering deep multi-step reasoning, large-scale software engineering and long-horizon agentic work over a 1.05M-token context window with up to 128K output tokens, and the site's latest-model navigation.

Phần giá trong phép so sánh này là phần biến động — chương trình khuyến mãi Sol của OpenAI chỉ được đảm bảo đến hết ngày 21 tháng 11 và xAI có bản 4.7 trong lộ trình — vì vậy tài liệu tham khảo mà blog này luôn cập nhật là trang định giá GPT-5.6 Sol, có đóng dấu ngày và được xác minh lại mỗi khi thẻ giá thay đổi.

A screenshot of OrcaRouter's '$4 / $20 per 1M Tokens — After the Price Cut' pricing article on the GPT-5.6 Sol promotional rate, bylined Gideon Frost, shown alongside the site's LATEST MODELS rail.

Câu trả lời hai dòng

Nếu prompt của bạn nằm dưới 500K token — và hầu hết đều như vậy — Grok 4.6 đạt cùng điểm chỉ số độc lập như GPT-5.6 Sol với mức giá chỉ bằng gần một nửa ở mọi độ dài mà nó có thể phục vụ, không có giới hạn đầu ra được công bố và một mô hình đơn nhất dễ dự đoán. GPT-5.6 Sol xứng đáng với mức giá cao hơn ở dải mà Grok không thể vươn tới: vượt qua 500K token ngữ cảnh, và trong bộ công cụ OpenAI nơi chỉ số ~96% SWE-bench Verified được báo cáo cùng các bậc Terra và Luna bên dưới mang lại cho bạn một gia đình mô hình thay vì một mô hình đơn lẻ. Việc hòa điểm trên chỉ số có nghĩa quyết định này xoay quanh trần giới hạn và chi phí, chứ không phải năng lực — vì vậy hãy đo các prompt thực tế dài nhất của bạn trước khi cam kết, bởi vì con số duy nhất đó sẽ chọn ra người thắng cuộc.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày