
GPT-6 và Grok 4.6: Hai hạng trung, một hóa đơn tách biệt khi vượt 200K token
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 128 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 60 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 356 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
GPT-6 Sol và Grok 4.6 có cùng mức giá $2,00 cho mỗi triệu token đầu vào và $6,00 cho mỗi triệu token đầu ra ở đầu hai cột. Điều mà gần như không ai in kèm ngay bên cạnh đó là hai cột ngừng khớp với nhau tại những điểm khác nhau trong yêu cầu. Grok 4.6 bắt đầu tính mức giá ngữ cảnh dài khi prompt vượt qua 200.000 token đầu vào; GPT-6 Sol đợi đến 272.000. Vượt qua các ngưỡng đó, toàn bộ yêu cầu được tính lại giá — không chỉ phần vượt — và hai nhà cung cấp tính lại giá theo hai hướng ngược nhau, và đây chính là phần quyết định hóa đơn cho một phiên chạy agent dài. GPT-6 Sol cùng hai mô hình anh em GPT-6 Astra và GPT-6 Luna đã phát hành ngày 22 tháng 9 năm 2026; Grok 4.6, phân khúc giữa trong dòng sản phẩm của SpaceXAI, đã phát hành ngày 12 tháng 8 năm 2026 và đã có Grok 4.7 gia nhập, nên đây là so sánh giữa hai mô hình đã phát hành chứ không phải màn ra mắt của bất kỳ mô hình nào trong hai.
Một điều thứ hai đã thay đổi vào ngày 7 tháng 10 năm 2026, và nó ảnh hưởng đến cách bạn đọc về GPT-6 nói chung: OpenAI bắt đầu đưa GPT-6 vào tab Chat chính của ChatGPT, tiếp cận các gói miễn phí vào ngày 8 tháng 10, với các gói Plus, Pro, Business và Enterprise chạy GPT-6 Sol còn các gói Free và Go chạy GPT-6 Luna. Đó là một thay đổi bề mặt — vẫn những mô hình đó, một lượng người dùng lớn hơn nhiều, và một lớp giao diện mới mà OpenAI gọi là Intelligent UI. Nó không làm thay đổi một mức rate API nào cả. Nhưng nó có nghĩa là nếu bạn đang đánh giá hiệu năng của "GPT-6" so với bất cứ thứ gì, thì giờ đây bạn đang đánh giá hiệu năng so với một mô hình mà rất nhiều người cũng đang trò chuyện cùng trong một tab trình duyệt.
Nơi hai thẻ thực sự khác nhau
• Đầu vào ngữ cảnh ngắn — GPT-6 Sol 2,00 USD mỗi triệu so với Grok 4.6 2,00 USD mỗi triệu
• Đầu ra ngữ cảnh ngắn — GPT-6 Sol 10,00 USD mỗi triệu so với Grok 4.6 6,00 USD mỗi triệu
• Ngưỡng yêu cầu dài — GPT-6 Sol tính giá lại khi trên 272.000 token đầu vào so với Grok 4.6 khi trên 200.000
• Đầu vào yêu cầu dài — GPT-6 Sol 4,00 USD mỗi triệu so với Grok 4.6 4,00 USD mỗi triệu
• Đầu ra yêu cầu dài — GPT-6 Sol 15,00 USD mỗi triệu so với Grok 4.6 12,00 USD mỗi triệu
• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Sol 0,20 USD mỗi triệu so với Grok 4.6 0,50 USD mỗi triệu
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Grok 4.6 500.000 token
• Các phương thức đầu vào — cả hai đều chấp nhận văn bản, hình ảnh và tệp
• Điểm công việc tri thức — GPT-6 Sol 47,6 so với Grok 4.6 44,3 trên Artificial Analysis Intelligence Index
• Terminal-Bench 2.1 — GPT-6 Sol không được công bố trên cùng phiên bản so với Grok 4.6 88,4
Đọc hai dòng kết quả cùng nhau, hình hài của quyết định sẽ hiện ra. Grok 4.6 rẻ hơn 4,00 USD cho mỗi triệu token đầu ra ở mọi yêu cầu dưới 200K, và chỉ rẻ hơn 3,00 USD khi vượt ngưỡng đó. Đó là khoảng cách nhỏ hơn nhiều so với con số 40% gây chú ý, bởi cả hai mô hình đều định giá lại toàn bộ yêu cầu thay vì chỉ phần vượt ngưỡng — một chi tiết đáng để ngẫm kỹ, vì một prompt ở 200.001 token không được tính phí như một token ở mức giá đắt cộng với 200.000 token ở mức giá rẻ.
Vậy thì chính ngưỡng đó lại chạy theo hướng ngược lại. Grok 4.6 bắt đầu tính giá lại sớm hơn GPT-6 Sol 72,000 token. Với một khối lượng công việc nằm ổn định trong khoảng từ 200K đến 272K, Grok 4.6 là mô hình đắt hơn bất chấp mức giá trên mỗi token rẻ hơn của nó, và nó là mô hình duy nhất trong hai mô hình đã dịch chuyển chút nào. Việc các prompt của bạn rơi vào phía nào của cửa sổ đó là một câu hỏi hữu ích hơn so với việc mức giá nào thấp hơn.

Khoảng cách chuẩn đối sánh nhỏ hơn và hẹp hơn so với khoảng cách giá
Trên Chỉ số Thông minh của Artificial Analysis, vốn là một phép đo của bên thứ ba chứ không phải bảng của nhà cung cấp, GPT-6 Sol đạt 47,6 và Grok 4.6 đạt 44,3. Khoảng cách 3,3 điểm trên thang 0 đến 100 là có thật, nhưng nó không phải kiểu khoảng cách khiến một mô hình trở nên sai với một tác vụ còn mô hình kia đúng. Con số này cũng được đo ở một thiết lập suy luận cụ thể cho từng mô hình, và GPT-6 Sol cho phép cấu hình mức độ nỗ lực suy luận trong khi Grok 4.6 có thiết lập riêng — nên bất kỳ ai trích dẫn một con số đối đầu trực tiếp chỉ là đang trích dẫn một điểm trong lưới hai chiều.
Điểm mà hai mô hình thực sự khác biệt rõ rệt hơn cả là công việc tác tử kiểu terminal. Trên Terminal-Bench 2.1, Grok 4.6 đạt 88.4. GPT-6 Sol không có con số công bố tương đương nào trên bản sửa đổi mà danh mục của chúng tôi đang có, và cách diễn giải trung thực về một ô trống là con số đó chưa được công bố — chứ không phải mô hình đã hoạt động kém. Nếu khối lượng công việc là một tác tử chạy dài hạn điều khiển bằng shell, thì bằng chứng đã công bố nghiêng về Grok 4.6, còn bằng chứng còn thiếu không được tính là bằng chứng cho bên nào.
Điều ngược lại đúng với truy xuất kiến thức ở ngữ cảnh dài. GPT-6 Sol ghi nhận 83.7 về khả năng nhớ lại trong ngữ cảnh dài, so với 80.3 của Grok 4.6, và nhà cung cấp của cả hai mô hình báo cáo các số liệu riêng của họ ở nơi khác — SpaceXAI nhấn mạnh GPQA Diamond đạt 94.9 đối với Grok 4.6, còn tài liệu GPT-6 của OpenAI phần lớn do nhà cung cấp báo cáo và chưa được tái lập. Hai nguyên tắc giúp phân định rõ điều này: số liệu của nhà cung cấp là một tuyên bố, còn số liệu chỉ mục là một phép đo trên một bản sửa đổi được nêu tên. Chúng không thể thay thế cho nhau và không bao giờ nên được lấy trung bình thành một điểm “tốt hơn” duy nhất.
Vấn đề người kế nhiệm
Không mô hình nào trong hai mô hình này là mô hình mới nhất từ chính phòng thí nghiệm của nó, và giả vờ điều ngược lại sẽ là điều gây hiểu lầm nhất mà so sánh này có thể làm. SpaceXAI đã phát hành Grok 4.7 vào ngày 21 tháng 9 năm 2026 với mức giá cơ bản vẫn là $2.00 / $6.00, khi Intelligence Index chuyển từ 44.3 lên 46.4. OpenAI đã phát hành GPT-6.1 Sol vào ngày 29 tháng 9 năm 2026, cũng với mức $2.00 / $10.00, với Intelligence Index ở 51.8 và một mức giá thực sự được cải thiện: đầu vào được lưu đệm giảm từ $0.20 xuống $0.10 mỗi triệu. Artificial Analysis hiện đánh dấu trang GPT-6 Sol của mình là không còn được hỗ trợ, hướng độc giả đến GPT-6.1 Sol.
Vậy nên cách đặt vấn đề công bằng không phải là “bạn nên chọn cái nào trong hai cái này” mà là “bạn nên chọn cái nào trong hai cái này, và liệu bạn có chắc nó không phải là một thế hệ mới hơn ở một trong hai phía không.” Lý do để ở lại với GPT-6 Sol thường là một tích hợp cụ thể mới tám ngày chứ không phải một tuyên bố về năng lực; lý do để ở lại với Grok 4.6 là một con số terminal-agent đã được công bố mà phiên bản kế nhiệm của nó chưa công khai sánh ngang được. Cả hai đều chính đáng, và cả hai đều có giới hạn thời gian.

Chạy cả hai từ một phím
Cả hai mô hình đều được OrcaRouter định tuyến, nên phần cơ học của việc duy trì hai ứng viên cùng hoạt động chẳng tốn gì: một API đứng trước hơn 200 mô hình, cùng một khóa, không cần hợp đồng thứ hai và không cần thay đổi mã giữa chúng. Điều đó ở đây quan trọng hơn bình thường, bởi lý do chọn mô hình thứ hai cho cặp đối đầu cụ thể này không phải là một biện pháp phòng ngừa về năng lực mà là một quyết định định tuyến — gửi cửa sổ 200K đến 272K cho GPT-6 Sol và mọi thứ ngắn hơn cho Grok 4.6, thì cùng một ứng dụng sẽ nhận được hóa đơn rẻ hơn ở cả hai phía của một ngưỡng mà không nhà cung cấp nào cho bạn tự chọn.
Tự động chuyển đổi dự phòng là nửa nhàm chán của cùng một thiết lập. Các lượt chạy agent với ngữ cảnh dài kéo dài lâu chính là vì có thứ gì đó đang giữ một phiên làm việc mở, và một trục trặc nhỏ từ nhà cung cấp ở phút thứ bốn mươi lại là kiểu thất bại tốn kém. Một tuyến thứ hai được cấu hình sẵn sẽ biến điều đó thành một lần thử lại thay vì phải chạy lại từ đầu.
Danh mục của chúng tôi liệt kê cả hai ở đúng giá niêm yết của nhà cung cấp tương ứng, không cộng thêm chút nào, nên thay đổi mức giá trên một trong hai thẻ sẽ về phía chúng tôi cùng ngày nó về phía họ. Điều đó đáng nói thẳng ra chứ không phải như một khẩu hiệu: lý do cần quan tâm là mức chênh lệch $0.20 so với $0.50 cho đầu vào được lưu trong bộ đệm ở trên đúng là kiểu dòng mà các nhà cung cấp âm thầm thay đổi, và cơ chế chuyển thẳng nghĩa là bạn không bao giờ phải chờ một nhà bán lại đuổi kịp.

Điều gì thực sự quyết định điều đó?
Nếu prompt của bạn ngắn, Grok 4.6 thắng về giá đầu ra với một khoảng cách mà không chênh lệch chỉ số nào thu hẹp được, và điểm terminal-agent của nó là con số được công bố mạnh nhất trong cả hai cột. Nếu prompt của bạn dài, ngưỡng định giá lại muộn hơn của GPT-6 Sol và cửa sổ dài hơn của nó có giá trị hơn tốc độ đầu ra cao hơn của nó, và dòng đầu vào được lưu trữ chỉ bằng một phần tư chi phí. Nếu prompt của bạn nằm trong khoảng từ 200K đến 272K, bạn đang nắm giữ khối lượng công việc duy nhất mà ở đó mô hình trông rẻ hơn lại là mô hình đắt hơn, và giải pháp là lựa chọn tuyến thay vì lựa chọn mô hình.
Điều đáng để ý không phải là một trong hai mô hình đó, mà là hai phiên bản kế nhiệm đã có sẵn trên thị trường. Grok 4.7 và GPT-6.1 Sol đều làm suy yếu lý lẽ cho việc chờ đợi một quyết định ở đây, và một so sánh phải chạy lại ba tuần một lần là một so sánh nên nằm sau một router hơn là trong một tài liệu kiến trúc.
So sánh trong bài viết này3
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
