Một thẻ tiêu đề nổi bật cho bài viết so sánh GPT-6 Sol với Grok 4.7, với dòng chữ 'GPT-6 Sol vs Grok 4.7' cùng phụ đề 'Token rẻ hơn nhưng lại đắt gấp ba lần', hiển thị số liệu thống kê '240M so với 77M token đầu ra', trong đó Grok 4.7 có giá output 6,00 USD và 3,74 USD mỗi tác vụ, còn GPT-6 Sol có giá output 10,00 USD và 1,06 USD mỗi tác vụ.
Guides & Insights

GPT-6 Sol so với Grok 4.7: Token rẻ hơn nhưng lại đắt gấp ba lần

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình ra mắt cách nhau một ngày vào tháng 9 năm 2026, và trên bảng giá niêm yết thì chúng không hề gần nhau. Grok 4.7 ra mắt ngày 21 tháng 9 với giá $2.00 cho mỗi triệu token đầu vào và $6.00 cho mỗi triệu token đầu ra. GPT-6 Sol ra mắt ngày 22 tháng 9 với cùng mức $2.00 cho đầu vào và $10.00 cho đầu ra. Đầu ra của Grok rẻ hơn 40%. Đó chính là toàn bộ cơ sở để hầu hết các so sánh sẽ chọn nó, và đó lại là con số sai để nhìn vào.

Con số quyết định sự ghép cặp này không nằm trên bảng giá nào. Đó là 240 triệu so với 77 triệu — số token đầu ra mà mỗi mô hình tạo ra trong khi Artificial Analysis chạy Chỉ số Thông minh của mình. Grok 4.7 đã đốt số token nhiều hơn gấp ba lần một chút để trả lời cùng một bộ câu hỏi. Nhân con số đó với mức giá trên mỗi token và mô hình có đầu ra rẻ hơn lại tốn 3,74 đô la cho mỗi tác vụ hoàn thành, so với 1,06 đô la. Rẻ hơn trên mỗi token, nhưng hóa đơn cao hơn gấp ba lần.

Mỗi mô hình thực sự là gì

Grok 4.7 là phiên bản kế nhiệm Grok 4.6 của xAI, được định vị là mô hình mạnh nhất của họ cho lập trình và công việc tri thức, với cửa sổ ngữ cảnh 500.000 token, đầu vào văn bản và hình ảnh, đầu ra văn bản, cùng mức độ nỗ lực suy luận có thể cấu hình theo low, medium, high và xhigh. xAI chưa công bố số lượng tham số. Mô hình chấp nhận thời điểm cắt dữ liệu tiền huấn luyện được báo cáo là tháng 6 năm 2026, với huấn luyện bổ sung đến tháng 8.

GPT-6 Sol là mô hình GPT-6 tầm trung của OpenAI — dưới mô hình hàng đầu GPT-6 Astra, trên mô hình giá rẻ GPT-6 Luna — với cửa sổ ngữ cảnh 1.050.000 token, đầu vào tối đa 922.000 token, giới hạn đầu ra 128.000 token và ngày cắt kiến thức 20 tháng 4 năm 2026. Nó nhận văn bản và hình ảnh, xuất ra văn bản, với nỗ lực suy luận từ không đến tối đa, và OpenAI đã mô tả giá của nó là vĩnh viễn chứ không phải khuyến mãi.

Các cửa sổ ngữ cảnh không hề gần nhau. Cửa sổ của Sol gần như gấp đôi. Điều đó chỉ quan trọng với đúng một loại khối lượng công việc, và đó không phải loại mà hầu hết mọi người chạy.

Bảng giá, và dòng đảo ngược nó

• Đầu vào — GPT-6 Sol $2.00 mỗi triệu token so với Grok 4.7 $2.00 mỗi triệu token; giống hệt nhau

• Đầu ra — GPT-6 Sol 10,00 USD mỗi triệu token so với Grok 4.7 6,00 USD mỗi triệu token; Grok rẻ hơn 40%

• Đầu vào được lưu trong bộ nhớ đệm — GPT-6 Sol $0.20 mỗi triệu token so với Grok 4.7 $0.50 mỗi triệu token; giá đọc bộ nhớ đệm của Sol rẻ hơn 2,5 lần, điều này trái ngược với hàm ý của mức giá đầu ra

• Ghi bộ nhớ đệm — GPT-6 Sol 2,50 đô la mỗi triệu token so với Grok 4.7, mức giá không được công bố trên cùng bảng đó

• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Grok 4.7 500.000 token

• Phụ phí ngữ cảnh dài — GPT-6 Sol định giá lại một yêu cầu trên 272.000 token đầu vào ở mức 2× đối với giá đầu vào và bộ nhớ đệm, và 1.5× đối với đầu ra cho toàn bộ yêu cầu, so với Grok 4.7 tăng gấp đôi mọi mức giá tại 200.000 token đầu vào, cũng cho toàn bộ yêu cầu

• Mốc kiến thức — GPT-6 Sol ngày 20 tháng 4 năm 2026 so với Grok 4.7, mốc cắt tiền huấn luyện được báo cáo là tháng 6 năm 2026 với huấn luyện bổ sung kéo dài đến tháng 8

• Mức độ suy luận — GPT-6 Sol: không, thấp, trung bình (mặc định), cao, xhigh, tối đa so với Grok 4.7: thấp, trung bình (mặc định), cao, xhigh

• Phương thức — đầu vào là văn bản và hình ảnh, đầu ra là văn bản, cho cả hai

Dòng cache là dòng mà người mua nên cân nhắc kỹ. Mức giá đầu ra của Grok thấp hơn, nhưng đầu vào được cache của nó gấp hai lần rưỡi của Sol, và đầu vào được cache chính là nơi lưu lịch sử agent dài cùng các system prompt lặp đi lặp lại. Một khối lượng công việc chủ yếu đọc lại một ngữ cảnh lớn, ổn định sẽ thấy hai mức này gần nhau hơn nhiều so với mức $6 so với $10 gợi ý — và khi áp thêm tỷ lệ khối lượng token lên trên, thứ tự sẽ đảo ngược.

A six-row scoreboard card titled 'GPT-6 Sol vs Grok 4.7 - the scoreboard', comparing the two models on output price, cached input, context window, Intelligence Index score, index output tokens and cost per task. The left column lists GPT-6 Sol at $10.00 output, $0.20 cached input, a 1,050,000-token context, an Index of 48, 77M index tokens and $1.06 per task; the right column lists Grok 4.7 at $6.00 output, $0.50 cached input, a 500,000-token context, an Index of 46, 240M index tokens and $3.74 per task. A footer reads 'Vendor list prices; index figures per Artificial Analysis.'

Tại sao 240 triệu token là toàn bộ câu chuyện

Artificial Analysis đã đo Grok 4.7 ở chế độ xhigh tạo ra khoảng 240 triệu token đầu ra trong toàn bộ lần chạy chỉ số của nó, so với mức trung vị khoảng 88 triệu đối với các mô hình trên cùng bảng xếp hạng. Bản tóm tắt của chính nó gọi mô hình này là "chậm một cách đáng chú ý và rất dài dòng." GPT-6 Sol, được đo trên cùng hệ thống đánh giá, tạo ra 77 triệu — được mô tả trên bảng xếp hạng là "khá súc tích."

Bảng xếp hạng cũng báo cáo trực tiếp hệ quả. Grok 4.7 đạt 46 điểm trên Chỉ số Trí tuệ với chi phí 3,74 USD mỗi tác vụ. Ở thiết lập cao, điểm số cũng là 46 và chi phí là 2,73 USD mỗi tác vụ. GPT-6 Sol đạt 48 điểm với chi phí 1,06 USD mỗi tác vụ. Cùng chỉ số, cùng hệ thống đánh giá, và mức chênh lệch chi phí gấp hai đến ba lần rưỡi mà không có bảng giá nào thể hiện.

Hai lưu ý trước khi bạn coi những con số đó là một so sánh đối đầu trực tiếp rõ ràng. Hai trang được ghi lại cùng ngày nhưng các bảng xếp hạng mang tổng số khác nhau — trang của Grok hiển thị một lớp gồm 212 mô hình, còn một danh sách Grok riêng báo cáo thứ hạng trong tổng số 655 — nên hai điểm số không được đảm bảo nằm trên cùng một bản dựng chỉ mục. Và cả hai con số đều không phải là số của nhà cung cấp: Artificial Analysis chạy bộ khung đánh giá riêng của mình, đó chính là điểm mấu chốt, nhưng các thiết lập suy luận khác nhau giữa hai danh sách (xhigh cho Grok, max cho Sol), nên hãy coi khoảng cách chi phí năm trăm phần trăm là phát hiện chính và khoảng cách chỉ số hai điểm là gần đúng.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing an Intelligence Index score of 46, list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, a cost of $3.74 per Intelligence Index task, 240 million output tokens generated during the index run, a 500,000-token context window and 39.2 output tokens per second.

Những gì xAI đã công bố, và những gì chưa ai kiểm chứng

Các con số công bố khi ra mắt của chính xAI là rất mạnh và, giống như mọi con số công bố khi ra mắt của nhà cung cấp, chưa được tái lập. CursorBench 4.0 đạt 46,3% ở mức xhigh so với 40,4% của Grok 4.6. Terminal-Bench 4.0 đạt 38,0% so với 20,3% — mức tăng đơn lẻ lớn nhất trong bản phát hành này. DeepSWE v1.1 đạt 71,0% ở mức high so với 65,2%. EEBench đạt 64,0% so với 53,0%. Đó là harness của xAI, cài đặt của xAI, cách báo cáo của xAI.

Các con số của OpenAI cho GPT-6 Sol cũng theo cùng một khuôn mẫu và xứng đáng nhận cùng mức chiết khấu. Khác biệt là Sol có thêm một bằng chứng độc lập so với Grok: con số chi phí trên mỗi tác vụ của Artificial Analysis, vốn được tính từ mức tiêu thụ token đo được thay vì từ bảng điểm của nhà cung cấp. Đó là con số trụ vững qua so sánh này.

Điều mà chưa ai công bố cho cả hai mô hình là một so sánh đối đầu trên cùng các tác vụ, cùng một harness và cùng một thiết lập effort. Nếu bạn thấy một cái như vậy, hãy kiểm tra xem trong ba biến đó, biến nào đã thay đổi.

Định giá một tháng lưu lượng agent được cache

Hãy xét một workload chủ yếu là ngữ cảnh ổn định: một coding agent với system prompt 60.000 token và bản tóm tắt repository, được đọc lại trong 5.000 lần gọi mỗi tháng, mỗi lần trả về 4.000 token đầu ra. Giả sử caching hoạt động và tiền tố ổn định được tính phí theo mức giá đã cache.

Trên GPT-6 Sol: 300 triệu token đầu vào được lưu trong bộ nhớ đệm với giá $0,20 mỗi triệu là $60,00. Hai mươi triệu token đầu ra với giá $10,00 mỗi triệu là $200,00. Tổng cộng là $260,00.

Với Grok 4.7: cùng 300 triệu token đầu vào được lưu trong bộ nhớ đệm ở mức $0,50 mỗi triệu là $150,00. Hai mươi triệu token đầu ra ở mức $6,00 mỗi triệu là $120,00. Tổng cộng là $270,00.

Gần như giống hệt — và đó là khi khối lượng token được giữ cố định, một giả định hào phóng. Độ dài dòng đo được của Grok 4.7 trong lần chạy chỉ mục gấp ba lần Sol. Chỉ cần áp hệ số nhân 1,5× cho khối lượng đầu ra thì hóa đơn của Grok sẽ lên tới $330.00 so với $320.00 của Sol, và khoảng cách còn nới rộng từ đó. Mức giá đầu ra rẻ hơn không trụ nổi khi cộng thêm cache lẫn độ dài dòng; nó chỉ vừa đủ trụ được khi chỉ có cache.

Không có gì ở đây là tuyên bố về giá của một trong hai mô hình thông qua OrcaRouter — cả hai đều không nằm trong danh mục của chúng tôi. GPT-6 Sol có thể truy cập được qua API riêng của OpenAI và Grok 4.7 qua API của xAI; phần còn lại của dòng Grok, bao gồm Grok 4.6, có thể được định tuyến qua chúng tôi ở mức giá niêm yết của xAI theo mô hình chuyển tiếp. Mục đích của phép tính này là quy tắc leo thang mà bạn viết ra nên dựa trên chi phí cho mỗi tác vụ hoàn thành trên lưu lượng của chính bạn, chứ không phải trên bảng giá — và một lớp định tuyến chính là thứ cho phép bạn thử nghiệm quy tắc đó mà không cần thêm một hợp đồng thứ hai.

Screenshot of OrcaRouter's model page for Grok 4.6, captured 23 September 2026, showing the model id grok/grok-4.6 from provider SpaceXAI, a 500,000-token context window, text, image and file input, list pricing of $2.00 per million input tokens and $6.00 per million output tokens, and an OpenAI-compatible API served over both /v1/chat/completions and /v1/responses. Grok 4.7 itself does not appear on the catalogue.

Nơi mỗi người thuộc về

• Công việc agent khối lượng lớn, ngữ cảnh được lưu đệm — GPT-6 Sol. Dòng đầu vào được lưu đệm nghiêng về phía Sol gấp 2,5×, còn dòng khối lượng đầu ra thì còn tệ hơn thế, nghiêng về phía Grok, và chúng cộng dồn.

• Công việc lập trình khi bạn muốn mức cải thiện Terminal-Bench đã công bố mạnh nhất trong bản phát hành — Grok 4.7 là mô hình có con số đó, và nó là một con số lớn. Chỉ cần dự trù cho token, không phải tốc độ.

• Tài liệu dài trên 500.000 token — GPT-6 Sol, và không hề sát nút chút nào. Cửa sổ của Grok kết thúc đúng ở chỗ cửa sổ của Sol mới chỉ đi được nửa chặng.

• Đường dẫn nhạy cảm với độ trễ — không bên nào. Artificial Analysis liệt kê Grok 4.7 ở mức 39,2 token đầu ra mỗi giây, con số mà họ mô tả là chậm một cách đáng chú ý. Hãy kiểm tra con số tốc độ của chính Sol trên bảng hiện tại trước khi bạn cho rằng nó tốt hơn.

• Nếu bạn được cho xem một so sánh theo từng token mà kết thúc bằng “vậy Grok rẻ hơn” — nó đã dừng sớm mất một bước. Bước tiếp theo là số lượng token.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày