Một thẻ hero được tạo cho so sánh GPT-6.1 Sol với Grok 4.7, có tiêu đề 'Rẻ hơn 40% mỗi token, gấp 5,2 lần hóa đơn', cùng ba huy hiệu ghi 'Đầu ra Grok 4.7: $6.00 mỗi 1M', 'Đầu ra GPT-6.1 Sol: $10.00 mỗi 1M' và 'Token đầu ra trong lần chạy chỉ số: 67M so với 240M', và logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

GPT-6.1 Sol đấu với Grok 4.7: Tốc độ đầu ra rẻ nhất phòng, và cuộc trò chuyện đắt đỏ nhất

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Grok 4.7, sản phẩm kế nhiệm Grok 4.6 của xAI, ra mắt ngày 21 tháng 9 năm 2026 với giá 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra. GPT-6.1 Sol, bản làm mới tầm trung của OpenAI, ra mắt tám ngày sau đó vào ngày 29 tháng 9 với giá 2,00 USD đầu vào và 10,00 USD đầu ra. Mức giá đầu vào giống hệt nhau, mức giá đầu ra rẻ hơn 40% ở Grok 4.7, và đó là nơi hầu hết các so sánh dừng lại. Đó là chỗ dừng lại sai lầm, bởi vì cùng một hội đồng độc lập giờ đây đã đo lường cả hai mô hình từ đầu đến cuối: Grok 4.7 đốt khoảng 240 triệu token đầu ra khi hoàn thành Artificial Analysis Intelligence Index; GPT-6.1 Sol đốt 67 triệu. Nhân mức giá rẻ hơn với khối lượng gấp ba lần rưỡi, và mô hình có giá mỗi token thấp hơn tốn 3,74 USD cho mỗi tác vụ hoàn thành so với 0,72 USD.

Hai mô hình, cách nhau tám ngày, và một bảng giá đảo ngược

Grok 4.7 là mô hình viết mã và xử lý công việc tri thức mạnh nhất của x​AI: cửa sổ ngữ cảnh 500.000 token, tối đa 450.000 token đầu ra trong một phản hồi theo chính danh mục của nhà cung cấp, đầu vào dạng văn bản, hình ảnh và tệp, cùng mức độ lập luận có thể cấu hình theo low, medium (mặc định), high và xhigh. x​AI chưa công bố số lượng tham số, và thời điểm cắt tiền huấn luyện được báo cáo là tháng 6 năm 2026 với huấn luyện bổ sung đến tháng 8.

GPT-6.1 Sol là bản làm mới chỉ tăng một bậc của OpenAI đối với dòng GPT-6 Sol, được định vị dưới GPT-6 Astra và trên GPT-6 Luna: 1.050.000 token ngữ cảnh — gần gấp đôi của Grok — với giới hạn đầu ra 128.000 token, tức khoảng một phần ba của Grok, mốc kiến thức ngày 30 tháng 4 năm 2026, và cùng đầu vào văn bản, hình ảnh và tệp. Thang suy luận của nó chạy từ thấp đến tối đa với mặc định là trung bình, và nó không còn chấp nhận không nữa.

Mỗi chiều một dòng, cả hai mặt trên mỗi dòng:

• Đầu vào — GPT-6.1 Sol 2,00 USD mỗi 1M so với Grok 4.7 2,00 USD mỗi 1M; giống hệt nhau
• Đầu ra — GPT-6.1 Sol 10,00 USD mỗi 1M so với Grok 4.7 6,00 USD mỗi 1M; Grok rẻ hơn 40%
• Đầu vào được lưu đệm — GPT-6.1 Sol 0,10 USD mỗi 1M so với Grok 4.7 0,50 USD mỗi 1M; Sol rẻ hơn năm lần, ngược lại với điều mà dòng đầu ra ngụ ý
• Cửa sổ ngữ cảnh — 1.050.000 token so với 500.000
• Đầu ra tối đa trong một phản hồi — 128.000 token so với 450.000 được công bố
• Bậc ngữ cảnh dài — tính lại giá cho toàn bộ yêu cầu khi trên 272.000 token đầu vào với 2× đầu vào và cache và 1,5× đầu ra so với mọi mức giá đều tăng gấp đôi khi trên 200.000 token đầu vào, cũng áp dụng cho toàn bộ yêu cầu
• Mức nỗ lực suy luận — thấp, trung bình (mặc định), cao, xhigh, tối đa so với thấp, trung bình (mặc định), cao, xhigh
• Trọng số và tham số — đóng, không tiết lộ so với đóng, không tiết lộ; cả hai đều không cung cấp cho bạn checkpoint
• Chỉ số Thông minh ở mức nỗ lực tối đa được công bố — GPT-6.1 Sol 51,8 ở mức tối đa so với Grok 4.7 46,4 ở mức xhigh
• Chi phí cho mỗi tác vụ chỉ số, độc lập — 0,72 USD so với 3,74 USD
• Token đầu ra trong lần chạy chỉ số — 67 triệu so với 240 triệu, so với mức trung vị của bảng xếp hạng gần 81 triệu

Hai dòng trong danh sách đó là toàn bộ phép so sánh. Mức giá đầu ra của Grok 4.7 thực sự thấp hơn và dòng cache của nó thực sự cao gấp năm lần; và nó đã tạo ra lượng token cần đo nhiều gấp ba lần rưỡi. Bảng giá, nếu chỉ đọc riêng, chỉ về một hướng. Phép đo lại chỉ về hướng ngược lại, với hệ số năm.

A generated hero card for a GPT-6.1 Sol versus Grok 4.7 comparison, headed '40% cheaper per token, 5.2 times the bill', with two badges reading 'Grok 4.7 output: $6.00 per 1M' and 'GPT-6.1 Sol output: $10.00 per 1M', a footer reading 'Independent figures per Artificial Analysis v4.3.2; Grok at xhigh, Sol at max; AI-generated card', and the OrcaRouter logo in the bottom-right corner.

Grok 4.7 thực sự dẫn đầu ở đâu

Sẽ là không trung thực nếu đăng bài viết này như một cuộc thắng áp đảo, bởi vì Grok 4.7 giành chiến thắng trên các đánh giá thực tế. Được chấm điểm song song ở mức nỗ lực tối đa đã công bố trên Artificial Analysis v4.3.2 — Grok ở xhigh, Sol ở max, một khác biệt cấu hình đáng để ghi nhớ xuyên suốt:

• GDPval-AA v2.1 — Grok 4.7 Elo 1715,4 so với GPT-6.1 Sol Elo 1575,1. Lợi thế Elo 140 điểm trong công việc tri thức có giá trị kinh tế, và là chiến thắng độc lập đơn lẻ lớn nhất dành cho mô hình có bảng giá rẻ hơn.
• AutomationBench-AA — Grok 4.7 0,6556 so với GPT-6.1 Sol 0,6487. Thực chất là hòa, nhưng trên danh nghĩa thuộc về Grok.
• SciCode — Grok 4.7 0,5741 so với GPT-6.1 Sol 0,5417. Lợi thế 3,2 điểm về lập trình khoa học.
• Terminal-Bench 4.0 — Grok 4.7 0,2576 so với GPT-6.1 Sol 0,5606. Mức thiếu hụt 30 điểm, và là khoảng cách lớn nhất trong cặp so sánh này.
• Humanity's Last Exam — Grok 4.7 0,4314 so với GPT-6.1 Sol 0,5292.
• AA-LCR v1.1, suy luận ngữ cảnh dài — Grok 4.7 0,7667 so với GPT-6.1 Sol 0,83.
• AA-Omniscience — Grok 4.7 32,0 so với GPT-6.1 Sol 41,5.
• GDP.pdf — Grok 4.7 0,20 so với GPT-6.1 Sol 0,31.
• CritPt — Grok 4.7 0,1771 so với GPT-6.1 Sol 0,3171.

Ba trong số chín đánh giá thuộc về Grok 4.7 hoặc hòa, bao gồm cả đánh giá khó tranh cãi nhất: GDPval-AA được thiết kế để định giá công việc chuyên môn có giá trị kinh tế, và mức dẫn đầu 140 điểm Elo không phải là nhiễu. Nếu khối lượng công việc của bạn thuộc loại mà GDPval được xây dựng để đại diện — phân tích nhiều tài liệu, sản phẩm chuyên môn, các quyết định phán đoán có đáp án đúng — thì mô hình có bảng giá rẻ hơn cũng là mô hình tốt hơn trên bảng trung lập, và hình phạt chi phí trên mỗi tác vụ là cái bạn phải trả cho nó.

Các con số ra mắt của chính xAI là lớn và, giống như mọi số liệu ra mắt của nhà cung cấp, đều chưa được tái lập. CursorBench 4.0 đạt 46.3% ở mức xhigh so với 40.4% của Grok 4.6; Terminal-Bench 4.0 đạt 38.0% so với 20.3%, mức tăng được công bố lớn nhất trong một hạng mục duy nhất của bản phát hành này; DeepSWE v1.1 đạt 71.0% ở mức high so với 65.2%; EEBench đạt 64.0% so với 53.0%. Đó là khung đánh giá của xAI, cấu hình của xAI, báo cáo của xAI — và hãy lưu ý rằng con số 38.0% được công bố cho Terminal-Bench 4.0 đối chiếu với 0.2576 của bảng độc lập cho cùng mô hình trên cùng bài kiểm tra, đây chính là kiểu sai lệch mà bạn nên kỳ vọng giữa cấu hình được tinh chỉnh của một nhà cung cấp và một lần chạy nỗ lực tối đa trung lập.

Số liệu của OpenAI về GPT-6.1 Sol cũng đáng bị chiết khấu tương tự và có cùng điểm yếu. Con số duy nhất trong so sánh này mà cả hai nhà cung cấp đều không đưa ra là chi phí cho mỗi tác vụ đã hoàn thành, vì nó được tính từ mức tiêu thụ token đo được chứ không phải từ bảng điểm. Đó mới là con số còn trụ lại.

Vì sao 240 triệu token lại quyết định điều đó

Artificial Analysis mô tả tính dài dòng của Grok 4.7 trong bản tóm tắt của chính nó, và số lượng token đằng sau lần chạy chỉ số là bằng chứng: 240 triệu token đầu ra so với mức trung vị của bảng gần 81 triệu, khoảng gấp ba lần những gì một mô hình điển hình trên cùng bộ thử nghiệm tạo ra. Con số 67 triệu của GPT-6.1 Sol nằm dưới mức trung vị khá xa. Kết hợp hai tỷ lệ lại — khối lượng gấp 3,6 lần với mức giá bằng 0,6 lần — và mức giá đầu ra rẻ hơn đang mua nhiều token hơn thay vì hóa đơn nhỏ hơn, đó chính xác là những gì một mức chênh lệch chi phí trên mỗi tác vụ 3,74 đô la so với 0,72 đô la trông như thế.

Bộ nhớ đệm thay đổi độ lớn của hiệu ứng nhưng không đổi hướng của nó, và đây chính là chi tiết khiến người ta dễ nhầm. Đầu vào được lưu đệm của Grok 4.7 là $0.50 mỗi triệu token, so với $0.10 của Sol — đắt gấp năm lần trên đúng cái dòng chi phí mà những lịch sử agent dài và các system prompt lặp đi lặp lại thường trú. Vì vậy, một khối lượng công việc chủ yếu là đọc lại một tiền tố lớn, ổn định sẽ thấy hai mô hình gần nhau hơn mức mà thế $6 so với $10 hàm ý, và một khi tính thêm cả tính dài dòng của Grok, chúng lại xa nhau hơn mức mà các mức giá đầu vào gợi ý. Dòng cache và dòng token ở đây chỉ về cùng một hướng, điều này khá bất thường và khiến cặp đôi này rõ ràng hơn mức mà bảng giá ngụ ý.

Các điều khoản ngữ cảnh dài đáng được định giá riêng vì chúng kích hoạt ở những thời điểm khác nhau. GPT-6.1 Sol định giá lại toàn bộ một yêu cầu khi vượt 272.000 token đầu vào; Grok 4.7 cũng làm điều tương tự khi vượt 200.000. Với một lượt gọi 250.000 token, Grok đã tăng gấp đôi — 4,00 USD và 12,00 USD, cộng thêm 1,00 USD cho việc đọc bộ đệm — trong khi Sol vẫn giữ mức tiêu chuẩn là 2,00 USD và 10,00 USD. Trong khoảng từ 200.000 đến 272.000 token, mô hình có bảng giá rẻ hơn lại chính là mô hình đắt hơn với khoảng cách lớn, và dải này rất phổ biến trong công việc xử lý tài liệu.

Điểm mà Grok thực sự thắng về cấu trúc chứ không phải về điểm số chính là trần đầu ra. Phản hồi tối đa 450.000 token so với 128.000 của Sol là một đẳng cấp tạo tác khác hẳn: toàn bộ một cơ sở mã được tạo ra, một bản ghi dài, một bản tổng hợp dài cỡ một cuốn sách chỉ trong một lần gọi. Nếu hôm nay bạn đang chạm trần đầu ra, thì dòng đó quyết định sự so sánh và không có gì trong phép tính chi phí ở trên còn áp dụng — bạn không thể mua một năng lực mà mô hình kia không có, dù với bất kỳ mức giá nào.

Cả hai đều nằm trên cùng một phím, đó chính là điểm hữu ích.

Grok 4.7 có mặt trên OrcaRouter đúng theo giá niêm yết của xAI — $2,00 và $6,00 mỗi triệu token, với $0,50 cho lượt đọc từ bộ nhớ đệm và mức bước 200.000 token lên $4,00 và $12,00 được chuyển nguyên vẹn đúng như xAI niêm yết — còn GPT-6.1 Sol đã lên các tuyến của chúng tôi ngay trong ngày ra mắt với mức giá của OpenAI, $2,00 và $10,00, đầu vào lưu đệm ở mức $0,10 và bước 272.000 token giữ nguyên không đổi. Không có khoản nào được cộng thêm vào cả hai: nền tảng chuyển nguyên giá niêm yết của nhà cung cấp thay vì đội giá lên, nghĩa là một đợt giảm giá từ nhà cung cấp ở bất kỳ bên nào cũng có hiệu lực ở đây cùng ngày với khi nó có hiệu lực ở đó, không có hóa đơn thứ hai và không có nhà bán lại nào chen giữa.

A screenshot of the OrcaRouter model page for grok/grok-4.7, showing the listing dated 2026-09-21, the model described as SpaceXAI's flagship for coding, agentic tasks and knowledge work, a 500K-token context with up to 450K output tokens, text, image and file input, and the list price of $2.00 input and $6.00 output per million tokens with a 4.03 s median time to first token.

Với cặp mô hình cụ thể này, điều đó đáng giá hơn cả sự tiện lợi. Hai mô hình không đồng thuận về việc chúng giỏi ở điểm nào — Grok 4.7 dẫn đầu về Elo cho công việc chuyên môn và về lập trình khoa học, GPT-6.1 Sol dẫn đầu về thực thi trên terminal, độ tin cậy thực tế và truy xuất ngữ cảnh dài — và ranh giới giữa những loại khối lượng công việc đó hiện rõ trong lưu lượng của chính bạn trước khi nó hiện rõ trong một bài đánh giá chuẩn. Việc gửi các yêu cầu có dạng GDPval về một hướng và các lượt chạy agent tầm dài hạn về hướng kia, phía sau một endpoint duy nhất, với cơ chế chuyển đổi dự phòng tự động trên cả hai và một quy tắc định tuyến mà bạn thay đổi trong cấu hình thay vì trong một lần triển khai, là cách rẻ hơn để tìm ra ranh giới đó so với một dự án đánh giá. Hợp nhất mô hình, trong đó một nhóm mô hình cùng trả lời, là lựa chọn khác mà nền tảng cung cấp nếu bạn không muốn chọn theo từng yêu cầu.

A screenshot of xAI's Grok 4.7 developer documentation, showing the model ID grok-4.7, the description 'SpaceXAI's frontier model for coding, agentic tasks, and knowledge work', text and image to text modalities, a 500,000-token context window, and pricing of $2.00 per 1M input tokens and $6.00 per 1M output tokens.

Cuộc gọi

• Công việc agentic và terminal với đầu ra dài, vòng lặp prefix được lưu đệm — GPT-6.1 Sol. Ba mươi điểm trên Terminal-Bench 4.0, một dòng cache rẻ hơn năm lần và bằng một phần năm chi phí cho mỗi tác vụ hoàn thành.
• Công việc tri thức chuyên môn, phân tích tài liệu, tác vụ phán đoán — Grok 4.7 nhờ lợi thế dẫn trước 140 điểm Elo trên GDPval-AA, với hóa đơn token được dự trù thay vì giả định.
• Lập trình khoa học — Grok 4.7, với cách biệt sít sao, trên phân mục SciCode của bảng xếp hạng. Hãy đối chiếu nó với bộ kiểm thử của riêng bạn; 3,2 điểm nằm trong khoảng mà một bộ prompt khác có thể dịch chuyển.
• Phản hồi đơn lẻ trên 128.000 token đầu ra — Grok 4.7, và không có phép toán nào có thể thay thế điều đó.
• Yêu cầu trong khoảng 200.000 đến 272.000 token đầu vào — GPT-6.1 Sol, vì Grok 4.7 đã nhân đôi toàn bộ yêu cầu của nó còn Sol thì chưa.
• Cuộc hội thoại rẻ nhất có thể — không mô hình nào trong hai mô hình này. Cả hai đều là mô hình có mức giá tiên phong với mức tiêu thụ token tiên phong; so sánh là để xem mô hình nào hoàn thành tác vụ của bạn, chứ không phải mô hình nào rẻ trên lý thuyết.
• Nếu một so sánh kết thúc bằng câu "Grok rẻ hơn trên mỗi token" — thì nó đã kết thúc sớm một bước. Bước tiếp theo là số lượng token, và con số đó là 240 triệu so với 67.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày