Thẻ tiêu đề hero cho một bài viết so sánh GPT-6 Sol Pro với Grok 4.7, với dòng chữ 'GPT-6 Sol Pro so với Grok 4.7' và phụ đề 'Dài dòng gấp đôi, giá chỉ bằng một phần ba'.
Guides & Insights

GPT-6 Sol Pro so với Grok 4.7: Độ dài dòng gấp đôi, giá chỉ bằng một phần ba

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình rẻ nhất nằm sát biên tiên tiến của tháng 9 năm 2026 ra mắt cách nhau một ngày, và điều thú vị ở chúng không phải là mô hình nào thông minh hơn. GPT-6 Sol — mô hình mà người ta tìm đến khi họ tìm kiếm GPT-6 Sol Pro, tức là mô hình đó với reasoning.mode được đặt thành pro chứ không phải một sản phẩm riêng — đã ra mắt vào ngày 22 tháng 9 năm 2026 với mức $2,00 mỗi triệu token đầu vào và $10,00 mỗi triệu token đầu ra. Grok 4.7 từ nhà cung cấp đã ra mắt vào ngày 21 tháng 9 với cùng mức $2,00 đầu vào và $6,00 đầu ra. Trên bộ kiểm thử trung lập của Artificial Analysis, hai mô hình cách nhau hai điểm chỉ số và chênh nhau khoảng hai đô la cho mỗi tác vụ hoàn thành, và lý do cho khoảng cách đó không phải là năng lực. Đó là việc mỗi mô hình đốt bao nhiêu token để đạt tới đó.

Sol đã tạo ra 77 triệu token đầu ra khi chạy Intelligence Index. Grok 4.7 tạo ra 240 triệu. Tỷ lệ đó — hơn ba trên một một chút — chính là toàn bộ phép so sánh, và nó đảo ngược kết luận mà một bảng giá theo token đưa ra cho bạn.

Hai bảng giá, và chỗ mà cái rẻ không hề rẻ

Cả hai nhà cung cấp đều tự công bố những con số này; không bên nào được định giá lại một cách độc lập.

• Đầu vào — GPT-6 Sol $2.00 mỗi triệu token so với Grok 4.7 $2.00 mỗi triệu token

• Đầu ra — GPT-6 Sol $10,00 mỗi triệu token so với Grok 4.7 $6,00 mỗi triệu token

• Đầu vào đã lưu trong bộ nhớ đệm — GPT-6 Sol $0,20 mỗi triệu token so với Grok 4.7 $0,50 mỗi triệu token; chi phí đọc bộ nhớ đệm của Sol rẻ hơn 2,5 lần, điều này ngược lại với những gì mức giá đầu ra được nhấn mạnh gợi ý

• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Grok 4.7 500.000 token

• Phụ phí ngữ cảnh dài — GPT-6 Sol định giá lại một yêu cầu trên 272.000 token đầu vào ở mức 2× đối với giá đầu vào và bộ nhớ đệm, và 1.5× đối với đầu ra cho toàn bộ yêu cầu, so với Grok 4.7 tăng gấp đôi mọi mức giá tại 200.000 token đầu vào, cũng cho toàn bộ yêu cầu

• Mốc kiến thức — GPT-6 Sol ngày 20 tháng 4 năm 2026 so với Grok 4.7, mốc cắt tiền huấn luyện được báo cáo là tháng 6 năm 2026 với huấn luyện bổ sung kéo dài đến tháng 8

• Mức độ suy luận — GPT-6 Sol: không, thấp, trung bình (mặc định), cao, xhigh, tối đa so với Grok 4.7: thấp, trung bình (mặc định), cao, xhigh

• Phương thức — cả hai đều nhận đầu vào là văn bản và hình ảnh, đồng thời trả về văn bản

Dòng đọc từ cache là dòng mà người mua nên ngẫm kỹ. Mức giá đầu ra của Grok 4.7 thấp hơn 40%, nhưng đầu vào được cache của nó lại cao hơn 150%, và đầu vào được cache chính là nơi lịch sử agent dài cùng các system prompt lặp lại nằm ở đó. Một khối lượng công việc chủ yếu đọc lại một ngữ cảnh lớn, ổn định sẽ thấy hai mô hình gần nhau hơn nhiều so với điều mà $6 so với $10 hàm ý.

A six-row scoreboard card titled 'GPT-6 Sol Pro vs Grok 4.7 - the scoreboard', comparing output price, cached input, context window, index tokens, AA Intelligence Index and cost per task. GPT-6 Sol Pro is listed at $10.00 output and $0.20 cached input per million tokens, a 1,050,000-token context, 77M index tokens, an AA Index of 48 and $1.06 per task; Grok 4.7 at $6.00 output and $0.50 cached input, a 500,000-token context, 240M index tokens, an AA Index of 46 and $3.74 per task. A footer reads 'Vendor list prices; index and cost figures per Artificial Analysis.'

Hồ sơ độc lập, và con số duy nhất quyết định nó

Artificial Analysis là bộ khung duy nhất đã đo lường cả hai mô hình, và các con số của nó đáng để đặt cạnh nhau vì sự khác biệt này rất đáng chú ý.

• Chỉ số Thông minh — GPT-6 Sol 48 ở mức nỗ lực tối đa so với Grok 4.7 46 ở xhigh; cả hai đều cao hơn hẳn mức trung vị 25 của các mô hình tương đương

• Chi phí mỗi tác vụ lập chỉ mục — GPT-6 Sol $1.06 so với Grok 4.7 $3.74

• Token đầu ra cho lần chạy chỉ mục — GPT-6 Sol 77M so với Grok 4.7 240M, trong khi trung vị là 88M

• Tốc độ xuất — Grok 4.7 đo được 39 token mỗi giây, mức mà chính giàn đánh giá gọi là đặc biệt chậm; con số của Sol trên cùng bảng xếp hạng đó không được công bố trong cùng dòng tóm tắt

• Chỉ số Tác nhân Lập trình — GPT-6 Sol 57 ở mức $2.99 mỗi tác vụ so với Grok 4.7 56 cùng bộ khung Grok Build do chính hãng phát triển, tăng chín điểm so với Grok 4.6

Hai điểm khác biệt về chỉ số, chi phí mỗi tác vụ gấp ba lần rưỡi. Đó không phải là một bất thường về định giá — mà là phép toán của sự dài dòng. Grok 4.7 là một mô hình suy nghĩ thành tiếng một cách dài dòng; bộ khung đánh giá gắn cờ nó là "rất dài dòng" so với mức trung vị 88M token, và chi phí bám theo số token, chứ không phải theo bảng giá.

So sánh coding-agent đi kèm một lưu ý mà bảng điểm che giấu. Điểm 56 của Grok 4.7 được đo bên trong harness Grok Build của chính xAI, tức cấu hình mà xAI phát hành và lấy làm chuẩn để đánh giá. Điểm 57 của Sol được đo trong một harness trung lập. Lợi thế một-hai điểm đến từ harness do chính hãng cung cấp nằm hoàn toàn trong phạm vi mà việc chọn harness có thể giải thích, nghĩa là cách hiểu trung thực là hai mô hình này ngang nhau về agentic coding — chứ không phải Sol hơn một điểm.

Screenshot of the Artificial Analysis model page for Grok 4.7 (xhigh), captured 23 September 2026, showing list pricing of $2.00 per million input tokens and $6.00 per million output tokens with a 75% cache discount, an Intelligence Index score of 46, a cost per Intelligence Index task of $3.74, 240 million output tokens generated during the index run, a 500,000-token context window, and a measured output speed of 39 tokens per second that the page labels notably slow.

Những gì mỗi nhà cung cấp tuyên bố, và những gì cả hai đều chưa chứng minh

Tài liệu ra mắt của xAI rất cụ thể và đây là một câu chuyện dài hạn: Grok 4.7 được xây dựng trên một mô hình nền tảng lớn hơn Grok 4.6 và được cho chạy quá trình học tăng cường lâu hơn, hướng đến những tác vụ "có thể mất hàng giờ để hoàn thành", từ đó rèn giũa khả năng tự xác minh, xử lý ngữ cảnh dài và hành vi bên trong môi trường Grok Bot. Các con số do nhà cung cấp báo cáo bao gồm Terminal-Bench 4.0 đạt 38,0% so với 20,3% của Grok 4.6, CursorBench 4.0 đạt 46,3% và DeepSWE v1.1 đạt 71,0%. Mỗi con số trong đó đều là đo lường của chính xAI và không có con số nào được tái lập một cách độc lập; con số Terminal-Bench 4.0 độc lập đang được lưu truyền thấp hơn đáng kể so với con số của nhà cung cấp, đúng như hình thái thường thấy của khoảng cách đó.

Các tuyên bố của OpenAI về GPT-6 Sol là những tuyên bố đã được đề cập ở trên, và chúng mang cùng nhãn. Các số liệu do nhà cung cấp báo cáo là 33,2% trên AutomationBench ở mức nỗ lực xhigh, so với 26,9% của Claude Opus 5 ở mức max, với chi phí mỗi tác vụ chỉ khoảng 9%, và 68,8% trên DeepSWE v1.1 ở mức nỗ lực max — chỉ kém 1,1 điểm so với Claude Fable 5 ở mức xhigh, với chi phí mỗi tác vụ thấp hơn khoảng 80%. Lưu ý đối tượng so sánh: các biểu đồ của chính OpenAI đặt Sol so với các mô hình của Anthropic, không phải với Grok 4.7. Không nhà cung cấp nào đã công bố so sánh đối đầu trực tiếp với bên kia.

Screenshot of OpenAI's developer model page for GPT-6 Sol, captured 23 September 2026, showing the model id gpt-6-sol as the default snapshot, a 1,050,000-token context window with 128,000 maximum output tokens, an April 20, 2026 knowledge cutoff, text and image input with text output, and Standard pricing of $2.00 input, $0.20 cached input, $2.50 cache writes and $10.00 output per million tokens. No pro model id appears on the page.

Nơi lớp định tuyến khẳng định được vị trí của mình

OrcaRouter không cung cấp cả hai mô hình trong cặp đối đầu này — Grok 4.7 và GPT-6 Sol đều không có trong danh mục của chúng tôi, nên không có gì ở đây là tuyên bố về mức giá của chúng qua chúng tôi. Điều mà một lớp định tuyến đáng giá trong cặp kết hợp cụ thể này là chế độ thất bại chứ không phải bảng giá. Lý do để tìm đến Grok 4.7 là hành vi tác tử theo tầm xa của nó; lý do để không tìm đến nó là tốc độ đầu ra 39 token mỗi giây khiến một tác tử chạy lâu trở nên chậm đến mức đáng kể, và một lượt chạy chậm là một lượt chạy có thể bị hết thời gian. Tự động chuyển đổi dự phòng giữa các nhà cung cấp nghĩa là một tác vụ dài có thể được định tuyến đến bất kỳ mô hình nào thực sự sẵn có mà không biến tốc độ đó thành một điểm lỗi đơn lẻ, và DSL định tuyến diễn đạt lựa chọn mô hình như một quy tắc bên trong lệnh gọi thay vì như một cuộc di trú — điều này quan trọng ở đây, bởi vì câu trả lời đúng cho cặp này phụ thuộc vào việc tác vụ ngốn token hay nhạy cảm với độ trễ, và đó là thuộc tính của yêu cầu, chứ không phải của quý.

Quy tắc quyết định

• Lập trình agentic với ngân sách cố định — GPT-6 Sol. Khả năng ngang tầm trên chỉ số lập trình trung lập, với chi phí mỗi tác vụ chỉ khoảng một phần ba, vì nó đạt được mức đó chỉ với một phần ba lượng token.

• Các tác vụ tầm xa, nơi độ dài lần chạy chính là điểm mấu chốt — Grok 4.7. Bản phát hành này được huấn luyện riêng cho công việc kéo dài nhiều giờ, và các con số của nhà cung cấp trên SWE-Marathon và CursorBench đi đúng theo hướng đó.

• Khối lượng nhạy cảm với độ trễ — không bên nào, dựa trên dữ liệu hiện có. Chi phí mỗi tác vụ của Sol là con số tốt hơn, nhưng 39 token mỗi giây đo được của Grok 4.7 là một hạn chế thực sự đối với bất kỳ thứ gì mang tính tương tác.

• Các tác vụ ngữ cảnh dài chủ yếu được lưu đệm — GPT-6 Sol, tính theo mục đọc bộ đệm thay vì mục đầu ra. Ở mức $0,20 so với $0,50 mỗi triệu token được lưu đệm, và với cửa sổ lớn gấp đôi, lập luận càng mạnh khi càng nhiều phần trong prompt của bạn ổn định.

• Nếu bảng so sánh của bạn được xây dựng từ bảng giá theo token — hãy xây dựng lại từ chi phí trên mỗi tác vụ. $6,00 so với $10,00 cho đầu ra là cặp số kém thông tin nhất trong bài viết này, và đó là cặp số mà mọi trang hiện có đều mở đầu bằng.

So sánh trong bài viết này2

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày