
GPT-6 so với Grok 4.7: Cột Đầu Ra Quyết Định
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 127 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 68 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 54 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 361 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 233 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
GPT-6 Sol và Grok 4.7tính cùng một mức giá cho token đầu vào — $2.00 mỗi triệu, cả hai — khiến cột đầu vào trở nên vô dụng khi phải chọn giữa chúng. Quyết định nằm ở cột ngay bên phải. GPT-6 Sol tính $10.00 mỗi triệu token đầu ra; Grok 4.7 tính $6.00. Và hai mô hình bất đồng với nhau về lượng đầu ra mà bạn được phép tạo trong một lần gọi, gấp ba lần rưỡi: GPT-6 Sol giới hạn ở 128.000 token, trong khi Grok 4.7 — mẫu chủ lực của SpaceXAI, ra mắt ngày 21 tháng 9 năm 2026 với tư cách là kế nhiệm của Grok 4.6 — lên tới 450.000.
Mọi thứ khác trong màn đối đầu này đều suy ra từ hai sự thật đó, cộng thêm một điều nữa: GPT-6 Sol có cửa sổ ngữ cảnh lớn hơn, 1.050.000 so với 500.000 của Grok 4.7. Vậy nên đây không phải là câu chuyện về việc một mô hình tốt hơn. Đây là câu chuyện về hai mô hình có hình dạng khác nhau, và về việc khối lượng công việc của bạn có hình dạng nào.
Hãy xác định đúng dạng thức yêu cầu của bạn trước tiên.
Cách hữu ích để phân định lựa chọn giữa GPT-6 và Grok 4.7 là dựa vào việc công việc của bạn thực sự tiêu tốn tài nguyên nào. Ba trường hợp bao quát phần lớn lưu lượng production.
Đầu vào dài, đầu ra ngắn. Bạn đang nạp vào một tài liệu lớn, một cơ sở mã, hoặc một bản ghi dài của tác nhân và nhận về một bản tóm tắt, một bản diff, hoặc một quyết định. Ở đây cửa sổ ngữ cảnh chính là ràng buộc then chốt, và 1.050.000 token của GPT-6 Sol gần gấp đôi con số 500.000 của Grok 4.7. Nhưng hãy để ý dòng phân bậc trên cả hai thẻ: mức 2,00 đô la của Grok 4.7 áp dụng cho tới 200.000 token đầu vào rồi nhảy lên 4,00 đô la khi vượt ngưỡng đó, trong khi mức 2,00 đô la của GPT-6 Sol kéo dài tới 272.000 và nhảy lên 4,00 đô la sau đó. Ở 200.001 token, Grok đã bị đổi giá còn GPT-6 Sol thì chưa, nên một tài liệu 250.000 token tốn 4,00 đô la mỗi triệu trên Grok 4.7 và 2,00 đô la mỗi triệu trên GPT-6 Sol — gấp đôi, trước cả khi bạn tính đến đầu ra.
Đầu vào ngắn, đầu ra dài. Bạn đang tạo: một tài liệu dài, một tệp mã lớn, một artifact có cấu trúc, hoặc một chuỗi lệnh gọi công cụ mà mô hình phải viết ra kết quả. Đây chính là trường hợp mà Grok 4.7 được xây dựng để xử lý. Giới hạn đầu ra 450.000 token vượt xa mức mà hầu hết các mô hình cho phép tới hơn một bậc độ lớn, và với mức 6,00 đô la cho mỗi triệu token đầu ra so với 10,00 đô la, bạn đang trả ít hơn 40% cho mỗi token trong số đó. Nếu quá trình tạo của bạn thường xuyên vượt quá 128.000 token đầu ra, GPT-6 Sol hoàn toàn không thể phục vụ yêu cầu trong một lệnh gọi, còn Grok 4.7 thì có thể.
Cân bằng và nặng ở cả hai. Đầu vào dài và đầu ra dài cùng nhau là trường hợp mà hai thẻ tương tác với nhau. Một đầu vào 400.000 token với đầu ra 200.000 token được định giá là $4.00 cho đầu vào và $12.00 cho đầu ra trên Grok 4.7 (cả hai đều trên ngưỡng của nó) và $4.00 cho đầu vào và $15.00 cho đầu ra trên GPT-6 Sol. Đó là cấu hình duy nhất mà GPT-6 Sol là mô hình đắt hơn trên mỗi token, và đáng để kiểm tra mức trung bình của riêng bạn so với nó trước khi cho rằng mặc định thời ChatGPT là rẻ hơn.
OpenAI đã thay đổi điều gì và tại sao điều đó lại quan trọng ở đây
GPT-6 là một dòng gồm ba mô hình, và vào ngày 7 tháng 10 năm 2026, OpenAI đã đưa mô hình ở giữa ra trước công chúng. GPT-6 trong ChatGPT — đợt triển khai Intelligent UI — được vận hành bởi GPT-6 Sol dành cho Plus, Pro, Business và Enterprise, và bởi GPT-6 Luna dành cho Free và Go, tiếp cận hơn 1,2 tỷ người dùng ChatGPT hàng tuần. Đó là một sự thật về phân phối chứ không phải về năng lực, và nó thay đổi ý nghĩa của “GPT-6” trong một so sánh: khi ai đó nói GPT-6 đã đánh bại hoặc thua một mô hình khác trên một benchmark nào đó, họ thường ám chỉ cụ thể GPT-6 Sol, hoặc mô hình chủ lực GPT-6 Astra ở mức $10.00 / $50.00.
Đối với cuộc đối đầu này, việc triển khai ChatGPT có ý nghĩa theo một cách cụ thể. Grok 4.7 được phát hành vào ngày 21 tháng 9 năm 2026, bốn ngày trước GPT-6 Sol, và nó là một mô hình API và ứng dụng thuần túy, không có sản phẩm mặc định tiêu dùng tương đương dành cho hàng tỷ người dùng. Mô tả của chính SpaceXAI về nó rất hẹp và cụ thể: một mẫu hàng đầu cho kỹ thuật phần mềm chạy dài, các luồng công việc tác tử với sử dụng công cụ và tự xác minh, cùng công việc tri thức. Đó là một tuyên bố về công việc nặng về đầu ra, đúng chính xác là dạng mà lá bài của Grok mạnh hơn.
Bảng điểm, được dán nhãn trung thực
Đánh giá độc lập về hai thứ này đến từ Artificial Analysis, và tóm tắt là chúng gần nhau trên chỉ số tổng hợp và khác biệt trên các bài kiểm tra riêng lẻ theo cách phù hợp với các sản phẩm.
• Chỉ số AA Intelligence: Grok 4.7 46,4 (xếp hạng 16 trong số các mô hình mà nó đánh giá), GPT-6 Sol 47,6 — GPT-6 Sol dẫn trước khoảng một điểm
• Humanity's Last Exam: Grok 4.7 43,1%, GPT-6 Sol 47,9%
• SciCode: Grok 4.7 57,4%, GPT-6 Sol 57,6% — gần như ngang bằng
• Khả năng truy hồi ngữ cảnh dài: Grok 4.7 76,7%, GPT-6 Sol 83,7% — GPT-6 Sol dẫn trước, phù hợp với cửa sổ lớn hơn
• Terminal-Bench (v4.0 trên model card của Grok): Grok 4.7 25,8%, GPT-6 Sol 43,9% trên cùng họ hệ thống đánh giá
• Lập trình: Grok 4.7 nằm trong nhóm 10% dẫn đầu của chỉ số lập trình, sánh vai cùng những mô hình mạnh nhất trên bảng
Hai lưu ý, và chúng không phải để trang trí. Giá trị chỉ số của hai mô hình được đánh giá vào các ngày khác nhau, nên đây không phải là cuộc so sánh trực tiếp cùng ngày, và một điểm khác biệt nằm trong mức dao động mà một lần bản sửa đổi tạo ra. Và mọi con số Grok 4.7 ở trên đều là số do chính nhà cung cấp công bố như được ghi trong danh mục, không phải điểm số do chúng tôi chạy lại — cách diễn giải trung thực là Grok 4.7 là một mô hình lập trình thuộc nhóm 10% dẫn đầu, xếp sau GPT-6 Sol khoảng một điểm trên một tổng hợp suy luận tổng quát, và khoảng cách terminal-bench là tín hiệu đơn lẻ lớn nhất trong bộ này.

Độ trễ và độ tin cậy, những điều mà bảng thông số kỹ thuật che giấu
Bảng giá công bố và bảng điểm chuẩn đều bỏ qua yếu tố quyết định chất lượng dịch vụ khi vận hành thực tế, nên đáng để xem xét những con số đo lường được thay vì những con số tiếp thị.
Dựa trên các đo lường trên playground của chính OrcaRouter trong tuần đầu tiên của tháng 10 năm 2026, Grok 4.7 có độ trễ trung vị cho token đầu tiên là 3.825 ms và tạo đầu ra với tốc độ khoảng 147 token mỗi giây, cùng tỷ lệ lỗi khoảng 8%. Độ trễ trung vị đo được của GPT-6 Sol trong cùng khoảng thời gian cao hơn — 6.363 ms — với tỷ lệ lỗi cao hơn nhiều. Đây là những quan sát trên playground đối với một route dùng chung, không phải SLA của nhà cung cấp, và tỷ lệ lỗi 39% trên route của một model là vấn đề định tuyến chứ không phải vấn đề của model; đó chính xác là kiểu khoảng cách mà failover tồn tại để bù đắp. Điểm cần rút ra cho một phép so sánh là route Grok 4.7 trông phản hồi nhanh hơn và đáng tin cậy hơn một cách đáng kể so với route GPT-6 Sol trong khoảng thời gian cụ thể đó, và rằng card công bố của cả hai nhà cung cấp đều sẽ không cho bạn biết điều này.
Chạy cả hai mà không cam kết với bên nào
Sự cám dỗ trong một cuộc so tài sát sao đến vậy là chọn trước một bên dựa trên giá, rồi ba tháng sau phát hiện ra rằng hình thái lưu lượng truy cập của bạn đã thay đổi. Đó chính là vấn đề mà định tuyến giải quyết. Trên OrcaRouter, cả grok/grok-4.7 và GPT-6 Sol đều là các route đang hoạt động trong cùng một danh mục phía sau một API duy nhất, với mức giá niêm yết của nhà cung cấp và 0% markup — vì vậy khi SpaceXAI hoặc OpenAI thay đổi mức giá, thay đổi đó sẽ có hiệu lực ngay trong cùng ngày thay vì phải chờ đến lần đối chiếu hóa đơn tiếp theo của bạn. Tự động chuyển đổi dự phòng giữa các nhà cung cấp sẽ bao quát trường hợp một route bị suy giảm, điều này đặc biệt liên quan khi xét đến mức chênh lệch tỷ lệ lỗi nêu trên. Và DSL định tuyến cho phép bạn chia lưu lượng theo hình dạng yêu cầu thay vì theo sở thích mô hình: gửi các tác vụ đầu vào dài, đầu ra ngắn đến mô hình có cửa sổ lớn hơn, gửi việc tạo đầu ra dài đến mô hình có giới hạn 450K và mức giá đầu ra rẻ hơn, và để một vị từ dựa trên kích thước yêu cầu thực hiện việc lựa chọn thay vì con người.
Chọn
Nếu công việc của bạn là phân tích tài liệu dài, suy luận ngữ cảnh lớn, hay bất cứ thứ gì nằm trên 200.000 token đầu vào, GPT-6 Sol là lựa chọn tốt hơn: gấp đôi ngữ cảnh, chỉ số độc lập cao hơn, và ngưỡng nằm xa hơn 72.000 token. Nếu công việc của bạn là tạo sinh — tạo tác mã dài, viết dài, chuỗi gọi công cụ dài nơi mô hình phải viết ra những gì nó tìm thấy — Grok 4.7 là lựa chọn tốt hơn: trần đầu ra 450.000 token mà GPT-6 Sol không thể đạt tới, token đầu ra rẻ hơn 40%, và hồ sơ lập trình thuộc nhóm 10% dẫn đầu để tương xứng. Nếu bạn thực sự làm cả hai, câu trả lời không phải là một mô hình. Đó là một định tuyến.


So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
