
Gemini 4 Argon vs GPT-6 Sol: Giá bằng một phần năm, hóa đơn gấp bốn lần
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 219 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Chạy bộ chỉ số Artificial Analysis trên Gemini 4 Argon và nó tính phí $2,407. Chạy cùng bộ chỉ số đó trên GPT-6 Sol và nó tính phí $1,546. Cùng chỉ số, cùng tác vụ, cùng tuần. Hai mô hình có giá niêm yết giống hệt nhau — $2.00 mỗi triệu token đầu vào và $10.00 mỗi triệu token đầu ra, Argon là mức giá giới thiệu được Google công bố còn Sol là mức giá tiêu chuẩn của OpenAI — vậy mà chi phí hoàn tất để làm công việc giống hệt nhau lại chênh lệch 56%, nghiêng về mô hình có điểm thấp hơn năm điểm. Khoảng cách đó chính là toàn bộ lý do khiến so sánh này đáng để viết, và nó chẳng liên quan gì đến bảng giá.
Google công bố Gemini 4 Argon vào ngày 30/09/2026, gọi đó là kỷ nguyên tiếp theo của trí tuệ tiên phong, với mức giá 2 USD đầu vào và 10 USD đầu ra, cùng mức giảm 95% cho đầu vào được lưu đệm, triển khai tới các chuyên gia phòng thủ an ninh mạng đáng tin cậy thông qua Fairwind Program. GPT-6 Sol đã được phát hành rộng rãi kể từ ngày 22/09/2026, khi OpenAI tung ra phiên bản tầm trung của dòng GPT-6 với giá 2 USD đầu vào và 10 USD đầu ra, kèm mức chiết khấu bộ đệm 90%. Một cái có thể mua ngay hôm nay trên điểm cuối tương thích OpenAI, còn cái kia thì không ai ngoài một nhóm được nêu tên có thể mua được, và đó chính là ngã rẽ thực tế trong bài viết này. Nhưng sự đảo ngược chi phí ở trên vẫn đúng ngay cả khi bạn gạt hoàn toàn chuyện tính sẵn có sang một bên, và hiểu được vì sao mới là phần hữu ích.
Sự đảo ngược, nói một cách đơn giản
Artificial Analysis công bố cả một Intelligence Index và một bản hạch toán về chi phí vận hành chỉ số đó. Đọc cùng nhau, chúng cho thấy điều này:
• Chỉ số Intelligence — Gemini 4 Argon 52,6 so với GPT-6 Sol 47,5. Khoảng cách năm điểm, được đo khi Argon được đặt ở thiết lập high effort và Sol ở mức tối đa, nên phép so sánh này có lợi cho Sol hơn là cho Argon.
• Giá niêm yết trên mỗi triệu token — hoàn toàn giống nhau. $2.00 đầu vào / $10.00 đầu ra ở cả hai. Đọc bộ nhớ đệm là điểm khác biệt duy nhất: $0.10 trên Argon, $0.20 trên Sol.
• Chi phí cho mỗi tác vụ lập chỉ mục — Gemini 4 Argon $1.99 so với GPT-6 Sol $1.05. Argon tốn chi phí gấp đôi cho mỗi tác vụ mặc dù có cùng mức giá trên mỗi token.
• Chi phí chạy toàn bộ bộ kiểm thử — Gemini 4 Argon $2,407 so với GPT-6 Sol $1,546.
• Tốc độ xuất đo được — GPT-6 Sol đạt 77,0 token mỗi giây so với 48,9 của Gemini 4 Argon, mức chênh lệch 1,6 lần thể hiện ở cả độ trễ lẫn chi phí.
Có một dòng trong danh sách đó giải thích tất cả những dòng còn lại, và đó không phải là giá. Đó là số lượng token. Trong chính các tác vụ của chỉ số, Gemini 4 Argon tạo ra khoảng 561.000 token đầu ra mỗi tác vụ; GPT-6 Sol tạo ra khoảng 282.000. Argon suy nghĩ lâu gấp đôi để trả lời cùng một câu hỏi, và với mức giá trên mỗi token như nhau, thì hóa đơn đúng gấp đôi.

Tại sao các token lại là mức giá
Đây là điểm chỉnh sửa đáng để khắc cốt ghi tâm trước khi bất kỳ ai lập ngân sách cho một cuộc chuyển đổi, bởi trực giác đang đi sai hướng. Khi một mô hình được định giá ngang bằng với đối thủ và tiêu thụ gấp đôi token đầu ra để hoàn tất, thì giá trên mỗi token không phải là cái giá. Cái giá là giá trên mỗi token nhân với số token mà mô hình quyết định chi ra, và yếu tố thứ hai đó là thuộc tính của mô hình, không phải bảng giá.
Biên lợi nhuận theo từng tác vụ thay đổi cực kỳ lớn, điều đó càng làm mọi thứ tệ hơn — bạn không thể áp một hệ số nhân cố định rồi đi tiếp:
• Terminal-Bench 4.0 — Argon 165.330 token đầu ra mỗi tác vụ, so với 97.372 của Sol. Argon tốn 6,78 USD mỗi tác vụ, so với 4,00 USD của Sol, dù Argon đạt 57,1% so với 43,9% của Sol.
• CritPt — Argon 109.533 token so với 31.848 của Sol. Tỷ lệ token 3,4× trong một tác vụ mà Sol thực ra đạt điểm cao hơn, 30,9% so với 27,1%.
• GDPval — Argon 74.571 token so với 41.567 của Sol, với chi phí 1,82 đô-la mỗi tác vụ so với 1,32 đô-la.
• Omniscience — tỷ lệ token 938 so với 2.662, Argonchiếm ưu thế, ở mức $0.010 mỗi tác vụ so với $0.027 của Sol. Nhóm tác vụ duy nhất mà chiều hướng đảo ngược.
• Suy luận ngữ cảnh dài — Argon 2.197 token so với 954 của Sol, và là tác vụ duy nhất trong bộ mà Sol thắng rõ ràng về điểm số, 83,7% so với 79,7%.
CritPt là trường hợp mang tính chỉ dẫn. Một mô hình đốt số token gấp ba lần rưỡi để tạo ra câu trả lời hơi tệ hơn cho cùng một câu hỏi không phải là câu chuyện về năng lực; đó là câu chuyện về thói quen chi tiêu. Suy luận của Argon kéo dài, và ở một số dạng tác vụ, độ dài đó chuyển thành điểm số, còn ở những dạng khác, nó chỉ đơn thuần chuyển thành đô la. Chỉ số 52.6 của index và 47.5 của Sol là giá trị tổng hợp, và các giá trị tổng hợp che giấu đúng điều này.
Năm điểm thực sự đến từ đâu
Vì khoảng cách chỉ số và khoảng cách chi phí đi theo hai hướng ngược nhau, nên cần biết những nhiệm vụ nào thúc đẩy từng khoảng cách.
• Terminal-Bench 4.0 — Gemini 4 Argon 57,1% so với GPT-6 Sol 43,9%. Chiến thắng đơn lẻ lớn nhất của Argon, và là họ nhiệm vụ gần nhất với lập trình tác tử tầm xa.
• Toàn tri — Gemini 4 Argon 42,4 so với GPT-6 Sol 27,1. Chênh lệch mười lăm điểm về độ phủ dữ kiện, khoảng cách theo tỷ lệ lớn nhất trong bộ đánh giá.
• AutomationBench-AA — Gemini 4 Argon 77,5% so với GPT-6 Sol 61,6%.
• SciCode — Gemini 4 Argon 61,8% so với GPT-6 Sol 57,6%.
• Bài kiểm tra cuối cùng của nhân loại — Gemini 4 Argon 57,1% so với GPT-6 Sol 47,9%.
• GDPval — Gemini 4 Argon 1.611 so với GPT-6 Sol 1.487.
• ApexAgents / AA-Briefcase — GPT-6 Sol 1.482,78 Elo so với 1.493,84 của Argon, khoảng cách 11 điểm nằm trong các khoảng tin cậy đã công bố và nên được coi là hòa.
• Suy luận ngữ cảnh dài — GPT-6 Sol 83,7% so với Gemini 4 Argon 79,7%. Chiến thắng rõ ràng duy nhất của Sol.
• CritPt — GPT-6 Sol 30,9% so với Gemini 4 Argon 27,1%. Sol lại thắng, nhưng chỉ sát nút.
Vậy nên cục diện không phải là “Argon tốt hơn”. Mà là Argon tốt hơn ở hai điểm mà tài liệu ra mắt của nó nhấn mạnh — thực thi tác vụ kinh doanh đầu-cuối và kỹ thuật phần mềm dài hạn — còn Sol ngang bằng hoặc vượt trội trên thang lý luận mang hơi hướng học thuật và ở khả năng giữ mạch nhất quán xuyên suốt một ngữ cảnh dài. Với một độc giả mà khối lượng công việc là pipeline truy xuất với prompt 400K token, Sol đồng thời là mô hình tốt hơn và rẻ hơn, một vị thế hiếm có và thoải mái.
Những khác biệt về thông số kỹ thuật còn tồn tại lâu hơn cuộc thảo luận về benchmark
• Đầu ra tối đa — Gemini 4 Argon 1.000.000 token trong một lần chạy duy nhất, mức mà Google mô tả là lớn nhất trong ngành và tăng so với giới hạn 64K của thế hệ trước. GPT-6 Sol 128.000 token.
• Cửa sổ ngữ cảnh — thẻ thông số nhà cung cấp của GPT-6 Sol ghi khoảng 1.050.000 token; của Argon là 1.000.000. Artificial Analysis đo Sol ở mức 872.000 token thông qua harness của họ; đây là số đo từ harness chứ không phải con số trên thẻ thông số — hãy coi thẻ thông số là đặc tả, còn con số từ harness là mức mà bên đánh giá thực sự đã chạy.
• Các phương thức đầu vào — cả hai đều nhận văn bản, hình ảnh và tệp. Tài liệu ra mắt của Argon cũng dựa vào khả năng hiểu video dài, khi Google tuyên bố đạt 91,7% trên LVBench và mô tả đây là tiên tiến nhất; đó là con số do nhà cung cấp báo cáo và chưa có bảng đánh giá độc lập nào tái tạo được kết quả đó.
• Đầu vào video — Không chắc chắn. Artificial Analysis đưa Argon lên biểu đồ với đầu vào video bị vô hiệu hóa và nêu rõ video ngay khi ra mắt, trong khi card của Sol hoàn toàn không liệt kê video. Nếu video là thành phần then chốt trong pipeline của bạn, thì cả hai card đều không giải quyết được điều đó và bạn nên kiểm thử trước khi thiết kế kiến trúc.
• Mức độ suy luận — Sol cung cấp mức effort có thể cấu hình (từ none đến max, mặc định là medium) tại API và được biểu diễn ở mức max. Argon được biểu diễn ở mức high; chưa ai công bố cùng bộ kiểm thử đó ở thiết lập cao nhất của nó.
Mức trần đầu ra 1M token chính là thứ có thể thực sự thay đổi một kiến trúc chứ không chỉ là một ngân sách. Bất cứ thứ gì bạn hiện đang phải chia thành hàng tá lời gọi nối tiếp nhau để giữ dưới mức giới hạn 128K — một bộ bản vá nhiều tệp, một báo cáo kiểm toán đầy đủ, một tài liệu dài trong một lượt — đều trở thành một lời gọi duy nhất với ít chỗ hơn để một vòng lặp tác tử đánh mất trạng thái. Việc đó có đáng với chi phí gấp đôi cho mỗi tác vụ hay không hoàn toàn phụ thuộc vào việc bạn có khối lượng công việc đó hay không. Nếu có, thì có lẽ nó đáng. Nếu các lời gọi của bạn chỉ là phân loại rồi trả về, thì đó là tiền đổ vào khoảng dư thừa mà chẳng ai sẽ dùng đến.
Cài đặt nỗ lực mà không ai sánh bằng, và vì sao nó quan trọng
Một lưu ý xứng đáng có một đoạn riêng vì nó đi ngược lại cách diễn giải khoảng cách chỉ số năm điểm như một khác biệt thuần túy về năng lực. Artificial Analysis biểu diễn Gemini 4 Argon ở thiết lập cao về nỗ lực suy luận của nó và GPT-6 Sol ở mức tối đa. Đó không phải là cùng một bậc trên hai chiếc thang, và hướng của sự không khớp thì thú vị: Sol được chạy ở thiết lập đắt đỏ nhất còn Argon thì ở mức trung bình.
Có hai cách diễn giải và dữ liệu không thể phân tách chúng. Hoặc là Argon ở max sẽ đạt điểm cao hơn 52.6 — nhưng cũng đốt nhiều token hơn 561,000 mỗi tác vụ và tốn hơn $1.99 — hoặc nó sẽ đạt điểm xấp xỉ như vậy, nghĩa là nút điều chỉnh nỗ lực không làm được gì nhiều trên bộ kiểm thử này. Không có bản chạy nào được công bố để phân xử điều đó. Bất kỳ ai trích dẫn 52.6 như mức trần của Argon là đang trích dẫn một cấu hình, chứ không phải một mô hình, và cấu hình đó chính là cấu hình mà nhà cung cấp của nó chọn công bố đầu tiên.
Logic tương tự cũng áp dụng cho Sol's 47.5, chỉ khác là theo hướng ngược lại: max là đỉnh của thang của nó, nên con số này gần với mức trần hơn là mức sàn. Một cuộc so tài công bằng với cùng mức nỗ lực có thể thu hẹp khoảng cách, và cũng có thể đảo ngược so sánh chi phí, vì những token mà max đốt chính là những token có giá $10 mỗi triệu.
Ngã rẽ về tính khả dụng, thứ quyết định câu trả lời thực tế
Gemini 4 Argon hiện không được cung cấp rộng rãi. Thông báo của Google cho biết nó đang được triển khai cho một nhóm chuyên gia phòng thủ mạng đáng tin cậy thông qua Fairwind Program, rằng công ty đang tham gia vào quy trình tiếp cận mô hình trước khi phát hành tự nguyện của chính phủ Hoa Kỳ, và rằng quyền truy cập chung dành cho nhà phát triển, doanh nghiệp và người tiêu dùng sẽ đến "càng sớm càng tốt", bắt đầu với khách hàng API trả phí và thuê bao Google AI Ultra. Không có mã định danh mô hình, không có endpoint, không có hạn ngạch và không có ngày. Nó không có trên bất kỳ API công khai nào, kể cả của chúng tôi — hãy kiểm tra danh mục và nó trả về 404, vì nó chưa tồn tại ở đó.
GPT-6 Sol là một sản phẩm có thể gọi được. Trên OrcaRouter, nó là openai/gpt-6-sol, trên cùng một endpoint tương thích OpenAI như các hơn 200 mô hình khác trong danh mục, với mức giá niêm yết của OpenAI được chuyển nguyên vẹn cùng mức chênh lệch bằng không, vì vậy mức $2/$10 ở trên và bước ngữ cảnh dài 272.000 token lên $4/$15 chính là những gì bạn thực sự phải trả chứ không phải như một bảng giá vẫn khẳng định. Chuyển đổi dự phòng tự động giữa các nhà cung cấp bao quát trường hợp tuyến bị suy giảm giữa chừng, và DSL định tuyến cho phép một ứng dụng duy nhất gửi lưu lượng phân loại chi phí thấp của mình đến một mô hình nhỏ hơn và lưu lượng suy luận khó đến Sol mà không cần SDK thứ hai.

Phương án cuối cùng đó chính là câu trả lời trung thực cho sự so sánh này đối với hầu hết các đội nhóm. Lập luận về chi phí ủng hộ Argon là có thật nhưng chỉ đúng với một khối lượng công việc mà ở đó công việc agent tầm xa chiếm ưu thế; lập luận về chi phí chống lại nó thì đúng với mọi khối lượng công việc khác; và dù sao thì tháng này bạn cũng không thể mua nó. Nước đi rẻ nhất là xây dựng khung đánh giá ngay bây giờ — prompt của riêng bạn, cách chấm điểm của riêng bạn, chạy đối chiếu với Sol ở một vài mức thiết lập nỗ lực — để khi Argon tiếp cận được khách hàng API trả phí, bạn đã có câu trả lời được đo lường cho một câu hỏi mà tất cả những người khác sẽ trả lời dựa trên bảng xếp hạng.
Điều gì sẽ giải quyết được nó?
Ba điều, theo thứ tự mức độ chúng sẽ thay đổi phán quyết. Tính khả dụng chung của Argon ở một mức giá thực sự, không phải giá giới thiệu — từ "introductory" nghĩa là mức $2/$10 có thể thay đổi, và trình tự của chính Google đặt khách hàng API trả phí lên trước, nên mức giá đầu tiên được công bố sau khi ra mắt là thứ cần theo dõi. Một lần chạy Artificial Analysis được công bố của Argon ở cài đặt nỗ lực cao nhất, điều này sẽ cho biết liệu 52.6 là mức trần hay chỉ kém một chút so với mức đó. Và một lần tái lập độc lập chỉ số DeepSWE v1.1 — Google tuyên bố 77.9% và gọi đó là một chuẩn mực tiên tiến mới; tính đến hôm nay, con số này do nhà cung cấp báo cáo và chưa được tái lập bên ngoài Google.
Cho đến lúc đó, sự phân tách này rất rõ ràng và có chút mỉa mai. GPT-6 Sol là mô hình được xác minh tốt hơn, nhanh hơn, rẻ hơn trên mỗi tác vụ hoàn thành, và là mô hình bạn có thể gọi ngay chiều nay. Gemini 4 Argon là mô hình đạt điểm cao hơn trên bảng xếp hạng mà nhà cung cấp của nó chọn công bố, đắt hơn khoảng gấp đôi nếu thực sự sử dụng, và vẫn chưa được bán ra. Việc lựa chọn giữa hai mô hình này không phải là đánh giá về năng lực. Đó là đánh giá xem câu nào trong hai câu đó mô tả tháng của bạn.

So sánh trong bài viết này1
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
