
GPT-6.1 Sol so với Gemini 4 Argon: Cách nhau nửa điểm, và chỉ một trong hai được bán
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Mọi thứ bạn có thể so sánh giữa GPT-6.1 Sol và Gemini 4 Argon đều có thể đo lường được, và không có gì trong đó có thể hành động được, bởi vì chỉ một trong hai mô hình có thể mua được. Gemini 4 Argon được công bố vào ngày 30 tháng 9 năm 2026 trong một bài đăng của DeepMind ghi công cho Koray Kavukcuoglu, với mức giá giới thiệu được nêu là $2,00 cho mỗi triệu token đầu vào và $10,00 cho mỗi triệu token đầu ra, và được triển khai trước tiên cho một nhóm được nêu tên gồm các chuyên gia phòng thủ không gian mạng thông qua Fairwind Program. Nó không có mã định danh mô hình, không có điểm cuối API, không có mức giá trên mỗi token được công bố mà bạn có thể bị tính phí, và không có trang nào bạn có thể truy cập với tư cách khách hàng. GPT-6.1 Sol đã ra mắt ngày 29 tháng 9 năm 2026 với mức $2,00 và $10,00 và hiện đã có sẵn. Trên Artificial Analysis Intelligence Index, hai mô hình cách nhau 0,8 điểm — Argon 52,6, Sol 51,8 — khiến đây trở thành cặp sát nút nhất trong đợt này và, nếu chỉ xét trên chỉ số, là một thế hòa. Trên thước đo quyết định các triển khai thực tế, một trong hai mô hình này hoàn toàn không phải là ứng viên.
Sự bất đối xứng đó không phải là một chi tiết kỹ thuật vụn vặt, và nó cũng không phải là một tin sốt dẻo. Đó là sự thật phải chi phối cách đọc so sánh này: các con số của Argon mô tả một mô hình đang được triển khai có kiểm soát cho một nhóm người dùng, còn các con số của GPT-6.1 Sol mô tả một sản phẩm nằm trên bảng giá. So sánh chúng vẫn đáng để làm — Argon là thứ mà nhà cung cấp hiện đang dẫn đầu, và các đo lường của nó nói lên điều gì đó thực sự về vị trí đỉnh của dòng Gemini — nhưng mọi kết luận đều phải mang cụm từ "nếu nó có thể mua được", và không kết luận nào mang cụm từ "bạn có nên chuyển sang không".
Chỉ số cho phép đúng một phép so sánh, và đó là một kết quả gần hòa.

Cả hai mô hình đều xuất hiện trên Artificial Analysis, và cả hai đều có một điểm số cùng bản hạch toán về chi phí để tạo ra điểm số đó.
• Chỉ số Trí tuệ, v4.3.2 — Gemini 4 Argon 52,6 so với GPT-6.1 Sol 51,8, khoảng cách 0,8 điểm
• Chi phí cho mỗi tác vụ lập chỉ mục — Gemini 4 Argon $1.99 so với GPT-6.1 Sol $0.72, chênh lệch gấp 2,8 lần để đổi lấy 0,8 điểm đó
• Chi phí chạy toàn bộ bộ kiểm thử — Gemini 4 Argon $2,407 so với GPT-6.1 Sol $1,082
• Token đầu ra phát sinh trên bộ đó — Gemini 4 Argon 110M so với GPT-6.1 Sol 67M, chênh lệch độ dài dòng 1,6×
• Mức giá giới thiệu được công bố — 2,00 USD cho đầu vào và 10,00 USD cho đầu ra trên mỗi triệu token ở cả hai, với đầu vào được lưu trong bộ nhớ đệm giảm 95% trên Argon
• Cửa sổ ngữ cảnh — GPT-6.1 Sol 1.050.000 token; Argon chưa được công bố
Dòng thứ tư giải thích dòng thứ hai. Mức chênh lệch chi phí 2,8× trên mỗi tác vụ với các mức giá niêm yết gần như giống hệt nhau đến từ việc viết lượng token gấp 1,6× ở mức giá đầu ra tương đương, cộng thêm chi phí của khối lượng suy luận đằng sau chúng, bất kể con số đó là bao nhiêu. Xét theo bảng giá của mình, Argon không phải là một mô hình đắt đỏ. Nó là một mô hình nói nhiều trong bài đánh giá, và khoản phải trả được quyết toán ở đầu ra.
Các cấu hình khác nhau, và hướng của sự khác biệt lại tôn lên mô hình rẻ hơn. Artificial Analysis biểu diễn Gemini 4 Argon ở thiết lập nỗ lực cao và GPT-6.1 Sol ở mức tối đa — vì vậy Sol được đo ở thiết lập đắt nhất còn Argon ở mức dưới mức trần của nó. Do đó, khoảng cách 0,8 điểm là phiên bản so sánh ưu ái dành cho Sol: cho Argon thiết lập cao nhất và khoảng cách có khả năng mở rộng, cho Sol thiết lập thấp hơn và chi phí của nó càng giảm. Cả hai động thái đều không làm thay đổi đường khả dụng, vốn là đường duy nhất kết thúc một quyết định triển khai.
Việc đọc ra dù chỉ khoảng cách 0,8 điểm
Chênh lệch dưới một điểm trên điểm tổng hợp từ mười đánh giá không phải là thứ hạng. Đó là hai mô hình nằm trong cùng một nhóm.
Điều mà bảng chỉ số không công bố cho Argon là chi tiết thành phần có thể khiến dải điểm trở nên rõ ràng — nó thắng những đánh giá nào, chỗ nào còn yếu, và nó thể hiện ra sao qua các điểm phụ cấu thành điểm tổng hợp. Trang của GPT-6.1 Sol có những dòng đó; trang của Argon chỉ có một con số tiêu đề và một mức chi phí. Một so sánh chỉ dựa trên con số tiêu đề thì chỉ có thể nói rằng hai bên ngang nhau, và không nói được gì hơn; và nó nên nói đúng như vậy thay vì tạo ra một người thắng từ khoảng cách 0,8 điểm.
Có một điểm dữ liệu bên ngoài đáng bổ sung, và nó lại chỉ về hướng ngược lại. Trong một đánh giá lập trình của bên thứ ba được lan truyền sau thông báo, Argon xếp thứ ba sau GPT-6 Astra và Claude Opus 5.5 — một kết quả mạnh mẽ đối với một mô hình đang trong giai đoạn triển khai có kiểm soát, và hoàn toàn nhất quán với mức 52,6 trên điểm tổng hợp. Đây cũng chỉ là một quan sát đơn lẻ từ một đánh giá duy nhất, được công bố trong những ngày đầu của một thông báo, khiến nó là bằng chứng hơn là một thành tích đã được kiểm chứng. Hãy gắn nhãn cho nó rồi tiếp tục.
Hai thẻ giá ấy thực sự dùng để làm gì
Tỷ lệ được nêu cho Argon đáng được chú ý hơn so với hàng chỉ mục, vì trong đó có hai con số.
Mức giá giới thiệu là 2,00 USD cho đầu vào và 10,00 USD cho đầu ra, với đầu vào đã lưu đệm được giảm 95%, điều mà trên một thẻ so sánh sẽ khiến Argon có mức giá tương đương cùng hạng với GPT-6.1 Sol. Chính chú thích của nhà cung cấp nêu rõ rằng sau một giai đoạn giới thiệu mà họ không định nghĩa, mức giá sẽ trở thành 4,00 USD mỗi triệu token đầu vào và 20,00 USD mỗi triệu token đầu ra. Cặp số thứ hai đó không phải là giả định — đó là con số đã được công bố mà mô hình được kỳ vọng sẽ ổn định ở mức ấy — và nó rơi đúng vào mức giá niêm yết tiên tiến hiện tại chứ không phải thấp hơn. Một so sánh chỉ trích dẫn cặp giá giới thiệu là đang trích dẫn một con số khuyến mãi cho một mô hình chưa được phổ cập rộng rãi, tức là hai mức độ tạm thời trên cùng một dòng.
Thẻ của GPT-6.1 Sol là kiểu đối tượng ngược lại. $2.00 và $10.00 là mức giá thường trực, không phải là khuyến mãi; mức tăng cho ngữ cảnh dài lên $4.00 / $15.00 khi vượt quá 272,000 token đầu vào đã được công bố và áp dụng cho một ngưỡng được xác định; đầu vào được lưu trong bộ nhớ đệm ở mức $0.10 đang hoạt động ngay hôm nay và được tính phí. Không có gì trong đó cần phải có chú thích về một khoảng thời gian mà nhà cung cấp từ chối định nghĩa.
Đó là thực chất đằng sau dòng trạng thái sẵn có. Không phải Argon là một mẫu kém hơn — chỉ số cho thấy hai mẫu ngang bằng nhau — mà là một trong hai thẻ này là một cam kết, còn thẻ kia là một ý định.
Bản thân việc triển khai chính là sự so sánh

Chương trình Fairwind là phần trong thông báo của Argon mà một so sánh kỹ thuật thường bỏ qua, và đó lại chính là phần quan trọng nhất ở đây.
Nhà cung cấp đang đặt mô hình vào tay một nhóm chuyên gia phòng thủ mạng được nêu tên trước tiên, trước tất cả những người khác, không có ngày công bố cho việc mở rộng chung, không có danh sách chờ dành cho nhà phát triển, và không có mã định danh được công bố mà khách hàng có thể ghim. Đó là một cách hợp lệ để phát hành một mô hình tiên phong và không có gì bất thường đối với năng lực tầm cỡ này. Điều đó cũng có nghĩa là mọi tuyên bố về chi phí, độ trễ, thông lượng và độ tin cậy của Argon trên lưu lượng thực tế hiện đều chưa được đo lường: không có lưu lượng sản xuất nào để đo. Lần chạy đánh giá chuẩn của chính nhà cung cấp thì có tồn tại, và chỉ số tổng hợp của Artificial Analysis cũng tồn tại, và giữa chúng, chúng chỉ là đánh giá của một phòng thí nghiệm và bộ của một đơn vị đánh giá. Đó là toàn bộ hồ sơ ghi nhận.
GPT-6.1 Sol có hồ sơ mới tám ngày tuổi và mỏng theo một kiểu khác: một cấu hình độc lập, không có kho ngữ liệu từ người thực hành, và một sản phẩm đã được bán ra mà các kiểu hỏng của nó vẫn chưa được ghi chép ở bất cứ đâu. Cả hai mô hình đều không có đủ bằng chứng xác đáng. Tuy nhiên, một trong số chúng có hóa đơn.
Vậy sự so sánh này để làm gì?
Ba mục đích sử dụng, và không mục đích nào trong số đó là quyết định mua hàng.
Trước tiên, hãy hiệu chỉnh. Nếu bạn đang theo dõi vị thế của Argon so với GPT-6.1 Sol, thì câu trả lời hiện tại là 52,6 so với 51,8 với mức chênh chi phí 2,8× cho mỗi tác vụ, và điều đó cho thấy dòng Gemini 4 có năng lực cạnh tranh ngang ngửa trong khi vẫn đang hoàn tất các điều khoản thương mại của mình. Hãy để ý việc mức giá giới thiệu sẽ bị thay bằng cặp $4.00 / $20.00, điều này sẽ biến một mức giá ngang bằng thành một mức giá cao hơn hẳn dù năng lực không đổi.
Thứ hai, một vị thế chờ đợi. Một mô hình được công bố, được đo lường nhưng không thể định tuyến là trường hợp rõ ràng nhất để duy trì một lớp trừu tượng giữa ứng dụng của bạn và lựa chọn mô hình của bạn. Cả hai mô hình trong bài viết này đều có thể tiếp cận theo cùng một cách từ phía chúng ta: GPT-6.1 Sol có mặt trên OrcaRouter với mức giá riêng $2.00 / $10.00 cùng với đầu vào được lưu đệm ở mức $0.10 và không phụ phí gì thêm, nên một khối lượng công việc có thể được xây dựng dựa trên nó ngay hôm nay theo giá niêm yết của nhà cung cấp. Nếu và khi Argon có được một mã định danh và một bảng giá, việc đánh giá nó nên là một thay đổi cấu hình chứ không phải là một cuộc viết lại — và cho đến lúc đó, lượng công sức kỹ thuật đúng đắn để dành cho Argon chính là lượng công sức giữ cho điều đó luôn đúng.
Thứ ba, một danh sách theo dõi có thể kiểm chứng sai. Bất kỳ điều nào sau đây sẽ biến bài này từ một bài tổng hợp những gì chúng ta biết tính đến nay thành một bản so sánh để chọn mua: một mã định danh mô hình trong tài liệu dành cho nhà phát triển, một mục trong chỉ mục model card của nó, một bài đăng về tính khả dụng chung kèm mức giá trên mỗi token được công bố, hoặc việc Artificial Analysis công bố cấu hình thứ hai ở một mức nỗ lực khác. Cho đến khi một trong những điều đó xuất hiện, một bài viết khẳng định Argon rẻ hơn, nhanh hơn hoặc tốt hơn GPT-6.1 Sol khi vận hành thực tế thì chỉ đang mô tả một mô hình mà không ai ngoài một nhóm người dùng duy nhất từng chạy.

Lời kết trung thực chỉ là một câu, và nó nói về hình dạng của câu hỏi chứ không phải điểm số. Gemini 4 Argon và GPT-6.1 Sol đủ sát nhau trên bảng độc lập duy nhất mà cả hai cùng xuất hiện đến mức chỉ số không thể chọn giữa chúng; điều chọn giữa chúng là một cái đã có sẵn và một cái chỉ là lời hứa, mà lời hứa thì không phải là thứ bạn định tuyến lưu lượng production tới. Theo dõi Argon, áp dụng Sol nếu giá và các modality phù hợp với công việc của bạn, và giữ lớp trừu tượng đủ mỏng để ngày Argon trở thành thật, nó chỉ là một dòng cấu hình chứ không phải một dự án.
So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
