Thẻ tiêu đề hero ghi "GPT-6 vs Gemini 4 Argon", với một chip ghi "Argon: triển khai theo từng giai đoạn tới các đối tác bảo mật kể từ 2026-09-30", hai chip chỉ số ghi "GPT-6 Astra 52.7" và "Gemini 4 Argon 52.6", cùng một chân trang ghi "Số liệu chỉ số theo Artificial Analysis v4.3.2; thông số Argon do nhà cung cấp công bố và không có sẵn để mua." Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

GPT-6 vs Gemini 4 Argon: Gần như hòa nhau giữa một mô hình đã có trên bảng giá và một mô hình còn nằm trong danh sách chờ

Tác giả

Elias Hawthorne

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cặp mô hình gần nhau nhất trên bảng xếp hạng tiên phong hiện tại không phải là cặp bạn có thể mua. Gemini 4 Argon đạt 52,6 điểm trên Chỉ số Trí tuệ v4.3.2 của Artificial Analysis. GPT-6 Astra, mẫu chủ lực của Ope​nAI, đạt 52,7. Đó là khoảng cách một phần mười điểm trải qua mười bài đánh giá, và cả hai con số đều đến từ cùng một bản sửa đổi của cùng một bộ kiểm tra. Đây là cặp đứng đầu bảng sát nút nhất trong bộ này.

Có một sự đối xứng trong con số đó và hoàn toàn không có sự đối xứng nào về tính sẵn có. Google đã công bố Gemini 4 Argon vào ngày 30 tháng 9 năm 2026, với mức giá giới thiệu được nêu là 2,00 USD cho mỗi triệu token đầu vào và 10,00 USD cho mỗi triệu token đầu ra, triển khai trước tiên cho một nhóm chuyên gia phòng thủ mạng được nêu tên cụ thể thông qua một chương trình mà Google gọi là Fairwind. Nó không có mã định danh mô hình API nào được công bố, không có ngày sẵn có chung, và không có endpoint nào để khách hàng có thể gọi hôm nay. GPT-6 Astra đã có thể mua được kể từ ngày 3 tháng 9 năm 2026, và tính đến ngày 7 tháng 10 năm 2026, dòng GPT-6 cũng là dòng mà ChatGPT định tuyến hơn 1,2 tỷ người dùng hàng tuần đến — với GPT-6 Sol, chứ không phải Astra, đang vận hành các gói trả phí của đợt triển khai đó.

Vậy nên sự so sánh là có thật nhưng bất đối xứng theo cách làm thay đổi cách nó nên được đọc. Các con số của Argon mô tả một mô hình trong một đợt triển khai có kiểm soát. Còn của GPT-6 mô tả một sản phẩm có bảng giá. Mọi nội dung dưới đây đều chỉ đúng với điều kiện "nếu bạn có thể mua nó", và không có nội dung nào dưới đây trả lời câu hỏi "bạn có nên chuyển sang không", bởi vì hiện chưa có gì để chuyển sang.

Điều gì thực sự được biết về bên đối ứng đang tồn tại?

Hãy bắt đầu từ phía tồn tại, vì sự so sánh chỉ có một nửa khả thi. GPT-6 ra mắt với ba phiên bản, và chỉ hai trong số đó là quan trọng ở đây:

• GPT-6 Astra — mẫu flagship, model id gpt-6-astra, phát hành ngày 3 tháng 9 năm 2026, ngữ cảnh 1.050.000 token, đầu ra 128.000 token, nhận đầu vào văn bản/hình ảnh/tệp, mức effort từ low đến max, 10,00 USD mỗi triệu token đầu vào và 50,00 USD đầu ra, đổi giá thành 20,00/75,00 USD cho toàn bộ request khi đầu vào vượt 272.000 token
• GPT-6 Sol — hạng trung, phát hành ngày 22 tháng 9 năm 2026, cùng giới hạn ngữ cảnh và đầu ra, 2,00/10,00 USD với bước long-context 4,00/15,00 USD, và là model OpenAI đưa vào ChatGPT Plus, Pro, Business và Enterprise ngày 7 tháng 10 năm 2026
• GPT-6 Luna — hạng tiết kiệm ở mức 0,10/0,50 USD, phục vụ ChatGPT Free và Go

Phần của Argon trong danh sách đó chỉ dài một dòng. Thông báo của Gooogle đưa ra mức giá giới thiệu, một cách định vị năng lực — lập trình trong thế giới thực, công việc tri thức doanh nghiệp và phòng thủ mạng — cùng một kế hoạch triển khai. Nó không đưa ra chuỗi mô hình, cửa sổ ngữ cảnh, đầu ra tối đa, mức phí đầu vào được lưu đệm, lịch ngừng hỗ trợ hay ngày cho quyền truy cập rộng rãi hơn. Việc thiếu định danh mô hình là điểm thực tế đáng nói: bất kỳ mẫu mã nào bạn thấy trực tuyến trích dẫn chuỗi mô hình Gemini 4 Argon đều là phỏng đoán, vì không có chuỗi nào để trích dẫn.

Phép đo duy nhất hoàn toàn có thể so sánh được, và điều mà nó che giấu

Một thước đo cho phép bạn so sánh Argon với một mô hình GPT-6 mà không kèm theo bất kỳ chữ “nếu” nào, vì Artificial Analysis đã chạy cả hai: chi phí tạo ra một câu trả lời hoàn chỉnh trên bộ đánh giá.

• Chi phí cho mỗi tác vụ lập chỉ mục đã hoàn thành — Gemini 4 Argon $1.99 so với GPT-6 Astra $3.26, mức chênh 1.6× nghiêng về Argon
• Token đầu ra được tạo trên toàn bộ bộ kiểm thử — Gemini 4 Argon 112.8M so với GPT-6 Astra 108.8M, thực tế ngang bằng nhau
• Chỉ số Trí tuệ, v4.3.2 — Gemini 4 Argon 52.6 so với GPT-6 Astra 52.7, bất phân thắng bại
• Giá công bố — $2.00 đầu vào và $10.00 đầu ra trên mỗi 1M đối với Argon, dưới dạng mức giá giới thiệu, so với mức giá tiêu chuẩn $10.00/$50.00 của Astra
• Cửa sổ ngữ cảnh — GPT-6 Astra 1,050,000 token so với Argon không được công bố

Đọc lại dòng đầu tiên đó đi, vì đó là điều bất ngờ duy nhất trên trang này. Mức giá niêm yết của Argon chỉ bằng một phần năm của Astra, và chi phí mỗi tác vụ của nó trên cùng bộ đánh giá thấp hơn 39%. Một mô hình đạt điểm số ngang với mô hình hàng đầu, với mức giá đầu vào chỉ bằng một phần năm, sẽ là câu chuyện của quý — nếu bạn có thể gọi nó như vậy.

A two-column comparison scoreboard for GPT-6 Astra and Gemini 4 Argon, showing GPT-6 Astra at an Intelligence Index of 52.7, $3.26 per index task and a 1,050,000-token context window, against Gemini 4 Argon at 52.6, $1.99 and dimensions marked not published, with prices of $10.00/$50.00 against a stated introductory $2.00/$10.00 and an availability row reading phased rollout only. A footer reads "Index figures per Artificial Analysis v4.3.2; Argon figures vendor-stated, no purchase path."

Dòng thứ hai là lý do dòng đầu tiên bớt kịch tính hơn vẻ ngoài của nó, và nó đi ngược hướng so với lập luận thường thấy về độ dài dòng. Argon và Astra viết gần như chính xác cùng số token để tạo ra gần như chính xác cùng số điểm. Không có khoảng cách độ dài dòng nào để giải thích chênh lệch chi phí — mức chênh $1.27 đến từ bảng giá, chứ không phải từ việc một mô hình viết lan man. Điều đó khiến đây là một so sánh sạch hơn hầu hết trong lô này, và nó khiến việc thiếu tính khả dụng trở thành thứ duy nhất đứng giữa Argon và một khuyến nghị thẳng thắn.

Bảng của riêng Google không phải là bảng độc lập.

Google đã công bố một bảng ra mắt cho Argon, so sánh nó với GPT-6 Astra qua mười chín bài kiểm chuẩn. Nếu chỉ đọc bảng đó, Argon thắng mười bốn, Astra thắng bốn, và một bài hòa. Đó là một kết quả đáng chú ý và cần được xử lý cẩn thận: mọi con số trong đó đều đến từ Google, do Google lựa chọn và sắp xếp, và không phần nào trong đó đã được tái lập một cách độc lập. Đây là lập luận của Google dành cho Argon, đó vốn là mục đích của một bảng ra mắt, và nó nên nằm trong một so sánh với tư cách là tuyên bố của nhà cung cấp được dán nhãn, chứ không phải bằng chứng.

Đặt nó cạnh lần chạy độc lập thì bức tranh đổi khác. Trên bộ kiểm thử của Artificial Analysis, hai mô hình ngang nhau ở mức 52,6 và 52,7 — một lợi thế nhỏ hơn nhiều so với điều mà tỉ số thắng 14-4 hàm ý, trên một bộ kiểm thử mà không nhà cung cấp nào tự dựng nên. Tóm tắt trung thực là Argon có khả năng ngang bằng Astra và thậm chí có thể nhỉnh hơn ở mảng kỹ thuật phần mềm, rằng bảng của chính nhà cung cấp hình dung một khoảng cách rộng hơn so với bảng độc lập tìm ra, và rằng cho đến khi ai đó ngoài Goo​gle chạy nó trên thứ gì đó không phải tác vụ của Goo​gle, thì chưa có gì ngã ngũ.

A screenshot of the top of the Artificial Analysis leaderboard table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings, showing Claude Opus 5.5 (max with fallback) at 58 and $5.98, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, then GPT-6 Astra (max) at 53 and $3.26 on the row immediately above Gemini 4 Argon (high) at 53 and $1.99, with GPT-6 Astra (xhigh) and GPT-6.1 Sol (max) at 52 below them - the near-tie rendered as adjacent rows at the same index.

Vì sao một mô hình chưa phát hành vẫn đáng có một mục riêng

Bởi vì chính cách Google triển khai cũng là thông tin, và nó chỉ ra bản phát hành Pro-tier tiếp theo sẽ hướng tới đâu. Google đã dành năm 2026 để tung ra các mô hình Flash-tier — dòng Flash 3.5, 3.6 và 3.8, các biến thể Lite, một bản 3.8 Flash tinh chỉnh cho an ninh mạng — trong khi dòng Pro vẫn dậm chân tại Gemini 3.1 Pro Preview, một mô hình đã ở dạng xem trước từ tháng 2 năm 2026 mà không có cam kết phát hành rộng rãi và không có ngày ngừng hoạt động. Argon là bước chuyển động đầu tiên ở vị trí cao nhất của dòng sản phẩm trong bảy tháng, và nó được đưa ra trước tiên cho giới phòng thủ thay vì cho các nhà phát triển.

Việc sắp xếp trình tự đó là một lựa chọn mạch lạc — an ninh mạng là khối lượng công việc mà ở đó một mô hình tiên phong với khả năng sử dụng công cụ dạng tác tử và quyền tự chủ trong thời gian dài có giá trị rõ ràng nhất, dễ đo lường nhất, và đây cũng là khối lượng công việc mà một nhà cung cấp muốn có một nhóm được kiểm soát trước khi phát hành chung. Đó không phải là bằng chứng cho thấy mô hình chưa sẵn sàng. Đó là bằng chứng cho thấy Goo​gle đang coi việc phát hành rộng rãi là một quyết định về sau thay vì một quyết định trong ngày ra mắt, điều mà mã định danh mô hình bị thiếu và ngày bị thiếu nói theo một cách khác.

Đối với một builder, hệ quả thật đơn giản: bạn không thể lập kế hoạch dựa trên Argon. Bạn có thể lập kế hoạch dựa trên GPT-6 Astra hoặc GPT-6 Sol, vì cả hai đều có mã định danh, endpoint, bảng giá và một nhà cung cấp đã công bố chính sách ngừng hỗ trợ cho dòng sản phẩm này. Một mô hình không có mã định danh là một mô hình mà bạn không thể viết adapter cho nó.

Điều gì sẽ thay đổi sự so sánh này?

Ba điều, và bất kỳ điều nào trong số đó cũng biến bài viết ở trên thành một vấn đề đã ngã ngũ. Điều đầu tiên là một mã định danh mô hình — một chuỗi thực được cung cấp từ API của Goo​gle, bởi đó chính là thời điểm mà một adapter trở nên có thể viết được và một ước tính tích hợp trở nên có ý nghĩa. Điều thứ hai là ngày phát hành chính thức, thứ phân biệt một bản xem trước với một sản phẩm và là mốc thời gian duy nhất mà thông báo của Argon đã bỏ sót hoàn toàn. Điều thứ ba là việc đánh giá độc lập trên những tác vụ mà Goo​gle không tự chọn; một bộ kiểm thử do nhà cung cấp tập hợp là một lời khẳng định, còn một bộ kiểm thử do người khác tập hợp là một phép đo.

Cho đến khi cả ba cùng tồn tại, vai trò của Argon trong một phép so sánh là mức trần hơn là một lựa chọn. Các con số của nó cho bạn biết phân khúc Gemini Pro đang đi về đâu và giúp bạn hình dung Google còn bao nhiêu dư địa về giá ở đầu bảng. Chúng không cho bạn biết nên xây dựng dựa trên cái gì.

Nên làm gì trong lúc Argon chờ đợi

Nếu lý do bạn đến đây là vì các con số của Argon trông hấp dẫn, thì nước đi hữu ích là kiểm thử cùng loại khối lượng công việc đó với mô hình mà bạn thực sự có thể gọi ngay hôm nay, và với kỹ thuật phần mềm cùng công việc tác nhân dài hạn, điều đó có nghĩa là GPT-6 Astra. Nó nằm trong danh mục của OrcaRouter theo đúng mô hình định giá chuyển tiếp của Google — mức $10.00/$50.00 của nhà cung cấp cùng bậc long-context $20.00/$75.00, với mức chênh 0%, nên khi nhà cung cấp thay đổi giá, bạn nhận được thông tin ngay trong ngày thay vì phải chờ đến kỳ thanh toán tiếp theo. GPT-6 Sol với mức $2.00/$10.00 cũng có mặt ở đó, và với hầu hết khối lượng công việc thì đây là lựa chọn đáng mua hơn: nó đạt 47,6 so với 52,7 của Astra, và chi phí chỉ bằng khoảng một phần ba cho mỗi tác vụ hoàn thành.

Lớp định tuyến chính là thứ giúp lịch triển khai của nhà cung cấp trở nên khả thi. Khi Argon thực sự có được một định danh, nó không nhất thiết phải trở thành một dự án di trú: một quy tắc định tuyến có thể gửi một phần lưu lượng của bạn đến nó, hoặc dùng cấu hình model-fusion để chạy một hội đồng và so sánh các câu trả lời, trong khi GPT-6 Astra hoặc Sol vẫn là mặc định phía sau. Chuyển đổi dự phòng tự động bao quát trường hợp quan trọng nhất ở đây — một mô hình đang trong quá trình triển khai có kiểm soát đúng là kiểu tuyến có thể bị giới hạn tốc độ hoặc bị rút bỏ mà không báo trước, và một đường dự phòng nghĩa là điều đó trở thành một yêu cầu chậm thay vì một sự cố ngừng dịch vụ.

A screenshot of the OrcaRouter model page for openai/gpt-6-astra, showing the OpenAI vendor label, a 2026-09-04 release date, a 1,050,000-token context window, a 128K-token maximum output, text, image and file input, and pricing of $10.00 per million input tokens and $50.00 per million output tokens.

Điều không nên làm là bắt đầu một kế hoạch di chuyển dựa trên bảng ra mắt của một mô hình không có endpoint. Khoảng cách với GPT-6 Astra chỉ là một phần mười điểm và chênh lệch giá là có thật, nhưng cả hai đều không đáng để xây dựng lại một tích hợp cho thứ mà bạn không thể gửi yêu cầu đến.

So sánh trong bài viết này1

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày