Thẻ tiêu đề chính ghi "Gemini 4 Argon vs GPT-6 Astra", cùng một chip ghi "Index 52.6 vs 52.7" và một chip ghi "Chi phí mỗi tác vụ index $1.99 vs $3.26", và một dòng chân trang ghi "Số liệu Argon do nhà cung cấp công bố; số liệu index và chi phí theo Artificial Analysis, 2026-09-30."
Guides & Insights

Gemini 4 Argon vs GPT-6 Astra: Bất phân thắng bại trên chỉ số, và một bước giảm giá xuống bằng hai phần ba.

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình tiên phong, cách nhau 0,11 điểm trên Intelligence Index của Artificial Analysis. Gemini 4 Argon đạt 52,56. GPT-6 Astra đạt 52,67. Nếu bạn phải chọn giữa chúng dựa trên năng lực tổng quát được đo lường, bạn có thể tung đồng xu, và khác biệt giữa hai điểm số nhỏ hơn khoảng tin cậy của mỗi bên. Đó là một tình huống thực sự hiếm gặp trong một thị trường nơi mười mô hình hàng đầu trải rộng tổng cộng khoảng mười lăm điểm, và điều đó khiến đây trở thành cuộc đối đầu dễ lý giải nhất trong các cuộc đối đầu của Gemini 4 Argon, bởi vì lập luận về năng lực kết thúc trước cả khi nó bắt đầu, và tất cả những gì còn lại là kinh tế và quyền truy cập.

Tuy nhiên, hai mô hình này không phải là cặp sinh đôi. Argon được Google DeepMind công bố vào ngày 2026-09-30 và đang được triển khai theo từng giai đoạn, bắt đầu với các chuyên gia phòng thủ an ninh mạng đáng tin cậy trong Chương trình Fairwind. GPT-6 Astra đã ra mắt vào đầu tháng 9 — thẻ danh mục của chúng tôi ghi ngày 2026-09-04, còn Artificial Analysis liệt kê ngày 2026-09-03 — và là một route đang hoạt động mà bạn có thể gọi ngay chiều nay với mức 10 USD đầu vào và 50 USD đầu ra cho mỗi triệu token, cùng cửa sổ ngữ cảnh 1.050.000 token và giới hạn đầu ra 128.000 token. Một trong hai mô hình này có mức giá mà bạn có thể bị tính phí ngay hôm nay.

Khi nào khoảng cách 0,11 điểm là thật và khi nào là nhiễu

Một chỉ số là một tổ hợp, nên hai mô hình có cùng điểm tổng hợp vẫn có thể khác biệt đáng kể ở các thành phần của nó. Ở đây, các thành phần phần lớn đồng thuận, với ba ngoại lệ đáng kể tên.

• Terminal-Bench 4.0 — GPT-6 Astra 59,1% so với Gemini 4 Argon 57,1%. Astra dẫn đầu, với khoảng cách sít sao.

• Suy luận ngữ cảnh dài — GPT-6 Astra 80,7% so với Gemini 4 Argon 79,7%.

• GPQA Diamond — GPT-6 Astra 96,1%. Argon không công bố số liệu nào trên bảng xếp hạng này.

• CritPt — GPT-6 Astra 31,7% so với Gemini 4 Argon 27,1%.

• SciCode — Gemini 4 Argon 61,8% so với GPT-6 Astra 56,5%.

• Kỳ thi cuối cùng của nhân loại — Gemini 4 Argon 57,1% so với GPT-6 Astra 54,7%.

• AutomationBench-AA — Gemini 4 Argon 77.5% so với GPT-6 Astra 68.5%.

• GDPval — Gemini 4 Argon 1.611 so với GPT-6 Astra 1.542.

• Toàn tri — GPT-6 Astra 43,4 so với Gemini 4 Argon 42,4.

• ITBench-SRE — GPT-6 Astra 48,6% so với việc không có số liệu Argon nào được công bố.

• Tốc độ xuất — GPT-6 Astra 51,2 token mỗi giây so với Gemini 4 Argon 48,9. Thực tế là ngang bằng.

• Độ trễ token đầu tiên trên bộ kiểm thử chỉ mục — Gemini 4 Argon 2,8 giây so với GPT-6 Astra 320,2 giây.

Astra có lợi thế ở lĩnh vực suy luận trắc nghiệm khoa học, ở các bài toán vật lý về điểm tới hạn và ở bộ đánh giá SRE. Argon có lợi thế ở lĩnh vực lập trình khoa học, ở bộ tác vụ đầu-cuối khó hơn và ở các công việc được định giá theo GDP. Không lợi thế nào trong hai lợi thế này đủ lớn để tự nó trở thành căn cứ cho việc chuyển đổi.

A two-column scoreboard comparing Gemini 4 Argon and GPT-6 Astra on six dimensions. Gemini 4 Argon reads: AA Intelligence Index 52.6, price $2 / $10 per million tokens, cost per index task $1.99, output ceiling 1M tokens, first token 2.8 s, input modalities text, image, video and files. GPT-6 Astra reads: AA Intelligence Index 52.7, price $10 / $50, cost per index task $3.26, output ceiling 128K tokens, first token 320.2 s, input modalities text, image and files, with a note that its standard rate steps to $20 input and $75 output above 272K input tokens. A footer line reads that Argon figures are vendor-reported and both models' index and cost figures are per Artificial Analysis.

Độ trễ lại là câu chuyện khác. 320 giây cho token đầu tiên là năm phút rưỡi im lặng trước khi bất cứ thứ gì được phát ra, so với chưa đầy ba giây ở Argon. Cả hai đều đo cùng một thứ — thời gian đến chunk đầu tiên trên các lượt chạy chỉ số của Artificial Analysis — nên đây là mức có thể so sánh được. Cơ chế suy luận của Astra luôn bật và có thể cấu hình từ mức nỗ lực thấp đến tối đa; một lượt chạy ở mức nỗ lực tối đa trên một tác vụ khó thực sự suy nghĩ hàng phút trước khi nói. Việc đó có phải là khiếm khuyết hay không hoàn toàn phụ thuộc vào giao diện của bạn. Với một tác vụ theo lô, nó chẳng tốn gì. Với bất cứ thứ gì có người dùng đang nhìn vòng xoay chờ, đó là khác biệt dễ thấy nhất đối với người dùng giữa hai mô hình này, lớn hơn bất kỳ khoảng cách benchmark nào trên trang.

Bước giá, vốn là đối tượng thực sự

Đây là nơi thế hòa bị phá vỡ, và nó phá vỡ theo một cách dễ bị mô hình hóa sai vì bảng giá của Astra có ba bậc trông giống nhau.

• Tiêu chuẩn, tối đa 272.000 token đầu vào — GPT-6 Astra $10,00 vào / $50,00 ra, lượt đọc từ bộ đệm $1,00, ghi vào bộ đệm $12,50.

• Ngữ cảnh dài, trên 272.000 token đầu vào — GPT-6 Astra $20.00 vào / $75.00 ra, lượt đọc từ bộ nhớ đệm ở mức $2.00. Toàn bộ yêu cầu được tính lại giá theo bậc cao hơn, không chỉ phần vượt: gấp 2× đầu vào và 1,5× đầu ra.

• Chế độ Nhanh — gấp 2 lần mức giá tiêu chuẩn áp dụng, tức $20.00 vào / $100.00 ra. Đây là con số $100 thường được trích dẫn như thể đó là mức giá ngữ cảnh dài; thực tế không phải vậy.

• Gemini 4 Argon — $2.00 vào / $10.00 ra, đồng giá theo mức giới thiệu, đầu vào được lưu đệm ở mức $0.10, không có bậc giá công bố và không có hạng nhanh công bố.

Vậy Argon rẻ hơn năm lần ở đầu vào và rẻ hơn năm lần ở đầu ra so với gói tiêu chuẩn của Astra, và rẻ hơn mười lần ở đầu vào khi vượt 272K. Hai phép đo chi phí độc lập cùng khẳng định một luận điểm từ một hướng khác: Artificial Analysis định giá Argon ở mức 1,99 USD mỗi tác vụ index, so với 3,26 USD của Astra, và 2.407 USD để chạy toàn bộ index, so với 5.324 USD của Astra. Tỷ lệ trên mỗi tác vụ nhỏ hơn tỷ lệ trên mỗi token vì cùng lý do như khi so với DeepSeek — Argon chạy ít token hơn để hoàn thành — nhưng vẫn là 1,6×.

Bảng xếp hạng theo trọng số GDP của Vals kể lại phiên bản thứ ba của cùng một câu chuyện: Argon đứng đầu với 68,90% và 15,68 đô la mỗi lần chạy, Astra đứng thứ sáu với 63,13% và 18,46 đô la. Astra đắt hơn và đạt điểm thấp hơn ở đó. Tài liệu của Google nói rõ rằng mức giá này là mức giá giới thiệu, một từ có nghĩa là nó có thể thay đổi, và cách hiểu trung thực là lợi thế về giá của Argon là có thật, còn tính lâu dài của nó thì không được đảm bảo.

Hai sự thật về kiến trúc quyết định nhiều hơn cả các bài kiểm chuẩn

A capture of the Google DeepMind blog post announcing Gemini 4 Argon, dated Sep 30 2026, credited to Koray Kavukcuoglu, SVP Google DeepMind and Chief AI Architect, with the standfirst describing frontier performance across real-world software engineering, enterprise knowledge work like legal and finance, and cybersecurity defense.

Giới hạn đầu ra trước tiên. Gemini 4 Argon tạo ra tối đa 1.000.000 token trong một lần sinh duy nhất — thông báo của Google nêu rõ đây là mức mở rộng từ 64K ở thế hệ trước. GPT-6 Astra giới hạn ở 128.000. Cả hai đều có cửa sổ ngữ cảnh khoảng một triệu token, nên đây hoàn toàn là chuyện mô hình có thể viết bao nhiêu trong một lần. Đối với tạo văn bản dài, thay đổi mã toàn bộ bản vá hay soạn thảo tài liệu trong một lượt, đó là khác biệt gấp tám lần về những gì một lệnh gọi có thể tạo ra. Với trò chuyện, trích xuất và các bước agent ngắn, cả hai giới hạn đều thực tế là vô hạn và sự khác biệt chẳng khiến bạn tốn thêm gì.

Tính đa phương thức xếp thứ hai, và ở đây lợi thế lại nghiêng theo hướng ngược lại ở một khía cạnh. GPT-6 Astra chấp nhận văn bản, hình ảnh và tệp. Gemini 4 Argon chấp nhận văn bản, hình ảnh, video và tệp, và tài liệu ra mắt của Google đặc biệt dựa vào khả năng hiểu video dài — con số LVBench 91,7% do nhà cung cấp báo cáo. Nếu pipeline của bạn tiếp nhận video, Astra không phải là phương án thay thế. Âm thanh cũng không được nêu tên trong danh sách đã công bố của Argon, vì vậy đừng cho rằng điều kiện đó vẫn đúng.

Việc thực sự cần làm

Astra đã có sẵn còn Argon thì không, và điều đó định đoạt phần lớn các quyết định trong tháng tới. Con đường cụ thể không lãng phí chút công sức nào: hãy xây dựng trên GPT-6 Astra nếu khối lượng công việc của bạn cần một mô hình suy luận luôn bật với độ chính xác khoa học cao và thành tích tác nhân đã được chứng minh, giữ tên mô hình trong cấu hình, và đặt thời gian chờ của máy khách dựa trên hành vi đo được của Astra thay vì dựa trên sự lạc quan — một lần chạy lấy token đầu mất năm phút sẽ kích hoạt thời gian chờ mặc định 60 giây, và một luồng chết ở giây thứ 300 trông chẳng khác nào một sự cố ngừng dịch vụ. Nếu bạn nhạy cảm về chi phí khi vượt quá 272K token đầu vào, hãy mô hình hóa cụ thể việc định giá lại trước khi cam kết, vì bước giá này nhân đôi đầu vào và tăng đầu ra thêm một nửa chỉ tại một ngưỡng.

A capture of the OrcaRouter model page for OpenAI: GPT-6 Astra, showing the OpenAI provider, a release date of 2026-09-04, a 1,050,000-token context window, a 128,000-token maximum output, text, image and file input, and pricing of $10.00 input / $50.00 output per million tokens.

Con đường trung dung thú vị nằm ở chỗ bạn không nhất thiết phải chọn một mặc định duy nhất. Astra và Argon — khi Argon ra mắt — có cùng dạng mô hình, nhắm vào cùng một loại công việc, khiến chúng trở thành những đối tác chuyển đổi dự phòng tự nhiên thay vì đối thủ cạnh tranh cho cùng một vị trí. Trên OrcaRouter, openai/gpt-6-astra đang hoạt động với giá niêm yết của nhà cung cấp, không phụ phí, trên cùng endpoint tương thích OpenAI như hơn 200 mô hình khác, với tự động chuyển đổi dự phòng giữa các nhà cung cấp và một DSL định tuyến để thể hiện cấu hình chính-và-dự phòng trên một khóa duy nhất. Khi Argon gia nhập danh mục với bất kỳ id nào mà Google công bố, việc chuyển đổi chỉ là một chuỗi ký tự — không cần hợp đồng thứ hai, không cần công việc tích hợp, và không cần xây dựng lại bất cứ thứ gì bạn đã tạo quanh Astra trong khoảng thời gian đó.

Điều gì sẽ phá vỡ thế hòa một cách vĩnh viễn?

Một mức giá Argon được công bố sau giai đoạn giới thiệu, cùng một bản tái lập độc lập các tuyên bố về năng lực tác tử của Google — con số 77,9% trên DeepSWE v1.1 và kết quả 68% trên CWE-bench v1 đều do nhà cung cấp tự báo cáo, và cả hai đều không có một lần chạy độc lập nào đứng sau. Mỗi yếu tố đều có thể đẩy Argon lên hoặc xuống một cách đáng kể, bởi vì mức dẫn trước 0,11 điểm trên chỉ số không phải là tấm đệm chống lại bất lợi chi phí gấp 1,6 lần nếu lợi thế chi phí hóa ra chỉ là tạm thời, và nó cũng không phải là mức thua kém nếu Google giữ nguyên mức giá giới thiệu và gói ngữ cảnh dài của Astra tác động mạnh hơn dự kiến trong môi trường vận hành thực tế.

Hiện tại: xét về năng lực tổng quát được đo lường, hai cái này là cùng một mô hình trong hai lớp vỏ. Astra là cái có tuyến đang hoạt động, một bước giá đã biết và khoảng dừng suy nghĩ năm phút. Argon là cái có thẻ rẻ hơn và không có endpoint. Thế hòa là thật, và một phía của nó thì có thể mua được.