Thẻ tiêu đề hero ghi "GPT-6 vs Gemini 3.1 Pro", với một chip ghi "Gemini 3.1 Pro: ở bản xem trước kể từ 2026-02-19", hai dòng giá ghi "GPT-6 Sol $2 / $10" và "Gemini 3.1 Pro $2 / $12", và phần chân trang ghi "Số liệu chỉ số theo Artificial Analysis v4.3.2; các mục do nhà cung cấp báo cáo của GPT-6 được dán nhãn trong văn bản." Logo OrcaRouter được ghép vào góc dưới cùng bên phải.
Guides & Insights

GPT-6 so với Gemini 3.1 Pro: Phân khúc Pro của Google chưa ra mắt mô hình mới nào kể từ tháng Hai

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Gemini 3.1 Pro đã nằm trong bảng giá của Google được bảy tháng rưỡi và chưa từng rời khỏi trạng thái xem trước. Nó được công bố vào ngày 19 tháng 2 năm 2026, vẫn được phục vụ dưới một endpoint có tên Gemini 3.1 Pro Preview, và tính đến hôm nay vẫn không có cam kết về tính khả dụng chung cũng như không có ngày ngừng dịch vụ — hai mốc ngày lẽ ra sẽ cho bạn biết mô hình đang ở đâu trong kế hoạch của chính nhà cung cấp. Ngược lại, GPT-6 Sol đã ra mắt vào ngày 22 tháng 9 năm 2026, và vào ngày 7 tháng 10 năm 2026, nó trở thành mô hình đứng sau các gói trả phí trong đợt triển khai toàn cầu của ChatGPT tới hơn 1,2 tỷ người dùng hàng tuần.

Vậy nên, so sánh chính không phải giữa hai phân khúc flagship. Mà là giữa một sản phẩm đã phát hành và một bản xem trước mở, và sự khác biệt đó hóa ra lại đáng giá hơn khoảng cách benchmark. Đặt chúng cạnh nhau trên Intelligence Index v4.3.2 của Artificial Analysis và bản xem trước bảy tháng tuổi của Google đạt 29,7 điểm so với 47,6 của GPT-6 Sol, trong khi tính phí cao hơn 1,25 lần cho mỗi tác vụ index hoàn thành — $1,30 so với $1,04. Cả hai con số đó đều là thật, và cả hai đều cần một lưu ý kèm theo trước khi bạn chi tiền cho chúng.

Điều khiến điều này đáng đọc thay vì bị gạt bỏ là bản xem trước thực sự giành được những chiến thắng. Nó đánh bại GPT-6 Sol trên GPQA Diamond, trên τ²-Bench về sử dụng công cụ tác tử, và trên một phép đo ngữ cảnh dài — và nó nhận đầu vào là âm thanh và video, điều mà GPT-6 Sol không làm được. Một bản xem trước bảy tháng tuổi mà vẫn thắng hai trong số những trận đấu đó không phải là một mô hình để gạt bỏ. Đó là một mô hình mà vòng đời của nó, chứ không phải năng lực của nó, mới là vấn đề.

Các con số, và lưu ý về việc điều chỉnh phải luôn đi kèm với chúng

Artificial Analysis chạy lại bộ kiểm thử của mình và công bố lại điểm số theo bản sửa đổi chỉ số hiện hành, nghĩa là cùng một mô hình có thể mang hai con số khác nhau tùy vào thời điểm bạn đọc. Với Gemini 3.1 Pro, mức chênh lệch đó rộng một cách bất thường: các bài đưa tin trước đây về mô hình này báo cáo 57 trên một bản sửa đổi cũ hơn, trong khi trang ở trạng thái hiện nay báo cáo 29.7 trên v4.3.2. Cả hai con số đều xác thực và cả hai đều nằm trên cùng một trang web.

Điều đó quan trọng vì chỉ những con số từ cùng một bản sửa đổi mới có thể trừ cho nhau. 29,7 và 47,6 là cặp nên dùng ở đây, vì cả hai đều đến từ v4.3.2 — cùng lần chạy cho điểm Claude Opus 5.5 là 57,6 và GPT-6 Astra là 52,7. Cách đọc từ cùng lần chạy, mỗi dòng một chiều:

• Chỉ số Thông minh, v4.3.2 — GPT-6 Sol 47,6 so với Gemini 3.1 Pro 29,7
• Chi phí cho mỗi tác vụ chỉ số đã hoàn thành — Gemini 3.1 Pro 1,30 USD so với GPT-6 Sol 1,04 USD; mô hình cũ hơn đắt hơn 25% cho mỗi câu trả lời hoàn chỉnh
• Giá đầu vào — 2,00 USD trên mỗi 1 triệu ở cả hai, ngang bằng ở mức giá niêm yết
• Giá đầu ra — GPT-6 Sol 10,00 USD so với Gemini 3.1 Pro 12,00 USD; Sol rẻ hơn 17%
• Điều khoản ngữ cảnh dài — GPT-6 Sol tính lại giá toàn bộ yêu cầu ở mức 4,00/15,00 USD khi vượt 272.000 token đầu vào; Gemini 3.1 Pro chuyển lên 4,00/18,00 USD khi vượt 200.000
• Cửa sổ ngữ cảnh — GPT-6 Sol 1.050.000 token so với Gemini 3.1 Pro 1.048.576, thực tế là ngang bằng
• Đầu ra tối đa — GPT-6 Sol 128.000 token so với Gemini 3.1 Pro 65.536; Sol gần gấp đôi
• Phương thức đầu vào — GPT-6 Sol văn bản, hình ảnh, tệp so với Gemini 3.1 Pro văn bản, hình ảnh, âm thanh, video, PDF

A two-column comparison scoreboard for GPT-6 Sol and Gemini 3.1 Pro, showing GPT-6 Sol at an Intelligence Index of 47.6, $1.04 per index task and a 128,000-token output ceiling, against Gemini 3.1 Pro at 29.7, $1.30 and 65,536 tokens, with input and output prices of $2.00/$10.00 against $2.00/$12.00 and a preview-since-2026-02-19 chip. A footer reads "Index figures per Artificial Analysis v4.3.2; Gemini 3.1 Pro is a preview product."

Hai dòng ở đó đáng được giải thích kỹ hơn vì chúng đảo ngược cách hiểu hiển nhiên. Dòng chi phí mỗi tác vụ cho thấy bảng giá trông có vẻ rẻ hơn lại thuộc về mô hình đắt hơn tính trên mỗi công việc hoàn thành — mức giá đầu ra $12 của Gemini 3.1 Pro cộng với khối lượng suy luận của nó làm được nhiều việc hơn mức mà giá đầu vào tiêu đề $2 của nó gợi ra. Và bước ngữ cảnh dài đáng để đọc lại ở cả hai phía: bậc của Gemini 3.1 Pro bắt đầu ở 200.000 token, thấp hơn mức 272.000 của GPT-6 Sol, nhưng đặt lại giá đầu ra thành $18.00 trong khi Sol đặt lại thành $15.00. Cả hai đều không phải là bảng giá phẳng, và các điểm giao nhau không trùng khớp.

Nơi bản xem trước vẫn chiếm ưu thế

Mô hình của Goo​gle không phải là một cổ vật. Hãy lấy các đánh giá mà cả hai thẻ đều mang:

• GPQA Diamond — Gemini 3.1 Pro 94,1% so với GPT-6 Sol, không có số liệu tương đương nào được công bố ở bản sửa đổi này
• τ²-Bench về sử dụng công cụ tác tử — Gemini 3.1 Pro 95,6% so với GPT-6 Sol, không được công bố trên cùng bảng
• Khả năng truy hồi ngữ cảnh dài — Gemini 3.1 Pro 82,0% so với GPT-6 Sol 83,7%, chênh lệch 1,7 điểm
• SciCode — Gemini 3.1 Pro 58,7% so với GPT-6 Sol 57,6%, thực tế ngang bằng
• Terminal-Bench 4.0 — Gemini 3.1 Pro 4,0% so với GPT-6 Sol 43,9%; hạng mục duy nhất mà bản xem trước không cạnh tranh được

A screenshot of the Artificial Analysis leaderboard: the top of the table under the Model, Context Window, Creator, Intelligence Index, Cost per Task, Tokens/s, First Chunk and Response headings - Claude Opus 5.5 (max with fallback) at 58, Claude Sonnet 5.5 at 56, Claude Fable 5.1 at 53, GPT-6 Astra (max) at 53 and $3.26, Gemini 4 Argon (high) at 53 and GPT-6.1 Sol (max) at 52 and $0.72 - with the Gemini 3.1 Pro Preview row set below it, showing an index of 30 at $1.30 per index task, 67M tokens generated and 22M output tokens at 23.40 tokens per second.

94,1% trên GPQA Diamond và điểm sử dụng công cụ dạng tác tử 95,6% là những con số tiên phong, không phải những con số thuộc thế hệ cũ, và chúng là lý do khiến khoảng cách chỉ số 17,9 điểm phóng đại khoảng cách thực tế. Chỉ số này là một chỉ số tổng hợp từ mười bài đánh giá, và các điểm thua kém của Gemini 3.1 Pro tập trung ở những chỗ bộ đánh giá dồn trọng số mạnh cho kỹ thuật phần mềm — Terminal-Bench 4.0 ở mức 4,0% là một điểm ngoại lai thảm hại bên cạnh 58,7% ở SciCode và 73,8% ở Terminal-Bench 2.1 của nó. Một mô hình đạt điểm gần đỉnh ở một chuẩn đánh giá tác tử và gần đáy ở bản kế nhiệm của nó đang cho bạn biết về ngày huấn luyện của nó, chứ không phải về mức trần của nó.

Đầu vào âm thanh và video là lợi thế cụ thể còn lại, và nó là một điều kiện có/không chứ không phải một thang liên tục. Nếu pipeline của bạn nhận bản ghi cuộc họp hoặc ảnh chụp màn hình làm đầu vào, Gemini 3.1 Pro có thể tham gia vào đó còn GPT-6 Sol thì không. Dù dẫn đầu về chỉ số đến đâu cũng không thể thay thế được điều đó.

Cái giá cụ thể mà trạng thái "vẫn đang trong bản xem trước" khiến bạn phải trả

Trạng thái xem trước không phải là một nhãn hình thức, và những chi phí đó là loại chỉ xuất hiện sau khi bạn đã xây dựng dựa trên một thứ gì đó.

Một điểm cuối bản xem trước không kèm cam kết về tính khả dụng chung, nghĩa là nhà cung cấp chưa hứa rằng mô hình vẫn sẽ tồn tại theo một lịch trình mà bạn có thể lên kế hoạch dựa vào. Nó cũng không kèm ngày ngừng hoạt động, nghe có vẻ như phiên bản tốt của điều đó — không có gì bị ngừng sử dụng — nhưng cũng có thể hiểu theo hướng ngược lại: Goo​gle đã không công bố vòng đời cho một mô hình đã ở trạng thái này từ tháng Hai trong khi vẫn phát hành các mô hình hạng Flash suốt cùng giai đoạn đó. Gemini 3.8 Flash, Gemini 3.5 Flash-Lite, dòng 3.6 và 3.8 Flash: hạng Pro vẫn giữ nguyên vị trí cũ, và sản phẩm kế nhiệm thay vào đó là Gemini 4 Argon, được Goo​gle công bố vào ngày 30 tháng 9 năm 2026 trong một đợt triển khai theo từng giai đoạn cho một nhóm đối tác bảo mật được nêu tên, cũng không kèm ngày khả dụng chung nào.

Đó mới là khuôn mẫu mà phép so sánh này thực sự nói tới. Nếu bạn xây dựng một pipeline bền vững trên Gemini 3.1 Pro Preview, bạn đang xây trên một mô hình mà chính nhà cung cấp của nó còn chưa nói khi nào nó sẽ tốt nghiệp, bị thay thế hay bị khai tử. Vị thế của GPT-6 Sol thì ngược lại: nó là một sản phẩm API được cung cấp rộng rãi với bảng giá đã công bố, và kể từ ngày 7 tháng 10 năm 2026, nó cũng là mặc định trong ứng dụng mà phần lớn đồng nghiệp của bạn dùng. Theo báo cáo từ nhà cung cấp và đến nay vẫn chưa được tái lập, Ope​nAI nói rằng trong ChatGPT, GPT-6 soạn câu trả lời bằng văn bản, đồ họa, biểu đồ và các điều khiển tương tác thông qua một năng lực mà họ gọi là Intelligent UI, những câu trả lời cần tìm kiếm web bắt đầu sớm hơn 44% so với GPT-5.6 Instant, và mức nỗ lực Extra High bắt đầu phản hồi nhanh ngang với GPT-5.6 ở mức Medium. Không điều nào trong số đó thay đổi một tích hợp API. Tất cả những điều đó là lý do vì sao GPT-6 giờ đây là mặc định hiện diện khắp nơi, còn bản preview thì không.

Cũng có một phiên bản đơn giản của lập luận. Bạn đang trả nhiều hơn 25% cho mỗi tác vụ đã hoàn thành, với điểm năng lực thấp hơn, cho một mô hình mà vòng đời không được công bố. Phản lập luận là có thật — bạn nhận được GPQA Diamond ở mức 94,1% và đầu vào âm thanh — nhưng đó là lập luận cụ thể cho một khối lượng công việc cụ thể, không phải lý do chung để ưu tiên mô hình cũ hơn.

Thử một bản xem trước mà không đặt cược vào nó

Sai lầm cần tránh với một mô hình ở vị thế của Gemini 3.1 Pro là coi "liệu chúng ta có nên dùng nó" như một quyết định nhị phân duy nhất. Thực tế không phải vậy. Cả Gemini 3.1 Pro Preview lẫn GPT-6 Sol đều nằm trong danh mục của OrcaRouter phía sau một endpoint tương thích Ope​nAI và một khóa duy nhất, với mức chênh 0% so với giá niêm yết của nhà cung cấp — nên bản preview là thứ bạn có thể đưa vào một luồng request thực tế, đo lường dựa trên chính khối lượng công việc của mình, rồi giữ lại hoặc loại bỏ mà không cần hợp đồng nhà cung cấp thứ hai hay thay đổi mã nguồn.

Chuyển đổi dự phòng tự động là điều khiến việc đó trở nên an toàn cho một mô hình đang trong vòng đời bản xem trước. Định tuyến lưu lượng âm thanh và video tới Gemini 3.1 Pro, nơi nó là mô hình duy nhất trong hai mô hình có thể nhận đầu vào; định tuyến lưu lượng kỹ thuật phần mềm và đầu ra dài tới GPT-6 Sol; và cấu hình dự phòng sao cho nếu endpoint bản xem trước bị ngừng hỗ trợ, bị giới hạn tần suất hoặc bị điều chỉnh giá âm thầm, yêu cầu sẽ chuyển đến một mô hình được cung cấp rộng rãi thay vì thất bại. Đó là cấu trúc mà một bản xem trước bảy tháng tuổi giành được — không phải sự né tránh, mà là một con đường không phụ thuộc vào nó.

Nếu bạn muốn tiến xa hơn, routing DSL kết hợp nhiều mô hình thành một lời gọi logic, nhờ đó một yêu cầu có thể được thử với Gemini 3.1 Pro và GPT-6 Sol, rồi câu trả lời được chọn theo tiêu chí của riêng bạn thay vì theo một nhà cung cấp. Model fusion làm điều tương tự theo hướng ngược lại — một hội đồng mô hình cùng trả lời một câu hỏi — đây là cách hợp lý để tìm ra những điểm mạnh cụ thể của một bản xem trước đáng để chi trả ở đâu trước khi cam kết dành một lộ trình sản xuất cho nó.

A screenshot of the OrcaRouter model page for google/gemini-3.1-pro-preview, showing the Google vendor label, a 2026-02-19 release date, a 1M-token context window, a 65K-token maximum output, text, image, audio, video and file input, and pricing of $2.00 per million input tokens and $12.00 per million output tokens.

Phán quyết, và con số cần theo dõi

Đối với công việc mới, GPT-6 Sol là lựa chọn an toàn hơn ở bốn trong sáu chiều quyết định một đợt triển khai, và nó rẻ hơn trên mỗi tác vụ hoàn thành trong khi đạt điểm cao hơn 17,9 điểm chỉ số ở cùng bản sửa đổi. Với các khối lượng công việc cần đầu vào âm thanh hoặc video, hoặc khi mức 94,1% GPQA Diamond chính là thứ bạn đang mua, Gemini 3.1 Pro Preview vẫn thắng và nhãn bản xem trước là một rủi ro cần quản lý chứ không phải lý do để bỏ qua.

Con số cần để mắt không phải là chỉ số. Mà là ngày trên tên endpoint của Gemini 3.1 Pro. Khi hậu tố preview được bỏ đi — hoặc khi Argon đạt mức sẵn sàng chung với một định danh API thực sự — thì sự so sánh này thay đổi hoàn toàn về hình hài, và khoảng cách bảy tháng giữa lần phát hành gần nhất của hạng Pro và hôm nay trở thành điều mà bài viết xoay quanh.

So sánh trong bài viết này3

Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày