
GPT-6.1 Sol vs Gemini 3.1 Pro: Bảy tháng xem trước so với tám ngày phát hành
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-2952Trí tuệ
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-2856Trí tuệ
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 161 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIGrok 4.72026-09-2146Trí tuệ
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 79 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 320 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 53 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 301 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 232 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Gemini 3.1 Pro đã nằm trong bảng giá của nhà cung cấp suốt bảy tháng rưỡi và chưa từng rời khỏi trạng thái preview. Được công bố ngày 19 tháng 2 năm 2026, được ghi nhận hôm nay tại một endpoint kết thúc bằng -preview, không có cam kết nào về tính khả dụng chung và — đáng nói hơn — cũng chẳng có ngày ngừng hoạt động. GPT-6.1 Sol mới tám ngày tuổi, ra mắt ngày 29 tháng 9 năm 2026 với mức giá $2.00 cho mỗi triệu token đầu vào và $10.00 cho mỗi triệu token đầu ra. Đặt chúng cạnh nhau trên Chỉ số Trí tuệ của Artificial Analysis, bản preview bảy tháng tuổi không chỉ đơn thuần là cạnh tranh — nó chỉ còn cách mô hình mới hơn 22 điểm trên bản sửa đổi chỉ số mới nhất — 29.7 so với 51.8 trên v4.3.2 — trong khi lại tốn hơn 1.8× chi phí cho mỗi tác vụ chỉ số, $1.30 so với $0.72. Chính sự kết hợp đó khiến phép so sánh này trở nên thú vị chứ không phải một thủ tục hình thức: trên bảng xếp hạng này, mô hình cũ hơn vừa thua kém về năng lực vừa đắt hơn về chi phí, một thế trái ngược đối với một bản preview lẽ ra phải được nâng cấp chính thức. Nhưng lưu ý về bản sửa đổi chỉ số lại quan trọng ở đây hơn bất kỳ chỗ nào khác trong bộ này, bởi vì cả 29.7 lẫn 53 đều được trích dẫn trên cùng một trang web và chúng không phải là cùng một phép đo.
Cả hai đều là những mô hình đa phương thức lớn với cửa sổ ngữ cảnh cấp 1M. Gemini 3.1 Pro nhận văn bản, hình ảnh, video, âm thanh và PDF với hạn mức đầu ra 65.536 token và bậc giá 200.000 token, trên mức đó đơn giá sẽ tăng gấp đôi. GPT-6.1 Sol nhận văn bản, hình ảnh và tệp với cửa sổ 1.050.000 token, hạn mức đầu ra 128.000 token, năm mức nỗ lực suy luận và một bậc ngữ cảnh dài trên 272.000 token prompt. Một bên là sản phẩm đã phát hành kèm cam kết hỗ trợ. Bên kia là bản xem trước với vòng đời không xác định, và hóa ra khác biệt đó đáng giá hơn cả khoảng cách chỉ số.
Số chỉ mục cần được đính kèm bản sửa đổi của nó.
Artificial Analysis chạy lại bộ kiểm thử của mình và công bố lại điểm số theo bản sửa đổi chỉ số hiện hành, nghĩa là cùng một mô hình có thể mang hai con số khác nhau tùy vào thời điểm bạn xem. Với Gemini 3.1 Pro, khoảng cách đó rộng một cách bất thường: các bài đưa tin trước đây của toà soạn về mô hình này báo cáo 57 trên một bản sửa đổi cũ hơn, trong khi trang ở trạng thái hiện tại hôm nay báo cáo 29.7 trên v4.3.2, phiên bản mười đánh giá cũng mang điểm 51.8 của GPT-6.1 Sol. Cả hai con số đều là thật và cả hai đều nằm trên cùng một website.
Điều này có ý nghĩa gì đối với một phép so sánh thì hẹp và quan trọng. Chỉ những con số từ cùng một bản sửa đổi mới trừ được cho nhau. Một 29,7 và một 51,8 từ v4.3.2 tạo ra khoảng cách 22 điểm; một 57 và một 51,8 tạo ra khoảng cách năm điểm theo chiều ngược lại. Con số 22 điểm là con số cần dùng ở đây, vì đó là con số mà cả hai mô hình được đo bằng cùng một bộ kiểm thử trên cùng một thang đo — và vì các con số chi phí trên mỗi tác vụ, $1,30 so với $0,72, đến từ chính lần chạy đó.
• Chỉ số trí tuệ, v4.3.2 — GPT-6.1 Sol 51,8 so với Gemini 3.1 Pro 29,7
• Chi phí cho mỗi tác vụ đánh chỉ mục — GPT-6.1 Sol $0.72 so với Gemini 3.1 Pro $1.30
• Chi phí chạy toàn bộ suite — GPT-6.1 Sol $1,082 so với Gemini 3.1 Pro $1,935
• Cửa sổ ngữ cảnh — GPT-6.1 Sol 1.050.000 token so với Gemini 3.1 Pro 1.000.000 token
• Đầu ra tối đa — GPT-6.1 Sol 128.000 token so với Gemini 3.1 Pro 65.536 token
• Các phương thức đầu vào — văn bản, hình ảnh và tệp trên cả hai, cùng với video, âm thanh và PDF trên Gemini 3.1 Pro
Hai trong số những dòng đó nghiêng về bản xem trước và đáng được nói thẳng. Gemini 3.1 Pro chấp nhận video và âm thanh, điều mà GPT-6.1 Sol không làm được; nếu pipeline của bạn nạp bản ghi màn hình hoặc cuộc gọi, đó là khoảng cách năng lực mà không điểm số nào bù đắp được. Và mức trần đầu ra 65.536 token của nó chỉ bằng một nửa của GPT-6.1 Sol, điều này quan trọng với việc tạo nội dung dài nhưng hiếm khi thành ràng buộc trong công việc agentic, nơi đầu ra ngắn và số lượt nhiều.
Tại sao con số mới hơn lại là thứ nên thay đổi quyết định của bạn
Câu hỏi về giá thú vị hơn câu hỏi về chỉ số.
Bảng giá của Gemini 3.1 Pro là $2,00 cho đầu vào và $12,00 cho đầu ra mỗi triệu token, với đầu vào cache ở mức $0,20 và ghi cache ở mức $0,375, cùng ngưỡng bậc tại 200.000 token prompt; trên mức đó, giá trở thành $4,00 và $18,00. GPT-6.1 Sol là $2,00 cho đầu vào và $10,00 cho đầu ra, với đầu vào cache ở mức $0,10, ghi cache ở mức $2,50, và ngưỡng tại 272.000 token; trên mức đó, giá của nó trở thành $4,00 và $15,00. Giá đầu vào niêm yết là như nhau. Giá đầu ra thấp hơn 20% ở GPT-6.1 Sol, và bước giá cho ngữ cảnh dài thấp hơn ở cả hai trục. Điểm mà hai bảng giá tách biệt là cache: $0,10 so với $0,20 mỗi triệu token đầu vào cache, với mô hình preview ghi cache rẻ hơn, ở mức $0,375 so với $2,50.

Cặp cuối cùng đó đảo ngược cách hiểu thông thường. Nếu khối lượng công việc của bạn nặng về cache — một system prompt cố định dài được gửi lại mỗi lượt, hoặc một tài liệu được đọc lại xuyên suốt một phiên — thì dòng ghi cache của Gemini 3.1 Pro rẻ hơn đáng kể, còn dòng đọc cache của nó thì gấp đôi. Mô hình nào thắng phụ thuộc vào số lần bạn đọc lại những gì mình đã ghi, và đó là con số mà log của chính bạn có còn không benchmark nào công bố. Điều không hề mơ hồ là chi phí theo chỉ số: với cùng một công việc đánh giá, mô hình tám ngày tuổi hoàn thành rẻ hơn 33%, còn tính chung, bản preview bảy tháng tuổi hoàn thành đắt hơn 79% so với mô hình mới hơn.
Badge xem trước là thực tế vận hành
Đây là phần của phép so sánh mà một bảng điểm không thể truyền tải, và đối với một triển khai production thì nó quan trọng hơn tất cả những gì ở trên.
Gemini 3.1 Pro đã ở trạng thái preview từ tháng Hai mà không có thông báo phát hành chính thức (general availability) và cũng không có ngày ngừng hoạt động. Cả hai sự thiếu vắng này đều quan trọng, và chúng tác động theo hai hướng ngược nhau. Không có GA nghĩa là không có cam kết về vòng đời: các endpoint preview không được hưởng những điều khoản thông báo ngừng hỗ trợ giống như các endpoint đã phát hành chính thức, và có thể bị chỉnh sửa ngay dưới chân người gọi mà không cần tăng phiên bản — đó chính là lý do tiêu chuẩn để ghim một định danh model chính xác trong môi trường production thay vì dùng alias. Không có ngày ngừng hoạt động cũng có nghĩa là bạn không thể lên kế hoạch cho một cửa sổ di trú — model này đã tồn tại lâu hơn cả quý mà mọi người kỳ vọng nó sẽ tốt nghiệp, và dòng model này từng đóng một model Pro trước đây rồi.
Vị thế của GPT-6.1 Sol là hình ảnh phản chiếu. Nó mới ra đời được tám ngày, nghĩa là hồ sơ đánh giá độc lập của nó chỉ sâu một cấu hình và các chế độ lỗi của nó chưa được ghi nhận; không có kho dữ liệu người thực hành nào để tham khảo khi nó hoạt động sai. Bản thân việc phát hành nó đã là tin tức, và nó được tung ra dưới một cấu trúc hỗ trợ mà bản xem trước không có.
Đó là những rủi ro khác nhau, không phải những mức độ rủi ro khác nhau. Chọn bản xem trước và bạn đang đặt cược rằng nhà cung cấp sẽ tiếp tục phục vụ một endpoint mà không có nghĩa vụ hợp đồng nào buộc họ phải làm vậy. Chọn mô hình mới ra mắt được tám ngày và bạn đang đặt cược rằng một lần chạy benchmark cùng tám ngày khả dụng là đủ bằng chứng cho workload của bạn. Chỉ số sẽ không giúp ích gì cho cả hai.
Điều duy nhất có thể khiến việc này trở nên dễ dàng
Một thông báo về tính khả dụng chung cho Gemini 3.1 Pro, với định danh mô hình nằm ngoài -preview không gian tên và cam kết vòng đời được công bố, sẽ giải quyết phần lớn vấn đề này. Nó sẽ không thu hẹp khoảng cách chỉ số 22 điểm hay khoảng cách chi phí 1,8× trên mỗi tác vụ, nhưng nó sẽ loại bỏ rủi ro khấu hao hiện đang khiến việc so sánh trở nên lệch lạc, và nó sẽ cho phép một nhóm áp dụng mô hình mà không cần ghim một định danh bản xem trước rồi chỉ biết hy vọng.
Việc không có thông báo đó, sau bảy tháng rưỡi, tự nó đã là thông tin. Một bản xem trước được dự định để xác thực các bản cập nhật trước khi chuyển sang GA “sớm”, theo cách diễn đạt hồi tháng Hai của nhà cung cấp, đã có trọn hai quý để làm việc đó. Hoặc quá trình xác thực vẫn đang diễn ra, hoặc bản xem trước chính là sản phẩm — và bên gọi không thể phân biệt được điều nào từ bên ngoài. Điều bên gọi có thể làm là định giá sự không chắc chắn và định tuyến tương ứng.
Cả hai đều trên cùng một khóa, nên câu trả lời có thể theo từng workload

Gemini 3.1 Pro có mặt trên OrcaRouter với đúng mức giá niêm yết của riêng nó — $2.00 / $12.00, tăng lên $4.00 / $18.00 khi vượt 200.000 token prompt, với mức đọc cache là $0.20. GPT-6.1 Sol có mặt trên OrcaRouter với giá $2.00 / $10.00, tăng lên $4.00 / $15.00 khi vượt 272.000 token prompt, với mức đọc cache là $0.10. Giá niêm yết của nhà cung cấp áp dụng cho cả hai, không cộng thêm gì, một khóa và một hóa đơn.
Điều đó khiến những phần khó xử của so sánh này trở nên dễ giải quyết với chi phí thấp. Việc tiếp nhận video và âm thanh vẫn nằm ở preview vì không thành phần nào khác trong cặp chấp nhận nó; còn khối lượng lớn công việc văn bản và lập trình thì chuyển sang mô hình mới hơn, vốn rẻ hơn trên mỗi tác vụ và rẻ hơn 33% trên cùng một công việc đánh giá. Nếu endpoint preview bị sửa đổi hoặc rút lại, failover tự động sẽ chuyển các lệnh gọi đó sang một tuyến khác thay vì để chúng thất bại — đó chính là biện pháp phòng ngừa cụ thể mà rủi ro vòng đời của một preview đòi hỏi. Và vì cả hai đều nằm sau một endpoint tương thích OpenAI, so sánh giá thực sự quan trọng có thể được chạy trên lưu lượng của chính bạn trong một buổi chiều thay vì tranh luận dựa trên bảng giá.

Cách lý giải có thể bảo vệ được, vậy thì, không phải là mô hình nào tốt hơn. Mà là hai mô hình này được định giá gần tương đương nhau trong khi cách nhau bảy tháng về độ trưởng thành trong vòng đời và 22 điểm trên bảng xếp hạng độc lập hiện tại, đồng thời những lợi thế thực sự của mô hình xem trước — đầu vào video và âm thanh, ghi cache rẻ — là hẹp và cụ thể. Nếu khối lượng công việc của bạn cần những phương thức đó, Gemini 3.1 Pro là lựa chọn duy nhất trong hai, và khoảng cách chỉ số là cái giá phải trả để tham gia. Nếu không, bạn đang được cung cấp một endpoint xem trước với tương lai để ngỏ tại chi phí mỗi tác vụ cao hơn 80% so với một mô hình ra mắt tuần trước, và nghĩa vụ chứng minh lại nằm ở phía ngược lại.
