
Gemini 3.1 Pro vs Qwen3.8-27B: Bản xem trước sớm bảy tháng so với một checkpoint bạn có thể tải xuống
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 trên 1 triệu token
- orcaMỚIOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- anthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0345Trí tuệ76Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3134Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
Vào ngày 18 tháng 9 năm 2026, người dùng trên chính diễn đàn dành cho nhà phát triển AI của nhà cung cấp bắt đầu báo cáo rằng Gemini 3.1 Pro đã biến mất khỏi trình chọn mô hình của AI Studio — kể cả các tài khoản trả phí, bất chấp việc xóa bộ nhớ đệm và dùng cửa sổ ẩn danh. Chuỗi thảo luận yêu cầu nhà cung cấp cho biết liệu đó là "một lỗi hay là chủ đích" vẫn còn mở vào ngày 21 tháng 9. Không có thông báo ngừng hỗ trợ, không có lộ trình chuyển đổi, và cũng không có phản hồi nào từ nhân viên. Trong khi đó Qwen3.8-27B, thứ mà phòng thí nghiệm đã mở mã nguồn vào ngày 14 tháng 8 theo giấy phép Apache 2.0, thì không thể bị lấy đi khỏi bất kỳ ai đã tải nó về. Chính sự bất đối xứng đó — chứ không phải khoảng cách điểm chuẩn, vốn là thật nhưng không lớn — mới là điều mà cuộc so tài này thực sự xoay quanh, và đó là lý do hai mô hình không thực sự cạnh tranh cho cùng một vị trí, dù các bảng so sánh đặt chúng cạnh nhau.
Những gì sau đây là phần đối chiếu trực tiếp trên các con số hiện có, với mỗi con số đều được ghi nhãn: số liệu của Artificial Analysis từ các bản chụp được thực hiện vào ngày 23 tháng 9 năm 2026, thẻ mô hình của chính Alibaba, bài đăng ra mắt của Google, và dữ liệu từ xa về định tuyến của chính chúng tôi, được giữ tách biệt xuyên suốt. Ở đâu chưa đo lường được gì, trang này nói rõ như vậy thay vì đoán.
Điều gì đã xảy ra trong tuần này, và điều đó có nghĩa gì và không có nghĩa gì
Các báo cáo rất cụ thể và đến từ chính diễn đàn của Google chứ không phải blog của một đối thủ cạnh tranh. Một luồng có tiêu đề "Gemini 3.1 Pro mất tích khỏi AI Studio từ 2026-09-18 — lỗi hay cố ý?" mô tả việc người dùng trả phí mất mô hình mà không hề có thông báo nào, bộ phận hỗ trợ Google One đưa ra những bước khắc phục sự cố không liên quan, và trang trạng thái của Google không cho thấy có gì sai. Một luồng thứ hai, "Mô hình Gemini 3.1 Pro Preview không khả dụng trong AI Studio để xây dựng App", cũng ghi nhận cùng khiếu nại đó, trong đó có một người dùng có trợ lý lập trình đã được xây dựng trên bản xem trước này suốt nhiều tháng và nói rằng Flash "tạo ra rác" trên mã nguồn của họ.
Ba lưu ý thẳng thắn. Đây là sự biến mất khỏi bảng điều khiển dành cho nhà phát triển, không phải sự cố API đã được xác nhận: Gemini 3.1 Pro vẫn được liệt kê và có thể định tuyến trên danh mục của chính chúng tôi, nơi nó đã xử lý 94,7 triệu token trong bảy ngày qua. Đây là thông tin do người dùng báo cáo — Google chưa nói gì, nên không ai ngoài Google có thể phân biệt "âm thầm khai tử" với "vấn đề công suất" với "lỗi bảng điều khiển". Và thời điểm này cũng chẳng mấy hay ho, khi mà mô hình này đã ở bản xem trước kể từ ngày 19 tháng 2 năm 2026 — bảy tháng, không có ngày GA nào được công bố, trong khi Google tung ra cả một loạt mô hình Flash ở phân khúc bên dưới. Riêng GitHub Copilot đã ngừng hỗ trợ Gemini 3.1 Pro vào ngày 1 tháng 9 năm 2026 với thông báo trước 30 ngày, đây là một sự kiện khác và không liên quan, nhưng nó cũng chỉ về cùng một hướng: một endpoint bản xem trước không có cam kết GA là một phụ thuộc mà bạn hoàn toàn được phép lo lắng.
Một con số từ phía chúng tôi đáng để đặt bên cạnh bối cảnh đó, vì chúng tôi không thể giải thích được nó và thà nói rõ điều đó. Dữ liệu telemetry bảy ngày của chúng tôi trên mục Gemini 3.1 Pro trong danh mục cho thấy tỷ lệ lỗi 80,5%; các mô hình lân cận mà chúng tôi kiểm tra cùng buổi sáng — Qwen3.8-Max, Claude Fable 5.1 — ở mức 5,9% và 6,9%. Chúng tôi không biết liệu đó có phải là cùng vấn đề mà diễn đàn đang báo cáo, một tuần tồi tệ đối với một nhà cung cấp thượng nguồn, hay một tạo tác của hệ thống đo lường. Hãy coi đó là lý do để chạy canary trước khi bạn cam kết, chứ không phải là phán quyết về mô hình.
Cùng một thước đo, hai điểm số khác nhau
Đây là phần mà hầu hết các trang so sánh đều làm sai, nên cần được xử lý cẩn thận. Artificial Analysis chấm điểm cả hai mô hình này trên Intelligence Index v4.3.2. Chúng tôi đã ghi lại cả hai trang vào ngày 23 tháng 9 năm 2026 và cả hai đều mang cùng một bản sửa đổi — vì vậy, không giống như hầu hết các tuyên bố chỉ số giữa các mô hình, trường hợp này là cùng một ảnh chụp nhanh và khoảng cách là có thật.
• Qwen3.8-27B (xhigh) — Chỉ số Trí tuệ 33.7
• Gemini 3.1 Pro Preview — Chỉ số Trí tuệ 29.7
Qwen dẫn đầu với cách biệt bốn điểm trên thước đo hiện tại. Câu hỏi khó hơn là điều đó có nghĩa gì, vì bản thân thước đo đã thay đổi ít nhất ba lần trong năm nay. Vào tháng Hai, Artificial Analysis đã công bố một bài viết gọi Gemini 3.1 Pro Preview là "nhà lãnh đạo mới trong AI", hơn Claude Opus 4.6 bốn điểm, và báo chí thời điểm đó đưa tin về điểm số 57 trên thứ khi đó là Index v4.0. Trên v4.3.2, con số là 29.7. Artificial Analysis công bố v4.3 vào ngày 7 tháng 9 năm 2026, bốn ngày sau v4.2, và bản sửa đổi đã thay Terminal-Bench 2.1 bằng Terminal-Bench 4.0 khó hơn nhiều với 66 tác vụ, đồng thời thay τ³-Banking bằng AutomationBench-AA. Những điểm mạnh hồi tháng Hai của Gemini 3.1 Pro nằm trong các đánh giá mà chỉ số mới đã loại bỏ hoặc điều chỉnh trọng số. Vậy nên: mô hình không trở nên kém hơn, mà bài kiểm tra thì có. Nhưng nếu bạn đang chọn một mô hình hôm nay, con số của hôm nay mới là con số bạn thực sự có thể dựa vào để hành động, và con số của hôm nay đang ủng hộ Qwen.
Nơi hai điều đó thực sự khác biệt
Điểm tổng hợp che mất hình dạng của sự khác biệt, mà hình dạng mới là phần hữu ích. Mọi con số dưới đây đều đến từ cùng một bản chụp ngày 23 tháng 9 các trang v4.3.2 của Artificial Analysis cho cả hai mô hình, trên cùng một bản sửa đổi.
• Suy luận và kiến thức — Gemini dẫn đầu rõ ràng. GPQA Diamond 94.1 so với 90.5; Humanity's Last Exam 47.0 so với 33.9; SciCode 58.7 so với 46.6; CritPt 17.7 so với 5.4.
• Nhiệm vụ nghề nghiệp trong thực tế — Qwen dẫn đầu, và dẫn trước rất xa. GDPval được chuẩn hóa 45,4% so với 13,8%.
• Ngân hàng và giao dịch dạng tác tử — Qwen dẫn đầu. τ-Banking 48.0 so với 21.4 của Gemini.
• Sử dụng công cụ dạng tác tử trên một bộ đánh giá tổng quát — Gemini dẫn đầu ở nơi Qwen không được đo lường. τ²-Bench 95,6 cho Gemini; không có số liệu nào cho Qwen3.8-27B tồn tại.
• Công việc trên terminal — sát nút, và cả hai đều kém trên benchmark mới. Terminal-Bench 2.1: Qwen 79.8, Gemini 73.8. Terminal-Bench 4.0: Qwen 5.6%, Gemini 4.0% — cả hai đều chỉ đạt một chữ số.
• Hiệu chuẩn — sự khác biệt rõ nét nhất trên cả hai trang. Trên AA-Omniscience, Gemini đạt 31.9 điểm với độ chính xác 54.9% và tỷ lệ ảo giác 50.9%; Qwen đạt −10.0 điểm với độ chính xác 15.6% và tỷ lệ ảo giác 30.3%. Gemini biết nhiều hơn và bịa ra thông tin trong hơn một nửa số trường hợp; Qwen thường xuyên từ chối trả lời và ảo giác ở khoảng một phần ba những gì nó trả lời.
• Ngữ cảnh dài — ngang bằng tuyệt đối về khả năng truy hồi ngữ cảnh dài, mỗi bên 82,0. Ở khả năng truy hồi ngữ cảnh dài đa phương thức, Qwen 21,7% so với Gemini 15,6%.
Hãy hiểu các mục "không được đo" đúng như bản chất của chúng. Gemini không có chỉ số chuẩn hóa GDPval-AA nào được công bố để đối chiếu với mức 45,4% của Qwen, và Qwen không có chỉ số τ²-Bench, IFBench, Terminal-Bench Hard hay ITBench-SRE nào để đối chiếu với các mức 77,1, 53,8 và 30,3 của Gemini. Mỗi khoảng trống trong số đó là một chỗ mà một bảng tóm tắt hẳn đã âm thầm cài cắm một người thắng.

Sự khác biệt quyết định ngân sách: cùng chi phí để chạy chỉ mục
Qwen3.8-27B rẻ hơn đáng kể trên mỗi token. Theo các số liệu thị trường mà Artificial Analysis công bố, nó có giá 0,50 USD cho mỗi triệu token đầu vào và 3,00 USD cho mỗi triệu token đầu ra, với chiết khấu bộ nhớ đệm 80% và mức giá hỗn hợp theo tỷ lệ 7:2:1 là 0,47 USD. Gemini 3.1 Pro Preview có giá 2,00 USD và 12,00 USD — gấp bốn lần giá đầu vào và gấp bốn lần giá đầu ra — với chiết khấu bộ nhớ đệm 90% và mức giá hỗn hợp là 1,74 USD.
Rồi đến con số mà không ai công bố: cách hạch toán của chính Artificial Analysis đặt chi phí chạy toàn bộ Intelligence Index ở mức $1,310.21 cho Gemini 3.1 Pro Preview và $1,335.92 cho Qwen3.8-27B. Qwen không hề rẻ hơn để chạy. Nó chỉ đắt hơn một chút, vì nó mất nhiều thời gian hơn để đi đến đích. Trong hóa đơn đầu ra của Qwen, $512.36 là token suy luận so với $82.51 cho câu trả lời thực tế; còn của Gemini, $691.82 là suy luận so với $113.08 cho câu trả lời. Giá mỗi token là một đơn giá, không phải một hóa đơn.
Thêm hai sự thật về giá mà các bảng so sánh bỏ qua. Thứ nhất, giá của Gemini 3.1 Pro được chia bậc theo kích thước đầu vào của mỗi yêu cầu: $2.00/$12.00 cho tới 200K token đầu vào, rồi $4.00/$18.00 khi vượt mức đó, với các lượt đọc cache tăng gấp đôi từ $0.20 lên $0.40. Cửa sổ ngữ cảnh một triệu token là có thật, nhưng 800.000 token cuối cùng của nó tốn gấp đôi. Thứ hai, mục trong danh mục của chính chúng tôi cho Qwen3.8-27B — được phục vụ ở block-FP8, tháp thị giác ở độ chính xác đầy đủ — niêm yết $0.40 cho đầu vào và $4.21 cho đầu ra, rẻ hơn về đầu vào và đắt hơn về đầu ra so với con số thị trường ở trên, và không công bố mức giá token được cache nào cả. Nhà cung cấp khác nhau, cách phân chia khác nhau. Hãy kiểm tra mức phí mà bạn thực sự sẽ bị tính.
Cả hai mô hình đều có thể truy cập được thông qua một khóa OrcaRouter duy nhất theo giá niêm yết của nhà cung cấp với mức markup 0%, nên khi nhà cung cấp thay đổi giá, thay đổi đó đến phía chúng tôi ngay trong ngày thay vì sau một chu kỳ định giá lại — điều này càng quan trọng hơn mức thông thường khi một trong hai mô hình có ranh giới bậc nằm ở 200K token.
Độ trễ: token đầu tiên nhanh nhất thuộc về mô hình chậm hơn
Đây là cặp số gây hiểu nhầm nhất trong toàn bộ phép so sánh, và cũng chính là cặp mà người đọc dễ hành động sai nhất.
• Thời gian đến chunk đầu tiên — Qwen 4,04 giây so với Gemini 28,37 giây. Qwen có vẻ nhanh gấp bảy lần.
• Thời gian để có câu trả lời thực tế — Gemini 28,37 giây so với Qwen 52,52 giây. Gemini nhanh hơn khoảng 1,8 lần, vì Qwen mất 48,48 giây để suy nghĩ giữa chunk đầu tiên và token trả lời đầu tiên.
• Tốc độ đầu ra — Gemini 116,5 token mỗi giây so với Qwen 41,3. Gemini nhanh hơn 2,8 lần khi bắt đầu viết, so với mức trung vị của đối thủ so sánh mà Artificial Analysis đưa ra ở mức 95,4 token mỗi giây. Trang của chính Qwen gọi nó là “chậm rõ rệt”.
Nếu sản phẩm của bạn phát luồng token đầu tiên cho người dùng, thì độ trễ được quảng cáo của Qwen là lời dối trá mà bạn sẽ chỉ tự nhủ một lần. Nếu sản phẩm của bạn chờ đợi một câu trả lời hoàn chỉnh, Gemini mới là mô hình nhanh hơn. Cả hai con số đều là kết quả đo của Artificial Analysis; cả hai đều được thực hiện ở thiết lập nỗ lực xhigh của Qwen, vốn là mặc định trên thẻ mô hình.
Mặc định đó đang là một lời phàn nàn thực tế giữa những người hành nghề, và thẻ mô hình cũng thừa nhận một nửa điều đó. Qwen3.8-27B cung cấp một tham số reasoning_effort với ba mức — xhigh (mặc định, "dành cho các tác vụ phức tạp đòi hỏi phân tích kỹ lưỡng"), medium, và low. Các bài viết cộng đồng tính đến tháng Chín báo cáo rằng xhigh tạo ra các pha suy luận rất dài và khuyến nghị hạ xuống medium hoặc low và giới hạn ngân sách suy luận. Thẻ của chính Alibaba cảnh báo rằng trong công việc agentic nhiều lượt, việc giảm effort "không phải lúc nào cũng làm giảm tổng thời gian hoàn thành tác vụ" — đó là một điều thẳng thắn để một thẻ mô hình nói ra và là một lời cảnh báo rằng cách khắc phục hiển nhiên không phải lúc nào cũng là cách khắc phục.
Ngữ cảnh: 1M so với 262K, và điều gì thực sự phù hợp
Gemini 3.1 Pro có cửa sổ ngữ cảnh 1.000.000 token với đầu ra tối đa 65.536 token. Qwen3.8-27B có sẵn 262.144 token, có thể mở rộng lên 1.000.000 bằng YaRN scaling, với các hạn mức riêng được khuyến nghị bên trong: nội dung suy luận tối đa 262.144 và phản hồi cuối cùng tối đa 131.072.
Hai chú thích chân trang trung thực. Bảng thông số của Artificial Analysis liệt kê cửa sổ của Qwen là 256.000, trong khi phần FAQ của chính mình lại ghi 260K và thẻ mô hình ghi 262.144 — đó chỉ là những khác biệt do làm tròn trên cùng một con số, nhưng hãy trích dẫn 262.144 vì đó là con số mà thẻ ghi. Còn việc mở rộng lên 1M là một kỹ thuật scaling, không đồng nghĩa với cửa sổ một triệu token gốc: khả năng truy hồi ngữ cảnh dài ở 1M trên một mô hình được mở rộng bằng YaRN không phải là thứ mà chỉ số AA-LCR 82.0 đo lường. Chưa ai công bố điểm truy hồi ngữ cảnh 1M cho Qwen3.8-27B. Hãy coi cửa sổ của Gemini là cửa sổ có hành vi đã được đo lường ở độ dài tối đa, còn cửa sổ của Qwen là cửa sổ bạn nên tự kiểm tra trước khi thiết kế dựa trên nó — và hãy nhớ rằng khi vượt quá 200K token đầu vào, giá của Gemini sẽ tăng gấp đôi.
Công việc tác tử và gọi công cụ
Đây là chỗ cuộc so tài thực sự chưa ngã ngũ, và cũng là chỗ một kẻ thắng được dàn dựng sẽ vừa dễ vừa sai. Qwen3.8-27B có các điểm số agentic được đo lường mà Gemini không có, và ngược lại.
Lập luận của Qwen dựa trên một con số độc lập mạnh mẽ và một con số từ nhà cung cấp cũng mạnh mẽ. Con số độc lập là τ-Banking ở mức 48,0 so với 21,4 của Gemini — cao hơn gấp đôi, trên cùng một phiên bản, trên một benchmark về việc sử dụng công cụ đa bước trong môi trường ngân hàng. Con số từ nhà cung cấp là card của chính Alibaba, liệt kê OSWorld-Verified 84,3, WebArena-Verified 64,8, AndroidWorld 81,9, CoWorkBench 70,7, JobBench 33,4 và Agents' Last Exam 20,4 Pass@1. Đó là các đánh giá của Alibaba, chưa được bất kỳ ai khác chạy lại, và chúng nằm đúng ở những hạng mục mà kết quả GDPval được đo độc lập (45,4% được chuẩn hóa so với 13,8%) chỉ về cùng một hướng.
Lợi thế của Gemini nằm ở chỗ nó có con số agentic tuyệt đối cao duy nhất trong so sánh — τ²-Bench 95,6 — còn Qwen hoàn toàn không có điểm τ²-Bench nào. Nó cũng có IFBench 77,1 cho khả năng tuân thủ chỉ dẫn, thêm một khoảng trống nữa ở phía Qwen. Và nó có thành tích vận hành thực tế bảy tháng mà một bản phát hành trọng số mở năm tuần tuổi không có.
Yếu tố phá vỡ thế cân bằng không phải là điểm số, mà là cấu trúc liên kết của bạn. Lợi thế tác tử của Qwen được đo trên các benchmark nơi mô hình vận hành bên trong một hệ thống phần mềm lớn, có sẵn mà nó không thiết kế. Còn lợi thế của Gemini được đo trên các benchmark nơi mô hình phải tuân theo hướng dẫn một cách chính xác trong thời gian dài. Đó là những kỹ năng khác nhau và cả hai đều có thật.

Lập trình
Việc lập trình cũng phân hóa theo cách tương tự, đó là lý do vì sao câu hỏi “mô hình nào giỏi code hơn” không có câu trả lời dứt khoát ở đây. Gemini dẫn đầu ở nhóm tính toán khoa học — SciCode 58.7 so với 46.6 — và AA Coding Index 68.8 của nó trên trang danh mục của chúng tôi chỉ nằm trong sai số làm tròn so với 68.1 của Qwen, tức nằm gọn trong bất kỳ khoảng tin cậy nào đáng để trích dẫn. Ở mảng tác vụ terminal dạng tác nhân, hai mô hình bám sát nhau trên benchmark cũ hơn, Qwen 79.8 so với Gemini 73.8 trên Terminal-Bench 2.1, và không thể phân biệt được trên benchmark mới hơn, nơi cả hai đều tụt xuống mức một chữ số.
Card của Alibaba công bố cao hơn nhiều — SWE-bench Pro 61.7, LiveCodeBench v6 90.3, QwenSWEBench 79.0 — nhưng đó là số do nhà cung cấp tự báo cáo, và card có chú thích rằng SWE-bench Pro và QwenSWEBench được chạy trong harness Claude Code, vốn không phải harness mà con số của một đối thủ sẽ dùng. Điều có thể khẳng định an toàn là: trên benchmark lập trình duy nhất mà mô hình của cả hai phòng thí nghiệm đều được bên thứ ba đo, hai mô hình cách nhau bốn điểm trên Terminal-Bench 2.1 và 1.6 điểm trên Terminal-Bench 4.0, và cả hai đều kém ở bài khó hơn.
Trọng số mở so với một điểm cuối xem trước
Đây là trục mà trên đó hai thứ hoàn toàn không thể so sánh được với nhau, và cũng là trục có hệ quả thực tiễn lớn nhất.
Qwen3.8-27B dùng Apache 2.0, 27B tham số dense, 64 lớp, với sự kết hợp giữa attention tuyến tính Gated DeltaNet và full attention theo tỷ lệ khoảng 3:1 — thiết kế giúp việc phục vụ cửa sổ 262K trở nên khả thi về chi phí. Nó chạy được. Khi lượng tử hóa xuống 4-bit, nó vừa trong khoảng 17GB, tức là một GPU tiêu dùng; cả một hệ sinh thái nén đã mọc lên quanh nó trong vòng năm tuần, từ các bản lượng tử Dynamic V3 của Unsloth, bao gồm bản dựng 1-bit mà Unsloth nói chạy trong 8GB với độ chính xác khoảng 77% so với bản gốc, cho đến Ternary Bonsai 2 27B của PrismML vào giữa tháng 9. Bạn có thể tinh chỉnh nó, bạn có thể kiểm toán nó, và bạn có thể chạy nó trên một chiếc laptop với mạng đã ngắt kết nối.
Gemini 3.1 Pro là một endpoint xem trước đóng, đã ra đời được bảy tháng, không có ngày GA, với một thẻ mô hình cảnh báo rõ rằng các bản xem trước có thể thiếu tính ổn định, khả năng sẵn có và hỗ trợ của một bản phát hành ổn định, và — tính đến tuần này — một bảng điều khiển dành cho nhà phát triển mà nó dường như đã âm thầm rời bỏ. Bạn không thể tải nó xuống, bạn không thể ghim một phiên bản, và bạn không thể chuyển đổi dự phòng sang chính mình.
Nếu bạn muốn câu trả lời định tuyến trung thực thay vì một phán quyết: sự tồn tại của checkpoint mở chính là thứ khiến sự phụ thuộc vào Gemini có thể chịu đựng được. Hãy đặt Qwen3.8-27B phía sau một đường dẫn cục bộ hoặc tự lưu trữ làm phương án dự phòng, giữ Gemini 3.1 Pro trên đường chính cho công việc nặng về suy luận mà nó tốt hơn một cách đo lường được, và đặt cả hai phía sau một endpoint với chuyển đổi dự phòng tự động sao cho một sự biến mất âm thầm khỏi bảng điều khiển của người khác là một sự cố mà lớp định tuyến của bạn hấp thụ, chứ không phải một sự cố ngừng dịch vụ mà người dùng của bạn nhìn thấy. Đó không phải là lời chào hàng cho một sản phẩm — đó là cấu hình duy nhất mà tin tức tuần này không khiến bạn mất một cuối tuần.
Chọn Gemini 3.1 Pro nếu
• Công việc khó nhất của bạn là suy luận đòi hỏi nhiều kiến thức hơn là sử dụng công cụ trong thời gian dài — nó dẫn trước GPQA Diamond 94,1 so với 90,5, Humanity's Last Exam 47,0 so với 33,9, SciCode 58,7 so với 46,6 và CritPt 17,7 so với 5,4.
• Bạn cần những đầu vào thực sự dài. Một cửa sổ một triệu token được đo lường, với hành vi truy hồi được kiểm nghiệm ở độ dài lớn, sẽ vượt trội hơn một cửa sổ 262K được mở rộng bằng kỹ thuật — miễn là bạn chấp nhận được mức giá tăng gấp đôi khi vượt quá 200K token đầu vào.
• Thời gian để hoàn thành câu trả lời quan trọng hơn thời gian tới token đầu tiên, và bạn muốn 116,5 token mỗi giây thay vì 41,3.
• Bạn cần tính đa phương thức toàn diện ngày nay: đầu vào âm thanh, tệp, hình ảnh, văn bản và video so với văn bản, hình ảnh và video của Qwen.
• Bạn sẵn sàng chấp nhận rủi ro của bản xem trước và bạn có một phương án dự phòng do chính mình kiểm soát.
Chọn Qwen3.8-27B nếu
• Các agent của bạn vận hành bên trong các hệ thống lớn hiện hữu — τ-Banking 48,0 đến 21,4 và GDPval 45,4% đến 13,8% sau chuẩn hóa là hai lợi thế đơn mô hình lớn nhất trong toàn bộ so sánh này.
• Bạn cần một câu trả lời trung thực thay vì tự tin. Tỷ lệ ảo giác 30,3% so với 50,9% của Gemini là một kiểu sản phẩm khác biệt.
• Quy định cấp phép hoặc lưu trú dữ liệu loại trừ API đóng, hoặc bạn cần tinh chỉnh trên dữ liệu của riêng mình.
• Bạn muốn hóa đơn theo token bằng một phần tư của Gemini và chấp nhận rằng bạn sẽ dùng phần chênh lệch đó cho các token suy nghĩ — chi phí chạy chỉ mục là như nhau trên cả hai.
• Bạn sẵn sàng điều chỉnh reasoning_effort xuống thấp hơn mức mặc định xhigh thay vì phát hành nguyên trạng.
Những gì chúng tôi không thể xác minh
Để ghi nhận rõ ràng, và bởi vì một trang so sánh chỉ tốt bằng những chỗ trống của nó: chưa có đánh giá độc lập nào được công bố cho Qwen3.8-27B ở mức nỗ lực suy luận giảm, nên sự đánh đổi giữa tốc độ và chất lượng của nó ở mức trung bình và thấp vẫn chưa được đo lường. Không tồn tại điểm số nhớ lại ngữ cảnh dài nào cho cấu hình 1M mở rộng bằng YaRN. Gemini 3.1 Pro không có điểm chuẩn hóa GDPval-AA nào được công bố, và Qwen3.8-27B cũng không có điểm nào cho τ²-Bench, IFBench hay ITBench-SRE. Và không ai — kể cả Google — đã nói vì sao Gemini 3.1 Pro rời khỏi danh sách chọn của AI Studio vào ngày 18 tháng 9. Chúng tôi sẽ cập nhật trang này khi bất kỳ điều nào trong số đó thay đổi.

So sánh trong bài viết này2
Phát hiện từ bài viết này · Benchmark: Artificial Analysis · cập nhật hằng ngày
