Thẻ tiêu đề hero cho 'Mercury 2.5 Preview vs Gemini 3.1 Pro' với phụ đề 'Hai bản xem trước, cách nhau sáu tháng'. Bảng bên trái có nhãn 'Mercury 2.5 Preview' hiển thị biểu tượng tia sét, viên '256K context' và thẻ 'text only' cùng viên '$0.04 intro'; bảng bên phải có nhãn 'Gemini 3.1 Pro' hiển thị bộ biểu tượng đa phương thức (hình ảnh, âm thanh, video), viên '1M context', huy hiệu 'AA Index 57 at launch' và viên '$2.00 / $12.00'. Huy hiệu mỏng 'vs' nằm giữa hai bảng. Logo OrcaRouter được ghép ở góc dưới bên phải.
Guides & Insights

Mercury 2.5 Preview so với Gemini 3.1 Pro: Hai bản xem trước, cách nhau sáu tháng

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Cả hai mô hình trong cặp so tài này đều mang từ "preview" trong tên gọi, và đó là nơi mọi điểm tương đồng chấm dứt. Mercury 2.5 Preview và Gemini 3.1 Pro đều là các mô hình suy luận bạn có thể gọi từ API ngay hôm nay, nhưng chúng là những bản xem trước ở hai thái cực ngược nhau trong vòng đời của mình. Gemini 3.1 Pro, mô hình suy luận chủ lực, đã ở chế độ xem trước kể từ ngày 19 tháng 2 năm 2026 — với sáu tháng đánh giá độc lập, các thứ hạng trên bảng xếp hạng công khai và lưu lượng vận hành thực tế phía sau, chỉ số Trí tuệ Phân tích Nhân tạo (Artificial Analysis Intelligence Index) đạt 57 khi ra mắt, đầu vào đa phương thức trên văn bản, hình ảnh, âm thanh và video, ngữ cảnh 1 triệu token và mức giá $2.00 / $12.00 cho mỗi triệu token. Mercury 2.5 Preview, LLM khuếch tán của Inception được phát hành ngày 31 tháng 8 năm 2026, mới chỉ hai ngày tuổi: mô hình chỉ hỗ trợ văn bản với ngữ cảnh 256K, tốc độ được công bố là 1.107 token mỗi giây, giá niêm yết $0.20 / $0.75 (khoảng $0.04 / $0.15 khi được giảm giá đến hết ngày 8 tháng 9), và chưa có một bài đánh giá chuẩn độc lập nào. Gọi cả hai là "bản xem trước" che giấu câu hỏi thực sự: lợi thế dẫn trước sáu tháng bằng chứng đáng giá bao nhiêu so với một cách tạo văn bản về cơ bản nhanh hơn.

Mỗi mô hình thực sự là gì

Gemini 3.1 Pro là một mô hình suy luận đa năng hàng đầu, đóng và đa phương thức. Nó đọc được văn bản, hình ảnh, âm thanh và video, xử lý cửa sổ ngữ cảnh 1 triệu token với trần đầu ra 64K, đồng thời điều chỉnh độ sâu suy luận một cách động — nhà cung cấp mô tả bốn cấp độ cường độ suy luận tăng theo độ phức tạp của nhiệm vụ. Các con số ra mắt của nó — ARC-AGI-2 đạt 77,1%, GPQA Diamond đạt 94,3%, SWE-bench Verified đạt 80,6%, Terminal-Bench 2.0 đạt 68,5% — do nhà cung cấp công bố, nhưng chúng nằm trên sáu tháng kiểm định độc lập, bao gồm phép đo lại bởi Artificial Analysis trên thang chỉ số nghiêm ngặt hơn, nơi mô hình đạt khoảng 46,5. Phép đo lại đó chính xác là điều một mô hình trưởng thành xứng đáng có: nó đã bị kiểm thử đủ gay gắt đến mức chỉ số phải trở nên khó hơn xung quanh nó. Mercury 2.5 Preview là một mô hình khuếch tán — nó tạo và tinh chỉnh các token song song thay vì từng cái một — với suy luận có thể điều chỉnh, gọi công cụ song song và JSON khớp schema, được xây dựng cho các khối lượng công việc cộng dồn độ trễ mà Inception nêu tên: tác nhân tìm kiếm, đường ống giọng nói, tác nhân con viết mã. Mọi tuyên bố chất lượng gắn với nó, bao gồm cả bước nhảy hơn 10 điểm so với Mercury 2, đều là của riêng nhà cung cấp, và chưa có bên thứ ba nào đo lường nó.

A screenshot of the Artificial Analysis model page for Inception's Mercury 2, the diffusion model Mercury 2.5 Preview builds on, showing its independently measured output speed of 684 tokens per second, its $0.25 / $0.75 per-1M pricing, its 128K context window, and its Intelligence Index score of 22.

So sánh thông số kỹ thuật

Giá — Mercury 2.5 Preview: $0.20 / $0.75 mỗi 1M vào/ra, ~$0.04 / $0.15 giá ưu đãi đến hết 8/9. Gemini 3.1 Pro: $2.00 / $12.00 mỗi 1M, tăng lên $4.00 / $18.00 trên 200K đầu vào.

Ngữ cảnh / đầu ra — Mercury 2.5 Preview: ngữ cảnh 256K. Gemini 3.1 Pro: ngữ cảnh 1M, đầu ra tối đa 64K.

Đầu vào — Mercury 2.5 Preview: chỉ văn bản. Gemini 3.1 Pro: văn bản, hình ảnh, âm thanh, video, tệp.

Kiến trúc — Mercury 2.5 Preview: LLM khuếch tán, tạo token song song. Gemini 3.1 Pro: tự hồi quy, độ sâu suy luận động.

Tốc độ — Mercury 2.5 Preview: tuyên bố đạt 1.107 token/giây. Gemini 3.1 Pro: không có tuyên bố đáng chú ý tương đương.

Bằng chứng — Mercury 2.5 Preview: chỉ do nhà cung cấp báo cáo. Gemini 3.1 Pro: Chỉ số AA 57 khi ra mắt (46,5 theo thang đo mới) cùng với hồ sơ đánh giá độc lập dài lâu.

A two-column scoreboard titled 'Mercury 2.5 Preview vs Gemini 3.1 Pro — the scoreboard'. Left column 'Mercury 2.5 Preview': 'Price: $0.20 / $0.75 (intro $0.04 / $0.15)', 'Inputs: text only', 'Context: 256K', 'Speed: 1,107 tok/s (claimed)', 'Independent score: none yet', 'Preview since: Aug 31, 2026'. Right column 'Gemini 3.1 Pro': 'Price: $2.00 / $12.00', 'Inputs: text, image, audio, video', 'Context: 1M', 'Speed: autoregressive', 'Independent score: AA Index 57 at launch', 'Preview since: Feb 19, 2026'. A footer reads 'Gemini index per Artificial Analysis; Mercury figures vendor-reported.' The OrcaRouter logo is composited in the bottom-right corner.

Khoảng cách đa phương thức là sự khác biệt quyết định.

Đối với hầu hết các ứng dụng, sự so sánh này được giải quyết trước khi giá cả hoặc điểm chuẩn xuất hiện, vì Mercury 2.5 Preview không thể nhìn thấy. Gemini 3.1 Pro đọc được ảnh chụp màn hình, sơ đồ, âm thanh và video — đó là mô hình bạn hướng tới một tệp PDF, biểu đồ, bản ghi cuộc họp hoặc giao diện người dùng khi bạn muốn câu trả lời về một thứ chưa phải là văn bản. Mercury 2.5 Preview chỉ hỗ trợ văn bản theo thiết kế; một mô hình ngôn ngữ khuếch tán tạo ra văn bản song song không có đường dẫn nhập hình ảnh hoặc âm thanh nào cả. Đối với ứng dụng nặng về tài liệu, tác nhân thị giác hoặc bất kỳ sản phẩm đa phương thức nào, Gemini 3.1 Pro là ứng viên duy nhất ở đây, dứt khoát. Giới hạn chỉ hỗ trợ văn bản của Mercury 2.5 Preview không phải là điều khoản nhỏ; đó là ranh giới quyết định khối lượng công việc mà mô hình thậm chí còn đủ điều kiện để đảm nhận.

Sáu tháng thử nghiệm so với hai ngày

Dựa trên bằng chứng, đây không phải là một cuộc cạnh tranh, và điều quan trọng là phải nói rõ lý do. Gemini 3.1 Pro đã bị các phòng thí nghiệm độc lập mổ xẻ suốt sáu tháng; điểm số của nó đã được xác lập, đo lại, và tranh luận sôi nổi, đó chính là hình dạng của "sự đáng tin cậy" ở một mô hình. Mercury 2.5 Preview chỉ có một nguồn thông tin duy nhất — chính nhà sản xuất — và nguồn đó tuyên bố mức tăng hơn 10 điểm về trí tuệ so với Mercury 2 và ngang bằng với tầng tối ưu chi phí của nhóm mô hình tiên tiến. Cả hai tuyên bố đều có thể đúng. Nhưng chưa ai ngoài Inception xác nhận điều đó, và mô hình quá mới nên việc này chẳng có gì ngoài dự kiến. Sự bất đối xứng không nằm ở chỗ bên nào tốt hơn; mà nằm ở chỗ một bên có thể kiểm chứng được còn bên kia thì chưa.

Nơi tốc độ của Sao Thủy thực sự chiến thắng

Điểm mạnh thực sự của Mercury 2.5 Preview là phạm vi hẹp, chỉ dành cho văn bản và xác thực. Việc tạo token song song thay đổi cách tính độ trễ theo cách mà không mô hình tự hồi quy nào — kể cả Gemini 3.1 Pro — có thể theo kịp, vì mô hình tự hồi quy được xây dựng theo kiểu tuần tự. Đối với một quy trình xử lý giọng nói, điều trớ trêu là đầu vào và đầu ra là âm thanh nhưng phần suy luận giữa chúng là văn bản: một lớp suy luận văn bản nhanh chính là thứ khiến trợ lý giọng nói có cảm giác phản hồi nhanh. Đối với một tác tử tìm kiếm thực hiện nhiều lần gọi công cụ, và đối với một tác tử phụ viết mã thực hiện nhiều lần hoàn thành nhỏ trong mỗi nhiệm vụ, độ trễ mỗi lần gọi cộng dồn thành tốc độ cảm nhận. Với mức giá giới thiệu — $0,04 cho đầu vào, $0,15 cho đầu ra — Mercury 2.5 Preview rẻ hơn khoảng 80 lần so với mức giá đầu ra tiêu chuẩn của Gemini 3.1 Pro, điều này khiến nó không chỉ nhanh hơn mà còn thuộc một phân khúc chi phí khác cho các tác vụ suy luận văn bản khối lượng lớn. Điều cần lưu ý phải đi kèm với từng câu nói trên: tốc độ chỉ là tuyên bố, chất lượng tương đương chỉ là tuyên bố, và không có phép đo độc lập nào tồn tại.

Định giá: mức phí cao cấp cho ngữ cảnh dài của Gemini so với mức giá chào mời của Mercury

Bảng giá của Gemini 3.1 Pro có một chi tiết đáng biết trước khi bạn so sánh các con số nổi bật: các yêu cầu vượt qua 200K token đầu vào sẽ tăng từ $2,00 / $12,00 lên $4,00 / $18,00 cho mỗi triệu token. Trên một mô hình ngữ cảnh 1M, mức phí ngữ cảnh dài đó không phải là trường hợp hiếm gặp — đó là cái giá để thực sự sử dụng cánh cửa sổ mà mô hình nổi tiếng. Mercury 2.5 Preview không có bước nhảy như vậy, và ngữ cảnh 256K của nó khó có thể thường xuyên chạm đến vùng ngữ cảnh dài. Nhưng mức giá thấp của Mercury chỉ là lời mời chào hết hạn vào ngày 8 tháng 9, trong khi giá của Gemini là mức niêm yết ổn định. Khi so sánh, hãy so sánh giá niêm yết $0,20 / $0,75 của Mercury với bậc tiêu chuẩn của Gemini, chứ không phải con số chiết khấu — chiết khấu là động lực để dùng thử, không phải mức giá để lên kế hoạch.

Quyết định định tuyến

Cả hai mô hình đều có thể định tuyến ngay hôm nay, và điều đó thay đổi cách bạn nên xử lý từng mô hình. Gemini 3.1 Pro có mặt trên OrcaRouter với tên google/gemini-3.1-pro-preview, với giá niêm yết của nhà cung cấp được chuyển thẳng ở mức 0% phụ phí, vì vậy các phân khúc tiêu chuẩn và ngữ cảnh dài có giá chính xác như nhà cung cấp công bố, cùng với hơn 200 mô hình khác trên một khóa API duy nhất. Huy hiệu preview chính là thứ nên định tuyến vòng qua thay vì đặt cược vào nó — bảng tỷ lệ lỗi trên trang mô hình tồn tại là có lý do, và cơ chế failover tự động có nghĩa là một phản hồi preview bị suy giảm sẽ được chuyển đến nhà cung cấp thứ hai mà không cần thay đổi mã. Mercury 2.5 Preview chưa có trên OrcaRouter; Inception phục vụ nó thông qua API riêng và một số nền tảng bên thứ ba. Một mô hình mới ra mắt hai ngày mà bạn chưa thể đặt sau cơ chế failover là ứng viên thử nghiệm, không phải phụ thuộc trong sản xuất. Ngày nhà cung cấp niêm yết nó, mức chuyển thẳng tương tự sẽ được áp dụng và ưu đãi giới thiệu sẽ xuất hiện ngay trong ngày — đó là lúc cuộc so tài này trở thành một quy tắc định tuyến thay vì một quyết định.

Kết luận thẳng thắn là hai bản xem trước này trả lời những câu hỏi khác nhau. Gemini 3.1 Pro trả lời câu hỏi “nên xây dựng sản phẩm trên mô hình nào hôm nay” — nó đa phương thức, ngữ cảnh dài, được kiểm thử độc lập và ổn định, với mức giá phản ánh đúng tất cả những điều đó. Mercury 2.5 Preview trả lời câu hỏi “suy luận văn bản có thể nhanh đến mức nào về mặt vật lý” — và kiến trúc tốc độ của nó là điều thú vị nhất trong mô hình, đang chờ một phòng thí nghiệm độc lập xác nhận liệu chất lượng đi kèm có thật hay không. Nếu khối lượng công việc của bạn là đa phương thức hoặc ngữ cảnh dài, lựa chọn đã được quyết định. Nếu khối lượng công việc chỉ thuần văn bản, có độ trễ tích lũy và nhạy cảm về giá, Mercury 2.5 Preview là lựa chọn đáng theo dõi — và ngày 8 tháng 9 là mốc thời gian để so sánh.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro Preview (google/gemini-3.1-pro-preview) showing the model header, the Home > Models > Google breadcrumb, the February 19, 2026 preview start date, and the description of Google's frontier reasoning model.
© 2026 OrcaRouter

Dành cho nhà cung cấp

Bạn vận hành nền tảng suy luận? Đưa mô hình của bạn lên OrcaRouter.

providers@orcarouter.ai

Tham gia cộng đồng

Discordsupport@orcarouter.aiXGitHubYouTube