Thẻ hero được tạo tự động so sánh Intern-S2 và Gemini 3.1 Pro, hiển thị một trang hình minh họa khoa học và một biểu đồ đưa vào mô hình đa phương thức ở bên trái, cùng bốn biểu tượng đầu vào cho hình ảnh, âm thanh, video và văn bản bao quanh một thẻ API đóng ở bên phải, được ghi nhãn thể hiện sự tương phản giữa tính đa phương thức khoa học Apache-2.0 và một mô hình đa phương thức tổng quát hàng đầu với ngữ cảnh 1M nhưng đóng, cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Intern-S2 vs Gemini 3.1 Pro: Cuộc so tài đa phương thức mà InternLM thực sự đo lường

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Phần lớn các màn đối đầu trong loạt bài này đều đòi hỏi phải ghép nối những tuyên bố của hai nhà cung cấp lại với nhau. Trường hợp này thì không. Intern-S2, mô hình đa phương thức Apache-2.0 397 tỷ tham số mà InternLM ra mắt hôm nay, và Gemini 3.1 Pro, mô hình suy luận chủ lực của Google, đều xuất hiện dưới dạng các cột được đo trong cùng một bảng benchmark — khiến đây trở thành màn đối đầu trực diện công bằng nhất trong bộ này và, không phải ngẫu nhiên, là trường hợp mà mô hình mở có nhiều điều phải trả lời nhất. Gemini 3.1 Pro đọc được văn bản, hình ảnh, âm thanh và video, giữ ngữ cảnh 1M token, và đã bị các phòng thí nghiệm độc lập cùng lưu lượng chạy thực tế mổ xẻ kể từ khi bước vào bản xem trước ngày 19 tháng 2 năm 2026. Intern-S2 đọc được văn bản, hình ảnh và chuỗi thời gian, đã được tải lên Hugging Face sáng nay, và không có bất kỳ điểm số nào từ bên thứ ba. Trên những hàng mà cả hai đều được đo, mô hình của Google thắng ở phần lớn số hàng đó.

Cả hai đều đọc hình ảnh. Đó là nơi sự giống nhau kết thúc.

Từ "multimodal" khiến những mô hình này nghe như thể chúng ngang hàng. Chúng không ngang hàng, và sự khác biệt nằm ở việc mỗi mô hình được xây dựng để nhìn vào điều gì.

Đường thị giác của Intern-S2 được huấn luyện để tiếp nhận các trang tài liệu khoa học thô — hình vẽ, phương trình, sơ đồ cấu trúc, bố cục — như một biểu diễn chia sẻ duy nhất, thay vì trích xuất văn bản ra trước. Các benchmark đa phương thức của nó mang tính khoa học: VQA về kính hiển vi sinh học, viễn thám, hỏi đáp biểu đồ khoa học. Nó cũng tiếp nhận dữ liệu chuỗi thời gian và có thể đưa ra dự báo, một loại đầu vào mà hầu như không có mô hình chủ lực phổ thông nào xử lý được.

Tính đa phương thức của Gemini 3.1 Pro mang tính đa dụng và rộng hơn về chủng loại: văn bản, hình ảnh, âm thanh và video, trong cùng một mô hình, nhắm đến toàn bộ phạm vi tác vụ sản xuất nơi bạn trỏ mô hình vào một tệp và đặt câu hỏi. Bản ghi cuộc họp, ảnh chụp màn hình giao diện, biểu đồ trong PDF, một đoạn clip video — tất cả đều nằm trong phạm vi xử lý, tất cả đều đã có sáu tháng đánh giá công khai phía sau.

Nếu đầu vào của bạn là một hình khoa học, Intern-S2 được xây dựng chuyên biệt cho nó và có số liệu từ nhà cung cấp để bảo vệ quan điểm của mình. Nếu đầu vào của bạn là bất cứ thứ gì khác, Gemini 3.1 Pro nhận âm thanh và video còn Intern-S2 không nhận cả hai. Điều đó giải quyết phần lớn câu hỏi "nên dùng cái nào" trước khi giá cả hay điểm chuẩn xuất hiện, và bất kỳ ai nói với bạn rằng hai cái đó có thể hoán đổi cho nhau là chưa đọc danh sách đầu vào.

Điều mà bảng chung cho thấy, đọc một cách trung thực

Vì InternLM đã đánh giá cả hai, đây là một trong số ít trường hợp mà so sánh trực tiếp là chính đáng thay vì được tổng hợp ghép lại. Lưu ý vẫn không đổi và đáng được nêu một lần: mọi số liệu của Intern-S2 đều do nhà cung cấp báo cáo, được InternLM chạy trên harness riêng của mình thông qua OpenCompass, VLMEvalKit và AgentCompass, mà không có tái lập độc lập. Các số liệu của Gemini trong bảng đó cũng đến từ lần chạy so sánh của InternLM, dù Gemini có một hồ sơ độc lập phong phú bên ngoài phép so sánh đó.

• Kiến thức đa phương thức — Gemini 3.1 Pro 83.99 trên MMMU Pro so với Intern-S2 81.68.

• Hỏi đáp biểu đồ khoa học — Gemini 3.1 Pro đạt 71.18 trên ChartQAPro so với Intern-S2 71.12. Một thế hòa đến hai chữ số thập phân.

• Viễn thám — Gemini 3.1 Pro 54,27 trên XLRS-Bench so với Intern-S2 51,38.

• VQA kính hiển vi — Gemini 3.1 Pro 71.02 trên MicroVQA so với Intern-S2 69.67.

• Các tác vụ đa phương thức khoa học — Intern-S2 đạt 60,74 trên SFE so với Gemini 3.1 Pro 59,57. Chiến thắng đa phương thức duy nhất của Intern-S2.

• Kiến thức tổng quát — Gemini 3.1 Pro 91.00 trên MMLU Pro so với Intern-S2 89.77.

• Toán trung học phổ thông — Gemini 3.1 Pro 94.70 trên HMMT-2026 so với Intern-S2 93.56.

• Suy luận về tài liệu khoa học — Intern-S2 đạt 55,71 trên Biology-Instructions so với Gemini 3.1 Pro đạt 13,87, và 53,95 so với 38,84 trên Mol-Instructions.

• Các bài toán olympic khoa học — Intern-S2 87.00 trên FrontierScience-Olympiad so với Gemini 3.1 Pro 79.00.

• Thành thạo Terminal — Gemini 3.1 Pro đạt 73.80 trên TerminalBench 2.1 so với 64.04 của Intern-S2.

Cách diễn giải trung thực: Gemini 3.1 Pro thắng các hàng đa phương thức rộng với cách biệt nhỏ, Intern-S2 thắng các hàng tài liệu khoa học chuyên sâu với cách biệt khổng lồ, và không kết quả nào đáng ngạc nhiên nếu xét mỗi mô hình được huấn luyện trên dữ liệu gì. Mức cách biệt nhỏ trong các thất bại ở đa phương thức có lẽ mới là phát hiện thú vị hơn — một checkpoint mở cùng ngày chỉ kém mô hình đầu bảng đóng đã sáu tháng tuổi chưa đầy hai điểm trên MMMU Pro và ChartQAPro là kết quả mạnh mẽ hơn cho InternLM so với bất kỳ con số khoa học áp đảo nào của nó.

Ngữ cảnh, đầu ra và câu hỏi xem trước

Câu chuyện về đầu vào dài tách bạch rõ ràng. Gemini 3.1 Pro giữ cửa sổ ngữ cảnh 1M token với trần đầu ra 64K — đủ cho một tập tài liệu dài và một câu trả lời đáng kể. Intern-S2 được đánh giá ở mức tối đa 256K token cho suy luận văn bản và 64K cho đa phương thức, và không công bố trần đầu ra; hãy coi cửa sổ khả dụng của nó nhỏ hơn của Gemini cho đến khi có ai đó đo độc lập.

Có một lưu ý vận hành ở phía Goog​le cần xuất hiện trong bất kỳ so sánh trung thực nào. Gemini 3.1 Pro vẫn là mô hình bản xem trước, chưa phải bản phát hành GA. Các mô hình bản xem trước đi kèm kỳ vọng về độ tin cậy thấp hơn, và bảng tỷ lệ lỗi 7 ngày trên trang mô hình là lời nhắc thường trực rằng hãy định tuyến vòng qua tình trạng bất ổn thay vì xây dựng một đường dẫn trọng yếu dựa trên nó. Intern-S2 là bản phát hành đầy đủ theo Apache-2.0 với các trọng số bạn có thể ghim cố định — điều mà, ngược với trực giác, khiến mô hình mở hoàn toàn mới trở thành mô hình ổn định hơn về mặt vận hành trong hai mô hình, theo nghĩa quan trọng nhất: không ai có thể thay đổi nó ngay dưới chân bạn.

• Ngữ cảnh — Intern-S2 256K văn bản / 64K đa phương thức được đánh giá so với Gemini 3.1 Pro 1M token.

• Đầu vào — Intern-S2 văn bản, hình ảnh, chuỗi thời gian so với Gemini 3.1 Pro văn bản, hình ảnh, âm thanh, video.

• Trọng số — Intern-S2 Apache-2.0, có thể tải xuống, so với Gemini 3.1 Pro thì đóng.

• Độ trưởng thành — Intern-S2 mới ra đời được vài giờ; chưa có điểm số độc lập nào so với Gemini 3.1 Pro preview, vốn có từ tháng 2 năm 2026 và đã được kiểm thử kỹ lưỡng lẫn độc lập.

• Giá — Intern-S2 không có bảng giá công khai; tự vận hành (self-host) hoặc dùng API Intern chính thức so với Gemini 3.1 Pro $2.00 cho đầu vào / $12.00 cho đầu ra mỗi triệu token, tăng lên $4.00/$18.00 khi vượt 200K token đầu vào.

A generated two-column scoreboard titled 'Intern-S2 vs Gemini 3.1 Pro — the scoreboard.' Left column Intern-S2-397B lists Weights Apache-2.0, Context 256K text / 64K multimodal, Inputs text image time series, Independent score none yet, Price self-host or Intern API, MMMU Pro 81.68. Right column Gemini 3.1 Pro lists Weights closed, Context 1M in / 64K out, Inputs text image audio video, Independent score 57 at launch on the then-current scale, Price $2.00 / $12.00 per 1M, MMMU Pro 83.99. Footer reads 'Intern-S2 figures are InternLM's own, unreproduced; both MMMU Pro rows as measured in InternLM's comparison table. Gemini 3.1 Pro figures per Google and independent trackers.'

Giá và nơi ở của từng đối tượng.

Gemini 3.1 Pro tính $2.00 cho mỗi triệu token đầu vào và $12.00 cho mỗi triệu token đầu ra ở gói tiêu chuẩn, tăng lên $4.00/$18.00 khi một yêu cầu vượt mốc 200K token đầu vào — một khoản phụ phí cho ngữ cảnh dài đánh trúng đúng lúc bạn dùng cửa sổ 1M vốn chính là lý do để chọn nó. Nó có thể được định tuyến trên OrcaRouter với đúng mức giá niêm yết đó, chuyển tiếp nguyên giá với mức chênh lệch 0%, trên một API key cũng mang theo hơn 200 mô hình khác; việc chuyển tiếp nguyên giá đặc biệt quan trọng ở đây vì một thay đổi giá từ Goog​le sẽ đến phía chúng ta ngay trong cùng ngày thay vì phải chờ hết một chu kỳ định giá lại. DSL định tuyến mới là phần hữu ích cho sự kết hợp cụ thể này: bạn có thể gửi công việc hình ảnh và video đến Gemini 3.1 Pro và các lô tài liệu khoa học đến một Intern-S2 tự vận hành, đồng thời giữ cả hai phía sau một endpoint duy nhất mà không cần thêm hợp đồng thứ hai hay thay đổi mã nguồn.

Intern-S2 không có giá API được công bố. Tự lưu trữ các trọng số Apache-2.0 là con đường mà hầu hết các nhóm sẽ thực sự chọn, và với 403 tỷ tham số, đó là một cam kết phần cứng thực sự. API Intern chính thức tồn tại cho những nhóm không muốn chạy GPU, nhưng nếu không có bảng giá công khai, việc so sánh chi phí với mức $2/$12 của Gemini không phải là điều bạn có thể làm trên giấy — bạn phải yêu cầu hạn mức và tự mình tính toán.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence badge, the tags image-text-to-text and qwen3_5_moe, the model size of 403B parameters in BF16/F32, the Intern-S2-397B heading, an inference providers panel reading 'This model isn't deployed by any Inference Provider,' and the collection listing nine items.

Cuộc gọi

Chọn Gemini 3.1 Pro nếu bạn cần một mô hình đa phương thức tổng quát có thể nhận âm thanh và video, chứa một triệu token, đã được kiểm chứng độc lập trong nhiều tháng và có thể được thuê theo token ngay hôm nay. Đây là mô hình có bằng chứng tốt hơn, có năng lực rộng hơn, và huy hiệu bản xem trước là một lưu ý về độ tin cậy chứ không phải về năng lực.

Chọn Intern-S2 nếu đầu vào đa phương thức của bạn mang tính khoa học và dữ liệu của bạn không thể rời khỏi hạ tầng của bạn. Đây là mô hình duy nhất trong hai mô hình đọc trực tiếp các trang tài liệu thô, dự báo từ tín hiệu chuỗi thời gian và có thể được tinh chỉnh trên dữ liệu thực nghiệm độc quyền theo một giấy phép tự do. Hãy chấp nhận rằng bạn là người đầu tiên chạy nó, và rằng bảng đánh giá chuẩn lập luận ủng hộ nó được viết bởi chính những người đã tạo ra nó.

A screenshot of the OrcaRouter model page for Gemini 3.1 Pro at orcarouter.ai/models/google/gemini-3.1-pro-preview, captured September 13, 2026, showing the model tagged FLAGSHIP and FEATURED by Google dated 2026-02-19 with Vision, Audio, Tools, JSON and Reasoning tags, a 1M-token context window and 65K max output, and pricing tiles reading input $2.00 and output $12.00 per 1M tokens.

Không mô hình nào thắng áp đảo ở đây, và bảng này chứng minh điều đó tốt hơn cả một lời kết luận. Một bên là mô hình đa năng tình cờ giỏi khoa học; bên kia là một công cụ khoa học tình cờ có sức cạnh tranh trong các tác vụ đa phương thức tổng quát — và với một bản phát hành mở cùng ngày, “có sức cạnh tranh” mới là kết quả đáng ngạc nhiên hơn.

Để nắm giữ cả hai nửa của phép so sánh này mà không cần hợp đồng thứ hai: một khóa API bao quát hơn 200 mô hình đặt mô hình hàng đầu đa phương thức dạng đóng cùng mọi lựa chọn thay thế phía sau một điểm cuối duy nhất, để bạn có thể định tuyến công việc hình ảnh và video theo một hướng, còn các lô tài liệu theo hướng khác.