
Intern-S2-397B vs Grok 4.6: Ai được quyền vặn các núm?
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Intern-S2-397B và Grok 4.6 ra mắt cách nhau khoảng một tháng và trả lời cùng một câu hỏi nền tảng theo hai cách trái ngược: ai được quyền kiểm soát việc suy luận. Grok 4.6, mẫu flagship của xAI ra mắt ngày 12 tháng 8 năm 2026, bán cho bạn một núm xoay — điều khiển mức nỗ lực suy luận có thể cấu hình trên một API đóng với giá $2.00 mỗi triệu token đầu vào và $6.00 mỗi triệu token đầu ra, cùng cửa sổ 500.000 token và các công cụ phía máy chủ của xAI được tính phí thêm. Intern-S2-397B, mô hình đa phương thức khoa học 403 tỷ tham số mà nhóm InternLM của Shanghai AI Laboratory phát hành theo Apache-2.0 vào ngày 13 tháng 9, trao cho bạn toàn bộ cỗ máy — trọng số, nút bật/tắt suy nghĩ, luồng thị giác, đầu chuỗi thời gian — và mong bạn tự vận hành nó. Một cái được thuê kèm các núm vặn; cái kia được sở hữu hoàn toàn. So sánh đáng quan tâm ở đây không phải là cái nào đạt điểm cao hơn trên bảng điểm chuẩn; mà là loại kiểm soát nào mà khối lượng công việc của bạn thực sự cần, và mỗi loại tốn kém ra sao.
Hai mặt số khác nhau
Cách rõ ràng nhất để phân biệt hai thứ này là xem các cơ chế kiểm soát suy luận nằm ở đâu. Grok 4.6 cung cấp một thiết lập mức nỗ lực suy luận qua API của xAI, và xung quanh nó là một bộ công cụ phía máy chủ — gọi hàm, tìm kiếm web, tìm kiếm X, thực thi mã — do xAI vận hành và tính phí riêng. Bạn điều chỉnh mức nỗ lực, bạn nối chuỗi các công cụ mà nó cung cấp, và bạn không bao giờ chạm vào một trọng số nào. Hành vi của mô hình là tài sản của xAI và vấn đề của xAI; đòn bẩy của bạn là một tham số trong yêu cầu.
Intern-S2-397B mang đến cho bạn một bộ đòn bẩy khác, và chúng nằm ở tầng thấp hơn trong ngăn xếp. Tính năng Thinking được bật mặc định và bạn tắt nó theo từng yêu cầu bằng enable_thinking=False. Vì mô hình thuộc giấy phép Apache-2.0, bạn cũng có thể lấy trọng số và tinh chỉnh chính hành vi suy luận trên dữ liệu của riêng mình, rồi phục vụ kết quả trên LMDeploy, vLLM hoặc SGLang. Bề mặt đầu vào của nó rộng hơn API văn bản và hình ảnh: nó chấp nhận tín hiệu chuỗi thời gian và tạo ra dự báo, một khả năng hiện chỉ được kết nối thông qua LMDeploy, và nó được huấn luyện cho công việc agent tầm xa trong môi trường sandbox. Sự đánh đổi cũng rõ ràng không kém — mức độ kiểm soát đó chỉ có ý nghĩa nếu bạn sẵn sàng vận hành phần cứng và ngăn xếp phục vụ đi kèm.
• Kiểm soát suy luận — Grok 4.6: núm điều chỉnh mức độ nỗ lực suy luận trên API đóng so với Intern-S2-397B: công tắc enable_thinking cùng khả năng kiểm soát đầy đủ ở cấp trọng số theo Apache-2.0.
• Công cụ — Grok 4.6: tìm kiếm web phía máy chủ của xAI, tìm kiếm X và thực thi mã, được tính phí riêng so với Intern-S2-397B: gọi công cụ do bạn tự kết nối, cùng với một lộ trình dự báo chuỗi thời gian thông qua LMDeploy.
• Đầu vào — Grok 4.6: văn bản, hình ảnh, tệp so với Intern-S2-397B: văn bản, hình ảnh, chuỗi thời gian.
• Ngữ cảnh — Grok 4.6: 500.000 token so với Intern-S2-397B: 256K suy luận văn bản, 64K đa phương thức, cả hai con số đều lấy từ thẻ mô hình.
• Giá — Grok 4.6: $2.00 / $6.00 mỗi 1M, phân bậc lên $4.00 / $12.00 sau 200K token so với Intern-S2-397B: không có bảng giá; tự lưu trữ hoặc API Intern chính thức.
Những con số thực sự bao gồm những gì
Mọi con số của Intern-S2-397B dưới đây đều là của chính InternLM, được chạy qua OpenCompass, VLMEvalKit và AgentCompass rồi công bố cùng với trọng số mà không có bản tái lập độc lập nào. Các con số của Grok 4.6 lại là một loại chuyện khác: chúng được tích lũy qua đấu trường công khai và Artificial Analysis sau khi mô hình ra mắt, nên chúng mang nhãn của bên thứ ba.
Về phía được đo lường độc lập, Grok 4.6 đạt 44 trên Chỉ số Trí tuệ Artificial Analysis hiện hành, với GPQA Diamond là 94.9, Humanity's Last Exam là 61.0 và điểm lập trình là 76.8, còn Artificial Analysis đưa ra con số TerminalBench 2.1 của nó ở mức gần 80.3. Về phía nhà cung cấp, thẻ của Intern-S2-397B báo cáo 89.77 trên MMLU Pro, 93.56 trên HMMT-2026, 81.68 trên MMMU Pro và 68.54 trên SWE-bench-Pro, cùng với các dòng khoa học mà nó trông như một loài khác: 55.71 trên Biology-Instructions, 63.28 trên SciReasoner 1.5, 53.95 trên Mol-Instructions, 62.35 trên MolecularIQ. Con số duy nhất trong bảng của nhà cung cấp có thể khiến một người xây dựng agent phải chùn bước là TerminalBench 2.1 ở mức 64.04 — một con số mà chính những người tạo ra mô hình báo cáo là thua kém một thế hệ đóng cũ hơn với cách biệt lớn, đúng ở làn công việc terminal mà một mô hình biên được thuê như Grok 4.6 mạnh nhất.
Hãy đọc sự chia tách đó như một bức chân dung, không phải một bảng xếp hạng. Intern-S2-397B là một chuyên gia khoa học đồng thời cũng là một mô hình tổng quát đủ năng lực; Grok 4.6 là một mô hình tổng quát chỉ có chút quan tâm đến khoa học. Việc các hàng khoa học bị lệch là điều dễ hiểu — không có mô hình tổng quát chủ lực nào được tiền huấn luyện trên các trang tài liệu khoa học thô với hình vẽ, bố cục và ký hiệu tượng trưng cùng lúc, và đó chính xác là mô hình mà Intern-S2-397B được xây dựng xoay quanh. Không có gì trong bất kỳ cơ sở bằng chứng nào ủng hộ "Intern-S2-397B giỏi ngang Grok 4.6 ở khả năng suy luận tùy ý", và không có gì trong bằng chứng về Grok 4.6 cho thấy nó được tinh chỉnh cho phân tích trình tự đa hệ gen.
Cái giá của sự kiểm soát
Grok 4.6 có một mức giá mà bạn có thể đưa thẳng vào bảng tính: 2,00 USD cho mỗi triệu token đầu vào và 6,00 USD cho mỗi triệu token đầu ra, với mức giá leo lên 4,00 USD / 12,00 USD khi một prompt vượt qua 200.000 token, cùng một gói ưu tiên tùy chọn để có phản hồi nhanh hơn. Nó có sẵn thông qua OrcaRouter với đúng mức giá niêm yết của xAI được chuyển nguyên, cộng thêm 0%, nên khi xAI thay đổi biểu phí thì ở đây cũng đổi ngay trong cùng ngày, không có chênh lệch từ bên trung gian — chiếc núm bạn thuê vẫn giữ nguyên mức giá mà nhà cung cấp đặt ra.
Intern-S2-397B hoàn toàn không có mức giá trên mỗi token nào được công bố. Thẻ mô hình có tham chiếu một API Intern chính thức, nhưng nền kinh tế mà người ta thực sự muốn so sánh là các phương án tự vận hành: một checkpoint 403 tỷ tham số, khoảng 807 GB trọng số trải trên 188 phân mảnh ở BF16, tức là cần một node đa GPU thực thụ, với bản dựng FP8 gần như giảm một nửa dung lượng. Nếu bạn đã sở hữu năng lực đó, chi phí biên cho truy vấn khoa học tiếp theo gần như chỉ còn tiền điện, và đó chính là toàn bộ ý nghĩa của lập trường Apache-2.0. Nếu bạn không sở hữu nó, mô hình "miễn phí" là một thử nghiệm chi tiêu vốn, chứ không phải một mục chi phí.
Điều mà một router mang lại trong sự kết hợp cụ thể này là mối nối, chứ không phải giá cả. Grok 4.6 dùng chính khóa bạn đã có cho lưu lượng production thông thường; Intern-S2-397B không được định tuyến trên OrcaRouter — đây là một checkpoint hoàn toàn mới, và đường đến nó là API riêng của nhà cung cấp hoặc bản triển khai tự lưu trữ. Hãy định tuyến phần suy luận tổng quát, nhạy cảm với độ trễ đến mô hình tính phí theo lưu lượng, giữ công việc theo lô khoa học trên mô hình bạn tự vận hành, và để cơ chế chuyển đổi dự phòng tự động bảo vệ bạn khi endpoint của một trong hai bên gặp sự cố. Ranh giới giữa chúng trở thành một quy tắc định tuyến thay vì một tích hợp thứ hai.

Chọn cái nào?
Chọn Grok 4.6 khi công việc mang tính tổng quát, phần suy luận phải trả về nhanh và chính xác, và bạn không muốn tự vận hành ngăn xếp tạo ra nó. Cửa sổ 500K, chỉ số GPQA Diamond đo được ở mức 94.9 và bộ công cụ của nó là những tính năng dành cho môi trường production, còn mức tính giá $2/$6 chính là khoản bạn trả để không phải vận hành bất cứ thứ gì.
Chọn Intern-S2-397B khi đầu vào mang tính khoa học — một bài báo dày đặc hình vẽ, một sơ đồ phân tử, một tín hiệu chuỗi thời gian — và khi việc suy luận phải diễn ra trên dữ liệu không thể rời khỏi môi trường của bạn, hoặc trên một hành vi mà bạn muốn tự tinh chỉnh. Apache-2.0 khiến điều đó trở nên khả thi; không một API thuê nào làm được. Hãy dự trù ngân sách cho phần cứng, đừng mong có bảng điểm độc lập trong một thời gian, và hãy coi mọi con số trên thẻ của nó là một tuyên bố cho đến khi có ai đó ngoài InternLM tái tạo được một con số.


