
Intern-S2-397B vs Qwen3.8-Max: Hai mẫu flagship Trung Quốc, hai canh bạc kinh tế trái ngược
- deepseekMỚIDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- openaiMỚIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- googleMỚIGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- qwenMỚIQwen: Qwen3.8 Max (0902)2026-09-0240Trí tuệ72Lập trình
- anthropicMỚIAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Trí tuệ69Lập trình
- grokSpaceXAI: Grok 4.62026-08-1244Trí tuệ77Lập trình
- metaMeta: Muse Spark 1.22026-08-0540Trí tuệ72Lập trình
- qwenQwen: Qwen3.8 Max2026-08-0340Trí tuệ72Lập trình
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Trí tuệ69Lập trình
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 trên 1 triệu token
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Trí tuệ78Lập trình
- googleGoogle: Gemini 3.6 Flash2026-07-2134Trí tuệ69Lập trình
Intern-S2-397B và Qwen3.8-Max là hai bản ra mắt flagship Trung Quốc có tác động lớn nhất vào đầu tháng 9 năm 2026, và chúng đưa ra những đặt cược kinh tế trái ngược nhau. Intern-S2-397B, mô hình đa phương thức khoa học 403 tỷ tham số mà nhóm InternLM của Phòng thí nghiệm AI Thượng Hải phát hành theo Apache-2.0 vào ngày 13 tháng 9, đặt cược rằng trọng số mở là con đường để giành chiến thắng trong các khối lượng công việc khoa học và agentic: không có giá theo từng token, trọng số trên Hugging Face, và phần cứng của chính bạn đóng vai trò đồng hồ đo. Qwen3.8-Max, flagship 2,4 nghìn tỷ tham số của Alibaba đạt trạng thái GA vào ngày 3 tháng 8 và được làm mới vào ngày 2 tháng 9, đặt cược vào một API có tính phí ở mức 2,00 USD mỗi triệu token đầu vào và 6,00 USD mỗi triệu token đầu ra trong ngữ cảnh 1 triệu token, với trọng số mở xuất hiện một tuần sau GA và điểm Artificial Analysis độc lập đã có sẵn trên bảng. Cuộc đối đầu giữa chúng không hẳn là về việc benchmark của ai giành chiến thắng, mà đúng hơn là về việc đặt cược nào — quyền sở hữu hay một endpoint tính phí theo mức sử dụng — phù hợp với hình dạng khối lượng công việc của bạn.
Hai siêu phẩm, hai canh bạc
Qwen3.8-Max là bậc năng lực cao nhất của Alibaba trong dòng Qwen, một mô hình mixture-of-experts thưa với tổng cộng 2,4 nghìn tỷ tham số và khoảng 95 tỷ tham số được kích hoạt trên mỗi token trên 512 chuyên gia, với 10 chuyên gia hoạt động cộng thêm một chuyên gia chia sẻ. Nó có cửa sổ ngữ cảnh 1M token (983.616 token khi bật thinking trong API được host), giới hạn đầu ra 131.072 token, đầu vào văn bản, hình ảnh và video, và được phục vụ qua endpoint tương thích OpenAI. Điểm nhấn định giá đặc trưng của nó là mức giá cố định: vẫn là $2.00 / $6.00 dù prompt của bạn là 5.000 token hay 900.000 token, với đầu vào được cache có giá thấp hơn — không phụ phí ngữ cảnh dài, đúng thứ mà hầu hết đối thủ vẫn còn tính phí. Alibaba định vị nó trực tiếp đối đầu với GPT-5.5, Claude Opus 4.7 và Gemini 3.1 Pro trong hướng dẫn di chuyển của chính mình.
Intern-S2-397B là một kiểu flagship có hình dạng khác. Đây là mô hình mixture-of-experts với 60 lớp và 512 chuyên gia (10 chuyên gia hoạt động mỗi token), ngữ cảnh suy luận văn bản 256K và đa phương thức 64K, bề mặt đầu vào gồm văn bản, hình ảnh và chuỗi thời gian, cùng một paradigm tiền huấn luyện đọc trực tiếp các trang tài liệu khoa học thô — hình vẽ, bố cục, ký hiệu tượng trưng và văn xuôi — thay vì phân tích tách văn bản ra trước. Học tăng cường của nó trải rộng hơn hai mươi lĩnh vực khoa học, và nó được huấn luyện cho công việc agent dài hạn trong môi trường sandbox. Cách định giá của nó không phải là một bảng giá mà là sự không có bảng giá: tự vận hành các trọng số Apache-2.0, hoặc yêu cầu quyền truy cập API Intern chính thức.
• Giá — Intern-S2-397B: không có bảng giá; tự vận hành hoặc Intern API so với Qwen3.8-Max: $2.00 / $6.00 cho mỗi 1M, mức cố định, giá đầu vào đã cache thấp hơn.
• Quy mô — Intern-S2-397B: tổng 403B, 512 chuyên gia / 10 hoạt động so với Qwen3.8-Max: tổng 2,4T, 95B hoạt động, 512 chuyên gia / 10 + 1 chia sẻ.
• Ngữ cảnh — Intern-S2-397B: 256K văn bản / 64K đa phương thức so với Qwen3.8-Max: 1M token, đồng giá.
• Đầu vào — Intern-S2-397B: văn bản, hình ảnh, chuỗi thời gian so với Qwen3.8-Max: văn bản, hình ảnh, video.
• Trọng số — Intern-S2-397B: Apache-2.0, mở ngay ngày phát hành so với Qwen3.8-Max: giấy phép Qwen3.8-Max tùy chỉnh, mở ngày 12 tháng 8 sau GA.
• Điểm số độc lập — Intern-S2-397B: chưa có vs Qwen3.8-Max: Chỉ số Thông minh AA 40, GPQA Diamond 92.7.
Cả hai bảng đều là bảng nhà cung cấp, và chỉ một bảng có trọng tài.
Cả hai mô hình đều ra mắt với các bảng điểm chuẩn do nhà cung cấp chạy, điều này khiến kỷ luật về nguồn giống hệt nhau và thành tích khác biệt. Các con số độc lập của Qwen3.8-Max kể từ đó đã tích lũy: Artificial Analysis đặt nó ở mức 40 trên Intelligence Index hiện tại của mình với GPQA Diamond là 92.7, HLE là 43.0 và điểm lập trình độc lập là 71.8, với chi phí khoảng 2,67 đô la cho mỗi tác vụ chỉ số trên thang điểm hiện tại. Đó là những con số đo lường được từ một trình theo dõi của bên thứ ba — trọng tài thực sự đầu tiên mà bất kỳ mẫu flagship nào trong hai mẫu này từng có.
Bằng chứng của Intern-S2-397B là thẻ của chính nó, được chạy qua OpenCompass, VLMEvalKit và AgentCompass, công bố cùng với trọng số: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54, và TerminalBench 2.1 ở mức 64.04, một con số mà chính thẻ đó cho thấy đang thua một thế hệ đóng cũ hơn. Các dòng khoa học của nó là lý do tồn tại trường hợp chuyên gia: Biology-Instructions 55.71, SciReasoner 1.5 63.28, Mol-Instructions 53.95, MolecularIQ 62.35. Mỗi một trong số đó đều là của chính InternLM, chưa được tái lập. Đặt cạnh nhau, hai cơ sở bằng chứng kể cùng một câu chuyện từ hai hướng đối lập: một mô hình là chuyên gia với các dòng tổng quát đáng nể và không có đo lường bên ngoài, mô hình kia là tổng quát với điểm số độc lập và không có tinh chỉnh khoa học.

Những hình khối tiền thực sự mua được gì
Mức tính phí cố định $2 / $6 là nước đi đặc trưng của Qwen3.8-Max, và đáng để nói rõ nó mang lại những gì. Một tác nhân phân tích kho mã đẩy 200.000 token đầu vào của ngữ cảnh mã qua trong một lần gọi sẽ trả cùng mức giá trên mỗi token như một cuộc trò chuyện ngắn — không phụ phí cho lời nhắc dài — và với bộ nhớ đệm, một ngữ cảnh mã ổn định làm giảm đáng kể giá đầu vào hiệu dụng khi lưu lượng lặp lại. Mô hình cũng có thể được gọi dưới dạng trọng số mở theo giấy phép tùy chỉnh của Alibaba, cho phép sử dụng thương mại với việc ghi công, cộng với các cổng dựa trên quy mô khi vượt quá 100 triệu MAU hoặc 20 triệu đô la doanh thu hàng tháng, và một thỏa thuận riêng cho các doanh nghiệp cung cấp mô hình dưới dạng dịch vụ quy mô lớn.
Kinh tế học của Intern-S2-397B thì ngược lại: không hề có đồng hồ đo nào, mà là một khoản chi phí vốn. Các trọng số vào khoảng 807 GB ở BF16 trải trên 188 shard — một node đa GPU thực thụ — với bản dựng FP8 cắt giảm kích thước lưu trữ khoảng một nửa. Nếu bạn đã sở hữu năng lực đó, chi phí biên của truy vấn khoa học tiếp theo tiệm cận tiền điện, và đó chính là canh bạc: quyền sở hữu khiến mô hình chuyên biệt trở nên rẻ ở biên. Nếu bạn không sở hữu phần cứng, mô hình "miễn phí" chỉ là bản thí điểm, và Intern API chính thức là phương án thay thế được tính cước duy nhất.
Hai mẫu flagship có thể dùng chung một đường nối nếu bạn định tuyến. Qwen3.8-Max có trên OrcaRouter với giá niêm yết của Alibaba được chuyển thẳng ở mức markup 0%, nên mức phí cố định $2 / $6 và mọi đợt giảm giá trong tương lai đều về đây ngay trong cùng ngày. Intern-S2-397B không được định tuyến — đây là một checkpoint hoàn toàn mới, và đường đến nó là API riêng của nhà cung cấp hoặc một triển khai tự lưu trữ. Hãy gửi lưu lượng tổng quát, hỗ trợ video, ngữ cảnh dài đến mô hình tính phí theo mức dùng bằng khóa bạn đã có; giữ công việc theo lô khoa học trên mô hình bạn tự vận hành; để cơ chế chuyển đổi dự phòng tự động bảo đảm cho bạn khi endpoint của một trong hai bên gặp sự cố. Ranh giới ở đây là một quy tắc định tuyến chứ không phải một tích hợp thứ hai.

Bản án
Chọn {{1}}Qwen3.8-Max{{/1}} cho suy luận tổng quát và công việc sản xuất có khả năng video, nơi {{2}}mức giá cố định cho một triệu token{{/2}} đánh bại mọi mức giá mà đối thủ của nó đưa ra, và nơi {{3}}một bảng điểm độc lập{{/3}} giảm rủi ro khi xây dựng dựa trên nó. {{4}}Trọng số của nó đủ mở để có ý nghĩa{{/4}} theo một giấy phép mà hầu hết các nhóm đều đã nằm trong vòng cho phép, và {{5}}mức tính giá $2 / $6 của nó{{/5}} là mức giá quyết liệt nhất trên bảng trong số các flagship tiên phong.
Chọn Intern-S2-397B cho các khối lượng công việc khoa học — những bài báo dày đặc hình vẽ, sơ đồ phân tử, tín hiệu chuỗi thời gian — nơi đầu vào mang tính đa phương thức theo cách mà một mô hình đa dụng chưa từng được tinh chỉnh để xử lý, và nơi việc lưu trú dữ liệu hoặc tinh chỉnh trên các kết quả độc quyền khiến Apache-2.0 trở thành thuộc tính quyết định. Hãy dự trù ngân sách cho phần cứng, tự chạy đánh giá của bạn, và coi các con số của nó như những tuyên bố cho đến khi một bên kiểm định độc lập xuất hiện.
Tóm tắt trung thực là hai mẫu flagship này không thực sự thay thế cho nhau. Một cái là công cụ khoa học thuộc sở hữu với năng lực tổng quát đáng nể; cái còn lại là một mẫu tổng quát thuê ngoài, được chấm điểm độc lập, có mức giá cố định và chỉ quan tâm hời hợt đến khoa học. Các nhóm cần cả hai nên coi ranh giới này như một quyết định định tuyến — và nên chạy lại đánh giá của chính họ trên Intern-S2-397B trước khi tin bất kỳ con số nào trên slide của bất kỳ nhà cung cấp nào.

