
Intern-S2-397B เทียบกับ Intern-S2 Mobius: เรือธงขนาด 397B และโมเดลให้เหตุผลขนาด 35B
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Intern-S2-397B และ Intern-S2 Mobius ต่างก็เป็นโมเดลของ InternLM ทั้งคู่ใช้ Apache-2.0 ทั้งคู่ถูกเรียกว่า Intern-S2 และแทบจะไม่มีอะไรเหมือนกันเลยภายใต้ชื่อเดียวกัน Intern-S2-397B คือเรือธง: โมเดล mixture-of-experts ขนาด 403 พันล้านพารามิเตอร์สำหรับวิทยาศาสตร์อัจฉริยะและเอเจนต์ระยะยาวที่ InternLM เปิดตัวเมื่อวันที่ 13 กันยายน 2026 Intern-S2 Mobius คือการทดลองด้านการให้เหตุผลขนาด 35 พันล้านพารามิเตอร์ที่มาถึงเมื่อวันที่ 29 กรกฎาคม 2026 สร้างบนสถาปัตยกรรม Mobius-v0 ที่มีหน่วยความจำแชร์ทั่วโลกและตัวให้เหตุผลแบบวนซ้ำ ผ่านการพรีเทรนต่อเนื่องจาก Qwen3.5-35B การที่ชื่อชนกันคือเหตุผลทั้งหมดที่ทำให้การเปรียบเทียบนี้จำเป็นต้องมีอยู่ เพราะการค้นหา "Intern-S2 review" จะแสดงทั้งสองโมเดล และทั้งสองก็ไม่ใช่ตัวแทนแทนกันได้ในทิศทางใดเลย
สองสถาปัตยกรรม สองงาน
Intern-S2-397B เป็นทรานส์ฟอร์มเมอร์ MoE แบบทั่วไป ที่กว้างในจุดที่สำคัญ: 60 เลเยอร์, 512 ผู้เชี่ยวชาญ โดยมี 10 ตัวที่ทำงานต่อโทเคน, บริบทการให้เหตุผลข้อความ 256K และบริบทมัลติโมดัล 64K, และพื้นผิวอินพุตที่รับข้อความ รูปภาพ และอนุกรมเวลา กระบวนทัศน์การฝึกก่อนของมันอ่านหน้าเอกสารดิบของวรรณกรรมทางวิทยาศาสตร์ — รูปภาพ เลย์เอาต์ สัญกรณ์เชิงสัญลักษณ์ และร้อยแก้วรวมกัน — และการเรียนรู้แบบเสริมกำลังของมันครอบคลุมโดเมนทางวิทยาศาสตร์มากกว่ายี่สิบโดเมน บวกกับการฝึกเอเจนต์ระยะยาวในสภาพแวดล้อมแบบแซนด์บ็อกซ์ มันเป็นผู้เชี่ยวชาญที่เป็นโมเดลทั่วไปด้วย: MMLU Pro 89.77, MMMU Pro 81.68, SWE-bench-Pro 68.54 บนการ์ดของตัวเอง ทั้งหมดเป็นข้อมูลที่ InternLM รายงานและยังไม่ได้ทำซ้ำ
Intern-S2 Mobius เป็นการเดิมพันที่แตกต่างในคำถามที่แตกต่าง แทนที่จะผูกการจัดเก็บความรู้และการคำนวณด้านการใช้เหตุผลเข้าด้วยกันทีละชั้น สถาปัตยกรรม Mobius-v0 กลับเก็บ Memory ของเวกเตอร์ความรู้ที่แชร์ร่วมกันทั่วโลก และให้ Reasoners หลายตัววนซ้ำกับมัน โดยปรับแต่ง hidden states บนการแทนค่าต่อเนื่องที่มีความหนาแน่นสูง จุดขายคือประสิทธิภาพการอนุมาน: เร็วขึ้นแบบ end-to-end เกือบ 4 เท่าเมื่อเทียบกับ baseline Qwen3.5-35B ที่มันสืบทอดมา พร้อมคะแนนการใช้เหตุผลที่เทียบเคียงได้หรือแข็งแกร่งกว่า นั่นคือคำกล่าวอ้างด้านอัตราการประมวลผลเกี่ยวกับ baseline เฉพาะหนึ่ง — และเป็นคำกล่าวอ้างจากผู้ขาย โดยไม่มีการทำซ้ำผลโดยอิสระ — แต่มันคือเหตุผลที่โมเดลนี้มีอยู่
• สถาปัตยกรรม — Intern-S2-397B: transformer MoE มาตรฐาน, 60 เลเยอร์, ผู้เชี่ยวชาญ 512 คน / ใช้งาน 10 คน เทียบกับ Intern-S2 Mobius: Mobius-v0, Memory ที่ใช้ร่วมกัน + Reasoners ที่วนซ้ำ
• ขนาด — Intern-S2-397B: รวม 403B, น้ำหนัก ~807 GB ใน BF16 เทียบกับ Intern-S2 Mobius: รวม 35B
• สายการสืบทอด — Intern-S2-397B: กระบวนทัศน์การฝึกล่วงหน้าทางวิทยาศาสตร์แบบดั้งเดิม เทียบกับ Intern-S2 Mobius: ผ่านการฝึกก่อนกำหนดแบบต่อเนื่องจาก Qwen3.5-35B
• อินพุต — Intern-S2-397B: ข้อความ, รูปภาพ, อนุกรมเวลา เทียบกับ Intern-S2 Mobius: ข้อความ, รูปภาพ
• บริบท — Intern-S2-397B: ข้อความ 256K / มัลติโมดัล 64K เทียบกับ Intern-S2 Mobius: ยังไม่มีตัวเลขบริบทที่ระบุโดยอิสระ
• การกล่าวอ้างความเร็ว — Intern-S2-397B: ไม่มีการโฆษณา เทียบกับ Intern-S2 Mobius: ความเร็วในการให้เหตุผลแบบ end-to-end เร็วขึ้นเกือบ 4 เท่าเมื่อเทียบกับพื้นฐาน Qwen3.5-35B ตามรายงานของผู้จำหน่าย
• หลักฐานอิสระ — ไม่มีโมเดลใดมีคะแนนจากบุคคลที่สาม
หมายเลขใดเป็นของโมเดลใด
การชนกันของชื่อกลายเป็นภัยในทางปฏิบัติทันทีที่คุณอ่านรีวิว ข้ออ้างเรื่องผลทดสอบ (benchmark) เกี่ยวกับ "Intern-S2" — MMLU Pro 89.77, HMMT-2026 93.56, Biology-Instructions 55.71 — นั้นหมายถึงโมเดลเรือธงขนาด 397B เพราะนั่นคือโมเดลที่ตารางเปิดตัวเป็นของมัน ข้ออ้างเรื่องอัตราการประมวลผล (throughput) เกี่ยวกับ "Intern-S2" — ความเร็วที่เพิ่มขึ้นเกือบ 4 เท่า — นั้นหมายถึง Mobius เพราะนั่นคือโมเดลที่สถาปัตยกรรมมุ่งเน้นเรื่องประสิทธิภาพการอนุมาน (inference) ตรวจสอบจำนวนพารามิเตอร์ก่อนจะอ้างอิงตัวเลขใด ๆ รีวิวที่บอกว่า "Intern-S2 เร็วกว่า 4 เท่า" กับอีกรีวิวที่บอกว่า "Intern-S2 เอาชนะ Grok 4.6 บน TerminalBench" กำลังพูดถึงโมเดลคนละตัว และข้ออ้างที่สองนั้นไม่ผ่านตารางของผู้จำหน่ายเองด้วยซ้ำ
ในด้านหลักฐาน ไม่มีโมเดลใดได้รับการทดสอบโดยใครก็ตามที่อยู่นอก InternLM การ์ดของโมเดลเรือธงคือตารางเบนช์มาร์กของผู้ขายที่รันผ่าน OpenCompass, VLMEvalKit และ AgentCompass; การ์ดของ Mobius คือคำอธิบายบวกกับข้ออ้างเรื่องความเร็วที่เพิ่มขึ้นเมื่อเทียบกับเบสไลน์ที่โมเดลถูก fine-tuned มา การไม่มีการตรวจสอบโดยอิสระสำคัญตรงนี้มากกว่าในการเปรียบเทียบส่วนใหญ่ เพราะข้ออ้างที่แข็งแกร่งที่สุดของสองโมเดลอยู่บนแกนที่แตกต่างกันโดยสิ้นเชิง — ความสามารถสำหรับตัวหนึ่ง ปริมาณงานสำหรับอีกตัว — และยังไม่มีการวัดจากภายนอกสำหรับแกนใดเลย
จะรันอันไหน
รัน Intern-S2-397B เมื่องานคือความเข้าใจทางวิทยาศาสตร์: การอ่านงานวิจัยที่เต็มไปด้วยรูปภาพ การวิเคราะห์แผนภาพโมเลกุล การพยากรณ์จากสัญญาณอนุกรมเวลา หรือการรันเอเจนต์ที่ทำงานยาวนานซึ่งต้องทำงานวิจัยให้เสร็จต่อเนื่อง มันคือโมเดลที่บทความของสัปดาห์นี้พูดถึง และผลคะแนนด้านทั่วไปของมันก็น่าพอใจพอที่คุณจะไม่ต้องซื้อม้าที่แสดงได้เพียงท่าเดียว ราคาที่ต้องแลกคือฮาร์ดแวร์: เช็กพอยต์ขนาด 403B ต้องใช้โหนดหลาย GPU ระดับจริงจัง และถ้าคุณไม่มีโหนดแบบนั้น API อย่างเป็นทางการของ Intern ก็เป็นทางเลือก
ลองพิจารณา Intern-S2 Mobius เมื่องานของคุณเป็นการทำ reasoning ปริมาณมากบนฮาร์ดแวร์ที่คุณมีอยู่แล้ว และคุณให้ความสำคัญกับต้นทุนต่อโทเคนมากกว่าคะแนน benchmark หนึ่งหรือสองคะแนน โมเดลขนาด 35B ที่มีข้อได้เปรียบด้าน throughput ราว 4 เท่าเหนือ baseline ถือเป็นข้อเสนอด้านการให้บริการที่น่าสนใจจริง ๆ — แต่ควรตรวจสอบความเร็วที่เพิ่มขึ้นบน trace ของคุณเองก่อนจะสร้างระบบโดยอิงกับมัน เพราะยังไม่มีใครนอก InternLM ที่ทำซ้ำผลนี้ได้ ไม่ว่าจะทางใดก็ตาม ควรระบุชื่อโมเดลอย่างชัดเจนในทุกงานเขียน เพราะชื่อเพียงอย่างเดียวไม่สามารถบอกได้อีกต่อไปว่าคุณหมายถึงตัวไหน



