
Intern-S2-Mobius: โมเดล 35B ที่แยกความรู้จากการใช้เหตุผล
- qwenใหม่Qwen: Qwen3.8 Max2026-08-03$2.00 / $6.00 ต่อ 1 ล้านโทเค็น · 56 tok/s
- deepseekใหม่DeepSeek: DeepSeek V4 Flash 07312026-07-3150ความฉลาด69การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น · 201 tok/s
- orcaใหม่OrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicใหม่Anthropic: Claude Opus 52026-07-2461ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2150ความฉลาด69การเขียนโค้ด
- googleGoogle: Gemini 3.5 Flash-Lite2026-07-2137ความฉลาด49การเขียนโค้ด
- metaMeta: Muse Spark 1.12026-07-1651ความฉลาด71การเขียนโค้ด
- kimiMoonshotAI: Kimi K32026-07-1557ความฉลาด76การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Luna2026-07-0951ความฉลาด71การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Terra2026-07-0955ความฉลาด77การเขียนโค้ด
- openaiOpenAI: GPT-5.6 Sol2026-07-0959ความฉลาด77การเขียนโค้ด
- grokxAI: Grok 4.52026-07-0854ความฉลาด72การเขียนโค้ด
- tencentTencent: Hy32026-07-0641ความฉลาด59การเขียนโค้ด
- obsidianQwen3.6 35B A3B Uncensored (Aggressive)2026-07-0232ความฉลาด42การเขียนโค้ด
- obsidianGemma4 26B A4B Uncensored (Balanced)2026-07-0226ความฉลาด39การเขียนโค้ด
- anthropicAnthropic: Claude Sonnet 52026-06-3053ความฉลาด72การเขียนโค้ด
- klingKling: Kling 3.0 Turbo2026-06-1757ความฉลาด52การเขียนโค้ด57คณิตศาสตร์
- z-aiZ.ai: GLM 5.22026-06-1651ความฉลาด69การเขียนโค้ด60คณิตศาสตร์
- kimiMoonshotAI: Kimi K2.7 Code2026-06-1242ความฉลาด61การเขียนโค้ด61คณิตศาสตร์
ทีม InternLM ของ Shanghai AI Laboratory ได้เผยแพร่อย่างเงียบๆ แล้ว Intern-S2-Mobiusซึ่งเป็นโมเดลพื้นฐานแบบ open-weight ขนาด 35B ที่ทำสิ่งที่แทบไม่มีโมเดลอื่นที่เผยแพร่แล้วทำได้: มันหยุดจัดเก็บความรู้ไว้ภายในเลเยอร์ของมัน แทนที่จะเป็นการจัดเรียงแบบ Transformer มาตรฐาน — ซึ่งแต่ละเลเยอร์มี feed-forward block ของตัวเองซึ่งเต็มไปด้วยข้อเท็จจริงที่จดจำไว้ — Mobius ดึงความรู้ทั้งหมดนั้นออกไปไว้ใน Memory กลางที่ใช้ร่วมกันทั่วทั้งโมเดล และให้ Reasoners จำนวนน้อยคิวรีมันซ้ำๆ ผลตอบแทนที่อ้างไว้ไม่ใช่คะแนน benchmark ที่สูงขึ้น แต่คือความเร็ว: ได้คำตอบเดียวกันโดยใช้ reasoning tokens ประมาณหนึ่งในสามถึงหนึ่งในห้า และมี request throughput สูงถึง 4.6 เท่า คู่มือนี้จะอธิบายว่า Mobius จริงๆ แล้วคืออะไร ไฟล์คอนฟิกูเรชันของมันเผยอะไรที่ model card ไม่ได้บอก เกณฑ์มาตรฐานที่เผยแพร่แสดงอะไรเป็นบรรทัดๆ — รวมถึงสองแถวที่มันแพ้ — ว่าข้อเรียกร้อง "เร็วกว่า 4 เท่า" เป็นจริงตรงไหนและหายไปตรงไหน และใครที่ควรสนใจจริงๆ
หมายเหตุด้านความถูกต้อง: ตัวเลขทุกตัวด้านล่างนี้มาจากการ์ดโมเดลของ InternLM เอง จากตัวเลขประสิทธิภาพและประสิทธิผลที่เผยแพร่ คู่มือการปรับใช้ และไฟล์การกำหนดค่าของโมเดลบน Hugging Face ณ เวลาที่เขียนข้อความนี้ ยังไม่มีการประเมินที่เป็นอิสระจากบุคคลที่สามสำหรับ Intern-S2-Mobius — โมเดลนี้ไม่ปรากฏในลีดเดอร์บอร์ดอิสระใด ๆ ไม่มีการปรับใช้โดยผู้ให้บริการอินเฟอร์เรนซ์รายใด และตัวนับการดาวน์โหลดยังคงอยู่ที่ศูนย์ ให้ถือว่าตัวเลขเชิงเปรียบเทียบทั้งหมดเป็นข้อมูลที่ผู้ผลิตแจ้งไว้ จนกว่าจะมีผู้ทำซ้ำผลลัพธ์ได้จริง สเปกและโค้ดของโมเดลใหม่ขนาดนี้เปลี่ยนแปลงได้รวดเร็ว โปรดตรวจสอบอีกครั้งก่อนนำไปสร้างระบบ
สรุป: Intern-S2-Mobius เป็นโมเดลพื้นฐานมัลติโมดัลขนาด 35B พารามิเตอร์ ใช้สัญญาอนุญาต Apache 2.0 ผ่านการปรับpretraining ต่อเนื่องจาก Qwen3.5-35B แล้วจึงpost-train ด้วย SFT และ reinforcement learning ความใหม่ของมันอยู่ที่สถาปัตยกรรม: การออกแบบ Mobius-v0 แทนที่การจัดเก็บความรู้แบบ feed-forward ที่ผูกกับแต่ละเลเยอร์ด้วย Memory ระดับโลกชุดเดียวที่มีผู้เชี่ยวชาญ 2,560 คน ซึ่งถูกสอบถามโดย Reasoner blocks สี่บล็อกที่ซ้อนกัน ซึ่งสามารถเข้าถึงความรู้นอกเหนือจากความลึกของตัวเอง (Backward Residual Connection) และปรับปรุง hidden states ผ่านการวนซ้ำเชิงแฝงซ้ำๆ ก่อนการถอดรหัส (Dynamic Latent Reasoning) ในการประเมินของ InternLM เอง โมเดลนี้ชนะ baseline Qwen3.5-35B ที่สร้างมาใน 7 จาก 9 เกณฑ์มาตรฐานทั่วไป (ค่าเฉลี่ย 67.88 เทียบกับ 65.05) และทำได้ดีกว่าแบบขาดลอยในงานวิทยาศาสตร์ (52.14 เทียบกับ 18.20) ขณะเดียวกันก็สร้างร่องรอยการให้เหตุผลที่สั้นกว่าโดยเฉลี่ยประมาณ 1.5 เท่า — สั้นกว่า 4.6 เท่าบน MMLU Pro และ 5.0 เท่าบน GPQA Diamond การบีบอัดร่องรอยเหล่านั้นคือที่มาของการเพิ่มปริมาณงาน: 2.9 เท่าที่ batch 16 และเพิ่มเป็น 4.6 เท่าที่ batch 256 ข้อจำกัดมีจริง: มันแพ้ในเกณฑ์มาตรฐานการให้เหตุผลที่ยากที่สุดสองอัน (HLE และ UGD hard) ผลได้ด้านปริมาณงานส่วนใหญ่หายไปเมื่อใช้กับคณิตศาสตร์โอลิมปิก และยังไม่มีใครนอกห้องปฏิบัติการยืนยันผลเหล่านี้
ประเด็นสำคัญ
• การเปิดตัวที่ให้สถาปัตยกรรมเป็นหลัก: Mobius-v0 แยกเวกเตอร์ความรู้ออกจากตัวดำเนินการเชิงเหตุผล — หน่วยความจำร่วมหนึ่งชุดที่มีผู้เชี่ยวชาญ 2,560 รายคอยให้บริการบล็อก Reasoner สี่บล็อก แทนที่จะเป็น 40 เลเยอร์ที่แต่ละเลเยอร์กักเก็บความรู้ FFN ของตัวเอง
• ประสิทธิภาพ ไม่ใช่ความฉลาด คือจุดขาย: ความยาวเอาต์พุตเฉลี่ยลดลงประมาณ 1.5 เท่า และปริมาณงานของคำขอเพิ่มขึ้น 2.9 เท่าที่ batch 16 ถึง 4.6 เท่าที่ batch 256 เมื่อเทียบกับ Transformer baseline
• มันเอาชนะโมเดลฐานของตัวเองได้อย่างแท้จริง: ค่าเฉลี่ย 67.88 เทียบกับ 65.05 ในงานทั่วไป ชนะ MMLU Pro (89.05 เทียบกับ 85.31), AIME 2026 (95.31 เทียบกับ 92.08) และ HMMT 2026 (85.51 เทียบกับ 78.50)
• แต่มันแพ้ในจุดที่การไตร่ตรองสำคัญที่สุด: HLE 19.11 vs 22.40 และ UGD hard 73.02 vs 78.02 — การประเมินที่ยากที่สุดสองรายการในชุด ซึ่งทั้งคู่ชนะโดย Transformer ธรรมดา
• การก้าวกระโดดทางวิทยาศาสตร์เป็นผลลัพธ์เดี่ยวที่ใหญ่ที่สุด: Biology-Instructions 51.40 เทียบกับ 3.77, Mol-Instructions 45.73 เทียบกับ 21.70, MolecularIQ 59.29 เทียบกับ 29.13
• เปิดให้ใช้แต่ไม่พร้อมใช้งาน: น้ำหนักโมเดล Apache 2.0 บน Hugging Face, ไม่มีผู้ให้บริการ inference ที่โฮสต์มัน, น้ำหนัก bfloat16 ประมาณ 73 GB — การโฮสต์ด้วยตัวเองเป็นวิธีเดียวที่จะรันมันได้ในตอนนี้
Intern-S2-Mobius จริงๆ แล้วคืออะไร
Intern-S2-Mobius เป็นโมเดลพื้นฐานขนาด 35B ที่เผยแพร่โดย internlm องค์กร Hugging Face ที่อยู่เบื้องหลังซีรีส์ Intern ของ Shanghai AI Laboratory น้ำหนักของโมเดลถูกอัปโหลดบน Hugging Face เมื่อวันที่ 29 กรกฎาคม 2026 และพื้นที่เก็บข้อมูล GitHub ที่มาพร้อมกัน — README, คู่มือการติดตั้งใช้งาน และรายงานเทคนิคฉบับเต็ม PDF — เปิดเผยต่อสาธารณะในวันที่ 5 สิงหาคม 2026 โมเดลนี้เผยแพร่ภายใต้สัญญาอนุญาต Apache 2.0 ซึ่งถือว่าให้สิทธิ์เสรีมากที่สุดเท่าที่น้ำหนักโมเดลแบบเปิดจะให้ได้ กล่าวคือ อนุญาตให้ใช้เชิงพาณิชย์ แก้ไข และแจกจ่ายซ้ำได้ทั้งหมด
นี่ไม่ใช่การ fine-tune แต่เป็นการ continual pre-train พร้อมการผ่าตัดสถาปัตยกรรม InternLM นำ Qwen3.5-35B — โมเดล mixture-of-experts ขนาด 35B แบบ open-weight ของ Alibaba ที่เผยแพร่เมื่อวันที่ 4 มีนาคม 2026 — มาจัดโครงสร้างวิธีการจัดเก็บและเข้าถึงความรู้ของโมเดลใหม่ จากนั้นจึงนำผลลัพธ์ที่ได้มาทำ pre-training ต่อ แล้วจึงทำ supervised fine-tuning และ reinforcement learning ทับเพิ่มอีกชั้นหนึ่ง ความเป็นมาดังกล่าวมีความสำคัญต่อการตีความผล benchmark: ทุกการเปรียบเทียบที่ InternLM เผยแพร่คือ Mobius เทียบกับโมเดลต้นทางที่มันถูกพัฒนามาโดยตรง ซึ่งเป็นการแยกตัวแปร (ablation) ที่สะอาดที่สุดเท่าที่จะเป็นไปได้สำหรับการเปลี่ยนแปลงสถาปัตยกรรม และยังเป็นการเปรียบเทียบที่น่าจะทำให้มันดูดีที่สุด ซึ่งก็สะดวกดี
โมเดลนี้เป็นแบบ multimodal Hugging Face จัดประเภทมันเป็น image-text-to-text และการตั้งค่าคอนฟิเกอเรชันยืนยันว่ามี vision encoder เต็มรูปแบบพร้อมกับการจัดการ token สำหรับวิดีโอ นอกจากนี้ เมื่อพิจารณาจากสิ่งที่มาพร้อมกับน้ำหนักของโมเดลแล้ว มันถูกออกแบบมาสำหรับงานด้านวิทยาศาสตร์โดยเฉพาะ — รายละเอียดเพิ่มเติมด้านล่างนี้
สถาปัตยกรรม Mobius อธิบายแบบเข้าใจง่าย
ทรานส์ฟอร์เมอร์แบบธรรมดาจะสลับหน้าที่สองอย่างในทุกเลเยอร์ แอตเทนชันย้ายข้อมูลระหว่างโทเคน ส่วนโครงข่ายป้อนไปข้างหน้า (หรือในโมเดลแบบ mixture-of-experts ก็คือกลุ่มของ FFN ผู้เชี่ยวชาญ) เก็บความรู้ เนื่องจาก FFN อยู่ภายในเลเยอร์ ความรู้ที่มันเก็บไว้จึงเข้าถึงได้เฉพาะที่ความลึกนั้น ข้อเท็จจริงที่ถูกเรียนรู้เข้าไปในเลเยอร์ 30 ไม่สามารถถูกนำมาปรึกษาโดยการให้เหตุผลที่เกิดขึ้นในเลเยอร์ 5 ได้ ข้อมูลไหลไปข้างหน้าทีละเลเยอร์ และนั่นคือเส้นทางเดียวเท่านั้น
Mobius ทำลายพันธะนั้น InternLM อธิบายถึงผลที่ตามมาสามประการ
การแยกความรู้และการใช้เหตุผล.การจัดเก็บแบบ FFN ที่ผูกกับชั้นถูกแทนที่ด้วยสิ่งที่ใช้ร่วมกันทั่วโลกMemoryแทนที่จะมี 40 ชั้นที่แต่ละชั้นครอบครองส่วนหนึ่งของความรู้ของโมเดล จะมีพูลเดียวที่ทุกขั้นตอนการให้เหตุผลสามารถเข้าถึงได้ ข้อโต้แย้งของ InternLM คือว่าสิ่งนี้ช่วยปรับปรุงการบีบอัดความรู้ — ข้อเท็จจริงเดียวกันไม่จำเป็นต้องถูกเรียนรู้ซ้ำซ้อนที่ความลึกหลายระดับ — และทำให้ Reasoner แต่ละตัวมีพื้นที่ความรู้ที่กว้างกว่า FFN ของชั้นเดียวจะให้ได้.
การเชื่อมต่อรีซิดิวอัลย้อนกลับ เนื่องจากหน่วยความจำถูกแชร์ร่วมกัน ขั้นการให้เหตุผลทั้งระดับตื้นและระดับลึกต่างก็เข้าถึงคลังความรู้เดียวกันได้ การเข้าถึงความรู้จึงไม่ได้จำกัดอยู่แค่การไหลไปข้างหน้าอย่างเคร่งครัดอีกต่อไป ขั้นระดับตื้นสามารถดึงสิ่งที่ในโครงสร้างแบบมาตรฐานจะพร้อมใช้งานเมื่อผ่านไปอีกสามสิบชั้นเท่านั้น InternLM อ้างว่าสิ่งนี้ทำให้โมเดลสามารถประกอบความรู้ข้ามระดับความลึกได้อย่างยืดหยุ่นมากขึ้น และที่สำคัญคือ สังเคราะห์ข้อมูลที่มีประโยชน์โดยใช้ขั้นตอนการให้เหตุผลน้อยลง. วลีสุดท้ายนั้นคือหัวใจสำคัญทั้งหมดของการเปิดตัวครั้งนี้
การให้เหตุผลเชิงแฝงแบบพลวัต แทนที่จะถ่ายทอดทุกขั้นตอนการพิจารณาออกมาเป็นโทเคนสายการคิดที่มองเห็นได้ Mobius จะปรับปรุงสถานะซ่อนเร้นต่อเนื่องของมันผ่านการวนซ้ำแฝงแบบเกิดซ้ำก่อนที่จะถอดรหัสสิ่งใดออกมา "การคิด" บางส่วนเกิดขึ้นในพื้นที่การแสดงผลภายในของโมเดล แทนที่จะเกิดในข้อความที่สร้างขึ้น และปริมาณการคำนวณภายในนั้นถูกจัดสรรแบบพลวัตในแต่ละโทเคน ผลในทางปฏิบัติคือ โมเดลต้องเขียนคำน้อยลงเพื่อให้ได้ข้อสรุปเดียวกัน — และเนื่องจากการสร้างเป็นแบบออโตรีเกรสซีฟและเรียงลำดับต่อเนื่อง การเขียนคำให้น้อยลงจึงเป็นวิธีที่ตรงที่สุดที่เดียวในการทำให้โมเดลการให้เหตุผลเร็วขึ้น
เมื่อรวมกันแล้ว จุดขายคือโมเดลการใช้เหตุผลที่คิดมากขึ้นแต่พิมพ์น้อยลง

สิ่งที่ไฟล์คอนฟิกูเรชันเผยให้เห็น
การ์ดโมเดลอธิบายสถาปัตยกรรมในรูปแบบร้อยแก้ว ส่วน code>config.json/code> ทำให้เห็นเป็นรูปธรรม และมีตัวเลขหลายตัวที่น่ารู้
• Reasoner สี่ตัวครอบคลุม 40 ชั้น.คอนฟิกข้อความระบุว่ามี 40 ชั้นซ่อน แต่มีเพียงสี่บล็อก 40 ชั้นถูกจัดเป็น Reasoner สี่สเตจซึ่งวนซ้ำกับ Memory ที่ใช้ร่วมกัน แทนที่จะเป็นหน่วยความรู้บวกความสนใจอิสระสี่สิบหน่วย.
• ผู้เชี่ยวชาญ 2,560 ตัว. นี่คือ Shared Memory ที่ถูกทำให้เป็นรูปธรรม Mobius ประกอบด้วยผู้เชี่ยวชาญ 2,560 ตัว โดยเปิดใช้งาน 8 ตัวต่อโทเคน และมีขนาดกลางต่อผู้เชี่ยวชาญที่เล็กมากเพียง 512 พร้อมผู้เชี่ยวชาญร่วมอีก 1 ตัว เพื่อเทียบขนาด Intern-S2-Preview โมเดลพี่น้องของมันใช้ผู้เชี่ยวชาญ 256 ตัว กลุ่มผู้เชี่ยวชาญที่ใหญ่กว่า 10 เท่าและประกอบด้วยผู้เชี่ยวชาญที่เล็กกว่ามาก คือสิ่งที่ "คลังความรู้ระดับโลกหนึ่งเดียวแทน FFN แบบรายชั้น" ปรากฏเป็นจริงเมื่อเขียนเป็นคอนฟิก
• 35B บนกล่อง, ~36B บนดิสก์, ~3B ที่ใช้งาน. โมเดลการ์ดระบุว่า 35B; เครื่องอ่าน safetensors ของ Hugging Face รายงานพารามิเตอร์ 36B; ดัชนีน้ำหนักรวมอยู่ที่ 72.96 GB ใน bfloat16 ซึ่งคิดเป็นประมาณ 36.5B. คู่มือการปรับใช้แม่นยำที่สุด: เรียกรุ่นนี้ว่า 30B-A3B โมเดล — มีพารามิเตอร์ที่ใช้งานประมาณ 3B ต่อโทเคน. เช่นเดียวกับ MoE แบบ sparse ทั่วไป คุณต้องจ่ายค่าหน่วยความจำสำหรับน้ำหนักทั้งชุด และได้การประมวลผลแบบโมเดลขนาดเล็กต่อโทเคน.
• แอตเทนชันแบบไฮบริด 3:1.รายการเลเยอร์สลับเลเยอร์แอตเทนชันเชิงเส้นสามชั้นต่อเลเยอร์แอตเทนชันเต็มรูปแบบหนึ่งชั้นไปจนครบทุกเลเยอร์ — มีเลเยอร์แอตเทนชันเต็มรูปแบบสิบชั้นจากทั้งหมดสี่สิบชั้น แอตเทนชันเชิงเส้นช่วยป้องกันไม่ให้หน่วยความจำสำหรับบริบทระยะยาวและการคำนวณเพิ่มขึ้นจนเกินควบคุม; ส่วนเลเยอร์แอตเทนชันเต็มรูปแบบที่แทรกเป็นระยะๆ จะรักษาการเรียกคืนข้อมูลที่แม่นยำ ซึ่งแอตเทนชันเชิงเส้นบริสุทธิ์ต้องยอมสละไป เลเยอร์เชิงเส้นใช้คอนโวลูชันเคอร์เนลความกว้าง 4 และสถานะ SSM ในรูปแบบ float32 ซึ่งเป็นสูตรสไตล์ gated-delta ที่เป็นมาตรฐานในปัจจุบัน
• บริบท 256Kการฝังตำแหน่งสูงสุดคือ 262,144 โปรดสังเกตช่องว่างระหว่างสิ่งที่สถาปัตยกรรมรองรับกับวิธีที่ใช้ประเมินผล: InternLM รันการวัดประสิทธิภาพด้านข้อความที่ 128K และที่ 64K บน MMLU Pro, SimpleQA และ HLE เพดาน 256K ไม่ได้หมายความว่ามีคุณภาพที่ผ่านการตรวจสอบถึง 256K
• มีส่วนหัวทำนายหลายโทเคนในตัวมีโมดูล MTP หนึ่งชั้นพร้อมผู้เชี่ยวชาญ 256 ตัวของตัวเอง นี่ไม่ใช่ของตกแต่ง — คู่มือการปรับใช้แนะนำให้รันด้วย MTP speculative decoding และ draft tokens สี่ตัว ดังนั้นส่วนหนึ่งของความเร็วในโลกจริงจึงมาจาก speculative decoding ไม่ใช่สถาปัตยกรรมเพียงอย่างเดียว
• หอวิสัยทัศน์ที่แท้จริง ตัวเข้ารหัสวิสัยทัศน์แบบซ่อนชั้น 27 ชั้น 1152 หน่วย ซับซ้อน ด้วยแพตช์ขนาด 16 การรวมเชิงพื้นที่ 2x2 และการแบ่งเวลาเป็นแพตช์สำหรับวิดีโอ โดยฉายเข้าสู่กระแสข้อความ 2048 มิติพร้อม RoPE แบบมัลติโมดัลสลับกัน รับรูปภาพและวิดีโอเข้า ส่งออกเป็นข้อความ
• รายละเอียดอื่นๆ สำหรับผู้ที่อยากรู้: 16 แอตเทนชันเฮด (attention heads) ขนาด head dimension 256, 2 คีย์-แวลูเฮด (key-value heads) (grouped-query attention แบบเข้มข้น), เอาต์พุตแอตเทนชันแบบมีเกต (gated), ค่า partial rotary factor 0.25, ค่า theta ของ RoPE 10 ล้าน และคำศัพท์ 251,392 โทเคน
เกณฑ์ชี้วัด ทีละบรรทัด
InternLM ได้รับการประเมินด้วย OpenCompass และเผยแพร่การเปรียบเทียบเพียงชุดเดียว: Intern-S2-Mobius-35B เทียบกับ Qwen3.5-35B ซึ่งเป็นโมเดลต้นทางที่ใช้ในการ pre-train ต่อเนื่อง มีเกณฑ์มาตรฐานทั่วไปเก้าชุด และเกณฑ์มาตรฐานทางวิทยาศาสตร์สามชุด
ในการทดสอบทั่วไป Mobius ชนะเจ็ดในเก้ารายการ MMLU Pro — การทดสอบความรู้หลายโดเมนในวงกว้างพร้อมตัวลวงที่ยากกว่า MMLU ดั้งเดิม — ได้คะแนน 89.05 ต่อ 85.31 ซึ่งเพิ่มขึ้น 3.7 จุด และเป็นผลลัพธ์ด้านความรู้ที่ชัดเจนที่สุดในชุดนี้ GPQA Diamond คำถามวิทยาศาสตร์ระดับบัณฑิตศึกษาที่ถูกเขียนขึ้นเพื่อให้ค้นหาคำตอบใน Google ไม่เจอ ถือว่าเสมอกันที่ 80.81 เทียบกับ 80.24 IMO Bench คณิตศาสตร์ระดับโอลิมปิก ได้ 81.25 ต่อ 77.50 AIME 2026 ข้อสอบ American Invitational Mathematics Examination ได้ 95.31 ต่อ 92.08 HMMT 2026 การแข่งขัน Harvard-MIT Mathematics Tournament เป็นการเปลี่ยนแปลงที่มากที่สุดในหมวดคณิตศาสตร์ที่ 85.51 เทียบกับ 78.50 AMO ได้ 58.00 ต่อ 50.00 และ SimpleQA — การเรียกคืนข้อเท็จจริงแบบคำตอบสั้น ๆ ซึ่งเป็นเบนช์มาร์กที่วัดโดยตรงที่สุดว่าโมเดลรู้สิ่งต่าง ๆ จริงหรือไม่ — กระโดดจาก 21.39 เป็น 28.90 ซึ่งเป็นการปรับปรุงสัมพัทธ์ 35% และเป็นหลักฐานที่ดีที่สุดเพียงชิ้นเดียวสำหรับข้อโต้แย้งของ InternLM ที่ว่า "หน่วยความจำที่ใช้ร่วมกันช่วยบีบอัดความรู้ได้ดีกว่า"
จากนั้นก็มีการขาดทุนสองรายการ และนั่นคือแถวที่น่าสนใจ UGD hard กลับไปในทิศทางตรงกันข้าม: 73.02 สำหรับ Mobius เทียบกับ 78.02 สำหรับ baseline ซึ่งขาดไปห้าจุด และ HLE — Humanity's Last Exam ซึ่งเป็นการประเมินทั่วไปที่ยากที่สุดที่ใช้กันอย่างแพร่หลาย โดยที่โมเดลระดับแนวหน้ายังทำคะแนนได้แค่หลักสิบตอนต้นถึงหลักยี่สิบ — คือ 19.11 เทียบกับ 22.40 Transformer ธรรมดาชนะไป 3.3 คะแนนบนเกณฑ์ชี้วัดที่ออกแบบมาเพื่อต้องการการใช้เหตุผลมากที่สุดโดยเฉพาะ
รูปแบบนั้นไม่ใช่สัญญาณรบกวน และไม่ได้ถูกซ่อนไว้: InternLM เผยแพร่มัน การตีความที่เป็นไปได้มากที่สุดคือ การให้เหตุผลแบบแฝงเป็นการบีบอัด และการบีบอัดนั้นสูญเสียข้อมูลที่ส่วนท้าย การฝังการไตร่ตรองเข้าไปในสถานะซ่อนแบบต่อเนื่องทำงานได้อย่างยอดเยี่ยมเมื่อการไตร่ตรองนั้นเน้นการเรียกค้นหรือเป็นไปตามรูปแบบที่คุ้นเคย — ซึ่งอธิบาย MMLU Pro, SimpleQA และคณิตศาสตร์แข่งขันส่วนใหญ่ สำหรับปัญหาที่ต้องใช้ห่วงโซ่การคิดที่ยาว สำรวจ และแก้ไขข้อผิดพลาดอย่างแท้จริง การติดตามแบบชัดเจนทีละโทเค็นยังคงดูคุ้มกับต้นทุน ค่าเฉลี่ยโดยรวม — 67.88 เทียบกับ 65.05 — เป็นชัยชนะที่แท้จริง แต่มันเป็นค่าเฉลี่ยที่ปกปิดการแลกเปลี่ยน ไม่ใช่การปรับปรุงที่สม่ำเสมอ
ผลลัพธ์ทางวิทยาศาสตร์เป็นความแตกต่างในอีกระดับหนึ่ง Biology-Instructionsเพิ่มขึ้นจาก 3.77 เป็น 51.40. Mol-Instructionsซึ่งครอบคลุมความเข้าใจและการสร้างโมเลกุล เพิ่มขึ้นจาก 21.70 เป็น 45.73. MolecularIQเพิ่มขึ้นจาก 29.13 เป็น 59.29. ค่าเฉลี่ยคือ 52.14 เทียบกับ 18.20. ตัวเลขอย่าง 3.77 ที่เพิ่มขึ้นเป็น 51.40 ไม่ใช่ชัยชนะของสถาปัตยกรรม แต่เป็นลายเซ็นของการฝึกฝนเฉพาะโดเมนบนงานที่โมเดลพื้นฐานไม่เคยถูกสอนให้ทำ การที่ Qwen3.5-35B ได้คะแนนต่ำกว่า 4% ใน Biology-Instructions หมายความว่ามันไม่เข้าใจรูปแบบของงาน ไม่ใช่ว่ามันไม่เก่งชีววิทยา จงอ่านสามแถวนั้นว่า "InternLM เพิ่มความเชี่ยวชาญทางวิทยาศาสตร์" ซึ่งมีคุณค่าอย่างแท้จริง และเป็นประเด็นทั้งหมดของสาย Intern-S — เพียงแต่อย่าให้เครดิตกับสถาปัตยกรรม Mobius.
ที่ไหนที่ 'เร็วกว่า 4 เท่า' เป็นจริง และที่ไหนที่ไม่จริง
การอ้างสิทธิ์ด้านประสิทธิภาพคือเหตุผลที่โมเดลนี้มีอยู่ ดังนั้นจึงสมควรได้รับการอ่านอย่างละเอียด พาดหัวของ InternLM คือ "ความเร็วในการอนุมานแบบ end-to-end เพิ่มขึ้นเกือบ 4 เท่า" ตัวเลขปริมาณงาน (throughput) ที่เผยแพร่นั้นให้ข้อมูลมากกว่าพาดหัว และซื่อสัตย์มากกว่า
วัดจากปริมาณงานของคำขอเทียบกับขนาดแบตช์ โดยเฉลี่ยจากเกณฑ์มาตรฐาน Mobius ดีกว่า Transformer baseline ถึง 2.9x ที่แบตช์ 16 และ 4.6x ที่แบตช์ 256. ช่องว่างนี้กว้างขึ้นตามขนาดแบตช์ ซึ่งเป็นสิ่งที่คาดหวังได้เมื่อข้อได้เปรียบมาจากการสร้างโทเค็นต่อคำขอลดลง ยิ่งรวมคำขอเข้าด้วยกันมากเท่าใด ขั้นตอนการถอดรหัสที่ประหยัดได้ก็ยิ่งทบต้นมากขึ้นเท่านั้น หัวข้อ "เกือบ 4 เท่า" เป็นจุดกึ่งกลางของช่วง ไม่ใช่ค่าคงที่
แจกแจงตามเกณฑ์ชี้วัดแต่ละตัวแล้วภาพจะชัดเจนขึ้น ใน MMLU Pro และ GPQA Diamond Mobius เร็วกว่าอย่างเห็นได้ชัดในทุกขนาดแบตช์ — เส้นโค้งปริมาณงานแยกจากกันทันทีและยิ่งห่างออกไปเรื่อย ๆ ใน IMO Bench Mobius นำอย่างสม่ำเสมอแต่เพียงเล็กน้อย ใน AIME 2026 และ HMMT 2026 โมเดล Transformer พื้นฐานกลับ เร็วกว่า ในขนาดแบตช์ระดับกลาง โดย Mobius จะแซงขึ้นมาได้ก็ต่อเมื่อแบตช์มีขนาด 256 ในโจทย์คณิตศาสตร์แข่งขันที่ยากที่สุด ข้อได้เปรียบด้านปริมาณงานนั้นสูสีหรือแย่กว่าในช่วงการทำงานที่มีประโยชน์ส่วนใหญ่
ทำไมหรือ? เพราะว่า throughput สอดคล้องกับการบีบอัด trace เกือบสมบูรณ์แบบ ความยาวเอาต์พุตเฉลี่ยในแต่ละเกณฑ์ชี้วัดลดลงประมาณ 1.5 เท่า จากประมาณ 20,400 token เป็นประมาณ 13,200 token แต่ค่าเฉลี่ยนั้นครอบคลุมช่วงที่กว้างมาก: สั้นกว่า 4.6 เท่าใน MMLU Pro (ประมาณ 1,100 token เทียบกับ 5,150) และสั้นกว่า 5.0 เท่าใน GPQA Diamond (ประมาณ 2,600 เทียบกับ 12,900) ในขณะที่เพียง 1.4 เท่าใน IMO Bench, 1.5 เท่าใน AIME 2026, และ 1.2 เท่าใน HMMT 2026. ในจุดที่โมเดลสามารถบีบอัดความคิดของมันได้ มันก็จะทำงานได้อย่างรวดเร็ว ในจุดที่โจทย์ต้องการการคำนวณถึง 24,000 token ไม่ว่าจะอย่างไรก็ตาม มันก็ไม่สามารถทำได้ และค่าใช้จ่ายของสถาปัตยกรรมก็จะแสดงออกมาแทน
การแปลความหมายในเชิงปฏิบัติ: หากปริมาณงานของคุณมีลักษณะเป็นการดึงข้อมูลความรู้ การเลือกตอบ การถาม-ตอบเชิงเทคนิค หรือการจำแนกประเภท ความเร็วที่เพิ่มขึ้นจะมากและเห็นผลทันที หากปริมาณงานของคุณเป็นการหามาเชิงคณิตศาสตร์หรือวิทยาศาสตร์ที่ยาก ให้คาดการณ์ว่าความเร็วจะเท่าเทียมกันโดยประมาณ และคุณอาจจะประหลาดใจในทางที่ดี ใครก็ตามที่อ้างว่า "เร็วกว่า 4 เท่า" เป็นคุณสมบัติทั่วไปของโมเดล กำลังอ้างค่าเฉลี่ยของพฤติกรรมสองแบบที่แตกต่างกันมาก

ชุดเครื่องมือวิทยาศาสตร์ที่ซ่อนอยู่ในรายการไฟล์
สิ่งหนึ่งที่เปิดเผยที่สุดเกี่ยวกับรุ่นนี้ไม่ได้อยู่ในการ์ดโมเดลเลย — แต่อยู่ในรายการไฟล์ของ repository ถัดจากไฟล์ tokenizer ปกติ Intern-S2-Mobius มาพร้อมกับ tokenizer เฉพาะโดเมนเพิ่มเติมสามตัว: code>tokenizer_PROT.model/code> สำหรับลำดับโปรตีน, code>tokenizer_SMILES.model/code> สำหรับโครงสร้างโมเลกุลในรูปแบบ SMILES และ code>tokenizer_XNA.model/code> สำหรับลำดับกรดนิวคลีอิก นอกจากนี้ยังมีอาร์เรย์ NumPy ที่หลงเหลือของข้อมูลแผ่นดินไหววางอยู่ใน repo.
โทเค็นไนเซอร์เฉพาะทางสำหรับโปรตีน โมเลกุล และ DNA/RNA ไม่ใช่สิ่งที่คุณจะเพิ่มเข้าไปอย่างไม่ใส่ใจ พวกมันหมายความว่าโมเดลถูกฝึกให้อ่านประเภทลำดับเหล่านั้นในฐานะอินพุตระดับแรก ไม่ใช่เป็นข้อความธรรมดาที่บังเอิญมีตัวอักษรอยู่ นั่นคือสิ่งที่เปลี่ยนคะแนน 3.77 ให้เป็น 51.40 ใน Biology-Instructions และทำให้ Mobius อยู่ในตระกูลเดียวกับ Intern-S2-Preview พี่น้องของมัน ซึ่งเพิ่มโหมดข้อมูลอนุกรมเวลาและวิทัศน์ และตามที่ InternLM กล่าว เป็นโมเดลโอเพนซอร์สตัวแรกที่มีความสามารถในการสร้างโครงสร้างผลึกวัสดุ
หากคุณเป็นนักพัฒนาทั่วไป นี่คือเรื่องไม่สำคัญ แต่หากคุณทำงานในสาขาชีววิทยาเชิงคำนวณ เคมีสารสนเทศ หรือวัสดุศาสตร์ นี่อาจเป็นบรรทัดที่สำคัญที่สุดในบทความนี้: นี่คือโมเดลขนาดเล็กที่ใช้สัญญาอนุญาต Apache-2.0 โฮสต์เองได้ และพูดภาษา SMILES และลำดับโปรตีนได้โดยตรง
มันอยู่ตรงตำแหน่งใดในตระกูล Intern
Intern-S คือซีรีส์มัลติโมดัลทางวิทยาศาสตร์ของ Shanghai AI Laboratory Intern-S1 ได้กำหนดรูปแบบไว้ Intern-S1-Pro ขยายขีดความสามารถไปสู่ระดับพารามิเตอร์ล้านล้าน Intern-S2-Preview ซึ่งเปิดตัวก่อน Mobius ไม่นาน คือโมเดลที่เน้นประสิทธิภาพ: พารามิเตอร์รวม 36B, ใช้งานจริง 3B, มีผู้เชี่ยวชาญ 256 ตัว และบริบท 262K ซึ่ง InternLM อ้างว่าทำงานเทียบเท่ากับ S1-Pro ระดับล้านล้านในงานวิทยาศาสตร์ระดับมืออาชีพหลัก — ลดพารามิเตอร์ลงประมาณ 30 เท่าเพื่อความสามารถทางวิทยาศาสตร์ที่เทียบเคียงได้
Intern-S2-Mobius คือสิ่งที่สาม: สถาปัตยกรรมรุ่นที่ใช้ชื่อ Intern-S2 คำว่า "v0" ใน Mobius-v0 มีความหมายจริงในป้ายชื่อนั้น — นี่คือการเผยแพร่ต่อสาธารณะครั้งแรกของการออกแบบ ไม่ใช่สายผลิตภัณฑ์ที่เติบโตเต็มที่ มันเชื่อมต่อกับ ArchSpace ซึ่งเป็นแพลตฟอร์มเปิดของ InternLM สำหรับตรวจสอบนวัตกรรมสถาปัตยกรรม LLM โดยมีเป้าหมายที่ประกาศไว้คือ "เปลี่ยนการสำรวจสถาปัตยกรรม LLM ให้เป็นความรู้ที่นำกลับมาใช้ใหม่ได้สำหรับชุมชน" พร้อมการทบทวนโดยผู้เชี่ยวชาญและผลลัพธ์ที่เผยแพร่รวมถึงผลลัพธ์เชิงลบ Mobius คือสิ่งที่โปรแกรมนั้นเป็นเมื่อข้อเสนอเลื่อนขั้นจากโมเดลทดลองขนาด 1B เป็นโมเดล 35B ที่คุณดาวน์โหลดได้จริง รายงานทางเทคนิคฉบับเต็มมาพร้อมกับที่เก็บ GitHub สำหรับผู้ที่ต้องการที่มาของสูตร
เมื่อมองในแง่นั้น การที่ benchmark สองรายการมีผลลัพธ์ลดลงถือเป็นคุณลักษณะของการเปิดตัวครั้งนี้ ไม่ใช่เรื่องน่าอับอาย นี่คือห้องแล็บที่เผยแพร่การทดลองทางสถาปัตยกรรมอย่างตรงไปตรงมา รวมถึงจุดที่ประสิทธิภาพถดถอย
วิธีเรียกใช้งาน
Intern-S2-Mobius รองรับสแตกการอนุมานสามชุด และคู่มือการปรับใช้งานมีคำสั่งเรียกใช้งานที่ใช้ได้จริงสำหรับแต่ละชุด
LMDeployเป็นเส้นทางที่แนะนำและเป็นเส้นทางเดียวที่คู่มือแสดงบน GPU ตัวเดียว: ให้บริการด้วยแบ็กเอนด์ PyTorch, code>--trust-remote-code/code>, เทนเซอร์พาราเลลิซึมเท่ากับ 1 และเปิดใช้งานการถอดรหัสแบบคาดเดา MTP ผ่านอัลกอริทึมการคาดเดา qwen3_5_mtp ด้วยโทเค็นร่าง 4 ตัว. vLLMแสดงด้วยเทนเซอร์พาราเลลิซึมเท่ากับ 2 ตัวแยกวิเคราะห์การให้เหตุผล qwen3 ตัวแยกวิเคราะห์การเรียกใช้เครื่องมือ qwen3_coder การเลือกเครื่องมืออัตโนมัติ และการถอดรหัสแบบคาดเดา MTP ด้วยโทเค็นคาดเดา 4 ตัว. Transformersทำงานสำหรับการอนุมานพื้นฐานผ่าน code>AutoModelForImageTextToText/code> ด้วย code>trust_remote_code=True/code> และ bfloat16 — โปรดทราบว่าโมเดลมาพร้อมโค้ดการสร้างแบบจำลองที่กำหนดเอง ดังนั้นการเรียกใช้โค้ดระยะไกลจึงจำเป็น และการกำหนดค่าตั้งเป้าไปที่ Transformers 5.2.
พารามิเตอร์การสุ่มตัวอย่างที่ InternLM แนะนำคือ temperature 0.8, top-p 0.95, top-k 50 และ min-p 0.0 — ซึ่งอุ่นกว่าการตั้งค่าแบบ near-greedy ที่โมเดล reasoning ส่วนใหญ่ต้องการ ซึ่งเป็นสิ่งที่ควรเคารพมากกว่าจะเขียนทับด้วยความเคยชิน
ในด้านฮาร์ดแวร์: น้ำหนัก bfloat16 ประมาณ 73 GB บวกกับ KV cache และ activations หมายความว่า accelerator ขนาด 80 GB ตัวเดียวจะแน่นไปหน่อย ในขณะที่การ์ดขนาด 141 GB ตัวเดียวนั้นสบายมาก ซึ่งน่าจะเป็นเหตุผลที่ตัวอย่าง vLLM ใช้ GPU สองตัว ในขณะที่ตัวอย่าง LMDeploy สมมติให้ใช้การ์ดขนาดใหญ่หนึ่งตัว งานที่ต้องใช้บริบทยาวจะยิ่งเพิ่มความต้องการนี้สูงขึ้น เปิดใช้ MTP — คู่มือแนะนำไว้อย่างชัดเจน และสัดส่วนที่มีนัยสำคัญของความเร็วที่โฆษณาไว้นั้นอยู่ตรงนั้น ไม่ใช่ในสถาปัตยกรรมพื้นฐาน
ข้อควรระวังเชิงปฏิบัติที่สำคัญที่สุด: ปัจจุบันไม่มีผู้ให้บริการ inference ใดโฮสต์โมเดลนี้ แผงผู้ให้บริการของ Hugging Face ระบุไว้ชัดเจน และตัวเลขดาวน์โหลดยังคงเป็นศูนย์เมื่อเขียนบทความนี้ ไม่มี API endpoint ไม่มีราคาต่อล้านโทเค็น และไม่มีวิธีจัดการเพื่อลองใช้ การโฮสต์ด้วยตนเองเป็นทางเลือกเดียวในตอนนี้

ใครควรจะสนใจจริงๆ
1. ทีมที่เรียกใช้ภาระงานด้านการให้เหตุผลที่มีปริมาณสูงและมีรูปแบบการค้นคืนข้อมูล
นี่คือโปรไฟล์ที่สถาปัตยกรรมถูกสร้างขึ้นมา หากคุณให้บริการชุดคำถาม-คำตอบทางเทคนิคจำนวนมาก การวิเคราะห์เอกสาร การสกัดข้อมูลแบบมีโครงสร้าง หรือการจำแนกแบบ multiple-choice ผ่านโมเดลที่ใช้เหตุผล และค่าใช้จ่ายของคุณถูกครอบงำด้วย reasoning tokens ที่คุณไม่เคยแสดงให้ผู้ใช้เห็น โมเดลที่ได้คำตอบเดียวกันในจำนวน tokens เพียงหนึ่งในห้าถือเป็นการลดต้นทุนโดยตรง ตัวเลข MMLU Pro และ GPQA — trace สั้นลง 4.6x และ 5.0x ด้วยความแม่นยำเท่ากันหรือดีกว่า — คือรูปแบบนี้พอดี ลองเบนช์มาร์กกับทราฟฟิกของคุณเองก่อนจะเชื่อ แต่กลไกนั้นสมเหตุสมผลและแรงจูงใจก็มหาศาล
2. กลุ่มวิทยาการคำนวณ
โทเคนไนเซอร์สำหรับโปรตีนพื้นเมือง SMILES และกรดนิวคลีอิก พร้อมกับการปรับปรุงที่วัดได้อย่างมากในเกณฑ์ชี้วัดทางชีววิทยาและโมเลกุล ในโมเดล Apache 2.0 ที่ทำงานบน GPU หนึ่งหรือสองตัว สำหรับห้องปฏิบัติการที่ต้องการให้ข้อมูลอยู่ในองค์กรและไม่สามารถส่งโครงสร้างโมเลกุลไปยัง API เชิงพาณิชย์ได้ การผสมผสานแบบนั้นหายาก กลุ่มโมเดล Intern-S ได้พัฒนามาเพื่อจุดนี้ และ Mobius คือจุดเริ่มต้นที่ถูกที่สุดเข้าสู่ระบบนี้ในตอนนี้
3. นักวิจัยและผู้ติดตามสถาปัตยกรรม
การแยกความรู้กับการให้เหตุผลออกจากกันและการให้เหตุผลแบบแฝงเป็นหัวข้อวิจัยที่มีการดำเนินการมาสักระยะหนึ่งแล้ว แต่มีเพียงไม่กี่ชิ้นที่ผ่านการตรวจสอบที่ขนาด 35B และถูกเผยแพร่อย่างเปิดเผยพร้อมกับกรณีความล้มเหลวครบถ้วน หากคุณสนใจว่าสถาปัตยกรรมหลังยุค Transformer จะก้าวไปทางไหนต่อ รายงานทางเทคนิคและสองแถวที่แพ้นั้นน่าสนใจกว่าคะแนนเฉลี่ยเสียอีก ArchSpace ถูกสร้างขึ้นมาโดยชัดเจนเพื่อให้ผลลัพธ์ในลักษณะนี้สามารถนำกลับมาใช้ใหม่ได้
ใครที่ไม่ควรสนใจ อย่างน้อยก็ตอนนี้: คนที่มองหาผู้ช่วยอเนกประสงค์สำหรับใช้ในงานผลิตจริง ยังไม่มี hosted endpoint ไม่มีการประเมินอย่างเป็นอิสระ ไม่มีเครื่องมือในระบบนิเวศ และไม่มีประวัติการใช้งาน นั่นไม่ใช่การตำหนิตัวโมเดล — แต่เป็นการอธิบายถึงผลงานวิจัยที่เพิ่งเปิดตัวมาได้เพียงหนึ่งสัปดาห์
มันเข้ากับสแตกสำหรับโปรดักชันได้อย่างไร
ตำแหน่งที่ตรงไปตรงมาของ Intern-S2-Mobius ในวันนี้คือ ตัวเลือกสำหรับการประเมินผล ไม่ใช่ โมเดลเริ่มต้น มันเป็นผลงานวิจัยที่มีอายุเพียงหนึ่งสัปดาห์ ยังไม่ถูกโฮสต์ และไม่ได้รับการตรวจสอบ มีสถาปัตยกรรมที่น่าสนใจอย่างแท้จริง และจุดแข็งที่เฉพาะเจาะจงอย่างหนึ่ง — การใช้โทเค็นอย่างมีประสิทธิภาพในการให้เหตุผลกับงานที่เกี่ยวกับการดึงข้อมูล — รวมถึงความเชี่ยวชาญพิเศษด้านข้อมูลลำดับทางวิทยาศาสตร์
รูปแบบที่สมเหตุสมผลคือการให้ทราฟฟิกโปรดักชันของคุณยังคงอยู่บนเอนด์พอยต์ที่ไม่ผูกกับผู้จำหน่ายใดๆ เช่น OrcaRouter ซึ่งให้ API ที่เข้ากันได้กับ OpenAI หนึ่งเดียวครอบคลุมหลายโมเดล และตั้ง Mobius แยกต่างหากบน GPU ของคุณเองสำหรับสัดส่วนแคบๆ ที่มันอาจชนะได้ วัดสิ่งที่สำคัญจริงๆ สำหรับโมเดลนี้: ไม่ใช่แค่ความแม่นยำ แต่คือ จำนวนโทเคนที่ใช้ต่อคำตอบที่ถูกต้อง. นี่คือมิติที่ Mobius ถูกปรับให้เหมาะสมที่สุด และเป็นมิติที่เครื่องมือประเมินผลส่วนใหญ่มองข้าม ถ้ามันผ่านกับเวิร์กโหลดของคุณ คุณจะมีเส้นทางแบบโฮสต์เองที่ค่าใช้จ่ายต่ำและไม่มีข้อจำกัดทางกฎหมาย ถ้าไม่ คุณก็เสียเวลา GPU ไปหนึ่งวันและเส้นทางโปรดักชันของคุณก็ไม่ขยับเลย
ตรรกะเดียวกันนี้ใช้ในทางกลับกัน หากผู้ให้บริการโฮสต์มันในที่สุด: เราเตอร์ช่วยให้คุณทดสอบ A/B โมเดลใหม่กับโมเดลเดิมที่ใช้งานอยู่โดยไม่ต้องเขียนอะไรใหม่ ซึ่งเป็นวิธีที่ถูกต้องอย่างยิ่งในการนำสถาปัตยกรรมที่ยังไม่มีใครทดสอบอย่างอิสระมาใช้
ข้อจำกัดและข้อควรระวัง
เริ่มต้นจากสิ่งที่ใหญ่ที่สุด: ไม่มีการตรวจสอบโดยอิสระสำหรับตัวเลขใดๆ ในบทความนี้ ทุกเกณฑ์มาตรฐาน ทุกกราฟปริมาณงาน และทุกการเปรียบเทียบความยาวโทเค็นล้วนมาจาก InternLM การเปรียบเทียบนี้ยังมีโครงสร้างที่เอื้อประโยชน์ — Mobius ถูกวัดเทียบกับเกณฑ์พื้นฐานเฉพาะที่มันถูก pre-train ต่อเนื่องมาเท่านั้น ไม่ได้เทียบกับ frontier ในปัจจุบัน และการ post-train เพิ่มเติมด้วย SFT และ RL ทำให้การเปรียบเทียบนี้ไม่ใช่การ ablation ทางสถาปัตยกรรมที่บริสุทธิ์ แม้ว่าจะถูกนำเสนอเช่นนั้นก็ตาม ผลประโยชน์บางส่วนมาจาก Mobius บางส่วนก็มาจากการฝึกเพิ่มเติมเท่านั้น
การถดถอยนั้นเป็นเรื่องจริง และมันเกิดขึ้นในงานที่ยากที่สุด การแพ้ HLE ไป 3.3 คะแนน และแพ้ UGD hard ไป 5 คะแนน ในขณะที่ชนะเกือบทุกอย่างที่ง่ายกว่า เป็นสัญญาณที่สอดคล้องกันและน่ากังวลเล็กน้อยสำหรับโมเดลที่มีจุดขายคือประสิทธิภาพในการให้เหตุผล
ในทางปฏิบัติ ความยุ่งยากไม่ใช่เรื่องเล็ก โค้ดสร้างโมเดลแบบกำหนดเองหมายถึง code>trust_remote_code/code> และเวอร์ชัน Transformers ที่ล้ำสมัย เฟรมเวิร์กที่รองรับมันจะต้องใหม่พอที่จะรู้ว่า code>interns2_mobius/code> คืออะไร และคู่มือของ InternLM เองก็เตือนว่าสิ่งเหล่านี้เป็นคอนฟิกูเรชันอ้างอิงที่อยู่ระหว่างการพัฒนาอย่างต่อเนื่อง น้ำหนักของโมเดลประมาณ 73 GB ไม่ใช่โมเดลสำหรับแล็ปท็อป ไม่มี API ที่โฮสต์ ไม่มีราคา ไม่มีการจำกัดอัตราการใช้งาน และไม่มี SLA — เพราะไม่มีบริการ
สุดท้ายนี้ โปรดสังเกตสิ่งที่ยังไม่ถูกเผยแพร่: ไม่มีผลการทดสอบมัลติโมดัลแม้จะมีตัวเข้ารหัสภาพเต็มรูปแบบ ไม่มีการประเมินบริบทระยะยาวแม้จะมีขีดจำกัด 256K ไม่มีการทดสอบการเขียนโค้ดเลยแม้แต่อย่างเดียว ไม่มีการประเมินด้านความปลอดภัยหรือการปรับความสอดคล้อง (alignment) และไม่มีการเปรียบเทียบกับโมเดลอื่นใดนอกจาก Qwen3.5-35B สำหรับการนำไปใช้งานทั่วไป สิ่งเหล่านี้คือช่องว่างขนาดใหญ่ สำหรับเอกสารเชิงสถาปัตยกรรมที่มีน้ำหนักโมเดลแนบมาด้วย สิ่งเหล่านี้อยู่นอกขอบเขตโดยสิ้นเชิง — ซึ่งเป็นวิธีที่ถูกต้องในการตีความการเผยแพร่นี้
คำถามที่พบบ่อย
Intern-S2-Mobius คืออะไร
โมเดลพื้นฐานแบบมัลติโมดัลขนาด 35B พารามิเตอร์ ภายใต้สัญญาอนุญาต Apache 2.0 จากทีม InternLM ของห้องปฏิบัติการ AI เซี่ยงไฮ้ (Shanghai AI Laboratory) สร้างขึ้นบนสถาปัตยกรรม Mobius-v0 ที่แยกการจัดเก็บความรู้ออกจากการคำนวณเชิงเหตุผล โดยผ่านการฝึกก่อนล่วงหน้าอย่างต่อเนื่องจาก Qwen3.5-35B และผ่านการฝึกหลังด้วย SFT และการเรียนรู้แบบเสริมกำลัง เผยแพร่บน Hugging Face เมื่อวันที่ 29 กรกฎาคม 2026
อะไรที่ทำให้สถาปัตยกรรม Mobius แตกต่าง
ทรานส์ฟอร์มเมอร์ทั่วไปจัดเก็บความรู้ไว้ในบล็อกฟีดฟอร์เวิร์ดภายในทุกเลเยอร์ ความรู้จึงเข้าถึงได้เฉพาะที่ความลึกซึ่งมันถูกเก็บไว้ Mobius แทนที่สิ่งนั้นด้วยหน่วยความจำที่แชร์ร่วมกันทั่วโลกหนึ่งชุด — ในคอนฟิกที่เผยแพร่มีผู้เชี่ยวชาญ 2,560 ตัว — ซึ่งบล็อก Reasoner สี่ตัวเรียกใช้ซ้ำ ๆ ทำให้เข้าถึงความรู้ข้ามระดับความลึกได้ และปล่อยให้การคิดใคร่ครวญบางส่วนเกิดขึ้นในสถานะซ่อนเร้นแบบต่อเนื่อง แทนที่จะเป็นโทเคนสายความคิดที่ถูกสร้างขึ้น
Intern-S2-Mobius เร็วกว่า 4 เท่าจริงหรือ?
โดยเฉลี่ยและที่ขนาดแบตช์ขนาดใหญ่ คำตอบคือประมาณว่าใช่: InternLM วัดปริมาณงานการร้องขอที่สูงกว่า 2.9 เท่าที่แบตช์ 16 และเพิ่มขึ้นเป็น 4.6 เท่าที่แบตช์ 256 แต่มันแตกต่างกันอย่างมากตามงาน ใน MMLU Pro และ GPQA Diamond ความได้เปรียบมีมากในทุกขนาดแบตช์; ในขณะที่การแข่งขันคณิตศาสตร์ AIME และ HMMT Transformer พื้นฐานกลับเร็วกว่าจริง ๆ ที่ขนาดแบตช์ระดับกลาง ความเร็วที่เพิ่มขึ้นสอดคล้องกับปริมาณที่โมเดลสามารถทำให้ร่องรอยการใช้เหตุผลสั้นลง
มันเทียบกับ Qwen3.5-35B ได้อย่างไร?
มันชนะ 7 จาก 9 เกณฑ์มาตรฐานทั่วไป โดยมีค่าเฉลี่ย 67.88 เทียบกับ 65.05 รวมถึง MMLU Pro (89.05 เทียบกับ 85.31), AIME 2026 (95.31 เทียบกับ 92.08), HMMT 2026 (85.51 เทียบกับ 78.50) และ SimpleQA (28.90 เทียบกับ 21.39) มันแพ้ UGD hard (73.02 เทียบกับ 78.02) และ HLE (19.11 เทียบกับ 22.40) ในงานด้านวิทยาศาสตร์ มันนำอยู่ไกลมาก — ค่าเฉลี่ย 52.14 เทียบกับ 18.20
ฉันสามารถใช้ Intern-S2-Mobius ผ่าน API ได้ไหม
ยังไม่มีในขณะนี้ ไม่มีผู้ให้บริการ inference ใดโฮสต์โมเดลนี้ ยังไม่มีการเปิดเผยราคา และ Hugging Face ก็ไม่มีการระบุการปรับใช้ การโฮสต์ด้วยตนเองด้วย LMDeploy, vLLM หรือ Transformers เป็นวิธีเดียวที่จะรันมันได้ในปัจจุบัน
ต้องใช้ฮาร์ดแวร์อะไรบ้างถึงจะรันมันได้
น้ำหนักของโมเดลมีขนาดประมาณ 73 GB ในรูปแบบ bfloat16 ดังนั้นควรวางแผนใช้ตัวเร่งความเร็วระดับ 141 GB หนึ่งตัว หรือ GPU ขนาด 80 GB สองตัว รวมถึงเผื่อพื้นที่สำหรับ KV cache ด้วย ตัวอย่าง LMDeploy ของ InternLM ใช้ tensor parallelism เท่ากับ 1 ส่วนตัวอย่าง vLLM ใช้เท่ากับ 2 แนะนำให้เปิดใช้ MTP speculative decoding ด้วย draft tokens สี่ตัว
ความยาวบริบทของมันคือเท่าไร
การกำหนดค่านี้รองรับ 262,144 โทเคน (256K) โปรดทราบว่า InternLM ได้รับการประเมินที่ 128K ในเกณฑ์มาตรฐานข้อความส่วนใหญ่ และ 64K บน MMLU Pro, SimpleQA และ HLE ดังนั้นคุณภาพที่ผ่านการตรวจสอบที่ 256K เต็มรูปแบบจึงยังไม่ได้รับการพิสูจน์
มันรองรับหลายรูปแบบหรือไม่?
ใช่ Hugging Face จัดประเภทโมเดลนี้เป็น image-text-to-text และคอนฟิกมี vision encoder 27 ชั้นพร้อมการจัดการ video token อย่างไรก็ตาม InternLM ไม่ได้เผยแพร่ผลการวัดประสิทธิภาพ multimodal ใด ๆ กับการเปิดตัวครั้งนี้ ดังนั้นความสามารถด้านวิทัศน์จึงไม่มีการบันทึกไว้ในทางปฏิบัติ
ทำไมมันถึงมาพร้อมกับตัวแยกโทเค็นโปรตีนและ SMILES
เนื่องจากกลุ่มโมเดล Intern-S เป็นตระกูลโมเดลทางวิทยาศาสตร์ โทเค็นไนเซอร์เฉพาะสำหรับลำดับโปรตีน สัญกรณ์โมเลกุล SMILES และกรดนิวคลีอิก หมายความว่าโมเดลอ่านรูปแบบเหล่านั้นเป็นประเภทอินพุตดั้งเดิม ซึ่งเป็นเหตุผลที่มันได้คะแนน 51.40 ใน Biology-Instructions ในขณะที่เกณฑ์พื้นฐานได้ 3.77
ใบอนุญาตเป็น Apache 2.0 จริงหรือ?
ใช่ — Apache 2.0 พร้อมไฟล์ใบอนุญาตในที่เก็บโค้ด การใช้งานเชิงพาณิชย์ การดัดแปลง และการแจกจ่ายต่อได้รับอนุญาต ซึ่งผ่อนปรนกว่าโมเดลแบบเปิดน้ำหนักหลายตัวจากห้องแล็บขนาดใหญ่อย่างเห็นได้ชัด
ฉันควรใช้มันในโปรดักชันไหม?
ยังไม่ใช่ โมเดลนี้มีอายุเพียงหนึ่งสัปดาห์ ยังไม่มีการโฮสต์ ยังไม่ได้รับการตรวจสอบโดยบุคคลที่สาม และขาดการประเมินด้านการเขียนโค้ด มัลติโมดัล บริบทระยะยาว และความปลอดภัย ควรถือว่าเป็นผู้สมัครสำหรับการประเมินด้านการใช้เหตุผลที่ประหยัดโทเค็นหรืองานด้านลำดับทางวิทยาศาสตร์ เก็บปริมาณงานการผลิตไว้กับโมเดลที่ได้รับการยอมรับผ่านเอนด์พอยต์ที่เป็นกลางระหว่างผู้ให้บริการ และกลับมาพิจารณาใหม่เมื่อมีตัวเลขจากการประเมินอิสระ
บรรทัดล่าง
Intern-S2-Mobius เป็นหนึ่งในโมเดลที่ปล่อยออกมาในปีนี้ซึ่งน่าสนใจอย่างแท้จริง และแทบไม่มีส่วนใดเกี่ยวข้องกับคะแนนของมันเลย InternLM นำแนวคิดเชิงสถาปัตยกรรมที่แท้จริง — หยุดผูกความรู้เข้ากับเลเยอร์ เก็บไว้ในหน่วยความจำร่วมเดียว และให้โมเดลคิดบางส่วนในปริภูมิแฝงแทนที่จะเป็นโทเคน — ขยายขนาดเป็น 35B ฝึกฝนอย่างเหมาะสม และปล่อยน้ำหนักภายใต้ Apache 2.0 พร้อมกับรายงานทางเทคนิคและผลลัพธ์ที่ไม่เป็นไปตามที่คาดหวัง กลไกประสิทธิภาพนั้นอ่านเข้าใจได้ และหลักฐานก็สอดคล้องภายใน: เทรซสั้นลงโดยเฉลี่ย 1.5 เท่า และสั้นลงถึง 5 เท่าในงานที่ต้องใช้ความรู้มาก และปริมาณงานเพิ่มขึ้นในสัดส่วนที่คุณคาดเดาได้จากสิ่งนั้น
ข้อควรระวังก็ชัดเจนไม่แพ้กัน {{1}}ไม่มีใครนอก Shanghai AI Laboratory ที่ยืนยันตัวเลขได้แม้แต่ตัวเดียว{{/1}} {{2}}การเปรียบเทียบนี้เทียบกับโมเดลฐานของตัวมันเองและรวมการฝึกหลังเทรนเพิ่มเติม (post-training) จึงไม่ใช่ ablation ที่สะอาดอย่างที่ดูเหมือน{{/2}} {{3}}ความเร็วที่เพิ่มขึ้นส่วนใหญ่หายไปเมื่อเจอคณิตศาสตร์ยากๆ{{/3}} {{4}}โมเดลแพ้ในสองเกณฑ์ชี้วัดการให้เหตุผลที่ยากที่สุดในตารางของตัวเอง{{/4}} {{5}}และไม่มีวิธีลองใช้โดยไม่ต้องเช่า GPU{{/5}}
ดังนั้น: ยังไม่ใช่โมเดลที่จะนำไปใช้งานจริงในสัปดาห์นี้ แต่เป็นโมเดลที่น่าจับตามองอย่างยิ่ง และเป็นตัวเลือกที่น่าสนใจอย่างแท้จริงสำหรับกลุ่มเป้าหมายเฉพาะสองกลุ่ม — ทีมที่ค่าใช้จ่ายด้านการให้เหตุผลถูกครอบงำด้วยโทเค็นที่ไม่มีใครอ่าน และกลุ่มนักวิทยาศาสตร์ที่ต้องการโมเดลขนาดเล็กที่มีใบอนุญาตแบบเสรีซึ่งเข้าใจโปรตีนและโมเลกุลได้โดยธรรมชาติ คงสแต็กการผลิตไว้กับโมเดลที่ผ่านการพิสูจน์แล้วผ่านเอนด์พอยต์ที่เป็นกลางต่อผู้จำหน่ายอย่าง OrcaRouter ตั้ง Mobius ขึ้นบนฮาร์ดแวร์ของคุณเองสำหรับกรณีการใช้งานเฉพาะ และวัดโทเค็นต่อคำตอบที่ถูกต้องแทนที่จะวัดเพียงความแม่นยำ หากสถาปัตยกรรมยังคงแข็งแกร่งภายใต้การตรวจสอบอย่างอิสระ Mobius-v0 จะถูกจดจำในฐานะโมเดล 35B น้อยกว่าการเป็นเลขเวอร์ชันก่อนหน้ารุ่นที่มีความสำคัญ
