
Step 5 Preview vs Intern-S2 Mobius: คุณต้องการเรือธงขนาด 600B หรือตัวให้เหตุผลขนาด 35B ที่รวดเร็ว?
- Orcaใหม่Orca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 ต่อ 1 ล้านโทเค็น
- openaiใหม่OpenAI: GPT-6.1 Sol2026-09-2952ความฉลาด
- anthropicใหม่Anthropic: Claude Sonnet 5.52026-09-2856ความฉลาด
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 ต่อ 1 ล้านโทเค็น · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238ความฉลาด
- OpenAIOpenAI: GPT-6 Sol2026-09-2248ความฉลาด
- AnthropicAnthropic: Claude Opus 5.52026-09-2258ความฉลาด
- xAIGrok 4.72026-09-2146ความฉลาด
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 ต่อ 1 ล้านโทเค็น · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 ต่อ 1 ล้านโทเค็น · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- OpenAIOpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245ความฉลาด76การเขียนโค้ด
- AnthropicAnthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 ต่อ 1 ล้านโทเค็น · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
เหตุผลที่ตรงไปตรงมาในการเปรียบเทียบ Step 5 Preview กับ Intern-S2 Mobius ไม่ใช่เพราะทั้งสองคล้ายกัน แต่เป็นเพราะทั้งสองเป็นคำตอบสำหรับคำถามที่แตกต่างกันสองข้อจากผู้ซื้อรายเดียวกัน — ทีมที่มีเวิร์กโหลดด้านการให้เหตุผลให้รัน และไม่อยากซื้อคลัสเตอร์ StepFun's Step 5 Preview ซึ่งประกาศเมื่อวันที่ 20 กันยายน 2026 คือคำตอบขนาดใหญ่: พารามิเตอร์รวมประมาณ 6 แสนล้าน โดยมี 2.7 หมื่นล้านที่ทำงานอยู่ บริบทขนาด 1 ล้านโทเคน คะแนน Artificial Analysis Intelligence Index ที่วัดโดยอิสระได้ 44 และราคาที่ประกาศไว้ที่ $1.00 ต่อล้านโทเคนอินพุต และ $2.70 ต่อล้านโทเคนเอาต์พุต InternLM's Intern-S2 Mobius ซึ่งเปิดตัวเมื่อวันที่ 29 กรกฎาคม 2026 คือคำตอบขนาดเล็ก: โมเดลน้ำหนักเปิดขนาด 35 พันล้านพารามิเตอร์ที่สร้างบนสถาปัตยกรรม Mobius-v0 ผ่านการฝึกต่อเนื่องแบบ pretrained จาก Qwen3.5-35B โดยจุดขายหลักไม่ใช่ความสามารถแต่เป็นความเร็ว — เร่งความเร็วแบบ end-to-end ประมาณ 4 เท่าในเบนช์มาร์กด้านการให้เหตุผลเมื่อเทียบกับโมเดลฐานที่ฝึกมา โดยไม่มีคะแนนเบนช์มาร์กอิสระใด ๆ เลย ตัวหนึ่งเป็นเรือธงที่คุณเช่าใช้ อีกตัวเป็นโมเดลเล็กที่คุณรัน การเปรียบเทียบนี้จริง ๆ แล้วอยู่ที่ว่างานที่อยู่ตรงหน้าคุณคุ้มค่ากับการเลือกใช้เรือธงหรือไม่
เรื่องที่ต้องเคลียร์ก่อนพูดถึงตัวเลข เพราะมันทำให้ผู้คนเสียเวลาจริง ๆ: InternLM ได้เปิดตัวโมเดลหลายตัวภายใต้ชื่อ Intern-S2 และพวกมันไม่ใช่สิ่งเดียวกัน Intern-S2-397B เป็นเรือธงมัลติโมดัลเชิงวิทยาศาสตร์ ส่วน Intern-S2 Mobius คือโมเดลให้เหตุผลขนาด 35B ที่มีประสิทธิภาพซึ่งกำลังพูดถึงกันที่นี่ และรุ่น Intern-S2 ที่เปิดตัวก่อนหน้านี้ก็เป็นอีกโมเดลหนึ่งแยกต่างหาก หากคุณค้นหา "Intern-S2" แล้วไปเจอตาราง benchmark ของโมเดลขนาด 397B แสดงว่าคุณกำลังอ่านข้อมูลของเช็กพอยต์อีกตัวหนึ่ง
สิ่งที่แต่ละโมเดลอ้างจริง ๆ
คำกล่าวอ้างของ Step 5 Preview เป็นแบบแผนทั่วไปสำหรับเรือธงระดับปี 2026 และหนึ่งในนั้นได้รับการตรวจสอบอย่างเป็นอิสระ StepFun ระบุพารามิเตอร์รวมประมาณ 600B โดยมี 27B ที่ทำงานอยู่ รับอินพุตทั้งข้อความและรูปภาพ หน้าต่างบริบท 1M โทเคน และราคา $1.00/$2.70 ต่อล้านโทเคนอินพุตและเอาต์พุต Artificial Analysis วัดได้ 44 บน Intelligence Index ของตน สูงกว่าค่ามัธยฐานของโมเดลที่เทียบเคียงได้ที่ 26 โดยมีเอาต์พุตที่ 87 โทเคนต่อวินาที เทียบกับค่าเฉลี่ย 78 และสร้างโทเคนเอาต์พุตประมาณ 160 ล้านโทเคนตลอดชุดงานของดัชนี เทียบกับค่ามัธยฐาน 82 ล้าน — ราวสองเท่าของปริมาณคำที่ยืดยาวตามปกติ ซึ่งมีความสำคัญกับโมเดลที่คิดค่าบริการตามเอาต์พุต
ข้ออ้างของ Intern-S2 Mobius เป็นเชิงสถาปัตยกรรมและแคบกว่า การออกแบบของมันแยกความรู้จากการคำนวณ: Memory ที่แชร์กันทั่วโลกเก็บเวกเตอร์ความรู้ และ Reasoner หลายตัวจะสอบถามและปรับปรุง hidden state แบบวนซ้ำโดยอ้างอิงจากมัน แทนที่จะผูกการจัดเก็บและการคำนวณเข้าด้วยกันทีละเลเยอร์แบบที่ทรานส์ฟอร์เมอร์ทั่วไปทำ ผลตอบแทนที่ InternLM ระบุคือความเร็วแบบ end-to-end ที่เพิ่มขึ้นราว 4 เท่าบนเบนช์มาร์กการให้เหตุผลเมื่อเทียบกับ Qwen3.5-35B ที่มันสืบทอดมา โดยมีคะแนนการให้เหตุผลใกล้เคียงหรือแข็งแกร่งกว่า พร้อมสายโซ่ความคิดที่มองเห็นได้สั้นลง โมเดลนี้เป็น Apache 2.0 รับอินพุตข้อความและภาพ และเป็นแบบดาวน์โหลด
• สเกล — Step 5 Preview: รวมทั้งหมดประมาณ 600B, ใช้งานจริง 27B ต่อ StepFun เทียบกับ Intern-S2 Mobius: รวมทั้งหมด 35B
• คะแนนอิสระ — Step 5 Preview: 44 บน Artificial Analysis Intelligence Index เทียบกับ Intern-S2 Mobius: ไม่มีข้อมูลใดที่เผยแพร่โดยบุคคลที่สาม
• ความเร็ว — Step 5 Preview: 87 โทเคนเอาต์พุตต่อวินาที เทียบกับค่าเฉลี่ย 78 ซึ่งวัดโดยบอร์ดดัชนีเทียบกับ Intern-S2 Mobius: "เกือบ 4 เท่า" เมื่อเทียบกับ baseline Qwen3.5-35B ของตัวเอง เป็นข้อมูลที่ผู้ขายรายงานและยังไม่มีการทำซ้ำ
• หน้าต่างบริบท — Step 5 Preview: 1M โทเคนต่อ StepFun เทียบกับ Intern-S2 Mobius: ไม่มีตัวเลขบริบทอิสระที่เผยแพร่
• ราคา — Step 5 Preview: $1.00 ขาเข้า / $2.70 ขาออก ต่อล้านโทเคน เทียบกับ Intern-S2 Mobius: ไม่มีราคา API; คุณต้องจ่ายค่าฮาร์ดแวร์เอง
• สัญญาอนุญาตและการเข้าถึง — ตัวอย่างขั้นตอนที่ 5: พรีวิวแบบปิดผ่าน API ของผู้ให้บริการ โดยสัญญาว่าจะเปิดน้ำหนักโมเดล BF16 ภายในวันที่ 15 ตุลาคม 2026 เทียบกับ Intern-S2 Mobius: น้ำหนักโมเดลภายใต้ Apache 2.0 พร้อมใช้งานแล้ว
• ความยืดยาวของคำตอบ — พรีวิว Step 5: ประมาณ 160M โทเคนเอาต์พุตทั่วทั้งชุดดัชนี เทียบกับค่ามัธยฐาน 82M ตามบอร์ดดัชนี เทียบกับ Intern-S2 Mobius: ร่องรอยการให้เหตุผลที่มองเห็นได้สั้นกว่า ซึ่ง InternLM อ้าง แต่ยังไม่มีใครอื่นวัด
คำกล่าวอ้าง 4 เท่า และเหตุใดจึงเป็นตัวเลขที่น่าสนใจในที่นี้
อ่านตัวเลขของสองผู้ขายเทียบกันแบบเคียงข้างกัน แล้วความไม่สอดคล้องก็ชัดเจน: ตัวเลขพาดหัวของ StepFun คือคะแนนความสามารถ ส่วนของ InternLM คือตัวคูณอัตราการประมวลผล นั่นไม่ใช่เรื่องบังเอิญ และเป็นสิ่งที่มีประโยชน์ที่สุดในการเปรียบเทียบนี้ การเร่งความเร็วแบบ end-to-end 4 เท่าในงานด้าน reasoning หากยังคงอยู่เมื่อเจอ harness ของคนอื่น จะมีมูลค่าสำหรับการนำไปใช้งานปริมาณสูงมากกว่าคะแนนไม่กี่คะแนนบนดัชนี — มันเปลี่ยนการคำนวณของการรัน workload ทั้งหมด Intern-S2 Mobius กำลังมุ่งเป้าไปที่ทีมที่มีคอขวดเป็นจำนวนโทเคนต่อวินาทีต่อดอลลาร์ ไม่ใช่ความสามารถระดับเพดาน
ข้อควรระวังคือ ตัวคูณนี้วัดเทียบกับ Qwen3.5-35B ซึ่งเป็นโมเดลที่ Intern-S2 Mobius ถูก continual-pretrained ต่อมา และไม่เคยผ่านการฝึกแบบ Mobius มาก่อน นั่นเป็นการเปรียบเทียบกับจุดเริ่มต้นของตัวมันเอง มากกว่าจะเทียบกับคู่แข่ง ไม่มีการทำซ้ำอย่างอิสระสำหรับข้ออ้างเรื่อง throughput ไม่มีคะแนนดัชนีจากบุคคลที่สาม และไม่มี context window ที่เผยแพร่จากใครอื่นนอกจากผู้ขาย ให้มอง "เกือบ 4 เท่า" เป็นสัญญาณเชิงสถาปัตยกรรมที่น่าสนใจและเป็นสมมติฐานให้ทดสอบบน harness ของคุณเอง ไม่ใช่เป็นสเปก
Step 5 Preview มีโปรไฟล์เชิงหลักฐานที่ตรงกันข้าม ตัวเลขความสามารถของมันถูกวัดอย่างเป็นอิสระ ส่วนเรื่องประสิทธิภาพคือจุดอ่อนของมัน ค่าความเยิ่นเย้อจากการอ่านของบอร์ดดัชนี — ประมาณ 160 ล้านโทเคนเอาต์พุต ขณะที่โมเดลค่ามัธยฐานสร้างประมาณ 82 ล้าน — เป็นตัวถ่วงดุลที่ซื่อตรงต่อราคาเอาต์พุต 2.70 ดอลลาร์ และหมายความว่าภาระงานที่พึ่งพาการสร้างข้อความแบบมีโครงสร้างยาว ๆ จะใช้จ่ายมากกว่าที่ป้ายราคาบอกไว้อย่างมีนัยสำคัญ สิ่งที่มันมีแต่ Intern-S2 Mobius ไม่มีก็คือราคา API ที่เผยแพร่ต่อสาธารณะเลย ซึ่งนั่นคือสิ่งที่ทำให้มันเปรียบเทียบกันได้ตั้งแต่แรก
ที่เก็บ Hugging Face สำหรับบิลด์ของผู้ขายที่สัญญาไว้บอกเล่าอีกครึ่งหนึ่งของเรื่องราว: นี่คือหน้าตาของการเปิดตัวแบบ open-weight เมื่อถูกประกาศแล้วแต่ยังไม่ได้ส่งมอบ

ตรงจุดที่คำถามเรื่องรอยเท้ากัดเข้าจริง ๆ
ข้อได้เปรียบที่แท้จริงของ Intern-S2 Mobius ไม่ใช่คะแนนของมัน ซึ่งยังไม่มีใครวัดได้ แต่เป็นต้นทุนที่ต้องจ่ายหากคิดผิดเกี่ยวกับมัน สามหมื่นห้าพันล้านพารามิเตอร์เป็นขนาดที่ทีมสามารถให้บริการบนฮาร์ดแวร์ที่ตนมีอยู่แล้ว ประเมินผลได้โดยไม่ต้องออกใบสั่งซื้อ และละทิ้งได้โดยไม่ต้องตัดจำหน่ายสิ่งใด นั่นคือข้อได้เปรียบเชิงโครงสร้างที่รุ่นเรือธงไม่อาจเทียบได้ไม่ว่าจะทำคะแนนได้กี่คะแนน และเป็นเหตุผลที่การเปรียบเทียบนี้ควรค่าแก่การทำมากกว่าจะมองข้ามว่าเป็นการจับคู่ที่ไม่เหมาะสม

ข้อได้เปรียบของเรือธงคือภาพสะท้อนกลับด้าน บริบท 1M โทเคน การป้อนข้อมูลภาพ และความสามารถในการให้เหตุผลทั่วไปที่วัดได้ของ Step 5 Preview ครอบคลุมงานที่โมเดลขนาด 35B ไม่น่าจะครอบคลุมได้ดี และการลองใช้ก็ไม่มีค่าใช้จ่ายตราบเท่าที่ช่วงเวลาฟรียังดำเนินอยู่ — โมเดลนี้เปิดให้ใช้ฟรีในช่องทางสำหรับนักพัฒนา 3 แห่งที่แยกจากกันในช่วงเดือนตุลาคม ข้อเท็จจริงทั้งสองข้อนั้นใช้ไม่ได้กับโมเดลที่โฮสต์ด้วยตนเอง: ไม่มีสัปดาห์ฟรีสำหรับการรัน GPU ของคุณเอง และไม่มีรายการราคาที่เปลี่ยนการตัดสินใจให้กลายเป็นรายการค่าใช้จ่าย
ถ้าอยากให้การเปรียบเทียบนี้ยังใช้ได้ต่อไปหลังช่วงโปรโมชั่น สิ่งที่ควรสร้างคือฮาร์เนส ไม่ใช่การตั้งค่าความชอบมากกว่า 200 โมเดลอยู่เบื้องหลัง API key เดียวและบิลใบเดียว โดยบวกเพิ่ม 0% และส่งผ่านราคาตามที่ผู้ให้บริการระบุ พร้อมกับ การสลับไปใช้ระบบสำรองอัตโนมัติ และ routing DSL สำหรับกำหนดเส้นทางทราฟฟิกตามต้นทุน ความหน่วง หรือความสามารถ ทั้ง Step 5 Preview และ Intern-S2 Mobius ไม่ได้อยู่ในแค็ตตาล็อกนั้น — โมเดลเรือธงของ StepFun ไม่ได้ถูกเรา route ให้ และ Intern-S2 Mobius เป็นตัวที่ต้องดาวน์โหลดมาโฮสต์เอง — ดังนั้นคุณค่าตรงนี้จึงไม่ใช่การเข้าถึงโมเดลใดโมเดลหนึ่ง แต่คือโมเดลที่คุณจะใช้เป็นเกณฑ์เปรียบเทียบนั้นอยู่ห่างแค่คีย์เดียว และการตัดสินใจที่มาจากการวัดจะเปลี่ยนไปตามหลักฐาน ไม่ใช่ตามบล็อกเปิดตัว

วิธีตัดสินใจ
ถ้าเวิร์กโหลดของคุณเป็นแบบเอเจนต์ มัลติโมดัล บริบทร้อนยาว หรือปลายเปิด — แบบที่คุณระบุงานล่วงหน้าทั้งหมดไม่ได้ — เรือธงคือคำตอบ และ Step 5 Preview ก็เป็นตัวอย่างที่สมเหตุสมผลของมัน: ผ่านการวัดผลแล้ว ตั้งราคาไว้แล้ว ทดลองใช้ได้ในราคาถูก และย้อนกลับได้ทีละโทเคน เพียงเผื่องบไว้สำหรับความเยิ่นเย้อ แทนที่จะยึดตามอัตราที่โฆษณาไว้
ถ้าเวิร์กโหลดของคุณเป็นงานให้เหตุผลที่แคบ ซ้ำ ๆ และมีปริมาณสูงบนข้อมูลที่ต้องอยู่ภายในขอบเขตของคุณ โมเดลขนาดเล็กคือคำตอบ และ Intern-S2 Mobius ก็เป็นตัวเลือกที่แท้จริง именноเพราะมันมีขนาดเล็ก: มันรันบนฮาร์ดแวร์ที่คุณมีอยู่ อยู่ภายใต้ Apache 2.0 และคำอ้างเรื่องความเร็วนั้น หากเป็นจริง ก็เป็นสิ่งที่ชี้ขาดคำถามด้านเศรษฐศาสตร์ต่อหน่วย จงเข้าไปโดยรู้ว่าคุณกำลังทดสอบคำอ้างของผู้ขาย ไม่ใช่รับเอาคำตัดสินของคนอื่นมาเป็นของตน
ความผิดพลาดคือการมองว่าทางเลือกนี้เป็นเรื่องถาวร ซื้อการประเมินของโมเดลเล็กก่อน เพราะมันคือการทดลองราคาถูก; เช่าโมเดลเรือธงสำหรับงานที่โมเดลเล็กทำไม่สำเร็จ เพราะนั่นคือการซ่อมราคาถูก ทีมที่ทำให้ทั้งสองทางเลือกยังใช้ได้บนคีย์เดียวกันและฮาร์เนสเดียวกัน จะลงเอยด้วยการตัดสินใจนี้โดยใช้ข้อมูลของตัวเอง และนั่นคือเวอร์ชันเดียวของการตัดสินใจนี้ที่ยังยืนได้เมื่อผู้ขายรายใดรายหนึ่งออกรุ่นสืบทอด
