สร้างการ์ดเปรียบเทียบสองคอลัมน์ที่มีหัวข้อ 'Step 5 Preview vs Intern-S2 Mobius' พร้อมคำบรรยายย่อย 'เรือธง 600B ที่คุณเช่า หรือตัวให้เหตุผล 35B ที่คุณรัน' การ์ดซ้าย 'Step 5 Preview' อ่านว่า: ดัชนี AA 44 (วัดแล้ว); ประมาณ 600B รวม / 27B ทำงาน; คอนเท็กซ์ 1M โทเค็น; $1.00 เข้า / $2.70 ออก ต่อ 1M; API พรีวิวแบบปิด; น้ำหนักโมเดลสัญญาไว้ 15 ต.ค. 2026 การ์ดขวา 'Intern-S2 Mobius' อ่านว่า: ไม่มีคะแนนอิสระ; พารามิเตอร์ 35B; ไม่เผยแพร่คอนเท็กซ์; ไม่มีราคา API, โฮสต์เอง; Apache 2.0 พร้อมใช้แล้ว; อ้างว่าเร็วขึ้นประมาณ 4 เท่า, ยังไม่ได้ทำซ้ำ ส่วนท้ายอ่านว่า 'ตัวเลขของ Step 5 Preview อ้างอิงจาก StepFun และ Artificial Analysis; ตัวเลขของ Intern-S2 Mobius เป็นคำอ้างของ InternLM, ยังไม่ได้ทำซ้ำ'
Engineering & Research

Step 5 Preview vs Intern-S2 Mobius: คุณต้องการเรือธงขนาด 600B หรือตัวให้เหตุผลขนาด 35B ที่รวดเร็ว?

ผู้เขียน

Magnus Corvin

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด →
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

เหตุผลที่ตรงไปตรงมาในการเปรียบเทียบ Step 5 Preview กับ Intern-S2 Mobius ไม่ใช่เพราะทั้งสองคล้ายกัน แต่เป็นเพราะทั้งสองเป็นคำตอบสำหรับคำถามที่แตกต่างกันสองข้อจากผู้ซื้อรายเดียวกัน — ทีมที่มีเวิร์กโหลดด้านการให้เหตุผลให้รัน และไม่อยากซื้อคลัสเตอร์ StepFun's Step 5 Preview ซึ่งประกาศเมื่อวันที่ 20 กันยายน 2026 คือคำตอบขนาดใหญ่: พารามิเตอร์รวมประมาณ 6 แสนล้าน โดยมี 2.7 หมื่นล้านที่ทำงานอยู่ บริบทขนาด 1 ล้านโทเคน คะแนน Artificial Analysis Intelligence Index ที่วัดโดยอิสระได้ 44 และราคาที่ประกาศไว้ที่ $1.00 ต่อล้านโทเคนอินพุต และ $2.70 ต่อล้านโทเคนเอาต์พุต InternLM's Intern-S2 Mobius ซึ่งเปิดตัวเมื่อวันที่ 29 กรกฎาคม 2026 คือคำตอบขนาดเล็ก: โมเดลน้ำหนักเปิดขนาด 35 พันล้านพารามิเตอร์ที่สร้างบนสถาปัตยกรรม Mobius-v0 ผ่านการฝึกต่อเนื่องแบบ pretrained จาก Qwen3.5-35B โดยจุดขายหลักไม่ใช่ความสามารถแต่เป็นความเร็ว — เร่งความเร็วแบบ end-to-end ประมาณ 4 เท่าในเบนช์มาร์กด้านการให้เหตุผลเมื่อเทียบกับโมเดลฐานที่ฝึกมา โดยไม่มีคะแนนเบนช์มาร์กอิสระใด ๆ เลย ตัวหนึ่งเป็นเรือธงที่คุณเช่าใช้ อีกตัวเป็นโมเดลเล็กที่คุณรัน การเปรียบเทียบนี้จริง ๆ แล้วอยู่ที่ว่างานที่อยู่ตรงหน้าคุณคุ้มค่ากับการเลือกใช้เรือธงหรือไม่

เรื่องที่ต้องเคลียร์ก่อนพูดถึงตัวเลข เพราะมันทำให้ผู้คนเสียเวลาจริง ๆ: InternLM ได้เปิดตัวโมเดลหลายตัวภายใต้ชื่อ Intern-S2 และพวกมันไม่ใช่สิ่งเดียวกัน Intern-S2-397B เป็นเรือธงมัลติโมดัลเชิงวิทยาศาสตร์ ส่วน Intern-S2 Mobius คือโมเดลให้เหตุผลขนาด 35B ที่มีประสิทธิภาพซึ่งกำลังพูดถึงกันที่นี่ และรุ่น Intern-S2 ที่เปิดตัวก่อนหน้านี้ก็เป็นอีกโมเดลหนึ่งแยกต่างหาก หากคุณค้นหา "Intern-S2" แล้วไปเจอตาราง benchmark ของโมเดลขนาด 397B แสดงว่าคุณกำลังอ่านข้อมูลของเช็กพอยต์อีกตัวหนึ่ง

สิ่งที่แต่ละโมเดลอ้างจริง ๆ

คำกล่าวอ้างของ Step 5 Preview เป็นแบบแผนทั่วไปสำหรับเรือธงระดับปี 2026 และหนึ่งในนั้นได้รับการตรวจสอบอย่างเป็นอิสระ StepFun ระบุพารามิเตอร์รวมประมาณ 600B โดยมี 27B ที่ทำงานอยู่ รับอินพุตทั้งข้อความและรูปภาพ หน้าต่างบริบท 1M โทเคน และราคา $1.00/$2.70 ต่อล้านโทเคนอินพุตและเอาต์พุต Artificial Analysis วัดได้ 44 บน Intelligence Index ของตน สูงกว่าค่ามัธยฐานของโมเดลที่เทียบเคียงได้ที่ 26 โดยมีเอาต์พุตที่ 87 โทเคนต่อวินาที เทียบกับค่าเฉลี่ย 78 และสร้างโทเคนเอาต์พุตประมาณ 160 ล้านโทเคนตลอดชุดงานของดัชนี เทียบกับค่ามัธยฐาน 82 ล้าน — ราวสองเท่าของปริมาณคำที่ยืดยาวตามปกติ ซึ่งมีความสำคัญกับโมเดลที่คิดค่าบริการตามเอาต์พุต

ข้ออ้างของ Intern-S2 Mobius เป็นเชิงสถาปัตยกรรมและแคบกว่า การออกแบบของมันแยกความรู้จากการคำนวณ: Memory ที่แชร์กันทั่วโลกเก็บเวกเตอร์ความรู้ และ Reasoner หลายตัวจะสอบถามและปรับปรุง hidden state แบบวนซ้ำโดยอ้างอิงจากมัน แทนที่จะผูกการจัดเก็บและการคำนวณเข้าด้วยกันทีละเลเยอร์แบบที่ทรานส์ฟอร์เมอร์ทั่วไปทำ ผลตอบแทนที่ InternLM ระบุคือความเร็วแบบ end-to-end ที่เพิ่มขึ้นราว 4 เท่าบนเบนช์มาร์กการให้เหตุผลเมื่อเทียบกับ Qwen3.5-35B ที่มันสืบทอดมา โดยมีคะแนนการให้เหตุผลใกล้เคียงหรือแข็งแกร่งกว่า พร้อมสายโซ่ความคิดที่มองเห็นได้สั้นลง โมเดลนี้เป็น Apache 2.0 รับอินพุตข้อความและภาพ และเป็นแบบดาวน์โหลด

• สเกล — Step 5 Preview: รวมทั้งหมดประมาณ 600B, ใช้งานจริง 27B ต่อ StepFun เทียบกับ Intern-S2 Mobius: รวมทั้งหมด 35B

• คะแนนอิสระ — Step 5 Preview: 44 บน Artificial Analysis Intelligence Index เทียบกับ Intern-S2 Mobius: ไม่มีข้อมูลใดที่เผยแพร่โดยบุคคลที่สาม

• ความเร็ว — Step 5 Preview: 87 โทเคนเอาต์พุตต่อวินาที เทียบกับค่าเฉลี่ย 78 ซึ่งวัดโดยบอร์ดดัชนีเทียบกับ Intern-S2 Mobius: "เกือบ 4 เท่า" เมื่อเทียบกับ baseline Qwen3.5-35B ของตัวเอง เป็นข้อมูลที่ผู้ขายรายงานและยังไม่มีการทำซ้ำ

• หน้าต่างบริบท — Step 5 Preview: 1M โทเคนต่อ StepFun เทียบกับ Intern-S2 Mobius: ไม่มีตัวเลขบริบทอิสระที่เผยแพร่

• ราคา — Step 5 Preview: $1.00 ขาเข้า / $2.70 ขาออก ต่อล้านโทเคน เทียบกับ Intern-S2 Mobius: ไม่มีราคา API; คุณต้องจ่ายค่าฮาร์ดแวร์เอง

• สัญญาอนุญาตและการเข้าถึง — ตัวอย่างขั้นตอนที่ 5: พรีวิวแบบปิดผ่าน API ของผู้ให้บริการ โดยสัญญาว่าจะเปิดน้ำหนักโมเดล BF16 ภายในวันที่ 15 ตุลาคม 2026 เทียบกับ Intern-S2 Mobius: น้ำหนักโมเดลภายใต้ Apache 2.0 พร้อมใช้งานแล้ว

• ความยืดยาวของคำตอบ — พรีวิว Step 5: ประมาณ 160M โทเคนเอาต์พุตทั่วทั้งชุดดัชนี เทียบกับค่ามัธยฐาน 82M ตามบอร์ดดัชนี เทียบกับ Intern-S2 Mobius: ร่องรอยการให้เหตุผลที่มองเห็นได้สั้นกว่า ซึ่ง InternLM อ้าง แต่ยังไม่มีใครอื่นวัด

คำกล่าวอ้าง 4 เท่า และเหตุใดจึงเป็นตัวเลขที่น่าสนใจในที่นี้

อ่านตัวเลขของสองผู้ขายเทียบกันแบบเคียงข้างกัน แล้วความไม่สอดคล้องก็ชัดเจน: ตัวเลขพาดหัวของ StepFun คือคะแนนความสามารถ ส่วนของ InternLM คือตัวคูณอัตราการประมวลผล นั่นไม่ใช่เรื่องบังเอิญ และเป็นสิ่งที่มีประโยชน์ที่สุดในการเปรียบเทียบนี้ การเร่งความเร็วแบบ end-to-end 4 เท่าในงานด้าน reasoning หากยังคงอยู่เมื่อเจอ harness ของคนอื่น จะมีมูลค่าสำหรับการนำไปใช้งานปริมาณสูงมากกว่าคะแนนไม่กี่คะแนนบนดัชนี — มันเปลี่ยนการคำนวณของการรัน workload ทั้งหมด Intern-S2 Mobius กำลังมุ่งเป้าไปที่ทีมที่มีคอขวดเป็นจำนวนโทเคนต่อวินาทีต่อดอลลาร์ ไม่ใช่ความสามารถระดับเพดาน

ข้อควรระวังคือ ตัวคูณนี้วัดเทียบกับ Qwen3.5-35B ซึ่งเป็นโมเดลที่ Intern-S2 Mobius ถูก continual-pretrained ต่อมา และไม่เคยผ่านการฝึกแบบ Mobius มาก่อน นั่นเป็นการเปรียบเทียบกับจุดเริ่มต้นของตัวมันเอง มากกว่าจะเทียบกับคู่แข่ง ไม่มีการทำซ้ำอย่างอิสระสำหรับข้ออ้างเรื่อง throughput ไม่มีคะแนนดัชนีจากบุคคลที่สาม และไม่มี context window ที่เผยแพร่จากใครอื่นนอกจากผู้ขาย ให้มอง "เกือบ 4 เท่า" เป็นสัญญาณเชิงสถาปัตยกรรมที่น่าสนใจและเป็นสมมติฐานให้ทดสอบบน harness ของคุณเอง ไม่ใช่เป็นสเปก

Step 5 Preview มีโปรไฟล์เชิงหลักฐานที่ตรงกันข้าม ตัวเลขความสามารถของมันถูกวัดอย่างเป็นอิสระ ส่วนเรื่องประสิทธิภาพคือจุดอ่อนของมัน ค่าความเยิ่นเย้อจากการอ่านของบอร์ดดัชนี — ประมาณ 160 ล้านโทเคนเอาต์พุต ขณะที่โมเดลค่ามัธยฐานสร้างประมาณ 82 ล้าน — เป็นตัวถ่วงดุลที่ซื่อตรงต่อราคาเอาต์พุต 2.70 ดอลลาร์ และหมายความว่าภาระงานที่พึ่งพาการสร้างข้อความแบบมีโครงสร้างยาว ๆ จะใช้จ่ายมากกว่าที่ป้ายราคาบอกไว้อย่างมีนัยสำคัญ สิ่งที่มันมีแต่ Intern-S2 Mobius ไม่มีก็คือราคา API ที่เผยแพร่ต่อสาธารณะเลย ซึ่งนั่นคือสิ่งที่ทำให้มันเปรียบเทียบกันได้ตั้งแต่แรก

ที่เก็บ Hugging Face สำหรับบิลด์ของผู้ขายที่สัญญาไว้บอกเล่าอีกครึ่งหนึ่งของเรื่องราว: นี่คือหน้าตาของการเปิดตัวแบบ open-weight เมื่อถูกประกาศแล้วแต่ยังไม่ได้ส่งมอบ

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

ตรงจุดที่คำถามเรื่องรอยเท้ากัดเข้าจริง ๆ

ข้อได้เปรียบที่แท้จริงของ Intern-S2 Mobius ไม่ใช่คะแนนของมัน ซึ่งยังไม่มีใครวัดได้ แต่เป็นต้นทุนที่ต้องจ่ายหากคิดผิดเกี่ยวกับมัน สามหมื่นห้าพันล้านพารามิเตอร์เป็นขนาดที่ทีมสามารถให้บริการบนฮาร์ดแวร์ที่ตนมีอยู่แล้ว ประเมินผลได้โดยไม่ต้องออกใบสั่งซื้อ และละทิ้งได้โดยไม่ต้องตัดจำหน่ายสิ่งใด นั่นคือข้อได้เปรียบเชิงโครงสร้างที่รุ่นเรือธงไม่อาจเทียบได้ไม่ว่าจะทำคะแนนได้กี่คะแนน และเป็นเหตุผลที่การเปรียบเทียบนี้ควรค่าแก่การทำมากกว่าจะมองข้ามว่าเป็นการจับคู่ที่ไม่เหมาะสม

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

ข้อได้เปรียบของเรือธงคือภาพสะท้อนกลับด้าน บริบท 1M โทเคน การป้อนข้อมูลภาพ และความสามารถในการให้เหตุผลทั่วไปที่วัดได้ของ Step 5 Preview ครอบคลุมงานที่โมเดลขนาด 35B ไม่น่าจะครอบคลุมได้ดี และการลองใช้ก็ไม่มีค่าใช้จ่ายตราบเท่าที่ช่วงเวลาฟรียังดำเนินอยู่ — โมเดลนี้เปิดให้ใช้ฟรีในช่องทางสำหรับนักพัฒนา 3 แห่งที่แยกจากกันในช่วงเดือนตุลาคม ข้อเท็จจริงทั้งสองข้อนั้นใช้ไม่ได้กับโมเดลที่โฮสต์ด้วยตนเอง: ไม่มีสัปดาห์ฟรีสำหรับการรัน GPU ของคุณเอง และไม่มีรายการราคาที่เปลี่ยนการตัดสินใจให้กลายเป็นรายการค่าใช้จ่าย

ถ้าอยากให้การเปรียบเทียบนี้ยังใช้ได้ต่อไปหลังช่วงโปรโมชั่น สิ่งที่ควรสร้างคือฮาร์เนส ไม่ใช่การตั้งค่าความชอบมากกว่า 200 โมเดลอยู่เบื้องหลัง API key เดียวและบิลใบเดียว โดยบวกเพิ่ม 0% และส่งผ่านราคาตามที่ผู้ให้บริการระบุ พร้อมกับ การสลับไปใช้ระบบสำรองอัตโนมัติ และ routing DSL สำหรับกำหนดเส้นทางทราฟฟิกตามต้นทุน ความหน่วง หรือความสามารถ ทั้ง Step 5 Preview และ Intern-S2 Mobius ไม่ได้อยู่ในแค็ตตาล็อกนั้น — โมเดลเรือธงของ StepFun ไม่ได้ถูกเรา route ให้ และ Intern-S2 Mobius เป็นตัวที่ต้องดาวน์โหลดมาโฮสต์เอง — ดังนั้นคุณค่าตรงนี้จึงไม่ใช่การเข้าถึงโมเดลใดโมเดลหนึ่ง แต่คือโมเดลที่คุณจะใช้เป็นเกณฑ์เปรียบเทียบนั้นอยู่ห่างแค่คีย์เดียว และการตัดสินใจที่มาจากการวัดจะเปลี่ยนไปตามหลักฐาน ไม่ใช่ตามบล็อกเปิดตัว

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

วิธีตัดสินใจ

ถ้าเวิร์กโหลดของคุณเป็นแบบเอเจนต์ มัลติโมดัล บริบทร้อนยาว หรือปลายเปิด — แบบที่คุณระบุงานล่วงหน้าทั้งหมดไม่ได้ — เรือธงคือคำตอบ และ Step 5 Preview ก็เป็นตัวอย่างที่สมเหตุสมผลของมัน: ผ่านการวัดผลแล้ว ตั้งราคาไว้แล้ว ทดลองใช้ได้ในราคาถูก และย้อนกลับได้ทีละโทเคน เพียงเผื่องบไว้สำหรับความเยิ่นเย้อ แทนที่จะยึดตามอัตราที่โฆษณาไว้

ถ้าเวิร์กโหลดของคุณเป็นงานให้เหตุผลที่แคบ ซ้ำ ๆ และมีปริมาณสูงบนข้อมูลที่ต้องอยู่ภายในขอบเขตของคุณ โมเดลขนาดเล็กคือคำตอบ และ Intern-S2 Mobius ก็เป็นตัวเลือกที่แท้จริง именноเพราะมันมีขนาดเล็ก: มันรันบนฮาร์ดแวร์ที่คุณมีอยู่ อยู่ภายใต้ Apache 2.0 และคำอ้างเรื่องความเร็วนั้น หากเป็นจริง ก็เป็นสิ่งที่ชี้ขาดคำถามด้านเศรษฐศาสตร์ต่อหน่วย จงเข้าไปโดยรู้ว่าคุณกำลังทดสอบคำอ้างของผู้ขาย ไม่ใช่รับเอาคำตัดสินของคนอื่นมาเป็นของตน

ความผิดพลาดคือการมองว่าทางเลือกนี้เป็นเรื่องถาวร ซื้อการประเมินของโมเดลเล็กก่อน เพราะมันคือการทดลองราคาถูก; เช่าโมเดลเรือธงสำหรับงานที่โมเดลเล็กทำไม่สำเร็จ เพราะนั่นคือการซ่อมราคาถูก ทีมที่ทำให้ทั้งสองทางเลือกยังใช้ได้บนคีย์เดียวกันและฮาร์เนสเดียวกัน จะลงเอยด้วยการตัดสินใจนี้โดยใช้ข้อมูลของตัวเอง และนั่นคือเวอร์ชันเดียวของการตัดสินใจนี้ที่ยังยืนได้เมื่อผู้ขายรายใดรายหนึ่งออกรุ่นสืบทอด

© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube