การ์ด hero ที่สร้างขึ้นซึ่งเปรียบเทียบ Intern-S2-397B กับ Grok 4.6 โดยด้านซ้ายแสดงโมเดลวิทยาศาสตร์แบบเปิดน้ำหนักพร้อมสวิตช์เปิด-ปิดการให้เหตุผลที่ติดป้ายว่า enable_thinking และรูปคลื่นอนุกรมเวลา ส่วนด้านขวาแสดงปลายทางคลาวด์แบบปิดพร้อมปุ่มปรับระดับความพยายามในการให้เหตุผลและไอคอนเครื่องมือฝั่งเซิร์ฟเวอร์ ติดป้ายด้วยความแตกต่างระหว่างการควบคุมแบบโฮสต์เอง Apache-2.0 กับ API แบบคิดค่าบริการตามการใช้งาน $2 / $6 โดยมีโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Intern-S2-397B vs Grok 4.6: ใครได้เป็นคนหมุนปุ่ม

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Intern-S2-397B และ Grok 4.6 เปิดตัวห่างกันประมาณหนึ่งเดือน และตอบคำถามพื้นฐานเดียวกันในทางตรงกันข้าม: ใครได้ควบคุมการใช้เหตุผล Grok 4.6 โมเดลเรือธงของ x​AI ที่เปิดให้บริการเมื่อวันที่ 12 สิงหาคม 2026 ขายปุ่มหมุนให้คุณ — ตัวควบคุมความพยายามในการใช้เหตุผลที่ปรับแต่งได้บน API แบบปิด ราคา $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต พร้อมหน้าต่าง 500,000 โทเคน และเครื่องมือฝั่งเซิร์ฟเวอร์ของ x​AI คิดค่าบริการเพิ่มเติม Intern-S2-397B โมเดลมัลติโมดัลเชิงวิทยาศาสตร์ขนาด 403 พันล้านพารามิเตอร์ ที่ทีม InternLM ของ Shanghai AI Laboratory เปิดตัวภายใต้ Apache-2.0 เมื่อวันที่ 13 กันยายน ยกทั้งเครื่องให้คุณ — น้ำหนัก สวิตช์เปิดปิดการคิด เส้นทางภาพ ส่วนหัวอนุกรมเวลา — และคาดหวังให้คุณรันมันเอง อันหนึ่งเช่ามาพร้อมปุ่มปรับ; อีกอันเป็นเจ้าของโดยสมบูรณ์ การเปรียบเทียบที่สำคัญตรงนี้ไม่ใช่ว่าอันไหนได้คะแนนสูงกว่าบนตาราง benchmark; แต่เป็นว่างานของคุณต้องการการควบคุมแบบไหนจริง ๆ และแต่ละแบบมีค่าใช้จ่ายเท่าไร

หน้าปัดที่แตกต่างกันสองแบบ

วิธีที่ชัดที่สุดในการแยกสองสิ่งนี้ออกจากกันคือดูว่าตัวควบคุมการให้เหตุผลอยู่ตรงไหน Grok 4.6 เปิดเผยการตั้งค่าระดับความพยายามในการให้เหตุผลผ่าน API ของ xAI และรอบ ๆ มันก็มีชุดเครื่องมือฝั่งเซิร์ฟเวอร์ — การเรียกใช้ฟังก์ชัน การค้นหาเว็บ การค้นหา X การรันโค้ด — ที่ xAI ดำเนินการและคิดค่าบริการแยกต่างหาก คุณปรับระดับความพยายาม คุณเชื่อมต่อเครื่องมือที่มันให้มา และคุณไม่ต้องแตะน้ำหนักเลย พฤติกรรมของโมเดลเป็นทรัพย์สินของ xAI และเป็นปัญหาของ xAI ส่วนคันโยกของคุณคือพารามิเตอร์ในคำขอ

Intern-S2-397B มอบชุดคันโยกที่แตกต่างให้คุณ และคันโยกเหล่านั้นอยู่ต่ำลงไปในสแตก การคิดเปิดอยู่เป็นค่าเริ่มต้น และคุณปิดมันเป็นรายคำขอได้ด้วยenable_thinking=False. เนื่องจากโมเดลนี้เป็น Apache-2.0 คุณยังสามารถนำเวตไปปรับจูนพฤติกรรมการให้เหตุผลของมันเองบนข้อมูลของคุณเอง แล้วให้บริการผลลัพธ์บน LMDeploy, vLLM หรือ SGLang พื้นผิวอินพุตของมันกว้างกว่าของ API แบบข้อความและรูปภาพ: มันรับสัญญาณอนุกรมเวลาและสร้างการพยากรณ์ ซึ่งเป็นความสามารถที่ปัจจุบันเชื่อมต่อผ่าน LMDeploy เท่านั้น และมันถูกฝึกมาสำหรับงานเอเจนต์ระยะยาวในสภาพแวดล้อมแบบแซนด์บ็อกซ์ ข้อแลกเปลี่ยนก็ชัดเจนพอกัน — การควบคุมในระดับนั้นจะมีความหมายก็ต่อเมื่อคุณพร้อมที่จะดำเนินการกับฮาร์ดแวร์และสแตกการให้บริการที่มาพร้อมกับมัน

• การควบคุมการให้เหตุผล — Grok 4.6: ตัวปรับ reasoning-effort บน API แบบปิด เทียบกับ Intern-S2-397B: สวิตช์เปิดปิด enable_thinking พร้อมการควบคุมระดับเวทอย่างเต็มรูปแบบภายใต้ Apache-2.0

• เครื่องมือ — Grok 4.6: การค้นหาเว็บบนฝั่งเซิร์ฟเวอร์ของ xAI, การค้นหา X และการรันโค้ด คิดค่าบริการแยกต่างหาก เทียบกับ Intern-S2-397B: การเรียกใช้เครื่องมือที่คุณต้องเชื่อมต่อเอง พร้อมเส้นทางการพยากรณ์อนุกรมเวลาผ่าน LMDeploy

• อินพุต — Grok 4.6: ข้อความ, รูปภาพ, ไฟล์ เทียบกับ Intern-S2-397B: ข้อความ, รูปภาพ, อนุกรมเวลา

• บริบท — Grok 4.6: 500,000 โทเคน เทียบกับ Intern-S2-397B: การให้เหตุผลด้วยข้อความ 256K, มัลติโมดัล 64K โดยทั้งสองตัวเลขมาจากการ์ดโมเดล

• ราคา — Grok 4.6: $2.00 / $6.00 ต่อ 1M โดยเพิ่มเป็น $4.00 / $12.00 เมื่อเกิน 200K โทเคน เทียบกับ Intern-S2-397B: ไม่มีตารางอัตราค่าบริการ; โฮสต์เองหรือใช้ Intern API อย่างเป็นทางการ

สิ่งที่ตัวเลขเหล่านี้ครอบคลุมจริง ๆ

ทุกตัวเลขของ Intern-S2-397B ด้านล่างนี้เป็นของ InternLM เอง รันผ่าน OpenCompass, VLMEvalKit และ AgentCompass และเผยแพร่พร้อมกับน้ำหนักโมเดล โดยไม่มีการทำซ้ำอย่างอิสระ ตัวเลขของ Grok 4.6 เป็นอีกประเภทหนึ่ง: พวกมันสะสมมาผ่านอารีน่าสาธารณะและ Artificial Analysis หลังจากโมเดลเปิดตัว ดังนั้นจึงมีป้ายกำกับจากบุคคลที่สาม

ในด้านที่วัดโดยอิสระ Grok 4.6 อยู่ที่ 44 บนดัชนี Artificial Analysis Intelligence Index ปัจจุบัน โดยมี GPQA Diamond ที่ 94.9, Humanity's Last Exam ที่ 61.0 และคะแนนเขียนโค้ดที่ 76.8 และ Artificial Analysis ระบุตัวเลข TerminalBench 2.1 ของมันไว้ใกล้ 80.3 ในฝั่งผู้ขาย การ์ดของ Intern-S2-397B รายงาน 89.77 บน MMLU Pro, 93.56 บน HMMT-2026, 81.68 บน MMMU Pro และ 68.54 บน SWE-bench-Pro พร้อมกับแถวด้านวิทยาศาสตร์ที่ดูเหมือนเป็นอีกสายพันธุ์หนึ่ง: 55.71 บน Biology-Instructions, 63.28 บน SciReasoner 1.5, 53.95 บน Mol-Instructions, 62.35 บน MolecularIQ ตัวเลขหนึ่งในตารางของผู้ขายที่ควรทำให้คนสร้างเอเจนต์สะดุ้งคือ TerminalBench 2.1 ที่ 64.04 — ตัวเลขที่ผู้สร้างโมเดลเองรายงานว่าแพ้โมเดลรุ่นปิดที่เก่ากว่าแบบห่างไกล ในเลนงานเทอร์มินัลที่โมเดลฟรอนเทียร์แบบเช่าใช้อย่าง Grok 4.6 แข็งแกร่งที่สุด

อ่านการแบ่งนั้นในฐานะภาพรวม ไม่ใช่การจัดอันดับ Intern-S2-397B เป็นผู้เชี่ยวชาญด้านวิทยาศาสตร์ที่เป็นโมเดลทั่วไปซึ่งทำได้ดี ส่วน Grok 4.6 เป็นโมเดลอเนกประสงค์ที่มีความสนใจด้านวิทยาศาสตร์เพียงผ่าน ๆ การที่แถวด้านวิทยาศาสตร์ออกมาไม่สมดุลนั้นเป็นสิ่งที่คาดหมายได้ — ไม่มีโมเดลเรือธงอเนกประสงค์รุ่นใดที่ถูกพรีเทรนบนหน้าต้นฉบับของวรรณกรรมวิทยาศาสตร์ซึ่งมีทั้งภาพ เลย์เอาต์ และสัญกรณ์เชิงสัญลักษณ์รวมกัน และนั่นคือกระบวนทัศน์ที่ Intern-S2-397B ถูกสร้างขึ้นมาอย่างแม่นยำ ไม่มีสิ่งใดในฐานหลักฐานทั้งสองที่สนับสนุนว่า "Intern-S2-397B เก่งเท่า Grok 4.6 ในการให้เหตุผลแบบใดก็ตาม" และไม่มีสิ่งใดในหลักฐานของ Grok 4.6 ที่ชี้ว่ามันถูกปรับจูนสำหรับการวิเคราะห์ลำดับหลายโอมิกส์

ราคาของการควบคุม

Grok 4.6 มีราคาที่คุณใส่ลงในสเปรดชีตได้เลย: $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน โดยอัตราจะไต่ขึ้นเป็น $4.00 / $12.00 เมื่อพรอมป์ตข้าม 200,000 โทเคน พร้อมระดับลำดับความสำคัญแบบเลือกเสริมสำหรับการตอบกลับที่เร็วขึ้น ใช้งานได้ผ่าน OrcaRouter ในราคาลิสต์ของ x​AI ที่ส่งต่อไปโดยบวกกำไร 0% ดังนั้นเมื่อ x​AI เปลี่ยนอัตรา ราคาที่นี่ก็ปรับตามในวันเดียวกันโดยไม่มีส่วนต่างจากคนกลาง — ช่องทางที่คุณเช่าใช้ยังคงมีราคาตามที่ผู้ขายกำหนดไว้

Intern-S2-397B ไม่มีอัตราต่อโทเคนที่เผยแพร่เลยแม้แต่นิดเดียว การ์ดโมเดลอ้างถึง Intern API อย่างเป็นทางการ แต่ตัวเลขทางเศรษฐศาสตร์ที่ผู้คนอยากเปรียบเทียบจริง ๆ คือแบบโฮสต์เอง: เช็กพอยต์ขนาด 403B พารามิเตอร์ โดยมีน้ำหนักราว 807 GB กระจายอยู่ใน 188 แชร์ดแบบ BF16 จึงต้องใช้โหนดหลาย GPU ระดับจริงจัง โดยบิลด์ FP8 ลดขนาดพื้นที่จัดเก็บลงได้ราวครึ่งหนึ่ง หากคุณมีความจุนั้นอยู่แล้ว ต้นทุนส่วนเพิ่มของคำถามทางวิทยาศาสตร์ครั้งถัดไปจะใกล้เคียงค่ากระแสไฟฟ้า และนั่นแหละคือจุดสำคัญทั้งหมดของจุดยืน Apache-2.0 หากคุณไม่ได้เป็นเจ้าของมัน โมเดล "ฟรี" นี้คือโครงการนำร่องด้านรายจ่ายฝ่ายทุน ไม่ใช่รายการในงบประมาณ

สิ่งที่ตัวจัดเส้นทางให้ในคู่เฉพาะนี้คือรอยต่อมากกว่าราคา Grok 4.6 อยู่บนคีย์ที่คุณมีอยู่แล้วสำหรับทราฟฟิกโปรดักชันทั่วไป; Intern-S2-397B ไม่ได้ถูกจัดเส้นทางบน OrcaRouter — มันเป็นเช็กพอยต์ใหม่เอี่ยม และเส้นทางของคุณไปยังมันคือ API ของผู้ขายเองหรือการดีพลอยแบบโฮสต์เอง จัดเส้นทางงานให้เหตุผลทั่วไปที่ไวต่อความหน่วงไปยังโมเดลแบบคิดค่าตามการใช้ เก็บงานแบตช์ด้านวิทยาศาสตร์ไว้บนโมเดลที่คุณรัน และให้การสลับสำรองอัตโนมัติคอยรองรับคุณเมื่อเอนด์พอยต์ของฝั่งใดฝั่งหนึ่งมีปัญหา ขอบเขตระหว่างทั้งสองจะกลายเป็นกฎการจัดเส้นทางแทนที่จะเป็นการผสานรวมครั้งที่สอง

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

เลือกอันไหนดี

เลือก Grok 4.6 เมื่องานเป็นงานทั่วไป การให้เหตุผลต้องกลับมาเร็วและถูกต้อง และคุณไม่อยากเป็นเจ้าของสแต็กที่สร้างมันขึ้นมา หน้าต่าง 500K ของมัน คะแนน GPQA Diamond ที่วัดได้ 94.9 และชุดเครื่องมือของมันเป็นฟีเจอร์ระดับพร้อมใช้งานจริง และอัตรา $2/$6 คือสิ่งที่คุณจ่ายเพื่อไม่ต้องดำเนินการใด ๆ

เลือก Intern-S2-397B เมื่ออินพุตเป็นงานวิทยาศาสตร์ — เอกสารที่เต็มไปด้วยรูปภาพ แผนภาพโมเลกุล สัญญาณอนุกรมเวลา — และเมื่อการให้เหตุผลต้องเกิดขึ้นบนข้อมูลที่ไม่สามารถออกจากสภาพแวดล้อมของคุณ หรือบนพฤติกรรมที่คุณต้องการปรับแต่งด้วยตัวเอง Apache-2.0 ทำให้สิ่งนั้นเป็นไปได้ ส่วน API แบบเช่าไม่มีทางทำได้ เตรียมงบสำหรับฮาร์ดแวร์ คาดว่ายังไม่มีกระดานคะแนนอิสระไปสักพัก และมองทุกตัวเลขบนการ์ดของมันเป็นเพียงคำกล่าวอ้าง จนกว่าจะมีคนนอก InternLM ทำซ้ำได้สักตัว

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube