
Intern-S2-397B vs Grok 4.6: ใครได้เป็นคนหมุนปุ่ม
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Intern-S2-397B และ Grok 4.6 เปิดตัวห่างกันประมาณหนึ่งเดือน และตอบคำถามพื้นฐานเดียวกันในทางตรงกันข้าม: ใครได้ควบคุมการใช้เหตุผล Grok 4.6 โมเดลเรือธงของ xAI ที่เปิดให้บริการเมื่อวันที่ 12 สิงหาคม 2026 ขายปุ่มหมุนให้คุณ — ตัวควบคุมความพยายามในการใช้เหตุผลที่ปรับแต่งได้บน API แบบปิด ราคา $2.00 ต่อล้านโทเคนอินพุต และ $6.00 ต่อล้านโทเคนเอาต์พุต พร้อมหน้าต่าง 500,000 โทเคน และเครื่องมือฝั่งเซิร์ฟเวอร์ของ xAI คิดค่าบริการเพิ่มเติม Intern-S2-397B โมเดลมัลติโมดัลเชิงวิทยาศาสตร์ขนาด 403 พันล้านพารามิเตอร์ ที่ทีม InternLM ของ Shanghai AI Laboratory เปิดตัวภายใต้ Apache-2.0 เมื่อวันที่ 13 กันยายน ยกทั้งเครื่องให้คุณ — น้ำหนัก สวิตช์เปิดปิดการคิด เส้นทางภาพ ส่วนหัวอนุกรมเวลา — และคาดหวังให้คุณรันมันเอง อันหนึ่งเช่ามาพร้อมปุ่มปรับ; อีกอันเป็นเจ้าของโดยสมบูรณ์ การเปรียบเทียบที่สำคัญตรงนี้ไม่ใช่ว่าอันไหนได้คะแนนสูงกว่าบนตาราง benchmark; แต่เป็นว่างานของคุณต้องการการควบคุมแบบไหนจริง ๆ และแต่ละแบบมีค่าใช้จ่ายเท่าไร
หน้าปัดที่แตกต่างกันสองแบบ
วิธีที่ชัดที่สุดในการแยกสองสิ่งนี้ออกจากกันคือดูว่าตัวควบคุมการให้เหตุผลอยู่ตรงไหน Grok 4.6 เปิดเผยการตั้งค่าระดับความพยายามในการให้เหตุผลผ่าน API ของ xAI และรอบ ๆ มันก็มีชุดเครื่องมือฝั่งเซิร์ฟเวอร์ — การเรียกใช้ฟังก์ชัน การค้นหาเว็บ การค้นหา X การรันโค้ด — ที่ xAI ดำเนินการและคิดค่าบริการแยกต่างหาก คุณปรับระดับความพยายาม คุณเชื่อมต่อเครื่องมือที่มันให้มา และคุณไม่ต้องแตะน้ำหนักเลย พฤติกรรมของโมเดลเป็นทรัพย์สินของ xAI และเป็นปัญหาของ xAI ส่วนคันโยกของคุณคือพารามิเตอร์ในคำขอ
Intern-S2-397B มอบชุดคันโยกที่แตกต่างให้คุณ และคันโยกเหล่านั้นอยู่ต่ำลงไปในสแตก การคิดเปิดอยู่เป็นค่าเริ่มต้น และคุณปิดมันเป็นรายคำขอได้ด้วยenable_thinking=False. เนื่องจากโมเดลนี้เป็น Apache-2.0 คุณยังสามารถนำเวตไปปรับจูนพฤติกรรมการให้เหตุผลของมันเองบนข้อมูลของคุณเอง แล้วให้บริการผลลัพธ์บน LMDeploy, vLLM หรือ SGLang พื้นผิวอินพุตของมันกว้างกว่าของ API แบบข้อความและรูปภาพ: มันรับสัญญาณอนุกรมเวลาและสร้างการพยากรณ์ ซึ่งเป็นความสามารถที่ปัจจุบันเชื่อมต่อผ่าน LMDeploy เท่านั้น และมันถูกฝึกมาสำหรับงานเอเจนต์ระยะยาวในสภาพแวดล้อมแบบแซนด์บ็อกซ์ ข้อแลกเปลี่ยนก็ชัดเจนพอกัน — การควบคุมในระดับนั้นจะมีความหมายก็ต่อเมื่อคุณพร้อมที่จะดำเนินการกับฮาร์ดแวร์และสแตกการให้บริการที่มาพร้อมกับมัน
• การควบคุมการให้เหตุผล — Grok 4.6: ตัวปรับ reasoning-effort บน API แบบปิด เทียบกับ Intern-S2-397B: สวิตช์เปิดปิด enable_thinking พร้อมการควบคุมระดับเวทอย่างเต็มรูปแบบภายใต้ Apache-2.0
• เครื่องมือ — Grok 4.6: การค้นหาเว็บบนฝั่งเซิร์ฟเวอร์ของ xAI, การค้นหา X และการรันโค้ด คิดค่าบริการแยกต่างหาก เทียบกับ Intern-S2-397B: การเรียกใช้เครื่องมือที่คุณต้องเชื่อมต่อเอง พร้อมเส้นทางการพยากรณ์อนุกรมเวลาผ่าน LMDeploy
• อินพุต — Grok 4.6: ข้อความ, รูปภาพ, ไฟล์ เทียบกับ Intern-S2-397B: ข้อความ, รูปภาพ, อนุกรมเวลา
• บริบท — Grok 4.6: 500,000 โทเคน เทียบกับ Intern-S2-397B: การให้เหตุผลด้วยข้อความ 256K, มัลติโมดัล 64K โดยทั้งสองตัวเลขมาจากการ์ดโมเดล
• ราคา — Grok 4.6: $2.00 / $6.00 ต่อ 1M โดยเพิ่มเป็น $4.00 / $12.00 เมื่อเกิน 200K โทเคน เทียบกับ Intern-S2-397B: ไม่มีตารางอัตราค่าบริการ; โฮสต์เองหรือใช้ Intern API อย่างเป็นทางการ
สิ่งที่ตัวเลขเหล่านี้ครอบคลุมจริง ๆ
ทุกตัวเลขของ Intern-S2-397B ด้านล่างนี้เป็นของ InternLM เอง รันผ่าน OpenCompass, VLMEvalKit และ AgentCompass และเผยแพร่พร้อมกับน้ำหนักโมเดล โดยไม่มีการทำซ้ำอย่างอิสระ ตัวเลขของ Grok 4.6 เป็นอีกประเภทหนึ่ง: พวกมันสะสมมาผ่านอารีน่าสาธารณะและ Artificial Analysis หลังจากโมเดลเปิดตัว ดังนั้นจึงมีป้ายกำกับจากบุคคลที่สาม
ในด้านที่วัดโดยอิสระ Grok 4.6 อยู่ที่ 44 บนดัชนี Artificial Analysis Intelligence Index ปัจจุบัน โดยมี GPQA Diamond ที่ 94.9, Humanity's Last Exam ที่ 61.0 และคะแนนเขียนโค้ดที่ 76.8 และ Artificial Analysis ระบุตัวเลข TerminalBench 2.1 ของมันไว้ใกล้ 80.3 ในฝั่งผู้ขาย การ์ดของ Intern-S2-397B รายงาน 89.77 บน MMLU Pro, 93.56 บน HMMT-2026, 81.68 บน MMMU Pro และ 68.54 บน SWE-bench-Pro พร้อมกับแถวด้านวิทยาศาสตร์ที่ดูเหมือนเป็นอีกสายพันธุ์หนึ่ง: 55.71 บน Biology-Instructions, 63.28 บน SciReasoner 1.5, 53.95 บน Mol-Instructions, 62.35 บน MolecularIQ ตัวเลขหนึ่งในตารางของผู้ขายที่ควรทำให้คนสร้างเอเจนต์สะดุ้งคือ TerminalBench 2.1 ที่ 64.04 — ตัวเลขที่ผู้สร้างโมเดลเองรายงานว่าแพ้โมเดลรุ่นปิดที่เก่ากว่าแบบห่างไกล ในเลนงานเทอร์มินัลที่โมเดลฟรอนเทียร์แบบเช่าใช้อย่าง Grok 4.6 แข็งแกร่งที่สุด
อ่านการแบ่งนั้นในฐานะภาพรวม ไม่ใช่การจัดอันดับ Intern-S2-397B เป็นผู้เชี่ยวชาญด้านวิทยาศาสตร์ที่เป็นโมเดลทั่วไปซึ่งทำได้ดี ส่วน Grok 4.6 เป็นโมเดลอเนกประสงค์ที่มีความสนใจด้านวิทยาศาสตร์เพียงผ่าน ๆ การที่แถวด้านวิทยาศาสตร์ออกมาไม่สมดุลนั้นเป็นสิ่งที่คาดหมายได้ — ไม่มีโมเดลเรือธงอเนกประสงค์รุ่นใดที่ถูกพรีเทรนบนหน้าต้นฉบับของวรรณกรรมวิทยาศาสตร์ซึ่งมีทั้งภาพ เลย์เอาต์ และสัญกรณ์เชิงสัญลักษณ์รวมกัน และนั่นคือกระบวนทัศน์ที่ Intern-S2-397B ถูกสร้างขึ้นมาอย่างแม่นยำ ไม่มีสิ่งใดในฐานหลักฐานทั้งสองที่สนับสนุนว่า "Intern-S2-397B เก่งเท่า Grok 4.6 ในการให้เหตุผลแบบใดก็ตาม" และไม่มีสิ่งใดในหลักฐานของ Grok 4.6 ที่ชี้ว่ามันถูกปรับจูนสำหรับการวิเคราะห์ลำดับหลายโอมิกส์
ราคาของการควบคุม
Grok 4.6 มีราคาที่คุณใส่ลงในสเปรดชีตได้เลย: $2.00 ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ $6.00 ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน โดยอัตราจะไต่ขึ้นเป็น $4.00 / $12.00 เมื่อพรอมป์ตข้าม 200,000 โทเคน พร้อมระดับลำดับความสำคัญแบบเลือกเสริมสำหรับการตอบกลับที่เร็วขึ้น ใช้งานได้ผ่าน OrcaRouter ในราคาลิสต์ของ xAI ที่ส่งต่อไปโดยบวกกำไร 0% ดังนั้นเมื่อ xAI เปลี่ยนอัตรา ราคาที่นี่ก็ปรับตามในวันเดียวกันโดยไม่มีส่วนต่างจากคนกลาง — ช่องทางที่คุณเช่าใช้ยังคงมีราคาตามที่ผู้ขายกำหนดไว้
Intern-S2-397B ไม่มีอัตราต่อโทเคนที่เผยแพร่เลยแม้แต่นิดเดียว การ์ดโมเดลอ้างถึง Intern API อย่างเป็นทางการ แต่ตัวเลขทางเศรษฐศาสตร์ที่ผู้คนอยากเปรียบเทียบจริง ๆ คือแบบโฮสต์เอง: เช็กพอยต์ขนาด 403B พารามิเตอร์ โดยมีน้ำหนักราว 807 GB กระจายอยู่ใน 188 แชร์ดแบบ BF16 จึงต้องใช้โหนดหลาย GPU ระดับจริงจัง โดยบิลด์ FP8 ลดขนาดพื้นที่จัดเก็บลงได้ราวครึ่งหนึ่ง หากคุณมีความจุนั้นอยู่แล้ว ต้นทุนส่วนเพิ่มของคำถามทางวิทยาศาสตร์ครั้งถัดไปจะใกล้เคียงค่ากระแสไฟฟ้า และนั่นแหละคือจุดสำคัญทั้งหมดของจุดยืน Apache-2.0 หากคุณไม่ได้เป็นเจ้าของมัน โมเดล "ฟรี" นี้คือโครงการนำร่องด้านรายจ่ายฝ่ายทุน ไม่ใช่รายการในงบประมาณ
สิ่งที่ตัวจัดเส้นทางให้ในคู่เฉพาะนี้คือรอยต่อมากกว่าราคา Grok 4.6 อยู่บนคีย์ที่คุณมีอยู่แล้วสำหรับทราฟฟิกโปรดักชันทั่วไป; Intern-S2-397B ไม่ได้ถูกจัดเส้นทางบน OrcaRouter — มันเป็นเช็กพอยต์ใหม่เอี่ยม และเส้นทางของคุณไปยังมันคือ API ของผู้ขายเองหรือการดีพลอยแบบโฮสต์เอง จัดเส้นทางงานให้เหตุผลทั่วไปที่ไวต่อความหน่วงไปยังโมเดลแบบคิดค่าตามการใช้ เก็บงานแบตช์ด้านวิทยาศาสตร์ไว้บนโมเดลที่คุณรัน และให้การสลับสำรองอัตโนมัติคอยรองรับคุณเมื่อเอนด์พอยต์ของฝั่งใดฝั่งหนึ่งมีปัญหา ขอบเขตระหว่างทั้งสองจะกลายเป็นกฎการจัดเส้นทางแทนที่จะเป็นการผสานรวมครั้งที่สอง

เลือกอันไหนดี
เลือก Grok 4.6 เมื่องานเป็นงานทั่วไป การให้เหตุผลต้องกลับมาเร็วและถูกต้อง และคุณไม่อยากเป็นเจ้าของสแต็กที่สร้างมันขึ้นมา หน้าต่าง 500K ของมัน คะแนน GPQA Diamond ที่วัดได้ 94.9 และชุดเครื่องมือของมันเป็นฟีเจอร์ระดับพร้อมใช้งานจริง และอัตรา $2/$6 คือสิ่งที่คุณจ่ายเพื่อไม่ต้องดำเนินการใด ๆ
เลือก Intern-S2-397B เมื่ออินพุตเป็นงานวิทยาศาสตร์ — เอกสารที่เต็มไปด้วยรูปภาพ แผนภาพโมเลกุล สัญญาณอนุกรมเวลา — และเมื่อการให้เหตุผลต้องเกิดขึ้นบนข้อมูลที่ไม่สามารถออกจากสภาพแวดล้อมของคุณ หรือบนพฤติกรรมที่คุณต้องการปรับแต่งด้วยตัวเอง Apache-2.0 ทำให้สิ่งนั้นเป็นไปได้ ส่วน API แบบเช่าไม่มีทางทำได้ เตรียมงบสำหรับฮาร์ดแวร์ คาดว่ายังไม่มีกระดานคะแนนอิสระไปสักพัก และมองทุกตัวเลขบนการ์ดของมันเป็นเพียงคำกล่าวอ้าง จนกว่าจะมีคนนอก InternLM ทำซ้ำได้สักตัว


