
Intern-S2-397B กับ Kimi K3: โมเดลวิทยาศาสตร์ 397B และยักษ์ใหญ่ด้านการให้เหตุผล 2.8T
- deepseekใหม่DeepSeek: DeepSeek V4.1 Flash2026-09-1040ความฉลาด
- openaiใหม่OpenAI: GPT-6 Astra2026-09-0453ความฉลาด77การเขียนโค้ด
- googleใหม่Google: Gemini 3.8 Flash2026-09-0241ความฉลาด76การเขียนโค้ด
- qwenใหม่Qwen: Qwen3.8 Max (0902)2026-09-0240ความฉลาด72การเขียนโค้ด
- anthropicใหม่Anthropic: Claude Fable 5.12026-09-0153ความฉลาด82การเขียนโค้ด
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642ความฉลาด72การเขียนโค้ด
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 ต่อ 1 ล้านโทเค็น
- z-aiZ.ai: GLM 5.32026-08-1845ความฉลาด75การเขียนโค้ด
- obsidianQwen3.8 27B2026-08-1534ความฉลาด68การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236ความฉลาด69การเขียนโค้ด
- grokSpaceXAI: Grok 4.62026-08-1244ความฉลาด77การเขียนโค้ด
- metaMeta: Muse Spark 1.22026-08-0540ความฉลาด72การเขียนโค้ด
- qwenQwen: Qwen3.8 Max2026-08-0340ความฉลาด72การเขียนโค้ด
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135ความฉลาด69การเขียนโค้ด
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 ต่อ 1 ล้านโทเค็น
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451ความฉลาด78การเขียนโค้ด
- googleGoogle: Gemini 3.6 Flash2026-07-2134ความฉลาด69การเขียนโค้ด
Intern-S2-397B และ Kimi K3 อยู่คนละฝั่งของเส้นแบ่ง open-weights ที่จะกำหนดช่วงที่เหลือของปี 2026: ผู้เชี่ยวชาญด้านวิทยาศาสตร์ที่ดาวน์โหลดได้ เทียบกับโมเดลอเนกประสงค์บริบทยาวที่ผ่านการพิสูจน์อย่างอิสระ Intern-S2-397B เป็นโมเดลมัลติโมดัลด้านวิทยาศาสตร์ขนาด 403 พันล้านพารามิเตอร์ที่ InternLM เปิดตัวภายใต้ Apache-2.0 เมื่อวันที่ 13 กันยายน 2026 — ไม่มีตารางราคา ไม่มีคะแนนอิสระ และมีเส้นทางการมองเห็นที่ฝึกด้วยหน้าดิบของเอกสารวิทยาศาสตร์ Kimi K3 เป็นเรือธงแบบ mixture-of-experts ขนาด 2.8 ล้านล้านพารามิเตอร์ของ Moonshot AI ที่เปิดตัวในเดือนกรกฎาคม 2026 ในราคา 3.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 15.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เปิดน้ำหนักในวันที่ 27 กรกฎาคมภายใต้สัญญาอนุญาต Modified MIT และผ่านการประเมินอิสระมาแล้วหกสัปดาห์ สิ่งที่ไม่ธรรมดาเกี่ยวกับการประชันนี้คือโมเดลทั้งสองมีความทะเยอทะยานระยะยาวแบบเดียวกัน — ทำงานต่อไปจนผ่านงานใหญ่ที่ยุ่งเหยิง — และแก้โจทย์นั้นไปในทิศทางที่ตรงกันข้าม
ทั้งคู่ทะเยอทะยาน แต่มีกลไกที่ตรงกันข้าม
ความทะเยอทะยานนั้นเหมือนกัน: แต่ละโมเดลต้องการเป็นสิ่งที่ยังคงดำเนินต่อไปเมื่อภารกิจนั้นยาวนาน พวกมันบรรลุสิ่งนั้นด้วยวิธีที่แตกต่างกัน และความแตกต่างนั้นเป็นเชิงสถาปัตยกรรม
คำตอบของ Kimi K3 คือบริบท หน้าต่างขนาด 1,048,576 โทเคนทั้งอินพุตและเอาต์พุต หมายความว่าทั้งรีโพซิทอรีทั้งแห่ง ห้องข้อมูลทั้งห้อง หรือลูปเอเจนต์ 50 ขั้นตอน สามารถอยู่ในบทสนทนาเดียวได้ มีรายงานว่าสแต็กการอนุมาน Mooncake ของ Moonshot รักษาอัตราแคชฮิตให้สูงกว่า 90% ในงานเขียนโค้ด ซึ่งเป็นวิธีที่ทำให้ราคาเอาต์พุต 15 ดอลลาร์ต่อล้านโทเคนพอจะอยู่รอดได้ในทางปฏิบัติ Kimi K3 เปิดให้ใช้การควบคุม reasoning_effort ระดับบนสุด และไม่รับพารามิเตอร์การสุ่มใด ๆ โดยค่าเริ่มต้นจะให้เหตุผลที่ความลึกสูงสุด และคาดหวังให้คุณเล่นซ้ำ reasoning_content และ tool_calls ก่อนหน้าแบบคำต่อคำในลูปเครื่องมือแบบหลายเทิร์น มิฉะนั้นคุณภาพจะลดลง
คำตอบของ Intern-S2-397B คือความเชี่ยวชาญเฉพาะทางบวกกับการควบคุมในระดับน้ำหนัก บริบทของมัน — การให้เหตุผลกับข้อความ 256K และมัลติโมดัล 64K ซึ่งเป็นตัวเลขจากโมเดลการ์ด — จัดอยู่ในหน้าต่างคนละประเภท เพียงพอสำหรับบทความวิจัยชิ้นใหญ่หรือเซสชันวิจัยยาว ๆ แต่ไม่พอสำหรับชุดทำงานระดับล้านโทเคน สิ่งที่มันมอบให้แทนคือเส้นทางการมองเห็นที่อ่านวรรณกรรมวิทยาศาสตร์ได้โดยตรง — ทั้งภาพ แผนผัง สัญลักษณ์ และร้อยแก้วไปพร้อมกัน — และอินพุตอนุกรมเวลาที่สร้างการพยากรณ์ ควบคู่กับความสามารถในการคิดที่เปิดเป็นค่าเริ่มต้นและสลับได้ตามคำขอ ถ้างานระยะยาวของคุณเป็นงานวิทยาศาสตร์ โมเดลนี้ถูกฝึกมาเพื่อสิ่งนั้นโดยตรง; ถ้างานระยะยาวของคุณเป็นฐานโค้ด นี่ไม่ใช่โมเดลที่มีหน้าต่างล้านโทเคนสำหรับงานนั้น
• บริบท — Kimi K3: 1,048,576 โทเค็นเข้าและออก เทียบกับ Intern-S2-397B: 256K ข้อความ / 64K มัลติโมดัล
• ขนาด — Kimi K3: รวม 2.8T, ใช้งานจริง ~104B ต่อโทเคน เทียบกับ Intern-S2-397B: รวม 403B, ผู้เชี่ยวชาญ 512 ราย / ใช้งาน 10 ราย
• ชุดควบคุม — Kimi K3: ปุ่มปรับ reasoning_effort, ไม่มีพารามิเตอร์การสุ่ม เทียบกับ Intern-S2-397B: สวิตช์เปิด-ปิด enable_thinking พร้อมการควบคุมในระดับน้ำหนักอย่างเต็มรูปแบบภายใต้ Apache-2.0
• อินพุต — Kimi K3: ข้อความ, รูปภาพ เทียบกับ Intern-S2-397B: ข้อความ, รูปภาพ, อนุกรมเวลา
• เวท — Kimi K3: เปิดให้ใช้ภายใต้ Modified MIT (27 กรกฎาคม) เทียบกับ Intern-S2-397B: เปิดให้ใช้ภายใต้ Apache-2.0 (13 กันยายน)
• หลักฐานอิสระ — Kimi K3: คะแนนจากบุคคลที่สามเป็นเวลาหกสัปดาห์ เทียบกับ Intern-S2-397B: ยังไม่มี
ความไม่สมดุลของหลักฐานต่างหากคือความแตกต่างที่แท้จริง
Kimi K3 ผ่านการทดสอบอย่างหนักหน่วงจากหน่วยงานอิสระ และออกมาพร้อมคะแนนที่คุณนำไปต่อยอดได้ Artificial Analysis จัดให้อยู่ในช่วงกลางเลข 40 บน Intelligence Index ปัจจุบัน โดยได้ GPQA Diamond ในช่วงต้นเลข 90, HLE ในช่วงกลางเลข 40, คะแนนการเรียกคืนบริบทยาวที่วัดโดยอิสระอยู่ที่ 88.7 และคะแนนด้านการเขียนโค้ดอยู่ในช่วงกลางเลข 70 ทั้งยังครองอันดับหนึ่งบน Frontend Code Arena (Elo อยู่ในช่วง 1670) และทำได้ 91.2 บน BrowseComp ซึ่งเป็นตัวเลขสูงสุดบนเกณฑ์วัดการค้นคืนแบบระยะยาวนั้น แม้ว่า Moonshot เองจะเตือนว่า K3 "ยังตามหลังโมเดล proprietary ที่ทรงพลังที่สุดอยู่" และหลายแถวข้อมูลในวันเปิดตัวยังคงเป็นข้อมูลที่ผู้จำหน่ายรายงานเอง
หลักฐานของ Intern-S2-397B คือตารางเปิดตัวของมันเอง ซึ่งรันผ่าน OpenCompass, VLMEvalKit และ AgentCompass และเผยแพร่ไม่กี่ชั่วโมงก่อนที่คุณจะอ่านข้อความนี้ ทุกตัวเลขเป็นของผู้จำหน่ายเองและยังไม่ถูกทำซ้ำ: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 และ TerminalBench 2.1 ที่ 64.04 — ตัวเลขที่การ์ดแสดงว่าแพ้รุ่นปิดที่เก่ากว่าแบบห่างไกล แถวด้านวิทยาศาสตร์ของมันคือตัวเลขที่ทำให้ข้อโต้แย้งของโมเดลเฉพาะทางมีน้ำหนัก: 55.71 ใน Biology-Instructions, 63.28 ใน SciReasoner 1.5, 53.95 ใน Mol-Instructions, 62.35 ใน MolecularIQ ฐานหลักฐานทั้งสองชุดไม่แตะกัน ซึ่งเป็นเหตุผลว่าการวางกรอบอย่างตรงไปตรงมาของการเปรียบเทียบครั้งนี้ไม่ใช่ "ใครชนะ" แต่คือ "ภาระงานของคุณต้องการหลักฐานแบบไหน"

ค่าใช้จ่ายของแต่ละอย่าง ฉบับน้ำหนักเปิด
ทั้งสองโมเดลเป็นแบบเปิดน้ำหนัก ซึ่งเปลี่ยนคำถามเรื่องต้นทุนจากเรื่องราวปกติแบบคิดตามปริมาณการใช้เทียบกับฟรี ไปเป็นการเปรียบเทียบข้อเสนอการโฮสต์สองแบบ Kimi K3 มีราคา API ที่ประกาศไว้ — 3.00 / 15.00 ดอลลาร์ต่อล้านโทเค็นตามราคาลิสต์ของ Moonshot โดยส่งต่อบน OrcaRouter ในอัตราบวกกำไร 0% พร้อมราคาการอ่านแคชเพิ่มเติม — และยังดาวน์โหลดได้ด้วย: รีลีสแบบเปิดน้ำหนัก 96 ชาร์ดที่ต้องใช้ฮาร์ดแวร์ระดับซูเปอร์โนด คือตัวเร่งความเร็ว 64 ตัวขึ้นไป เพื่อให้บริการ กลุ่มเป้าหมายที่ใช้งานได้จริงสำหรับการโฮสต์ K3 เองคือทีมที่มีงบประมาณระดับดาต้าเซ็นเตอร์ Intern-S2-397B ไม่มีราคา API ที่ประกาศไว้เลย การ์ดโมเดลชี้ไปที่ Intern API อย่างเป็นทางการ และเศรษฐศาสตร์ที่แท้จริงคือการโฮสต์เอง: น้ำหนักประมาณ 807 GB กระจายใน 188 ชาร์ดใน BF16 เป็นโหนดหลาย GPU ระดับจริงจัง โดยบิลด์ FP8 ลดขนาดพื้นที่ลงประมาณครึ่งหนึ่ง
ทั้งสองโมเดลเรียกใช้ผ่านรอยต่อเดียวกันได้ถ้าคุณกำหนดเส้นทาง: Kimi K3 อยู่บน OrcaRouter ในราคาตามที่ Moonshot ประกาศ โดยบวกเพิ่ม 0% ส่วน Intern-S2-397B ไม่ได้ถูกกำหนดเส้นทาง — เป็นเช็กพอยต์ Apache-2.0 ใหม่เอี่ยม เส้นทางของคุณไปสู่มันคือ API ของผู้จำหน่ายเองหรือการติดตั้งแบบโฮสต์เอง คุณค่าของการกำหนดเส้นทางในการจับคู่นี้คือการเก็บทราฟฟิกงานทั่วไปที่ใช้บริบทยาวไว้บนคีย์ที่คุณมีอยู่แล้ว และงานประมวลผลแบบกลุ่มเชิงวิทยาศาสตร์ไว้บนโมเดลที่คุณรัน โดยมีระบบสลับอัตโนมัติระหว่างทั้งสอง DSL ทำให้ขอบเขตนั้นกลายเป็นการตั้งค่าแทนที่จะเป็นการผสานรวมครั้งที่สอง

คำตัดสิน
เลือก Kimi K3 เมื่องานเป็นงานทั่วไปที่ต้องใช้บริบทยาว — การเขียนโค้ดทั้งรีโพซิทอรี, ลูปเอเจนต์ที่ทำงานต่อเนื่อง, งานองค์ความรู้ที่ต้องใช้หน่วยความจำใช้งานหนึ่งล้านโทเคน — และคุณต้องการกระดานคะแนนอิสระรองรับอยู่เบื้องหลัง มันเป็นโมเดลที่มีหลักฐานหนุนแน่นหนากว่าในทุกแง่มุม เวตเปิดของมันมีอยู่จริง (Modified MIT, 27 กรกฎาคม) และถ้าคุณดำเนินโครงสร้างพื้นฐานระดับซูเปอร์โหนดอยู่แล้ว เศรษฐศาสตร์ต่อโทเคนเมื่อใช้แคชก็อยู่ในเกณฑ์ที่ดี
เลือก Intern-S2-397B เมื่องานเป็นงานวิทยาศาสตร์: เอกสารที่มีรูปภาพหนาแน่น แผนภาพโมเลกุล วรรณกรรมที่สแกน สัญญาณอนุกรมเวลา และข้อมูลที่ต้องอยู่ภายในขอบเขตของคุณ หรือเวทที่คุณต้องการไฟน์จูนบนผลลัพธ์ที่เป็นกรรมสิทธิ์ Apache-2.0 ทำให้สิ่งนั้นเป็นไปได้ ไม่มี API แบบเช่ารายใดทำได้ และแถวทางวิทยาศาสตร์ในการ์ดเป็นคนละชนิดกับสิ่งที่โมเดลเอนกประสงค์เคยถูกปรับจูนมาเพื่อ จัดงบสำหรับฮาร์ดแวร์ รันการประเมินของคุณเอง และถือว่าทุกตัวเลขที่เผยแพร่เกี่ยวกับมันเป็นเพียงคำกล่าวอ้าง จนกว่าจะมีคนนอก InternLM ทำซ้ำตัวเลขใดตัวเลขหนึ่งได้

