การ์ดฮีโร่ที่สร้างขึ้นซึ่งเปรียบเทียบ Intern-S2-397B กับ Kimi K3 โดยด้านซ้ายแสดงหน้าเอกสารวรรณกรรมทางวิทยาศาสตร์ที่มีแผนภาพโมเลกุลป้อนเข้าสู่การ์ดแบบโอเพนเวตส์ขนาด 403 พันล้านพารามิเตอร์ และด้านขวาเป็นริบบอนเอกสารยาวที่ป้อนเข้าสู่โมเดลเรือธงขนาด 2.8 ล้านล้านพารามิเตอร์พร้อมมาตรวัดบริบท 1M โดยมีโลโก้ OrcaRouter อยู่ที่มุมขวาล่าง
Guides & Insights

Intern-S2-397B กับ Kimi K3: โมเดลวิทยาศาสตร์ 397B และยักษ์ใหญ่ด้านการให้เหตุผล 2.8T

ผู้เขียน

Gideon Frost

วันที่เผยแพร่

โมเดลล่าสุด · 20ดูโมเดลทั้งหมด
เบนช์มาร์ก: Artificial Analysis · อัปเดตทุกวัน
กลับไปยังโพสต์ทั้งหมด

Intern-S2-397B และ Kimi K3 อยู่คนละฝั่งของเส้นแบ่ง open-weights ที่จะกำหนดช่วงที่เหลือของปี 2026: ผู้เชี่ยวชาญด้านวิทยาศาสตร์ที่ดาวน์โหลดได้ เทียบกับโมเดลอเนกประสงค์บริบทยาวที่ผ่านการพิสูจน์อย่างอิสระ Intern-S2-397B เป็นโมเดลมัลติโมดัลด้านวิทยาศาสตร์ขนาด 403 พันล้านพารามิเตอร์ที่ InternLM เปิดตัวภายใต้ Apache-2.0 เมื่อวันที่ 13 กันยายน 2026 — ไม่มีตารางราคา ไม่มีคะแนนอิสระ และมีเส้นทางการมองเห็นที่ฝึกด้วยหน้าดิบของเอกสารวิทยาศาสตร์ Kimi K3 เป็นเรือธงแบบ mixture-of-experts ขนาด 2.8 ล้านล้านพารามิเตอร์ของ Moonshot AI ที่เปิดตัวในเดือนกรกฎาคม 2026 ในราคา 3.00 ดอลลาร์ต่อโทเคนอินพุตหนึ่งล้านโทเคน และ 15.00 ดอลลาร์ต่อโทเคนเอาต์พุตหนึ่งล้านโทเคน เปิดน้ำหนักในวันที่ 27 กรกฎาคมภายใต้สัญญาอนุญาต Modified MIT และผ่านการประเมินอิสระมาแล้วหกสัปดาห์ สิ่งที่ไม่ธรรมดาเกี่ยวกับการประชันนี้คือโมเดลทั้งสองมีความทะเยอทะยานระยะยาวแบบเดียวกัน — ทำงานต่อไปจนผ่านงานใหญ่ที่ยุ่งเหยิง — และแก้โจทย์นั้นไปในทิศทางที่ตรงกันข้าม

ทั้งคู่ทะเยอทะยาน แต่มีกลไกที่ตรงกันข้าม

ความทะเยอทะยานนั้นเหมือนกัน: แต่ละโมเดลต้องการเป็นสิ่งที่ยังคงดำเนินต่อไปเมื่อภารกิจนั้นยาวนาน พวกมันบรรลุสิ่งนั้นด้วยวิธีที่แตกต่างกัน และความแตกต่างนั้นเป็นเชิงสถาปัตยกรรม

คำตอบของ Kimi K3 คือบริบท หน้าต่างขนาด 1,048,576 โทเคนทั้งอินพุตและเอาต์พุต หมายความว่าทั้งรีโพซิทอรีทั้งแห่ง ห้องข้อมูลทั้งห้อง หรือลูปเอเจนต์ 50 ขั้นตอน สามารถอยู่ในบทสนทนาเดียวได้ มีรายงานว่าสแต็กการอนุมาน Mooncake ของ Moonshot รักษาอัตราแคชฮิตให้สูงกว่า 90% ในงานเขียนโค้ด ซึ่งเป็นวิธีที่ทำให้ราคาเอาต์พุต 15 ดอลลาร์ต่อล้านโทเคนพอจะอยู่รอดได้ในทางปฏิบัติ Kimi K3 เปิดให้ใช้การควบคุม reasoning_effort ระดับบนสุด และไม่รับพารามิเตอร์การสุ่มใด ๆ โดยค่าเริ่มต้นจะให้เหตุผลที่ความลึกสูงสุด และคาดหวังให้คุณเล่นซ้ำ reasoning_content และ tool_calls ก่อนหน้าแบบคำต่อคำในลูปเครื่องมือแบบหลายเทิร์น มิฉะนั้นคุณภาพจะลดลง

คำตอบของ Intern-S2-397B คือความเชี่ยวชาญเฉพาะทางบวกกับการควบคุมในระดับน้ำหนัก บริบทของมัน — การให้เหตุผลกับข้อความ 256K และมัลติโมดัล 64K ซึ่งเป็นตัวเลขจากโมเดลการ์ด — จัดอยู่ในหน้าต่างคนละประเภท เพียงพอสำหรับบทความวิจัยชิ้นใหญ่หรือเซสชันวิจัยยาว ๆ แต่ไม่พอสำหรับชุดทำงานระดับล้านโทเคน สิ่งที่มันมอบให้แทนคือเส้นทางการมองเห็นที่อ่านวรรณกรรมวิทยาศาสตร์ได้โดยตรง — ทั้งภาพ แผนผัง สัญลักษณ์ และร้อยแก้วไปพร้อมกัน — และอินพุตอนุกรมเวลาที่สร้างการพยากรณ์ ควบคู่กับความสามารถในการคิดที่เปิดเป็นค่าเริ่มต้นและสลับได้ตามคำขอ ถ้างานระยะยาวของคุณเป็นงานวิทยาศาสตร์ โมเดลนี้ถูกฝึกมาเพื่อสิ่งนั้นโดยตรง; ถ้างานระยะยาวของคุณเป็นฐานโค้ด นี่ไม่ใช่โมเดลที่มีหน้าต่างล้านโทเคนสำหรับงานนั้น

• บริบท — Kimi K3: 1,048,576 โทเค็นเข้าและออก เทียบกับ Intern-S2-397B: 256K ข้อความ / 64K มัลติโมดัล

• ขนาด — Kimi K3: รวม 2.8T, ใช้งานจริง ~104B ต่อโทเคน เทียบกับ Intern-S2-397B: รวม 403B, ผู้เชี่ยวชาญ 512 ราย / ใช้งาน 10 ราย

• ชุดควบคุม — Kimi K3: ปุ่มปรับ reasoning_effort, ไม่มีพารามิเตอร์การสุ่ม เทียบกับ Intern-S2-397B: สวิตช์เปิด-ปิด enable_thinking พร้อมการควบคุมในระดับน้ำหนักอย่างเต็มรูปแบบภายใต้ Apache-2.0

• อินพุต — Kimi K3: ข้อความ, รูปภาพ เทียบกับ Intern-S2-397B: ข้อความ, รูปภาพ, อนุกรมเวลา

• เวท — Kimi K3: เปิดให้ใช้ภายใต้ Modified MIT (27 กรกฎาคม) เทียบกับ Intern-S2-397B: เปิดให้ใช้ภายใต้ Apache-2.0 (13 กันยายน)

• หลักฐานอิสระ — Kimi K3: คะแนนจากบุคคลที่สามเป็นเวลาหกสัปดาห์ เทียบกับ Intern-S2-397B: ยังไม่มี

ความไม่สมดุลของหลักฐานต่างหากคือความแตกต่างที่แท้จริง

Kimi K3 ผ่านการทดสอบอย่างหนักหน่วงจากหน่วยงานอิสระ และออกมาพร้อมคะแนนที่คุณนำไปต่อยอดได้ Artificial Analysis จัดให้อยู่ในช่วงกลางเลข 40 บน Intelligence Index ปัจจุบัน โดยได้ GPQA Diamond ในช่วงต้นเลข 90, HLE ในช่วงกลางเลข 40, คะแนนการเรียกคืนบริบทยาวที่วัดโดยอิสระอยู่ที่ 88.7 และคะแนนด้านการเขียนโค้ดอยู่ในช่วงกลางเลข 70 ทั้งยังครองอันดับหนึ่งบน Frontend Code Arena (Elo อยู่ในช่วง 1670) และทำได้ 91.2 บน BrowseComp ซึ่งเป็นตัวเลขสูงสุดบนเกณฑ์วัดการค้นคืนแบบระยะยาวนั้น แม้ว่า Moonshot เองจะเตือนว่า K3 "ยังตามหลังโมเดล proprietary ที่ทรงพลังที่สุดอยู่" และหลายแถวข้อมูลในวันเปิดตัวยังคงเป็นข้อมูลที่ผู้จำหน่ายรายงานเอง

หลักฐานของ Intern-S2-397B คือตารางเปิดตัวของมันเอง ซึ่งรันผ่าน OpenCompass, VLMEvalKit และ AgentCompass และเผยแพร่ไม่กี่ชั่วโมงก่อนที่คุณจะอ่านข้อความนี้ ทุกตัวเลขเป็นของผู้จำหน่ายเองและยังไม่ถูกทำซ้ำ: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54 และ TerminalBench 2.1 ที่ 64.04 — ตัวเลขที่การ์ดแสดงว่าแพ้รุ่นปิดที่เก่ากว่าแบบห่างไกล แถวด้านวิทยาศาสตร์ของมันคือตัวเลขที่ทำให้ข้อโต้แย้งของโมเดลเฉพาะทางมีน้ำหนัก: 55.71 ใน Biology-Instructions, 63.28 ใน SciReasoner 1.5, 53.95 ใน Mol-Instructions, 62.35 ใน MolecularIQ ฐานหลักฐานทั้งสองชุดไม่แตะกัน ซึ่งเป็นเหตุผลว่าการวางกรอบอย่างตรงไปตรงมาของการเปรียบเทียบครั้งนี้ไม่ใช่ "ใครชนะ" แต่คือ "ภาระงานของคุณต้องการหลักฐานแบบไหน"

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

ค่าใช้จ่ายของแต่ละอย่าง ฉบับน้ำหนักเปิด

ทั้งสองโมเดลเป็นแบบเปิดน้ำหนัก ซึ่งเปลี่ยนคำถามเรื่องต้นทุนจากเรื่องราวปกติแบบคิดตามปริมาณการใช้เทียบกับฟรี ไปเป็นการเปรียบเทียบข้อเสนอการโฮสต์สองแบบ Kimi K3 มีราคา API ที่ประกาศไว้ — 3.00 / 15.00 ดอลลาร์ต่อล้านโทเค็นตามราคาลิสต์ของ Moonshot โดยส่งต่อบน OrcaRouter ในอัตราบวกกำไร 0% พร้อมราคาการอ่านแคชเพิ่มเติม — และยังดาวน์โหลดได้ด้วย: รีลีสแบบเปิดน้ำหนัก 96 ชาร์ดที่ต้องใช้ฮาร์ดแวร์ระดับซูเปอร์โนด คือตัวเร่งความเร็ว 64 ตัวขึ้นไป เพื่อให้บริการ กลุ่มเป้าหมายที่ใช้งานได้จริงสำหรับการโฮสต์ K3 เองคือทีมที่มีงบประมาณระดับดาต้าเซ็นเตอร์ Intern-S2-397B ไม่มีราคา API ที่ประกาศไว้เลย การ์ดโมเดลชี้ไปที่ Intern API อย่างเป็นทางการ และเศรษฐศาสตร์ที่แท้จริงคือการโฮสต์เอง: น้ำหนักประมาณ 807 GB กระจายใน 188 ชาร์ดใน BF16 เป็นโหนดหลาย GPU ระดับจริงจัง โดยบิลด์ FP8 ลดขนาดพื้นที่ลงประมาณครึ่งหนึ่ง

ทั้งสองโมเดลเรียกใช้ผ่านรอยต่อเดียวกันได้ถ้าคุณกำหนดเส้นทาง: Kimi K3 อยู่บน OrcaRouter ในราคาตามที่ Moonshot ประกาศ โดยบวกเพิ่ม 0% ส่วน Intern-S2-397B ไม่ได้ถูกกำหนดเส้นทาง — เป็นเช็กพอยต์ Apache-2.0 ใหม่เอี่ยม เส้นทางของคุณไปสู่มันคือ API ของผู้จำหน่ายเองหรือการติดตั้งแบบโฮสต์เอง คุณค่าของการกำหนดเส้นทางในการจับคู่นี้คือการเก็บทราฟฟิกงานทั่วไปที่ใช้บริบทยาวไว้บนคีย์ที่คุณมีอยู่แล้ว และงานประมวลผลแบบกลุ่มเชิงวิทยาศาสตร์ไว้บนโมเดลที่คุณรัน โดยมีระบบสลับอัตโนมัติระหว่างทั้งสอง DSL ทำให้ขอบเขตนั้นกลายเป็นการตั้งค่าแทนที่จะเป็นการผสานรวมครั้งที่สอง

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

คำตัดสิน

เลือก Kimi K3 เมื่องานเป็นงานทั่วไปที่ต้องใช้บริบทยาว — การเขียนโค้ดทั้งรีโพซิทอรี, ลูปเอเจนต์ที่ทำงานต่อเนื่อง, งานองค์ความรู้ที่ต้องใช้หน่วยความจำใช้งานหนึ่งล้านโทเคน — และคุณต้องการกระดานคะแนนอิสระรองรับอยู่เบื้องหลัง มันเป็นโมเดลที่มีหลักฐานหนุนแน่นหนากว่าในทุกแง่มุม เวตเปิดของมันมีอยู่จริง (Modified MIT, 27 กรกฎาคม) และถ้าคุณดำเนินโครงสร้างพื้นฐานระดับซูเปอร์โหนดอยู่แล้ว เศรษฐศาสตร์ต่อโทเคนเมื่อใช้แคชก็อยู่ในเกณฑ์ที่ดี

เลือก Intern-S2-397B เมื่องานเป็นงานวิทยาศาสตร์: เอกสารที่มีรูปภาพหนาแน่น แผนภาพโมเลกุล วรรณกรรมที่สแกน สัญญาณอนุกรมเวลา และข้อมูลที่ต้องอยู่ภายในขอบเขตของคุณ หรือเวทที่คุณต้องการไฟน์จูนบนผลลัพธ์ที่เป็นกรรมสิทธิ์ Apache-2.0 ทำให้สิ่งนั้นเป็นไปได้ ไม่มี API แบบเช่ารายใดทำได้ และแถวทางวิทยาศาสตร์ในการ์ดเป็นคนละชนิดกับสิ่งที่โมเดลเอนกประสงค์เคยถูกปรับจูนมาเพื่อ จัดงบสำหรับฮาร์ดแวร์ รันการประเมินของคุณเอง และถือว่าทุกตัวเลขที่เผยแพร่เกี่ยวกับมันเป็นเพียงคำกล่าวอ้าง จนกว่าจะมีคนนอก InternLM ทำซ้ำตัวเลขใดตัวเลขหนึ่งได้

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.
© 2026 OrcaRouter

สำหรับผู้ให้บริการ

ให้บริการแพลตฟอร์มการอนุมานอยู่หรือไม่ นำโมเดลของคุณขึ้น OrcaRouter

providers@orcarouter.ai

เข้าร่วมคอมมูนิตี้ของเรา

Discordsupport@orcarouter.aiXGitHubYouTube