Intern-S2-397B와 Kimi K3를 비교하는 생성된 히어로 카드로, 왼쪽에는 분자 다이어그램이 있는 과학 문헌 페이지가 4030억 개 매개변수의 오픈 웨이트 카드로 이어지고, 오른쪽에는 긴 문서 리본이 1M 컨텍스트 미터를 갖춘 2.8조 개 매개변수의 플래그십으로 이어지며, 오른쪽 아래 모서리에는 OrcaRouter 로고가 있습니다.
Guides & Insights

Intern-S2-397B vs Kimi K3: 397B 과학 모델과 2.8T 추론의 거인

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Intern-S2-397B와 Kimi K3는 2026년의 나머지를 정의할 오픈 웨이트 구분선의 반대편에 자리한다: 다운로드 가능한 과학 특화 모델과 독립적으로 검증된 장문맥 범용 모델. Intern-S2-397B는 InternLM이 2026년 9월 13일 Apache-2.0으로 공개한 4030억 개 매개변수 과학 멀티모달 모델이다 — 요금표도, 독립 점수도 없으며, 과학 문헌의 원본 페이지로 훈련된 비전 경로를 갖추고 있다. Kimi K3는 Moonshot AI의 2조 8000억 개 매개변수 전문가 혼합(MoE) 플래그십으로, 2026년 7월 백만 입력 토큰당 $3.00, 백만 출력 토큰당 $15.00에 출시되었고, 7월 27일 수정 MIT 라이선스로 가중치를 공개했으며, 6주간의 독립 평가를 거쳤다. 이 대결에서 특이한 점은 두 모델 모두 동일한 장기적 야심 — 크고 지저분한 작업을 계속 끝까지 수행하는 것 — 을 지녔으면서도 이를 정반대 방향으로 해결한다는 것이다.

둘 다 야심차지만 상반된 메커니즘

목표는 공통적이다: 각 모델은 작업이 길어질 때에도 계속 나아가는 존재가 되고자 한다. 그것을 이루는 방식은 서로 다르며, 그 차이는 아키텍처에 있다.

Kimi K3의 답은 맥락이다. 입력과 출력 모두에 적용되는 1,048,576토큰 창은 전체 리포지토리, 전체 데이터룸, 또는 50단계 에이전트 루프가 하나의 대화에 담길 수 있음을 의미한다. Moonshot의 Mooncake 추론 스택은 코딩 워크로드에서 90% 이상의 캐시 적중률을 유지한다고 알려져 있으며, 이것이 실제로 백만 토큰당 15달러의 출력 가격을 감당할 수 있게 하는 방식이다. Kimi K3는 최상위 reasoning_effort 제어를 노출하고 샘플링 매개변수를 받지 않으며, 기본적으로 최대 깊이로 추론하고, 다중 턴 도구 루프에서 이전 reasoning_content와 tool_calls를 그대로 재생할 것을 기대하며, 그렇지 않으면 품질이 저하된다.

Intern-S2-397B의 답은 특화와 가중치 수준 제어의 결합입니다. 그 컨텍스트 — 256K 텍스트 추론과 64K 멀티모달, 두 수치 모두 모델 카드에서 나온 것입니다 — 는 다른 범주의 창으로, 상당한 분량의 논문이나 긴 연구 세션에는 충분하지만 백만 토큰 작업 세트에는 부족합니다. 대신 이 모델이 제공하는 것은 과학 문헌을 네이티브로 읽어 내는 비전 경로 — 도표, 레이아웃, 기호 표기, 산문을 함께 — 와 예측을 생성하는 시계열 입력이며, 여기에 기본적으로 켜져 있고 요청별로 전환할 수 있는 사고가 더해집니다. 긴 작업이 과학이라면 이 모델은 바로 그 일을 위해 훈련되었습니다. 긴 작업이 코드베이스라면, 이 모델은 그것을 위한 백만 토큰 창을 갖춘 모델이 아닙니다.

• 컨텍스트 — Kimi K3: 입출력 1,048,576 토큰 vs Intern-S2-397B: 텍스트 256K / 멀티모달 64K.

• 규모 — Kimi K3: 총 2.8T, 토큰당 약 104B 활성 vs Intern-S2-397B: 총 403B, 512개 전문가 / 10개 활성.

• 제어 인터페이스 — Kimi K3: reasoning_effort 다이얼, 샘플링 파라미터 없음 vs Intern-S2-397B: enable_thinking 토글 및 Apache-2.0 하의 완전한 가중치 수준 제어.

• 입력 — Kimi K3: 텍스트, 이미지 vs Intern-S2-397B: 텍스트, 이미지, 시계열.

• 가중치 — Kimi K3: Modified MIT로 공개(7월 27일) vs Intern-S2-397B: Apache-2.0으로 공개(9월 13일).

• 독립적 증거 — Kimi K3: 6주간의 제3자 점수 대 Intern-S2-397B: 아직 없음

증거의 비대칭성이 진정한 차이다

Kimi K3는 독립적인 혹독한 검증을 통과하고, 기반으로 삼을 수 있는 점수들을 얻었습니다. Artificial Analysis는 현재 Intelligence Index에서 K3를 40대 중반에 위치시켰으며, GPQA Diamond는 90대 초반, HLE는 40대 중반, 독립적으로 측정된 장문맥 회상력은 88.7, 코딩 점수는 70대 중반입니다. Frontend Code Arena에서는 1위(Elo 1670대)를 차지했고, BrowseComp에서는 91.2를 기록해 그 장기 지평 검색 벤치마크에서 최고 수치를 냈습니다. 다만 Moonshot 스스로는 K3가 "여전히 가장 강력한 독점 모델들에는 뒤처진다"고 경고하며, 출시 당일 공개된 여러 항목은 여전히 공급업체 보고 수치로 남아 있습니다.

Intern-S2-397B의 근거는 자체 출시 표이며, OpenCompass, VLMEvalKit, AgentCompass를 통해 실행되어 당신이 이것을 읽기 몇 시간 전에 공개되었습니다. 모든 수치는 벤더 자체의 것이고 재현되지 않았습니다: MMLU Pro 89.77, MMMU Pro 81.68, HMMT-2026 93.56, SWE-bench-Pro 68.54, 그리고 TerminalBench 2.1은 64.04 — 카드에서는 더 오래된 폐쇄형 세대에 큰 격차로 뒤지는 것으로 나타나는 수치입니다. 과학 관련 행들은 전문가의 주장을 뒷받침하는 수치입니다: Biology-Instructions에서 55.71, SciReasoner 1.5에서 63.28, Mol-Instructions에서 53.95, MolecularIQ에서 62.35. 두 근거 기반은 서로 맞닿지 않습니다. 그래서 이 맞대결을 정직하게 규정하는 방식은 "누가 이기는가"가 아니라 "당신의 워크로드에는 어떤 종류의 근거가 필요한가"입니다.

A generated two-column scoreboard titled 'Intern-S2-397B vs Kimi K3 — the scoreboard.' Left column 'Intern-S2-397B': Weights Apache-2.0 open; Scale 403B total MoE; Context 256K text / 64K multimodal; Inputs text, image, time series; Independent score none yet; Biology-Instructions 55.71 vendor-reported. Right column 'Kimi K3': Weights Modified MIT open; Scale 2.8T total, ~104B active; Context 1M tokens in and out; Inputs text, image; Independent score AA Index mid-40s, long-context recall 88.7; Price .00 / 5.00 per 1M. Footer reads 'Intern-S2-397B figures are InternLM's own, unreproduced; Kimi K3 figures per Artificial Analysis and Moonshot AI.'

각각의 비용, 오픈 웨이트 에디션

두 모델 모두 오픈 웨이트이므로, 비용 문제는 일반적인 종량제 대 무료라는 이야기에서 두 가지 호스팅 제안을 비교하는 문제로 바뀐다. Kimi K3는 공개된 API 가격이 있다 — Moonshot 정가 기준 백만 토큰당 $3.00 / $15.00이고, OrcaRouter에서 0% 마크업으로 그대로 전달되며, 캐시 읽기 요금이 추가로 붙는다 — 또한 다운로드할 수 있다: 슈퍼노드급 하드웨어, 즉 64개 이상의 가속기가 있어야 서빙할 수 있는 96개 샤드 오픈 웨이트 릴리스다. 자체 호스팅 K3의 실질적인 대상은 데이터센터 예산을 가진 팀이다. Intern-S2-397B는 공개된 API 가격이 전혀 없다. 모델 카드는 공식 Intern API를 가리키며, 실제 경제성은 자체 호스팅 쪽에서 나온다: BF16 기준 약 807 GB의 가중치가 188개 샤드에 걸쳐 있고, 제대로 된 멀티 GPU 노드가 필요하며, FP8 빌드는 점유 규모를 약 절반으로 줄인다.

라우팅만 하면 두 모델 모두 동일한 심(seam)을 통해 호출할 수 있습니다: Kimi K3는 Moonshot의 정가에 0% 마크업으로 OrcaRouter에서 제공되며, 반면 Intern-S2-397B는 라우팅되지 않습니다 — 완전히 새로운 Apache-2.0 체크포인트로, 여기에 접근하는 경로는 벤더 자체 API나 자체 호스팅 배포입니다. 이 대결에서 라우팅의 가치는 장문 컨텍스트 범용 트래픽은 이미 보유한 키에, 과학적 배치 작업은 직접 운영하는 모델에 유지하고, 둘 사이에 자동 장애 조치를 두는 데 있습니다. DSL은 그 경계를 두 번째 통합이 아닌 구성으로 만들어 줍니다.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.

평결

작업이 장문맥 범용 작업, 즉 전체 저장소 코딩, 지속적인 에이전트 루프, 100만 토큰의 작업 기억이 필요한 지식 노동이고, 그 뒤에 독립적인 스코어보드를 원한다면 Kimi K3를 선택하세요. 이 모델은 모든 면에서 더 강력한 근거를 갖춘 모델이며, 공개 가중치는 실제로 공개되어 있고(Modified MIT, 7월 27일), 이미 슈퍼노드급 인프라를 운영 중이라면 캐싱을 포함한 토큰당 경제성도 유리합니다.

과제가 과학적일 때는 Intern-S2-397B를 선택하세요: 그림이 빽빽한 논문, 분자 다이어그램, 스캔한 문헌, 시계열 신호, 그리고 경계 안에 남아 있어야 하는 데이터나 독점 결과로 파인튜닝하려는 가중치 같은 경우입니다. Apache-2.0이 그것을 가능하게 하며, 임대 API는 그렇게 하지 못합니다. 그리고 카드에 있는 과학 분야 행들은 범용 모델이 애초에 튜닝된 대상과는 다른 종류입니다. 하드웨어 예산을 책정하고, 직접 평가를 실행하며, InternLM 외부의 누군가가 그중 하나를 재현할 때까지 그것에 관해 공개된 모든 수치를 주장으로 취급하세요.

A screenshot of the OrcaRouter model page for Kimi K3 at orcarouter.ai/models/kimi/kimi-k3, captured September 13, 2026, showing the model listing with its provider MoonshotAI, 1,048,576-token context window, and .00 / 5.00 per-million-token pricing displayed alongside the surrounding catalogue.