Intern-S2-397B와 Grok 4.6을 비교하는 생성된 히어로 카드로, 왼쪽에는 enable_thinking이라고 표시된 추론 토글과 시계열 파형이 있는 오픈 웨이트 과학 모델을, 오른쪽에는 추론 강도 다이얼과 서버 측 도구 아이콘이 있는 비공개 클라우드 엔드포인트를 보여주며, Apache-2.0 자체 호스팅 제어와 $2 / $6 종량제 API의 대비를 라벨로 달고, 오른쪽 아래 모서리에 OrcaRouter 로고가 있습니다.
Guides & Insights

Intern-S2-397B vs Grok 4.6: 누가 제어권을 쥐는가

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Intern-S2-397B와 Grok 4.6은 약 한 달 간격으로 출시되었으며, 근본적으로 같은 질문—추론을 누가 통제하는가—에 정반대 방식으로 답한다. 2026년 8월 12일에 공개된 xAI의 플래그십 Grok 4.6은 다이얼 하나를 판다. 폐쇄형 API에서 구성 가능한 추론 노력(reasoning effort) 제어를 제공하며, 가격은 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00이고, 50만 토큰 창과 xAI의 서버 측 도구는 별도로 청구된다. 9월 13일 상하이 AI 연구소의 InternLM 팀이 Apache-2.0 라이선스로 공개한 4,030억 개 파라미터 과학 멀티모달 모델 Intern-S2-397B는 기계 전체—가중치, 사고 토글, 비전 경로, 시계열 헤드—를 건네주며 직접 실행하라고 기대한다. 하나는 노브를 달아 임대해 주는 것이고, 다른 하나는 완전히 소유하는 것이다. 여기서 중요한 비교는 어느 쪽이 벤치마크 표에서 더 높은 점수를 받는가가 아니라, 당신의 워크로드에 실제로 어떤 종류의 통제가 필요한가, 그리고 각 종류에 비용이 얼마나 드는가이다.

서로 다른 두 개의 다이얼

이 둘을 구분하는 가장 깔끔한 방법은 추론 제어가 어디에 자리 잡고 있는지 살펴보는 것입니다. Grok 4.6은 x​AI의 API를 통해 추론 노력(reasoning-effort) 설정을 노출하며, 그 주변에는 x​AI가 운영하고 별도로 청구하는 서버 측 도구 모음 — 함수 호출, 웹 검색, X 검색, 코드 실행 — 이 있습니다. 여러분은 노력 수준을 조정하고, 그것이 제공하는 도구를 연결하며, 가중치는 결코 건드리지 않습니다. 모델의 동작은 x​AI의 자산이자 x​AI의 문제입니다. 여러분의 지렛대는 요청에 포함된 파라미터입니다.

Intern-S2-397B는 여러분에게 다른 레버 세트를 제공하며, 그 레버들은 스택의 더 아래쪽에 있습니다. 사고는 기본적으로 켜져 있고, 요청별로 enable_thinking=False로 끕니다. 이 모델은 Apache-2.0이므로, 가중치를 가져와 자체 데이터로 추론 동작 자체를 파인튜닝한 다음 그 결과를 LMDeploy, vLLM 또는 SGLang에서 서빙할 수도 있습니다. 입력 인터페이스는 텍스트 및 이미지 API보다 더 넓습니다. 시계열 신호를 받아 예측을 생성하는데, 이 기능은 현재 LMDeploy를 통해서만 연결되어 있습니다. 또한 샌드박스 환경에서의 장기 지평 에이전트 작업을 위해 훈련되었습니다. 트레이드오프도 똑같이 분명합니다. 그 수준의 제어는 그에 따르는 하드웨어와 서빙 스택을 운영할 준비가 되어 있을 때만 의미가 있습니다.

• 추론 제어 — Grok 4.6: 폐쇄형 API의 추론 노력 다이얼 vs Intern-S2-397B: enable_thinking 토글과 Apache-2.0 하의 완전한 가중치 수준 제어.

• 도구 — Grok 4.6: xAI의 서버 측 웹 검색, X 검색 및 코드 실행, 별도 과금 vs Intern-S2-397B: 직접 연결하는 도구 호출, 그리고 LMDeploy를 통한 시계열 예측 경로.

• 입력 — Grok 4.6: 텍스트, 이미지, 파일 vs Intern-S2-397B: 텍스트, 이미지, 시계열.

• 컨텍스트 — Grok 4.6: 500,000토큰 vs Intern-S2-397B: 256K 텍스트 추론, 64K 멀티모달, 두 수치 모두 모델 카드에서 가져온 것임.

• 가격 — Grok 4.6: 1M당 $2.00 / $6.00, 200K 토큰 초과 시 $4.00 / $12.00로 구간 상향 vs Intern-S2-397B: 요금표 없음; 자체 호스팅 또는 공식 Intern API.

숫자가 실제로 포함하는 범위

아래의 모든 Intern-S2-397B 수치는 InternLM 자체 측정치로, OpenCompass, VLMEvalKit, AgentCompass를 통해 실행되었고 독립적 재현 없이 가중치와 함께 공개되었습니다. Grok 4.6의 수치는 성격이 다릅니다: 모델 출시 후 공개 아레나와 Artificial Analysis를 통해 축적된 것이므로 제3자 라벨을 달고 있습니다.

독립적으로 측정된 쪽에서 Grok 4.6은 현재 Artificial Analysis Intelligence Index에서 44에 위치하며, GPQA Diamond 94.9, Humanity's Last Exam 61.0, 코딩 점수 76.8을 기록했고, Artificial Analysis는 TerminalBench 2.1 수치를 약 80.3으로 제시한다. 벤더 측에서는 Intern-S2-397B의 카드가 MMLU Pro 89.77, HMMT-2026 93.56, MMMU Pro 81.68, SWE-bench-Pro 68.54를 보고하며, 과학 관련 항목들에서는 마치 다른 종처럼 보인다. Biology-Instructions 55.71, SciReasoner 1.5 63.28, Mol-Instructions 53.95, MolecularIQ 62.35가 그것이다. 벤더 표에서 에이전트 빌더를 움찔하게 만들 만한 단 하나의 숫자는 TerminalBench 2.1의 64.04인데, 이는 모델 자체를 만든 이들이 한 세대 전의 폐쇄형 모델에게 큰 차이로 지고 있다고 보고하는 수치이며, 바로 Grok 4.6 같은 임대형 프런티어 모델이 가장 강한 터미널 작업 영역에서 그렇다.

그 격차는 순위가 아니라 초상으로 읽어야 합니다. Intern-S2-397B는 유능한 범용 모델이기도 한 과학 전문가이고, Grok 4.6은 과학에 어느 정도 관심을 가진 범용 모델입니다. 과학 분야 행들이 한쪽으로 치우친 것은 예상된 일입니다. 그림, 레이아웃, 기호 표기를 모두 함께 갖춘 과학 문헌 원문 페이지로 사전 학습된 범용 최상위 모델은 없으며, 바로 그것이 Intern-S2-397B가 기반으로 삼은 패러다임입니다. 어느 쪽 근거 자료에도 "Intern-S2-397B가 임의 추론에서 Grok 4.6만큼 뛰어나다"는 주장을 뒷받침하는 내용은 없고, Grok 4.6의 근거 자료 어디에도 그것이 멀티오믹스 서열 분석용으로 튜닝되었다는 암시는 없습니다.

통제의 대가

Grok 4.6은 스프레드시트에 넣을 수 있는 가격을 갖고 있습니다: 입력 토큰 100만 개당 $2.00, 출력 100만 개당 $6.00이며, 프롬프트가 200,000 토큰을 넘으면 요금이 $4.00 / $12.00로 올라가고, 더 빠른 응답을 위한 선택형 우선순위 등급도 있습니다. xAI의 정가를 0% 마크업으로 그대로 전달하는 방식으로 OrcaRouter를 통해 이용할 수 있습니다, 따라서 xAI에서 요금이 바뀌면 중간상 차액 없이 같은 날 여기에 반영됩니다 — 여러분이 빌리는 다이얼은 벤더가 책정한 방식 그대로 가격이 유지됩니다.

Intern-S2-397B는 공개된 토큰당 단가가 전혀 없다. 모델 카드는 공식 Intern API를 언급하지만, 사람들이 실제로 비교하고 싶어 하는 경제성은 자체 호스팅 방식이다. 즉 403B 파라미터 체크포인트, BF16 기준으로 약 807GB의 가중치가 188개 샤드에 걸쳐 있으므로 제대로 된 멀티 GPU 노드가 필요하고, FP8 빌드는 그 용량을 대략 절반으로 줄인다. 이미 그 용량을 보유하고 있다면 다음 과학적 질의의 한계 비용은 전기료에 가까워지며, 그것이 바로 Apache-2.0 입장의 핵심이다. 보유하고 있지 않다면 그 "무료" 모델은 자본 지출 파일럿이지 비용 항목이 아니다.

이 특정 조합에서 라우터가 제공하는 것은 가격이 아니라 경계면입니다. Grok 4.6은 일반 프로덕션 트래픽용으로 이미 보유한 키를 사용합니다. Intern-S2-397B는 OrcaRouter에서 라우팅되지 않습니다. 완전히 새로운 체크포인트이며, 여기에 접근하는 경로는 공급업체 자체 API 또는 자체 호스팅 배포입니다. 일반적이고 지연에 민감한 추론은 종량제 모델로 라우팅하고, 과학적 배치 작업은 직접 실행하는 모델에 남겨 두며, 어느 한쪽의 엔드포인트가 비정상일 때 자동 장애 조치가 보호해 주도록 하세요. 두 모델 사이의 경계는 두 번째 통합이 아니라 라우팅 규칙이 됩니다.

A generated two-column scoreboard titled Intern-S2-397B vs Grok 4.6 — the scoreboard. Left column Intern-S2-397B: Weights Apache-2.0 open; Reasoning control toggle plus full weight control; Inputs text, image, time series; Context 256K text / 64K multimodal; Independent score none yet; TerminalBench 2.1 64.04 vendor-reported. Right column Grok 4.6: Weights closed API only; Reasoning control effort dial; Inputs text, image, file; Context 500K tokens; Independent score AA Index 44, GPQA 94.9; TerminalBench 2.1 80.3 per Artificial Analysis. Footer reads Intern-S2-397B figures are InternLM's own, unreproduced; Grok 4.6 figures per Artificial Analysis and the vendor.

어느 걸 고를까?

일반적인 작업이고, 추론이 빠르고 정확하게 돌아와야 하며, 그 결과를 만들어 내는 스택을 직접 떠안고 싶지 않다면 Grok 4.6을 선택하세요. 500K 윈도우, 측정된 GPQA Diamond 94.9, 그리고 도구 모음은 모두 프로덕션 기능이며, $2/$6 요금제는 아무것도 운영하지 않는 대가로 지불하는 비용입니다.

입력이 과학적일 때 — 그림이 빽빽한 논문, 분자 다이어그램, 시계열 신호 — 그리고 추론이 당신의 환경을 떠날 수 없는 데이터에서, 또는 직접 파인튜닝하고 싶은 동작에서 이루어져야 할 때 Intern-S2-397B를 선택하세요. Apache-2.0이 그것을 가능하게 합니다; 임대 API는 어느 것도 그러지 못합니다. 하드웨어 예산을 잡아두고, 한동안 독립적인 스코어보드는 없을 것으로 예상하며, InternLM 외부의 누군가가 숫자 하나를 재현하기 전까지는 그 카드에 적힌 모든 숫자를 주장으로 취급하세요.

A screenshot of the Hugging Face model card for internlm/Intern-S2, captured September 13, 2026, showing the Apache-2.0 licence, the description of Intern-S2-397B as a 403-billion-parameter multimodal foundation model for scientific intelligence and long-horizon agents, and the note that text reasoning benchmarks use a 256K inference length while multimodal benchmarks use 64K.A screenshot of the OrcaRouter model page for Grok 4.6 at orcarouter.ai/models/grok/grok-4.6, captured September 13, 2026, showing the model listing with its provider SpaceXAI, 500,000-token context window, and $2.00 / $6.00 per-million-token pricing displayed alongside the surrounding catalogue.