'Step 5 Preview vs Intern-S2 Mobius'라는 제목과 '임대해서 쓰는 600B 플래그십인가, 직접 실행하는 35B 추론 모델인가'라는 부제가 달린 2열 비교 카드가 생성되었습니다. 왼쪽 카드 'Step 5 Preview'에는 다음과 같이 적혀 있습니다: AA Index 44(측정됨); 총 약 600B / 활성 27B; 컨텍스트 1M 토큰; 1M당 입력 $1.00 / 출력 $2.70; 비공개 프리뷰 API; 가중치 2026년 10월 15일 공개 예정. 오른쪽 카드 'Intern-S2 Mobius'에는 다음과 같이 적혀 있습니다: 독립 점수 없음; 35B 파라미터; 컨텍스트 미공개; API 가격 없음, 자체 호스팅; Apache 2.0 지금 이용 가능; 약 4배 속도 향상 주장, 미재현. 하단에는 'Step 5 Preview 수치는 StepFun 및 Artificial Analysis 기준; Intern-S2 Mobius 수치는 InternLM의 주장이며 미재현.'이라고 적혀 있습니다.
Engineering & Research

5단계 미리 보기 vs Intern-S2 Mobius: 600B 플래그십이 필요하신가요, 아니면 빠른 35B 리즈너가 필요하신가요?

작성자

Magnus Corvin

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

를 비교하는 솔직한 이유는Step 5 Preview와 Intern-S2 Mobius 이 둘이 비슷하기 때문이 아니다. 같은 구매자, 즉 추론 워크로드를 돌려야 하지만 클러스터를 살 생각은 없는 팀이 던진 서로 다른 두 질문에 대한 답이기 때문이다. StepFun의 Step 5 Preview는 2026년 9월 20일 발표된 큰 답이다. 대략 총 6,000억 개 파라미터에 27억 개 활성, 100만 토큰 컨텍스트, 독립적으로 측정된 Artificial Analysis Intelligence Index 점수 44, 그리고 백만 입력 토큰당 $1.00, 백만 출력 토큰당 $2.70의 공개 가격을 갖는다. InternLM의 Intern-S2 Mobius는 2026년 7월 29일 출시된 작은 답이다. Mobius-v0 아키텍처를 기반으로 Qwen3.5-35B에서 지속 사전학습한 350억 개 파라미터 오픈 웨이트 모델이며, 핵심 주장은 성능이 아니라 속도다. 즉 학습 기반이 된 베이스라인 대비 추론 벤치마크에서 대략 4배의 엔드투엔드 속도 향상을 보이며, 어떤 종류의 독립 벤치마크 점수도 없다. 하나는 당신이 빌리는 플래그십이고, 다른 하나는 당신이 실행하는 작은 모델이다. 이 비교의 진짜 쟁점은 당신 앞에 놓인 워크로드가 과연 플래그십을 정당화하느냐이다.

숫자를 다루기 전에 꼭 짚고 넘어갈 것이 있습니다. 사람들의 실제 시간을 잡아먹기 때문입니다. InternLM은 Intern-S2라는 이름 아래 여러 모델을 출시했는데, 이들은 서로 같은 것이 아닙니다. Intern-S2-397B는 과학 멀티모달 플래그십이고, Intern-S2 Mobius는 여기서 논의하는 35B 효율적 추론 모델이며, 이전 Intern-S2 릴리스는 또 다른 별개의 모델입니다. "Intern-S2"를 검색하다가 397B 모델의 벤치마크 표에 도착했다면, 당신은 다른 체크포인트에 관한 글을 읽고 있는 것입니다.

각 모델이 실제로 주장하는 것

Step 5 Preview의 주장은 2026년 플래그십에 일반적인 것들이며, 그중 하나는 독립적으로 검증된다. StepFun은 총 600B 파라미터에 27B 활성, 텍스트 및 이미지 입력, 1M 토큰 컨텍스트 윈도우, 그리고 백만 입력 및 출력 토큰당 $1.00/$2.70의 가격을 명시한다. Artificial Analysis는 이를 자사의 Intelligence Index에서 44로 측정하는데, 이는 비교 모델 중앙값 26보다 높으며, 출력은 초당 87 토큰으로 평균 78을 상회하고, 인덱스 작업 모음 전반에서 약 1억 6천만 개의 출력 토큰이 생성되어 중앙값 8,200만의 약 두 배에 달한다. 이는 일반적인 장황한 출력량의 약 두 배로, 출력 기준 과금 모델에서는 중요한 점이다.

Intern-S2 Mobius의 주장은 아키텍처에 관한 것이며 범위가 더 좁습니다. 그 설계는 지식을 연산으로부터 분리합니다. 전역적으로 공유되는 Memory가 지식 벡터를 보관하고, 여러 Reasoner가 기존 트랜스포머처럼 저장과 연산을 계층별로 묶어두는 대신 그 Memory를 상대로 은닉 상태를 반복적으로 질의하고 정제합니다. InternLM이 제시한 성과는 자사의 뿌리인 Qwen3.5-35B 대비 추론 벤치마크에서 대략 4배의 종단 간 속도 향상이며, 추론 점수는 비슷하거나 더 강하고, 눈에 보이는 사고 연쇄는 더 짧습니다. 이 모델은 Apache 2.0이고, 텍스트와 이미지 입력을 지원하며, 다운로드할 수 있습니다.

• 규모 — Step 5 Preview: StepFun 기준 총 약 600B, 활성 27B vs Intern-S2 Mobius: 총 35B.

• 독립 점수 — Step 5 Preview: Artificial Analysis Intelligence Index에서 44점, Intern-S2 Mobius: 제3자가 공개한 점수 없음.

• 속도 — Step 5 Preview: 인덱스 보드가 Intern-S2 Mobius와 비교해 측정한 결과, 평균 78개 대비 초당 출력 토큰 87개; 자체 Qwen3.5-35B 기준선 대비 "거의 4배", 공급업체 보고이며 재현되지 않음.

• 컨텍스트 윈도우 — Step 5 Preview: StepFun 기준 1M 토큰 vs Intern-S2 Mobius: 독립적인 컨텍스트 수치 미공개.

• 가격 — Step 5 프리뷰: 백만 토큰당 $1.00 입력 / $2.70 출력 vs Intern-S2 Mobius: API 가격 없음; 하드웨어 비용을 지불합니다.

• 라이선스 및 접근성 — Step 5 Preview: 벤더 API를 통한 비공개 프리뷰, BF16 가중치는 2026년 10월 15일 예정 vs Intern-S2 Mobius: Apache 2.0 가중치 현재 제공 중.

• 장황함 — Step 5 Preview: 인덱스 스위트 전반에서 약 1억 6,000만 개의 출력 토큰으로, 중앙값 8,200만 개와 대비됨. 인덱스 보드 기준 Intern-S2 Mobius 대비: InternLM이 주장하는 더 짧은 가시적 추론 흔적, 다른 누구도 측정하지 않음.

4배라는 주장, 그리고 그것이 왜 여기서 흥미로운 숫자인지

두 벤더의 수치를 나란히 놓고 보면 불일치가 명백하다: StepFun의 대표 수치는 역량 점수이고, InternLM의 것은 처리량 배수다. 이는 우연이 아니며, 이 비교에서 가장 유용한 지점이다. 추론 작업에서의 4배 엔드투엔드 속도 향상은, 다른 누군가의 하네스와 맞닥뜨려도 살아남는다면, 지수상의 몇 점보다 대규모 배포에 더 가치가 있다 — 그것은 해당 워크로드를 애초에 돌리는 일의 셈법 자체를 바꾼다. Intern-S2 Mobius는 병목이 역량의 상한이 아니라 달러당 초당 토큰인 팀들을 겨냥하고 있다.

주의할 점은 그 배수가 Qwen3.5-35B를 기준으로 측정되었다는 것입니다. Qwen3.5-35B는 Intern-S2 Mobius가 continual pretraining을 시작한 모델이며, Mobius 학습을 거친 적이 없습니다. 이는 경쟁 모델과의 비교가 아니라 자체 출발점과의 비교입니다. 처리량 주장에 대한 독립적 재현도, 제3자 지수 점수도, 벤더 외 누구도 공개한 컨텍스트 윈도도 없습니다. "거의 4배"를 사양으로 취급하지 말고, 흥미로운 아키텍처 신호이자 여러분 자신의 하네스에서 테스트할 가설로 취급하십시오.

스텝 5 프리뷰는 정반대의 증거 프로파일을 가진다. 능력 수치는 독립적으로 측정되며, 효율성 이야기가 약한 부분이다. 인덱스 보드의 장황함 판독값 — 중앙값 모델이 약 8,200만 개를 출력하는 데 비해 약 1억 6,000만 개의 출력 토큰 — 은 2.70달러의 출력 가격에 대한 솔직한 상쇄 요인이며, 이는 긴 구조화 생성을 많이 쓰는 워크로드가 표시 가격이 시사하는 것보다 실질적으로 더 많이 지출하게 된다는 뜻이다. 그것이 Intern-S2 Mobius에는 없지만 가진 것은 공개된 API 가격이며, 바로 이 점이 애초에 비교를 가능하게 만든다.

약속된 벤더 빌드를 위한 Hugging Face 저장소는 이야기의 나머지 절반을 말해준다: 이것이 바로 발표되었지만 아직 출시되지 않은 오픈 웨이트 릴리스의 모습이다.

Generated two-column scoreboard card titled 'Step 5 Preview vs Intern-S2 Mobius - the scoreboard'. The left column gives Step 5 Preview a speed of 87 output tokens per second against a 78 average, about 160M output tokens against an 82M median, text and image input, closed preview weights, and best-for open-ended, long-context and multimodal work. The right column gives Intern-S2 Mobius a claimed speed of about 4x faster than its own Qwen3.5-35B baseline, shorter reasoning traces claimed, text and image input, Apache 2.0 weights, and best-for narrow high-volume reasoning inside your own perimeter. A footer reads 'Speed and verbosity on the left are third-party measurements; every figure on the right is the vendor's own and unreproduced.'

풋프린트 문제가 실제로 타격을 입히는 지점

Intern-S2 Mobius의 진정한 장점은 아무도 측정하지 않은 점수가 아니라, 그것에 대해 틀렸을 때 치르는 비용에 있다. 350억 개 매개변수는 팀이 이미 보유한 하드웨어에서 서빙하고, 구매 주문서 없이 평가하며, 아무것도 상각하지 않고 포기할 수 있는 규모다. 그것은 플래그십이 아무리 많은 점수를 받아도 따라잡을 수 없는 구조적 이점이며, 이 비교를 불일치라며 일축하지 않고 해 볼 가치가 있는 이유다.

Screenshot of the Hugging Face repository page for stepfun-ai/Step-5-Preview-BF16, the vendor placeholder for the promised open-weight build of Step 5 Preview, showing the repository shell with no model card, no configuration, no licence terms and no tensor files.

플래그십의 이점은 거울상이다. Step 5 Preview의 100만 토큰 컨텍스트, 이미지 입력, 측정된 일반 추론 능력은 35B 모델이 잘 감당하기 어려운 작업을 커버하며, 무료 기간이 이어지는 동안에는 시도하는 데 비용이 들지 않는다 — 이 모델은 10월 동안 세 개의 별도 개발자 인터페이스에서 무료로 제공되어 왔다. 그 두 사실 중 어느 것도 자체 호스팅 모델에는 해당되지 않는다: 자체 GPU를 돌리기 위한 무료 주간은 없고, 그 결정을 비용 항목으로 환산해 주는 가격표도 없다.

비교가 프로모션 기간이 지난 뒤에도 살아남길 바란다면, 만들어야 할 것은 선호가 아니라 하네스입니다. OrcaRouter는 하나의 API 키와 하나의 청구서 뒤에서 200개 이상의 모델을, 0% 마크업으로 제공업체 정가를 그대로 전달하며 라우팅합니다. 그리고 자동 페일오버와 비용, 지연 시간, 역량에 따라 트래픽을 조정하는 라우팅 DSL도 갖추고 있습니다. Step 5 Preview도 Intern-S2 Mobius도 그 카탈로그에는 없습니다 — StepFun의 플래그십은 우리가 라우팅하지 않고, Intern-S2 Mobius는 자체 호스팅 다운로드입니다 — 따라서 여기서의 가치는 둘 중 어느 것에 대한 접근성이 아닙니다. 가치는 여러분이 이들과 비교 벤치마크하게 될 모델들이 키 하나만큼 가까이 있다는 것, 그리고 측정으로 내린 결정은 출시 블로그 포스트가 아니라 증거를 따라 움직인다는 점입니다.

Screenshot of the OrcaRouter models page at www.orcarouter.ai/models, showing 207 models from 16 providers behind one API key and one bill, with filters for input modalities, context length, input price, status, series and supported parameters, and a credits panel.

결정하는 방법

워크로드가 에이전트형, 멀티모달, 롱컨텍스트 또는 개방형이라면 — 미리 작업을 열거할 수 없는 유형이라면 — 플래그십이 답이고, Step 5 Preview는 그 합리적인 인스턴스입니다: 측정되고, 가격이 매겨져 있으며, 파일럿하기 저렴하고, 토큰 단위로 되돌릴 수 있습니다. 대표 요금이 아니라 장황함에 예산을 잡으세요.

귀하의 워크로드가 귀하의 경계 안에 남아 있어야 하는 데이터를 대상으로 하는, 범위가 좁고 반복적이며 대용량인 추론 작업이라면, 소형 모델이 답입니다. 그리고 Intern-S2 Mobius는 바로 작기 때문에 진정한 후보입니다: 이미 보유한 하드웨어에서 실행되고, Apache 2.0이며, 속도 주장은 그것이 사실이라면 단위 경제성 문제를 결정짓는 종류의 것입니다. 다른 사람의 결론을 물려받는 것이 아니라 공급업체의 주장을 시험하고 있다는 점을 알고 시작하세요.

실수는 그 선택을 영구적인 것으로 취급하는 것이다. 소형 모델의 평가를 먼저 구매하라, 그것이 저렴한 실험이기 때문이다; 소형 모델이 실패하는 작업에는 플래그십을 임대하라, 그것이 저렴한 수선이기 때문이다. 두 옵션을 같은 키와 같은 하네스에서 모두 살려 두는 팀은 결국 자기 데이터로 이 결정을 내리게 되며, 그것이 어느 벤더가 후속 모델을 출시하든 견디는 유일한 버전이다.