
5단계 미리 보기 vs Intern-S2 Mobius: 600B 플래그십이 필요하신가요, 아니면 빠른 35B 리즈너가 필요하신가요?
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 113 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 52 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 423 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 62 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 399 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 230 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
를 비교하는 솔직한 이유는Step 5 Preview와 Intern-S2 Mobius 이 둘이 비슷하기 때문이 아니다. 같은 구매자, 즉 추론 워크로드를 돌려야 하지만 클러스터를 살 생각은 없는 팀이 던진 서로 다른 두 질문에 대한 답이기 때문이다. StepFun의 Step 5 Preview는 2026년 9월 20일 발표된 큰 답이다. 대략 총 6,000억 개 파라미터에 27억 개 활성, 100만 토큰 컨텍스트, 독립적으로 측정된 Artificial Analysis Intelligence Index 점수 44, 그리고 백만 입력 토큰당 $1.00, 백만 출력 토큰당 $2.70의 공개 가격을 갖는다. InternLM의 Intern-S2 Mobius는 2026년 7월 29일 출시된 작은 답이다. Mobius-v0 아키텍처를 기반으로 Qwen3.5-35B에서 지속 사전학습한 350억 개 파라미터 오픈 웨이트 모델이며, 핵심 주장은 성능이 아니라 속도다. 즉 학습 기반이 된 베이스라인 대비 추론 벤치마크에서 대략 4배의 엔드투엔드 속도 향상을 보이며, 어떤 종류의 독립 벤치마크 점수도 없다. 하나는 당신이 빌리는 플래그십이고, 다른 하나는 당신이 실행하는 작은 모델이다. 이 비교의 진짜 쟁점은 당신 앞에 놓인 워크로드가 과연 플래그십을 정당화하느냐이다.
숫자를 다루기 전에 꼭 짚고 넘어갈 것이 있습니다. 사람들의 실제 시간을 잡아먹기 때문입니다. InternLM은 Intern-S2라는 이름 아래 여러 모델을 출시했는데, 이들은 서로 같은 것이 아닙니다. Intern-S2-397B는 과학 멀티모달 플래그십이고, Intern-S2 Mobius는 여기서 논의하는 35B 효율적 추론 모델이며, 이전 Intern-S2 릴리스는 또 다른 별개의 모델입니다. "Intern-S2"를 검색하다가 397B 모델의 벤치마크 표에 도착했다면, 당신은 다른 체크포인트에 관한 글을 읽고 있는 것입니다.
각 모델이 실제로 주장하는 것
Step 5 Preview의 주장은 2026년 플래그십에 일반적인 것들이며, 그중 하나는 독립적으로 검증된다. StepFun은 총 600B 파라미터에 27B 활성, 텍스트 및 이미지 입력, 1M 토큰 컨텍스트 윈도우, 그리고 백만 입력 및 출력 토큰당 $1.00/$2.70의 가격을 명시한다. Artificial Analysis는 이를 자사의 Intelligence Index에서 44로 측정하는데, 이는 비교 모델 중앙값 26보다 높으며, 출력은 초당 87 토큰으로 평균 78을 상회하고, 인덱스 작업 모음 전반에서 약 1억 6천만 개의 출력 토큰이 생성되어 중앙값 8,200만의 약 두 배에 달한다. 이는 일반적인 장황한 출력량의 약 두 배로, 출력 기준 과금 모델에서는 중요한 점이다.
Intern-S2 Mobius의 주장은 아키텍처에 관한 것이며 범위가 더 좁습니다. 그 설계는 지식을 연산으로부터 분리합니다. 전역적으로 공유되는 Memory가 지식 벡터를 보관하고, 여러 Reasoner가 기존 트랜스포머처럼 저장과 연산을 계층별로 묶어두는 대신 그 Memory를 상대로 은닉 상태를 반복적으로 질의하고 정제합니다. InternLM이 제시한 성과는 자사의 뿌리인 Qwen3.5-35B 대비 추론 벤치마크에서 대략 4배의 종단 간 속도 향상이며, 추론 점수는 비슷하거나 더 강하고, 눈에 보이는 사고 연쇄는 더 짧습니다. 이 모델은 Apache 2.0이고, 텍스트와 이미지 입력을 지원하며, 다운로드할 수 있습니다.
• 규모 — Step 5 Preview: StepFun 기준 총 약 600B, 활성 27B vs Intern-S2 Mobius: 총 35B.
• 독립 점수 — Step 5 Preview: Artificial Analysis Intelligence Index에서 44점, Intern-S2 Mobius: 제3자가 공개한 점수 없음.
• 속도 — Step 5 Preview: 인덱스 보드가 Intern-S2 Mobius와 비교해 측정한 결과, 평균 78개 대비 초당 출력 토큰 87개; 자체 Qwen3.5-35B 기준선 대비 "거의 4배", 공급업체 보고이며 재현되지 않음.
• 컨텍스트 윈도우 — Step 5 Preview: StepFun 기준 1M 토큰 vs Intern-S2 Mobius: 독립적인 컨텍스트 수치 미공개.
• 가격 — Step 5 프리뷰: 백만 토큰당 $1.00 입력 / $2.70 출력 vs Intern-S2 Mobius: API 가격 없음; 하드웨어 비용을 지불합니다.
• 라이선스 및 접근성 — Step 5 Preview: 벤더 API를 통한 비공개 프리뷰, BF16 가중치는 2026년 10월 15일 예정 vs Intern-S2 Mobius: Apache 2.0 가중치 현재 제공 중.
• 장황함 — Step 5 Preview: 인덱스 스위트 전반에서 약 1억 6,000만 개의 출력 토큰으로, 중앙값 8,200만 개와 대비됨. 인덱스 보드 기준 Intern-S2 Mobius 대비: InternLM이 주장하는 더 짧은 가시적 추론 흔적, 다른 누구도 측정하지 않음.
4배라는 주장, 그리고 그것이 왜 여기서 흥미로운 숫자인지
두 벤더의 수치를 나란히 놓고 보면 불일치가 명백하다: StepFun의 대표 수치는 역량 점수이고, InternLM의 것은 처리량 배수다. 이는 우연이 아니며, 이 비교에서 가장 유용한 지점이다. 추론 작업에서의 4배 엔드투엔드 속도 향상은, 다른 누군가의 하네스와 맞닥뜨려도 살아남는다면, 지수상의 몇 점보다 대규모 배포에 더 가치가 있다 — 그것은 해당 워크로드를 애초에 돌리는 일의 셈법 자체를 바꾼다. Intern-S2 Mobius는 병목이 역량의 상한이 아니라 달러당 초당 토큰인 팀들을 겨냥하고 있다.
주의할 점은 그 배수가 Qwen3.5-35B를 기준으로 측정되었다는 것입니다. Qwen3.5-35B는 Intern-S2 Mobius가 continual pretraining을 시작한 모델이며, Mobius 학습을 거친 적이 없습니다. 이는 경쟁 모델과의 비교가 아니라 자체 출발점과의 비교입니다. 처리량 주장에 대한 독립적 재현도, 제3자 지수 점수도, 벤더 외 누구도 공개한 컨텍스트 윈도도 없습니다. "거의 4배"를 사양으로 취급하지 말고, 흥미로운 아키텍처 신호이자 여러분 자신의 하네스에서 테스트할 가설로 취급하십시오.
스텝 5 프리뷰는 정반대의 증거 프로파일을 가진다. 능력 수치는 독립적으로 측정되며, 효율성 이야기가 약한 부분이다. 인덱스 보드의 장황함 판독값 — 중앙값 모델이 약 8,200만 개를 출력하는 데 비해 약 1억 6,000만 개의 출력 토큰 — 은 2.70달러의 출력 가격에 대한 솔직한 상쇄 요인이며, 이는 긴 구조화 생성을 많이 쓰는 워크로드가 표시 가격이 시사하는 것보다 실질적으로 더 많이 지출하게 된다는 뜻이다. 그것이 Intern-S2 Mobius에는 없지만 가진 것은 공개된 API 가격이며, 바로 이 점이 애초에 비교를 가능하게 만든다.
약속된 벤더 빌드를 위한 Hugging Face 저장소는 이야기의 나머지 절반을 말해준다: 이것이 바로 발표되었지만 아직 출시되지 않은 오픈 웨이트 릴리스의 모습이다.

풋프린트 문제가 실제로 타격을 입히는 지점
Intern-S2 Mobius의 진정한 장점은 아무도 측정하지 않은 점수가 아니라, 그것에 대해 틀렸을 때 치르는 비용에 있다. 350억 개 매개변수는 팀이 이미 보유한 하드웨어에서 서빙하고, 구매 주문서 없이 평가하며, 아무것도 상각하지 않고 포기할 수 있는 규모다. 그것은 플래그십이 아무리 많은 점수를 받아도 따라잡을 수 없는 구조적 이점이며, 이 비교를 불일치라며 일축하지 않고 해 볼 가치가 있는 이유다.

플래그십의 이점은 거울상이다. Step 5 Preview의 100만 토큰 컨텍스트, 이미지 입력, 측정된 일반 추론 능력은 35B 모델이 잘 감당하기 어려운 작업을 커버하며, 무료 기간이 이어지는 동안에는 시도하는 데 비용이 들지 않는다 — 이 모델은 10월 동안 세 개의 별도 개발자 인터페이스에서 무료로 제공되어 왔다. 그 두 사실 중 어느 것도 자체 호스팅 모델에는 해당되지 않는다: 자체 GPU를 돌리기 위한 무료 주간은 없고, 그 결정을 비용 항목으로 환산해 주는 가격표도 없다.
비교가 프로모션 기간이 지난 뒤에도 살아남길 바란다면, 만들어야 할 것은 선호가 아니라 하네스입니다. OrcaRouter는 하나의 API 키와 하나의 청구서 뒤에서 200개 이상의 모델을, 0% 마크업으로 제공업체 정가를 그대로 전달하며 라우팅합니다. 그리고 자동 페일오버와 비용, 지연 시간, 역량에 따라 트래픽을 조정하는 라우팅 DSL도 갖추고 있습니다. Step 5 Preview도 Intern-S2 Mobius도 그 카탈로그에는 없습니다 — StepFun의 플래그십은 우리가 라우팅하지 않고, Intern-S2 Mobius는 자체 호스팅 다운로드입니다 — 따라서 여기서의 가치는 둘 중 어느 것에 대한 접근성이 아닙니다. 가치는 여러분이 이들과 비교 벤치마크하게 될 모델들이 키 하나만큼 가까이 있다는 것, 그리고 측정으로 내린 결정은 출시 블로그 포스트가 아니라 증거를 따라 움직인다는 점입니다.

결정하는 방법
워크로드가 에이전트형, 멀티모달, 롱컨텍스트 또는 개방형이라면 — 미리 작업을 열거할 수 없는 유형이라면 — 플래그십이 답이고, Step 5 Preview는 그 합리적인 인스턴스입니다: 측정되고, 가격이 매겨져 있으며, 파일럿하기 저렴하고, 토큰 단위로 되돌릴 수 있습니다. 대표 요금이 아니라 장황함에 예산을 잡으세요.
귀하의 워크로드가 귀하의 경계 안에 남아 있어야 하는 데이터를 대상으로 하는, 범위가 좁고 반복적이며 대용량인 추론 작업이라면, 소형 모델이 답입니다. 그리고 Intern-S2 Mobius는 바로 작기 때문에 진정한 후보입니다: 이미 보유한 하드웨어에서 실행되고, Apache 2.0이며, 속도 주장은 그것이 사실이라면 단위 경제성 문제를 결정짓는 종류의 것입니다. 다른 사람의 결론을 물려받는 것이 아니라 공급업체의 주장을 시험하고 있다는 점을 알고 시작하세요.
실수는 그 선택을 영구적인 것으로 취급하는 것이다. 소형 모델의 평가를 먼저 구매하라, 그것이 저렴한 실험이기 때문이다; 소형 모델이 실패하는 작업에는 플래그십을 임대하라, 그것이 저렴한 수선이기 때문이다. 두 옵션을 같은 키와 같은 하네스에서 모두 살려 두는 팀은 결국 자기 데이터로 이 결정을 내리게 되며, 그것이 어느 벤더가 후속 모델을 출시하든 견디는 유일한 버전이다.
