Intern-S2-Mobius-1
Engineering & Research

Intern-S2-Mobius: 지식과 추론을 분리하는 35B 모델

작성자

Jim Song

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

상하이 AI 연구소의 InternLM 팀이 조용히 공개한 것,Intern-S2-Mobius는 35B 규모의 오픈 가중치 파운데이션 모델로서, 출시된 다른 모델 중 거의 아무도 하지 않는 일을 합니다: 지식을 레이어 내부에 저장하지 않습니다. 표준 Transformer 구조 — 각 레이어가 기억된 사실로 가득한 자체 피드포워드 블록을 지니는 구조 — 대신에, Mobius는 모든 지식을 하나의 전역 공유 메모리로 끌어내고 소수의 Reasoner가 이를 반복적으로 질의하도록 합니다. 주장되는 이득은 더 높은 벤치마크 점수가 아닙니다. 그것은 속도입니다: 동일한 답변을 추론 토큰의 약 1/3에서 1/5 만으로 생성하며, 요청 처리량은 최대 4.6배입니다. 이 가이드는 Mobius가 실제로 무엇인지, 구성 파일이 모델 카드에서는 드러나지 않는 것을 드러내는지, 공개된 벤치마크가 줄 단위로 보여주는 내용 — 패배한 두 행을 포함하여 — "4배 빠름" 주장이 성립하는 곳과 효력을 잃는 곳, 그리고 현실적으로 누가 관심을 가져야 하는지를 설명합니다.

정확성 참고 사항: 아래의 모든 수치는 InternLM 자체 모델 카드, 공개된 성능 및 효율성 수치, 배포 가이드, 그리고 Hugging Face의 모델 구성 파일에서 가져온 것입니다. 현재 시점에서 Intern-S2-Mobius에 대한 독립적인 제3자 평가는 없습니다. 이 모델은 어떤 독립 리더보드에도 등재되어 있지 않고, 어떤 추론 제공업체에도 배포되지 않았으며, 다운로드 카운터는 여전히 0입니다. 누군가 그 수치를 재현하기 전까지 모든 비교 수치는 공급업체가 보고한 것으로 간주하세요. 이렇게 새로운 모델의 사양과 코드는 빠르게 변경되므로, 구축 전에 검증하십시오.

TL;DR. Intern-S2-Mobius는 35B 파라미터, Apache 2.0 라이선스의 멀티모달 파운데이션 모델로, Qwen3.5-35B에서 지속 사전학습된 후 SFT와 강화학습으로 후속 학습되었다. 혁신성은 아키텍처에 있다. Mobius-v0 설계는 계층에 묶인 피드포워드 지식 저장소를 2,560개 전문가로 구성된 단일 전역 공유 메모리로 대체하며, 이 메모리는 자신의 깊이 밖의 지식에도 도달할 수 있는 4개의 적층 Reasoner 블록(역방향 잔차 연결)이 질의하고, 디코딩 전에 순환 잠재 반복을 통해 은닉 상태를 정제한다(동적 잠재 추론). InternLM 자체 평가에서 이 모델은 기반이 된 Qwen3.5-35B 베이스라인을 9개 일반 벤치마크 중 7개에서 능가하며(평균 67.88 대 65.05), 과학 과제에서는 압도적인 차이로 이긴다(52.14 대 18.20). 또한 평균 약 1.5배 더 짧은 추론 경로를 생성한다 — MMLU Pro에서는 4.6배, GPQA Diamond에서는 5.0배 더 짧다. 처리량 향상은 바로 이 경로 압축에서 비롯된다: 배치 16에서 2.9배, 배치 256에서는 4.6배까지 증가한다. 단점도 분명하다. 가장 어려운 두 추론 벤치마크(HLE와 UGD hard)에서는 지며, 처리량 이점은 경쟁 수학 문제에서는 대부분 사라지고, 연구실 밖에서는 아무도 이를 검증하지 못했다.

주요 시사점

• 아키텍처 우선 릴리스: Mobius-v0는 지식 벡터와 추론 연산자를 분리합니다 — 40개의 레이어가 각자 자신의 FFN 지식을 보유하는 대신, 2,560명의 전문가가 공유하는 단일 메모리가 4개의 Reasoner 블록을 제공합니다.

효율성, 즉 지능이 아니라 효율성이 핵심입니다. 평균 출력 길이는 약 1.5배 감소하고, 요청 처리량은 Transformer 베이스라인 대비 배치 16에서 2.9배, 배치 256에서 4.6배 증가합니다.

• 이는 실제로 자체 기본 모델을 능가합니다: 일반 작업에서 평균 67.88 대 65.05를 기록했으며, MMLU Pro(89.05 대 85.31), AIME 2026(95.31 대 92.08), HMMT 2026(85.51 대 78.50)에서도 승리했습니다.

하지만 숙고가 가장 중요한 경우에는 패배합니다: HLE 19.11 대 22.40, UGD hard 73.02 대 78.02 — 이 세트에서 가장 어려운 두 평가는 모두 일반 Transformer가 승리했습니다.

• 과학 점프가 가장 큰 단일 결과입니다: Biology-Instructions 51.40 vs 3.77, Mol-Instructions 45.73 vs 21.70, MolecularIQ 59.29 vs 29.13.

• 오픈되었지만 사용할 수 없음: Apache 2.0 가중치가 Hugging Face에 있고, 이를 호스팅하는 추론 제공자가 없습니다. 약 73GB의 bfloat16 가중치로, 현재 실행하려면 자체 호스팅이 유일한 방법입니다.

Intern-S2-Mobius가 실제로 무엇인지

Intern-S2-Mobius는 상하이 AI 연구소의 Intern 시리즈를 배후에 둔 Hugging Face 조직인 internlm이 공개한 35B 규모의 기반 모델입니다. 가중치는 2026년 7월 29일 Hugging Face에 공개되었으며, 관련 GitHub 저장소(README, 배포 가이드, 전체 기술 보고서 PDF)는 2026년 8월 5일에 공개되었습니다. 이 모델은 Apache 2.0 라이선스로 배포되며, 이는 오픈 가중치로서 매우 허용적인 조건에 해당합니다. 상업적 이용, 수정, 재배포가 모두 허용됩니다.

이것은 파인튜닝이 아닙니다. 이것은 아키텍처 수술을 통한 지속적 사전 학습입니다. InternLM은 알리바바의 오픈 가중치 35B mixture-of-experts 모델인 Qwen3.5-35B(2026년 3월 4일 출시)를 가져와 모델이 지식을 저장하고 접근하는 방식을 재구성하고, 그 결과물을 계속 사전 학습한 다음, 그 위에 지도 파인튜닝과 강화 학습을 적용했습니다. 이러한 계보는 벤치마크를 해석하는 데 중요합니다. InternLM이 발표하는 모든 비교는 Mobius와 그것이 파생된 바로 그 모델을 대조한 것이며, 이는 아키텍처 변경에 대한 가장 깨끗한 절제 실험일 뿐만 아니라, 편리하게도 Mobius를 가장 돋보이게 할 가능성이 높은 비교입니다.

이 모델은 멀티모달입니다. Hugging Face는 이를 image-text-to-text로 분류하며, 구성(configuration)을 보면 완전한 비전 인코더와 비디오 토큰 처리가 포함되어 있음을 확인할 수 있습니다. 또한 가중치와 함께 제공되는 파일들로 미루어 보면, 이 모델은 전적으로 과학을 겨냥하고 있습니다 — 자세한 내용은 아래에서 다룹니다.

뫼비우스 아키텍처, 쉽게 설명하면

일반적인 Transformer는 모든 계층에서 두 가지 작업을 번갈아 수행합니다. 어텐션은 토큰 간에 정보를 이동시키고, 피드포워드 네트워크(또는 mixture-of-experts 모델에서는 전문가 FFN들의 뱅크)는 지식을 저장합니다. FFN이 계층 내부에 있기 때문에, 그것이 보유한 지식은 해당 깊이에서만 접근할 수 있습니다. 계층 30에서 학습된 사실은 계층 5에서 일어나는 추론에 사용될 수 없습니다. 정보는 계층별로 앞으로만 흐르며, 그것이 유일한 경로입니다.

Mobius는 그 결속을 깨뜨린다. InternLM은 세 가지 결과를 설명한다.

지식-추론 분리. 계층에 묶인 FFN 저장소는 전역적으로 공유되는 Memory로 대체된다. 40개의 계층이 각각 모델 지식의 일부를 보유하는 대신, 모든 추론 단계가 접근할 수 있는 하나의 풀이 있다. InternLM은 이것이 지식 압축을 개선한다고 주장한다. 즉, 동일한 사실을 여러 깊이에서 중복적으로 재학습할 필요가 없어지며, 각 Reasoner는 단일 계층의 FFN이 제공할 수 있는 것보다 훨씬 더 넓은 지식 공간을 확보하게 된다.

역방향 잔차 연결.Memory가 공유되므로, 얕은 추론 단계와 깊은 추론 단계 모두 동일한 저장소에 도달한다. 지식 접근은 더 이상 엄격하게 순방향으로 흐르지 않는다. 얕은 단계는 표준 스택에서는 삼십 개 층 뒤에야 사용할 수 있었던 무언가를 끌어올 수 있다. InternLM의 주장은 다음과 같다: 이것이 모델로 하여금 깊이를 가로질러 지식을 더 유연하게 구성하게 하고, 결정적으로, 더 적은 추론 단계로 유용한 정보를 합성하게 한다. 그 마지막 절이 이번 릴리스의 핵심 주제이다.

동적 잠재 추론. 모든 사고 단계를 가시적인 사고 사슬 토큰으로 외부화하는 대신, Mobius는 무엇이든 디코딩하기 전에 순환적 잠재 반복을 통해 연속적인 은닉 상태를 정제합니다. '생각'의 일부는 생성된 텍스트가 아닌 모델의 내부 표현 공간에서 이루어지며, 그러한 내부 연산의 양은 토큰마다 동적으로 할당됩니다. 실질적인 효과는 모델이 동일한 결론에 도달하기 위해 더 적은 단어를 작성하면 된다는 것입니다. 생성은 자기회귀적이고 직렬화되어 있기 때문에, 더 적은 단어를 작성하는 것이 추론 모델을 더 빠르게 만드는 가장 직접적인 방법입니다.

종합하면, 핵심은 더 많이 생각하고 더 적게 타이핑하는 추론 모델입니다.

Intern-S2-Mobius-2

구성 파일이 드러내는 것

모델 카드는 아키텍처를 산문으로 설명합니다. code>config.json/code>은 이를 구체화하며, 알아둘 만한 몇 가지 숫자를 포함합니다.

40개 레이어에 걸친 4개의 Reasoner.텍스트 설정은 40개의 히든 레이어를 선언하지만 블록은 4개뿐입니다. 40개의 레이어는 40개의 독립적인 지식+어텐션 유닛이 아니라, 공유 Memory를 대상으로 반복 실행되는 4개의 Reasoner 스테이지로 구성됩니다.

2,560명의 전문가. 이것은 공유 Memory를 문자 그대로 구현한 것입니다. Mobius는 토큰당 8개의 전문가가 활성화되고, 전문가당 중간 크기가 512로 매우 작은 2,560개의 전문가와 하나의 공유 전문가를 보유합니다. 규모를 비교하자면, 자매 모델인 Intern-S2-Preview는 256개의 전문가를 사용합니다. 훨씬 더 작은 전문가들로 구성된 10배 더 큰 풀은 "레이어별 FFN 대신 하나의 글로벌 지식 저장소"를 설정(config)으로 작성했을 때 정확히 어떤 모습인지를 보여줍니다.

박스에는 35B, 디스크에는 ~36B, 활성 파라미터는 ~3B입니다. 모델 카드에는 35B라고 표기되어 있고, Hugging Face의 safetensors 리더는 36B 파라미터로 보고하며, 가중치 인덱스는 bfloat16 기준 총 72.96GB로 대략 36.5B에 해당합니다. 배포 가이드가 가장 정확한데, 이 릴리스를 30B-A3B 모델이라고 부릅니다 — 토큰당 약 3B 파라미터가 활성화됩니다. 다른 희소 MoE와 마찬가지로 메모리에는 전체 가중치 세트를 적재해야 하지만, 토큰당 연산은 소형 모델 수준입니다.

하이브리드 어텐션, 3:1.레이어 목록은 선형 어텐션 레이어 3개마다 전체 어텐션 레이어 1개를 번갈아 배치하며, 끝까지 이어집니다. 총 40개 중 10개가 전체 어텐션 레이어입니다. 선형 어텐션은 장문맥 메모리와 연산량이 폭증하는 것을 방지하며, 주기적인 전체 어텐션 레이어는 순수 선형 어텐션이 포기하는 정확한 재현을 보존합니다. 선형 레이어는 폭 4의 컨볼루션 커널과 float32 SSM 상태를 사용하는데, 이는 현재 표준이 된 게이티드 델타 스타일 방식입니다.

256K 컨텍스트. 최대 위치 임베딩은 262,144입니다. 아키텍처가 지원하는 범위와 평가 방식 간의 차이에 유의하세요: InternLM은 텍스트 벤치마크를 128K에서 실행했고, MMLU Pro, SimpleQA, HLE에서는 64K에서 실행했습니다. 256K 상한이 곧 검증된 품질의 256K를 의미하는 것은 아닙니다.

내장된 다중 토큰 예측 헤드. 자체 256개 전문가를 갖춘 1계층 MTP 모듈이 있다. 이는 장식이 아니다. 배포 가이드에서는 MTP 추측 디코딩과 드래프트 토큰 4개로 실행할 것을 권장한다. 따라서 실제 환경의 속도 성능 일부는 아키텍처만이 아니라 추측 디코딩에서 비롯된다.

진짜 비전 타워.패치 크기 16, 2x2 공간 병합, 비디오 시간 패칭을 갖춘 27층 1152-히든 비전 인코더로, 인터리브된 멀티모달 RoPE가 적용된 2048차원 텍스트 스트림으로 투영합니다. 이미지와 비디오 입력, 텍스트 출력.

궁금한 분들을 위한 기타 세부 사항: 헤드 차원 256의 어텐션 헤드 16개, 키-값 헤드 2개(공격적인 그룹 쿼리 어텐션), 게이티드 어텐션 출력, 부분 로터리 팩터 0.25, RoPE 세타 1,000만, 251,392토큰 어휘 집합.

벤치마크, 한 줄씩

InternLM은 OpenCompass로 평가되었으며, 단일 비교 결과를 발표했습니다: 지속적 사전 학습의 기반이 된 모델인 Qwen3.5-35B와 Intern-S2-Mobius-35B를 비교한 것입니다. 일반 벤치마크 9개, 과학 벤치마크 3개가 사용되었습니다.

일반적인 작업에서 Mobius는 9개 중 7개를 이깁니다. MMLU Pro — 원래 MMLU보다 더 어려운 방해 요소를 가진 광범위한 다중 도메인 지식 — 89.05 대 85.31을 기록하여 3.7포인트 향상됐으며, 이는 이번 세트에서 가장 명확한 지식 결과입니다. GPQA Diamond, 대학원 수준의 과학 문제로, 구글 검색으로 풀 수 없게 작성된, 80.81 대 80.24로 사실상 동률입니다. IMO Bench, 올림피아드 수준의 수학으로, 81.25 대 77.50을 기록했습니다. AIME 2026, 미국 초청 수학 시험으로, 95.31 대 92.08을 기록했습니다. HMMT 2026, 하버드-MIT 수학 토너먼트로, 가장 큰 수학 격차인 85.51 대 78.50을 기록했습니다. AMO58.00 대 50.00을 기록했습니다. 그리고 SimpleQA — 단답형 사실 회상으로, 모델이 실제로 알고 있는지를 가장 직접적으로 측정하는 벤치마크 — 21.39에서 28.90으로 뛰어올라 상대적 개선율 35%를 기록했으며, 이는 InternLM의 "공유 메모리가 지식을 더 잘 압축한다"는 주장을 뒷받침하는 가장 강력한 증거입니다.

그런 다음 두 가지 손실이 있으며, 그것들이 흥미로운 행들입니다. UGD hard는 반대 방향입니다: Mobius는 73.02, 기준선은 78.02로 5점 차이의 열세입니다. 그리고 HLE — Humanity's Last Exam, 광범위하게 사용되는 가장 어려운 일반 평가로, 최첨단 모델들이 여전히 10~20점대를 기록하는 벤치마크 — 는 19.11 대 22.40입니다. 일반 Transformer가 가장 많은 추론을 요구하도록 특별히 설계된 이 벤치마크에서 3.3점 차이로 승리합니다.

그 패턴은 노이즈가 아니며, 숨겨져 있지도 않습니다. InternLM이 이를 공개했습니다. 가장 그럴듯한 해석은 잠재 추론(latent reasoning)이 곧 압축이며, 압축은 끝부분에서 손실이 발생한다는 것입니다. 숙고 과정을 연속적인 은닉 상태로 내재화하는 방식은 숙고가 검색 중심이거나 익숙한 형태를 따를 때 훌륭하게 작동합니다. 이는 MMLU Pro, SimpleQA, 그리고 대부분의 경쟁 수학 문제에 해당합니다. 진정으로 길고 탐험적이며 오류를 수정하는 사고 사슬이 필요한 문제에서는, 명시적인 토큰 단위 추적이 여전히 그 비용만한 가치가 있는 것으로 보입니다. 전체 평균인 67.88 대 65.05는 실질적인 승리이지만, 이 평균은 일률적인 개선이 아니라 일종의 교환(trade)을 숨기고 있습니다.

과학적 결과는 차원이 다른 차이를 보여줍니다. Biology-Instructions는 3.77에서 51.40으로 상승합니다. Mol-Instructions는 분자 이해와 생성을 다루며, 21.70에서 45.73으로 상승합니다. MolecularIQ는 29.13에서 59.29로 상승합니다. 평균은 18.20 대비 52.14입니다. 3.77이 51.40으로 상승하는 것과 같은 수치는 아키텍처의 성과가 아닙니다. 이는 기준 모델이 애초에 배우지 못한 과제에 대한 맞춤형 도메인 훈련의 특징입니다. Qwen3.5-35B가 Biology-Instructions에서 4% 미만의 점수를 기록한 것은 생물학에 약해서가 아니라 과제 형식을 이해하지 못했다는 뜻입니다. 이 세 개의 행을 "InternLM이 과학적 전문화를 추가했다"는 의미로 읽으십시오. 이는 진정으로 가치 있는 일이며 Intern-S 라인의 핵심입니다. 다만 그것을 Mobius 아키텍처의 덕으로 돌리지는 마십시오.

'4x faster'가 실제인 경우와 그렇지 않은 경우

효율성 주장은 이 모델이 존재하는 이유이므로 신중히 읽어볼 만하다. InternLM의 헤드라인은 "엔드투엔드 추론 속도가 약 4배 빨라졌다"는 것이다. 공개된 처리량 수치는 헤드라인보다 더 유익하고, 더 정직하다.

벤치마크 전반에 걸쳐 평균을 낸 배치 크기 대비 요청 처리량으로 측정했을 때, Mobius는 Transformer 기준선을 배치 16에서 2.9배, 배치 256에서 4.6배 능가합니다. 격차는 배치 크기가 커질수록 벌어지는데, 이는 요청당 생성되는 토큰이 적어서 얻는 이점을 고려하면 예상할 수 있는 결과입니다. 요청을 더 많이 함께 묶을수록 절약되는 디코딩 단계가 더 크게 누적되기 때문입니다. "거의 4배"라는 헤드라인은 범위의 중간값일 뿐, 상수가 아닙니다.

벤치마크별로 나누어 보면 그림이 더 선명해진다. 다음으로, MMLU ProGPQA Diamond에서는 Mobius는 모든 배치 크기에서 훨씬 더 빠릅니다 — 처리량 곡선은 즉시 갈라지며 계속 벌어집니다. 다음으로, IMO Bench에서는 일관되게, 그러나 약간의 차이로 앞섭니다. 다음으로, AIME 2026HMMT 2026에서는 기준 Transformer는 실제로 더 빠릅니다. 중간 배치 크기에서는 Mobius가 배치 256에서만 앞섭니다. 가장 어려운 경쟁 수학 문제에서는 처리량 우위가 유용한 작동 범위의 상당 부분에서 차이가 없거나 오히려 불리합니다.

왜일까요? 처리량은 트레이스 압축을 거의 완벽하게 따라가기 때문입니다. 벤치마크 전반의 평균 출력 길이는 약 20,400토큰에서 약 13,200토큰으로 약 1.5배 감소합니다. 하지만 그 평균은 엄청난 범위에 걸쳐 있습니다: MMLU Pro에서 4.6배 더 짧고 (약 1,100토큰 대 5,150토큰), 그리고 GPQA Diamond에서 5.0배 더 짧으며 (약 2,600 대 12,900), 반면에 단지 IMO Bench에서는 1.4배, AIME 2026에서는 1.5배, 그리고 HMMT 2026에서는 1.2배입니다. 모델이 사고를 압축할 수 있는 곳에서는 매우 빠릅니다. 문제가 무엇이든 24,000토큰의 유도 과정을 요구하는 곳에서는 그럴 수 없고, 대신 아키텍처의 오버헤드가 드러납니다.

실질적으로 말하면, 워크로드가 지식 검색, 객관식, 기술 Q&A 또는 분류와 같은 유형이라면 속도 향상은 크고 즉각적입니다. 워크로드가 어려운 수학적 또는 과학적 유도라면 대략 동등한 성능을 기대하되, 더 나으면 기분 좋게 놀라게 될 것입니다. 모델의 보편적 속성으로 "4x faster"를 인용하는 사람은 매우 다른 두 가지 동작의 평균을 인용하는 것입니다.

Intern-S2-Mobius-3

파일 목록에 숨어 있는 과학 스택

이번 릴리스에서 가장 잘 드러나는 것 중 하나는 모델 카드에 전혀 없습니다 — 그것은 저장소의 파일 목록에 있습니다. 일반적인 토크나이저 파일들과 함께, Intern-S2-Mobius는 세 가지 추가 도메인 토크나이저를 제공합니다: code>tokenizer_PROT.model/code>는 단백질 서열용이며, code>tokenizer_SMILES.model/code>는 SMILES 표기법의 분자 구조용이고, code>tokenizer_XNA.model/code>는 핵산 서열용입니다. 또한 저장소에는 지진 데이터의 NumPy 배열이 하나 덩그러니 있습니다.

단백질, 분자, DNA/RNA를 위한 전용 토크나이저는 함부로 추가할 수 있는 것이 아닙니다. 이는 모델이 그러한 서열 유형을 단지 문자가 들어 있는 일반 텍스트가 아니라 1급 입력으로 읽도록 훈련되었음을 뜻합니다. 이것이 바로 Biology-Instructions에서 3.77을 51.40으로 바꾸는 힘이며, Mobius를 시계열 및 비전 모달리티를 추가한 자매 모델 Intern-S2-Preview와 같은 계열에 놓이게 합니다. InternLM에 따르면 Intern-S2-Preview는 재료 결정 구조 생성 기능을 갖춘 최초의 오픈소스 모델이었습니다.

일반적인 개발자라면 이는 사소한 지식입니다. 하지만 계산생물학, 화학정보학, 또는 재료과학 분야에서 일한다면, 이 글에서 가장 중요한 문장일 수 있습니다: 이것은 SMILES와 단백질 서열을 기본적으로 이해하는, Apache-2.0 라이선스의 작은 자체 호스팅 모델입니다.

Intern 패밀리에서의 위치

Intern-S 라인은 상하이 인공지능 연구소의 과학 특화 멀티모달 시리즈입니다. Intern-S1이 포맷을 확립했고, Intern-S1-Pro는 이를 트릴리언(triillion) 파라미터급으로 확장했습니다. Mobius 출시 직전에 공개된 Intern-S2-Preview는 효율성에 초점을 맞춘 모델로, 총 36B 파라미터 중 3B만 활성화되는 구조에 256개의 전문가(experts)와 262K 컨텍스트를 갖추고 있습니다. InternLM은 이 모델이 핵심 전문 과학 작업에서 트릴리언 규모의 S1-Pro와 견줄 만한 성능을 내면서도 파라미터를 약 30배 줄였다고 주장합니다.

Intern-S2-Mobius는 세 번째 것입니다: 아키텍처 릴리스이며, Intern-S2라는 이름을 지닌 것입니다. Mobius-v0의 "v0"은 그 명칭에서 실질적인 의미를 지닙니다 — 이것은 설계의 첫 공개 반복이지, 성숙한 제품 라인이 아닙니다. 그것은 다음에 연결됩니다: ArchSpace, 즉 InternLM의 오픈 플랫폼으로, LLM 아키텍처 혁신을 검증하는 곳이며, 명시된 목표는 "LLM 아키텍처 탐구를 커뮤니티가 재사용할 수 있는 지식으로 전환하는 것"이고, 동료 검토와 부정적 결과를 포함한 공개 결과를 제공합니다. Mobius는 제안이 1B 규모의 프로브에서 실제로 다운로드할 수 있는 35B 모델로 졸업할 때 그 프로그램이 보이는 모습입니다. 전체 기술 보고서는 유도 과정을 원하는 사람들을 위해 GitHub 저장소와 함께 제공됩니다.

그런 관점에서 본다면, 두 가지 벤치마크 성능 하락은 이번 출시의 특징이지 부끄러운 일이 아니다. 이는 연구소가 아키텍처 실험의 결과를 성능이 후퇴한 부분까지 포함해 정직하게 공개하는 것이다.

실행 방법

Intern-S2-Mobius는 세 가지 추론 스택에서 지원되며, 배포 가이드에는 각각에 대한 실행 가능한 호출 방법이 나와 있습니다.

LMDeploy는 권장 경로이며, 가이드가 단일 GPU에서 보여 주는 유일한 방법입니다: PyTorch 백엔드로 서빙하고, code>--trust-remote-code/code>, 텐서 병렬 처리 1, 그리고 4개의 드래프트 토큰을 가진 qwen3_5_mtp 추측 알고리즘으로 MTP 추측 디코딩을 활성화합니다.vLLM은 텐서 병렬 처리 2, qwen3 추론 파서, qwen3_coder 도구 호출 파서, 자동 도구 선택, 그리고 4개의 추측 토큰을 사용하는 MTP 추측 디코딩으로 표시됩니다.Transformers는 기본 추론을 위해 다음을 통해 작동합니다: code>AutoModelForImageTextToText/code>와 함께 code>trust_remote_code=True/code> 및 bfloat16을 사용합니다. 참고로 모델에는 커스텀 모델링 코드가 포함되어 있으므로 원격 코드 실행이 필수이며, 구성은 Transformers 5.2를 대상으로 합니다.

InternLM의 권장 샘플링 파라미터는 temperature 0.8, top-p 0.95, top-k 50, min-p 0.0으로, 대부분의 추론 모델이 선호하는 거의 탐욕적(greedy) 설정보다 더 따뜻한 값입니다. 이는 습관적으로 덮어쓰기보다 존중할 가치가 있습니다.

하드웨어적으로 보면: 약 73GB의 bfloat16 가중치에 KV 캐시와 활성화(activations)까지 합치면 단일 80GB 가속기로는 빠듯하고, 단일 141GB 카드면 넉넉합니다. 이것이 아마도 vLLM 예제가 GPU 두 개를 사용하는 반면, LMDeploy 예제는 대형 GPU 하나를 가정하는 이유일 것입니다. 긴 컨텍스트 작업에서는 요구 사항이 더 높아집니다. MTP를 활성화하세요 — 가이드에서 명시적으로 권장하며, 공개된 속도 향상의 상당 부분이 기본 아키텍처가 아닌 MTP에서 비롯됩니다.

가장 중요한 현실적 주의사항: 현재 이 모델을 호스팅하는 추론 제공업체는 없습니다. 허깅페이스 제공업체 패널에도 그렇게 명확히 표시되어 있으며, 이 글을 작성할 당시 다운로드 카운터는 여전히 0이었습니다. API 엔드포인트도, 백만 토큰당 가격도, 관리형으로 사용해 볼 방법도 없습니다. 오늘날 유일한 옵션은 셀프 호스팅입니다.

Intern-S2-Mobius-4

누가 실제로 신경 써야 할까?

1. 대규모 검색 중심 추론 워크로드를 실행하는 팀들

이것은 이 아키텍처가 만들어진 프로필입니다. 기술 Q&A, 문서 분석, 구조화 추출, 또는 객관식 분류를 추론 모델을 통해 대규모로 처리하고, 사용자에게 표시하지 않는 추론 토큰이 비용을 지배한다면, 동일한 답을 1/5의 토큰으로 도달하는 모델은 직접적인 비용 절감입니다. MMLU Pro와 GPQA 수치 — 4.6배 및 5.0배 더 짧은 추적과 동일하거나 더 나은 정확도 — 는 정확히 이 형태입니다. 직접 트래픽으로 벤치마킹하여 믿기 전에 확인하십시오. 그러나 메커니즘은 타당하고 인센티브는 큽니다.

2. 계산과학 그룹

네이티브 단백질, SMILES, 핵산 토크나이저와 생물학 및 분자 벤치마크에서의 큰 실측 개선, 그리고 1~2개의 GPU에서 실행되는 Apache 2.0 모델을 제공합니다. 데이터를 온프레미스로 유지해야 하고 분자 구조를 상업용 API에 보낼 수 없는 연구실에는 이 조합이 드뭅니다. Intern-S 라인은 이 목표를 향해 발전해 왔으며, Mobius는 지금까지 이 라인의 가장 저렴한 진입점입니다.

3. 연구자 및 건축 관찰자

지식-추론 디커플링과 잠재 추론은 한동안 활발한 연구 주제였습니다. 그러나 35B 규모에서 검증되고 실패 사례를 그대로 포함한 채 공개적으로 출시된 경우는 거의 없습니다. 포스트-트랜스포머 아키텍처가 다음에 어디로 향할지 관심이 있다면, 기술 보고서와 두 개의 실패한 행은 평균 점수보다 더 흥미롭습니다. ArchSpace는 이러한 종류의 결과를 재사용할 수 있도록 명시적으로 설계되었습니다.

아직은 신경 쓰지 않아도 될 사람: 프로덕션용 범용 어시스턴트를 찾는 사람들입니다. 호스팅된 엔드포인트도 없고, 독립적인 평가도 없고, 생태계 도구도 없고, 실적도 없습니다. 그것은 모델에 대한 비판이 아니라, 일주일밖에 안 된 연구용 릴리스에 대한 설명입니다.

프로덕션 스택에 어떻게 맞는지

오늘 Intern-S2-Mobius의 정직한 위치는 평가 후보이지, 기본 모델이 아닙니다. 이는 호스팅되지 않고 검증되지 않은, 일주일 된 연구 산출물로, 진정으로 흥미로운 아키텍처와 매우 구체적인 한 가지 강점—검색형 작업에 대한 토큰 효율적 추론—그리고 과학적 시퀀스 데이터에 대한 실질적인 특화를 갖추고 있습니다.

현명한 패턴은 프로덕션 트래픽을 OrcaRouter 같은 벤더 중립적 엔드포인트에 유지하는 것입니다. 이렇게 하면 여러 모델에 걸쳐 하나의 OpenAI 호환 API를 얻을 수 있고, Mobius는 승산이 있는 좁은 영역에서만 여러분의 자체 GPU에 별도로 배포하면 됩니다. 이 모델에 실제로 중요한 것을 측정하세요: 정확도만이 아니라 정답당 소비된 토큰 수입니다. Mobius가 최적화된 축은 바로 이것이며, 대부분의 평가 하네스가 무시하는 축이기도 합니다. 이것이 여러분의 워크로드에서도 유효하다면, 실행 비용이 싸고 법적 제약이 없는 자체 호스팅 경로를 확보한 것입니다. 그렇지 않다면 GPU 시간 하루를 잃었을 뿐, 프로덕션 경로는 전혀 바뀌지 않은 것입니다.

공급자가 결국 이를 호스팅하게 되면 동일한 논리가 반대로 적용됩니다. 라우터를 사용하면 아무것도 다시 작성하지 않고도 새 모델을 기존 모델과 A/B 테스트할 수 있으며, 이는 누구도 독립적으로 테스트하지 않은 아키텍처를 채택하는 정확히 올바른 방법입니다.

제한 사항 및 주의 사항

가장 큰 것부터 시작하자: 이 글의 수치 중 어느 것도 독립적으로 검증된 것이 없다. 모든 벤치마크, 모든 처리량 곡선, 모든 토큰 길이 비교는 InternLM에서 나온 것이다. 또한 이 비교는 구조적으로 유리하다. Mobius는 현재 최전선 모델이 아니라 지속적으로 사전 학습된 특정 기준선과만 비교되며, 추가적인 SFT 및 RL 후처리로 인해 이 비교는 하나의 깨끗한 아키텍처 절제 연구로 제시되었음에도 그렇지 않다. 이득의 일부는 Mobius 덕분이고, 일부는 단순히 더 많은 훈련 때문이다.

성능 하락은 실제이며 가장 어려운 과제들에서 나타납니다. HLE에서 3.3포인트, UGD 하드에서 5포인트를 잃으면서 거의 모든 더 쉬운 과제에서 이기는 것은, 추론 효율성을 핵심 강점으로 내세우는 모델에게 일관되면서도 다소 우려되는 신호입니다.

운영상으로 볼 때 마찰이 상당합니다. 맞춤형 모델링 코드는 code>trust_remote_code/code> 및 최신 개발 버전의 Transformers를 의미합니다. 이를 지원하는 프레임워크는 code>interns2_mobius/code>가 무엇인지 알 수 있을 만큼 최신이어야 하며, InternLM의 자체 가이드에 따르면 이들은 활발히 개발 중인 참조 구성입니다. 약 73GB의 가중치는 노트북용 모델이 아닙니다. 호스팅된 API, 가격 정책, 요청 한도, SLA가 없습니다 — 서비스가 없기 때문입니다.

마지막으로, 무엇이 발표되지 않았는지 주목하자: 완전한 비전 인코더를 갖추고도 멀티모달 벤치마크 결과가 없고, 256K 상한에도 불구하고 장문 컨텍스트 평가가 없으며, 코딩 벤치마크는 전혀 없고, 안전성·정렬 평가도 없으며, Qwen3.5-35B 외의 어떤 모델과의 비교도 없다. 범용 배포를 기준으로 볼 때 이는 큰 공백이다. 가중치가 딸려 있는 아키텍처 논문으로서는 단순히 범위를 벗어난 것일 뿐이며 — 이것이 이번 릴리스를 읽는 올바른 방식이다.

자주 묻는 질문

Intern-S2-Mobius란 무엇인가요?

Shanghai AI Laboratory의 InternLM 팀이 개발한 35B 파라미터, Apache 2.0, 멀티모달 기반 모델로, 지식 저장과 추론 연산을 분리하는 Mobius-v0 아키텍처를 기반으로 합니다. Qwen3.5-35B에서 지속 사전 학습(continual pre-training)을 거쳤고, SFT와 강화 학습을 통해 후속 학습되었으며, 2026년 7월 29일 Hugging Face에 공개되었습니다.

Mobius 아키텍처를 다르게 만드는 것은 무엇인가?

기존 트랜스포머는 모든 레이어 내부의 피드포워드 블록에 지식을 저장하므로, 지식은 해당 깊이에서만 도달할 수 있습니다. Mobius는 이를 하나의 전역 공유 메모리(릴리스된 구성에서는 2,560개의 전문가)로 대체하며, 네 개의 Reasoner 블록이 이를 반복적으로 쿼리하여 깊이를 넘어선 지식 접근을 허용하고, 추론의 일부가 생성된 사고 사슬 토큰이 아닌 연속적인 히든 상태에서 이루어지게 합니다.

Intern-S2-Mobius는 정말 4배 더 빠른가요?

평균적으로 그리고 큰 배치 크기에서는 대체로 그렇다. InternLM은 배치 16에서 요청 처리량이 2.9배 높게 측정되며, 배치 256에서는 4.6배까지 상승한다. 그러나 작업에 따라 차이가 매우 크다. MMLU Pro와 GPQA Diamond에서는 모든 배치 크기에서 이득이 크지만, AIME 및 HMMT 경쟁 수학 문제에서는 중간 배치 크기에서 기본 Transformer가 실제로 더 빠르다. 속도 향상은 모델이 추론 과정을 얼마나 줄일 수 있는지에 따라 달라진다.

Qwen3.5-35B와 비교하면 어떤가요?

9가지 일반 벤치마크 중 7가지에서 승리하여 평균 67.88 대 65.05를 기록했습니다. 여기에는 MMLU Pro(89.05 대 85.31), AIME 2026(95.31 대 92.08), HMMT 2026(85.51 대 78.50), SimpleQA(28.90 대 21.39)가 포함됩니다. UGD hard(73.02 대 78.02)와 HLE(19.11 대 22.40)에서는 패배했습니다. 과학적 과제에서는 평균 52.14 대 18.20으로 훨씬 앞서 있습니다.

Intern-S2-Mobius를 API를 통해 사용할 수 있나요?

현재는 아닙니다. 추론 제공업체 중 어디에서도 이를 호스팅하지 않으며, 공개된 가격도 없고, Hugging Face에도 배포 목록이 없습니다. 오늘날 이를 실행할 수 있는 유일한 방법은 LMDeploy, vLLM, 또는 Transformers를 이용한 자체 호스팅입니다.

그것을 실행하려면 어떤 하드웨어가 필요합니까?

가중치는 bfloat16 기준 약 73GB이므로, KV 캐시용 여유 공간을 포함해 141GB급 가속기 1개 또는 80GB GPU 2개를 준비하세요. InternLM의 LMDeploy 예시는 텐서 병렬 처리 값을 1로 사용하고, vLLM 예시는 2로 사용합니다. 드래프트 토큰 4개를 사용한 MTP 추측 디코딩을 활성화하는 것이 권장됩니다.

그것의 컨텍스트 길이는 얼마나 됩니까?

이 구성은 {{1}}262,144개의 토큰(256K){{/1}}을 지원합니다. 참고로 {{2}}InternLM은 대부분의 텍스트 벤치마크에서 128K, MMLU Pro, SimpleQA 및 HLE에서 64K로 평가되었으므로{{/2}}, 전체 256K에서 검증된 품질은 아직 입증되지 않았습니다.

멀티모달인가요?

네. Hugging Face는 이를 이미지-텍스트-텍스트로 분류하며, 구성에는 비디오 토큰 처리를 지원하는 27개 층의 비전 인코더가 포함됩니다. 그러나 InternLM은 이번 릴리스에서 멀티모달 벤치마크 결과를 발표하지 않았으므로, 비전 기능은 실제로 문서화되어 있지 않습니다.

왜 단백질과 SMILES 토크나이저를 포함하나요?

Intern-S 라인은 과학적 모델 계열이기 때문입니다. 단백질 서열, SMILES 분자 표기법, 핵산에 대한 전용 토크나이저 덕분에 모델이 이러한 형식을 기본 입력 유형으로 읽을 수 있으며, 이로 인해 베이스라인이 3.77점을 기록한 Biology-Instructions에서 51.40점을 달성했습니다.

라이선스가 정말 Apache 2.0인가요?

네 — Apache 2.0이며, 라이선스 파일이 저장소에 포함되어 있습니다. 상업적 사용, 수정, 재배포가 허용되며, 이는 대형 연구소들의 많은 오픈웨이트 릴리스보다 훨씬 관대한 편입니다.

프로덕션에서 사용해야 할까요?

아직 아닙니다. 이 모델은 일주일밖에 되지 않았고, 호스팅되지 않았으며, 제3자 검증을 받지 않았고, 코딩·멀티모달·장문 맥락·안전성 평가가 누락되어 있습니다. 토큰 효율적 추론이나 과학적 시퀀스 작업을 위한 평가 후보로 취급하고, 벤더 중립 엔드포인트를 통해 기존 모델에 프로덕션 트래픽을 유지한 채, 독립적인 수치가 나왔을 때 다시 검토하십시오.

결론

Intern-S2-Mobius는 올해 가장 진정으로 흥미로운 모델 릴리스 중 하나이며, 그 점의 거의 대부분은 점수와 관련이 없습니다. InternLM은 실제 아키텍처 아이디어 — 지식을 레이어에 묶는 것을 중단하고, 하나의 공유 메모리에 넣고, 모델이 토큰 대신 잠재 공간에서 사고의 일부를 수행하도록 하는 것 — 를 채택하여 35B로 확장하고, 제대로 훈련시켰으며, Apache 2.0 하에서 가중치를 기술 보고서와 함께 공개했습니다. 그리고 자신에게 유리하지 않은 결과도 함께 공개했습니다. 효율성 메커니즘은 명확하고, 그에 대한 증거는 내부적으로 일관성이 있습니다: 트레이스는 평균 1.5배, 지식 집약적 작업에서는 최대 5배까지 짧아지며, 처리량은 정확히 그 예측 비율만큼 증가합니다.

주의할 점도 마찬가지로 분명하다. {{1}}Shanghai AI Laboratory 외에는 누구도 단 하나의 수치도 검증하지 않았다.{{/1}} 비교 대상은 모델 자체의 베이스라인이며 추가 사후 학습(post-training)을 포함하므로, 언뜻 보이는 것 같은 깔끔한 절제 실험(ablation)이 아니다. {{2}}속도 향상은 어려운 수학 문제에서는 대부분 사라진다.{{/2}} 이 모델은 자체 표에서 가장 요구 수준이 높은 두 가지 추론 벤치마크에서 밀린다. {{3}}그리고 GPU를 임대하지 않고는 시도해볼 방법이 없다.{{/3}}

그러니까: 이번 주에 배포할 모델은 아니지만, 충분히 주목할 가치가 있는 모델이며, 두 가지 특정 사용자층에게는 정말 매력적인 선택지입니다 — 아무도 읽지 않는 토큰이 추론 비용을 지배하는 팀, 그리고 단백질과 분자를 기본적으로 다루는 작고 허용적 라이선스의 모델이 필요한 과학 연구 그룹. 프로덕션 스택은 OrcaRouter 같은 벤더 중립적 엔드포인트를 통해 검증된 모델에 유지하고, Mobius는 그 좁은 용도에 한해 자체 하드웨어에 구축하며, 정확도만이 아니라 정답당 토큰 수로 측정하세요. 아키텍처가 독립적인 검증을 견뎌 낸다면, Mobius-v0는 35B 모델로 기억되기보다는, 진짜 중요한 버전의 바로 이전 버전 번호로 기억될 것입니다.

© 2026 OrcaRouter

제공업체용

추론 플랫폼을 운영하시나요? OrcaRouter에 모델을 등록하세요.

문의하기

커뮤니티에 참여하세요

DiscordEmailXGitHubYouTube