
Intern-Decision-4B vs ContextPilot-8B: 컨텍스트를 축소하는 모델 대 컨텍스트를 관리하는 모델
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 592 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
독을 고르세요: internlm/Intern-Decision-4B는 8,192개 토큰 넘게 읽기를 거부하고, tencent/ContextPilot-8B는 끝없이 커지는 컨텍스트를 견디기 위해 특별히 존재합니다. 두 모델은 같은 크기 등급이고, 둘 다 Qwen 베이스의 파인튜닝이며, 둘 다 벤더 발표도, 그 어떤 종류의 독립적 평가도 없이 Hub에 올라왔습니다 — ContextPilot-8B는 2026년 8월 27일, Intern-Decision-4B는 2026년 9월 26일 — 그리고 둘은 정반대의 문제를 해결합니다. Intern-Decision-4B는 45억 개 파라미터의 구조화된 의사결정 모델로, 단일 순전파를 실행하고 로짓을 읽어서 여러분이 물어본 모든 질문에 대해 보정된 확률을 반환합니다. 토큰은 결코 생성하지 않습니다. ContextPilot-8B는 81.9억 개 파라미터의 텍스트 생성기로, 긴 에이전트 실행 중에 자체 작업 컨텍스트를 계획하고, 기억하고, 오프로드하도록 훈련되었습니다. 이 둘을 비교하는 것은 사실 벤치마크 문제가 아닙니다. 그것은 여러분의 문제 중 어느 절반을 모델이 삼키게 하고 싶은지에 대한 문제입니다.
먼저, 그들이 진정으로 공유하는 것
두 모델 모두 자신의 연구소 밖의 누구도 검증한 단 하나의 수치도 갖고 있지 않다. 이는 무엇보다 먼저 언급할 만큼 이례적인데, 왜냐하면 이 블로그의 대부분의 비교는 적어도 한쪽에 대해서는 독립적인 리더보드에 기댈 수 있기 때문이다.
Intern-Decision-4B는 자기 카드에 전체 평가 표를 공개한다 — 7개 세트에서 평균 90.02, Brier 점수 0.347, 기대 캘리브레이션 오차 0.065 — 모두 InternLM이 InternLM의 하네스에서 측정한 것이다. ContextPilot-8B는 표를 전혀 공개하지 않는다. 그 카드에는 프레임워크가 "다양한 베이스 모델과 벤치마크에서 기존 베이스라인을 일관되게 능가한다"고 적혀 있으며, 세부 사항은 논문과 평가 파이프라인을 보라고 가리킨다. 따라서 이 맞대결에서 정직한 출처 표기 문구는 짧다: 한쪽은 공급업체가 보고했지만 재현되지 않았고, 다른 쪽은 공급업체가 주장했지만 미공개이며, 이 페이지의 어떤 것도 독립적이지 않다.

두 가지 베팅, 명확히 말하자면
Intern-Decision-4B가 거는 것은 결정에서 어려운 부분이 추론이 아니라 결단을 내리는 것이라는 점입니다. 상태, 이름이 붙은 질문들의 스키마, 그리고 최대 8개의 이미지를 주면, 사용자의 옵션 문자열들에 대한 분포를 반환합니다. 추론 절차는 결정적이며 형태가 고정되어 있습니다: 옵션을 단일 토큰 심볼에 매핑하고, 각 필드마다 플레이스홀더가 하나씩 있는 어시스턴트 JSON 골격을 렌더링하고, 하나의 인과적 순방향 패스를 실행하고, 각 플레이스홀더 바로 앞의 로짓을 읽고, 해당 필드의 후보들에만 소프트맥스를 적용하고, 피팅된 온도를 적용합니다. 디코딩 루프가 없으므로 파서도 없고 자유 텍스트 환각 표면도 없습니다. 그 베팅의 대가는 엄격한 입력 상한입니다 — 카드에 따르면 DecisionEngine(max_length=8192)를 초과하는 입력은 "잘림 없이 거부됩니다".
ContextPilot-8B의 승부수는 그 거울상이다: 에이전트가 계속 토큰을 쓰게 하되, 자신이 들고 있는 것을 편집하도록 가르치는 것이다. 이는 에이전트의 도구 세트에 계획, 구조화된 장기 기억, 검색, 소프트 컨텍스트 오프로딩을 추가한 다음, 중요한 컨텍스트 편집 결정을 중심으로 분기를 샘플링하고 궤적 수준이 아니라 행동 수준에서 크레딧을 할당하는 RL 레시피로 체크포인트를 훈련한다. 카드는 패키징 결과에 대해 솔직하다: 체크포인트를 로드한다고 해서 컨텍스트 관리가 제공되는 것은 아니다. 도구 정의, 에이전트 런타임, 평가 파이프라인은 다른 곳에 있으며 함께 가져와야 한다.
스코어보드, 차원별로
• 출력 — Intern-Decision-4B는 텍스트를 전혀 내보내지 않고, 여러분의 옵션 값에 대한 확률만 출력합니다. ContextPilot-8B는 정상적으로 생성하며, 그 답변은 산문과 직접 파싱해야 하는 도구 호출입니다.
• 입력 상한 — Intern-Decision-4B는 8,192토큰을 초과하는 입력은 거부합니다. ContextPilot-8B는 Qwen3-8B의 40,960토큰 위치 한도를 계승하며, 유효 컨텍스트가 커져도 계속 작동하도록 설계되었습니다.
• 파라미터 — Intern-Decision-4B의 경우 텍스트 타워, 비전 타워, 프로젝터에 걸쳐 4.54B BF16; ContextPilot-8B의 경우 8.19B BF16으로, 단순한 dense Qwen3 인과 언어 모델.
• 지연 시간 — Intern-Decision-4B는 자체 카드에 따르면 단일 RTX 4090에서 평균 44.16ms, P95에서 44.60ms를 기록합니다. ContextPilot-8B는 지연 시간 수치를 공개하지 않으며, 비용은 토큰을 평가하는 것이 아니라 생성하기 때문에 근본적으로 다릅니다.
• 이미지 — Intern-Decision-4B는 최대 8개까지 처리하며, 이미지 토큰은 8,192 상한에 포함됩니다; ContextPilot-8B의 카드에는 멀티모달 경로가 없는 텍스트 생성 체크포인트가 설명되어 있습니다.
• 라이선스 — Intern-Decision-4B는 Apache-2.0이며, 그 옆에 업스트림 Qwen 라이선스가 보존되어 있습니다. ContextPilot-8B의 라이선스는 섹션 0, “오직 과학적 연구 및 개발의 목적으로만 제공됩니다. 다른 어떤 목적으로도 사용해서는 안 됩니다.”로 시작합니다.
• 공개된 증거 — 한쪽에는 보정 진단이 담긴 7개 세트 표, 다른 쪽에는 논문 초록과 평가 저장소 링크.
• 실적 — 둘 다 조용한 편이다. Intern-Decision-4B는 2026년 9월 26일 이후 좋아요 1개와 다운로드 0회를 기록했고, ContextPilot-8B는 2026년 8월 27일 이후 좋아요 11개와 약 1,000회의 다운로드를 기록해 더 많은 관심을 받았지만 여전히 제3자 평가는 없다.

각각이 실제로 어디서 끊어지는지
Intern-Decision-4B의 실패 모드는 구조적이며, 이 점을 구체적으로 짚어볼 가치가 있다. 어떤 결정을 뒷받침할 근거가 8,192토큰에 들어가지 않으면, 모델은 완만하게 성능이 저하되지 않는다 — 요청을 거부한다. 이는 방어할 수 있는 엔지니어링 선택이며, ContextPilot-8B가 바로 그 용도로 만들어진 워크로드에는 끔찍하게 맞지 않는다. 카드 자체의 설정은 이 긴장을 더 날카롭게 만든다: 래퍼 아래의 텍스트 타워는 262,144토큰 위치 한도를 선언한다. 백본은 25만 토큰을 처리할 수 있는데, 출시된 래퍼는 8천 개를 넘는 토큰을 받아들이지 않는다.
ContextPilot-8B의 실패 양상은 그것이 그 어떤 용도로도 그대로 대체 투입할 수 있는 물건이 아니라는 점이다. 그것은 프레임워크 내부의 체크포인트이며, 동작이 구현되어 있는 곳은 바로 그 프레임워크다. 도구 정의와 에이전트 런타임 없이 가중치만 빼내면, 차별화되는 능력이 무용지물인 Qwen3-8B 파인튜닝이 남는다. 여기에 라이선스의 제0조까지 더하면, 상용 배포에 대한 실질적인 답은 배포된 그대로는 전혀 사용할 수 없다는 것이다. 이는 곧 지금이나 가까운 시일 내에 우리가 택할 후보 경로가 아니라는 뜻이기도 하다.
각각을 배포할 생각이라면
Intern-Decision-4B는 작은 GPU와 제대로 된 서빙 스택 없이도 충분합니다. Python 3.12 환경에서 PyTorch 2.9.1과 Transformers 5.14.1을 설치하고, 네 개의 샤드를 한 번 로드한 뒤 엔진을 상주시켜 채점하면 됩니다. 순전파가 고정 형상이기 때문에 P50과 P95는 서로 0.6밀리초 이내에 있어, 용량 계획은 테일 지연 시간보다 동시성에 관한 문제입니다. 곤란한 부분은 이것이 HTTP 서비스가 아니라 임포트 가능한 Python 클래스로 제공된다는 점이므로, 프로덕션 호출자 앞에 두려면 직접 래핑해야 합니다.
ContextPilot-8B는 정반대의 대우를 요구합니다. 설계된 대로 다시 훈련하거나 평가할 의도가 있다면, 실제 서빙 경로, 도구 실행기, 메모리 저장소, 그리고 분기 지원 롤아웃 환경이 필요합니다. 이것은 오후 한나절에 시험해 볼 모델이 아니라, 채택하는 연구 프레임워크입니다.
여기서 라우터가 도움이 될까요?
부분적으로는 그렇습니다. 그리고 솔직히 말하자면 그 범위는 여느 때보다 좁습니다. OrcaRouter는 자사 카탈로그에 Intern-Decision-4B, ContextPilot-8B, 또는 이와 유사한 의사결정 점수화 체크포인트를 등재하고 있지 않습니다. 두 모델의 모델 페이지는 모두 404이며, 이 글의 어떤 내용도 가용성 주장으로 읽혀서는 안 됩니다. 통합 엔드포인트가 실제로 제공하는 것은 실패한 실험을 폴백 뒤에 둘 수 있는 능력입니다: 200개 이상의 모델에 걸친 하나의 키, 프로바이더 정가가 0% 마크업으로 그대로 전달되며, 아직 평가 중인 스코어러가 단일 장애점이 되지 않도록 하는 자동 페일오버. 이는 이 비교에서 Intern-Decision 쪽에 실질적인 이점인데, 그 모델은 실제로 저렴하게 로컬에서 실행되기 때문입니다. ContextPilot-8B의 경우에는 이 점이 무의미합니다. 연구·개발 전용 라이선스는 어떤 라우터가 지원하든 상업적 경로를 원천적으로 차단하기 때문입니다.
그럼 어느 것?
당신의 질문이 닫힌 답변 집합을 갖고 있고, 증거가 첨부된 채로 도착하며, 설명이 아니라 확률을 필요로 한다면, Intern-Decision-4B가 더 흥미로운 대상이다 — 저렴하고, 형태가 고정되어 있으며, 설계상 캘리브레이션되어 있고, 받아들이지 않을 입력에 대해 솔직하다. 당신의 문제가 증거가 멈추지 않고 계속 도착한다는 것이라면, 어떤 결정 스코어러도 당신에게 도움이 되지 않을 것이며, ContextPilot-8B는 올바른 목표를 겨냥하고 있다. 단, 모델이 아니라 프레임워크와 연구 라이선스를 채택하게 된다는 점은 유의해야 한다.
이 문제를 결말지을 방법은 어느 공급업체도 아직 해보지 않은 테스트다. 두 모델 모두에게 상태로부터 정답을 계산할 수 있는 동일한 짧고 구조화된 결정을 주고, 채점기의 90.02 평균이 자체 평가 환경 밖에서도 유지되는지 확인하는 것이다. 누군가 그렇게 하기 전까지, 이 맞대결을 올바르게 해석하자면 두 모델은 애초에 같은 자리를 두고 경쟁하는 것이 아니다.

