
Decision 3.0 vs Intern-Decision-4B: 두 팀이 동일한 모델을 파인튜닝했지만 그 외 모든 것에서는 의견이 갈렸다
- OrcaNEWOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 100만 토큰당 · 71 tok/s
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 116 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAIOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicAnthropic: Claude Opus 5.52026-09-2258지능
- xAIGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 48 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 478 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 59 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 389 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
를 d3-mini의 4B 멤버인 Decision 3.0 옆에 놓아 보면Intern-Decision-4B, 가장 먼저 눈에 띄는 것은 차이가 아니다. 둘 다 동일한 베이스 체크포인트인 Qwen3.5-4B의 파인튜닝 버전이다. 둘 다 45억 4천만 개의 파라미터로 표기되어 있다. 둘 다 상태(state), 이름이 붙은 질문들의 스키마, 후보 답변 집합을 입력받아 토큰을 하나도 생성하지 않고 후보별로 보정된 확률을 반환한다. 둘 다 Apache-2.0이다. 둘 다 별다른 발표 없이 공개되었다 — InternLM은 2026년 9월 26일 40초 만에 체크포인트 세 개를 업로드했고, vLLM-SR의 Decision 3.0 패밀리는 2026년 10월 10일 Hugging Face에 등장했지만 그 소식은 vLLM 프로젝트의 X 계정을 통해서만 전해졌다.
그 이후의 모든 것은 의견 불일치다. 그들은 모델에서 확률을 어떻게 읽어낼지, 비디오가 입력으로 간주되는지, 요청이 얼마나 길어도 되는지, 그리고 — 가장 첨예하게 — 팀이 자체 신뢰도가 믿을 만하다고 말해 주는 수치를 공개할 의향이 있는지에 대해 의견이 다르다. 이 글은 그 네 가지 의견 불일치와 각각이 당신에게 치르게 하는 비용에 관한 것이지, 어느 모델이 "더 나은지"에 관한 것이 아니다. 왜냐하면 그 둘은 같은 척도로 측정되지 않으며, 어느 벤더도 하지 않은 작업을 하지 않고서는 서로를 비교해 순위를 매길 수 없기 때문이다.
가장 먼저 이해할 가치가 있는 우연
두 연구실이 2주 안에 같은 4B 백본을 선택한 것은 전혀 놀랍지 않다. Qwen3.5-4B는 구조화된 출력 모델을 위한 합리적인 기반이고, 두 팀 모두 값싸게 실행할 만큼 작으면서 지시를 읽어낼 만큼 강력하기에 그것을 택한 것이 분명하다. 놀라운 점은 두 팀이 유효 숫자 네 자리까지 동일한 파라미터 수에 도달했다는 것이다. 이는 파인튜닝이 아키텍처를 그대로 보존했으며, 어느 쪽도 전체 파라미터 수를 움직일 만큼 큰 별도의 비전 타워를 추가하지 않았다는 것을 말해준다. 두 모델 모두 멀티모달 능력을 같은 가중치 안에 접어 넣는다.
흥미로운 부분은 리드아웃이다. 두 모델 모두 원칙적으로는 질문에 같은 방식으로 답한다 — 후보 답변을 생성하는 대신 점수를 매긴다 — 그러나 메커니즘은 완전히 다르다:
• Intern-Decision-4B — 모든 선택지를 단일 토큰 기호(A–Z, 그다음 a–z, 그다음 0–9)에 매핑하고, 각 필드마다 플레이스홀더가 있는 JSON 스켈레톤을 프롬프트에 렌더링한 뒤, 단 한 번의 인과적 순방향 패스를 실행하여 각 플레이스홀더 바로 앞 위치에서 로짓을 읽습니다. 이 메커니즘은 정확한 소프트맥스와 온도 단계를 포함해 모델 카드에 단계별로 문서화되어 있습니다.
• d3-mini — modeling_d3.py에 커스텀 아키텍처를 탑재하며, 자체 readout.safetensors에 별도의 readout 헤드를 두고, decision_config.json에서 noncausal_full_attention과 마지막 토큰 풀링을 선언하며, 토큰-코드 매핑은 산문이 아니라 구성 파일에 정의합니다.
어느 접근 방식도 명백히 더 낫지는 않습니다. InternLM 경로는 문서화된 수치 시퀀스를 갖춘 표준 Hugging Face 모델 클래스에서 실행된다는 장점이 있어, 그 작업을 검증할 수 있습니다. vLLM-SR 경로는 리드아웃이 기존 토큰 임베딩의 투영이 아니라 훈련된 헤드라는 장점이 있으며, 이는 더 자유로운 피팅입니다. 그 대가는 trust_remote_code=True로 설정하고 그들의 코드를 실행해야만 무엇이든 할 수 있다는 것입니다.
각자가 공개하는 한도
여기서 실질적인 선호가 형성되기 시작하는데, 이는 한 카드가 어디서 작동을 멈추는지에 관해 다른 카드보다 훨씬 더 구체적이기 때문입니다.
• 입력 상한 — Intern-Decision-4B: 기본적으로 8,192 토큰이며 이를 초과하는 요청은 절대 잘리지 않고 곧바로 거부됩니다. 상한은 생성자 인수로 설정됩니다. d3-mini: max_length는 null입니다(배포된 구성에서). 그리고 카드 어디에도 토큰 예산이 나타나지 않습니다.
• 요청당 질문 수 — Intern-Decision-4B: 1~16개이며, 한 질문당 선택지 최대 62개라는 명시된 상한이 있습니다. d3-mini: 명시된 제한 없음; 카드에는 질문들이 함께 답변되며, 각각 자체적인 순전파에서 나온다고만 적혀 있습니다.
• 이미지 — Intern-Decision-4B: 요청당 최대 8개까지 지원하며, 사용자가 제공한 목록에 따라 정렬되고 체크포인트 프로세서가 크기 조정과 토큰 확장을 처리합니다. d3-mini: 요청당 여러 개를 경로, URL, PIL 이미지 또는 base64 데이터 URL로 지정할 수 있으며, 각 이미지는 최대 1.6메가픽셀까지 읽히고 모든 질문이 모든 이미지를 확인합니다.
• 비디오 — Intern-Decision-4B: 없음. d3-mini: 여러 비디오를 초당 2프레임으로 읽으며, 클립 전체에 걸쳐 최대 32프레임, 프레임당 0.2메가픽셀로 제한됩니다.
입력 상한은 대부분의 사람에게 이 문제를 결정지을 기준선이다. 상태, 질문 지시사항, 후보 설명 사이에 공유되는 8,192토큰 예산은 이 모델들이 내세우는 문서 채점과 장문맥 라우팅 작업에 실질적인 제약이며, InternLM이 이를 숨기지 않고 분명히 밝힌 점은 인정받을 만하다. vLLM-SR이 이를 명시하지 않은 것은 정반대다. 그것은 숨겨진 한계가 아니라 알 수 없는 한계이며, 저장소를 아무리 읽어도 결론이 나지 않는다.
칼리브레이션이 진정한 차별점이다
모든 의사결정 모델은 같은 약속을 한다: 그것이 반환하는 숫자는 확률이며, 그에 맞춰 설정된 임계값은 의미를 지닌다. 하지만 거의 어느 것도 그것을 입증하지 못한다. 바로 이 지점에서 두 릴리스는 가장 크게 갈라지며, 그 차이는 릴리스 날짜를 보고 짐작했을 방향과 반대 방향으로 흐른다.
Intern-Decision-4B는 자체 카드에 7개 벤치마크 평균에 걸쳐 Brier 점수 0.347과 기대 캘리브레이션 오차 0.065를 공개하며, 1,728개의 지정된 캘리브레이션 사례와 1,693개의 별도 검증 사례에 대해 NLL 최소화로 도출한 적합 온도 1.99241824, 그 온도를 선택하는 데 테스트 스위트 레이블이 사용되지 않았다는 명시적 진술, 그리고 온도 스케일링 전 0.628 Brier / 0.213 ECE에서 후 0.550 / 0.089로 이동하는 것을 보여주는 96개 사례 진단을 제시합니다. 또한 기본값을 밝히고 캘리브레이션이 체크포인트별이라고 하므로, 이 모듈과 함께 다른 크기를 사용하면 일치하지 않습니다.
Decision 3.0은 정확도 지수와 커버리지 주장을 발표합니다 — 140,178건의 공개 요청 모두에 응답했고, 지원되지 않은 것은 하나도 없습니다 — 그리고 보정 수치는 전혀 없습니다. 여섯 개 체크포인트 중 어디에도 Brier score도, ECE도, 명시된 temperature도 없습니다. temperature는 d3의 배포된 decision_config.json에서 1.0이며, 이는 항등값이고 적합된 값일 수도 있고 아닐 수도 있습니다. 파일에는 명시되어 있지 않습니다.
두 인덱스 헤드라인을 나란히 읽어 보면 비대칭은 더 심해진다. d3-mini의 카드는 Jev Decision Index 0.3 public-suite 점수 54.90을 보고하는데, 이는 공개된 가중치에 공식 키트로 측정한 것이라고 설명되는 반면, 같은 보드의 비교 행들은 라이브 보드 데이터라고 설명된다. Intern-Decision-4B는 자체 일곱 개 벤치마크에서 평균 90.02를 보고한다. 그 두 숫자는 같은 척도가 아니고, 같은 과제를 사용하지 않으며, 이를 한 문장에 비교로 넣는 것은 부정직할 것이다. 비교할 수 있는 것은 공개 정보이다: 한 카드는 자신의 신뢰도가 얼마나 틀렸는지 알려 주고, 다른 카드는 모르거나 말하지 않으려 한다.

지연 시간, 그리고 두 밀리초 집합 역시 비교할 수 없는 이유
두 카드 모두 요청당 지연 시간을 공개하는데, 정확도 수치를 비교할 수 없는 것과 같은 이유로 이를 액면 그대로 받아들이는 것은 실수가 될 것이다.
• Intern-Decision-4B — 평균 44.16ms, 중앙값 44.03ms, p95 44.60ms이며, 단일 RTX 4090에서 로컬 Hugging Face 경로를 통해 측정되었고, 워크로드와 하드웨어에 따라 달라지는 것으로 설명됩니다.
• d3-mini — 텍스트의 경우 중앙값 17.5ms, 이미지가 있는 경우 96.2ms, 10초 동영상이 있는 경우 371.5ms, AMD Instinct MI325X 한 대에서 한 번에 하나의 요청으로.
이 둘을 서로 비교할 수 없게 만드는 두 가지 요인이 있습니다. 첫째는 하드웨어와 소프트웨어 경로입니다. 4090 대 MI325X, 기본 Hugging Face 순전파 대 flash-linear-attention을 통해 사용할 수 있는 마스크 레이어 커널을 갖춘 맞춤형 어텐션 구현입니다. 둘째는 워크로드입니다. InternLM의 수치는 명시되지 않은 조합에서 쿼리당 엔드투엔드로 설명되고, vLLM-SR의 수치는 입력 모달리티별로 분류되어 있으므로, 텍스트 전용 비교만이 유일한 동등 비교 항목이며, 그것조차 두 GPU 벤더에 걸쳐 있습니다.
두 카드에서 가져가야 할 숫자는 순위가 아니라 형태다. 의사결정 모델은 하나의 워크플로 안에서 반복적으로 호출된다 — 지원 기록 하나에 목적지, 환불 확인, 에스컬레이션 결정, 우선순위 점수라는 네 가지 질문이 필요할 수 있고, 128건의 레코드 배치는 이를 512개의 결정으로 바꾼다. 그 규모에서는 17ms와 44ms 모두 다운스트림 생성 모델에 드는 비용 앞에서 사라진다. 주목해야 할 것은 모달리티에 따라 달라지는 수치다. d3-mini 자체 수치로는 이미지나 비디오 요청이 텍스트 요청 비용의 5배에서 20배 사이이고, 스크린샷을 기준으로 결정을 내리고 있다면 대부분의 의사결정 모델 배포에는 없는 비용 프로필을 끌어들인 것이다.
실제로 어떤 걸 골라야 할까
내려야 할 결정이 영상에 달려 있다면, 겨룰 것도 없고 분석할 필요도 없습니다. Decision 3.0은 영상을 읽고 Intern-Decision-4B는 읽지 못합니다. 화면 녹화, 카메라 클립, 프레임 시퀀스가 관련된 모든 경우에 대한 답은 이것으로 끝이며, 이는 더 새로운 제품군의 존재를 그 자체만으로 정당화해 주는 역량 격차입니다.
입력이 텍스트와 가끔 있는 이미지라면, 선택은 두 가지에 달려 있으며 그중 어느 것도 리더보드는 아닙니다.
임계값에 대해 추론해야 할 때는 Intern-Decision-4B를 선택하세요. 두 가지 중 0.9가 열 번 중 아홉 번을 의미하는지 알려주는 유일한 모델이며, 온도를 명시하고, 그 온도가 어떤 사례에 피팅되었는지 말해주며, 추론 과정을 기성 모델 클래스에 대해 재구현할 수 있는 짧은 번호 매김 절차로 문서화합니다. 자동화된 행동 앞에 앉은 스코어러에게 그것이 중요한 속성이며, 정확도 점수보다 더 희귀합니다.
범위나 모달리티가 필요할 때 Decision 3.0을 선택하세요. 0.59B에서 26.09B에 이르는 6개의 체크포인트는 동일한 요청 형식을 6.7 ms 엣지 모델과 27B 모델 모두에서 처리할 수 있음을 의미하며, 패밀리가 하나의 인터페이스를 공유하므로 티어 간 이동은 재작성이 아니라 구성 변경입니다. 문제는 명시되지 않은 입력 예산과 감사되지 않은 캘리브레이션 주장을 신뢰하고 있다는 점이며, 패밀리에서 가장 큰 모델은 공급업체가 자체 하네스에서 인덱스 번호를 측정한 모델이라는 점입니다.
오늘날 둘 중 어느 것도 안전한 기본값이 아니다. d3의 가장 많이 다운로드된 체크포인트는 Hugging Face에 올라온 지 약 하루밖에 되지 않았고, Intern-Decision-4B는 2주째 공개되어 약 3,200회 다운로드와 83개의 좋아요를 받았는데, 이는 관심을 끈 것이지 프로덕션 트래픽은 아니다. 둘 다 테스트하기에 충분히 저렴하지만, 어느 쪽도 제3자 평가가 뒷받침하고 있지 않다. 돈을 쓰는 무언가 앞에 스코어러를 두려는 거라면, 올바른 방법은 두 모델을 모두 직접 라벨링한 케이스에서 실행해 보고 인덱스 행이 아니라 보정 곡선을 비교하는 것이다.

라우터는 어디에서 오는가
OrcaRouter는 이 두 모델 중 어느 것도 제공하지 않습니다. Decision 3.0의 체크포인트는 HTTP 엔드포인트가 공개되지 않은 Hugging Face 리포지토리 내 로컬 Python 추론 경로이며, Intern-Decision-4B는 사용자가 직접 인스턴스화하는 DecisionEngine 클래스로 제공됩니다. 둘 다 현재 우리가 라우팅할 수 있는 대상이 아니며, 이 글의 어떤 부분도 가용성에 대한 주장으로 해석되어서는 안 됩니다.
우리가 제공하는 것은 같은 패밀리의 호스팅 버전입니다. typesafe/jev-1.13은(는) 우리 카탈로그에 있으며, 다음을 통해 제공됩니다: POST /v1/systemone — 위의 두 오픈 모델이 모두 구현하는 것과 동일한 상태 및 명명된 질문 계약 — 입력 토큰 백만 개당 $0.042이고, 완료를 생성하지 않으므로 완료 요금은 없습니다. 다른 200개 이상의 모델과 나란히 자리하며, 이 두 모델을 비교하는 사람에게 실용적인 핵심은 바로 이것입니다: 스코어러는 루프에서 저렴한 부분이고, 결정에 따라 행동하는 모델은 비싼 부분입니다. 두 모델 모두를 하나의 키로 라우팅하고, 공급자가 흔들릴 때 자동 장애 조치를 수행하며, 공급자 정가를 0% 마크업으로 그대로 전달하는 것, 즉 결정 모델을 평가할 때 두 번째 계약에 서명하거나 백엔드를 전환할 때 호출 지점을 다시 작성할 필요가 없다는 뜻입니다. 지금 평가 중이라면 — 두 모델 모두 오늘 그 단계에 있습니다 — 어느 쪽이든 확정하기 전에 설정해 둘 가치가 있는 부분입니다.

열린 질문
두 카드는 모델 작성자가 독자에게 무엇을 제공할 의무가 있는지를 두고 서로 다른 입장을 보이는데, 그 불일치는 모델들보다 더 흥미롭다. InternLM은 temperature 값과 그것이 피팅된 사례들을 공개한 뒤, 캘리브레이션이 얼마나 개선되었는지 보여주는 진단 결과를 공개했다. vLLM-SR은 파일 해시, 고정된 베이스 리비전, 명시된 하드웨어 타깃, 커버리지 주장을 공개했다 — 실질적인 출처 추적 작업 — 그리고 캘리브레이션 수치는 전혀 없었다.
어느 릴리스가 성숙하는지를 가르는 시험은 어느 것이 보드에서 이기는가가 아니다. 그것은 다음 Decision 체크포인트가 그것에 대한 Brier 점수를 달고 나오는지, 그리고 InternLM의 다음 업로드가 비디오에 도달하는지이다. 둘 다 외부에서 볼 수 있고, 둘 다 확인하기에 저렴하며, 둘 중 어느 것도 아직 일어나지 않았다.
