'FrogNano-4B-2609 vs Intern-Decision-4B'라고 적힌 생성된 타이틀 카드, '동일한 Qwen3.5-4B 조상, 두 개의 정반대 출력'이라는 부제, '도구 호출 및 패치', '필드당 하나의 기호', '둘 다 독립적으로 평가되지 않음'이라고 적힌 세 개의 칩, '두 스코어보드 모두 벤더가 보고한 것이며, 제3자가 어느 쪽도 재현하지 않았다'라고 적힌 하단 문구, 그리고 오른쪽 아래 모서리에 합성된 OrcaRouter 로고.
Guides & Insights

FrogNano-4B-2609 vs Intern Decision 4B: 하나의 베이스 모델, 완전히 다른 두 가지 베팅

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

두 연구소는 동일한 체크포인트인 Qwen3.5-4B를 가져다 서로 닮지 않은 방향으로 밀어붙였다. microsoft/FrogNano-4B-2609는 약 1,500개의 합성 소프트웨어 엔지니어링 환경에서 강화 학습으로 사후 학습되어, 다섯 도구로 구성된 하네스를 통해 구조화된 도구 호출과 다중 파일 패치를 출력할 수 있게 되었다. internlm/Intern-Decision-4B는 아무 텍스트도 출력하지 않도록 미세 조정되었다 — 상태와 명명된 질문들의 스키마를 받아 단일 순전파로 각 선택지에 대한 보정된 확률을 반환한다. 하나는 코드를 작성한다. 다른 하나는 아무것도 작성하기를 거부하고 분포를 반환한다. 품질로 이들을 비교하는 것은 무의미하다; 실행하는 데 드는 비용과 이들에게 무엇을 신뢰하고 맡길 수 있는지로 비교하는 것이 정직한 연습이다.

둘 다 발표 없이 출시됐는데, 이는 둘의 또 다른 공통점이다. 어느 쪽도 Artificial Analysis 항목이나 아레나 평점, 단 하나의 독립적 평가도 없다. 아래의 모든 수치 — 한쪽의 SWE-bench 순위표, 다른 쪽의 Brier 및 ECE 캘리브레이션 행 — 는 모델을 훈련한 연구소가 그 연구소 자체의 하네스에서 산출한 것이며, 그 연구소는 자기에게서 나오지 않은 테스트 세트를 만난 적이 없다.

그 포크는 두 모델이 존재하기도 전에 일어났습니다.

베이스 체크포인트는 dense 32계층 하이브리드 Gated DeltaNet 및 gated-attention 모델이며, 두 파생 모델 모두 그 골격을 물려받습니다. 그 이후에는 두 포스트트레이닝 파이프라인 간에 공통점이 전혀 없습니다.

마이크로소프트의 파이프라인은 닫힌 루프입니다. TaskPilot은 실제 스냅샷에서 후보 저장소 작업을 생성하고, 현재 체크포인트에서 롤아웃을 실행해 정책이 때때로 해결하는 작업을 찾아내고, 그것들을 유지한 뒤 학습합니다. 5회 반복하며, 각 반복은 이전 반복의 정책에 맞춰 보정되었고, 최종적으로 SWE-bench Verified에서 61.5, SWE-bench Pro에서 37.6%를 기록했습니다. 증류는 없습니다 — 카드에는 더 강한 모델의 궤적, 행동 또는 추론 흔적이 대상으로 사용되지 않았다고 명시되어 있습니다.

InternLM의 파이프라인은 고정된 작업 형태에 대한 단일 지도 학습 목표입니다. 모델에는 시스템 프롬프트, 상태, 결정 스키마, 그리고 각 필드마다 하나의 플레이스홀더가 있는 완전한 어시스턴트 JSON 골격이 주어집니다. 단일 인과적 순전파를 실행하고, 각 플레이스홀더 위치의 로짓을 읽고, 해당 필드에 허용된 후보 심볼에 대해서만 소프트맥스를 취합니다. InternLM의 카드는 이를 명확히 밝힙니다: 이 경로는 "generate()를 호출하거나 자유 형식 텍스트를 샘플링하지 않습니다."

그 차이는 규모의 차이가 아니다. 그것은 아티팩트가 애초에 무엇인지에 대한 차이다. FrogNano-4B-2609는 백 가지 흥미로운 방식으로 틀릴 수 있고 테스트로 교정될 수 있는 에이전트다. Intern-Decision-4B는 실패 모드가 확신에 찬 숫자인 스코어러다.

두 개의 계약, 그리고 둘 중 어느 것도 '프롬프트를 보내는 것'이 아니다

FrogNano의 계약은 루프입니다. 모델은 Read, Write, Edit, Glob 및 Bash 호출을 내보내고, Leaf 하네스가 이를 격리된 리포지토리 샌드박스 안에서 실행해 출력을 반환하며, 루프는 모델이 호출을 멈출 때까지 계속됩니다. 평가는 약 131K의 총 토큰 안에서 150스텝으로 실행되었고, 어시스턴트 턴당 최대 8,192개의 토큰이 생성되었습니다. 서빙에는 Qwen3 추론 파서와 Qwen3 코더 도구 호출 파서를 갖춘 SGLang이 필요합니다 — 이걸 잘못 설정하면 하네스가 JSON을 기대하는 자리에서 모델이 산문을 내놓게 되는데, 밖에서 보기에는 모델이 완전히 망가진 것처럼 보입니다.

Intern-Decision-4B의 규약은 단 한 번의 호출로 끝나며 경계가 엄격합니다. 질문과 선택지는 순서를 그대로 유지합니다. 선택지는 단일 토큰 심볼에 매핑됩니다 — A부터 Z, 그다음 a부터 z, 그다음 0부터 9, 이는 질문이 최대 62개의 선택지로 제한되는 산술적 이유입니다. 래퍼의 상한은 8,192 토큰이며, InternLM의 카드에는 더 긴 입력이 잘림 없이 거부된다고 명시되어 있습니다. 세 가지 질문 유형이 지원됩니다: choice(순서가 있는 기준 맵 사용), score(목록 또는 숫자 키 맵 사용), noul(이진형). 최대 8개의 이미지가 허용되며, 해당 토큰도 동일한 8,192에 포함되어 계산됩니다.

출력 형태 — FrogNano-4B-2609는 도구 호출, 추론 텍스트, 패치를 내보낸다. Intern-Decision-4B는 필드당 하나의 심볼만 내보내고 그 외에는 아무것도 내보내지 않는다.

• 결정론 — FrogNano는 세 개의 시드에 걸쳐 온도 0.6에서 샘플링하므로 설계상 확률적입니다. Intern-Decision-4B의 argmax는 순전파에 의해 고정되며, 피팅된 온도는 그 신뢰도만을 변화시킵니다.

• 실패 표면 — FrogCan은 API를 환각하거나, 편집을 과도하게 넓히거나, 취약점을 도입하면서 테스트를 통과할 수 있으며, 이 모두는 그 카드가 이름을 붙이는 항목입니다. Intern-Decision-Cannot은 답을 환각할 수 없습니다. 왜냐하면 당신이 제공한 선택지 중에서 고를 수 있을 뿐이기 때문입니다 — 그것은 오직 잘못 보정될 수 있을 뿐입니다.

• 입력 상한 — 평가된 구성에서 FrogNano는 대략 131K 결합 토큰인 반면, Intern-Decision-4B는 하드 한도 8,192이며, 이는 16배 차이이고 우회 방법이 없습니다.

• 비용 구조 — FrogNano는 궤적 단위로 과금하는데, 궤적은 길다. Intern-Decision-4B는 청구할 출력 토큰이 전혀 없다.

• 파라미터 — FrogNano 카드는 "500M-5B" 범위를 제시하고 약 4.66B로 설명하며, 9.32GB BF16 다운로드를 제공합니다. Intern-Decision-4B는 4.54B로 명시되며, 언어 샤드와 함께 612MB 비전 타워와 54MB 프로젝터가 있습니다.

이 짝을 결정하는 숫자

InternLM의 카드에는 Intern-Decision-4B가 단일 RTX 4090에서 로컬 Hugging Face 경로를 통해 평균 지연 시간 44.16ms, 중앙값 44.03ms, P95 44.60ms를 기록한다고 나와 있습니다. 그 편차를 다시 읽어보세요. 중앙값에서 꼬리까지는 1밀리초도 훨씬 안 됩니다. 고정된 형태의 순전파에는 변할 것이 거의 없기 때문입니다. 이것이 바로 이 아키텍처에 대한 전체 논거입니다.

FrogNano의 대응 수치는 밀리초 단위가 아니다. 그 평가는 과제당 150단계 예산과 10,800초의 에이전트 상한을 허용했다. 이 둘은 비교 가능한 단위가 아니며 지연 시간 주장과 같은 문장에 절대 넣어서는 안 된다 — 하지만 그 둘은 트레이드오프의 형태를 알려주긴 한다. 한 모델은 44밀리초 만에 결정에 답하고, 다른 모델은 패치를 쫓아가며 몇 분 동안 도구 호출에 시간을 쓴다. 당신의 문제가 “이 티켓을 여섯 개 큐 중 하나로 라우팅하고 당신이 얼마나 확신하는지 알려줘”라면, 첫 번째는 두 번째의 더 저렴한 버전이 아니라, 다른 기계다.

두 연구소 모두 스스로를 신중하게 측정했으며, 두 측정값 세트는 모두 결과라기보다 의도로 읽어야 한다. InternLM은 1,728개의 지정된 캘리브레이션 사례에서 온도 1.99241824로 피팅하여 7세트 평균 90.02, 브라이어 점수 0.347, 기대 캘리브레이션 오차 0.065를 보고한다. Microsoft는 SWE-bench Verified에서 39.4%에서 61.5%로의 5회 반복 상승을 보고하며, 같은 논문의 부록은 동일한 진행 과정을 48.2%, 53.4%, 58.3%, 58.6%, 61.6%로 보고한다 — 이는 한 연구소 안에서조차 같은 사실을 두 가지 방식으로 측정하면 두 개의 사다리가 나온다는 것을 상기시킨다.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Intern-Decision-4B'. The left column reads Output tool calls and patch, Latency minutes per trajectory, Context about 131K evaluated, Independent evals none, Base Qwen3.5-4B, and Score 61.5% SWE-bench Verified vendor. The right column reads Output one symbol per field, Latency 44.16 ms mean, Context 8,192 tokens rejected above, Independent evals none, Base Qwen3.5-4B, and Score 90.02 seven-set average vendor. A footer reads 'Both scoreboards vendor-reported; no third party has reproduced either.'

단서는 각 카드가 무엇을 경고하기로 선택하는지에 달려 있다

두 카드 모두 이례적으로 솔직한데, 그 솔직함은 서로 반대 방향을 가리킨다 — 이 점이 이 비교에서 가장 유용한 부분이다.

Microsoft의 알려진 한계 섹션은 배포 경고처럼 읽힌다. 영어와 Python만 지원한다. 성능은 및 테스트 품질에 민감하다. 테스트를 통과했음에도 부정확하거나 안전하지 않을 수 있는 패치. 카드 자체의 문장은 FrogNano가 "무제한 자율 배포를 위해 독립적으로 안전 정렬된 것으로 간주되어서는 안 된다"라는 것이며, 구체적인 격차를 명시한다: 에이전트 특화 포스트트레이닝은 안전 선호, 거부 또는 적대적 데이터를 사용하지 않았는데, 대신 기능적 정확성과 회귀 회피를 최적화했기 때문이다. 또한 1.71%의 병렬 도구 호출률을 자발적으로 밝히는데, 이는 하네스가 허용함에도 모델이 한 턴에 두 도구를 거의 발동하지 않는다는 뜻이다 — 팀이 회복시키려고 통합 단계를 추가한 실제 역량 격차다.

InternLM의 카드는 정반대 종류의 문제를 경고한다. 경고할 만한 환각 표면이 없으므로, 주의 사항은 입력에 관한 것이다: 8,192 거부, 62개 옵션 상한, 그리고 기반 텍스트 타워가 262,144토큰 위치 한도를 선언했지만 공개된 래퍼는 이를 사용하기를 거부한다는 사실이다. 그 위험은 확신에 찬 숫자가 마땅히 받아야 할 정도를 넘어서까지 신뢰된다는 점이며, 그 카드는 보정이 Jev 기준선과의 격차를 좁히지만 모든 슬라이스에서 그 격차를 닫지는 않는다는 점을 솔직히 밝힌다.

함께 읽어 보면 이들은 두 가지 서로 다른 신뢰 태도를 설명한다. FrogNano는 행동하기 때문에 감독이 필요하다. Intern-Decision-4B는 점수를 매기기 때문에 감사가 필요하다 — 그리고 프로덕션 의사 결정을 움직이는 숫자는 아무도 테스트해야 한다고 생각하지 않는 바로 그런 종류의 출력이다.

라우터가 어울리는 자리, 그리고 둘 모두에 관한 솔직한 메모

두 모델 모두 호스팅 엔드포인트가 아닙니다. FrogNano는 가중치와 Kubernetes 평가 하네스로 제공되며, Intern-Decision-4B는 네 개의 샤드를 다운로드한 뒤 임포트하는 Python 클래스로 제공됩니다. 실제 환경 앞단에서 둘 중 하나를 시험해 보고 싶은 팀에게 안전한 패턴은 둘 모두에 동일하며, 전혀 화려하지 않습니다. 실험적 구성 요소를 폴백 뒤에 두어, 잘못된 궤적이나 보정이 어긋난 날이 인시던트가 아니라 재시도 비용으로 끝나게 하는 것입니다.

그런 패턴은 라우팅 계층이 존재하는 이유입니다. OrcaRouter는 OpenAI 호환 키 하나로 200개 이상의 모델을 운영합니다 0% 마크업으로 — 공급자 정가가 그대로 전달되고, 그래서 벤더 가격 변경이 같은 날 우리 쪽에 반영됩니다 — 그리고 그 페일오버는 여러분이 폴백으로 삼는 범용 모델 앞에 자리할 뿐, 이 두 모델 앞에 있는 것이 아닙니다. 분명히 말하자면, 우리는 FrogNano-4B-2609나 Intern-Decision-4B를 취급하지 않으며, 둘 다 출시 일정도 없습니다. 단일 엔드포인트가 여기서 주는 이점은 비교 자체가 저렴해진다는 것입니다 — 자격 증명 하나, 청구 라인 하나, 그리고 전문 모델을 비교하는 기준이 되는 범용 모델을 교체할 때마다 두 번째 통합을 만들 필요가 없다는 것.

A screenshot of the internlm/Intern-Decision-4B model card on Hugging Face showing the model heading and the Qwen3.5-4B base-model line, the five-step explanation of how inference works (single-token symbol mapping, one causal forward pass, a softmax over each field's allowed symbols and the checkpoint's probability calibration), the Benchmark results table listing Intern-Decision-0.8B, Intern-Decision-2B and Intern-Decision-4B against the Jev, Laya, SemIf, Kev and JevK5 comparison rows, and the inference latency table with the 4B row at 44.16 ms mean, 44.03 ms median and 44.60 ms P95.

어느 것, 그리고 언제

프롬프트에 이미 답이 존재하고, 초당 수천 건의 속도로 신뢰도까지 붙여 그 답을 선택해야 할 때 Intern-Decision-4B를 사용하세요. 고정 분류 체계 라우팅, 루브릭 채점, 스키마 제약 추출, 닫힌 레이블 세트에 대한 모더레이션. 44밀리초의 포워드 패스와 출력 토큰 청구액 제로가 바로 제품이며, 신뢰하기 전에 감사해야 할 대상은 캘리브레이션입니다.

정답이 아직 존재하지 않고 저장소를 읽고 테스트를 실행해 알아내야 할 때는 FrogNano-4B-2609를 택하라. 그것은 몇 분이 걸리는, 샌드박스화된, 검토 가능한 과정이며, SWE-bench Verified에서의 61.5% — 공급업체가 보고했고 재현되지 않은 — 는 4B 체크포인트가 애초에 그것을 해낼 수 있다는 현 시점 최고의 증거다.

어느 쪽으로도 용납되어서는 안 될 것은 그들의 점수를 비교하는 습관이다. 90.02의 7개 세트 평균과 61.5의 SWE-bench Verified 비율은 서로 다른 두 질문에 대한 측정값으로, 두 연구소가 두 개의 하네스에서 산출한 것이며, 어느 숫자도 제3자의 손을 거치지 않았다. 그 둘은 조상만 공유할 뿐, 그 외에는 아무것도 공유하지 않는다.

A screenshot of the file listing for the microsoft/FrogNano-4B-2609 repository on Hugging Face showing the model header with its size and the Safetensors, qwen3_5 and license:mit tags, the two safetensors shards model-00000-of-00002 and model-00001-of-00002, the config, tokenizer, vocab, merges, chat template and preprocessor files, and the commit column listing 'Update README.md', 'Upload FrogNano 4B SWE checkpoint' and 'Update FrogNano 4B README.md' across two contributors and four commits.

공통 조상으로부터 나온 유일하게 진짜 유용한 예측은 이것이다. 두 모델 모두 같은 4B 체크포인트에서 출발하기 때문에, 둘 사이의 차이는 거의 전적으로 포스트트레이닝에 있다. 즉 Qwen3.5-4B 위에 무언가를 만들려는 사람에게 흥미로운 질문은 이 두 가지 보상 구조 중 어느 쪽이 자기 도메인으로 전이되는가이다. 자체 정책에 맞춰 보정하는 합성 과제 루프인가, 아니면 적합된 온도를 가진 고정 형태의 스코어링 헤드인가. 이 둘은 두 가지 레시피이며, 둘 다 공개되었고, 둘 다 아직 다른 누구에게도 돌려보게 하지 않은 연구소들에서 나왔다. 이는 드문 상황이며, 곧바로 받아들이기보다는 지켜볼 만한 일이다.