생성된 타이틀 카드에는 'FrogNano-4B-2609 vs Gemma 4 12B'라고 적혀 있고, 부제는 '11.95B 멀티모달 제너럴리스트에 맞선 4B 리포지토리 에이전트'이며, 세 개의 칩에는 '61.5% SWE-bench, 벤더 보고', '72.0% LiveCodeBench, 벤더 보고', '공유 벤치마크 없음'이라고 적혀 있고, 푸터에는 '겹치는 부분이 없는 서로 다른 벤치마크; 두 스코어보드 모두 벤더 보고'라고 적혀 있으며, OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있다.
Guides & Insights

FrogNano-4B-2609 vs Gemma 4 12B: SWE-bench에서 61.5%, 그리고 아무도 이를 확인하지 않았다

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Microsoft의 FrogNano-4B-2609는 40억급 코딩 에이전트입니다. 그 기반은 Qwen3.5-4B입니다. 이 에이전트는 SWE-bench Verified에서 61.5%를 보고합니다. Gemma 4 12B는 DeepMind의 119억 5천만 파라미터 인코더 없는 멀티모달 모델이며, 해당 모델 카드는 LiveCodeBench v6에서 72.0%를 보고합니다. 이 두 숫자를 구매자는 나란히 놓고 볼 것이고, 그것을 나란히 놓는 것이 바로 실수입니다. 이들은 서로 다른 벤치마크, 서로 다른 하네스, 서로 다른 연구소에서 나왔으며 — 더 중요하게는 — 그중 하나만이 외부인이 읽어본 공개 평가 방법론을 갖고 있습니다. 이 맞대결에 관한 나머지 모든 것은 각 모델이 실제로 무엇인지의 문제이며, 답은 이들이 애초에 같은 범주에 속하지 않는다는 것입니다.

아래의 FrogNano 수치는 Microsoft의 모델 카드와 기술 보고서에서 나온 것으로, 둘 다 9월부터 공개되었으며 연구소 외부의 누구도 이를 재현하지 않았다. Gemma 4 12B 수치는 Google의 모델 카드에서 나온 것으로, 이것 역시 공급업체 문서다. 차이는 Gemma의 수치에는 20주와 약 260만 다운로드에 걸친 검증이 뒷받침되어 있는 반면, FrogNano에는 2주와 한 자릿수를 넘지 못한 다운로드 카운터가 있다는 점이다.

각 모델의 용도

이것이 바로 스펙 시트가 숨기는 부분이다. FrogNano-4B-2609는 우연히 코드를 잘하는 범용 모델이 아니다. 그것은 전체 포스트트레이닝이 저장소 수준의 소프트웨어 엔지니어링으로 이루어진 체크포인트이며, 대화를 나누기보다는 하네스로 구동되도록 설계되었다.

이 모델의 다섯 가지 도구는 다음과 같습니다: Read, Write, Edit, Glob 및 Bash. 이 모델은 이 도구들에 호출을 보내고, 샌드박스가 이를 실행해 출력을 반환하며, 모델이 요청을 멈출 때까지 루프가 실행됩니다. 평가된 구성은 약 131K의 결합 토큰 내에서 150번의 상호작용 단계이며, 각 작업마다 하나의 후보 패치를 생성했습니다. Microsoft의 모델 카드는 이 모델이 재현 가능한 환경과 실행 가능한 테스트 스위트를 갖춘 영어로 된, Python 비중이 높은 저장소를 위한 것이며, 기본 모델에서 상속된 이미지 및 비디오 구성 요소는 사후 학습된 적이 없고 지원되지 않는다는 점을 분명히 밝히고 있습니다.

Gemma 4 12B는 정반대 형태입니다. 256K 컨텍스트를 갖춘 48개 레이어의 통합 모델이며, 별도의 비전 또는 오디오 인코더가 없습니다. 원시 이미지 패치와 오디오 파형은 경량 선형 레이어를 통해 단일 디코더의 임베딩 공간으로 곧바로 투영됩니다. 텍스트, 이미지, 오디오를 입력으로 받아 텍스트를 출력합니다. 시스템 프롬프트의 토큰으로 트리거되는 사고 모드, 네이티브 함수 호출 기능을 갖추고 있으며, Google의 카드에는 의도된 용도 중 하나로 에이전트형 워크플로를 명시적으로 나열하고 있습니다.

그러니까 진짜 질문은 어느 쪽이 더 똑똑한가가 아니다. 당신이 직접 운영해야 하는 장비 안에서만 작동하는 특화된 구성 요소를 원하는지, 아니면 여러 가지 일을 꽤 잘 해내면서 어떤 것에 의해서든 호출될 수 있는 범용 모델을 원하는지다.

A screenshot of the google/gemma-4-12B-it model card on Hugging Face showing the Gemma 4 12B Unified heading, the Any-to-Any, Transformers, Safetensors and image-text-to-text tags, the Apache 2.0 license line credited to Google DeepMind, and the model overview explaining that text, audio, image and video inputs are handled without separate encoders.

줄별로, 실제로 다른 부분

• 매개변수 — FrogNano-4B-2609는 자체 설명에 약 46억 6천만이라고 적힌 카드에 "500M-5B"라는 범위를 공개하지만, 다운로드로 보면 BF16 가중치 9.32GB로 확정된다. Gemma 4 12B는 11.95B이며, 단 한 번 명시되고 결코 얼버무려지지 않는다. 그 비율은 대략 2.6대 1이고, 이는 여러분이 임대해야 하는 것에 직접적으로 나타난다.

• 맥락 — FrogNano의 평가 구성은 합산 약 131K 토큰이며, 추론과 도구 출력이 예산을 공유합니다. Gemma 4 12B는 256,000개 토큰을 지원하고, 자체 롱컨텍스트 행에서 128K에서 8개 니들을 사용한 MRCR v2 43.4%를 기록합니다. 창이 거의 두 배이며, 두 번째 숫자는 역량 주장이 아니라 공개된 측정치입니다.

• 모달리티 — FrogNano-4B-2609는 텍스트 입력, 텍스트 출력이며, 체크포인트에 비전 타워가 있음에도 불구하고 그렇습니다. Gemma 4 12B는 텍스트, 이미지, 오디오 입력입니다.

• 출력 상한 — 검증된 FrogNano 구성은 어시스턴트 턴당 8,192개의 생성된 토큰을 허용하며, 해당 카드에는 RL 훈련 구성이 동일한 상한을 사용했다고 명시되어 있습니다. Gemma 4 12B는 이에 상응하는 단일 턴 상한을 공개하지 않습니다; 여기서 제약은 256K 윈도우입니다.

• 에이전트 인터페이스 — FrogNano는 구조화된 Leaf 호출을 생성하며 이를 실행할 하네스가 필요합니다. Gemma 4 12B는 인스트럭션 튜닝된 형태로 네이티브 함수 호출을 제공하며 직접 호출할 수 있습니다.

• 라이선스 — Gemma 4 12B는 Google의 Gemma 4 약관에 따라 Apache 2.0이며, 이는 명확히 명시되어 있다. FrogNano의 카드는 앞부분에서는 MIT이고 자체 본문에서는 Apache 2.0인데, 이런 종류의 모호함은 각주로 끝나는 게 아니라 결국 법률 검토로 이어진다.

• 숫자 — FrogNano는 SWE-bench Verified 61.5%, SWE-bench Pro 37.6%, Terminal-Bench 2.0 31.1%, PatchEval-Verified 47.3%를 보고합니다. Gemma 4 12B는 MMLU Pro 77.2%, LiveCodeBench v6 72.0%, Codeforces ELO 1659, GPQA Diamond 78.8%, Tau2 69.0%를 보고합니다. Google의 카드에는 SWE-bench 행이 공개되어 있지 않고, Microsoft의 카드에는 LiveCodeBench가 공개되어 있지 않습니다. 두 점수표 사이에는 전혀 겹치는 부분이 없습니다.

그 마지막 불릿이 숫자로 비교하는 본능을 끝내야 하는 항목이다. 두 카드 모두에 등장하는 벤치마크는 하나도 없다. 61.5를 72.0에 맞세운 독자는 리포지토리 해결률을 경쟁 프로그래밍 통과율과 비교한 셈인데, 이는 둘 다 초 단위라는 이유로 마라톤 기록과 100미터 기록을 비교하는 것과 거의 같다.

구글의 SWE-bench 침묵이 적신호가 아닌 이유

불릿 목록에서 나오는 유혹적인 결론은 FrogNano에는 실제 SWE-bench 수치가 있고 Gemma에는 없으므로 FrogNano가 코딩 질문에서 이긴다는 것이다. 그 결론은 따라 나오지 않는다. 정확히 짚어볼 만한 이유가 있기 때문이다.

Gemma 4 12B는 Tau2에서 69.0%를 보고합니다 — 세 번의 실행에 걸친 에이전트형 도구 사용 벤치마크 — 그리고 함수 호출 지원과 에이전트형 워크플로에 대한 명시적 포지셔닝도 함께 내세웁니다. Tau2에서 69.0을 기록하는 모델은 에이전트 작업을 할 수 없는 모델이 아닙니다. 그것은 공급업체가 리포지토리 해결보다 도구 사용 성능을 보고하기로 선택한 모델입니다. Google은 또한 26B나 31B에 대한 SWE-bench 행을 보고하지 않으며, 이는 12B의 약점이라기보다 제품군 전체의 편집상 선택입니다.

한편 Microsoft 자체 논문에 나오는 이 직관에 반하는 결과는 Gemma 구매자라면 주의 깊게 읽어야 할 결과다. FrogNano는 일반 모델인 Qwen3.5-4B에서 출발하는데, 이 모델은 Leaf 하네스를 통해 SWE-bench Verified에서 39.4%를 기록했다. 약 1,500개의 합성 과제에 대한 다섯 차례의 강화 학습을 거치면서 61.5%로 올라섰다. 교훈은 "작은 모델은 코딩할 수 없다"가 아니다. 오히려 39.4%의 일반 4B 체크포인트가 유능한 에이전트 루프 안에서 실행되었을 때 이미 어렵고 사람이 검증한 이슈 세트의 3분의 1 이상을 해결하고 있었다는 점이다. Gemma 4 12B는 그 세 배 크기이며 20주 더 성숙했다. 아무도 그것을 Leaf로 실행해 본 적이 없고, 누군가 그렇게 하기 전까지 "Gemma는 repo 에이전트가 아니다"라는 말은 발견이 아니라 가정일 뿐이다.

스코어보드가 완전히 숨기고 있는 하네스 세금

여기에 실용적인 비대칭이 있으며, 바로 그것이 구매를 결정하는 요인입니다.

Gemma 4 12B는 모델입니다. 11.95B의 가중치를 다운로드하고, Transformers, vLLM 또는 SGLang이 그 가중치를 가리키도록 설정한 다음, 텍스트를 보내고 텍스트를 받으세요. Google은 서빙 경로를 공개했고, 라이선스는 명확하며, 260만 다운로드에 달하는 사람들이 이미 거친 부분들을 겪고 문서화했습니다. 작업이 "이 스택 트레이스를 요약해줘", "이 스크린샷을 읽고 무엇이 깨졌는지 알려줘", 또는 "이 인수들로 이 함수를 호출해줘"라면, 그것은 오늘도 작동합니다.

FrogNano-4B-2609는 모델에 하네스를 더한 것이며, Microsoft 자체 README에서도 하네스가 선택 사항이 아니라고 못 박고 있습니다. 저장소는 github.com/microsoft/FrogNano에 있으며, Leaf 평가 리그이지 학습 코드가 아닙니다 — Kubernetes 클러스터, 기존 네임스페이스, 파드와 네트워크 정책을 관리할 권한, 벤치마크 컨테이너 이미지에 대한 풀 액세스, 그리고 올바른 추론 및 도구 호출 파서로 구성된 OpenAI 호환 엔드포인트가 필요합니다. Microsoft의 카드는 일치 조건을 직설적으로 명시합니다: 동일한 점수를 얻으려면 체크포인트, 토크나이저, 서빙 구성, 작업 이미지 및 평가 프로토콜이 일치해야 합니다. 점수를 생성하는 릴리스의 절반이 바로 카드가 GitHub 링크를 가리키는 절반입니다.

그 안에는 실질적인 가치가 있으며, 이를 무시하기보다는 이름 붙일 가치가 있다. FrogNano의 기여는 현재 정책의 능력에 맞춰 학습 문제를 재생성하는 과제 합성 루프다 — 논문의 주장은 작은 에이전트가 전혀 증류 없이 합성 과제만으로 경쟁력 있는 수준까지 학습될 수 있다는 것이며, 이는 최전선 교사 모델을 감당할 수 없는 누구에게나 길을 열어준다. 그 API는 공개되어 있다. 그 방법들은 원칙적으로 재현 가능하다. 그것은 또 하나의 점진적 체크포인트보다 더 강한 기여이며, 동시에 대부분의 팀이 감수하려는 것보다 더 많은 작업이기도 하다.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs Gemma 4 12B'. The left column reads Parameters approx 4.66B with the card saying 500M-5B, Context about 131K evaluated, Input text only, Harness required Leaf with 5 tools, SWE-bench Verified 61.5% vendor, and Independent evals none. The right column reads Parameters 11.95B, Context 256,000 tokens, Input text, image, audio, Harness none required, LiveCodeBench v6 72.0% vendor, and Independent evals widely run. A footer reads 'Different benchmarks, no overlap; both scoreboards vendor-reported.'

하나를 선택한다면, 작업에 따라 선택하세요.

작업이 여러 모달리티를 섞거나, 무언가가 이미지를 보거나 오디오를 들어야 하거나, 컨텍스트가 큰 파일 트리와 긴 트랜스크립트를 동시에 담아야 하거나, 뒤에 두 번째 시스템 없이 어떤 프레임워크든 로드할 수 있는 모델을 원한다면 Gemma 4 12B를 선택하세요. 69.0 Tau2 점수와 네이티브 함수 호출 덕분에 에이전트 파이프라인에 정당화할 수 있는 선택이 되며, 누구도 연구소의 말을 그대로 믿을 필요가 없습니다 — 이 모델은 수천 명의 사람들에게 평가되었고 그 결과는 비밀이 아닙니다.

이미 샌드박스된 리포지토리 에이전트를 운영 중이고, 그 안에 넣을 4B급 체크포인트를 원하며, 보급형 하드웨어에 들어가는 9.32 GB 다운로드가 결정을 좌우하는 제약이라면 FrogNano-4B-2609를 선택하세요. 순서를 냉정하게 보세요: 당신은 점수를 사는 것이 아니라 방법론에 거는 것이며, 가장 먼저 알게 될 것은 당신의 폴링 루프와 도구 호출 파서가 Leaf와 충분히 닮았는지 여부입니다. 어떤 팀은 셋째 날 오후에 61.5%에 가까운 동작을 얻겠지만, 어떤 팀은 자신들의 평가 세트가 SWE-bench Verified보다 쉬웠다는 사실을 깨닫는 데 2주를 보낼 것이며, 연구소 밖에서는 아직 당신이 어느 쪽인지 알려줄 수 있는 사람이 없습니다.

결정이 정말로 팽팽하다면, 벤치마크를 공유하지 않는 공개된 수치를 두고 논쟁하기보다는 같은 하네스 안에서 둘 다 여러분의 실제 이슈에 돌려보는 것이 저렴한 실험입니다. OrcaRouter는 200개 이상의 모델을 하나의 OpenAI 호환 키 0% 마크업으로 제공하므로, 제공업체의 정가가 그대로 전달됩니다 — 덕분에 결정을 내리는 동안 호스팅된 범용 모델과 나머지 후보군을 단일 엔드포인트와 하나의 청구 라인 뒤에 둘 수 있습니다. FrogNano는 우리의 라우트 중 하나가 아니며 출시 일정도 없습니다. 가중치는 직접 호스팅해야 하는 다운로드입니다. 우리가 없앨 수 있는 것은 비교의 반대편에 있는 마찰입니다. 두 번째 계약, 두 번째 SDK, 두 번째 자격 증명 세트 없이 여러분의 하네스에서 후보 모델을 교체하는 일 말입니다.

A generated timeline card headed 'Two releases, twenty weeks apart' showing an upper bar labelled Gemma 4 12B uploaded 23 May 2026 with 2.6 million downloads across the family, and a lower bar labelled FrogNano-4B-2609 uploaded 17 September 2026 with no announcement, with a span marker of 20 weeks between them and a footer reading 'Download figures from Hugging Face on 3 October 2026.'

솔직한 요약은 61.5라는 숫자가 그것을 만든 연구소의 실제 작업이며, 현재 코딩에서 FrogNano를 선호할 유일한 이유라는 것입니다. Microsoft 외부의 누군가가 동일한 500개 과제에서 61.5를 재현하거나, 재현하지 못하게 되면 이 맞대결은 진정한 답을 얻게 됩니다. 그때까지 대부분의 팀에게 더 안전한 기본값은 깨끗한 라이선스, 공개된 긴 컨텍스트 측정값, 그리고 문서에 이미 흡수된 20주간의 다른 사람들의 실수를 갖춘 11.95B 모델입니다.