
FrogNano-4B-2609: Microsoft가 4B 코딩 에이전트를 Hugging Face에 출시하고도 전혀 발표하지 않았다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
이 저장소는 2026년 9월 17일 최초 커밋과 함께 공개되었고, 체크포인트 자체는 4분 뒤에 올라왔습니다. 그다음에는 아무것도 없었습니다. Microsoft AI의 트윗도, Microsoft Research 블로그 게시물도, 출시 페이지도 없었습니다. 7주가 지난 뒤에도 microsoft/FrogNano-4B-2609 — 40억 규모급 코딩 에이전트이자 Qwen3.5-4B를 기반으로 구축된 이 모델에는 여전히 이를 뒷받침하는 발표가 없으며, 그 침묵이야말로 이 모델의 공개에 관한 가장 중요하고도 유일한 사실입니다. 이 모델에게 있는 것이라고는 논문과 하네스를 내세우는 모델 카드, 알고 보니 논문이 아니라 하네스로 밝혀진 GitHub 저장소, 그리고 createdAt이 9월 17일이라는 사실뿐인데, 이는 "Release date 22-SEP-2026"이라고 적힌 카드 아래에 놓여 있습니다. 두 날짜 모두 즉흥적으로 정해진 것이고, 어느 쪽도 틀리지 않았지만, 서로 어긋납니다.
실제로 게시되는 것은 무엇인가요?
아래의 모든 내용은 지금 허브에서 확인할 수 있으며, 이 글의 모든 수치는 Microsoft 자체 카드 또는 리포지토리 자체의 바이트 수에서 나온 것입니다. 제3자가 재현한 것은 아무것도 없습니다 — Artificial Analysis 항목도, 아레나 평점도, FrogNano에 대한 독립적 평가도 어디에도 없습니다.
• 가중치 — Microsoft 조직 산하의 공개 저장소 하나, 게이트 없음, 허브에서 MIT 태그 지정, 파일 15개, 다운로드 게이트도 서명할 동의서도 없음.
• 디스크상의 가중치 — 두 개의 safetensors 샤드에 걸쳐 9.32 GB, 옵티마이저가 없는 파일 세트를 포함한 596억 바이트의 리포지토리 데이터, 인덱스에 738개의 텐서.
• 아키텍처 — Qwen3_5ForConditionalGeneration는 Qwen3.5-4B에서 물려받은 32층 dense 하이브리드 스택이며, 카드에 따르면 물려받기만 하고 사후 학습된 적이 없는 24층 비전 타워를 함께 갖추고 있습니다.
• 카드 자체의 매개변수 필드 — "500M-5B". 이는 숫자가 아니라 대역이며, 다운로드가 더 정확한 문서입니다.
• 라이선스 — 카드의 앞부분에는 MIT라고 적혀 있다. 카드 본문에는 Apache License 2.0이라고 적혀 있고, GitHub 하네스에는 실제로 MIT LICENSE 파일이 포함되어 있다. 이 두 진술은 같은 릴리스 내 서로 다른 산출물에 관한 것이다.
• 발표 — 없음. Microsoft Research 블로그에도, 팀 자체 연구 사이트에도, Hugging Face 조직 피드에도 리포지토리 목록 외의 어떤 형태로도 없었습니다.
그 마지막 문장은 독자가 이 글의 나머지 부분을 읽는 자세를 정해 줘야 하는 문장이다. 조용히 업로드된 체크포인트는 공식 발표된 것보다 못한 결과물이 아니다 — 오히려 그 카드는 더 길 때가 많다. 아무도 보도자료용으로 줄여 편집하지 않기 때문이다. 하지만 그것은 공식 발표된 릴리스가 공짜로 얻는 단 하나의 필터, 즉 다른 사람들이 그것을 들여다보는 과정을 거치지 않았다.

점수들, 그리고 그 모든 점수를 만들어낸 사람
마이크로소프트는 FrogNano가 SWE-bench Verified에서 61.5%, SWE-bench Pro에서 37.6%, Terminal-Bench 2.0에서 31.1%, PatchEval-Verified에서 47.3%를 달성했다고 보고합니다. 이는 모두 Leaf 하네스를 통해 측정된 Avg@3 해결률입니다. 같은 모델 카드는 출발점도 제시합니다. Qwen3.5-4B는 동일한 하네스와 예산 아래에서 SWE-bench Verified에서 39.4%를 기록했습니다. 다섯 차례의 강화 학습 반복을 거치며 49.1%, 53.1%, 56.7%, 59.1%, 61.5%에 도달했습니다. 이는 베이스 모델보다 22.1포인트 높은 수치이며, 마이크로소프트 자체 설명에서는 약 56%의 상대적 개선으로 반올림합니다.
그 사다리와 관련해서는 두 가지를 잠시 짚고 넘어갈 만하다. 그 두 가지는 요약이 잘못될 수 있는 지점이지, 벤더가 잘못한 지점은 아니기 때문이다.
첫 번째는 Iter 5 불일치입니다. 카드의 헤드라인 표에는 최종 이터레이션에 대해 61.5%라고 나와 있습니다. 논문 자체의 효율성 부록은 동일한 다섯 개 체크포인트 추이를 48.2%, 53.4%, 58.3%, 58.6%, 61.6%로 보고합니다. 마지막 숫자만 근접하며, 누구나 인용하는 숫자도 마지막 숫자뿐입니다. 최종 수치는 안정적인 결과로, 중간 단계들은 서로 다른 것의 측정으로 취급하십시오. 다른 집계 아래에서는 그것들이 분명히 서로 다른 것의 측정이기 때문입니다.
두 번째는 FrogNano가 출발점이 된 모델보다 모든 측면에서 일률적으로 더 나은 것은 아니라는 점이다. 공개된 병렬 도구 호출률은 1.71%다. 모델 카드는 이후 반복 개발에서 한 턴에 여러 도구 호출을 실행하는 능력을 잃었고, 팀의 통합 작업이 부분적으로 이를 회복하기 위해 존재한다는 점을 솔직히 밝히고 있다. 더 많은 문제를 해결하면서도 동시 호출은 거의 발생시키지 않는 모델은 각주가 아니라 실제 엔지니어링 트레이드오프다.

하네스가 곧 제품이고, 저장소가 곧 하네스다
FrogNano는 스스로 실행되지 않습니다. 다섯 개의 도구 — Read, Write, Edit, Glob 및 Bash — 에 대한 구조화된 호출을 내보내며, 무언가가 이를 격리된 환경에서 실행하고 출력을 돌려주어야 합니다. 그 무언가가 Leaf이며, 여기서 그 흐름은 다소 특이하게 흘러갑니다.
모델 카드의 "추가 관련 자산" 행은 기술 보고서를 다음 링크로 연결합니다: aka.ms/frognano-tech-report 그리고 하네스를 다음 링크로 연결합니다: github.com/microsoft/FrogNano. 해당 aka.ms 링크는 PDF를 가리키지 않습니다. arXiv 초록 페이지로 곧바로 리디렉션되며, 실제 보고서는 바로 그곳에 있습니다. 한편 GitHub 저장소에는 학습 코드도, RL 레시피도, 체크포인트도 없습니다. 자체 README는 OpenAI 호환 엔드포인트를 대상으로 Kubernetes 샌드박스에서 코딩 에이전트를 실행하는 평가 하네스를 설명하고, 학습 내용에 대해서는 arXiv 논문을 다시 가리킵니다. 따라서 모델 카드의 두 자산 링크는 논문을 가리키는 포인터와 논문에 대한 답변을 가리키는 포인터이며, 이름은 공유된 것입니다.
이 모델을 사용할 계획이라면 누구에게나 실질적인 이유로 중요한 사항입니다. 문서에 나온 서빙 레시피는 SGLang에 --reasoning-parser qwen3 및 --tool-call-parser qwen3_coder를 사용하는 것이며, 하네스는 이미 도구 호출과 추론을 지원하는 엔드포인트를 원합니다. 파싱 구성을 조금만 잘못 맞추면 모델은 하네스가 JSON을 기대하는 자리에서 텍스트를 생성하는데, 외부에서 보면 이는 잘못된 구성이 아니라 잘못된 모델처럼 보입니다. 카드에는 일치하는 점수를 얻으려면 일치하는 체크포인트, 토크나이저, 서빙 구성, 작업 이미지 및 평가 프로토콜이 필요하다고 명시되어 있습니다 — 이는 벤더가 하네스가 결과의 절반이라고 말하는 것입니다.
또한 하드웨어를 산정하는 모든 분께 분명히 말해둘 점이 있습니다: 카드의 평가 컨텍스트에서 9.32GB 체크포인트는 9.32GB 추론 문제가 아닙니다. 평가는 약 131K개의 합산 토큰과 150스텝 예산으로 실행되었습니다. 메모리는 가중치가 아니라 컨텍스트에 따라 확장되며, 카드에는 최소 GPU 구성이 여전히 "출시 전에 검증되어야 한다"고 적혀 있습니다. 이는 이미 다운로드 가능한 모델에 나타나는 문구입니다.
그 훈련이 실제로 무엇을 했는지, 한 문단으로.
이 논문의 기여는 모델이 아니라 루프다. TaskPilot은 실제 저장소 스냅샷으로부터 소프트웨어 엔지니어링 후보 작업을 생성하고, 현재 체크포인트로부터의 롤아웃을 이들에 대해 실행하며, 정책이 때때로 해결할 수 있는 경계 근처에 있는 작업은 유지하고, 영구적으로 사소하거나 영구적으로 불가능한 후보는 버린다. 수용된 집합은 다음 체크포인트를 학습시킨다. 그다음 체크포인트는 다음 라운드의 작업 생성을 보정하므로, 작업 분포는 정책이 움직이는 대로 움직인다. 총 약 1,500개의 검증된 환경. 증류는 없다: 카드는 에이전트 특화 사후 학습이 더 강력한 모델의 해결 궤적, 행동, 추론 트레이스 또는 패치 대상을 사용하지 않았다고 분명히 명시한다. 더 강력한 모델은 작업을 작성한다; 답을 시연하지는 않는다.
Microsoft는 그 루프를 5회 반복 실행했고, 어떤 통합도 수행하기 전에 8.7포인트 향상을 보고했으며, 추론 트레이스가 개선되는 속도보다 더 빠르게 길어지고 있었기 때문에 실행 중간에 로그 길이 페널티가 추가되었다.
모델 카드는 이 전체 접근 방식이 어디에서 취약한지에 대해 이례적으로 솔직하다. 훈련 데이터는 Python에 치우쳐 있고 주로 영어다. 카드에 명시된 지원 자연어 집합은 영어뿐이며 그 외에는 없고, 기본 모델의 더 넓은 다국어 지원은 명시적으로 주장되지 않는다. 성능은 하네스와 테스트 품질에 민감하다. 생성된 패치는 "사용 가능한 테스트를 통과했음에도 부정확하거나 안전하지 않을 수 있다." 4B의 모델 카드는 그 문단을 모든 독자가 새겨야 할 문장으로 맺는다. 자격을 갖춘 인간 검토와 독립적인 회귀 및 보안 테스트 없이는 사용해서는 안 된다. 이는 공급업체 산출물에 관한 공급업체의 진술이며, 위에 있는 어떤 점수판 행보다도 더 유용한 문장이다.
이것이 구매자를 어디에 남기는지, 그리고 라우터가 어디에 맞는지
FrogNano는 호출하는 모델이 아니다. 자사 API도, 호스팅된 엔드포인트도, 서버리스 이미지도 없다. 그것은 체크포인트이며, 이를 사용한다는 것은 Kubernetes가 호스팅하는 샌드박스 뒤에 자체 SGLang 배포를 세우거나, 이미 운영 중인 에이전트 스택 안의 구성 요소로 평가하는 것을 의미한다. 그것이 오늘날의 전체 도입 경로이며, 어떤 발표도 그 형태를 바꾸지 못했을 것이다.
여기서 라우팅 계층이 솔직히 할 수 있는 일은 처음 들리는 것보다 범위가 좁습니다. 자체 호스팅 FrogNano를 자체 하네스 안에서 호스팅형 코딩 모델과 비교하려는 계획이라면, 호스팅되는 쪽이 두 번째 계약 대신 하나의 키 뒤에 있는 덕을 보는 쪽입니다: OrcaRouter는 OpenAI 호환 단일 엔드포인트 뒤에 200개 이상의 모델을 제공합니다0% 마크업으로, 즉 공급자 정가가 그대로 전달되고 공급업체 가격 변경이 같은 날 우리 쪽에 반영됩니다. 이는 단일 벤치마크 수치가 아니라 해결된 이슈당 비용으로 결과가 결정되는 비교 평가에서 중요합니다. 우리는 FrogNano를 호스팅하지 않으며 그에 대한 일정도 없습니다. 가중치와 서빙 작업은 여러분 몫입니다.

그것을 해결할 세 가지
먼저, 독립적인 재현입니다. 이 글의 모든 수치 — 61.5, 37.6, 31.1, 47.3 — 는 모델을 학습시킨 연구소가, 같은 연구소가 유지 관리하는 하네스에서, 같은 연구소가 측정한 베이스 모델 수치에 대비해 산출한 것입니다. 이는 완전하고 내적으로 일관된 그림이며, 동시에 닫힌 루프이기도 합니다. 유용한 테스트는 아무런 이해관계가 없는 누군가가, Microsoft가 해당 과제 세트에 수행한 보정 작업 없이, 동일한 500개 과제에서 39.4에서 61.5로의 상승을 재현할 수 있는지입니다.
둘째, 누군가는 하네스 주장을 엔드 투 엔드로 검증해야 한다. 저장소는 공개되어 있는데, 이는 많은 릴리스가 해내지 못하는 일이지만, 그 저장소는 평가 장비다. 다섯 가지 도구와 샌드박스 격리가 진정한 성능 메커니즘이라면, 공개된 구성을 실행하는 제3자는 공개된 수치에 근접해야 한다. 그렇지 않다면, 그 격차가 진짜 발견이다.
셋째, 답변 비용이 가장 적게 드는 사안: Microsoft는 이것이 제품인지 논문용 아티팩트인지 말해야 합니다. 카드의 배포 섹션은 가중치, 카드, 하네스를 결과물로 취급하는데, 이는 출시라기보다 논문 게재처럼 읽힙니다. "Release date 22-SEP-2026"은 출시처럼 읽힙니다. 발표된 모델이라면 블로그 글의 첫 문장에서 그 모호함을 해소했을 텐데, 블로그 글은 없습니다.
그때까지 올바른 자세는 그 릴리스 자체가 암시하는 자세다. FrogNano-4B-2609는 실제로 다운로드 가능한, MIT-Apache-그리고-어쩌면-아닐 수도 있는 체크포인트로, 유난히 철저한 카드, 공개 평가 하네스, 하나의 방법론적 아이디어, 그리고 Microsoft 주소가 없는 사람은 아무도 건드린 적 없는 스코어보드를 갖추고 있다. 연구실 입장에서 그것은 완전하고 흥미로운 아티팩트다. 새벽 3시에 저장소 앞에 에이전트를 세우려는 팀에게 그것은 따라가 볼 가치는 있지만 아직 내릴 결정은 아닌 단서다.
