
FrogNano-4B-2609 vs Qwen 3.8: 가중치가 당신의 것일 때 코딩 에이전트에 드는 비용
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
microsoft/FrogNano-4B-2609은 직접 다운로드해 서빙하는, Qwen3.5-4B에서 파생된 40억급 저장소 에이전트입니다. Qwen3.8-Max는 호스팅형 플래그십으로, 토큰당 약 950억 개의 파라미터가 활성화되는 2.4조 파라미터 희소 전문가 혼합(MoE) 모델이며, 100만 토큰 멀티모달 창과 입력 토큰 100만 개당 $2.00, 출력 토큰 100만 개당 $6.00의 요금표를 갖추고 있고, 2026년 8월 3일부터 API 키로 접근할 수 있습니다. 둘 중 하나는 GPU 한 장과 오후 한나절이 듭니다. 다른 하나는 사용하기 전까지는 비용이 들지 않지만, 그러고 나면 흔히 쓰이는 가장 긴 트레이젝터리에서 토큰당 비용을 청구합니다. 진짜 대결은 벤치마크 표가 아니라 그 트레이드오프입니다.
이 글에 나오는 FrogNano 수치는 Microsoft의 모델 카드와 기술 보고서에서 가져온 것이고, Qwen3.8-Max 수치는 Alibaba가 공개한 가격과 자체 카탈로그의 모델 레코드에서 가져온 것이며, 독립적인 점수는 등장하는 모든 곳에서 Artificial Analysis 수치로 표기했습니다. 명칭을 주의 깊게 보세요. 오픈 웨이트 릴리스인 Qwen3.8은 발표되었지만 아직 출시되지 않았고, Qwen3.8-Max는 현재 서비스 중이며 가격이 책정되어 있습니다. 이 글에서 호출할 수 있는 모든 것은 후자입니다.
비교를 결정하는 산술
단일 작업에 드는 비용부터 시작하세요. 그것은 명백하지도 않고 작지도 않기 때문입니다.
FrogNano의 평가는 모든 궤적을 약 131K의 결합 토큰 안에서 150단계 예산으로 실행했으며, 어시스턴트 턴당 최대 8,192개의 생성 토큰, 그리고 10,800초의 상한을 적용했습니다. 공개된 두 한도를 곱하면 최악의 궤적 하나에 대해 약 123만 개의 생성 토큰이라는 상한이 나옵니다 — Qwen3.8-Max의 출력 토큰 100만 개당 $6.00 기준으로, 예산 끝까지 실행된 단일 작업에 약 $7.38입니다. 이는 공개된 두 숫자에 대한 산술이지 측정값이 아닙니다. 실제 궤적은 일찍 멈추고, 평균은 상한보다 훨씬 낮으며, 도구 결과와 셸 출력은 출력 요율이 아니라 더 저렴한 입력 요율로 청구됩니다. 하지만 이것은 그 실체의 윤곽을 잡아줍니다. 코딩 에이전트는 질문 하나에 수백 개의 토큰을 쓰지 않습니다. 자기 자신과의 길고 추론이 많은 대화에 토큰을 쓰며, 그 대화의 모든 토큰이 생성됩니다.
이제 원장의 다른 면을 그 옆에 나란히 놓아 보자. FrogNano-4B-2609는 두 개의 샤드에 담긴 9.32 GB의 BF16 가중치이며, 게이트 없이 다운로드할 수 있다. 이를 서빙하려면 Qwen3 추론 파서와 Qwen3 coder 도구 호출 파서를 갖춘 SGLang, 그리고 다섯 도구를 위한 격리된 샌드박스가 필요하다. 그다음부터 트래젝터리 하나의 한계 비용은 전기이며, 그것이 차지하는 메모리는 가중치의 무게가 아니라 여러분의 컨텍스트가 자라나는 만큼이다.
• 비용 모델 — FrogNano-4B-2609는 고정 하드웨어 비용이고 한계 비용은 거의 0입니다. Qwen3.8-Max는 고정 비용이 0이며 토큰당 과금이고, $2.00 / $6.00 분할은 앞쪽에 아무것도 미리 부과하지 않고 모든 것을 출력 요율로 뒤로 미룹니다.
• 그 돈으로 무엇을 얻을 수 있는가 — 자체 실리콘 위에서 돌아가는 4B급 에이전트인가, 아니면 용량 계획을 세울 필요가 없는 프런티어 규모 모델인가.
• 손익분기점 — 월간 트래젝터리 볼륨에 트래젝터리당 평균 토큰 요금을 곱한 값이, 그렇지 않았다면 임대했을 GPU 비용을 초과할 때 도달합니다. 하루에 리포지토리 작업을 몇 건만 처리하는 팀이라면 그 기준선은 아직 멀리 있고, 호스팅 모델이 편의성만으로도 우위를 차지합니다.
같은 일을 하지 않는 두 모델
비용 비교는 결과물이 서로 비교 가능할 때만 공정한데, 여기서는 그렇지 않으며, 바로 이 부분을 대부분의 사양서가 묻어둔다.
FrogNano-4B-2609는 저장소 수준 소프트웨어 엔지니어링에만 독점적으로 포스트트레이닝되었습니다. 이 모델의 인터페이스 전체는 다섯 가지 도구 루프 — Read, Write, Edit, Glob 및 Bash — 이며, 격리된 샌드박스에서 Leaf 하네스가 실행하고, 모델이 호출을 멈출 때까지 반복합니다. Microsoft의 카드는 지원 언어를 영어로, 검증된 프로그래밍 도메인을 Python으로 명시하며, 체크포인트의 이미지 및 비디오 구성 요소는 포스트트레이닝된 적이 없고 지원되지 않는다고 분명히 밝힙니다. 이 모델은 당신의 아키텍처를 추론하거나, 비즈니스에 관한 질문에 답하거나, 스크린샷을 읽지 않습니다.
Qwen3.8-Max는 범용 모델입니다. 알리바바의 카탈로그 기록에 따르면 이 모델은 텍스트, 이미지, 비디오 입력과 텍스트 출력, 그리고 1,000,000토큰 컨텍스트 창을 제공합니다. 추론하고, 글을 쓰고, 문서를 읽고, 대화를 나누며, 함수 호출은 체크포인트의 핵심이라기보다 범용 모델의 한 기능입니다. 2026년 9월 2일자 기록에서 확인된 Artificial Analysis 수치는 Intelligence Index 45.4, Coding Index 76.2입니다.
• 입력 — FrogNano-4B-2609은 텍스트만 지원합니다. Qwen3.8-Max는 텍스트, 이미지, 동영상을 지원합니다.
• 컨텍스트 — FrogNano의 평가 구성에서는 합산 토큰이 대략 131K인 반면, Qwen3.8-Max는 1,000,000입니다. 이는 7.5배 차이이며, 코딩 에이전트가 받는 바로 그 저장소 크기의 입력에서 가장 중요합니다.
• 턴당 출력 — FrogNano의 검증된 구성은 단일 어시스턴트 턴을 8,192토큰으로 제한합니다. Qwen3.8-Max는 이에 상응하는 응답당 상한을 공개하지 않습니다.
• 출력 형식 — FrogNano는 구조화된 Leaf 도구 호출을 내보내므로 이를 실행할 하네스가 필요합니다. Qwen3.8-Max는 이미 보유한 클라이언트에 산문이나 함수 호출을 반환합니다.
• 독립적인 점수 — FrogNano-4B-2609의 경우 자체 카드 외에는 없음; 위의 Qwen3.8-Max 수치는 제3자, 즉 Artificial Analysis에서 제공한 것입니다.
• 파라미터 — FrogNano의 경우 자체 카드 설명에 따르면 약 4.66B인 반면, Qwen3.8-Max는 총 2.4조, 활성 약 95B입니다.

4B가 실제로 그 가치를 입증하는 곳
4B 에이전트가 프런티어 모델을 완전히 앞서는 축이 하나 있는데, 그것은 정확성이 아니다.
FrogNano의 논문은 Qwen3.5-4B에서 출발한다. 이 모델은 일반 범용 모델로서 Leaf 하네스를 통해 SWE-bench Verified에서 39.4%를 기록했다. 약 1,500개의 합성 과제에 대한 다섯 차례 강화학습 반복으로 61.5%까지 끌어올렸으며, 같은 논문의 부록은 반복별 진행 상황을 48.2%, 53.4%, 58.3%, 58.6%, 61.6%로 보고한다. 더 강력한 모델로부터의 증류 없이 현재 정책의 학습 가능성 최전선에 맞춰 조정된 과제를 생성하는 이 방법이 바로 이 논문의 기여이며, 프런티어 모델 예산이 없는 연구 그룹이 관심을 가질 이유다.
그것이 이 비교에 무엇을 시사하는지 읽어 보세요. 마이크로소프트의 모델 카드는 FrogNano가 자신이 파생된 모델보다 모든 면에서 더 나은 것은 아니라는 점을 솔직히 밝히고 있습니다. 병렬 도구 호출 비율은 1.71%인데, 이후 반복 버전에서 동시 호출을 실행하는 능력을 잃었고, 팀은 이를 되찾으려고 통합 단계를 추가했기 때문입니다. 더 많은 문제를 해결하면서도 특정 동작 하나에서는 더 나빠지는 모델은 눈에 띄는 이음새가 있는 실제 공학적 산물이며, 그 카드도 이를 감추기보다 그대로 밝히고 있습니다.
그리고 SWE-bench 수치는 닫힌 루프다. 베이스 모델 기준선, 하네스, 최종 점수 모두 같은 연구소에서 나왔고, 같은 논문의 두 표는 동일한 실험에 대해 서로 다른 두 개의 사다리를 제시한다. 반면 Qwen3.8-Max의 코딩 수치는 Alibaba가 아니라 Artificial Analysis에 의해 산출되었다. 즉 다른 종류의 증거이고 다른 종류의 확신이며, 이 둘을 서로 빼서 비교해서는 결코 안 된다.
아직 제대로 대비할 수 없는 4B
FrogNano-4B-2609가 프로덕션 슬롯에 들어가기까지 두 가지가 가로막고 있으며, 그 둘은 모두 어떤 리뷰어의 의견이 아니라 자체 문서에 있습니다.
첫 번째는 하드웨어입니다. 이 카드는 BF16 가중치 요구량을 약 9.3GB로 제시한 뒤, 결합 컨텍스트가 약 131K 토큰에 가까워질수록 메모리가 "상당히 증가한다"라고 덧붙이고, 그다음 정확한 최소 GPU 모델, VRAM 구성, 런타임 버전 및 성능 프로필이 "출시 전에 여전히 검증되어야 한다"라고 명시합니다. 이는 이미 다운로드 가능한 모델에 적혀 있는 문장입니다. 평가된 구성에 대한 VRAM 수치를 공개한 사람은 아무도 없으며, 이 카드에도 그런 수치가 없습니다.
두 번째는 안전성 태세입니다. Microsoft의 자체 정렬 노트에 따르면 에이전트 특화 사후 학습에는 안전 선호, 거부, 유해 콘텐츠 또는 적대적 데이터셋이 사용되지 않았고, 대신 기능적 정확성과 회귀 방지를 최적화했으며, 해당 모델은 "무제한 자율 배포에 대해 독립적으로 안전 정렬된 것으로 간주되어서는 안 된다"고 밝히고 있습니다. 이 카드는 구체적인 위험을 명시하며 마무리합니다: 패치는 테스트를 통과하더라도 부정확하거나 안전하지 않을 수 있고, 성능은 해당 테스트의 품질에 민감하며, 모든 후보 패치는 사용 전에 자격을 갖춘 인간의 검토와 독립적인 회귀 및 보안 테스트가 필요합니다. 일반적인 호스팅 모델에는 그러한 특정 유의사항이 전혀 없으며, 또한 저장소에서 셸 명령을 실행하지도 않습니다.
어느 쪽을 선택하든 하나의 키
실제로 이 비교를 실행할 때 유용한 점은 그중 절반만 다운로드하면 된다는 것입니다. Qwen3.8-Max와, 자체 호스팅 에이전트의 벤치마크 대상이 될 일반 모델들은 모두 OrcaRouter의 OpenAI 호환 엔드포인트 하나를 통해 접근할 수 있습니다0% 마크업으로 — 공급자 정가가 그대로 반영되므로, 벤더 가격이 바뀌면 같은 날 우리 쪽에 반영됩니다. 코딩 에이전트의 출력 토큰 청구서를 관리하려는 상황에서 실제로 움직이는 숫자가 바로 이것이죠. 이는 페일오버 문제도 단순하게 만들어 줍니다. 파이프라인의 호스팅된 절반이 저하되면, 재시도는 자동으로 이루어지고 실험은 계속됩니다.
FrogNano-4B-2609는 저희 라우트 중 하나가 아니며, 예정일도 없습니다. 가중치는 직접 서빙하시면 되고, 모델 카드에는 서빙 구성이 완전히 검증되지 않았다는 점이 솔직히 적혀 있습니다. 저희가 할 수 있는 일은 비교의 다른 쪽을 설정하는 데 비용이 전혀 들지 않게 만드는 것입니다. 그래야 결국 답하게 되는 질문이 진짜 질문이 됩니다 — 자체 GPU에서 벤더가 보고한 61.5% SWE-bench 에이전트가 자체 작업과 자체 볼륨에서 종량제 프런티어 모델을 이기는지 말입니다.

어느 것을 선택할까
일반적인 작업일 때, 다른 누군가의 운영 팀이 용량을 감당해야 할 때, 입력에 이미지나 긴 문서가 포함될 수 있을 때, 또는 금요일까지 서빙 스택을 갖추는 대신 오늘 답이 필요할 때 Qwen3.8-Max를 선택하세요. 타사 평가 점수 덕분에 무엇을 구매하는지 대략 예측할 수 있고, 토큰당 청구 비용은 약정하기 전에 확인할 수 있는 변동 비용입니다. 한 달에 적당한 수의 리포지토리 작업을 실행하는 팀이라면, 계산은 비교가 되지 않습니다.
긴 궤적에서 토큰당 과금이 제약이 될 만큼 볼륨이 충분히 높을 때, 데이터가 여러분의 인프라를 떠날 수 없을 때, 또는 연구 질문 — 작은 에이전트가 교사 없이 저장소 수준의 역량까지 훈련될 수 있는가 — 자체가 실제로 테스트하려는 대상일 때 FrogNano-4B-2609를 선택하세요. 시작하기 전에 세 가지를 알고 있어야 합니다: 61.5%는 연구실이 자체 유지관리하는 하네스에서 얻은 연구실 자체 측정치이고, 평가된 구성에 대한 VRAM 수치는 아무도 공개하지 않았으며, 카드 자체가 서빙 설정이 아직 검증되지 않았다고 말합니다.
이 조합이 글을 쓸 만한 가치가 있는 이유는 두 모델이 두 세대 전 조상을 공유한다는 점이다. FrogNano는 Qwen3.5-4B에서 파생되었는데, 이는 같은 회사의 범용 모델이며, 2.4조 매개변수 플래그십이 이 페이지 반대편에 있다. Microsoft는 작은 쪽을 가져다 합성 저장소에 RL 반복을 다섯 번 수행해 전문 모델을 얻었다. Alibaba는 반대 방향으로 가서 규모를 키웠다. 두 답변 모두 공개되어 있으며, 다운로드 비용과 API 비용 사이의 격차가 둘 중 하나를 고르는 정직한 기준이다.

이 글에서 비교한 모델1
이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트
