'FrogNano-4B-2609 vs LFM2.5 2.6B Base'라고 적힌 생성된 타이틀 카드, 부제는 '완성된 4B 에이전트 대 2.69B 사전 학습 체크포인트', 세 개의 칩은 'RL 후속 학습 완료', '사전 학습만, 30개 층에 2.69B dense', '명령어 튜닝 없음'이라고 적혀 있으며, 푸터는 '두 열 모두 공급업체 보고; 어느 모델도 제3자가 점수를 매긴 적 없음'이라고 적혀 있고, OrcaRouter 로고가 오른쪽 아래 모서리에 합성되어 있습니다.
Engineering & Research

FrogNano-4B-2609 vs LFM2.5 2.6B Base: 완성된 전문가 모델과 사전학습 가중치 묶음

작성자

Elias Hawthorne

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

질문을 입력하면 LFM2.5 2.6B Base는 답변 대신 문장을 이어서 쓸 것입니다. 이것은 결함이 아닙니다 — Liquid AI는 이를 LFM2.5 제품군을 뒷받침하는 사전 학습 체크포인트로 공개했으며, 지시문 튜닝은 의도적으로 Base가 아닌 형제 모델에 남겨두었고, 모델 카드에는 대규모 파인튜닝용이라고 명확히 적혀 있습니다. Microsoft의 FrogNano-4B-2609는 그 파이프라인의 반대쪽 끝이 어떤 모습인지 보여줍니다: 동일한 종류의 소형 언어 모델을 합성 저장소 작업에 대한 다섯 차례의 강화 학습에 넣어, 다섯 개 도구로 구성된 하네스를 통해 구조화된 도구 호출과 후보 패치를 출력할 때까지 이르게 한 것입니다. 둘 중 어느 쪽도 공개된 독립 벤치마크가 없습니다. 차이점은 그중 하나는 사후 학습이 완료되었다는 것이며, 어느 쪽인지 아는 것이 결정의 전부입니다.

아래 FrogNano 수치들은 Microsoft의 모델 카드와 기술 보고서에서 가져왔습니다. LFM 수치들은 Liquid AI의 카드, 아키텍처 구성, 라이선스 파일에서 가져왔습니다. 두 공급업체 중 어느 쪽에 귀속된 모든 수치는 공급업체 보고로 표시되어 있으며, 이들 모델 중 어느 것도 제3자의 평가를 거치지 않았습니다 — LFM2.5 2.6B Base의 경우 이는 대체로 의도된 일입니다. 왜냐하면 명령 튜닝이 없는 체크포인트는 채팅 벤치마크의 공정한 대상이 아니기 때문입니다.

비교는 무엇을 비교하고 있는지 알 때에만 통한다

두 사양서를 나란히 놓으면 가장 먼저 잘못되는 것이 파라미터 수다. LFM2.5 2.6B Base는 30개 레이어에 26.9억 개의 dense 파라미터를 갖추고 있다 — 22개의 이중 게이트 숏 컨볼루션 블록과 8개의 그룹화된 쿼리 어텐션 레이어, 약 34조 토큰으로 16개 언어에 걸쳐 학습되었으며, 128,000개 토큰 어휘와 131,072개 토큰 컨텍스트를 갖는다. 양자화된 빌드는 Q4_K_M에서 약 1.67GB에 이른다.

FrogNano-4B-2609의 카드는 파라미터 필드를 "500M-5B" 범위로 제시하고, 모델 요약은 이를 약 46억 6천만 개로 설명합니다. 다운로드가 논쟁을 종결합니다: 두 개의 safetensors 샤드에 총 9.32GB의 BF16 가중치, 738개 텐서가 있으며, 이는 상속된 dense 32계층 하이브리드 Gated DeltaNet 및 gated-attention 스택 위에 있습니다. 24계층 비전 타워가 체크포인트에 들어 있으며, 한 번도 사후 학습된 적이 없습니다.

따라서 크기 비율은 대략 1.7 대 1이고, 양자화를 고려하면 메모리 비율은 5.6 대 1에 더 가깝습니다. 그 격차는 파라미터 수치보다 더 중요합니다. 왜냐하면 이 두 모델은 모두 엔드포인트라기보다 자체 호스팅 후보이기 때문이며, 이것이 이들이 같은 글에 포함되는 유일한 이유입니다.

• 사용 목적 — LFM2.5 2.6B Base는 파인튜닝 실행을 위한 원재료입니다. FrogNano-4B-2609는 Leaf 하네스 내에서 저장소 수준 소프트웨어 엔지니어링을 위한 완성된 정책입니다.

• 지시 따르기 — LFM2.5 2.6B Base는 기본 제공 상태로는 이를 전혀 갖추고 있지 않으며, Liquid AI의 카드에서는 많은 파인튜닝이 필요한 작업에 사용할 것을 권장합니다. FrogNano-4B-2609는 작업 설명을 따르고 구조화된 도구 호출을 출력하는데, 이는 바로 RL 목표가 훈련한 내용이기 때문입니다.

• 컨텍스트 — LFM2.5 2.6B Base의 경우 131,072 토큰인 반면, FrogNano의 평가 구성에서는 합쳐서 약 131K 토큰입니다. 명목상 동일하지만, FrogNano의 윈도우는 단순한 프롬프트뿐 아니라 도구 결과, 셸 출력, 테스트 로그까지 담아야 합니다.

• 출력 상한 — FrogNano의 검증된 구성은 어시스턴트 턴당 8,192개의 생성 토큰을 허용합니다. LFM2.5 2.6B Base는 답변을 끝내도록 만들어지지 않았기 때문에 이에 상응하는 내용을 공개하지 않습니다.

• 모달리티 — 둘 다 텍스트 전용입니다. FrogNano의 비전 구성 요소는 상속된 것이며 명시적으로 지원되지 않습니다. LFM2.5 2.6B Base는 구조상 텍스트 입력, 텍스트 출력입니다.

• 라이선스 — LFM2.5 2.6B Base는 LFM Open License v1.0에 따라 제공되며, 연간 매출 1,000만 달러 미만에서는 무료이고 그 기준 이상에서는 별도 라이선스가 필요하며, 파생 저작물도 동일한 상한을 승계합니다. FrogNano의 카드는 머리말에는 MIT라고 적혀 있고 본문에는 Apache 2.0이라고 적혀 있습니다.

Microsoft가 비용을 지불한 것, 그리고 당신이 비용을 지불해야 할 것

이것은 핵심을 떠받치는 부분입니다. 바로 여기에서 스펙 비교가 오해를 불러일으키기 때문입니다.

FrogNano-4B-2609의 부가가치 전부는 포스트트레이닝에 있으며, Microsoft가 그 방법을 공개했다. 일반 모델로서 Leaf 하네스를 통해 SWE-bench Verified에서 39.4%를 기록한 Qwen3.5-4B에서 시작하십시오. 실제 스냅샷에서 후보 저장소 작업을 생성하고, 현재 체크포인트에서 롤아웃을 실행해 모델이 때때로 해결하는 작업을 찾아내고, 그 작업들을 유지한 뒤 학습하고 반복하십시오 — 다섯 번의 반복, 총 약 1,500개의 검증된 합성 환경, 그리고 어느 시점에도 더 큰 모델로부터의 증류는 없습니다. Microsoft 자체 카드에 적힌 결과는 SWE-bench Verified 61.5%, SWE-bench Pro 37.6%, Terminal-Bench 2.0 31.1%, PatchEval-Verified 47.3%입니다. 논문의 효율성 부록은 같은 상승세를 반복별로 48.2%, 53.4%, 58.3%, 58.6%, 61.6%로 보고하는데, 이는 같은 실험에 대한 연구소 자체의 두 표조차 각 단계 수치에서 일치하지 않는다는 점을 잘 일깨워 줍니다.

이제 그것을 LFM2.5 2.6B Base와 대조해 보세요. 그것은 그 작업이 시작되기 전의 체크포인트입니다. 그 카드 자체의 권장 사항인 미세 조정은 바로 FrogNano가 문서화하는 작업입니다: 과제 환경, 실행 가능한 보상, 더 오래 서비스하는 하네스, 그리고 변화하는 정책에 맞선 여러 번의 학습 반복입니다. 그 논문은 그것이 쉽다고 주장하지 않습니다. 추론 흔적이 길어짐에 따라 중간 체크포인트를 학습시키는 비용이 점점 더 커졌고, 드리프트를 멈추기 위해 로그 길이 페널티를 추가해야 했으며, 이후 반복에서 기본 모델이 가지고 있던 병렬 도구 호출 능력을 잃어 최종적으로 1.71%의 동시 호출률에 이르렀다고 보고합니다. 다른 2.6B 기반 모델에서 FrogNano 레시피를 실행할 계획이 있는 사람은 특히 그 세 가지 문제를 예산에 반영해야 합니다.

LFM2.5 2.6B Base가 제공하는 것은 또 다른 종류의 유리한 출발점입니다: 34조 토큰 사전 학습 예산, 문서화된 하이브리드 아키텍처, 기존 양자화 빌드, 그리고 131,072 토큰의 문서화된 컨텍스트를 갖추고 있으며, 이 모든 것이 9.32 GB BF16 체크포인트가 들어가지 않을 하드웨어에서도 실행되는 크기입니다. 여러분의 용도가 작은 파인튜닝이 범용 모델을 능가할 만큼 좁다면, 그것은 실질적인 포지션입니다 — 그리고 그렇지 않다면, 학습 실행 하나를 아낀 셈입니다.

A generated two-column scoreboard titled 'FrogNano-4B-2609 vs LFM2.5 2.6B Base'. The left column reads State RL post-training complete, Params approx 4.66B with the card saying 500M-5B, Weights 9.32 GB BF16, Context about 131K evaluated, Licence MIT in front matter and Apache 2.0 in body, Independent scores none. The right column reads State pretrained checkpoint only, Params 2.69B dense, Weights 1.67 GB in Q4_K_M, Context 131,072 tokens, Licence LFM Open License v1.0, Independent scores none. A footer reads 'Both columns vendor-reported; no third party has scored either model.'

어느 쪽이든 당신이 구축해야 하는 것

이 둘 중 어느 것도 네트워크 호출이 아니며, 그 사실은 어떤 스펙 행보다도 실질적인 비교를 더 크게 좌우한다.

LFM2.5 2.6B Base에는 추론 런타임과 학습 실행이 필요합니다. Liquid AI의 카드에는 네이티브 포맷, GGUF, ONNX, MLX 빌드가 나열되어 있으므로 서빙 부분은 잘 커버됩니다 — 양자화된 체크포인트의 경우 노트북에서 llama.cpp를 실행하는 것도 실질적인 선택지입니다. 학습 부분은 여러분의 몫입니다: 데이터, 목적 함수, 평가, 그리고 결과가 더 나아졌는지 아니면 그저 달라졌는지 판별할 방법까지.

FrogNano-4B-2609는 올바른 파서를 갖춘 OpenAI 호환 엔드포인트와 파드 및 네트워크 정책을 관리할 권한이 있는 Kubernetes 클러스터를 원합니다. Microsoft의 README는 하네스가 편의 기능이 아니라 의존성이라는 점을 이례적으로 노골적으로 밝히고 있으며, 카드에는 동일한 점수를 얻으려면 일치하는 체크포인트, 토크나이저, 서빙 구성, 태스크 이미지 및 평가 프로토콜이 필요하다고 명시되어 있습니다. 여기서 구성은 세부 사항이 아닙니다 — Qwen3 추론 파서와 Qwen3 코더 도구 호출 파서 없이 서빙하면, 하네스가 도구 호출을 기대하는 곳에서 모델이 산문을 씁니다.

그것이 이 맞대결의 모습이다. 한쪽에는 작은 서빙 문제가 있는 학습 프로젝트가 있고, 다른 쪽에는 큰 평가 문제가 있으며 더 이상 할 학습이 남아 있지 않은 서빙 프로젝트가 있다. 둘 다 저녁 몇 시간이면 되는 작업이다. 그중 오직 하나만이, 당신의 잘못이 아님에도 "모델이 충분히 좋지 않다"는 결말로 끝날 수 있는 저녁 몇 시간의 작업이다.

A screenshot of the Hugging Face model card for microsoft/FrogNano-4B-2609 showing the model summary table with the Parameters row reading 500M-5B, the Context length row reading approximately 131K tokens in the evaluated coding-agent configuration, the Training Dates row reading Jun 2026 to Aug 2026, the Release date row reading 22-SEP-2026, the License row reading Apache License 2.0, the Qwen/Qwen3.5-4B model dependency, and the model overview naming the dense 32-layer hybrid Gated DeltaNet and gated-attention architecture.

이런 제작에서 라우터가 진가를 발휘하는 지점

이 두 모델은 모두 호스팅되는 무언가를 호출하는 파이프라인 안에 결국 들어가게 됩니다. FrogNano 자체의 평가 장비가 그 증거입니다: Leaf 하네스는 OpenAI 호환 엔드포인트와 통신하며, 이는 테스트 대상 모델과 비교 대상 모델 모두 동일한 인터페이스를 통해 접근된다는 뜻입니다. 이는 이유가 단지 위생 관리 차원일 뿐이더라도 따라 할 가치가 있는 패턴이며, 단일 엔드포인트가 구체적인 일을 하는 바로 그 지점입니다.

OrcaRouter는 하나의 OpenAI 호환 키 뒤에 200개 이상의 모델을 제공하며 0% 마크업으로, 따라서 제공업체의 정가가 그대로 전달되고 공급업체의 가격 변경이 같은 날 우리 쪽에 반영됩니다. 이는 자체 호스팅 전문 모델이 작업당 비용에서 호스팅된 범용 모델을 능가하는지 판단할 때 실제로 움직이는 수치입니다. 자동 페일오버는 그 비교의 호스팅된 절반을 처리할 뿐, 직접 서빙하는 체크포인트는 처리하지 않습니다. 우리는 FrogNano-4B-2609나 LFM2.5 2.6B Base를 호스팅하지 않습니다. 둘 다 다운로드입니다. 라우팅 레이어가 제거하는 것은 벤치마크의 호스팅 측이 바뀔 때마다 발생하는 두 번째 통합입니다.

솔직히, 하나 고르자면

좁은 과업에, 작은 하드웨어에, 그리고 학습 실행을 직접 감당할 준비가 되어 있다면 LFM2.5 2.6B Base를 선택하라 — 라이선스는 매출 $10M 미만이면 무료이고, 양자화 빌드는 1.67 GB이며, Liquid AI 자체 카드도 바로 이 용도로 이를 권장한다. 대가는 그것이 역량이 아니라 출발점이라는 점이다: 이 릴리스 어디에도 그 위에 FrogNano 형태의 RL 실행을 얹으면 어떤 점수를 낼지 알려주지 않으며, 아무도 그런 결과를 공개하지 않았다.

작업이 저장소 수준의 소프트웨어 엔지니어링이고 사후 학습이 이미 완료된 상태를 원한다면 FrogN-4B-2609를 선택하세요. 61.5%, 37.6%, 31.1% 및 47.3%는 자신의 방법을 상세히 설명한 한 연구소가 공개한 실제 결과이며, 또한 현재로서는 닫힌 루프입니다: 동일한 연구소, 동일한 하네스, 동일한 기본 모델 기준선. 9.32 GB, 하네스 의존성 및 복합 라이선싱은 그렇지 않았다면 직접 실행해야 했을 학습 프로젝트를 건너뛰는 대가입니다.

A generated pipeline card headed 'The same pipeline, two positions' showing three stages connected by arrows: 'Pretrained checkpoint' captioned LFM2.5 2.6B Base, 'RL on synthetic tasks, 5 iterations' captioned Microsoft's loop, and 'Finished agent' captioned FrogNano-4B-2609, with a footer reading 'Neither model has been independently evaluated; both appear as vendor-reported figures only.'

유용한 관점 전환은 이것들이 경쟁자가 아니라는 점이다. LFM2.5 2.6B Base는 FrogNano-4B-2609 같은 것을 만들어낸 프로세스의 상류에 있다. 이 둘 사이에서 선택하고 있는 자신을 발견한다면, 진짜 질문은 당신의 문제가 훈련 실행을 직접 소유할 가치가 있느냐이다 — 그리고 답이 아니라면, 하네스와 공개된 방법, 그리고 벤더의 SWE-bench 래더를 갖춘 4B가 완성된 상태로 도착하는 쪽이다.