'ARTEMIS vs LFM2.5-2.6B-Base'의 생성된 타이틀 카드로, 부제는 '완성된 하네스, 미완성된 체크포인트'이며, ARTEMIS는 Apache 2.0 안드로이드 자동화 하네스로, LFM2.5-2.6B-Base는 명령어 튜닝도 벤치마크도 없는 26.9억 개의 사전 학습 가중치로 대비시킨다. 각주에는 기저 모델이 Apache 2.0이 아니라 LFM Open License로 배포된다고 달려 있다.
Guides & Insights

ARTEMIS vs LFM2.5-2.6B-Base: 그 일을 할 수 없는 체크포인트, 그리고 그것이 그 일을 해내기를 필요로 하는 하네스

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Google의 ARTEMIS 로드맵에는 네 가지 항목이 있고, 그중 정확히 하나는 아직 명백히 존재하지 않는 모델을 필요로 한다: 저지연, 프라이버시 우선 자동화를 위한 온디바이스 경량 비전-언어 모델이다. 그런 작업에 딱 맞는 후보는 LFM2.5-2.6B-Base 정도의 크기 등급에 속하는 무언가다 — Liquid AI의 26억 9천만 파라미터 사전 학습 체크포인트로, 131,072 토큰 컨텍스트와 휴대폰에 들어갈 만큼 작은 풋프린트를 갖춘 오픈 웨이트로 공개되었다. 또한 이 모델은 출시된 그대로는 그 자리를 채울 수 없으며, 누군가 이 둘을 비교 표에 올리기 전에 그 이유를 이해해 둘 가치가 있다. Google의 ARTEMIS는 자연어 Android 자동화 하네스로, 2026년 8월 Apache 2.0으로 오픈소스화되었으며, ADB를 통해 실제 핸드셋을 구동하고 Google Research의 AndroidWorld 벤치마크에서 99%+ 완료율을 주장한다. LFM2.5-2.6B-Base는 지시 튜닝도, 채팅 템플릿도, 그리고 의도적으로 공개된 벤치마크도 없는 순수한 사전 학습 자료이며, 스스로 추가 학습을 수행할 팀을 위한 것이다. 하나는 미완의 모델 문제를 안은 완성된 소프트웨어다. 다른 하나는 라이선스 문제는 정리된 미완의 가중치다. 어느 쪽도 다른 쪽의 대체물이 아니며, 이들이 진정으로 만나는 지점은 당신이 짐작할 만한 곳이 아니다.

LFM2.5-2.6B-Base의 실제 정체

브랜딩을 걷어내면, 이는 온디바이스 작업을 위해 정성껏 구축된 기반이며, 그 제원은 누군가가 리더보드 순위보다 메모리 대역폭에 맞춰 최적화한 것처럼 읽힌다.

크기 — bfloat16 기준 2.69B 파라미터가 단일 ~5.39 GB 샤드에 담겨 있으며, "2.6B"로 홍보된다.

아키텍처 — 하이브리드 분할 구조로 구성된 30개 레이어: 8개 그룹화 쿼리 어텐션 레이어 위에 22개의 이중 게이팅 단축 컨볼루션 블록, 은닉 폭 2048, 8개 KV 헤드에 대응하는 32개 어텐션 헤드, 공유 임베딩. 이전 세대와 동일한 code>Lfm2ForCausalLM/code> 클래스를 사용하므로 별도의 사용자 정의 모델링 코드가 필요하지 않습니다.

학습 — 약 34조 개의 토큰으로, 컨텍스트 확장을 위한 전용 중간 학습 단계가 포함됩니다.

어휘 — 128,000개 토큰으로, 비라틴 문자 체계를 더 잘 처리하기 위해 이번 세대에서 두 배로 늘어났습니다. 약 2억 6,200만 개의 매개변수, 즉 모델의 약 10분의 1이 공유 임베딩에 자리하고 있습니다.

컨텍스트 — 모델 카드와 config가 여기서 서로 어긋나며, 이 점은 알아둘 만합니다: 문서에는 131,072 토큰이라고 광고되어 있지만 code>config.json/code>은 code>max_position_embeddings/code>를 128,000으로 설정합니다. 128K를 기준으로 예산을 잡고, 그보다 높은 값은 검증되지 않은 것으로 취급하세요.

언어 — 16개: 영어, 아랍어, 중국어, 프랑스어, 독일어, 힌디어, 인도네시아어, 이탈리아어, 일본어, 한국어, 폴란드어, 포르투갈어, 러시아어, 스페인어, 태국어, 베트남어.

벤치마크 — 없음. Liquid는 기본 체크포인트에 대한 평가를 공개하지 않으며, 모델 카드는 이러한 누락을 의도적인 것으로 설명합니다: 이 결과물은 원시 상태로 측정되기 위한 것이 아니라 후속 학습되기 위해 존재합니다.

그 마지막 문장이 이번 릴리스의 핵심이며, "X vs LFM2.5-2.6B-Base" 비교를 신중하게 다뤄야 하는 이유이기도 합니다. 베이스 체크포인트는 어떤 것에 대해서도 의견이 없습니다. 안드로이드 워크플로를 계획해 달라고 요청하면, 답변하도록 배운 적이 없기 때문에 텍스트를 확률적으로 이어갈 뿐입니다. 카드에서는 대규모 파인튜닝이 필요한 경우에만 권장합니다. 언어별 어시스턴트, 규제 산업 분야의 도메인 특화 어시스턴트, 독점 데이터 학습, 또는 증류 학생 모델로 쓰는 경우입니다. 툴 호출을 포함해 바로 사용할 수 있는 용도라면 Liquid는 사후 학습된 LFM2.5-2.6B를 안내합니다.

A screenshot of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the lfm1.0 licence, 16 languages, the lfm2.5, liquid and edge tags, BF16 tensor type, 27,908 downloads in the last month, 13 finetunes and 10 quantizations, and a model table listing the base as a pre-trained base model for fine-tuning alongside its post-trained sibling for agentic workloads.

ARTEMIS가 모델에 요구하는 것, 즉 베이스 체크포인트가 제공하는 것이 아닌 것

ARTEMIS는 두 가지 모드를 가진 제어 루프입니다. Flash는 단계당 대략 3–5초의 반응형 관찰-행동 주기입니다. Pro는 단계당 대략 15–40초의 멀티 에이전트 그래프로, 살아 있는 Markdown 계획을 유지하는 Planner, 전체 도구 세트를 갖춘 Operator, 그리고 네 가지 수준에서 체크포인트를 검증하는 읽기 전용 Checker로 구성됩니다. 수준은 code>off/code>에서 code>strict/code>까지. 두 모드 모두 그 아래에 있는 모델에게 같은 것을 요구합니다: 스크린샷을 보고, 고정된 도구 세트에서 하나의 행동을 고르고, 1~2초 안에 다시 하기를, 흐름을 놓치지 않고 백 번 반복하는 것입니다.

그것은 까다로운 요구입니다 — 엄격한 스키마 아래에서의 지시 따르기, 근거 있는 시각적 이해, 장기적 일관성 — 그리고 그것은 바로 베이스 체크포인트가 부여받지 못한 기술 집합입니다. ARTEMIS가 자체적으로 테스트한 백엔드는 호스팅 모델입니다: Gemini, Claude, GPT-4o, Qwen-VL. 그들 모두 도구 사용을 위해 지시 튜닝되어 있으며, 모두 대규모입니다.

그래서 격차는 크기의 문제가 아니다. 2.6B 사후 학습 모델은 도구 호출 루프를 유지할 수 있다 — Liquid 자체의 사후 학습 형제 모델은 모든 지시 수행 평가와 거의 모든 도구 사용 평가에서 Gemma 4 E2B-it 및 E4B-it를 능가한다고 주장하지만, 이는 독립적 검증이 없는 벤더 보고 수치다. 격차는 베이스 체크포인트에는 그러한 학습이 전혀 적용되지 않아 하네스에 아예 넣을 수 없다는 점이다.

라이선스가 더 뚜렷한 차이다

이 지점에서 실제로 승부가 결정되며, 대부분의 비교가 건너뛰는 부분이기도 합니다.

ARTEMIS — Apache 2.0. 상업적으로 사용하고, 포크하고, 제품 내부에 포함해 배포해도 되며, 수익 조건은 없습니다. 유일한 의무는 고지 사항을 유지하고 변경 사항을 명시하는 것인데, 이 의무는 Minitap이 ARTEMIS의 229개 파일 중 228개가 자사의 Apache-2.0 code>mobile-use/code> 프로젝트와 일치하며 작성자 이름이 강제 푸시(force-push)로 삭제되었다고 주장한 뒤, 2026년 9월에 프로젝트 스스로가 공개적으로 바로잡아야 했던 의무입니다. 이제 해당 저장소에는 Minitap 출처 표기가 포함되어 있습니다.

LFM2.5-2.6B-Base — LFM 오픈 라이선스는 Apache나 MIT가 아닌 맞춤형 라이선스입니다. 연간 매출 1,000만 달러 미만에서는 부여되는 권리가 광범위하고 영구적이며 로열티가 없습니다. 해당 기준 이상에서는 라이선스가 상업적 사용에는 전혀 적용되지 않으므로 Liquid에 연락해야 합니다. 이를 기반으로 구축하는 모든 사람이 알아야 할 중요한 세부 사항은 다음과 같습니다: 2차적 저작물은 동일한 조건을 승계합니다. 포스트트레이닝한 체크포인트는 여러분이 완전히 소유하는 새로운 결과물이 아닙니다 — 수익 조건이 붙은 라이선스를 계속 이어받으며, 자격을 갖춘 비영리 단체를 위한 예외가 있습니다.

그 두 사실을 나란히 놓으면, 당신이 누구인지에 따라 결정이 뒤집힌다. 휴대폰 쪽 에이전트를 출시하려는 자금을 확보한 회사는 자유롭게 사용할 수 있는 Apache-2.0 하네스와, 상업적으로는 전혀 사용할 수 없을 수도 있는 체크포인트를 가지고 있다. 개인 개발자나 임계값 미만의 스타트업은 둘 다를 가지며, 라이선스는 각주에 불과하다. 어느 벤더도 부당하게 행동하는 것은 아니다 — Liquid는 자사의 상업용 티어를 보호하는 회사이고, Google은 테스트 도구를 오픈소스로 공개하는 것이다 — 하지만 "open weights"와 "open weights"는 같은 허가가 아니며, 파라미터 수에서 멈추는 비교로는 당신이 어느 쪽을 가졌는지 알 수 없다.

A generated licence comparison: ARTEMIS under Apache 2.0 with commercial use, no revenue gate, freedom to fork and ship, and a keep-notices obligation, against LFM2.5-2.6B-Base under the LFM Open License, where commercial use applies below $10M revenue, derivatives inherit the same terms, and organisations above the threshold must contact Liquid.

패밀리는, 베이스 체크포인트가 그 안으로 들어가는 잘못된 문이기 때문이다

목표가 온디바이스 Android 에이전트라면, 베이스보다 더 중요한 세 형제가 있고, ARTEMIS 로드맵이 실제로 필요로 하는 것은 뻔한 쪽이 아니다.

LFM2.5-2.6B — 사후 학습된 에이전트형 형제 모델. 벤더가 보고한 처리량은 스마트폰급 하드웨어에서 초당 약 30토큰, Ryzen AI Max+ 395에서는 113, Apple M5 Max에서는 220이며, 2.5GB 미만에서 실행됩니다.

LFM2.5-VL-3B — 동일한 베이스에 SigLIP2 400M NaFlex 인코더를 기반으로 구축된 비전-언어 엣지 모델로, RefCOCO에서 벤더가 보고한 그라운딩 precision@1이 57.1에서 87.9로 향상되었으며, Liquid의 설명에 따르면 온스크린 UI 요소에서 훨씬 더 큰 Gemma 모델들을 능가하고 4.7B Qwen 3.5에 0.7% 이내로 근접하는 성능을 냅니다. 검증되지는 않았지만, 이 제품군에서 화면을 볼 수 있는 유일한 모델입니다.

LFM2.5-230M — 추출 및 분류 계층으로, 추론 비중이 높은 작업에는 명시적으로 권장되지 않습니다.

이 맞대결에서 베이스 체크포인트에 대한 불편한 결론은 무엇인가: ARTEMIS의 로드맵 항목은 비전 요구사항이고, 베이스는 텍스트 전용이며, 그 자리를 채우는 패밀리 구성원은 비전 인코더와 포스트 트레이닝이 이미 모두 적용된 VL 변형이다. Android 자동화 스택에서 베이스 체크포인트의 역할은 휴대폰을 구동하는 것이 아니다. 그것은 결국 그 일을 하게 될 어떤 소형 모델 아래에 깔리는 원재료가 되는 것이다.

그것들이 실제로 만나는 지점: 아직 아무도 만들어내지 못한 플라이휠

여기에는 수사적이기만 한 것이 아니라 실제로 존재하는 단 하나의 연결이 있으며, 그것은 일반적인 방향과 반대로 흐른다. ARTEMIS의 가장 과소평가된 기능은 에이전트가 아니라 배출물이다. 모든 실행은 크래시 스택, 키프레임 스크린샷, 압축된 단계의 세션 원장, 진단 보고서를 캡처하고, Pro는 어떤 작업이 실패할 때마다 "실행 인시던트"를 열어 이후의 성공이 그것을 해소할 때까지 컨텍스트에 유지한다. 그것은 UI 에이전트의 인식이 틀렸던 바로 그 순간들로 이루어진 레이블링된 코퍼스다.

그것을 존재 목적 전체가 포스트트레이닝인 체크포인트와 짝지으면, 명백한 루프가 만들어진다: 호스팅된 모델에서 하네스를 실행하고, 그것이 당신의 앱에서 걸려 넘어진 트레이스들을 수집한 뒤, 바로 그 프레임들로 2.6B 모델을 파인튜닝하는 것이다. 이는 Liquid 자체의 카드가 베이스 체크포인트를 애초에 공개하는 근거로 언급하는 바로 그런 종류의 독점 데이터셋이다 — "자체 데이터로 학습하기" — 그리고 매출 기준으로 제한되는 라이선스는, 그것이 임계치 미만의 팀에게는 타당한 경로이고 그 이상의 팀에게는 논의가 필요한 경로라는 뜻이다.

그 아이디어의 위상을 분명히 말하자면: 아무도 이 루프를 발표한 적이 없고, 어느 벤더도 그것을 제안하지 않으며, 어느 쪽도 그것을 테스트했다는 증거가 없다. 그것은 결과가 아니라 제안이며, 그렇게 읽어야 한다. 하지만 이것은 이 두 아티팩트가 범주 오류가 아니라 협력자로 놓이는 유일한 프레이밍이다.

파인튜닝까지 가게 된다면, 비교 세트가 문제의 나머지 절반입니다. LFM2.5-2.6B-Base는 우리 카탈로그에 없습니다 — 어떤 LFM2.5 변형도 없습니다 — 그래서 그 체크포인트는 Liquid 자체 배포판과 일반적인 제3자 호스트에서 가져와야 합니다. 라우팅된 카탈로그가 제값을 하는 지점은, 도구 사용에서 반드시 이겨야 하는 모델들을 상대로 여러분의 파인튜닝을 벤치마킹하는 일입니다. 하나의 키와 하나의 청구서로, 그리고 페일오버를 갖춰서 말이죠. 그래야 한 제공자의 안 좋은 오후가 여러분 평가의 안 좋은 오후가 되지 않습니다. 이 연습의 요점이 여러분이 실제로 행동에 옮기려는 맞대결이라면, 이는 정말로 유용한 것입니다.

A generated scoreboard comparing ARTEMIS and LFM2.5-2.6B-Base across six dimensions: type (Android automation harness vs pre-trained text checkpoint), whether it runs a phone (yes through ADB vs no), instruction tuning (not applicable vs none), vision (from the configured model vs none, text only), context (compressed session history vs 128,000 tokens) and licence (Apache 2.0 vs LFM Open License with a revenue threshold).

그래서 어느 쪽이 당신의 문제인가요?

Android 앱이 있고 이번 분기에 자동으로 테스트하고 싶다면, 필요한 것은 ARTEMIS이며, LFM2.5-2.6B-Base는 답의 일부가 아닙니다 — 호스팅된 비전 모델을 대상으로 ARTEMIS를 실행하고 단계마다 비용을 지불하게 될 것이며, 온디바이스 VLM에 관한 로드맵 항목은 결국 도래해 아직 측정하지 않은 비용 문제를 해결해 줄 것입니다.

네트워크 없이 핸드셋에서 실행되어야 하는 제품을 만들고 있다면, 소형 모델 경로를 원할 것입니다. 그리고 LFM2.5-2.6B-Base는 그 프로젝트의 해결책의 일부라기보다는 시작점입니다: 여러분은 이를 포스트 트레이닝할 것이고, 첫 번째 훈련 스크립트를 작성하기 전에 수익 예측과 비교하여 LFM Open License를 읽게 될 것입니다. 그리고 에이전트가 화면을 봐야 한다면, 대신 VL variant를 사용하게 될 것입니다.

절대로 해서는 안 될 일은 이 둘을 나란히 놓고, 하네스가 더 뛰어나다고 선언한 뒤 넘어가는 것이다. 유용한 비교는 두 개의 완전한 스택 — 호스팅된 모델 + 하네스 대 파인튜닝한 소형 모델 + 직접 구축한 프레임워크 — 사이의 비교이며, 그중 하나만 공개 벤치마크에 발표된 성공률을 가지고 있는데, 이는 다른 하나가 클라우드 비용이 전혀 없다는 사실과 정확히 맞먹는 가치가 있다.

라우팅된 카탈로그가 진가를 발휘하는 지점은, 도구 사용에서 여러분의 파인튜닝을 그것이 반드시 이겨야 하는 모델들과 벤치마킹하는 것입니다. 하나의 키와 하나의 청구서로, 페일오버를 갖추어 제공자의 안 좋은 오후가 여러분 평가의 안 좋은 오후가 되지 않도록 말이죠.

LFM2.5-2.6B-Base는 우리 카탈로그에 없습니다 — LFM2.5 변형도 없습니다 — 따라서 해당 체크포인트는 Liquid 자체 배포와 일반적인 서드파티 호스트에서 제공됩니다.

이 글에서 비교한 모델2

이 글에서 자동 인식 · 벤치마크: Artificial Analysis · 매일 업데이트