
TwIL-LM3-Pro vs LFM2.5 2.6B Base: 하나는 완성되었고, 다른 하나는 시작점이다
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-2952지능
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-2856지능
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 219 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 47 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 104 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
사이의 공개된 비교에서 가장 많은 것을 드러내는 점은 TwIL-LM3-Pro와 LFM2.5 2.6B BasewebAI가 2.6B에 대한 비교를 전혀 공개하지 않았다는 것이다. webAI의 Track A와 Track B 표는 자사의 3.66B 형식 논리 전문 모델을 다양한 상대와 맞붙인다 — 자체 Granite 베이스, VibeThinker-3B, Qwen3-8B, Qwen3.5-4B, Llama-3.2-3B, gpt-oss-120b — 그리고 그들이 선택한 Liquid AI 항목은 2.6B가 아니라 LFM2.5-8B-A1B이다. 표에 실제로 등장하는 2.6B는 이전 세대인 `LFM2-2.6B`이며, 이는 다른 사전 학습 실행을 거친 다른 모델이다. 그 누락은 간과가 아니다. LFM2.5 2.6B Base는 명령 튜닝이 없는 사전 학습 체크포인트이며, 명령 수행 벤치마크는 이 모델이 치르도록 만들어진 시험이 아니다.
그래서 이 페이지는 완성된 산출물과 원재료를 비교합니다. Aion 스타일의 프레이밍, 즉 한 모델은 점수가 있고 다른 모델은 그렇지 않다는 구도는 들어맞지만, 그 이유는 더 구체적이고 더 흥미롭습니다: 하나는 사후 학습을 거쳐 병합되었고, 다른 하나는 의도적으로 사후 학습 전에 멈추며, 이 둘을 설명하는 두 문서는 의도적으로 서로 다른 질문에 답하고 있습니다.
동일한 측정값이 아닌 두 개의 매개변수 개수
TwIL-LM3-Pro는 36.6억 개의 파라미터를 가진 덴스 모델이며, 모든 파라미터가 모든 토큰에서 활성화됩니다. 이 모델은 `ibm-granite/granite-4.2-3b`에서 LoRA 파인튜닝, 멀티패스 증류, 체크포인트 융합, 베이스 모델을 향해 다시 병합하는 WiSE-FT, 그리고 엔트로피 가중 GRPO 단계를 거쳐 파생되었습니다 — 그리고 webAI가 출시한 아티팩트는 LoRA 어댑터가 아니라 병합된 정책이므로, 단독으로 실행됩니다.
LFM2.5 2.6B Base는 30개 레이어에 걸쳐 2.69B개의 파라미터를 가지고 있습니다: 22개의 이중 게이트 단거리 합성곱 블록이 8개의 그룹화된 쿼리 어텐션 레이어와 교차 배치되어 있습니다. 이러한 하이브리드 합성곱/어텐션 설계는 Liquid의 온디바이스 아키텍처이며, 이 제품군의 처리량 수치가 단순히 파라미터 수의 함수가 아니라 현재와 같은 값인 이유입니다. 이 모델은 128,000개 토큰 어휘로 34조 개의 토큰에 대해 훈련되었으며, 131,072개 토큰의 컨텍스트 창을 갖추고 있습니다.
두 수치는 서로 약 36% 이내의 차이를 보이며 완전히 다른 아키텍처를 통해 산출된 값이므로, “3.66B가 2.69B를 이긴다”는 말도 그 반대도 품질 주장으로서는 아무 의미가 없다. webAI 자체의 모델 카드도 토크나이저 간 코퍼스 퍼플렉서티 비교를 꺼리면서 이 점을 에둘러 전한다 — TwIL-LM3-Pro의 어휘 크기는 100,352개이고, LFM2.5-2.6B의 어휘 크기는 128,000개이며, 퍼플렉서티는 토큰당이다.
"Base"가 제거하는 것, 그리고 그것이 스코어보드를 바꾸는 이유
Liquid AI는 LFM2.5 2.6B를 두 가지 형태로 공개합니다. 널리 쓰이는 에이전트 하네스에서 에이전틱 워크로드에 맞게 튜닝된 사후 학습(post-trained) 체크포인트와, 자체 카드에서 "모든 LFM2.5-2.6B 변형을 만드는 데 사용되는 사전 학습된 텍스트 전용 체크포인트"라고 설명하는 Base입니다. Base는 파인튜닝의 입력일 뿐, 제품이 아닙니다. 인스트럭션 튜닝도 없고, 이름값을 하는 채팅 템플릿도 없으며, 공개된 평가도 없습니다 — 베이스 모델을 인스트럭션 수행 과제로 평가하는 것은 잘못된 것을 측정하기 때문입니다.
TwIL-LM3-Pro의 위치는 반대다. 그 가치 전체는 포스트트레이닝 스택에 있다: webAI에 따르면 자체 하네스에서 이 파이프라인은 도메인 내 매크로 게이트를 베이스의 0.4313에서 0.5539로 끌어올렸고, 홀드아웃 10개 데이터셋 매크로는 붕괴하지 않고 수준을 유지했다(0.7942에서 0.7901). 홀드아웃 유지가 전문가 포스트트레이닝의 어려운 부분이며, 바로 그 부분이 Base가 답할 수 없는 부분이다.
이것이 또한 webAI의 표에서 크기 비교가 빛을 발하는 지점입니다. TwIL-LM3-Pro는 두 홀드아웃 매크로 모두에서 LFM2.5-8B-A1B보다 앞서는 것으로 보고됩니다. 10개 데이터셋 세트에서는 0.7901 대 0.7884, 14개 세트에서는 0.7425 대 0.7378이며, 그 MoE 모델의 파라미터 수의 절반도 안 됩니다. 이는 진정한 동일 조건 비교 결과이며, 바로 LFM2.5-8B-A1B가 명령 하네스를 통해 실행될 수 있는 사후 훈련 모델이기 때문에 가능합니다. Base는 그럴 수 없으며, 그래서 2.6B는 열을 얻지 못했습니다.
맞춰볼 가치가 있는 치수
• 파라미터 — TwIL-LM3-Pro 3.66B 덴스 vs LFM2.5 2.6B Base 2.69B (30개 레이어: 22개 conv + 8개 GQA).
• 포스트 트레이닝: 2580에서의 LoRA SFT, 증류, WiSE-FT 병합 및 GRPO 대 없음; 베이스는 설계상 사전 학습 출력이다.
• 컨텍스트 창 — 둘 다 131,072 토큰, 각자의 기반에서 상속됨.
• 어휘 — 100,352개 토큰 vs 128,000개, 이것이 이들의 퍼플렉서티를 비교할 수 없는 이유입니다.
• 언어 — 영어만 vs 아랍어, 중국어, 일본어, 한국어, 스페인어, 태국어를 포함한 17개.
• 사고 형식 — TwIL-LM3-Pro는 기본적으로 `<think>` 블록을 출력하고 길게 추론합니다(도메인 내 평균 1,902토큰, 생성의 24.2%가 길이 상한에 도달). 이는 지시 형식이 전혀 없는 기본 체크포인트와 대조적입니다.
• 라이선스 — webAI 비상업적 라이선스 ver. 1.0 vs Liquid의 LFM 오픈 라이선스 v1.0.
• 무엇을 위한 것인가 — 형식 논리 추론 엔드포인트인가, 파인튜닝 시작점인가.
컨텍스트 줄에는 두 모델 모두가 붙이는 각주가 필요하다: 각각 사전 학습에서부터 131, 토큰이며, 어느 벤더도 장문 컨텍스트를 검증하지 않았다 — TwIL-LM의 카드에는 공개된 모든 점수가 8,192 윈도우 안에서 측정되었다고 적혀 있다. 여기서 숫자가 일치하는 것은 독립적 검증 덕분이 아니라 같은 출처에서 나왔기 때문이다.
라이선스, 그리고 각각이 법적으로 무엇을 위한 것인지
TwIL-LM3-Pro의 webAI Non-Commercial License는 연구 및 개인 사용을 허용하며, 수익을 창출하는 배포에는 webAI와 별도의 계약이 필요합니다. LFM2.5 2.6B Base는 Liquid 자체의 LFM Open License v1.0에 따라 제공되는데, Hugging Face API는 이를 표준 SPDX 식별자가 아니라 `license: other`로 보고합니다 — 약관이 인정된 템플릿이 아니라 Liquid 자체의 것이기 때문에, 이를 바탕으로 계획을 세우기 전에 라이선스 파일을 읽어 보세요.
어느 라이선스도 Apache 2.0이 아니며, "오픈 웨이트"를 "상업적으로 허용적"의 동의어로 취급하는 것은 실수다. 두 라이선스의 실질적 차이는 각 라이선스가 무엇을 보호하는지에 있다: 비상업적 연구자는 둘 다 사용할 수 있고, 제품을 만드는 기업은 둘 다 확인해야 하며, Base의 목적 전체 — 다른 누군가의 제품으로 파인튜닝되는 것 — 는 Base의 정확한 조건을 겉보기보다 훨씬 더 중대하게 만든다.
각각이 스택에서 어디에 속하는지
The Base는 학습을 의도할 때 올바른 선택입니다. 문제가 좁은 레이블링 작업, 도메인 특화 분류 헤드, 또는 수천 개의 레이블이 지정된 예제에 대한 파인튜닝이라면, 광범위한 다국어 어휘와 처리량을 위해 설계된 하이브리드 컨볼루션 아키텍처를 갖춘 2.69B 사전 학습된 체크포인트에서 시작하는 것은 합리적인 엔지니어링 결정이며, 건너뛰게 될 사후 학습의 비용은 대신 의도적으로 지불하는 비용입니다.
TwIL-LM3-Pro는 훈련할 계획이 없고 작업이 이미 형식 논리일 때 적합한 선택입니다. 함의 레이블, Lean 명제 형식화, 의미 파싱, 증명 비평은 전체 파이프라인이 겨냥한 작업이며, 이미 병합과 강화 단계를 거친 체크포인트에서 시작하면 이 중 진정으로 재현하기 어려운 한 부분, 즉 도메인 내 성능을 얻으면서 홀드아웃 스위트 수준을 유지하는 부분을 절약해 줍니다.
"3.66B post-trained specialist"를 "2.69B base checkpoint"보다 확실히 더 낫다고 해석하는 것은 오류다. 둘은 같은 생산 라인의 서로 다른 단계에 있을 뿐이다.
그들을 섬기는 것, 아니면 그들을 우회하여 섬기는 것
오늘날 OrcaRouter 카탈로그에서 두 모델 중 어느 것도 라우트가 아니며, 그 이유는 각각 다릅니다. TwIL-LM3-Pro는 비상업적 라이선스가 적용되어 있고 호스팅된 엔드포인트도 없습니다. LFM2.5 2.6B Base는 아무도 일부러 추론 엔드포인트로 제공하지 않을 파인튜닝 산출물입니다. 라우터가 제 역할을 하는 지점은 한 계층 위, 즉 전문 모델을 둘러싼 작업에 있습니다: Base를 파인튜닝할 때 사용할 훈련 데이터를 생성하고 필터링하는 일, 형식 논리 모델에 입력할 프롬프트를 확장하는 일, 그리고 출력을 채점하는 일입니다. 이들은 텍스트 호출이며, 다음을 통해 실행됩니다: 제공업체 정가에 0% 마크업을 추가한 가격으로 200개 이상의 모델을 대상으로 하는 하나의 OpenAI 호환 엔드포인트, 따라서 제공업체의 가격 인하가 당일에 반영되고 한 데이터 생성 모델에서 다른 모델로의 전환은 두 번째 공급업체 관계가 아니라 구성 편집입니다.
자동 장애 조치(failover)는 파인튜닝 파이프라인에서 평소보다 더 중요합니다. 80%에서 죽은 배치 작업은 전체 실행을 통째로 낭비하기 때문입니다. 생성 모델 전반에 걸쳐 키 하나를 사용하고, 제공자 오류가 발생하면 재요청하는 폴백을 두는 것은 세 개의 API 통합보다 더 작은 인프라 조각입니다.

어느 쪽인지는 당신의 의도에 따라 결정됩니다.
훈련 중이라면 Base를 선택하세요. 형식 논리에서 추론 중이고 라이선스가 당신의 사용을 허용한다면 TwIL-LM3-Pro를 선택하세요. 오늘 당장 명령 수행형 소형 모델이 필요하고 두 제한 중 어느 것도 해당하지 않는다면, LFM2.5 2.6B의 포스트트레이닝된 형제 모델 — Liquid가 실제로 그 목적을 위해 공개하는 모델 — 을 사용하고, 어차피 계획하고 있던 미세 조정을 위해 Base는 남겨 두세요.


