
Intern-Decision-0.8B vs LFM2.5 2.6B Base: 스스로 무언가를 만드는 두 가지 방법
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 592 tok/s
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 187 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1306 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 113 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 224 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
Intern-Decision-0.8B를 LFM2.5 2.6B Base 옆에 놓고 보면, 솔직한 첫 관찰은 둘 중 어느 것도 구매자가 보통 말하는 의미의 제품은 아니라는 것이다. Intern-Decision-0.8B는 InternLM이 2026년 9월 26일 아무런 발표도 없이 Hugging Face에 업로드한 체크포인트다 — Qwen3.5-0.8B를 852,985,920개 파라미터로 파인튜닝한 모델로, 타이핑한 질문에 답하지만 텍스트를 출력하지 않으며, 404가 뜨는 GitHub 링크와 함께 Apache 2.0으로 배포되었다. LFM2.5 2.6B Base는 Liquid AI가 2026년 8월 1일 LFM2.5 패밀리의 기반으로 게시한 26억 9천만 파라미터 사전 학습 텍스트 체크포인트이며, 자체 카드에는 "상당한 파인튜닝이 필요한 작업에만 권장된다"라고 적혀 있다. 하나는 완성되었고 좁다. 다른 하나는 미완성이며 범용적이다. 둘 다 당신이 작업을 수행하는 사람이라고 가정한다 — 그리고 그 작업은 같은 작업이 아니다.
그 구분이 비교의 전부이며, 그것이 단순한 스펙 표가 오해를 불러일으킬 수 있는 이유다. 독자가 실제로 품는 질문은 "이 중에서 무엇을 다운로드해야 하지?"이고, 그 답은 당신이 만들어야 하는 것이 결정 계층인지 언어 능력인지에 달려 있다. 이 둘은 일정이 다른 서로 다른 프로젝트다.
각 모델이 여러분에게 건네는 것
Intern-Decision-0.8B는 작동하는 시스템으로 등장합니다. 저장소는 inference.py, DecisionEngine 클래스, 문서화된 요청 스키마와 응답 스키마, 그리고 네 개의 버전이 고정된 Python 의존성을 설치한 후 실행할 수 있는 예제를 제공합니다. 상태 하나, 각각 최대 62개의 옵션을 가진 1~16개의 명명된 질문, 선택적으로 최대 8개의 이미지를 제공하면, 각 필드에 대해 보정된 분포와 argmax 레이블을 돌려받습니다. 이 엔진은 무엇인가를 생성하는 대신 미리 렌더링된 스켈레톤의 고정된 위치에서 로짓을 읽으므로, 디코딩 단계도, 출력 토큰도, 복구할 JSON도 없습니다. 이는 대략 1.73GB의 파일에서 실행됩니다.
LFM2.5 2.6B Base는 정반대를 안겨줍니다: 인터페이스 없는 원시 능력입니다. 이는 텍스트 전용 인과 언어 모델로, 22개의 이중 게이트 단기 컨볼루션 블록과 8개의 그룹화된 쿼리 어텐션 레이어로 구성된 30개 레이어를 가지며, 16개 언어에 걸쳐 약 34조 토큰으로 사전 학습되었고, 128,000개 토큰 어휘와 131,072개 토큰 컨텍스트 창을 갖추고 있습니다. 자체적인 지시 튜닝이 없고 카드에 작업 벤치마크도 없는데, 이는 베이스 체크포인트는 점수가 매겨지지 않기 때문입니다 — 여러분이 그것으로부터 훈련하는 모델이 점수가 매겨집니다. Liquid 자체의 사후 훈련 파이프라인이 이를 에이전트형 LFM2.5-2.6B로 바꾸는 것이며, 바로 그 파이프라인이 여러분이 자신의 도메인을 위해 부분적으로 또는 전체적으로 재현하도록 요청받는 대상입니다.
그러니까 축은 규모가 아니다. 그것은 빠진 조각이 의사결정 계약인지, 아니면 학습 실행인지의 여부다.
단서가 붙은 점수판
• 첫 결과까지 걸리는 시간 — Intern-Decision-0.8B: 체크포인트를 로드하고 predict()를 호출하는 데 반나절/. LFM2.5 2.6B Base: continued pre-training 또는 SFT 실행에 걸리는 시간만큼, 그리고 이를 준비하기 위한 데이터 작업까지.
• 매개변수 — Intern-Decision-0.8B: 1.50GB 언어 샤드, 176MB 비전 샤드, 25MB 프로젝터에 걸쳐 852,985,920개. LFM2.5 2.6B Base: 2.69B, 약 2.5GB의 가중치.
• 입력 모달리티 — Intern-Decision-0.8B: 텍스트와 최대 8개의 이미지, 비전 가중치는 저장소에 포함되어 있습니다. LFM2.5 2.6B Base: 설계상 텍스트 전용 — LFM2.5 패밀리의 멀티모달 작업은 VL 변형에 있습니다.
• 실용적 컨텍스트 — Intern-Decision-0.8B: 8,192 토큰, config에 262,144 최대 위치 임베딩이 있음에도 불구하고 잘리기보다는 거부됨. LFM2.5 2.6B Base: 131,072 토큰 네이티브.
• 출력 — Intern-Decision-0.8B: 필드별 보정된 확률 분포와 argmax 레이블, 결정론적. LFM2.5 2.6B Base: 이어쓰기 텍스트, 샘플링됨.
• 벤치마크 — Intern-Decision-0.8B: 7개 벤치마크 전반에 걸친 완전한 벤더 표를 제공했으나, 누구도 이를 재현하지 못했습니다. LFM2.5 2.6B Base: 베이스 자체에 대해서는 설계상 아무것도 공개된 바 없습니다.
• 라이선스 — Intern-Decision-0.8B: Apache 2.0, 보존된 LICENSE-QWEN/ (업스트림 가중치용). LFM2.5 2.6B Base: LFM Open License v1.0.

라이선스 행은 자체 섹션이 필요합니다
두 카드 모두 'open'이라고 표시하지만, 그 두 단어는 실질적으로 서로 다른 것을 뜻합니다. Intern-Decision-0.8B는 Apache 2.0입니다 — 수익 조건도, 사용 분야 제한도, 별도로 협상해야 할 상업적 허여도 없습니다. 저장소의 두 번째 라이선스 파일은 이 모델이 Qwen3.5-0.8B의 파생물이기 때문에 이어받은 Qwen 라이선스이며, 이는 제한이라기보다 올바른 처리 방식입니다.
LFM2.5 2.6B Base는 LFM Open License v1.0에 따라 배포되며, 상업적 계획이 이에 의존하기 전에 해당 라이선스의 제5조를 전문을 읽어볼 가치가 있습니다. 상업적 사용에 부여된 권리는 귀하 또는 귀하의 법인이 라이선스에서 연간 매출 1,000만 미국 달러 이상으로 정의된 기준을 초과하지 않는 것을 조건으로 합니다. 그 선을 넘으면, 해당 저작물 또는 파생물의 상업적 사용은 본 계약에 따라 라이선스되지 않습니다. 비영리 및 연구 사용은 예외로 되어 있습니다. 이는 실질적이고 집행 가능한 경계이며, 파생물에도 적용되기 때문에 베이스에서 파인튜닝하는 모든 것에까지 전파됩니다. 이는 이 체크포인트의 의도된 용도 전체에 해당합니다.
여기에는 단순명료한 해석이 있습니다. 상업적으로 구축 중이고 귀하의 법인이 연간 매출 $10M을 넘긴다면, LFM2.5 2.6B Base는 두 모델의 성능이 어떻든 Intern-Decision-0.8B와 같은 종류의 자산이 아닙니다. 임계값 아래에 있거나, 연구 중이거나, 비상업적 목적으로 파인튜닝하는 경우라면 이 구분은 문제가 되지 않습니다. 어느 쪽이든 이는 학습을 실행하기 전에 답해야 할 질문이지, 그 후에 답할 질문이 아닙니다.
각각이 실제로 올바른 다운로드인 곳
LFM2.5 2.6B Base는 필요한 역량이 아직 완성된 모델에 존재하지 않을 때 올바른 선택입니다. Liquid의 카드에는 의도된 사례가 명시적으로 나열되어 있습니다. 일본어와 같은 언어별 어시스턴트, 의료와 같은 도메인별 어시스턴트, API로 보낼 수 없는 독점 데이터로 학습하기, 또는 새로운 포스트 트레이닝 접근법을 실험하기입니다. 그 목록의 근거는 34조 토큰의 다국어 사전 학습은 재현하기에는 비용이 많이 들고 물려받기에는 거의 무료라는 점입니다. 즉, 여러분은 이미 16개 언어와 128K 컨텍스트 전반에서 유능한 출발점을 사고, 자신에게 특화된 부분에 자신의 컴퓨팅을 쓰는 것입니다.
그 계획에 대한 생태계 지원은 이렇게 새로운 모델치고는 이례적으로 완성도가 높다. Liquid는 Unsloth와 TRL을 통한 연속 사전 학습, SFT, DPO, GRPO를 문서화하며, 각각에 대한 노트북도 제공한다. 그리고 이 체크포인트는 Transformers, vLLM, SGLang, llama.cpp, MLX 및 LM Studio에서 지원된다. 이것은 마케팅 문구가 아니다 — 이번 주에 파인튜닝할 수 있는 베이스 모델과 트레이너에 끼워 맞추느라 2주를 보내야 하는 모델의 차이다.
Intern-Decision-0.8B는 필요한 역량이 이미 존재하고 문제가 그 형태에 있을 때 올바른 선택이다. 여러분의 작업이 닫힌 정답 집합을 가진 경계가 명확한 결정이라면 — 이 티켓을 라우팅하고, 이 청구를 채점하고, 이 레코드를 루브릭에 따라 분류하는 — 생성 모델은 레이블을 얻는 어색한 방법이고, 베이스 모델은 레이블을 얻는 방법이 전혀 아니다. 여러분이 원하는 것은 분포를 반환하고, 신뢰도를 알려주며, 매번 동일한 34밀리초 안에 그것을 해내는 무언가다. 단일 RTX 4090에서 측정된 InternLM의 지연 시간은 평균 33.98ms, p95 37.50ms이며, 이 카드 자체의 수치는 2B 형제 모델이 평균 33.28ms임을 보여준다 — 이는 이러한 프롬프트 길이에서 비용은 가중치를 실행하는 데가 아니라 스키마를 읽는 데서 발생한다는 것을 상기시켜 준다.
당신이 하고 있는 거래는 계약을 얻는 대신 유연성을 포기하는 것입니다. 베이스 모델은 데이터와 컴퓨트만 있으면 결국 무엇이든 될 수 있습니다. 결정 헤드는 이미 그것 자체이며, 결코 다른 무엇이 되지 않습니다. 스키마의 형태가 매달 바뀐다면 그것은 실제 비용입니다. 그렇지 않다면 그것은 전혀 비용이 아닙니다.
Intern-Decision 테이블에 대해 누구도 알려줄 수 없는 것
Intern-Decision-0.8B의 모든 성능 수치는 벤더가 보고한 것이며, 여기서의 주의 사항은 평소보다 더 큽니다. 이번 출시는 일주일밖에 되지 않았고 전혀 문서화되지 않았기 때문입니다. 논문도 없고, 세 가지 크기를 모아 놓은 컬렉션도 없고, 작동하는 GitHub 리포지토리도 없으며, 독립적인 평가도 없습니다. Artificial Analysis에서 검색해도 이 모델에 대해서는 아무것도 나오지 않습니다.
InternLM은 벤치마크를 선정하고, TypeSafe의 Jev, Convai의 Laya와 Kev를 포함한 의사결정 모델이 주를 이루는 비교 모델 세트를 선정했으며, 출시 게시물 없이 표를 공개했다.

그 라벨이 붙어 있음에도, 그 형태는 여전히 읽어볼 가치가 있다. Intern-Decision-0.8B는 세 개의 Jevbench 분할에서 97.92 / 80.56 / 52.25를 기록하고, Typed Decision에서 77.35, ToolACE에서 94.52를 기록하며 평균 79.38을 낸다. 이 모델의 캘리브레이션 프로파일이 가장 흥미로운 항목이다. Brier는 0.530, 기대 캘리브레이션 오차는 0.066으로, Brier는 더 나쁘지만 ECE는 Jev의 0.095보다 더 좋다. 쉬운 말로 하면 정확도는 더 낮지만 자신이 얼마나 정확한지에 대해서는 더 정직하다는 뜻이며, 임계값 기반 워크플로에서는 이러한 순서가 평균보다 더 중요하다. 배포를 멈춰 세워야 할 칼럼은 WildJail로, Jev의 96.29에 맞서 64.48이다. 이렇게 큰 거부 견고성 결손은 파인튜닝의 속성이며, 그것이 Qwen3.5-0.8B 베이스에 속하는 것인지, 결정 튜닝 목표에 속하는 것인지, 아니면 파라미터 수에 속하는 것인지는 카드 어디에도 문서화되어 있지 않다.
이 축에서 LFM2.5 2.6B Base와의 비교는 "누가 더 높은 점수를 받는가"가 아니다. 베이스에는 점수가 없기 때문이다. 그것은 한 모델의 수치는 감사를 받지 않았고 다른 모델의 수치는 존재하지 않는다는 점이며, 둘 사이에서 선택하는 독자는 어떤 종류의 미지를 다뤄야 할지 선택하는 것이다.
대부분의 사람들이 실제로 결국 구축하게 되는 파이프라인
둘 모두를 사용하는 구성이 하나 있는데, 대부분의 프로덕션 시스템이 바로 여기에 안착하기 때문에 이름을 붙일 가치가 있습니다. 결정 계층은 정답 집합이 알려져 있고, 지연 시간이 백만 건의 레코드에 걸쳐 누적되며, 출력 토큰이 순전히 오버헤드인 폐쇄형 호출—트리아지, 라우팅, 루브릭 채점—을 처리합니다. 언어 계층은 산문, 종합, 긴 컨텍스트가 필요한 모든 것, 즉 에스컬레이션 요약, 레이블에 첨부된 설명, 사람이 편집하는 초안을 처리합니다. LFM2.5 2.6B Base는 학습할 가치가 있는 도메인 데이터가 있다면 후반부를 위한 그럴듯한 기반이며, 결정 헤드는 전반부의 자연스러운 형태입니다.
이 둘을 합성하는 것이 까다로운 부분이며, 바로 직접 만들지 않을 가치가 있는 부분입니다. OrcaRouter의 라우팅 DSL은 라우팅을 코드로 표현합니다 — CEL 조건이 포함된 YAML이고, 재배포 없이 배포됩니다 — 따라서 한 부류의 요청은 결정 엔드포인트로, 또 다른 요청은 언어 모델로 보내는 파이프라인은 직접 유지 관리하는 로드 밸런서가 아니라 하나의 라우팅 규칙이 됩니다. 이 게이트웨이는 하나의 OpenAI 호환 키 뒤에서 200개 이상의 모델을 아우르며 제공업체 정가를 마진 없이 그대로 전달합니다, 그리고 선택한 모델에 마진을 붙이지도 않습니다. 경계를 정확히 하자면, Intern-Decision-0.8B도 LFM2.5 2.6B Base도 우리 것이 아닙니다 — 둘 다 직접 다운로드해 로컬에서 실행하는 체크포인트이며, 두 경우 모두 그 점이 핵심입니다. 2GB 모델을 고르는 이유는 바로 데이터가 이미 있는 곳에서 실행되기 때문이니까요. 게이트웨이가 필요한 부분은 그렇지 않았다면 외부로 호출했을 스택의 나머지 절반입니다.
결정 레이어가 훈련 실행을 거기에 투입하지 않고 테스트하고 싶은 부분이라면, 호스팅된 결정 모델이 더 저렴한 실험이며, TypeSafe의 Jev 1.13이 InternLM이 벤치마크한 대상입니다 — 오늘 바로 단일 OpenAI 호환 엔드포인트를 통해 호출할 수 있으며, 입력 토큰 100만 개당 $0.042, 출력 요금은 0입니다.

그럼 어느 것?
LFM2.5 2.6B Base는 아직 해당 기능이 존재하지 않고 도메인 데이터와 파인튜닝 실행에 대한 의욕을 모두 갖추고 있다면 선택하고, 상업적으로 이를 기반으로 구축하기 전에 LFM Open License의 $10M 매출 임계값을 확인하세요. Intern-Decision-0.8B는 해당 기능이 존재하고, 답변이 프롬프트에 이미 열거 가능하며, 필요한 것이 레이블을 얻는 빠르고 결정론적이며 라이선스가 깨끗한 방법일 때 선택하세요 — 다만 그 문서가 누락되어 있고, 벤치마크가 감사되지 않았으며, 적대적 입력에 대한 거부 행동이 이를 튜닝한 연구소 외부의 누구에 의해서도 테스트되지 않았다는 점을 받아들여야 합니다. 두 번째는 더 짧은 경로이자 더 큰 미지수입니다. 첫 번째는 더 긴 경로이자 더 문서화된 쪽이며, 그 사실들 중 어느 것도 더 낫다는 것과 같지 않습니다.
