
Ember-1 vs LFM2.5 2.6B Base: 완성된 행동 대 원시 기반
- openaiNEWOpenAI: GPT-6 Luna2026-09-2237지능
- openaiNEWOpenAI: GPT-6 Sol2026-09-2248지능
- anthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- grokNEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 100만 토큰당 · 177 tok/s
- orcaNEWOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1323 tok/s
- deepseekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- openaiOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- googleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- anthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 108 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 220 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236지능69코딩
- grokSpaceXAI: Grok 4.62026-08-1244지능77코딩
- metaMeta: Muse Spark 1.22026-08-0540지능72코딩
- qwenQwen: Qwen3.8 Max2026-08-0345지능76코딩
Ember-1도 LFM2.5 2.6B Base도 곧바로 집어서 쓸 수 있는 모델이 아니며, 둘은 정반대의 이유로 사용할 수 없다. 2026년 9월 23일 Fireworks Research가 공개한 Ember-1은 Moonshot AI의 Kimi K3에서 파생된 특화 모델로, 연구소가 약 40% 더 적은 토큰으로 K3의 정확도에 도달하도록 재학습시킨 것이다. 즉 완성된 동작이지만, 벤더 자체의 서버리스 플랫폼에서 연구 프리뷰로만 제공되며 가중치도, 공개된 가격도 없다. 2026년 8월 4일 Liquid AI가 공개한 LFM2.5 2.6B Base는 LFM Open License v1.0에 따라 배포되는 2.69B 파라미터 사전학습 체크포인트로, 명령어 튜닝이 전혀 되어 있지 않아 질문에 답하는 대신 여러분의 텍스트를 이어 쓸 뿐이다. 즉 오늘 바로 다운로드할 수 있는 날것의 기반이며, 의도적으로 미완성이다. 이 둘을 나란히 놓고 읽어 보면 효율성 향상이 이제 어디서 오는지에 관한 두 가지 주장을 살펴보기에 좋다.
두 모델이 모두 답하고 있는 질문
두 릴리스 모두 같은 전제를 깔고 있다: 모델을 더 크게 만들어 얻는 손쉬운 이득은 대부분 이미 거두어졌고, 흥미로운 작업은 모델이 이미 가진 것을 어떻게 쓰는가로 옮겨갔다는 것이다. 두 연구소는 그에 서로 다르게 답한다. Fireworks Research는 기존의 프런티어 모델을 가져와 그 행동을 바꿨다. Liquid AI는 작은 모델을 처음부터 만들어 규모를 바꿨다. 둘 다 새로운 아키텍처 이야기가 아니며, 어느 쪽도 리더보드 정상을 노리지 않는다.
Ember-1의 답변: 모델은 그대로 두고, 행동을 다시 학습시키세요
Ember-1은 Kimi K3의 아키텍처는 건드리지 않고 한 가지 특정 비효율만 공략한다. 추론 모델은 생성하는 토큰의 90% 이상을 내부 심의에 태워버릴 수 있으며, 멀티턴 에이전트 루프에서는 그 흔적이 이후 매 턴마다 다시 재생되고 다시 과금된다. Fireworks Research는 이로 인한 컨텍스트 증가가 턴 수에 대해 대략 제곱에 비례한다고 설명한다. 이 연구소의 주장은 K3의 추론이 작업에 필요한 것보다 길고, 그 초과분을 답변을 바꾸지 않고 제거할 수 있다는 것이다. 자체 서버리스 학습 스택에서 50건이 넘는 학습 실험과 200건이 넘는 평가를 실행했다고 보고하며, 7개 벤치마크와 2개 고객 프로덕션 트래픽 세트 전반에서 정확도 손실 없이 추론 길이가 35~50% 감소했다고 말한다. 이 모든 것은 벤더가 보고한 것이며 재현되지 않았다.
결과는 헤드라인 숫자가 가리는 방식으로 고르지 않다. Ember-1의 토큰 감소폭은 Terminal Bench 2.1의 51.9%부터 τ-2 Bench Airline의 5.9%까지 다양하다. 한 고객의 프로덕션 코딩 A/B에서는 출력 토큰이 49.3K에서 29.9K로 줄었고 점수는 0.751 대비 0.753을 유지했다 — 추론 토큰이 71.3% 줄어든 것이다. 이는 한 워크로드 형태에는 큰 효과이고 다른 형태에는 거의 보이지 않는 효과인데, 이는 덜 생각하도록 훈련된 모델이 아니라 과잉 사고를 멈추도록 훈련된 모델에서 기대할 수 있는 바로 그 결과다.

LFM2.5 2.6B Base의 답변: 스케일을 바꾸고 레시피는 유지하세요
LFM2.5 2.6B Base는 다른 종류의 승부수입니다. 이는 소규모로 구현된 Liquid AI의 하이브리드 아키텍처로, 30개 레이어 중 22개는 이중 게이트 단축 합성곱 블록이고 8개는 그룹 쿼리 어텐션 레이어이며, 약 34조 토큰으로 16개 언어에 걸쳐 학습되었고 131,072토큰 컨텍스트 창을 갖추고 있습니다. 전체 체크포인트는 2.69B 덴스 파라미터입니다 — 비용에 관한 논의가 더 이상 토큰에 관한 것이 아니라, 여유로 남는 단일 GPU가 무엇인지에 관한 것이 되기 시작할 만큼 작습니다.
이 모델이 특별한 이유는 그것이 의도적으로 하지 않는 일에 있다. 명령어 튜닝이 전혀 없는데, 이는 "Base" 접미사의 핵심이다: 질문을 주면 답하는 대신 질문의 문체로 텍스트를 이어간다. Liquid AI 자체 모델 카드에서는 이 모델을 상당한 파인튜닝이 필요한 작업에 권장한다. 또한 이에 대한 공개된 평가도 없는데, 이는 실수가 아니다 — 베이스 체크포인트를 명령어 수행 벤치마크로 평가하는 것은 아무것도 측정하지 못할 것이다, 왜냐하면 측정하려는 행동이 아직 훈련되지 않았기 때문이다.
대비, 차원당 한 줄씩
• 무엇인가 — Ember-1: 추론이 단축된 Kimi K3의 재훈련된 파생 모델. LFM2.5 2.6B Base: 명령어 튜닝이 없는, 처음부터 사전 훈련된 체크포인트.
• 매개변수 — Ember-1: 비공개, Kimi K3에서 계승. LFM2.5 2.6B Base: 2.69B 덴스.
• 가중치 — Ember-1: 공개된 것 없음. LFM2.5 2.6B Base: LFM 오픈 라이선스 v1.0에 따라 이용 가능.
• 가격 — Ember-1: 공개된 가격 없음; 벤치마크 비용은 Kimi K3의 요금표를 사용합니다. LFM2.5 2.6B Base: 무료로 다운로드 가능하며, 하드웨어는 직접 제공해야 합니다.
• 컨텍스트 — Ember-1: 프리뷰용으로 공개되지 않음. LFM2.5 2.6B Base: 131,072 토큰.
• 공개된 평가 — Ember-1: 7개 벤치마크와 2개 A/B 테스트, 모두 벤더가 수행. LFM2.5 2.6B Base: 없음, 설계상.
• 마지막에 얻는 것 — Ember-1: K3 수준의 정확도로 더 짧은 추론을 생성하는 엔드포인트. LFM2.5 2.6B Base: 훈련하는 대로 동작이 결정되는 시작점.
두 가지 다른 종류의 그리움
이 두 릴리스의 격차는 대칭적으로 보이지만 대칭적이지 않습니다. LFM2.5 2.6B Base의 평가 부재는 아티팩트의 속성입니다. 베이스 체크포인트에는 점수를 매길 동작이 없으며, 인스트럭션 튜닝의 부재는 결함이 아니라 문서화된 기능입니다. 이러한 부재는 상업적 불확실성을 만들지 않습니다. 왜냐하면 구매하는 것은 라이선스가 첨부된 파일이고, 다운로드가 끝나는 순간 결과물은 완성되기 때문입니다.
Ember-1의 빠진 부분들은 진정으로 미해결 상태입니다. 공개된 가격이 없으므로, 비용 주장은 예산을 세울 수 있는 요율이 아니라 Kimi K3의 요금표를 바탕으로 한 계산에 불과합니다. 가중치 공개도 없으므로, 이 모델은 공급업체가 계속 서비스하겠다는 결정보다 오래 존속할 수 없습니다. 그리고 접근 기간은 일시적이라고 설명됩니다: Fireworks Research는 자사의 연구 릴리스를 2주짜리 서버리스 기간으로 규정하며, 그 지속 여부는 커뮤니티 수요에 달려 있습니다. 다음 달에는 존재하지 않을 수도 있는 프리뷰는 단지 입증되지 않았을 뿐인 프리뷰와는 다른 사안이며, 발표문의 두 번째 고객 A/B — 작업당 토큰 약 35% 감소 — 는 연구소가 기대하는 바를 알려줄 뿐, 11월에도 여전히 접근 가능할지를 알려주지는 않습니다.
그 비대칭성이 "이들 중 어느 쪽이 더 준비되어 있는가"에 대한 솔직한 답이다. 둘 다 바로 투입 가능한 프로덕션 의존성이라는 의미에서는 준비되어 있지 않다. LFM2.5 2.6B Base는 원재료로서는 완성되어 있지만 모델로서는 미완성이다. Ember-1은 모델로서는 완성되어 있지만 서비스로서는 미완성이다.

이번 분기에 각각 무엇을 해야 할까
미세 조정 파이프라인과 레이블이 깔끔한 좁은 작업이 있다면, LFM2.5 2.6B Base가 둘 중 더 예측 가능한 쪽입니다. 체크포인트는 작고, 라이선스는 관대하며, 아키텍처는 추론 시 효율적이도록 설계되었고, 이를 유용한 무언가로 바꾸는 작업 — 지도 미세 조정, 평가 세트, 서빙 스택 — 은 이미 처음부터 끝까지 여러분이 소유한 작업입니다. 어느 쪽이든 여러분은 자체 평가를 실행하게 될 것입니다. Liquid AI가 어떤 평가도 공개하지 않았기 때문입니다.
청구서가 추론 토큰에 의해 좌우되는 호스팅형 에이전트 워크로드가 있다면, Ember-1은 비용 방정식에서 실질적인 항을 해결해 주며, 2주를 투자할 가치가 있습니다. 올바른 테스트는 기존 시스템을 상대로 한 섀도 트래픽입니다. 실제 요청의 일부를 양쪽 모두에 보내고, 출력을 비교하고, 라이브 결과는 그대로 두세요. 이는 이번 릴리스에 대한 독립적인 비판적 보도가 제시한 조언이기도 하며, 공정한 경고도 함께했습니다 — 숙고를 압축하면 모델에 필요했던 단계를 잃을 위험이 있고, 에이전트에서는 그것이 나중에 잘못된 문장이 아니라 잘못된 도구 호출로 나타납니다.
두 모델 모두 OrcaRouter에 없습니다. 이 두 산출물 — 하나의 파이프라인에 있는 작은 파인튜닝 가능 모델과 대형 호스팅 추론기 — 이 아니라 그 패턴을 테스트하고 싶다면, 바로 그것이 라우팅 DSL이 존재하는 이유입니다: 여러 모델을 하나의 호출로 구성하세요 그리고 각각이 잘하는 부분을 처리하게 하세요. 이 모든 것의 뒤에는 하나의 키와 하나의 청구서. 두 특정 엔드포인트 모두 접근할 수 없는 상황에서도 여기서의 비교는 아키텍처 수준에서 해볼 가치가 있습니다.
그 거래, 한 번만 말하겠다.
Ember-1은 행동의 확실성과 공급의 불확실성을 판다: 품질은 신중하게 논증되고 가용성은 명시적으로 조건부인 모델이다. LFM2.5 2.6B Base는 공급의 확실성과 행동의 불확실성을 판다: 언제나 보유하게 될 파일이며, 그 역량은 전적으로 여러분이 투입한 학습에 의해 결정된다. 서빙 문제가 있지만 학습 역량이 없는 팀은 프리뷰를 지켜보며 그것이 영구화되기를 바라야 한다. 학습 역량이 있고 과업이 좁은 팀은 베이스를 다운로드하고 누군가의 로드맵을 기다리는 일을 그만두어야 한다.

이 조합이 실제로 보여주는 것은 "효율성"이 더 이상 한 가지를 의미하지 않게 되었다는 점이다. Ember-1에게 그것은 남의 하드웨어에서 같은 품질로 더 적은 토큰을 의미한다. LFM2.5 2.6B Base에게 그것은 하드웨어가 아예 남의 것이 아니게 될 만큼 충분히 작은 모델을 의미한다. 둘 다 좋은 답이며, 서로 바꿔 쓸 수 있는 것이 아니다.
