
Solar Mini 4 vs LFM2.5 2.6B Base: 지수는 세 배, 그리고 존재하지 않는 비용 비교
- openaiNEWOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 100만 토큰당
- anthropicNEWAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 100만 토큰당 · 159 tok/s
- typesafeNEWTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 100만 토큰당 · 220 tok/s
- OpenAINEWOpenAI: GPT-6 Luna2026-09-2238지능
- OpenAINEWOpenAI: GPT-6 Sol2026-09-2248지능
- AnthropicNEWAnthropic: Claude Opus 5.52026-09-2258지능
- xAINEWGrok 4.72026-09-2146지능
- OrcaNEWOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 100만 토큰당 · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 100만 토큰당 · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040지능
- OpenAIOpenAI: GPT-6 Astra2026-09-0453지능77코딩
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241지능76코딩
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245지능76코딩
- AnthropicAnthropic: Claude Fable 5.12026-09-0153지능82코딩
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 100만 토큰당 · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 100만 토큰당 · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642지능72코딩
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 100만 토큰당 · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845지능75코딩
- obsidianQwen3.8 27B2026-08-1534지능68코딩
Solar Mini 4와 LFM2.5 2.6B Base를 솔직하게 비교하려면, 애초에 두 모델이 같은 시장에 있지 않다는 점을 먼저 인정해야 합니다. Solar Mini 4는 Upstage의 350억 개 파라미터 희소 전문가 혼합(mixture-of-experts) 모델로, 2026년 9월 22일 출시되었으며 토큰당 약 30억 개 파라미터를 활성화하고, 독점 모델이며 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.40으로 과금됩니다. LFM2.5 2.6B Base는 Liquid AI의 26.9억 개 파라미터 사전 학습 체크포인트로, 2026년 8월 초 LFM Open License v1.0에 따라 Hugging Face에 공개되었고, 휴대폰 메모리에 올라갈 만큼 작습니다. 하나는 엔드포인트입니다. 다른 하나는 가중치 파일이며, 모델을 호출하기보다 직접 실행하고 싶어서 이 글을 읽고 있다면 비교는 이미 끝난 셈입니다.
어쨌든 이 조합이 기사로 다룰 가치가 있는 이유는 두 모델이 진정으로 겹치는 단 하나의 차원에 있다. 둘 다 동일한 독립적 잣대에 비추어 평가되어 왔고, 그 비교의 양상은 파라미터 수가 예측하는 바로 그 모습이다. Artificial Analysis는 Intelligence Index v4.3에서 Solar Mini 4에 24점을 주고 LFM2.5 2.6B generation에 8.4점을 매긴다. 하지만 두 번째 수치는 추정치이며, 이 기사의 제목에 있는 체크포인트를 측정한 것이 아니다. 두 가지 단서 모두 중요하며, 이것이 가장 먼저 정리해야 할 사항이다.
나란히 보는 사양 시트
• 파라미터 — Solar Mini 4는 총 35B 중 3B가 활성화되며; LFM2.5 2.6B Base는 2.69B로 dense하고, 아무것도 숨기지 않습니다. Upstage 측은 거의 동일한 토큰당 컴퓨팅 예산으로 13배의 가중치를 가집니다.
• 아키텍처 — Solar Mini 4는 희소 전문가 혼합(mixture-of-experts) 모델입니다. LFM2.5 2.6B Base는 30개 레이어로 구성되며, 그중 22개는 이중 게이팅된 단축 합성곱 블록이고 8개는 그룹 쿼리 어텐션으로, Liquid가 CPU 및 엣지 추론을 위해 설계한 하이브리드 구조입니다.
• 학습 — Upstage는 토큰 예산을 공개하지 않습니다. Liquid의 카드에는 16개 언어에 걸쳐 34조 개의 토큰과 128,000개 토큰 어휘가 명시되어 있으며, 그중에는 한국어와 일본어도 포함됩니다.
• 라이선스 — Solar Mini 4는 독점 소프트웨어입니다. LFM2.5 2.6B Base는 LFM Open License v1.0에 따라 배포됩니다. 조건이 충족되면 상업적 사용이 허용되며 파인튜닝도 가능합니다.
• 컨텍스트 — Upstage는 512K 토큰을 문서화하고, Artificial Analysis는 동일 모델에 대해 1.05M을 기재하므로 상한은 미확정으로 보아야 합니다. LFM2.5 2.6B Base는 131,072로 동작합니다.
• 모달리티 — 둘 다 텍스트 입력, 텍스트 출력입니다. 어느 쪽도 이미지나 오디오를 처리하지 않습니다.
• 가격 — Solar Mini 4는 백만 토큰당 $0.10 / 캐시된 경우 $0.01 / $0.40이며, 현재 2026년 10월 22일까지 50% 할인 중입니다. LFM2.5 2.6B Base는 요금표가 전혀 없으며, 호스트인 Artificial Analysis는 LFM2.5 2.6B 세대의 가격을 $0.00으로 추적합니다.
"8.4, estimated"가 측정하는 것과 측정하지 않는 것

LFM2.5 2.6B 세대에 대한 Artificial Analysis의 항목 — 사후 학습된 모델이며 사전 학습된 Base가 아님 — 은 추정치로 표시된 8.4의 지수를 제시하며, 대부분의 구성 요소 평가에도 같은 표시가 붙어 있습니다. 이는 리더보드상의 위치일 뿐, 이를 기준으로 구축해야 할 사양이 아니며, 누군가 Base 체크포인트를 해당 스위트에 돌린 것처럼 인용되어서는 안 됩니다. 아무도 그렇게 하지 않았습니다. Liquid 자체의 모델 카드는 LFM2.5 2.6B Base에 대한 벤치마크 표를 전혀 게재하지 않습니다: 이는 사전 학습된 텍스트 완성 체크포인트이며, 카드에는 대규모 파인튜닝에만 권장된다고 분명히 명시되어 있습니다.
점수가 매겨진 형제 모델은 별개의 아티팩트다. 포스트트레이닝된 LFM2.5 2.6B에 대한 Liquid의 벤치마크 표는 IFStruct 85.5, Multi-IF 80.1, AIME25 51.9, LiveCodeBench v6 59.4, BFCLv4 56.9, τ³-Banking 5.7을 보여준다 — 모두 벤더가 실행한 것이고, 모두 인스트럭션 튜닝된 빌드에서 측정되었으며, τ³ 수치가 경고처럼 읽히는 바로 그 값이다.
Solar Mini 4의 프로필은 완전히 다른 형태입니다. 장문맥 추론을 위한 AA-LCR v1.1에서 83.3%를 기록하고, SciCode에서 47.6%, AA-Omniscience에서 −10.8을 기록했으며 정확도 18.4%, 비환각률 64.2%입니다. 또한 Terminal-Bench 4.0에서 1%, AutomationBench-AA에서 22.3%를 기록합니다. 두 제품군 모두 에이전트 작업에 취약합니다. Upstage의 모델은 에이전트 작업에 취약하면서도 비싸다는 점에서, 에이전트 작업에 취약하지만 무료인 것보다 더 나쁜 처지입니다.
Solar Mini 4가 가격값을 하는 지점은 추론의 규모다. 인덱스 작업당 88,300개의 출력 토큰 — 그중 71,600개가 추론 — 을 쓰면서, 이 모델은 2.6B 덴스 모델이 더 긴 프롬프트를 받는 것만으로는 흉내 낼 수 없는 방식으로 연산을 소비한다. 2.69B 파라미터를 가진 모델에게는 단계별로 생각하라고 말할 수 있지만, 35B 파라미터를 가지라고 말할 수는 없다. 그것이 실제 제품이다.
지수의 세 배, 그리고 비교할 만한 비용 수치는 없습니다.
Artificial Analysis는 Solar Mini 4를 완료된 인덱스 작업당 $0.36로, Granite 4.2 3B를 $0.006으로 산정하며, LFM2.5 2.6B 생성은 가격이 0이므로, 이 비율을 공정하게 만들 작업당 비용 수치는 존재하지 않는다. 따라서 “Solar Mini 4는 LFM2.5 2.6B Base보다 훨씬 더 많은 비용이 든다”는 프레이밍은 사실이며 약간 핵심을 벗어난다. 관련 질문은 Solar Mini 4가 위해 만들어진 한국어 장문 문서 구조적 추출 작업을 2.69B 사전학습 체크포인트가 애초에 할 수 있는지 여부다. 보통은 할 수 없으며, 그럼 비교는 Solar Mini 4 대 휴대폰 모델이 아니라 Solar Mini 4 대 최전선 범용 모델이 된다.
LFM2.5 2.6B Base가 이기는 경우는 더 저렴한 경우가 아니다. 그것은 작업이 파인튜닝으로 격차를 좁힐 만큼 충분히 좁은 경우이다. 알려진 문서 형식에서의 구조화된 필드 추출, 고정된 분류 체계에 대한 분류, 네트워크 없이 작동해야 하는 온디바이스 어시스턴트 — 이러한 작업은 2.69B 체크포인트와 자체 학습 데이터가 35B 범용 모델에 요금표를 더한 것을 능가하고, 토큰 미터 대신 GPU 인스턴스 비용이 드는 작업이다. Liquid는 바로 그 움직임을 위해 Unsloth와 TRL을 통해 continued-pretraining, LoRA SFT, DPO 및 GRPO 레시피와 함께 기본 체크포인트를 제공한다.
어느 것을 불러야 하나요
입력이 길고, 출력에 추론이 필요하며, 언어 조합에 한국어나 일본어가 포함되고, 어려운 작업마다 7분의 디코딩 시간을 감수할 수 있을 때는 Solar Mini 4를 선택하세요. 가중치를 직접 소유해야 하고, 기기에 네트워크가 없으며, 작업이 미세 조정할 수 있을 만큼 좁을 때는 LFM2.5 2.6B Base를 선택하세요. 흥미로운 배포는 둘 다 사용합니다. 왜냐하면 이 둘은 대안이 아니기 때문입니다. 작은 로컬 모델이 라우팅, 비식별화, 추출을 담당하고, 호스팅 모델은 실제로 35B 파라미터가 필요했던 요청 중 일부에 대해서만 호출됩니다.
Liquid의 모델은 OrcaRouter에 없고, Upstage의 모델도 없습니다. 따라서 어느 쪽 경로도 저희가 판매할 수 있는 것이 아닙니다. 저희가 할 수 있는 일은 이 비교를 결정에서 구성으로 바꿔 주는 부분입니다: 하나의 키로 200개 이상의 모델을 제공하며, 제공업체 정가 대비 0% 마크업, 제공업체 간 자동 장애 조치(failover)와 여러 모델을 단일 호출로 구성할 수 있게 해 주는 라우팅 DSL. 정답이 "대부분의 경우에는 저렴한 모델, 중요한 순간에는 좋은 모델"이라면, 그것은 라우팅 문제이며, 라우팅 DSL이 존재하는 이유입니다.

어느 벤더도 슬라이드에 올리지 않을 숫자
지연 시간. Solar Mini 4는 Intelligence Index 작업당 88,300개의 출력 토큰을 측정된 초당 204토큰으로 소비하므로, 각 고난도 작업에서 평균 430초, 즉 7분이 조금 넘는 시간이 걸렸습니다. Artificial Analysis가 테스트한 호스트에서 LFM2.5 2.6B 세대는 첫 청크까지 2.8초를 기다리며 초당 45.7토큰으로 실행되었지만, 이는 평소라면 책상 위에서 실행될 모델을 상대하는 데이터센터 호스트의 수치입니다. Liquid의 자체 측정에 따르면 동일한 아키텍처는 M5 Max에서 초당 220토큰, Ryzen AI Max+ 395에서 초당 113토큰, 휴대폰에서 약 초당 30토큰을 내며, 이는 네트워크가 없는 기기에서도 사용할 수 있는 에이전트 루프입니다.
워크로드가 인터랙티브라면 비교는 차이가 확실하고, 어떤 벤치마크 점수도 그것을 바꾸지 못합니다. 워크로드가 배치이고 기다리는 것이 cron 작업이라면, 7분은 괜찮으며 그 추론 깊이는 그만한 가치가 있습니다.

끝으로 두 가지 출처 관련 주석을 남깁니다. 여기 있는 모든 Artificial Analysis 수치는 해당 기관이 공통 스위트에서 독립적으로 측정한 값입니다. LFM2.5 2.6B 지수는 명시적으로 추정치이며, 위에 명시된 사전 학습 Base 체크포인트가 아니라 사후 학습된 모델을 대상으로 합니다. 모든 Liquid AI 수치는 공급업체가 자사 벤치마크에서 실행한 결과이며 재현되지 않았습니다. 그리고 Base 체크포인트 자체는 공개된 점수가 전혀 없는데, 이는 이 모델에 대한 비판이라기보다 사전 학습 모델에 관한 사실입니다.
