생성된 히어로 타이틀 카드로, 'Solar Mini 4 vs Granite 4.2 3B'라는 제목, '호출하는 모델과 다운로드하는 체크포인트'라는 부제목, 그리고 '각각 토큰당 약 30억 개의 파라미터가 활성화됨'과 '하나는 토큰당 과금하고, 다른 하나는 와트당 과금함'이라는 두 개의 배지가 표시됩니다.
Guides & Insights

Solar Mini 4 vs Granite 4.2 3B: 호출하는 모델과 다운로드하는 체크포인트

작성자

Gideon Frost

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Solar Mini 4를 Granite 4.2 3B 옆에 놓아 보자. 흥미로운 숫자는 벤치마크 격차가 아니다. IBM이 2026년 8월 25일에 공개한 Apache-2.0 추론 모델인 Granite 4.2 3B는 오늘 밤 노트북에서 무료로 돌아가지만, Upstage가 2026년 9월 22일에 공개한 독점 모델인 Solar Mini 4는 당신이 소유한 어디에서도 돌아가지 않고 질문에 답하는 데 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.40를 청구한다는 점이다. 둘 다 토큰당 약 30억 개 파라미터의 연산을 활성화한다. 하나는 파일이다. 다른 하나는 미터기다.

그 차이는 이 비교에 관한 거의 모든 나머지, 심지어 어떤 벤치마크를 나란히 놓을 가치가 있는지까지 결정한다. Granite 4.2 3B는 Solar Mini 4보다 훨씬 먼저 독립적인 평가를 받았다 — Artificial Analysis는 Solar Mini 4를 24점으로 평가하는 것과 동일한 평가 스위트와 동일한 기관에서, Intelligence Index v4.3.2에서 이 모델에 9점을 준다. 즉, 여기서의 15점 차이는 이례적으로 근거가 탄탄하다: 하나의 연구소, 하나의 방법론, 그리고 아무도 믿음만으로 받아들일 필요가 없었던 두 모델이다.

그 명세는, 실제로 이들을 구분하는 차원에 관해서는

• 아키텍처 — Solar Mini 4는 희소 전문가 혼합(MoE) 모델로, Upstage에 따르면 총 35B 파라미터에 토큰당 3B가 활성화됩니다. Granite 4.2 3B는 dense 모델로, safetensors 메타데이터에 따르면 약 3B 파라미터이고 임베딩을 포함하면 총 약 4B입니다. 동일한 활성화 예산을 서로 다른 두 가지 방식으로 사용하는 셈입니다.

• 가중치 — Solar Mini 4는 독점 모델로 비공개입니다. Granite 4.2 3B는 데이터 비율까지 문서화된 학습 레시피와 함께 Apache 2.0 라이선스로 배포됩니다.

• 컨텍스트 — Upstage는 512K 토큰과 최대 128K 출력을 문서에 명시하지만, Artificial Analysis는 같은 모델에 대해 1.0M을 제시하므로 상한은 미확정으로 보아야 합니다. Granite 4.2 3B는 기본적으로 131,072 토큰을 지원하며, 다섯 번째 사전 학습 단계를 통해 512K로 확장됩니다.

• 가격 — Solar Mini 4는 백만 토큰당 $0.10 / 캐시 사용 시 $0.01 / $0.40이며, 현재 2026년 10월 22일까지 50% 할인 중입니다. Granite 4.2 3B는 임대할 것이 없기 때문에 벤더 요금표가 존재하지 않습니다. Artificial Analysis가 추적하는 호스팅 엔드포인트에서는 약 $0.03 / $0.12로 책정하며, 자체 호스팅에는 전기 요금이 듭니다.

• 지능 지수 — Solar Mini 4는 24, Granite 4.2 3B는 9이며, 두 수치 모두 Artificial Analysis v4.3.2 기준입니다.

• 속도 — Solar Mini 4의 초당 출력 토큰은 204개, Granite 4.2 3B는 223개이며, 둘 다 동일한 연구소에서 측정되었습니다. 첫 청크까지 걸리는 시간은 각각 1.5초와 0.5초입니다. 두 지표 모두에서 Dense 모델이 더 빠릅니다.

15점 격차는 실제로 무엇으로 이루어져 있는가

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

개별 평가들은 Granite 4.2 3B에게는 헤드라인보다 덜 호의적인 이야기를, Solar Mini 4에게는 더 복잡한 이야기를 들려준다. 장문맥 추론 벤치마크인 AA-LCR v1.1에서 Solar Mini 4는 83%, Granite 4.2 3B는 24%를 기록한다. 그 단일 평가가 지수 차이의 막대한 부분을 차지하며, 이는 규모의 우연이 아니다 — 그것은 512K~1M 토큰의 컨텍스트와 이를 활용하는 훈련으로 얻는 것이다. Granite 4.2 3B의 윈도는 기본적으로 131K에서 최대치다. 확장된 512K 단계가 존재하긴 하지만, 그 모델은 Solar Mini 4처럼 그 전체에 걸쳐 추론하도록 튜닝되지 않았다.

일반 지식에서는 격차가 좁아졌다가 성격이 뒤바뀐다. Granite 4.2 3B는 GPQA에서 55.9%를 기록하고, Solar Mini 4는 GPQA 수치가 아예 없다. Humanity's Last Exam에서는 두 모델이 각각 6.6%와 25.8%를 기록하는데, 이는 더 직접적인 비교이며 크기 차이가 예측하는 바로 그 비교다. Artificial Analysis에 따르면 Granite 4.2 3B가 하지 않는 일은 날조다. 즉 AA-Omniscience 비환각률이 73.7%로 Solar Mini 4의 64.2%보다 높다. 더 작은 모델은 자신이 갖지 않은 답을 지어낼 가능성이 더 낮다.

에이전트형 코딩은 두 모델 모두 무너지는 지점이며, 여기서는 숫자를 제대로 읽는 것이 중요하다. Solar Mini 4는 Terminal-Bench 4.0에서 1%, AutomationBench-AA에서 22.3%를 기록한다. Granite 4.2 3B는 Terminal-Bench 4.0에서 0%, 구버전 Terminal-Bench 2.1에서 13.9%, τ³-Banking에서 5.6%를 기록한다. 두 모델 모두 자율 터미널 작업에 적합한 도구가 아니다. Granite 4.2 패밀리의 8B 및 30B 모델은 IBM의 에이전트형 강화 학습을 적용했고 SWE-Bench와 Terminal-Bench 결과를 보유한다. 3B는 해당 학습 블록을 명시적으로 건너뛰었으며, Upstage의 모델은 셸을 구동하기보다는 검색, 구조화, 정책 적용에 맞춰 가격이 책정되어 있다.

Granite 4.2 3B가 여전히 정답인 경우

7과 3분의 1기가바이트의 bfloat16 가중치, 실용적인 양자화에서는 4기가바이트 미만, 그리고 자신의 데이터로 미세 조정하고 누구에게도 허락을 구하지 않고 결과물을 배포할 수 있게 하는 Apache 2.0 라이선스. 소비자용 GPU 한 장을 가진 학생, 환자 텍스트를 제3자에게 보낼 수 없는 병원, 항공기나 공장 지하에서 작동해야 하는 제품, 엔드포인트를 임대하기보다 모델을 소유하고 싶은 팀 — 이 모든 경우가 Granite 4.2 3B를 선택하고 뒤돌아보지 않습니다. 이 엔진은 vLLM, SGLang, Transformers, GGUF를 통해 실행되며, Ollama에는 granite4.2:3b 빌드가 등록되어 있습니다.

벤더가 보고한 수치에는 늘 그렇듯 주의가 필요하다. IBM의 카드는 AIME 2025에서 78.33, HMMT February 2025에서 66.67, LiveCodeBench v6에서 69.71을 주장한다 — 모두 제3자가 재현한 바 없으며, dense 3B 모델의 경우 AIME 수치는 역사적 범위를 훨씬 웃돈다. Artificial Analysis 지수 9는 이 모델이 실질적으로 유용하며 프런티어와는 거리가 멀다고 평가한다. 이는 IBM이 그것을 공개하지 않았기 때문에 바로 더 신뢰할 수 있는 신호다.

Solar Mini 4가 정답인 경우

작업이 긴 문서이거나, 반복적인 구조화 추출이거나, 대량으로 일관되게 적용해야 하는 정책인 경우 — 그리고 90초의 지연 시간이 허용되는 경우라면 무엇이든. Solar Mini 4의 프로필은 전문가형 프로필입니다: 장문맥 추론 83%, 과학 코딩 48%, 환각 없음 64%, 그리고 추측하기보다 답변을 유보하는 문서화된 경향이 있습니다. 또한 영어, 일본어와 함께 한국어를 일급 언어로 구사하는데, 이는 한국 시장 배포에서 결코 각주에 불과한 사항이 아닙니다.

구매자가 해서는 안 되는 일은 두 토큰 가격을 비교하고 Solar Mini 4가 세 배 더 비싸다고 결론 내리는 것이다. Artificial Analysis는 Solar Mini 4를 완료된 Intelligence Index 작업당 $0.36로 측정했으며, 같은 제품군에서 Granite 4.2 3B는 $0.006이었다. 이는 60배 차이로, GPT-6 Luna (max) 대비 Solar Mini 4를 부풀리는 것과 같은 요인에 기인한다. 즉 작업당 출력 토큰이 88,300개로 Granite의 18,600개와 대비되며, 프롬프트 캐시 쓰기가 Solar Mini 4의 $0.36 중 $0.30을 차지하는 반면 Granite의 $0.006 중 $0.0006을 차지하는 비용 구조 때문이다. 장황한 모델의 저렴한 출력 가격은 저렴한 작업이 아니다.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

두 모델 모두 OrcaRouter에는 없습니다 — 저희는 Granite도 Upstage도 라우팅하지 않습니다 — 따라서 Granite 4.2 3B를 원하신다면 Hugging Face에서 가져와야 하고, Solar Mini 4를 원하신다면 Upstage 자체 API와 서드파티 플랫폼에서 가져와야 합니다. 하지만 이 비교가 시사하는 투 모델 패턴은 라우터가 바로 그런 용도로 만들어진 것이며, 이것이 OrcaRouter가 제공자 정가 대비 0% 마크업으로 200개가 넘는 모델을 단일 키 뒤에 제공하는 이유입니다: 장문 문서와 한국어 작업은 실제로 그 비용을 정당화하는 모델에 돌리고, 결정론적 추출 단계는 직접 호스팅하는 무언가에 유지하며, 라우팅과 페일오버가 계약 단위가 아니라 호출 단위로 요청을 이들 사이에서 이동시키도록 하십시오.

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

위 수치들에 관한 마지막 한 가지. Artificial Analysis에서 나온 모든 Solar Mini 4 수치는 독립적인 측정값입니다. IBM의 모델 카드에서 나온 모든 Granite 4.2 3B 수치는 제3자가 재현한 적 없는 공급업체의 주장입니다. Artificial Analysis 지수 점수 24와 9는 여기서 동일한 연구소가 동일한 조건에서 산출한 유일한 두 수치이며 — 바로 이 두 수치를 기준으로 결정을 내려야 합니다.