Solar Mini 4용으로 생성된 히어로 타이틀 카드로, 헤드라인은 'Solar Mini 4 — 독립 실행', 부제는 '인텔리전스 지수 24, 그리고 GPT-6 Luna의 작업당 비용의 약 5배', 두 개의 배지에는 '2026년 9월 22일'과 '최초의 제3자 평가, 2026년 9월 30일'이라고 적혀 있습니다.
Guides & Insights

Solar Mini 4, Artificial Analysis 지수에서 24점 기록 — GPT-6 Luna보다 작업당 비용 5배 더 높아

작성자

Alistair Wren

게시일

최신 모델 · 20모든 모델 보기 →
벤치마크: Artificial Analysis · 매일 업데이트
모든 게시물로 돌아가기

Solar Mini 4는 입력 토큰당 GPT-6 Luna와 같은 요금을 받지만, 실제로 작업을 끝내는 데는 약 다섯 배가 든다. 이것이 Upstage의 새 모델에 대한 첫 독립 평가의 전부이며, 출시 자료가 들려준 이야기는 아니다. Solar Mini 4는 2026년 9월 22일, 토큰당 약 30억 개 파라미터를 활성화하는 350억 파라미터 규모의 희소 전문가 혼합(MoE) 모델로 공개되었고, 입력 토큰 100만 개당 $0.10, 출력 토큰 100만 개당 $0.40으로 책정되었다. OpenAI의 효율성 등급인 GPT-6 Luna는 $0.10과 $0.50으로 책정되어 있으며, 272,000토큰 초과를 위한 장문맥 등급은 두 가격을 대략 두 배로 높인다. 요금표상으로는 같은 구매처럼 보인다. 두 모델 모두 동일한 10개 평가 스위트로 실행된 Artificial Analysis의 Intelligence Index에서, Solar Mini 4는 완료된 작업당 $0.36이 드는 반면 GPT-6 Luna(max)는 $0.07이다 — 이 5.4배라는 차이는 토큰당 요금이 아니라 작업 중 두 모델이 어떻게 동작하는지에서 전적으로 비롯된다.

2026년 9월 30일, Artificial Analysis는 이 모델에 대한 리뷰를 발표했습니다. 이 모델은 24점을 기록했습니다. 이 점수는 Intelligence Index v4.3.2에서 측정된 것입니다. 이 글에서 Artificial Analysis에 귀속된 모든 것은 해당 기관의 자체 측정치이며, Upstage에 귀속된 모든 것은 벤더의 주장입니다. 여기서 이 구분은 평소보다 더 중요합니다. 왜냐하면 두 숫자 집합이 항상 일치하지는 않기 때문입니다.

독립 실행이 실제로 말하는 것

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4는 Intelligence Index에서 24.05를 기록했으며, 이는 같은 가격대의 추론 모델들 사이 중앙값 12와 대비됩니다. 이는 해당 체급에서 평균을 크게 웃도는 위치이며, Upstage의 자체 표현인 “Artificial Analysis Intelligence Index 비교에서 3B 활성 모델 중 최고 종합 점수”는 바로 그 지점에 한해 독립 테스트에서도 유지됩니다. 마찬가지로 3B 파라미터를 활성화하는 Qwen3.6 35B A3B는 같은 지수에서 18.2점을 기록합니다. 4B가 활성인 K2 Horizon MoVA 36B A4B는 25.3점을 기록하며, 이는 Solar Mini 4의 1.05M 대비 더 짧은 컨텍스트인 524K 토큰에서 나온 결과입니다. 7월에 공개된 9,750억 파라미터 오픈 웨이트 MoE인 Inkling과 비교하면, Solar Mini 4는 25.0 대비 24.1로 나옵니다. 이는 백만 토큰당 $1.00/$4.05의 비용이 드는, 거의 30배 큰 모델에 1점 이내로 근접한 것입니다.

그 점수 안의 프로필은 불균일하며, 바로 그 불균일함이 유용한 부분이다:

• 장문맥 추론이 상대적 강점입니다. Solar Mini 4는 AA-LCR v1.1에서 83%를 기록해 MiniMax-M3 및 GPT-6 Luna(max)와 동일한 수준이며, 81%를 기록한 Gemini 3.8 Flash(high)와 GPT-6 Astra(max)를 앞섭니다.

• 과학적 코딩 성능이 견고합니다. SciCode에서 48%로, MiniMax-M3와 Inkling(xhigh)보다 1포인트 앞섭니다.

• 에이전틱 코딩은 붕괴합니다. Terminal-Bench 4.0에서 1%. "약하다"는 게 아니라 1%입니다. 실제 SaaS 애플리케이션 전반에서 다단계 워크플로를 실행하는 AutomationBench-AA에서는 22.3%입니다.

• 지식 정확도는 낮지만, 모델은 자신이 추측하고 있음을 알고 있다. AA-Omniscience는 정확도 18%로 −11을 반환한다; 모델은 질문받은 것의 약 절반에 대해 답변을 유보한다. 비환각률은 64%로, 32%인 Inkling (xhigh)과 23%인 GPT-6 Luna (max)를 크게 앞선다. 절반의 경우 "모르겠다"고 말하고 실제 답할 때는 3분의 2의 확률로 맞히는 모델은, 자신 있게 허위 정보를 만들어내는 모델과는 다른 도구다.

에이전틱 지식 노동에서 수치는 GDPval-AA에서 1072 Elo, AA-Briefcase에서 872 Elo로, 둘 다 Inkling(xhigh)에 근접합니다.

다섯 배 숫자, 자세히 풀어보기

Artificial Analysis의 태스크당 비용 수치는 대부분의 조달 논의를 좌우할 수치이며, 이는 헤드라인처럼 인용되기보다 세부 분석으로 읽혀야 한다. 여기에는 두 가지 요인이 작용한다.

먼저, 양입니다. Solar Mini 4는 Intelligence Index 작업당 약 88,300개의 출력 토큰을 생성하며, 그중 71,600개가 추론 토큰입니다. 출력 토큰 100만 개당 $0.40라면 이는 청구서의 약 $0.035에 해당합니다 — 출력이 저렴하기 때문에 저렴합니다. 대신 치르는 비용은 시간입니다. 측정된 초당 204토큰 기준으로 Artificial Analysis는 평균 인덱스 작업에 430초의 작업 시간, 즉 약 7.2분을 기록합니다. GPT-6 Luna (max)는 초당 127토큰으로 작업당 50,000개의 출력 토큰을 생성하며 396초가 걸립니다. 9,750억 개 매개변수의 오픈 웨이트 모델인 Inkling (xhigh)은 34,700개의 토큰을 생성하고 169초 만에 끝납니다. Solar Mini 4는 둘보다 느리지만, 그 차이는 5배의 비용 격차와는 아무 관련이 없습니다.

둘째로 — 그리고 이게 전부입니다 — 캐시 쓰기 입력입니다. Artificial Analysis의 비용 분석은 Solar Mini 4의 태스크당 $0.36 중 약 $0.30을 프롬프트 캐시에 기록된 토큰 탓으로 돌리며, 이는 캐시 읽기 $0.03, 출력 $0.035, 그리고 실제로 캐시되지 않은 입력에 대한 반올림 오차 수준의 금액과 대비됩니다. GPT-6 Luna (max)의 경우 캐시 쓰기는 $0.068 중 $0.012로, 청구서의 약 17%인 반면 Solar Mini 4는 82%입니다. 캐시된 입력은 Upstage의 요금표에서 백만 개당 $0.01로 가장 저렴한 항목이며, Artificial Analysis의 모델은 실제로 이를 사용합니다. 문제는 읽을 수 있기 전에 얼마나 많이 기록해야 하는가입니다. 매 턴마다 커져가는 대화를 다시 보내는 에이전트는 짧고 닫힌 턴으로 답하는 모델보다 쓰기 비용을 훨씬 더 자주 지불합니다.

프로덕션에 가져갈 만한 결론은 이것이다. 이런 모델의 경우 토큰당 가격만으로는 작업당 비용을 거의 예측할 수 없다. 캐시 동작이 그걸 예측한다.

Upstage 자체 수치가 다른 부분

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

Upstage의 출시 게시물은 2026년 10월 1일 “Solar Mini 4: Built for High-Volume Agent Workloads”라는 제목으로 공개되었으며, Artificial Analysis Intelligence Index에서 24.1을 보고한다 — 사실상 동일한 수치다 — 그리고 독립 데이터 위에 놓이기보다는 그와 나란히 놓이는 여러 주장을 제기한다.

공급업체는 AutomationBench-AA에서 22.3%를 인용하며 이는 Artificial Analysis와 정확히 일치하고, τ³-Banking에서는 47.2를 기록하는데, 이는 해당 인덱스 스위트가 이후 제외한 정책 및 도구 사용 벤치마크입니다. AA-LCR에서는 83.3%, SciCode에서는 47.6%를 보고하며, 둘 다 독립 수치와 반올림 오차 범위 내에 있습니다. Humanity's Last Exam에서는 19.6%를 보고하지만, Artificial Analysis 페이지에는 같은 모델에 대해 25.8%가 실려 있습니다. 둘 다 변동성이 악명 높은 평가에 대한 그럴듯한 판독값이지만, 같은 숫자가 아니며 어느 쪽도 다른 쪽 수치인 것처럼 제시되어서는 안 됩니다.

두 가지 사양 항목도 서로 일치하지 않습니다. Upstage는 512K 토큰 컨텍스트 윈도우와 최대 128K 출력 토큰을 문서에 명시하고 있습니다. Artificial Analysis는 1.0M 토큰 컨텍스트 윈도우와 262K 최대 출력을 기재하고 있습니다. Upstage의 블로그는 512K 수치가 실제 제공되는 사양임을 명확히 밝히고 있습니다. 이러한 불일치는 누구든 그 위에 검색 파이프라인을 구축하기 전에 API 응답과 대조하여 해결할 가치가 있는 종류의 문제입니다.

공급업체는 또한 자체 기준으로 할 수 있는 유일한 비교도 제시한다: 모델당 세 번씩 실행한 세 가지 한국어 에이전트 작업에 걸친 내부 테스트로, 여기서 1,000개의 세 가지 작업 세트를 완료하는 비용이 Solar Mini 4에서는 약 $1.25, MiMo-V2.5에서는 $2.20으로 추정되었다. 이는 공급업체가 선택한 작업을 대상으로 지연 시간을 제외하고 공급업체가 실행한 테스트이며, Artificial Analysis 결과와는 반대 방향을 가리킨다. 그것이 틀린 것은 아니다 — 작업이 다르면 사용하는 토큰 예산도 다르다 — 하지만 이는 마케팅 수치이며, 해당 모델의 공개된 출시 할인은 누구의 수치든 그대로 받아들이기보다 자신의 수치를 다시 산출해 볼 별도의 이유다.

가격은 현재 라이브 Upstage 콘솔 문서 기준으로 백만 입력 토큰당 $0.10, 백만 캐시 입력 토큰당 $0.01, 백만 출력 토큰당 $0.40이며, 현재 출시 할인이 2026년 10월 22일 UTC까지 50% 할인으로 광고되고 있어, 그때까지 실효 요율은 입력 $0.05, 캐시 입력 $0.005, 출력 $0.20입니다.

당신이 돈을 내는 사람이라면 이것이 의미하는 바

Solar Mini 4에 관한 흥미로운 점은 그것이 나쁜 모델이라는 게 아니다. 흥미로운 점은 그것이, 경제성이 요금표로는 보여줄 수 없는 행동에 좌우되는, 진정으로 좋은 소형 모델이라는 것이다. 활성 파라미터 3개로 지수 24점을 기록한 것은 실질적인 엔지니어링 성과이며, 한국어 워크로드 — 이 모델이 영어, 일본어와 함께 내세우는 강점 — 는 바로 그 성과가 가격만큼의 가치를 발휘할 가능성이 가장 높은 곳이다.

곤란한 부분은 첫 호출 이후의 모든 후속 단계입니다. 긴 어시스턴트 턴, 낮은 캐시 재사용률, 그리고 인덱스 실행당 7분의 디코드가 걸리는 작업이 합쳐지면 $0.10/$0.40과는 전혀 닮지 않은 숫자가 됩니다. 이를 평가하고 있다면, 정직한 실험은 토큰 가격 비교가 아니라, 프로덕션 스택이 실제로 사용할 방식으로 프롬프트 캐싱을 활성화한 상태에서 자체 워크로드에 대한 완료된 작업당 비용 테스트입니다.

이것 역시 라우터가 해결하기 위해 존재하는 문제 유형이며, OrcaRouter가 제공업체 정가를 0% 마크업으로 그대로 전달하는 이유이기도 합니다. 그래서 벤더의 가격 변경이 같은 날 청구서에 반영됩니다. 우리는 Upstage 모델을 라우팅하지 않으므로 Solar Mini 4도 Solar Pro 4도 우리를 통해 이용할 수 없습니다. 두 모델은 Upstage 자체 API와 서드파티에서 제공됩니다. 우리가 라우팅하는 것은 이 비교의 나머지 절반입니다. GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash 그리고 단일 키 뒤에 있는 200개 이상의 다른 모델 — 이것이 값싼 모델과 비싼 모델을 같은 작업에 함께 두고 자동 장애 조치와 요청별 라우팅이 어느 쪽이 응답할지 결정하게 하는 것을 실용적으로 만들어 줍니다. 두 모델 사이의 차이가 어떤 가격표도 알려주지 않는 작업당 비용 5배 격차일 때, 단일 요청을 두 모델 사이에서 옮길 수 있는 능력은 어떤 벤치마크 표보다도 중요합니다.

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

짧게 말하자면: Solar Mini 4는 Artificial Analysis가 활성 파라미터 30억 개 미만 모델에 대해 제시하는 새로운 파레토 포인트이며, 동일한 입력 가격으로 책정된 모델보다 완료된 작업당 대략 다섯 배 더 비쌉니다. 두 진술은 모두 사실이고, 청구서에 나타나는 것은 두 번째입니다.