Solar Mini 4 用に生成されたヒーロータイトルカード。見出しは「Solar Mini 4 — 独立した実行」、サブタイトルは「インテリジェンス指数 24、タスクあたりのコストは GPT-6 Luna のおよそ 5 倍」、そして「2026 年 9 月 22 日リリース」と「2026 年 9 月 30 日、初の第三者評価」と記された 2 つのバッジを備えている。
Guides & Insights

{{1}}Solar Mini 4はArtificial Analysis Indexで24点を獲得——しかしタスクあたりのコストはGPT-6 Lunaの5倍{{/1}}

著者

Alistair Wren

公開日

最新モデル · 20すべてのモデルを見る →
ベンチマーク:Artificial Analysis · 毎日更新
すべての記事に戻る

Solar Mini 4は、入力トークンあたりではGPT-6 Lunaと同じ料金を請求するが、実際に1つのジョブを完了させるにはおよそ5倍の費用がかかる。これがUpstageの新モデルに対する最初の独立評価の全容であり、ローンチ資料が語った話ではない。Solar Mini 4は2026年9月22日に、トークンあたり約30億パラメータを活性化する350億パラメータのスパースなMixture-of-Expertsとして提供開始され、価格は入力100万トークンあたり0.10ドル、出力100万トークンあたり0.40ドルだった。OpenAIの効率ティアであるGPT-6 Lunaは0.10ドルと0.50ドルで、272,000トークンを超える長コンテキストティアでは両方ともおよそ2倍になる。料金表の上では、両者は同じ買い物に見える。両モデルが同じ10項目の評価スイートで実行されたArtificial AnalysisのIntelligence Indexでは、Solar Mini 4は完了タスクあたり0.36ドルで、GPT-6 Luna(max)の0.07ドルに対して——その5.4倍という差は、トークンにいくら請求するかではなく、タスク中の両モデルの振る舞い方に完全に由来している。

2026年9月30日、Artificial Analysisはこのモデルに関する解説記事を公開した。このモデルは24をインテリジェンスインデックス v4.3.2で記録している。本記事中でArtificial Analysisに帰属するとされている内容はすべて同組織自身の測定値であり、Upstageに帰属するとされている内容はすべてベンダーによる主張である。この区別は通常にも増して重要である。というのも、両者の数値は常に一致するとは限らないからだ。

独立した実行が実際に述べていること

A scoreboard titled 'Solar Mini 4 — the scoreboard' with the rows: Intelligence Index 24.05 against a median of 12; Cost per index task $0.36 against GPT-6 Luna (max) at $0.07; Rate card $0.10 in / $0.01 cached / $0.40 out per 1M; Output per index task 88,300 tokens, 71,600 of them reasoning; Output speed 204 tokens per second and 430 seconds per index task; Context Upstage says 512K while Artificial Analysis lists 1.05M; Weakest result Terminal-Bench 4.0 at 1%.

Solar Mini 4 は Intelligence Index で 24.05 を記録し、同価格帯の推論モデルにおける中央値 12 に対する結果となっている。これは同重量級の中で平均を大きく上回る位置づけであり、Upstage 自身の説明——「Artificial Analysis Intelligence Index の比較において、3B アクティブモデルの中で総合スコア最高」——は、その特定の点について独立したテストでも裏付けられている。同じく 3B パラメータをアクティブ化する Qwen3.6 35B A3B は、同じインデックスで 18.2 を記録する。K2 Horizon MoVA 36B A4B は 4B をアクティブにして 25.3 を記録し、しかもそれを、Solar Mini 4 の 1.05M に対して 524K トークンというより短いコンテキストで達成している。7 月にリリースされた 9750 億パラメータのオープンウェイト MoE である Inkling と比べると、Solar Mini 4 は 24.1 対 25.0 となり、自身の約 30 倍の規模で 100 万トークンあたり $1.00/$4.05 かかるモデルと 1 ポイント差以内に収まっている。

そのスコアの内側にあるプロファイルは不均一で、その不均一さこそが役に立つ部分だ:

• 長文脈推論が相対的な強みです。Solar Mini 4はAA-LCR v1.1で83%を記録し、MiniMax-M3およびGPT-6 Luna(max)と同水準、81%のGemini 3.8 Flash(high)とGPT-6 Astra(max)を上回っています。

• 科学的コーディングは健在だ。SciCodeで48%、MiniMax-M3とInkling(xhigh)を1ポイント上回っている。

• エージェント型コーディングは崩壊する。Terminal-Bench 4.0で1%。「弱い」ではなく、1%だ。実際のSaaSアプリケーションをまたいで多段階のワークフローを実行するAutomationBench-AAでは、22.3%。

• 知識の正確さは低いが、モデルは自分が推測していることを自覚している。AA-Omniscienceは18%の正確性で−11を返す。このモデルは尋ねられた質問のおよそ半分で回答を控える。その非ハルシネーション率は64%で、32%のInk(xhigh)や23%のGPT-6 Luna(max)を大きく上回っている。「わからない」と半分の確率で言い、実際に答えるときは3分の2の確率で正しいモデルは、自信たっぷりに作り話をするモデルとは別種の道具である。

エージェント型ナレッジワークにおいて、数値はGDPval-AAで1072 Elo、AA-Briefcaseで872 Eloであり、どちらもInkling(xhigh)に近い。

5倍の数値、徹底解説

Artificial Analysisのタスクあたりコストの数値は、ほとんどの調達の議論を左右するものになるため、見出しの数字として引用するのではなく、内訳として読むべきだ。それを左右する要因は2つある。

まず、量についてです。Solar Mini 4はIntelligence Indexのタスクあたり約88,300の出力トークンを生成し、そのうち71,600が推論トークンです。出力トークン100万あたり0.40ドルなので、請求額はおよそ0.035ドルです。安いのは、出力が安いからです。その代わりにかかるのは時間です。実測204トークン/秒では、Artificial Analysisは平均的なインデックスタスクに430秒、つまり約7.2分の作業時間を記録しています。GPT-6 Luna(max)は1タスクあたり50,000の出力トークンを生成し、127トークン/秒で396秒かかります。9750億パラメータのオープンウェイトモデルであるInkling(xhigh)は、34,700トークンを生成し、169秒で完了します。Solar Mini 4は両者より遅いですが、その差は5倍のコスト差とは何の関係もありません。

第二に——そしてこれがすべての核心だが——キャッシュ書き込み入力だ。Artificial Analysisのコスト内訳では、Solar Mini 4のタスクあたり$0.36のうち約$0.30をプロンプトキャッシュに書き込まれるトークンに帰しており、それに対してキャッシュ読み取りが$0.03、出力が$0.035、真にキャッシュされていない入力は丸め誤差程度である。GPT-6 Luna (max)では、キャッシュ書き込みは$0.068のうち$0.012——請求額の約17%で、Solar Mini 4では82%に相当する。キャッシュ入力はUpstageの料金表で100万あたり$0.01の最安項目であり、Artificial Analysisのモデルも実際にそれを使っている。問題は、読み取れるようになるまでにどれだけ書き込まねばならないかだ。毎ターン、大きくなっていく会話を再送するエージェントは、短く閉じたターンで答えるモデルよりも、はるかに頻繁に書き込みコストを払う。

これこそ本番環境に持ち込む価値のある知見だ。この種のモデルでは、トークンあたりの価格からタスクごとの請求額をほとんど予測できない。キャッシュの挙動がそれを左右する。

Upstage自身の数値が異なる箇所

A screenshot of Upstage's Console documentation page for Solar Mini 4, showing the Intelligence, Speed and Price gauges, the '$0.10 / 1M tokens' input rate, the description of a cost-efficient compact language model at 35B total and 3B active parameters built for agentic use cases, English, Japanese and Korean language support, tool calling, a 128K max output, the platforms Upstage Console and on-premises, and the version string solar-mini4-260922 with a training data cut-off of February 2026.

Upstageのローンチ投稿は、2026年10月1日に「Solar Mini 4: Built for High-Volume Agent Workloads」というタイトルで公開され、Artificial Analysis Intelligence Indexで24.1を報告している——実質的に同じ数値だ——そして、独立したデータを土台とするのではなく、それと並置されるいくつかの主張をしている。

ベンダーは AutomationBench-AA で 22.3% を挙げており、Artificial Analysis と完全に一致している。また τ³-Banking では 47.2 を挙げている。これはポリシーとツール使用に関するベンチマークだが、その後インデックススイートから削除された。同社は AA-LCR で 83.3%、SciCode で 47.6% を報告しており、いずれも独立した数値とは丸め誤差の範囲内にある。Humanity's Last Exam では 19.6% を報告している一方、Artificial Analysis のページには同じモデルについて 25.8% が掲載されている。どちらも悪名高いほど変動しやすい評価の妥当な読み取り値ではあるが、同じ数値ではなく、どちらも他方として提示すべきではない。

仕様の2行も食い違っている。Upstageは512Kトークンのコンテキストウィンドウと最大128Kの出力トークンを文書化している。Artificial Analysisは1.0Mトークンのコンテキストウィンドウと262Kの最大出力を記載している。Upstageのブログは、512Kという数値が出荷時の契約であることを明言している。この食い違いは、誰かがその上に検索パイプラインを構築する前に、APIレスポンスと照らして解消する価値のある類のものだ。

ベンダーはまた、自社の条件で可能な唯一の比較も行っている。それは、モデルごとに3回実行した3つの韓国語エージェントタスクにわたる社内テストで、1,000組の3タスクセットを完了するコストは、Solar Mini 4では推定1.25ドル、MiMo-V2.5では2.20ドルだった。これは、レイテンシを除外した、ベンダーが選んだタスクによるベンダー実施のテストであり、Artificial Analysisの結果とは逆の方向を示している。それは間違いではない — タスクが違えば消費されるトークン予算も違う — が、それはマーケティング上の数字であり、そのモデルが公開している発売時の割引は、誰かの数字をそのまま採用するのではなく、自分の数字を測り直すべきもう一つの理由である。

料金は、Upstageコンソールの現行ドキュメント時点では、入力トークン100万あたり$0.10、キャッシュされた入力トークン100万あたり$0.01、出力トークン100万あたり$0.40で、現在、2026年10月22日UTCまで50%オフとして告知されているローンチ割引により、それまでは実効料金が入力$0.05、キャッシュ入力$0.005、出力$0.20になります。

あなたが支払う側なら、これが意味すること

Solar Mini 4 で興味深いのは、それが悪いモデルだということではない。料金表には表れない挙動に経済性が支配されている、本当に優れた小型モデルだということだ。3つのアクティブパラメータでインデックス24というのは、れっきとしたエンジニアリングの成果であり、韓国語のワークロード——英語や日本語と並ぶ、このモデルが公言する得意分野——こそ、その成果が価格に見合う可能性が最も高い領域なのだ。

厄介なのは、最初の呼び出しより下流の部分です。長いアシスタントのターン、キャッシュ再利用率の低さ、そしてインデックス実行ごとに7分かかるタスクが積み重なると、$0.10/$0.40 とはとても思えない数字になります。評価するなら、正直な実験は自分のワークロードで完了ジョブ当たりのコストを測るテストです。本番スタックが実際に使う形でプロンプトキャッシュを有効にして行うものであって、トークン単価の比較ではありません。

これはまさにルーターが解決するために存在する類の問題であり、OrcaRouter がプロバイダーの定価を0%のマークアップでそのまま通す理由でもあります。そのため、ベンダーの価格変更は同じ日にあなたの請求に反映されます。当社は Upstage のモデルをルーティングしていないため、Solar Mini 4 も Solar Pro 4 も当社経由では利用できません — これらは Upstage 自身の API およびサードパーティのプラットフォームから提供されます。当社がルーティングするのは、この比較のもう半分です。GPT-6 Luna、Qwen3.8-Max、Qwen3.8-27B、Qwen3.8-Flash、そして単一のキーの背後にある200以上の他のモデル。これにより、安価なモデルと高価なモデルを同じタスクに置き、自動フェイルオーバーとリクエストごとのルーティングにどちらが応答するかを決めさせることが実用的になります。2つのモデル間の違いが、どの価格表にも明かされないタスクあたり5倍のコスト差であるとき、単一のリクエストをそれらの間で移動できる能力は、どんなベンチマーク表よりも重要です。

A screenshot of the Artificial Analysis article dated September 30, 2026, headlined 'Korean AI Lab Upstage has released Solar Mini 4 which scores 24 on the Artificial Analysis Intelligence Index, but costs ~5x as much per task as GPT-6 Luna (max) despite similar per-token prices'. The visible key-results text covers the 3B-active Pareto claim, the 6-point lead over Qwen3.6 35B A3B at the same active size, 83% on AA-LCR v1.1 matching MiniMax-M3 and GPT-6 Luna (max), 48% on SciCode, and fast output at 208 tokens per second with slow tasks.

手短に言うと、Solar Mini 4は、Artificial Analysisがアクティブパラメータ30億未満のモデル向けに描く新たなパレート点であり、完了したタスクあたりでは、同じ入力価格を掲げるモデルよりおよそ5倍高価だ。これらの記述はどちらも正しく、請求書に現れるのは2つ目のほうである。