
Solar Mini 4 đạt 24 điểm trên Artificial Analysis Index — và chi phí mỗi tác vụ cao gấp năm lần so với GPT-6 Luna
- openaiMỚIOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 trên 1 triệu token
- anthropicMỚIAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 trên 1 triệu token · 159 tok/s
- typesafeMỚITypeSafe: Jev 1.132026-09-24$0.04 / $0.00 trên 1 triệu token · 220 tok/s
- OpenAIMỚIOpenAI: GPT-6 Luna2026-09-2238Trí tuệ
- OpenAIMỚIOpenAI: GPT-6 Sol2026-09-2248Trí tuệ
- AnthropicMỚIAnthropic: Claude Opus 5.52026-09-2258Trí tuệ
- xAIMỚIGrok 4.72026-09-2146Trí tuệ
- OrcaMỚIOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 trên 1 triệu token · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 trên 1 triệu token · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Trí tuệ
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Trí tuệ77Lập trình
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Trí tuệ76Lập trình
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Trí tuệ76Lập trình
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Trí tuệ82Lập trình
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 trên 1 triệu token · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 trên 1 triệu token · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Trí tuệ72Lập trình
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 trên 1 triệu token · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Trí tuệ75Lập trình
- obsidianQwen3.8 27B2026-08-1534Trí tuệ68Lập trình
Solar Mini 4 tính cùng mức giá cho mỗi token đầu vào như GPT-6 Luna, và tốn khoảng năm lần chi phí để thực sự hoàn thành một công việc. Đó là toàn bộ câu chuyện của đánh giá độc lập đầu tiên về mô hình mới của Upstage, và đó không phải là câu chuyện mà tài liệu ra mắt kể. Solar Mini 4 ra mắt ngày 22 tháng 9 năm 2026 dưới dạng mixture-of-experts thưa 35 tỷ tham số, kích hoạt khoảng 3 tỷ tham số mỗi token, có giá $0,10 mỗi triệu token đầu vào và $0,40 mỗi triệu token đầu ra. GPT-6 Luna, hạng hiệu quả của OpenAI, niêm yết ở mức $0,10 và $0,50, với một hạng ngữ cảnh dài trên 272.000 token gần như nhân đôi cả hai mức giá. Trên bảng giá, chúng trông giống như cùng một giao dịch mua. Trên Chỉ số Thông minh của Artificial Analysis, nơi cả hai mô hình được chạy qua cùng một bộ mười đánh giá, Solar Mini 4 tốn $0,36 cho mỗi tác vụ hoàn thành so với $0,07 đối với GPT-6 Luna (max) — hệ số 5,4 hoàn toàn đến từ cách hai mô hình hành xử trong một tác vụ chứ không phải từ mức giá mà chúng tính cho một token.
Vào ngày 30 tháng 9 năm 2026, Artificial Analysis đã công bố bài viết của mình về mô hình, mô hình này đạt 24 trên Intelligence Index v4.3.2. Mọi nội dung trong bài viết này được quy cho Artificial Analysis đều là kết quả đo lường của chính tổ chức đó; mọi nội dung được quy cho Upstage là tuyên bố của nhà cung cấp. Sự phân biệt này ở đây quan trọng hơn mức thông thường, vì hai bộ số liệu không phải lúc nào cũng khớp nhau.
Lần chạy độc lập thực sự nói gì

Solar Mini 4 đạt 24,05 trên Intelligence Index, so với mức trung vị là 12 trong số các mô hình suy luận thuộc phân khúc giá của nó. Điều đó đặt nó cao hơn đáng kể mức trung bình trong cùng tầm cỡ, và cách diễn đạt của chính Upstage — "điểm tổng thể cao nhất trong số các mô hình hoạt động 3B trong bảng so sánh Artificial Analysis Intelligence Index" — vẫn đứng vững qua kiểm thử độc lập ở đúng điểm cụ thể đó. Qwen3.6 35B A3B, cũng có 3B tham số hoạt động, đạt 18,2 trên cùng chỉ số. K2 Horizon MoVA 36B A4B, với 4B hoạt động, đạt 25,3 — và đạt được điều đó trên ngữ cảnh ngắn hơn, 524K token so với 1,05M của Solar Mini 4. So với Inkling, một MoE trọng số mở 975 tỷ tham số ra mắt vào tháng 7, Solar Mini 4 đạt 24,1 so với 25,0 — chỉ trong vòng một điểm so với một mô hình có kích thước gần gấp ba mươi lần, với chi phí $1,00/$4,05 mỗi triệu token.
Cấu trúc bên trong bản nhạc đó không đồng đều, và chính sự không đồng đều ấy mới là phần hữu ích:
• Suy luận ngữ cảnh dài là điểm mạnh tương đối. Solar Mini 4 đạt 83% trên AA-LCR v1.1, ngang bằng với MiniMax-M3 và GPT-6 Luna (max), và vượt lên trên Gemini 3.8 Flash (high) cùng GPT-6 Astra (max) ở mức 81%.
• Khả năng lập trình khoa học vẫn đứng vững. 48% trên SciCode, cao hơn MiniMax-M3 và Inkling (xhigh) một điểm.
• Lập trình tác tử sụp đổ. 1% trên Terminal-Bench 4.0. Không phải "yếu" — mà là 1%. Trên AutomationBench-AA, nơi vận hành các quy trình nhiều bước trên những ứng dụng SaaS thực tế, 22,3%.
• Độ chính xác kiến thức thấp, nhưng mô hình biết rằng nó đang đoán. AA-Omniscience trả về −11 với độ chính xác 18%; mô hình từ chối trả lời khoảng một nửa số câu hỏi được đặt ra. Tỷ lệ không ảo giác của nó là 64%, vượt xa Inkling (xhigh) ở mức 32% và GPT-6 Luna (max) ở mức 23%. Một mô hình nói "Tôi không biết" một nửa thời gian và đúng hai phần ba thời gian khi nó thực sự trả lời là một công cụ khác với một mô hình bịa đặt một cách tự tin.
Về công việc tri thức dạng tác tử, các con số là 1072 Elo trên GDPval-AA và 872 Elo trên AA-Briefcase, cả hai đều sát với Inkling (xhigh).
Con số gấp năm lần, được giải mã
Con số chi phí mỗi tác vụ của Artificial Analysis là con số sẽ quyết định phần lớn các cuộc trao đổi về mua sắm, và nó xứng đáng được đọc như một bản phân tích chi tiết thay vì được trích dẫn như một tiêu đề. Có hai yếu tố chi phối con số này.
Đầu tiên, khối lượng. Solar Mini 4 phát ra khoảng 88.300 token đầu ra cho mỗi tác vụ Intelligence Index; 71.600 trong số đó là token suy luận. Với mức 0,40 USD cho mỗi triệu token đầu ra, đó chỉ là khoảng 0,035 USD trong hóa đơn — rẻ, vì đầu ra rẻ. Cái phải trả thay vào đó là thời gian: ở tốc độ đo được 204 token mỗi giây, Artificial Analysis ghi nhận 430 giây làm việc cho một tác vụ index trung bình, tức khoảng 7,2 phút. GPT-6 Luna (max) phát ra 50.000 token đầu ra mỗi tác vụ ở tốc độ 127 token mỗi giây và mất 396 giây. Inkling (xhigh), một mô hình trọng số mở với 975 tỷ tham số, phát ra 34.700 token và hoàn thành trong 169 giây. Solar Mini 4 chậm hơn cả hai, nhưng với mức chênh lệch không liên quan gì đến khoảng cách chi phí gấp năm lần.
Thứ hai — và đây chính là toàn bộ câu chuyện — là input ghi cache. Bảng phân tích chi phí của Artificial Analysis quy khoảng 0,30 đô la trong mức 0,36 đô la mỗi tác vụ của Solar Mini 4 cho các token được ghi vào cache prompt, so với 0,03 đô la cho đọc cache, 0,035 đô la cho output và một sai số làm tròn cho input thực sự không được cache. Với GPT-6 Luna (max), ghi cache là 0,012 đô la trong 0,068 đô la — khoảng 17% hóa đơn, so với 82% đối với Solar Mini 4. Input được cache là dòng rẻ nhất trên bảng giá của Upstage, ở mức 0,01 đô la mỗi triệu token, và mô hình của Artificial Analysis có sử dụng nó; vấn đề là phải ghi vào bao nhiêu trước khi có thể đọc ra. Một agent gửi lại một cuộc hội thoại ngày càng dài ở mỗi lượt phải trả chi phí ghi thường xuyên hơn nhiều so với một mô hình trả lời trong một lượt ngắn, khép kín.
Đó là phát hiện đáng để mang vào môi trường sản xuất: với một mô hình như thế này, giá trên mỗi token gần như không dự đoán được gì về chi phí trên mỗi tác vụ. Hành vi của bộ nhớ đệm mới là yếu tố quyết định.
Nơi số liệu của chính Upstage khác biệt

Bài đăng ra mắt của Upstage, được công bố ngày 1 tháng 10 năm 2026 với tiêu đề "Solar Mini 4: Được thiết kế cho khối lượng công việc tác nhân quy mô lớn", báo cáo mức 24,1 trên Artificial Analysis Intelligence Index — thực chất là cùng một con số — và đưa ra một số tuyên bố song hành cùng, chứ không phải đứng trên, dữ liệu độc lập.
Nhà cung cấp nêu 22,3% trên AutomationBench-AA, khớp chính xác với Artificial Analysis, và 47,2 trên τ³-Banking, một benchmark về chính sách và sử dụng công cụ mà bộ chỉ số này đã loại bỏ kể từ đó. Họ báo cáo 83,3% trên AA-LCR và 47,6% trên SciCode, cả hai đều nằm trong sai số làm tròn so với các con số độc lập. Trên Humanity's Last Exam, họ báo cáo 19,6%, trong khi trang Artificial Analysis ghi 25,8% cho cùng mô hình; cả hai đều là những cách đọc hợp lý của một phép đánh giá vốn nổi tiếng là biến động khó lường, nhưng chúng không phải cùng một con số và không con số nào nên được trình bày như thể là con số kia.
Hai dòng thông số kỹ thuật cũng không khớp nhau. Upstage ghi nhận cửa sổ ngữ cảnh 512K token với tối đa 128K token đầu ra. Artificial Analysis liệt kê cửa sổ ngữ cảnh 1,0M token và đầu ra tối đa 262K. Blog của Upstage nói rõ rằng con số 512K mới là cam kết chính thức khi phát hành; sự khác biệt này là kiểu vấn đề đáng để giải quyết dựa trên phản hồi từ API trước khi bất kỳ ai xây dựng pipeline truy xuất dựa trên đó.
Nhà cung cấp cũng đưa ra phép so sánh duy nhất mà họ có thể thực hiện theo cách của riêng mình: một bài kiểm tra nội bộ trên ba tác vụ agent tiếng Hàn, chạy ba lần cho mỗi mô hình, trong đó hoàn thành 1.000 bộ ba tác vụ tốn khoảng 1,25 USD với Solar Mini 4 và 2,20 USD với MiMo-V2.5. Đó là một bài kiểm tra do nhà cung cấp thực hiện trên các tác vụ do nhà cung cấp lựa chọn, không tính độ trễ, và nó cho kết quả ngược lại với kết quả của Artificial Analysis. Nó không sai — các tác vụ khác nhau sử dụng ngân sách token khác nhau — nhưng đây là một con số tiếp thị, và mức giảm giá ra mắt đã công bố của mô hình là một lý do riêng để bạn tự chạy lại các con số của chính mình thay vì chấp nhận con số của bất kỳ ai.
Giá, theo tài liệu console Upstage trực tuyến: 0,10 USD cho mỗi triệu token đầu vào, 0,01 USD cho mỗi triệu token đầu vào được lưu trong bộ nhớ đệm, 0,40 USD cho mỗi triệu token đầu ra, với ưu đãi ra mắt hiện được quảng cáo giảm 50% đến hết ngày 22 tháng 10 năm 2026 theo UTC, điều này đưa mức giá thực tế thành 0,05 USD cho đầu vào, 0,005 USD cho đầu vào được lưu trong bộ nhớ đệm và 0,20 USD cho đầu ra cho đến thời điểm đó.
Điều này có nghĩa gì nếu bạn là người trả tiền
Điều thú vị về Solar Mini 4 không nằm ở việc nó là một mô hình tồi. Mà ở chỗ nó là một mô hình nhỏ thực sự tốt, với bài toán kinh tế bị chi phối bởi những hành vi mà bảng giá không thể cho bạn thấy. Điểm 24 trên chỉ số với ba tham số hoạt động là một kết quả kỹ thuật thực sự, và các khối lượng công việc tiếng Hàn — điểm mạnh được công bố của mô hình, cùng với tiếng Anh và tiếng Nhật — chính là nơi kết quả đó có khả năng cao nhất đáng với mức giá của nó.
Phần trớ trêu nằm ở mọi thứ phía sau lệnh gọi đầu tiên. Các lượt trả lời dài của trợ lý, mức tái sử dụng bộ nhớ đệm thấp và một tác vụ tốn bảy phút giải mã cho mỗi lần chạy chỉ mục cộng lại thành một con số chẳng giống $0.10/$0.40 chút nào. Nếu bạn đang đánh giá nó, thử nghiệm trung thực là bài kiểm tra chi phí cho mỗi công việc hoàn thành trên khối lượng công việc của chính bạn, với tính năng bộ nhớ đệm prompt được bật theo cách ngăn xếp vận hành thực tế của bạn sẽ dùng — chứ không phải so sánh giá token.
Đây cũng chính là nhóm vấn đề mà một router sinh ra để giải quyết, và là lý do OrcaRouter chuyển tiếp nguyên giá niêm yết của nhà cung cấp với mức markup 0% để một thay đổi giá từ nhà cung cấp đến được hóa đơn của bạn ngay trong cùng ngày. Chúng tôi không định tuyến các mô hình Upstage, nên cả Solar Mini 4 lẫn Solar Pro 4 đều không khả dụng qua chúng tôi — chúng đến từ API riêng của Upstage và các nền tảng bên thứ ba. Thứ chúng tôi định tuyến là nửa còn lại của so sánh này: GPT-6 Luna, Qwen3.8-Max, Qwen3.8-27B, Qwen3.8-Flash và hơn 200 mô hình khác chỉ sau một khóa duy nhất, điều này khiến việc duy trì một mô hình rẻ và một mô hình đắt cho cùng một tác vụ trở nên thực tế, rồi để cơ chế chuyển đổi dự phòng tự động và định tuyến theo từng yêu cầu quyết định mô hình nào sẽ trả lời. Khi khác biệt giữa hai mô hình là khoảng cách chi phí gấp năm lần cho mỗi tác vụ mà không bảng giá nào tiết lộ, khả năng di chuyển một yêu cầu duy nhất giữa chúng quan trọng hơn bất kỳ bảng xếp hạng benchmark nào.

Phiên bản ngắn gọn: Solar Mini 4 là điểm Pareto mới mà Artificial Analysis vẽ ra cho các mô hình dưới ba tỷ tham số hoạt động, và nó đắt hơn khoảng năm lần cho mỗi tác vụ hoàn thành so với một mô hình có cùng mức giá đầu vào niêm yết. Cả hai nhận định đó đều đúng, và nhận định thứ hai là nhận định xuất hiện trên hóa đơn.
