Một thẻ tiêu đề hero được tạo ghi 'Solar Mini 4 vs Granite 4.2 3B' với phụ đề 'Một mô hình bạn gọi và một checkpoint bạn tải xuống' và hai huy hiệu ghi 'Mỗi cái có khoảng 3 tỷ tham số hoạt động mỗi token' và 'Một cái tính phí theo token, cái kia theo watt'.
Guides & Insights

Solar Mini 4 so với Granite 4.2 3B: một mô hình bạn gọi và một checkpoint bạn tải về

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Đặt Solar Mini 4 cạnh Granite 4.2 3B và con số thú vị không phải là khoảng cách điểm chuẩn. Mà là việc Granite 4.2 3B, mô hình suy luận Apache-2.0 của IBM ra mắt ngày 25 tháng 8 năm 2026, sẽ chạy trên một chiếc laptop tối nay mà không tốn xu nào, trong khi Solar Mini 4, mô hình độc quyền của Upstage ra mắt ngày 22 tháng 9 năm 2026, sẽ không chạy được ở bất cứ đâu bạn sở hữu và tính 0,10 đô la cho mỗi triệu token đầu vào cùng 0,40 đô la cho mỗi triệu token đầu ra để trả lời một câu hỏi. Cả hai đều kích hoạt khoảng ba tỷ tham số tính toán cho mỗi token. Một cái là một tệp. Cái kia là một chiếc đồng hồ tính tiền.

Sự khác biệt đó quyết định gần như mọi thứ khác trong so sánh này, bao gồm cả việc những benchmark nào thậm chí đáng để đặt cạnh nhau. Granite 4.2 3B đã có một đánh giá độc lập từ rất lâu trước khi Solar Mini 4 có — Artificial Analysis chấm nó 9 điểm trên Intelligence Index v4.3.2, từ cùng bộ đánh giá và cùng tổ chức chấm Solar Mini 4 24 điểm. Điều đó nghĩa là khoảng cách mười lăm điểm ở đây có cơ sở đặc biệt vững chắc: đó là một phòng thí nghiệm, một phương pháp luận, và hai mô hình mà không ai phải chấp nhận bằng niềm tin.

Đặc tả kỹ thuật, xét trên những khía cạnh thực sự phân biệt chúng

• Kiến trúc — Solar Mini 4 là một mixture-of-experts thưa: tổng cộng 35B tham số, 3B hoạt động mỗi token, theo Upstage. Granite 4.2 3B là dạng dense, khoảng 3B tham số với tổng cộng khoảng 4B bao gồm cả embeddings theo metadata safetensors. Cùng một ngân sách kích hoạt, hai cách khác nhau để sử dụng nó.

Trọng số — Solar Mini 4 là độc quyền và đóng kín. Granite 4.2 3B được phát hành theo Apache 2.0 với công thức huấn luyện được ghi chép đầy đủ đến từng tỷ lệ dữ liệu.

• Ngữ cảnh — Upstage ghi nhận 512K token với đầu ra lên tới 128K; Artificial Analysis liệt kê 1,0M cho cùng mô hình đó, vì vậy hãy coi giới hạn trần là chưa được xác định. Granite 4.2 3B chạy 131.072 token nguyên bản, được mở rộng lên 512K nhờ giai đoạn tiền huấn luyện thứ năm.

• Giá — Solar Mini 4 ở mức $0.10 / $0.01 cho token đã cache / $0.40 mỗi triệu token, hiện đang giảm 50% đến hết ngày 22 tháng 10 năm 2026. Granite 4.2 3B không có bảng giá của nhà cung cấp vì không có gì để thuê; các endpoint được host mà Artificial Analysis theo dõi định giá nó vào khoảng $0.03 / $0.12, và tự host chỉ tốn tiền điện.

• Chỉ số Trí tuệ — 24 cho Solar Mini 4, 9 cho Granite 4.2 3B, cả hai đều từ Artificial Analysis v4.3.2.

• Tốc độ — 93 token đầu ra mỗi giây đối với Solar Mini 4 và 223 đối với Granite 4.2 3B, cả hai đều được đo bởi cùng một phòng thí nghiệm, với thời gian đến chunk đầu tiên lần lượt là 1,5 giây và 0,5 giây. Mô hình dense là mô hình nhanh hơn ở cả hai chỉ số.

Khoảng cách mười lăm điểm thực sự được tạo nên từ điều gì

A two-column comparison scoreboard titled 'Solar Mini 4 vs Granite 4.2 3B', subtitled 'Same activation budget, two different ways of spending it'. Solar Mini 4: parameters 35B total / 3B active; weights proprietary, no download; context 512K claimed and 1.05M listed; price per 1M $0.10 / $0.01 / $0.40; Intelligence Index 24.05; cost per index task $0.36; output per task 88,300 tokens at 204 tok/s; non-hallucination 64.2%. Granite 4.2 3B: parameters 3.66B dense; weights Apache 2.0 on Hugging Face; context 131,072 native; price per 1M about $0.03 / $0.12 hosted; Intelligence Index 9.06; cost per index task $0.006; output per task 18,600 tokens at 223 tok/s; non-hallucination 73.7%.

Các đánh giá riêng lẻ kể một câu chuyện kém nổi bật hơn so với tiêu đề đối với Granite 4.2 3B, và phức tạp hơn đối với Solar Mini 4. Trên AA-LCR v1.1, bài đánh giá suy luận ngữ cảnh dài, Solar Mini 4 đạt 83% và Granite 4.2 3B đạt 24%. Chỉ riêng đánh giá đó chiếm một phần cực lớn trong khác biệt về chỉ số, và đó không phải là sự tình cờ của quy mô — đó là thứ bạn có được với 512K đến 1M token ngữ cảnh cùng quá trình huấn luyện để sử dụng nó. Cửa sổ của Granite 4.2 3B đạt tối đa 131K ở chế độ gốc; giai đoạn mở rộng lên 512K có tồn tại, nhưng mô hình không được tinh chỉnh để suy luận xuyên suốt cửa sổ đó như Solar Mini 4.

Về kiến thức phổ thông, khoảng cách thu hẹp lại rồi sau đó đảo chiều về mặt tính chất. Granite 4.2 3B đạt 55.9% trên GPQA, còn Solar Mini 4 hoàn toàn không có con số GPQA nào; trên Humanity's Last Exam, hai mô hình lần lượt đạt 6.6% và 25.8%, đây là phép so sánh trực tiếp hơn và cũng là kết quả mà sự khác biệt về kích thước dự đoán. Điều mà Granite 4.2 3B không làm, theo Artificial Analysis, là bịa đặt: tỷ lệ không ảo giác trên AA-Omniscience của nó là 73.7%, cao hơn mức 64.2% của Solar Mini 4. Mô hình nhỏ hơn ít có khả năng bịa ra một câu trả lời mà nó không có hơn.

Lập trình tác tử là điểm mà cả hai mô hình đều thất bại, và cũng là nơi việc đọc các con số trở nên quan trọng. Solar Mini 4 đạt 1% trên Terminal-Bench 4.0 và 22,3% trên AutomationBench-AA. Granite 4.2 3B đạt 0% trên Terminal-Bench 4.0, 13,9% trên Terminal-Bench 2.1 cũ hơn và 5,6% trên τ³-Banking. Không mô hình nào là công cụ phù hợp cho công việc terminal tự trị. Các thành viên 8B và 30B của dòng Granite 4.2 đã nhận được học tăng cường tác tử của IBM và mang theo kết quả SWE-Bench và Terminal-Bench; phiên bản 3B đã bỏ qua rõ ràng khối huấn luyện đó, còn mô hình của Upstage được định giá cho truy xuất, cấu trúc hóa và áp dụng chính sách thay vì để điều khiển shell.

Những trường hợp Granite 4.2 3B vẫn là câu trả lời đúng

Bảy và một phần ba gigabyte trọng số ở dạng bfloat16, dưới bốn gigabyte khi lượng tử hóa thực tế, cùng giấy phép Apache 2.0 cho phép bạn tinh chỉnh nó trên dữ liệu của riêng mình và phát hành kết quả mà không cần hỏi bất kỳ ai. Một sinh viên chỉ có một GPU tiêu dùng, một bệnh viện không thể gửi văn bản bệnh nhân cho bên thứ ba, một sản phẩm cần hoạt động trên máy bay hoặc trong tầng hầm nhà máy, một nhóm muốn sở hữu một mô hình thay vì thuê một endpoint — mọi trường hợp trong số đó đều chọn Granite 4.2 3B và không hề ngoảnh lại. Engine này chạy qua vLLM, SGLang, Transformers và GGUF, và Ollama có liệt kê bản dựng granite4.2:3b.

Các số liệu do nhà cung cấp báo cáo của nó cần được thận trọng như thường lệ. Thẻ mô hình của IBM tuyên bố 78,33 trên AIME 2025, 66,67 trên HMMT February 2025 và 69,71 trên LiveCodeBench v6 — tất cả đều chưa được bất kỳ bên thứ ba nào tái lập, và với một mô hình dense 3B, con số AIME cao hơn hẳn phạm vi lịch sử. Chỉ số Artificial Analysis ở mức 9 ghi nhận mô hình là thực sự hữu ích và không hề tiệm cận mức tiên tiến nhất, đây là tín hiệu đáng tin cậy hơn chính vì IBM đã không công bố nó.

Trường hợp Solar Mini 4 là đáp án đúng

Bất kỳ việc gì mà công việc là một tài liệu dài, một tác vụ trích xuất có cấu trúc lặp lại, hoặc một chính sách phải được áp dụng nhất quán với khối lượng lớn — và ở đó độ trễ chín mươi giây là chấp nhận được. Hồ sơ năng lực của Solar Mini 4 là hồ sơ của một chuyên gia: 83% về suy luận ngữ cảnh dài, 48% về lập trình khoa học, 64% về khả năng không ảo giác, và xu hướng đã được ghi nhận là từ chối trả lời thay vì đoán. Nó cũng nói tiếng Hàn như một ngôn ngữ hạng nhất bên cạnh tiếng Anh và tiếng Nhật, điều mà đối với việc triển khai tại thị trường Hàn Quốc không phải là một chú thích nhỏ.

Điều người mua không nên làm là so sánh hai mức giá token rồi kết luận rằng Solar Mini 4 đắt hơn gấp ba lần. Artificial Analysis đo Solar Mini 4 ở mức 0,36 USD cho mỗi tác vụ Intelligence Index hoàn thành — và trên cùng bộ đánh giá, Granite 4.2 3B ở mức 0,006 USD. Đó là hệ số sáu mươi, bắt nguồn từ chính những yếu tố làm thổi phồng Solar Mini 4 so với GPT-6 Luna (max): 88.300 token đầu ra mỗi tác vụ so với 18.600 của Granite, và một cấu trúc chi phí trong đó các thao tác ghi prompt-cache chiếm 0,30 USD trong 0,36 USD của Solar Mini 4, so với 0,0006 USD trong 0,006 USD của Granite. Giá đầu ra rẻ ở một mô hình dài dòng không đồng nghĩa với một tác vụ rẻ.

A screenshot of the Hugging Face model card for ibm-granite/granite-4.2-3b showing the model summary table: developer Granite Team at IBM, a decoder-only dense transformer, base model Granite-4.1-3B-Base, 3B parameters, context length natively 128K with long-context extension to 512K, bfloat16 precision, twelve tested languages including Korean, a built-in chain-of-thought thinking mode, and an Apache-2.0 licence, with the model tree showing three finetunes and the base model ibm-granite/granite-4.1-3b-base.

Cả hai model đều không có trên OrcaRouter — chúng tôi không định tuyến Granite lẫn Upstage — nên nếu bạn muốn Granite 4.2 3B thì nó đến từ Hugging Face, còn nếu bạn muốn Solar Mini 4 thì nó đến từ API riêng của Upstage và các nền tảng bên thứ ba. Nhưng kiểu mẫu hai model mà điều này gợi ra chính là thứ mà các router được sinh ra để phục vụ, và đó là lý do Orca đưa hơn 200 model ra sau một chiếc key duy nhất với mức markup 0% so với giá niêm yết của nhà cung cấp: hãy chạy phần việc xử lý tài liệu dài bằng tiếng Hàn trên bất kỳ model nào thực sự xứng đáng với chi phí của nó, giữ các bước trích xuất trên một thứ do mình tự host, và để việc định tuyến cùng failover chuyển yêu cầu qua lại giữa chúng theo từng lần gọi thay vì theo từng

A screenshot of the Artificial Analysis comparison page headed 'Granite 4.2 3B Intelligence, Performance & Price Analysis', marked as an IBM open-weights model released August 2026, with an overall speed of 223.4 output tokens per second, a 131k-token context window, and the summary line that Granite 4.2 3B scores 9 on the Artificial Analysis Intelligence Index, placing it above average among comparable models with a median of 6.

Một lưu ý cuối về những con số ở trên. Mọi số liệu Solar Mini 4 đến từ Artificial Analysis đều là một phép đo độc lập; mọi số liệu Granite 4.2 3B từ thẻ mô hình của IBM đều là tuyên bố của nhà cung cấp mà chưa có bên thứ ba nào tái lập được. Các điểm chỉ số Artificial Analysis là 24 và 9 là hai con số duy nhất ở đây được cùng một phòng thí nghiệm tạo ra trong cùng điều kiện — và chúng là hai con số để dựa vào mà đưa ra quyết định.