Thẻ tiêu đề ghi “Solar Mini 4 vs Gemma 4 12B” với phụ đề “Một checkpoint bạn tải về và một model bạn gọi”, đặt trên nền chuyển sắc từ xanh dương sang xanh ngọc với logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Solar Mini 4 so với Gemma 4 12B: một checkpoint bạn tải xuống và một mô hình bạn gọi

Tác giả

Magnus Corvin

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

So sánh trung thực ngắn gọn nhất giữa Solar Mini 4 và Gemma 4 12B là một trong hai là một tệp còn cái kia là một endpoint. Solar Mini 4 của Upstage là mô hình mixture-of-experts 35 tỷ tham số với 3 tỷ tham số hoạt động mỗi token, cửa sổ ngữ cảnh 512.000 token và không có trọng số mở — bạn truy cập nó thông qua Upstage Console, Playground, hoặc triển khai tại chỗ do bạn sắp xếp với nhà cung cấp. Gemma 4 12B là một checkpoint dense 11,95 tỷ tham số theo Apache 2.0, có thể tải xuống ngay hôm nay, chạy trong khoảng 16 GB bộ nhớ hợp nhất trên một máy tính xách tay. Cả hai đều được xây dựng cho công việc agentic, cả hai đều nhận một tài liệu dài làm đầu vào, và chúng không cạnh tranh cho cùng một vị trí trong stack của bạn, vì một trong hai có hóa đơn bộ nhớ còn cái kia có hóa đơn token.

Sự khác biệt đó bị lu mờ vì hai mô hình trông giống nhau trên danh sách tính năng. Cả hai đều suy luận, đều gọi công cụ, đều tạo đầu ra có cấu trúc, đều xử lý tiếng Anh, tiếng Hàn và tiếng Nhật. Những khác biệt quyết định vấn đề nằm ở chỗ khác: điều gì xảy ra lúc 3 giờ sáng khi hệ thống gặp sự cố, đội ngũ tuân thủ của bạn nói gì về việc dữ liệu nằm ở đâu, và liệu bạn đang trả tiền theo token hay theo giờ GPU.

Đối chiếu thông số kỹ thuật, theo từng khía cạnh

• Kiến trúc — Solar Mini 4 là mô hình thưa: tổng cộng 35B tham số, 3B hoạt động trên mỗi token. Gemma 4 12B là mô hình dày đặc: mỗi một trong 11,95B tham số của nó đều chạy trên mọi token. Solar lưu trữ lượng trọng số gấp mười lần và tính toán với một phần tư trong số đó; Gemma lưu trữ một phần tư và tính toán với toàn bộ.

• Nơi nó chạy — Solar Mini 4 chạy trên hạ tầng của Upstage (Console, Playground) hoặc trong môi trường của riêng bạn theo hình thức triển khai tại chỗ. Gemma 4 12B chạy trên phần cứng của bạn: khoảng 16 GB bộ nhớ hợp nhất ở độ chính xác đầy đủ, gần 8 GB ở 4-bit, và nó vừa vặn trên một GPU tiêu dùng hoặc một laptop dòng M.

• Trọng số — Apache 2.0 cho Gemma 4 12B, nghĩa là được dùng cho mục đích thương mại, chỉnh sửa và phân phối lại mà không có ngưỡng doanh thu. Đóng đối với Solar Mini 4. Upstage đã từng phát hành trọng số mở trước đây, nhưng không có gì trong lần phát hành này cho thấy họ có kế hoạch làm vậy ở đây.

• Ngữ cảnh — 512.000 token cho Solar Mini 4, với tối đa 128.000 token đầu ra. Gemma 4 12B có 256.000 token, với Artificial Analysis ghi 260K trên trang mô hình của nó. Solar là mô hình dài hơn trong hai, và khoảng cách không hề nhỏ.

• Các phương thức — Gemma 4 12B là đa phương thức không dùng bộ mã hóa: các mảng ảnh và âm thanh 16 kHz được chiếu trực tiếp vào không gian nhúng của mô hình ngôn ngữ, nên nó nhận văn bản, hình ảnh, âm thanh và video rồi trả về văn bản. Solar Mini 4 là đầu vào văn bản, đầu ra văn bản. Đây là phương diện duy nhất mà Gemma thắng tuyệt đối và thắng với cách biệt lớn.

• Giá — Solar Mini 4 niêm yết ở mức 0,10 USD mỗi triệu token đầu vào và 0,40 USD mỗi triệu token đầu ra, với đầu vào được lưu trong bộ nhớ đệm ở mức 0,01 USD; chương trình khuyến mãi ra mắt 50% kéo dài đến ngày 22 tháng 10 năm 2026. Gemma 4 12B tải xuống miễn phí, và Artificial Analysis đã niêm yết dịch vụ suy luận được lưu trữ ở mức 0,10 USD cho đầu vào và 0,30 USD cho đầu ra mỗi triệu token khi trang của nó được ghi lại vào ngày 22 tháng 9 năm 2026.

• Mốc cắt kiến thức — tháng 2 năm 2026 đối với Solar Mini 4; Gemma 4 12B ra mắt ngày 3 tháng 6 năm 2026 với mốc cắt kiến thức tháng 1 năm 2025. Cả hai đều đã cũ đến mức việc truy xuất không còn là tùy chọn.

• Điểm số độc lập — Solar Mini 4 vẫn chưa có điểm nào, một ngày sau khi phát hành. Gemma 4 12B có Artificial Analysis Intelligence Index là 14, xếp thứ 22 trong số 142 mô hình được theo dõi trong cùng lớp, với 112,7 token đầu ra mỗi giây.

Gemma 4 12B thực sự dùng để làm gì

Screenshot of Artificial Analysis’s model page for Gemma 4 12B, showing its Intelligence Index score, its rank among the models tracked in its class, and its output speed.

Gemma 4 12B ra đời để đưa một mô hình đa phương thức có năng lực vào nơi bạn kiểm soát. Định vị của Google khi ra mắt là nó tiệm cận mô hình mixture-of-experts 26B của chính công ty với chưa bằng một nửa bộ nhớ, và rằng nó vượt qua Gemma 3 27B của thế hệ trước ở các tác vụ suy luận, khoa học và tài liệu. Những con số do nhà cung cấp báo cáo đằng sau tuyên bố đó rất mạnh so với kích thước: 77,2% trên MMLU-Pro, 78,8% trên GPQA Diamond, 94,9 trên DocVQA và 88,4 trên InfoVQA, tất cả đều là số liệu của chính Google và chưa được tái lập độc lập.

Quyết định kỹ thuật thú vị là Gemma 4 12B không có bộ mã hóa thị giác hay âm thanh riêng. Các mảng ảnh được chiếu vào không gian embedding của mô hình thông qua một phép nhân ma trận duy nhất; âm thanh thô cũng đi vào theo cùng cách. Điều đó loại bỏ chi phí bộ nhớ và độ trễ khi chạy thêm hai tháp song song với mô hình ngôn ngữ, và đó là lý do một mô hình đa phương thức vừa vặn trong 16 GB. Nó cũng có nghĩa là mô hình ngôn ngữ hấp thụ công việc mà các bộ mã hóa lẽ ra phải làm, đây là một sự đánh đổi thực sự đối với chi tiết thị giác mịn.

Đối với công việc agent, hệ quả thực tế là Gemma 4 12B là mô hình duy nhất trong hai mô hình này có thể đọc ảnh chụp màn hình, một trang quét hoặc ghi chú thoại như một phần của vòng lặp. Nếu công việc của agent của bạn liên quan đến việc nhìn vào một thứ gì đó, thì cuộc so sánh kết thúc trước khi nó bắt đầu.

Solar Mini 4 thực sự để làm gì

Solar Mini 4 nhắm đến trường hợp ngược lại: công việc tần suất cao, nhạy cảm về chi phí, nơi đầu vào là văn bản và khối lượng lớn. Mô tả của chính Upstage là "tốc độ phản hồi và chi phí đều quan trọng," và số lượng tham số hoạt động 3B chính là cơ chế. Một mô hình thưa ở tỷ lệ này có chi phí phục vụ thấp, đó là lý do Upstage có thể niêm yết mức $0.10 cho mỗi triệu token đầu vào cho một thứ có cửa sổ 512K.

Ngữ cảnh 512K là vũ khí sắc bén hơn. Đó cũng chính là con số mà Upstage trang bị trên Solar Pro 4, mẫu chủ lực của mình, nghĩa là mẫu nhỏ gọn này không hề bị cắt giảm về dung lượng tài liệu — một hợp đồng 400 trang, một cơ sở mã đầy đủ, một năm phiếu hỗ trợ. 256K của Gemma 4 12B là hào phóng theo bất kỳ tiêu chuẩn thông thường nào, nhưng theo tiêu chuẩn này thì chỉ bằng một nửa của Solar.

Suy luận là năng lực mới của dòng Mini. Các mô hình solar-mini của thế hệ trước hoàn toàn phớt lờ tham số reasoning_effort; Solar Mini 4 chấp nhận tham số này, và các công cụ agent của bên thứ ba đã được cập nhật để coi nó là có khả năng suy luận thay vì đưa nó vào danh sách từ chối. Upstage cũng tung ra Solar Jev cùng ngày, một endpoint ra quyết định bản beta được cung cấp trên Solar Mini 4, trả về một lựa chọn, một điểm số hoặc một xác suất mà không có chút văn xuôi nào — một tín hiệu về việc Upstage nghĩ mô hình này dành cho những khối lượng công việc nào.

Điều mà Solar Mini 4 không có, tại thời điểm viết bài này, là một con số độc lập duy nhất. Không có Intelligence Index, không có vị trí trên Agent Arena, và cũng không có bảng benchmark nào từ Upstage — mục changelog chỉ mang thông số kỹ thuật và không có điểm số. Con số duy nhất mang tính gần như bên thứ ba đang lưu hành là một lần chạy test400 do một wrapper cộng đồng tự báo cáo, được một mô hình khác đánh giá theo một rubric đã nêu, trong đó Solar Mini 4 đạt độ chính xác theo trường 98,4% ở reasoning_effort=none và trung bình 1,21 giây mỗi lần gọi. Đó là so sánh của một nhà phát triển với chính harness của họ, và nó không phải là lý do để đưa ra một quyết định sản xuất.

Sự so sánh quyết định tất cả

Screenshot of Upstage’s pricing page listing Solar Mini 4’s input, cached input and output rates alongside the launch promotion window.

Nếu bạn có GPU và lý do để giữ dữ liệu trong nội bộ, thì Gemma 4 12B thực sự không cạnh tranh với Solar Mini 4 chút nào — nó đang cạnh tranh với hóa đơn tiền điện của bạn. Bạn tải nó về một lần, chạy nó mãi mãi, không phải trả đồng nào cho mỗi token, và bạn có được đầu vào đa phương thức mà Solar Mini 4 không cung cấp ở bất kỳ mức giá nào. Những chi phí xuất hiện sau đó đều mang tính vận hành: ai đó phải đứng ra quản lý ngăn xếp phục vụ, ai đó phải xử lý việc nâng cấp khi Google phát hành phiên bản tiếp theo, và thông lượng của bạn bị giới hạn bởi phần cứng mà bạn đã mua.

Nếu bạn không có GPU, hoặc có nhưng khối lượng công việc lúc cao lúc thấp, thì Solar Mini 4 là lựa chọn không có chi phí vốn. Bạn trả $0,05 cho mỗi triệu token đầu vào trong chương trình khuyến mãi ra mắt và $0,10 sau đó, bạn nhận được cửa sổ ngữ cảnh gấp đôi, và bạn nhận được SLA từ nhà cung cấp thay vì một chiếc máy nhắn tin. Điều bạn đánh đổi là trọng số mô hình, đầu vào đa phương thức, và bất kỳ khả năng nào để trả lời câu hỏi "dữ liệu của tôi sẽ ra sao" bằng "nó không bao giờ rời khỏi tòa nhà này."

Việc so sánh giá gần nhau hơn mức mà tiêu đề gợi ý và đáng để thực hiện một cách cẩn thận. Ở giá niêm yết, Solar Mini 4 và Gemma 4 12B dạng hosted có cùng chi phí đầu vào ($0.10) và Gemma rẻ hơn ở đầu ra ($0.30 so với $0.40). Trong chương trình khuyến mãi của Upstage, Solar chỉ bằng một nửa mức đó ở cả hai. Nếu khối lượng công việc của bạn thiên về đầu vào — tài liệu dài, câu trả lời ngắn — thì hai bên thực tế ngang bằng ở giá niêm yết và Solar rẻ hơn ở thời điểm hiện tại. Nếu thiên về đầu ra, Gemma rẻ hơn trừ khi chương trình khuyến mãi đang diễn ra.

Chạy một trong hai mà không cần xây dựng lại stack của bạn

Phần khó xử của quyết định này nằm ở chỗ nó không hề dễ đảo ngược một cách rõ ràng. Tải Gemma 4 12B về là bạn tự trói mình vào một ngăn xếp phục vụ; chọn Solar Mini 4 là bạn tự trói mình vào một dạng API. Dù bạn chọn cái nào, chi phí chuyển đổi chính là thứ khiến bạn thôi không đánh giá lại sau sáu tháng nữa, và lý do thành thật để vẫn giữ một router trong bức tranh là nhằm giữ chi phí đó ở mức gần như bằng không.

Một điều cần nói cho chính xác: OrcaRouter không định tuyến bất kỳ mô hình nào của Upstage, nên Solar Mini 4 không có sẵn ở đây — nó đến từ API riêng của Upstage và một số nền tảng bên thứ ba. Chúng tôi có định tuyến các kích cỡ Gemma 4 lớn hơn của Google, tức bản 26B-A4B và 31B, nhưng không định tuyến checkpoint 12B mà bài viết này nói tới. Điều mà nền tảng thực sự hướng tới trong bối cảnh này chính là phép so sánh bạn thực hiện sau phép so sánh này: một khi bạn đã quyết định "mô hình agent nhỏ gọn, đầu vào văn bản", câu hỏi thú vị trở thành chọn cái nào, và đó là câu hỏi bạn trả lời bằng cách đặt ba mô hình trong số đó sau một khóa duy nhất và đo lường trên lưu lượng của chính bạn thay vì đọc thêm một bảng thông số kỹ thuật nữa. Một DSL định tuyến giúp kết hợp nhiều mô hình vào một lời gọi duy nhất chính là cách bạn chạy thử nghiệm đó mà không cần viết ba tích hợp riêng.

OrcaRouter scoreboard comparing Solar Mini 4 and Gemma 4 12B across six dimensions: architecture, weights, context, input modalities, price per million tokens, and Artificial Analysis Intelligence Index.

Chọn cái nào?

Hãy chọn Gemma 4 12B nếu bạn có phần cứng, nếu agent của bạn cần xem hình ảnh hoặc nghe âm thanh, nếu bạn cần trọng số để tinh chỉnh, hoặc nếu câu trả lời cho “dữ liệu đi đâu?” buộc phải là “không đi đâu cả.” Chọn Solar Mini 4 nếu bạn không muốn chạy suy luận, nếu đầu vào của bạn là văn bản dài và đầu ra ngắn, nếu cửa sổ 512K quan trọng, hoặc nếu bạn cần một mô hình ưu tiên tiếng Hàn có hợp đồng nhà cung cấp đứng sau.

Nếu bạn còn đang phân vân, yếu tố quyết định không phải là một benchmark. Mà là câu hỏi bạn chưa thể trả lời về Solar Mini 4: chưa ai ngoài Upstage đo lường nó. Gemma 4 12B có Intelligence Index là 14 và một bảng xếp hạng công khai; Solar Mini 4 có bảng thông số, một mức giá và một chương trình khuyến mãi hết hạn vào ngày 22 tháng 10. Thử nghiệm nó chỉ tốn vài đô la trong khoảng thời gian đó. Đặt cược một lộ trình sản xuất vào nó sẽ khiến bạn phải viết lại nếu những con số, khi chúng xuất hiện, không mấy thuận lợi.