Thẻ tiêu đề ghi “Kolibri vs Solar Mini 4” với phụ đề “Cùng ngân sách 3B active, hai canh bạc rất khác nhau”, và hai dòng chữ nhỏ ghi “Kolibri — tổng 78,1B, trọng số Apache 2.0, tự vận hành” và “Solar Mini 4 — tổng 35B, đóng, API do nhà cung cấp vận hành”, đặt trên nền trắng với các điểm nhấn chuyển sắc xanh dương và xanh lơ dịu nhẹ cùng logo OrcaRouter ở góc dưới bên phải.
Guides & Insights

Kolibri vs Solar Mini 4: Cùng một ngân sách 3B active, hai canh bạc rất khác nhau

Tác giả

Rowan Sterling

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình →
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Hai mô hình ra mắt cách nhau mười bảy ngày, đều được tinh chỉnh để dành khoảng ba tỷ tham số hoạt động cho mỗi token, vậy mà xét về việc thực sự đưa vào sử dụng, chúng gần như khác nhau một trời một vực. Kolibri của Aleph Alpha là 78,1 tỷ tham số với trọng số Apache-2.0 mà bạn tự tải về và tự phục vụ: không tồn tại endpoint được lưu trữ nào, và tính đến hôm nay, không có một điểm số độc lập nào về nó ở bất cứ đâu. Solar Mini 4 của Upstage là 35 tỷ tham số mà bạn hoàn toàn không thể tải về — nó chỉ tồn tại dưới dạng một endpoint tính phí theo mức sử dụng, và nó đã đạt Chỉ số Thông minh Artificial Analysis là 24,05. Số tham số hoạt động cho bạn biết mỗi mô hình tốn bao nhiêu để chạy. Không có gì khác về con số đó cho bạn biết bạn phải tốn bao nhiêu để bắt đầu.

Lý do khiến tổng số tham số chênh lệch đến vậy — 78.1B so với 35B với phần kích hoạt gần như tương đương — là cả hai đều là thiết kế mixture-of-experts thưa, và hai phòng thí nghiệm đã đưa ra những lựa chọn trái ngược nhau về việc nên dự trữ bao nhiêu dung lượng expert. Kolibri mang 384 expert và định tuyến tới 1 expert chia sẻ cộng với 6 expert trong số đó cho mỗi token. Solar Mini 4 tiết lộ tỷ lệ 35B/3B và không nói gì về số lượng expert của nó. Khi hai mô hình được quảng cáo với cùng một con số kích hoạt, tổng số tham số, chứ không phải con số kích hoạt, mới là thứ quyết định hóa đơn phần cứng của bạn — và ở đây, đó là mức chênh lệch 2.2× trên cùng một ngân sách tính toán đã công bố.

Thực tế mỗi thứ là gì

• Tổng số tham số — Kolibri 78.10B so với Solar Mini 4 35B

• Tham số hoạt động trên mỗi token — Kolibri 3.46B so với Solar Mini 4 3B

• Trọng số — Kolibri Apache 2.0, trọng số đầy đủ trên Hugging Face so với Solar Mini 4 đóng; chỉ API

• Ngữ cảnh — Kolibri 1.048.576 token được xác thực so với Solar Mini 4 512K theo tài liệu của Upstream, 1.048.576 theo thẻ mô hình của Artificial Analysis

• Đầu ra tối đa — Kolibri không bị nhà cung cấp giới hạn so với Solar Mini 4 128.000 token

• Ngôn ngữ — Kolibri tiếng Đức và tiếng Anh so với Solar Mini 4 tiếng Anh, tiếng Hàn và tiếng Nhật

• Mốc kiến thức — Kolibri 18 tháng 6 năm 2026 so với Solar Mini 4 tháng 2 năm 2026

• Cung cấp — Kolibri tự triển khai (vLLM) so với Solar Mini 4 được triển khai trên Console, Playground của Upstage và tại chỗ

• Đánh giá độc lập — Kolibri không công bố kết quả nào, so với Solar Mini 4 AA Intelligence Index 24.05

Kolibri: 78 tỷ tham số, và chưa có ai ngoài phòng thí nghiệm chấm điểm nó

Aleph Alpha đã công bố Kolibri vào ngày 3 tháng 10 năm 2026, cố ý chọn Ngày Thống nhất nước Đức, với tư cách là mô hình đầu tiên của một dòng mô hình mới và là sản phẩm kế nhiệm Kolibri Origin. Thẻ mô hình trình bày một cách cởi mở đến bất thường về những gì đã được đưa vào: 20 nghìn tỷ token tiền huấn luyện, 3,44 nghìn tỷ token huấn luyện trung gian và 201 tỷ token huấn luyện ngữ cảnh dài, được chạy trên 768 GPU B200 trong 21 ngày, tương đương khoảng 6,4×10²³ FLOP và khoảng 950 MWh. Nhà cung cấp cũng tự nguyện công bố số lần thất bại — 38 lần gián đoạn ngoài kế hoạch, khoảng một lần mỗi 10.000 giờ GPU — một kiểu con số mà các phòng thí nghiệm thường lược bỏ.

Screenshot of Aleph Alpha's newsroom post “Kolibri Has Landed”, showing the 03/10/2026 release date, the line about releasing on the Day of German Reunification, and the architecture comparison table between Kolibri and Kolibri Origin.

Kiến trúc là một câu chuyện sparse-MoE gọn gàng. Năm mươi lớp với tỷ lệ 4:1 giữa attention cửa sổ trượt (cửa sổ 512 token) và attention toàn cục, vốn chỉ kích hoạt ở mỗi lớp thứ năm. Trọng số FP8 với scaling khối 128×128 và bộ đệm KV FP8. Để so sánh, Kolibri Origin đã dùng 128 chuyên gia định tuyến rộng 8, chiều ẩn chuyên gia rộng 768 và attention đầy đủ trên mọi lớp, trên dữ liệu tiếng Anh có mốc cắt đến tháng 9 năm 2024. Kolibri chuyển sang 384 chuyên gia định tuyến rộng 6 với chiều ẩn rộng 512, và đẩy cả hai mốc cắt ngôn ngữ đến ngày 18 tháng 6 năm 2026.

Pipeline tiếng Đức là phần thực sự khó mua được ở nơi khác. Aleph Alpha đã tự huấn luyện tokenizer UniBPE của riêng mình và báo cáo văn bản tiếng Đức đạt 4,90 byte mỗi token, so với 4,35 của GPT-5, 4,17 của Qwen3.5 và 4,13 của Gemini. Đó là một tokenizer tuyên bố nén tiếng Đức tốt hơn bất kỳ mô hình đa ngôn ngữ tiên tiến nào, và nó là cơ chế cụ thể đằng sau lời chào bán về triển khai chủ quyền: ít token hơn cho mỗi tài liệu tiếng Đức nghĩa là ít token bị tính phí hơn và cửa sổ hiệu dụng dài hơn trên cùng phần cứng.

Mọi số liệu hiệu năng hiện có cho Kolibri đều đến từ model card của chính Aleph Alpha, và cần được đọc theo cách đó. Bảng do nhà cung cấp báo cáo cho thấy Kolibri đạt tổng thể 75,5 trên các bài đánh giá tiếng Anh và 70,8 trên tiếng Đức, 84,3 GPQA Diamond bằng tiếng Anh so với 81,3 bằng tiếng Đức, 21,5 trên Humanity's Last Exam bằng tiếng Anh so với 15,9 bằng tiếng Đức, 66,4 trên SWE-Bench Verified, 85,9 trên LiveCodeBench v6 và 68,3 trên AA-LCR. Đó là những con số chưa được kiểm toán. Không có trang Artificial Analysis nào cho Kolibri — URL mô hình của trình theo dõi trả về lỗi 404 — nên không có gì trong bảng đó đã được tái lập một cách độc lập, và bài viết bạn đang đọc không thể khiến nó trở nên vững chắc hơn mức nó đang có.

Điều mà chiếc card này làm được một cách vững chắc là câu chuyện phục vụ. Nền tảng phần cứng tối thiểu là hai A100 80GB, hoặc hai H100 SXM5, hoặc một chiếc H200, B200 hay B300. Một công thức vLLM đã được công bố sẽ chạy nó với --kv-cache-dtype fp8 cùng các bộ phân tích cú pháp suy luận và gọi công cụ chuyên dụng, ở temperature 1.0, top-p 0.97 và top-k 128, với một nút chỉnh reasoning_effort trải từ none, low, medium đến high. Một chiếc B300 duy nhất phục vụ mô hình 78B ở ngữ cảnh 1M token đã được kiểm chứng chính là hình dạng cụ thể của gói chào: bạn mua chiếc máy, rồi sau đó bạn tự gánh chi phí biên của từng token.

Solar Mini 4: bạn thuê phần hoạt động 3B thay vì mua nó

Solar Mini 4 ra mắt ngày 22 tháng 9 năm 2026 — bản snapshot solar-mini4-260922, bí danh solar-mini4 — với tư cách là mô hình nhỏ hướng tác tử của Upstage: tổng 35B, 3B hoạt động, điểm cắt tháng 2 năm 2026, tiếng Anh, tiếng Hàn và tiếng Nhật, với các chế độ trò chuyện, suy luận, đầu ra có cấu trúc và gọi công cụ. Mô hình có sẵn qua Console và Playground của Upstage, và để triển khai on-premises, nhưng không có bản tải trọng số và không có giấy phép để kiểm tra. Tài liệu của Upstage cũng ghi "Dữ liệu không được thu thập" cho mô hình này, đây là thông tin tuân thủ quan trọng nếu bạn đang đưa nó ra phục vụ lưu lượng thực tế.

Screenshot of Upstage's Console documentation page for Solar Mini 4, showing the snapshot identifier solar-mini4-260922, the release date 2026-09-22, 35B total and 3B active parameters, a 512K context window with 128K maximum output, the list price of $0.10 per million input, $0.40 per million output and $0.01 per million cached, and the note “Data not collected”.

Khác với Kolibri, Solar Mini 4 đã được đánh giá bằng một harness độc lập. Artificial Analysis xếp nó ở Chỉ số Thông minh 24,05, với kết quả đo được là 1,01% trên Terminal-Bench 4.0, 47,6% trên SciCode, 83,3% trên AA-LCR và 25,8% trên Humanity's Last Exam. Bài đăng ra mắt của Upstage mô tả 24,1 là Chỉ số cao nhất trong số các mô hình có 3B tham số hoạt động, dẫn trước Qwen3.6 35B A3B ở mức 18 và Nemotron 3.5 Lightning ở mức 13 — một cách định khung công bằng trong giới hạn của nó, và đáng lưu ý là nó hẹp đúng như nghe có vẻ, vì đây là tuyên bố về lớp 3B hoạt động chứ không phải về các mô hình nhỏ nói chung.

Phép đo cần định hình cách bạn lập ngân sách cho nó không phải là Index. Bảng phân tích chi phí theo từng tác vụ của Artificial Analysis đặt Solar Mini 4 ở mức khoảng 0,36 USD cho mỗi tác vụ Intelligence-Index, và khoảng 0,30 USD trong số đó — chừng 82% — là các lần ghi vào bộ đệm prompt. Đọc bộ đệm tốn 0,03 USD và phần đầu ra được tạo chỉ 0,035 USD. Mô hình phát ra khoảng 88.300 token đầu ra mỗi tác vụ, trong đó khoảng 71.600 là token suy luận. Nói cách khác: đây là một mô hình rẻ mà hóa đơn của nó bị chi phối bởi việc ghi lại một ngữ cảnh dài, chứ không phải bởi những token nó viết trả lại. Chi phí mỗi bài đánh giá dao động từ 1,63 USD cho Terminal-Bench 4.0 xuống còn 0,95 USD cho AA-Briefcase. Tốc độ đầu ra trung vị là 198 token mỗi giây với thời gian đến chunk đầu tiên là 1,58 giây.

Giá của mỗi lộ trình

Solar Mini 4 hiện không được định giá theo mức niêm yết. Trang định giá của chính Upstage đưa ra một biểu giá theo mốc thời gian dành cho nó: $0.03 cho mỗi triệu token đầu vào, $0.003 cho token đã lưu trong bộ nhớ đệm và $0.12 cho đầu ra — mức giảm giá ra mắt 70% — kéo dài đến 10 tháng 10 năm 2026 theo giờ UTC, sau đó là $0.05 / $0.005 / $0.20 từ ngày 11 tháng 10, và cuối cùng là mức niêm yết $0.10 / $0.01 / $0.40 từ ngày 23 tháng 10. Bài đăng ra mắt của Upstage mô tả khoản giảm giá một cách lỏng lẻo hơn so với lịch trình trên chính trang định giá; biểu giá bậc thang này là phiên bản có ghi ngày tháng, và đó chính là phiên bản đáng để lập kế hoạch dựa theo. Hãy để ý xem mức giảm sâu nhất nằm ở đâu: đầu vào đã lưu đệm giảm xuống chỉ còn một phần mười mức giá đầu vào, điều này đền đáp đúng cho loại khối lượng công việc với ngữ cảnh ổn định lâu dài mà cấu hình chi phí ghi bộ nhớ đệm ở trên tính phí.

Giá của Kolibri là một đơn đặt hàng. Không có mức giá trên mỗi triệu token để so sánh vì không có đồng hồ đo dịch vụ máy chủ — bạn trả tiền cho GPU và điện, và tín hiệu chi phí công khai duy nhất của nhà cung cấp chính là lần chạy huấn luyện: khoảng 950 MWh để tạo ra mô hình. Nếu bạn đã sở hữu năng lực suy luận, chi phí biên trên mỗi token của Kolibri tiệm cận chi phí điện; nếu chưa, vé vào cửa là một máy hai A100 hoặc tốt hơn. Đó là một dạng cam kết khác về cơ bản so với một mô hình mà bạn có thể gọi theo hàng triệu token rồi ngừng gọi vào ngày mai, và đó chính là quyết định thực sự mà hai lựa chọn đặt ra.

Nơi chúng trùng nhau, và nơi phép so sánh đổ vỡ

• Tính toán hoạt động — gần như giống hệt: 3,46 tỷ so với 3 tỷ mỗi token

• Mọi điều rút ra từ đó — không thể so sánh, vì chỉ một trong hai có bất kỳ bằng chứng đã được xác minh nào

• Điểm số đo lường tốt nhất — Solar Mini 4 có Chỉ số đã được kiểm toán là 24.05; Kolibri có bảng của nhà cung cấp và hoàn toàn không có điểm số đã kiểm toán

• Tiếng Đức — Kolibri là mô hình duy nhất trong hai mô hình được huấn luyện cho ngôn ngữ này, với 4,90 byte mỗi token; Solar Mini 4 không liệt kê ngôn ngữ này

• Tiếng Hàn và tiếng Nhật — Solar Mini 4 liệt kê cả hai; Kolibri không liệt kê cái nào.

• Ngữ cảnh dài — Kolibri xác thực đầy đủ 1,048,576 token; tài liệu của chính Solar Mini 4 ghi 512K trong khi thẻ Artificial Analysis của nó ghi 1M, vì vậy hãy coi giới hạn trên là phụ thuộc vào nhà cung cấp

• Thời gian tới token đầu tiên — Solar Mini 4 tính bằng phút, vì bạn chỉ cần đăng ký; Kolibri tính bằng ngày, vì bạn phải dựng một chiếc máy chủ vào tủ rack

• Mô hình chi phí — trên mỗi token, giảm dần theo thang chiết khấu, so với vốn cộng điện năng

Tóm tắt một cách trung thực là: đây không phải là một cuộc so tài mà bạn có thể phân định trên bảng xếp hạng. Bảng của nhà cung cấp Kolibri thậm chí còn bao gồm bộ so sánh của chính họ — GLM-4.7 Flash 30B-A3B đạt 64.7 tổng thể tiếng Anh, Nemotron 3 Nano 30B-A3B đạt 65.6, Qwen3.5 35B-A3B đạt 74.7, Qwen3.6 35B-A3B đạt 71.4, Gemma 4 26B-A4B IT đạt 71.9, tất cả đều đối chiếu với mức 75.5 của chính Kolibri — và mỗi dòng trong số đó đều là con số của chính Aleph Alpha, được chạy bởi cùng một phòng thí nghiệm trên bộ khung đánh giá của riêng họ. Đó là một bản đồ hữu ích về vùng lân cận 3B-active. Đây không phải là một bảng xếp hạng độc lập.

Nếu điều bạn muốn là một MoE 3B-active trên một key ngay hôm nay

Không mô hình nào trong so sánh này có mặt trên OrcaRouter, và cần nói chính xác vì sao. Kolibri hiện chưa có bất kỳ hình thức suy luận được lưu trữ nào — nó chỉ là trọng số và một công thức vLLM, nên không có gì để một bộ định tuyến trỏ tới. Solar Mini 4 được phục vụ bởi Upstage và bởi kênh tại chỗ của chính Upstage; chúng tôi không định tuyến nó, và chúng tôi không định tuyến bất kỳ mô hình Upstage nào. Nếu bạn muốn một trong hai, bạn nhận nó từ chính các nhà cung cấp.

Điều chúng tôi làm với route là lớp bao quanh — phân khúc MoE nhỏ, thưa mà cả hai mô hình này đang cạnh tranh bên trong. Gemma 4 26B-A4B IT có trong danh mục với mức $0.06 cho đầu vào và $0.33 cho đầu ra mỗi triệu token, cùng cửa sổ 262,144 token. Qwen3.5 35B-A3B ở mức $0.057 / $0.459 và Qwen3.6 35B-A3B ở mức $0.248 / $1.485 với cửa sổ 262,144 token và tối đa 65,536 token đầu ra. Đó cũng chính là đánh đổi mà hai mô hình trên đang thực hiện — một lát cắt hoạt động 3B-đến-4B được mua với giá của một mô hình nhỏ — có sẵn trên một API key với giá niêm yết của nhà cung cấp được chuyển nguyên ở mức 0% markup, nên thay đổi giá từ nhà cung cấp sẽ vào hóa đơn của bạn ngay trong ngày nó được công bố, thay vì vào lần gia hạn hợp đồng tiếp theo. Chuyển đổi dự phòng tự động quan trọng hơn bình thường ở đây: khi bạn đang đánh giá một mô hình thưa chưa được kiểm chứng, một route thứ hai phía sau cùng một key chính là thứ giữ cho một buổi chiều tồi tệ không biến thành sự cố ngừng dịch vụ.

A two-column comparison scoreboard titled “Kolibri vs Solar Mini 4 — the scoreboard”. The Kolibri column lists total parameters 78.1B, 3.46B active per token, Apache 2.0 downloadable weights, 1,048,576-token context, German and English, and no independent score published. The Solar Mini 4 column lists total parameters 35B, 3B active per token, closed API-only weights, a 512K-per-docs / 1M-per-Artificial-Analysis context, English, Korean and Japanese, and an Artificial Analysis Intelligence Index of 24.05. A footer line reads “Kolibri figures are Aleph Alpha's own, unaudited; Solar Mini 4 figures per Artificial Analysis and Upstage.”

Nên làm gì và nên xem gì

Chọn Kolibri nếu khối lượng công việc của bạn là tiếng Đức hoặc tiếng Anh, nếu dữ liệu không thể rời khỏi rack của chính bạn, và nếu bạn đã có — hoặc sẵn sàng mua — GPU để phục vụ 78B ở FP8. Trong cấu hình đó, nó là mô hình duy nhất trong hai mô hình này thậm chí còn là một lựa chọn, và ngữ cảnh 1M-token đã được kiểm chứng với tokenizer tiếng Đức 4,90 byte mỗi token là một lợi thế thực sự, dù được đo đạc bởi nhà cung cấp. Chọn Solar Mini 4 nếu bạn muốn đưa vào sản xuất trong tuần này, nếu tiếng Hàn hoặc tiếng Nhật nằm trong lộ trình, và nếu khối lượng công việc của bạn là một ngữ cảnh dài ổn định mà ưu đãi cache thưởng cho; hãy dự trù chi phí cho việc ghi cache, không phải token đầu ra.

Câu hỏi mở là như nhau cho cả hai, và đó là câu hỏi về bằng chứng chứ không phải về năng lực. 75.5 và 84.3 của Kolibri là những con số của chính Aleph Alpha trên hệ thống đánh giá của chính Aleph Alpha, và cho đến khi một đơn vị theo dõi độc lập chạy nó, bất kỳ ai trích dẫn chúng đều đang trích dẫn phòng thí nghiệm. 24.05 của Solar Mini 4 là có thật và đã được tái lập, nhưng Index là ảnh chụp nhanh của một mô hình vẫn đang ở giữa thang chiết khấu, với giá niêm yết mãi đến ngày 23 tháng 10 mới xuất hiện. Hãy theo dõi đánh giá độc lập đầu tiên của Kolibri, và theo dõi chi phí thực tế của Solar Mini 4 một khi thang chiết khấu kết thúc — bởi vì ở mức $0.10 / $0.40, tính kinh tế của việc thuê phần 3B trông khác với mức $0.03 / $0.12 mà bạn đang được báo giá hôm nay.