Một thẻ tiêu đề được tạo để so sánh Aion 3.5 Mini, ở bên trái, được mô tả là 'API đóng - không có điểm số công bố', với Gemma 4 12B, ở bên phải, được mô tả là 'Apache 2.0 - thẻ đánh giá của nhà cung cấp', cùng một dải ruy băng bên dưới ghi 'Cùng công việc, bằng chứng khác nhau'.
Guides & Insights

Aion 3.5 Mini vs Gemma 4 12B: Một trong hai có bảng điểm, còn cái kia có mức giá

Tác giả

Gideon Frost

Ngày đăng

Mô hình mới nhất · 20Xem tất cả mô hình
Benchmark: Artificial Analysis · cập nhật hằng ngày
Quay lại tất cả bài viết

Aion 3.5 Mini và Gemma 4 12B chỉ là cùng một kiểu mua hàng ở đúng một khía cạnh: cả hai đều là những mô hình nhỏ mà bạn có thể gọi qua API ngay hôm nay. AionLabs phát hành Aion 3.5 Mini vào ngày 23 tháng 9 năm 2026 dưới dạng một hệ thống đa mô hình đóng, chỉ hỗ trợ văn bản, với giá $0,70 mỗi triệu token đầu vào và $1,40 đầu ra. DeepMind phát hành Gemma 4 12B vào ngày 3 tháng 6 năm 2026 dưới dạng một mô hình trọng số mở 11,95 tỷ tham số theo Apache 2.0, với đường đầu vào đa phương thức không dùng bộ mã hóa và một thẻ đánh giá được công bố. Khác biệt thực tế không nằm ở số lượng tham số hay mức giá. Mà là một trong hai mô hình này có thể được đo lường trước khi bạn cam kết, còn mô hình kia thì hoàn toàn không thể đo lường được.

Mọi thông tin về Aion 3.5 Mini dưới đây đều đến từ danh sách mô hình do chính AionLabs công bố và cấu hình phục vụ trên API của nó. Mọi thông tin về Gemma 4 12B đều đến từ thẻ mô hình của nhà cung cấp, nơi bắt nguồn các con số của nó, cùng với bộ khung đánh giá của bên thứ ba đã thực sự chạy nó. Đối với những số liệu do nhà cung cấp báo cáo, chúng được ghi nhãn rõ như vậy. Không có bất kỳ đánh giá độc lập nào đối với mô hình Aion nào, và điều đó được nêu như một sự thật, chứ không phải như một lưu ý.

Nơi hai thứ thực sự khớp với nhau

Ít điểm hơn so với nhãn “small model” gợi ý, và những điểm thực sự khớp lại đáng để nói chính xác, vì đó là những thứ người mua kiểm tra đầu tiên.

• Ngữ cảnh — Aion 3.5 Mini mang 262,144 token. Gemma 4 12B mang cửa sổ 256K. Xét trên danh nghĩa thì ngang nhau, và trên thực tế cả hai đều đủ lớn để ngữ cảnh không phải là yếu tố quyết định.

• Đầu ra tối đa — Aion 3.5 Mini giới hạn một phản hồi ở mức 32.768 token, một mức trần được dùng chung cho toàn bộ danh mục Aion. Gemma 4 12B không công bố trên model card của mình mức giới hạn tương đương bằng một con số duy nhất, vì vậy đây là thông số bạn sẽ phải kiểm thử thay vì chỉ đọc.

• Gọi công cụ — cả hai đều hỗ trợ. Aion 3.5 Mini chấp nhận định nghĩa công cụ, định dạng phản hồi JSON và temperature trên endpoint tương thích OpenAI. Gemma 4 12B đi kèm khả năng gọi hàm ở dạng được tinh chỉnh theo chỉ dẫn.

• Kiểm soát suy luận — Aion 3.5 Mini suy luận trong mọi lời gọi và cung cấp ba mức nỗ lực: max, high và low, với high là mặc định; suy luận không phải là tùy chọn. Gemma 4 12B có các biến thể suy luận và không suy luận, và hai biến thể này đạt điểm khác nhau trên cùng một bộ khung đánh giá vì chúng thực hiện lượng công việc khác nhau.

• Phương thức đầu vào — đây là điểm đầu tiên mà chúng khác biệt rõ rệt. Aion 3.5 Mini là văn bản vào, văn bản ra, và kiến trúc không có đầu vào hình ảnh. Gemma 4 12B nhận văn bản, hình ảnh, âm thanh và video vào, và trả về văn bản.

Gemma 4 12B có thể cho bạn thấy những gì

Gemma 4 12B ra mắt cùng một thẻ đánh giá của nhà cung cấp, và các con số trên đó do nhà cung cấp báo cáo thay vì được tái lập độc lập — nhưng chúng tồn tại, chúng cụ thể, và chúng bao quát những trục mà người mua thực sự tranh luận.

• Suy luận và kiến thức do nhà cung cấp báo cáo — MMLU Pro 77,2, GPQA Diamond 78,8, HLE không dùng công cụ 5,2, BigBench Extra Hard 53,0, MMMLU 83,4.

• Lập trình do nhà cung cấp báo cáo — LiveCodeBench v6 72.0, Codeforces ELO 1659, AIME 2026 không dùng công cụ 77.5.

• Agentic do nhà cung cấp báo cáo — Tau2 đạt trung bình 69,0 qua ba lần chạy, và Codeforces ELO một lần nữa là màn thể hiện đơn lẻ mạnh nhất trên bảng.

• Đa phương thức do nhà cung cấp báo cáo — MMMU Pro 69,1, MATH-Vision 79,7, MedXPertQA MM 48,7. Card không có dòng DocVQA; số liệu tài liệu gần nhất là khoảng cách chỉnh sửa trung bình 0,164 của OmniDocBench 1.5.

• Khả năng gợi nhớ ngữ cảnh dài — MRCR v2, 8-needle, 128k, 43.4. Đó là điểm yếu được nói thẳng trên thẻ thông số, và đáng để đọc kỹ trước khi bạn cho rằng một cửa sổ 256K sẽ hành xử giống như một cửa sổ 256K ở tận phía cuối.

• Đo lường từ bên thứ ba — Artificial Analysis liệt kê Gemma 4 12B với Chỉ số Trí tuệ Suy luận là 14 và Chỉ số Không suy luận là 9 trên hệ thống đo lường riêng của mình, tốc độ đầu ra khoảng 113 token mỗi giây ở chế độ suy luận, và giá niêm yết là $0.10 cho đầu vào và $0.30 cho đầu ra trên mỗi triệu token. Các bản sửa đổi chỉ số thay đổi giữa các ảnh chụp nhanh, vì vậy hãy coi chỉ số chỉ mang tính định hướng và giá cùng tốc độ là những thông tin ổn định.

A screenshot of the Hugging Face model card for google/gemma-4-12b, showing the model blurb 'Google | Gemma 4 | 12B | Apache 2.0 | Text, Image, Audio, Video -> Text | 256K context' and the description that Gemma 4 models are multimodal, handling text and image input and generating text output.

Aion 3.5 Mini có thể cho bạn thấy những gì

Một mức giá, một cửa sổ, một mô tả kiến trúc, và không có gì khác. AionLabs không công bố bất kỳ số liệu SWE-bench Verified, Terminal-Bench, GPQA hay MMLU-Pro nào cho bất kỳ mô hình nào trong danh mục của mình, và tài liệu ra mắt 3.5 hoàn toàn không có bảng điểm chuẩn nào. Artificial Analysis không có trang nào cho Aion 3.5 Mini, Aion 3.5, Aion 3.0 hay Aion 3.0 Mini — không mô hình nào trong bốn mô hình này xuất hiện trong chỉ mục mô hình.

Việc vắng mặt đó không tự động là điều đáng kết tội, và sẽ là sai lầm nếu trình bày nó như vậy. AionLabs mô tả các mô hình của mình là những hệ thống đa mô hình được xây dựng cho công việc tự sự và kể chuyện, với một quy trình tạo sinh mang tính cộng tác, trong đó nhiều mô hình chuyên biệt cùng đóng góp vào một câu trả lời. Các chỉ số tổng hợp ở trên được tập hợp từ các tác vụ toán học, lập trình và kinh tế — công cụ sai để đánh giá văn xuôi. Một mô hình có thể thực sự giỏi ở công việc mà nó được tạo ra để làm và vẫn đạt điểm kém trên một bảng xếp hạng lập trình, hoặc thậm chí chưa bao giờ được đưa vào một bảng như vậy.

Điều mà sự thiếu hụt đó thực sự có nghĩa thì hẹp hơn và khó hơn: bạn không thể tính được chi phí cho mỗi tác vụ đã hoàn thành. Mức $0.70 và $1.40 của Aion 3.5 Mini là giá niêm yết không có mẫu số được đo lường. Mức $0.10 và $0.30 của Gemma 4 12B có kèm một mẫu số được đo lường, và chính bộ khung đo lường đã đo nó cũng báo cáo chi phí cho mỗi tác vụ. Đó là sự bất đối xứng, và nó vẫn đứng vững trước mọi lập luận về việc liệu các benchmark có phải là những benchmark phù hợp hay không.

Khoảng cách về giá lớn hơn mức mà khoảng cách về năng lực có khả năng sẽ đạt tới.

Đặt hai bảng giá cạnh nhau và cục diện của quyết định thay đổi. Aion 3.5 Mini tính $0.70 cho mỗi triệu token đầu vào và $1.40 cho mỗi triệu token đầu ra. Gemma 4 12B được niêm yết ở mức $0.10 cho đầu vào và $0.30 cho đầu ra trên bộ đánh giá của bên thứ ba đo lường nó. Đó là gấp bảy lần mức giá đầu vào và khoảng bốn lần rưỡi mức giá đầu ra, đối với một mô hình mà chính nhà cung cấp của nó không công bố điểm số nào để bạn có thể so sánh.

Hai điều khiến cho một phép nhân thẳng trở nên phức tạp, và cả hai đều càng có lợi hơn cho Gemma 4 12B. Thứ nhất, Aion 3.5 Mini suy luận trong mỗi lần gọi, nên dòng đầu ra mang theo những token mà bạn không yêu cầu và không thể giới hạn — AionLabs không công bố bất kỳ tuyên bố nào về việc mô hình dành bao nhiêu token để suy nghĩ ở bất kỳ mức nỗ lực nào trong ba mức của nó. Gemma 4 12B cho phép bạn tắt bước suy nghĩ, điều này làm thay đổi cả hóa đơn lẫn độ trễ. Thứ hai, Gemma 4 12B là trọng số mở theo Apache 2.0, nên mức $0.10 và $0.30 chỉ là một lựa chọn trong số nhiều lựa chọn, chứ không phải cách duy nhất để chạy nó.

Không điều nào trong số đó giải quyết được việc mô hình nào viết tốt hơn, vì chưa ai đo lường cả hai trên phương diện đó. Nó giải quyết được việc bạn có thể đặt mô hình nào trước mặt một bên liên quan.

Chạy cả hai cùng nhau

Việc hữu ích cần làm ở đây không phải là chọn một trong hai. Aion 3.5 Mini và Gemma 4 12B nằm sau những giao diện khác nhau nhưng cùng một quy ước gọi — AionLabs cung cấp endpoint tương thích OpenAI, còn Gemma 4 12B được phục vụ bởi các runtime tương thích OpenAI thông thường. Điều đó khiến chúng có thể thay thế cho nhau ở cấp base-URL, nhờ đó việc xây dựng một chuỗi trở nên rẻ: Aion 3.5 Mini đứng trước cho những prompt mà ensemble chính là lý do bạn gọi nó, Gemma 4 12B đứng sau cho mọi thứ mà bạn muốn một mô hình chừng mực, một bước tư duy có thể bật/tắt và một bảng giá chỉ bằng một phần tư.

Một gateway đứng trước hàng trăm mô hình trên cùng một khóa chính là thứ biến chuỗi đó thành một dòng cấu hình thay vì một tích hợp thứ hai, và đó cũng là nơi một quy tắc chuyển đổi dự phòng chứng tỏ được giá trị của mình — lỗi 429 hay sự cố từ nhà cung cấp được hấp thụ trước khi phản hồi bắt đầu, thay vì nổi lên thành một tác vụ thất bại. Khi một nhà cung cấp thay đổi bảng giá của mình, một router chuyển tiếp sẽ tính theo giá niêm yết của nhà cung cấp với không cộng thêm gì trên mỗi token, nên thay đổi đó có hiệu lực ngay trong ngày chứ không phải đến kỳ thanh toán tiếp theo. Một chi tiết đáng để kiểm tra thay vì mặc định: cả Aion 3.5 Mini lẫn Gemma 4 12B đều không được phục vụ trên mọi nền tảng lưu trữ các mô hình cỡ này, và đặc biệt Gemma 4 12B vắng mặt trong một số danh mục có chứa những phiên bản anh em lớn hơn của nó. Hãy xác minh rằng định danh đó phân giải được trước khi bạn đưa nó vào cấu hình.

A screenshot of AionLabs' own documentation site, the Introduction / LLM API page, showing that the vendor serves its models through an OpenAI-compatible REST API at https://api.aionlabs.ai/v1 supporting chat completions and model discovery, with API-key authentication and a signed-in browser workspace for testing prompts.

Cách quyết định

• Nếu bạn cần một con số trước khi quyết định — Gemma 4 12B. Đây là mẫu duy nhất trong hai mẫu có thẻ đánh giá được công bố và chỉ số của bên thứ ba, và việc đánh giá có trước quyết định của bạn thay vì theo sau quyết định đó.

• Nếu bạn cần đầu vào hình ảnh, âm thanh hoặc video — Gemma 4 12B. Aion 3.5 Mini tuyên bố chỉ văn bản sang văn bản và không có gì khác.

• Nếu bạn cần sở hữu thứ này — Gemma 4 12B. Trọng số Apache 2.0 nghĩa là bạn có thể tinh chỉnh, lượng tử hóa hoặc tự vận hành nó; Aion 3.5 Mini là một hệ thống đóng, không có trọng số để tải xuống.

• Nếu tường thuật và văn xuôi dài là toàn bộ công việc — đây là trường hợp duy nhất mà việc so sánh không thể làm thay bạn. Aion 3.5 Mini được xây dựng cho công việc đó còn Gemma 4 12B được xây dựng như một mẫu đa dụng, và không có con số được công bố nào cho bạn biết mẫu nào viết tốt hơn. Hãy thử nó trên một hướng đi mà bạn có thể chấp nhận mất.

• Nếu chi phí cho mỗi công việc đã hoàn thành là tiêu chí quyết định — thì Gemma 4 12B, chỉ xét riêng về mặt số học, và khoảng cách sẽ càng nới rộng khi tác vụ càng phụ thuộc vào token đầu ra.

Cả hai mô hình đều mới, cả hai đều đang hoạt động, và chỉ một trong số chúng đang yêu cầu bạn tin vào lời nó nói. Tóm lược xác đáng là Gemma 4 12B là mặc định có thể đo lường được, còn Aion 3.5 Mini là một chuyên gia mà bạn chọn dùng có chủ đích, không phải bằng cách so sánh — và nếu bạn có chọn dùng nó, hãy chọn dùng nó bên cạnh một phương án dự phòng, chứ không phải để thay thế một phương án dự phòng.

A generated scoreboard comparing Aion 3.5 Mini and Gemma 4 12B across six rows: published scores (none vs vendor card), price in / out ($0.70 / $1.40 vs $0.10 / $0.30), context (262,144 vs 256K), inputs (text only vs text, image, audio, video), weights (closed vs Apache 2.0) and reasoning (mandatory, 3 levels vs switchable off). Footnoted that Aion figures are unaudited and vendor-published and that Gemma figures are vendor-reported with the index per Artificial Analysis.