一张生成的标题卡,左侧是 Aion 3.5 Mini,描述为“封闭 API——未公布评分”,右侧是 Gemma 4 12B,描述为“Apache 2.0——厂商评估卡”,下方有一条横幅写着“同样的任务,不同的证据”。
Guides & Insights

Aion 3.5 Mini 与 Gemma 4 12B:一个有记分牌,一个有价格标签

作者

Gideon Frost

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

Aion 3.5 Mini 和 Gemma 4 12B 只在一个方面属于同一类采购:两者都是如今可以通过 API 调用的小型模型。AionLabs 于 2026 年 9 月 23 日发布 Aion 3.5 Mini,这是一个闭源、纯文本的多模型系统,输入每百万 token 收费 0.70 美元,输出每百万 token 收费 1.40 美元。DeepMind 于 2026 年 6 月 3 日发布 Gemma 4 12B,这是一个拥有 119.5 亿参数的开源权重模型,采用 Apache 2.0 许可,具备无编码器的多模态输入路径,并公布了评估卡。实际的差别不在于参数数量或定价那一行。而在于:其中一个模型可以在你做出承诺之前先被测量,另一个则完全无法测量。

下文关于 Aion 3.5 Mini 的所有内容,均来自 AionLabs 自己发布的模型列表及其 API 上的服务配置。关于 Gemma 4 12B 的所有内容,均来自厂商的模型卡——其数字正源于此——以及实际运行过它的第三方评估工具。若某项数据为厂商报告,则会如此标注。目前没有任何针对任何 Aion 模型的独立评估,这一点是作为事实陈述,而非作为免责说明。

在两者真正吻合之处

比“小模型”这个标签所暗示的要少,而那些确实对得上的地方值得精确说明,因为它们是买家最先核查的。

• 上下文 — Aion 3.5 Mini 拥有 262,144 个 token。Gemma 4 12B 拥有 256K 的上下文窗口。名义上二者不分伯仲,而实际上两者都足够大,上下文并非决定性因素。

• 最大输出——Aion 3.5 Mini 将单次响应限制在 32,768 个 token,这一上限在整个 Aion 产品系列中是通用的。Gemma 4 12B 在其说明卡上并未公布等效的单一数值上限,因此这一项你只能通过测试、而非阅读来确认。

• 工具调用——两者都支持。Aion 3.5 Mini 在兼容 OpenAI 的端点上接受工具定义、JSON 响应格式和温度参数。Gemma 4 12B 的指令微调版内置了函数调用功能。

• 推理控制——Aion 3.5 Mini 在每次调用时都会进行推理,并公开三档努力级别:max、high 和 low,其中 high 为默认值;推理并非可选功能。Gemma 4 12B 提供推理和非推理两种变体,二者在同一测试框架上的得分不同,因为它们所做的工作量不同。

• 输入模态 —— 这是它们明显分道扬镳的第一点。Aion 3.5 Mini 是文本输入、文本输出,其架构未声明支持图像输入。Gemma 4 12B 接受文本、图像、音频和视频输入,并返回文本。

Gemma 4 12B 能向你展示什么

Gemma 4 12B 附带一张厂商评估卡,上面的数字是厂商自行报告的,而非独立复现的——但它们确实存在,具体明确,并且覆盖了买家真正会争论的那些维度。

• 厂商报告的推理与知识 — MMLU Pro 77.2、GPQA Diamond 78.8、HLE(无工具)5.2、BigBench Extra Hard 53.0、MMMLU 83.4。

• 厂商自报编码 — LiveCodeBench v6 72.0,Codeforces ELO 1659,AIME 2026 不使用工具 77.5。

• 厂商报告的智能体能力 — Tau2 三次运行平均为 69.0,而 Codeforces ELO 再次成为榜单上最强的单项表现。

• 厂商报告的多模态成绩——MMMU Pro 69.1、MATH-Vision 79.7、MedXPertQA MM 48.7。该卡片未列出 DocVQA 一项;最接近的文档类数据是 OmniDocBench 1.5 平均编辑距离 0.164。

• 长上下文召回——MRCR v2,8-needle,128k,43.4。这是这份参数表上实打实的短板,在你认定 256K 窗口在远端也能像 256K 窗口那样表现之前,这一点值得先读一读。

• 第三方测量 — Artificial Analysis 在其自有测试框架上将 Gemma 4 12B 列为推理智能指数(Reasoning Intelligence Index)14、非推理指数(Non-reasoning Index)9,推理模式下输出速度约为每秒 113 个 token,标价为每百万 token 输入 $0.10、输出 $0.30。指数会随快照版本发生修订,因此应将指数视为方向性参考,而价格和速度则是更持久的指标。

A screenshot of the Hugging Face model card for google/gemma-4-12b, showing the model blurb 'Google | Gemma 4 | 12B | Apache 2.0 | Text, Image, Audio, Video -> Text | 256K context' and the description that Gemma 4 models are multimodal, handling text and image input and generating text output.

Aion 3.5 Mini 能为您展示什么

一个价格、一个窗口、一段架构描述,别无其他。AionLabs 未在其产品目录中的任何模型上公布 SWE-bench Verified、Terminal-Bench、GPQA 或 MMLU-Pro 的数值,3.5 发布材料中也完全没有基准测试表。Artificial Analysis 没有 Aion 3.5 Mini、Aion 3.5、Aion 3.0 或 Aion 3.0 Mini 的页面——这四者均未出现在模型索引中。

这种缺席并不自动意味着有问题,将其呈现为有问题也是错误的。AionLabs 将其模型描述为专为叙事和讲故事工作打造的多模型系统,采用协作式生成流程,由多个专门化模型各自对回答做出贡献。上述综合指数由数学、代码和经济任务汇编而成——用它们来评判散文是错误的工具。一个模型可以真正擅长其被打造用于的工作,却在编程排行榜上得分很差,或者从未被列入排行榜。

这种缺失真正意味的东西更窄、也更难:你无法算出每完成一项任务的成本。Aion 3.5 Mini 的 0.70 美元和 1.40 美元是标价,没有可测量的分母。Gemma 4 12B 的 0.10 美元和 0.30 美元则附有一个可测量的分母,而测出这个分母的同一套测试框架也会报告每项任务的成本。这就是那种不对称,而无论人们如何争论这些基准测试选得对不对,它都依然成立。

价格差距比能力差距可能达到的幅度更大

把两份价目表并排放在一起,这个决策的形态就变了。Aion 3.5 Mini 每百万输入 token 收费 0.70 美元,每百万输出 token 收费 1.40 美元。Gemma 4 12B 在对其进行测评的第三方测试平台上标价为输入 0.10 美元、输出 0.30 美元。也就是说,输入费率是它的七倍,输出费率约为它的四倍半,而这个模型自家厂商并未公布任何可供你对照比较的评分。

有两件事让直接相乘变得复杂,而这两件事都进一步有利于 Gemma 4 12B。首先,Aion 3.5 Mini 在每次调用时都会进行推理,因此输出行会携带你并未要求且无法设定上限的 token——AionLabs 并未发布任何声明,说明该模型在其三个努力级别中的任一档思考时会花掉多少 token。Gemma 4 12B 允许你关闭思考步骤,这会同时改变账单和延迟。其次,Gemma 4 12B 是在 Apache 2.0 下的开放权重,因此 0.10 美元和 0.30 美元只是若干选项之一,而不是运行它的唯一方式。

这些都无法断定哪个模型写得更好,因为没有人从这一维度衡量过二者中的任何一个。但它确实能断定哪一个可以拿给利益相关者看。

将两者一起运行

这里有用的做法并不是二选一。Aion 3.5 Mini 和 Gemma 4 12B 位于不同的接口之后,但遵循同一种调用约定——AionLabs 暴露了一个兼容 OpenAI 的端点,而 Gemma 4 12B 则由常见的兼容 OpenAI 的运行时提供服务。这使得它们在 base URL 层面可以互换,从而让构建链条的成本很低:先用 Aion 3.5 Mini 处理那些你调用它正是为了其集成组合的提示,再用 Gemma 4 12B 兜底处理其他所有场景——在这些场景中,你想要的是一个审慎克制的模型、一个可切换的思考步骤,以及一份仅为四分之一大小的价目表。

用一个密钥接入数百个模型的网关,正是它让这条链路变成一行配置,而不是第二套集成;它也是故障转移规则真正发挥价值的地方——429 或供应商中断会在响应开始之前就被吸收,而不会以任务失败的形式暴露出来。当供应商调整价目表时,透传路由器按供应商的标价计费,每个 token 不加价,因此变动当天就会生效,而不必等到下一个计费周期。有一个细节值得核实而非想当然:Aion 3.5 Mini 和 Gemma 4 12B 并非在所有承载这一规模模型的平台上都能使用,Gemma 4 12B 尤其缺席于一些收录了其更大体量兄弟型号的目录。在接入之前,先确认该标识符能够解析。

A screenshot of AionLabs' own documentation site, the Introduction / LLM API page, showing that the vendor serves its models through an OpenAI-compatible REST API at https://api.aionlabs.ai/v1 supporting chat completions and model discovery, with API-key authentication and a signed-in browser workspace for testing prompts.

如何决定

• 如果你在拍板之前需要一个数字——Gemma 4 12B。它是这两者中唯一有公开评测卡和第三方指数的,而且评测早于你的决策,而不是紧随其后。

• 如果你需要图像、音频或视频输入——Gemma 4 12B。Aion 3.5 Mini 声明仅支持文本到文本,别无其他。

• 如果你需要真正拥有这个东西——Gemma 4 12B。Apache 2.0 权重意味着你可以对它进行微调、量化或自行托管;Aion 3.5 Mini 则是闭源系统,没有可供下载的权重。

• 如果叙事和长篇散文就是全部任务——这是比较唯一无法替你做出判断的情形。Aion 3.5 Mini 就是为这类工作而打造的,而 Gemma 4 12B 则是作为通用模型构建的,没有任何已公布的数字能告诉你哪个写得更好。不妨在一条你输得起的路径上试试它。

• 如果以每个完成任务的成本作为决定标准——仅从算术上看,Gemma 4 12B 胜出,而且任务越依赖输出 token,差距就越大。

两个模型都很新,且都已上线,但只有其中一个要求你仅凭它的一面之词就相信它。站得住脚的总结是:Gemma 4 12B 是可量化的默认选择,而 Aion 3.5 Mini 是你特意采用的专业型方案,不是通过对比来选的——如果你确实要采用它,应当把它与一个后备方案并用,而不是用它取代后备方案。

A generated scoreboard comparing Aion 3.5 Mini and Gemma 4 12B across six rows: published scores (none vs vendor card), price in / out ($0.70 / $1.40 vs $0.10 / $0.30), context (262,144 vs 256K), inputs (text only vs text, image, audio, video), weights (closed vs Apache 2.0) and reasoning (mandatory, 3 levels vs switchable off). Footnoted that Aion figures are unaudited and vendor-published and that Gemma figures are vendor-reported with the index per Artificial Analysis.