一张图解式标题卡,主题为“Tiny Aya Base 32K vs Tiny Aya En-Thinker”。两张圆角卡片并排摆放,从左到右由标有“后训练”的箭头连接。左侧卡片“Tiny Aya Base 32K”带有两行文字:“预训练基座”和“无聊天模板”;右侧卡片“Tiny Aya En-Thinker”带有“后训练”和“包含思考模式”。两者下方居中一行写着“相同的3.35B架构,相同的32K窗口”。OrcaRouter徽标合成在右下角。
Guides & Insights

Tiny Aya Base 32K vs Tiny Aya En-Thinker:父子关系,而非竞争对手

作者

Rowan Sterling

发布日期

最新模型 · 20查看全部模型
基准测试:Artificial Analysis · 每日更新
返回全部文章

两个 Hugging Face 仓库,各有四个 safetensors 分片,分片大小逐字节完全一致 — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792。Tiny Aya Base 32KTiny Aya En-Thinker并不是两个实验室对同一问题的答案。它们是同一 3.35B Cohere2 架构的两个不同阶段,Cohere Labs 自己的模型卡也明确写道:基础检查点"用作 Tiny Aya L2-Thinker 和 Tiny Aya En-Thinker 的基础模型"。

这使得通常的正面交锋式对比框架是错误的。你并不是在两个相互竞争的3B多语言模型之间做选择,而是在一个起点和一个成品之间做选择——有趣的问题在于,两者之间的后训练步骤究竟带来了什么、代价是什么,以及考虑到二者都受同一非商业许可约束、且均未发布任何基准测试,它们是否有一个适合你心中的用途。

决定关系的那一句话

通常,“vs”对比文章需要从架构和参数数量来推断两个检查点之间的关系。而在这里,你不需要这样做。

Tiny Aya Base 32K 的模型卡直白地说明了这一点,而且这句话值得仔细阅读,因为它所在的位置——不在脚注中,而是在模型摘要中,介于检查点描述和开发者致谢之间:

“这是一个基础预训练模型,尚未经过指令微调或偏好对齐。该检查点用作 Tiny Aya L2-Thinker 和 Tiny Aya En-Thinker 的基础模型。

这之所以值得单独写一段,是因为它暴露出的不一致性。En-Thinker 自己的模型卡并未提到 Base 32K。其结尾一行将读者引向“tiny-aya-global、tiny-aya-base、tiny-aya-l2-thinker”——而tiny-aya-base是 2 月份的检查点,文档标注的上下文为 8K,并非那个自称是 En-Thinker 父模型的 32K 变体。En-Thinker 在自己的卡片上声称支持 32K。一个模型不可能通过后训练获得比预训练时宽四倍的上下文窗口。所以 8K 基础模型从来就不可能是答案,而 32K 基础模型的宣称才符合算术逻辑,En-Thinker 自己的指引反而不符合。

可能的解释平淡无奇:Base 32K 于 2026 年 9 月 8 日上传,六天晚于 Thinkers,因此 En-Thinker 的卡片是在其父级存在之前编写的,此后一直没有更新。这是根据时间戳推断的,而非厂商声明——但这是所需假设最少的解读,而且意味着该系列中最新的文档信息量最大。

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

逐个维度

以下内容是两张卡片所陈述的内容(已去重)——两者均为 3.35B、BF16、仅文本、Cohere2ForCausalLM、CC-BY-NC-4.0、gated(门控访问),且未经过基准测试。

• 阶段 — Tiny Aya Base 32K 是一个预训练基础模型,"未经指令微调或偏好对齐";Tiny Aya En-Thinker 则在带有英语推理轨迹的多语言推理数据上进行了后训练。

• 聊天模板 — Base 32K 完全不附带 chat_template.jinja;En-Thinker 则附带了一个,其模型卡用整整一节来介绍它如何渲染对话轮次。

• 提示风格 — Base 32K 自己的示例是补全(prompt = "The capital of Spain is");En-Thinker 期望 apply_chat_template(),并传入消息列表。

• 推理模式 — Base 32K 没有推理模式;En-Thinker 是双模式的,默认附加 /think 并生成英文思考轨迹,或 /no_think 配合 enable_thinking=False 以获得直接回答。

— 语言范围 — Base 32K 的卡片声称训练覆盖 70+ 种语言,并明确列出了 67 种;En-Thinker 覆盖“44 种语言加英语”,带有英语推理轨迹,并通过额外的非推理指令数据扩展到 20+ 种以上。

• 架构足迹 — 完全相同。四种分片大小相同,参数数量相同,配置文件长度相同。

• 上下文 — 两张卡上均为32K输入加输出。两者都无法验证:两种配置都位于许可证门之后。

• 基准测试 — 两张卡均无任何基准测试结果。目前没有任何第三方对这两个模型进行过评测。

• 势头 — Base 32K 显示零次下载和一个点赞;En-Thinker 显示七次下载和两个点赞。两者均未出现在推理提供商的目录中。

后训练步骤带来了什么

三件事,全都是行为层面的,而非结构层面的。

第一个是可用的界面。没有聊天模板的检查点不是你能直接提示的模型,而是供你继续训练的模型。你与 Base 32K 的每次对话都必须自己序列化为文本,模型卡也明确说明了这一点:"提示应使用文本补全,而不是聊天模板。在将其部署为对话助手之前,建议进行额外的后训练。" En-Thinker 已经替你做了这个决定,甚至连 token 布局都安排好了。

第二点是推理作为一种开关。En-Thinker 的/think/no_think模式让相同的权重要么在思维标签之间产生可见的思维链,要么直接回答;卡片还记录了将先前的思维块作为助手回合传回对话。这是训练后的产物——基础检查点中没有任何东西会对此作出响应。

第三点则是 {{1}}En-Thinker{{/1}} 的核心设计押注:即使问题和答案使用另一种语言,推理也会以英语进行。模型卡明确指出,这一点使其有别于 {{2}}Tiny Aya L2-Thinker{{/2}},后者{{3}}"使用与提示相同的语言进行思考。"{{/3}} 以高资源语言规划、再以低资源语言作答是否确实有帮助,仍是一个开放的研究问题;{{1}}En-Thinker{{/1}} 的存在是为了让人们检验这一点,而非给出定论。{{4}}Base 32K{{/4}} 完全没有推理模式,对这个问题不置一词——而这恰恰使它成为任何试图回答该问题之人的合适对照组。

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

后训练步骤的成本是多少

诚实的答案是,没有人能够量化它,因为两个模型都没有经过任何评估。但这两张卡片放在一起暗示了权衡所在之处,而它并不在你预期的地方。

这不是语言覆盖范围的问题。En-Thinker 狭窄的、仅覆盖 44 种以上英语的推理范围是其推理训练数据的一个属性,而且模型卡称覆盖范围通过“额外的非推理指令数据”扩展到了 20 多种其他语言——因此模型仍然能处理这些语言,只是没有思考路径。这也不是上下文窗口的问题;两者都声称是 32K。

这是行为广度的问题。Base 32K 的模型卡将“持续预训练、指令微调,以及多语言和长上下文语言建模研究”列为预期用途,并明确将多语言文本生成、摘要、翻译和跨语言适配列为下游应用。En-Thinker 的模型卡范围更窄:“数学、科学和通用推理任务,以及指令遵循和多语言开放式生成。”后训练检查点带有基础检查点所不具备的特定倾向,而 Base 32K 模型卡标记的局限性——“思维链推理任务(如多语言数学)相对较弱”——正是后训练旨在修复的弱点。

所以这个家族读起来是一种分工,而非竞争。基础卡宽广而未完成;En-Thinker 狭窄而完成;而基础卡自身的文本也直言不讳——它正是两位 Thinker 被塑造而成的基底。

许可证才是真正具有约束力的限制。

两个模型都采用CC-BY-NC-4.0许可,并叠加了Cohere Labs的可接受使用政策;两者都位于同一道门禁之后,要求你在下载文件前接受条款并注册;同时,商业问题都被引导至Cohere Sales。

这一点值得在任何技术比较之前说明,因为它对很大一部分读者来说决定了问题的答案。如果计划是商业产品,那么在没有与 Cohere 沟通的情况下,两个检查点都不是候选,无论多长的上下文行为或多灵活的推理模式都不会改变这一点。在非商业用途确实没问题的情况下——学术工作、内部研究、基准测试框架、与自己模型的比较——许可证无关紧要,技术选择就是全部决定。

两者都未经过基准测试。以下是如何做出选择的方法。

缺乏数据是真实存在的问题,靠更仔细地阅读也无法解决。两张规格卡都没有任何性能声明,也没有任何排行榜将这两款模型列入其中,而且两者背后都没有推理服务提供商——也就是说,没有任何提供商公布通常会替代基准测试的吞吐量或定价。你能做的是在结构上挑毛病,这方面的证据是确凿的。

• 如果您打算进行训练,请选择 Tiny Aya Base 32K。该模型卡说明其用途是在多语言 3.35B 模型之上进行继续预训练、指令微调或领域自适应,而使用基础检查点意味着您不必与并非自己选择的后训练方案作斗争。32K 窗口还支持 2 月份 8K 基础版本无法支持的长上下文研究。

• 如果您今天想进行提示,请选择 Tiny Aya En-Thinker。它是这两者中唯一能进行对话的,也是唯一具有推理模式的。

• 如果问题是科学性的而非实用性的,就两者都选。这对模型构成了受控对比——相同的架构、相同的规模、相同的窗口,主要区别在于是否进行了后训练——用于探究英文推理轨迹能否改善多语言回答。这正是 En-Thinker 发布出来让人们探究的问题,而它的父模型是最干净的基线。

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

关于评估这两者,有一个实用的提示:它们都是未经证实的研究检查点,没有部署历史,而且 6.7 GB 的 BF16 下载外加 GPU 时间,花在一款从未被独立运行过的模型上,是一笔实实在在的开销。与其为每个候选模型分别部署权重,不如通过单一端点运行该对比,这样更便宜——OrcaRouter 提供一个 API 背后的 195 个模型对提供商目录价格 0% 加价,并在各提供商之间自动故障转移,因此,一个你仅仅是在测试的研究检查点永远不会进入生产路径。Tiny Aya 不在其中,我们也不托管它;关键在于,那些你要拿它来对比的模型大多都在其中。

什么能解决这个问题?

有两件事,对Cohere Labs来说发布都很便宜,但对其他任何人来说制作都很昂贵。

第一项是基准测试——任何基准测试都可以。只要在两个检查点上运行一次多语言推理评估,就能将整个系列从“纸面声称”变为“实测验证”,并立即回答:英语思维设计是否胜过未经后训练的同一模型——这正是此次发布围绕的研究问题。

第二项是一个配置文件。由于仓库设有访问限制,这两张卡上关于32K的声明都无法验证;而且,真正意义上的长上下文预训练运行与对8K检查点应用位置编码扩展,这两者之间的差异在实践中十分显著,即便两者都会产生一个能接受32K token的模型。打开这两个配置文件就能弥合这一差距,这是任何营销文案都无法做到的。

在那之前,对“Tiny Aya Base 32K还是Tiny Aya En-Thinker”的准确回答是:比较是真实的,但竞赛并不存在。相同的权重、相同的窗口、相同的许可证、所有未下载过它们的人都同样沉默——只是其中一个带有聊天模板和思考标签,而另一个则是它所由来的那个。