一張圖表式標題卡,用於「Tiny Aya Base 32K 對比 Tiny Aya En-Thinker」。兩張圓角卡片並排,由一支標示「後訓練」的箭頭從左到右連接。左邊的卡片「Tiny Aya Base 32K」帶有以下文字:「預訓練基礎模型」與「無聊天模板」;右邊的卡片「Tiny Aya En-Thinker」帶有「已後訓練」與「包含思考模式」。兩張卡片下方置中一行文字寫著「相同 3.35B 架構,相同 32K 視窗」。OrcaRouter 標誌合成於右下角。
Guides & Insights

Tiny Aya Base 32K 對比 Tiny Aya En-Thinker:親子關係,而非競爭對手

作者

Rowan Sterling

發佈日期

最新模型 · 20查看全部模型
基準測試:Artificial Analysis · 每日更新
返回全部文章

兩個 Hugging Face 儲存庫,各含四個 safetensors 分片,而且分片大小連一個位元組都不差——1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792。Tiny Aya Base 32KTiny Aya En-Thinker並不是兩間實驗室對同一個問題給出的兩種答案。它們是同一套 3.35B Cohere2 架構,只是處於兩個不同階段,而且 Cohere Labs 自家的模型卡也直言不諱:基礎檢查點「被用作 Tiny Aya L2-Thinker 與 Tiny Aya En-Thinker 的基礎模型」。

這使得常見的正面對決式框架並不正確。你不是在兩個互相競爭的 3B 多語言模型之間做選擇,而是在一個起點與一個完成品之間做選擇——而真正有趣的問題是:兩者之間的後訓練步驟究竟換來了什麼、付出了什麼代價,以及在兩者都受同一非商業授權限制、且都沒有任何已發表基準測試的情況下,兩者中是否有任何一個能用於你心中所設想的用途。

決定關係的那一句話

通常一篇「vs」文章必須從架構與參數量推斷兩個檢查點之間的關係。在這裡,你不必這麼做。

Tiny Aya Base 32K 的卡片直截了當地說明了這一點,而這句話所在的位置值得仔細閱讀——它不在註腳裡,而是在模型摘要中,位於檢查點描述與開發者名單之間:

「這是一個基礎預訓練模型,尚未經過指令微調或偏好對齊。此檢查點用作 Tiny Aya L2-Thinker 與 Tiny Aya En-Thinker 的基礎模型。

這件事之所以值得花一整段來談,是因為它暴露出的前後矛盾。En-Thinker 自己的模型卡並沒有點名 Base 32K。它的結尾一句把讀者引向「tiny-aya-global、tiny-aya-base、tiny-aya-l2-thinker」——而 tiny-aya-base 是二月的檢查點,記載為 8K 上下文,並非那個自稱是 En-Thinker 母模型的 32K 版本。En-Thinker 在自己的模型卡上宣稱 32K。一個模型不可能透過後訓練,被拓展到比它預訓練時寬四倍的視窗。所以那個 8K 基礎模型根本不可能會是答案,而 32K 基礎模型的說法符合這套算術,En-Thinker 自己指出的那個對象則不然。

最可能的解釋很平淡:Base 32K 是在 2026 年 9 月 8 日上傳的,晚於Thinkers 六天,因此 En-Thinker 的卡片是在其母體存在之前寫成的,此後便未再更新。這是從時間戳推斷而來,並非廠商說法——但這是所需假設最少的解讀,也意味著這個家族裡最新的文件正是資訊最豐富的一份。

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

逐維度地

以下內容是這兩張模型卡所述的內容,扣除重複的部分——兩者皆為 3.35B、BF16、純文字、Cohere2ForCausalLM、CC-BY-NC-4.0、須經審核,且未經基準測試。

• 階段 — Tiny Aya Base 32K 是一個預訓練基礎模型,「未經指令微調或偏好對齊」;Tiny Aya En-Thinker 是在多語言推理資料上進行後訓練,並帶有英語推理軌跡。

• 聊天模板 — Base 32K 完全不附帶 chat_template.jinja;En-Thinker 有附帶一個,而它的模型卡用了整整一節說明它如何渲染對話輪次。

• 提示風格 — Base 32K 本身的範例是補完成(prompt = "The capital of Spain is");En-Thinker 則預期使用 apply_chat_template(),並搭配訊息清單。

• 推理模式 — Base 32K 沒有推理模式;En-Thinker 為雙模式,會附加 /think作為預設,並以英文輸出思考軌跡,或/no_think搭配enable_thinking=False以直接取得回答。

• 語言範圍 — Base 32K 的模型卡聲稱在 70 多種語言上進行訓練,並明確列出 67 種;En-Thinker 涵蓋「44 種語言加上英文」,並具備英文推理軌跡,透過額外的非推理指令資料再擴展到 20 多種語言。

• 架構足跡 — 完全相同。相同的四個分片大小、相同的參數數量、相同的設定檔長度。

• 情境 — 兩張卡上的輸入加輸出皆為 32K。兩者皆無從驗證:兩組配置都位於授權閘門之後。

• 基準測試 —— 兩張卡上都沒有。這兩個模型都沒有任何第三方評估。

• 關注度——Base 32K 顯示零次下載、一個讚;En-Thinker 顯示七次下載、兩個讚。兩者皆未出現在推論服務供應商的型錄中。

後訓練步驟換來了什麼

三件事,全都是行為層面的,而非結構層面的。

第一個是可用的介面。沒有對話範本的檢查點,不是讓你下提示的模型;而是讓你續寫的模型。你與 Base 32K 進行的每一段對話,都必須由你自己序列化成文字,而模型卡也這麼說:「提示應使用文字補全,而非對話範本。在將它部署為對話助理之前,建議先進行額外的後訓練。」En-Thinker 已經替你做了那個決定,甚至連 token 配置都幫你決定好了。

第二點是把推理當成一個開關。En-Thinker 的 /think/no_think模式讓同一組權重能在思考標籤之間產生可見的思維鏈,或直接作答,而模型卡也記載了將先前的思考區塊以助理回合的形式傳回對話中的做法。那是後訓練階段的產物——基礎檢查點裡沒有任何部分會對它產生反應。

第三項是 En-Thinker 的核心設計賭注:推理以英文進行,即使問題與答案使用另一種語言。說明卡明確指出,這使它有別於 Tiny Aya L2-Thinker,「後者以與提示相同的語言思考」。以高資源語言規劃、卻用低資源語言回答,是否真的有所幫助,仍是一個開放的研究問題;En-Thinker 的存在是為了讓人測試這件事,而不是為它下定論。Base 32K 完全沒有推理模式,因此對這個問題不置一詞——這正是它會是任何想回答此問題者理想對照組的原因。

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

訓練後步驟的成本是什麼

誠實的答案是,沒有人能將它量化,因為這兩個模型都沒有在任何事物上受過評估。但這兩張卡放在一起,暗示了取捨存在於何處,而那並不是你會預期的地方。

這不是語言覆蓋範圍的問題。En-Thinker 那套以英文為主、僅涵蓋 44 種以上語言的狹隘推理範圍,是其推理訓練資料的一項特性,而說明卡上寫著覆蓋範圍可「透過額外的非推理指令資料」延伸至另外 20 多種語言——所以模型仍能處理這些語言,只是少了思考路徑。這也不是脈絡視窗的問題;兩者都聲稱支援 32K。

這是行為廣度的差異。Base 32K 的模型卡將「持續預訓練、指令微調,以及多語言與長脈絡語言模型研究」列為預期用途,並把多語言文本生成、摘要、翻譯與跨語言適應全數列為下游應用。En-Thinker 的模型卡則較為狹窄:「數學、科學與一般推理任務,以及指令遵循與多語言開放式生成。」後訓練檢查點帶有主觀取向,這是基礎檢查點所沒有的;而 Base 32K 模型卡所點出的限制——「諸如多語言數學之類的思維鏈推理任務相對較弱」——正是後訓練著手修正的弱點。

所以這個家族讀起來更像是一套分工,而不是一場競爭。基礎版本廣泛而尚未完成;En-Thinker 狹窄而已完成;而基礎卡本身的文字也道出了它的本質——兩個 Thinkers 都是從這個基底形塑出來的。

授權條款才是真正具有約束力的限制。

兩個模型皆採用 CC-BY-NC-4.0,並額外疊加 Cohere Labs 的 Acceptable Use Policy;兩者都位於同一道閘門之後,要求你在檔案下載前接受條款並註冊;而且兩者都會將商業相關問題轉給 Cohere Sales。

在任何技術比較之前,這點值得先說明,因為它為很大一部分讀者決定了這個問題。如果計畫是商業產品,在未與 Cohere 洽談之前,這兩個檢查點都不是候選方案,而再多的長上下文行為或推理模式彈性也改變不了這一點。若非商業用途確實沒問題——學術工作、內部研究、基準測試工具、與自家模型的比較——授權條款就無關緊要,技術選擇便是全部的決定因素。

兩者都尚未經過基準測試。以下仍說明該如何選擇。

數字的缺席是真實的,而且不會因為讀得更仔細就得到解決。兩張卡都沒有提出任何效能宣稱,沒有任何排行榜列出其中任何一個模型,兩者背後也都沒有推論供應商——這意味著沒有供應商公布通常用來替代基準測試的吞吐量或定價。你能做的是針對結構挑毛病,而那裡的證據很紮實。

• 如果你要進行訓練,請選擇 Tiny Aya Base 32K。以一個多語言 3.35B 模型為基礎進行持續預訓練、指令微調或領域調適,正是模型卡所說明的用途;而從基礎檢查點開始,意味著你不必對抗並非由你選擇的後訓練。32K 視窗也支援 8K February base 無法支援的長上下文研究。

• 如果你想在今天下提示,請選擇 Tiny Aya En-Thinker。它是兩者之中唯一能進行對話的,也是唯一具備推理模式的。

• 如果問題是科學性的而非實用性的,就兩者都選。這一對是受控比較——相同架構、相同規模、相同視窗,主要差別在於是否做過後訓練——用來探究英文推理軌跡是否能改善多語言答案。這正是 En-Thinker 發布時要讓人們探究的問題,而它自己的母模型就是最乾淨的基準。

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

關於評估這兩者的實用提醒:它們是未經驗證的研究檢查點,沒有部署紀錄,而下載 6.7 GB 的 BF16 模型再加上 GPU 時間,對一個從未獨立執行過的模型來說是實實在在的成本。透過單一端點來執行這項比較,而不是為每個候選項目架設權重,會更便宜——OrcaRouter 在單一 API 背後提供 195 個模型,並有供應商定價的 0% 加價,以及供應商之間的自動容錯移轉,因此你只是拿來測試的研究檢查點永遠不會位於正式環境路徑上。Tiny Aya 不在其上,我們也不代管它;重點只是,你會拿來與它對照測試的模型大多都在上面。

「什麼能解決這件事?」

有兩件事,而這兩件事對 Cohere Labs 來說發布成本很低,但對其他任何人來說,要產出卻所費不貲。

第一個就是基準測試——任何基準測試都行。只要在兩個檢查點上跑一次多語言推理評估,就能讓整個系列從「卡片上寫的」變成「實測出來的」,而且它能立刻回答一個問題:這種英語思考的設計,是否勝過同一個未經後訓練的模型——而這正是這次發布所圍繞的研究問題。

第二個是設定檔。在儲存庫受到權限管制的情況下,兩張卡上關於 32K 的宣稱都無法驗證;而真正進行長上下文預訓練,與把位置編碼擴充套用到 8K 檢查點,兩者在實務上有很大差異,即使兩者都產出能接受 32K 詞元的模型。打開那兩個設定檔,就能以任何行銷文案都辦不到的方式消弭這個落差。

在那之前,對「Tiny Aya Base 32K 還是 Tiny Aya En-Thinker」的準確答案是:這個比較確有其事,但這場競賽並不成立。相同的權重、相同的上下文視窗、相同的授權條款,以及所有尚未下載它們的人同樣的沉默——其中一個只是有對話範本和思考標籤,另一個則是它被製作時所依據的來源。