Una scheda di titolo in stile diagramma per 'Tiny Aya Base 32K vs Tiny Aya En-Thinker'. Due schede arrotondate sono affiancate, unite da sinistra a destra da una freccia etichettata 'post-addestramento'. La scheda a sinistra, 'Tiny Aya Base 32K', riporta le righe 'base pre-addestrata' e 'nessun template di chat'; la scheda a destra, 'Tiny Aya En-Thinker', riporta 'post-addestrata' e 'modalità di pensiero inclusa'. Una riga centrata sotto entrambe recita 'stessa architettura da 3.35B, stessa finestra da 32K'. Il logo OrcaRouter è composto nell'angolo in basso a destra.
Guides & Insights

Tiny Aya Base 32K vs Tiny Aya En-Thinker: Genitore e Figlio, Non Rivali

Autore

Rowan Sterling

Data di pubblicazione

Ultimi modelli · 20Vedi tutti i modelli
Benchmark: Artificial Analysis · aggiornato ogni giorno
Torna a tutti gli articoli

Due repository Hugging Face, quattro shard safetensors ciascuno, e le dimensioni degli shard coincidono al byte — 1.998.698.496 / 1.996.494.056 / 1.996.494.088 / 708.852.792. Tiny Aya Base 32K e Tiny Aya En-Thinker non sono le risposte di due laboratori alla stessa domanda. Sono la stessa architettura Cohere2 da 3,35B in due fasi diverse, e la model card di Cohere Labs lo dice apertamente: il checkpoint base "è usato come modello base per Tiny Aya L2-Thinker e Tiny Aya En-Thinker".

Questo rende sbagliata la consueta impostazione basata sul confronto diretto. Non stai scegliendo tra due modelli multilingue da 3B in competizione. Stai scegliendo tra un punto di partenza e uno finito — e la domanda interessante è che cosa abbia effettivamente apportato il passaggio di post-addestramento tra i due, quanto sia costato, e se l'uno o l'altro sia utilizzabile per ciò che hai in mente, dato che entrambi sono soggetti alla stessa licenza non commerciale e nessuno dei due ha un singolo benchmark pubblicato.

L'unica frase che mette a posto la relazione

Normalmente un pezzo "vs" deve dedurre la relazione tra due checkpoint dall'architettura e dal numero di parametri. Qui non devi farlo.

La card di Tiny Aya Base 32K lo afferma chiaramente, e vale la pena leggerlo con attenzione per via di dove si trova la frase — non in una nota a piè di pagina, ma nel riepilogo del modello, tra la descrizione del checkpoint e i crediti degli sviluppatori:

"Questo è un modello base preaddestrato e non è stato sottoposto a instruction tuning né allineato alle preferenze. Questo checkpoint viene utilizzato come modello base per Tiny Aya L2-Thinker e Tiny Aya En-Thinker."

Ciò che lo rende meritevole di un paragrafo è l'incoerenza che mette in luce. La scheda di En-Thinker non nomina Base 32K. La sua riga finale indirizza i lettori a "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — e tiny-aya-base è il checkpoint di febbraio, documentato con contesto a 8K, non la variante a 32K che dichiara di essere il genitore di En-Thinker. En-Thinker rivendica 32K sulla propria scheda. Un modello non può essere post-addestrato fino a una finestra quattro volte più ampia di quella con cui è stato pre-addestrato. Quindi la base a 8K non sarebbe mai stata la risposta, e l'affermazione della base a 32K è coerente con l'aritmetica, mentre il puntatore di En-Thinker stesso non lo è.

La spiegazione probabile è banale: Base 32K è stato caricato l'8 settembre 2026, sei giorni dopo i Thinkers, quindi la scheda di En-Thinker è stata scritta prima che esistesse il suo genitore e non è stata aggiornata da allora. Questa è un'inferenza basata sui timestamp, non una dichiarazione di un fornitore — ma è la lettura che richiede il minor numero di assunzioni, e significa che il documento più recente della famiglia è quello più informativo.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Dimensione per dimensione

Tutto ciò che segue è quanto affermano le due card, al netto della duplicazione — entrambi sono 3,35B, BF16, solo testo, Cohere2ForCausalLM, CC-BY-NC-4.0, ad accesso controllato e non benchmarkati.

• Fase — Tiny Aya Base 32K è una base preaddestrata, "non ottimizzata per le istruzioni né allineata alle preferenze"; Tiny Aya En-Thinker è post-addestrata su dati di ragionamento multilingue con tracce di ragionamento in inglese.

• Template di chat — Base 32K non fornisce alcun chat_template.jinja affatto; En-Thinker ne fornisce uno, e la sua scheda dedica un'intera sezione a come renderizza i turni.

• Stile di prompting — l'esempio proprio di Base 32K è il completamento (prompt = "The capital of Spain is"); En-Thinker si aspetta apply_chat_template() con una lista di messaggi.

• Modalità di ragionamento — Base 32K non ha una modalità di ragionamento; En-Thinker è a doppia modalità, aggiungendo /think per impostazione predefinita ed emettendo una traccia di pensiero in inglese, oppure /no_think con enable_thinking=False per una risposta diretta.

• Ambito linguistico — La scheda di Base 32K dichiara l'addestramento su oltre 70 lingue e ne nomina esplicitamente 67; En-Thinker copre "44 lingue più l'inglese" con tracce di ragionamento in inglese, estendendosi a oltre 20 altre attraverso ulteriori dati di istruzione non di ragionamento.

• Impronta architetturale — identica. Stesse quattro dimensioni di shard, stesso numero di parametri, stessa lunghezza del file di configurazione.

• Contesto — 32K di input più output su entrambe le schede. Nessuna delle due è verificabile: entrambe le configurazioni sono dietro il controllo della licenza.

• Benchmark — nessuno su nessuna delle due schede. Non esiste alcuna valutazione di terze parti di nessuno dei due modelli.

• Trazione — Base 32K mostra zero download e un like; En-Thinker mostra sette download e due like. Nessuno dei due compare nel catalogo di un fornitore di inferenza.

Cosa ha fruttato la fase di post-addestramento

Tre cose, tutte comportamentali anziché strutturali.

Il primo è un'interfaccia utilizzabile. Un checkpoint senza template di chat non è un modello a cui invii prompt; è un modello che continui. Ogni conversazione che hai con Base 32K deve essere serializzata in testo da te, e la scheda lo dice chiaramente: "i prompt dovrebbero usare il completamento di testo anziché un template di chat. Si raccomanda un ulteriore post-addestramento prima di distribuirlo come assistente conversazionale." En-Thinker ha già preso questa decisione per te, persino per quanto riguarda il layout dei token.

Il secondo è il ragionamento come interruttore. En-Thinker/think e /no_think che consentono agli stessi pesi di produrre una catena di pensiero visibile tra i tag di pensiero oppure di rispondere direttamente, e la scheda documenta il passaggio di un blocco di pensiero precedente di nuovo nella conversazione come turno dell'assistente. Questo è un artefatto di post-addestramento — non c'è nulla in un checkpoint di base che vi risponda.

Il terzo è la scommessa progettuale al centro di En-Thinker: che il ragionamento avvenga in inglese anche quando la domanda e la risposta sono in un'altra lingua. La scheda è esplicita nel dire che questo lo distingue da Tiny Aya L2-Thinker, "che pensa nella stessa lingua del prompt". Se pianificare in una lingua ad alte risorse e rispondere in una a basse risorse aiuti davvero è una questione di ricerca aperta, ed En-Thinker esiste per permettere alle persone di testarla, non per risolverla. Base 32K, non avendo alcuna modalità di ragionamento, tace sulla questione — ed è proprio per questo che rappresenta il controllo giusto per chiunque provi a rispondervi.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Quanto è costata la fase di post-addestramento

La risposta onesta è che nessuno può quantificarlo, perché nessuno dei due modelli è stato valutato su alcunché. Ma le due schede insieme lasciano intuire dove si annida il compromesso, e non è dove te lo aspetteresti.

Non è la copertura linguistica. La ristretta portata di ragionamento di En-Thinker, limitata a 44 lingue più l'inglese, è una proprietà dei suoi dati di addestramento al ragionamento, e la scheda afferma che la copertura si estende a oltre 20 altre lingue "tramite dati aggiuntivi di istruzione non di ragionamento" — quindi il modello le gestisce comunque, solo senza il percorso di pensiero. Non è nemmeno la finestra di contesto; entrambi dichiarano 32K.

È l'ampiezza del comportamento. La scheda di Base 32K elenca «pre-addestramento continuato, instruction tuning e ricerca sulla modellazione linguistica multilingue e a contesto lungo» tra gli usi previsti, indicando generazione di testo multilingue, sintesi, traduzione e adattamento interlinguistico come applicazioni a valle. La scheda di En-Thinker è più ristretta: «compiti di matematica, scienza e ragionamento generale, oltre a seguire istruzioni e generazione aperta multilingue». Un checkpoint post-addestrato esprime una precisa presa di posizione, cosa che un checkpoint di base non fa, e la limitazione segnalata dalla scheda di Base 32K — «I compiti di ragionamento a catena di pensiero, come la matematica multilingue, sono comparativamente più deboli» — è esattamente la debolezza che il post-training si proponeva di correggere.

Quindi la famiglia si legge come una divisione del lavoro più che come una competizione. La base è ampia e incompiuta; En-Thinker è ristretto e finito; e il testo stesso della scheda base la chiama per quello che è — il substrato da cui entrambi i Thinker sono stati plasmati.

La licenza è il vincolo che effettivamente vincola

Entrambi i modelli sono CC-BY-NC-4.0 con l'Acceptable Use Policy di Cohere Labs applicata in aggiunta, entrambi si trovano dietro lo stesso gate che chiede di accettare i termini e registrarsi prima del download dei file, ed entrambi indirizzano le domande commerciali a Cohere Sales.

Vale la pena affermarlo prima di qualsiasi confronto tecnico, perché decide la questione per una gran parte dei lettori. Se il piano è un prodotto commerciale, nessuno dei due checkpoint è una scelta possibile senza una conversazione con Cohere, e nessuna quantità di comportamento a contesto lungo o flessibilità della modalità di ragionamento cambia le cose. Laddove l'uso non commerciale sia davvero accettabile — lavoro accademico, ricerca interna, un'infrastruttura di benchmark, un confronto con il tuo modello — la licenza è irrilevante e la decisione è tutta nella scelta tecnica.

Nessuno dei due è stato sottoposto a benchmark. Ecco come scegliere comunque

L'assenza di numeri è reale e non sarà risolta leggendo con più attenzione. Entrambe le schede non contengono alcuna dichiarazione sulle prestazioni, nessuna classifica elenca l'uno o l'altro modello, e nessuno dei due ha un fornitore di inferenza alle spalle — il che significa che nessun fornitore ha pubblicato il throughput o i prezzi che di solito sostituiscono un benchmark. Quello che puoi fare è concentrarti sulla struttura, dove le prove sono solide.

• Scegli Tiny Aya Base 32K se intendi addestrare. Il continued pretraining, l'instruction tuning o un adattamento di dominio su un modello multilingue da 3,35B sono gli usi per cui la scheda dice che è pensato, e partire da un checkpoint base significa che non devi combattere contro un post-training che non hai scelto. La finestra da 32K supporta anche la ricerca su contesti lunghi, cosa che la base di febbraio da 8K non poteva fare.

• Scegli Tiny Aya En-Thinker se oggi vuoi promptare qualcosa. È l'unico dei due che sosterrà una conversazione, e l'unico che abbia in assoluto una modalità di ragionamento.

• Scegli entrambi se la domanda è scientifica piuttosto che pratica. La coppia è un confronto controllato — stessa architettura, stessa dimensione, stessa finestra, che differisce principalmente per il fatto che il post-addestramento sia avvenuto o meno — per chiedere se le tracce di ragionamento in inglese migliorano le risposte multilingue. Questa è la domanda che En-Thinker è stato rilasciato per permettere alle persone di sondare, e il suo stesso genitore è la baseline più pulita.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Una nota pratica sulla valutazione dell'uno o dell'altro: sono checkpoint di ricerca non comprovati, senza alcuna storia di deployment, e un download BF16 da 6,7 GB più il tempo di GPU rappresentano un costo reale da spendere per un modello che non è mai stato eseguito in modo indipendente. Eseguire quel confronto attraverso un unico endpoint anziché predisporre i pesi per ogni candidato è più economico — OrcaRouter offre 195 modelli dietro un'unica API con 0% di ricarico sui prezzi di listino dei provider e failover automatico tra provider, così un checkpoint di ricerca che stai soltanto testando non finisce mai su un percorso di produzione. Tiny Aya non è tra questi e non lo ospitiamo; il punto è solo che i modelli contro cui lo testeresti

{{1}}Cosa risolverebbe questo{{/1}}

Due cose, ed entrambe sono economiche da pubblicare per Cohere Labs e costose da produrre per chiunque altro.

Il primo è un benchmark — qualsiasi benchmark. Una singola valutazione di ragionamento multilingue eseguita su entrambi i checkpoint convertirebbe l'intera famiglia da "dichiarato sulla scheda" a "misurato", e risponderebbe immediatamente se il design di pensiero in inglese batte lo stesso modello senza post-addestramento, che è la domanda di ricerca attorno a cui è costruito il rilascio.

Il secondo è una configurazione. L'affermazione dei 32K su entrambe le schede non è verificabile finché i repository sono ad accesso limitato, e la differenza tra un addestramento preliminare autenticamente a contesto lungo e un'estensione della codifica posizionale applicata a un checkpoint da 8K è grande nella pratica, anche se entrambi producono un modello che accetta 32K token. Aprire i due file di configurazione colmerebbe quel divario in un modo che nessun testo pubblicitario può.

Fino ad allora, la risposta accurata a "Tiny Aya Base 32K o Tiny Aya En-Thinker" è che il confronto è reale, ma la sfida no. Stessi pesi, stessa finestra, stessa licenza, stesso silenzio da parte di chiunque non li abbia scaricati — uno dei due ha semplicemente il template di chat e i tag di pensiero, e l'altro è ciò da cui è stato ottenuto.