
Tiny Aya Base 32K vs Tiny Aya En-Thinker : Parent et enfant, pas rivaux
- deepseekNOUVEAUDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 par million de tokens
- openaiNOUVEAUOpenAI: GPT-6 Astra2026-09-0453Intelligence77Code
- googleNOUVEAUGoogle: Gemini 3.8 Flash2026-09-0241Intelligence76Code
- qwenNOUVEAUQwen: Qwen3.8 Max (0902)2026-09-0240Intelligence72Code
- anthropicNOUVEAUAnthropic: Claude Fable 5.12026-09-0153Intelligence82Code
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 par million de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligence72Code
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 par million de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligence75Code
- obsidianQwen3.8 27B2026-08-1534Intelligence68Code
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligence69Code
- grokSpaceXAI: Grok 4.62026-08-1244Intelligence77Code
- metaMeta: Muse Spark 1.22026-08-0540Intelligence72Code
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligence72Code
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligence69Code
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 par million de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligence78Code
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligence69Code
Deux dépôts Hugging Face, quatre shards safetensors chacun, et les tailles des shards correspondent à l'octet près — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K et Tiny Aya En-Thinker ne sont pas les réponses de deux laboratoires à la même question. Il s’agit de la même architecture Cohere2 de 3.35B à deux étapes différentes, et la fiche du modèle de Cohere Labs elle-même le dit clairement : le checkpoint de base "est utilisé comme modèle de base pour Tiny Aya L2-Thinker et Tiny Aya En-Thinker."
Cela rend le cadrage habituel de comparaison directe erroné. Vous ne choisissez pas entre deux modèles multilingues 3B concurrents. Vous choisissez entre un point de départ et un produit fini — et la question intéressante est de savoir ce que l'étape de post-entraînement entre les deux a réellement apporté, ce qu'elle a coûté, et si l'un ou l'autre est utilisable pour ce que vous avez en tête, étant donné que les deux sont soumis à la même licence non commerciale et qu'aucun des deux ne dispose d'un seul benchmark publié.
La seule phrase qui règle la relation.
Normalement, un comparatif « vs » doit déduire la relation entre deux points de contrôle à partir de l'architecture et du nombre de paramètres. Ici, vous n'avez pas à le faire.
La fiche de Tiny Aya Base 32K le dit clairement, et il vaut la peine de la lire attentivement à cause de l'endroit où se trouve la phrase — non pas dans une note de bas de page, mais dans le résumé du modèle, entre la description du checkpoint et les crédits des développeurs :
« Il s'agit d'un modèle de base pré-entraîné qui n'a pas été affiné par instructions ni aligné sur les préférences. Ce point de contrôle sert de modèle de base pour Tiny Aya L2-Thinker et Tiny Aya En-Thinker. »
Ce qui vaut un paragraphe à ce sujet, c'est l'incohérence qu'il révèle. La propre fiche d'En-Thinker ne mentionne pas Base 32K. Sa dernière ligne renvoie les lecteurs à « tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker » — et tiny-aya-base est le checkpoint de février, documenté avec un contexte de 8K, pas la variante 32K qui prétend être le parent d'En-Thinker. En-Thinker revendique 32K sur sa propre fiche. Un modèle ne peut pas être post-entraîné sur une fenêtre quatre fois plus large que celle avec laquelle il a été pré-entraîné. La base 8K n'allait donc jamais être la réponse, et la revendication de la base 32K concorde avec l'arithmétique, là où le renvoi d'En-Thinker lui-même ne concorde pas.
L'explication probable est banale : Base 32K a été téléversée le 8 septembre 2026, six jours après les Thinkers, donc la fiche d'En-Thinker a été écrite avant l'existence de son parent et n'a pas été mise à jour depuis. C'est une déduction fondée sur les horodatages, et non une déclaration du fournisseur — mais c'est l'interprétation qui requiert le moins d'hypothèses, et elle implique que le document le plus récent de la famille est le plus informatif.

Dimension par dimension
Tout ce qui suit est ce que les deux cartes indiquent, sans la duplication — les deux sont 3.35B, BF16, texte uniquement, Cohere2ForCausalLM, CC-BY-NC-4.0, à accès restreint et non évalués.
• Étape — Tiny Aya Base 32K est une base pré-entraînée, « non affinée par instructions ni alignée sur des préférences » ; Tiny Aya En-Thinker est post-entraînée sur des données de raisonnement multilingues avec des traces de raisonnement en anglais.
• Chat template — Base 32K ne fournit aucun chat_template.jinja du tout ; En-Thinker en fournit un, et sa fiche consacre une section entière à la façon dont il génère les tours.
• Style d’invite — L’exemple de Base 32K est la complétion (prompt = "La capitale de l'Espagne est") ; En-Thinker attend apply_chat_template() avec une liste de messages.
• Mode raisonnement — Base 32K n'a pas de mode raisonnement ; En-Thinker est à double mode, ajoutant /think par défaut et émettant une trace de réflexion en anglais, ou /no_think avec enable_thinking=False pour une réponse directe.
• Portée linguistique — La fiche de Base 32K revendique un entraînement sur 70+ langues et en nomme 67 explicitement ; En-Thinker couvre « 44 langues plus l'anglais » avec des traces de raisonnement en anglais, s'étendant à 20+ autres grâce à des données d'instruction supplémentaires non liées au raisonnement.
• Empreinte d'architecture — identique. Mêmes quatre tailles de shard, même nombre de paramètres, même longueur de fichier de configuration.
• Contexte — 32K d'entrée plus sortie sur les deux cartes. Ni l'une ni l'autre n'est vérifiable : les deux configurations sont derrière la barrière de licence.
• Benchmarks — aucun sur l’une ou l’autre fiche. Aucune évaluation par un tiers de l’un ou l’autre modèle n’existe.
• Traction — Base 32K affiche zéro téléchargement et un like ; En-Thinker affiche sept téléchargements et deux likes. Aucun des deux n'apparaît dans le catalogue d'un fournisseur d'inférence.
Ce que l'étape de post-entraînement a apporté
Trois choses, toutes comportementales plutôt que structurelles.
La première est une interface utilisable. Un checkpoint sans template de chat n'est pas un modèle que l'on invite ; c'est un modèle que l'on continue. Chaque conversation que vous avez avec Base 32K doit être sérialisée en texte par vous-même, et la fiche le dit expressément : « les prompts doivent utiliser la complétion de texte plutôt qu'un template de chat. Un post-entraînement supplémentaire est recommandé avant de le déployer en tant qu'assistant conversationnel. » En-Thinker a déjà pris cette décision pour vous, jusqu'à la disposition des tokens.
Le deuxième est le raisonnement en tant que commutateur. En-Thinker a des modes /think et /no_think qui permettent aux mêmes poids soit de produire une chaîne de pensée visible entre les balises de réflexion, soit de répondre directement, et la fiche documente le fait de renvoyer un bloc de réflexion antérieur dans la conversation en tant que tour d'assistant. C'est un artefact de post-entraînement — il n'y a rien dans un checkpoint de base qui y réponde.
Le troisième est le pari de conception au cœur d'En-Thinker : le raisonnement se fait en anglais, même lorsque la question et la réponse sont dans une autre langue. La fiche indique explicitement que cela le distingue de Tiny Aya L2-Thinker, « qui pense dans la même langue que l'invite ». La question de savoir si planifier dans une langue à fortes ressources et répondre dans une langue à faibles ressources est réellement utile demeure une question de recherche ouverte, et En-Thinker existe pour permettre aux gens de la tester plutôt que de la trancher. Base 32K, qui ne possède aucun mode de raisonnement, reste muette sur la question — ce qui est précisément la raison pour laquelle elle constitue le bon témoin pour quiconque tente d'y répondre.

Ce qu'a coûté l'étape de post-entraînement
La réponse honnête est que personne ne peut le quantifier, car aucun des deux modèles n'a été évalué sur quoi que ce soit. Mais les deux cartes ensemble laissent entrevoir où se situe le compromis, et ce n'est pas là où on l'attendrait.
Ce n'est pas une question de couverture linguistique. La portée de raisonnement étroite d'En-Thinker — limitée à 44 langues plus l'anglais — est une propriété de ses données d'entraînement au raisonnement, et la fiche indique que la couverture s'étend à plus de 20 langues supplémentaires « grâce à des données d'instruction non liées au raisonnement » — le modèle les gère donc toujours, mais sans le cheminement de réflexion. Ce n'est pas non plus la fenêtre de contexte ; les deux annoncent 32K.
Il s'agit d'une largeur de comportement. La fiche de Base 32K liste « continued pretraining, instruction tuning, and research on multilingual and long-context language modeling » comme utilisations prévues, avec la génération de texte multilingue, le résumé, la traduction et l'adaptation cross-lingue toutes nommées comme applications en aval. La fiche d'En-Thinker est plus étroite : « mathematics, science, and general reasoning tasks, as well as instruction following and multilingual open-ended generation. » Un point de contrôle post-entraîné est orienté d'une manière qu'un point de contrôle de base ne l'est pas, et la limitation signalée par la fiche de Base 32K — « Chain-of-thought reasoning tasks such as multilingual math are comparatively weaker » — est exactement la faiblesse que le post-entraînement visait à corriger.
Ainsi, la famille se lit comme une division du travail plutôt qu'une compétition. La base est large et inachevée ; En-Thinker est étroite et achevée ; et le texte de la carte de base la nomme pour ce qu'elle est — le substrat à partir duquel les deux Thinkers ont été façonnés.
La licence est la contrainte qui lie véritablement.
Les deux modèles sont sous licence CC-BY-NC-4.0, avec la politique d'utilisation acceptable de Cohere Labs appliquée par-dessus ; tous deux se trouvent derrière la même passerelle qui vous demande d'accepter les conditions et de vous inscrire avant le téléchargement des fichiers, et tous deux renvoient les questions commerciales à Cohere Sales.
Il vaut la peine de le dire avant toute comparaison technique, car cela tranche la question pour une grande partie des lecteurs. Si le projet est un produit commercial, aucun des deux checkpoints n'est envisageable sans un échange avec Cohere, et aucune quantité de comportement en contexte long ou de flexibilité du mode de raisonnement n'y change quoi que ce soit. Lorsque le non-commercial est véritablement acceptable — travaux universitaires, recherche interne, banc d’essai de référence, comparaison avec votre propre modèle — la licence est sans importance et le choix technique est toute la décision.
Ni l'un ni l'autre n'a été benchmarké. Voici comment choisir quand même.
L'absence de chiffres est réelle et elle ne sera pas résolue en lisant plus attentivement. Les deux fiches ne formulent aucune promesse de performance, aucun classement ne répertorie ni l'un ni l'autre modèle, et aucun des deux n'a de fournisseur d'inférence derrière lui — ce qui signifie qu'aucun fournisseur n'a publié le débit ou les tarifs qui remplacent habituellement un benchmark. Ce que vous pouvez faire, c'est vous en prendre à la structure, là où les preuves sont solides.
• Choisissez Tiny Aya Base 32K si vous comptez l'entraîner. Le pré-entraînement continu, l'ajustement par instructions ou une adaptation de domaine à partir d'un modèle multilingue de 3,35B : c'est à cela que {{1}}la fiche dit qu'il est destiné{{/1}}, et partir d'un checkpoint de base signifie que vous n'avez pas à lutter contre un post-entraînement que vous n'avez pas choisi. La fenêtre de 32K prend également en charge la recherche sur les longs contextes, ce que la base 8K de février ne pouvait pas faire.
• Choisissez Tiny Aya En-Thinker si vous souhaitez l'utiliser aujourd'hui. C'est le seul des deux à pouvoir tenir une conversation, et le seul à disposer d'un mode de raisonnement.
• Choisissez les deux si la question est scientifique plutôt que pratique. La paire constitue une comparaison contrôlée — même architecture, même taille, même fenêtre, ne différant principalement que par la présence ou non d'un post-entraînement — pour se demander si les traces de raisonnement en anglais améliorent les réponses multilingues. C'est la question qu'En-Thinker a été publié pour permettre aux gens de sonder, et son propre parent constitue la référence la plus propre.

Une remarque pratique sur l’évaluation de l’un ou l’autre : ce sont des checkpoints de recherche non éprouvés, sans historique de déploiement, et un téléchargement BF16 de 6,7 Go, auquel s’ajoute du temps GPU, représente un coût réel pour un modèle qui n’a jamais été exécuté de manière indépendante. Effectuer cette comparaison via un seul endpoint plutôt que de déployer les poids de chaque candidat est moins cher — OrcaRouter propose 195 modèles derrière une seule API avec 0 % de majoration sur les prix catalogue des fournisseurs et un basculement automatique entre les fournisseurs, si bien qu’un checkpoint de recherche que vous ne faites que tester ne se retrouve jamais sur un chemin de production. Tiny Aya n’y figure pas et nous ne l’hébergeons pas ; le point est seulement que les modèles que vous testeriez contre lui y sont pour la plupart.
Qu'est-ce qui réglerait cela ?
Deux choses, et les deux sont peu coûteuses à publier pour Cohere Labs et coûteuses à produire pour n'importe qui d'autre.
Le premier est un benchmark — n’importe quel benchmark. Une seule évaluation de raisonnement multilingue exécutée sur les deux checkpoints ferait passer toute la famille de « annoncé sur le papier » à « mesuré », et répondrait immédiatement à la question de savoir si la conception pensant en anglais bat le même modèle sans post-entraînement, ce qui est la question de recherche autour de laquelle la publication est construite.
Le second est un fichier de configuration. L'affirmation des 32K sur les deux fiches est invérifiable tant que les dépôts sont verrouillés, et la différence entre un véritable pré-entraînement à long contexte et une extension d'encodage positionnel appliquée à un point de contrôle de 8K est considérable en pratique, même si les deux produisent un modèle qui accepte 32K jetons. Ouvrir les deux fichiers de configuration comblerait cet écart d'une manière qu'aucun texte marketing ne peut.
Jusqu'à présent, la réponse exacte à « Tiny Aya Base 32K ou Tiny Aya En-Thinker » est que la comparaison est réelle, mais le duel n'existe pas. Mêmes poids, même fenêtre, même licence, même silence de la part de tous ceux qui ne les ont pas téléchargés — l'un n'a que le gabarit de chat et les balises de raisonnement, et l'autre est simplement ce à partir de quoi il a été créé.
