
Tiny Aya Base 32K vs Tiny Aya En-Thinker: Ouder en kind, geen rivalen
- deepseekNIEUWDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1 mln tokens
- openaiNIEUWOpenAI: GPT-6 Astra2026-09-0453Intelligentie77Coderen
- googleNIEUWGoogle: Gemini 3.8 Flash2026-09-0241Intelligentie76Coderen
- qwenNIEUWQwen: Qwen3.8 Max (0902)2026-09-0240Intelligentie72Coderen
- anthropicNIEUWAnthropic: Claude Fable 5.12026-09-0153Intelligentie82Coderen
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1 mln tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligentie72Coderen
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1 mln tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligentie75Coderen
- obsidianQwen3.8 27B2026-08-1534Intelligentie68Coderen
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligentie69Coderen
- grokSpaceXAI: Grok 4.62026-08-1244Intelligentie77Coderen
- metaMeta: Muse Spark 1.22026-08-0540Intelligentie72Coderen
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligentie72Coderen
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligentie69Coderen
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1 mln tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligentie78Coderen
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligentie69Coderen
Twee Hugging Face-repositories, elk met vier safetensors-shards, en de shardgroottes komen tot op de byte overeen — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K en Tiny Aya En-Thinker zijn niet de antwoorden van twee laboratoria op dezelfde vraag. Het gaat om dezelfde 3.35B Cohere2-architectuur in twee verschillende fasen, en de eigen modelkaart van Cohere Labs zegt het ronduit: het basischeckpoint "wordt gebruikt als basismodel voor Tiny Aya L2-Thinker en Tiny Aya En-Thinker."
Dat maakt de gebruikelijke directe vergelijking onjuist. Je kiest niet tussen twee concurrerende 3B-meertalige modellen. Je kiest tussen een beginpunt en een eindproduct — en de interessante vraag is wat de post-trainingstap daartussen werkelijk heeft opgeleverd, wat die heeft gekost, en of een van beide bruikbaar is voor wat je in gedachten hebt, aangezien beide onder dezelfde niet-commerciële licentie vallen en geen van beide een enkele gepubliceerde benchmark heeft.
De ene zin die de relatie beslecht
Normaal gesproken moet een "vs"-artikel de relatie tussen twee checkpoints afleiden uit architectuur en parameteraantallen. Hier hoeft dat niet.
De kaart van Tiny Aya Base 32K zegt het ronduit, en het is de moeite waard om die aandachtig te lezen vanwege waar de zin staat — niet in een voetnoot, maar in de modelsamenvatting, tussen de beschrijving van het checkpoint en de ontwikkelaarscredits:
"Dit is een basis voorafgetraind model en het is niet afgestemd op instructies of voorkeuren. Deze checkpoint wordt gebruikt als basismodel voor Tiny Aya L2-Thinker en Tiny Aya En-Thinker."
Wat dat een alinea waard maakt, is de inconsistentie die het blootlegt. En-Thinkers eigen kaart noemt Base 32K niet. De slotregel verwijst lezers naar "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — en tiny-aya-base is het februari-checkpoint, gedocumenteerd op 8K-context, niet de 32K-variant die zegt dat hij de ouder van En-Thinker is. En-Thinker claimt 32K op zijn eigen kaart. Een model kan niet worden nagetraind tot een venster dat vier keer zo breed is als het venster waarmee het is voorgetraind. Dus de 8K-basis zou nooit het antwoord worden, en de bewering van de 32K-basis past bij de rekensom, terwijl En-Thinkers eigen verwijzing dat niet doet.
De waarschijnlijke verklaring is alledaags: Base 32K werd op 8 september 2026 geüpload, zes dagen na de Thinkers, dus de kaart van En-Thinker werd geschreven voordat zijn ouder bestond en is sindsdien niet bijgewerkt. Dat is een gevolgtrekking op basis van tijdstempels, geen verklaring van de leverancier — maar het is de lezing die de minste aannames vereist, en het betekent dat het nieuwste document in de familie het meest informatief is.

Dimensie voor dimensie
Alles hieronder is wat op de twee kaarten staat, minus de duplicatie — beide zijn 3,35B, BF16, alleen tekst, Cohere2ForCausalLM, CC-BY-NC-4.0, toegangsbeperkt en niet gebenchmarkt.
• Fase — Tiny Aya Base 32K is een vooraf getraind basismodel, "niet instructie-afgestemd of op voorkeuren afgestemd"; Tiny Aya En-Thinker is post-getraind op meertalige redeneerdata met Engelse redeneertraces.
• Chat-template — Base 32K levert helemaal geen chat_template.jinja mee; En-Thinker levert er wel een, en de kaart ervan wijdt een hele sectie aan hoe het beurten weergeeft.
• Promptstijl — het eigen voorbeeld van Base 32K is completion (prompt = "De hoofdstad van Spanje is"); En-Thinker verwacht apply_chat_template() met een berichtenlijst.
• Redeneermodus — Base 32K heeft geen redeneermodus; En-Thinker heeft twee modi en voegt standaard /think toe en produceert een denkspoor in het Engels, of /no_think met enable_thinking=False voor een direct antwoord.
• Taalbereik — de kaart van Base 32K beweert dat er op 70+ talen is getraind en noemt er 67 expliciet; En-Thinker bestrijkt "44 talen plus Engels" met Engelse redeneersporen, en breidt dit uit naar nog eens 20+ via aanvullende niet-redeneerinstructiedata.
• Architectuurvoetafdruk — identiek. Dezelfde vier shardgroottes, hetzelfde aantal parameters, dezelfde lengte van het configuratiebestand.
• Context — 32K invoer plus uitvoer op beide kaarten. Geen van beide is verifieerbaar: beide configuraties zitten achter de licentiepoort.
• Benchmarks — op geen van beide kaarten. Er bestaat voor geen van beide modellen een evaluatie door derden.
• Traction — Base 32K toont nul downloads en één like; En-Thinker toont zeven downloads en twee likes. Geen van beide komt voor in de catalogus van een inferentieprovider.
Wat de post-trainingsstap heeft opgeleverd
Drie dingen, allemaal gedragsmatig in plaats van structureel.
Het eerste is een bruikbare interface. Een checkpoint zonder chat-template is geen model dat je prompt; het is een model dat je voortzet. Elk gesprek dat je met Base 32K hebt, moet je zelf naar tekst serialiseren, en de kaart zegt dat ook: "prompts moeten tekstaanvulling gebruiken in plaats van een chat-template. Extra post-training wordt aanbevolen voordat je het als gespreksassistent inzet." En-Thinker heeft die beslissing al voor je genomen, tot en met de tokenindeling.
Het tweede is redeneren als een schakelaar. En-Thinkers /think en /no_think-modi laten dezelfde gewichten ofwel een zichtbare gedachteketen tussen thinking-tags produceren, ofwel direct antwoorden, en de kaart documenteert het terugdoorgeven van een blok eerdere gedachten in het gesprek als een assistentbeurt. Dat is een post-training-artefact — er is niets in een basis-checkpoint dat erop reageert.
Het derde is de ontwerpweddenschap die centraal staat in En-Thinker: dat het redeneren in het Engels plaatsvindt, zelfs wanneer de vraag en het antwoord in een andere taal zijn. De kaart stelt expliciet dat dit het onderscheidt van Tiny Aya L2-Thinker, "die denkt in dezelfde taal als de prompt." Of het plannen in een taal met veel hulpbronnen en het antwoorden in een taal met weinig hulpbronnen daadwerkelijk helpt, is een open onderzoeksvraag, en En-Thinker bestaat om mensen het te laten testen in plaats van het te beslechten. Base 32K, dat helemaal geen redeneermodus heeft, zwijgt over de vraag — en dat is precies waarom het de juiste controle is voor iedereen die de vraag probeert te beantwoorden.

Wat de post-trainingstap kostte
Het eerlijke antwoord is dat niemand het kan kwantificeren, omdat geen van beide modellen op iets is geëvalueerd. Maar de twee kaarten samen geven een hint naar waar de afweging zit, en dat is niet waar je het zou verwachten.
Het is geen taalbereik. En-Thinkers smalle redeneerbereik van 44-plus-Engels is een eigenschap van zijn redeneertrainingsdata, en de kaart zegt dat de dekking zich uitstrekt tot 20+ extra talen "via aanvullende niet-redeneer-instructiedata" — dus het model verwerkt ze nog steeds, alleen zonder het denkpad. Het is ook niet het contextvenster; beide claimen 32K.
Het is de breedte van gedrag. De kaart van Base 32K noemt "voortgezette pretraining, instructie-tuning en onderzoek naar meertalige en lang-context taalmodellering" als beoogde toepassingen, waarbij meertalige tekstgeneratie, samenvatting, vertaling en cross-linguale aanpassing allemaal als downstream-toepassingen worden genoemd. De kaart van En-Thinker is beperkter: "wiskunde, wetenschap en algemene redeneertaken, evenals instructieopvolging en meertalige open-einde generatie." Een post-getrainde checkpoint is uitgesproken op een manier waarop een basis-checkpoint dat niet is, en de beperking die de kaart van Base 32K noemt — "Chain-of-thought-redeneertaken zoals meertalige wiskunde zijn relatief zwakker" — is precies de zwakte die post-training wilde verhelpen.
Dus de familie leest als een arbeidsverdeling in plaats van een competitie. De base is breed en onvoltooid; En-Thinker is smal en voltooid; en de tekst op de base card zelf noemt het wat het is — het substraat waaruit beide Thinkers zijn gevormd.
De licentie is de beperking die daadwerkelijk bindt.
Beide modellen zijn CC-BY-NC-4.0, met daarbovenop het Acceptable Use Policy van Cohere Labs; beide zitten achter dezelfde poort die je vraagt de voorwaarden te accepteren en je te registreren voordat de bestanden kunnen worden gedownload, en beide verwijzen commerciële vragen door naar Cohere Sales.
Dit is de moeite waard om te vermelden vóór elke technische vergelijking, omdat het de vraag beslist voor een groot deel van de lezers. Als het plan een commercieel product is, is geen van beide checkpoints een kandidaat zonder een gesprek met Cohere, en geen enkele hoeveelheid long-contextgedrag of flexibiliteit in reasoning-modus verandert dat. Waar niet-commercieel echt prima is — academisch werk, intern onderzoek, een benchmarkharness, een vergelijking met je eigen model — is de licentie irrelevant en is de technische keuze de hele beslissing.
Geen van beide is gebenchmarkt. Hier is hoe je toch kunt kiezen
Het ontbreken van cijfers is reëel en zal niet worden opgelost door nog nauwkeuriger te lezen. Beide kaarten bevatten geen enkele prestatieclaim, geen enkele ranglijst vermeldt een van beide modellen, en geen van beide heeft een inferenceprovider achter zich — wat betekent dat geen enkele provider de doorvoer of prijsstelling heeft gepubliceerd die gewoonlijk in de plaats komt van een benchmark. Wat je kunt doen, is je richten op de structuur, waar het bewijs solide is.
• Kies Tiny Aya Base 32K als je gaat trainen. Verder pretrainen, instruction tuning of domeinadaptatie bovenop een meertalig model van 3,35B is waarvoor de kaart zegt dat het bedoeld is, en starten vanaf een basis-checkpoint betekent dat je niet vecht tegen post-training die je niet zelf hebt gekozen. Het 32K-venster ondersteunt ook onderzoek naar lange contexten dat de 8K February base niet kon.
• Kies Tiny Aya En-Thinker als je vandaag iets wilt prompten. Het is de enige van de twee die een gesprek kan voeren, en de enige met überhaupt een redeneermodus.
• Kies beide als de vraag wetenschappelijk is in plaats van praktisch. Het paar vormt een gecontroleerde vergelijking — dezelfde architectuur, dezelfde grootte, hetzelfde venster, met als belangrijkste verschil of er post-training heeft plaatsgevonden — om de vraag te stellen of Engelse redeneersporen meertalige antwoorden verbeteren. Dat is de vraag die En-Thinker is uitgebracht om mensen te laten onderzoeken, en de eigen parent is de zuiverste baseline.

Een praktische opmerking bij het evalueren van een van beide: het zijn onbewezen research-checkpoints zonder deploymentgeschiedenis, en een download van 6,7 GB BF16 plus GPU-tijd is een reële kostenpost voor een model dat nooit onafhankelijk is gedraaid. Die vergelijking via één endpoint laten lopen in plaats van voor elke kandidaat gewichten op te zetten, is goedkoper — OrcaRouter biedt 195 modellen achter één API met 0% opslag op de lijstprijzen van providers en automatische failover tussen providers, zodat een research-checkpoint dat je alleen maar test nooit op een productiepad terechtkomt. Tiny Aya staat er niet op en wij hosten het niet; het punt is alleen dat de modellen waar je het tegen zou testen, grotendeels wel zijn.
Wat zou dit oplossen?
Twee dingen, en beide zijn goedkoop voor Cohere Labs om te publiceren en duur voor iedereen anders om te produceren.
Het eerste is een benchmark — welke dan ook. Eén enkele meertalige redeneerevaluatie, uitgevoerd op beide checkpoints, zou de hele familie van 'op de modelkaart vermeld' naar 'gemeten' omzetten, en zou meteen antwoord geven op de vraag of het ontwerp met Engels als denktaal hetzelfde model zonder post-training verslaat, wat de onderzoeksvraag is waar de release omheen is gebouwd.
De tweede is een config. De 32K-bewering op beide kaarten is niet verifieerbaar zolang de repositories toegangsbeperkt zijn, en het verschil tussen een echt lange-context-pretrainingsrun en een positiecodering-uitbreiding toegepast op een 8K-checkpoint is in de praktijk groot, ook al leveren beide een model op dat 32K tokens accepteert. Het openen van de twee configbestanden zou die kloof dichten op een manier die geen enkele marketingtekst kan.
Tot dan is het precieze antwoord op "Tiny Aya Base 32K of Tiny Aya En-Thinker" dat de vergelijking reëel is, maar de wedstrijd niet. Dezelfde gewichten, hetzelfde venster, dezelfde licentie, dezelfde stilte van iedereen die ze niet heeft gedownload — een van hen heeft alleen het chatsjabloon en de denktags, en de andere is waar hij van gemaakt is.
