
Tiny Aya Base 32K mot Tiny Aya En-Thinker: Förälder och barn, inte rivaler
- deepseekNYDeepSeek: DeepSeek V4.1 Flash2026-09-10$0.15 / $0.60 per 1M tokens
- openaiNYOpenAI: GPT-6 Astra2026-09-0453Intelligens77Kodning
- googleNYGoogle: Gemini 3.8 Flash2026-09-0241Intelligens76Kodning
- qwenNYQwen: Qwen3.8 Max (0902)2026-09-0240Intelligens72Kodning
- anthropicNYAnthropic: Claude Fable 5.12026-09-0153Intelligens82Kodning
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 per 1M tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Intelligens72Kodning
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.24 / $0.73 per 1M tokens
- z-aiZ.ai: GLM 5.32026-08-1845Intelligens75Kodning
- obsidianQwen3.8 27B2026-08-1534Intelligens68Kodning
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Intelligens69Kodning
- grokSpaceXAI: Grok 4.62026-08-1244Intelligens77Kodning
- metaMeta: Muse Spark 1.22026-08-0540Intelligens72Kodning
- qwenQwen: Qwen3.8 Max2026-08-0340Intelligens72Kodning
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Intelligens69Kodning
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 per 1M tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
- anthropicAnthropic: Claude Opus 52026-07-2451Intelligens78Kodning
- googleGoogle: Gemini 3.6 Flash2026-07-2134Intelligens69Kodning
Två Hugging Face-repositories, fyra safetensors-shards vardera, och shard-storlekarna stämmer exakt ned till sista bytet — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K och Tiny Aya En-Thinker är inte två laboratoriers svar på samma fråga. De är samma 3.35B Cohere2-arkitektur i två olika stadier, och Cohere Labs eget modellkort säger det rakt ut: bascheckpointen "används som basmodell för Tiny Aya L2-Thinker och Tiny Aya En-Thinker."
Det gör det vanliga upplägget med direkt jämförelse felaktigt. Du väljer inte mellan två konkurrerande 3B-flerspråkiga modeller. Du väljer mellan en utgångspunkt och en färdig sådan — och den intressanta frågan är vad efterträningssteget mellan dem faktiskt gav, vad det kostade, och om någon av dem är användbar för det du har i åtanke, med tanke på att båda ligger under samma icke-kommersiella licens och att ingen av dem har en enda publicerad benchmark.
Den enda meningen som avgör relationen.
Normalt sett måste en "vs"-artikel sluta sig till relationen mellan två checkpoints utifrån arkitektur och parameterantal. Här behöver du inte det.
Tiny Aya Base 32K:s kort säger det rakt av, och det är värt att läsa noggrant på grund av var meningen sitter – inte i en fotnot, utan i modellsammanfattningen, mellan beskrivningen av checkpointen och utvecklarkrediterna:
"Detta är en förtränad basmodell och har inte instruktionsjusterats eller preferensanpassats. Denna checkpoint används som basmodell för Tiny Aya L2-Thinker och Tiny Aya En-Thinker."
Det som gör att det är värt ett stycke är den inkonsekvens det avslöjar. En-Thinkers eget modellkort nämner inte Base 32K. Dess avslutande rad hänvisar läsare till "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — och tiny-aya-base är februari-checkpointen, dokumenterad med 8K-kontext, inte 32K-varianten som säger sig vara En-Thinkers förälder. En-Thinker hävdar 32K på sitt eget modellkort. En modell kan inte eftertränas till ett kontextfönster som är fyra gånger bredare än det fönster den förtränades med. Så 8K-basen skulle aldrig bli svaret, och 32K-basens påstående stämmer med aritmetiken där En-Thinkers egen hänvisning inte gör det.
Den troliga förklaringen är prosaisk: Base 32K laddades upp den 8 september 2026, sex dagar efter Thinkers, så En-Thinkers kort skrevs innan dess förälder existerade och har inte uppdaterats sedan dess. Det är en slutledning från tidsstämplar, inte ett leverantörsuttalande — men det är den tolkning som kräver minst antaganden, och det innebär att det nyaste dokumentet i familjen är det mest informativa.

Dimension för dimension
Allt nedan är vad de två korten anger, minus upprepningen — båda är 3.35B, BF16, endast text, Cohere2ForCausalLM, CC-BY-NC-4.0, åtkomstbegränsade och utan riktmärken.
• Etapp — Tiny Aya Base 32K är en förtränad bas, "inte instruktionsjusterad eller preferensanpassad"; Tiny Aya En-Thinker är eftertränad på flerspråkig resonemangsdata med engelska resonemangsspår.
• Chattmall — Base 32K medföljer ingen chat_template.jinja alls; En-Thinker medföljer en, och dess kort ägnar ett helt avsnitt åt hur den renderar turer.
• Promptningsstil — Base 32K:s eget exempel är completion (prompt = "The capital of Spain is"); En-Thinker förväntar sig apply_chat_template() med en meddelandelista.
• Reasoning-läge — Base 32K har inget reasonings-läge; En-Thinker är dubbelläge, som lägger till /think som standard och avger ett tankespår på engelska, eller /no_think med enable_thinking=False för ett direkt svar.
• Språkomfång — Base 32K:s kort hävdar träning på 70+ språk och namnger 67 uttryckligen; En-Thinker täcker "44 språk plus engelska" med engelska resonemangsspår, vilket utökas till 20+ fler genom ytterligare icke-resonerande instruktionsdata.
• Arkitekturfotavtryck — identiskt. Samma fyra shard-storlekar, samma parameterantal, samma konfigurationsfillängd.
• Kontext — 32K indata plus utdata på båda korten. Ingen av dem är verifierbar: båda konfigurationerna ligger bakom licensspärren.
• Riktmärken — inga på något av korten. Det finns ingen tredjepartsutvärdering av någon av modellerna.
• Genomslag — Base 32K visar noll nedladdningar och en gillning; En-Thinker visar sju nedladdningar och två gillningar. Ingen av dem förekommer i en inferensleverantörs katalog.
Vad efterträningssteget gav
Tre saker, alla av dem beteendemässiga snarare än strukturella.
Det första är ett användbart gränssnitt. En checkpoint utan chattmall är inte en modell som du promptar; det är en modell som du fortsätter träna. Varje konversation du har med Base 32K måste du själv serialisera till text, och modellkortet säger precis det: "promptar bör använda textkomplettering snarare än en chattmall. Ytterligare efterträning rekommenderas innan du distribuerar den som en konversationsassistent." En-Thinker har redan fattat det beslutet åt dig, ända ner till tokenlayouten.
Det andra är resonemang som en switch. En-Thinker's /think och /no_think lägen låter samma vikter antingen producera en synlig tankekedja mellan thinking-taggar eller svara direkt, och kortet dokumenterar att man skickar tillbaka ett tidigare thinking-block till konversationen som en assistenttur. Det är en post-training-artefakt — det finns inget i en bascheckpoint som svarar på det.
Det tredje är designsatsningen i centrum för En-Thinker: att resonerandet sker på engelska även när frågan och svaret är på ett annat språk. Kortet anger uttryckligen att detta skiljer det från Tiny Aya L2-Thinker, "som tänker på samma språk som prompten." Huruvida planering på ett högresursspråk och svar på ett lågresursspråk faktiskt hjälper är en öppen forskningsfråga, och En-Thinker finns till för att låta människor testa det snarare än att avgöra det. Base 32K, som inte har något resonemangsläge alls, är tyst i frågan — vilket är precis därför det är den rätta kontrollen för den som försöker besvara den.

Vad efterträningssteget kostade
Det ärliga svaret är att ingen kan kvantifiera det, eftersom ingen av modellerna har utvärderats på någonting. Men de två korten tillsammans antyder var avvägningen finns, och den är inte där du skulle förvänta dig.
Det är inte språktäckning. En-Thinker's snäva 44-plus-engelska resonemangsomfång är en egenskap hos dess resonemangsträningsdata, och kortet säger att täckningen sträcker sig till 20+ ytterligare språk "genom ytterligare icke-resonemangsinstruktionsdata" — så modellen hanterar dem fortfarande, bara utan tankebanan. Det är inte heller kontextfönstret; båda anger 32K.
Det är beteendets bredd. Base 32K:s modellkort listar "fortsatt förträning, instruktionsanpassning och forskning om flerspråkig språkmodellering med lång kontext" som avsedda användningsområden, med flerspråkig textgenerering, sammanfattning, översättning och tvärspråklig anpassning alla nämnda som nedströmsapplikationer. En-Thinkers modellkort är smalare: "matematik, naturvetenskap och allmänna resonemangsuppgifter, såväl som instruktionsföljning och flerspråkig öppen generering." En eftertränad checkpoint är åsiktsbunden på ett sätt som en bascheckpoint inte är, och den begränsning som Base 32K:s modellkort flaggar — "Kedjetankeresonemangsuppgifter som flerspråkig matematik är jämförelsevis svagare" — är precis den svaghet som efterträningen syftade till att åtgärda.
Så familjen läses som en arbetsfördelning snarare än en tävling. Basen är bred och ofärdig; En-Thinker är smal och färdig; och basens egen text kallar den för vad den är — substratet som båda Thinkers formades ur.
Licensen är den begränsning som faktiskt binder.
Båda modellerna är CC-BY-NC-4.0 med Cohere Labs' Acceptable Use Policy ovanpå, båda ligger bakom samma spärr som ber dig att acceptera villkoren och registrera dig innan filerna laddas ner, och båda hänvisar kommersiella frågor till Cohere Sales.
Detta är värt att nämna innan någon teknisk jämförelse, eftersom det avgör frågan för en stor del av läsarna. Om planen är en kommersiell produkt är ingen av kontrollpunkterna en kandidat utan ett samtal med Cohere, och ingen mängd långkontextbeteende eller resonemangslägesflexibilitet ändrar på det. Där icke-kommersiellt verkligen är okej — akademiskt arbete, intern forskning, ett benchmark-ramverk, en jämförelse med din egen modell — är licensen irrelevant och det tekniska valet hela beslutet.
Ingen av dem har benchmarkats. Så här väljer du ändå.
Avsaknaden av siffror är verklig, och den kommer inte att lösas genom att man läser mer noggrant. Båda korten gör inga prestandaanspråk alls, ingen leaderboard listar någon av modellerna, och ingen av dem har en inferensleverantör bakom sig — vilket innebär att ingen leverantör har publicerat det genomflöde eller den prissättning som vanligtvis ersätter ett riktmärke. Vad du kan göra är att fokusera på strukturen, där bevisen är solida.
• Välj Tiny Aya Base 32K om du ska träna. Fortsatt förträning, instruktionsfinjustering eller en domänanpassning ovanpå en flerspråkig 3,35B-modell är vad kortet säger att den är till för, och att börja från en bascheckpoint innebär att du inte kämpar mot efterträning som du inte valt. 32K-fönstret stöder också långkontextforskning som 8K-februaribasen inte kunde.
• Välj Tiny Aya En-Thinker om du vill fråga något idag. Det är den enda av de två som kan föra en konversation, och den enda som överhuvudtaget har ett resonemangsläge.
• Välj båda om frågan är vetenskaplig snarare än praktisk. Paret utgör en kontrollerad jämförelse — samma arkitektur, samma storlek, samma fönster, som skiljer sig mest i fråga om huruvida efterträning skedde — för att undersöka om engelska resonemangsspår förbättrar flerspråkiga svar. Det är den frågan En-Thinker släpptes för att låta människor utforska, och dess egen förälder är den renaste baslinjen.

En praktisk anmärkning om att utvärdera endera: de är oprövade forskningskontrollpunkter utan distributionshistorik, och en 6,7 GB BF16-nedladdning plus GPU-tid är en verklig kostnad att lägga på en modell som aldrig har körts oberoende. Att köra den jämförelsen via en enda slutpunkt snarare än att sätta upp vikter för varje kandidat är billigare — OrcaRouter har 195 modeller bakom ett API med 0 % påslag på leverantörernas listpriser och automatisk redundansväxling mellan leverantörer, så en forskningskontrollpunkt som du bara testar hamnar aldrig på en produktionssökväg. Tiny Aya finns inte där och vi tillhandahåller den inte; poängen är bara att modellerna du skulle testa den mot mestadels finns där.
Vad skulle avgöra detta
Två saker, och båda är billiga för Cohere Labs att publicera och dyra för alla andra att producera.
Det första är ett riktmärke — vilket riktmärke som helst. En enda flerspråkig resonemangsutvärdering som körs på båda kontrollpunkterna skulle förvandla hela familjen från "kortangiven" till "uppmätt," och den skulle omedelbart besvara frågan om den engelsktänkande designen slår samma modell utan efterträning, vilket är den forskningsfråga som releasen är byggd kring.
Det andra är en config. 32K-påståendet på båda korten är overifierbart så länge repositoryerna är stängda, och skillnaden mellan en genuint långkontextig förträningskörning och en positionskodningsutvidgning som applicerats på en 8K-checkpoint är stor i praktiken, även om båda ger en modell som accepterar 32K tokens. Att öppna de två config-filerna skulle överbrygga den klyftan på ett sätt som ingen marknadsföringstext kan.
Tills dess är det korrekta svaret på "Tiny Aya Base 32K eller Tiny Aya En-Thinker" att jämförelsen är verklig men tävlingen är det inte. Samma vikter, samma fönster, samma licens, samma tystnad från alla som inte har laddat ner dem — den ena har bara chatmallen och tanketaggarna, och den andra är det som den skapades från.
