Um cartão de título em estilo de diagrama para 'Tiny Aya Base 32K vs Tiny Aya En-Thinker'. Dois cartões arredondados ficam lado a lado, ligados da esquerda para a direita por uma seta rotulada como 'pós-treinamento'. O cartão esquerdo, 'Tiny Aya Base 32K', traz as linhas 'base pré-treinada' e 'sem template de chat'; o cartão direito, 'Tiny Aya En-Thinker', traz 'pós-treinado' e 'modo de raciocínio incluído'. Uma linha centralizada abaixo de ambos diz 'mesma arquitetura 3.35B, mesma janela de 32K'. O logotipo OrcaRouter é sobreposto no canto inferior direito.
Guides & Insights

Tiny Aya Base 32K vs Tiny Aya En-Thinker: Pai e Filho, Não Rivais

Autor

Rowan Sterling

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Dois repositórios do Hugging Face, quatro shards safetensors cada, e os tamanhos dos shards coincidem byte a byte — 1,998,698,496 / 1,996,494,056 / 1,996,494,088 / 708,852,792. Tiny Aya Base 32K e Tiny Aya En-Thinker não são as respostas de dois laboratórios para a mesma pergunta. São a mesma arquitetura Cohere2 de 3,35B em dois estágios diferentes, e o próprio model card da Cohere Labs afirma isso explicitamente: o checkpoint base "é usado como modelo base para Tiny Aya L2-Thinker e Tiny Aya En-Thinker."

Isso torna errada a estrutura usual de comparação frente a frente. Você não está escolhendo entre dois modelos multilíngues de 3B concorrentes. Você está escolhendo entre um ponto de partida e um já finalizado — e a questão interessante é o que a etapa de pós-treinamento entre eles realmente proporcionou, quanto custou, e se algum deles é utilizável para o que você tem em mente, dado que ambos estão sob a mesma licença não comercial e nenhum tem sequer um benchmark publicado.

A única frase que define a relação.

Normalmente, um artigo "vs" tem que inferir a relação entre dois checkpoints a partir da arquitetura e das contagens de parâmetros. Aqui você não precisa.

O card do Tiny Aya Base 32K afirma isso claramente, e vale a pena ler com atenção por causa de onde a frase está — não em uma nota de rodapé, mas no resumo do modelo, entre a descrição do checkpoint e os créditos dos desenvolvedores:

"Este é um modelo base pré-treinado e não foi ajustado por instruções nem alinhado por preferências. Este checkpoint é usado como modelo base para Tiny Aya L2-Thinker e Tiny Aya En-Thinker."

O que torna isso digno de um parágrafo é a inconsistência que ele expõe. A ficha do próprio En-Thinker não menciona o Base 32K. Sua frase final encaminha os leitores para "tiny-aya-global, tiny-aya-base, tiny-aya-l2-thinker" — e tiny-aya-base é o checkpoint de fevereiro, documentado com contexto de 8K, não a variante de 32K que afirma ser o modelo-pai do En-Thinker. O En-Thinker afirma 32K na própria ficha. Um modelo não pode ser pós-treinado para uma janela quatro vezes maior do que aquela com que foi pré-treinado. Portanto, a base de 8K nunca seria a resposta, e a afirmação da base de 32K se encaixa na aritmética onde a própria referência do En-Thinker não se encaixa.

A explicação provável é mundana: a Base 32K foi carregada em 8 de setembro de 2026, seis dias depois dos Thinkers, portanto o cartão do En-Thinker foi escrito antes de seu pai existir e não foi atualizado desde então. Isso é inferência a partir de timestamps, não uma declaração do fornecedor — mas é a leitura que exige o menor número de suposições, e significa que o documento mais recente da família é o mais informativo.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-base-32K. The page is licence-gated, and the card summary states Model Size 3.35B and Context Length 32K (input + output), followed by the line 'This checkpoint is used as the base model for Tiny Aya L2-Thinker and Tiny Aya En-Thinker' and 'For the 8K release, see tiny-aya-base.' The tags row includes long-context and 46 languages, and the Inference Providers panel reads 'This model isn't deployed by any Inference Provider.'

Dimensão por dimensão

Tudo abaixo é o que os dois cartões declaram, menos a duplicação — ambos são 3.35B, BF16, somente texto, Cohere2ForCausalLM, CC-BY-NC-4.0, com acesso restrito e sem benchmark.

• Etapa — Tiny Aya Base 32K é uma base pré-treinada, "não ajustada por instruções nem alinhada por preferências"; Tiny Aya En-Thinker é pós-treinada em dados de raciocínio multilíngues com rastros de raciocínio em inglês.

• Template de chat — a Base 32K não inclui chat_template.jinja de forma alguma; a En-Thinker inclui um, e seu card dedica uma seção inteira a como ele renderiza os turnos.

• Estilo de prompting — o exemplo da própria Base 32K é completion (prompt = "The capital of Spain is"); En-Thinker espera apply_chat_template() com uma lista de mensagens.

• Modo de raciocínio — Base 32K não tem modo de raciocínio; En-Thinker é de modo duplo, acrescentando /think por padrão e emitindo um rastro de pensamento em inglês, ou /no_think com enable_thinking=False para uma resposta direta.

• Escopo de idiomas — A ficha do Base 32K afirma treinamento em mais de 70 idiomas e lista 67 explicitamente; o En-Thinker cobre "44 idiomas mais inglês" com cadeias de raciocínio em inglês, estendendo-se a mais de 20 outros por meio de dados adicionais de instrução sem raciocínio.

• Pegada de arquitetura — idêntica. Mesmos quatro tamanhos de shard, mesma contagem de parâmetros, mesmo comprimento do arquivo de configuração.

• Contexto — 32K de entrada mais saída em ambas as placas. Nenhuma é verificável: ambas as configurações estão atrás do gate de licença.

• Benchmarks — nenhum em qualquer um dos cartões. Não existe avaliação de terceiros de nenhum dos modelos.

• Tração — Base 32K mostra zero downloads e um like; En-Thinker mostra sete downloads e dois likes. Nenhum dos dois aparece no catálogo de um provedor de inferência.

O que a etapa de pós-treinamento trouxe

Três coisas, todas elas comportamentais em vez de estruturais.

A primeira é uma interface utilizável. Um checkpoint sem modelo de chat não é um modelo que se interpela; é um modelo que se continua. Cada conversa que tiver com o Base 32K tem de ser serializada em texto por si, e a ficha diz exatamente isso: "os prompts devem usar conclusão de texto em vez de um modelo de chat. Recomenda-se treino adicional antes de o implementar como assistente conversacional." O En-Thinker já tomou essa decisão por si, até ao layout de tokens.

A segunda é o raciocínio como um interruptor. Os modos do En-Thinker/think e /no_think permitem que os mesmos pesos produzam uma cadeia de pensamento visível entre as tags de pensamento ou respondam diretamente, e o card documenta a passagem de um bloco de pensamento anterior de volta para a conversa como um turno do assistente. Isso é um artefato de pós-treinamento — não há nada em um checkpoint base que responda a isso.

O terceiro é a aposta de design no centro do {{1}}En-Thinker{{/1}}: que o raciocínio acontece em inglês mesmo quando a pergunta e a resposta estão em outro idioma. O card deixa explícito que isso o distingue do {{2}}Tiny Aya L2-Thinker{{/2}}, "que pensa no mesmo idioma do prompt". Se planejar em um idioma de altos recursos e responder em um de baixos recursos realmente ajuda é uma questão de pesquisa em aberto, e o {{3}}En-Thinker{{/3}} existe para permitir que as pessoas testem isso, em vez de resolvê-la. O {{4}}Base 32K{{/4}}, por não ter nenhum modo de raciocínio, é silencioso quanto à questão — o que é exatamente o motivo pelo qual é o controle certo para qualquer pessoa que tente respondê-la.

A screenshot of the Hugging Face model card page for CohereLabs/tiny-aya-en-thinker, also licence-gated. The tags row reads Text Generation, Transformers, Safetensors, 46 languages, cohere2, aya, reasoning, tiny-aya, conversational and License: cc-by-nc-4.0, and the safetensors panel additionally shows a Chat template entry. The summary describes a 3.35 billion parameter multilingual reasoning model trained with English reasoning traces for 44 languages plus English, and the card lists Model Size 3.35B and Context Length 32K (input + output). The closing line points readers to tiny-aya-global, tiny-aya-base and tiny-aya-l2-thinker, and the sidebar shows 7 downloads last month and 'This model isn't deployed by any Inference Provider.'

Quanto custou a etapa de pós-treinamento.

A resposta honesta é que ninguém pode quantificá-la, porque nenhum dos modelos foi avaliado em nada. Mas as duas cartas juntas indicam onde está o trade-off, e não é onde você esperaria.

Não é cobertura de idiomas. O escopo de raciocínio restrito a 44+ idiomas, incluindo o inglês, do En-Thinker é uma propriedade de seus dados de treinamento de raciocínio, e o cartão diz que a cobertura se estende a mais 20+ idiomas "por meio de dados de instrução adicionais de não-raciocínio" — portanto, o modelo ainda os abrange, apenas sem o caminho de pensamento. Também não é a janela de contexto; ambos afirmam 32K.

É amplitude de comportamento. O cartão do Base 32K lista "pré-treinamento contínuo, ajuste de instruções e pesquisa sobre modelagem de linguagem multilíngue e de contexto longo" como usos pretendidos, com geração de texto multilíngue, sumarização, tradução e adaptação entre idiomas, todas nomeadas como aplicações downstream. O cartão do En-Thinker é mais restrito: "matemática, ciências e tarefas gerais de raciocínio, bem como seguimento de instruções e geração multilíngue de final aberto." Um checkpoint pós-treinado tem uma opinião própria de uma forma que um checkpoint base não tem, e a limitação que o cartão do Base 32K aponta — "tarefas de raciocínio de cadeia de pensamento, como matemática multilíngue, são comparativamente mais fracas" — é exatamente a fraqueza que o pós-treinamento se propôs a corrigir.

Então a família se lê como uma divisão de trabalho em vez de uma competição. A base é ampla e inacabada; En-Thinker é estreito e acabado; e o texto da própria carta-base a chama pelo que é — o substrato do qual ambos os Thinkers foram moldados.

A licença é a restrição que efetivamente vincula.

Ambos os modelos são CC-BY-NC-4.0 com a Política de Uso Aceitável da Cohere Labs sobreposta, ambos estão atrás da mesma cancela que pede que você aceite os termos e se registre antes de baixar os arquivos, e ambos encaminham questões comerciais para o Cohere Sales.

Vale a pena afirmar isto antes de qualquer comparação técnica, porque decide a questão para uma grande parte dos leitores. Se o plano for um produto comercial, nenhum dos checkpoints é um candidato sem uma conversa com a Cohere, e nenhuma quantidade de comportamento de contexto longo ou flexibilidade de modo de raciocínio muda isso. Quando o uso não comercial é genuinamente aceitável — trabalho académico, investigação interna, uma plataforma de benchmark, uma comparação contra o seu próprio modelo — a licença é irrelevante e a escolha técnica é toda a decisão.

Nenhum dos dois passou por benchmark. Veja como escolher mesmo assim.

A ausência de números é real e não vai ser resolvida com uma leitura mais atenta. Nenhum dos dois cards faz qualquer afirmação de desempenho, nenhum leaderboard lista qualquer um dos modelos, e nenhum dos dois tem um provedor de inferência por trás — ou seja, nenhum provedor publicou o throughput ou o preço que normalmente substitui um benchmark. O que você pode fazer é criticar a estrutura, onde a evidência é sólida.

• Escolha o Tiny Aya Base 32K se você for treinar. Pré-treinamento contínuo, ajuste de instruções ou adaptação de domínio sobre um modelo multilíngue de 3.35B é o que a ficha técnica indica, e começar a partir de um checkpoint base significa que você não está lutando contra um pós-treinamento que não escolheu. A janela de 32K também suporta pesquisas de contexto longo que a base de fevereiro de 8K não suportava.

• Escolha Tiny Aya En-Thinker se quiser solicitar algo hoje. É o único dos dois que manterá uma conversa, e o único com um modo de raciocínio.

• Escolha ambos se a pergunta for científica em vez de prática. O par é uma comparação controlada — mesma arquitetura, mesmo tamanho, mesma janela, diferindo principalmente quanto à ocorrência de pós-treinamento — para investigar se os traços de raciocínio em inglês melhoram as respostas multilíngues. Essa é a pergunta que o En-Thinker foi lançado para que as pessoas pudessem explorar, e seu próprio ancestral é a linha de base mais limpa.

A two-column scoreboard titled 'Tiny Aya Base 32K vs Tiny Aya En-Thinker — the scoreboard'. Both columns use the same six labels. The 'Tiny Aya Base 32K' column reads 'Stage: Pretrained base', 'Chat template: none', 'Reasoning mode: none', 'Languages: 70+ claimed', 'Benchmarks: none published' and 'Providers: none'. The 'Tiny Aya En-Thinker' column reads 'Stage: Post-trained SFT', 'Chat template: included', 'Reasoning mode: thinking mode', 'Languages: 44 + English', 'Benchmarks: none published' and 'Providers: none'. A footer reads 'Both cards stated by Cohere Labs; neither model has any independent benchmark.' The OrcaRouter logo is composited in the bottom-right corner.

Uma nota prática sobre avaliar qualquer um deles: são checkpoints de pesquisa não comprovados, sem histórico de implantação, e um download BF16 de 6,7 GB mais tempo de GPU é um custo real para gastar em um modelo que nunca foi executado de forma independente. Fazer essa comparação por meio de um único endpoint em vez de levantar os pesos para cada candidato é mais barato — o OrcaRouter disponibiliza 195 modelos em uma única API com 0% de acréscimo sobre os preços de tabela dos provedores e failover automático entre provedores, portanto um checkpoint de pesquisa que você está apenas testando nunca fica em um caminho de produção. A Tiny Aya não está nele e não a hospedamos; o ponto é apenas que os modelos que você a testaria em comparaçãoem sua maioria estão.

O que resolveria isso

Duas coisas, e ambas são baratas para a Cohere Labs publicar e caras para qualquer outra pessoa produzir.

O primeiro é um benchmark — qualquer benchmark. Uma única avaliação de raciocínio multilíngue executada em ambos os checkpoints converteria toda a família de "declarado no card" para "medido", e responderia imediatamente se o design de pensamento em inglês supera o mesmo modelo sem pós-treinamento, que é a questão de pesquisa em torno da qual o lançamento é construído.

A segunda é uma configuração. A alegação de 32K em ambos os cartões é inverificável enquanto os repositórios estiverem restritos, e a diferença entre um treinamento prévio genuinamente de contexto longo e uma extensão de codificação posicional aplicada a um checkpoint de 8K é grande na prática, mesmo que ambos produzam um modelo que aceite 32K tokens. Abrir os dois arquivos de configuração fecharia essa lacuna de uma forma que nenhum texto de marketing consegue.

Até então, a resposta precisa para {{1}}Tiny Aya Base 32K ou Tiny Aya En-Thinker{{/1}} é que a comparação é real, mas a disputa não é. Mesmos pesos, {{2}}mesma janela, mesma licença, mesmo silêncio de todos que não os baixaram{{/2}} — um deles apenas tem o template de chat e as tags de pensamento, e o outro é aquilo a partir do qual foi feito.