
Kolibri vs Intern-Decision 4B: Um Escreve Documentos, o Outro Recusa-se a Escrever Seja o Que For
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 217 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 117 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 969 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 52 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 100 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 214 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A coisa mais útil a observar sobre Kolibri e Intern-Decision-4B é que eles não são o mesmo tipo de objeto, e tratar isto como uma comparação modelo versus modelo seria um erro de categoria. Kolibri é o modelo de linguagem de mistura de especialistas com 78,1 bilhões de parâmetros da Aleph Alpha, lançado em 3 de outubro de 2026, que ativa 3,46 bilhões de parâmetros por token e escreve texto em alemão e inglês. Intern-Decision-4B é um modelo multimodal de decisão estruturada com 4,54 bilhões de parâmetros da equipe InternLM, enviado ao Hugging Face em 26 de setembro de 2026, cujo cartão afirma claramente que ele "não chama generate() nem faz amostragem de texto de forma livre de modo algum". Um produz prosa. O outro produz uma distribuição de probabilidade sobre as opções que você fornece, em uma única passagem direta, e não tem nenhuma capacidade de escrever uma frase. Eles só se tornam concorrentes em uma única situação restrita, e saber exatamente qual é essa situação acaba sendo a coisa mais útil em qualquer um dos dois lançamentos.
Dois lançamentos, duas alegações concisas completamente diferentes
O card do Kolibri é uma especificação de um grande modelo de linguagem esparso: 50 camadas, todas de mistura de especialistas, 384 especialistas por camada, sendo um compartilhado e seis roteados, um contexto nativo de 262.144 tokens validado até 1.048.576, quatro níveis de esforço de raciocínio, chamada de ferramentas no estilo Hermes com um parser vLLM fornecido, pesos FP8 em blocos de 128×128 e termos Apache 2.0. Seu treinamento rodou 20 trilhões de tokens em 768 NVIDIA B200s ao longo de 21 dias — 392.000 horas de GPU a 6,4×10²³ FLOPs relatados e uma estimativa de 9,5×10² MWh incluindo sobrecarga do data center, excluindo ajuste fino supervisionado e aprendizado por reforço. A configuração mínima de serviço do card é duas placas A100 de 80 GB, duas H100 SXM5, uma H200, uma B200 ou uma B300, e o consumo de memória em FP8 é de cerca de 78 GB. É uma infraestrutura séria, e responde a perguntas gerando texto.
O Intern-Decision-4B é o tipo oposto de objeto, e a ficha do modelo é refrescantemente franca a respeito disso. É um fine-tune do Qwen3.5-4B no qual a torre de visão e o projetor ficam congelados, e apenas o backbone de linguagem é treinado. Você entrega a ele um estado, um esquema de perguntas nomeadas e, opcionalmente, até oito imagens, e ele retorna uma distribuição sobre as respostas candidatas para cada pergunta de uma só vez. O mecanismo é incomum e vale a pena enunciar com precisão: as opções são mapeadas para símbolos de token único abrangendo de A a Z, de a a z e de 0 a 9 — 62 candidatos, portanto no máximo 62 opções por pergunta —, o prompt é renderizado com um placeholder por campo, e o modelo lê os logits na posição imediatamente anterior a cada placeholder. O Softmax é aplicado apenas sobre os logits dos símbolos permitidos daquele campo, uma temperatura específica do checkpoint calibra o resultado, e os símbolos são mapeados de volta para os valores originais das suas opções como JSON tipado. Não há loop de decodificação, nem amostragem, nem prosa.
• Saída — Kolibri: texto em alemão ou inglês gerado livremente, chamadas de ferramentas, traços de raciocínio. Intern-Decision-4B: respostas JSON tipadas com uma probabilidade por opção.
• Parâmetros — Kolibri: 78.103.074.560 no total, 3.457.573.120 ativos. Intern-Decision-4B: 4,54 bilhões distribuídos em quatro fragmentos safetensors em bfloat16, com uma torre de visão congelada.
• Entrada — Kolibri: apenas texto. Intern-Decision-4B: texto mais até oito imagens.
• Capacidade de perguntas — Intern-Decision-4B: até 62 opções por campo, em uma única passagem direta, com tipos de pergunta 'choice', 'score' e 'noul' (sim/não). Kolibri: ilimitado em princípio, um token por vez na prática.
• Idioma — Kolibri: alemão e inglês por construção. Intern-Decision-4B: o que quer que o Qwen3.5-4B carregue, com todas as suítes de avaliação publicadas em inglês.
• Latência — Intern-Decision-4B: média de 44,16 ms, mediana de 44,03 ms e P95 de 44,60 ms por consulta em uma única RTX 4090, segundo sua própria medição. Kolibri: nenhuma métrica publicada por consulta.
Licença — ambas Apache 2.0; o Intern-Decision-4B é distribuído com o ficheiro de licença do Qwen preservado ao seu lado.

Por que um scorer 4B existe, afinal
O argumento em favor do Intern-Decision-4B não é que ele seja pequeno. É que pedir a um grande modelo generativo uma probabilidade não é o mesmo que medi-la, e a diferença é mensurável.
A própria tabela de benchmark do card faz o argumento com uma quantidade incomum de autoexposição. Em sete suítes de acurácia, o Intern-Decision-4B tem média de 90,02 — contra 88,74 do baseline mais forte com o qual se compara, um modelo chamado Jev. Mas a acurácia é a metade menos interessante. A tabela também reporta Brier score e erro de calibração esperado, e aí o quadro é mais exigente. O 4B registra um Brier de 0,347 e um ECE de 0,065, contra 0,358 e 0,095 do Jev. Os irmãos menores são onde a história da calibração se torna genuinamente informativa. O Intern-Decision-2B marca uma média de 84,68, bem à frente do 0.8B com 79,38 — e, ainda assim, seu ECE de 0,100 é pior que o 0,066 do 0.8B e pior que o 0,065 do 4B, com um Brier de 0,437 contra o 0,530 do 0.8B. O mais acurado dos dois modelos pequenos é o menos honesto sobre a própria confiança. Se você tivesse assumido que a calibração melhora com a acurácia, ou com o número de parâmetros, essa tabela é o contraexemplo em ambos os casos.
Um segundo diagnóstico separado abrange 96 casos construídos com distribuições de referência exatas em vez de rótulos rígidos amostrados — sorteios aleatórios, eventos compostos, histórico condicional, quebra-cabeças de probabilidade. O erro do modelo 4B nesse piloto caiu de 0,628 para 0,550 na métrica reportada, enquanto o modelo de comparação ficou em 0,595. O cartão deixa explícito que este piloto não foi usado para ajustar ou selecionar a temperatura publicada; a temperatura de 1,992418 do 4B foi ajustada separadamente em um conjunto de calibração. A equipe do InternLM também disponibilizou o próprio benchmark no repositório do GitHub — o gerador determinístico, as referências e o avaliador offline — o que significa que a alegação de calibração é do tipo raro que um terceiro pode realmente executar novamente em vez de aceitar por fé.
Nada no lançamento do Kolibri oferece um equivalente. Sua tabela comparativa relata a acurácia de tarefas em quatorze modelos em um único harness de fornecedor, e a acurácia é a métrica pela qual um modelo generativo pode ser medido. Não há nenhum valor de calibração, nem Brier nem ECE em qualquer parte do material, e não há como pedir a ele "a probabilidade de que esta cláusula contratual seja exequível" que não envolva amostrar uma frase e lê-la.
A única costura onde eles realmente se encontram
Coloque os dois lado a lado em um pipeline real e as formas ficam óbvias. Um fluxo de trabalho de documentos em alemão precisa das duas metades, e nenhuma ferramenta cobre a metade da outra.
Kolibri é a metade que lê e escreve. Uma equipe com contratos alemães ou documentação técnica recebe uma janela nativa de 262.144 tokens, um cache KV FP8, um tokenizador bilíngue que a Aleph Alpha relata em 4,90 bytes médios por token em texto da web em alemão, e chamada de ferramentas Hermes — ou seja, um modelo que consegue resumir um documento oficial, redigir uma resposta e conduzir um ciclo de ferramentas. O que ele não consegue fazer é informar sua própria confiança de uma forma que você possa auditar, porque tudo o que ele emite é uma string amostrada.
O Intern-Decision-4B é a metade que decide. Dada uma página de texto em alemão e um conjunto fixo de opções, ele retorna uma distribuição calibrada em 44 milissegundos em uma única GPU de consumo, sem etapa de geração e, portanto, sem variância de amostragem alguma. O que ele não consegue fazer é produzir o texto em alemão em primeiro lugar, e seus conjuntos de avaliação publicados são em inglês — seu comportamento em alemão é herdado da base Qwen3.5-4B em vez de ter sido treinado para isso, o que é uma limitação real para uma implantação em língua alemã e uma que ninguém avaliou.
Portanto, a resposta honesta de engenharia para um fluxo de trabalho regulado em língua alemã é que estas são duas etapas de um mesmo pipeline, não dois candidatos para um único slot. A questão prática é onde cada um é executado. O Kolibri precisa de duas H100s ou de uma B200 e de cerca de 78. O Intern-Decision-4B precisa de uma RTX 4090 e executa uma consulta em menos de 45 milissegundos. A assimetria de custo é de aproximadamente duas ordens de magnitude em hardware, e aponta para um design em que um pequeno pontuador roda continuamente em todos os casos e o grande gerador só é acionado quando um caso realmente precisa de texto. Essa é uma configuração mais barata e mais favorável à auditoria do que encaminhar todos os casos pelo modelo 78B para obter uma resposta que depois você tem de interpretar.

A realidade de hospedagem para ambos, e para que serve a camada
Nenhum dos modelos está disponível como uma API hospedada, e nós verificamos em vez de assumir. O Intern-Decision-4B não tem endpoint de fornecedor; o lançamento é pesos, um repositório GitHub e um Hugging Face Space. Suas contagens de download e curtidas mudaram desde o meio da semana, o que mostra que as pessoas estão adotando-o, mas ainda não há nenhuma rota paga chamável em qualquer lugar que nós nomearíamos.
O Kolibri também não tem um SKU de API da Aleph Alpha — o lançamento é composto por pesos, um relatório técnico e uma imagem de contêiner em ghcr.io/aleph-alpha/aleph-alpha-in. E não está no Orca: sondamos o catálogo com todas as grafias do prefixo do fornecedor e do modelo, e ele retorna não encontrado — o que preferimos dizer a dar a entender o contrário.
O que uma camada de roteamento muda aqui não é o acesso a esses dois modelos, e sim a economia de decidir se vale comprar o hardware para qualquer um deles. O teste honesto de pré-compra para a metade generativa é rodar a carga de trabalho contra um nível pequeno de mistura de especialistas que já é roteado — a variante Gemma 4 26B-A4B a US$ 0,06 por milhão de tokens de entrada e US$ 0,33 por milhão de saída, com janela de 262.144 tokens e entrada de texto, imagem e vídeo — em uma chave compatível com OpenAI ao preço de tabela do provedor sem nada a mais, e ver se a carga de trabalho de documentos em alemão realmente precisa de 78 bilhões de parâmetros antes de os GPUs serem encomendados. A metade de decisão não tem esse atalho, porque o comportamento de distribuição calibrada é o ponto central do modelo e nenhum nível roteado faz isso. Mas isso é, em si, a descoberta: ela mostra que o pontuador 4B é a parte que você vai realmente auto-hospedar, e o gerador é a parte que vale a pena testar de novo contra algo que você pode alugar hoje à tarde.
O que resolveria isso
Duas medições, e nenhuma delas existe ainda.
O primeiro é o Intern-Decision-4B com entrada em alemão. Todo conjunto publicado está em inglês e o modelo é um fine-tune de uma base multilíngue, então sua calibração em alemão é desconhecida — e a calibração é exatamente a propriedade que não se transfere de graça entre idiomas. Uma versão em alemão do piloto de distribuição de 96 casos seria o artefato mais informativo que alguém poderia publicar sobre esse modelo.
O segundo é o custo por decisão do Kolibri. Sua alegação de economia de serving é uma fronteira de Pareto de qualidade em relação a tokens decodificados por segundo por GPU, e não há página do Artificial Analysis para o Kolibri nem replicação de terceiros do harness. Até que alguém o execute, "78 bilhões de parâmetros" é uma especificação em vez de um custo, e o argumento para manter um scorer de 44 milissegundos à sua frente permanece um argumento de design em vez de uma medição.
Até lá, a maneira certa de interpretar esse pareamento não é como uma disputa. O Intern-Decision-4B é o lançamento tecnicamente mais interessante dos dois, porque a saída estruturada ciente de calibração é uma capacidade que quase nenhum modelo generativo oferece, e seu card permite verificar a alegação. O Kolibri é o lançamento de maior impacto, porque um laboratório europeu lançar um modelo Apache 2.0 com 78 bilhões de parâmetros com o pipeline de dados publicado junto é um evento de cadeia de suprimentos, e não um evento de modelo. Nenhum substitui o outro. Equipes que precisam dos dois devem planejar para ambos e dimensionar o hardware de acordo, e é no harness ao redor deles que o esforço de engenharia de fato se concentra.

