Inkling-Small-1
Guides & Insights

Inkling-Small: O modelo de um quarto do tamanho que supera seu próprio carro-chefe, e ainda fica atrás do índice.

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

O Thinking Machines Lab passou as duas semanas após lançar seu primeiro modelo de pesos abertos construindo um com cerca de um quarto do tamanho e, no placar do próprio laboratório, o menor vence. Inkling-Small relata 80.2% no SWE-bench Verified contra Inkling (77.6%), 89.5% no GPQA Diamond contra 87.2%, 64.7% no Terminal-Bench 2.1 contra 63.8% e 31.6% no Humanity's Last Exam contra 29.7% — de 276B parâmetros totais com 12B ativos, em vez de 975B com 41B. Dos números principais que os dois model cards compartilham, o carro-chefe de 975B mantém exatamente um: AIME 2026, por 1.6 pontos.

Então a Artificial Analysis executou ambos de forma independente e colocou o Inkling-Small em 40 no seu Intelligence Index contra os 41 do Inkling — o modelo menor ficou um ponto atrás. Ambos os resultados são reais, e o espaço entre eles é a coisa mais útil neste lançamento. Tudo o que está abaixo separa o que a Thinking Machines relata sobre seu próprio modelo do que outra pessoa mediu: os números do fornecedor vêm do anúncio e dos dois cartões de modelo do Hugging Face, os números independentes vêm das próprias execuções da Artificial Analysis, e os números de preço e contexto vêm dos dados do endpoint em tempo real do OpenRouter, verificados no dia em que isto foi escrito. Quando esses três discordam — e no tamanho do contexto eles discordam — nós dizemos isso em vez de escolher o mais lisonjeiro.

O que realmente foi lançado em 30 de julho

{{1}}Inkling-Small é um transformer de mistura esparsa de especialistas: 276B de parâmetros no total, 12B ativos por token, 42 camadas, com cada token roteado para 6 de 256 especialistas, mais 2 especialistas compartilhados que são acionados em tudo.{{/1}} {{2}}A atenção alterna entre camadas locais e globais.{{/2}} {{3}}Os pesos estão no Hugging Face sob a licença Apache 2.0, sem restrições comerciais; ele faz fine-tuning na API Tinker da Thinking Machines, e você pode conversar com ele por texto, imagem e áudio no Tinker Playground.{{/3}} {{4}}O laboratório diz que o modelo foi treinado em sistemas NVIDIA GB300 NVL72.{{/4}}

Inkling-Small-2

A multimodalidade é nativa, em vez de acoplada artificialmente, e a ficha técnica é incomumente específica sobre como. Não há codificador separado para visão ou áudio: o áudio chega como espectrogramas dMel, as imagens como patches de 40×40 pixels processados por um hMLP de quatro camadas, e ambos são incorporados diretamente no mesmo fluxo de tokens que o texto. A entrada é texto, imagens e áudio; a saída é somente texto, o que vale a pena afirmar claramente porque "multimodal" é lido como "ele pode falar" com frequência suficiente para arruinar uma tarde. O esforço de raciocínio é um dial com cinco configurações — minimal, low, medium, high, xhigh — de modo que os mesmos pesos possam ser executados de forma leve ou intensa.

A parte interessante da receita é o pós-treinamento. O Inkling-Small foi destilado on-policy com o Inkling completo como professor, e depois recebeu aproximadamente mais duas semanas de aprendizado por reforço ampliado em codificação com agentes. Essa ordem explica o formato dos resultados: o aluno herdou a competência geral do professor e, em seguida, recebeu treinamento extra exatamente no eixo em que agora supera o professor.

O placar que a Thinking Machines publicou

Benchmarks de fornecedores são marketing até que alguém os reproduza; portanto, leia esta seção como o que o laboratório afirma, não como o que foi verificado. Ainda assim, é um conjunto amplo, e é amplo em uma direção nada lisonjeira para o carro-chefe.

Inkling-Small-3

Além dos quatro números compartilhados, o cartão completa o restante do quadro — todas as execuções da própria Thinking Machines:

Trabalho agêntico — 1269 Elo no GDPval-AA v2, um benchmark de tarefas econômicas realistas em vez de quebra-cabeças.

Gráficos e documentos — 77,4% no CharXiv RQ, subindo para 81,3% quando o modelo pode escrever e executar Python. Esse salto de 3,9 pontos é uma dica útil de que o acesso a ferramentas rende mais em tarefas de raciocínio visual do que a engenharia de prompt.

Vision — 74,0% no MMMU Pro, um pouco acima dos 73,5% da Inkling.

Audio — 90.1% VoiceBench e 77.0% MMAU, ambos ligeiramente abaixo dos 91.4% e 77.2% do flagship. Audio é uma das duas áreas onde a redução claramente teve um custo.

Segurança — 98,4% em StrongREJECT e 96,9% em prompts benignos do FORTRESS, mas 71,6% em adversariais do FORTRESS contra os 78,0% do carro-chefe. Esse é o outro custo: uma regressão de 6,4 pontos em robustez adversarial, o que importa mais do que qualquer ganho em codificação se o modelo for ficar atrás de uma caixa de texto pública.

Previsão — 61.3 ± 0.46 Índice de Brier no ForecastBench sem acesso à busca, e 0.1238 ± 0.0086 de escore de Brier no Prophet Arena. Relatar barras de erro já é mais disciplina do que a maioria dos posts de lançamento consegue.

Uma lacuna: a ficha do carro-chefe lista 54,3% no SWE-bench Pro, o irmão mais difícil do SWE-bench Verified. A ficha do Inkling-Small não informa o SWE-bench Pro. Dado o quão enfaticamente o número do Verified é destacado, sua ausência é o número que mais gostaríamos de ver preenchido.

O que o índice independente diz em vez disso

Artificial Analysis coloca Inkling-Small em 40 na versão 4.1 do seu Índice de Inteligência, um ponto abaixo de Inkling, com 41. O índice é um composto de nove avaliações — GDPval-AA v2, τ³-Banking, Terminal-Bench v2.1, SciCode, Humanity's Last Exam, GPQA Diamond, CritPt, AA-Omniscience e AA-LCR — e essa lista explica a maior parte da aparente contradição. Apenas duas das nove se sobrepõem à demonstração de raciocínio no cartão da Thinking Machines. O restante é ponderado para o uso de ferramentas por agentes, recuperação de contexto longo e resistência a alucinações, e um modelo pode vencer os benchmarks que um laboratório escolhe publicar enquanto perde os que um terceiro escolhe executar. Nenhuma das partes está mentindo; elas estão medindo coisas diferentes.

Inkling-Small-4

Há também um detalhe nas letras miúdas que vale mais do que a manchete de um ponto: a Artificial Analysis lista a entrada do carro-chefe como Inkling (xhigh) — sua configuração de esforço de raciocínio máxima — enquanto a linha do Inkling-Small não traz sufixo de esforço. Ou seja, a vantagem de um ponto do carro-chefe foi registrada com o ajuste de raciocínio no máximo. Se a equalização de esforço mudasse essa comparação nem que fosse levemente, o último argumento a favor do modelo maior apenas com base em capacidade iria junto.

Onde os dados independentes divergem totalmente é em velocidade e custo, e aqui eles favorecem o modelo pequeno por margens que nenhuma tabela de benchmark transmite:

Velocidade de saída — 133 tokens por segundo contra 80 do Inkling (xhigh). A Artificial Analysis classifica o Inkling-Small em 7º lugar entre 101 modelos da sua classe em velocidade, contra uma mediana de 66 na classe.

Tempo até o primeiro token — 1,63s contra 1,84s. Uma vantagem real, porém pequena.

Preço combinado por 1M de tokens — $0,22 versus $0,72 na ponderação deles. Aproximadamente um terço do custo, por um ponto de índice a menos.

Ranking de inteligência — #15 de 101, contra uma pontuação mediana da classe de 25. Folgadamente acima da média, mas não chega nem perto da fronteira.

Verbosidade — e aqui está o problema. Ele queimou 130M tokens de saída para percorrer o índice, contra uma mediana de 100M. O resumo da própria Artificial Analysis o descreve como "notavelmente rápido, porém um tanto verboso." Ele pensa cerca de 30% mais do que o normal, o que silenciosamente consome parte do desconto por token.

Uma pequena nota de escrituração, já que qualquer um que compare fontes vai se deparar com isso: a Artificial Analysis lista a contagem de parâmetros como 266B no total, enquanto o anúncio, ambos os model cards e a OpenRouter dizem 276B. Usamos 276B em todo o texto. Isso não muda nenhuma conclusão, mas é o tipo de discrepância que vale a pena conhecer antes de citar um número em um documento de design.

O que você pode realmente alugar hoje, que não é o que a ficha técnica diz

A diferença entre um anúncio de pesos abertos e um endpoint utilizável é onde a maior parte da cobertura de lançamento deixa de prestar atenção. A Thinking Machines anuncia uma janela de contexto de até 1 milhão de tokens, e a Artificial Analysis também lista 1 milhão. No OpenRouter, ambos os provedores que atualmente servem o Inkling-Small limitam isso a 524.288 tokens — metade do valor anunciado. Isso não é uma contradição, mas sim uma diferença entre o que a arquitetura suporta e o que alguém implementou em produção. Em contraste, o Inkling principal tem um endpoint com os 1.048.576 tokens completos, embora esse mesmo endpoint limite as completions a 32.768 tokens.

O restante da imagem ao vivo, lido dos dados de endpoint do OpenRouter:

Dois provedores, dois preços — $0,45 por 1M de entrada e $1,20 por 1M de saída de um, $0,50 e $1,20 do outro. A Artificial Analysis lista a taxa de primeira parte da própria Thinking Machines ainda mais baixa, em $0,30 e $1,20, com entrada em cache a $0,06. A hospedagem de terceiros está cobrando um prêmio de 50–67% sobre a entrada para os mesmos pesos.

Cache de prompt — $0,10 por 1M de tokens de entrada em cache via OpenRouter, contra $0,17 para o modelo principal.

Os números que você aluga não são os números que foram submetidos ao benchmark — a ficha do modelo lista BF16 e NVFP4. O endpoint mais barato serve fp8; o outro não declara quantização alguma. As pontuações de benchmark do fornecedor não foram medidas em uma implantação fp8 desses pesos, e os efeitos da quantização em execuções longas de agentes são exatamente o tipo de coisa que uma margem de 0,9 ponto no Terminal-Bench não consegue suportar. Se você estiver reproduzindo um número, anote qual endpoint você usou.

A cobertura de funcionalidades é desigual por provedor — ambos os endpoints expõem raciocínio e reasoning_effort, então o controle de pensamento de cinco configurações funciona. Mas apenas um anuncia tool calling e logprobs, e nenhum dos dois anuncia atualmente response_format, o parâmetro de saída estruturada/modo JSON. O Inkling principal tem um endpoint que anuncia. Se o seu pipeline depende de JSON com esquema obrigatório, esse é o detalhe que vai te morder no primeiro dia, e é uma limitação do provedor, não do modelo.

Teto de conclusão — 262.144 tokens no endpoint fp8; o outro declara não ter limite.

O caso de custo, com base em contagens de tokens medidas.

Preços por milhão de tokens são uma péssima forma de comparar modelos de raciocínio, porque a única variável é quantos tokens eles queimam pensando. A Artificial Analysis publica o gasto real, que é um instrumento muito melhor: fazer o Inkling-Small passar pelo Intelligence Index completo consumiu cerca de 130 milhões de tokens de saída e custou $192.37, o que dá cerca de $0.07 por tarefa na média ponderada deles.

Compare isso com a mesma métrica para modelos que as pessoas realmente implantam: DeepSeek V4 Flash a $0.03 por tarefa, gpt-oss-120b a $0.08, Gemini 3.6 Flash a $0.56, GLM-5.2 a $0.57, Kimi K3 a $0.86, GPT-5.6 Sol a $1.23, Claude Opus 5 a $2.34, Claude Fable 5 a $3.15. O Inkling-Small é o segundo modelo mais barato desse grupo e cerca de 18× mais barato por tarefa que o GPT-5.6 Sol, que pontua 59 a 40.

Há também uma maneira mais clara de ver por que o preço caiu até onde caiu. Os parâmetros ativos caíram de 41B para 12B, um fator de 3,4. O preço de saída caiu de $4,05 para $1,20 por milhão, um fator de 3,375. O preço de aluguel de um MoE esparso é essencialmente apenas o seu custo computacional por token, e a Thinking Machines cobrou de acordo, em vez de precificar com base no benchmark.

Uma observação prática sobre fazer essa comparação você mesmo: o Inkling-Small não está no catálogo da OrcaRouter hoje, então você o alugaria pelos próprios endpoints dele. Os modelos fechados contra os quais você o mediria — GPT-5.6 Sol, Claude Opus 5, Gemini 3.6 Flash e o restante dessa lista — estão na OrcaRouter atrás de uma única chave com margem de 0%, ou seja, você paga o preço de tabela de cada provedor sem nada adicionado por cima. Isso é importante especificamente para um modelo de custo: o número que você coloca na planilha é o número que é cobrado, e quando um provedor corta preços, isso chega ao nosso lado no mesmo dia, em vez de após uma renegociação. O failover automático entre provedores cobre a outra metade de uma avaliação, que é o braço de controle caindo no meio da execução e envenenando silenciosamente seus números.

Onde ele realmente se posiciona entre os modelos open-weight

Comparado ao modelo principal, o Inkling-Small parece um triunfo. Comparado à concorrência, parece um modelo sólido de pesos abertos de meio de tabela, e a cobertura do lançamento deixou de fazer, em sua maior parte, a segunda leitura.

No Índice de Inteligência Artificial Analysis, os modelos à frente de ambos os Inklings incluem Claude Opus 5 com 61, Claude Fable 5 com 60, GPT-5.6 Sol com 59, Kimi K3 com 57, Grok 4.5 com 54, GLM-5.2 e Muse Spark 1.1 com 51, e Gemini 3.6 Flash com 50. Isso é esperado — esses são sistemas de fronteira, a maioria fechados, vários deles enormes.

Aquele que de fato deveria mudar uma decisão é DeepSeek V4 Flash, que marca 50 contra os 40 do Inkling-Small, com 284B no total e 13B ativos — praticamente a mesma classe de tamanho e o mesmo custo-benefício de pesos abertos, por menos da metade do custo por tarefa. Se o que você quer é o modelo de pesos abertos mais barato que seja capaz, os números independentes apontam para lá, não para cá. Ele também, ao contrário do Inkling-Small, está disponível via OrcaRouter, então testar essa alternativa na sua própria carga de trabalho é uma mudança de string de modelo, em vez de um exercício de aquisição.

O que o Inkling-Small tem que o DeepSeek V4 Flash não tem é entrada nativa de áudio e imagem nos mesmos pesos, um seletor de pensamento de cinco níveis e o ajuste fino Tinker do laboratório que o treinou. Esses são diferenciais reais para um agente multimodal, e é essa a razão honesta para escolhê-lo — não a pontuação do índice.

Quem deve se mover, e quem deve ficar parado

A decisão se divide de forma limpa, o que é incomum o bastante para valer a pena ser dito.

Move from Inkling to Inkling-Small if you are running coding agents. The vendor numbers favour the small model on SWE-bench Verified and Terminal-Bench, the extra agentic RL is the documented reason, and it costs about a third as much and returns tokens 1.66× faster. Paying 3.3× for one index point measured at maximum thinking effort is a hard case to make.

Opte se o custo por tarefa de raciocínio for a restrição limitante e você aceitar 40 no índice. US$ 0,07 por tarefa, com uma taxa de acerto de cache de US$ 0,06 por milhão no endpoint de primeira parte, é um preço agressivo para um modelo com áudio e visão nativos.

Mude se você estiver fazendo fine-tuning. Um modelo 276B/12B é dramaticamente mais barato de adaptar e servir do que 975B/41B, e o Tinker suporta ambos.

Continue na Inkling se você precisar de áudio longo. Esta é a regressão mais acentuada desta versão e está escondida nas fichas dos modelos: o modelo principal recomenda entradas de áudio com menos de 20 minutos, enquanto a ficha do Inkling-Small recomenda menos de 2 minutos. Uma redução de dez vezes. Se você estava transcrevendo ou raciocinando sobre reuniões, o modelo pequeno não é um substituto direto por nenhum preço.

Fique se precisar de contexto além de 512K a partir de um endpoint hospedado, ou de conclusões mais longas que 262K tokens. Hoje, apenas o modelo principal tem um endpoint que atende o milhão completo.

Fique se você precisar de JSON com esquema obrigatório sem escrever seu próprio loop de validação e nova tentativa, até que um provedor disponibilize response_format para o modelo pequeno.

Fique se a robustez adversarial for essencial. 71.6% versus 78.0% no FORTRESS adversarial é a direção errada para qualquer coisa voltada ao usuário, e é o próprio número do laboratório.

Três perguntas que a cobertura do lançamento deixou em aberto

O Inkling-Small é apenas um Inkling destilado?

Em parte, e a parte que não é é a que importa. A destilação on-policy com Inkling como professor foi uma etapa do pós-treinamento, então grande parte da capacidade geral realmente é herdada. Mas este é um modelo com arquitetura separada — 42 camadas contra as 66 do carro-chefe, com a mesma topologia de roteamento de 6 especialistas ativos entre 256, mais 2 compartilhados, o que significa que os especialistas em si são mais estreitos, não menos numerosos. E recebeu cerca de duas semanas de RL de codificação agêntica que o professor nunca teve. Essa última etapa é a razão pela qual um aluno destilado supera seu professor em benchmarks de codificação, o que de outra forma não deveria acontecer.

É realista eu mesmo hospedar isso?

Somente em hardware potente. 276B de parâmetros equivalem a cerca de 276GB de pesos em 8 bits e aproximadamente 552GB em BF16, antes de qualquer cache KV — um nó multi-GPU de qualquer forma, não uma workstation. O lado positivo do MoE esparso é o custo de inferência, não o uso de memória; você armazena todos os 276B e computa com 12B. O cartão menciona SGLang, vLLM, TokenSpeed, Unsloth e Hugging Face Transformers como caminhos de serving suportados e lista os formatos numéricos BF16 e NVFP4. Observe também que ambos os endpoints hospedados atualmente servem uma versão quantizada, então "o mesmo modelo" auto-hospedado em BF16 não se comportará de maneira idêntica à API que você testou.

A 975B Inkling ainda tem razão de existir?

Três, e são todas limitadas: o contexto servido completo de 1M de tokens, entradas de áudio com mais de dois minutos e melhor comportamento de segurança adversarial. Notadamente, não se pode dizer com confiança que "é mais inteligente" esteja nessa lista — um ponto de índice com esforço máximo de pensamento, contra um conjunto de benchmarks de fornecedores que o modelo menor vence na maioria das vezes, não é um argumento de capacidade. Duas semanas após lançar um carro-chefe de 975B, a Thinking Machines lançou o modelo que dificulta a recomendação do carro-chefe. Isso é ou franqueza incomum ou velocidade incomum, e de qualquer forma é um bom sinal sobre o laboratório.

O que assistir em seguida

Três coisas determinarão como este lançamento envelhece. Se um endpoint aparecer servindo o contexto de 1M anunciado, o que removeria a vantagem restante mais clara do carro-chefe. Se alguém publicar uma comparação independente com esforço equivalente dos dois modelos, que é a única forma de saber se aquele ponto de índice é real. E se a recomendação de áudio de 2 minutos é uma limitação de treinamento ou um padrão de serviço — porque se for este último, o maior motivo para permanecer no modelo maior simplesmente evapora. Até lá, o resumo honesto é que a Thinking Machines lançou um modelo que custa um terço do preço, é dois terços mais rápido, melhor em codificação segundo suas próprias evidências, marginalmente atrás na pontuação agregada independente e claramente atrás de um rival do mesmo tamanho que a maior parte da cobertura não mencionou.

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube