Análise do Modelo Inkling AI: Primeiro Modelo de Pesos Abertos da Thinking Machines, Testado e Explicado
Guides & Insights

Análise do Modelo Inkling AI: Primeiro Modelo de Pesos Abertos da Thinking Machines, Testado e Explicado

Autor

Jim Song

Data de publicação

Modelos mais recentes · 20Ver todos os modelos
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Esta análise do modelo Inkling AI analisa de perto o lançamento inaugural da Thinking Machines Lab, a startup liderada pela ex-CTO da OpenAI, Mira Murati. Inkling é um modelo multimodal de código aberto, com arquitetura de Mistura de Especialistas (MoE), janela de contexto de 1 milhão de tokens e um dial controlável de “esforço de pensamento”. É rápido, barato para auto-hospedar e construído para personalização, não para dominar rankings. A seguir, separamos os benchmarks auto‑relatados pelo fornecedor das medições independentes, explicamos a arquitetura, mostramos como executá‑lo e explicamos exatamente quem deve (e não deve) adotá-lo.

Data: 2026-07-16 — um dia após o lançamento. Esta é uma análise baseada em pesquisa; ainda não existem testes práticos de longo prazo para qualquer modelo tão novo, e sinalizamos cada número não verificado abaixo.

Um aviso para construtores: se você quiser testar o Inkling junto com outros modelos, OrcaRouter atua como front-end para modelos disponíveis via API com um único endpoint compatível com OpenAI, para que você possa comparar e alternar sem novas integrações.

- Veredito TL;DR:Inkling é um modelo aberto genuinamente capaz e eficiente que se destaca para fine-tuning e implantação sensível a custos, mas não é um líder de fronteira e seu criador afirma isso abertamente. Se você quer uma base personalizável e livre de royalties com uma imensa janela de contexto, é um dos lançamentos mais interessantes de 2026. Se você quer o modelo mais forte disponível, procure em outro lugar.

- O que é: Um modelo de raciocínio MoE de pesos abertos (Apache 2.0). Para quem é: Profissionais que desejam ajustar e auto-hospedar em vez de pagar por uma API de fronteira fechada.

Principais conclusões

Fabricante & data: Thinking Machines Lab; lançado em 15 de julho de 2026 como o primeiro modelo do laboratório.

Arquitetura: Sparse MoE, 975B total / 41B parâmetros ativos, 66 camadas, até 1M de tokens de contexto nos pesos (256K via APIs hospedadas).

Licença: Apache 2.0 — pesos completos no Hugging Face, gratuito para uso comercial e auto-hospedagem.

Posicionamento honesto: A empresa afirma claramente que “não é o modelo mais forte disponível hoje, fechado ou aberto”.

Pontuação independente: 41/100 no Artificial Analysis Intelligence Index — #10 de 97 modelos, e à frente de vários pares abertos (veja a reconciliação abaixo).

Custo: Os pesos são livres de royalties para auto-hospedagem; o acesso hospedado começa em cerca de $1,87 / 1M de tokens de entrada.

Ressalva: Quase todos os principais benchmarks são auto-relatados pelos fornecedores e não são auditados de forma independente.

Quem está por trás do Inkling?

- Caixa do Fundador. Inkling é o primeiro modelo da Thinking Machines Lab (thinkingmachines.ai), fundada por Mira Murati, anteriormente Diretora de Tecnologia (CTO) na OpenAI. O laboratório operou em relativo sigilo antes deste lançamento e adotou uma postura de pesos abertos que contrasta com a abordagem de modelo-fechado principal da antiga empregadora de Murati. A Thinking Machines não monetiza o modelo em si — a receita flui através de sua Tinker plataforma de fine-tuning e parceiros de hospedagem terceirizados. Esse modelo de negócio é central para entender a Inkling: os pesos são um acesso gratuito, e a empresa ganha quando você personaliza ou escala.

O que é Inkling?

Inkling é um modelo de linguagem e raciocínio grande, multimodal, de pesos abertos, Mistura de Especialistas, anunciado pela Thinking Machines Lab em 15 de julho de 2026 e lançado sob a permissiva Apache 2.0 licença com pesos completos no Hugging Face.

O que torna este lançamento notável é o enquadramento. Em vez de reivindicar uma coroa de fronteira, a Thinking Machines descreve o Inkling como um modelo aberto versátil, eficiente e customizável. Em uma admissão incomumente sincera para um dia de lançamento, a empresa afirma que o Inkling “não é o modelo mais forte disponível hoje, fechado ou aberto.” Essa honestidade define o tom para toda esta análise: o Inkling é uma ferramenta projetada para ser adaptada, auto-hospedada e ajustada, não um troféu de benchmark.

Cobertura da Fortune e do TechCrunch ecoou essa leitura. O TechCrunch argumentou que a Inkling não ameaça a OpenAI, a Anthropic ou o Google no nível de fronteira, mas sim pressiona a camada intermediária de provedores de hospedagem de pesos abertos e plataformas de ajuste fino. A Forbes enquadrou a estratégia de pesos abertos de Murati como mais próxima do manual chinês de modelos abertos (DeepSeek, Qwen, Kimi) do que dos carros-chefe fechados dos EUA — uma narrativa de pesos abertos entre EUA e China que perpassa grande parte dos comentários do lançamento.

Arquitetura e especificações

Por baixo dos panos, o Inkling é um transformer esparso de Mistura de Especialistas. Apenas uma fração de seus parâmetros é ativada por token, o que mantém a inferência eficiente apesar do grande número total de parâmetros. Os detalhes estão documentados no cartão do modelo oficial e no blog do Hugging Face.

Parâmetros totais: 975B

Parâmetros ativos: 41B (MoE esparso)

Camadas: transformador apenas decodificador de 66 camadas

Especialistas: 256 roteados + 2 compartilhados; 6 de 256 roteados por token (os 2 compartilhados sempre ativos)

Roteamento: Sigmoid / aux-loss-free

Atenção: Híbrido, janela deslizante 5:1 (local) para global; 8 cabeças KV

Codificação de posição: aprendidosembeddings de posição relativa (não RoPE)

Multimodalidade: Sem codificador — áudio como espectrogramas dMel, imagens como patches de 40×40, alimentados diretamente

Extras: Convoluções curtas (SConv); camadas MTP para decodificação especulativa

Numéricos: BF16, MXFP8, NVFP4 (NVFP4 checkpoint para NVIDIA Blackwell)

Janela de contexto: Até 1.000.000 tokens nos pesos (256K em APIs hospedadas)

Variante menor: Inkling-Small, 276B total / 12B ativos (preview, pesos ainda não lançados)

Algumas escolhas de design diferenciam o Inkling de um MoE padrão:

Layout especialista. Com 256 especialistas roteados mais 2 especialistas compartilhados, e 6 especialistas roteados disparando por token, o par compartilhado atua como um "coletor de especialistas" sempre ativo que captura computação comum enquanto os especialistas roteados se especializam. O roteamento sigmoide sem perda auxiliar evita o termo de penalidade de balanceamento de carga usado por muitos designs de MoE.

Embeddings de posição relativa, não RoPE. A maioria dos modelos modernos de contexto longo depende de embeddings rotativos; a Inkling, em vez disso, usa embeddings de posição relativa aprendidos, uma escolha incomum nesta escala.

Multimodalidade sem codificador. Em vez de acoplar codificadores separados de visão/áudio, o Inkling ingere patches de imagem de 40×40 e espectrogramas de áudio dMel diretamente na pilha do transformer. Isso simplifica o pipeline e é parte da razão pela qual o modelo é descrito como nativamente multimodal.

MTP para decodificação especulativa. Camadas de predição de múltiplos tokens (MTP) atuam como um rascunhador integrado, acelerando a geração sem um modelo de rascunho separado.

Nota do editor — adicionar visual:Um diagrama de blocos rotulado de uma camada Inkling — atenção global vs janela deslizante (5:1), o roteador de especialistas 256+2 com 6 especialistas ativos destacados, SConv e a cabeça de rascunho MTP.

Treinamento e o dial de "esforço mental"

Inkling foi pré-treinado em 45 trilhões de tokens multimodais abrangendo texto, imagens, áudio e vídeo, usando um otimizador híbrido (Muon para pesos de matriz grandes, Adam para o restante) em sistemas NVIDIA GB300 NVL72. O pós-treinamento usou aprendizado por reforço assíncrono em grande escala, escalado além de 30M+ rollouts em duas longas execuções contínuas, inicializadas a partir de ajuste fino supervisionado inicial em dados sintéticos.

Uma característica distintiva é um parâmetro controlável de esforço de raciocínio, demonstrado variando de aproximadamente 0,2 a 0,99, onde valores mais altos significam mais raciocínio e mais custo. Isso permite que os operadores troquem latência e gasto por profundidade de pensamento. Todos os números de benchmark abaixo foram executados com Esforço = 0,99.

Esforço de pensamento controlável: um guia operacional

Na implantação, o controle de esforço é exposto como um enum reasoning_effort com os níveis none / minimal / low / medium / high / xhigh / max. Não existe uma única configuração “correta” — é uma alavanca dinâmica para o trade-off entre latência, custo e qualidade. Use a tabela abaixo como um mapa inicial (orientação relativa; a qualidade de nível benchmark foi medida no topo da faixa):

nenhum / mínimo. Latência relativa e custo de token: Menor; Melhor para: Classificação, extração, formatação, roteamento, cola de recuperação

baixo. Latência relativa e custo de token: Baixo; Melhor para: Perguntas e respostas curtas, sumarização simples, trabalhos em lote de alto volume

médio. Latência relativa e custo de token: Moderado; Melhor para: Chat geral, rascunho, maioria das chamadas de ferramentas de agente

Alta. Latência relativa & custo de token: Mais alta; Melhor para: raciocínio em várias etapas, geração de código, análise

xhigh / máx. Latência relativa e custo de token: Máximo; Melhor para: Matemática difícil, raciocínio estilo competição, paridade de benchmark (Effort=0.99)

Você pode rodar localmente? Hardware e VRAM

Como o Inkling é um modelo de 975B parâmetros, "local" significa realisticamente um servidor com múltiplas GPUs, não um laptop. Requisitos aproximados (de acordo com a cobertura de lançamento e ferramentas da comunidade):

BF16 (completo). VRAM agregada aprox.: ~2 TB; Exemplos de configurações: 8× NVIDIA B300 ou 16× H200

NVFP4 (quantizado). Aprox. VRAM agregada: ~600 GB; Exemplos de configurações: 4× NVIDIA B300, ou 8× H200

GGUF (comunidade). VRAM agregada aprox.: Varia por quant; Exemplos de configurações: Existem builds Unsloth GGUF para pegadas menores/quantizadas

O checkpoint NVFP4 — lançado especificamente para a NVIDIA Blackwell — reduz o custo de memória em aproximadamente dois terços em relação ao BF16, o que é a diferença entre um nó B300 de 8 GPUs e um de 4 GPUs. Para a maioria das equipes, isso ainda aponta para um provedor de hospedagem ou um nó GPU alugado, em vez de hardware próprio. As quantizações GGUF do Unsloth ampliam ainda mais o alcance na hierarquia de hardware para experimentação, com algum custo de qualidade.

Guia rápido de implantação

Inkling expõe uma API compatível com OpenAI, então a maioria do código cliente existente funciona como uma substituição direta com uma URL base e nome de modelo alterados. Os três caminhos de serviço comuns:

vLLM — servidor de comando único (por padrão, porta 8000):

vllm serve thinkingmachines/Inkling --port 8000
# em seguida, chame o endpoint compatível com OpenAI em http://localhost:8000/v1

SGLang — fragmentar por 8 GPUs (padrão para a porta 30000):

python -m sglang.launch_server \
--model-path thinkingmachines/Inkling \
--tp 8 --port 30000

Hugging Face transformers — carregue via a classe auto multimodal:

de transformers import AutoModelForMultimodalLM, AutoProcessor

model = AutoModelForMultimodalLM.from_pretrained("thinkingmachines/Inkling")
processor = AutoProcessor.from_pretrained("thinkingmachines/Inkling")
# passe reasoning_effort em {none, minimal, low, medium, high, xhigh, max}

Como o endpoint é compatível com OpenAI, migrar um aplicativo existente geralmente é uma questão de apontar seu SDK para a nova URL base e ajustar reasoning_effort a gosto. Runtimes adicionais no lançamento incluem TokenSpeed e Unsloth.

Onde executá-lo: disponibilidade do provedor de inferência

Se você preferir não gerenciar GPUs, vários parceiros hospedam o Inkling. Opções 'Run Inkling on X' no lançamento:

Tinker (Thinking Machines). Função: Ajuste fino; Notas: 64K e 256K opções de contexto; 50% de desconto de lançamento por tempo limitado (pago)

Together AI. Função: Inferência hospedada; Observações: Endpoints compatíveis com OpenAI

Fireworks. Função: Inferência hospedada; Notas:

Modal. Função: Inferência hospedada / GPU sem servidor; Notas:

Databricks. Função: Inferência hospedada; Notas: por meio de Unity AI Gateway

Baseten. Função: Inferência hospedada; Notas:

Benchmarks: alegações do fornecedor vs. medição independente

Esta é a seção mais importante de qualquer honesta Inkling review 2026, porque os números vêm de dois lugares muito diferentes.

Divulgação: Com a única exceção do Artificial Analysis Index, todos os benchmarks Inkling abaixo são auto‑relatados pelo fornecedor no lançamento (Esforço = 0,99, temperatura 1,0) e não foi auditado de forma independente. Os números dos concorrentes são provenientes de terceiros (MarkTechPost, Artificial Analysis) ou foram reexecutados pela Thinking Machines, e são igualmente não auditados de forma independente aqui. Alguns números possuem qualificadores de harness ou subconjunto. Trate todos como indicativos, não como verdade absoluta.

Pontuações autorrelatadas do fornecedor

De acordo com os próprios materiais de lançamento da Thinking Machines:

AIME 2026 (matemática): 97,1%

GPQA Diamond (raciocínio científico): 87.2%

SWE-bench Verified (codificação, ambiente apenas bash): 77.6%

SWE-bench Pro (Public): 54.3%

MMMU Pro (multimodal): 73.3%

VoiceBench (áudio): 91.4%

MMAU (áudio): 77.2%

IFBench (seguimento de instruções): 79.8%

Terminal Bench 2.1 (terminal agêntico): 63.8

FORTRESS Adversária: 78,0%

SimpleQA Verificado: 43.9%

No papel, esses números parecem fortes, especialmente os de raciocínio matemático e científico. Mas a empresa avaliou a Inkling em relação a versões concorrentes de futuro próximo (GPT 5.6 Sol, Claude Fable 5, Gemini 3.1 Pro, DeepSeek V4 Pro, Kimi K2.5/K2.6, GLM 5.2, Nemotron 3 Ultra) usando pontuações que ela mesma gerou. Esses números concorrentes podem não corresponder aos valores informados pelos próprios concorrentes, portanto as comparações diretas devem ser lidas com cautela.

Confronto direto entre múltiplos modelos (rivais de pesos abertos)

A comparação lado a lado mais clara do Inkling com outros modelos de peso aberto vem de tabela de comparação do MarkTechPost (reproduzida abaixo, atribuída a MarkTechPost). É útil precisamente porque coloca os rivais em um único quadro:

HLE. Inkling: 29.7%; Nemotron 3 Ultra: 26.6%; Kimi K2.6: 35.9%; GLM 5.2: 40.1%; DeepSeek V4 Pro: 35.9%

AIME 2026. Inkling: 97.1%; Nemotron 3 Ultra: 94.2%; Kimi K2.6: 96.4%; GLM 5.2: 99.2%; DeepSeek V4 Pro: 96.7%

SWE-bench Verified. Inkling: 77.6%; Nemotron 3 Ultra: 70.7%; Kimi K2.6: 80.2%; GLM 5.2: 80.0%; DeepSeek V4 Pro: 80.6%

Terminal Bench 2.1. Inkling: 63.8%; Nemotron 3 Ultra: 56.4%; Kimi K2.6: 71.3%; GLM 5.2: 82.7%; DeepSeek V4 Pro: 64%

FORTRESS (adversarial). Inkling: 78.0%; Nemotron 3 Ultra: 77.6%; Kimi K2.6: 65.6%; GLM 5.2: 71.3%; DeepSeek V4 Pro: 36.0%

MarkTechPost. Não auditado de forma independente.

O padrão é claro e consistente com a própria modéstia da Thinking Machines. Inkling lidera em FORTRESS (segurança adversarial) e supera o Nemotron 3 Ultra em todos os aspectos, mas ele perde para GLM 5.2, Kimi K2.6 e DeepSeek V4 Pro no HLE, SWE-bench Verified e especialmente Terminal Bench 2.1 (63,8% contra 82,7% do GLM 5.2). Se codificação agêntica e tarefas de terminal são sua prioridade, os principais modelos abertos chineses estão à frente hoje.

Medição independente (Artificial Analysis)

Para uma leitura mais neutra, Artificial Analysis avaliou Inkling em 2026-07-15 e o colocou em 41/100 em seu Intelligence Index, classificado em #10 de 97 modelos. Dois pontos sobre como interpretar essa classificação de forma justa:

É uma forte demonstração de modelo aberto, não um #1 geral. De acordo com a Artificial Analysis, o índice de 41 da Inkling fica à frente do Nemotron 3 Ultra (38), Gemma 4 31B (29) e gpt-oss-120b (24) — portanto, entre pares de pesos abertos, é competitivo a líder. Mas #10 de 97 significa que nove modelos têm classificação mais alta no geral, consistente com o enquadramento “capaz, não de fronteira”.

É na eficiência que ele se destaca. A Artificial Analysis observa forte eficiência de tokens — cerca de 25 mil tokens para concluir seu conjunto de avaliação contra 37–43 mil para modelos de comparação — e um GDPval-AA v2 Elo de 1238, à frente do Kimi (1190) e DeepSeek V4 Flash (1189), além de uma pequena vantagem (+2) no AA-Omniscience.

Velocidade de saída medida em 72,7 tokens/s com um tempo até o primeiro token de 1,75s. Em resumo: uma colocação respeitável entre os dez primeiros e uma genuinamente eficiente — mas evitamos deliberadamente exagerar como uma vitória no ranking.

Capacidades multimodais e de contexto longo

O Inkling aceita texto (UTF-8), imagens (de 40px a 4096px através de um codificador de patches hierárquico) e áudio (WAV de 16kHz, até cerca de 20 minutos, usando codificação discreta de tokens). A saída é apenas texto — não há geração de imagem ou áudio, portanto planeje um modelo de compreensão, não um de geração. O vídeo foi usado durante o pré-treinamento, mas é não um input suportado ou avaliado no lançamento, portanto não planeje em torno disso ainda.

A capacidade principal é a janela de contexto de 1 milhão de tokens nos pesos lançados, que abre a porta para análise de código de repositório inteiro, síntese de documentos longos e sessões estendidas de agente multi-turn sem fragmentação agressiva. Observe a nuance prática: as APIs hospedadas expõem até 256 mil tokens, então o 1 milhão completo é um recurso auto-hospedado hoje. Combinado com o design de atenção de janela deslizante e decodificação especulativa, a história do contexto longo continua sendo um dos pontos de venda mais práticos da Inkling.

Preços, níveis e custo total de propriedade

Inkling é genuinamente aberto. Pesos completos (um checkpoint BF16 mais um checkpoint NVFP4) estão em Hugging Face sob Apache 2.0, então self-hosting é livre de royalties — você paga apenas pelo processamento. A Thinking Machines não monetiza o modelo em si; a receita flui através do Tinker e de hosts terceiros.

Preço por token hospedado (por Artificial Analysis), por nível de contexto:

64K. Entrada / 1M: $1.87; Entrada em cache / 1M: $0.374; Saída / 1M: $4.68

256K. Entrada / 1M: $3.74; Entrada em cache / 1M: $0.748; Saída / 1M: $9.36

Reflete um desconto de lançamento de 50% por tempo limitado; os valores exatos por token do Tinker estão na documentação e mudarão.

Self-host vs API — como pensar sobre o TCO. A economia gira em torno do volume e da utilização:

API (Tinker / parceiros): custo fixo zero, pague por token, quase instantâneo para iniciar. Melhor em volume baixo ou irregular, ou durante a prototipagem.

Auto-hospedagem (GPUs alugadas ou próprias): você paga por um nó de 4–8 GPUs esteja ele ocupado ou não, mas o custo marginal por token se aproxima do custo da eletricidade bruta. Como o Inkling ativa apenas 41B parâmetros e é eficiente em tokens (~25K vs 37–43K segundo o conjunto do Artificial Analysis), a taxa de transferência por GPU-hora é favorável, e cargas de trabalho pesadas e constantes podem sair consideravelmente mais baratas do que o preço por token de API quando um nó é bem utilizado. Os comentários em torno do lançamento enquadraram a auto-hospedagem de pesos abertos como aproximadamente 40–60% mais barata do que o uso de API fechada comparável em escala — uma afirmação direcional, não um valor auditado.

Nota do editor — adicionar visual: Um gráfico de ponto de equilíbrio — volume mensal de tokens (x) vs custo total (y) com três linhas: API de fronteira fechada, API hospedada do Inkling e Inkling auto-hospedado em um nó de GPU alugado — mostrando o ponto de cruzamento onde auto-hospedagem vence.

Segurança, alinhamento e censura

A segurança é uma das histórias mais fortes e diferenciadas da Inkling. No adversário FORTRESS benchmark, ele pontua 78,0% — o melhor entre modelos de peso aberto na comparação da MarkTechPost, à frente do GLM 5.2 (71,3%), do Kimi K2.6 (65,6%) e muito à frente do DeepSeek V4 Pro (36,0%). A Thinking Machines também enfatiza a incerteza calibrada nas saídas do modelo.

A cobertura da VentureBeat destacou uma propriedade relacionada: resistência à censura. Combinado com uma licença permissiva Apache 2.0, isso posiciona o Inkling como um modelo aberto que as equipes podem alinhar às suas próprias políticas, em vez de herdar um regime de conteúdo opaco e imposto pelo fornecedor — uma consideração significativa para implantações regulamentadas ou específicas de região. Como sempre com um modelo de lançamento, nenhuma auditoria independente de red-team ou de segurança de terceiros havia surgido no momento da redação, portanto, trate a indicação FORTRESS como proveniente de fornecedor/terceiros, e não certificada externamente.

Você deve ajustar o Inkling?

O ajuste fino é, sem dúvida, a razão de existir da Inkling. Um framework rápido de decisão:

Ajuste fino (via Tinker ou seu próprio pipeline) se: você tem dados proprietários, um domínio restrito ou uma tarefa onde um modelo especializado menor supera um generalista; você precisa ser dono dos pesos; ou você quer incorporar um tom, formato ou política específicos. As opções de contexto de 64K/256K do Tinker e o desconto de lançamento reduzem a barreira.

Apenas use o modelo base (auto-hospedado ou API) se: sua tarefa é de propósito geral, seu volume é baixo, ou você ainda não validou que o fine-tuning melhora sua métrica. Engenharia de prompt combinada com o dial de reasoning_effort geralmente já é suficiente.

Procure em outro lugar se: você precisa de codificação agentiva de ponta hoje (GLM 5.2 e Kimi K2.6 lideram nesses benchmarks) ou você exige garantias de qualidade auditadas de forma independente.

Prós e contras

Prós

Pesos totalmente abertos sob Apache 2.0, isentos de royalties para auto-hospedagem e gratuitos para uso comercial.

MoE esparso eficiente (apenas 41B ativos) mais forte eficiência de tokens mantém o custo e a velocidade de inferência competitivos.

Massivo contexto de 1M-token nos pesos (256K via API).

Multimodalidade genuína (texto, imagem, áudio entrada).

Dial de esforço de raciocínio controlável (nenhum → máximo) para compensações em tempo real entre custo e qualidade.

Segurança adversarial de peso aberto líder em sua classe (FORTRESS 78,0%, segundo MarkTechPost) e “resistência à censura.”

Posição independente forte — top 10 de 97 no Artificial Analysis Index, à frente de Nemotron 3 Ultra, Gemma 4 31B e gpt-oss-120b.

Contras

Explicitamente não um modelo de fronteira, por admissão do próprio fabricante.

Fica atrás dos principais rivais abertos (GLM 5.2, Kimi K2.6, DeepSeek V4 Pro) em benchmarks de agente e codificação (Terminal Bench 2.1, SWE-bench Verified, HLE).

A maioria dos benchmarks são autorrelatados pelos fornecedores e não auditados de forma independente.

Saída apenas de texto; sem geração de imagem/áudio; sem entrada de vídeo no lançamento; Inkling-Small ainda em preview.

O uso “local” real precisa de um nó multi-GPU (~600 GB de VRAM mesmo quantizado).

Nenhuma revisão substancial independente, crítica ou de segurança/red-team havia surgido no lançamento.

Quem deve usar o Inkling?

Inkling é uma excelente opção se você é um profissional ou equipe que deseja possuir e personalizar seu modelo em vez de alugar uma API fechada. Casos de uso ideais incluem:

Equipes de ajuste fino construindo modelos específicos de domínio via Tinker ou seu próprio pipeline.

Implantações sensíveis a custo e de alto volume onde a auto-hospedagem sem royalties supera o preço de fronteira por token.

Cargas de trabalho de contexto longo como assistência de código em todo o repositório, análise de documentos e sessões longas de agente.

Aplicações multimodais que necessitam de compreensão combinada de texto, imagem e áudio.

Implementações sensíveis a políticas que desejam uma base aberta com forte segurança e resistente à censura para se alinhar.

É uma escolha inadequada se você precisar do raciocínio mais forte absoluto ou desempenho de codificação agentiva, precisar de entrada de vídeo ou saída generativa, ou exigir benchmarks auditados de forma independente antes da implantação.

Veredito e classificação final

Vamos abordar o elefante diretamente: Inkling não é o modelo mais forte disponível hoje, e a Thinking Machines diz exatamente isso. Lido com cinismo, isso é uma barra baixa. Lido de forma justa, é exatamente o ponto — a Inkling é otimizada para um objetivo diferente do que liderar um ranking. Ela é eficiente (41B ativos, orçamentos de tarefas de ~25K tokens), licenciada abertamente (Apache 2.0), segura pelos padrões de pesos abertos (FORTRESS 78%) e projetada para ser ajustada e auto-hospedada. Essa combinação faz dela um dos lançamentos de modelo aberto mais ponderados de 2026, mesmo ficando atrás do GLM 5.2 e do Kimi K2.6 nos benchmarks mais difíceis de agente e codificação.

Os asteriscos restantes são os benchmarks amplamente autorrelatados e a ausência de qualquer revisão crítica independente tão cedo. Mas para seu público-alvo — construtores que valorizam propriedade, personalização, controle de custos e uma enorme janela de contexto em vez de vanglória de fronteira — o Inkling entrega.

Avaliação: 4 de 5 para seu público-alvo de construtores e ajustadores; menor se você está comprando estritamente por capacidade de fronteira.

Perguntas Frequentes

O que é o Inkling e quem o criou? O Inkling é o primeiro modelo do Thinking Machines Lab, a startup de IA liderada por Mira Murati (ex-CTO da OpenAI). Foi lançado em 15 de julho de 2026 como um modelo de raciocínio multimodal de mistura de especialistas com pesos abertos.

O Inkling é o melhor modelo de IA?Não, e a empresa não afirma que isso é verdade — ela afirma que o Inkling “não é o modelo mais forte disponível hoje, fechado ou aberto.” Uma medição independente (Artificial Analysis) o classifica em 10º lugar entre 97 no geral, embora ele lidere vários concorrentes abertos.

Quantos parâmetros o Inkling tem e qual é a janela de contexto?975B no total com 41B ativos (sparse MoE), em 66 camadas. A janela de contexto é de até 1.000.000 tokens nos pesos liberados, e até 256K em APIs hospedadas.

O Inkling é código aberto e qual é a licença?Os pesos são disponibilizados sob Apache 2.0, que permite uso comercial e auto-hospedagem. São “pesos abertos” — os pesos completos do modelo estão no Hugging Face.

O Inkling é gratuito para usar? Os pesos são gratuitos e livres de royalties para auto-hospedagem. Ajuste fino no Tinker e inferência hospedada por meio de provedores como Together AI, Fireworks, Modal, Databricks ou Baseten são serviços pagos. O acesso hospedado começa em cerca de $1,87 / 1M tokens de entrada (um desconto de lançamento por tempo limitado).

Como executar ou baixar o Inkling, e de qual hardware preciso? Baixe os pesos do Hugging Face e sirva-os com vLLM, SGLang ou transformers do Hugging Face por meio de uma API compatível com OpenAI. Espere aproximadamente ~2TB de VRAM agregada para BF16 (8× B300 / 16× H200) ou ~600GB para o checkpoint quantizado NVFP4 (4× B300 / 8× H200). As compilações GGUF da comunidade Unsloth reduzem a barreira para experimentação.

Como faço para ajustar o Inkling? Use Thinking Machines’ Tinker plataforma, que oferece opções de contexto de 64K e 256K e um desconto de lançamento de 50% por tempo limitado, ou ajuste os pesos abertos em seu próprio pipeline.

O que é esforço de pensamento controlável? Uma configuração de reasoning_effort (none / minimal / low / medium / high / xhigh / max) que troca latência e custo de tokens por profundidade de raciocínio. O esforço baixo é adequado para classificação e extração; o esforço máximo é adequado para matemática difícil e corresponde à configuração de benchmark (Effort=0.99).

Como o Inkling se compara a Kimi, GLM, DeepSeek e Nemotron? De acordo com a comparação da MarkTechPost, o Inkling lidera no FORTRESS (segurança) e supera amplamente o Nemotron 3 Ultra, mas fica atrás do GLM 5.2, Kimi K2.6 e DeepSeek V4 Pro no Terminal Bench 2.1, SWE-bench Verified e HLE. É competitivo, mas não é o modelo aberto mais forte em codificação agêntica.

O Inkling pode processar imagens, áudio e vídeo? Ele aceita texto, imagens (40px–4096px) e áudio (WAV de 16kHz, até ~20 minutos) como entrada. A saída é apenas texto — sem geração de imagens ou áudio. O vídeo foi usado no pré-treinamento, mas não é uma entrada suportada no lançamento.

As pontuações de benchmark do Inkling são confiáveis?Trate-as com cautela. Além do índice independente Artificial Analysis Intelligence, os números de destaque são autorrelatados pelo fornecedor no lançamento e não são auditados de forma independente. Os números dos concorrentes vêm de terceiros (MarkTechPost) ou foram reexecutados pela Thinking Machines e podem não corresponder aos números relatados pelos próprios rivais.

O que é o Inkling-Small e o que está no roteiro?Inkling-Small é uma variante menor (276B total / 12B ativos). No lançamento, ainda estava em pré-visualização, com pesos ainda não liberados. O modelo principal já inclui camadas MTP para decodificação especulativa.



Comparados neste artigo2

Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente

© 2026 OrcaRouter

Para provedores

Opera uma plataforma de inferência? Traga seus modelos para o OrcaRouter.

Fale conosco

Junte-se à comunidade

DiscordEmailXGitHubYouTube