
GLM-5.3-Flash, cinco semanas depois: um 42 independente, uma execução de exploit em nível Mythos e o agente GLM que reconstruiu sua própria stack de serving
- OrcaNOVOOrca: OrcaCyber Zero 1.52026-10-10$3.00 / $7.50 por 1M de tokens · 87 tok/s
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligência
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligência
- typesafeTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 115 tok/s
- OpenAIOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAIOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAIGrok 4.72026-09-2146Inteligência
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 47 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 777 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 61 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 452 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 231 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
O GLM-5.3-Flash vem atendendo tráfego de produção há cinco semanas e, em 17 de setembro de 2026, a Zhipu AI disse algo sobre onde: a empresa divulgou que toda solicitação de produção para o GLM-5.3-Flash agora é executada em uma frota de mais de 100.000 aceleradores de IA chineses produzidos internamente, que passou do primeiro boot nesse hardware a suportar toda a sua carga de trabalho ativa em menos de duas semanas e que a vazão de ponta a ponta aumentou 3,2x no mesmo período. A parte que foi mais longe é quem fez o trabalho. Boa parte disso foi feita não pela equipe de infraestrutura, mas por um agente guiado pelo próprio GLM-5.3, que analisou gargalos, propôs correções e escreveu código de sistema de inferência, com engenheiros definindo objetivos, construindo o ambiente de feedback e revisando tudo o que tocasse semântica numérica, concorrência ou risco de produção. O GLM-5.3-Flash é o modelo multimodal de 320 bilhões no total e 18 bilhões ativos (320B-A18B) que a Zhipu lançou e disponibilizou em código aberto em 26 de agosto de 2026 — o anônimo "Ox Alpha" que a empresa revelou naquele dia —, e seu irmão maior, o GLM-5.3, é o carro-chefe de 743B com o qual ele foi comparado em preço. Nenhum dos três números da divulgação de hoje veio de nós nem de qualquer outra pessoa: são da própria Zhipu. O carro-chefe também não é mais a única comparação: no ExploitBench, uma avaliação independente de até onde um modelo sobe numa escada real de exploits do Chrome, o GLM-5.3-Flash foi agora medido no mesmo nível que o Claude Mythos Preview, o modelo de fronteira fechado que seu desenvolvedor liberou apenas para defensores verificados, a uma fração do custo por tentativa.
Essa é a boa notícia, e ela é real, mas foi declarada pelo fornecedor. Três outras coisas mudaram desde que este post foi publicado pela primeira vez no dia do lançamento, e duas delas apontam na direção oposta. A Artificial Analysis agora publicou sua própria medição do modelo, e o número dela não é o da Zhipu. O desconto de lançamento que fez deste o modelo capaz mais barato do mercado expirou conforme programado em 9 de setembro e não foi prorrogado. E uma empresa externa de avaliação, a Generality Labs, publicou sua própria execução do ExploitBench, na qual o GLM-5.3-Flash ficou acima da média de três execuções do Claude Mythos Preview na mesma escala — por cerca de seis centavos por dólar. Para quem salvou este modelo nos favoritos no final de agosto como “o barato”, a conta hoje é diferente do que era, e a manchete honesta é mista: a economia de serving melhorou de verdade, o preço subiu porque uma promoção terminou, o número de inteligência amplamente citado não sobreviveu ao primeiro contato com um harness independente, e a comparação de capacidade que de fato favoreceu o modelo é uma única execução não revisada por pares cujos próprios autores dizem que não se deve interpretar demais.
Zhipu é a única fonte para o tamanho do cluster, o prazo de duas semanas e o 3,2x — não há auditoria independente de nenhum deles, e a própria empresa diz que não alcançou autoaperfeiçoamento recursivo, descrevendo o resultado como um loop de escala mínima, e não como a coisa real. O que dava para verificar, nós verificamos: o único artefato concreto no relato que existe fora dos muros da Zhipu — uma correção de precisão em um kernel Flash Linear Attention — foi de fato mesclada no upstream, e nós confirmamos isso. Quando um número abaixo vem da Zhipu, ele diz isso. Quando vem da Artificial Analysis, ele diz isso em vez disso. Quando vem da Generality Labs — a organização de avaliação de segurança por trás dos números de exploit neste post — ele diz isso, junto com as ressalvas que os próprios autores anexaram: uma execução, 41 bugs, um método autopublicado, nenhuma reprodução por terceiros e uma questão de contaminação que eles levantam por iniciativa própria. Quando um número é da Anthropic — os únicos números aqui que vêm de um laboratório com interesse competitivo na resposta — o corpo do texto diz qual modelo a Anthropic realmente mediu, porque nem todos se referem a este modelo.
O que realmente foi lançado
GLM-5.3-Flash é um modelo de mistura de especialistas com 320B no total / 18B ativos e 45 camadas, o que coloca seus parâmetros ativos um pouco acima da metade dos cerca de 32B do GLM-5.2. O principal destaque de capacidade é a modalidade: ele aceita nativamente entrada de texto, imagem e vídeo — o primeiro modelo GLM-5 a fazer isso — em vez de encaminhar a visão por um adaptador separado. O contexto vai até 1 milhão de tokens, e a Zhipu afirma que o custo de serviço de contexto longo fica em cerca de um terço do de GLM-5.3.
Sobre a arquitetura, a Zhipu o descreve como o primeiro modelo de fronteira de código aberto a combinar atenção híbrida esparsa mais linear com Manifold-Constrained Hyper-Connections (mHC) para escalabilidade e um mecanismo IndexPool que comprime quatro vetores de chave do indexador em um único pool ponderado para reduzir a latência de contexto longo. O pré-treinamento foi realizado em um corpus multimodal de 30 trilhões de tokens. Nada disso é auditado de forma independente — é a Zhipu descrevendo seu próprio modelo —, mas as alegações de eficiência de serviço são específicas o suficiente para serem testadas agora que os pesos estão diante da pilha de inferência de código aberto, e o relato de 17 de setembro acrescenta o primeiro panorama detalhado de como o lado de serviço foi de fato construído.
A ficha técnica do dia do lançamento, num relance:
• Parâmetros — 320B total / 18B ativos, 45 camadas, MoE.
• Modalidade — entrada nativa de texto, imagem e vídeo; saída de texto.
• Janela de contexto — até 1.000.000 de tokens.
• Licença — MIT, pesos abertos no Hugging Face desde o dia do lançamento.
• Preço — $0,15 / $0,50 por milhão de tokens (entrada / saída), $0,03 por milhão de entrada em cache.

Esse card é um instantâneo do dia de lançamento, e duas de suas linhas mudaram desde 26 de agosto. O número do AA Index ainda é uma afirmação da própria Zhipu e agora é contradito por medição independente — mais sobre isso abaixo. O preço com desconto que ele mostra acabou; a promoção terminou em 9 de setembro. As contagens de parâmetros, a janela de contexto, a licença e a modalidade são fatos atuais inalterados, e é principalmente para isso que a imagem serve.
A semana Ox Alpha, e o que o sorteio gratuito estava realmente testando
A revelação encerrou uma semana de especulação. Em 20 de agosto, um modelo anônimo apareceu em uma plataforma terceirizada de API de IA com uma janela de contexto de 1 milhão de tokens, entrada de texto/imagem/vídeo e preço zero, e rapidamente se tornou o modelo mais chamado nos gráficos semanais dessa plataforma. A comunidade traçou sua origem à família GLM da Zhipu em 48 horas — o mesmo padrão de anônimo e depois reivindicado que já havia identificado modelos de outros laboratórios chineses — e analistas amplamente apostaram em uma variante Flash do GLM-5.3. O anúncio de 26 de agosto confirmou a aposta: a semana gratuita foi um teste intencional, e a empresa diz que a execução anônima movimentou mais de 62 trilhões de tokens em seis dias nas plataformas de codificação onde foi oferecido, tudo servido a partir de chips chineses domésticos.
Aquela última cláusula parecia uma nota de rodapé na época. Acabou sendo o ponto principal. A semana gratuita não era principalmente uma jogada de marketing nem mesmo um teste de carga do modelo; era um teste de carga da frota de aceleradores por baixo dele, executado em uma escala em que uma falha teria sido pública e gratuita. Três semanas depois, a Zhipu está descrevendo a mesma frota como suportando 100% do tráfego de produção do modelo.

A lógica de preços daquela semana ainda se mantém, com uma correção. Um modelo oferecido a $0 durante uma semana e depois lançado a um décimo do preço do modelo principal, com mais 50% de desconto, foi um movimento deliberado de criação de mercado no segmento de entrada, e a expressão "por tempo limitado" era sempre a parte a que se devia prestar atenção. Foi sinalizado como algo que poderia ser revertido. Foi revertido conforme previsto — o que vale a pena dizer claramente, porque a expiração do desconto é a única mudança nesta história que aparece numa fatura.
A pilha de serving que um agente reconstruiu
O relato técnico da Zhipu de 17 de setembro é a primeira descrição detalhada de como o GLM-5.3-Flash é servido em silício chinês, e sua afirmação central é que um modelo ajudou a otimizar o sistema que o executa. A empresa chama o mecanismo de feedback denso: testes de correção, logs de execução, traces, microbenchmarks e métricas de ponta a ponta foram interligados para que um agente pudesse validar uma hipótese localmente, em vez de esperar por uma implantação completa e um teste de carga após cada alteração. Para que isso funcionasse, a Zhipu diz que o feedback tinha de ser local, barato e objetivamente verificável — vinculado a um kernel ou caminho de código específico, rápido o suficiente para iterar e verdadeiro ou falso sem a intervenção de um humano.
Com esse loop em vigor, o agente encontrou e corrigiu três coisas que a empresa descreveu em detalhes:
• Um caminho de paralelismo de contexto no kernel KDA estava perdendo precisão à medida que as sequências cresciam, porque tl.dot usava TF32 por padrão, apesar de as entradas serem FP32, acumulando erro de arredondamento conforme o comprimento do contexto aumentava. A correção fixa a precisão de entrada em tf32x3, com fallback para ieee em plataformas sem suporte a TF32. Esta é a mais interessante das três, porque é a única afirmação no relato que sai da própria infraestrutura da Zhipu: a mudança foi mesclada no upstream do Flash Linear Attention como PR #1180, que verificamos e confirmamos ter sido mesclado em 27 de agosto de 2026.
• A transferência de KV não estava se sobrepondo ao agendamento do DeepEP. Nem o dispatch intra-nó nem o combine intra-nó estavam liberando o GIL do Python na versão do DeepEP em uso, o que travava a thread de transferência atrás deles; relatos em inglês e em chinês do mesmo texto indicam que a sobrecarga resultante ficou acima de 20% e acima de 30%, respectivamente. Após a correção, a Zhipu afirma que a diferença em relação ao seu baseline apenas de prefill caiu para menos de 1%.
• Um kernel de decodificação estava recalculando a mesma normalização FP32 e o mesmo gating quatro vezes, uma vez por tile da dimensão V. Dividir o trabalho de divisão reduziu o tempo do kernel em 9,6%, e mesclar os tiles em um único bloco de threads — de modo que a normalização seja executada uma única vez — produziu uma aceleração de 1,71x.
Ao redor dessas correções estão as mudanças estruturais: ReplaySSM, que troca computação por memória no chip porque os aceleradores têm menos desta do que as GPUs para as quais a pilha foi originalmente escrita; paralelismo tensorial intra-nó para aliviar a mesma pressão; cache misto de INT8, FP8 e BF16 para ampliar a capacidade; e uma arquitetura desagregada Encode-Prefill-Decode que agenda as três etapas de inferência separadamente, em vez de como um único pipeline. A Zhipu também nomeia as restrições com honestidade — memória no chip e largura de banda de interconexão limitadas, software imaturo, cobertura incompleta de kernels e documentação escassa — e afirma que não alcançou autoaperfeiçoamento recursivo, descrevendo o resultado como um loop de escala mínima.
Leia o relato com ceticismo, porque os incentivos são óbvios. A Zhipu não dirá quanto do trabalho o agente fez versus quanto os engenheiros fizeram, e não há auditoria externa do valor de throughput, do prazo de duas semanas ou do tamanho do cluster. O enquadramento de feedback denso também é autointeressado de uma forma específica: faz com que a alegação mais impressionante ("nosso modelo melhorou a si mesmo") se apoie nas evidências menos verificáveis (um loop interno que ninguém pode inspecionar). O que impede a história de ser puro marketing é que sua alegação mais concreta é falsificável e revela-se verdadeira — a correção do kernel tf32x3 realmente está no repositório upstream, datada de 27 de agosto, três semanas antes do ciclo de imprensa em torno dela.
Quanto custa, em dólares reais.
A tabela de preços é da Zhipu, e é simples: US$ 0,15 por milhão de tokens de entrada, US$ 0,50 por milhão de tokens de saída e US$ 0,03 por milhão de tokens de entrada em cache. Esse é o preço de tabela até hoje. A promoção de lançamento com 50% de desconto vigorou até 9 de setembro de 2026 e não foi prorrogada, então os números de US$ 0,075 / US$ 0,25 / US$ 0,015 que circularam amplamente no final de agosto não estão mais disponíveis na própria API do fornecedor. Em comparação com os US$ 1,40 / US$ 4,40 publicados do GLM-5.3, o Flash ainda fica em cerca de um décimo no preço de tabela — o desconto era um bônus sobre um preço que já era o cerne da questão, não o preço em si. A Artificial Analysis calcula uma tarifa combinada de cerca de US$ 0,10 por milhão de tokens em uma mistura 7:2:1 de acerto de cache/entrada/saída, e lista a velocidade de saída em aproximadamente 117 tokens por segundo, que descreve como notavelmente rápida, embora a AA observe que os números de velocidade descrevem a API própria do modelo, e não um teste conduzido pela AA.
A história de custos mais ampla da Zhipu é a razão pela qual o preço pode se manter nesse patamar. Em seus resultados semestrais, publicados em 31 de agosto, a empresa disse que o custo de inferência por token unitário em sua frota doméstica de 100.000 aceleradores caiu 80% desde o início de 2026, e que a margem bruta da API passou de -0,4% para 24,6% em resultado de escala, precificação e serving mais barato. Esses são números da empresa, de uma empresa que reporta aos acionistas, e não são auditados por nós; trate-os como direcionalmente claros, e não precisos. O relato de serving acima é o mecanismo por trás da afirmação — menos passagens redundantes pelo kernel, menos pressão sobre a memória, melhor sobreposição —, o que é uma história mais credível do que uma porcentagem nua, mesmo que a porcentagem seja a que será citada.
As alegações de eficiência em relação ao modelo principal permanecem inalteradas: o compute de atenção caiu 3,0x e o cache KV caiu 4,4x em comparação com o GLM-5.3, segundo o fornecedor, com a Zhipu admitindo que seu cache KV continua um pouco maior que o do DeepSeek V4 Flash e o do Kimi K3. A alegação feita no lançamento de uma melhoria de 3x no serving de ponta a ponta em chips nacionais agora é apresentada como 3,2x, medida do primeiro boot até o tráfego de produção total. Ambos os números são da Zhipu, e os dois relatos que os apresentam estão separados por três semanas — nada aqui foi reproduzido fora da empresa.
Por que a revelação importa — e onde foi parar o número principal
Eis a correção que mais importa a quem leu a cobertura de lançamento e guardou o número. Os materiais da Zhipu colocam o GLM-5.3-Flash em 57 no Índice de Inteligência da Artificial Analysis, igualando o Claude Opus 4.8. Desde então, a Artificial Analysis publicou sua própria medição do modelo no Intelligence Index v4.3, e ela indica 42 — contra 47 do GPT-5.6 Sol (max) na mesma versão. O 57 nunca foi um número independente; era da Zhipu, e a medição independente coloca o modelo cerca de cinco pontos abaixo da faixa adjacente à fronteira e bem abaixo do número anunciado pelo fornecedor. No mesmo índice atual, o próprio GLM-5.3 mede 45, de modo que o número de 60 para o carro-chefe que apareceu na nossa cobertura de lançamento não corresponde mais ao que a Artificial Analysis publica hoje. A diferença de 15 pontos entre a alegação e a medição não é uma diferença de arredondamento, e é a coisa mais útil que um leitor pode tirar desta atualização — com uma ressalva que a seção abaixo acrescenta, porque a segunda medição independente nesta história aponta na direção oposta.
O que sobrevive a essa correção é mais restrito, mas ainda real. O GLM-5.3-Flash é um modelo multimodal de pesos abertos com contexto de 1M e entrada nativa de imagem e vídeo por cerca de um décimo do preço de tabela de seu irmão carro-chefe — uma combinação sem equivalente direto nos laboratórios de fronteira dos EUA, cujos modelos multimodais comparáveis custam substancialmente mais e são lançados fechados. O próprio enquadramento da Zhipu, “inteligência de fronteira, custo flash”, é a parte que saiu prejudicada: com uma medição de 42, ele é um modelo econômico forte, não um modelo de fronteira com desconto. Uma medição independente também o coloca confortavelmente acima da mediana entre modelos de pesos abertos de tamanho semelhante, o que é uma conquista real para um modelo de 18B ativos com um décimo do custo de inferência — é apenas uma conquista diferente da que a cobertura de lançamento sugeria.
O outro número independente — e ficou a favor do modelo
Se o resultado do Artificial Analysis fez o GLM-5.3-Flash descer um degrau, este vai na direção oposta, e é o fato mais estranho da história. O ExploitBench, desenvolvido na Carnegie Mellon, não pergunta se um modelo consegue derrubar um alvo. Ele pontua a escalada: alcançar o código vulnerável, acionar o bug, construir primitivas reutilizáveis e, por fim, o sequestro completo do fluxo de controle com execução de código arbitrário, avaliado mecanicamente contra o V8 de produção com a sandbox de segurança ativada. A Generality Labs executou o GLM-5.3-Flash em 41 bugs com um orçamento de 1 bilhão de tokens por bug, em vez do limite habitual de 300 turnos do benchmark, com o argumento de que turnos são uma proxy ruim para o que um comprador realmente gasta e que dólares são a restrição honesta. O GLM-5.3-Flash alcançou execução de código arbitrário completa em 13 dos 41, e uma pontuação média de capacidade de 64,8% do máximo da escada. As três execuções publicadas do Claude Mythos Preview pontuaram 9, 10 e 11 na mesma escada — uma média de 10, ou 62,2%. O próprio enquadramento da Generality, impresso sob o gráfico, é que o GLM-5.3-Flash “pode estar no nível do Mythos em cibersegurança” nessa medição. A própria execução do ExploitBench pela Anthropic, publicada em 29 de setembro, relata a mesma ordenação em taxas absolutas muito mais baixas — embora no GLM-5.3 principal, não no Flash: ela conta exploits ponta a ponta por tentativa, em vez de progresso na escada, e coloca o GLM-5.3 em 50 de 410 contra 56 de 410 do Mythos Preview. Regra de contagem diferente, ordenação semelhante — que é exatamente por que um número do ExploitBench nunca deveria ser citado sem a regra anexada.
O motivo que importa é o denominador por trás disso. A execução precificou os tokens de saída do GLM-5.3-Flash a $0,25 por milhão — sua tarifa de lançamento com 50% de desconto, que já expirou — contra os históricos $125 por milhão do Claude Mythos Preview, uma diferença de 500 vezes. Com paridade de custos, a execução gastou $16,81 por vulnerabilidade contra os $297,17 do Mythos, que é de onde vem o número de aproximadamente 6%. Leia a afirmação com atenção, porque a versão que circula é a errada. Não é que o GLM-5.3-Flash seja um desenvolvedor de exploits melhor que o Claude Mythos Preview. É que um dólar em tokens do GLM-5.3-Flash compra aproximadamente o que um dólar em tokens do Mythos compra nesta tarefa específica, e que você pode arcar com muitos mais dólares do primeiro.
As ressalvas da própria Generality valem mais do que a manchete. Elas dizem claramente que uma única execução não estabelece paridade na cibersegurança como um todo, que a contaminação é uma questão em aberto — é possível que o ExploitBench tenha sido alvo de treinamento de alguma forma — e que quatro das 41 amostras deram erro e foram pontuadas carregando adiante o último resultado observado, o que, se alguma coisa, subestima o modelo. Eles também publicaram um follow-up em 28 de setembro que complica toda a comparação. Executando o GLM-5.3-Flash em sete harnesses de agente diferentes com um orçamento de 250 milhões de tokens, em dez amostras selecionadas para cobrir toda a faixa de dificuldade, os mesmos pesos marcaram 10,6 no harness Codex — acima da referência de 10,02 do Claude Mythos Preview — e 6,2 no harness Claude Code, abaixo até mesmo da configuração original do benchmark limitada por turnos, de 6,4. O harness alterou a pontuação mais do que a comparação entre modelos, e os autores dizem que o subconjunto de dez amostras provavelmente não é representativo. O fato de o gráfico ter circulado amplamente em 2 de outubro com o argumento de que o escalonamento de computação em tempo de teste está apagando as diferenças entre os níveis de modelo é uma alegação sobre a indústria, não uma constatação da avaliação: o que a avaliação constatou é que um modelo aberto e barato, quando recebe orçamento em vez de um limite de turnos, pode alcançar o especialista em exploits de um laboratório de fronteira em uma escada.
Já não é a história de um único laboratório. A avaliação da própria Frontier Red Team da Anthropic, publicada em 29 de setembro, executou o GLM-5.3-Flash — o irmão menor — numa sessão com humano no circuito: ao receber detalhes públicos de uma falha já corrigida do Chrome mais uma outra, sem orientação significativa, o modelo encadeou-as num exploit ARM64 confiável que contornou o endurecimento da autenticação de ponteiros, em 20 minutos de atenção humana e oito horas de trabalho do modelo — US$ 20,40 às tarifas da API da Zhipu. A mesma avaliação é a fonte do número 50 de 410 do ExploitBench acima, e essa parte dela mediu o GLM-5.3, o carro-chefe de 743B, não o Flash — uma distinção que a cobertura do relatório em grande parte achatou. Duas partes independentes, harnesses diferentes, orçamentos diferentes, mesma direção. Ambos também são execuções de um único laboratório e nenhum é um resultado reproduzido, e apenas a execução da Generality informa um valor em dólares para o Flash, e não para o carro-chefe. A leitura prática é a que a Anthropic afirma sem rodeios: os pesos são baixáveis, a abliteração do GLM-5.3-Flash levou cerca de 600 horas de GPU, e um modelo que custa menos de um dólar por hora para executar é um tipo diferente de problema de disponibilidade do que um atrás de um programa de triagem.
Experimente e veja como a camada de roteamento se encaixa.
O acesso é simples. A própria API da Zhipu disponibiliza-o à tarifa de tabela acima, os pesos com licença MIT estão no Hugging Face em zai-org/GLM-5.3-Flash em FP8 e BF16, e os produtos de programação da Zhipu — ZCode e o GLM Coding Plan — incluem-no. Para auto-hospedagem, tanto o vLLM como o SGLang o suportam. Duas notas práticas caso siga esse caminho: o cookbook do SGLang contém um aviso de alteração em aberto de que a entrada de visão pode ser silenciosamente descartada em compilações do transformers anteriores à 5.13, o que não gerará um erro e simplesmente lhe dará uma leitura apenas de texto de um pedido de imagem; e o caminho da AMD ainda não é uma receita. O PR original de ativação do gfx950 no dia do lançamento (sgl-project/sglang #37653) foi fechado sem ter sido integrado a 6 de setembro e substituído por um conjunto mais amplo de pull requests de dia zero para o gfx950 — mHC através do AITER, indexador DSA k-pool, serviço FP8 e MXFP4 — vários dos quais ainda estavam abertos a 17 de setembro. A ativação em hardware da classe MI350X está em curso, ainda não foi lançada, e continua a não existir um valor independente de throughput da AMD.
Do lado do roteamento, a situação mudou desde o lançamento: o GLM-5.3-Flash está agora no catálogo do OrcaRouter, ao lado do restante da linha GLM. Nós repassamos o preço de lista do provedor com 0% de margem e sem sobretaxa do roteador, que é exatamente o mecanismo que importa para um modelo cujo preço acabou de mudar — o desconto que expira do lado da Zhipu é o preço que você paga aqui, no mesmo dia, sem um segundo contrato para renegociar e sem qualquer alteração de código. Esse repasse corta nos dois sentidos, e vale a pena ser explícito sobre isso: uma promoção expirada é um aumento de preço real na sua fatura, e acontece aqui no mesmo momento em que acontece na origem. Se você está ponderando o Flash contra o GLM-5.3 ou outro modelo econômico, ambos ficam atrás de uma única chave com failover automático entre provedores, que é a maneira barata de experimentar um modelo cujas pontuações independentes ainda estão se estabilizando sem apostar um caminho de produção nele. Também é o formato certo para o resultado acima, e por um motivo mais direto do que a conveniência: os mesmos pesos obtiveram 10,6 ou 6,2 no mesmo benchmark dependendo de qual harness de agente os conduziu, então o que um comprador realmente testa é uma combinação de scaffold mais modelo, e trocar o modelo por trás de um scaffold fixo sob uma única chave é mais barato do que se comprometer com qualquer um dos dois.

O que assistir em seguida
Quatro coisas decidem o resto desta história. Primeira: se o 42 se move; o modelo está em amplo uso público desde agosto, então, se a avaliação interna da Zhipu e o harness da AA divergirem por uma razão estrutural — contabilização de tokens de raciocínio, verbosidade, uma avaliação à qual o fornecedor deu muito peso —, isso deve aparecer quando o índice for revisado, e não como uma diferença pontual. Segunda: se o resultado do exploit se reproduz. A Generality Labs rodou 41 bugs uma vez, em seu próprio harness, e diz isso; o acompanhamento do harness mostra os mesmos pesos se movendo quatro pontos apenas pela escolha do harness, então o número que resolveria isso é uma segunda equipe reexecutando os 41 com o orçamento fixado em dólares e o harness mantido constante. Terceira: se o relato sobre silício doméstico ganha uma segunda fonte. A Zhipu é a única parte capaz de declarar o tamanho do cluster, o cronograma de duas semanas e o 3,2x, e a única afirmação verificável de forma independente nele — a correção de kernel mesclada — é pequena. Quarta: o preço. O desconto acabou, e a questão interessante é se ele volta como promoção quando a Zhipu precisar de volume, ou se o preço de tabela agora é o piso.
O fio condutor é que se pede ao GLM-5.3-Flash que prove duas coisas diferentes ao mesmo tempo — que um modelo barato pode ser bom o suficiente, e que aceleradores chineses podem atendê-lo em escala — e a divulgação de 17 de setembro é a resposta da Zhipu à segunda pergunta, entregue por um modelo que ajudou a escrevê-la. A primeira pergunta agora tem dois números independentes associados e eles apontam em direções opostas: um 42 no índice de inteligência, bem abaixo do destaque do fornecedor, e uma execução de exploit que fica no mesmo nível de um especialista de um laboratório de ponta a um vigésimo do custo. Ambos podem ser verdadeiros ao mesmo tempo, e a lacuna entre eles — não qualquer um dos números — é onde as decisões realmente são tomadas.
Comparados neste artigo1
Detectado a partir deste artigo · Benchmarks: Artificial Analysis · atualizado diariamente
