
Ternary Bonsai 2 27B vs Qwen3.8-27B: O que 47,9 gigabytes de precisão realmente compram
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $5.00 por 1M de tokens
- orcaNOVOOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens
- deepseekNOVODeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- openaiNOVOOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- googleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- qwenQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- anthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
- deepseekDeepSeek: DeepSeek V4 Pro 08132026-08-1236Inteligência69Código
- grokSpaceXAI: Grok 4.62026-08-1244Inteligência77Código
- metaMeta: Muse Spark 1.22026-08-0540Inteligência72Código
- qwenQwen: Qwen3.8 Max2026-08-0345Inteligência76Código
- deepseekDeepSeek: DeepSeek V4 Flash 07312026-07-3135Inteligência69Código
- minimaxMiniMax: MiniMax-H32026-07-31minimax/minimax-h3
- qwenQwen: Qwen3.7 Flash2026-07-27$0.03 / $0.13 por 1M de tokens
- orcaOrcaDub: OrcaDub 1.02026-07-27orca/dub
O Ternary Bonsai 2 27B e o Qwen3.8-27B são o mesmo modelo em dois mundos numéricos. Eles compartilham uma arquitetura, um tokenizador, uma linhagem de treinamento e uma janela de contexto de 262.144 tokens. O que os separa é como os pesos são escritos: o Qwen3.8-27B armazena cada um como um float de 16 bits e ocupa 53,81 GB em sua forma de referência FP16, enquanto o Ternary Bonsai 2 27B armazena cada um como um entre três símbolos e ocupa 5,93 GB. A Prism ML anunciou a versão comprimida em 17 de setembro de 2026 e a disponibilizou no Hugging Face sob a licença Apache 2.0; os pesos originais do Qwen3.8-27B foram publicados em 13 de agosto de 2026, também sob a licença Apache 2.0.
A comparação que importa não é qual deles é melhor. É o que os 47,9 GB ausentes custam a você, e a resposta honesta é mais estreita e específica do que qualquer um dos lados lhe dirá. A Prism ML relata que seu build mantém 98,2% da média do modelo de precisão total em uma suíte de 20 benchmarks — 83,9 contra 85,4. Esse número é do próprio fornecedor, medido no próprio harness do fornecedor, e um dia após o lançamento ninguém fora da Prism ML o reproduziu. O agregado também esconde a parte com a qual você deveria realmente se importar, porque os 1,8 pontos não estão distribuídos de maneira uniforme. Nos dois benchmarks que põem à prova engenharia de software sustentada, a diferença não é de 1,8% — está mais perto de 25%.
A mesma rede, escrita de forma diferente
Comece pelo que a compressão não toca, porque é a razão pela qual a comparação é interessante. A contagem de camadas, o tamanho oculto, o vocabulário, o padrão de atenção e a torre de visão são do modelo base. O Qwen3.8-27B é um design de atenção híbrida: 48 camadas de atenção linear Gated DeltaNet intercaladas com 16 camadas de atenção completa, uma divisão de aproximadamente 3:1, ao longo de 64 camadas com um tamanho oculto de 5.120 e um vocabulário de 248.320 tokens. Esse backbone majoritariamente linear é o que torna um contexto de 262K viável em primeiro lugar, e é a propriedade que o Bonsai herda sem alterações.
O que a Prism ML mudou foi a representação das matrizes do modelo de linguagem, além dos kernels necessários para computar sobre elas. Seu whitepaper divide os 27,36B de parâmetros em 24,35B no backbone de linguagem, distribuídos em 64 blocos, 2,54B no embedding e na cabeça LM, e 0,47B em uma torre de visão de 27 blocos. A torre de visão é entregue como um arquivo mmproj separado de 4 bits de cerca de 0,63 GB e só é carregada quando uma imagem realmente chega, então uma implantação somente de texto nunca paga por ela.
Uma consequência prática desse design majoritariamente linear vale a pena ser destacada antes de qualquer discussão sobre benchmarks. Como a arquitetura não é um transformer convencional, os kernels de baixa precisão tiveram de ser escritos especificamente para ela. O llama.cpp padrão rejeita ambos os empacotamentos da Prism ML como tipos desconhecidos — e, mais perigosamente, carrega um formato ternário mais antigo sem reclamar e produz absurdos fluentes, porque não tem a rotação correspondente aplicada às ativações. Se você executar este modelo em um binário que não o conhece, não receberá um erro. Você receberá uma saída errada e convicta.
A comparação, categoria por categoria
Aqui está o detalhamento de 20 benchmarks do fornecedor, com a base de precisão total como referência. Todos os números desta lista são da Prism ML; nenhum deles foi verificado de forma independente.
• Matemática — 96,57 para Ternary Bonsai 2 27B vs 97,06 para Qwen3.8-27B. Efetivamente no mesmo nível.
• Programação — 81.58 vs 82.17. Também próximos, e é a categoria sobre a qual toda a técnica está sendo debatida.
• Seguimento de instruções — 82,66 vs 81,25. O modelo comprimido está à frente aqui, o que é a única linha da tabela que é genuinamente surpreendente.
• Conhecimento e raciocínio — 83,95 vs 86,66. Uma queda de 2,7 pontos, e a maior contribuição individual para os 1,8 pontos faltantes.
• Agêntico e chamada de ferramentas — 77,57 vs 79,74, abrangendo τ2-Bench com 80,22 e BFCL v3 com 74,92.
• Visão — 78,59 vs 81,64, a maior perda entre as categorias. Observe que a própria torre de visão não é a parte comprimida; o modelo de linguagem que lê suas saídas é.

Leia a forma em vez da média e uma história mais clara surge. A compressão é quase gratuita em matemática, programação e seguimento de instruções, e é cara em conhecimento e visão. Isso é o oposto da sabedoria popular sobre modelos de baixa precisão, segundo a qual o conhecimento superficial sobrevive e o raciocínio entra em colapso. Aqui, é o conhecimento que se erode e o raciocínio que se mantém.
Onde os 1,8 pontos realmente estão
O agregado é uma média de vinte benchmarks, e as médias são onde as disparidades se escondem. Separe os resultados individuais e dois deles são muito piores do que a média sugere.
• Terminal-Bench 2.1 — 52,8 para a build ternária, contra 69,7 para precisão total
• SWE-bench Verified — 60,8 contra 80,6
Ambos ficam perto de três quartos da pontuação de precisão completa. Em contrapartida, o AIME26 chega a 95,83, o LiveCodeBench a 90,07 e o AA-LCR a 77,0 — a um ponto do modelo não comprimido. Esta é a primeira vez que a família Bonsai é avaliada no Terminal-Bench, e a Prism ML é explícita em seus próprios materiais de que a capacidade de engenharia de software de longo horizonte que prometeu na primeira geração é entregue parcialmente, não totalmente.
A questão prática, então, não é "ele retém 98,2%", mas sim "qual é a minha carga de trabalho". Se você está executando um agente de codificação que mantém um plano ao longo de dezenas de chamadas de ferramentas e edita arquivos ao longo de minutos, você está na categoria com a lacuna de 25%, e o número agregado é ativamente enganoso. Se você está fazendo matemática, geração de código em turno único, extração, classificação ou chat, você está nas categorias em que a lacuna some no arredondamento. A coisa mais útil na tabela do próprio fornecedor é que ela permite que você faça essa distinção em vez de adivinhar.
O que cada um realmente precisa para funcionar
A história do hardware é menos simétrica do que a proporção de tamanho sugere. Um modelo FP16 de 53,81 GB não cabe de forma alguma em um laptop de 16 GB, o que torna a comparação menos “mais rápido versus mais lento” e mais “possível versus não”. Medições padronizadas da Prism ML com tamanho de lote 1, excluindo a torre de visão:
• NVIDIA RTX 5090 — 142,5 tok/s de decodificação no empacotamento PQ2_0, a 0,582 mWh por token
• Apple M5 Max — 46,8 tok/s de decodificação, com processamento de prompt em torno de 765 tok/s
• Apple M5 Pro — 27,7 tok/s na decodificação
• Apple M4 Pro — 18,0 tok/s de decodificação, com o processamento de prompt próximo de 125 tok/s se tornando a restrição vinculante em contextos muito longos
A ressalva importante é que nada disso é um único binário. O empacotamento PTQ1_0 rende 5,93 GB a 1,76 bits por peso; o PQ2_0 custa 7,25 GB a 2,16 bits por peso e compra velocidade de decodificação em hardware onde o limite é a taxa de transferência de instruções, não a largura de banda de memória. A compilação MLX para Apple Silicon é um terceiro artefato com sua própria contabilidade — um contêiner afim de 2 bits que armazena um viés de que os pesos ternários não precisam, chegando a 2,25 bits por peso e 8,005 GiB em disco, com kernels Metal e CPU, mas sem caminho CUDA. "Ele roda em 5,9 GB" é verdadeiro para exatamente um desses arquivos em exatamente o runtime certo.
A comparação de custos, apresentada de forma honesta
Há duas formas de pagar pelo Qwen3.8-27B e apenas uma forma de pagar por seu irmão compactado. O Ternary Bonsai 2 27B é um download: Apache 2.0, seu hardware, sem medição de uso. O Qwen3.8-27B é tanto um download quanto um serviço hospedado, e, se você optar pela via hospedada, o valor relevante é o que consta na página do modelo — US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída, servido a partir da infraestrutura própria da OrcaRouter em vez de revendido a partir da infraestrutura de outra pessoa.
É aí que o OrcaRouter conquista um lugar nesta comparação, e não uma nota de rodapé. A build roteada do Qwen3.8-27B traz o mesmo contexto de 262K, aceita texto, imagens e vídeo, e expõe o controle de esforço de raciocínio que o modelo oferece. Fica atrás da mesma chave que mais de 200 outros modelos, sem acréscimo sobre o preço de tabela do fornecedor, o que importa mais do que parece: porque o preço de tabela é repassado em vez de revendido, uma mudança de preço do fornecedor aparece aqui no mesmo dia, em vez de na próxima renovação do contrato. Para uma equipe que quer a base de precisão total como o nível de escalonamento acima de um Bonsai local, isso é um endpoint e uma chave, em vez de duas relações com fornecedores.

Qual escolher
A decisão é principalmente sobre onde o trabalho acontece, não sobre qual modelo é melhor, porque na maioria das tarefas eles são o mesmo modelo.
• Escolha o Qwen3.8-27B em precisão total quando a tarefa for de longo horizonte e agêntica, quando você estiver avaliando ou fazendo ajuste fino, quando precisar do contexto YaRN de 1M de tokens, ou quando a precisão de visão for essencial. Os números do Terminal-Bench e do SWE-bench são o motivo.
• Escolha o Ternary Bonsai 2 27B quando o trabalho tiver de acontecer em hardware que você possui, quando a alternativa for não executar um modelo 27B de forma alguma, ou quando a carga de trabalho for matemática, programação, extração ou raciocínio sem ferramentas, em que as categorias estão empatadas.
• Não escolha com base no agregado. 83,9 e 85,4 estão próximos o suficiente para que uma única troca de benchmark possa reordená-los, e apenas um dos dois números é verificado de forma independente.
O que é genuinamente novo aqui não é que um modelo de 27B caiba em seis gigabytes — a primeira geração do Bonsai fez isso em julho. É que a capacidade de seguir instruções ficou à frente do modelo pai e que matemática e programação ficaram no mesmo nível, o que é uma afirmação diferente de "pequeno para o seu tamanho". Se isso se sustenta na sua carga de trabalho é exatamente o que um dia de existência não pode dizer, e a primeira avaliação independente deste modelo é o resultado que vale a pena esperar.

Se você quiser executar a comparação nos seus próprios prompts em vez de em uma suíte de benchmark, o caminho mais rápido é chamar o Qwen3.8-27B hospedado por meio de um endpoint e rodar o build ternário localmente, depois comparar as saídas nas tarefas que você realmente tem. Isso é trabalho de uma manhã e vai lhe dizer mais sobre os 1,8 pontos do que qualquer tabela publicada.
