Um cartão de título gerado intitulado "Prévia do Pareto 26.10 da Unbiased" com o subtítulo "Uma troca de contexto de 1M por trás da mesma string de modelo", acima de três cartões com os textos "Lançado: 1º de outubro de 2026", "Contexto: 1.048.576 tokens" e "Preço roteado: $0.80 / $3.20 por 1M", com um rodapé com o texto "Benchmarks preliminares executados pelo fornecedor; nenhuma pontuação independente publicada em 1º de outubro de 2026."
Guides & Insights

Prévia do Pareto 26.10 da Unbiased: Uma Troca de Contexto de 1M por Trás da Mesma String de Modelo

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

A integração não muda. O modelo por trás dela, sim. Em 1º de outubro de 2026, a Unbiased mudou sua string de modelo — pareto — para Pareto 26.10 Preview, uma nova versão com uma janela de contexto quatro vezes maior, um preço mais baixo no catálogo roteado e uma planilha de benchmark que, por admissão do próprio fornecedor, é preliminar e não publicada em sua forma final. Se você chama o Pareto hoje pelo nome, está chamando o 26.10 Preview, e o changelog do fornecedor diz isso nos termos mais claros possíveis: "O Pareto 26.10 Preview agora é a versão atual do Pareto… A string do modelo permanece pareto."

Essa única linha é a história completa para qualquer pessoa que tenha o Pareto em uma stack. Este não é um segundo produto lançado junto com o primeiro. É o primeiro produto, substituído no mesmo lugar, sob um nome que não mudou — o que significa que a versão que você recebe é decidida pelo calendário de lançamentos, e não por nada na sua solicitação.

O que realmente mudou em 1º de outubro

Quatro coisas mudaram, e nem todas apontam na mesma direção.

• Janela de contexto — 262 144 tokens na versão de setembro do Pareto, agora 1 048 576. A documentação da própria Unbiased nunca indica o valor; o número provém da listagem técnica pública do modelo, onde é o limite por pedido, sem que seja oferecido um nível inferior.
• Preço, conforme o encaminhamento — o par habitualmente cotado para o Pareto tem sido $2,50 por milhão de tokens de entrada e $7,50 por milhão de tokens de saída, com entrada em cache a $0,25. A listagem do 26.10 Preview apresenta $0,80, $3,20 e $0,03, respetivamente — cerca de um terço da tarifa de entrada e um pouco mais de 40% da tarifa de saída.
• Pontuações de benchmark — publicadas pela primeira vez nesta versão, e preliminares segundo a própria classificação do fornecedor.
• A opção estável — o 26.10 Preview é uma pré-visualização. O texto do catálogo da Unbiased diz que "pode mudar sem aviso prévio" e, em vez disso, remete para a versão anterior quem precisa de um comportamento previsível.

Todo o resto se manteve. A saída máxima ainda é 131,072 tokens. A entrada ainda é texto e imagem; a saída ainda é apenas texto. Ainda não há identificador do Hugging Face na listagem, então os pesos continuam fechados. E ainda há exatamente um provedor de serviço — a própria Unbiased — sem um segundo host dentro da listagem.

A generated single-column card titled "Pareto 26.10 Preview - what changed" with six rows reading "Context: 262K to 1M", "Max output: 131,072 (unchanged)", "Input price: $2.50 to $0.80 per 1M", "Output price: $7.50 to $3.20 per 1M", "Benchmarks: four, preliminary" and "Providers: one, the vendor", with a footer reading "Preview figures per the public listing; the vendor's own site keeps the $2.50 / $7.50 card."

O preço é a parte que vale a pena ler duas vezes.

Na própria plataforma da Unbiased, a tabela de preços não se moveu. Tanto o cartão do modelo quanto a página de preços ainda mostram US$ 2,50 por milhão de tokens de entrada, US$ 0,25 em cache, US$ 7,50 de saída — os mesmos três números do lançamento de setembro — e, como a string do modelo permaneceu pareto, um cliente na API do fornecedor está pagando essas tarifas pelo 26.10 Preview. Os valores mais baixos são os que constam na listagem do catálogo roteado, e a diferença entre os dois é exatamente o tipo de coisa que decide uma migração.

Duas interpretações são possíveis, e o fornecedor não disse qual delas é verdadeira. Ou o 26.10 Preview está genuinamente sendo oferecido mais barato por essa via como uma ação introdutória, ou o anúncio representa um acordo comercial diferente do da plataforma direta. A Unbiased não publica nenhuma data de término da promoção, e um preço definido no dia do lançamento não é um compromisso.

Esta é a única parte da história cuja forma um roteador altera. O OrcaRouter repassa o preço de tabela do provedor diretamente, com 0% de margem, então um corte de preço do fornecedor entra em vigor do nosso lado no mesmo dia em que acontece, e não em um ciclo de contrato — e o failover automático significa que um release de preview que se comporte de forma diferente na próxima semana pode ser trocado sem alteração de código. Não trabalhamos com o Unbiased's Pareto 26.10 Preview, então a versão honesta é esta: se você quer esse modelo específico, chame-o pela própria API da Unbiased. O ponto é apenas que, em um release de preview, o preço e a versão são ambas variáveis, e nenhuma delas deveria estar fixada no código.

A planilha de benchmark, com os rótulos que vieram com ela.

A Unbiased publicou quatro pontuações para o 26.10 Preview, cada uma acompanhada de um custo medido por tarefa e cada uma com uma ressalva que o próprio fornecedor escreveu. Leia-as como executadas pelo fornecedor e não reproduzidas, porque é exatamente isso que são:

• DeepSWE v1.1 (codificação agêntica) — 69,9%, a US$ 0,24 por tarefa
• Terminal-Bench 4.0 (uso agêntico de terminal) — 50,8%, a US$ 0,48 por tarefa
• Humanity's Last Exam, somente texto (raciocínio especializado) — 49,9%, a US$ 0,008 por tarefa
• GPQA-Diamond (raciocínio científico) — 92,4%, a US$ 0,004 por tarefa

A generated single-column scoreboard titled "Pareto 26.10 Preview - the benchmark sheet" listing six rows: "DeepSWE v1.1: 69.9% at $0.24 per task", "Terminal-Bench 4.0: 50.8% at $0.48 per task", "HLE text-only: 49.9% at $0.008 per task", "GPQA-Diamond: 92.4% at $0.004 per task", "Context: 1,048,576 tokens" and "Independent scores: none yet", with a footer reading "Vendor-run, preliminary results; not independently validated."

O enquadramento do fornecedor é que o 26.10 Preview está "igualando ou estabelecendo a fronteira de Pareto nos quatro benchmarks". A planilha que ele publica junto com essa alegação é mais específica, e é mérito da Unbiased que ela seja publicada: no Terminal-Bench 4.0, o GPT 6 Astra aparece com 58 e o Fable 5.1 com 56, ambos acima dos 50,8 do Pareto, e a própria seção "onde outros modelos pontuam mais alto" do fornecedor diz isso diretamente. No DeepSWE v1.1, o lançamento fica em um cluster — GLM-5.3 e Kimi K3 aparecem listados com 69,0 cada, contra os 69,9 do Pareto — o que é um empate na prática e está dentro de qualquer margem de erro que uma única execução carregue.

Os números da comparação trazem uma segunda ressalva que importa mais que a primeira: eles foram transcritos de uma comparação de 21 de setembro e, nas palavras do fornecedor, "não foram validados de forma independente", e foram produzidos em uma avaliação separada de modelos individuais — portanto, não devem ser emparelhados com os números de custo por tarefa da Pareto como se ambos tivessem saído da mesma bancada. O fornecedor diz isso nos detalhes da avaliação. Um leitor que ignorar essa linha vai superinterpretar o gráfico.

O que nada disto é: independente. A Artificial Analysis, o painel que a maioria das equipes consulta antes de confiar num novo nome numa tabela de preços, não tem página alguma para o Pareto. Todos os números acima foram produzidos pela empresa que vende o modelo. A única coisa que ameniza isso é que o harness de avaliação é público — o fornecedor publica uma suíte reproduzível de comparação direta que qualquer pessoa pode apontar para um endpoint — o que transforma "confie na nossa pontuação" em "reexecute a nossa pontuação". Essa é uma oferta real e não é o mesmo que um número verificado. Ninguém publicou a reexecução ainda.

O que "prévia" significa no contrato

A palavra está fazendo mais trabalho aqui do que as notas de versão fazem. A documentação da própria Unbiased descreve o acesso atual como acesso de avaliação segundo seus termos, e afirma que uso comercial ou de produção exige um acordo escrito separado. Novas contas são revisadas manualmente antes de uma chave de API ser emitida. A API é compatível com OpenAI e Anthropic — URL base, chave, string de modelo, sem reescrita — mas a superfície documentada é apenas chat completions e messages, com lacunas conhecidas que o fornecedor lista abertamente: GET /v1/models não está implementado e identificadores de modelo desconhecidos não são rejeitados, então os chamadores devem enviar pareto explicitamente em vez de descobrir o que está disponível.

Junte o rótulo de pré-visualização e o contrato de beta privado e os conselhos operacionais escrevem-se sozinhos. Este é um modelo para avaliar face à sua própria carga de trabalho por trás de uma camada de encaminhamento, não um para colocar à frente do tráfego de receita e nos esquecermos dele. O mecanismo para isso é pouco glamoroso: uma cadeia de fallback configurada uma vez, para que uma versão que muda debaixo dos seus pés a meio da semana se torne uma alteração de configuração em vez de um incidente. A Unbiased passou setembro a corrigir exatamente esta classe de problema do seu lado — uma entrada de changelog de 16 de setembro regista que cerca de 13% dos pedidos longos não-streaming estavam a atingir um timeout de 120 segundos, e o limite do gateway foi elevado para 300 segundos. Isto é um fornecedor a ser franco sobre uma imperfeição. É também um lembrete de que o perfil operacional de uma pré-visualização ainda está a ser escrito.

A screenshot of the Unbiased Pareto 26.10 Preview model card page, headed "Pareto 26.10 Preview model card" and subtitled "Pareto is our blended AI model, available through the Unbiased AI platform. Send one request and receive one answer.", showing the DeepSWE v1.1 and Terminal-Bench cost-per-score chart with the Pareto 26.10 Preview point at 69.9% and $0.24 alongside other labs' published points, over an evaluation-details block stating the Pareto 26.10 Preview results are from October 1, 2026 runs and may change before final publication.

O que observar antes de se comprometer

Três coisas específicas resolveriam as questões em aberto, e cada uma é verificável.

A primeira é uma pontuação independente. Até que um terceiro execute o 26.10 Preview em um harness publicado, o 92,4 no GPQA-Diamond e o 50,8 no Terminal-Bench são alegações do fornecedor sobre o trabalho do fornecedor — boas o suficiente para decidir se vale testar, mas não boas o suficiente para decidir se vale migrar.

O segundo é o que a prévia faz com o preço. Se o anúncio roteado permanecer em $0,80 e $3,20 enquanto a própria plataforma do fornecedor mantém $2,50 e $7,50, a diferença é uma decisão de canal que vale a pena entender antes de construir um modelo de custos com base em qualquer um dos números.

O terceiro é o que “pode mudar sem aviso prévio” acaba significando na prática. Uma preview que é revisada duas vezes em um mês é um instrumento diferente de uma que é congelada e renomeada no fim do trimestre, e o changelog é onde isso vai aparecer primeiro.

Nada disso é argumento contra experimentá-lo. Um modelo multimodal de 1M de tokens que apresenta pontuações próximas da fronteira a US$ 0,24 por tarefa vale uma tarde de trabalho de verdade nos seus próprios prompts, e essa avaliação custa menos do que a discussão a respeito. O argumento é contra presumir que o modelo que você avalia esta semana será o modelo que você terá na próxima semana — o que, para um lançamento que o próprio fornecedor chama de prévia, é a única suposição que precisa estar correta.

Uma versão de pré-visualização é exatamente o caso para o qual o failover automático foi criado: failover automático transforma um modelo que muda sob seus pés no meio da semana em uma alteração de configuração, em vez de uma interrupção.