
Solar Mini 4 vs LFM2.5 2.6B Base: Três vezes o índice, e uma comparação de custos que não existe
- openaiNOVOOpenAI: GPT-6.1 Sol2026-09-29$2.00 / $10.00 por 1M de tokens
- anthropicNOVOAnthropic: Claude Sonnet 5.52026-09-28$2.00 / $10.00 por 1M de tokens · 159 tok/s
- typesafeNOVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 220 tok/s
- OpenAINOVOOpenAI: GPT-6 Luna2026-09-2238Inteligência
- OpenAINOVOOpenAI: GPT-6 Sol2026-09-2248Inteligência
- AnthropicNOVOAnthropic: Claude Opus 5.52026-09-2258Inteligência
- xAINOVOGrok 4.72026-09-2146Inteligência
- OrcaNOVOOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 118 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligência
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligência77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligência76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligência76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligência82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 102 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligência72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 217 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligência75Código
- obsidianQwen3.8 27B2026-08-1534Inteligência68Código
A forma honesta de comparar o Solar Mini 4 e o LFM2.5 2.6B Base é admitir desde o início que eles não estão no mesmo mercado. O Solar Mini 4 é o mixture-of-experts esparso de 35 bilhões de parâmetros da Upstage, lançado em 22 de setembro de 2026, que ativa cerca de 3 bilhões de parâmetros por token, é proprietário e é cobrado a US$ 0,10 por milhão de tokens de entrada e US$ 0,40 por milhão de saída. O LFM2.5 2.6B Base é o checkpoint pré-treinado de 2,69 bilhões de parâmetros da Liquid AI, publicado no Hugging Face no início de agosto de 2026 sob a LFM Open License v1.0, pequeno o suficiente para caber na memória de um telefone. Um é um endpoint. O outro é um arquivo de pesos e, se você está lendo isto porque quer executar um modelo em vez de chamar um, a comparação já acabou.
O que torna o par digno de um artigo, de qualquer forma, é a única dimensão em que eles realmente se sobrepõem: ambos foram posicionados contra a mesma régua independente, e a forma dessa comparação não é o que as contagens de parâmetros preveem. O Artificial Analysis atribui ao Solar Mini 4 uma pontuação de 24 no Intelligence Index v4.3.2 e classifica a geração LFM2.5 2.6B em 8,4 — mas o segundo número é uma estimativa, e não está medindo o checkpoint do título deste artigo. Ambas as ressalvas importam, e são a primeira coisa a esclarecer.
A ficha técnica, lado a lado
• Parâmetros — O Solar Mini 4 tem 35B no total, com 3B ativos; o LFM2.5 2.6B Base é denso, com 2,69B, sem nada retido. Treze vezes mais pesos do lado da Upstage para um orçamento de computação por token aproximadamente igual.
• Arquitetura — O Solar Mini 4 é uma mistura esparsa de especialistas. O LFM2.5 2.6B Base tem 30 camadas, 22 delas blocos de convolução curta com duplo gate e 8 de atenção com consultas agrupadas, o design híbrido que a Liquid criou para inferência em CPU e na borda.
• Treinamento — A Upstage não publica um orçamento de tokens. O cartão do Liquid documenta 34 trilhões de tokens e um vocabulário de 128.000 tokens em 16 idiomas, entre eles coreano e japonês.
• Licença — O Mini 4 é proprietário. O LFM2.5 2.6B Base é distribuído sob a LFM Open License v1.0 — permissiva para uso comercial com condições, e permite fine-tuning.
• Contexto — Upstage documenta 512K tokens, Artificial Analysis lista 1,05M para o mesmo modelo, então trate o teto como indefinido. LFM2.5 2.6B Base roda 131.072.
• Modalidade — ambos são entrada de texto, saída de texto. Nenhum deles aceita imagens ou áudio.
• Preço — Solar Mini 4 a US$ 0,10 / US$ 0,01 em cache / US$ 0,40 por milhão de tokens, atualmente com 50% de desconto até 22 de outubro de 2026. O LFM2.5 2.6B Base não tem nenhuma tabela de preços; o host Artificial Analysis acompanha os preços da geração LFM2.5 2.6B em US$ 0,00.
O que "8.4, estimated" mede e não mede

A entrada do Artificial Analysis para a geração LFM2.5 2.6B — o modelo pós-treinado, não o Base pré-treinado — traz um índice de 8,4 sinalizado como estimativa, com a maioria de suas avaliações de componentes marcadas da mesma forma. Isso é uma posição em um ranking, não uma especificação na qual se basear, e nunca deve ser citado como se alguém tivesse executado o checkpoint Base na suíte. Ninguém o fez. O próprio cartão de modelo da Liquid não publica nenhuma tabela de benchmark para o LFM2.5 2.6B Base: é um checkpoint pré-treinado de conclusão de texto, e o cartão diz claramente que ele é recomendado apenas para fine-tuning pesado.
O irmão avaliado é um artefato diferente. A tabela de benchmarks da Liquid para o LFM2.5 2.6B pós-treinado mostra IFStruct em 85,5 e Multi-IF em 80,1, AIME25 em 51,9, LiveCodeBench v6 em 59,4, BFCLv4 em 56,9 e τ³-Banking em 5,7 — todos executados pelo fornecedor, todos na versão ajustada para instruções, e o valor de τ³ é o que soa como um alerta.
O perfil do Solar Mini 4 tem um formato completamente diferente. Ele obtém 83,3% no AA-LCR v1.1 para raciocínio de contexto longo, 47,6% no SciCode e −10,8 no AA-Omniscience, com 18,4% de precisão e uma taxa de não alucinação de 64,2%. Ele também obtém 1% no Terminal-Bench 4.0 e 22,3% no AutomationBench-AA. Ambas as famílias são fracas em trabalho agêntico; o modelo da Upstage é fraco em trabalho agêntico e caro, o que é uma posição pior do que ser fraco em trabalho agêntico e gratuito.
Onde o Solar Mini 4 justifica o seu preço é na escala de raciocínio. Com 88.300 tokens de saída por tarefa de indexação — 71.600 deles de raciocínio —, ele gasta computação de uma forma que um modelo denso de 2,6B não consegue imitar recebendo um prompt mais longo. Pode-se dizer a um modelo com 2,69 bilhões de parâmetros que pense passo a passo; não se pode dizer a ele que tenha 35 bilhões de parâmetros. Esse é o produto de verdade.
Três vezes o índice, e nenhum valor de custo comparável
Artificial Analysis coloca o Solar Mini 4 a US$ 0,36 por tarefa de índice concluída, contra US$ 0,006 do Granite 4.2 3B, e a geração LFM2.5 2.6B tem preço zero, de modo que não existe um valor de custo por tarefa que tornaria isso uma proporção justa. Portanto, o enquadramento “o Solar Mini 4 custa muito mais do que o LFM2.5 2.6B Base” é verdadeiro e um pouco fora de propósito. A questão relevante é se o trabalho de extração estruturada em documentos longos em língua coreana, para o qual o Solar Mini 4 foi criado, pode ser realizado por um checkpoint pré-treinado de 2,69B. Normalmente, não pode, e então a comparação passa a ser entre o Solar Mini 4 e um generalista de ponta, em vez de entre o Solar Mini 4 e um modelo de celular.
O caso em que o LFM2.5 2.6B Base vence não é o caso em que ele é mais barato. É o caso em que a tarefa é estreita o suficiente para que o ajuste fino feche a lacuna. Extração estruturada de campos de um formato de documento conhecido, classificação com base em uma taxonomia fixa, um assistente no dispositivo que precisa funcionar sem rede — essas são tarefas em que um checkpoint de 2,69B mais os seus próprios dados de treinamento supera um generalista de 35B mais uma tabela de preços, e custa uma instância de GPU em vez de um medidor de tokens. A Liquid disponibiliza o checkpoint base com receitas de continued-pretraining, LoRA SFT, DPO e GRPO por meio do Unsloth e do TRL exatamente para essa finalidade.
Qual chamar
Recorra ao Solar Mini 4 quando a entrada for longa, for preciso raciocinar sobre a saída e a combinação de idiomas incluir coreano ou japonês — e quando sete minutos de decodificação por tarefa difícil forem toleráveis. Recorra ao LFM2.5 2.6B Base quando os pesos precisarem ser seus, o dispositivo não tiver rede e a tarefa for específica o bastante para ajuste fino. As implantações interessantes usam ambos, porque não são alternativas: um modelo local pequeno faz o roteamento, a redação e a extração, e um modelo hospedado é chamado apenas para a fração de solicitações que realmente precisavam de 35B parâmetros.
O modelo da Liquid não está no OrcaRouter, e o da Upstage também não, então nenhuma das duas rotas é algo que possamos vender para você. O que podemos fazer é a parte que transforma essa comparação de uma decisão em uma configuração: mais de 200 modelos atrás de uma única chave, com 0% de markup sobre o preço de tabela do provedor, com failover automático entre provedores e uma DSL de roteamento que permite compor vários modelos em uma única chamada. Quando a resposta certa é "o barato na maior parte do tempo e o bom quando importa", isso é um problema de roteamento, e é por isso que a DSL de roteamento existe.

O número que nenhum dos fornecedores colocará em um slide
Latência. O Solar Mini 4 consome 88.300 tokens de saída por tarefa do Intelligence Index a uma taxa medida de 204 tokens por segundo, então levou em média 430 segundos — um pouco mais de sete minutos — em cada tarefa difícil. A geração LFM2.5 2.6B, no host que a Artificial Analysis testou, rodou a 45,7 tokens por segundo com uma espera de 2,8 segundos pelo primeiro chunk, mas isso é um host de datacenter conversando com um modelo que normalmente rodaria na sua mesa. As próprias medições da Liquid colocam a mesma arquitetura a 220 tokens por segundo num M5 Max, 113 num Ryzen AI Max+ 395, e cerca de 30 tokens por segundo num telefone — o que é um loop de agente utilizável num dispositivo sem rede.
Se a sua carga de trabalho for interativa, a comparação não é nem de perto e nenhuma pontuação de benchmark vai mudar isso. Se a sua carga de trabalho for em lote e o que está esperando for um cron job, sete minutos está ótimo e a profundidade de raciocínio vale a pena.

Duas notas de fontes para encerrar. Todos os valores da Artificial Analysis aqui apresentados são medições independentes dessa organização numa suite partilhada; o índice do LFM2.5 2.6B é explicitamente uma estimativa e refere-se ao modelo pós-treinado, e não ao checkpoint Base pré-treinado mencionado acima. Todos os valores da Liquid AI são execuções do próprio fornecedor nos seus próprios benchmarks, não reproduzidas — e o próprio checkpoint Base não tem quaisquer pontuações publicadas, o que é um facto sobre modelos pré-treinados e não uma crítica a este.
