Um cartão de título gerado com o texto 'Clef vs LFM2.5 2.6B Base', com o subtítulo '55 GB em um H200 contra 5,4 GB em um laptop', e chips com os textos 'modelo de decisão de 27B' e 'base pré-treinada de 2,69B'. O logotipo do OrcaRouter é composto no canto inferior direito.
Engineering & Research

Clef vs. LFM2.5 2.6B Base: 55 GB em um H200, ou 5,4 GB em um laptop

Autor

Alistair Wren

Data de publicação

Modelos mais recentes · 20Ver todos os modelos →
Benchmarks: Artificial Analysis · atualizado diariamente
Voltar para todas as publicações

Aqui está uma comparação em que o hardware decide a questão antes dos modelos. Cloudflare/clef é um modelo multimodal de decisão com 27 bilhões de parâmetros, pós-treinado a partir do Qwen3.8-27B, cujo repositório ocupa pouco mais de 55 GB, distribuídos em doze shards de backbone mais uma pequena cabeça de esquema conjunta. LiquidAI/LFM2.5-2.6B-Base é um checkpoint somente texto com 2,69 bilhões de parâmetros, cujos pesos são um único arquivo de 5,4 GB, publicado pela Liquid AI em 1º de agosto de 2026 sob a LFM Open License. A latência publicada pela própria Cloudflare para o Clef — mediana de 209,3 ms, p95 de 238,6 ms — foi medida em um único H200. A implantação pretendida pela Liquid AI para sua família LFM2.5 é um laptop, um celular ou um dispositivo portátil Ryzen. Ambos os fornecedores descrevem seu modelo como pequeno, rápido e eficiente, e ambos estão dizendo a verdade sobre uma máquina diferente.

Há uma segunda lacuna por trás da primeira, e é ela que de fato muda os planos. Nem Clef nem LFM2.5 2.6B Base responde a uma pergunta de cara, do jeito que você provavelmente espera. O Clef chega totalmente treinado para uma tarefa da qual não pode se desviar: ele responde a perguntas digitadas e não fará mais nada além disso. O checkpoint da Liquid chega sem treinamento para absolutamente nada — é um modelo base, deliberadamente sem ajuste por instruções, e o próprio card da Liquid AI diz que ele é recomendado apenas para fine-tuning pesado. Então a verdadeira questão não é qual dos dois é mais barato de executar. É se você está comprando um componente pronto ou um material de partida, e a resposta é diferente para cada um deles.

Onde cada um é executado, e por que isso é toda a comparação

O formato de implantação não é um detalhe secundário para esses dois modelos. Para um modelo de decisão, isso é a arquitetura, porque um forward pass de 209 ms e uma história de "roda na máquina à sua frente" são a mesma afirmação contada a partir de extremos diferentes.

• Parâmetros — 27B para o Clef, com o codificador de visão Qwen3.8-27B mantido; 2,69B somente texto para o LFM2.5 2.6B Base.

• Disco — um repositório de 55 GB para o Clef; um ficheiro safetensors de 5,4 GB para o checkpoint Liquid, com builds quantizadas em GGUF, ONNX e MLX publicadas ao lado.

• Hardware — A Cloudflare testou o Clef com torch 2.11 e transformers 5.10.2 em uma única H200, e os números de latência vêm dessa execução. O irmão pós-treinado da Liquid AI deste checkpoint roda a 220 tokens por segundo em um Apple M5 Max e 113 tok/s em uma CPU AMD Ryzen, em menos de 2,5 GB de memória, e o fornecedor observa que 30 tok/s são alcançáveis em um telefone.

• Contexto — 65.536 tokens para o Clef, de acordo com a página do modelo Workers AI e o post de lançamento; 131.072 tokens para o LFM2.5 2.6B Base.

• Entrada — Clef lê texto, JSON, imagens e quadros de vídeo e pontua-os conjuntamente. O checkpoint Liquid é somente texto.

• Licença — Apache-2.0 para o Clef. LFM Open License v1.0 para o LFM2.5, que tem código-fonte disponível, em vez de ser código aberto segundo a OSI: o uso comercial está condicionado a que a sua organização se mantenha abaixo de 10 milhões de dólares de receita anual e, acima desse limite, a licença simplesmente não o concede. Esse limite é um fato de aquisição, não uma nota de rodapé.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Custo por decisão não é a mesma questão que custo por token

A tentação aqui é dividir dois preços e declarar um vencedor. Isso não sobrevive ao contato com o que os dois modelos fazem.

Clef custa US$ 0,24 por milhão de tokens de entrada no Workers AI da Cloudflare. Sua saída não é prosa, então a linha usual de tokens de saída não existe; você paga pelo estado, uma vez, e recebe uma distribuição de volta. Para uma camada de roteamento que toma milhões de pequenas decisões por dia, esse número é todo o custo operacional, e é um número que você só consegue obter de um fornecedor em vez de sua própria conta de luz.

O LFM2.5 2.6B Base não custa nada por chamada e não consegue tomar uma decisão. Para obter um custo por decisão a partir dele, primeiro você precisa fazer um ajuste fino nele para a sua tarefa, o que significa reunir dados, executar um job de treinamento, avaliar o resultado e só então descobrir quanto isso custa a você em kVA e tempo de engenharia. A economia atraente de um checkpoint de 2.6B é real, mas está a jusante de um trabalho que ainda não aconteceu, e a pessoa que compara preços por token passou direto por cima disso.

A forma honesta de enquadrar isto é que estas são duas compras diferentes. Clef é um componente com preço de tabela e uma conta de hospedagem. O Liquid checkpoint é uma matéria-prima cujo custo é a execução de treinamento que você vai pagar de qualquer maneira — e cujo retorno é que, depois, você passa a ser dono do artefato em definitivo, momento em que o custo marginal de uma decisão é, de fato, a eletricidade. Para uma tarefa restrita, de alto volume e estável, essa troca costuma ser acertada. Para uma tarefa que você ainda não especificou, ela é o inverso, porque você não consegue fazer ajuste fino em direção a um alvo que não consegue descrever.

Uma base não treinada não é um modelo pior, é uma linha de partida diferente.

É tentador interpretar a ausência da tabela de benchmarks do checkpoint Liquid como uma fraqueza oculta. Não é. Pontuar um modelo base pré-treinado em benchmarks de seguimento de instruções mediria a ausência de fine-tuning, não a qualidade do substrato, e é exatamente por isso que a Liquid AI avalia o LFM2.5-2.6B pós-treinado e deixa o base sem avaliação. O espaço em branco é verificável do seu lado, e é esse o ponto: baixe 5,4 GB, execute a sua própria avaliação na sua própria tarefa e saiba a resposta antes de se comprometer a servir qualquer coisa.

A tabela da Clef apresenta o tipo oposto de evidência e tem o problema oposto. A Cloudflare publica cerca de 40 linhas de benchmark, um conjunto completo de avaliação de workflow e uma distribuição de latência, e cada uma delas foi produzida pela Cloudflare em seu próprio Decision Index, sem que nenhum terceiro tenha reproduzido nada disso. A coluna da Clef é muito mais informativa que a coluna da Liquid, e nenhum número nela foi verificado por mais ninguém. Isso é uma afirmação mais forte do que um espaço em branco, e mais fraca do que parece.

O que você mesmo consegue medir se divide da mesma forma. Com o checkpoint Liquid, você consegue medir tudo — são 5,4 GB no seu próprio disco. Com o Clef, os pesos Apache-2.0 são igualmente seus para baixar e executar, mas igualar a mediana de 209 ms da Cloudflare exige a classe de GPU que a Cloudflare usou; então, na prática, a maioria das equipes vai medi-lo por meio do endpoint hospedado e herdar a disponibilidade do fornecedor junto com sua latência.

Onde a camada de roteamento se encaixa, para cada um deles

Nem o Clef nem qualquer variante do LFM2.5 é uma rota no OrcaRouter, e este artigo não é uma alegação de disponibilidade — o catálogo retorna 404 para ambos, então o Clef vem do Workers AI da Cloudflare ou da sua própria GPU, e o checkpoint da Liquid vem da sua própria distribuição.

O que uma camada de roteamento genuinamente faz aqui é o padrão que ambos os modelos implicam. Um scorer pequeno e delimitado que decide, e um generalista maior que age com base na decisão, é uma arquitetura de dois modelos por construção — e o próprio backbone da Clef torna concreta a segunda metade disso, já que o modelo a partir do qual a Cloudflare fez o pós-treinamento, o Qwen3.8 27B, é uma rota listada a US$ 0,33 por milhão de tokens de entrada e US$ 2,40 por milhão de tokens de saída em um contexto de 262.144 tokens. Um endpoint na frente de mais de 200 modelos significa que o decisor barato e o ator capaz ficam atrás da mesma chave, compostos em uma única chamada por meio da DSL de roteamento em vez de conectados manualmente, com failover automático para que uma tarde ruim de um provedor não derrube junto o caminho de decisão. Se, em vez disso, você estiver auto-hospedando o checkpoint da Liquid e comparando seu fine-tune com os modelos que ele precisa superar, o mesmo endpoint é o que faz dessa comparação uma mudança de configuração em vez de um ciclo de aquisição.

O Jev 1.13 da TypeSafe vale a pena mencionar especificamente para o caso de auto-hospedagem: é o modelo de decisão com o qual a Cloudflare fez benchmark e fala deliberadamente o mesmo POST /v1/systemone formato de requisição que o Clef, é uma rota listada a $0,042 por milhão de tokens de entrada em um contexto de 65.536 tokens, e é a forma de baixo esforço de descobrir se um modelo de decisão limitado ajuda seu pipeline antes de você gastar uma execução de treinamento em um substrato que pode não precisar existir.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

Qual deles, para quê?

Use o checkpoint Liquid quando a tarefa for estreita, de alto volume, especificada o suficiente para se escrever dados de treino para ela e limitada por uma das duas restrições rígidas que uma API roteada não consegue resolver: os dados não podem sair da sua infraestrutura, ou a máquina onde tem de correr é a que está na sua secretária. O limiar de receita do LFM 1.0 é a primeira coisa a verificar, porque é ele que decide se a licença está sequer disponível para você.

Use o Clef quando a decisão já for enumerável, o estado couber em 64K, a resposta precisar de uma probabilidade calibrada em vez de uma frase, e 209 ms em um hot path for a propriedade que você está comprando. Seu esquema fixo é o recurso — um formato de saída auditável, reproduzível e sem parser — e sua pegada de 55 GB é o preço do backbone que o torna preciso logo na primeira tentativa, em vez de depois de uma execução de treinamento.

O que você não deve fazer é escolher pelo número de parâmetros. Um modelo de 2,69B que precisa ser treinado antes de conseguir responder não é uma versão menor de um modelo de 27B que já é capaz, e os dois números no título — 55 GB e 5,4 GB — descrevem dois orçamentos diferentes, não dois pontos em uma mesma escala.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

A questão em aberto, e é a mesma para ambos

Nenhum dos fornecedores publicou evidências que resistam ao escrutínio independente. A execução do Decision Index da Cloudflare é autoadministrada e não reproduzida; os números de throughput da Liquid AI são medições do próprio fornecedor em hardware que ele escolheu. O LFM2.5 2.6B Base não tem benchmark algum propositalmente, e a tabela Clef tem muitíssimos por opção.

Para o checkpoint do Liquid, a evidência que falta é barata de corrigir e está inteiramente em suas mãos — o arquivo é pequeno o bastante para ser avaliado em um laptop numa tarde. Para o Clef, não é: reproduzir a mediana de 209 ms exige o hardware que a Cloudflare usou e o estado que ninguém fora da Cloudflare montou. Essa assimetria, mais do que qualquer coisa em qualquer uma das duas especificações, é o que deve definir qual destes dois você planeja levar em conta neste mês.