Una tarjeta de título generada que dice 'Clef vs LFM2.5 2.6B Base', con el subtítulo '55 GB en una H200 frente a 5.4 GB en un portátil', con chips que dicen 'modelo de decisión de 27B' y 'base preentrenada de 2.69B'. El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Clef frente a LFM2.5 2.6B Base: 55 GB en una H200, o 5.4 GB en un portátil

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Aquí hay una comparación en la que el hardware decide la discusión antes de que lo hagan los modelos. Cloudflare/clef es un modelo multimodal de decisión de 27 mil millones de parámetros, postentrenado a partir de Qwen3.8-27B, cuyo repositorio mide un poco más de 55 GB repartidos en doce fragmentos de backbone más una pequeña cabeza de esquema conjunta. LiquidAI/LFM2.5-2.6B-Base es un checkpoint solo de texto de 2,69 mil millones de parámetros cuyos pesos son un único archivo de 5,4 GB, publicado por Liquid AI el 1 de agosto de 2026 bajo la LFM Open License. La latencia publicada por Cloudflare para Clef —209,3 ms de mediana, 238,6 ms de p95— se midió en una única H200. El despliegue previsto por Liquid AI para su familia LFM2.5 es un portátil, un teléfono o una consola portátil Ryzen. Ambos proveedores describen su modelo como pequeño, rápido y eficiente, y ambos dicen la verdad sobre una máquina diferente.

Hay una segunda brecha detrás de la primera, y es la que realmente cambia los planes. Ni Clef ni LFM2.5 2.6B Base responden a una pregunta de fábrica tal como probablemente esperas. Clef llega totalmente entrenado para una tarea de la que no puede desviarse: responde preguntas escritas y no hará nada más. El checkpoint de Liquid llega sin entrenamiento para nada en absoluto — es un modelo base, deliberadamente sin ajuste por instrucciones, y la propia ficha de Liquid AI dice que solo se recomienda para un ajuste fino intensivo. Así que la verdadera pregunta no es cuál de los dos es más barato de ejecutar. Es si estás comprando un componente terminado o un material de partida, y la respuesta es diferente para cada uno de ellos.

Dónde se ejecuta cada uno, y por qué esa es toda la comparación

La forma del despliegue no es un detalle secundario para estos dos modelos. Para un modelo de decisión, es la arquitectura, porque una pasada forward de 209 ms y un relato de «se ejecuta en la máquina que tienes delante» son la misma afirmación contada desde extremos distintos.

• Parámetros — 27B para Clef, con el codificador de visión Qwen3.8-27B conservado; 2,69B solo texto para LFM2.5 2.6B Base.

• Disco — un repositorio de 55 GB para Clef; un único archivo safetensors de 5,4 GB para el checkpoint de Liquid, junto con compilaciones cuantizadas de GGUF, ONNX y MLX publicadas además.

• Hardware — Cloudflare probó Clef con torch 2.11 y transformers 5.10.2 en una sola H200, y sus cifras de latencia provienen de esa ejecución. El modelo hermano postentrenado de este checkpoint, de Liquid AI, se ejecuta a 220 tokens por segundo en un Apple M5 Max y a 113 tok/s en una CPU AMD Ryzen, con menos de 2,5 GB de memoria, y el proveedor señala que se pueden alcanzar 30 tok/s en un teléfono.

• Contexto — 65.536 tokens para Clef, según la página del modelo de Workers AI y la publicación de lanzamiento; 131.072 tokens para LFM2.5 2.6B Base.

• Entrada — Clef lee texto, JSON, imágenes y fotogramas de vídeo, y los puntúa de forma conjunta. El checkpoint Liquid es solo de texto.

• Licencia — Apache-2.0 para Clef. LFM Open License v1.0 para LFM2.5, que es de código disponible en lugar de código abierto OSI: el uso comercial está condicionado a que tu organización se mantenga por debajo de los 10 millones de dólares en ingresos anuales, y por encima de esa línea la licencia simplemente no lo otorga. Ese umbral es un hecho de adquisición, no una nota al pie.

A two-column comparison scoreboard titled 'Clef vs LFM2.5 2.6B Base — the scoreboard'. The left column 'Clef' reads: Parameters: 27B multimodal; On disk: 55 GB repository; Context: 65,536 tokens; Output: probability per option, no text; Hardware: H200 class, 209.3 ms median; Licence: Apache 2.0. The right column 'LFM2.5 2.6B Base' reads: Parameters: 2.69B text-only; On disk: 5.4 GB single file; Context: 131,072 tokens; Output: untuned text continuation; Hardware: laptop, 220 tok/s on M5 Max; Licence: LFM 1.0, $10M revenue threshold. A footer reads 'Clef figures per Cloudflare; LFM figures per Liquid AI's cards. Neither independently reproduced.' The OrcaRouter logo is composited in the bottom-right corner.

El costo por decisión no es la misma pregunta que el costo por token

La jugada tentadora aquí es dividir dos precios y declarar un ganador. Eso no sobrevive al contacto con lo que hacen los dos modelos.

Clef cuesta $0.24 por millón de tokens de entrada en Workers AI de Cloudflare. Su salida no es prosa, así que la habitual línea de tokens de salida no existe; pagas por el estado, una sola vez, y recibes una distribución a cambio. Para una capa de enrutamiento que toma millones de decisiones pequeñas al día, ese número es todo el costo operativo, y es un número que solo puedes obtener de un proveedor en lugar de tu propia factura de electricidad.

LFM2.5 2.6B Base no cuesta nada por llamada y no puede tomar una decisión. Para obtener de él un costo por decisión, primero hay que ajustarlo finamente en tu tarea, lo que implica reunir datos, ejecutar un trabajo de entrenamiento, evaluar el resultado y solo entonces descubrir cuánto te cuesta en kVA y tiempo de ingeniería. La atractiva economía de un checkpoint de 2.6B es real, pero es posterior a un trabajo que aún no ha ocurrido, y la persona que compara precios por token se ha saltado eso directamente.

La forma honesta de plantearlo es que se trata de dos compras diferentes. Clef es un componente con un precio de lista y una factura de hosting. El checkpoint de Liquid es una materia prima cuyo costo es la ejecución de entrenamiento que vas a pagar de todos modos, y cuyo beneficio es que después posees el artefacto en propiedad absoluta, y en ese punto el costo marginal de una decisión es, de verdad, la electricidad. Para una tarea acotada, de gran volumen y estable, ese intercambio suele ser acertado. Para una tarea que aún no has especificado, es al revés, porque no puedes hacer ajuste fino hacia un objetivo que no puedes describir.

Una base sin entrenar no es un modelo peor, es una línea de partida diferente.

Es tentador interpretar la ausente tabla de benchmarks del checkpoint de Liquid como una debilidad oculta. No lo es. Puntuar un modelo base preentrenado en benchmarks de seguimiento de instrucciones mediría la ausencia de ajuste fino, no la calidad del sustrato, que es precisamente por lo que Liquid AI evalúa con benchmarks el LFM2.5-2.6B postentrenado y deja el base sin evaluar. El espacio en blanco es verificable desde tu lado, y ese es el punto: descarga 5.4 GB, ejecuta tu propia evaluación en tu propia tarea y conoce la respuesta antes de comprometerte a servir cualquier cosa.

La tabla de Clef tiene la forma opuesta de evidencia y el problema opuesto. Cloudflare publica unas 40 filas de benchmark, un conjunto completo de evaluación de flujos de trabajo y una distribución de latencia, y cada uno de ellos fue producido por Cloudflare sobre el propio Decision Index de Cloudflare, sin que ningún tercero haya reproducido nada de ello. La columna de Clef es mucho más informativa que la columna de Liquid, y ni una sola cifra de ella ha sido comprobada por nadie más. Eso es una afirmación más fuerte que un espacio en blanco, y más débil de lo que parece.

Lo que puedes medir por tu cuenta se divide de la misma manera. Con el checkpoint Liquid, puedes medirlo todo: son 5,4 GB en tu propio disco. Con Clef, los pesos Apache-2.0 son igualmente tuyos para descargar y ejecutar, pero igualar la mediana de 209 ms de Cloudflare requiere la clase de GPU que usó Cloudflare, así que, en la práctica, la mayoría de los equipos lo medirá a través del endpoint alojado y heredará la disponibilidad del proveedor junto con su latencia.

Dónde encaja la capa de enrutamiento, para cada uno de ellos

Ni Clef ni ninguna variante de LFM2.5 es una ruta en OrcaRouter, y este artículo no es una afirmación de disponibilidad — el catálogo devuelve un 404 para ambos, así que Clef proviene de Workers AI de Cloudflare o de tu propia GPU, y el checkpoint de Liquid proviene de su propia distribución.

Lo que realmente hace aquí una capa de enrutamiento es el patrón que ambos modelos implican. Un evaluador pequeño y acotado que decide, y un generalista más grande que actúa según esa decisión, es una arquitectura de dos modelos por construcción — y el propio backbone de Clef hace concreto la segunda mitad de eso, ya que el modelo a partir del cual Cloudflare hizo post-entrenamiento, Qwen3.8 27B, es una ruta listada a $0.33 por millón de tokens de entrada y $2.40 por millón de tokens de salida sobre un contexto de 262,144 tokens. Un único endpoint frente a más de 200 modelos significa que el decisor barato y el actor capaz quedan detrás de la misma clave, compuestos en una sola llamada mediante el DSL de enrutamiento en lugar de conectados a mano, con conmutación por error automática para que una tarde mala de un proveedor no se lleve por delante la ruta de decisión. Si, en cambio, estás autoalojando el checkpoint de Liquid y comparando tu ajuste fino con los modelos a los que tiene que superar, ese mismo endpoint es lo que convierte esa comparación en un cambio de configuración en lugar de un ciclo de adquisición.

Vale la pena mencionar Jev 1.13 de TypeSafe específicamente para el caso de autoalojamiento: es el modelo de decisión con el que Cloudflare hizo sus pruebas comparativas y que, deliberadamente, habla la misma POST /v1/systemone forma de petición que Clef, es una ruta listada a $0,042 por millón de tokens de entrada con un contexto de 65.536 tokens, y es la manera de bajo esfuerzo de averiguar si un modelo de decisión acotado ayuda a tu pipeline antes de gastar una ejecución de entrenamiento en un sustrato que quizá no necesite existir.

A headless capture of the OrcaRouter model page for qwen/qwen3.8-27b, showing the Qwen breadcrumb, the Qwen3.8 27B title with a 262K context marker, the text, image and video input modalities, and the site's Code samples, Pricing, Performance, Public benchmarks and FAQ navigation tabs.

¿Cuál, para qué?

Toma el checkpoint de Liquid cuando la tarea sea acotada, de gran volumen, esté especificada lo bastante bien como para escribir datos de entrenamiento para ella y esté sujeta a una de las dos restricciones estrictas que una API enrutada no puede resolver: los datos no pueden salir de tu infraestructura, o la máquina en la que tiene que ejecutarse es la que está en tu escritorio. El umbral de ingresos de LFM 1.0 es lo primero que hay que comprobar, porque determina si la licencia está siquiera disponible para ti.

Elige Clef cuando la decisión ya sea enumerable, el estado quepa en 64K, la respuesta necesite una probabilidad calibrada en lugar de una frase, y 209 ms en una ruta crítica sea la propiedad que estás comprando. Su esquema fijo es la característica — una forma de salida auditable, reproducible y sin parser — y su huella de 55 GB es el precio del backbone que lo hace preciso al primer intento en lugar de después de una ejecución de entrenamiento.

Lo que no deberías hacer es elegir según la cantidad de parámetros. Un modelo de 2.69B que tiene que ser entrenado antes de poder responder no es una versión más pequeña de un modelo de 27B que ya puede hacerlo, y los dos números del título —55 GB y 5.4 GB— describen dos presupuestos diferentes, no dos puntos en una misma escala.

A headless capture of the LiquidAI/LFM2.5-2.6B-Base model card on Hugging Face, showing the model title, the TextGeneration and Transformers and Safetensors tags, a 16-languages marker, the Liquid AI organisation, and the opening line describing the LFM2.5 family as hybrid models designed for on-device deployment.

La cuestión abierta, y es la misma para ambos

Ninguno de los dos proveedores tiene evidencia que resista la independencia. La ejecución del Decision Index de Cloudflare es autoadministrada y no reproducida; las cifras de rendimiento de Red AI son mediciones propias del proveedor sobre lo que eligió. El LFM2.5 2.6B Base no tiene ningún benchmark por diseño, y la tabla de Clef tiene muchísimos por elección.

Para el checkpoint de Liquid, la evidencia faltante es barata de corregir y está en tus manos: el archivo es lo bastante pequeño como para evaluarlo en una laptop en una tarde. Para Clef no lo es: reproducir la mediana de 209 ms requiere el hardware que usó Cloudflare y el estado que nadie fuera de Cloudflare ha reunido. Esa asimetría, más que cualquier cosa en cualquiera de las dos especificaciones, es lo que debería determinar en torno a cuál de estos dos vas a planificar este mes.