Una tarjeta de título generada que dice «Clef», con el subtítulo «los modelos de decisión de Cloudflare que nunca escriben un token», con dos etiquetas que dicen «weights 30 sept 2026» y «blog 1 oct 2026». El logotipo de OrcaRouter está compuesto en la esquina inferior derecha.
Engineering & Research

Clef copia la API de Jev a propósito — y esa es la parte interesante

Autor

Alistair Wren

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Clef es un modelo multimodal de 27 mil millones de parámetros de Cloudflare que responde preguntas escritas y nada más. Le entregas un estado — texto, JSON, una imagen, un fotograma de vídeo — más un esquema de hasta 64 preguntas con nombre, y devuelve una probabilidad para cada opción permitida en una sola pasada hacia delante. Sin texto generado, sin analizador, sin bucle de decodificación. Lo que hace que Cloudflare/clef valga la pena leer no es ese diseño, que tomó prestado, sino el formato de cable que eligió: Cloudflare creó Clef para hablar el cuerpo de solicitud y respuesta de Jev System One, el modelo de decisión que TypeSafe lanzó primero, servido en la misma POST /v1/systemone ruta. La interoperabilidad aquí es todo el argumento comercial. Si tu canalización ya hace preguntas a un modelo de decisión de esa forma, Clef es un cambio de URL y una cadena de modelo, no una migración.

Es una cosa inusual de enterrar en una publicación de lanzamiento, y Cloudflare no la entierra: la tarjeta del modelo afirma sin rodeos que la API es "totalmente compatible con Jev y SystemOne", y el blog abre acreditando a TypeSafe por poner la categoría en el mapa antes de posicionar a Clef como la versión de segunda generación de un experimento interno. Así que la lectura honesta de este lanzamiento tiene tres partes: qué te aporta la decisión de compatibilidad, qué dicen los propios números de Cloudflare sobre dónde gana y pierde Clef, y qué queda sin verificar porque cada cifra de esa tabla fue producida por el proveedor que distribuye el modelo.

La categoría provino de otro lugar

La publicación de Cloudflare es sincera sobre el linaje. La idea de un modelo que devuelve salidas estructuradas y acotadas en lugar de prosa se atribuye a Jev System One de TypeSafe. La propia vía de entrada de Cloudflare fue una demostración anterior que forzó a un modelo de difusión a emitir probabilidades deterministas exponiendo logprobs, además del trabajo comunitario de Matt Mastracci para hacer que el motor de inferencia manejara ese patrón. Clef se basa en ese concepto con una arquitectura troncal diferente, una cabeza de puntuación diseñada específicamente y —la parte que importa comercialmente— un cuerpo de solicitud que coincide con el del proveedor establecido.

Cuando un proveedor copia el formato de transmisión de un rival y además se mide contra el índice del rival, la compatibilidad no es una nota al pie, es estrategia de producto. Cambiar el modelo de decisión de un endpoint existente es la forma más barata posible de que prueben a un nuevo entrante, y el experimento más barato posible para un equipo que ya tiene uno de estos conectado.

Lo que realmente se lanzó, y lo que cuesta

• Parámetros — 27B, creado congelando Qwen3.8-27B junto con su codificador de visión y entrenando una cabeza de esquema conjunta más adaptadores de bajo rango de rango 256 por encima.

• Hermano — Clef-Flash, la misma receta en 9B de Qwen3.5-9B. Artículo separado, compensaciones separadas.

• Contexto — 65.536 tokens, según la página del modelo de Workers AI y la entrada del blog. El asistente de codificación incluido usa por defecto max_length=16.384, un valor predeterminado y no un límite máximo, pero el valor predeterminado que obtienes si usas el cargador tal como se distribuye.

• Tipos de preguntas — noul (verdadero/falso, devuelve la probabilidad de verdadero), choice (de 2 a 26 opciones con nombre), score (de 2 a 26 niveles ordenados). De una a 64 preguntas por solicitud.

• Precio — 0,24 $ por millón de tokens de entrada en Workers AI de Cloudflare, o autoalojado a partir de pesos Apache-2.0 que ocupan aproximadamente 55 GB repartidos en doce fragmentos.

• Licencia — Apache 2.0, siguiendo el checkpoint base Qwen3.8-27B.

A single-column scoreboard titled 'Clef — the scoreboard', with six rows: Parameters: 27B, vision encoder kept; Trained from: Qwen3.8-27B, head plus rank-256 adapters; Context: 65,536 tokens; Output: a probability per option, no generated text; Latency: 209.3 ms median, 238.6 ms p95; Licence: Apache 2.0. A footer reads 'Cloudflare figures, self-run on the Jev Decision Index, unreproduced.' The OrcaRouter logo is composited in the bottom-right corner.

Dónde gana, y dónde no

La ejecución del Decision Index de Cloudflare es la fuente de todo lo que aparece en esta sección, y la tabla de clasificación que lo aloja es de Cloudflare. Nada de lo que sigue ha sido reproducido de forma independiente. Léalo como el mejor escenario de un proveedor y observe lo desigual que es.

El grupo de victorias donde un clasificador entrenado en casa debería ganar. Clef obtiene un macro-F1 de intención de BANKING77 de 94,2 frente al 79,7 de Jev, y CLINC150 con gestión de fuera de alcance en 97,4 frente a 89,3 —una brecha de treinta puntos que es la celda más relevante para la decisión en la tabla, porque negarse a clasificar es la mitad difícil del enrutamiento. También obtiene 86,7 en CRUXEval, 94,0 en CLadder y 83,0 en el simulador de electrodomésticos.

Las pérdidas son igual de reales y pertenecen al mismo párrafo. En conocimiento general y razonamiento difícil, el Jev más antiguo gana sin discusión: GPQA Diamond 78,3 a 48,0, MMLU-Pro 82,7 a 65,9, BBH 92,9 a 73,7. Esas son las tres brechas más grandes de la tabla y todas apuntan en la misma dirección. Clef tampoco es el mejor modelo en su propia comparación en el conjunto PhishNChips del dominio de seguridad, donde se sitúa en 79,6 y una entrada competidora obtiene una puntuación más alta.

En las cuatro evaluaciones de flujo de trabajo de extremo a extremo, extraídas del propio conjunto de evaluación público de TypeSafe y puntuadas contra etiquetas de consenso, las dos están tan parejas que se decide a cara o cruz. Clef se lleva el procesamiento de facturas en acciones exactas por 64,7 a 61,8 y el conjunto de incidentes de seguridad por 62,9 a 61,7; Jev se lleva la observabilidad de trazas de agentes por 71,6 frente a 68,5; atención al cliente es un empate de 76,3 a 76,0 que no significa nada con ese margen.

La latencia es donde la diferencia es estructural y no marginal. Cloudflare reporta 209,3 ms de mediana y 238,6 ms de p95 para Clef, frente a 524,1 y 536,0 para Jev. Ese orden se desprende del diseño no autorregresivo y no de las peculiaridades de un benchmark, por lo que es la cifra que más probabilidades tiene de sobrevivir al contacto con un despliegue real. Los milisegundos absolutos se midieron en el hardware propio de Cloudflare y, por sí solos, significan poco.

El dato más convincente del lanzamiento no es una fila de benchmark. Cloudflare afirma que su equipo de inteligencia de amenazas entregó un dominio a Clef junto con su servicio de renderizado de navegador y obtuvo un veredicto de categoría en 2,2 segundos, frente a 4,7 segundos de su propio LLM general más rápido en el mismo flujo de trabajo, con más clasificaciones devueltas. Anécdota interna, no un estudio —pero es el tipo de historia que explica por qué alguien construiría esto en lugar de pedirle a un modelo general.

A headless capture of Cloudflare's blog post announcing Clef, showing the Cloudflare site header, the breadcrumb 'Blog', the banner date 'October 1, 2026', the headline 'Introducing Clef: our open-source decision models, and new RL fine-tuning platform', and the three named authors.

Dos cosas que te dice la referencia de la API, y una que no.

Las trampas documentadas son pequeñas y vale la pena leerlas antes de portar cualquier cosa. El confidence mide cuán concentradas están las probabilidades, no la probabilidad de que la respuesta sea correcta: un modelo bien calibrado puede devolver una respuesta correcta con baja confianza y una incorrecta con alta confianza. Y cuando dos opciones empatan, la respuesta sigue el orden de opciones del modelo, así que pon tu opción preferida en primer lugar. Cualquiera que porte un clasificador basado en prompts sin leer esas dos frases malinterpretará sus propios registros.

La restricción más grande no está documentada en ninguna parte porque es estructural. Clef no tiene ninguna vía de generación de texto, lo que significa que no puede redactar una respuesta, resumir un hilo, llamar a una herramienta ni mantener una conversación, y no inventará una categoría que no hayas declarado. Todo el diseño supone que puedes enumerar de antemano las respuestas permitidas. Eso excluye silenciosamente una gran clase de problemas, y ningún nivel de rendimiento en los benchmarks lo cambia.

Lo que vale el argumento de la compatibilidad

Aquí es donde el lanzamiento deja de ser una revisión de modelo y se convierte en una cuestión de arquitectura. Si Clef habla la forma de solicitud de Jev, entonces el modelo que hay detrás de tu endpoint de decisión es un valor de configuración, y la forma sensata de adoptarlo es en paralelo, no como reemplazo: ejecuta ambos con tu propio tráfico, quédate con el que mida mejor en tus datos y deja que el cambio siga siendo barato.

Clef en sí no está en nuestra lista de rutas; el catálogo de OrcaRouter devuelve un 404 para él, y nada de lo que aquí se dice debe interpretarse como una afirmación nuestra sobre su disponibilidad. Lo que sí ofrecemos es el incumbent al que estaba destinado a desplazar. Jev 1.13 de TypeSafe es una ruta listada a $0.042 por millón de tokens de entrada con un contexto de 65,536 tokens, servida a través del mismo POST /v1/systemone cuerpo, así que una prueba A/B entre ambos es una cadena de modelo en lugar de una reescritura. Tener los dos detrás de una sola clave —más de 200 modelos, precio de lista del proveedor traspasado sin margen por token, failover automático entre proveedores — es lo que mantiene esa prueba en marcha después de la semana en que alguien decide preocuparse por ella, en lugar de degradarse hasta convertirse en un comentario obsoleto en un archivo de configuración. El modelo general que uno conserva para actuar sobre lo que concluya el modelo de decisión es accesible desde esa misma clave, en lugar de requerir un segundo contrato.

A headless capture of the OrcaRouter model page for typesafe/jev-1.13, showing the TypeSafe breadcrumb, the model title, the description naming the noul, choice and score question types served over POST /v1/systemone, a code sample set to model 'typesafe/jev-1.13', and the performance strip reading p50 TTFT 148 ms.

¿Qué cambiaría esta lectura?

Alguien fuera de Cloudflare necesita volver a ejecutar el Decision Index. La suite es pública y las evaluaciones se describen como reproducibles, así que una ejecución de terceros es la diferencia entre la tabla de un proveedor y un hecho —y las celdas que más importan son las que apuntan en direcciones opuestas. Un 97,4 en detección de intención fuera de alcance junto a un 48,0 en GPQA Diamond no es una curva de capacidades uniforme; describe un modelo que es muy bueno con las formas de clasificación de su distribución de entrenamiento y mucho más débil en razonamiento que no ha visto. Si eso se mantiene bajo pruebas independientes, es el hecho operativamente más importante sobre Clef y no está en los aspectos destacados.

El tráfico de producción también debe parecerse a la tabla de latencia. Una mediana de 209 ms medida en un solo H200 no dice nada sobre el p95 bajo concurrencia, y el principal argumento de venta del diseño es que se encuentra en una ruta crítica.

Y la plataforma de ajuste fino tiene que producir algo. El artículo de Cloudflare describe un bucle de RL —AI Gateway para capturar un conjunto de datos de tu propio tráfico, Workers AI para generar rollouts, Containers como el sandbox de puntuación, Trainer para actualizar los pesos y, después, volver a desplegar en Workers AI— en el mismo artículo en el que anuncia los modelos, sin adjuntar ningún resultado de cliente. Un Clef ajustado que superara al modelo base en una tarea para la que este nunca fue entrenado sería una evidencia mucho más contundente para la categoría que cualquier fila de la tabla.

Hasta entonces, el resumen justo es este: Cloudflare lanzó un modelo de decisión real, con licencia permisiva y genuinamente rápido, y lo hizo trivialmente intercambiable con el que llegó primero. Esa es una historia mejor que la que ofrecen la mayoría de los lanzamientos abiertos y, hasta ahora, sigue siendo enteramente el relato que el proveedor hace de sí mismo.