
Clef vs Qwen3.8-27B: una arquitectura base, dos contratos de salida
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
Clefno puede escribir una sola frase, y está construido a partir de un modelo que sí puede. Cloudflare/clef es un modelo de decisión multimodal de 27 mil millones de parámetros: le entregas un estado y un esquema de preguntas tipadas, y devuelve una probabilidad para cada opción permitida sin generar un solo token de prosa. La columna vertebral que lo sustenta es Qwen3.8-27B, un modelo denso de visión y lenguaje con pesos abiertos, congelado en su sitio con una pequeña cabeza adicional acoplada. Eso convierte a esta en una de las pocas páginas de modelo contra modelo en las que los dos bandos no son rivales en absoluto: son un checkpoint y su derivado, que comparten 55 gigabytes de pesos y discrepan sobre si la respuesta es algo que se lee o algo con lo que se calcula.
Los pesos de ambos se hicieron públicos antes que las palabras. Cloudflare creó el repositorio Cloudflare/clef en Hugging Face a las 21:15 UTC del 30 de septiembre de 2026, bajo Apache-2.0, y publicó la entrada de anuncio —«Introducing Clef: our open-source decision models, and new RL fine-tuning platform»— a la tarde siguiente. Durante aproximadamente dieciocho horas, un modelo de 55 gigabytes estuvo disponible para su descarga y ejecutándose en las propias GPU de borde de Cloudflare antes de que su proveedor dijera algo al respecto. En tres días ya tenía una página en la biblioteca de Ollama detrás de Ollama 0.35.1, que es donde este artículo lo encontró, y compilaciones NVFP4, FP8, EXL3, INT8, Q4 y Q8 de una docena de cargadores distintos.
Lo que se puede saber a partir del repositorio es inusualmente completo, y vale la pena separar eso de lo que no lo es. Se puede saber: la arquitectura, el checkpoint base, la licencia, una implementación de referencia que se ejecuta y una matriz de evaluación completa. No se puede saber: si alguno de esos números sobrevive a una nueva ejecución por parte de alguien que no sea Cloudflare. Cada puntuación atribuida a Clef a continuación proviene de la propia ejecución del proveedor de una suite que el proveedor aloja. Esa asimetría frente a un modelo con un mes de uso independiente a sus espaldas es la columna vertebral honesta de esta comparación, y el resto del artículo trata sobre dónde muerde de verdad.
Los dos repositorios, uno al lado del otro.
Empieza por la descarga, porque la igualdad es lo esencial. Los safetensors de Clef suman 54,97 GB repartidos en doce fragmentos. Los del modelo padre suman 55,56 GB repartidos en dieciocho. Clef conserva el codificador de visión de Qwen3.8-27B —el procesador, la torre de visión, todo el front-end multimodal—, así que no se eliminó nada para reducirlo. Lo que Cloudflare añadió es una cabeza de esquema conjunta de 256 MB: cuatro capas, 1.024 de ancho, dieciséis cabezas, una red feedforward de 4.096 de ancho y dos capas de enrutamiento que leen los estados ocultos finales del backbone. La receta de entrenamiento es un backbone congelado, esa cabeza y adaptadores de bajo rango de rango 256, con entropía cruzada con suavizado de etiquetas para respuestas de esquema válidas, combinada con una pérdida de Brier para afinar la calibración.
Luego, la divergencia, que reside enteramente en lo que se le permite emitir al modelo.
• Parámetros — Clef 27B, post-entrenado a partir de Qwen/Qwen3.8-27B. Qwen3.8-27B 27B denso, 64 capas, 5.120 ocultas, vocabulario de 248.320 tokens, 16 × (3 × Gated DeltaNet → FFN) intercalado con Gated Attention.
• Salida — Clef: un logit por cada opción permitida, con softmax aplicado por pregunta, sin ninguna ruta de generación en absoluto. Qwen3.8-27B: tokens, llamadas a herramientas y un bloque de razonamiento que está activado por defecto.
• Formas de pregunta — Clef acepta de 1 a 64 preguntas tipadas por solicitud en tres formas: noul (probabilidad de verdadero), choice (de 2 a 255 opciones con nombre), score (de 2 a 10 niveles ordenados, que devuelve un valor ponderado por probabilidad que puede situarse entre ellos). Qwen3.8-27B no tiene ese contrato; obtienes texto en prosa y tú escribes el analizador.
• Licencia — Apache-2.0 en ambos, por eso la cuantización de terceros se hizo en un fin de semana.
• El coste de la mitad congelada — la cabeza de Clef es de 256 MB frente a 54,97 GB de backbone. Casi toda la descarga es el modelo padre. Si ya tienes Qwen3.8-27B en disco, lo estás descargando por segunda vez para obtener una opinión distinta sobre cómo responder.

Lo que cuesta el cambio de rumbo, en dos cifras
La evaluación de Cloudflare es la suite Decision Index 0.2.1, ejecutada internamente, y es una tabla sobre modelos de decisión — seis columnas: Clef, Clef-flash, Jev, DiffusionGemma Jev, Kev 9B y Laya. Qwen3.8-27B no tiene fila en ella, y Clef no tiene fila en el Artificial Analysis Intelligence Index. Así que no hay un marcador compartido y este artículo no va a inventar uno.
Sin embargo, hay un benchmark al que ambos bandos se han sometido, y la brecha es lo bastante grande como para ser la cifra más relevante para la decisión en este lanzamiento. En GPQA Diamond —preguntas de ciencia de nivel de posgrado, de opción múltiple—, Cloudflare mide a Clef en 48,0. El modelo padre se sitúa en 90,5 en el arnés de evaluación de Artificial Analysis y en 89,2 en la propia ficha de modelo del proveedor. Eso es un precipicio de cuarenta puntos en conocimiento general, y no es ningún misterio: Clef responde puntuando un conjunto fijo de opciones que se le entregan, y la opción múltiple de conocimiento general está tan lejos de «enrutar este ticket» como se pueden orientar esos mismos pesos. Considera la comparación como indicativa y no como controlada: dos arneses, dos laboratorios, ni el del proveedor ni el del rastreador. Pero la dirección no está en duda, y es el precio del contrato.
El mismo patrón se observa en el resto de las celdas de propósito general de Clef. MMLU-Pro 65.9, BBH 73.7, CLINC150 con manejo fuera de alcance 97.4 para el 27B frente al 89.3 de Jev —esa última es la rara celda en la que el derivado supera por completo al modelo de decisión más antiguo, y es importante porque negarse a clasificar es la mitad difícil del enrutamiento. Donde Clef es fuerte, lo es exactamente donde debería serlo un clasificador entrenado en casa: BANKING77 con macro-F1 de intención en 94.2, BFCL case-exact en 98.5, API-Bank en 91.9. Donde es débil, un modelo de decisión solo de texto de un laboratorio de la competencia —Jev, de TypeSafe— le gana por treinta puntos en GPQA Diamond mientras cobra $0.042 por millón de tokens de entrada en nuestro propio catálogo, lo cual es un recordatorio útil de que «27B» no es en sí mismo un argumento.
Lo que el padre conserva es todo aquello sobre lo que no pregunta el Decision Index. En su propia tarjeta y en las filas procedentes de AA, nuestro catálogo incluye: Terminal-Bench 2.1 con 73,0, SWE-bench Pro 61,7, LiveCodeBench v6 90,3, OSWorld-Verified 84,3, DeepSWE 1.1 con 42,2, AA Coding 68,1 en el puesto 35 de 138 modelos muestreados. Ninguno de esos tiene una fila de Clef, porque Clef no puede intentarlos. No tiene una ruta de llamada a herramientas, ni planificación de horizonte largo, ni forma de emitir el parche.
Lo que cuesta una decisión, y por qué la línea de salida es todo el argumento
La página del modelo de Workers AI indica exactamente un precio unitario para Clef: $0,24 por millón de tokens de entrada. No hay una línea de salida, y la razón está en las respuestas. El propio ejemplo documentado de Ollama —un ticket de soporte enrutado entre tres preguntas— responde con "usage": {"input_tokens": 1204, "output_tokens": 3}. Tres tokens de salida para tres preguntas. Que Cloudflare facture esos tres tokens es casi irrelevante: el costo de salida de una decisión no es una tarifa, es un recuento de preguntas.
Compara eso con la tarifa del padre en nuestro propio catálogo, que es $0.33 por millón de tokens de entrada y $2.40 por millón de salida con una ventana de 262,144 tokens. Mismo estado de 1,204 tokens, misma única decisión de enrutamiento:
• Clef — 1.204 tokens de entrada a $0,24 por millón son aproximadamente $0,00029 por decisión, y alrededor de $289 por millón de decisiones. La cifra apenas cambia cuando la respuesta se vuelve más difícil, solo cuando el estado se alarga.
• Qwen3.8-27B con el pensamiento desactivado — el mismo estado cuesta alrededor de $0.00040 en entrada, más aproximadamente diez tokens de salida a $2.40 por millón. Digamos $0.00042, o $421 por millón. Clef es aproximadamente 1.5× más barato, que no es la historia que nadie está contando.
• Qwen3.8-27B con el pensamiento activado — que es lo predeterminado en este checkpoint. Si el modelo dedica 400 tokens a razonar sobre en cuál de cuatro categorías encaja un correo de restablecimiento de contraseña, eso es otro $0,00096 y la decisión queda cerca de $0,0014, o $1.357 por millón. Esos 400 tokens son una suposición, no una medición, y el múltiplo se mueve linealmente con ella.
Entonces, la versión honesta del argumento de precios es más limitada de lo que parece a primera vista. Frente a un generalista que funciona con el pensamiento desactivado, Clef gana en dólares por un factor de aproximadamente uno y medio: es real, pero no transformador. Frente al mismo modelo en su configuración predeterminada, la brecha es una función de la verbosidad, y la verbosidad es exactamente lo que tiene un modelo de lenguaje y lo que un diseño de puntuadores sobre opciones no tiene en absoluto. Esa es la afirmación estructural: el coste de Clef está acotado por la longitud del estado, y el del padre está acotado por cuánto decide decir el padre.

El único número que no está cerca
Cloudflare informa una latencia mediana de solicitud de 209,3 ms para Clef y un p95 de 238,6 ms, medidas en las 43 pruebas de referencia de su ejecución, en sus propias GPU de borde. Nadie fuera de Cloudflare lo ha reproducido, y la infraestructura del proveedor es la razón de que la cifra sea tan baja: este modelo está diseñado para estar en la misma red que el llamador.
Para la empresa matriz, podemos hacerlo mejor que con un número de proveedor, porque es una de nuestras rutas. En la ventana de siete días que termina el 2 de octubre de 2026, el propio playground de OrcaRouter midió Qwen3.8-27B en un p50 de 1.929 ms y 235,8 tokens de salida por segundo, sobre 136,3 millones de tokens de tráfico en esa ventana. La serie diaria es la parte interesante: el p95 se sitúa exactamente en 10.000 ms en seis de los siete días, lo que se lee como un techo más que como una medición, y el p50 oscila entre 1.751 ms y 4.296 ms según el día. Considera la mediana como aproximadamente nueve veces la de Clef, y considera la cola como poco informativa hasta que alguien publique una distribución real.
Esa brecha no es una diferencia de ajuste y no se cerrará. Una pasada de solo prefill más una cabeza de puntuación paralela termina en un solo barrido; un modelo autorregresivo termina cuando se queda sin cosas que decir. Las cifras absolutas del proveedor para Clef merecen el descuento habitual, pero el orden es una propiedad de la arquitectura, no del hardware de Cloudflare.
El contexto se cita de tres maneras para uno de ellos.
Ambos modelos aceptan texto, JSON, imágenes y video. Las ventanas no son las mismas, y una de ellas se cita de forma inconsistente según dónde lo leas.
• Clef, alojado — 65,536 tokens, según la página del modelo de Workers AI y la publicación del anuncio. Ese es el número que vincula a un llamador de API, y el propio planteamiento de Cloudflare es comparativo: el doble del estado que alberga la ventana de 32K de Jev.
• Clef, en disco — el config.json publicado declara max_position_embeddings de 262,144, porque el backbone congelado es el del modelo padre y aún conserva el techo de posiciones del padre. El encode_record auxiliar incluido tiene como valor predeterminado max_length=16,384, con max_state_tokens disponible para acotar el estado por separado. Ninguno de esos tres números es incorrecto; responden a preguntas diferentes, y un listado en tiempo de ejecución que anuncia 256K está leyendo la configuración, no el endpoint.
• Qwen3.8-27B — 262.144 de forma nativa, ampliable a 1.000.000 con la configuración de servicio adecuada, según la ficha del proveedor y nuestra fila del catálogo. Como mínimo, cuatro veces la ventana de Clef alojada.
La consecuencia práctica es menor de lo que sugiere la proporción. Clef consume un estado —un ticket, una factura, una captura de pantalla—, no una conversación, y uno de sus puntos de venta es que puedes entregarle una carga útil grande y aplanada y hacerle sesenta y cuatro preguntas sobre ella sin volver a pagar por la carga útil con cada pregunta. El padre necesita la ventana porque tiene que mantener el historial, los resultados de las herramientas y su propio razonamiento. Distintos requisitos, distintos límites.
Ambos ven los mismos píxeles
El codificador de visión es heredado, así que no se trata de un caso en el que un modelo sea multimodal y el otro no. Clef acepta hasta cuatro imágenes por solicitud, PNG, JPEG o WebP codificadas en base64, compartidas por todas las preguntas de la carga útil, y se pueden añadir fotogramas de vídeo como matrices de fotogramas: el ejemplo del recibo en la tarjeta plantea una pregunta de sí/no sobre si un total es legible, lo que constituye el diseño en miniatura. Qwen3.8-27B es un modelo nativo de visión y lenguaje, con OmniDocBench 1.5 en 91,1, RealWorldQA en 85,9 y CharXiv en 78,8 según la tarjeta del proveedor.
La diferencia está en lo que recibes de vuelta. Clef te da una decisión campo por campo con una probabilidad asociada, que es una respuesta tipada sobre un documento. El padre te da una descripción del documento, que luego parseas. Para una gran clase de trabajo con documentos —revisa este formulario, localiza esta cláusula, ¿este total supera el umbral?—, la respuesta tipada es todo el trabajo, y la descripción es una sobrecarga que pagas y luego desechas.
Dónde cae realmente la línea
• Usa Clef — las respuestas se pueden enumerar de antemano y prefieres no escribir un analizador. Enrutamiento, triaje, control de paso, comprobaciones de políticas, extracción de campos de documentos. Conjuntos cerrados, de 2 a 255 opciones por pregunta, hasta 64 preguntas puntuadas en conjunto.
• Elige Clef: la decisión está en una ruta caliente y 209 ms frente a 1.929 ms cambia lo que el pipeline puede hacer. Esta es la razón más fuerte, por sí sola, para cambiar, y es una razón de latencia, no de precisión.
• Usa Clef — quieres determinismo. Una opción que no declaraste no puede volver, porque no hay ningún paso de generación que la produzca.
• Conserva Qwen3.8-27B — la respuesta no es una opción de una lista: resumir, redactar, razonar sobre un problema novedoso, escribir código, manejar herramientas a lo largo de un horizonte extenso. Clef no puede hacer nada de eso, y no te lo dirá.
• Conserva Qwen3.8-27B — necesitas que el modelo diga «ninguna de estas». Un modelo de decisión puntúa las opciones que se le dieron. Dale un esquema de facturación/técnico/ventas y una solicitud de privacidad, y devolverá la menos mala de esas tres en lugar de un rechazo. El padre saca a la superficie la pregunta que no se te ocurrió hacer.
• Mantén Qwen3.8-27B — para trabajo de contexto o de documentos largos. Cuatro veces la ventana alojada, antes de la ampliación a un millón de tokens.
Lee esa lista como una canalización en lugar de un veredicto, porque eso es lo que es. La arquitectura hace literal la relación: Clef es la pasada de prefill del padre con un mecanismo de respuesta distinto al final. Un diseño sensato coloca a Clef delante —decide la ruta, la prioridad, el indicador de escalado— y mantiene a Qwen3.8-27B detrás para actuar según la decisión. Los dos son complementos que resulta que comparten una descarga.
Dónde ejecutar cada uno de ellos
Clef está alojado en Workers AI de Cloudflare a la cifra de $0.24 por millón de tokens de entrada indicada arriba, y los pesos Apache-2.0 son tuyos para ejecutarlos localmente. La ficha en la biblioteca de Ollama es la superficie más reciente: ollama pull clef necesita Ollama 0.35.1 o posterior, porque el modelo se comunica a través del endpoint /v1/systemone que Ollama añadió para los modelos de decisión. Fíjate en las etiquetas, no en el titular — la etiqueta predeterminada y la clef:27b son de 18 GB, que es una compilación de cuatro bits de un modelo de 55 gigabytes; clef:27b-q8_0 es de 30 GB, clef:27b-nvfp4 es de 18 GB, clef:27b-mxfp8 es de 31 GB, y clef:27b-mlx-bf16 es la versión completa de 55 GB para Apple silicon. El propio SDK de Python de TypeSafe se comunicará con él si lo apuntas a un Ollama local y proporcionas cualquier clave de API, que el entorno de ejecución ignora. Una advertencia que pasará factura en producción: la confianza mide cuán concentradas están las probabilidades, no la probabilidad de que la respuesta sea correcta, y los empates se resuelven según el orden de opciones que declaraste.
El padre es el más fácil de poner detrás de una API hoy. Qwen3.8-27B se puede enrutar en OrcaRouter con las tarifas de $0.33 y $2.40 por millón usadas arriba, con la ventana de 262,144 tokens, y es uno de los más de 200 modelos accesibles mediante una sola clave compatible con OpenAI. Como el precio de lista del proveedor se traslada con un 0% de margen, un recorte de precio del proveedor en cualquiera de los dos lados de esta comparación está activo en nuestras rutas el mismo día en que se aplica.
Clef en sí no es una de nuestras rutas — nuestro catálogo público no devuelve nada para él, y nada de lo que hay aquí debería interpretarse como una afirmación de disponibilidad por nuestra parte. Lo que sí ofrecemos es el modelo que hace que el patrón de decisión sea alcanzable sin una cuenta de Cloudflare: TypeSafe's Jev 1.13 es una ruta listada a $0.042 por millón de tokens de entrada con un contexto de 65,536 tokens, medido en un p50 de 148 ms durante la misma ventana de siete días, y habla la misma POST /v1/systemone forma de solicitud. Dado que Clef es compatible con la API de Jev a propósito, un pipeline construido contra cualquiera de los dos está a un cambio de configuración del otro — que es el caso que una capa de enrutamiento existe para hacer gratuito. Mantén ambos accesibles, mide con tus propias etiquetas y deja que el ganador sea un dato en lugar de un compromiso arquitectónico. Si un modelo de decisión termina condicionando a un agente, el modelo que actúa sobre la decisión todavía tiene que ser accesible, y esa mitad ya está detrás de la misma clave.

¿Qué cambiaría esta lectura?
Tres cosas, en orden ascendente según cuánto lo moverían.
Un tercero tiene que volver a ejecutar el Decision Index. El conjunto es público y Cloudflare describe las evaluaciones como reproducibles, así que esto es factible — y la celda fuera de alcance de CLINC150 es la que hay que vigilar, porque un 97,4 del 27B es o una ventaja genuina sobre el 89,3 de Jev en la mitad más difícil del enrutamiento, o un artefacto de un arnés construido en casa. Nadie fuera de Cloudflare lo sabe todavía.
Alguien tiene que puntuar a Clef y a Qwen3.8-27B en la misma tarea de clasificación con las mismas etiquetas. Esa es la única comparación que resolvería si el recambio de la cabeza de clasificación es un trueque de calidad o una mejora de calidad para decisiones de conjunto cerrado, y ninguno de los dos proveedores tiene incentivos para llevarla a cabo. Hasta entonces, la brecha de cuarenta puntos en GPQA se mantiene como la mejor evidencia disponible sobre lo que se eliminó, y es evidencia sobre la tarea equivocada.
Y la latencia de Clef necesita un p95 bajo concurrencia. La mediana de 209 ms fue medida por el proveedor, en hardware que el proveedor controla, para un modelo cuyo principal argumento de venta es que se sitúa en una ruta crítica. El ordenamiento frente a un padre autorregresivo es arquitectónico y sobrevivirá. Los milisegundos absolutos son el número del que hay que desconfiar, y son el número en el que se sustenta todo el caso de negocio.
Qwen3.8-27B es uno de los más de 200 modelos a los que se puede acceder mediante una única clave compatible con OpenAI — Qwen3.8-27B.
