
Clef vs Gemma 4 12B: un dispositivo de decisión de 64K tokens frente a un generalista de 256K tokens
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 219 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 114 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1064 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 41 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 105 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 213 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
El número más útil en una comparación entre Clef y Gemma 4 12B no es una puntuación de benchmark. Es 65.536 frente a 256.000: las ventanas de contexto. Cloudflare/clef es un modelo de decisión multimodal de 27 mil millones de parámetros, postentrenado a partir de Qwen3.8-27B, que lee un estado y un esquema de preguntas tipadas y devuelve una probabilidad para cada respuesta permitida en una sola pasada no autorregresiva. Gemma 4 12B — el checkpoint Unified, google/gemma-4-12B-it — es el modelo any-to-any sin codificador de 11,95 mil millones de parámetros del proveedor, lanzado en el verano de 2026, que genera texto en una ventana de 256.000 tokens en más de 140 idiomas. Pon una carpeta de contratos delante de ambos y el modelo de decisión se queda sin espacio cuatro veces antes, porque su techo es de 65.536 tokens documentados, mientras que el del generalista es de 256.000. Esa asimetría no es una nota al pie. Para toda una clase de trabajo de enrutamiento —documentos largos, hilos pegados, formularios de varias páginas—, decide la elección antes de que siquiera se discuta la precisión.
Así que esta no es una página sobre qué modelo es mejor. Es una página sobre los dos ejes en los que realmente difieren: cuánto estado puede retener cada uno y qué forma de respuesta es capaz de producir físicamente cada uno. Todo lo demás es o bien un número de proveedor que nadie ha reproducido, o una comparación que no significa lo que parece.
Qué es cada uno, en un párrafo cada uno
Clef es el modelo de decisión 27B de Cloudflare, publicado bajo Apache-2.0 con los pesos en Hugging Face y un endpoint alojado en Workers AI. Cloudflare congeló el backbone Qwen3.8-27B, incluido su codificador de visión, le adjuntó una cabeza de esquema conjunta más adaptadores de bajo rango con rango 256, y lo entrenó con entropía cruzada suavizada por etiquetas para respuestas de esquema válidas junto con una pérdida de Brier para afinar la calibración. Tú proporcionas el estado — texto, JSON, imágenes o fotogramas de vídeo — y de una a 64 preguntas con nombre, cada una de tipo booleano (verdadero/falso, devolviendo la probabilidad de verdadero), elección (de 2 a 26 opciones con nombre) o puntuación (de 2 a 26 niveles ordenados). Lo que se devuelve es una distribución por pregunta y nada más. No hay ninguna ruta de generación de texto en absoluto.
Gemma 4 12B es un modelo generalista que genera texto. No tiene codificador: en lugar de torres separadas de visión o audio, los parches de imagen sin procesar y las formas de onda se proyectan directamente en el espacio de embeddings del modelo de lenguaje mediante capas lineales ligeras, lo que le permite aceptar texto, imagen, vídeo y audio sin una canalización por modalidad. Tiene modos de pensamiento configurables, llamada nativa a funciones, un vocabulario de 262K y un esquema de atención híbrido que intercala atención de ventana deslizante de 1.024 tokens con atención global completa. Es Apache-2.0, junto con los términos de uso propios del proveedor, y es el checkpoint al que se refiere la mayoría cuando dice «ejecuta este tamaño en local».
Una cosa que hay que decir con claridad antes de seguir: ninguno de los dos modelos es una ruta en OrcaRouter. Nuestro catálogo devuelve un 404 para cloudflare/clef y para el checkpoint de 12B de la misma familia, y nada de este artículo debe interpretarse como una afirmación de disponibilidad por nuestra parte. Lo que sí ofrecemos de la familia Gemma son los dos tamaños más grandes, y sus precios aparecen más abajo.

La lista de opciones es una interfaz, y tiene un modo de fallo.
La diferencia estructural entre estos dos es lo que ocurre con la entrada que no encaja.
• Salida — Clef devuelve una probabilidad por cada opción declarada, y solo esas opciones. Gemma 4 12B devuelve texto generado.
• Rechazo — Clef no tiene "ninguna de las anteriores" a menos que escribas una en los criterios tú mismo. Gemma 4 12B puede describir un caso que no encaja con nada de lo que preguntaste.
• Modo de fallo — El error de Clef es silencioso: una elección segura dentro de tu esquema, no se lanza ninguna excepción, no se activa ninguna rama de reserva. El error del generalista suele ser ruidoso: prosa que no se puede analizar.
• Testabilidad — un conjunto de opciones fijo hace que el componente sea reproducible y barato de auditar. El texto libre lo hace flexible y costoso de validar.
Los propios números de Clef para ese problema de rechazo son las cifras más débiles que publica. En CLINC150 con manejo de fuera de alcance —detección de intención en la que una respuesta válida es «esto no pertenece a ninguna categoría»—, el 27B obtiene 97,4 de macro-F1, que es el mejor de la tabla de Cloudflare y la razón para interesarse por el 27B en lugar de su propio hermano 9B, que obtiene 66,8 en el mismo benchmark. Una brecha de treinta puntos entre dos modelos construidos con la misma receta indica que el comportamiento fuera de alcance es lo que compra la escala de postentrenamiento, y es aquello de lo que dependen en silencio la mayoría de los pipelines de enrutamiento. La mitigación que documenta Cloudflare es una segunda pregunta en el esquema —añadir un campo llamado noul que pregunte si el estado encaja en absoluto y luego aplicarle un umbral—, lo cual funciona, y es tarea tuya y no del modelo.
De dónde vienen los números importa más que lo que dicen
Todas las cifras de Clef en este artículo provienen de Cloudflare: su ficha de modelo, su publicación de lanzamiento o su ejecución del Decision Index. La suite en sí es de Cloudflare, y la tabla de clasificación que aloja las puntuaciones también es de Cloudflare. Eso es un proveedor que mide su producto en hardware que él controla contra un rival cuya API replica deliberadamente. Ningún tercero ha reproducido nada de esto, y este artículo no va a pretender lo contrario.
La columna de Gemma 4 12B es un tipo distinto de evidencia. La propia ficha del proveedor publica MMLU Pro 77,2 %, GPQA Diamond 78,8 %, AIME 2026 sin herramientas con 77,5 % y LiveCodeBench v6 con 72,0 %. Artificial Analysis, un rastreador independiente, indexa la configuración de razonamiento con un Intelligence Index de 14,18, con un precio indicado de $0,10 / $0,30 por millón de tokens y una velocidad de salida mediana medida de aproximadamente 113 tokens por segundo — y su propia página señala que esas cifras dependen de la carga de trabajo y del hardware.
La lectura honesta es que las dos columnas no son comparables en absoluto. Una es una suite de calidad de decisiones de un proveedor ejecutada por el proveedor; la otra es una mezcla de benchmarks de proveedores y una evaluación independiente de un modelo general. Citar un 97.4 junto a un 77.2 como si fueran columnas de la misma tabla sería lo más engañoso que podría hacer esta página.
La latencia es el único punto en el que los dos pueden al menos discutirse en las mismas unidades e, incluso ahí, las salvedades se acumulan. Cloudflare reporta Clef en 209,3 ms de mediana y 238,6 ms de p95, medidos en su propia infraestructura. Artificial Analysis mide el tiempo hasta el primer fragmento del 12B en aproximadamente 2,4 segundos en una configuración de razonamiento, que incluye un presupuesto de pensamiento que el modelo de decisión no tiene. Un pase no autorregresivo de 209 ms frente a un inicio de generación de 2,4 segundos es una diferencia arquitectónica real —un pase hacia adelante frente a un bucle de decodificación—, y es el argumento más fuerte que tiene Clef para una ruta caliente. También es, con 27B, un modelo que necesita hardware de clase H200 para alcanzar esa cifra, y Cloudflare cobra $0,24 por millón de tokens de entrada por ejecutarlo para ti.

Qué te aporta realmente 64K de contexto
El contexto es donde esta comparación se vuelve práctica y donde el generalista gana sobre el papel por un amplio margen.
• Clef — 65.536 tokens, según la página del modelo de Workers AI y la publicación de lanzamiento; el asistente de codificación incluido usa por defecto max_length=16,384, que es un valor predeterminado y no un límite máximo, pero es el valor predeterminado que obtendrás si usas el cargador tal como se distribuye.
• Gemma 4 12B — 256.000 tokens, según la ficha del proveedor, con atención de ventana deslizante de 1.024 tokens para mantener bajo el coste del contexto largo.
• Imágenes — Clef puntúa imágenes y fotogramas de vídeo conjuntamente con el estado de texto a través del codificador de visión heredado. Gemma 4 12B toma texto, imagen, vídeo y audio a través de su ruta sin codificador.
• Idiomas — la ficha de Clef no hace ninguna afirmación multilingüe; Gemma 4 12B está documentado en más de 140 idiomas.
Para un ticket, una factura o una captura de pantalla renderizada, 64K es generoso y la diferencia es académica. Para un contrato de 200 páginas que quieres clasificar campo por campo, es todo el argumento: el generalista puede retener el documento entero, y el modelo de decisión no. La respuesta de Clef a eso es la fragmentación, y fragmentar un documento antes de decidir sobre él significa que ya has tomado una decisión que el modelo debía tomar. Ese es un límite real y merece ser enunciado como tal.
Lo que realmente pagarías, y dónde
Ninguno de los dos modelos está en nuestro catálogo, así que la cuestión del precio se divide en tres vertientes.
• Clef — 0,24 $ por millón de tokens de entrada en Workers AI de Cloudflare, o autoalojado a partir de los pesos Apache-2.0; la latencia publicada por Cloudflare se midió en una única H200 con torch 2.11 y transformers 5.10.2, y las cuantizaciones de la comunidad que aparecieron en dos días sugieren que se puede reducir aún más a costa de un coste de precisión que nadie ha medido.
• Gemma 4 12B — aquí no hay ninguna ruta alojada en absoluto. Descargas aproximadamente 24 GB de pesos BF16 y los sirves tú mismo, o recurres a una plataforma de terceros. No existe un precio por token que podamos cotizar.
• El sustituto enrutado — Gemma 4 26B A4B, un modelo de mezcla de expertos con 25.2B parámetros totales y 3.8B parámetros activos, se ofrece en OrcaRouter a $0.06 por millón de tokens de entrada y $0.33 por millón de tokens de salida con un contexto de 262,144 tokens. Gemma 4 31B, el hermano denso multimodal con pensamiento configurable y llamada a funciones nativa, se ofrece a $0.13 y $0.38. Ambos están en una sola clave con el precio de lista del proveedor traspasado sin margen por token y conmutación automática por error entre proveedores.
Esa última línea es la versión honesta de nuestra implicación en esta comparación. Si lo que necesitas es un generalista que lea un documento largo y escriba una frase, la vía barata para conseguirlo es un tamaño de Gemma 4 que sí servimos, y cuesta menos por millón de tokens que autoalojar un 12B en GPUs alquiladas. Si lo que necesitas es una decisión acotada en la ruta crítica, la mediana de 209 ms de Clef es una propiedad arquitectónica real, y lo más parecido a ello en nuestro catálogo es Jev 1.13 de TypeSafe —el modelo contra el que Cloudflare hizo benchmarking y del que copió el formato de transmisión— a 0,042 $ por millón de tokens de entrada con un contexto de 65.536 tokens, servido a través de la misma forma POST /v1/systemone shape. Como los dos son compatibles a nivel de API tras un adaptador fino, probar Clef frente al proveedor establecido es un experimento y no una migración, y el experimento sigue siendo barato cuando se puede acceder a ambos lados a través de un único endpoint.

La decisión, expresada como una decisión
Elige Clef cuando las respuestas sean enumerables, el estado quepa en 64K, la decisión se encuentre en una ruta sensible a la latencia y estés dispuesto a hacerte cargo tú mismo de la clase residual. El 97.4 del 27B en la detección de intenciones fuera de alcance es la razón por la que pagarías por él en lugar del hermano 9B, y su forma de salida fija es lo que hace que el componente sea auditable sin un analizador.
Elige Gemma 4 12B cuando la entrada sea larga, cuando la modalidad sea audio o vídeo, cuando la respuesta deba ser prosa, o cuando aún no se conozcan las categorías — porque «clasifica este montón en las agrupaciones que tengan sentido» es una solicitud que un modelo de decisión no puede aceptar, no una que maneje mal. Es un generalista con una evaluación independiente que lo respalda y, para el trabajo de final abierto, eso vale más que una tabla de proveedores.
Y sé escéptico de ambos conjuntos de cifras por la razón que este artículo no deja de repetir: Cloudflare no ha sido reproducido de forma independiente en nada, y esa ficha es la propia tabla comparativa del proveedor. El único número realmente interesante del par —si una cabeza de esquema de 27B mantiene de verdad su puntuación de 97,4 fuera de alcance con datos con los que no fue entrenada— es exactamente el número que ningún proveedor puede resolver y que un tercero sí podría.
