
FLUX 3 Image vs Bernini-Diffusers-v2: Un endpoint de pago frente a un repositorio descargable
- openaiNUEVOOpenAI: GPT-6.1 Sol2026-09-2952Inteligencia
- anthropicNUEVOAnthropic: Claude Sonnet 5.52026-09-2856Inteligencia
- typesafeNUEVOTypeSafe: Jev 1.132026-09-24$0.04 / $0.00 por 1M de tokens · 223 tok/s
- OpenAINUEVOOpenAI: GPT-6 Luna2026-09-2238Inteligencia
- OpenAINUEVOOpenAI: GPT-6 Sol2026-09-2248Inteligencia
- AnthropicNUEVOAnthropic: Claude Opus 5.52026-09-2258Inteligencia
- xAINUEVOGrok 4.72026-09-2146Inteligencia
- OrcaOrca: OrcaCyber Zero 1.02026-09-17$3.00 / $7.50 por 1M de tokens · 125 tok/s
- OrcaOrca: OrcaVerify Text 1.02026-09-16$2.00 / $0.00 por 1M de tokens · 1148 tok/s
- DeepSeekDeepSeek: DeepSeek V4.1 Flash2026-09-1040Inteligencia
- OpenAIOpenAI: GPT-6 Astra2026-09-0453Inteligencia77Código
- GoogleGoogle: Gemini 3.8 Flash2026-09-0241Inteligencia76Código
- AlibabaQwen: Qwen3.8 Max (0902)2026-09-0245Inteligencia76Código
- AnthropicAnthropic: Claude Fable 5.12026-09-0153Inteligencia82Código
- TencentTencent: Hy4 preview2026-08-28$0.83 / $2.50 por 1M de tokens · 48 tok/s
- AlibabaQwen: Qwen3.8 Flash2026-08-26$0.15 / $0.47 por 1M de tokens · 103 tok/s
- z-aiZ.ai: GLM 5.3 Flash2026-08-2642Inteligencia72Código
- DeepSeekDeepSeek: DeepSeek V4 Flash Vision (Exp)2026-08-21$0.22 / $0.66 por 1M de tokens · 212 tok/s
- z-aiZ.ai: GLM 5.32026-08-1845Inteligencia75Código
- obsidianQwen3.8 27B2026-08-1534Inteligencia68Código
FLUX 3 Image y Bernini-Diffusers-v2 son dos modelos de imagen que puedes obtener en su totalidad hoy mismo, y ninguno de los dos es un producto que puedas alquilar. FLUX 3 Image se puso en marcha el 1 de octubre de 2026 en api.bfl.ai/v1/flux-3-image con una lista de precios publicada y sin puntuación publicada. Bernini-Diffusers-v2 llegó a Hugging Face el 13 de agosto de 2026 bajo Apache-2.0 con puntuaciones publicadas y sin más forma de invocarlo que tus propias GPU. Uno viene con factura. El otro viene con una versión de Python fijada.
Esa división es toda la comparación, y vale la pena ser preciso al respecto, porque el encuadre habitual de "alojado frente a pesos abiertos" no encaja aquí. Bernini no es un modelo de pesos abiertos que puedas integrar en una pila de inferencia existente. Es un sistema de dos etapas —un planificador Qwen2.5-VL-7B delante de un decodificador de difusión Wan2.2-T2V-A14B— y su versión v2 es una corrección del calendario de entrenamiento, no un nuevo nivel de capacidad. FLUX 3 Image es un único endpoint con una cantidad inusual de superficie de control atornillada a él: anclaje espacial, una cuadrícula de coordenadas de 0 a 1000 y edición acotada por cajas en la que nombras qué regiones sobreviven. Son cosas de distinta forma.
Lo que realmente es cada uno
• FLUX 3 Image — Black Forest Labs' image tier of its unified FLUX 3 family, released October 1, 2026. One HTTP POST to https://api.bfl.ai/v1/flux-3-image with an x-key header; only prompt is required. The call returns a polling URL, and a finished 4K render can take several minutes. Generated samples are downloadable for one hour.
• Bernini-Diffusers-v2 — la pila de planificador y renderizador de ByteDance, publicada en Hugging Face el 13 de agosto de 2026 sin ningún anuncio que la acompañara. El repositorio está etiquetado comoimage-text-to-video y depende de diffusers. Tareas incluidas: texto a imagen, imagen a imagen, texto a video, video a video, referencia a video y referencia a imagen. No hay inferencia alojada ni lista de precios; la ruta para empezar es hf download y una aplicación de Gradio.
• La brecha de distribución — FLUX 3 Image es un servicio medido al que llamas. Bernini es un repositorio que despliegas. Antes de que merezca la pena plantear cualquier cuestión de calidad, uno de estos requiere una GPU de clase Hopper y el otro requiere una tarjeta de crédito.
El licenciamiento es donde estos dos divergen más drásticamente.
Bernini-Diffusers-v2 es Apache-2.0 a nivel de repositorio. Para un pipeline autoalojado, eso importa enormemente: sin medidor por imagen, sin acuerdo comercial negociado, sin informes de uso. Pagas la electricidad y el tiempo del planificador, y el coste marginal de la imagen número diez mil es el mismo que el de la primera.
FLUX 3 Image no tiene pesos abiertos, y Black Forest Labs deja claro que esto es temporal. Los pesos comerciales están disponibles hoy bajo una licencia BFL negociada, y el lanzamiento público de pesos abiertos se describe como previsto para las próximas semanas. Eso es una promesa con forma pero sin fecha, y es lo más importante de esta página que hay que volver a verificar en lugar de dar por sentado. Si estás eligiendo un stack de imágenes para los próximos dos años, la cuestión de la licencia probablemente pesa más que la cuestión del Elo, pero solo si estás dispuesto a operar tú mismo un stack de difusión nativo de video de dos etapas.
Superficie de control: cuadros delimitadores frente a mejora de prompts
Esta es la parte del enfrentamiento que resulta genuinamente interesante, porque los dos modelos resuelven "hacer que llegue exactamente ahí" de maneras completamente distintas.
FLUX 3 Image toma un array JSON anexado al prompt. Las coordenadas se rigen por una cuadrícula de 0–1000 en ambos ejes, y cada caja se escribe como [arriba, izquierda, abajo, derecha]. Tú proporcionas una tabla de elementos, cada uno con un id, un bbox y un desc, además de un caption global que cita esos ids por nombre. En el propio ejemplo de BFL, los ids son como animal_1 y silhouette_1; el caption se refiere a ellos directamente. Por encima de la llamada de generación está grounding, activado por defecto, que ejecuta una búsqueda web y de imágenes antes de generar.
FLUX 3 Image luego extiende el mismo sistema de coordenadas a la edición. En lugar de enviar una máscara, se envía un conjunto de operaciones delimitadas por cuadros: Keep (cuadro de origen al mismo cuadro, con origen en ref_image_0), Move (cuadro de origen a un nuevo cuadro de destino), New (sin origen, cuadro de destino generado a partir de una descripción — añadir, reemplazar o recolorear) y Remove (cuadro de origen a un destino nulo). Varias operaciones van en una sola solicitud.
La matización importa. La documentación de BFL dice que los píxeles fuera de los recuadros editados «por lo general permanecen idénticos». Por lo general. Es una afirmación de preservación con una salvedad incorporada en la redacción, que es la forma honesta de publicar una y también la razón por la que deberías probar con tus propios fotogramas en lugar de confiar en una demo.
Bernini no tiene un lenguaje de coordenadas equivalente de cara al usuario. Su edición guiada por referencias mejoró en la v2 debido a un cambio en el entrenamiento —el módulo conector se precalienta durante miles de pasos antes de que comience el coentrenamiento— y ByteDance informa que ese cambio se refleja en una mejor edición guiada por referencias y en el rendimiento de OpenS2V. Es una corrección de calidad dentro de una arquitectura existente, no una nueva interfaz de control. Si tu flujo de trabajo depende de decirle al modelo qué rectángulo dejar intacto, solo una de estas dos responde a la pregunta.

Lo que los números respaldan y lo que no
La página de Bernini-Diffusers-v2 incluye una tabla de siete métricas que compara v2 con v1, y cada cifra que aparece en ella está reportada por el proveedor. La dirección es mixta, lo cual vale la pena decir en voz alta:
• Subida — OpenS2V 63,83 (desde 62,30), VBench 84,46 (desde 84,37), Bernini-rv2v 3,55 (desde 3,48).
• Flat — EditVerse 8.02, sin cambios, y Bernini-v2v 3.49, sin cambios.
• Baja — OpenVE 3.96, desde 4.03.
La página también afirma que v2 se sitúa en el primer nivel entre los principales modelos comerciales de código cerrado en una arena interna de comparación por pares con humanos y a ciegas. Eso no es verificable desde fuera de ByteDance y debe interpretarse como una afirmación de marketing, no como una medición. Los tres movimientos reales son los enumerados anteriormente, y se autoinforman frente a la propia v1 del mismo laboratorio.
FLUX 3 Image todavía no tiene ninguna cifra. El tablero de texto a imagen de Artificial Analysis y su tablero de edición se consultaron tanto el 1 de octubre como el 2026-10-02 y no incluyen ninguna fila de FLUX 3 Image; las entradas de BFL en esos tableros se detienen en la línea FLUX.2, donde FLUX.2 [max] se sitúa en 1021 Elo en el tablero de generación y en 996 en el tablero de edición. FLUX.2 [dev] ancla ambos tableros exactamente en 1000. Así que la afirmación honesta sobre la calidad de FLUX 3 Image en este momento es que nadie fuera de Black Forest Labs ha publicado una puntuación para él, y el punto de referencia disponible más cercano es la generación anterior a él.
Esa asimetría es la trampa práctica de esta comparación. Las cifras de Bernini las ejecuta el propio proveedor, pero existen y son orientativas. Las de FLUX 3 Image brillan por su ausencia. La ausencia no es un fracaso —el modelo tiene un día de vida—, pero sí significa que la única evidencia que respalda la afirmación de FLUX 3 Image sobre la edición proviene, por ahora, de la empresa que lo vende.
El lado del precio, que no es simétrico en absoluto
FLUX 3 Image tiene un precio por imagen según el nivel de resolución, y la lista de tarifas del proveedor incluye cinco de ellos:
• 768 pies² — $0.041 precio de lista, $0.0205 durante la ventana de lanzamiento.
• 1K (el predeterminado) — $0.048 de lista, $0.024 en oferta.
• 1.5K — $0.07 de precio de lista, $0.035 en oferta.
• 2K — $0.10 precio de lista, $0.05 en oferta.
• 4K — $0.607 de precio de lista, $0.3035 en oferta.

Las imágenes de referencia y la longitud del prompt se incluyen sin coste adicional, y las solicitudes rechazadas, fallidas o moderadas no se facturan, lo cual importa más de lo habitual aquí, porque una llamada en 4K es lenta y la tentación de abandonar una solicitud es real. El precio de lanzamiento va desde las 15:00 UTC del 1 de octubre hasta las 15:00 UTC del 8 de octubre. El salto del precio de tarifa de 2K a 4K es de un factor de 6,07, mucho más pronunciado que la proporción del recuento de píxeles, por lo que el nivel de resolución que elijas es la principal decisión de coste en toda la API.
Los niveles se rigen por un presupuesto de píxeles en lugar de por un marco fijo. La salida de ejemplo de BFL es de 5456 × 3072, aproximadamente 16,8 megapíxeles, frente a UHD 2160p con 8,3 megapíxeles, así que «4K» aquí denomina un presupuesto, y las dimensiones de salida se redondean a múltiplos de 16, y la cifra real se devuelve como output_mp.
El precio de Bernini es cero por imagen y distinto de cero por hora. Ocho GPUs para inferencia con paralelismo de secuencia, se recomienda silicio de clase Hopper, Python 3.11.2 con PyTorch 2.7.1 y CUDA 12.6. El punto de equilibrio frente a $0.048 por imagen a 1K llega en algún punto entre los miles de imágenes al mes, dependiendo por completo de lo que pagues por cómputo, y es un número real, no retórico. Si ya ejecutas infraestructura de inferencia, la imagen marginal de Bernini es casi gratuita. Si no lo haces, el endpoint FLUX 3 Image es drásticamente más barato que montar una pila de difusión de dos etapas.
Enrutamiento: ninguno de estos está en nuestro catálogo
Vale la pena decirlo sin rodeos, porque es el tipo de afirmación que queda obsoleta rápido. OrcaRouter no enruta FLUX 3 Image, y no enruta Bernini-Diffusers-v2. Llamar a FLUX 3 Image significa llamar directamente a Black Forest Labs en su propio endpoint. Llamar a Bernini significa desplegarlo tú mismo.
La verdadera función de un enrutador compatible con OpenAI, en una canalización como esta, es todo lo que está a ambos lados de la llamada a la imagen. Una pasada de generación de descripciones o de reescritura de prompts, un modelo de visión que comprueba el render contra el brief, un modelo de vídeo que anima la imagen fija aprobada, un modelo de texto pequeño que clasifica la salida — esos son los pasos en los que poder cambiar de proveedor con una sola cadena, en una sola clave, y hacer que las solicitudes conmuten automáticamente cuando uno está degradado, elimina una cantidad importante de mantenimiento. OrcaRouter pasa el precio de lista del proveedor sin recargo, así que cuando un proveedor reduce una tarifa, el cambio está activo el mismo día en lugar de esperar a que un revendedor vuelva a fijar el precio, y el DSL de enrutamiento te permite fijar un modelo específico o definir el orden de respaldo sin tocar el código de la aplicación. Nada de eso hace que FLUX 3 Image se pueda enrutar. Solo significa que el resto de la canalización no necesita preocuparse por cuál modelo produjo la imagen fija.
![Screenshot of the Artificial Analysis text-to-image leaderboard, showing FLUX.2 [max] at 1021 Elo and FLUX.2 [dev] fixed as the 1000 anchor, with no FLUX 3 Image entry anywhere on the board](https://cms.orcarouter.ai/api/media/file/4-1497.png)
¿Sobre cuál construir?
Tres preguntas separan esto con claridad, y no tienen una respuesta común.
¿Necesitas controlar dónde va cada cosa? FLUX 3 Image es el único de los dos con un lenguaje de coordenadas, y sus operaciones de edición delimitadas por cuadros —conservar, mover, añadir, eliminar— son una interfaz genuinamente distinta de la edición por instrucciones de texto. Si tu trabajo es composición, maquetación o imágenes de producto en las que las regiones deben sobrevivir, eso es decisivo y la salvedad de "normalmente permanecen idénticas" es algo que se comprueba en lugar de asumirse.
¿Necesitas saber lo bueno que es antes de decidirte? Bernini tiene cifras, todas reportadas por el proveedor, y una trayectoria desigual. FLUX 3 Image no tiene ninguna. Si no puedes realizar tu propia evaluación, estás eligiendo entre un modelo medido y uno sin medir, y el medido es la arquitectura más antigua.
¿Puedes operar una pila de difusión de dos etapas? Esa es la verdadera barrera para Bernini. Un planificador Qwen2.5-VL-7B que alimenta a un decodificador Wan2.2-T2V-A14B, en GPUs Hopper, con un hook de mejora de prompts que apunta a un endpoint compatible con OpenAI. La licencia es permisiva y la factura de cómputo no lo es. Si no puedes, la pregunta es irrelevante y $0.048 por imagen es la respuesta.
Lo único que cambiaría esta página más rápido es que BFL abra los pesos de FLUX 3 Image, algo que la empresa ha dicho que está a semanas de distancia. Eso convierte la asimetría de licencias de decisiva en leve y deja la diferencia de la superficie de control como la comparación real. Hasta entonces, el resumen preciso es que estos son dos buenos modelos con modelos de distribución opuestos, y la elección se hace en función de las licencias y el control mucho antes de que se haga en función de la calidad.
