Tarjeta de título para FLUX 3 Image vs FLUX 3, que muestra una línea de tiempo: 23 de julio de 2026 para el anuncio de FLUX 3 unificado y el 1 de octubre de 2026 para el endpoint de FLUX 3 Image, con la nota de que solo el nivel de imagen acepta cuadros delimitadores. El logotipo de OrcaRouter se compone en la esquina inferior derecha.
Guides & Insights

FLUX 3 Image vs FLUX 3: dos nombres, dos productos, nueve semanas de diferencia

Autor

Elias Hawthorne

Fecha de publicación

Últimos modelos · 20Ver todos los modelos →
Benchmarks: Artificial Analysis · actualizado a diario
Volver a todas las publicaciones

Desde el 1 de octubre de 2026, «FLUX 3» ha significado dos cosas distintas, y la segunda acepción es la que tiene lista de precios. FLUX 3 Image es el nivel de imagen que se lanzó ese día en api.bfl.ai/v1/flux-3-image, con facturación por imagen desde 0,041 $. FLUX 3 es el conjunto mayor al que pertenece: el modelo multimodal unificado que Black Forest Labs anunció el 23 de julio de 2026 y que desde entonces ha ido lanzando por partes, de las cuales el video y una cabeza de acción para robótica son las que ya funcionan en producción. Esto no es una comparación entre un buque insignia y su hermano menor. Es una comparación entre toda una familia y una de sus tres partes funcionales.

Esa distinción es fácil de perder, y la propia nomenclatura de BFL no ayuda: la página de la familia, la documentación de vídeo, los términos de licencia y la referencia de la API dicen FLUX 3 en lugares donde se refieren a algo más concreto. Si has leído una hoja de especificaciones de FLUX 3 y te has quedado sin saber si describe un modelo de imagen, un modelo de vídeo o un programa de investigación, no es que hayas sido descuidado. Ambos nombres están en uso activo para subconjuntos superpuestos del mismo lanzamiento.

Las dos fechas que importan

• 23 de julio de 2026 — FLUX 3 anunciado bajo el sello de Acceso Anticipado. Una arquitectura Self-Flow que abarca la generación de imágenes, vídeo y audio, además de la predicción de acciones. La revelación sobre el cómputo es la parte interesante: más del 95% del cómputo de entrenamiento se destinó a vídeo, y menos del 0,5% de los tokens se asignó a audio.

• 1 de octubre de 2026 — el nivel de imágenes se abre como un endpoint con medición. Lo que deja un lapso de unas diez semanas entre el anuncio y la llegada de la modalidad a la que la mayoría de la gente asumía que se refería "FLUX 3".

Leer ese reparto de cómputo te dice qué consideraba Black Forest Labs que era el problema difícil. Una familia de modelos que dedica casi todo su presupuesto de entrenamiento al video no está optimizando para imágenes fijas ni tratando el movimiento como una extensión. Es lo contrario, y el nivel de imagen heredó lo que haya producido el entrenamiento con prioridad de video.

Screenshot of Black Forest Labs' FLUX 3 Image page showing the model heading and its control features, captured from bfl.ai on October 2, 2026

Qué es cada nivel y cuánto cuesta

Tres de las cuatro modalidades anunciadas en julio ya están disponibles. El nivel de imagen es el más reciente y es el único que se comporta como una API de pago convencional.

• FLUX 3 Image — un POST, un x-key encabezado, y una URL de polling de vuelta. Precio por imagen según el nivel de resolución: $0.041 en 768sq, $0.048 en 1K (el predeterminado), $0.07 en 1.5K, $0.10 en 2K y $0.607 en 4K. Un descuento de lanzamiento del 50% está vigente hasta las 15:00 UTC del 8 de octubre. Las referencias y la longitud del prompt están incluidas; las solicitudes fallidas y moderadas no se facturan. Acepta hasta diez imágenes de referencia de entre 256×256 píxeles y 16 megapíxeles cada una.

•FLUX 3 Video disponible con carácter general y facturado por tiempo en lugar de por imagen. El texto a vídeo y la imagen a vídeo cuestan 0,06 $/s en HD, 0,17 $/s en HD, 0,29 $/s en FHD, 0,40 $/s en QHD y 0,80 $/s en UHD, y el vídeo a vídeo es más caro en todos los casos. Los clips duran hasta 20 segundos con audio sincronizado nativo, y los modos incluyen fotograma clave a vídeo y continuación. El modo borrador es solo en HD. La salida en QHD y UHD llegó el 10 de septiembre de 2026.

• FLUX 3 Action — un modelo de mundo-acción de 7B, y la única parte de FLUX 3 cuyos parámetros se pueden descargar. El 22 de septiembre de 2026 aparecieron tres checkpoints en Hugging Face: un checkpoint base, una variante del brazo SO-101 y una variante DROID. El acceso está restringido a socios en lugar de ser abierto, con la manipulación robótica como uso demostrado.

• Lo que no se ha lanzado — un backbone de pesos abiertos FLUX 3. Los niveles de autoalojamiento de BFL todavía solo cubren FLUX.2 [klein] y FLUX.2 [dev]. En concreto, para el nivel de imagen, existen pesos comerciales bajo una licencia negociada y se dice que los pesos abiertos públicos están a unas semanas de distancia.

La comparación de costos que nadie hace

Screenshot of Black Forest Labs' FLUX 3 Video model page captured October 2, 2026, showing the model heading and its video generation modes

El precio por imagen y por segundo parecen incomparables, que es exactamente por lo que vale la pena hacer el cálculo una vez.

Cinco segundos de texto a video en HD estándar cuestan $0,85. Cinco segundos en UHD cuestan $4,00. Una sola imagen fija en 4K del nivel de imágenes tiene un precio de lista de $0,607, o $0,3035 dentro de la ventana de lanzamiento —y aunque el «4K» del nivel de imágenes designa un presupuesto de píxeles en lugar de un fotograma fijo (la salida de ejemplo de BFL es 5456 × 3072, unos 16,8 megapíxeles, frente a los 8,3 de UHD 2160p), es del mismo orden de resolución que el nivel de video cobra por segundo para moverla.

La consecuencia es que generar un fotograma clave UHD cuesta una fracción de generar un segundo de vídeo UHD, y el fotograma clave es lo que generarías repetidamente mientras iteras. Si tu pipeline es "obtener el fotograma correcto y luego animarlo", el nivel de imagen es la mitad barata por más de un orden de magnitud, y es la mitad que ha estado disponible durante menos tiempo.

Hay una salvedad en el lado de las imágenes que el lado de video no tiene. Una llamada de imagen 4K puede tardar varios minutos, y la muestra devuelta se puede descargar durante una hora. Que sea lento y solo se pueda recuperar durante una hora es una forma operativa distinta de la de un trabajo de video, y es el tipo de detalle que decide si una canalización por lotes necesita una cola.

Los cuadros delimitadores existen bajo uno de estos dos nombres

Las superficies de control no se comparten entre niveles, y esta es la diferencia práctica más marcada entre el nombre y la familia.

El nivel de imagen toma un array JSON anexado al prompt, con coordenadas en una cuadrícula de 0 a 1000 en ambos ejes y cada cuadro escrito [arriba, izquierda, abajo, derecha]. Se le pasa una tabla de elementos que llevan un id, una bbox y una desc, y un caption global que cita esos ids; los ejemplos de BFL usan nombres como animal_1. El mismo sistema de coordenadas rige la edición: conservar una región, mover una región, generar una nueva dentro de un cuadro de destino o eliminar un cuadro de origen. Varias operaciones van en una sola solicitud, y ref_image_0 nombra la primera entrada de la lista de referencias. Los píxeles fuera de los cuadros editados, dice la documentación, «suelen permanecer idénticos» — una salvedad que conviene leer al pie de la letra.

El grounding está activado por defecto en el nivel de imagen: se ejecuta una búsqueda web y de imágenes antes de la generación. Las dimensiones de salida se redondean a múltiplos de 16 y la cifra resultante se devuelve como output_mp.

Nada de esto aparece en los parámetros del nivel de video. FLUX 3 Video tiene su propia historia de control —fotogramas clave, continuación, condicionamiento del primer y último fotograma—, pero ningún lenguaje de coordenadas. Las partes comparten una arquitectura, no una interfaz.

Leyendo con atención las propias comparativas del vendedor

Black Forest Labs ha publicado resultados de preferencia de FLUX 3 Video, y merece la pena citarlos con su procedencia adjunta. Las ejecuciones las lleva a cabo el proveedor, son preliminares y se puntúan como tasas de victoria en resultados de 10 segundos a 720p:

• Frente a Luma Ray 3.2 — 93 % de preferencia por FLUX 3 Video.

• Frente a Runway Gen-4.5 — 77%.

• Frente a Grok Imagine Video — 69%.

• Contra Kling v3 Pro — 60%.

• Contra Happy Horse v1 y v1.1 — 59 % y 57 %.

• Frente a Seedance 2.0 y Gemini Omni Flash — aproximadamente un 52 % en cada caso, lo que en esencia constituye un empate estadístico aunque la cifra supere la mitad.

La diferencia del 93% al 52% en toda esa lista es más informativa que cualquier fila individual. Nadie fuera de BFL ha hecho estas comparaciones, y los resultados por debajo del 55% en la parte inferior son los que te dicen dónde está realmente en disputa el modelo.

No hay cifras equivalentes para FLUX 3 Image en absoluto. Se revisaron las tablas de texto a imagen y de edición de Artificial Analysis el 1 de octubre y de nuevo el 2 de octubre de 2026, y ninguna incluye una entrada de FLUX 3 Image. La línea FLUX.2 sigue siendo donde se detienen las puntuaciones publicadas de BFL: FLUX.2 [max] con 1021 Elo en la tabla de generación y 996 en la de edición, con FLUX.2 [dev] fijado como el ancla de 1000 en ambas. El nivel de imagen tiene un día de antigüedad y aún no se ha medido.

Screenshot of the Artificial Analysis text-to-image leaderboard captured October 2, 2026, listing FLUX.2 [max], FLUX.2 [flex] and FLUX.2 [dev] as the 1000-point anchor, with no FLUX 3 Image row present

Elegir entre los nombres

La elección no se trata tanto de qué modelo es mejor como de en cuál de los tres niveles disponibles vive tu problema.

Si necesitas imágenes fijas con control espacial, FLUX 3 Image es el único nivel con un lenguaje de coordenadas, y a $0.048 por imagen en 1K es lo bastante económico para evaluarlo adecuadamente en lugar de discutir sobre ello. Empieza por ahí, prueba la afirmación de que “normalmente permanecen idénticos” en tus propios fotogramas y observa el salto de 6.07× en la lista de 2K a 4K cuando dimensiones tus lotes.

Si necesitas movimiento, FLUX 3 Video es un producto medido y maduro con niveles de resolución de hasta UHD y clips de 20 segundos con audio sincronizado. Compáralo con los modelos a los que está destinado a desplazar, en lugar de con el nivel de imagen: no son alternativas entre sí.

Si necesitas los pesos, hoy la respuesta es FLUX 3 Action bajo un acuerdo de socio y, en caso contrario, FLUX.2. Ni el nivel de vídeo ni el de imagen son descargables, y la publicación abierta del nivel de imagen es una intención declarada sin fecha.

Ni FLUX 3 ni FLUX 3 Image están en el catálogo de OrcaRouter, así que llamar a cualquiera de los dos significa acudir directamente a Black Forest Labs. Lo que un router neutral respecto a proveedores aporta en un pipeline construido en torno a esta familia es la capa que rodea la llamada de generación: la pasada de reescritura de prompts, la comprobación visual que compara un render con el brief, el clasificador que divide las salidas en categorías de aceptación y rechazo. Esos pasos cambian con mucha más frecuencia que el modelo de imagen, y cambiar de proveedor detrás de un único endpoint compatible con OpenAI — con precios de lista de los proveedores repercutidos sin margen, conmutación automática por error cuando un backend se degrada, y un DSL de enrutamiento cuando quieres fijar o recurrir a una alternativa de forma deliberada — es la diferencia entre un pipeline que sigue el mercado y uno que tiene que volver a desplegarse cada vez que un modelo queda obsoleto.

La conclusión honesta es una convención de nombres. Cuando alguien dice FLUX 3 y te entrega una lista de tarifas, se refiere al endpoint de imágenes. Cuando alguien lo dice y te entrega una hoja de especificaciones sobre la asignación de tokens de audio, se refiere al anuncio de julio. La brecha entre esos dos documentos es de nueve semanas y tres niveles ya lanzados, y sigue ampliándose.