← Volver al blog
Aiaprox. 8 min de lectura

FLUX 3 Image convirtió la generación de imágenes en un archivo de maquetación

Publicado 3 oct 2026
FLUX 3 Image convirtió la generación de imágenes en un archivo de maquetación

Black Forest Labs lanzó FLUX 3 Image el 1 de octubre, y la mayoría de la cobertura abrió con la resolución: salida nativa de hasta 4K, unos 16,8 megapíxeles, sin upscaler de por medio. Es una mejora real. También es lo menos interesante del lanzamiento.

La parte por la que vale la pena leer la documentación es el formato de entrada. FLUX 3 Image no quiere un párrafo y un deseo. Quiere una tabla.

Cada elemento recibe una dirección

Una solicitud de generación es un array JSON de elementos. Cada elemento lleva un ID único, un cuadro delimitador escrito como `[y_min, x_min, y_max, x_max]` sobre una cuadrícula normalizada de 0 a 1000, y una descripción en lenguaje natural de lo que va allí. Un bloque de fondo abarca todo el lienzo. Un producto se sitúa en `[400, 200, 950, 800]`. Un logotipo vive en la esquina superior izquierda. El prompt de escena sigue existiendo, pero ahora es una entrada entre varias en lugar de todo el brief.

La cuadrícula es independiente de la resolución. El mismo JSON de maquetación renderiza la misma composición a 768 píxeles de ancho o en 4K nativo, lo que significa que la maquetación que probaste en un borrador barato es la maquetación que obtienes en el final costoso.

Eso suena a función de conveniencia. En la práctica, cambia quién puede llamar al modelo. BFL diseñó la tabla de elementos para que un modelo de lenguaje pueda escribirla a partir de un brief de una línea y una relación de aspecto objetivo. Un agente no tiene que traducir la intención a prosa y esperar lo mejor. Puede maquetar la imagen tal como maqueta una hoja de cálculo, y los ID de los elementos sobreviven como identificadores a los que puede referirse en turnos posteriores.

Una hoja de papel en blanco pegada con cinta en una cuadrícula uniforme sobre un escritorio de madera, con algunos pequeños objetos abstractos descansando en algunas de las casillas

También hay una consecuencia más económica. Como la cuadrícula es independiente de la resolución, una maquetación puede validarse a 768 píxeles por una fracción del precio y luego renderizarse en 4K con la composición intacta. La iteración y la entrega final dejan de pelearse por el presupuesto, algo que importa a cualquiera que produzca docenas de imágenes con la misma plantilla.

Bloqueo de píxeles y el problema de la deriva

La edición sigue la misma lógica. Especificas un cuadro delimitador de origen y uno de destino, eliges el elemento que se va a mover, reemplazar o eliminar, y se supone que los píxeles fuera de esa región permanecen exactamente donde estaban. La propia medición de BFL sitúa las áreas no tocadas en una fidelidad bit a bit idéntica del 67,8 al 89,7 por ciento, un rango que depende de lo compleja que sea la edición.

La parte honesta es la redacción. La demo de lanzamiento promete ediciones "sin cambiar ningún otro píxel". La documentación de la API dice que los píxeles no tocados "generalmente" permanecen sin cambios, y BFL reconoce que las ediciones pueden extenderse más allá del cuadro especificado. Los artefactos de borde son reales. Cualquier equipo que incorpore esto en un pipeline debería crear una prueba de aceptación en lugar de confiar en la demo.

Aun así, la comparación con el inpainting ordinario no está cerca. El inpainting tradicional deja una deriva sutil incluso en regiones que se le indicó dejar intactas. En una edición, nadie lo nota. A lo largo de un ciclo de aprobación de diez pasos, el fondo se ha desplazado, la tipografía se ha suavizado y la composición ya no coincide con lo que un cliente aprobó hace tres rondas. Esa acumulación es lo que hace inutilizables las cadenas largas de edición, y es lo específico que los cuadros delimitadores pretenden detener.

Lo que los creadores encontraron de verdad

Un creador que ejecutó las mismas instrucciones de edición en Midjourney, Ideogram 4.5 y FLUX 3 Image publicó una comparación útil. En una prueba que pedía recolorear una prenda a seda rosa con flores blancas y un lazo amarillo crema, y luego primeros planos macro de la cara y las manos, Midjourney resolvió los primeros planos, pero falló en las flores blancas y el tono exacto. Ideogram 4.5 acertó con los cambios de la prenda, aunque la iluminación en los macros se veía mal. FLUX 3 Image acertó con los cambios de la prenda y recibió elogios por la iluminación y el contexto en los primeros planos. En otra prueba, mantuvo una edición de una columna diminuta limitada a los objetos previstos, mientras que los otros dos extendieron más el cambio.

El hilo de un creador no es un benchmark. Trátalo como una señal de dónde es fuerte el modelo, que parece ser el seguimiento de instrucciones de detalle fino más que la estilización amplia.

Lo que los cuadros delimitadores no arreglan

La ubicación y la deriva son dos problemas, no todos. Un cuadro le dice al modelo dónde va algo. No le dice al modelo cómo debería verse la cosa, y no evita que un elemento de referencia cambie de estilo una vez colocado. Los equipos que generan un solo producto sobre treinta fondos diferentes todavía tienen que mantener consistente el producto en sí, y ese trabajo vive en las imágenes de referencia y el prompt, no en las coordenadas.

El renderizado de texto es la otra costura abierta. Las propias imágenes de demo de BFL provienen de un prompt curado por un humano. Si un modelo de maquetación coloca de forma fiable texto legible dentro de un cuadro pequeño, en una fuente específica, es una pregunta aparte, y el material de lanzamiento no la responde. Para el trabajo de maquetación de revistas y comercio electrónico, que es el público al que apunta este lanzamiento, ese es el detalle que decide la adopción.

Una entrada estructurada tampoco hace que el modelo sea menos una caja negra en cuanto a estética. Puedes especificar que un logotipo vaya en la esquina superior izquierda. No puedes especificar que la composición debe sentirse calmada.

Los trade-offs que nadie puso en el titular

Los cuadros delimitadores cuestan más configuración que escribir "haz el fondo azul". Tienes que saber dónde va cada cosa. Para una imagen puntual, ese sobrecoste probablemente no valga la pena. Para un pipeline que regenera la misma maquetación en veinte fotos de producto, o un agente que tiene que colocar un logotipo en un lugar fiable, se amortiza rápido.

El precio de lanzamiento tiene un 50 por ciento de descuento hasta el 8 de octubre: unos $0,0205 por una imagen de 768 píxeles hasta $0,3035 por 4K, con referencias y prompts incluidos y sin cargo para las generaciones fallidas. Los pesos comerciales autoalojados están disponibles contactando a BFL, y se promete una edición de pesos abiertos en las próximas semanas.

El manejo de referencias merece una nota propia. Una sola llamada acepta hasta 10 imágenes de referencia, y a cada elemento se le puede indicar de qué referencia proviene y dónde va. Diez referencias por sí solas no son inusuales. Diez referencias que cada una se asigna a un cuadro específico del lienzo son un flujo de trabajo para ensamblar una composición a partir de recursos existentes, más cercano a cómo trabaja un diseñador que a cómo funciona un prompt. Combínalo con la cuadrícula de maquetación y el modelo empieza a parecerse menos a un pintor y más a un compositor que tiene opiniones.

El panorama general es que las API de imágenes se han optimizado durante años en torno a una pregunta: ¿qué tan buena se ve la imagen? FLUX 3 Image añade una segunda pregunta que a los agentes les importa más. ¿Puedes dirigirte a una parte de la imagen, cambiarla y dejar todo lo demás intacto? Una vez que la respuesta es sí, la generación de imágenes deja de ser una máquina tragamonedas y empieza a comportarse como un archivo que puedes editar.

Esa distinción es la razón por la que la comparación con Midjourney e Ideogram importa menos de lo que parece al principio. Esos modelos compiten por lo bella que es una imagen recién generada, y siguen siendo muy buenos en eso. BFL compite por si una imagen generada puede tratarse como un documento con regiones estables, y esa es una contienda diferente con un ganador diferente. La primera contienda está casi resuelta y la segunda acaba de empezar, que es más o menos donde quiere estar una apuesta de infraestructura.

Artículos relacionados