Flux 3 e Imagen 4 llegan a Replicate y el estante de imágenes se abarrota

El 1 de octubre, Black Forest Labs y Google lanzaron nuevos modelos de imagen en Replicate. Black Forest Labs publicó Flux 3 para texto a imagen y edición, con soporte para hasta diez imágenes de referencia. Google subió cuatro modelos: Imagen 4 fast para velocidad y costo, Imagen 4 ultra para detalle, Imagen 3 fast para trabajos sensibles al precio, e Imagen 3 para resultados de máxima calidad. Llámalos a través de la misma API que ya usas.
El titular se lee como un lanzamiento de modelo. Se parece más a un anuncio de distribución. Cada uno de estos modelos ya existía en algún lugar. Lo que cambió es que un desarrollador con un token de Replicate ahora puede acceder a ellos sin abrir una cuenta con Black Forest Labs ni configurar un proyecto de Google Cloud.
Qué te dan realmente diez imágenes de referencia
El número en el que vale la pena detenerse son las diez imágenes de referencia de Flux 3. Hace un año, la edición de imágenes significaba una imagen de entrada y una instrucción de texto. Diez referencias cambian lo que se le puede pedir al modelo. Puedes darle una foto de producto, una textura de una segunda imagen, una paleta de colores de una tercera y un rostro de una cuarta, y luego pedir una composición que respete todas ellas.
Esa es la capacidad hacia la que todo el mercado ha estado corriendo. Nano Banana Pro combina hasta catorce imágenes y cinco personas. GPT Image 2.5 Sunburst lidera el tablero de edición de Artificial Analysis al hacer un cambio en una región sin alterar el resto. Seedream 5.0 recurre a la búsqueda web en vivo cuando una edición necesita una referencia del mundo real. La línea competitiva se ha desplazado de qué tan buena se ve la primera imagen a qué tan bien acepta el modelo las indicaciones en la décima edición.

Para cualquiera que construya un producto sobre estas herramientas, el recuento de imágenes de referencia es una especificación más útil que las puntuaciones de benchmark. Te dice cuánto control puedes entregar a un usuario. Un modelo que toma una referencia se adapta a un botón de texto a imagen. Un modelo que toma diez se adapta a una herramienta de diseño donde el usuario ensambla material de marca a partir de una carpeta de recursos aprobados.
Los cuatro modelos de Google son en realidad dos niveles
La línea de Google parece cuatro lanzamientos. Mira los nombres y son dos modelos divididos por costo. Imagen 4 fast e Imagen 4 ultra ejecutan la misma generación, uno ajustado para ser económico y otro para el detalle. Lo mismo ocurre con Imagen 3 fast e Imagen 3. Las variantes fast no son modelos peores en un sentido significativo. Son el mismo modelo con un presupuesto de cómputo menor, vendido a un precio más bajo.
Esa es una forma sensata de vender generación de imágenes, y también es una pista sobre dónde reside el costo. Cuando la única diferencia entre un nivel fast y un nivel ultra es cuánto tiempo se le permite pensar al modelo, el modelo en sí ha dejado de ser el producto. El cómputo se ha convertido en el producto, y el modelo es lo que lo gasta.
Para un equipo que decide qué ejecutar en producción, eso cambia el cálculo. La pregunta no es cuál de los cuatro es mejor. Es qué nivel de calidad requiere realmente tu caso de uso, porque pagar por ultra en un caso de uso que solo necesita fast es una forma de quemar dinero sin mejorar nada que un usuario note.
Qué vale realmente un listado en una plataforma
Vale la pena ser preciso sobre por qué la llegada de un modelo a Replicate es noticia. Replicate alquila inferencia alojada. Un desarrollador se registra una vez, obtiene un token y llama a cualquier modelo del catálogo a través de la misma interfaz. Para Black Forest Labs y Google, listar significa llegar a desarrolladores que nunca abrirán una cuenta separada por un modelo, y pagar a una plataforma por el alcance.
Este es el trato al que se han visto forzados los creadores de modelos abiertos. Publica los pesos y los técnicamente curiosos pueden ejecutarlos, sin costo para nadie y sin ingresos para el laboratorio. Lista en una plataforma alojada y la audiencia se amplía a personas que quieren un endpoint y una factura mensual, pero un intermediario se lleva una parte y el modelo se sienta junto a una docena de competidores en un selector.
La alternativa es vender acceso directamente, que es lo que hace un modelo cerrado y lo que la mayoría de los laboratorios no puede hacer a escala. Así que la plataforma alojada se convierte en el terreno neutral donde los modelos abiertos y cerrados compiten por el mismo desarrollador, juzgados en la misma página. Un laboratorio pequeño con buenos pesos ahora puede aparecer junto a un lanzamiento de Google, lo que es o bien competencia sana o una carrera de comoditización, dependiendo del lado en el que estés.
Para un comprador, eso tiene una consecuencia práctica. El modelo que elijas hoy es accesible a través de una interfaz que ya conoces, lo que hace que los costos de cambio sean bajos y experimentar sea barato. También significa que el modelo que elijas probablemente no sea especial, porque el mismo estante está abierto para todos.
El resto del día
El mismo día produjo una amplia variedad de lanzamientos más pequeños. Cloudflare puso Clef, un modelo de imagen-texto-a-texto, en Hugging Face. ISTA-DASLab publicó una compilación GGUF de Qwen3.8 Flash, que importa principalmente a quienes ejecutan modelos localmente. AI Gateway de Vercel añadió un modelo de decisión llamado Laya que enruta solicitudes de soporte y flujos de trabajo de agentes con puntuaciones de probabilidad, gratis hasta finales de octubre, junto con modelos de audio de Microsoft y herramientas de búsqueda de Browserbase. Google añadió asistencia visual en tiempo real a Gemini Live, construida con usuarios ciegos y de baja visión.
Ninguno de estos cambiará un pipeline de imágenes por sí solo. Juntos muestran hacia dónde están empujando los proveedores de plataformas. Replicate, Vercel y Hugging Face compiten por ser el lugar donde un desarrollador elige un modelo, y la forma en que compiten es ampliando el catálogo y simplificando la facturación. Los laboratorios de modelos se benefician, porque la distribución a través de una plataforma es cómo un laboratorio más pequeño llega a desarrolladores que nunca firmarán un contrato separado.
Ese es el dilema que enfrenta todo creador de modelos abiertos. Publica los pesos y deja que la comunidad los ejecute, lo que no cuesta nada y llega a los técnicamente curiosos. O lista en una plataforma alojada y llega a los desarrolladores que quieren un endpoint y una factura, lo que alcanza a más personas y le entrega una parte a una plataforma. Flux 3 está en Replicate, lo que sugiere que Black Forest Labs quiere la segunda audiencia lo suficiente como para compartir.
Qué significa si estás eligiendo
El efecto práctico de todo esto es que el estante está abarrotado y las etiquetas son cada vez más difíciles de leer. Cuatro modelos Imagen, un lanzamiento de Flux y una larga cola de compilaciones comunitarias compiten todos por el mismo espacio en un pipeline. Las diferencias que importan son más estrechas de lo que sugiere el marketing.
Vale la pena verificar tres cosas antes de comprometerte. Cuántas imágenes de referencia toma el modelo, porque eso determina el techo de control. Si la licencia permite el uso comercial, que es donde se dividen Apache-2.0 y las compilaciones no comerciales. Y si el modelo está disponible en algún lugar que se ajuste a cómo despliegas, ya que un gran modelo detrás de una plataforma que no puedes usar es un modelo que no puedes usar.
Nada de eso es glamoroso, y nada de eso estará en una publicación de lanzamiento. También es la parte que decide si un modelo funciona en un producto seis meses después de que el anuncio haya pasado de largo.
Artículos relacionados
La clasificación de modelos de video que nadie promociona: adónde van realmente las solicitudes
Cada semana aparece una nueva clasificación de generación de video, y casi todas se construyen de la misma manera.
Ai2 publicó como código abierto el stack de entrenamiento, no otro conjunto de pesos
Los pesos son fáciles de regalar y difíciles de aprender de ellos.
Qwen3.8-Max de Alibaba afirma que puede programar por sí solo durante dos semanas
Los recuentos de parámetros dejaron de ser noticia hace tiempo. Doce días es la cifra que vale la pena examinar.
PixelUMM descarta los dos componentes de los que depende todo modelo visual de IA
La difusión a nivel de píxeles se ha propuesto antes y se ha topado repetidamente con el cómputo.