¿Todavía puedes distinguir una imagen de IA de una real? La respuesta honesta es no.

Hay un juego que circula este mes y convierte una pregunta seria en un marcador. Te muestra una secuencia de imágenes y te pide que señales cuáles están generadas por IA. La gente juega convencida de que tiene buen ojo, y luego ve cómo su precisión se derrumba más o menos en el punto en que la IA empieza a renderizar manos humanas realistas correctamente. Han pasado años desde que eso era una señal fiable. El juego superó los cien puntos en Hacker News, y los comentarios se leen como un grupo de apoyo para personas que descubren su propia ceguera.
Los indicios han desaparecido
Todos los atajos en los que la gente solía confiar se han cerrado. Dedos de más, texto destrozado, piel de plástico, iluminación imposible. Los modelos actuales manejan todo eso lo bastante bien como para que no puedas confiar en ninguno por sí solo. El texto, en particular, ha mejorado drásticamente, lo que eliminó una de las últimas victorias fáciles para la detección humana. Un modelo que renderizaba un letrero legible dentro de una escena solía ser una señal inequívoca. Ahora es lo mínimo indispensable.
El resultado es una situación extraña. Las imágenes mejoraron, pero la capacidad humana de detectarlas no. La mayoría de la gente, ante una buena imagen de IA y una foto real puestas una al lado de la otra, está adivinando. La popularidad del juego es en parte prueba de ello: es divertido precisamente porque sigues equivocándote, y equivocarse es el punto. La confianza es alta y la precisión ronda el cara o cruz.
Los detectores tampoco nos salvan
Hay un mercado paralelo de herramientas de detección de IA, y es igual de frágil. Se lanzan nuevas herramientas que afirman detectar imágenes de IA, y funcionan en el laboratorio y fallan en el mundo real. Un detector ajustado a los artefactos de un modelo tiene problemas con los del siguiente. Comprime una imagen, cámbiale el tamaño o pásala por la recodificación de una plataforma social, y las huellas sutiles en las que se basaba el detector se borran.
Peor aún, los detectores producen falsos positivos. Una foto real con cierta iluminación o un filtro pesado puede activarlos. Para una herramienta destinada a restaurar la confianza en las imágenes, un falso positivo es un problema grave, porque permite que cualquiera descarte una foto genuina como falsa. Las herramientas de detección, en otras palabras, pueden usarse como arma en ambas direcciones. Eso no es un defecto que se arregle con más entrenamiento. Es estructural.
La carrera armamentista solo tiene un ganador
Hay una asimetría fundamental que la gente sigue subestimando. Los generadores intentan producir imágenes que parezcan reales y tienen un objetivo claro. Los detectores intentan detectarlas y persiguen un blanco móvil que no deja de mejorar. En una carrera armamentista, el lado con un objetivo claro y un ciclo de iteración rápido suele ganar, y ese lado es el de los generadores.
Cada nuevo modelo obliga a los detectores a reentrenarse, y para cuando se ponen al día, ya se ha lanzado el siguiente modelo. La brecha no se está cerrando. Se está ampliando, y se amplía con cada lanzamiento. Quienes venden herramientas de detección tienen incentivos para sonar optimistas, pero la línea de tendencia real no está de su lado. Más bien, la postura honesta es que la detección fiable es un juego perdido, y cuanto antes lo aceptemos, antes podremos trabajar en lo que de verdad ayuda.
Qué significa esto en la práctica
La respuesta honesta a «¿puedes distinguirlo?» es: no de forma fiable y, cada vez más, no. La pregunta más útil es cómo convivimos con eso. La verificación tiene que trasladarse aguas arriba, a la procedencia. Si una imagen se firma en el momento de su creación, o lleva un registro de dónde vino y cómo se editó, entonces no necesitas entrecerrar los ojos ante los píxeles. Consultas los metadatos.
Esa infraestructura apenas existe para los usuarios comunes. Algunos fabricantes de cámaras y plataformas están experimentando con credenciales de contenido, pero no es estándar, y en el momento en que se le hace una captura de pantalla a una imagen, la cadena se rompe. Hasta que eso cambie, lo predeterminado es el escepticismo, y el escepticismo agota. También es corrosivo, y esa es la parte que apenas empezamos a sentir.
El costo social es la verdadera historia
El daño no consiste realmente en que te engañe una imagen falsa. Se trata del colapso de la confianza compartida. Cuando cualquier foto puede ser fabricada y las herramientas de detección no son fiables, la gente empieza a dudar de todo, incluida la evidencia real. Ese es un problema más grave que cualquier imagen individual, y es el que la tecnología no ha resuelto.
Esta es la parte que la conversación técnica sigue pasando por alto. A quienes les preocupan las imágenes de IA no les preocupa mayormente que los engañe un filtro divertido. Les preocupa un mundo donde una fotografía real de un evento real pueda descartarse como falsa, y una falsa pueda defenderse como real. Cuando la propia evidencia está en duda, los argumentos que dependen de la evidencia dejan de funcionar. Eso no es un problema de detectores. Es un problema de confianza, y es más grande que cualquiera de las herramientas de uno u otro lado.
La responsabilidad se desplaza, y nadie la quiere
Una de las subtramas silenciosas es que la responsabilidad no deja de pasarse de unos a otros sin asentarse en ningún lugar. Los creadores de modelos dicen que solo proporcionan una herramienta. Las plataformas dicen que no pueden verificar cada imagen. Los usuarios dicen que no deberían tener que ser analistas forenses. Todos tienen técnicamente razón, y el resultado es que nadie es responsable del daño cuando una imagen falsa causa perjuicio.
Esa difusión de la responsabilidad es el problema real. Cuando una imagen manipulada se propaga y causa daño, el daño es real, pero no hay un único actor cuyo trabajo fuera detectarlo. El creador del modelo lanzó una herramienta capaz, la plataforma la alojó y el usuario le creyó. Cada eslabón de la cadena puede señalar al siguiente y afirmar que no hizo nada malo.
Hasta que la responsabilidad recaiga en algún lugar concreto, la respuesta predeterminada será culpar a la herramienta o culpar al espectador, y ninguna de las dos funciona. Culpar a la herramienta es como culpar a una cámara por una foto montada. Culpar al espectador ignora que ya ningún humano puede distinguirlo de forma fiable. La solución honesta es estructural: reglas claras sobre la divulgación y la procedencia que obliguen a quienes publican y distribuyen imágenes, no a quienes las miran.
Qué viene realmente después
Los generadores de imágenes ganaron la carrera armamentista. Se volvieron tan buenos que la pregunta «¿esto es real?» ya no tiene una respuesta rápida. El siguiente problema que hay que resolver no es crear mejores detectores. Es construir un sistema donde la verdad de una imagen no dependa de si tu ojo llega a detectarla. Procedencia, contenido firmado, cadenas de custodia verificables. Eso es aburrido, y es lo único que funcionará de verdad. El ojo ha perdido, y fingir lo contrario solo da a todos una falsa sensación de seguridad.
Artículos relacionados
El silencioso cambio en las licencias que podría cambiar las imágenes de IA de código abierto
Los pesos abiertos ya no significan lo que significaban hace un año. La letra pequeña de las licencias se está volviendo más complicada justo cuando los modelos mejoran.
La presión de los modelos locales: por qué los creadores siguen persiguiendo modelos de imágenes sin restricciones
Cada semana, otro creador pide un modelo sin restricciones. La demanda dice más sobre las herramientas en la nube que sobre quienes preguntan.
Tongyi Wanxiang Qwen-Image 2.1 ya es de código abierto: ¿por qué un modelo de 7B se atreve a plantar cara a Google y OpenAI?
¿Con qué se atreve un modelo de generación de imágenes de código abierto de 7B a medirse con Google y OpenAI? Este artículo analiza los resultados, las capacidades clave y la polémica de licencia de Qwen-Image 2.1.
El stack de imágenes de IA de código abierto se está reconstruyendo, un flujo de trabajo a la vez
Workflow1111 recrea AUTOMATIC1111 con 73 nodos y 11 pipelines. Qué significa la reconstrucción comunitaria para la generación local de imágenes.