← Volver al blog
News7 min

¿Todavía puedes distinguir una imagen de IA de una foto real? La carrera armamentista de la detección se está volviendo incómoda

Publicado 27 sept 2026
¿Todavía puedes distinguir una imagen de IA de una foto real? La carrera armamentista de la detección se está volviendo incómoda

Un pequeño juego web llamado «¿Puedes decir cuáles imágenes son generadas por IA?» llegó a la portada de Hacker News este mes con 112 puntos y 85 comentarios. La premisa es simple: te muestran una serie de imágenes y adivinas si son reales o generadas. Los comentarios convergieron en la misma confesión. Las personas que trabajan con imágenes para ganarse la vida apenas obtenían resultados mejores que lanzar una moneda al aire.

Unos días después, otro hilo de HN presentó a Pangram, una startup que vende detección de IA tanto para texto como para imágenes, con una discusión de 27 comentarios sobre si la detección puede funcionar en absoluto. Entre ambos hilos yace el estado incómodo del campo: distinguir imágenes generadas de reales se está volviendo más difícil más rápido de lo que mejora la detección.

Por qué tus ojos siguen perdiendo

Las señales que antes funcionaban se han ido o casi. Manos distorsionadas, texto derretido, iluminación inconsistente, piel cerosa: cada arreglo se entregó en generaciones sucesivas de modelos. La renderización de texto, durante mucho tiempo la pista reveladora fiable, ya es un problema resuelto en los modelos líderes, y en parte por eso los benchmarks de imágenes empezaron a ponderarla tanto. Lo que queda es una brecha más sutil. Las imágenes generadas suelen ser un poco demasiado coherentes, las texturas un poco demasiado uniformes, los fondos un poco demasiado dispuestos. Los humanos notan la vibra y no pueden articularla, que es exactamente por lo que un juego de adivinanzas avergüenza a todos.

La cuestión de Loki ilustra el punto en otro registro. Una publicación en r/StableDiffusion preguntaba cómo hace la gente para producir imágenes de IA que preservan con tanta precisión la apariencia de un actor específico con nuevos atuendos y escenas. La respuesta, de quienes lo hacen, es generación basada en referencias y adaptadores ajustados, ninguno de los cuales requiere herramientas exóticas hoy en día. Parecidos que le habrían llevado años a una casa de VFX ahora son un proyecto de una tarde, y quien preguntaba no podía distinguir cuáles de las imágenes que inundaban su feed eran salidas del modelo.

La detección como producto, la detección como política

La propuesta de Pangram es que la detección es tratable cuando entrenas detectores con la misma agresividad que los generadores. La discusión en HN respondió con las objeciones habituales y en su mayoría correctas: los detectores generalizan mal a modelos no vistos, producen falsos positivos que perjudican a fotógrafos reales, y cualquier detector publicado se convierte en un objetivo que la próxima versión de un modelo derrota silenciosamente. También está el enfoque de procedencia, credenciales de contenido al estilo C2PA, que esquiva la detección pidiendo a cámaras y generadores que firmen sus salidas. Ayuda cuando todos cooperan. No hace nada por la imagen que alguien recodificó y despojó de metadatos.

La política avanza de todos modos. Los restaurantes que usan fotografía gastronómica con IA se convirtieron en una noticia menor este mes gracias a un artículo del Wall Street Journal, y la reacción no fue tanto por el engaño en abstracto como por la traición específica: la hamburguesa que pides debería parecerse a la hamburguesa del anuncio. Eso es un mecanismo de detección social, confianza colaborativa, y es más estricto que cualquier clasificador.

Qué debatieron realmente los hilos de HN

Las dos discusiones de Hacker News dividieron el problema con nitidez. El hilo del juego era sobre todo gente reportando puntuaciones e intercambiando consejos, y los consejos son un buen registro fósil de lo que solía funcionar: mira las manos, revisa el texto, inspecciona los reflejos, cuenta los dedos de los peatones del fondo. Casi todas esas comprobaciones ahora dan falsos negativos en los modelos actuales. La renderización de texto en particular dejó de ser una señal fiable una vez que los modelos líderes la convirtieron en prioridad de benchmark; un escaparate generado con letreros legibles era una novedad hace dos años y ahora es un comportamiento por defecto.

El hilo de Pangram fue más escéptico. Las objeciones en los comentarios eran las de siempre, y se sostienen: los detectores entrenados con los generadores de ayer no detectan los de mañana, los falsos positivos golpean con más fuerza a fotógrafos reales cuyo trabajo es marcado como sintético, y la publicación de un detector es una invitación abierta a que el próximo modelo se entrene en su contra. Un comentario hizo concreta la asimetría: un generador solo necesita engañar a los detectores que existen, mientras que un detector necesita atrapar a todos los generadores, incluidos los que aún no se han lanzado. Es una carrera perdida por construcción, y por eso los productos comerciales de detección se venden sobre todo a instituciones con obligaciones de moderación, no a individuos con curiosidad por una imagen sospechosa.

La procedencia, la alternativa aburrida

La alternativa que no deja de aparecer son las credenciales de contenido: metadatos firmados criptográficamente, al estilo C2PA, adjuntos en la captura o la generación. Las cámaras firman lo que vio el sensor. Los generadores firman lo que hizo el modelo. Las herramientas de edición preservan o anotan la cadena. Nada de eso requiere detectar nada, que es su principal virtud, ya que la detección es una carrera armamentista permanente y la firma es un estándar de fontanería.

Las debilidades son igual de estructurales. La firma es voluntaria, los metadatos se eliminan con capturas de pantalla y recodificaciones, y la cadena solo prueba de dónde vino una imagen, nunca si el original era honesto. Una imagen de IA firmada sigue siendo una imagen de IA. Pero a medida que las plataformas empiezan a mostrar credenciales, la presencia de una cadena limpia se convierte en una señal de confianza tal como lo hizo HTTPS, y su ausencia empieza a leerse como una pregunta que la imagen no puede responder.

La capa social es más estricta que la capa técnica

Entre la detección y la procedencia está el mecanismo que realmente hizo el trabajo este mes: las multitudes. La historia del restaurante se difundió porque los clientes reconocieron la brecha entre la comida fotografiada y la servida, no porque un clasificador la marcara. Las imágenes de abuelos boomer con nietos se convirtieron en noticia porque los padres en el chat grupal dijeron que no. Las imágenes de Loki llevaron a un subreddit a preguntar cómo se hicieron, y obtuvieron una respuesta en un día. Las comunidades detectan como los detectores no pueden: conociendo el contexto.

Eso sugiere una división del trabajo que vale la pena tomar en serio. Las máquinas son buenas para el cribado a escala, marcando cargas masivas para revisión humana. Los humanos son buenos para el contexto, detectando que la hamburguesa del anuncio no tiene migas porque ninguna hamburguesa las tiene. La procedencia es buena en la fuente, donde están los actores honestos. Ninguna capa por sí sola lo atrapa todo, y es exactamente por eso que el juego que avergonzó a todos sigue siendo una calibración útil en lugar de un veredicto.

Qué significa esto para quienes publican imágenes

Si publicas o encargas imágenes, del estado actual se derivan tres hábitos. Primero, etiquetar el contenido generado se está convirtiendo en un activo de confianza en lugar de una admisión. Los creadores que lo revelan, y hay una división visible en los hilos de r/StableDiffusion sobre cómo manejar los comentarios anti-IA, están construyendo audiencias que se quedan cuando la divulgación ocurre desde el principio. Segundo, los metadatos de procedencia son baratos de conservar y ocasionalmente decisivos; las plataformas están empezando a mostrarlos, y el costo de preservarlos es una opción en la configuración. Tercero, para cualquier cosa donde la imagen haga una afirmación factual (noticias, productos, evidencia), asume que tu audiencia tiene un detector que acierta como lanzar una moneda al aire y una herramienta de captura de pantalla. La única defensa duradera es ser veraz sobre lo que es la imagen.

Dos retratos de estudio casi idénticos lado a lado, uno una fotografía real y otro generado por IA

El juego que avergonzó a todos vale la pena jugarlo de todos modos. Diez minutos contra una baraja mezclada de imágenes reales y generadas recalibra tu confianza en una dirección útil. Las imágenes en las que fallas no fueron fallos de atención. Son la nueva línea base, y la línea base se mueve cada mes.

Artículos relacionados