Apple ahora quiere entrenar IA con tus datos, y los modelos de imagen están en la mira

Apple pasó años posicionándose como la empresa de la privacidad. Puso «lo que pasa en tu iPhone se queda en tu iPhone» en vallas publicitarias, convirtió el procesamiento en el dispositivo en un argumento de venta y usó la privacidad como arma contra competidores cuyos modelos de negocio se basaban en los datos. Así que cuando este mes surgieron informes de que Apple ahora quiere entrenar modelos de IA con datos de usuarios, el giro cayó con fuerza.
La información, publicada por Heise y recogida ampliamente en Hacker News, describe un cambio en la postura de Apple respecto al entrenamiento de sus modelos con contenido de usuarios, con las habituales garantías sobre la opción de participar (opt-in) y las protecciones de privacidad. Los detalles importan menos que la dirección. Una empresa que construyó su marca sobre no tocar tus datos ahora busca la forma de entrenar con ellos, y la brecha entre esas dos posiciones es la historia.
Para la generación de imágenes, esto no es una cuestión de política abstracta. Los modelos de texto a imagen y de edición de imágenes están hambrientos precisamente del tipo de datos que los usuarios producen constantemente: fotos, capturas de pantalla, dibujos, imágenes editadas y los prompts que la gente usa para describir lo que quiere. La mejor señal de entrenamiento para un modelo que convierte palabras en imágenes es un enorme montón de imágenes reales emparejadas con cómo la gente habla de ellas. Cada usuario de iPhone es, en efecto, un conjunto de datos andante de exactamente este tipo de datos emparejados.
Apple se ha mantenido discreta en el terreno de la generación de imágenes en comparación con OpenAI, Google y Adobe, pero las piezas están ahí. La generación en el dispositivo, las funciones de edición de fotos y un conjunto creciente de herramientas creativas apuntan a modelos que se beneficiarían enormemente de los datos de los usuarios. Solo la biblioteca de Fotos es un corpus que la mayoría de los laboratorios envidiarían: miles de millones de imágenes con etiquetas de ubicación, hora y personas, la materia prima para enseñar a un modelo cómo es «un atardecer sobre un lago» o «el cumpleaños de mi hija». La pregunta es si Apple puede usar esos datos sin romper la confianza que ha sido su diferenciador.
La tensión no es exclusiva de Apple. Todos los grandes creadores de modelos se enfrentan a la misma economía. Los datos de entrenamiento son el cuello de botella, los datos de alta calidad escasean y el contenido de los usuarios es la mayor reserva sin explotar. Las empresas que se negaban a entrenar con datos de usuarios ahora ven a sus competidores hacerlo y sienten la presión de seguirlos. La web está mayormente raspada hasta secarse, los datos sintéticos tienen sus propios límites de calidad, y la próxima frontera de los datos de entrenamiento es lo que la gente crea en sus apps y dispositivos privados. El giro de Apple es solo la versión más visible de una decisión que muchas empresas están tomando en silencio.
Lo que separa las versiones responsables de las temerarias es el consentimiento y la transparencia, no el acto de entrenar en sí. Un usuario que acepta explícitamente, sabe para qué se usan sus datos y puede revocar su consentimiento en cualquier momento está en una posición distinta a la de aquel cuyas imágenes se recogen de forma predeterminada, enterradas en una actualización de los términos de servicio que nadie lee. La información sobre Apple sugiere que la empresa intenta hilar fino: mantener su lenguaje de privacidad mientras abre la puerta al entrenamiento, lo que es o bien un intento genuino de entrenamiento basado en el consentimiento o bien un giro gestionado con cuidado, según cuán benévolo te sientas.
Hay un problema más profundo específicamente para los datos de imagen. Una foto no es como una consulta de búsqueda. Contiene personas, lugares y metadatos que pueden identificar a individuos, y es la materia prima de modelos que después podrían generar imágenes que se parezcan a esas personas. La línea entre «datos de entrenamiento» y «semejanza» se vuelve borrosa muy rápido. Entrena un modelo con la cara de alguien y puede que sea capaz de reproducir esa cara, lo que plantea preguntas sobre consentimiento, derechos de imagen y privacidad que un modelo de texto nunca tiene que responder.
Los reguladores han demostrado este mes, en los casos de deepfakes de Grok, que están dispuestos a tratar el uso indebido de la imagen de una persona como un problema de protección de datos, no solo de moderación de contenido. La Oficina del Comisionado de Información del Reino Unido calificó los deepfakes no consentidos como una violación de la protección de datos, y ese encuadre podría extenderse fácilmente a cómo las empresas recopilan y usan las imágenes que entrenan los modelos en primer lugar. Apple, precisamente, no quiere que la pillen entrenando con semejanzas sin un consentimiento hermético.
Para los usuarios, la conclusión práctica es leer con atención los avisos y la configuración. Lo predeterminado puede no favorecerte, y la posibilidad de optar por no participar solo tiene sentido si sabes que existe y puedes encontrarla. Cuando Apple lance cualquier opción de participación en el entrenamiento, búscala en los ajustes, lee lo que dice realmente y decide por ti mismo en lugar de hacer clic sin más. Los ajustes de privacidad solo valen lo que haces con ellos.
Para la industria, el movimiento de Apple es una señal de que la era del reticente de la privacidad en la IA está terminando. Cuando incluso la empresa que convirtió la privacidad en un eslogan empieza a entrenar con datos de usuarios, la suposición de que algún modelo importante se construyó sin tus imágenes resulta más difícil de sostener. También eleva las apuestas para todos los demás. Si Apple puede entrenar con datos de usuarios con consentimiento y tener éxito, legitima la práctica. Si tropieza y la pillan haciéndolo mal, refuerza los argumentos a favor del tipo de regulación hacia la que ya apunta el escándalo de Grok.
Es probable que Apple mantenga su encuadre de privacidad, porque el encuadre es el producto. La verdadera pregunta es si ese encuadre sigue describiendo lo que ocurre o solo lo que el equipo de marketing quiere que sientas. La respuesta, como con casi todo en la IA ahora mismo, aún se está escribiendo, y se escribirá en la letra pequeña de una pantalla de ajustes antes que en cualquier comunicado de prensa.
Hay una dimensión competitiva que es fácil pasar por alto. Apple llega tarde a la IA generativa en comparación con sus rivales, y tarde de una forma que daña su imagen de líder tecnológico. La presión por ponerse al día es real, y los datos de entrenamiento son la restricción que determina si puede lograrlo. Una empresa que se niega a entrenar con datos de usuarios mientras sus competidores lo hacen elige luchar con una mano atada a la espalda. El giro de Apple, si es que es un giro, tiene tanto que ver con mantenerse en la carrera como con cualquier cambio filosófico. La marca de privacidad era un diferenciador cuando Apple no intentaba competir en IA. Ahora que lo hace, la marca y la ambición tiran en direcciones opuestas.
Para la generación de imágenes, lo que está en juego en esa tensión es concreto. El ecosistema fotográfico de Apple es, posiblemente, su activo sin explotar más fuerte. La app Fotos, las herramientas de edición y la cámara del hardware: todo ello genera un flujo de datos de imagen de alta calidad y bien etiquetados por el que la mayoría de los laboratorios de IA pagarían una fortuna. Si Apple puede entrenar modelos de imagen con esos datos y con un consentimiento genuino, podría adelantar a competidores que están atascados raspando la web. Si no puede, verá cómo ese activo queda sin usar mientras otros muerden su mercado de herramientas creativas. Ese es el verdadero premio detrás de la historia política.
El mecanismo de consentimiento es donde se observará a Apple con mayor atención. La empresa tiene un historial de plantear la recopilación de datos mediante avisos de opt-in que muchos usuarios hojean y aceptan. Si eso cuenta como un consentimiento significativo es exactamente la pregunta que los reguladores empiezan a hacerse, y es la misma que los casos de deepfakes de Grok han forzado a salir a la superficie. Apple tiene más que perder que la mayoría si se equivoca en esto, porque toda su reputación está en juego en la afirmación de que hace la privacidad de forma diferente. Si esa afirmación resulta ser marketing, el daño no es solo legal, es a nivel de marca, y socavaría la única ventaja que Apple todavía tiene de forma fiable.
Artículos relacionados
Los chips Ascend de Huawei están construyendo una ruta alternativa para los modelos de imagen de IA
Los modelos de imagen son intensivos en cómputo, y la historia del hardware acaba de sumar una segunda ruta. Qué significa el impulso de Ascend de Huawei para quién puede permitirse construirlos y ejecutarlos.
El desastre de generación de imágenes de Grok está reescribiendo las reglas para todos los demás
Millones de deepfakes no consentidos, investigaciones en tres continentes y un parche de suscripción de pago. Lo que la crisis de Grok zanjó sobre la responsabilidad de las imágenes con IA.
Los modelos chinos de IA para imágenes conquistan adeptos en el extranjero, y Washington observa
La adopción es técnica primero, política después. Los desarrolladores descargan lo que funciona, y ahora mismo eso viene cada vez más de laboratorios chinos.
Qué están apostando los mercados de predicción sobre las imágenes de IA
Hay dinero real apostando por quién gana en imágenes de IA. OpenAI lidera las imágenes fijas, MiniMax lidera el vídeo, y los modelos abiertos son el comodín que nadie valora.