El primer caso de infracción de voz por IA en Shanghái se cierra en segunda instancia: la identificabilidad se convierte en el criterio y la plataforma indemniza con 50.000 yuanes

--- title: El primer caso de infracción de voz por IA en Shanghái se cierra en segunda instancia: la identificabilidad se convierte en el criterio y la plataforma indemniza con 50.000 yuanes meta_title: ¿Cómo se juzga la infracción de voz por IA? El primer caso de segunda instancia en Shanghái ofrece el criterio meta_description: El Tribunal Intermedio Popular N.º 1 de Shanghái mantiene la sentencia en segunda instancia: la voz de una actriz de doblaje fue sintetizada con IA para promociones y la plataforma indemniza con 50.000 yuanes. El tribunal establece la identificabilidad como estándar central de la infracción de voz. ---
La actriz de doblaje, la señora Wang, descubrió el problema cuando una amiga le avisó. Alguien le dijo que en una campaña de captación de usuarios de una aplicación, la voz utilizada se parecía mucho a la suya.
Ella lo verificó y determinó que ese audio probablemente había sido sintetizado con IA. Después notarizó las pruebas, demandó al operador y reclamó 300.000 yuanes. El caso llegó hasta el Tribunal Intermedio Popular N.º 1 de Shanghái, donde la sentencia final confirmó el fallo original: la plataforma constituyó una infracción de voz y deberá indemnizar con 50.000 yuanes.
Este es el primer caso en Shanghái de una disputa por la protección de los derechos de voz provocada por voz sintetizada con IA. Merece ser analizado por separado, y la razón no tiene que ver con la indemnización: el tribunal aclaró una cuestión: bajo qué condiciones la imitación de la voz de una persona mediante IA constituye una infracción.
Tres hechos clave del caso
Primero, el demandado admitió que el audio fue generado por IA, pero no pudo explicar de dónde provenía el material.
La defensa de la empresa A fue: el audio en cuestión efectivamente fue generado por la IA desarrollada por la empresa, pero la procedencia concreta y los materiales de entrenamiento no pueden confirmarse porque el exempleado que los gestionaba ya no está. La empresa tampoco sabía que la señora Wang era actriz de doblaje, por lo que no existió recolección ni uso de su voz.
Segundo, el dictamen pericial aportó resultados cuantitativos.
La señora Wang solicitó una pericia judicial y comparó el audio notariado con su propia voz recogida en el momento. De 28 indicadores acústicos de formantes, 24 presentaron una desviación inferior al 10 %, y 16 de ellos inferior al 5,36 %. Las partes con similitud considerable y alta similitud alcanzaron el 90 %.
Tercero, el tribunal impuso la carga de la prueba a la plataforma que controlaba los datos de entrenamiento.
El Tribunal Intermedio Popular N.º 1 de Shanghái consideró que la empresa A, como parte que controlaba los datos de entrenamiento originales, no aportó pruebas suficientes sobre la legalidad de la procedencia de los materiales de entrenamiento, la no utilización de las características vocales de una persona natural, ni la ausencia de confusión o error en el público, por lo que debía asumir las consecuencias adversas de la falta de prueba.
La regla que estableció el tribunal: se atiende a la identificabilidad, no al origen técnico
La esencia de la decisión en este caso se resume en una frase: sin el consentimiento de una persona natural, utilizar su voz como corpus de entrenamiento, imitar su timbre, entonación y estilo de pronunciación, y generar una voz sintética que permita identificar a esa persona, debe considerarse una infracción de sus derechos de voz.
Aquí hay dos ideas que conviene desglosar.
Una es que la línea de defensa habitual de los desarrolladores de voz por IA no se sostiene. Algunos argumentan que la voz es una reconstrucción algorítmica de la huella vocal, distinta de copiar directamente una grabación original, por lo que no constituye infracción. La respuesta del tribunal es que el criterio recae en el resultado sintetizado: si permite que el público general lo asocie con una identidad concreta.
La otra es que el umbral de identificación se fija en el nivel del público general, no en el de los expertos. En el caso, el resultado pericial fue de alta similitud, por lo que existe identificabilidad. Pero esto también implica que una similitud cercana a ese grado ya cruza la línea, y no solo cuando se logra una imitación indistinguible de la real.
Este precedente conecta con el documento del Tribunal Popular Supremo
Si ampliamos la línea temporal, este caso no es una sentencia aislada.
El 7 de septiembre, el Tribunal Popular Supremo publicó las «Opiniones sobre la tramitación conforme a derecho de casos relacionados con inteligencia artificial», cuyo artículo 4 aclara dos cuestiones: sin consentimiento, utilizar inteligencia artificial para procesar el nombre o la imagen de otra persona, generar una figura digital virtual identificable y usarla o hacerla pública constituye una infracción de los derechos de la personalidad, como el derecho al nombre y el derecho a la imagen; sin consentimiento, utilizar la voz de otra persona para entrenamiento, imitar su timbre, entonación y estilo de pronunciación y generar una voz sintética identificable constituye una infracción de los derechos de voz.
Este es el primer documento de reglas judiciales sobre inteligencia artificial emitido por el máximo órgano judicial del país. Uno de los puntos de mayor peso es que, por primera vez, la voz recibe la misma protección que la imagen, y la identificabilidad se convierte en el criterio unificado para determinar la infracción.
El caso de Shanghái apareció después de este documento y equivale a llevar la regla escrita a un caso concreto: la pericia arrojó un 90 % de similitud, el tribunal determinó sobre esa base que la identificabilidad estaba acreditada, la plataforma no pudo aportar pruebas de la procedencia legal del material, y la indemnización quedó establecida.
Anteriormente, otro caso típico fue incluido por el Tribunal Supremo como referencia. En 2024, una empresa de medios culturales de Xuzhou encargó a un streamer de ventas la creación de un vídeo promocional; el streamer utilizó fragmentos de un discurso público de la señora Li, académica en el ámbito de la educación familiar, junto con un audio sintetizado por IA muy similar a su voz en timbre, entonación y estilo de pronunciación. En julio de 2025, el Tribunal de Internet de Pekín condenó al demandado a disculparse y a indemnizar con 120.000 yuanes por pérdidas económicas y gastos razonables de defensa. Ambos casos apuntan a la misma lógica: el uso no autorizado de la imagen de otra persona, sumado a una voz sintetizada por IA altamente coincidente, constituye una doble infracción del derecho a la imagen y de los derechos de voz.
La reacción del mercado: el intercambio de rostros se restringe, pero la clonación de voz sigue vendiéndose
Tras la entrada en vigor de las reglas, la reacción en el lado comercial no fue simétrica.
Según informes de prensa, en la semana posterior a la publicación de las opiniones del Tribunal Supremo, en algunas plataformas de comercio electrónico la búsqueda de servicios de intercambio de rostros mostró un mayor bloqueo y no arrojó productos relacionados; sin embargo, al buscar clonación de voz, los productos seguían a la venta en grandes cantidades. Algunos productos de síntesis de voz se vendían a 33,88 yuanes, con más de 700 unidades vendidas; el entrenamiento por encargo de modelos de voz se anunciaba a 20 yuanes; y en plataformas de segunda mano había servicios de clonación de voz a 8,85 yuanes, con más de 770 unidades vendidas.
Esta asimetría revela una realidad: el umbral de la clonación de voz es mucho más bajo que el del intercambio de rostros, y la necesidad de material es más discreta. Una obra de doblaje pública, un episodio de pódcast o un vídeo corto pueden constituir un corpus de entrenamiento suficientemente bueno.
Para los usuarios, estas sentencias envían una señal clara. Primero, no se puede pretender quedar exento de responsabilidad por no poder explicar la procedencia del material; quien controla los datos de entrenamiento se encuentra en una posición desfavorable en materia probatoria. Segundo, la determinación de la identificabilidad depende de una pericia técnica; una vez que el resultado sintetizado se acerca lo suficiente como para que el público lo asocie con una persona concreta, el uso comercial constituye infracción. Tercero, el importe de la indemnización se determinará tomando como referencia las tarifas de licencia del titular para usos similares; el coste ahorrado por eludir la autorización mediante IA puede terminar devolviéndose en forma de indemnización.
Qué significa esto para los equipos que desarrollan productos de voz con IA
La lógica de la sentencia de este caso ofrece varias advertencias directas para el lado del producto.
La prueba del origen de los datos de entrenamiento debe archivarse. El punto más letal del caso fue que la empresa A no pudo explicar la procedencia de los materiales de entrenamiento. Para los equipos que trabajan en clonación de voz, síntesis de voz o generación de contenido de audio, la cadena de autorización del corpus debe contar con registros trazables, en lugar de depender de confirmaciones verbales.
La imitación de características vocales debe desvincularse de personas concretas. Si el producto va a generar un timbre específico, la autorización es una condición previa, no un remedio posterior. A la inversa, si solo se busca un timbre genérico, los datos de entrenamiento deben proceder de fuentes comercialmente utilizables y trazables.
La línea de la identificabilidad debe tratarse como una línea roja, no como un valor de referencia. El 90 % de similitud del dictamen pericial es la base de la determinación en este caso, pero el tribunal no fijó un umbral numérico fijo. Esto significa que cualquier resultado generado que se acerque a las características vocales de una persona natural concreta requiere una evaluación prudente.
En el caso de la señora Wang, la indemnización fue de 50.000 yuanes. Comparado con los 300.000 yuanes reclamados, no es una cifra elevada. Pero su significado no está en este caso, sino en que, a partir de ahora, la suposición por defecto de todos al trabajar con voz por IA ha cambiado.
Artículos relacionados
DeepSeek está recaudando 12.000 millones de dólares y construyendo un clúster de Huawei con 160.000 chips
La mayor apuesta única en la IA china en este momento es por el silicio nacional, hecha por el laboratorio con más credibilidad en modelos abiertos.
El dinero se está moviendo hacia la IA física: los $1.450 millones de SiMa.ai y los agentes que diseñan hardware
El capital está llegando antes que la evidencia. Los despliegues del próximo año dirán si la apuesta fue correcta.
Un tribunal de Arizona anuló una sentencia porque un video con IA habló por la víctima
Reproducir lo que hizo una persona es una cosa. Hablar por ella es otra, y la línea entre ambas ahora está escrita en un expediente judicial.
OpenAI aplicará una marca de agua al texto de ChatGPT en la UE. Sus propios números muestran lo frágil que es
Una marca que la paráfrasis rutinaria puede eliminar puede satisfacer la letra del artículo 50 mientras fracasa en la tarea para la que se escribió el artículo.