← Volver al blog
Aiaprox. 7 min de lectura

Ahora Suno habla y trae su propia banda sonora

Publicado 2 oct 2026
Ahora Suno habla y trae su propia banda sonora

El 1 de octubre, Suno abrió Speech en beta pública para todos los usuarios en web, iOS y Android. Escribes una idea, un poema o un guion que ya tenías escrito, y luego describes la voz y el ambiente musical que quieres por debajo. Speech devuelve ambos como una sola pista.

El director de producto de Suno, Jack Brody, lo describió en el anuncio como el primer modelo de audio que genera voz y música juntas como una única pista cohesiva. Ese encuadre es todo el producto. Muchas herramientas producen una voz sintética, y muchas producen música. La propuesta aquí es que el ritmo y el ambiente se ajustan al significado mientras ambos se generan, en lugar de ensamblarse después en un editor, que es donde va a morir toda introducción de pódcast amateur.

La mecánica es deliberadamente sencilla. El modo Simple toma un prompt en lenguaje natural, algo como «un capitán de barco arengando a su tripulación antes de una tormenta», y genera tanto el habla como la partitura. El modo Avanzado toma un guion exacto y expone controles para el género de la voz, el estilo vocal, el ritmo y cuánta variedad debe tener cada generación. Hay un interruptor para eliminar la música por completo si solo quieres una narración limpia. En la beta, cada generación está limitada a unos ocho minutos.

Qué significa beta aquí

Suno es inusualmente sincera sobre el estado de la cosa. La nota de Brody dice que un acento británico puede ocasionalmente irse a Australia y volver, y que las pausas dramáticas pueden ser muy dramáticas. Ese tipo de divulgación es más rara de lo que debería en los anuncios de lanzamiento, y dice algo sobre en qué punto sigue estando el modelado de voz.

La empresa tampoco nombró idiomas compatibles, lo que significa que el rendimiento fuera del inglés no está verificado hasta que lo pruebes. Dado que la audiencia actual de Suno es global, la ausencia de una lista de idiomas en un lanzamiento de voz es una señal, no un descuido. El clonado de voz es difícil en inglés y más difícil en idiomas con sistemas tonales más ricos, y Suno lanza antes de poder prometer mucho.

Tampoco se dijo nada sobre niveles de precios, límites de generación ni derechos comerciales del audio. Eso vive en los detalles de los planes, y cualquiera que planee usar Speech para trabajo con clientes debería leerlos con atención, dada la historia de Suno.

El giro de las licencias

El último año de Suno ha sido un giro lento del scraping a la firma de acuerdos. El 9 de septiembre lanzó v6, una generación de modelos musicales creada con Warner Music Group, BMG y Believe. La familia tiene tres partes: el buque insignia v6 y un v6-wild orientado a la exploración para suscriptores Pro y Premier, y v6-mini para todos. Suno dice que v6 puede editar parte de una canción existente usando lenguaje natural, construir un mashup a partir de varias fuentes en una sola petición, aislar audio para crear un nuevo beat, crear música a partir de texto, audio, imágenes y video, y reescribir una sola letra sin reconstruir toda la canción. A medida que v6 se despliega, la empresa planea retirar sus modelos más antiguos y trasladar la plataforma por completo a la nueva generación.

Eso es una verdadera mejora de capacidades, y también es una estrategia legal. Los acuerdos de licencia convierten a Suno de demandado en socio, y las experiencias de artistas con adhesión voluntaria que la empresa dice estar construyendo, en las que los artistas eligen participar y cobrar, son la forma de un negocio que quiere dejar de recibir demandas.

Las demandas no se han detenido. Sony Music y Universal Music Group demandaron a Suno por infracción de derechos de autor, y en septiembre de 2026 las discográficas ampliaron el caso con una acusación de lavado de modelos: usar modelos más antiguos, presuntamente infractores, para generar audio sintético con el que entrenar modelos más nuevos. Es una acusación más afilada que la de entrenar con canciones obtenidas mediante scraping, porque describe una cadena de infracción que continúa después de que una empresa afirma haberse limpiado.

Mientras tanto, el CEO Mikey Shulman dijo a Bloomberg el mismo día del lanzamiento de Speech que Suno ha superado con creces los 2 millones de suscriptores y los 300 millones de dólares en ingresos que reportó por última vez. Una empresa tan grande expandiéndose hacia la voz está haciendo algo más que añadir una función. Está construyendo una cartera de herramientas de audio generativo bajo una sola suscripción para que un cliente tenga menos motivos para irse.

A quién le comprime el trabajo

La pregunta correcta para una nueva herramienta no es qué hace, sino a quién le reemplaza el trabajo. A juzgar por los usos que Suno reportó durante su mes de pruebas privadas, cuatro grupos lo notan de inmediato.

Los creadores de video de formato corto tienen el encaje más obvio. Una intro con firma musical, transiciones entre segmentos, un remate musical de cierre: recursos que antes requerían un compositor y una sesión ahora salen de una sola generación. La compresión es real, porque el antiguo flujo de producción tenía un paso duro en el que una persona emparejaba una pista con un guion, y ese paso ahora está dentro del modelo.

Los creadores de pódcast también obtienen una versión. Un segmento narrado con música original debajo es un problema de dos partes que acaba de convertirse en uno, y el interruptor para desactivar la música significa que hay una locución limpia disponible cuando un cliente la necesita.

El tercer grupo es menos obvio y probablemente más grande. Los casos de prueba que Suno reportó se apoyan mucho en contenido personal y semipersonal: lecturas dramáticas de mensajes de texto de amigos, notas de voz con partituras épicas, meditaciones guiadas, charlas motivacionales y cuentos para dormir para los propios hijos del equipo. Es el mismo patrón que siguió el generador de canciones de Suno. Se convirtió en un elemento fijo de cumpleaños y chistes internos antes de convertirse en una herramienta de producción, y la empresa está posicionando Speech en el mismo carril, llamando a la categoría entretenimiento creativo.

Los competidores ya están en la sala. ElevenLabs ha dominado la síntesis de voz desde 2023, Adobe tiene una herramienta de texto a voz, y Google DeepMind lleva una década trabajando en el habla. La ventaja de Suno no es la calidad de la voz, que según las salvedades de la beta está por detrás de los líderes. Es el emparejamiento: un prompt, una toma, palabras habladas y música original que ya encajan entre sí.

La parte sin resolver

La brecha entre la historia de producto de Suno y su historia legal es donde esto se vuelve interesante. Speech amplía lo que la plataforma puede crear, y también amplía aquello que se puede acusar a la plataforma de crear. Una herramienta de voz que produce narración en el estilo elegido por el usuario se acerca a la suplantación, y un modelo que genera música junto con el habla hereda todas las preguntas sobre datos de entrenamiento por las que el lado musical ya está peleando.

La respuesta de Suno hasta ahora son acuerdos y transparencia. Ha firmado con las discográficas, añadido filtros para el audio y las letras subidos, y prometido adhesiones voluntarias de artistas con pago. Eso es más de lo que han hecho la mayoría de las empresas de audio generativo. Tampoco es una respuesta definitiva, porque la acusación de lavado de modelos, si se sostiene, describe un problema dentro de la propia historia de entrenamiento de Suno, y no en sus márgenes.

Lo que Speech hace bien es eliminar un paso que antes requería dos especialistas y reservar una sesión. Lo que no hace es resolver si los modelos que hay detrás se construyeron como la empresa ahora dice que los construye. Esas dos preguntas seguirán avanzando en paralelo, y solo una de ellas se responderá al usar el producto.

Artículos relacionados