RecursosTranscripción musicalAndrew Carlins•9 min de lectura

¿Cómo funciona la transcripción musical con IA?

La transcripción musical con IA escucha una grabación y escribe las notas. Te contamos qué pasa de verdad entre el audio que entra y la partitura que sale, sin tecnicismos, y en qué ya funciona bien y en qué todavía le cuesta.

¿Cómo funciona la transcripción musical con IA?

La transcripción musical con IA toma una grabación y escribe las notas, y todo el proceso ocurre en tres pasos. El audio se convierte en una imagen de sus frecuencias, un modelo entrenado con miles de grabaciones lee esa imagen y predice las notas, y esas notas se alinean con el pulso y se escriben como partitura y como MIDI. Si hoy funciona tan bien es porque el paso del medio, el más difícil, dejó de ser un conjunto de reglas escritas a mano y pasó a ser una red neuronal que aprendió con ejemplos cómo se ven las notas.

La versión corta

Quien transcribe de oído escucha una nota, la busca en su instrumento, calcula cuánto dura, la escribe y repite todo eso unos cuantos miles de veces. La IA hace el mismo trabajo, solo que mucho más rápido y todo de una vez. Convierte el sonido en datos que puede analizar, reconoce las notas escondidas en esos datos y las traduce a los símbolos que leemos. La inteligencia está en el paso del reconocimiento, y ahí se concentra casi todo el avance de los últimos años.

Paso uno: el sonido se convierte en imagen

Una grabación digital no es más que una larga lista de números, decenas de miles por segundo, que describen cómo debe vibrar la membrana que reproduce el sonido. En esa lista no se ve ninguna melodía. Por eso lo primero que hace el software es aplicar una transformada que responde a una pregunta más útil: en cada instante, ¿cuánta energía hay en cada altura? El resultado es un espectrograma, un mapa de calor con el tiempo de izquierda a derecha y la frecuencia de abajo hacia arriba, donde los puntos brillantes marcan las notas que están sonando.

Es más o menos la misma imagen que te muestra un piano roll, y se parece mucho más a la música que la forma de onda en bruto. Una nota mantenida se ve como una franja horizontal, un acorde como varias franjas apiladas y un golpe de batería como una mancha vertical breve que cruza muchas frecuencias. Convertir el sonido en este tipo de imagen vuelve abordable el paso siguiente, porque el problema pasa a parecerse a algo que puede leer un modelo entrenado con imágenes.

Paso dos: el modelo encuentra las notas

Leer notas en un espectrograma es más difícil de lo que parece, porque una sola nota de piano no es una línea limpia. Es una frecuencia fundamental con una escalera de armónicos encima, y cuando suenan varias notas juntas sus armónicos se superponen y se enredan. El mi grave de la guitarra comparte armónicos con el mi de una octava más arriba. Distinguir qué puntos brillantes son notas reales y cuáles son armónicos de otras notas es el gran rompecabezas de la transcripción.

Los sistemas actuales lo resuelven con redes neuronales entrenadas con grandes conjuntos de grabaciones emparejadas con sus notas exactas. En el caso del piano, los instrumentos que registran a la vez el audio y cada tecla que se toca dieron lugar a conjuntos de datos con miles de interpretaciones perfectamente alineadas con las notas que de verdad se tocaron. Una red estudia todo eso y aprende a distinguir una nota tocada de sus armónicos y a reconocer cómo se ve el ataque de una nota y cómo se apaga. Por lo general predice unas pocas cosas por cada altura y por cada franja de tiempo: si una nota empieza, si una nota está sonando y con qué intensidad. Al unir esas predicciones se obtiene una lista de eventos de nota, cada uno con su altura, su inicio, su final y su velocidad de nota.

El gran cambio es que nadie programó a mano reglas como «ignora el tercer armónico». El modelo dedujo todo eso a partir de ejemplos. Por eso el mismo enfoque se extiende a otros instrumentos a medida que hay más datos de entrenamiento, y los resultados siguen mejorando sin que nadie reescriba la lógica. Hay fuentes que salen más limpias que otras, y lo explicamos con más detalle en por qué varía la precisión de la transcripción con IA.

Paso tres: las notas se convierten en una partitura legible

Una lista de eventos de nota con marcas de tiempo exactas ya alcanza para generar MIDI y para mostrar las notas en un piano roll. Pero una partitura necesita más que momentos de inicio y de final: necesita un tempo, una métrica y notas ajustadas a figuras rítmicas reconocibles. A 120 pulsaciones por minuto nadie toca una negra que dure exactamente 500 milisegundos, así que el software tiene que encontrar el pulso de la canción, decidir dónde caen las barras de compás y redondear cada nota a la figura razonable más cercana, como una negra o una corchea. Este paso se llama cuantización, y es lo que separa una transcripción que se lee con claridad de otra llena de fusas imposibles de tocar.

El software también tiene que tomar las decisiones de notación que espera quien toca: qué notas van en la mano derecha y cuáles en la izquierda, cómo escribir una alteración, dónde poner los silencios. Después el resultado se exporta en distintos formatos, así que una misma transcripción puede ser un PDF para imprimir, un archivo MIDI para una DAW y un archivo MusicXML que puedes abrir en un editor de partituras. Si un ritmo o el reparto entre las manos sale mal, se corrige en esta capa, y corregir los errores de transcripción suele ser cuestión de una edición rápida, sin empezar de cero.

Dónde funciona bien y dónde le cuesta

Con el piano solo, la transcripción con IA juega de local. Es donde hay más datos de entrenamiento, el sonido se comporta bien y los buenos modelos captan la gran mayoría de las notas de una grabación limpia. Transcribir un solo instrumento que toca acordes, lo que se llama transcripción polifónica, también funciona bien hoy, y el caso del piano lo explicamos en la transcripción polifónica de piano.

Las dificultades son previsibles. Una banda completa grabada en una sola pista mezclada es difícil, porque el modelo tiene que desenredar varios instrumentos que se superponen a la vez en el mismo rango de frecuencias. La distorsión fuerte, la reverberación densa y el audio de baja calidad desdibujan el espectrograma y bajan la precisión, y en los pasajes muy rápidos o con notas muy suaves algunas se escapan con facilidad. El resultado sigue siendo útil, pero lo realista es esperar un primer borrador sólido que revisas y no una partitura terminada que nadie tenga que mirar. Le ponemos números a esa expectativa en precisión de la transcripción musical con IA.

Cómo conseguir el mejor resultado

Como el primer paso alimenta todo lo que viene después, la grabación es lo que más está en tus manos. Cuanto más limpia y clara sea la fuente, mejor sale la imagen, y cuanto mejor sea la imagen, más acierta el modelo. Elige la versión más clara de la canción que encuentres, dile a la herramienta qué instrumento está escuchando para que use el modelo adecuado y dale al borrador una revisión rápida. Con Songscription subes un archivo o pegas un enlace, la IA hace los tres pasos que vimos y obtienes un piano roll y una partitura que puedes reproducir, ralentizar, transponer y editar en el navegador antes de exportarlos. La tecnología hace el trabajo pesado de escuchar, y la última palabra al editar es tuya.

Preguntas frecuentes

¿Cómo funciona la transcripción musical con IA?

Funciona en tres grandes pasos. Primero, el software convierte el audio en un espectrograma, una imagen de qué frecuencias suenan en cada momento. Después, una red neuronal entrenada con miles de grabaciones emparejadas con sus notas conocidas lee esa imagen y predice dónde empiezan las notas, qué altura tienen y cuándo terminan. Por último, las notas predichas se alinean con una rejilla de pulsos y se convierten en MIDI y en notación estándar. El modelo reconoce patrones que aprendió de los datos en lugar de seguir reglas escritas a mano, y por eso la transcripción mejoró tanto cuando llegaron los grandes conjuntos de datos alineados y las redes neuronales modernas.

¿Es precisa la transcripción musical con IA?

Con una grabación limpia de un solo instrumento hoy funciona muy bien, sobre todo con piano solo, donde los modelos suelen captar la gran mayoría de las notas. La precisión baja cuando el audio se complica: una mezcla densa de banda completa, una grabación ruidosa hecha con el celular, mucha reverberación o notas rápidas que se superponen hacen el trabajo más difícil. Lo realista es esperar un primer borrador sólido que tú revisas y corriges, y no una partitura impecable que nadie tenga que revisar.

¿La transcripción con IA distingue entre instrumentos?

Sacar las notas de un solo instrumento, incluidos los acordes de un piano o de una guitarra, es algo que los modelos hacen bien. Lo difícil es separar varios instrumentos que suenan a la vez en una misma grabación mezclada, y lo habitual es dividir primero la grabación en stems, es decir, en pistas de audio separadas, y transcribir cada parte por su cuenta. También puedes transcribir la mezcla completa directamente a un arreglo condensado, como una reducción para piano, cuando lo que quieres es la canción y no cada parte por separado.

¿Quieres ver los tres pasos con una canción tuya? Sube una grabación y mira cómo se convierte en notas que puedes leer y editar.

Sobre quien escribe

Andrew Carlins

Escrito por

Andrew Carlins

Cofundador y CEO de Songscription

Andrew cofundó Songscription en Stanford junto con otros músicos que estaban cansados de no encontrar las notas de las canciones que querían tocar. Creció tocando piano y saxofón barítono, y también hizo teatro musical. Hace años que no se sube a un escenario, pero le gusta pensar que sigue bastante afinado. Escribe sobre cómo sacar una canción de la grabación y pasarla a partitura.

Más sobre el equipo

Sigue leyendo sobre los mismos temas.