MateriaisTranscrição musicalAndrew Carlins•9 min de leitura

Transcrição musical monofônica e polifônica: qual é a diferença

As ferramentas de transcrição se separam por um critério: acompanham uma nota de cada vez ou várias ao mesmo tempo. Essa diferença diz mais sobre o que uma ferramenta consegue fazer do que qualquer índice de precisão. Veja o que transcrição monofônica e polifônica querem dizer de verdade.

Transcrição musical monofônica e polifônica: por que o áudio polifônico é mais difícil e o que conferir numa ferramenta

Faz parte do nosso guia de termos de notação musical.

Nem toda ferramenta de transcrição musical trata o áudio do mesmo jeito. A diferença que mais pesa é se ela consegue acompanhar uma nota de cada vez ou várias ao mesmo tempo. Essa divisão entre transcrição monofônica e polifônica diz mais sobre o que a ferramenta faz de verdade do que qualquer número de precisão no texto de propaganda.

O que é transcrição musical monofônica?

A transcrição monofônica transforma em notação escrita um áudio que tem só uma nota de cada vez. “Monofônico” quer dizer uma voz só: música em que você ouve exatamente uma altura a cada momento.

Por causa dessa limitação, a transcrição monofônica é o mais simples dos dois problemas. Quando uma única frequência domina o sinal, o algoritmo acompanha as mudanças de altura com bastante segurança e quase nenhuma interferência para contornar.

Exemplos de áudio monofônico

O caso clássico é a flauta solo. A maioria dos instrumentos de sopro foi feita para soar uma nota por vez, e a voz sem acompanhamento (um solo a cappella, uma melodia folclórica tradicional) entra na mesma categoria.

Linhas numa corda só também contam, mesmo em instrumentos que tocam acordes. Se você faz uma melodia na corda mi aguda do violão ou da guitarra sem encostar nas outras, o áudio é monofônico, e as ferramentas de transcrição dão conta dele com facilidade. O mesmo vale para uma linha de baixo isolada, venha ela de um baixo elétrico, de um baixo acústico ou de um sintetizador.

Por que o áudio monofônico é mais fácil de transcrever

O áudio monofônico entrega ao algoritmo um sinal mais limpo. Sem frequências concorrendo nem harmônicos sobrepostos, o software acompanha a frequência fundamental ao longo do tempo com muito menos pontos de dúvida do que numa fonte polifônica.

O processamento de sinal se resume a três passos: achar a frequência dominante, seguir o movimento dela no tempo e converter esses valores em nomes de notas e ritmos. Por isso os primeiros programas de transcrição se concentravam em entrada monofônica. Uma análise de frequência básica bastava para áudio de uma voz só, coisa que nunca aconteceu com acordes e partes sobrepostas.

O que é transcrição musical polifônica?

Música polifônica é o áudio em que mais de uma nota soa ao mesmo tempo. Pense num pianista tocando um acorde enquanto a mão esquerda segura uma nota de baixo, ou em alguém batendo um acorde no violão enquanto uma melodia soa nas cordas agudas. Qualquer momento com mais de uma altura ativa é polifônico.

A transcrição polifônica transforma esse áudio em notação registrando todas as vozes ativas, e não só a que soa mais forte. A monofônica segue um fio só. A polifônica precisa desembaraçar vários fios sobrepostos de uma vez e colocar cada um no lugar certo: duas vozes que se entrelaçam dentro da parte de um mesmo instrumento, ou linhas independentes de melodia e baixo andando pelas duas mãos do piano.

Exemplos de áudio polifônico

A música para piano é o desafio polifônico mais comum. Até uma tríade simples pede que a ferramenta identifique várias alturas no mesmo instante e as coloque certo na pauta.

No violão solo a polifonia chega rápido. Junte uma corda solta com uma nota presa, ou bata um acorde enquanto dedilha uma melodia, e você já tem várias vozes independentes que precisam ser acompanhadas separadamente. Na prática, a polifonia é a maior parte do que as pessoas tocam.

Por que a transcrição polifônica é mais difícil

Os harmônicos sobrepostos criam um problema de separação de sinal que os modelos mais antigos resolviam mal. Quando várias notas soam juntas, as fundamentais e os harmônicos delas se misturam numa única forma de onda, e os primeiros programas tinham poucos recursos para descobrir qual frequência pertencia a qual nota.

Num acorde de piano, cada nota gera uma série de harmônicos, e os harmônicos superiores de uma nota grave podem cair bem em cima da fundamental de uma nota mais aguda que soa no mesmo momento. Os algoritmos antigos tinham dificuldade para desfazer esse emaranhado com confiabilidade. Os modelos de IA atuais, treinados especificamente com material polifônico, mudaram o que é possível. Ferramentas como a transcrição de piano do Songscription foram pensadas em torno desse problema: os modelos aprendem a separar as vozes e a identificar os voicings dos acordes em vez de ficar só com a frequência dominante. O resultado não é perfeito em toda gravação, mas a distância entre o que os modelos atuais produzem e o que as abordagens antigas conseguiam é grande.

Principais diferenças entre transcrição monofônica e polifônica

Na prática, a diferença está na complexidade do sinal e no que o algoritmo precisa fazer com ele.

  • Na transcrição monofônica, o algoritmo acompanha uma única frequência dominante ao longo do tempo. Ele tem um alvo claro, a detecção de altura nesse caso já é um problema bem conhecido, e os erros que aparecem costumam ser de ritmo, não de nota errada.
  • Na transcrição polifônica, ele precisa seguir várias frequências sobrepostas ao mesmo tempo e ainda distinguir as alturas fundamentais dos harmônicos delas.
  • As fontes são diferentes. O áudio monofônico vem de instrumentos de sopro solo, de voz sem acompanhamento ou de linhas isoladas numa corda só. O polifônico cobre quase tudo o que os músicos tocam de fato: acordes de piano, violão batido e qualquer coisa com mais de uma voz ativa ao mesmo tempo.
  • O resultado é diferente. A transcrição monofônica gera uma única linha melódica. A polifônica precisa lidar com várias vozes, voicings de acordes, condução de vozes e complexidade rítmica em partes independentes.

Por que a transcrição polifônica importa para a maioria dos músicos

Música de verdade raramente é monofônica. Até no violão solo as cordas soltas continuam soando enquanto você pressiona novas notas, e o piano vira polifônico assim que você aperta uma segunda tecla, o que acontece em quase tudo que se toca nele. Uma ferramenta monofônica pega só uma parte disso.

Quanto mais densa a música, mais ela põe à prova a parte polifônica da ferramenta. Quem está começando pode estudar melodias simples, de uma nota por vez, mas quem avança trabalha com sequências de acordes, contraponto e arranjos em camadas, e uma ferramenta monofônica nunca foi feita para isso. Se você quer transcrever a música que provavelmente mais importa para você, o suporte polifônico é obrigatório.

Como a IA lida com áudio polifônico e monofônico

Numa melodia de uma nota por vez, o algoritmo pode se concentrar em acompanhar uma frequência dominante ao longo do tempo, com uma detecção de altura bem direta. Quando várias notas tocam juntas, o modelo precisa identificar e separar padrões de frequência sobrepostos, e redes neurais treinadas com música polifônica ajudam muito nessa tarefa.

Foi a passagem para o aprendizado profundo que fez a transcrição polifônica avançar. As abordagens antigas de processamento de sinal esbarravam num limite com alturas sobrepostas; as redes modernas aprendem a reconhecer padrões de acordes e combinações de instrumentos de um jeito que aqueles métodos não conseguiam. A dificuldade de fundo continua sendo a sobreposição de harmônicos. Cada nota carrega uma série de harmônicos que dá corpo e timbre ao som, e quando vários instrumentos tocam juntos essas séries se sobrepõem e interferem umas nas outras. Aí fica difícil dizer qual frequência vem de qual fonte.

Como é a precisão na prática

Uma transcrição polifônica confiável gera uma partitura limpa, com os voicings certos e poucas notas inventadas. Ela registra baixo, melodia e harmonia como vozes distintas e mantém o timing no lugar. Os erros mais comuns são previsíveis: nota de baixo que some em trechos densos, nota duplicada criada por um harmônico forte e ornamento lido como nota sustentada.

O desempenho cai com orquestração complexa e áudio de má qualidade. Numa gravação limpa de piano solo, um modelo bem treinado se sai bem; numa mixagem ao vivo densa, com um instrumento vazando no outro, o mesmo modelo exige mais correção. Ferramentas que juntam a transcrição a um editor de piano roll ou a uma visualização da partitura, como a conversão de áudio em partitura do Songscription, deixam essa revisão simples, sem pular de um aplicativo para outro.

O que procurar numa ferramenta de transcrição polifônica

Nem toda ferramenta que diz ter suporte polifônico entrega a mesma coisa. Vale conferir alguns pontos antes de se decidir.

Teste primeiro com seu próprio áudio

Não acredite no suporte polifônico só porque a página de propaganda diz. Muitas ferramentas anunciam precisão com IA e acompanham só uma nota de cada vez. Envie um acorde simples de piano ou um trecho curto de violão batido e veja o que volta. Uma ferramenta que lida bem com polifonia mostra várias notas no mesmo instante, e não só a frequência mais forte de cada momento.

Confira quais instrumentos o modelo cobre de verdade

A qualidade polifônica varia muito de instrumento para instrumento. Uma ferramenta com um modelo forte de piano pode dar resultados bem mais fracos no violão, na guitarra ou nos metais, porque os perfis harmônicos e as técnicas de execução mudam tanto que cada instrumento precisa do próprio treinamento. Prefira ferramentas que dizem com clareza quais instrumentos fazem bem às que prometem cobrir tudo. Se a maior parte do seu trabalho gira em torno de um instrumento, um modelo focado nele costuma render mais que um generalista.

Formatos de saída

Quando a transcrição fica pronta, você vai querer escolher o que fazer com ela: partitura para tocar, MIDI para uma sessão na DAW, MusicXML para um editor de partitura. Cada formato serve para uma coisa, e uma ferramenta que exporta um só cria atrito mais adiante. Para ver com mais calma como trabalhar com saída em MIDI, leia nosso guia de conversão de áudio para MIDI.

Para fechar

A maior parte da música é polifônica, e a maioria dos músicos precisa de uma ferramenta que dê conta disso. A transcrição monofônica tem seu lugar (uma linha de melodia solo, uma parte de baixo isolada), mas cobre uma fatia pequena do que as pessoas querem de fato colocar no papel.

Um modelo com bom suporte polifônico resolve áudio de uma nota por vez sem esforço, enquanto uma ferramenta só monofônica nunca vai pegar o acorde da sua mão direita. Na dúvida, teste a ferramenta com o trecho mais difícil que você pretende transcrever, como um acorde, e não com uma escala.

Perguntas frequentes

Qual é a diferença entre transcrição monofônica e polifônica?

A transcrição monofônica transforma em notação um áudio que tem só uma nota de cada vez, acompanhando uma única frequência dominante ao longo do tempo. A transcrição polifônica trabalha com áudio em que mais de uma nota soa ao mesmo tempo, então precisa registrar todas as vozes ativas, e não só a que soa mais forte. Instrumentos de sopro solo e voz sem acompanhamento são fontes monofônicas. A polifonia cobre quase tudo o que as pessoas tocam de fato, como acordes de piano e violão batido.

Por que a transcrição polifônica é mais difícil que a monofônica?

Os harmônicos sobrepostos criam um problema de separação de sinal. Quando várias notas soam juntas, as fundamentais e os harmônicos delas se misturam numa única forma de onda, e os harmônicos superiores de uma nota grave podem cair em cima da fundamental de uma nota mais aguda que soa no mesmo momento. Os modelos de IA atuais, treinados especificamente com material polifônico, lidam com isso muito melhor do que as abordagens antigas de processamento de sinal, mas o resultado ainda não é perfeito em toda gravação.

Como saber se uma ferramenta de transcrição lida mesmo com polifonia?

Teste com seu próprio áudio em vez de acreditar na página de propaganda. Envie um acorde simples de piano ou um trecho curto de violão batido e veja o que volta. Uma ferramenta que lida bem com polifonia mostra várias notas no mesmo instante, e não só a frequência mais forte de cada momento. Também vale conferir quais instrumentos o modelo cobre de verdade, porque a qualidade polifônica varia muito de instrumento para instrumento.

Sobre quem escreveu

Andrew Carlins

Escrito por

Andrew Carlins

Cofundador e CEO, Songscription

Andrew fundou o Songscription em Stanford com alguns outros músicos que estavam cansados de não achar as notas das músicas que queriam tocar. Cresceu tocando piano e sax barítono e fazendo teatro musical. Faz anos que não sobe num palco, mas gosta de pensar que continua afiado. Aqui ele escreve sobre como tirar uma música da gravação e passar para o papel.

Mais sobre a equipe

Veja outros posts sobre os mesmos assuntos.