Dieser Artikel gehört zu unserem Überblick über Begriffe der Notenschrift.
Nicht jedes Transkriptionstool geht gleich mit Audio um. Der wichtigste Unterschied liegt darin, ob ein Tool immer nur einem Ton folgen kann oder vielen gleichzeitig. Man spricht von monophoner und polyphoner Transkription, und diese Unterscheidung verrät dir mehr darüber, was ein Tool wirklich kann, als jede Genauigkeitsangabe im Werbetext.
Was ist monophone Musiktranskription?
Monophone Musiktranskription überträgt Audio, in dem immer nur ein Ton gleichzeitig klingt, in Noten. „Monophon“ heißt einstimmig: Du hörst in jedem Moment genau eine Tonhöhe.
Weil immer nur eine Tonhöhe klingt, ist die monophone Transkription das einfachere der beiden Probleme. Bestimmt eine einzige Frequenz das Signal, kann ein Algorithmus Tonhöhenwechsel sehr zuverlässig verfolgen, und es gibt kaum Störungen, die er umgehen muss.
Beispiele für monophones Audio
Das klassische Beispiel ist eine Flöte solo. Die meisten Blasinstrumente sind so gebaut, dass sie immer nur einen Ton spielen, und unbegleiteter Gesang gehört in dieselbe Kategorie, etwa ein A-cappella-Solo oder eine traditionelle Folkmelodie.
Auch Linien auf einer einzelnen Saite zählen dazu, selbst auf Instrumenten, die Akkorde spielen können. Spielst du auf der Gitarre eine Melodie nur auf der hohen E-Saite und berührst die anderen Saiten nicht, entsteht monophones Audio, mit dem Transkriptionstools leicht zurechtkommen. Genauso ist es mit einer einzelnen Basslinie, egal ob sie von einem E-Bass, einem Kontrabass oder einem Synthesizer kommt.
Warum monophones Audio leichter zu transkribieren ist
Monophones Audio liefert einem Algorithmus ein saubereres Signal. Es gibt keine konkurrierenden Frequenzen und keine überlappenden Obertöne. Die Software kann die Grundfrequenz über die Zeit verfolgen und stößt dabei auf weit weniger Mehrdeutigkeiten als bei einer polyphonen Quelle.
Die Signalverarbeitung bleibt überschaubar. Die Software bestimmt die dominante Frequenz, folgt ihrem Verlauf und wandelt die Werte in Notennamen und Rhythmen um. Deshalb haben sich die ersten Transkriptionsprogramme auf monophones Material konzentriert. Für einstimmiges Audio reichte eine einfache Frequenzanalyse, für Akkorde und mehrere übereinanderliegende Stimmen dagegen nicht.
Was ist polyphone Musiktranskription?
Polyphone Musik ist Audio, in dem mehr als ein Ton gleichzeitig klingt. Stell dir vor, jemand spielt am Klavier einen Akkord, während die linke Hand einen Basston hält, oder schlägt auf der Gitarre Akkorde an, während auf den hohen Saiten eine Melodie klingt. Jeder Moment mit mehr als einer klingenden Tonhöhe ist polyphon.
Polyphone Transkription macht aus diesem Audio Noten und erfasst dabei jede aktive Stimme, nicht nur die lauteste. Die monophone Transkription folgt einem einzigen Faden. Die polyphone muss mehrere Fäden, die sich überlagern, gleichzeitig entwirren und richtig darstellen, zum Beispiel zwei Stimmen, die sich innerhalb eines Instruments umeinander winden, oder eine Melodie und eine Basslinie, die unabhängig voneinander über beide Hände am Klavier laufen.
Beispiele für polyphones Audio
Klaviermusik ist die häufigste polyphone Herausforderung. Schon bei einem einfachen Dreiklang muss das Tool mehrere Tonhöhen im selben Augenblick erkennen und richtig in die Notenzeile setzen.
Auch Gitarre solo wird schnell polyphon. Lass eine offene Saite zu einem gegriffenen Ton klingen oder schlag einen Akkord an und zupf dazu eine Melodie, und schon hast du mehrere unabhängige Stimmen, die getrennt verfolgt werden müssen. Das meiste, was Leute spielen, ist also polyphon.
Warum polyphone Transkription schwieriger ist
Überlagerte Obertöne machen es schwer, die Signale zu trennen, und ältere Modelle kamen damit schlecht zurecht. Wenn mehrere Töne zusammen klingen, verschmelzen ihre Grundtöne und Obertöne zu einer einzigen Wellenform, und frühe Software hatte nur begrenzte Mittel, um herauszufinden, welche Frequenz zu welchem Ton gehört.
Ein Klavierakkord besteht eben nicht aus ein paar sauberen Tönen. Jeder Ton erzeugt eine Reihe von Obertönen, und die oberen Obertöne eines tiefen Tons können genau auf dem Grundton eines höheren Tons liegen, der gleichzeitig klingt. Solche Verflechtungen konnten frühere Algorithmen kaum zuverlässig auflösen. Moderne KI-Modelle, die gezielt mit polyphonem Material trainiert wurden, haben das geändert. Die Klaviertranskription von Songscription ist zum Beispiel genau für dieses Problem gebaut. Ihre Modelle lernen, Stimmen zu trennen und Akkord-Voicings zu erkennen, statt einfach die dominante Frequenz zu nehmen. Fehlerfrei sind die Ergebnisse nicht bei jeder Aufnahme, aber zwischen dem, was aktuelle Modelle liefern, und dem, was ältere Ansätze geschafft haben, liegt ein großer Abstand.
Die wichtigsten Unterschiede zwischen monophoner und polyphoner Transkription
In der Praxis läuft der Unterschied darauf hinaus, wie komplex das Signal ist und was der Algorithmus damit anfangen muss.
- Monophone Transkription verfolgt eine einzige dominante Frequenz über die Zeit. Der Algorithmus hat ein klares Ziel, die Tonhöhenerkennung ist dafür ziemlich ausgereift, und wenn Fehler auftauchen, betreffen sie meist den Rhythmus und selten die Töne selbst.
- Polyphone Transkription muss mehreren überlagerten Frequenzen gleichzeitig folgen und dabei die Grundtöne von ihren Obertönen unterscheiden.
- Die Quellen sind verschieden. Monophones Audio kommt von Blasinstrumenten solo, unbegleitetem Gesang oder einzelnen Linien auf einer Saite. Polyphones Audio umfasst das meiste, was Musiker:innen tatsächlich spielen: Akkorde am Klavier, geschlagene Gitarre und alles, worin mehr als eine Stimme gleichzeitig aktiv ist.
- Das Ergebnis ist verschieden. Monophone Transkription liefert eine einzelne Melodielinie. Polyphone Transkription muss mit mehreren Stimmen, Akkord-Voicings, Stimmführung und komplexen Rhythmen über unabhängige Stimmen hinweg klarkommen.
Warum polyphone Transkription für die meisten Musiker:innen wichtig ist
Echte Musik ist selten monophon. Selbst auf der Gitarre solo klingen offene Saiten weiter, während du neue Töne greifst. Das Klavier ist polyphon, sobald du eine zweite Taste drückst, und genau das passiert beim Klavierspielen fast die ganze Zeit. Ein monophones Tool erfasst davon nur einen Teil.
Je dichter die Musik, desto stärker wird die polyphone Fähigkeit eines Tools gefordert. Wer gerade anfängt, übt vielleicht einfache einstimmige Melodien. Mit wachsender Erfahrung kommen aber Akkordfolgen, Kontrapunkt und mehrschichtige Arrangements dazu, und dafür wurde ein monophones Tool nie gebaut. Wenn du die Musik transkribieren willst, die dich wahrscheinlich am meisten interessiert, kommst du um polyphone Unterstützung nicht herum.
Wie KI mit polyphonem und monophonem Audio umgeht
Bei einstimmigen Melodien kann sich ein Algorithmus darauf konzentrieren, eine dominante Frequenz über die Zeit zu verfolgen, und kommt mit recht einfacher Tonhöhenerkennung aus. Klingen mehrere Töne gleichzeitig, muss das Modell sich überlagernde Frequenzmuster erkennen und voneinander trennen. Neuronale Netze, die mit polyphoner Musik trainiert wurden, helfen dabei enorm.
Erst der Wechsel zum Deep Learning hat die polyphone Transkription vorangebracht. Die älteren Verfahren der Signalverarbeitung stießen bei überlagerten Tonhöhen an ihre Grenzen. Moderne Netze lernen, Akkordmuster und Instrumentenkombinationen auf eine Weise zu erkennen, die mit diesen Methoden nicht möglich war. Die eigentliche Schwierigkeit sind aber nach wie vor die überlagerten Obertöne. Jeder Ton trägt eine Reihe von Obertönen, die ihm Fülle und Klangfarbe geben. Spielen mehrere Instrumente zusammen, überlagern und stören sich diese Obertonreihen, und dann ist schwer zu sagen, welche Frequenz zu welcher Quelle gehört.
Wie Genauigkeit in der Praxis aussieht
Eine zuverlässige polyphone Transkription liefert saubere Noten mit richtigen Akkord-Voicings und wenigen Phantomnoten. Bass, Melodie und Harmonie stehen als eigene Stimmen da, und das Timing stimmt. Die typischen Fehler lassen sich vorhersehen: In dichten Passagen fehlen Basstöne, starke Obertöne erzeugen doppelte Noten, und Verzierungen werden als ausgehaltene Töne gelesen.
Bei komplexer Orchestrierung und schlechter Audioqualität lässt die Leistung nach. Mit einer sauberen Aufnahme von Klavier solo kommt ein gut trainiertes Modell gut zurecht. Bei einem dichten Live-Mix, in dem die Instrumente ineinander übersprechen, musst du beim selben Modell mehr nacharbeiten. Mit einem Tool, das zur Transkription gleich einen Piano-Roll-Editor oder eine Notenansicht mitbringt, wie Songscription bei der Umwandlung von Audio in Noten, geht diese Durchsicht leichter, und du musst dafür nicht zwischen Programmen hin und her wechseln.
Worauf du bei einem polyphonen Transkriptionstool achten solltest
Nicht jedes Tool, das polyphone Unterstützung verspricht, hält dieses Versprechen gleich gut. Ein paar Dinge solltest du prüfen, bevor du dich festlegst.
Teste es zuerst mit deinem eigenen Audio
Verlass dich bei der Polyphonie nicht auf die Werbeseite. Viele Tools werben mit KI-gestützter Genauigkeit und verfolgen trotzdem nur einen Ton auf einmal. Lade einen einfachen Klavierakkord oder eine kurze Passage mit geschlagenen Akkorden hoch und schau dir an, was herauskommt. Ein Tool, das Polyphonie wirklich beherrscht, zeigt mehrere Noten zum selben Zeitpunkt und nicht nur die stärkste Frequenz in jedem Moment.
Prüf, welche Instrumente das Modell wirklich abdeckt
Die polyphone Qualität hängt stark vom Instrument ab. Ein Tool mit einem starken Klaviermodell kann bei Gitarre oder Blechbläsern deutlich schwächere Ergebnisse liefern. Obertonprofile und Spieltechniken unterscheiden sich so sehr, dass jedes Instrument sein eigenes Training braucht. Nimm lieber ein Tool, das genau sagt, welche Instrumente es gut kann, als eines, das angeblich alles abdeckt. Arbeitest du überwiegend mit einem Instrument, schlägt ein spezialisiertes Modell, das darauf trainiert wurde, meistens ein Allround-Modell.
Flexible Ausgabeformate
Ist die Transkription fertig, willst du damit weiterarbeiten können, und zwar je nach Zweck anders: Noten zum Spielen, MIDI für eine Session in der DAW, MusicXML für ein Notenprogramm. Ein Tool, das nur eines dieser Formate exportiert, macht dir die weitere Arbeit schwer. Mehr zum Arbeiten mit MIDI findest du in unserem Leitfaden zur Umwandlung von Audio in MIDI.
Fazit
Die meiste Musik ist polyphon, und die meisten Musiker:innen brauchen ein Tool, das damit umgehen kann. Monophone Transkription hat ihren Platz, etwa bei einer einzelnen Melodielinie oder einer isolierten Bassstimme. Sie deckt aber nur einen kleinen Teil dessen ab, was Leute tatsächlich aufschreiben wollen.
Ein Modell mit solider polyphoner Unterstützung kommt mit einstimmigem Audio ohne Weiteres zurecht, ein rein monophones Tool schafft dagegen nie den Akkord unter deiner rechten Hand. Wenn du unsicher bist, teste das Schwierigste, was du transkribieren willst, und nicht das Einfachste, also den Akkord und nicht die Tonleiter.
Häufige Fragen
Was ist der Unterschied zwischen monophoner und polyphoner Transkription?
Bei monophoner Transkription wird Audio, in dem immer nur ein Ton gleichzeitig klingt, in Noten übertragen. Die Software verfolgt dabei eine einzige dominante Frequenz über die Zeit. Polyphone Transkription verarbeitet Audio, in dem mehrere Töne gleichzeitig klingen, und muss deshalb jede aktive Stimme erfassen, nicht nur die lauteste. Monophone Quellen sind zum Beispiel Blasinstrumente solo oder unbegleiteter Gesang. Polyphon ist dagegen das meiste, was Leute tatsächlich spielen, etwa Akkorde am Klavier oder geschlagene Gitarre.
Warum ist polyphone Transkription schwieriger als monophone?
Weil sich die Obertöne überlagern und die Signale dadurch schwer zu trennen sind. Klingen mehrere Töne zusammen, verschmelzen ihre Grundtöne und Obertöne zu einer einzigen Wellenform, und die oberen Obertöne eines tiefen Tons können genau auf dem Grundton eines höheren Tons liegen, der gleichzeitig klingt. Moderne KI-Modelle, die gezielt mit polyphonem Material trainiert wurden, kommen damit viel besser zurecht als ältere Verfahren der Signalverarbeitung. Fehlerfrei sind die Ergebnisse aber nicht bei jeder Aufnahme.
Wie erkenne ich, ob ein Transkriptionstool wirklich mit Polyphonie umgehen kann?
Probier es mit deinem eigenen Audio aus, statt dich auf die Werbeseite zu verlassen. Lade einen einfachen Klavierakkord oder eine kurze Passage mit geschlagenen Akkorden hoch und schau dir an, was herauskommt. Ein Tool, das Polyphonie wirklich beherrscht, zeigt mehrere Noten zum selben Zeitpunkt und nicht nur die stärkste Frequenz in jedem Moment. Prüf außerdem, welche Instrumente das Modell tatsächlich abdeckt, denn die polyphone Qualität schwankt je nach Instrument stark.
