Teil unseres Leitfadens zum Transkribieren einer ganzen Band.
Das ist eine der ersten Fragen, die Leute zur KI-Transkription stellen: Kann sie aus einem kompletten Song, in dem Schlagzeug, Bass, Gitarre und Gesang gleichzeitig laufen, jede Stimme heraushören und aufschreiben? Ein einfaches Ja oder Nein gibt es darauf nicht. Hinter der einen Frage verstecken sich nämlich zwei, und die haben sehr unterschiedliche Antworten.
Dazu kommt ein Wort, das oft ungenau benutzt wird. Viele Töne gleichzeitig von einem einzigen Instrument zu erkennen, nennt man Polyphonie, und das kann KI gut, vor allem beim Klavier. Mehrere verschiedene Instrumente aus einer gemischten Aufnahme herauszulösen, ist Multi-Instrument-Transkription, und da wird es wirklich schwierig. Oft sagen Leute „mehrere Instrumente“, wenn sie eigentlich „mehrstimmig“ meinen. Kurz gesagt ist Polyphonie weitgehend gelöst. Die Modelle von Songscription sind außerdem in der Regel robust genug, um das gewünschte Instrument aus dem Mix herauszuhören. Du transkribierst also ein Instrument nach dem anderen und musst den Song vorher nicht in Stems, das heißt in einzelne Instrumentenspuren, zerlegen.
Zwei Fragen in einer
Wenn Leute von „mehreren Instrumenten gleichzeitig“ sprechen, meinen sie meistens eins von zwei Dingen, und die beiden haben wenig miteinander zu tun.
- Viele Töne gleichzeitig von einem Instrument, etwa ein voller Klavierakkord. Das ist polyphone Transkription, und darin ist KI sehr gut geworden.
- Viele verschiedene Instrumente gleichzeitig in einer gemischten Aufnahme, etwa eine ganze Band. Dafür muss die Aufnahme vor dem Transkribieren erst in einzelne Quellen entmischt werden, und das ist schwer.
Wer beides in einen Topf wirft, findet das Thema schnell verwirrend. Ein Tool kann das Erste hervorragend und tut sich mit dem Zweiten trotzdem schwer, weil es zwei verschiedene Fähigkeiten sind. Wie das Erste im Detail funktioniert, erklären wir in unserem Artikel über monophone und polyphone Transkription.
Viele Töne auf einmal
Mehrere zusammenklingende Töne zu erkennen, ist polyphone Transkription, und genau da ist moderne KI stark. Stell dir ein Klavier vor, das einen Akkord aus fünf Tönen spielt, während sich darunter eine Mittelstimme bewegt. Um so dichte Musik auseinanderzuhören, brauchte früher selbst ein geschultes Ohr ewig, und ein gutes Modell liest sie sauber heraus. Meinst du mit „mehrere“ also das volle, vielstimmige Spiel eines einzelnen Klaviers, lautet die Antwort ganz klar ja. Wie das funktioniert und warum es beim Klavier am besten klappt, steht in unserem ausführlichen Artikel zur polyphonen Klaviertranskription.
Warum viele Instrumente schwieriger sind
In einer Bandaufnahme laufen mehrere Instrumente in einem einzigen Klangstrom zusammen. Ihre Frequenzen überlappen sich und verdecken einander. Damit jedes Instrument in einer eigenen Notenzeile landet, muss ein System den Mix erst wieder in seine Bestandteile zerlegen, dann jeden davon transkribieren und schließlich entscheiden, wie alles auf der Seite angeordnet wird. Bei jedem dieser Schritte kommen Fehler dazu, und weil sich die Instrumente gegenseitig verdecken, gehen im Mix manche Details verloren. Deshalb macht kein Tool aus einem beliebigen Song per Knopfdruck fehlerfreie, sauber getrennte Noten für ein ganzes Orchester. Daran wird gerade aktiv geforscht, gelöst ist das Problem noch nicht, und jedes ehrliche Tool sagt dir das auch.
So gehst du in der Praxis vor
Heute gibt es zwei verlässliche Wege zu gut lesbaren Noten aus einer Aufnahme mit mehreren Instrumenten. Welchen du nimmst, hängt davon ab, was du eigentlich haben willst.
- Du willst getrennte Stimmen? Transkribier jedes Instrument einzeln mit dem Modell, das dazu passt. Die Modelle sind in der Regel robust genug, um das gewünschte Instrument aus dem kompletten Mix herauszuhören, du musst den Song also nicht vorher in Stems zerlegen. Bei einer besonders dichten Aufnahme kann eine optionale Stem-Trennung eine Stimme noch sauberer machen.
- Du willst Noten, die du direkt spielen kannst? Transkribier die Aufnahme in eine einzige zusammengefasste Stimme. Meistens ist das ein Klavierauszug, der Melodie, Harmonien und Bass auf einem Klaviersystem zusammenbringt. Das geht schneller und reicht zum Spielen oft völlig aus.
Wie du Stimme für Stimme vorgehst, zeigt unser Leitfaden zum Transkribieren von Mehrspur-Audio in Noten. Um den Weg über zusammengefasste Noten geht es beim Transkribieren einer kompletten Bandaufnahme. In beiden Fällen startest du mit deiner Aufnahme bei Audio in Noten.
Welche Instrumente Songscription erkennt
Songscription transkribiert mit einem eigenen Modell pro Instrument. Das Klaviermodell ist am weitesten ausgereift und kommt mit dichter Polyphonie am besten zurecht. Neuere Modelle decken Gitarre, Bass und Schlagzeug ab, dazu Melodieinstrumente wie Trompete, Saxophon und Geige. Gesang ist noch experimentell. Wenn du eine Stimme nach der anderen transkribierst, wird das Ergebnis genauer, als wenn ein einziges Modell die ganze Band auf einmal übernehmen soll. Bei einer besonders dichten Aufnahme kann eine optionale Stem-Trennung eine Stimme noch klarer herausarbeiten. Wie das bei einem einzelnen Instrument aussieht, zeigen unsere Anleitungen zum Transkribieren einer Basslinie und von Schlagzeug.
Häufige Fragen
Kann KI mehrere Instrumente gleichzeitig transkribieren?
Das hängt davon ab, was du mit „mehrere“ meinst. Viele Töne gleichzeitig von einem Instrument erkennt KI sehr gut, genau das macht die polyphone Transkription beim Klavier. Mehrere verschiedene Instrumente aus einer gemischten Aufnahme herauszulösen und jedes in eigene Noten zu schreiben, ist deutlich schwieriger, und daran arbeitet die Forschung gerade am meisten. In der Praxis transkribierst du heute am besten ein Instrument nach dem anderen. Die Modelle von Songscription sind in der Regel robust genug, um das gewünschte Instrument aus dem kompletten Mix herauszuhören. Den Song vorher in Stems zu zerlegen, also in einzelne Instrumentenspuren, brauchst du deshalb nicht. Du kannst auch alles in eine einzige zusammengefasste Stimme transkribieren, etwa einen Klavierauszug. Das geht schneller, wenn du einfach etwas zum Spielen haben willst.
Was ist der Unterschied zwischen polyphoner Transkription und dem Trennen von Instrumenten?
Bei der polyphonen Transkription hört die KI mehrere Töne, die aus einer Quelle gleichzeitig klingen, etwa einen Klavierakkord, und schreibt sie alle auf. Bei der Quellentrennung wird eine gemischte Aufnahme in ihre einzelnen Instrumente zerlegt, also Gesang, Bass und Gitarre, und zwar bevor überhaupt transkribiert wird. Das sind zwei verschiedene Probleme: Beim einen geht es darum, mehrere übereinanderliegende Töne herauszuhören, beim anderen darum, eine Aufnahme wieder zu entmischen. Wer mehrere Instrumente transkribieren will, braucht meistens beides. Deshalb ist das schwieriger als ein einzelnes, sauber aufgenommenes Instrument.
Wie transkribiere ich einen Song mit mehreren Instrumenten?
Es gibt zwei praktische Wege. Willst du getrennte Stimmen, transkribierst du jedes Instrument einzeln. Die Modelle von Songscription sind in der Regel robust genug, um die gewünschte Stimme aus dem kompletten Mix herauszuhören. Du musst den Song also nicht vorher in Stems zerlegen, auch wenn eine optionale Stem-Trennung bei einer besonders dichten Aufnahme helfen kann. Willst du Noten, die du direkt spielen kannst, transkribierst du die Aufnahme in ein zusammengefasstes Arrangement. Meistens ist das ein Klavierauszug, der Melodie, Harmonien und Bass auf einem Klaviersystem zusammenbringt. Entscheide nach deinem Ziel: getrennte Stimmen für alle Instrumente oder eine einzige Stimme zum Spielen.
Welche Instrumente kann Songscription transkribieren?
Das Klaviermodell ist am weitesten ausgereift und kommt mit dichtem, polyphonem Spiel am besten zurecht. Neuere Modelle decken Instrumente wie Gitarre, Bass und Schlagzeug ab, dazu Melodieinstrumente wie Trompete, Saxophon und Geige. Gesang ist noch experimentell. Diese Modelle sind in der Regel robust genug, um das gewünschte Instrument aus dem kompletten Mix herauszuhören. So kannst du eine Stimme nach der anderen transkribieren, ohne den Song vorher in Stems zu zerlegen. Bei einer besonders dichten Aufnahme kann eine optionale Stem-Trennung eine Stimme noch sauberer machen.
