KI-Musiktranskription macht aus einer Aufnahme Noten, und zwar in drei Schritten. Zuerst wird der Klang in ein Bild seiner Frequenzen umgewandelt. Ein Modell, das mit Tausenden Aufnahmen trainiert wurde, liest dieses Bild und sagt die Töne voraus. Die werden dann an einem Beat ausgerichtet und als Noten und MIDI ausgegeben. Dass das heute so gut klappt, liegt am schwierigen mittleren Schritt. Früher steckten darin von Hand geschriebene Regeln, heute ist es ein neuronales Netz, das an Beispielen gelernt hat, wie Töne aussehen.
Kurz gesagt
Wer nach Gehör transkribiert, hört einen Ton heraus, sucht ihn auf dem Instrument, findet heraus, wie lange er dauert, schreibt ihn auf und macht das ein paar tausend Mal. Die KI erledigt dieselbe Arbeit, nur viel schneller und alles auf einmal. Sie wandelt den Klang in Daten um, die sie auswerten kann, erkennt die Töne, die in diesen Daten stecken, und übersetzt sie in die Zeichen, die wir lesen. Die eigentliche Intelligenz steckt im Erkennen, und dort ist in den letzten Jahren auch am meisten passiert.
Im ersten Schritt wird aus Klang ein Bild
Eine digitale Aufnahme ist nichts weiter als eine lange Liste von Zahlen, die beschreiben, wie sich eine Lautsprechermembran bewegen soll. Pro Sekunde sind das Zehntausende Werte. Eine Melodie kann man in dieser Liste nicht sehen. Deshalb rechnet die Software die Aufnahme zuerst so um, dass sie eine nützlichere Frage beantwortet: wie viel Energie in jedem Moment auf jeder Tonhöhe liegt. Heraus kommt ein Spektrogramm. Das ist eine Art Wärmebild: Die Zeit läuft von links nach rechts, die Frequenz von unten nach oben, und helle Stellen zeigen die Tonhöhen, die gerade klingen.
Das Spektrogramm ähnelt dem, was dir eine Piano Roll zeigt, und ist viel näher an Musik als die rohe Wellenform. Ein gehaltener Ton wird zu einem waagerechten Streifen, ein Akkord zu mehreren übereinanderliegenden Streifen. Ein Schlag aufs Schlagzeug wird zu einem kurzen senkrechten Fleck, der sich über viele Frequenzen zieht. Erst weil der Klang jetzt als Bild vorliegt, wird der nächste Schritt machbar, denn das Problem sieht nun aus wie etwas, das ein auf Bilder trainiertes Modell lesen kann.
Im zweiten Schritt findet das Modell die Töne
Töne aus einem Spektrogramm abzulesen ist schwerer, als es aussieht. Schon ein einzelner Klavierton ist keine saubere Linie, sondern ein Grundton mit einer ganzen Leiter von Obertönen darüber. Spielen mehrere Töne zusammen, überlagern und verheddern sich ihre Obertöne. Das tiefe E einer Gitarre hat Obertöne mit dem E eine Oktave höher gemeinsam. Welche hellen Stellen echte Töne sind und welche nur Obertöne anderer Töne, ist das zentrale Rätsel der Transkription.
Moderne Systeme lösen es mit neuronalen Netzen. Trainiert werden sie mit großen Datensätzen aus Aufnahmen, zu denen genau bekannt ist, welche Noten gespielt wurden. Für Klavier gibt es Instrumente, die gleichzeitig den Klang und jeden Tastenanschlag genau aufzeichnen. So sind Datensätze mit Tausenden Einspielungen entstanden, bei denen Klang und gespielte Noten exakt zusammenpassen. Ein Netz lernt aus all dem, wie sich ein angeschlagener Ton von seinen Obertönen unterscheidet, wie ein Toneinsatz aussieht und wie ein Ton ausklingt. Meist sagt es pro Tonhöhe und pro kurzem Zeitabschnitt ein paar Dinge voraus: ob ein Ton beginnt, ob ein Ton klingt und wie laut er ist. Setzt man diese Vorhersagen zusammen, hat man eine Liste von Noten-Events, jedes mit Tonhöhe, Anfang, Ende und Anschlagstärke.
Neu ist dabei vor allem, dass niemand Regeln wie „ignoriere den dritten Teilton“ von Hand programmiert hat. Das Modell hat sich all das aus Beispielen erschlossen. Deshalb lässt sich derselbe Ansatz auf andere Instrumente übertragen, sobald es mehr Trainingsdaten gibt, und die Ergebnisse werden besser, ohne dass jemand die Logik neu schreibt. Warum manche Aufnahmen sauberere Ergebnisse liefern als andere, erklären wir ausführlicher in Warum die Genauigkeit von KI-Transkription schwankt.
Im dritten Schritt werden aus Tönen lesbare Noten
Eine Liste von Noten-Events mit exakten Zeitstempeln reicht schon, um MIDI zu erzeugen und eine Piano Roll zu füllen. Für Noten braucht es aber mehr als Anfangs- und Endzeiten, nämlich ein Tempo, eine Taktart und Töne, die auf übliche Notenwerte gerundet sind. Bei 120 Schlägen pro Minute spielt kein Mensch eine Viertelnote, die exakt 500 Millisekunden dauert. Die Software muss also den zugrunde liegenden Beat finden, entscheiden, wo die Taktstriche hinkommen, und jeden Ton auf den nächsten sinnvollen Wert runden, etwa eine Viertel oder eine Achtel. Dieser Schritt heißt Quantisierung. Von ihm hängt ab, ob sich eine Transkription sauber lesen lässt oder voller unspielbarer Zweiunddreißigstelnoten steckt.
Außerdem muss die Software so notieren, wie man es beim Spielen erwartet. Sie entscheidet, welche Töne in die rechte und welche in die linke Hand gehören, ob ein Ton mit Kreuz oder mit Be geschrieben wird und wo Pausen stehen. Zum Schluss gibt es das Ergebnis in verschiedenen Formaten: als PDF zum Ausdrucken, als MIDI-Datei für deine DAW und als MusicXML-Datei, die du in einem Notensatzprogramm öffnen kannst. Kommt ein Rhythmus oder die Aufteilung auf die Hände falsch heraus, setzt du genau hier an. Transkriptionsfehler zu korrigieren ist meist eine kurze Bearbeitung und kein Neuanfang.
Wo die KI stark ist und wo sie sich schwertut
Klavier solo ist das Heimspiel der KI-Transkription. Dort gibt es die meisten Trainingsdaten, der Klang verhält sich gutmütig, und gute Modelle erkennen bei einer sauberen Aufnahme den Großteil der Töne. Auch ein einzelnes Instrument, das Akkorde spielt, bekommen die Modelle inzwischen gut hin. Das nennt man polyphone Transkription, und wie sie beim Klavier funktioniert, zeigen wir in Polyphone Klaviertranskription erklärt.
Wo es hakt, lässt sich ziemlich gut vorhersagen. Eine ganze Band in einer einzigen gemischten Aufnahme ist schwierig, weil das Modell mehrere Instrumente auseinanderhalten muss, die sich gleichzeitig im selben Frequenzbereich überlagern. Starke Verzerrung, dichter Hall und schlechte Audioqualität verwischen das Spektrogramm und kosten Genauigkeit. Sehr schnelle Passagen und sehr leise Töne gehen leicht unter. Unbrauchbar wird das Ergebnis dadurch nicht. Realistisch ist aber ein guter erster Entwurf, den du durchsiehst, und keine fertigen Noten, auf die niemand mehr schauen muss. Wie sich das in Zahlen ausdrückt, steht in Wie genau ist KI-Musiktranskription?.
So holst du das beste Ergebnis heraus
Schritt eins liefert die Grundlage für alles Weitere, deshalb ist die Aufnahme der größte Hebel, den du selbst in der Hand hast. Je sauberer und klarer die Quelle, desto besser das Bild, und je besser das Bild, desto mehr erkennt das Modell richtig. Am besten nimmst du die klarste Version des Songs, die du finden kannst. Sag dem Tool, welches Instrument es hört, damit es das passende Modell verwendet, und sieh dir den Entwurf danach kurz durch. Bei Songscription lädst du eine Datei hoch oder fügst einen Link ein, die KI erledigt die drei oben beschriebenen Schritte, und du bekommst eine Piano Roll und Noten. Beides kannst du im Browser abspielen, langsamer machen, transponieren und bearbeiten, bevor du es exportierst. Das schwere Zuhören übernimmt die Technik, das letzte Wort hast du.
Häufige Fragen
Wie funktioniert KI-Musiktranskription?
Grob gesagt in drei Schritten. Zuerst macht die Software aus der Aufnahme ein Spektrogramm, also ein Bild davon, welche Frequenzen in jedem Moment klingen. Dann liest ein neuronales Netz dieses Bild. Es wurde mit Tausenden Aufnahmen trainiert, zu denen die gespielten Noten bekannt sind, und sagt voraus, wo Töne beginnen, welche Tonhöhe sie haben und wann sie enden. Zum Schluss werden diese Töne an einem Raster aus Zählzeiten ausgerichtet und als MIDI und in normaler Notenschrift ausgegeben. Das Modell folgt dabei keinen von Hand geschriebenen Regeln, es erkennt Muster, die es aus Daten gelernt hat. Deshalb ist es so viel besser geworden, seit es große Datensätze mit genau zugeordneten Noten und moderne neuronale Netze gibt.
Ist KI-Musiktranskription genau?
Bei einer sauberen Aufnahme eines einzelnen Instruments ist sie inzwischen sehr gut, vor allem bei Klavier solo. Dort erkennen die Modelle regelmäßig den weitaus größten Teil der Töne. Je schwieriger das Audio, desto ungenauer wird das Ergebnis. Ein dichter Mix mit ganzer Band, eine verrauschte Handyaufnahme, viel Hall oder schnelle, sich überlappende Töne machen die Aufgabe schwerer. Realistisch ist ein guter erster Entwurf, den du durchsiehst und korrigierst. Fehlerfreie Noten, die niemand mehr prüfen muss, solltest du nicht erwarten.
Kann KI-Transkription verschiedene Instrumente auseinanderhalten?
Töne aus einem einzelnen Instrument herauszuhören, auch Akkorde auf einem Klavier oder einer Gitarre, gelingt den Modellen gut. Schwieriger wird es, wenn mehrere Instrumente gleichzeitig in einer einzigen gemischten Aufnahme spielen und auseinandergehalten werden sollen. Meistens teilt man die Aufnahme dann zuerst in Stems auf, also in einzelne Spuren, und transkribiert jedes Instrument für sich. Du kannst aber auch einen kompletten Mix direkt in ein zusammengefasstes Arrangement transkribieren, etwa einen Klavierauszug, wenn dir der Song als Ganzes wichtiger ist als die einzelnen Parts.
Wenn du die drei Schritte mit einem eigenen Song ausprobieren möchtest, lade eine Aufnahme hoch und sieh zu, wie daraus Noten werden, die du lesen und bearbeiten kannst.
