Du hältst dein Handy an einen Lautsprecher, und nach ein paar Sekunden sagt dir Shazam, welcher Song läuft und von wem er ist. Als die App herauskam, wirkte das wie Science-Fiction. Heute ist es selbstverständlich. Schau aber mal, welche Frage sie eigentlich beantwortet. Sie sagt dir, was das für ein Song ist. Zum Zuhören reicht das völlig. Für Musiker:innen fängt es damit gerade erst an, denn für sie kommt die eigentliche Frage danach: Wie spiele ich das? Diese Frage ist schwieriger, und inzwischen gibt es endlich eine Antwort darauf.
Was Shazam macht und was nicht
Shazam arbeitet mit Fingerabdrücken. Es verdichtet ein paar Sekunden Audio zu einem kompakten Muster markanter Punkte und gleicht dieses Muster mit einer riesigen Datenbank von Fingerabdrücken bekannter Aufnahmen ab. Findet es einen Treffer, bekommst du die Metadaten, also Titel, Interpret:in und Album. Im musikalischen Sinn zugehört hat Shazam dabei nie. Es kennt weder die Melodie noch die Akkorde oder die Tonart, nicht einmal einen einzigen Ton. Nachschlagen kann es brillant, zuhören kann es nicht. Deshalb kann Shazam einen Song benennen, den es gespeichert hat. Zu einer Melodie, die du selbst gesummt hast, kann es dir nichts sagen, und wie die Töne gehen, verrät es dir auch nicht.
Wie spiele ich das?
Dir zu sagen, wie du einen Song spielst, ist eine ganz andere Aufgabe. Sie heißt Transkription und ist schwieriger. Es gibt keine Datenbank, in der die Antwort schon steht. Die Software muss sich die Aufnahme anhören und die Musik selbst herausholen: die Melodie von der Begleitung trennen, herausfinden, welche Töne gleichzeitig klingen, den Rhythmus bestimmen, die Tonart ableiten und das alles als Noten aufschreiben. Das ist Analyse und kein Abgleich. Es kommt dem, was geübte Musiker:innen mit Kopfhörern und Pausetaste machen, viel näher als einem Fingerabdruck.
Lange war das zu schwierig, um es gut hinzubekommen. Deshalb haben Generationen von Musiker:innen Songs mühsam nach Gehör gelernt oder für Noten bezahlt, falls es überhaupt welche gab. Heute gibt es Transkriptionsmodelle, die eigens dafür gebaut sind und automatisch einen guten ersten Entwurf liefern. Für genau diese Aufgabe ist Songscription gemacht. Du gibst ihm eine Aufnahme, direkt im Browser und ohne etwas zu installieren. Songscription isoliert den Part, den du auswählst, erkennt die Akkorde und gibt dir die Töne als Noten und als Piano Roll zurück. Die Antwort auf „Wie spiele ich das?“ musst du so nicht mehr selbst aus der Aufnahme heraushören oder dir von Expert:innen geben lassen.
Ein Shazam für Noten, mit einem Unterschied
Wir beschreiben Songscription gern kurz als Shazam für Noten. Das Bild passt, solange du einen Unterschied im Kopf behältst. Die Antwort von Shazam ist entweder richtig oder falsch, ein Fingerabdruck passt oder er passt nicht. Eine Transkription ist dagegen eine Deutung der Musik, und wie jede Deutung ist sie mal genauer und mal weniger genau, je nachdem, was da gedeutet wird. Die Modelle von Songscription wurden von Grund auf mit echten musikalischen Performances trainiert und nicht aus der Spracherkennung übernommen. Deshalb klappt die Transkription bei einer sauberen, sparsam instrumentierten Aufnahme sehr gut. Ein dichter, stark produzierter Mix ist schwieriger, und im Ergebnis wird es Stellen geben, die du korrigieren musst. Du bekommst also nicht auf einen Fingertipp fehlerfreie Noten, sondern in ein, zwei Minuten einen guten, bearbeitbaren Entwurf davon, wie der Song geht. Den korrigierst du dann nach Gehör.
Ein Entwurf, den du lesen, langsamer abspielen und spielen kannst, bringt dich ein ganzes Stück weiter als eine Aufnahme, die du dir nur anhören kannst. Statt vor einer verschlossenen Audiodatei zu sitzen, sitzt du am Instrument und arbeitest dich durch die echten Töne. Genau das wolltest du ja von Anfang an. Wie genau eine Transkription ist und wo sie an Grenzen stößt, haben wir in einem eigenen Artikel beschrieben: was du von der Genauigkeit einer Transkription erwarten kannst. Und die größere Frage, was so ein Tool den Menschen am Instrument noch übrig lässt, behandeln wir in unserem Artikel über KI und Musiker:innen.
Vom Erkennen zum Verstehen
Da zeichnet sich eine schöne Entwicklung ab. Die erste Welle der Musiktechnik hat uns geholfen, Musik zu finden und zu erkennen, mit Suche, Empfehlungen und Shazam. Neu ist jetzt Technik, die uns hilft, Musik zu verstehen und selbst zu machen. Sie macht aus einer Aufnahme, die du dir bloß anhörst, etwas, das du lesen, lernen, verändern und spielen kannst. Falls du schon einmal dein Handy an einen Lautsprecher gehalten und dir gewünscht hast, dass es mehr kann, dann ist das inzwischen möglich. Du kannst fast jeden Song, den du liebst, in Noten verwandeln, die du wirklich spielen kannst. Und es geht noch einen Schritt weiter: Anything Piano macht aus der Aufnahme eine Piano Roll und keine Noten, hört dann zu, während du den Song auf einem beliebigen Klavier spielst, und sagt dir, welche Töne du getroffen hast.
Häufige Fragen
Gibt es ein Shazam für Noten?
So etwas Ähnliches gibt es, nur funktioniert es anders als Shazam. Shazam erkennt einen Song, indem es einen kurzen akustischen Fingerabdruck mit einer Datenbank abgleicht. So erfährst du Titel und Interpret:in, aber nichts über die Töne. Um an die Noten zu kommen, braucht es etwas anderes und deutlich Schwierigeres, nämlich die Transkription. Dabei hört sich eine Software die Aufnahme an, ermittelt die tatsächlichen Tonhöhen und Rhythmen und schreibt sie als Noten auf. Genau das machen Tools wie Songscription. Du gibst ihnen eine Audiodatei oder einen Link und bekommst Noten, eine Piano Roll und Akkorde, die du lesen und spielen kannst.
Warum ist es schwieriger, dir zu sagen, wie du einen Song spielst, als ihn zu erkennen?
Zum Erkennen reicht es, einen eindeutigen akustischen Fingerabdruck einer bekannten Aufnahme zuzuordnen. Von der Musik selbst muss die Software dafür nichts verstehen. Um dir zu sagen, wie du den Song spielst, muss sie einzelne Töne aus einem Mix herausholen, in dem sich die Instrumente überlagern, die Melodie von den Harmonien trennen und Rhythmus und Tonart bestimmen. Dafür muss sie den Klang wirklich analysieren. Deshalb ist das Ergebnis einer Transkription ein guter Entwurf, den du noch korrigierst, und keine garantiert fehlerfreie Antwort.
Kann eine KI dir die Akkorde und Töne jedes Songs sagen?
Bei den meisten Songs schon. Wie genau das Ergebnis wird, hängt allerdings von der Aufnahme ab. Eine saubere, sparsam instrumentierte Aufnahme lässt sich gut transkribieren. Ein dichter, stark produzierter Mix ist schwieriger, und du wirst mehr korrigieren müssen. Beim ersten Versuch bekommst du realistisch keine fehlerfreien Noten, sondern einen Entwurf der Töne und Akkorde, den du mit der Aufnahme vergleichst und ausbesserst. Wenn du einen Song lernen willst, bringt dich aber schon ein unvollkommener Entwurf, den du langsamer abspielen und nachspielen kannst, ein großes Stück voran.
Geht dir das nächste Mal ein Song nicht aus dem Kopf, kannst du herausfinden, wie du ihn spielst, statt es beim Namen zu belassen.
