AnleitungMusiktranskriptionAndrew Carlins•8 Min. Lesezeit

Wie aus einer gesungenen Melodie Noten werden

Singen kannst du eine Melodie lange, bevor du sie aufschreiben kannst. Mit KI werden aus einer gesungenen oder gesummten Aufnahme lesbare Noten. Das Gesangsmodell erkennt vieles gut, nur Liedtext und Läufe bringen es aus dem Tritt. Mit ein paar Korrekturen räumst du das Ergebnis zu einem Leadsheet auf, das du behalten kannst.

Wie aus einer gesungenen Melodie Noten werden

Teil unseres Ratgebers zum Transkribieren beliebiger Instrumente.

Die meisten Menschen können eine Melodie singen, lange bevor sie sie aufschreiben können. Du wachst mit einer Melodie im Kopf auf, singst sie ins Handy, damit sie nicht verloren geht, und dann liegt sie da als Audiodatei, die du dich nicht so recht zu löschen traust. Wer daraus Noten machen wollte, musste die gesungene Linie früher Ton für Ton am Keyboard heraushören. Heute geht das anders. Eine KI-Transkription kann sich eine Gesangsaufnahme anhören und dir die Melodie in einer Notenzeile ausgeben. Wie gut das klappt, hängt vor allem davon ab, wie du aufnimmst und was du danach noch korrigierst.

Warum eine gesungene Melodie schwieriger ist, als man denkt

Beim Klavier hat es ein Transkriptionsmodell leicht: Eine Taste geht runter, der Ton setzt mit einer eindeutigen Tonhöhe ein und klingt auf vorhersehbare Weise ab. Die Stimme macht fast nichts davon so sauber. Wir rutschen von unten in Töne hinein und gleiten aus ihnen heraus, singen mit Vibrato, das die Tonhöhe absichtlich schwanken lässt, und verteilen mehrere Töne auf eine einzige Silbe, was man Melisma nennt. Dazu unterbrechen Atemzüge und Konsonanten die Linie mit Geräuschen, die überhaupt keine Tonhöhe haben. Das Modell muss entscheiden, wo ein Ton aufhört und der nächste anfängt, und ein ausdrucksvoller Gesang kann dabei wie eine lange, unruhige Linie ohne klare Grenzen wirken statt wie eine ordentliche Reihe von Tönen.

Unmöglich wird die Aufgabe dadurch nicht. Das erklärt nur, warum du eine Gesangstranskription etwas genauer durchsehen solltest als eine Klaviertranskription und wo du dabei hinschauen musst. Je sauberer und bewusster gesungen wird, desto näher ist der erste Entwurf schon dran. Dasselbe Muster, einzelne Linie gegen dichten Satz, zeigt sich bei jedem Instrument. Warum eine einzelne Gesangslinie dabei der einfache Fall ist, erklärt unser Artikel über monophone und polyphone Transkription.

Was das Gesangsmodell gut kann

Die meisten Gesangsideen sind genau dieser einfache Fall: eine Person, eine Linie, keine Harmonien zum Entwirren. Gib dem Modell eine deutlich gesungene Melodie, dann stimmt die Kontur, und die gehaltenen Töne sitzen. Bis ein Kaffee durchgelaufen ist, steht deine Melodie in einer Notenzeile. Wer als Songwriter:in eine Topline festhalten will, im Chor die eigene Stimme ausgeschrieben braucht oder einfach eine Idee als Noten sichern möchte, hat damit schon das meiste in der Hand.

Ehrlich gesagt steht die Stimme bei uns nicht ganz vorne. In Songscription ist Gesang das neueste Modell und noch als experimentell gekennzeichnet, am weitesten entwickelt ist Klavier. Praktisch heißt das: Eine saubere, einfache Gesangslinie wird gut transkribiert, eine schnelle, stark verzierte braucht mehr Nacharbeit. Das gilt für jedes Tool, auch für unseres.

Was du für ein sauberes Ergebnis aufnehmen solltest

Ein paar Entscheidungen bei der Aufnahme bringen mehr als jede spätere Einstellung:

  • Sing jeden Ton als eigenen Ton. Verkneif dir das Rutschen und Anschleifen, solange du die Idee festhältst. Den Ausdruck kannst du später wieder dazunehmen, das Modell muss erst mal klar getrennte Tonhöhen hören.
  • Bleib bei einer neutralen Silbe. Summen oder Singen auf einem offenen Vokal wie „ah“ oder „la“ ergibt eine sauberere Tonhöhe als der komplette Liedtext, weil harte Konsonanten den Ton kurz unterbrechen.
  • Nimm trocken und nah auf. Ein ruhiger Raum mit wenig Hall und ein Mikrofon, das nicht zu weit weg steht, geben dem Modell das klarste Signal.
  • Halt ein gleichmäßiges Tempo. Wenn du mit dem Fuß mittippst oder zu einem leisen Klick singst, kommt der Rhythmus richtig heraus und nicht als Durcheinander seltsamer Notenwerte.
  • Nimm die Stimme allein auf. Steckt der Gesang in einem Playback, klappt es am saubersten mit einer Aufnahme, auf der nur die Stimme zu hören ist.

Von der Aufnahme zum Leadsheet

Der Ablauf selbst ist kurz, und Songscription ist genau dafür gemacht. Es holt eine einzelne Linie aus einer Aufnahme heraus und schreibt sie als Noten auf, die du direkt im Browser bearbeiten kannst. Das Modell dahinter ist auf gesungene und gesummte Aufnahmen ausgelegt, nicht auf Klavier. Lad deine Aufnahme hoch und wähl als Instrument Gesang, damit Songscription weiß, dass es eine Stimme hört. Dann wird die Linie transkribiert, und nach ein, zwei Minuten steht die Melodie in einer Notenzeile vor dir. Liegt unter dem Gesang eine Begleitung, kann die Akkorderkennung Akkordsymbole über der Notenzeile ergänzen. So wird aus der bloßen Melodie ein richtiges Leadsheet, also das Format aus Melodie und Akkorden, mit dem die meisten Sänger:innen und Bands arbeiten.

Ab da kannst du damit machen, was du willst. Transponier die Melodie in eine Tonart, die zur Stimme passt. Um eine knifflige Phrase zu prüfen, machst du die Wiedergabe langsamer, ohne dass sich die Tonhöhe ändert. Wenn alles so aussieht, wie du es haben willst, exportierst du die Noten als PDF für den Notenständer oder als MusicXML, um in MuseScore, Sibelius oder Dorico weiterzuarbeiten. Fängst du mit einer schnellen Handyaufnahme an statt mit einem fertigen Take, zeigt dir unser Ratgeber Sprachmemo in Noten umwandeln, wie du dabei vorgehst.

Die holprigen Stellen korrigieren

Wenn du die typischen Fehler kennst, geht das Durchsehen schnell, weil du gezielt bestimmte Dinge prüfst, statt alles unvorbereitet von vorn bis hinten zu lesen:

  • Anschleifen und Rutschen. Wo du in einen Ton hineingerutscht bist, schreibt das Modell unter Umständen die Tonhöhen dazwischen mit. Fass sie zu dem einen Ton zusammen, den du gemeint hast.
  • Melisma. Bei einem Lauf aus mehreren Tönen auf einer Silbe kann der Rhythmus ungenau herauskommen, weil das Modell die Notenwerte rundet. Hör genau hin und bring die Notenwerte in Ordnung.
  • Falsche Oktave. Die Stimme kann in einer Lage liegen, in der das Modell bei ein, zwei Tönen die falsche Oktave wählt. Solche Töne fallen schnell auf und lassen sich leicht um eine Oktave verschieben.
  • Atemzüge als Pausen. Meistens passt das, aber ab und zu wird aus einem Atemzug eine seltsame Pause, die du aufräumen willst.

Genauso gehen gute Musiker:innen an jede automatische Transkription heran, und unser Artikel Fehler in KI-Transkriptionen korrigieren geht auf die einzelnen Handgriffe genauer ein. Das Tool bringt dich in zwei Minuten vom leeren Blatt zu einem soliden Entwurf. Deine Zeit steckst du dann in musikalische Entscheidungen, statt am Keyboard Töne herauszusuchen.

Häufige Fragen

Kann KI aus einer Gesangsaufnahme Noten machen?

Ja, für die Melodie. Eine KI-Transkription hört sich eine gesungene oder gesummte Linie an und schreibt Tonhöhen und Rhythmus als Noten auf, die du lesen und bearbeiten kannst. Am besten klappt das mit einer einzelnen, deutlich gesungenen Linie, und nach ein, zwei Minuten steht die Melodie in einer Notenzeile vor dir. Das Gesangsmodell ist jünger als das Klaviermodell. Sieh das Ergebnis deshalb als soliden ersten Entwurf, den du noch durchgehst, vor allem dort, wo du in Töne hineinrutschst, zwischen ihnen gleitest oder schnelle Läufe singst.

Ist der Liedtext in der Transkription enthalten?

Nein. Die Transkription erfasst Töne und Rhythmus der Gesangslinie, aber nicht den Text. Wenn der Liedtext unter der Notenzeile stehen soll, fügst du ihn selbst hinzu, entweder im Editor oder nach dem Export in einem Notensatzprogramm. Melodie, Tonart und Rhythmus kommen aus der Aufnahme, der Text nicht.

Wie bekomme ich eine möglichst genaue Gesangstranskription?

Nimm die Stimme allein auf, nah am Mikrofon und in einem Raum mit wenig Hall. Sing jeden Ton für sich, statt zwischen den Tonhöhen zu gleiten. Bei gleichmäßigem Tempo kommt auch der Rhythmus sauber heraus. Steckt die Stimme in einem kompletten Mix, trenn sie vorher heraus. Danach vergleichst du den Entwurf mit der Aufnahme und korrigierst die Stellen, an denen ein Anschleifen oder ein Melisma das Modell durcheinandergebracht hat.

Kann ich die Tonart an meinen Stimmumfang anpassen?

Ja. Sobald die Melodie transkribiert ist, kannst du sie im Editor nach oben oder unten transponieren, bis sie bequem im Tonumfang der singenden Person liegt, und sie dann neu exportieren. Beim Transponieren ändern sich die angezeigten Noten und die Wiedergabe gleichermaßen. Du hörst also genau das, was du liest.

Wenn eine Melodie in deinen Sprachmemos liegt, fang bei Audio zu Noten an und wähl Gesang aus. So hältst du die Melodie aus deinem Kopf als Noten fest. Wenn du lieber die Akkorde aus einem kompletten Song herausholen willst, hilft dir unser Ratgeber Akkorde für jeden Song finden weiter.

Zur Person

Andrew Carlins

Geschrieben von

Andrew Carlins

Mitgründer und CEO von Songscription

Andrew hat Songscription in Stanford zusammen mit ein paar anderen Musiker:innen gegründet. Sie hatten es satt, die Noten zu den Songs, die sie spielen wollten, nirgends zu finden. Er ist mit Klavier und Baritonsaxofon aufgewachsen und stand in Musicals auf der Bühne. Das ist zwar schon Jahre her, aus dem Takt ist er nach eigener Einschätzung aber noch lange nicht. Hier schreibt er darüber, wie ein Song von der Aufnahme aufs Papier kommt.

Mehr über das Team

Hier findest du weitere Artikel zu denselben Themen.